Re Reference AI

技術

動画理解(映像理解)とは

Video Understanding / 映像理解

動画中の物体・行動・場面展開などを認識し、内容を意味的に理解するタスク

マルチモーダル画像認識

概要

動画理解とは、動画に含まれる物体やその動き、人物の行動、場面の展開といった情報を認識し、動画の内容を意味的に理解するタスクを指す。 静止画を対象にする画像認識と異なり、フレーム間の時間的な変化や前後関係を捉える必要があり、行動認識や動画キャプション生成、動画に関する質問応答などのサブタスクに広がる。 近年は、視覚と言語を統合的に扱うマルチモーダルモデルが動画のフレーム系列を入力として扱えるように拡張され、動画内容についての自然言語での説明や質問応答を行えるようになっている。

比較

  • VLMVLMは画像に加えて動画のフレーム系列を入力として扱えるよう拡張され、動画理解の基盤モデルとしても使われる

関連用語

マルチモーダルVLMViTアクション認識時空間特徴