マルチモーダル
マルチモーダルに関連する用語(15件)
マルチモーダルは、テキスト・画像・音声・動画など複数の種類のデータを統合的に処理するAI技術です。画像を理解して文章で答えるなど、モダリティをまたいだ理解・生成を実現します。
用語一覧
Gemini
Google Gemini / Bard
Googleが開発する、テキスト・画像・音声等を統合的に扱うマルチモーダル大規模言語モデルファミリー
マルチモーダル
Multimodal
テキスト・画像・音声・動画等、複数の種類(モダリティ)のデータを組み合わせて扱うAIの性質・手法
Grok
イーロン・マスク率いるxAIが開発する、X(旧Twitter)との統合を特徴とする大規模言語モデルファミリー
Whisper
OpenAIが公開した、多言語対応のオープンソース音声認識(ASR)モデル
CLIP
Contrastive Language-Image Pre-training
画像とテキストを同じ埋め込み空間へ対応づけ、両者の意味的な近さを比較できるようにするOpenAIのマルチモーダルモデル
VLM
Vision-Language Model / 視覚言語モデル / VLM(Vision Language Model)
画像と言語を同時に理解し、画像に関する質問応答や説明生成ができるマルチモーダルモデル
世界モデル
World Model / World Models
環境のダイナミクスを学習し、行動の結果を内部でシミュレートできるようにするモデル
VLA
Vision-Language-Action / VLAモデル
視覚と言語の理解に行動の生成を統合し、カメラ映像と自然言語の指示からロボットの動作を出力する基盤モデル
動画理解
Video Understanding / 映像理解
動画中の物体・行動・場面展開などを認識し、内容を意味的に理解するタスク
マルチモーダル対話
Multimodal Dialogue
テキストに加えて画像・音声・動画など複数のモダリティを入出力に扱う対話
視覚対話
Visual Dialog / VisDial
画像を提示しながら複数ターンにわたり質問応答を行う対話タスク
マルチモーダル融合
Multimodal Fusion
複数モダリティの特徴表現を組み合わせ、単一の統合表現として扱う技術
マルチモーダルLLM
Multimodal LLM / MLLM
テキストに加え画像・音声・動画など複数モダリティの入出力を単一モデルで扱える大規模言語モデル
GPT-4V
GPT-4 Vision / GPT-4 with Vision
GPT-4に画像入力・理解機能を追加した、OpenAIのマルチモーダルモデルバリアント
バーチャル試着
Virtual Try-on / VTO
AIが衣服やアクセサリーを利用者の画像・映像上に合成し試着体験を提供する技術