マルチモーダル
マルチモーダルに関連する用語(8件)
マルチモーダルは、テキスト・画像・音声・動画など複数の種類のデータを統合的に処理するAI技術です。画像を理解して文章で答えるなど、モダリティをまたいだ理解・生成を実現します。
用語一覧
Gemini
Googleが開発する、テキスト・画像・音声等を統合的に扱うマルチモーダル大規模言語モデルファミリー
モデルLLMGoogleマルチモーダル
マルチモーダル
Multimodal
テキスト・画像・音声・動画等、複数の種類(モダリティ)のデータを組み合わせて扱うAIの性質・手法
技術マルチモーダル
Grok
イーロン・マスク率いるxAIが開発する、X(旧Twitter)との統合を特徴とする大規模言語モデルファミリー
モデルLLMマルチモーダル
Whisper
OpenAIが公開した、多言語対応のオープンソース音声認識(ASR)モデル
モデル音声認識マルチモーダル
CLIP
Contrastive Language-Image Pre-training
画像とテキストを同じ埋め込み空間へ対応づけ、両者の意味的な近さを比較できるようにするOpenAIのマルチモーダルモデル
モデルマルチモーダル埋め込み
VLM
Vision-Language Model / 視覚言語モデル / VLM(Vision Language Model)
画像と言語を同時に理解し、画像に関する質問応答や説明生成ができるマルチモーダルモデル
モデルマルチモーダルLLM画像認識
世界モデル
World Model / World Models
環境のダイナミクスを学習し、行動の結果を内部でシミュレートできるようにするモデル
技術深層学習強化学習マルチモーダル
VLA
Vision-Language-Action / VLAモデル
視覚と言語の理解に行動の生成を統合し、カメラ映像と自然言語の指示からロボットの動作を出力する基盤モデル
モデルロボティクスマルチモーダル