Re Reference AI

マルチモーダル

マルチモーダルに関連する用語(15件)

マルチモーダルは、テキスト・画像・音声・動画など複数の種類のデータを統合的に処理するAI技術です。画像を理解して文章で答えるなど、モダリティをまたいだ理解・生成を実現します。

用語一覧

Gemini

Google Gemini / Bard

Googleが開発する、テキスト・画像・音声等を統合的に扱うマルチモーダル大規模言語モデルファミリー

モデルLLMGoogleマルチモーダル

マルチモーダル

Multimodal

テキスト・画像・音声・動画等、複数の種類(モダリティ)のデータを組み合わせて扱うAIの性質・手法

技術マルチモーダル

Grok

イーロン・マスク率いるxAIが開発する、X(旧Twitter)との統合を特徴とする大規模言語モデルファミリー

モデルLLMマルチモーダル

Whisper

OpenAIが公開した、多言語対応のオープンソース音声認識(ASR)モデル

モデル音声認識マルチモーダル

CLIP

Contrastive Language-Image Pre-training

画像とテキストを同じ埋め込み空間へ対応づけ、両者の意味的な近さを比較できるようにするOpenAIのマルチモーダルモデル

モデルマルチモーダル埋め込み

VLM

Vision-Language Model / 視覚言語モデル / VLM(Vision Language Model)

画像と言語を同時に理解し、画像に関する質問応答や説明生成ができるマルチモーダルモデル

モデルマルチモーダルLLM画像認識

世界モデル

World Model / World Models

環境のダイナミクスを学習し、行動の結果を内部でシミュレートできるようにするモデル

技術深層学習強化学習マルチモーダル

VLA

Vision-Language-Action / VLAモデル

視覚と言語の理解に行動の生成を統合し、カメラ映像と自然言語の指示からロボットの動作を出力する基盤モデル

モデルロボティクスマルチモーダル

動画理解

Video Understanding / 映像理解

動画中の物体・行動・場面展開などを認識し、内容を意味的に理解するタスク

技術マルチモーダル画像認識

マルチモーダル対話

Multimodal Dialogue

テキストに加えて画像・音声・動画など複数のモダリティを入出力に扱う対話

技術マルチモーダル対話AI

視覚対話

Visual Dialog / VisDial

画像を提示しながら複数ターンにわたり質問応答を行う対話タスク

技術マルチモーダル対話AI

マルチモーダル融合

Multimodal Fusion

複数モダリティの特徴表現を組み合わせ、単一の統合表現として扱う技術

技術マルチモーダル

マルチモーダルLLM

Multimodal LLM / MLLM

テキストに加え画像・音声・動画など複数モダリティの入出力を単一モデルで扱える大規模言語モデル

モデルマルチモーダルLLM

GPT-4V

GPT-4 Vision / GPT-4 with Vision

GPT-4に画像入力・理解機能を追加した、OpenAIのマルチモーダルモデルバリアント

モデルマルチモーダル画像認識

バーチャル試着

Virtual Try-on / VTO

AIが衣服やアクセサリーを利用者の画像・映像上に合成し試着体験を提供する技術

技術画像認識マルチモーダル