マルチモーダル対話とは
Multimodal Dialogue
テキストに加えて画像・音声・動画など複数のモダリティを入出力に扱う対話
概要
マルチモーダル対話とは、テキストだけでなく画像・音声・動画といった複数のモダリティを入力または出力に用いて行う対話を指す。 ユーザーが画像を提示しながら質問したり、音声で話しかけたりといった、テキスト単独の対話では扱えない情報を含むやり取りに対応できる点が特徴。 マルチモーダルモデルの発展により、画像の内容について説明を求めたり、音声で受け答えしたりするチャットボットが実用化されている。
比較
- チャットボット — チャットボットが主にテキストによる対話を扱うのに対し、マルチモーダル対話は画像・音声・動画など複数のモダリティを入出力に扱う