GPT-4V(GPT-4 Vision)とは
GPT-4 Vision / GPT-4 with Vision
GPT-4に画像入力・理解機能を追加した、OpenAIのマルチモーダルモデルバリアント
概要
GPT-4Vは、OpenAIのGPT-4にVision(画像理解)機能を追加したモデルバリアントで、テキストに加えて画像を入力として受け取り、画像の内容説明・画像に関する質問応答・画像内のテキスト読み取りなどができるようにしたモデル。 それまでテキスト専用だったGPT-4を、画像とテキストを組み合わせて理解できるマルチモーダルモデルへ拡張したもので、以降のGPT-4o等、テキストと画像(さらに音声)を統合的に扱う後継モデルの足がかりとなった。
歴史
2023年9月、OpenAIがGPT-4に画像入力機能を追加したGPT-4Vを一般提供開始。 2023年3月のGPT-4発表時点でVision機能はテクニカルレポートで予告されていたが、実際の一般提供は同年9月まで持ち越された。
比較
- GPT — GPTはOpenAIのモデルファミリー全体を指し、GPT-4Vはその中で画像入力へ対応を広げた具体的なバリアント
- マルチモーダルLLM — GPT-4Vは、テキストと画像を扱うマルチモーダルLLMの代表的な初期の実例
- VLM — GPT-4Vは、画像と言語を同時に理解するVision-Language Modelの一種