Re Reference AI

モデル

GPT-4V(GPT-4 Vision)とは

GPT-4 Vision / GPT-4 with Vision

GPT-4に画像入力・理解機能を追加した、OpenAIのマルチモーダルモデルバリアント

マルチモーダル画像認識

概要

GPT-4Vは、OpenAIのGPT-4にVision(画像理解)機能を追加したモデルバリアントで、テキストに加えて画像を入力として受け取り、画像の内容説明・画像に関する質問応答・画像内のテキスト読み取りなどができるようにしたモデル。 それまでテキスト専用だったGPT-4を、画像とテキストを組み合わせて理解できるマルチモーダルモデルへ拡張したもので、以降のGPT-4o等、テキストと画像(さらに音声)を統合的に扱う後継モデルの足がかりとなった。

歴史

2023年9月、OpenAIがGPT-4に画像入力機能を追加したGPT-4Vを一般提供開始。 2023年3月のGPT-4発表時点でVision機能はテクニカルレポートで予告されていたが、実際の一般提供は同年9月まで持ち越された。

比較

  • GPTGPTはOpenAIのモデルファミリー全体を指し、GPT-4Vはその中で画像入力へ対応を広げた具体的なバリアント
  • マルチモーダルLLMGPT-4Vは、テキストと画像を扱うマルチモーダルLLMの代表的な初期の実例
  • VLMGPT-4Vは、画像と言語を同時に理解するVision-Language Modelの一種

関連用語

GPTマルチモーダルLLMVLMCLIP