Re Reference AI

アーキテクチャ

ViTとは

Vision Transformer / ビジョントランスフォーマー

画像をパッチの系列に分割してTransformerで処理する画像認識アーキテクチャ

画像認識Transformer

ひとことで言うと

画像を小さなタイルに切り分けて「単語の列」のように扱い、文章用のTransformerで画像を認識する仕組み。

概要

ViT(Vision Transformer)とは、画像を小さなパッチの系列に分割し、Transformerで処理する画像認識アーキテクチャを指す。 画像を16×16ピクセル程度のパッチへ切り分けて各パッチをトークンとして扱い、言語向けに設計されたTransformerをほぼそのまま画像へ適用した。 大規模データでの事前学習を前提とすればCNNを上回る精度を達成できると示し、画像認識の主流アーキテクチャをCNNからTransformerへ転換させる契機になった。 CLIPの画像エンコーダやVLMの視覚部分など、マルチモーダルモデルの構成要素としても広く使われている。

歴史

2020年10月にGoogleの研究者ら(Dosovitskiyら)が論文「An Image is Worth 16x16 Words」で発表した。

比較

  • CNNCNNが畳み込みによる局所的な特徴抽出を積み重ねるのに対し、ViTは自己注意で画像全体のパッチ間の関係を直接捉える

関連用語

TransformerCNNCLIPSelf-Attention

参考文献

関連Zenn記事