Transformer
Transformerに関連する用語(14件)
Transformerは、Attention機構を中核とするニューラルネットワークアーキテクチャです。2017年の登場以降、GPTやBERTをはじめ現代のほぼすべてのLLMの基盤となっています。
用語一覧
LLM
大規模言語モデル / Large Language Model
大量のテキストコーパスで学習し、言語を予測・生成するニューラルネットワーク
Attention
注意機構 / Attention Mechanism
入力系列の各要素に動的な重みを割り当て、関連度の高い部分に着目して処理するニューラルネットワークの機構
BERT
Bidirectional Encoder Representations from Transformers
文中の前後の文脈を双方向に参照して単語表現を学習する、Transformerエンコーダベースの事前学習済み言語モデル
Encoder
エンコーダ
入力系列を、意味を圧縮した内部表現(コンテキストベクトル)へ変換するニューラルネットワークの構成要素
Self-Attention
自己注意機構
同一の入力系列内で各要素同士の関連度を計算し、系列全体の文脈を考慮した表現を得るAttentionの一形態
RoPE
Rotary Position Embedding / 回転位置埋め込み
クエリ・キーベクトルを位置に応じて回転させることで、Transformerに相対的な位置情報を組み込む位置エンコーディング手法
FlashAttention
GPUのメモリ階層を意識した計算順序により、通常のAttentionと同じ結果を高速かつ省メモリに計算するアルゴリズム
GQA
Grouped-Query Attention
複数のクエリヘッドをいくつかのグループに分け、グループ内でキー・バリューヘッドを共有するAttentionの構造
MQA
Multi-Query Attention
全てのクエリヘッドが単一のキー・バリューヘッドを共有し、KVキャッシュを最小限に抑えるAttentionの構造
Sliding Window Attention
スライディングウィンドウAttention
各トークンが固定サイズの近傍ウィンドウ内のみを参照することで、計算量を系列長に対して線形に抑えるAttentionの手法
Mixture-of-Depths
MoD
各トークンごとに処理へ使う層の数を動的に決め、計算量を必要最小限に絞るTransformerの設計
ViT
Vision Transformer / ビジョントランスフォーマー
画像をパッチの系列に分割してTransformerで処理する画像認識アーキテクチャ
Decoder
デコーダ / デコーダオンリー
内部表現から出力系列を生成する側のネットワーク。デコーダのみを積んだ構成が現在のLLMの主流
位置エンコーディング
Positional Encoding / 位置埋め込み
語順を区別できない自己注意機構へ、トークンの位置情報を与える仕組み