Re Reference AI

Transformer

Transformerに関連する用語(14件)

Transformerは、Attention機構を中核とするニューラルネットワークアーキテクチャです。2017年の登場以降、GPTやBERTをはじめ現代のほぼすべてのLLMの基盤となっています。

用語一覧

LLM

大規模言語モデル / Large Language Model

大量のテキストコーパスで学習し、言語を予測・生成するニューラルネットワーク

モデルNLPTransformer深層学習

Attention

注意機構 / Attention Mechanism

入力系列の各要素に動的な重みを割り当て、関連度の高い部分に着目して処理するニューラルネットワークの機構

アーキテクチャ深層学習Transformer

BERT

Bidirectional Encoder Representations from Transformers

文中の前後の文脈を双方向に参照して単語表現を学習する、Transformerエンコーダベースの事前学習済み言語モデル

モデルNLPTransformer事前学習

Encoder

エンコーダ

入力系列を、意味を圧縮した内部表現(コンテキストベクトル)へ変換するニューラルネットワークの構成要素

アーキテクチャ系列モデリングTransformer

Self-Attention

自己注意機構

同一の入力系列内で各要素同士の関連度を計算し、系列全体の文脈を考慮した表現を得るAttentionの一形態

アーキテクチャTransformer深層学習

RoPE

Rotary Position Embedding / 回転位置埋め込み

クエリ・キーベクトルを位置に応じて回転させることで、Transformerに相対的な位置情報を組み込む位置エンコーディング手法

アーキテクチャTransformer位置エンコーディング

FlashAttention

GPUのメモリ階層を意識した計算順序により、通常のAttentionと同じ結果を高速かつ省メモリに計算するアルゴリズム

アーキテクチャTransformer推論最適化

GQA

Grouped-Query Attention

複数のクエリヘッドをいくつかのグループに分け、グループ内でキー・バリューヘッドを共有するAttentionの構造

アーキテクチャTransformer推論最適化

MQA

Multi-Query Attention

全てのクエリヘッドが単一のキー・バリューヘッドを共有し、KVキャッシュを最小限に抑えるAttentionの構造

アーキテクチャTransformer推論最適化

Sliding Window Attention

スライディングウィンドウAttention

各トークンが固定サイズの近傍ウィンドウ内のみを参照することで、計算量を系列長に対して線形に抑えるAttentionの手法

アーキテクチャTransformer推論最適化

Mixture-of-Depths

MoD

各トークンごとに処理へ使う層の数を動的に決め、計算量を必要最小限に絞るTransformerの設計

アーキテクチャTransformer推論最適化

ViT

Vision Transformer / ビジョントランスフォーマー

画像をパッチの系列に分割してTransformerで処理する画像認識アーキテクチャ

アーキテクチャ画像認識Transformer

Decoder

デコーダ / デコーダオンリー

内部表現から出力系列を生成する側のネットワーク。デコーダのみを積んだ構成が現在のLLMの主流

アーキテクチャTransformer系列モデリング

位置エンコーディング

Positional Encoding / 位置埋め込み

語順を区別できない自己注意機構へ、トークンの位置情報を与える仕組み

アーキテクチャTransformer位置エンコーディング