モデル圧縮
モデル圧縮に関連する用語(6件)
モデル圧縮は、モデルのサイズや計算量を削減しつつ性能を維持する技術です。量子化・蒸留・プルーニングなどの手法があり、エッジデバイスでの実行や推論コスト削減に不可欠です。
用語一覧
知識蒸留
Knowledge Distillation / 蒸留
大規模な教師モデルの出力を模倣させることで、小規模な生徒モデルへ知識を移す学習手法
技術モデル圧縮軽量化
量子化
Quantization
モデルの重みや計算を低ビット精度の数値表現に変換し、モデルサイズと推論コストを削減する手法
技術モデル圧縮軽量化
PTQ
Post-Training Quantization / 学習後量子化
学習済みモデルの重みを、追加学習なしに事後的に低ビット精度へ変換する量子化手法
技術モデル圧縮軽量化
QAT
Quantization-Aware Training / 量子化を考慮した学習
学習段階から量子化による誤差を考慮に入れることで、低ビット化後も精度低下を抑える量子化手法
技術モデル圧縮軽量化
GPTQ
少量のキャリブレーションデータのみで、LLMの重みを4bit程度まで高速かつ高精度に量子化するPTQ手法
技術モデル圧縮軽量化
AWQ
Activation-aware Weight Quantization
活性化値の分布をもとに重要な重みを特定し、その精度を保護しながら量子化するLLM向けの重み量子化手法
技術モデル圧縮軽量化