Re Reference AI

技術

PTQとは

Post-Training Quantization / 学習後量子化

学習済みモデルの重みを、追加学習なしに事後的に低ビット精度へ変換する量子化手法

モデル圧縮軽量化

ひとことで言うと

学習が終わったモデルに、後から手軽に量子化をかける手法。

概要

PTQ(Post-Training Quantization、学習後量子化)とは、既に学習が完了したモデルに対し、再学習せずに重みや活性化値を低ビット精度の数値表現へ変換する量子化手法。 量子化後のモデル性能を保つため、変換前に少量のキャリブレーションデータを用いて数値の分布(スケール・ゼロ点等)を調整する場合が多いが、QATのようにモデル全体を再学習する必要はなく、比較的少ない計算コスト・短時間で適用できる点が特徴。 GPTQAWQ等、LLM向けに開発された量子化手法の多くもPTQに分類される。

背景

学習済みの大規模モデルを量子化する際、QATのように学習全体をやり直すアプローチは計算コスト・時間の面で負担が大きい。PTQは、既存の学習済みモデルへ事後的に変換を適用するだけで量子化を完了できる、より手軽な手法として発展した。

歴史

2018年: GoogleのJacobらが論文「Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference」を発表し、整数演算のみで推論する量子化手法とその学習方法を示した。同論文はQATとあわせて、学習済みモデルを整数量子化する手法の基礎ともなっている。 以降、LLMを対象としたGPTQAWQ等、PTQに分類される量子化手法が多数提案されている。

利点

  • 再学習が不要なため、量子化を短時間・低コストで適用できる
  • 学習用のデータセットや計算資源を用意できない場合でも、学習済みモデルへ適用しやすい

欠点

  • QATと比べ、低ビット化に伴う性能低下(精度劣化)が大きくなりやすい
  • キャリブレーションデータの質や量子化のビット数によっては、想定より精度が低下しやすい

比較

  • QATQATが学習段階から量子化を考慮するのに対し、PTQは学習済みモデルへ事後的に量子化を適用する
  • 量子化PTQは、量子化の中でも学習済みモデルへ事後的に適用する代表的な手法の1つ
  • GPTQGPTQは、LLM向けに開発された代表的なPTQ手法の1つ
  • AWQAWQは、LLM向けに開発された代表的なPTQ手法の1つ

関連用語

QAT量子化INT8INT4GPTQAWQ

よくある質問

PTQはどの程度の精度低下を見込むべき?

モデルやタスク、量子化するビット数によって精度低下の程度は大きく異なる。目安として、int8程度までは精度低下が小さく収まりやすい。4bit以下等、より低ビットになるほど精度低下は目立ちやすくなり、QATとの比較検討が必要になる。

参考文献