Re Reference AI

技術

歪み最小化とは

Distortion Minimization

量子化などによって生じる出力の誤差(歪み)を最小化するよう、パラメータや量子化パラメータを最適化する手法

量子化モデル圧縮

概要

歪み最小化は、モデル圧縮量子化の文脈で、重みや活性化を低ビット表現へ変換した際に生じる出力の誤差(歪み)ができるだけ小さくなるよう、量子化のスケールやゼロ点、あるいは重み自体を最適化するアプローチ。単純に値を丸めるだけの量子化に比べ、層ごとの出力誤差を小さくするよう明示的に最適化することで、精度低下を抑えつつビット幅を下げられる。 代表例として、GPTQは層ごとの重みを2次近似(Hessian)に基づいて逐次的に量子化し、量子化誤差を後続の未量子化重みに配分することで全体の歪みを最小化する。AWQは活性化の分布を考慮して重要な重みチャネルを保護することで歪みを抑える。

利点

  • 単純な丸め込みによる量子化より低いビット幅でも精度低下を抑えやすい
  • 追加の学習(再学習)なしで適用できる手法が多い

欠点

  • 誤差の最適化計算にキャリブレーションデータや追加の計算コストが必要になる
  • モデルやタスクによって最適な最適化対象・手法が異なる

関連用語

量子化GPTQAWQPTQQAT

参考文献