Re Reference AI

量子化

量子化に関連する用語(5件)

量子化は、モデルの重みを低ビットの数値表現に変換してサイズと計算量を削減する技術です。INT8やINT4などへの変換により、性能低下を抑えつつメモリ使用量を大幅に削減できます。

用語一覧

GGUF

GPT-Generated Unified Format

量子化されたモデルの重みとメタデータを1ファイルにまとめた、llama.cpp発のモデル配布フォーマット

技術量子化ファイル形式

FP16

半精度浮動小数点 / half precision

16ビットで数値を表現する浮動小数点フォーマット。学習・推論の高速化とメモリ削減に使われる

技術数値精度量子化

INT8

数値を8ビットの整数で表現する、量子化でよく用いられる数値形式

技術数値精度量子化

INT4

数値を4ビットの整数で表現する、LLMの大幅な軽量化に用いられる量子化精度

技術数値精度量子化

QLoRA

Quantized LoRA

ベースモデルを4bitに量子化して凍結し、その上にLoRAを載せて学習するメモリ効率の高いファインチューニング手法

技術ファインチューニング量子化