量子化
量子化に関連する用語(5件)
量子化は、モデルの重みを低ビットの数値表現に変換してサイズと計算量を削減する技術です。INT8やINT4などへの変換により、性能低下を抑えつつメモリ使用量を大幅に削減できます。
用語一覧
GGUF
GPT-Generated Unified Format
量子化されたモデルの重みとメタデータを1ファイルにまとめた、llama.cpp発のモデル配布フォーマット
技術量子化ファイル形式
FP16
半精度浮動小数点 / half precision
16ビットで数値を表現する浮動小数点フォーマット。学習・推論の高速化とメモリ削減に使われる
技術数値精度量子化
INT8
数値を8ビットの整数で表現する、量子化でよく用いられる数値形式
技術数値精度量子化
INT4
数値を4ビットの整数で表現する、LLMの大幅な軽量化に用いられる量子化精度
技術数値精度量子化
QLoRA
Quantized LoRA
ベースモデルを4bitに量子化して凍結し、その上にLoRAを載せて学習するメモリ効率の高いファインチューニング手法
技術ファインチューニング量子化