推論最適化とは
Inference Optimization
学習済みモデルの推論時のレイテンシ・スループット・メモリ使用量を改善するための技術群の総称
概要
推論最適化は、学習済みモデルを実際に稼働させる際の応答速度(レイテンシ)・単位時間あたりの処理量(スループット)・使用メモリ量を改善するための技術の総称。 代表的な手法として、計算済みのKey/Valueを再利用して再計算を省くKVキャッシュ、次トークンを軽量モデルによって先読みし本体モデルで検証する投機的デコーディング、複数リクエストのバッチを動的に組み替えて処理する継続的バッチ処理(Continuous Batching)がある。 他にも、パラメータを低ビット幅で表現する量子化や、Attention計算のメモリアクセスを最適化するFlashAttentionなどが使われる。これらはvLLMやTensorRT-LLM、SGLangといった推論エンジンに組み込まれる形で提供されることが多い。
利点
- 同じハードウェアでより多くのリクエストを処理でき、サービング効率が向上する
- レイテンシを下げることでユーザー体験が改善する
欠点
- 量子化など一部の手法は出力精度とのトレードオフを伴う
- 手法ごとに得意なワークロードが異なり、用途に応じた選定・チューニングが必要