Re Reference AI

技術

推論最適化とは

Inference Optimization

学習済みモデルの推論時のレイテンシ・スループット・メモリ使用量を改善するための技術群の総称

推論最適化サービング

概要

推論最適化は、学習済みモデルを実際に稼働させる際の応答速度(レイテンシ)・単位時間あたりの処理量(スループット)・使用メモリ量を改善するための技術の総称。 代表的な手法として、計算済みのKey/Valueを再利用して再計算を省くKVキャッシュ、次トークンを軽量モデルによって先読みし本体モデルで検証する投機的デコーディング、複数リクエストのバッチを動的に組み替えて処理する継続的バッチ処理(Continuous Batching)がある。 他にも、パラメータを低ビット幅で表現する量子化や、Attention計算のメモリアクセスを最適化するFlashAttentionなどが使われる。これらはvLLMTensorRT-LLM、SGLangといった推論エンジンに組み込まれる形で提供されることが多い。

利点

  • 同じハードウェアでより多くのリクエストを処理でき、サービング効率が向上する
  • レイテンシを下げることでユーザー体験が改善する

欠点

  • 量子化など一部の手法は出力精度とのトレードオフを伴う
  • 手法ごとに得意なワークロードが異なり、用途に応じた選定・チューニングが必要

関連用語

KVキャッシュ投機的デコーディング量子化連続バッチ処理FlashAttention