Re Reference AI

推論最適化

推論最適化に関連する用語(17件)

推論最適化は、モデルの推論速度・メモリ効率・コストを改善する技術です。量子化、KVキャッシュ、投機的デコーディングなど、多様な手法でサービス運用の効率を高めます。

用語一覧

KVキャッシュ

KV Cache / Key-Value Cache

自己回帰生成において、過去のKey・ValueベクトルをGPUメモリに保持し再利用する推論最適化の仕組み

技術推論最適化Attention

投機的デコーディング

Speculative Decoding

小規模な下書きモデルに複数トークンを先に生成させ、本体モデルで一括検証し生成を高速化する手法

技術推論最適化デコーディング

バッチ推論

Batch Inference

複数の推論リクエストをまとめて処理し、GPUの利用効率とスループットを高める手法

技術推論最適化スループット

vLLM

PagedAttentionによりGPUメモリを効率利用する、高スループットなオープンソースLLM推論・サービングエンジン

インフラ推論最適化サービング

TensorRT

NVIDIA GPU上での推論を高速化する、NVIDIA製の推論最適化SDK

インフラNVIDIA推論最適化

エッジAI

Edge AI

クラウド上のサーバーではなく、スマートフォンやIoT機器等の端末上でAIモデルを推論する仕組み

インフラエッジAI推論最適化

プロンプトキャッシュ

Prompt Caching / Context Caching

プロンプトの共通部分をサーバー側でキャッシュし、繰り返し送信時のレイテンシとコストを削減する仕組み

技術推論最適化コスト削減

FlashAttention

GPUのメモリ階層を意識した計算順序により、通常のAttentionと同じ結果を高速かつ省メモリに計算するアルゴリズム

アーキテクチャTransformer推論最適化

GQA

Grouped-Query Attention

複数のクエリヘッドをいくつかのグループに分け、グループ内でキー・バリューヘッドを共有するAttentionの構造

アーキテクチャTransformer推論最適化

MQA

Multi-Query Attention

全てのクエリヘッドが単一のキー・バリューヘッドを共有し、KVキャッシュを最小限に抑えるAttentionの構造

アーキテクチャTransformer推論最適化

Sliding Window Attention

スライディングウィンドウAttention

各トークンが固定サイズの近傍ウィンドウ内のみを参照することで、計算量を系列長に対して線形に抑えるAttentionの手法

アーキテクチャTransformer推論最適化

Mixture-of-Depths

MoD

各トークンごとに処理へ使う層の数を動的に決め、計算量を必要最小限に絞るTransformerの設計

アーキテクチャTransformer推論最適化

Model Router

モデルルーター / LLMルーター

リクエストの内容や要求される品質・コストに応じて、複数のLLMから最適なモデルを自動的に選択して振り分ける仕組み

インフラAPI推論最適化

MLA

Multi-head Latent Attention / マルチヘッド潜在注意

キーとバリューを低ランクの潜在ベクトルへ圧縮して保持し、KVキャッシュを削減する注意機構

アーキテクチャAttention推論最適化

SGLang

sgl-project

RadixAttentionによる接頭辞キャッシュの再利用を特徴とする、オープンソースのLLM推論サービング基盤

インフラサービング推論最適化

Groq

LPU / GroqCloud

LLM推論に特化した独自チップLPUを開発する半導体企業と、その高速推論クラウドサービス

インフラハードウェア推論最適化

連続バッチ処理

Continuous Batching

生成完了したリクエストの枠へ新規リクエストを即座に詰め替え、LLM推論サーバーのスループットを高めるバッチ処理方式

技術推論最適化スループット