サービング
サービングに関連する用語(4件)
サービングは、学習済みモデルを本番環境で推論リクエストに応答できる状態で提供することです。スループット・レイテンシ・コストの最適化が課題で、vLLMなどの専用ソフトウェアが使われます。
用語一覧
vLLM
PagedAttentionによりGPUメモリを効率利用する、高スループットなオープンソースLLM推論・サービングエンジン
インフラ推論最適化サービング
SGLang
sgl-project
RadixAttentionによる接頭辞キャッシュの再利用を特徴とする、オープンソースのLLM推論サービング基盤
インフラサービング推論最適化
llm-d
Kubernetes上でLLM推論を分散オーケストレーションする、vLLMをベースにしたオープンソースの推論サービングフレームワーク
インフラサービング推論最適化
推論最適化
Inference Optimization
学習済みモデルの推論時のレイテンシ・スループット・メモリ使用量を改善するための技術群の総称
技術推論最適化サービング