トークン消費最適化とは
Token Optimization
LLM利用時のAPIコストや応答レイテンシを抑えるため、消費トークン量を減らす実践全般を指す総称
ひとことで言うと
AIを使うときにかかるトークン量(≒料金や待ち時間)を減らすための工夫をまとめた呼び方。
概要
トークン消費最適化とは、LLMを利用する際のAPIコストや応答レイテンシを抑えるために、入出力で消費するトークン量を減らす実践全般を指す総称。 プロンプトの共通部分をキャッシュして再送信のコストを省くプロンプトキャッシュ、コンテキストウィンドウに渡す情報を絞り込み整理するコンテキストエンジニアリング、ドキュメントを検索に適したサイズへ分割するチャンキングなど、入力設計に関わる手法が含まれる。 推論基盤側でも、KVキャッシュや量子化によって計算・メモリ効率を高める手法があり、入力設計から推論基盤まで複数の技術領域にまたがる。 単一の技術ではなく、これらの手法群を目的別に組み合わせて運用する際の総称として使われる。
利点
- APIコストや応答レイテンシを削減し、同じタスクをより低コスト・高速にこなせる
- 限られたコンテキストウィンドウを有効活用でき、より多くの実質的な情報をやり取りに使える
欠点
- 過度な圧縮や省略で、モデルへ渡す情報が乏しくなり出力品質を落としかねない
- キャッシュや分割の仕組みを導入する分、システムの実装・運用が複雑になる