Re Reference AI

技術

トークン消費最適化とは

Token Optimization

LLM利用時のAPIコストや応答レイテンシを抑えるため、消費トークン量を減らす実践全般を指す総称

推論最適化コスト削減

ひとことで言うと

AIを使うときにかかるトークン量(≒料金や待ち時間)を減らすための工夫をまとめた呼び方。

概要

トークン消費最適化とは、LLMを利用する際のAPIコストや応答レイテンシを抑えるために、入出力で消費するトークン量を減らす実践全般を指す総称。 プロンプトの共通部分をキャッシュして再送信のコストを省くプロンプトキャッシュコンテキストウィンドウに渡す情報を絞り込み整理するコンテキストエンジニアリング、ドキュメントを検索に適したサイズへ分割するチャンキングなど、入力設計に関わる手法が含まれる。 推論基盤側でも、KVキャッシュ量子化によって計算・メモリ効率を高める手法があり、入力設計から推論基盤まで複数の技術領域にまたがる。 単一の技術ではなく、これらの手法群を目的別に組み合わせて運用する際の総称として使われる。

利点

  • APIコストや応答レイテンシを削減し、同じタスクをより低コスト・高速にこなせる
  • 限られたコンテキストウィンドウを有効活用でき、より多くの実質的な情報をやり取りに使える

欠点

  • 過度な圧縮や省略で、モデルへ渡す情報が乏しくなり出力品質を落としかねない
  • キャッシュや分割の仕組みを導入する分、システムの実装・運用が複雑になる

関連用語

プロンプトキャッシュコンテキストエンジニアリングチャンキングKVキャッシュ量子化トークンマキシング

よくある質問

トークンマキシングとの違いは?

トークンマキシングが出力品質を高めるためにあえてトークンを多く使おうとする姿勢を指すのに対し、トークン消費最適化はコストやレイテンシを抑えるためにトークンを減らそうとする、方向性が逆の実践を指す。