WOS に払うのは $2。LLM 側でその何倍も節約。
WOS がクエリごとに LLM へ渡すのは約 1,000 トークン - 上限があり関連性の高いスライスです。全履歴を毎回プロンプトに詰め込む場合との差は非常に大きく、履歴が増えるほど広がります。
クエリ 1,000 件あたりの LLM コスト Tablet 1 基準
ユーザー履歴100K
クエリ数 / 月1,000
使用する LLM
45× 低コスト - 月 $244 の節約
WOS に使う $1 ごとに、LLM 側で ~$98 を節約できます。履歴が大きいほど、モデルが高価なほど、ROI は大きくなります。
節約が生まれる仕組み
- WOS なしでは、毎回のプロンプトに全履歴を詰め込みます -
100K tokens × $2.50/1M = $0.25がクエリ 1 件ごとに(GPT-4o の入力単価基準。Opus 級モデルでは約 2 倍)。 - WOS ありでは、取り込みは一度だけ(
$2/1M)。以降の各クエリは小さな取得($3/1M × 1,000)と、約 1,000 トークンだけを読む LLM のコストで済みます。 - LLM が読むトークンが少ないほど、支払いは減ります。そして WOS は、記憶が増えてもその数を一定に保ちます。
コンテキスト圧縮率 = 履歴 ÷ 投入トークンであり、コストの倍率ではありません(コストは上の計算機で)。 25K → 21× · 100K → 83× · 200K → 167×.