コスト

WOS に払うのは $2。LLM 側でその何倍も節約。

WOS がクエリごとに LLM へ渡すのは約 1,000 トークン - 上限があり関連性の高いスライスです。全履歴を毎回プロンプトに詰め込む場合との差は非常に大きく、履歴が増えるほど広がります。

クエリ 1,000 件あたりの LLM コスト Tablet 1 基準
ユーザー履歴100K
クエリ数 / 月1,000
使用する LLM
45× 低コスト - 月 $244 の節約
WOS なし$250.00
WOS あり$5.50

WOS に使う $1 ごとに、LLM 側で ~$98 を節約できます。履歴が大きいほど、モデルが高価なほど、ROI は大きくなります。

節約が生まれる仕組み

  • WOS なしでは、毎回のプロンプトに全履歴を詰め込みます - 100K tokens × $2.50/1M = $0.25 がクエリ 1 件ごとに(GPT-4o の入力単価基準。Opus 級モデルでは約 2 倍)。
  • WOS ありでは、取り込みは一度だけ($2/1M)。以降の各クエリは小さな取得($3/1M × 1,000)と、約 1,000 トークンだけを読む LLM のコストで済みます。
  • LLM が読むトークンが少ないほど、支払いは減ります。そして WOS は、記憶が増えてもその数を一定に保ちます。
コンテキスト圧縮率 = 履歴 ÷ 投入トークンであり、コストの倍率ではありません(コストは上の計算機で)。 25K → 21× · 100K → 83× · 200K → 167×.