クロード オプス 5.5 プロンプトキャッシュ: 20セントのキャッシュ読み込みにおける損益分岐計算

クロード Opus 5.5は、新規入力に4.00ドル、生成に5.00ドルかかるのに対し、キャッシュされた入力トークンには100万トークンあたり0.20ドルを課金します。以下に、実際の要求パターンに基づいて算出された、損益分岐点となる再利用率21%を示します。

INEZA Felin-Michel

INEZA Felin-Michel

23 9月 2026

クロード オプス 5.5 プロンプトキャッシュ: 20セントのキャッシュ読み込みにおける損益分岐計算

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

エージェントは、システムプロンプト、ツール定義、ポリシー文書からなる同じ40,000トークンを、呼び出しごとに毎回再送しています。Claude Opus 5.5の入力価格は100万トークンあたり4ドルなので、このプレフィックスは、前回のリクエストから1バイトも変更されていなくても、送信されるたびに0.16ドルかかります。

プロンプトキャッシュがその解決策であり、AnthropicはOpus 5.5で積極的な価格設定を行いました。キャッシュされた読み取りは100万トークンあたり0.20ドルで、新しい入力の4.00ドルと比較して95%の割引です。しかし、キャッシュへの書き込みは100万トークンあたり5.00ドルで、キャッシュなしでトークンを送信するよりも高価です。したがって、キャッシングはただの儲け話ではありません。それはプレフィックスを再利用するという賭けであり、その賭けには、ほとんど誰も計算せずにオンにするような、正確な損益分岐点が存在します。

この記事では、その計算を解き明かします。手短に言えば、単一のプレフィックスでは1.26回の呼び出し後に採算が取れ、定常状態ではキャッシュヒット率が約21%で採算が取れます。それを下回ると、キャッシングは費用がかさみます。

ボタン

まず、規模について述べる価値があります。OpenAIは、自社のローンチ時に、中央値の研究者がコーディングエージェントに1日あたり600ドル以上を費やし、90パーセンタイルでは1日あたり7,000ドルを超えると開示しました。この量では、ヒット率の20パーセントポイントの差は給与に相当します。9月に発表された3つのモデル全体の価格の全体像については、弊社の2026年9月モデル価格戦争の内訳をご覧ください。

すべてを決定する3つの料金

トークンタイプ Claude Opus 5.5 100万トークンあたりの料金 新規入力に対する比率
新規入力 $4.00 ベースライン
キャッシュ書き込み $5.00 $1.00 の追加料金
キャッシュ読み取り $0.20 $3.80 の節約
出力 $20.00 キャッシングは影響しない

この表からすぐに2つの事実がわかります。プレフィックスをキャッシュに書き込むと、全くキャッシュしない場合よりも100万トークンあたり1.00ドル多く費用がかかります。そのプレフィックスのその後の読み取りごとに、100万トークンあたり3.80ドル節約できます。出力価格は決して変動しないため、短いプロンプトから長い回答を出力するエージェントはここでほとんど得られるものがありませんが、大量の安定したコンテキストを読み取り、短い結論を返すエージェントは大きな利益を得ることができます。

1,000,000トークンのコンテキストウィンドウと128,000トークンの最大出力を含む詳細な仕様書は、Claude Opus 5.5とはでご覧いただけます。

損益分岐点は2回ではなく1.26回の呼び出し

正確に100万トークンのプレフィックスと、それを共有するN回の呼び出し(1回の書き込みとN-1回の読み取り)を考えてみましょう。

キャッシュなし: N * $4.00
キャッシュあり: $5.00 + (N - 1) * $0.20

4.00N = 5.00 + 0.20(N - 1)
3.80N = 4.80
N     = 1.26

書き込みの追加料金を回収するには1.26回の呼び出しが必要です。呼び出しは整数なので、これはつまり、プレフィックスが一度でも読み戻されれば、キャッシュは正しかったということになります。2回の呼び出しですでに35%も先行しています。

1回の書き込みを共有する呼び出し数 100万プレフィックスあたりのキャッシュなしコスト キャッシュありコスト 節約
1 $4.00 $5.00 25%悪化
2 $8.00 $5.20 35%
5 $20.00 $5.80 71%
10 $40.00 $6.80 83%
100 $400.00 $24.80 94%

この表は、1回の書き込みとその後の完璧な再利用を前提としています。実際のシステムはもっと複雑であり、そこで2番目の計算が登場します。

定常状態では、ヒット率が唯一重要な数字である

1日のトラフィック全体で、一度も書き込みをしていないわけではありません。キャッシュは期限切れになり、プレフィックスは編集され、新しいテナントが到着します。hをキャッシュから提供されるプレフィックスのトークンの割合とします。ミスは書き込みとして、ヒットは読み取りとして課金されます。

100万プレフィックストークンあたりの実効コスト = $5.00 * (1 - h) + $0.20 * h
                                    = $5.00 - $4.80h

キャッシュなしの$4.00に対する損益分岐点:  h = 1.00 / 4.80 = 20.8%

21パーセントが覚えておくべき数字です。プレフィックスのトークンの約5分の1未満しかキャッシュから提供されない場合、キャッシングをオンにすると請求額が悪化します。

キャッシュヒット率 100万プレフィックスあたりの実効コスト キャッシュなしの$4.00との比較
0% $5.00 25%悪化
20.8% $4.00 損益分岐点
50% $2.60 35%安価
75% $1.40 65%安価
90% $0.68 83%安価
95% $0.44 89%安価
99% $0.25 94%安価
100% $0.20 95%安価

この2つの表は、異なる視点から見た同じ方程式です。N回の呼び出しごとに1回の書き込みがある場合、ヒット率は(N-1)/Nです。10回の呼び出しごとに1回の書き込みは90%のヒット率であり、両方の表で83%と示されています。

3つのリクエスト形状、実施例

形状1:高頻度エージェント、小さなプレフィックス

40,000トークンのプレフィックス、800トークンの可変ユーザー入力、600トークンの出力を持つサポートトリアージエージェントが、1日あたり10,000回の呼び出しを行います。呼び出しの3%で書き込みが発生し、97%のヒット率を仮定します。

キャッシュなし キャッシュあり
プレフィックス、4億トークン/日 $1,600.00 $137.60
可変入力、800万トークン/日 $32.00 $32.00
1日あたりの入力合計 $1,632.00 $169.60

これは入力行から89.6%オフ、1日あたり約1,462ドル、1か月あたり43,800ドルに相当します。出力はいずれにしても1日あたり120ドルで変わりません。プレフィックスがわずか40,000トークンであることに注意してください。ここでは、サイズの大きさではなく、頻度がキャッシングの費用対効果を高めています。

形状2:100万コンテキストに対するワンショット処理

100万トークンを入力し、1つの回答を出力し、その後再利用しない場合です。キャッシュなしでは、その呼び出しの入力コストは4.00ドルです。キャッシュありでは5.00ドルかかります。なぜなら、誰も読み取らないプレフィックスを書き込む費用を支払ったからです。1日に500のドキュメントをこのパターンで処理すると、キャッシングは余分に1日500ドルも無駄な費用がかかります。

これは人々が最も誤解しやすい形状です。なぜなら、コンテキストが膨大で、膨大なコンテキストは当然キャッシングが必要だという直感が働くからです。しかし、サイズは無関係です。再利用こそが唯一の変数なのです。

形状3:1Mウィンドウでの長時間エージェントセッション

同じ100万トークンのコンテキストを使用し、エージェントが200ターンにわたってそれを再読み込みするケースを考えます。これは、18時間のタスクループがまさにどのようなものかを示しています。

コスト
キャッシュなし、200回 x $4.00 $800.00
キャッシュあり、1回の書き込み + 199回の読み取り $44.80
キャッシュあり、5回の書き込み + 195回の読み取り $64.00

セッション中にキャッシュが4回失効し、5回分の全書き込み費用を支払ったとしても、キャッシュなしの請求額より92%も安くなります。長いセッションこそが、0.20ドルという料金がその評価を得る場なのです。

高価な間違い:変更される部分をキャッシュすること

共有の6,000トークンの指示ヘッダーの背後で、それぞれ60,000トークンの5,000個のドキュメントを一度ずつ要約することを考えます。

戦略 入力コスト
全くキャッシュしない $1,320
各ドキュメントを含むリクエスト全体をキャッシュする $1,650
6,000トークンのヘッダーのみをキャッシュする $1,206

誤った境界をキャッシュすると、キャッシュしないよりも25%悪くなります。正しい境界をキャッシュすると9%良くなります。同じ機能、同じ料金ですが、キャッシュされたプレフィックスがどこで終わるかによって、444ドルの差が生じます。

これから導き出されるルールは、呼び出し間で同一のバイト列の最長先行部分をキャッシュし、それ以上1バイトもキャッシュしないということです。タイムスタンプ、リクエストID、またはリクエストごとのドキュメントがキャッシュされたプレフィックス内に含まれている場合、ヒット率はゼロに低下し、すべての呼び出しは4.00ドルではなく5.00ドルで課金されます。プレフィックスマッチングの一般的な仕組みについては、弊社のプロンプトキャッシング入門で説明しています。

95%は漸近線であり、受け取る割引ではない

見出しの数字は、キャッシュされた読み取りが新規入力の5%の費用であるというものです。実際には5%を支払うことはありません。なぜなら、常に少なくとも1回の書き込みに費用を支払っているからです。1回の書き込みあたり100回の呼び出しでは94%です。1回の書き込みあたり10回の呼び出しでは83%です。2回の呼び出しでは35%です。

見出しの数字ではなく、ヒット率の表から予算を立ててください。95%の節約をモデル化し、83%を観測した財務チームは、機能が価格通りに機能しているにもかかわらず、それが壊れていると結論付けるでしょう。

ローンチ資料が語らないこと

この計算における3つのインプットはAnthropicのOpus 5.5のローンチ資料には含まれておらず、これらを推測することは予算を誤る最も早い方法となるでしょう。

数値にコミットする前に、ベンダーの価格ページでこれら3つすべてを確認してください。この記事の料金は公表されています。これら3つはそうではありません。

キャッシュが実際にヒットしているかテストする

失敗モードはサイレントです。プレフィックスがコールドになってもエラーは発生しません。誰かがシステムメッセージにデバッグIDを追加すると、ヒット率が97%から0に低下し、唯一の兆候は3週間後の請求書に記載された行だけです。

Messages APIは、すべての応答で分割を報告します。

"usage": {
  "input_tokens": 812,
  "cache_creation_input_tokens": 0,
  "cache_read_input_tokens": 40960,
  "output_tokens": 604
}

最初の呼び出しでは `cache_creation_input_tokens` がプレフィックスを伝達します。それ以降のすべての呼び出しでは、そのフィールドは0であるべきで、`cache_read_input_tokens` が同じ負荷を伝達するはずです。Apidogでリクエストを一度保存し、二度実行して、どのフィールドが変化するかを確認してください。

そして、その観察結果をアサーションに変えることで、静かに後退することを防ぎます。Apidogのテストシナリオで、リクエストを2回送信し、2回目の応答で `cache_read_input_tokens > 40000` をアサートするように設定すると、チームメンバーがプレフィックスを非決定論的にした瞬間にCIで失敗します。これは、プレフィックスの課金が25倍になるのを防ぐための1行のテストであり、この記事の中で最も高いリターンをもたらすものです。

GPT-6が同じ計算にたどり着く場所

GPT-6 Solは、入力が100万トークンあたり2.00ドルで、キャッシュされた読み取りには90%の割引が適用され、これによりキャッシュされた読み取りは100万トークンあたり0.20ドルとなり、Opus 5.5と同じ数値です。GPT-6 Lunaは100万トークンあたり0.10ドルの入力で、キャッシュされた場合は100万トークンあたり0.01ドルになります。

違いは、私たちが計算できることです。OpenAIのローンチ資料にはキャッシュ書き込み料金が記載されていないため、GPT-6の損益分岐再利用率は、Opus 5.5の場合のように導き出すことはできません。Anthropicが明示的に5.00ドルの書き込み価格を公開したことで、21%という数値が計算可能になったのです。OpenAIのキャッシングに関する残りのリリース(キャッシュを維持するための変更や新しい診断ツールなど)は、弊社のGPT-6プロンプトキャッシング解説に記載されています。

結論

Claude Opus 5.5でのプロンプトキャッシングは、一つの算術的な質問に帰結します。つまり、プレフィックスのトークンの5分の1以上がキャッシュから読み取られるか、という点です。もしそうであれば、これをオンにして、広告されている95%ではなく、入力行から83%から94%の割引を期待してください。もしワークロードがユニークなドキュメントに対するワンショット処理である場合、これをオフにして、100万トークンあたり1.00ドルの書き込みプレミアムを節約してください。そして、どちらを選択するにしても、`cache_read_input_tokens` に対してCIでアサートしてください。なぜなら、キャッシュの退行は決して自ら発表されることはないからです。

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる