DeepSeekは、メーターを気にしないような価格でフロンティアに近いモデルを提供することで、開発者基盤を構築しました。しかし、2026年8月6日、同社はその取引が間もなく変更されることを警告しました。Dataconomyが最初に報じた発表で、DeepSeekはAPI価格が「近い将来」上昇し、その増加は「大幅になる」と述べました。具体的な数字、発効日、モデルや料金ティアごとの内訳は示されていません。
この文脈は、警告の信憑性を高めます。DeepSeekは、計算コストの上昇、容量のボトルネック、V4-FlashおよびV4-Proへの大量のトラフィックを挙げています。これは1ヶ月足らずでの2度目の価格変更であり、7月中旬にはピーク/オフピーク料金が導入されました。また、この発表はV4 Pro 0813が8月12日に一般提供開始された時期と重なり、需要を押し上げる要因となります。eWeekは、この動きを、DeepSeekがAPAC内外のチームにとってデフォルトの予算選択肢となった低コストの優位性に対する試練と位置付けています。
新しい料金を制御することはできません。しかし、購入するトークンの量、どのティアで、何時に、どのプロバイダーから購入するかは制御できます。このプレイブックでは、値上げが適用される前に行うべき5つの行動と、1.5倍、2倍、3倍のシナリオがサンプルワークロードに与える影響について説明します。
要するに
- DeepSeekは2026年8月6日にAPI価格の「大幅な」値上げを発表しましたが、具体的な金額、日付、モデルごとの詳細は不明です。
- 最大のレバーは自動プロンプトプレフィックスキャッシュです。キャッシュされた入力の請求額は、キャッシュミス率の1%未満です。今すぐプロンプトプレフィックスを安定させてください。
- タスクごとにルーティングします。大量の単純な呼び出しにはV4-Flash、深い推論にはV4-Proを使用します。分類が推論の価格を支払わないように、思考予算に上限を設けてください。
- バッチワークロードは、DeepSeekが7月中旬に導入したオフピークの時間帯に移動します。
- セカンドプロバイダーでヘッジします。OpenRouterはDeepSeekモデルを独立して価格設定しており、両方に対して実行されるApidogテストスイートにより、フォールバックが機能することを証明できます。
- 仮に3倍になったとしても、V4-Proの出力は100万トークンあたり2.61ドルとなり、フロンティア競合が持つとされる25~30ドルと比較しても安価です。準備をしてください。パニックにならないでください。
DeepSeekが発表したこと、そして発表しなかったこと
開示内容は薄く、API全体の価格が「近い将来」上昇し、その増加は「大幅になる」こと、そしてその原因は計算コスト、容量のボトルネック、V4-FlashおよびV4-Proエンドポイントへの大量のトラフィックである、とされています。DeepSeekが述べたのはこれだけです。本日8月13日現在、現在の料金はまだ適用されており、時間は刻々と過ぎています。
さて、不足している情報です。DeepSeekは、価格がどれだけ上昇するのか、いつ上昇するのか、V4-FlashとV4-Proが同じ係数で変動するのか、キャッシュヒット率がキャッシュミス率と連動して変動するのか、あるいは推論ワークロードが異なる扱いを受けるのかについては述べていません。Hacker Newsのスレッドでは2倍から3倍と推測されていますが、これは公式の裏付けのない憶測であり、特定の数字ではなく範囲で計画を立てるべきです。
これらのシナリオで倍増する料金カードは以下の通りです。
| モデル | 入力 (キャッシュミス) | 入力 (キャッシュヒット) | 出力 |
|---|---|---|---|
| DeepSeek V4-Pro | $0.435 / Mトークン | $0.003625 / Mトークン | $0.87 / Mトークン |
| DeepSeek V4-Flash | $0.14 / Mトークン | $0.28 / Mトークン |
どちらのモデルも1Mトークンのコンテキストウィンドウを持ちます。詳細な内訳については、当社のDeepSeek V4 API 価格ガイドをご覧ください。実際の料金カードはDeepSeekのAPIドキュメントに掲載されています。
この表には、プレイブック全体を駆動する2つの比率があります。キャッシュされた入力はキャッシュミスの入力の1%未満のコストであり、V4-Proは入力と出力の両方でV4-Flashの約3倍の費用がかかります。以下の各ステップは、これらのギャップのいずれかを活用します。
ステップ1:値上げ前にリスクを測定する
値上げは、ほとんどのチームが正確に把握できていない数値に乗算されます。プロンプトやルーティングに手を加える前に、乗算が何に適用されるかを知るために使用状況を計測してください。
すべてのモデル呼び出しに、それをトリガーした機能またはエンドポイントのタグを付け、APIがすでに返すトークン数をログに記録します。
usage = response.usage
log.info("llm_call", extra={
"feature": "ticket-summarizer", # 誰が使用しているか
"model": "deepseek-v4-flash",
"input_tokens": usage.prompt_tokens,
"output_tokens": usage.completion_tokens,
"cache_hit_tokens": usage.prompt_cache_hit_tokens,
})
完全なパターン、アトリビューション、ダッシュボード、機能ごとのユニットエコノミクスについては、機能ごとのOpenAI API費用を追跡する方法にあり、DeepSeekにもそのまま適用できます。
1週間のデータで、その他すべてを決定する以下の疑問に答えることができます。何が支出の大部分を占めているのか、入力トークンのうちキャッシュにヒットする割合はどれくらいか、V4-ProのトラフィックのうちV4-Flashのような作業を行っているのはどれくらいか、そして各機能がユニットエコノミクスを破綻させるのはどのくらいの倍率でか。最後の数字はステップ5の閾値です。書き留めておいてください。
ステップ2:キャッシュヒットを最大化する、最大のテコ
DeepSeekはプロンプトプレフィックスを自動的にキャッシュします。リクエストの冒頭のトークンが最近のリクエストと一致する場合、その繰り返されたプレフィックスはキャッシュヒット料金で請求されます。V4-Proの場合、キャッシュミスの場合の100万入力トークンあたり0.435ドルではなく、0.003625ドルです。キャッシュ制御フラグやTTL管理は不要で、割引はプロンプト構造の繰り返し可能性に完全に依存します。プレフィックスキャッシュが初めての方は、プロンプトキャッシュとは何か、そしてその仕組みに関する入門記事でその仕組みを解説しています。
プレフィックスをバイト単位で安定させる
キャッシングは正確なトークンプレフィックスに一致するため、プロンプトを静的要素を最初に、動的要素を最後に配置するように構成します。
- 常に変化しないコンテンツ(システムプロンプト、ツール定義、少数のショットの例、ポリシーテキストなど)を先頭に配置します。すべての呼び出しで同じバイト列、同じ順序で記述します。
- 可変コンテンツ(ユーザーメッセージ、取得されたドキュメント、セッションデータなど)を最後に配置します。
- プレフィックスを破壊する要素を見つけ出して排除します。例えば、システムプロンプト内のタイムスタンプ、最初の行にあるリクエストID、冒頭のパーソナライズされた挨拶、非決定的な順序でシリアライズされるツールリストなどです。これらがあると、99%の割引が全額請求に変わってしまいます。
- 複数ターンのループに注意してください。エージェントのワークフローは、ターンごとに会話全体を再送信します。安定したプレフィックスがあれば、最新のメッセージより前のすべてがキャッシュ済みとして請求されるため、エージェントを多用するワークロードはここで最も利益を得ますが、プレフィックスが頻繁に変わると最も損失を被ります。
すべての応答からヒット率を読み取る
DeepSeekは、各応答のusageオブジェクトにキャッシュパフォーマンスを報告しています。DeepSeekのAPIドキュメントに記載されています。
u = response.usage
hit_rate = u.prompt_cache_hit_tokens / (
u.prompt_cache_hit_tokens + u.prompt_cache_miss_tokens
)
ステップ1の計測で、機能ごとにそのレートを追跡します。繰り返し構造を持つ機能でヒット率が低い場合、そのプレフィックス内の何かが頻繁に変わっており、それを修正することは通常、1日のプロンプトのリファクタリング作業で、次の料金がどうなっても永続的な利益をもたらします。
ステップ3:習慣ではなくタスクでルーティングする
V4-Proの料金がV4-Flashの約3倍であることは、深い推論には妥当な価格です。しかし、JSONの再フォーマットには不適切な価格です。ほとんどのコードベースはプロトタイピング中に1つのモデルを選択し、それを再検討することはありません。通常はProがデフォルトです。ステップ1のデータを監査し、意図的にルーティングしてください。
| ワークロードの形状 | ルーティング先 |
|---|---|
| 分類、抽出、フォーマット、意図のルーティング | V4-Flash、思考は最小限に |
| 要約、RAG回答、初稿生成 | まずはV4-Flash; 評価が失敗した場合のみProに昇格 |
| 多段階エージェントループ、困難なデバッグ、アーキテクチャ分析 | V4-Pro、思考予算あり |
モデル選択と同じくらい思考の規律が重要です。推論の追跡は出力トークンとして請求され、DeepSeekが販売する最も高価なトークンであり、Proでは100万あたり0.87ドルです。したがって、分類ルートで最大限の思考設定を行うと、ルックアップに対して推論価格を支払うことになります。ルートごとの思考努力に上限を設けてください。機械的なタスクには思考なしまたは最小限にし、深い思考は、明確な利益があるエージェントループや分析作業に限定します。
感覚ではなく、証拠に基づいてダウングレードしてください。ルートをFlashに移動するか、思考予算を削減し、評価スイートを実行して、品質が維持される場合は変更を維持します。
ステップ4:バッチ作業をオフピーク時間帯に移行する
DeepSeekが7月中旬に導入したピーク/オフピーク料金は、最近の変更の中で唯一あなたに有利に働くものですが、ほとんどのチームはまだそれを無視しています。現在の時間帯と割引は、DeepSeekのAPIドキュメントの料金カードに掲載されています。
人間の待ち時間がないものは何でも対象となります。夜間評価実行、埋め込みのバックフィル、データセットのラベリング、CIプロンプト回帰スイートなどです。これらのジョブをオンデマンドで実行する代わりに、リリースウィンドウを持つキューに配置してください。これは、トークンは同一であり、時間が動くだけなので、品質検証が不要な1日のスケジューリング変更です。
ただし、DeepSeekはオフピークの割引が値上げ後も存続するかどうかは述べていません。今のうちに活用し、新しい料金が発表されたら再確認してください。
1.5倍、2倍、3倍になった場合の費用
これらは例示的なシナリオであり、予測ではありません。DeepSeekは乗数を発表しておらず、すべてのティアが均一にスケールするかどうかも不明です。以下の表では、架空ですが現実的なワークロードに適用されるものと仮定しています。
サンプルワークロード(月額):V4-Proは、60%のキャッシュヒット率で4億入力トークンと6千万出力トークンを処理します(ミス69.60ドル + ヒット0.87ドル + 出力52.20ドル = 122.67ドル)。V4-Flashは6億入力トークンと1億2千万出力トークンを処理します(84.00ドル + 33.60ドル = 117.60ドル)。基準請求額:240.27ドル。
「最適化済み」の列はステップ2~3を適用しています。プレフィックスの再構築によりProのキャッシュヒット率が85%に上昇し、思考予算によりProの出力が4500万トークンに削減されます(26.10ドル + 1.23ドル + 39.15ドル = 66.48ドル、Flashは変更なし、合計184.08ドル)。数値は四捨五入して整数ドルにしています。
| 料金シナリオ | 最適化されていない請求額 | 最適化済み (ステップ2-3) |
|---|---|---|
| 現行料金 | $240 | $184 |
| 1.5倍の増加 | $360 | $276 |
| 2倍の増加 | $481 | $368 |
| 3倍の増加 | $721 | $552 |
斜めに見てください。2倍の増加における最適化されたワークロード(368ドル)は、1.5倍の場合の最適化されていないワークロード(360ドル)とほぼ同じ費用です。構造的な節約は、どのような乗数が適用されてもスケールし、現在の23%の削減は今日56ドルの価値があり、3倍のシナリオでは168ドルの価値があります。オフピークのバッチ処理は、ライブスケジュールに割引が依存するため、ここではモデル化されていません。したがって、最適化された列は控えめな見積もりとして扱ってください。
モデル切り替えが最適化に勝る時
最も悲観的な憶測の範囲であっても、DeepSeekは絶対的な価格で安価なままです。3倍の値上げでもV4-Proの出力は100万トークンあたり2.61ドルであり、公開されている比較では、フロンティア競合の出力は100万トークンあたり25~30ドルです。桁違いの差は、噂されているすべてのシナリオで存続しており、eWeekはこれをDeepSeekの優位性の終焉ではなく、その浸食と呼んでいます。
では、いつ切り替えが有利になるのでしょうか?
DeepSeekがあなたの品質評価をクリアし、支出がキャッシュ可能でルーティング可能なトラフィックに集中しており、料金が適用される前にエンジニアリングの時間がある場合は、最適化して継続してください。上記のプレイブックは効果を複合させますが、切り替えコストは一度きりで多額です。
キャッシュヒットの天井が構造的に低い場合(すべてのリクエストが独自の長いドキュメントを含み、再利用するプレフィックスがない場合)、競合他社の小型モデルがあなたの評価を通過するタスクに対してPro価格を支払っている場合、または発表された乗数がステップ1で計算した損益分岐点を超えて着地した場合、切り替えを行うか、トラフィックを分割してください。
ほとんどのチームにとって正直な答えはハイブリッドです。DeepSeekがコストあたりの品質評価で優れている場所ではDeepSeekを維持し、そうでないルートは移動させ、ステップ5のパリティスイートを実行し続けることで、どのベンダーからの次の料金変更のサプライズも、危機ではなく設定変更で対応できるようにします。
まとめ
DeepSeekは値上げを告げましたが、それ以外のことは何も伝えませんでした。その間に行動を起こすチームが成功します。機能ごとの費用を計測し、プロンプトプレフィックスを安定させ、Flash向けの作業をFlashにルーティングし、バッチジョブをオフピークに移動させ、必要になる前にセカンドプロバイダーが機能することを証明してください。
すべてのステップは測定可能であり、ほとんどがスプリントではなく数日で完了します。フェイルオーバーの半分を1つのツールで処理するには、Apidogを無料でダウンロードしてください。テストスイートを一度作成し、api.deepseek.comと、プロバイダーごとの環境を持つフォールバック先に向け、料金ニュースが展開する間、両方を正確に保つようにスケジュールを設定します。
