DeepSeekは、deepseek-v4-proユーザーに4日間の猶予を与えました。2026年9月14日04:00 UTC(北京時間12:00)をもって、deepseek-v4-proを指定するすべてのリクエストはDeepSeek-V4.1-Flashにルーティングされ、V4.1-Flashの料金が適用されます。エラーは発生せず、警告もありません。料金が下がり、別のモデルがプロンプトに応答を開始します。
計画すべきは最後の部分です。リリースノートではこの変更をアップグレードとして位置付けており、DeepSeek自身の数値上もその通りです。しかし、「サイレントリルーティング」は「テスト済み」とは異なります。もしあなたの製品が特定のツールコール形状や、V4-Proに合わせて調整したレイテンシ予算に依存している場合、日曜日の後ではなく、その前に何が変更されるかを知りたいと思うでしょう。
このガイドでは、DeepSeekが発表した内容、何もしなかった場合に何が起こるか、移行チェックリスト、そして切り替えを問題なく完了させるためにApidogでPro対Flashの回帰テストスイートを構築する方法について説明します。モデル自体については、まずDeepSeek-V4.1-Flashとは何かをお読みください。
要点
- 切り替え:2026年9月14日04:00 UTCより、
deepseek-v4-proへのリクエストはV4.1-Flashにルーティングされます。 - 呼び出しが失敗することはなく、Proの価格を支払うこともありません。ピーク時のキャッシュミス入力料金は100万トークンあたり$1.32から$0.30に(77%減)、出力料金は$3.96から$1.20に(70%減)なります。
- モデルIDを
deepseek-flashに自分で変更し、関数呼び出し、構造化出力、ストリーミング、推論の努力を再テストしてください。 - DeepSeekによると、V4.1-FlashはすべてのベンチマークでV4-Proを上回っています。これらはベンダーの数値です。独自の評価を実行してください。
DeepSeekが9月10日に発表した内容
9月10日の変更ログエントリは、V4.1-FlashのAPIでの一般提供開始と、4日後のV4-Proの引退という2つの項目を扱っています。

V4-Proに関して、文言は直接的です。DeepSeekは、V4.1-Flashが「パフォーマンス、コスト、速度、総時間においてV4 Proを総合的に上回っている」と述べ、「複数の関係者によるテスト」を引用しています。9月14日04:00 UTC以降、deepseek-v4-proへのリクエストはV4.1-Flashによって処理され、V4.1-Flashとして課金されます。Proがレガシー名で稼働し続ける猶予期間はありません。
命名規則の整理はProを超えて行われます。
| モデル名 | 9月10日以降のステータス |
|---|---|
deepseek-flash |
V4.1-Flashの新しい正規ID |
deepseek-v4-flash |
引き続き受け入れられ、V4.1-Flashによって処理されます |
deepseek-v4-flash-vision-exp |
引き続き受け入れられ、V4.1-Flashによって処理されます |
deepseek-v4-pro |
9月14日04:00 UTCまでV4-Proによって処理され、その後V4.1-Flashにルーティングされます |
V4-FlashとV4-Flash-Vision-Expはモデルとして引退し、その名前だけがエイリアスとして残ります。ベースURLは変更されません。OpenAI互換フォーマットはhttps://api.deepseek.com、Anthropic互換フォーマットはhttps://api.deepseek.com/anthropicです。V4.1-Flash APIの使用方法では、新しいモデルID、推論制御、画像入力について詳しく説明しています。
何もしなかったらどうなるか
短いバージョン:あなたの連携は動作し続け、より安価になります。長いバージョン:5つのことがあなたの下で変わります。
異なるモデルが応答します。 V4.1-Flashは、新しい因果エンコーダ-デコーダレイアウトを持つ552BパラメータのMoEです。40層(20層のエンコーダと20層のデコーダ)で構成され、プリフィル中に8Bパラメータ、デコード中に16Bパラメータがアクティブになります。あなたのプロンプトは、異なるアクティブパラメータ予算と異なるアテンション設計(Compressed Sparse Attention 2)に影響されます。異なる言い回し、異なるデフォルトの冗長性、そして時には境界線上のツールコールに対する異なる決定が予想されます。
出力の上限は同じですが、推奨設定は異なります。 どちらのモデルも1Mコンテキストと384Kの最大出力をリストしています。V4.1-Flashモデルカードは、温度1.0、top_p 0.95または1.0、最大トークン数256K以上を推奨しています。V4-Proでコストを抑えるために厳密なmax_tokensを設定している場合、回答が到着する前に推論出力が途中で打ち切られないか確認してください。
推論の努力は異なるスケールで機能します。 DeepSeekはV4.1-Flashの推論の努力を1から100のスケールで「連続的に制御可能」と説明しています。V4-Flashはreasoning_effortとextra_body={"thinking": {"type": "enabled"}}を受け入れました。1から100のスケールがAPIパラメータにどのようにマッピングされるかは、現在のドキュメントと[要確認]です。"high"のような名前付きレベルがProでの深さを意味すると仮定しないでください。
料金はピーク時間帯を除いて有利に変わります。 ピーク時間は月曜日から金曜日の01:00から04:00、および06:00から10:00 UTCです。オフピークはピークの半額です。ルーティングされたProトラフィックは、どちらの時間帯でもFlashレートで課金されます。
同時実行の許容量が増加します。 V4-Proの制限は500同時リクエストでしたが、Flashは2,500です。ルーティングされたトラフィックは高い制限を引き継ぐため、500に合わせて調整されたクライアント側のバックオフを再検討してください。
移行チェックリスト
これらを順番に実行してください。これらをすべて行うことで、サイレントルーティングは意図的なリリースへと変わります。
- モデルIDの名前を変更します。 コードベースと設定ファイルで
deepseek-v4-proを検索し、deepseek-flashに置き換えてください。エイリアスが引き続き解決されるとしてもこれを行ってください。明示的なIDを使用することで、後でインシデントの読み取りが容易になります。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash", # 「deepseek-v4-pro」であった
messages=[
{"role": "system", "content": "You triage support tickets. Return a JSON object with priority, team, and summary."},
{"role": "user", "content": "Customer reports checkout returns 502 after applying a discount code."},
],
response_format={"type": "json_object"},
)
print(response.choices[0].message.content)
- 推論の努力設定を確認します。
reasoning_effortまたは思考切り替えを設定しているすべての箇所をリストアップします。エンドポイントごとに深さまたはレイテンシのどちらを優先するかを決定し、古い値をそのまま使用するのではなく、新しいスケールに対してそれぞれをテストしてください。 - 関数呼び出しおよび構造化出力テストを再実行します。 モデルの入れ替えで最も影響を受けるのは、ツールコールの引数フォーマットです。V4-Proで関数呼び出しを設定したときにテストを作成した場合は、今すぐ
deepseek-flashに対してそれらを実行してください。作成していない場合は、以下のApidogワークフローがテストスイートを提供します。 - ストリーミングパーサーを確認します。 V4.1-Flashは、思考モードで推論の差分と応答の差分を別々にストリームします。あなたのSSEハンドラがそれらを連結していないこと、そしてあなたの「最初のトークン」タイマーが意図した通りに測定していることを確認してください。
- レイテンシとコストの再ベースライン化を行います。 今週中にV4-Proでのp50およびp95レイテンシとリクエストあたりのトークン数を記録し、次に
deepseek-flashで同じことを行います。月曜日にダッシュボードがなぜ変動したかと尋ねられたときに、両方の数値が必要になるでしょう。 - ダッシュボードと予算を更新します。 ピーク時に$3.96の出力に合わせて調整されたコストアラートは、$1.20の支払いになると静かになり、決して発火しない予算は誰も見なくなります。料金ページのレートに閾値をリセットし、古いIDでフィルタリングするモデルごとの内訳を修正してください。
チャット補完ではなくAnthropic互換またはResponses APIフォーマットを呼び出す場合も、同じ手順が適用されます。V4-Pro APIフォーマット比較には、各リクエストがどのように見えるかが示されているため、フィールドをマッピングできます。
V4-Pro対V4.1-Flashの概要
ベンチマークの数値はDeepSeekによって報告されたもので、V4.1-Flashモデルカードからのものです。料金は100万トークンあたりの米ドルで、2026年9月10日より有効です。
| deepseek-v4-pro | deepseek-flash (V4.1) | |
|---|---|---|
| アクティブパラメータ | V4.1カードに再記載なし | 8Bプリフィル / 16Bデコード |
| HumanEval | 76.8 | 79.4 |
| GSM8K | 92.6 | 93.0 |
| DeepSWE v1.1 | 62.7 | 74.2 |
| Terminal-Bench 2.1 | 87.9 | 90.6 |
| 入力、キャッシュヒット (オフピーク / ピーク時) | $0.022 / $0.044 | $0.003 / $0.006 |
| 入力、キャッシュミス (オフピーク / ピーク時) | $0.66 / $1.32 | $0.15 / $0.30 |
| 出力 (オフピーク / ピーク時) | $1.98 / $3.96 | $0.60 / $1.20 |
| コンテキスト / 最大出力 | 1M / 384K | 1M / 384K |
| 同時実行制限 | 500 | 2,500 |
最大の差はDeepSWEで11.5ポイント増です。最小はGSM8Kで0.4ポイント増です。もしあなたのワークロードが小学校の算数のようであれば同等性を期待できますが、複数のファイルを編集するコードのようであれば、DeepSeekの数値によれば利点があります。V4-Flashを含む3つのモデルの比較は、V4.1-Flash対V4-Pro対V4-Flashにあります。
リスク:ベンダーのベンチマークはベンダーのタスクを測定する
この表のすべての数値はDeepSeekから提供されたものです。「複数の関係者によるテスト」はDeepSeekの言葉であり、リリースノートには関係者の名前は記載されていません。それは数値が間違っているという意味ではありません。それは、あなたのプロンプト、あなたのツールスキーマ、またはあなたのユーザーの乱雑な入力ではなく、ベンチマークスイートで測定されたことを意味します。
モデルはTerminal-Benchでより高いスコアを出すことができても、あなたのパーサーが依存するツールコール引数のフォーマットを変更する可能性があります。モデルが2倍のトークンを書き出す場合、出力トークンが安くても役に立ちません。唯一確実な方法は、両方のモデルが存在する間に、あなた自身のトラフィックを両方のモデルで実行することです。期限は9月14日までです。
切り替え前にApidogで回帰テストスイートを構築する
以下は、Apidogでのワークフローです。これにより、ProとFlashの比較を再現性のある形で行い、その実行をCIに引き渡すことができます。
- 既存のV4-Proリクエストをインポートします。 OpenAI互換のOpenAPIスペックをインポートするか、本番環境で使用しているcurlコマンドを貼り付けます。
DEEPSEEK_API_KEYを環境変数に設定し、AuthorizationヘッダーでBearer {{DEEPSEEK_API_KEY}}として参照します。2番目の変数{{MODEL_ID}}を追加し、deepseek-v4-proに設定します。 - 各リクエストを
deepseek-flashで複製します。 2番目の環境で{{MODEL_ID}}をdeepseek-flashに設定するか、ペアになったリクエストで2つのIDをハードコードします。同じプロンプト、同じツール配列、同じmax_tokensを使用します。唯一の違いはモデルであるべきです。 - JSONの形状とツールコール構造にアサーションを追加します。 構造化出力の場合、
choices[0].message.contentがJSONとして解析され、期待するキーが含まれていることをアサートします。関数呼び出しの場合、choices[0].message.tool_calls[0].function.nameが期待するツールと等しく、argumentsが解析されることをアサートします。これらのチェックは、サイレントなフォーマットのずれを検出します。 - 両方を一つのテストシナリオとして実行します。 ProとFlashのリクエストを単一のシナリオに連結し、各実行が1つのレポートを生成するようにします。
stream: trueを設定したストリーミングリクエストを含めます。ApidogはSSEイベントを1つずつレンダリングするため、推論と応答の差分がパーサーの期待通りに到着するかどうかを確認できます。 - 結果を比較します。 レポートの2つの部分(アサーション合格率、応答時間、
usage.completion_tokens)を比較します。すべてのアサーションに合格しても、出力トークンが40%多く生成されるモデルは、コスト計算を変更します。これは請求書が届く前に確認できるでしょう。 apidog-cliでCIにスケジュールします。 9月14日まで毎日パイプラインからシナリオを実行し、その後も実行を続けます。Proがなくなると、Proの部分もFlash応答を返し、差分はゼロになります。これは切り替えが完了し、あなたのアサーションが引き続き有効であることを確認するものです。
これを設定するにはApidogをダウンロードしてください。このフローは共有プロジェクトに存在するため、請求書の担当者とプロンプトの担当者は同じレポートを閲覧できます。
よくある質問
9月14日にV4-Proへの呼び出しは失敗しますか? いいえ。deepseek-v4-proを指定するリクエストはV4.1-Flashにルーティングされます。200応答とV4.1-Flashの回答が得られます。失敗モードは動作によるものであり、エラーコードではありません。
切り替え後もV4-Proの料金が課金されますか? いいえ。ルーティングされたリクエストはV4.1-Flashのレートで課金されます。ピーク時では、100万キャッシュミス入力トークンあたり$1.32ではなく$0.30、100万出力トークンあたり$3.96ではなく$1.20です。
IDをdeepseek-flashに変更すべきですか、それともdeepseek-v4-proのままにしておくべきですか? 変更してください。エイリアスは機能しますが、明示的なIDを使用することで、ログ、ダッシュボード、コストレポートで何が呼び出されているかが明確になります。
V4-Pro-0813の設定は引き続き適用されますか? V4-Pro-0813 APIガイドからのキー、ベースURL、リクエストの形状は変更されずに引き継がれます。変更されるのは、それらの背後にあるモデルと推論の努力制御なので、仮定せずに再テストしてください。
V4.1-FlashはV4-Proよりも劣る点はありますか? DeepSeekが公開しているベンチマークでは、リストされているすべてのタスクで改善が見られます。公開時点では独立した結果は利用できませんでした。「何も劣っていない」という主張はテストすべきものとして扱ってください。
4日間で十分
移行は文字列の変更1つとテスト実行で完了します。文字列の変更には1分かかります。テスト実行は、来週から支払うモデルが、あなたが設計したモデルのように振る舞うかどうかを教えてくれます。スイートを構築し、deepseek-v4-proがまだProに解決される間に実行し、差分を読み取ってください。もし問題がなければ、70%安い請求書と5倍の同時実行が無料で手に入ります。もし問題があれば、DeepSeekのスケジュールではなく、あなたのスケジュールでそれを発見したことになります。
