DeepSeek-V4.1-Flash, V4-Pro, V4-Flash ベンチマーク、コスト、速度比較

より小さく、より安価なV4.1-Flashは、DeepSeek自身のベンチマークでV4-Proを上回り、9月14日にV4-Proを吸収します。ここでは、スペック、価格、スループットを並べて示します。加えて、まず両モデルを比較するためのApidogワークフローもご紹介します。

Medy Evrard

10 9月 2026

DeepSeek-V4.1-Flash, V4-Pro, V4-Flash ベンチマーク、コスト、速度比較

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

DeepSeekは2026年9月10日にDeepSeek-V4.1-Flashのモデルカードを公開しましたが、その数値はV4-Proの顧客にとって都合の悪いものです。より小型で安価なモデルは、DeepSeekがリストアップしているすべてのコーディングおよびエージェントベンチマークにおいてフラッグシップモデルよりも高いスコアを叩き出し、ピーク時のトークンあたりのコストは70〜77%低く、さらに9月14日にはV4-Proを完全に吸収します。つまり、deepseek-v4-proへのすべてのリクエストはV4.1-Flashにルーティングされ、Flashの料金で課金されます。

これは通常の「小さい方がいいか、大きい方がいいか」というトレードオフではありません。これは期限付きの比較です。もし本番環境でV4-Proを使用しているなら、ルーティングが切り替わる際に何が変わるのかを学ぶための時間は4日間しかありません。もしV4-Flashを使用しているなら、変更はすでに発生しています。deepseek-v4-flashという名前は今日からV4.1-Flashによって提供されています。

以下に、アーキテクチャ、DeepSeekが報告したベンチマーク、米ドル価格、スループットに関する3つのモデルすべてを比較します。その後、切り替え前にApidogでdeepseek-v4-proとdeepseek-flashの両方に1つのプロンプトセットを実行し、出力、レイテンシ、使用量カウントを比較するワークフローを示します。アーキテクチャの詳細については、まずDeepSeek-V4.1-Flashとは何かをお読みください。移行チェックリストについては、V4-Proリタイアメントガイドをご参照ください。

要約

スペック比較

V4.1世代は、再トレーニングされたものではなく、新しいアーキテクチャです。DeepSeekはこれを因果エンコーダー・デコーダー(CED)と呼んでいます。20層のエンコーダーと20層のデコーダーに分割された40層で構成され、各層には384のルーティングされたエキスパートと1つの共有エキスパートがあります。モデルカードによると、基盤モデルは5520億パラメータ(ビジョンエンコーダーを含めると7630億パラメータ)です。

V4-Flash V4-Pro V4.1-Flash
アーキテクチャ世代 V4 MoE V4 MoE V4.1 因果エンコーダー・デコーダー、40層
総パラメータ数 2840億 (OpenRouterのビジョンビルドリスト) ここで開示なし 5520億(基盤モデル)、7630億(ビジョンエンコーダー含む)
アクティブパラメータ数 130億 ここで開示なし 80億(プリフィル)、160億(デコード)
コンテキストウィンドウ 100万トークン 100万トークン 100万トークン
最大出力 38.4万トークン 38.4万トークン 38.4万トークン
ビジョン 別途Vision-Expビルド ここで開示なし ネイティブ、DeepSeek-ViTエンコーダー
ライセンス ここで説明なし ここで説明なし MIT、Hugging Faceで重み公開
同時実行制限 2,500 500 2,500
APIステータス 廃止、V4.1-Flashによってエイリアスが提供 9月14日にV4.1-Flashに再ルーティング 9月10日から一般提供、モデルID deepseek-flash

アクティブパラメータ数が分割されている点に注目してください。V4-Flashはすべてのトークンに130億を使用していたのに対し、V4.1-Flashは入力に80億、出力に160億を費やしており、品質が出力で決まることを示しています。

ベンチマーク:11.5ポイントの由来

以下に示す数値はすべて、DeepSeekがモデルカードから報告したものです。独立した実行は公開されておらず、リタイアメント通知の「複数の関係者によるテスト」という表現は、具体的な関係者名を挙げていません。これらはベンダーの主張として扱い、ご自身のプロンプトで検証してください。

DeepSWE v1.1(Proを+11.5、V4-Flashを+19.8上回る)。 これが主要な点であり、意思決定を変えるに足る唯一の大きな差です。DeepSWEは、コーディングエージェントが一日中実行するマルチファイルソフトウェアエンジニアリングタスクを測定します。もしこれがあなたのリポジトリでも当てはまるなら、V4.1-Flashは4倍高価だったモデルを上回るコーディング性能を発揮します。

Terminal-Bench 2.1(+2.7)。 シェル駆動のエージェントタスク。V4-Flash-0731は7月にすでにV4-Pro-Previewを上回っていましたが、V4.1はそのリードを3ポイント未満で拡大しています。実際の差ですが、決定的ではありません。

HumanEval(+2.6)およびGSM8K(+0.4)。 両方ともほぼ飽和状態にあります。すべてのモデルがGSM8Kで90を上回り、HumanEvalは本番コードについてはほとんど何も示唆しません。これらの項目を重視しないでください。

MiniMax M3 vs DeepSeek V4 vs Qwen 3.7には、V4世代の他のオープンモデルとの比較数値がありますが、V4.1はまだ含まれていません。

コスト:3つのモデル、6つの料金ティア

ピーク時間は月曜日から金曜日のUTC 01:00〜04:00と06:00〜10:00です。それ以外の時間はオフピークとなり、半額です。料金は料金ページからの100万トークンあたりの料金で、9月10日から有効です。V4-Flashの行には、2026年8月21日の米ドルレートが「変更前」の列として使用されています。

モデルとティア 入力(キャッシュヒット) 入力(キャッシュミス) 出力
V4-Flash、オフピーク(8月21日レート) $0.007 $0.22 $0.66
V4-Flash、ピーク(8月21日レート) $0.014 $0.44 $1.32
V4-Pro、オフピーク $0.022 $0.66 $1.98
V4-Pro、ピーク $0.044 $1.32 $3.96
V4.1-Flash、オフピーク $0.003 $0.15 $0.60
V4.1-Flash、ピーク $0.006 $0.30 $1.20

V4-Flashと比較して、V4.1はキャッシュヒット入力を約57%、キャッシュミス入力を約32%、出力を約9%削減します。V4-Proと比較すると、ピーク時のキャッシュミス入力で77%、出力で70%の削減となります。

1ヶ月間の試算。 コーディングエージェントが、70%のキャッシュヒット率(システムプロンプトとリポジトリコンテキストを複数ターンで再利用)で月に20億の入力トークンを処理し、3億の出力トークンを生成する場合(すべてピーク時)。

V4-Pro、ピーク V4-Flash、ピーク V4.1-Flash、ピーク V4.1-Flash、オフピーク
14億(キャッシュヒット入力) $61.60 $19.60 $8.40 $4.20
6億(キャッシュミス入力) $792.00 $264.00 $180.00 $90.00
3億(出力) $1,188.00 $396.00 $360.00 $180.00
月間合計 $2,041.60 $679.60 $548.40 $274.20

これはV4-Proと比較して73%の削減であり、バッチジョブをオフピークに移行するとさらに半減します。出力トークンが各列で大部分を占めるため、70%の出力削減はキャッシュヒットの削減よりも重要です。V4.1-Flashの料金内訳では、キャッシュヒットの計算について説明しています。

速度とスループット

DeepSeekは1秒あたりのトークン数を公表していません。そのため、スループットの話は3つのアーキテクチャ上の事実と1つの逸話に基づいています。

これらを信頼する前に、ご自身のp50とp95を測定してください。

9月14日以降に失うもの、得るもの

切り替え後は「どのモデルを選べばいいか」という問いはありません。deepseek-v4-proはエイリアスとなるため、正直なところ損益計算書のようなものです。

得られるもの: リストされたすべてのベンチマークで高いスコア、ピーク時で70〜77%低い価格、5倍の同時実行性、別のビジョンモデルIDなしでのネイティブ画像入力、そしてDeepSeekが1から100のスケールで連続的に制御可能と説明する推論努力ダイヤル。

失うもの: V4世代のチェックポイントを固定する機能。V4-Proのスタイル、冗長性、ツール呼び出しフォーマットに合わせて調整されたプロンプトがずれる可能性があります。出力長と推論トークン数が変更される可能性があり、料金表には示されていない方法で請求額が変わります。また、再ルーティングはあなたのスケジュールではなく、DeepSeekのスケジュールで発生します。

この2番目のリストこそが、14日以降ではなく、14日より前に差分比較を行うべき理由です。

切り替え前にApidogでV4-ProとV4.1-Flashを比較する

ApidogはAPIレイヤーをテストするため、両方のモデルIDに1つのプロンプトセットを実行し、返ってくるものを比較するのに適した場所です。

  1. エンドポイントを追加する。 プロジェクトを作成し、POST https://api.deepseek.com/chat/completionsを追加するか、OpenAPIスペックをインポートします。
  2. キーとモデルIDを環境変数に設定する。 DEEPSEEK_API_KEYとMODEL変数を保存します。MODEL=deepseek-v4-proを持つv4-pro環境と、MODEL=deepseek-flashを持つv41-flash環境の2つを作成し、ヘッダーでBearer {{DEEPSEEK_API_KEY}}として、ボディで"model": "{{MODEL}}"としてそれらを参照します。
  3. 実際のプロンプトをリクエストとして保存する。 本番環境を代表する20〜30個のプロンプト(システムプロンプト、ツール呼び出しターン、長文コンテキストの要約、複数ファイルのコード編集など)を選びます。それぞれをstream: falseで保存し、usageオブジェクトがレスポンスボディに含まれるようにします。
  4. 請求額に影響するフィールドをアサートする。 保存されたリクエストからテストシナリオを構築し、usage.prompt_tokens、usage.completion_tokens、usage.prompt_cache_hit_tokensに対してアサーションを追加します。ステップごとの応答時間を記録し、実行が識別できるように環境名をヘッダーに付与するプリリクエストスクリプトを追加します。
  5. 環境ごとに一度実行し、その後差分を比較する。 v4-pro環境でシナリオを実行し、次にv41-flash環境で実行します。完了トークン数(再ルーティングによって出力の請求額が変わります)、ステップごとのレイテンシ、そしてフォーマットのずれがないかコンテンツ自体を比較します。
  6. 14日にCIで再実行する。 切り替え時にパイプラインでapidog-cliを使用して同じシナリオを実行します。再ルーティングによって何か問題が発生した場合、サポートチケットではなく失敗したアサーションとして表示されます。

スクリプトでの同じ比較は以下の通りです。

import os, time
from openai import OpenAI

client = OpenAI(api_key=os.environ["DEEPSEEK_API_KEY"],
                base_url="https://api.deepseek.com")

prompt = "Make payment retries in the checkout service idempotent. Return a unified diff."

for model in ("deepseek-v4-pro", "deepseek-flash"):
    start = time.perf_counter()
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    print(model, f"{time.perf_counter() - start:.2f}s",
          r.usage.prompt_tokens, r.usage.completion_tokens)

ピーク時とオフピーク時に実行し、出力を保存してください。Apidogをダウンロードして、差分、アサーション、実行履歴を1か所にまとめてください。

FAQ

V4.1-FlashはコーディングにおいてV4-Proよりも優れていますか? DeepSeekが報告した数値によると、はい。DeepSWE v1.1で74.2 vs 62.7、Terminal-Bench 2.1で90.6 vs 87.9です。V4世代がコーディングでClaudeとどのように比較されたかについては、DeepSeek V4 vs Claude Opus for codingをご覧ください。

9月14日にV4-Proとの統合はどうなりますか? UTC 04:00から、すべてのdeepseek-v4-proリクエストはV4.1-Flashによって提供され、Flashの料金で課金されます。あなたのコードは引き続き動作しますが、その背後のモデルが変更されます。移行ガイドに完全なチェックリストがあります。

deepseek-v4-flashをdeepseek-flashにリネームする必要がありますか? 今日のところは必要ありません。deepseek-v4-flashとdeepseek-v4-flash-vision-expは引き続きV4.1-Flashによって受け入れられ、提供されます。DeepSeekは削除日を公表していないため、次回設定を変更する際にdeepseek-flashに切り替えてください。

V4.1-FlashはV4-Proよりも高速ですか? DeepSeekはそう述べていますが、具体的な数値は公表していません。アーキテクチャはその主張を裏付けています。プリフィルに80億のアクティブパラメータを使用し、KVキャッシュはV4-Flashの4分の1のサイズです。ご自身で測定してください。

V4-Proをどこかでまだ実行できますか? 14日以降はDeepSeekのAPIでは実行できません。V4世代の背景については、DeepSeek V4とは何かをご覧ください。V4.1-Flashの重みはMITライセンスでHugging Faceにあります。

まとめ

V4.1-Flashは、ベンダーの表によれば、より小型で、より安価で、同時に高スコアです。しかし、その表だけではあなたのプロンプトにとってそれが優れているかどうかはわかりません。今週中にApidogで同じプロンプトセットを両方のモデルIDで実行し、差分を保存しておけば、9月14日に何が変わるかをユーザーが知る前に知ることができます。

ボタン

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる