DeepSeek V4-Pro wird am 14. September eingestellt: So migrieren Sie auf V4.1-Flash

DeepSeek stellt V4-Pro am 14. September 2026 ein und leitet Anfragen an V4.1-Flash um. Was sich ändert, eine Migrations-Checkliste und wie vor der Umstellung getestet wird.

INEZA Felin-Michel

INEZA Felin-Michel

10 September 2026

DeepSeek V4-Pro wird am 14. September eingestellt: So migrieren Sie auf V4.1-Flash

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

DeepSeek gab den Nutzern von deepseek-v4-pro vier Tage Zeit. Am 14. September 2026 um 04:00 UTC (12:00 Peking) wird jede Anfrage, die deepseek-v4-pro benennt, an DeepSeek-V4.1-Flash weitergeleitet und zu V4.1-Flash-Tarifen abgerechnet. Es treten keine Fehler auf. Es gibt keine Warnungen. Ihre Rechnung wird niedriger, und ein anderes Modell beginnt, Ihre Prompts zu beantworten.

Dieser letzte Teil ist der, für den Sie planen müssen. Die Versionshinweise stellen die Änderung als Upgrade dar, und nach DeepSeeks eigenen Zahlen ist es auch so. Aber „stillschweigend umgeleitet“ ist nicht dasselbe wie „getestet“. Wenn Ihr Produkt von einer bestimmten Tool-Call-Struktur oder einem Latenzbudget abhängt, das Sie für V4-Pro optimiert haben, möchten Sie wissen, welche Änderungen es gibt, bevor der Sonntag kommt, nicht danach.

Dieser Leitfaden behandelt, was DeepSeek angekündigt hat, was passiert, wenn Sie nichts tun, eine Migrations-Checkliste und eine Möglichkeit, eine Pro- versus Flash-Regressions-Suite in Apidog zu erstellen, damit die Umstellung ein Nicht-Ereignis wird. Für das Modell selbst lesen Sie zuerst was DeepSeek-V4.1-Flash ist.

TL;DR

Was DeepSeek am 10. September angekündigt hat

Der Eintrag im Changelog vom 10. September behandelt zwei Dinge: V4.1-Flash wird GA (General Availability) auf der API und V4-Pro wird vier Tage später eingestellt.

Bezüglich V4-Pro ist die Formulierung direkt. DeepSeek sagt, dass V4.1-Flash „V4 Pro in Leistung, Kosten, Geschwindigkeit und Gesamtzeit umfassend übertroffen hat“, und verweist auf „Tests durch mehrere Parteien“. Ab dem 14. September um 04:00 UTC werden Anfragen an deepseek-v4-pro von V4.1-Flash bedient und zu V4.1-Flash-Preisen abgerechnet. Es gibt keine Übergangsfrist, in der Pro unter einem älteren Namen weiterläuft.

Die Namensbereinigung reicht über Pro hinaus:

Modellname Status nach dem 10. September
deepseek-flash Neue kanonische ID für V4.1-Flash
deepseek-v4-flash Weiterhin akzeptiert, bedient von V4.1-Flash
deepseek-v4-flash-vision-exp Weiterhin akzeptiert, bedient von V4.1-Flash
deepseek-v4-pro Bedient von V4-Pro bis 14. September 04:00 UTC, dann an V4.1-Flash umgeleitet

V4-Flash und V4-Flash-Vision-Exp als Modelle werden eingestellt; nur ihre Namen leben als Aliase weiter. Die Basis-URLs ändern sich nicht: https://api.deepseek.com für das OpenAI-kompatible Format und https://api.deepseek.com/anthropic für das Anthropic-kompatible Format. Die Anleitung für die V4.1-Flash API behandelt die neue Modell-ID, die Denksteuerung und die Bildeingabe im Detail.

Was passiert, wenn Sie nichts tun

Kurzversion: Ihre Integration funktioniert weiterhin und wird günstiger. Längere Version: Fünf Dinge ändern sich für Sie.

Ein anderes Modell antwortet. V4.1-Flash ist ein MoE mit 552 Mrd. Parametern und einem neuen kausalen Encoder-Decoder-Layout: 40 Schichten, 20 Encoder und 20 Decoder, 8 Mrd. aktive Parameter während des Prefill und 16 Mrd. während des Decode. Ihre Prompts treffen nun auf ein anderes aktives Parameterbudget und ein anderes Aufmerksamkeitsdesign (Compressed Sparse Attention 2). Erwarten Sie eine andere Formulierung, eine andere Standardausführlichkeit und gelegentlich andere Entscheidungen bei grenzwertigen Tool-Calls.

Die Obergrenze der Ausgabe ist gleich, die empfohlenen Einstellungen nicht. Beide Modelle listen 1 Mio. Kontext und 384K maximale Ausgabe auf. Die V4.1-Flash-Modellkarte empfiehlt eine Temperatur von 1.0, top_p von 0.95 oder 1.0 und maximale Tokens von 256K oder mehr. Wenn Sie bei V4-Pro ein enges max_tokens gesetzt haben, um Kosten zu begrenzen, prüfen Sie, ob die Denk-Ausgabe jetzt abgeschnitten wird, bevor die Antwort eintrifft.

Denkaufwand funktioniert auf einer anderen Skala. DeepSeek beschreibt den Denkaufwand von V4.1-Flash als „kontinuierlich steuerbar“ auf einer Skala von 1 bis 100. V4-Flash akzeptierte reasoning_effort plus extra_body={"thinking": {"type": "enabled"}}. Wie die Skala von 1 bis 100 auf den API-Parameter abgebildet wird, ist mit der aktuellen Dokumentation zu [VERIFIZIEREN]; gehen Sie nicht davon aus, dass ein benannter Level wie "high" dieselbe Tiefe bedeutet wie bei Pro.

Die Preisgestaltung ändert sich zu Ihren Gunsten, mit einem Spitzenzeitfenster. Spitzenzeiten sind Montag bis Freitag, 01:00 bis 04:00 und 06:00 bis 10:00 UTC. Außerhalb der Spitzenzeiten ist der Preis die Hälfte des Spitzenpreises. Umgeleiteter Pro-Verkehr zahlt Flash-Tarife in beiden Zeitfenstern.

Die Parallelitätskapazität steigt erheblich. Das Limit von V4-Pro betrug 500 gleichzeitige Anfragen. Das von Flash beträgt 2.500. Umgeleiteter Verkehr erbt das höhere Limit, überprüfen Sie daher jedes clientseitige Backoff, das auf 500 abgestimmt war.

Migrations-Checkliste

Führen Sie diese Schritte der Reihe nach aus. Zusammen verwandeln sie eine stillschweigende Umleitung in eine bewusste Freigabe.

  1. Benennen Sie die Modell-ID um. Suchen Sie in Ihrer Codebasis und Konfiguration nach deepseek-v4-pro und ersetzen Sie es durch deepseek-flash. Tun Sie dies, auch wenn der Alias weiterhin funktioniert: Explizite IDs erleichtern das spätere Lesen von Vorfällen.
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",  # war "deepseek-v4-pro"
    messages=[
        {"role": "system", "content": "Sie bearbeiten Support-Tickets. Geben Sie ein JSON-Objekt mit Priorität, Team und Zusammenfassung zurück."},
        {"role": "user", "content": "Kunde meldet, dass der Checkout nach Anwendung eines Rabattcodes 502 zurückgibt."},
    ],
    response_format={"type": "json_object"},
)
print(response.choices[0].message.content)
  1. Überprüfen Sie die Einstellungen für den Denkaufwand. Listen Sie jede Stelle auf, an der Sie reasoning_effort oder einen Denk-Schalter gesetzt haben. Entscheiden Sie pro Endpunkt, ob Sie Tiefe oder Latenz wünschen, und testen Sie dann jeden gegen die neue Skala, anstatt den alten Wert zu übernehmen.
  2. Führen Sie Funktion aufrufen- und strukturierte Ausgabe-Tests erneut aus. Die Formatierung von Tool-Call-Argumenten ist der Punkt, an dem Modellwechsel am stärksten zu Buche schlagen. Wenn Sie Tests geschrieben haben, als Sie Funktion aufrufen auf V4-Pro eingerichtet haben, führen Sie diese jetzt gegen deepseek-flash aus. Falls nicht, bietet Ihnen der untenstehende Apidog-Workflow einen Satz.
  3. Überprüfen Sie Ihre Streaming-Parser. V4.1-Flash streamt Denk-Deltas und Antwort-Deltas im Denkmodus separat. Bestätigen Sie, dass Ihr SSE-Handler diese nicht verkettet und dass Ihr „erster Token“-Timer das misst, was Sie glauben.
  4. Baselinie für Latenz und Kosten neu festlegen. Erfassen Sie diese Woche die p50- und p95-Latenz sowie Tokens pro Anfrage für V4-Pro und dann dasselbe für deepseek-flash. Sie werden beide Zahlen benötigen, wenn jemand fragt, warum sich das Dashboard am Montag geändert hat.
  5. Dashboards und Budgets aktualisieren. Kostenwarnungen, die auf eine Ausgabe von 3,96 $ in der Spitze kalibriert sind, verstummen, sobald Sie 1,20 $ zahlen, und ein Budget, das nie ausgelöst wird, wird von niemandem beachtet. Setzen Sie die Schwellenwerte auf die Tarife auf der Preisseite zurück und korrigieren Sie jede modellbezogene Aufschlüsselung, die nach der alten ID filtert.

Wenn Sie die Anthropic-kompatiblen oder Responses API-Formate anstelle von Chat-Completions aufrufen, gelten die gleichen Schritte; der Vergleich der V4-Pro API-Formate zeigt, wie jede Anfrage aussieht, sodass Sie die Felder zuordnen können.

V4-Pro vs V4.1-Flash auf einen Blick

Benchmark-Zahlen sind von DeepSeek gemeldet, aus der V4.1-Flash-Modellkarte. Die Preise sind in USD pro 1 Mio. Tokens, gültig ab 10. September 2026.

deepseek-v4-pro deepseek-flash (V4.1)
Aktive Parameter Nicht auf der V4.1-Karte neu angegeben 8B Prefill / 16B Decode
HumanEval 76.8 79.4
GSM8K 92.6 93.0
DeepSWE v1.1 62.7 74.2
Terminal-Bench 2.1 87.9 90.6
Eingabe, Cache-Hit (Nebenspitzenzeit / Spitzenzeit) $0.022 / $0.044 $0.003 / $0.006
Eingabe, Cache-Miss (Nebenspitzenzeit / Spitzenzeit) $0.66 / $1.32 $0.15 / $0.30
Ausgabe (Nebenspitzenzeit / Spitzenzeit) $1.98 / $3.96 $0.60 / $1.20
Kontext / maximale Ausgabe 1M / 384K 1M / 384K
Parallelitätslimit 500 2,500

Die größte Lücke besteht bei DeepSWE, mit einem Plus von 11,5 Punkten. Die kleinste bei GSM8K, mit einem Plus von 0,4. Wenn Ihre Arbeitslast wie Grundschulmathematik aussieht, erwarten Sie Gleichstand; wenn sie wie Codebearbeitungen mehrerer Dateien aussieht, sagen DeepSeeks Zahlen, dass Sie gewinnen. Die dreifache Aufschlüsselung, einschließlich V4-Flash, finden Sie unter V4.1-Flash vs V4-Pro vs V4-Flash.

Das Risiko: Anbieter-Benchmarks messen Anbieter-Aufgaben

Jede Zahl in dieser Tabelle stammt von DeepSeek. „Tests durch mehrere Parteien“ ist DeepSeeks Formulierung, und die Parteien werden in den Versionshinweisen nicht genannt. Das macht die Zahlen nicht falsch. Es bedeutet, dass sie auf Benchmark-Suiten gemessen wurden, nicht auf Ihren Prompts, Ihren Tool-Schemas oder den unsauberen Eingaben Ihrer Benutzer.

Ein Modell kann auf Terminal-Bench höher abschneiden und trotzdem die Formatierung eines Tool-Call-Arguments ändern, von dem Ihr Parser abhängt. Günstigere Ausgabe-Tokens helfen nicht, wenn das Modell doppelt so viele schreibt. Die einzige Möglichkeit, dies herauszufinden, besteht darin, Ihren eigenen Datenverkehr durch beide Modelle laufen zu lassen, solange beide existieren. Sie haben bis zum 14. September Zeit.

Erstellen Sie eine Regressions-Suite in Apidog vor der Umstellung

Hier ist ein Workflow in Apidog, der Ihnen einen wiederholbaren Pro- versus Flash-Vergleich ermöglicht und den Lauf an CI übergibt.

  1. Importieren Sie Ihre bestehenden V4-Pro-Anfragen. Importieren Sie eine OpenAI-kompatible OpenAPI-Spezifikation oder fügen Sie die Curl-Befehle ein, die Sie in der Produktion verwenden. Legen Sie DEEPSEEK_API_KEY in einer Umgebung ab und referenzieren Sie es als Bearer {{DEEPSEEK_API_KEY}} im Authorization-Header. Fügen Sie eine zweite Variable hinzu, {{MODEL_ID}}, gesetzt auf deepseek-v4-pro.
  2. Duplizieren Sie jede Anfrage mit deepseek-flash. Setzen Sie {{MODEL_ID}} in einer zweiten Umgebung auf deepseek-flash, oder hardcoden Sie die beiden IDs in gepaarten Anfragen. Dieselben Prompts, dasselbe Tools-Array, dieselben max_tokens. Der einzige Unterschied sollte das Modell sein.
  3. Fügen Sie Assertions für JSON-Struktur und Tool-Call-Struktur hinzu. Für strukturierte Ausgaben bestätigen Sie, dass choices[0].message.content als JSON geparst wird und die von Ihnen erwarteten Schlüssel enthält. Für Funktion aufrufen bestätigen Sie, dass choices[0].message.tool_calls[0].function.name dem von Ihnen erwarteten Tool entspricht und dass arguments geparst wird. Diese Prüfungen fangen eine stillschweigende Formatverschiebung ab.
  4. Führen Sie beide als ein Testszenario aus. Verketten Sie die Pro- und Flash-Anfragen zu einem einzigen Szenario, sodass jeder Lauf einen Bericht erstellt. Fügen Sie eine Streaming-Anfrage mit stream: true hinzu; Apidog rendert SSE-Ereignisse einzeln, sodass Sie sehen können, ob Denk- und Antwort-Deltas so ankommen, wie Ihr Parser es erwartet.
  5. Vergleichen Sie die Ergebnisse. Vergleichen Sie die beiden Hälften des Berichts: Assertions-Erfolgsrate, Antwortzeit und usage.completion_tokens. Ein Modell, das jede Assertion besteht, aber 40 % mehr Ausgabe-Tokens emittiert, ändert Ihre Kostenkalkulation, und Sie werden es sehen, bevor die Rechnung kommt.
  6. Planen Sie es in CI mit apidog-cli ein. Führen Sie das Szenario täglich bis zum 14. September aus Ihrer Pipeline aus und lassen Sie es danach weiterlaufen. Sobald Pro verschwunden ist, liefert die Pro-Hälfte ebenfalls Flash-Antworten und der Unterschied schrumpft auf Null: Bestätigung, dass die Umstellung erfolgt ist und Ihre Assertions weiterhin gültig sind.

Laden Sie Apidog herunter, um dies einzurichten. Der Workflow befindet sich in einem gemeinsamen Projekt, sodass der Rechnungsbesitzer und der Prompt-Besitzer denselben Bericht lesen.

FAQ

Werden meine V4-Pro-Aufrufe am 14. September fehlschlagen? Nein. Anfragen, die deepseek-v4-pro angeben, werden an V4.1-Flash umgeleitet. Sie erhalten eine 200-Antwort und eine V4.1-Flash-Antwort. Der Fehlerfall ist verhaltensbedingt, kein Fehlercode.

Werden mir nach der Umstellung V4-Pro-Preise berechnet? Nein. Umgeleitete Anfragen werden zu V4.1-Flash-Tarifen abgerechnet: in Spitzenzeiten 0,30 $ anstelle von 1,32 $ pro 1 Mio. Cache-Miss-Eingabe-Tokens und 1,20 $ anstelle von 3,96 $ pro 1 Mio. Ausgabe-Tokens.

Soll ich die ID in deepseek-flash umbenennen oder deepseek-v4-pro beibehalten? Umbenennen. Der Alias funktioniert, aber eine explizite ID bedeutet, dass Ihre Protokolle, Dashboards und Kostenberichte genau angeben, was aufgerufen wird.

Gilt die V4-Pro-0813-Einrichtung weiterhin? Der Schlüssel, die Basis-URL und die Anforderungsstruktur aus der V4-Pro-0813 API-Anleitung bleiben unverändert. Was sich ändert, ist das dahinterliegende Modell und die Steuerung des Denkaufwands, testen Sie also neu, anstatt Annahmen zu treffen.

Ist V4.1-Flash in irgendeiner Hinsicht schlechter als V4-Pro? DeepSeeks veröffentlichte Benchmarks zeigen Verbesserungen bei jeder gelisteten Aufgabe. Unabhängige Ergebnisse waren zum Zeitpunkt der Veröffentlichung nicht verfügbar. Behandeln Sie „in nichts schlechter“ als eine Behauptung, die es zu testen gilt.

Vier Tage sind genug

Die Migration ist eine Zeichenkettenänderung plus ein Testlauf. Die Zeichenkettenänderung dauert eine Minute. Der Testlauf verrät Ihnen, ob sich das Modell, für das Sie nächste Woche bezahlen, so verhält wie das, um das Sie Ihr System herum entwickelt haben. Erstellen Sie die Suite, führen Sie sie aus, während deepseek-v4-pro noch auf Pro auflöst, und lesen Sie den Unterschied. Wenn alles in Ordnung ist, erhalten Sie eine um 70 % günstigere Rechnung und das Fünffache der Parallelität kostenlos. Wenn nicht, haben Sie es nach Ihrem Zeitplan herausgefunden, nicht nach dem von DeepSeek.

Button

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen