DeepSeek gab den Nutzern von deepseek-v4-pro vier Tage Zeit. Am 14. September 2026 um 04:00 UTC (12:00 Peking) wird jede Anfrage, die deepseek-v4-pro benennt, an DeepSeek-V4.1-Flash weitergeleitet und zu V4.1-Flash-Tarifen abgerechnet. Es treten keine Fehler auf. Es gibt keine Warnungen. Ihre Rechnung wird niedriger, und ein anderes Modell beginnt, Ihre Prompts zu beantworten.
Dieser letzte Teil ist der, für den Sie planen müssen. Die Versionshinweise stellen die Änderung als Upgrade dar, und nach DeepSeeks eigenen Zahlen ist es auch so. Aber „stillschweigend umgeleitet“ ist nicht dasselbe wie „getestet“. Wenn Ihr Produkt von einer bestimmten Tool-Call-Struktur oder einem Latenzbudget abhängt, das Sie für V4-Pro optimiert haben, möchten Sie wissen, welche Änderungen es gibt, bevor der Sonntag kommt, nicht danach.
Dieser Leitfaden behandelt, was DeepSeek angekündigt hat, was passiert, wenn Sie nichts tun, eine Migrations-Checkliste und eine Möglichkeit, eine Pro- versus Flash-Regressions-Suite in Apidog zu erstellen, damit die Umstellung ein Nicht-Ereignis wird. Für das Modell selbst lesen Sie zuerst was DeepSeek-V4.1-Flash ist.
TL;DR
- Umstellung: 14. September 2026, 04:00 UTC. Anfragen an
deepseek-v4-prowerden ab diesem Zeitpunkt an V4.1-Flash weitergeleitet. - Ihre Aufrufe werden nicht fehlschlagen, und Sie werden keine Pro-Preise zahlen. Der maximale Preis für Cache-Miss-Eingaben sinkt von 1,32 $ auf 0,30 $ pro 1 Mio. Tokens (77 % weniger); die Ausgabe sinkt von 3,96 $ auf 1,20 $ (70 % weniger).
- Benennen Sie die Modell-ID selbst in
deepseek-flashum, und testen Sie dann Funktion aufrufen, strukturierte Ausgabe, Streaming und Denkaufwand erneut. - DeepSeek sagt, dass V4.1-Flash V4-Pro bei jedem gelisteten Benchmark übertrifft. Dies sind Herstellerzahlen. Führen Sie Ihre eigenen Evaluierungen durch.
Was DeepSeek am 10. September angekündigt hat
Der Eintrag im Changelog vom 10. September behandelt zwei Dinge: V4.1-Flash wird GA (General Availability) auf der API und V4-Pro wird vier Tage später eingestellt.

Bezüglich V4-Pro ist die Formulierung direkt. DeepSeek sagt, dass V4.1-Flash „V4 Pro in Leistung, Kosten, Geschwindigkeit und Gesamtzeit umfassend übertroffen hat“, und verweist auf „Tests durch mehrere Parteien“. Ab dem 14. September um 04:00 UTC werden Anfragen an deepseek-v4-pro von V4.1-Flash bedient und zu V4.1-Flash-Preisen abgerechnet. Es gibt keine Übergangsfrist, in der Pro unter einem älteren Namen weiterläuft.
Die Namensbereinigung reicht über Pro hinaus:
| Modellname | Status nach dem 10. September |
|---|---|
deepseek-flash |
Neue kanonische ID für V4.1-Flash |
deepseek-v4-flash |
Weiterhin akzeptiert, bedient von V4.1-Flash |
deepseek-v4-flash-vision-exp |
Weiterhin akzeptiert, bedient von V4.1-Flash |
deepseek-v4-pro |
Bedient von V4-Pro bis 14. September 04:00 UTC, dann an V4.1-Flash umgeleitet |
V4-Flash und V4-Flash-Vision-Exp als Modelle werden eingestellt; nur ihre Namen leben als Aliase weiter. Die Basis-URLs ändern sich nicht: https://api.deepseek.com für das OpenAI-kompatible Format und https://api.deepseek.com/anthropic für das Anthropic-kompatible Format. Die Anleitung für die V4.1-Flash API behandelt die neue Modell-ID, die Denksteuerung und die Bildeingabe im Detail.
Was passiert, wenn Sie nichts tun
Kurzversion: Ihre Integration funktioniert weiterhin und wird günstiger. Längere Version: Fünf Dinge ändern sich für Sie.
Ein anderes Modell antwortet. V4.1-Flash ist ein MoE mit 552 Mrd. Parametern und einem neuen kausalen Encoder-Decoder-Layout: 40 Schichten, 20 Encoder und 20 Decoder, 8 Mrd. aktive Parameter während des Prefill und 16 Mrd. während des Decode. Ihre Prompts treffen nun auf ein anderes aktives Parameterbudget und ein anderes Aufmerksamkeitsdesign (Compressed Sparse Attention 2). Erwarten Sie eine andere Formulierung, eine andere Standardausführlichkeit und gelegentlich andere Entscheidungen bei grenzwertigen Tool-Calls.
Die Obergrenze der Ausgabe ist gleich, die empfohlenen Einstellungen nicht. Beide Modelle listen 1 Mio. Kontext und 384K maximale Ausgabe auf. Die V4.1-Flash-Modellkarte empfiehlt eine Temperatur von 1.0, top_p von 0.95 oder 1.0 und maximale Tokens von 256K oder mehr. Wenn Sie bei V4-Pro ein enges max_tokens gesetzt haben, um Kosten zu begrenzen, prüfen Sie, ob die Denk-Ausgabe jetzt abgeschnitten wird, bevor die Antwort eintrifft.
Denkaufwand funktioniert auf einer anderen Skala. DeepSeek beschreibt den Denkaufwand von V4.1-Flash als „kontinuierlich steuerbar“ auf einer Skala von 1 bis 100. V4-Flash akzeptierte reasoning_effort plus extra_body={"thinking": {"type": "enabled"}}. Wie die Skala von 1 bis 100 auf den API-Parameter abgebildet wird, ist mit der aktuellen Dokumentation zu [VERIFIZIEREN]; gehen Sie nicht davon aus, dass ein benannter Level wie "high" dieselbe Tiefe bedeutet wie bei Pro.
Die Preisgestaltung ändert sich zu Ihren Gunsten, mit einem Spitzenzeitfenster. Spitzenzeiten sind Montag bis Freitag, 01:00 bis 04:00 und 06:00 bis 10:00 UTC. Außerhalb der Spitzenzeiten ist der Preis die Hälfte des Spitzenpreises. Umgeleiteter Pro-Verkehr zahlt Flash-Tarife in beiden Zeitfenstern.
Die Parallelitätskapazität steigt erheblich. Das Limit von V4-Pro betrug 500 gleichzeitige Anfragen. Das von Flash beträgt 2.500. Umgeleiteter Verkehr erbt das höhere Limit, überprüfen Sie daher jedes clientseitige Backoff, das auf 500 abgestimmt war.
Migrations-Checkliste
Führen Sie diese Schritte der Reihe nach aus. Zusammen verwandeln sie eine stillschweigende Umleitung in eine bewusste Freigabe.
- Benennen Sie die Modell-ID um. Suchen Sie in Ihrer Codebasis und Konfiguration nach
deepseek-v4-pround ersetzen Sie es durchdeepseek-flash. Tun Sie dies, auch wenn der Alias weiterhin funktioniert: Explizite IDs erleichtern das spätere Lesen von Vorfällen.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash", # war "deepseek-v4-pro"
messages=[
{"role": "system", "content": "Sie bearbeiten Support-Tickets. Geben Sie ein JSON-Objekt mit Priorität, Team und Zusammenfassung zurück."},
{"role": "user", "content": "Kunde meldet, dass der Checkout nach Anwendung eines Rabattcodes 502 zurückgibt."},
],
response_format={"type": "json_object"},
)
print(response.choices[0].message.content)
- Überprüfen Sie die Einstellungen für den Denkaufwand. Listen Sie jede Stelle auf, an der Sie
reasoning_effortoder einen Denk-Schalter gesetzt haben. Entscheiden Sie pro Endpunkt, ob Sie Tiefe oder Latenz wünschen, und testen Sie dann jeden gegen die neue Skala, anstatt den alten Wert zu übernehmen. - Führen Sie Funktion aufrufen- und strukturierte Ausgabe-Tests erneut aus. Die Formatierung von Tool-Call-Argumenten ist der Punkt, an dem Modellwechsel am stärksten zu Buche schlagen. Wenn Sie Tests geschrieben haben, als Sie Funktion aufrufen auf V4-Pro eingerichtet haben, führen Sie diese jetzt gegen
deepseek-flashaus. Falls nicht, bietet Ihnen der untenstehende Apidog-Workflow einen Satz. - Überprüfen Sie Ihre Streaming-Parser. V4.1-Flash streamt Denk-Deltas und Antwort-Deltas im Denkmodus separat. Bestätigen Sie, dass Ihr SSE-Handler diese nicht verkettet und dass Ihr „erster Token“-Timer das misst, was Sie glauben.
- Baselinie für Latenz und Kosten neu festlegen. Erfassen Sie diese Woche die p50- und p95-Latenz sowie Tokens pro Anfrage für V4-Pro und dann dasselbe für
deepseek-flash. Sie werden beide Zahlen benötigen, wenn jemand fragt, warum sich das Dashboard am Montag geändert hat. - Dashboards und Budgets aktualisieren. Kostenwarnungen, die auf eine Ausgabe von 3,96 $ in der Spitze kalibriert sind, verstummen, sobald Sie 1,20 $ zahlen, und ein Budget, das nie ausgelöst wird, wird von niemandem beachtet. Setzen Sie die Schwellenwerte auf die Tarife auf der Preisseite zurück und korrigieren Sie jede modellbezogene Aufschlüsselung, die nach der alten ID filtert.
Wenn Sie die Anthropic-kompatiblen oder Responses API-Formate anstelle von Chat-Completions aufrufen, gelten die gleichen Schritte; der Vergleich der V4-Pro API-Formate zeigt, wie jede Anfrage aussieht, sodass Sie die Felder zuordnen können.
V4-Pro vs V4.1-Flash auf einen Blick
Benchmark-Zahlen sind von DeepSeek gemeldet, aus der V4.1-Flash-Modellkarte. Die Preise sind in USD pro 1 Mio. Tokens, gültig ab 10. September 2026.
| deepseek-v4-pro | deepseek-flash (V4.1) | |
|---|---|---|
| Aktive Parameter | Nicht auf der V4.1-Karte neu angegeben | 8B Prefill / 16B Decode |
| HumanEval | 76.8 | 79.4 |
| GSM8K | 92.6 | 93.0 |
| DeepSWE v1.1 | 62.7 | 74.2 |
| Terminal-Bench 2.1 | 87.9 | 90.6 |
| Eingabe, Cache-Hit (Nebenspitzenzeit / Spitzenzeit) | $0.022 / $0.044 | $0.003 / $0.006 |
| Eingabe, Cache-Miss (Nebenspitzenzeit / Spitzenzeit) | $0.66 / $1.32 | $0.15 / $0.30 |
| Ausgabe (Nebenspitzenzeit / Spitzenzeit) | $1.98 / $3.96 | $0.60 / $1.20 |
| Kontext / maximale Ausgabe | 1M / 384K | 1M / 384K |
| Parallelitätslimit | 500 | 2,500 |
Die größte Lücke besteht bei DeepSWE, mit einem Plus von 11,5 Punkten. Die kleinste bei GSM8K, mit einem Plus von 0,4. Wenn Ihre Arbeitslast wie Grundschulmathematik aussieht, erwarten Sie Gleichstand; wenn sie wie Codebearbeitungen mehrerer Dateien aussieht, sagen DeepSeeks Zahlen, dass Sie gewinnen. Die dreifache Aufschlüsselung, einschließlich V4-Flash, finden Sie unter V4.1-Flash vs V4-Pro vs V4-Flash.
Das Risiko: Anbieter-Benchmarks messen Anbieter-Aufgaben
Jede Zahl in dieser Tabelle stammt von DeepSeek. „Tests durch mehrere Parteien“ ist DeepSeeks Formulierung, und die Parteien werden in den Versionshinweisen nicht genannt. Das macht die Zahlen nicht falsch. Es bedeutet, dass sie auf Benchmark-Suiten gemessen wurden, nicht auf Ihren Prompts, Ihren Tool-Schemas oder den unsauberen Eingaben Ihrer Benutzer.
Ein Modell kann auf Terminal-Bench höher abschneiden und trotzdem die Formatierung eines Tool-Call-Arguments ändern, von dem Ihr Parser abhängt. Günstigere Ausgabe-Tokens helfen nicht, wenn das Modell doppelt so viele schreibt. Die einzige Möglichkeit, dies herauszufinden, besteht darin, Ihren eigenen Datenverkehr durch beide Modelle laufen zu lassen, solange beide existieren. Sie haben bis zum 14. September Zeit.
Erstellen Sie eine Regressions-Suite in Apidog vor der Umstellung
Hier ist ein Workflow in Apidog, der Ihnen einen wiederholbaren Pro- versus Flash-Vergleich ermöglicht und den Lauf an CI übergibt.
- Importieren Sie Ihre bestehenden V4-Pro-Anfragen. Importieren Sie eine OpenAI-kompatible OpenAPI-Spezifikation oder fügen Sie die Curl-Befehle ein, die Sie in der Produktion verwenden. Legen Sie
DEEPSEEK_API_KEYin einer Umgebung ab und referenzieren Sie es alsBearer {{DEEPSEEK_API_KEY}}im Authorization-Header. Fügen Sie eine zweite Variable hinzu,{{MODEL_ID}}, gesetzt aufdeepseek-v4-pro. - Duplizieren Sie jede Anfrage mit
deepseek-flash. Setzen Sie{{MODEL_ID}}in einer zweiten Umgebung aufdeepseek-flash, oder hardcoden Sie die beiden IDs in gepaarten Anfragen. Dieselben Prompts, dasselbe Tools-Array, dieselbenmax_tokens. Der einzige Unterschied sollte das Modell sein. - Fügen Sie Assertions für JSON-Struktur und Tool-Call-Struktur hinzu. Für strukturierte Ausgaben bestätigen Sie, dass
choices[0].message.contentals JSON geparst wird und die von Ihnen erwarteten Schlüssel enthält. Für Funktion aufrufen bestätigen Sie, dasschoices[0].message.tool_calls[0].function.namedem von Ihnen erwarteten Tool entspricht und dassargumentsgeparst wird. Diese Prüfungen fangen eine stillschweigende Formatverschiebung ab. - Führen Sie beide als ein Testszenario aus. Verketten Sie die Pro- und Flash-Anfragen zu einem einzigen Szenario, sodass jeder Lauf einen Bericht erstellt. Fügen Sie eine Streaming-Anfrage mit
stream: truehinzu; Apidog rendert SSE-Ereignisse einzeln, sodass Sie sehen können, ob Denk- und Antwort-Deltas so ankommen, wie Ihr Parser es erwartet. - Vergleichen Sie die Ergebnisse. Vergleichen Sie die beiden Hälften des Berichts: Assertions-Erfolgsrate, Antwortzeit und
usage.completion_tokens. Ein Modell, das jede Assertion besteht, aber 40 % mehr Ausgabe-Tokens emittiert, ändert Ihre Kostenkalkulation, und Sie werden es sehen, bevor die Rechnung kommt. - Planen Sie es in CI mit
apidog-cliein. Führen Sie das Szenario täglich bis zum 14. September aus Ihrer Pipeline aus und lassen Sie es danach weiterlaufen. Sobald Pro verschwunden ist, liefert die Pro-Hälfte ebenfalls Flash-Antworten und der Unterschied schrumpft auf Null: Bestätigung, dass die Umstellung erfolgt ist und Ihre Assertions weiterhin gültig sind.
Laden Sie Apidog herunter, um dies einzurichten. Der Workflow befindet sich in einem gemeinsamen Projekt, sodass der Rechnungsbesitzer und der Prompt-Besitzer denselben Bericht lesen.
FAQ
Werden meine V4-Pro-Aufrufe am 14. September fehlschlagen? Nein. Anfragen, die deepseek-v4-pro angeben, werden an V4.1-Flash umgeleitet. Sie erhalten eine 200-Antwort und eine V4.1-Flash-Antwort. Der Fehlerfall ist verhaltensbedingt, kein Fehlercode.
Werden mir nach der Umstellung V4-Pro-Preise berechnet? Nein. Umgeleitete Anfragen werden zu V4.1-Flash-Tarifen abgerechnet: in Spitzenzeiten 0,30 $ anstelle von 1,32 $ pro 1 Mio. Cache-Miss-Eingabe-Tokens und 1,20 $ anstelle von 3,96 $ pro 1 Mio. Ausgabe-Tokens.
Soll ich die ID in deepseek-flash umbenennen oder deepseek-v4-pro beibehalten? Umbenennen. Der Alias funktioniert, aber eine explizite ID bedeutet, dass Ihre Protokolle, Dashboards und Kostenberichte genau angeben, was aufgerufen wird.
Gilt die V4-Pro-0813-Einrichtung weiterhin? Der Schlüssel, die Basis-URL und die Anforderungsstruktur aus der V4-Pro-0813 API-Anleitung bleiben unverändert. Was sich ändert, ist das dahinterliegende Modell und die Steuerung des Denkaufwands, testen Sie also neu, anstatt Annahmen zu treffen.
Ist V4.1-Flash in irgendeiner Hinsicht schlechter als V4-Pro? DeepSeeks veröffentlichte Benchmarks zeigen Verbesserungen bei jeder gelisteten Aufgabe. Unabhängige Ergebnisse waren zum Zeitpunkt der Veröffentlichung nicht verfügbar. Behandeln Sie „in nichts schlechter“ als eine Behauptung, die es zu testen gilt.
Vier Tage sind genug
Die Migration ist eine Zeichenkettenänderung plus ein Testlauf. Die Zeichenkettenänderung dauert eine Minute. Der Testlauf verrät Ihnen, ob sich das Modell, für das Sie nächste Woche bezahlen, so verhält wie das, um das Sie Ihr System herum entwickelt haben. Erstellen Sie die Suite, führen Sie sie aus, während deepseek-v4-pro noch auf Pro auflöst, und lesen Sie den Unterschied. Wenn alles in Ordnung ist, erhalten Sie eine um 70 % günstigere Rechnung und das Fünffache der Parallelität kostenlos. Wenn nicht, haben Sie es nach Ihrem Zeitplan herausgefunden, nicht nach dem von DeepSeek.
