DeepSeek hat sein Flaggschiff mit seinem kleinsten Modell in den Ruhestand geschickt. Am 10. September 2026 wurde DeepSeek-V4.1-Flash allgemein über die API verfügbar (GA), und der Versionshinweis enthält eine Zeile, die die meisten Labore verbergen würden: ab dem 14. September wird jede Anfrage an deepseek-v4-pro an V4.1-Flash weitergeleitet und zu Flash-Preisen abgerechnet. Das 552B-Parameter-Flash-Modell, mit 8B aktiven Parametern bei der Eingabe, ist nun für die gesamte V4-Familie zuständig.
Das ist die Geschichte hinter den „deepseek v4.1 flash“-Suchen dieser Woche, und sie ist aus zwei Gründen wichtig. Erstens ist die Architektur neu. Eine kausale Encoder-Decoder-Aufteilung, FP4 KV-Caching mit 890 Bytes pro Token und native Vision ab dem ersten Vortrainingsschritt sind keine inkrementellen Änderungen an DeepSeek V4. Zweitens hat sich die Preisliste damit geändert. Wenn Sie V4-Pro-Tarife bezahlt haben, sinkt Ihre Rechnung am 14. um 70 % oder mehr, unabhängig davon, ob Sie etwas ändern oder nicht.
Dieser Leitfaden behandelt, was ausgeliefert wurde, wie die Architektur aus Entwicklersicht funktioniert, was die Anbieter-Benchmarks aussagen und die Preisberechnung. Er schließt mit einem Workflow zum Testen des Modells mit Ihren eigenen Prompts in Apidog ab, denn eine Benchmark-Tabelle ist ein Ausgangspunkt, kein Urteil.
TL;DR
- DeepSeek-V4.1-Flash ist seit dem 10. September 2026 allgemein verfügbar (GA). Modell-ID:
deepseek-flash. Basis-URL unverändert unterhttps://api.deepseek.com. - 552B MoE (763B mit dem Vision-Encoder), 8B aktiv für Prefill, 16B aktiv für Decode. 1M Kontext, 384K maximale Ausgabe.
- Nach DeepSeeks eigenen Zahlen übertrifft es V4-Pro bei HumanEval, GSM8K, DeepSWE und Terminal-Bench.
- Spitzenpreise: $0,30 pro 1M Cache-Fehler-Eingabe, $1,20 pro 1M Ausgabe. Nebenzeiten sind die Hälfte davon.
- V4-Pro-Anfragen werden am 14. September um 04:00 UTC auf V4.1-Flash umgeleitet.
Was am 10. September ausgeliefert wurde
DeepSeek führte vom 8. September an eine zweitägige interne Beta unter dem Modellnamen deepseek-v4.1-flash-expires-on-0910 durch, begrenzt auf 20 gleichzeitige Anfragen pro Konto und zum selben Preis wie deepseek-v4-flash. TechNode berichtete über diese Beta. Zwei Tage später wurde das Modell allgemein verfügbar (GA), mit einem Änderungsprotokoll-Eintrag vom 10.09.2026 und einer Ankündigung auf X.
Drei Namensänderungen sind für Ihren Code relevant:
- Die neue Modell-ID ist
deepseek-flash. Verwenden Sie sie für neue Integrationen. - Die älteren Namen
deepseek-v4-flashunddeepseek-v4-flash-vision-expfunktionieren weiterhin, werden aber von V4.1-Flash bedient. V4-Flash und V4-Flash-Vision-Exp sind als separate Modelle außer Dienst gestellt. deepseek-v4-profunktioniert bis zum 14. September, leitet dann aber auf V4.1-Flash um.
Die Basis-URLs haben sich nicht geändert: https://api.deepseek.com für das OpenAI-Format, https://api.deepseek.com/anthropic für das Anthropic-Format. Die Responses API wurde bereits in der Flash-Linie unterstützt, sodass Codex-ähnliche Integrationen übernommen werden. Für Parameterdetails, einschließlich Bildeingabe und Schlussfolgerungsaufwand, siehe wie man die DeepSeek-V4.1-Flash API verwendet.
Die kausale Encoder-Decoder-Architektur für Entwickler
Die Modellkarte beschreibt ein Design, das DeepSeek als Causal Encoder-Decoder, oder CED, bezeichnet. Hier erfahren Sie, was jede Zahl bedeutet, wenn Sie für Tokens bezahlen.
552B Parameter, 763B mit Vision. Das Sprach-Backbone ist ein 552B-Parameter Mixture-of-Experts-Modell. Fügt man den DeepSeek-ViT-Encoder hinzu, der für diese Veröffentlichung von Grund auf neu trainiert wurde, erreicht das vollständige Modell 763B. Dies sind gespeicherte Parameter, nicht die Kosten einer Anfrage.
8B aktiv für Prefill, 16B aktiv für Decode. Dies ist die wichtigste Änderung. Die 40 Schichten teilen sich in 20 Encoder- und 20 Decoder-Schichten auf. Das Lesen Ihres Prompts (Prefill) aktiviert etwa 8B Parameter pro Token. Das Schreiben der Antwort (Decode) aktiviert etwa 16B. Frühere DeepSeek MoE-Modelle verwendeten ein aktives Parameterbudget für beide Phasen.
Warum ist diese Aufteilung wichtig? Prefill ist rechenintensiv: Sie schieben ein 200K-Token-Dokument in einem Durchgang durch das Modell. Decode ist speicherintensiv: Sie generieren ein Token nach dem anderen, und die Kosten entstehen durch das Lesen von Gewichten und KV-Cache aus dem HBM. Weniger Parameter beim Prefill verkürzen die Time-to-First-Token bei langen Eingaben. Mehr Decode-Parameter verbessern die Antwortqualität, wo zusätzliche Rechenleistung im Verhältnis zum Speicherverkehr günstig ist. Ein 1M-Kontext-Agenten-Trace, der eine 2K-Token-Antwort erzeugt, nimmt den günstigen Pfad für 99,8 % seiner Tokens.
384 geleitete Experten plus 1 gemeinsam genutzter Experte pro Schicht. Der Router wählt einige der 384 Experten pro Token aus, und der gemeinsam genutzte Experte läuft jedes Mal. So werden aus 552B gespeicherten Parametern 8B oder 16B aktive Parameter.
CSA2 und der FP4 KV-Cache. Compressed Sparse Attention 2 wird mit drei statischen Aufmerksamkeitsmodi ausgeliefert. Kombiniert mit FP4-Speicher für den Haupt-KV-Cache beträgt der globale Cache-Speicherbedarf 890 Bytes pro Token, etwa ein Viertel von DeepSeek-V4-Flash. Der Versionshinweis gibt an, dass es 1/4 des HBM- und 1/8 des SSD-Speichers der vorherigen Generation benötigt. Bei 890 Bytes pro Token benötigt ein vollständiger 1M-Token-Kontext etwa 0,9 GB KV-Cache. Das ist ein Grund, warum die Parallelitätsgrenze bei 2.500 für Flash gegenüber 500 für Pro liegt.
1M Kontext, 384K Ausgabe. Die Sparse Attention wurde bei 64K trainiert und bei der 34T-Token-Marke eines 45T-Token multimodalen Korpus auf 1M erweitert. Der Schlussfolgerungsaufwand wird als stufenlos steuerbar auf einer Skala von 1 bis 100 beschrieben; die genaue API-Parameterform für diese Skala ist [ÜBERPRÜFEN] anhand der Dokumentation.
Benchmarks: Was DeepSeek berichtet
Jede Zahl in diesem Abschnitt wurde von DeepSeek aus der Modellkarte berichtet. Bis zum 10. September war keine unabhängige Bewertung veröffentlicht worden. Lesen Sie sie als Anspruch des Anbieters und führen Sie dann Ihre eigenen aus.

Das Muster ist konsistent: V4.1-Flash liegt in jeder Zeile über V4-Pro, mit dem größten Abstand beim agentischen Coding. DeepSWE springt 11,5 Punkte über Pro und fast 20 über das alte Flash. GSM8K ist gesättigt, sodass der Vorsprung von 0,4 Punkten wenig aussagt.
Vision-Werte, ebenfalls vom Anbieter berichtet: MMMU-Pro 56.5, CVBench 77.9, DocVQA 95.6, RefCOCO 86.0. DocVQA ist die Zahl, die man im Auge behalten sollte, da die Dokumentenanalyse den Großteil des produktiven Vision-Traffics ausmacht.
DeepSeeks Begründung für die V4-Pro-Umleitung ist, dass V4.1-Flash „V4 Pro in Leistung, Kosten, Geschwindigkeit und Gesamtzeit umfassend übertroffen hat“, unter Berufung auf Tests mehrerer Parteien. Die Parteien werden nicht genannt. Betrachten Sie diesen Satz als eine Behauptung, die Sie überprüfen können.
Preise und die V4-Pro-Umleitung
Die unten aufgeführten Tarife stammen von der Preisseite und gelten ab dem 10. September um 04:00 UTC in USD pro 1M Tokens.
| deepseek-flash Nebenzeiten | deepseek-flash Stoßzeiten | deepseek-v4-pro Nebenzeiten | deepseek-v4-pro Stoßzeiten | |
|---|---|---|---|---|
| Eingabe, Cache-Treffer | $0.003 | $0.006 | $0.022 | $0.044 |
| Eingabe, Cache-Fehler | $0.15 | $0.30 | $0.66 | $1.32 |
| Ausgabe | $0.60 | $1.20 | $1.98 | $3.96 |
Die Stoßzeiten sind werktags von 01:00 bis 04:00 und von 06:00 bis 10:00 UTC; Nebenzeiten sind 50% der Stoßzeiten. Kontext-Caching ist automatisch, und ein Cache-Treffer kostet 50-mal weniger als ein Fehl-Cache auf jeder Stufe.
Im Vergleich zu den August-Tarifen von V4-Flash reduziert V4.1-Flash die Cache-Treffer-Eingabe um etwa 57%, die Cache-Fehler-Eingabe um etwa 32% und die Ausgabe um etwa 9%.
Die V4-Pro-Spalte ist diejenige, die man beachten sollte. Nach dem 14. September wird eine an deepseek-v4-pro gesendete Anfrage gemäß der Flash-Spalte abgerechnet. In Stoßzeiten sind das $0,30 statt $1,32 pro 1M Cache-Fehler-Eingabe (77% weniger) und $1,20 statt $3,96 pro 1M Ausgabe (70% weniger). Sie erhalten die Reduzierung, ohne Code zu ändern, obwohl Sie die Modell-ID ohnehin aktualisieren sollten, anstatt sich auf einen eingestellten Alias zu verlassen. Der Migrationsleitfaden führt durch die Checkliste, und der detaillierte Preiseinblick behandelt die Cache-Treffer-Berechnung für lange Agenten-Sitzungen.
V4.1-Flash mit Ihren eigenen Prompts in Apidog evaluieren
Die Anbietertabelle besagt, dass das Modell gut in DeepSWE ist. Sie sagt nicht aus, ob es Ihr Extraktionsschema, Ihr Tool-Call-Format oder Ihre 300K-Token-Support-Transkripte verarbeitet. Hier ist ein Workflow in Apidog, der diese Fragen an einem Nachmittag beantwortet und dies auch nach jedem stillen Modellupdate weiterhin tut.
- Speichern Sie den Schlüssel als Umgebungsvariable. Erstellen Sie eine Apidog-Umgebung und fügen Sie
DEEPSEEK_API_KEYvon der DeepSeek-Plattform hinzu. Referenzieren Sie ihn im Authorization-Header alsBearer {{DEEPSEEK_API_KEY}}. - Fügen Sie den Endpunkt hinzu. Erstellen Sie
POST https://api.deepseek.com/chat/completions, oder importieren Sie eine OpenAPI-Spezifikation. - Speichern Sie eine Anfrage pro echtem Prompt. Nehmen Sie fünf bis zehn Prompts aus den Produktionsprotokollen und speichern Sie jeden als eigene Anfrage mit
"model": "deepseek-flash". Behalten Sie bis zum 14. eine Kopie bei, die aufdeepseek-v4-prozeigt, damit Sie die Ausgaben nebeneinander vergleichen können. - Streamen Sie und beobachten Sie die Ereignisse. Setzen Sie
"stream": true. Apidog rendert SSE-Antworten Ereignis für Ereignis, sodass Schlussfolgerungs-Deltas und Antwort-Deltas separat angezeigt werden, anstatt als eine Wand vondata:Zeilen. Dies ist der schnellste Weg, um die Time-to-First-Token bei einem langen Prefill zu sehen. - Fügen Sie Assertions hinzu und erstellen Sie ein Testszenario. Führen Sie Assertions für den Statuscode, für ein
tool_calls-Feld, wo Sie eines erwarten, und für die JSON-Gültigkeit der Ausgabe durch. Verketten Sie die gespeicherten Anfragen zu einem Testszenario. - Bei jedem Modellupdate erneut ausführen. Wenn DeepSeek die nächste Änderung hinter
deepseek-flashveröffentlicht, führen Sie das Szenario aus. Integrieren Sie es mitapidog-cliin Ihre CI, damit es bei jedem Deployment ausgeführt wird.
Hier ist der Body für einen dieser gespeicherten Prompts, unter Verwendung des OpenAI SDK:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "system", "content": "Extract the order ID, SKU list, and refund amount as JSON."},
{"role": "user", "content": "Ticket #48213: customer wants a refund of $42.90 for SKUs KB-220 and MS-114 from order ORD-99117."},
],
stream=True,
)
for chunk in response:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Laden Sie Apidog herunter und fügen Sie diesen Body in eine gespeicherte Anfrage ein. Apidog testet die API-Schicht, nicht einen Modell-Host, sodass das, was Sie sehen, die Antwort ist, die Ihre Benutzer erhalten werden.
FAQ
- Ist DeepSeek-V4.1-Flash ein Ersatz für V4-Pro? Ja, nach DeepSeeks Entscheidung. Ab dem 14. September um 04:00 UTC werden Anfragen an
deepseek-v4-provon V4.1-Flash zu Flash-Preisen bedient. Es gibt kein größeres Modell mehr in der V4-API-Produktpalette. - Muss ich meine Modell-ID ändern? Nicht sofort.
deepseek-v4-flash,deepseek-v4-flash-vision-expund (nach dem 14.)deepseek-v4-prolösen alle zu V4.1-Flash auf. Wechseln Sie zudeepseek-flash, wenn Sie das nächste Mal die Integration anfassen. Der API-Leitfaden enthält die vollständige Parameterreferenz. - Was bedeuten 8B Prefill / 16B Decode für die Latenz? Weniger aktive Parameter bei der Eingabe bedeuten eine schnellere Time-to-First-Token bei langen Prompts. Mehr bei der Ausgabe bedeutet, dass die Rechenleistung dorthin fließt, wo die Generierungsqualität entschieden wird. Der 890 Byte pro Token KV-Cache hält lange Sitzungen kostengünstig im Speicher.
- Kann ich es lokal ausführen? Die Gewichte sind MIT-lizenziert auf Hugging Face. Das Backbone allein beträgt etwa 552 GB bei 8-Bit oder 280 GB bei 4-Bit, daher ist dies ein Multi-GPU- oder SSD-Streaming-Projekt, kein Laptop-Projekt. Die Unterstützung für Inferenz-Engines am ersten Tag ist [ÜBERPRÜFEN].
- Sind die Benchmarks unabhängig? Nein. Jede oben genannte Punktzahl stammt aus DeepSeeks Modellkarte. Der Technologiebericht enthält die Methodik.
Wo dies die V4-Linie lässt
DeepSeek hat eine Zwei-Modell-API zu einer einzigen zusammengefasst. Die Wette ist, dass ein 552B-Modell mit einem 16B-Decode-Budget, einem viertelgroßen KV-Cache und 2.500 gleichzeitigen Sitzungen pro Konto Agenten-Workloads besser bedient als ein größeres Modell zum drei- bis vierfachen Preis. Die Anbieterzahlen stützen die Wette; Ihre Workload entscheidet, ob sie aufgeht.
Richten Sie Ihr SDK auf deepseek-flash aus, lassen Sie Ihre eigenen Prompts vor dem 14. darüber laufen und behalten Sie das Testszenario bei. Wenn Sie auf der ursprünglichen V4-Flash API aufgebaut haben, funktioniert Ihre Integration bereits. Was sich geändert hat, ist das dahinterliegende Modell, und das ist der Teil, der es wert ist, gemessen zu werden.
