Was ist DeepSeek-V4.1-Flash

DeepSeek-V4.1-Flash erklärt: Kausales Encoder-Decoder-Design, 8B/16B aktive Parameter, Hersteller-Benchmarks, Preisgestaltung und warum V4-Pro am 14. September darauf umgeleitet wird.

Ashley Innocent

Ashley Innocent

10 September 2026

Was ist DeepSeek-V4.1-Flash

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

DeepSeek hat sein Flaggschiff mit seinem kleinsten Modell in den Ruhestand geschickt. Am 10. September 2026 wurde DeepSeek-V4.1-Flash allgemein über die API verfügbar (GA), und der Versionshinweis enthält eine Zeile, die die meisten Labore verbergen würden: ab dem 14. September wird jede Anfrage an deepseek-v4-pro an V4.1-Flash weitergeleitet und zu Flash-Preisen abgerechnet. Das 552B-Parameter-Flash-Modell, mit 8B aktiven Parametern bei der Eingabe, ist nun für die gesamte V4-Familie zuständig.

Das ist die Geschichte hinter den „deepseek v4.1 flash“-Suchen dieser Woche, und sie ist aus zwei Gründen wichtig. Erstens ist die Architektur neu. Eine kausale Encoder-Decoder-Aufteilung, FP4 KV-Caching mit 890 Bytes pro Token und native Vision ab dem ersten Vortrainingsschritt sind keine inkrementellen Änderungen an DeepSeek V4. Zweitens hat sich die Preisliste damit geändert. Wenn Sie V4-Pro-Tarife bezahlt haben, sinkt Ihre Rechnung am 14. um 70 % oder mehr, unabhängig davon, ob Sie etwas ändern oder nicht.

Dieser Leitfaden behandelt, was ausgeliefert wurde, wie die Architektur aus Entwicklersicht funktioniert, was die Anbieter-Benchmarks aussagen und die Preisberechnung. Er schließt mit einem Workflow zum Testen des Modells mit Ihren eigenen Prompts in Apidog ab, denn eine Benchmark-Tabelle ist ein Ausgangspunkt, kein Urteil.

TL;DR

Was am 10. September ausgeliefert wurde

DeepSeek führte vom 8. September an eine zweitägige interne Beta unter dem Modellnamen deepseek-v4.1-flash-expires-on-0910 durch, begrenzt auf 20 gleichzeitige Anfragen pro Konto und zum selben Preis wie deepseek-v4-flash. TechNode berichtete über diese Beta. Zwei Tage später wurde das Modell allgemein verfügbar (GA), mit einem Änderungsprotokoll-Eintrag vom 10.09.2026 und einer Ankündigung auf X.

Drei Namensänderungen sind für Ihren Code relevant:

Die Basis-URLs haben sich nicht geändert: https://api.deepseek.com für das OpenAI-Format, https://api.deepseek.com/anthropic für das Anthropic-Format. Die Responses API wurde bereits in der Flash-Linie unterstützt, sodass Codex-ähnliche Integrationen übernommen werden. Für Parameterdetails, einschließlich Bildeingabe und Schlussfolgerungsaufwand, siehe wie man die DeepSeek-V4.1-Flash API verwendet.

Die kausale Encoder-Decoder-Architektur für Entwickler

Die Modellkarte beschreibt ein Design, das DeepSeek als Causal Encoder-Decoder, oder CED, bezeichnet. Hier erfahren Sie, was jede Zahl bedeutet, wenn Sie für Tokens bezahlen.

552B Parameter, 763B mit Vision. Das Sprach-Backbone ist ein 552B-Parameter Mixture-of-Experts-Modell. Fügt man den DeepSeek-ViT-Encoder hinzu, der für diese Veröffentlichung von Grund auf neu trainiert wurde, erreicht das vollständige Modell 763B. Dies sind gespeicherte Parameter, nicht die Kosten einer Anfrage.

8B aktiv für Prefill, 16B aktiv für Decode. Dies ist die wichtigste Änderung. Die 40 Schichten teilen sich in 20 Encoder- und 20 Decoder-Schichten auf. Das Lesen Ihres Prompts (Prefill) aktiviert etwa 8B Parameter pro Token. Das Schreiben der Antwort (Decode) aktiviert etwa 16B. Frühere DeepSeek MoE-Modelle verwendeten ein aktives Parameterbudget für beide Phasen.

Warum ist diese Aufteilung wichtig? Prefill ist rechenintensiv: Sie schieben ein 200K-Token-Dokument in einem Durchgang durch das Modell. Decode ist speicherintensiv: Sie generieren ein Token nach dem anderen, und die Kosten entstehen durch das Lesen von Gewichten und KV-Cache aus dem HBM. Weniger Parameter beim Prefill verkürzen die Time-to-First-Token bei langen Eingaben. Mehr Decode-Parameter verbessern die Antwortqualität, wo zusätzliche Rechenleistung im Verhältnis zum Speicherverkehr günstig ist. Ein 1M-Kontext-Agenten-Trace, der eine 2K-Token-Antwort erzeugt, nimmt den günstigen Pfad für 99,8 % seiner Tokens.

384 geleitete Experten plus 1 gemeinsam genutzter Experte pro Schicht. Der Router wählt einige der 384 Experten pro Token aus, und der gemeinsam genutzte Experte läuft jedes Mal. So werden aus 552B gespeicherten Parametern 8B oder 16B aktive Parameter.

CSA2 und der FP4 KV-Cache. Compressed Sparse Attention 2 wird mit drei statischen Aufmerksamkeitsmodi ausgeliefert. Kombiniert mit FP4-Speicher für den Haupt-KV-Cache beträgt der globale Cache-Speicherbedarf 890 Bytes pro Token, etwa ein Viertel von DeepSeek-V4-Flash. Der Versionshinweis gibt an, dass es 1/4 des HBM- und 1/8 des SSD-Speichers der vorherigen Generation benötigt. Bei 890 Bytes pro Token benötigt ein vollständiger 1M-Token-Kontext etwa 0,9 GB KV-Cache. Das ist ein Grund, warum die Parallelitätsgrenze bei 2.500 für Flash gegenüber 500 für Pro liegt.

1M Kontext, 384K Ausgabe. Die Sparse Attention wurde bei 64K trainiert und bei der 34T-Token-Marke eines 45T-Token multimodalen Korpus auf 1M erweitert. Der Schlussfolgerungsaufwand wird als stufenlos steuerbar auf einer Skala von 1 bis 100 beschrieben; die genaue API-Parameterform für diese Skala ist [ÜBERPRÜFEN] anhand der Dokumentation.

Benchmarks: Was DeepSeek berichtet

Jede Zahl in diesem Abschnitt wurde von DeepSeek aus der Modellkarte berichtet. Bis zum 10. September war keine unabhängige Bewertung veröffentlicht worden. Lesen Sie sie als Anspruch des Anbieters und führen Sie dann Ihre eigenen aus.

Das Muster ist konsistent: V4.1-Flash liegt in jeder Zeile über V4-Pro, mit dem größten Abstand beim agentischen Coding. DeepSWE springt 11,5 Punkte über Pro und fast 20 über das alte Flash. GSM8K ist gesättigt, sodass der Vorsprung von 0,4 Punkten wenig aussagt.

Vision-Werte, ebenfalls vom Anbieter berichtet: MMMU-Pro 56.5, CVBench 77.9, DocVQA 95.6, RefCOCO 86.0. DocVQA ist die Zahl, die man im Auge behalten sollte, da die Dokumentenanalyse den Großteil des produktiven Vision-Traffics ausmacht.

DeepSeeks Begründung für die V4-Pro-Umleitung ist, dass V4.1-Flash „V4 Pro in Leistung, Kosten, Geschwindigkeit und Gesamtzeit umfassend übertroffen hat“, unter Berufung auf Tests mehrerer Parteien. Die Parteien werden nicht genannt. Betrachten Sie diesen Satz als eine Behauptung, die Sie überprüfen können.

Preise und die V4-Pro-Umleitung

Die unten aufgeführten Tarife stammen von der Preisseite und gelten ab dem 10. September um 04:00 UTC in USD pro 1M Tokens.

deepseek-flash Nebenzeiten deepseek-flash Stoßzeiten deepseek-v4-pro Nebenzeiten deepseek-v4-pro Stoßzeiten
Eingabe, Cache-Treffer $0.003 $0.006 $0.022 $0.044
Eingabe, Cache-Fehler $0.15 $0.30 $0.66 $1.32
Ausgabe $0.60 $1.20 $1.98 $3.96

Die Stoßzeiten sind werktags von 01:00 bis 04:00 und von 06:00 bis 10:00 UTC; Nebenzeiten sind 50% der Stoßzeiten. Kontext-Caching ist automatisch, und ein Cache-Treffer kostet 50-mal weniger als ein Fehl-Cache auf jeder Stufe.

Im Vergleich zu den August-Tarifen von V4-Flash reduziert V4.1-Flash die Cache-Treffer-Eingabe um etwa 57%, die Cache-Fehler-Eingabe um etwa 32% und die Ausgabe um etwa 9%.

Die V4-Pro-Spalte ist diejenige, die man beachten sollte. Nach dem 14. September wird eine an deepseek-v4-pro gesendete Anfrage gemäß der Flash-Spalte abgerechnet. In Stoßzeiten sind das $0,30 statt $1,32 pro 1M Cache-Fehler-Eingabe (77% weniger) und $1,20 statt $3,96 pro 1M Ausgabe (70% weniger). Sie erhalten die Reduzierung, ohne Code zu ändern, obwohl Sie die Modell-ID ohnehin aktualisieren sollten, anstatt sich auf einen eingestellten Alias zu verlassen. Der Migrationsleitfaden führt durch die Checkliste, und der detaillierte Preiseinblick behandelt die Cache-Treffer-Berechnung für lange Agenten-Sitzungen.

V4.1-Flash mit Ihren eigenen Prompts in Apidog evaluieren

Die Anbietertabelle besagt, dass das Modell gut in DeepSWE ist. Sie sagt nicht aus, ob es Ihr Extraktionsschema, Ihr Tool-Call-Format oder Ihre 300K-Token-Support-Transkripte verarbeitet. Hier ist ein Workflow in Apidog, der diese Fragen an einem Nachmittag beantwortet und dies auch nach jedem stillen Modellupdate weiterhin tut.

  1. Speichern Sie den Schlüssel als Umgebungsvariable. Erstellen Sie eine Apidog-Umgebung und fügen Sie DEEPSEEK_API_KEY von der DeepSeek-Plattform hinzu. Referenzieren Sie ihn im Authorization-Header als Bearer {{DEEPSEEK_API_KEY}}.
  2. Fügen Sie den Endpunkt hinzu. Erstellen Sie POST https://api.deepseek.com/chat/completions, oder importieren Sie eine OpenAPI-Spezifikation.
  3. Speichern Sie eine Anfrage pro echtem Prompt. Nehmen Sie fünf bis zehn Prompts aus den Produktionsprotokollen und speichern Sie jeden als eigene Anfrage mit "model": "deepseek-flash". Behalten Sie bis zum 14. eine Kopie bei, die auf deepseek-v4-pro zeigt, damit Sie die Ausgaben nebeneinander vergleichen können.
  4. Streamen Sie und beobachten Sie die Ereignisse. Setzen Sie "stream": true. Apidog rendert SSE-Antworten Ereignis für Ereignis, sodass Schlussfolgerungs-Deltas und Antwort-Deltas separat angezeigt werden, anstatt als eine Wand von data: Zeilen. Dies ist der schnellste Weg, um die Time-to-First-Token bei einem langen Prefill zu sehen.
  5. Fügen Sie Assertions hinzu und erstellen Sie ein Testszenario. Führen Sie Assertions für den Statuscode, für ein tool_calls-Feld, wo Sie eines erwarten, und für die JSON-Gültigkeit der Ausgabe durch. Verketten Sie die gespeicherten Anfragen zu einem Testszenario.
  6. Bei jedem Modellupdate erneut ausführen. Wenn DeepSeek die nächste Änderung hinter deepseek-flash veröffentlicht, führen Sie das Szenario aus. Integrieren Sie es mit apidog-cli in Ihre CI, damit es bei jedem Deployment ausgeführt wird.

Hier ist der Body für einen dieser gespeicherten Prompts, unter Verwendung des OpenAI SDK:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {"role": "system", "content": "Extract the order ID, SKU list, and refund amount as JSON."},
        {"role": "user", "content": "Ticket #48213: customer wants a refund of $42.90 for SKUs KB-220 and MS-114 from order ORD-99117."},
    ],
    stream=True,
)

for chunk in response:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

Laden Sie Apidog herunter und fügen Sie diesen Body in eine gespeicherte Anfrage ein. Apidog testet die API-Schicht, nicht einen Modell-Host, sodass das, was Sie sehen, die Antwort ist, die Ihre Benutzer erhalten werden.

FAQ

Wo dies die V4-Linie lässt

DeepSeek hat eine Zwei-Modell-API zu einer einzigen zusammengefasst. Die Wette ist, dass ein 552B-Modell mit einem 16B-Decode-Budget, einem viertelgroßen KV-Cache und 2.500 gleichzeitigen Sitzungen pro Konto Agenten-Workloads besser bedient als ein größeres Modell zum drei- bis vierfachen Preis. Die Anbieterzahlen stützen die Wette; Ihre Workload entscheidet, ob sie aufgeht.

Richten Sie Ihr SDK auf deepseek-flash aus, lassen Sie Ihre eigenen Prompts vor dem 14. darüber laufen und behalten Sie das Testszenario bei. Wenn Sie auf der ursprünglichen V4-Flash API aufgebaut haben, funktioniert Ihre Integration bereits. Was sich geändert hat, ist das dahinterliegende Modell, und das ist der Teil, der es wert ist, gemessen zu werden.

button

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen