DeepSeek-V4.1-Flash wurde heute, am 10. September 2026, für die API allgemein verfügbar (GA). Die Versionshinweise sind kurz, ändern aber drei Dinge für alle, die die DeepSeek API aufrufen: Es gibt von nun an nur noch eine Modell-ID zu verwenden, deepseek-flash; die Pro-Token-Preise sind erneut gesunken; und in vier Tagen, am 14. September, wird jede Anfrage an deepseek-v4-pro auf dieses Modell umgeleitet und zu Flash-Preisen abgerechnet.
Dieser letzte Punkt ist der Grund, warum es diesen Leitfaden gibt. Wenn Sie Produktionscode auf V4-Pro haben, können Sie kein Migrationsdatum wählen. Wenn Sie V4-Flash verwenden, werden Sie bereits unter dem alten Namen vom neuen Modell bedient. So oder so, die Parameter, die Sie heute senden, sollten Sie überprüfen.
Dieser Beitrag behandelt die praktische Seite: Modell-ID, Basis-URLs, einen ersten Aufruf in drei Sprachen, Denkaufwand, Bildeingabe, Streaming und Preisgestaltung. FĂĽr die Architektur und Benchmark-Story lesen Sie zuerst Was ist DeepSeek-V4.1-Flash.
Bevor Sie etwas in Code umsetzen, möchten Sie wahrscheinlich einen schnellen Weg, Anfragen zu senden und Antworten zu vergleichen. Apidog erledigt das: Richten Sie es auf https://api.deepseek.com aus, speichern Sie den Schlüssel als Variable und speichern Sie jeden funktionierenden Aufruf als wiederholbaren Test. Der Workflow befindet sich am Ende.
TL;DR
- Modell-ID:
deepseek-flash. Alte Namendeepseek-v4-flashunddeepseek-v4-flash-vision-expfunktionieren weiterhin, leiten aber auf V4.1-Flash um. - Basis-URLs unverändert:
https://api.deepseek.com(OpenAI-kompatibel) undhttps://api.deepseek.com/anthropic(Anthropic-kompatibel). deepseek-v4-prowird am 14. September 2026 um 04:00 UTC auf V4.1-Flash umgeleitet.- Kontext 1M Tokens, maximale Ausgabe 384K, gleichzeitige Anfragen (Concurrency Limit) 2.500.
- Preise auĂźerhalb der Spitzenzeiten pro 1M Tokens: $0.003 Cache-Hit, $0.15 Cache-Miss, $0.60 Ausgabe. Spitzenzeiten sind doppelt so teuer.
- Vision ist nativ. Bilder werden im
content-Array alsimage_url-Teile ĂĽbergeben.
Was sich für API-Aufrufer geändert hat
Hier ist die Änderung, entnommen den Versionshinweisen und dem Änderungsprotokoll.
Eine Modell-ID. Der kanonische Name ist jetzt deepseek-flash, ohne Versionsnummer. Verankern Sie Ihre Prompts und Tests am Verhalten, nicht an einer Versionszeichenfolge, da die nächste Flash-Veröffentlichung unter demselben Namen erscheinen wird.
Alte Namen werden weiterhin geroutet. deepseek-v4-flash und deepseek-v4-flash-vision-exp werden vorerst akzeptiert, aber die dahinter liegenden Modelle, V4-Flash und V4-Flash-Vision-Exp, sind eingestellt. Anfragen an diese Namen werden von V4.1-Flash bedient. Nichts bricht, aber Sie verwenden nicht das Modell, das Sie glauben. Benennen Sie es um, wenn Sie können.
Der Beta-Name ist weg. Die zweitägige Beta vom 8. September lief als deepseek-v4.1-flash-expires-on-0910. Sie ist wie versprochen abgelaufen. Wechseln Sie zu deepseek-flash.
Basis-URLs und -Formate sind unverändert. OpenAI-kompatible Aufrufe gehen an https://api.deepseek.com, Anthropic-kompatible Aufrufe an https://api.deepseek.com/anthropic, und das Responses API-Format, das die Flash-Linie bereits unterstützte, wird übernommen. Ihre SDK-Konfiguration ändert sich nicht.
V4-Pro hat noch vier Tage. Ab dem 14. September 2026 um 04:00 UTC (12:00 Beijing) wird jede deepseek-v4-pro-Anfrage an V4.1-Flash weitergeleitet und zu V4.1-Flash-Tarifen abgerechnet. DeepSeeks angegebener Grund ist, dass V4.1-Flash „V4 Pro in Leistung, Kosten, Geschwindigkeit und Gesamtzeit umfassend übertroffen hat“, unter Berufung auf Tests mehrerer Parteien. Dies ist eine Herstellerangabe. Der V4-Pro Migrationsleitfaden zur Außerbetriebnahme zeigt, wie Sie dies mit Ihren eigenen Prompts überprüfen können, bevor die Umstellung für Sie erfolgt.
Schritt 1: SchlĂĽssel abrufen
Melden Sie sich auf der DeepSeek-Plattform an, öffnen Sie „API Keys“ und erstellen Sie einen. Schlüssel beginnen mit sk-. Exportieren Sie ihn, anstatt ihn in den Quellcode einzufügen:
export DEEPSEEK_API_KEY="sk-your-key-here"
Es wird kein DeepSeek-spezifisches SDK benötigt. Die OpenAI- und Anthropic-Client-Bibliotheken funktionieren beide, sobald Sie die Basis-URL ändern.
Schritt 2: Ihren ersten Aufruf tätigen
Zuerst curl, weil es jede Variable auĂźer der API selbst entfernt:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-flash",
"messages": [
{"role": "system", "content": "Sie sind Support-Ingenieur fĂĽr eine Zahlungs-API."},
{"role": "user", "content": "Ein Kunde erhält HTTP 402 auf /v1/charges. Listen Sie die drei wahrscheinlichsten Ursachen auf."}
],
"stream": false
}'
Derselbe Aufruf ĂĽber das OpenAI Python SDK:
# pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "system", "content": "Sie sind Support-Ingenieur fĂĽr eine Zahlungs-API."},
{"role": "user", "content": "Ein Kunde erhält HTTP 402 auf /v1/charges. Listen Sie die drei wahrscheinlichsten Ursachen auf."},
],
)
print(response.choices[0].message.content)
Und Node:
// npm install openai
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await client.chat.completions.create({
model: "deepseek-flash",
messages: [
{ role: "user", content: "Schreiben Sie eine Postgres-Migration, die einen nullbaren refunded_at-Zeitstempel zu Rechnungen hinzufĂĽgt." },
],
});
console.log(completion.choices[0].message.content);
Wenn Sie die Einrichtung anhand der vorherigen Version und des V4-Flash API-Leitfadens vorgenommen haben, ist der einzige Unterschied die Modellzeichenfolge.
Schritt 3: Denkaufwand und Denkmodus
Die Modellkarte beschreibt den Denkaufwand als „kontinuierlich steuerbar“ auf einer Skala von 1 bis 100. Das ist eine Abkehr von den Low-/Medium-/High-Voreinstellungen, die die meisten APIs bieten, und bedeutet, dass Sie Kosten und Latenz pro Endpunkt anstatt pro Stufe anpassen können.
Die Parameterform, die diesen Wert von 1 bis 100 trägt, ist [ÜBERPRÜFEN] anhand der API-Dokumentation. Bis zur Bestätigung, gehen Sie vom V4-Flash-Muster aus: reasoning_effort plus ein thinking-Objekt, das über extra_body übergeben wird:
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Unser Redis-Cluster verliert 2% der SETs unter Last. Planen Sie die Untersuchung."}],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}},
)
Empfohlene Sampling-Einstellungen aus der Modellkarte: temperature 1.0, top_p 0.95 oder 1.0, und max_tokens von 256K oder mehr für lange Denktraces. Die maximale Ausgabe beträgt 384K Tokens.
Eine praktische Aufteilung: Denkmodus aus für Autovervollständigung, Klassifizierung und alles, worauf ein Benutzer wartet; Denkmodus an mit hohem Aufwand für Agenten-Schleifen, Multi-Datei-Refactorings und Debugging. Dann messen. Aufwand, den Sie in der Ausgabe nicht sehen können, ist Aufwand, den Sie ohnehin bezahlen.
Schritt 4: Ein Bild senden
V4.1-Flash ist nativ multimodal und wurde auf einem multimodalen Corpus von 45 Billionen Tokens mit einem von Grund auf neu trainierten DeepSeek-ViT-Encoder trainiert. Das Anfrageformat wird von V4-Flash-Vision-Exp ĂĽbernommen: Bilder sind Teile des content-Arrays der Benutzernachricht.
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extrahieren Sie jeden Posten und die Gesamtsumme von diesem Beleg als JSON."},
{"type": "image_url", "image_url": {"url": "https://cdn.example-shop.com/receipts/48213.png"}},
],
}],
)
FĂĽr eine lokale Datei kodieren Sie diese als Base64-Daten-URL:
import base64
with open("receipt.png", "rb") as f:
data_url = "data:image/png;base64," + base64.b64encode(f.read()).decode()
# dann {"url": data_url} im image_url-Teil ĂĽbergeben
Limits: Base64-Daten-URLs bis zu 32 MiB, externe URLs bis zu 8.192 Zeichen oder eine Datei-ID. Ein optionales detail-Feld wird akzeptiert. DeepSeek meldet DocVQA 95.6, was dem oben genannten Fall des Dokumentenlesens entspricht. Der Vision API-Leitfaden behandelt Multi-Image-Prompts, Detailebenen und die Kosten fĂĽr Bilder pro Anfrage.
Schritt 5: Die Antwort streamen
Setzen Sie stream=True und der Endpunkt gibt Server-Sent Events zurück. Begründungsinhalte und Antwortinhalte kommen als separate Deltas an, was wichtig ist, wenn Sie einen „Denk“-Zustand in einer Benutzeroberfläche rendern.
stream = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Erklären Sie Idempotenzschlüssel in einem Absatz."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta
if delta.content:
print(delta.content, end="", flush=True)
Wenn SSE neu für Sie ist, erklärt das Streamen von LLM-Antworten mit Server-Sent Events das Wire-Format und die Edge-Cases bei der Wiederverbindung.
Preise auf einen Blick
Von der offiziellen Preisseite, gĂĽltig ab dem 10. September 2026 um 04:00 UTC, in USD pro 1M Tokens:
| deepseek-flash auĂźerhalb der Spitzenzeiten | deepseek-flash Spitzenzeiten | |
|---|---|---|
| Eingabe, Cache-Hit | $0.003 | $0.006 |
| Eingabe, Cache-Miss | $0.15 | $0.30 |
| Ausgabe | $0.60 | $1.20 |
Drei Dinge, die Sie wissen sollten:
- Spitzenzeiten sind Montag bis Freitag, 01:00 bis 04:00 und 06:00 bis 10:00 UTC (9:00 bis 12:00 und 14:00 bis 18:00 Beijing). Außerhalb der Spitzenzeiten ist der Preis halb. Batch-Jobs, die warten können, sollten warten.
- Cache-Hits sind automatisch. Ein Hit kostet 50-mal weniger als ein Miss, daher ist ein stabiler System-Prompt am Anfang jeder Anfrage die günstigste verfügbare Optimierung. Was ist Prompt-Caching erklärt, wie Prefix-Matching funktioniert.
- Im Vergleich zu V4-Flash beträgt die Reduzierung etwa 57 % bei Cache-Hit-Eingaben, 32 % bei Cache-Miss-Eingaben und 9 % bei der Ausgabe. Eine V4-Pro-Arbeitslast, die am 14. September umgeleitet wird, zahlt $0.30 statt $1.32 pro 1M Cache-Miss-Eingabe zu Spitzenzeiten und $1.20 statt $3.96 für die Ausgabe.
Die API in Apidog testen
Sobald der erste Aufruf funktioniert, stellt sich die Frage, ob er weiterhin funktioniert. deepseek-flash trägt keine Version, daher wird das nächste Upgrade stillschweigend erfolgen. Hier ist ein Apidog-Workflow, der dies abfängt:

- Den Endpunkt hinzufĂĽgen. Erstellen Sie
POST https://api.deepseek.com/chat/completionsoder importieren Sie eine OpenAI-kompatible OpenAPI-Spezifikation, damit jede Route auf einmal ankommt. - Den SchlĂĽssel als Umgebungsvariable speichern. FĂĽgen Sie
DEEPSEEK_API_KEYin eine Apidog-Umgebung ein und setzen Sie den Header aufBearer {{DEEPSEEK_API_KEY}}. Das Umschalten zwischen einem persönlichen Schlüssel und dem Produktionsschlüssel wird zu einem Dropdown-Menü. - Eine Anfrage pro Aufwandsstufe speichern. Duplizieren Sie die Basisanfrage in Varianten: Denkmodus aus, Denkmodus an bei geringem Aufwand, Denkmodus an bei hohem Aufwand. Derselbe Prompt, unterschiedliche Parameter. Senden Sie alle drei und vergleichen Sie die Token-Nutzung und Latenz nebeneinander.
- Den Stream beobachten. Bei
stream: truerendert Apidog SSE-Ereignisse, sobald sie eintreffen, sodass Begründungs-Deltas und Inhalts-Deltas als separate Zeilen anstatt einer Wand vondata:-Präfixen angezeigt werden. - Die Varianten in ein Testszenario umwandeln. Fügen Sie Assertionen zum Statuscode hinzu, zur Cache-Hit-Anzahl in
usage, die beim zweiten Lauf über Null liegt, und zur Antwort, die die Felder enthält, die Ihre App parst. Führen Sie das Szenario nach jedem Modell-Update erneut aus und am 14. September, wenn die V4-Pro-Umleitung live geht. - Im CI ausführen.
apidog-cliführt dasselbe Szenario aus einer Pipeline aus, sodass eine stillschweigende Modelländerung einen Build fehlschlägt, anstatt einen Kunden zu beeinträchtigen.
Laden Sie Apidog herunter und die gesamte Einrichtung dauert etwa zehn Minuten.
FAQ
- Muss ich
deepseek-v4-flashindeepseek-flashumbenennen? Nicht heute. Der alte Name leitet immer noch auf V4.1-Flash um. Aber V4-Flash selbst ist außer Betrieb, und DeepSeek hat nicht gesagt, wann der Alias wegfällt. Benennen Sie ihn in Ihrem nächsten Deployment um. - Was passiert mit meinem V4-Pro-Code am 14. September? Nichts geht kaputt. Anfragen an
deepseek-v4-prowerden von V4.1-Flash beantwortet und ab 04:00 UTC zu Flash-Tarifen abgerechnet. Ihre Ausgaben können sich jedoch ändern, daher sollten Sie Ihr Evaluierungsset vor diesem Datum ausführen. Der Migrationsleitfaden enthält eine Checkliste. - Unterstützt der Anthropic-kompatible Endpunkt das neue Modell? Ja.
https://api.deepseek.com/anthropicist unverändert; verwenden Sie auch dortdeepseek-flashals Modellnamen. - Gibt es einen kostenlosen Tarif? Die API wird auf Pay-as-you-go-Basis abgerechnet, ohne permanenten kostenlosen Tarif. Die Gewichte sind auf Hugging Face MIT-lizenziert, wenn Sie sie selbst hosten möchten. Aktuelle Optionen sind in wie man die DeepSeek V4 API kostenlos nutzt zusammengefasst.
- Wie schnell ist es? DeepSeek hat keine Tokens-pro-Sekunde-Zahl veröffentlicht. Ein X-Benutzer berichtete in Videotests von „fast 400 t/s“, was eine Anekdote und keine Spezifikation ist. Messen Sie mit Ihren eigenen Prompts während eines Spitzenfensters.
Vor der Umleitung
Die API-Oberfläche hat sich kaum verändert: gleiche Basis-URLs, gleiches Anforderungsformat, eine neue Modell-ID. Was sich geändert hat, sind der Preis und am 14. September die Umleitung jedes V4-Pro-Aufrufs. Benennen Sie deepseek-v4-flash in deepseek-flash um, wählen Sie ein Aufwandsniveau pro Endpunkt und führen Sie Ihre Prompts durch das neue Modell, bevor DeepSeek es für Sie tut.
Speichern Sie diese Prompts gleich als Tests. Apidog führt sie mit einem Klick erneut aus, und das nächste stillschweigende Flash-Upgrade wird als fehlgeschlagene Assertion anstatt als Support-Ticket angezeigt.
