DeepSeek hat heute Morgen die offizielle DeepSeek-V4-Flash API veröffentlicht. Die Ankündigung erfolgte am 31. Juli 2026, und die Versionshinweise machen drei Dinge deutlich: Die Agentenfunktionen des Modells wurden erheblich verbessert, es unterstützt jetzt nativ das Responses API-Format von OpenAI und es funktioniert von Anfang an mit Codex.
Wenn Sie deepseek-v4-flash seit April verwendet haben, waren Sie in der Vorschauversion. Diese Veröffentlichung überführt das Modell in seine offizielle Version, DeepSeek-V4-Flash-0731, und Sie erhalten das Upgrade, ohne eine einzige Codezeile ändern zu müssen. Der Modellname bleibt gleich.
Dieser Leitfaden führt Sie durch alles: das Besorgen eines Schlüssels, Ihren ersten Aufruf, das Ein- und Ausschalten des Denkmodus und wie die Preisgestaltung der öffentlichen Beta aussieht. Wenn Sie neu in der DeepSeek-Produktreihe sind, beginnen Sie mit Was ist DeepSeek V4? für einen Überblick über die Familie und kehren Sie dann hierher zurück.
Was am 31. Juli tatsächlich veröffentlicht wurde
Laut dem offiziellen Änderungslog betrifft die Veröffentlichung nur die API. Die DeepSeek App- und Web-Modelle bleiben unverändert, und die V4-Pro API bleibt ebenfalls unverändert. Hier ist die Zusammenfassung:
- DeepSeek-V4-Flash-0731 ist die offizielle Veröffentlichung der V4-Flash-Reihe, jetzt in öffentlicher Beta-Phase über die API.
- Gleiche Architektur und Größe wie V4-Flash-Preview. DeepSeek sagt, dass das Modell nur neu nachtrainiert wurde, sodass die Verbesserungen aus dem Training stammen, nicht aus einem größeren Netzwerk.
- Agenten-Benchmarks übertrafen V4-Pro-Preview. DeepSeek meldet Terminal Bench 2.1 mit 82,7, Cybergym mit 76,7, Toolathlon verifiziert mit 70,3 und DeepSWE mit 54,4. Dies sind DeepSeeks eigene veröffentlichte Zahlen, getestet mit ihrer Harness bei maximalem Aufwand.
- Native Responses API-Unterstützung und offizielle Codex-Integration. Wir behandeln beides ausführlich in DeepSeek-V4-Flash unterstützt jetzt die Responses API und Codex.
- Die offizielle Veröffentlichung von DeepSeek-V4-Pro „folgt in Kürze“, laut Änderungslog. Die Unterstützung der Responses API und von Codex für V4-Pro wird für Anfang August 2026 erwartet.
Ein Hinweis zur Ehrlichkeit: Die Schlagzeilen-Benchmark-Behauptung („übertrifft V4-Pro-Preview bei weitem“) stammt aus DeepSeeks eigener Bewertung, und zwei der aufgeführten Benchmarks (DSBench-FullStack und DSBench-Hard) sind interne Test-Sets. Unabhängige Zahlen werden erst in einigen Tagen verfügbar sein.

Schritt 1: Ihren API-Schlüssel erhalten
Gehen Sie zur DeepSeek-Plattform, melden Sie sich an und erstellen Sie einen Schlüssel auf der Seite für API-Schlüssel. Schlüssel beginnen mit sk-. Speichern Sie ihn als Umgebungsvariable, anstatt ihn fest zu codieren:
export DEEPSEEK_API_KEY="sk-your-key-here"
Die DeepSeek API ist sowohl mit den OpenAI- als auch mit den Anthropic API-Formaten kompatibel, sodass Sie kein DeepSeek-spezifisches SDK benötigen. Zwei Basis-URLs sind wichtig:
| Format | Basis-URL |
|---|---|
| OpenAI-kompatibel | https://api.deepseek.com |
| Anthropic-kompatibel | https://api.deepseek.com/anthropic |
Schritt 2: Ihren ersten Aufruf tätigen
Der schnellste Funktionstest ist curl:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Summarize what changed in DeepSeek-V4-Flash-0731."}
],
"stream": false
}'
Der gleiche Aufruf über das OpenAI Python SDK:
# pip3 install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Write a Python function that validates an email address."}
],
stream=False
)
print(response.choices[0].message.content)
Und Node.js:
// npm install openai
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [{ role: "user", content: "Hello!" }],
});
console.log(completion.choices[0].message.content);
Da der Modellname deepseek-v4-flash nun auf die 0731-Veröffentlichung verweist, übernimmt jede bestehende Integration, die Sie gegen die Vorschauversion erstellt haben, das neue Modell automatisch. Nichts zu migrieren.
Schritt 3: Denkmodus und Denkaufwand steuern
V4-Flash unterstützt sowohl einen Nicht-Denkmodus als auch einen Denkmodus, wobei der Denkmodus die Standardeinstellung ist. Sie steuern ihn mit dem Parameter thinking und können die Tiefe mit reasoning_effort einstellen:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Plan a database migration from MySQL to Postgres."}],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}}
)
Zwei Verhaltensweisen, die Sie kennen sollten, bevor Sie Parameter anpassen:
temperatureundtop_phaben keine Auswirkung, solange der Denkmodus aktiv ist.- FIM-Vervollständigung (Fill-in-the-Middle, noch Beta) funktioniert nur im Nicht-Denkmodus.
Für latenzempfindliche Endpunkte wie die Autovervollständigung deaktivieren Sie den Denkmodus. Für Agenten-Loops und schwierige Debugging-Aufgaben lassen Sie ihn aktiviert und erhöhen den Aufwand.
Schritt 4: Die Antwort streamen
Setzen Sie stream: true und die API gibt Server-Sent Events zurück. Wenn Sie noch keine SSE-Nutzlasten debuggt haben, erklärt unser Leitfaden zu Streaming von LLM-Antworten mit Server-Sent Events das Format detailliert.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Explain connection pooling."}],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Preisgestaltung während der öffentlichen Beta-Phase
Laut der offiziellen Seite für Modelle & Preise bleibt V4-Flash aggressiv günstig:
| Artikel | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Eingabe, Cache-Treffer (pro 1 Mio. Tokens) | $0.0028 | $0.003625 |
| Eingabe, Cache-Fehlversuch (pro 1 Mio. Tokens) | $0.14 | $0.435 |
| Ausgabe (pro 1 Mio. Tokens) | $0.28 | $0.87 |
| Kontextlänge | 1 Mio. Tokens | 1 Mio. Tokens |
| Maximale Ausgabe | 384K | 384K |
| Gleichzeitigkeitslimit | 2.500 | 500 |
Drei Hinweise zur Preisgestaltung:
- Kontext-Caching erfolgt automatisch, und ein Cache-Treffer kostet 50x weniger als ein Fehlversuch. Langlaufende Agenten-Sitzungen, die einen System-Prompt wiederverwenden, profitieren enorm davon.
- DeepSeek hat eine Peak-/Off-Peak-Richtlinie angekündigt: Die Nutzung zu Spitzenzeiten (9:00-12:00 und 14:00-18:00 Pekinger Zeit) wird zum doppelten regulären Preis abgerechnet. Zum 31. Juli besagen die Dokumente, dass das Gültigkeitsdatum „der offiziellen Ankündigung unterliegt“, es ist also noch nicht aktiv. Beobachten Sie die Preisgestaltungsseite.
- Das Gleichzeitigkeitslimit spricht für sich: 2.500 gleichzeitige Anfragen für Flash gegenüber 500 für Pro. DeepSeek hat dieses Modell gebaut, um von Agentenflotten intensiv genutzt zu werden.
Für ein vollständigeres Kostenbild der V4-Familie, einschließlich der Geschichte der dauerhaften Preissenkung für V4-Pro, lesen Sie unsere DeepSeek V4 API Preisübersicht.
API in Apidog testen und debuggen
Roher Curl-Befehl funktioniert für einen Smoke-Test, aber in dem Moment, in dem Sie die Ausgabe von Denkmodus und Nicht-Denkmodus vergleichen oder beobachten, wie das Modell Tool-Aufrufe streamt, möchten Sie Transparenz haben. Hier ist ein Workflow, der in Apidog etwa fünf Minuten dauert:

- Ein Projekt erstellen und den Endpunkt hinzufügen. Fügen Sie
POST https://api.deepseek.com/chat/completionshinzu (oder importieren Sie eine OpenAI-kompatible Spezifikation, damit alle Endpunkte auf einmal ankommen). - Den Schlüssel als Umgebungsvariable speichern. Fügen Sie
DEEPSEEK_API_KEYin eine Apidog-Umgebung ein und referenzieren Sie ihn im Authorization-Header alsBearer {{DEEPSEEK_API_KEY}}. Das Umschalten zwischen einem Testschlüssel und einem Produktionsschlüssel wird zu einem Dropdown-Klick. - Senden und prüfen. Bei Streaming-Aufrufen rendert Apidog die SSE-Ereignisse, sobald sie eintreffen, sodass Sie den Reasoning-Inhalt und den Antwort-Inhalt als separate Deltas sehen können, anstatt nur eine Wand von rohen
data:-Zeilen zu betrachten. - Varianten als Testfälle speichern. Speichern Sie eine Anfrage mit aktiviertem Denkmodus und eine ohne, und führen Sie dann beide nach jedem Modell-Update erneut aus. Wenn DeepSeek das nächste stille Upgrade für
deepseek-v4-flashveröffentlicht, wissen Sie mit einem Klick, ob Ihre Prompts immer noch wie erwartet funktionieren.
Apidog kostenlos herunterladen, der gesamte oben beschriebene Workflow funktioniert mit dem kostenlosen Plan.
FAQ
Muss ich meinen Code ändern, um das neue Modell zu erhalten? Nein. Der Modellname deepseek-v4-flash bedient jetzt DeepSeek-V4-Flash-0731. Bestehende Integrationen werden automatisch aktualisiert.
Ist dies dasselbe Modell wie die DeepSeek App? Nein. Das Update vom 31. Juli betrifft nur die API. Die App- und Web-Modelle bleiben unverändert.
Was ist mit deepseek-chat und deepseek-reasoner passiert? Diese älteren Modellnamen sollten am 24. Juli 2026 eingestellt werden. Verwenden Sie deepseek-v4-flash oder deepseek-v4-pro. Unser Leitfaden zur Nutzung der DeepSeek V4 API behandelt die Migration.
Kann ich es kostenlos nutzen? DeepSeeks API ist ein Pay-as-you-go-Dienst ohne dauerhaft kostenlosen Tarif, aber die Preisgestaltung für Cache-Treffer macht Experimente in der Praxis nahezu kostenlos. Die aktuellen Optionen finden Sie unter Wie man die DeepSeek V4 API kostenlos nutzt.
Funktioniert V4-Flash mit Codex und der Responses API? Ja, beides, und es ist bisher das einzige DeepSeek-Modell, das dies tut. Die Unterstützung für V4-Pro wird Anfang August 2026 erwartet. Eine vollständige Einrichtung finden Sie in unserem Leitfaden für Responses API und Codex.
Fazit
DeepSeek-V4-Flash-0731 ist eine eher unauffällige Veröffentlichung: gleicher Modellname, gleiche Preise, gleiche Architektur und eine Reihe von Agenten-Benchmark-Ergebnissen, die nun das größere V4-Pro-Preview übertreffen, zumindest in DeepSeeks eigenen Tests. Die Unterstützung der Responses API und die Codex-Anpassung zeigen, worauf dieses Modell abzielt: Agenten-Workloads mit hoher Parallelität zu Preisen, die jedes westliche Labor unterbieten.
Besorgen Sie sich einen Schlüssel, richten Sie Ihr OpenAI SDK auf https://api.deepseek.com und unterziehen Sie das Modell Ihrer eigenen Testsuite, bevor Sie der Benchmark-Tabelle vertrauen. Apidog beschleunigt diesen Verifizierungszyklus: Speichern Sie Ihre Prompts einmal als Testfälle, führen Sie sie bei jedem Modell-Update erneut aus, und Sie werden nie wieder von einem stillen Upgrade überrascht werden.
