DeepSeek-V4-Flash unterstützt jetzt Responses API und Codex: Das müssen Entwickler wissen

DeepSeek-V4-Flash spricht jetzt OpenAIs Responses API und läuft in Codex. Siehe die vollständige Kompatibilitätsmatrix, die 2-Minuten-Einrichtung und die Fallstricke, die es zu vermeiden gilt.

Ashley Innocent

Ashley Innocent

31 July 2026

DeepSeek-V4-Flash unterstützt jetzt Responses API und Codex: Das müssen Entwickler wissen

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

In der Ankündigung zur Veröffentlichung von DeepSeek’s V4-Flash vom 31. Juli findet sich die strategisch interessanteste Zeile: Das offizielle V4-Flash „unterstützt nativ das Responses API-Format und ist vollständig an Codex angepasst.“

Lesen Sie das noch einmal. Ein chinesisches Open-Weight-Labor hat gerade OpenAIs neuestes API-Format implementiert, jenes, das OpenAI für seine eigenen Agentenprodukte entwickelt hat, und zwar speziell damit OpenAIs eigener Coding-Agent auf einem DeepSeek-Modell laufen kann. Der Änderungsverlauf nennt die Motivation klar: „Um der Nachfrage nach Codex gerecht zu werden, unterstützt unsere API jetzt das Responses API-Format.“

Dieser Artikel behandelt, was das in der Praxis bedeutet: wie kompatibel die Implementierung ist, was stillschweigend ignoriert wird, wie man V4-Flash in zwei Minuten in Codex einbindet und wo die Fallstricke liegen. Wenn Sie zuerst nur eine grundlegende API-Einrichtung benötigen, beginnen Sie mit unserem V4-Flash Public Beta Guide.

button

Warum die Responses API hier wichtig ist

OpenAI hat die Responses API als Nachfolger von Chat Completions eingeführt: eine einzige Schnittstelle, die für agentenbasierte Arbeitslasten konzipiert ist, mit erstklassigen Argumentationselementen, integrierten Tools und semantischen Streaming-Ereignissen. Wir erläutern das Format in So verwenden Sie die OpenAI Responses API, aber kurz gesagt: Es ist das Format, das OpenAIs Agenten-Stack, einschließlich Codex, nativ spricht.

Bisher bedeutete der Betrieb eines Nicht-OpenAI-Modells hinter einem Responses API-Client entweder einen Übersetzungsproxy oder gar nichts. DeepSeek hat den Proxy übersprungen und das Format serverseitig unter https://api.deepseek.com implementiert. Ihr bestehendes OpenAI SDK funktioniert unverändert:

# pip3 install openai
from openai import OpenAI

client = OpenAI(
    api_key="<your DeepSeek API key>",
    base_url="https://api.deepseek.com"
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful assistant.",
    input="Hi, how are you?",
)

print(response.output_text)

Ein wichtiger Hinweis, bevor Sie sich zu sehr freuen: Die Responses API funktioniert derzeit nur mit deepseek-v4-flash. DeepSeek gibt an, dass die Unterstützung für deepseek-v4-pro Anfang August 2026 kommen wird.

Wie vollständig ist die Kompatibilität?

DeepSeek hat eine vollständige Kompatibilitätsmatrix veröffentlicht, was mehr ist, als die meisten „OpenAI-kompatiblen“ Anbieter sich die Mühe machen. Die wichtigen Zeilen:

Unterstützt und funktionsfähig:

Akzeptiert, aber inaktiv:

Nicht unterstützt, absichtlich:

Der elegante Teil: Nicht unterstützte Parameter werden stillschweigend ignoriert, anstatt abgelehnt zu werden, sodass bestehende Responses API-Clients ohne Änderungen verbunden werden können. Der unversöhnliche Teil: Anfragen, die das 1M-Token-Kontextfenster überschreiten, geben einen 400-Fehler zurück, anstatt abgeschnitten zu werden.

Streaming folgt dem Responses API-Ereignismodell, von response.created bis response.completed, wobei Begründungsdeltas (response.reasoning_text.delta) als separate Ereignisse vom Ausgabetext ankommen. Es gibt keinen data: [DONE]-Terminator; der Stream endet mit einem response.completed-, response.incomplete- oder response.failed-Ereignis. Wenn Ihr SSE-Handler auf [DONE] wartet, wird er hängen bleiben. Unser Leitfaden zum Streamen von API-Antworten mit Server-Sent Events behandelt defensive Parsing-Muster für genau diese Art von Dialektunterschied.

Codex mit DeepSeek-V4-Flash einrichten

Codex kommuniziert mit Modellen über die Responses API, was der Hauptgrund für diese Veröffentlichung ist. DeepSeeks Integrationsleitfaden bietet zwei Wege an, und beide konfigurieren jeden Codex-Client gleichzeitig (CLI, ChatGPT Desktop-App und die VS Code-Erweiterung), da sie eine gemeinsame Konfiguration teilen.

Das Ein-Klick-Skript

Stellen Sie sicher, dass Codex CLI oder die ChatGPT Desktop-App installiert ist und mindestens einmal ausgeführt wurde, dann:

bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)

Windows-Benutzer führen die PowerShell-Variante aus:

irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex

Das Skript fragt bei der ersten Ausführung nach Ihrem DeepSeek API-Schlüssel und erledigt dann vier Dinge: Es sichert Ihre bestehende ~/.codex/config.toml in ~/.codex/backup-deepseek/, schreibt einen Modellkatalog nach ~/.codex/models.json, fügt einen [model_providers.deepseek]-Abschnitt zu Ihrer Konfiguration hinzu, während MCP-Server und Projektvertrauenseinstellungen erhalten bleiben, und validiert die Syntax, bevor es etwas schreibt. Führen Sie es jederzeit erneut aus, um Modelle zu wechseln oder Ihre ursprüngliche Einrichtung über das Menü wiederherzustellen.

Die übliche Vorsicht beim Piping von curl in bash gilt: Lesen Sie das Skript zuerst, wenn das Ihre Richtlinie ist. Das Sicherungs- und Validierungsverhalten ist ein gutes Zeichen, aber es handelt sich immer noch um ein Drittanbieter-Skript, das Ihre Codex-Konfiguration berührt.

Was Ihnen der Modellkatalog verrät

Die models.json, die das Skript schreibt, ist lesenswert, da sie dokumentiert, wie DeepSeek das Modell in Codex positioniert:

Der Katalog beschreibt V4-Flash als das „neueste agentenbasierte Codierungsmodell der Spitzenklasse“, und nur deepseek-v4-flash funktioniert heute. Der Katalog enthält bereits deepseek-v4-pro für den Zeitpunkt, an dem die Unterstützung Anfang August verfügbar sein wird.

Hält es sich tatsächlich in Codex?

DeepSeeks Argument ist, dass das Re-Post-Training vom 0731 genau auf diese Arbeitslast abzielte. Ihre veröffentlichten Agentenzahlen: Terminal Bench 2.1 bei 82.7, Cybergym bei 76.7, Toolathlon verifiziert bei 70.3, DeepSWE bei 54.4, alle wurden als besser als V4-Pro-Preview gemeldet. Behandeln Sie diese als Herstellerangaben, bis unabhängige Ergebnisse vorliegen; sie wurden mit DeepSeeks eigenem Harness bei maximalem Aufwand erstellt, und zwei der Benchmarks in der Ankündigung sind interne Testsets.

Die Wirtschaftlichkeit ist schwerer zu bestreiten. Mit 0,14 $ pro Million Input-Tokens (Cache Miss) und 0,28 $ pro Million Output kostet V4-Flash nur einen Bruchteil der Modelle, die Codex normalerweise ausführt, und Cache Hits senken die Input-Kosten auf 0,0028 $. Ein Tag intensiver Agenten-Sitzungen kostet weniger als der Kaffee, den Sie dabei trinken. Die vollständige Kostentabelle finden Sie im Preisabschnitt unseres Beta-Guides. Wenn Sie Codex selbst gegen Alternativen abwägen, deckt unser Claude Code vs Codex CLI Vergleich die Agenten-Seite der Gleichung ab.

Überprüfen Sie den Endpunkt, bevor Sie dem Agenten vertrauen

Ein Agent ist nur so debugfähig wie die dahinterstehende API, und ein brandneuer öffentlicher Beta-Endpunkt verdient einen Praxistest, bevor Sie Codex auf ein echtes Repository loslassen. Dies ist eine Fünf-Minuten-Aufgabe in Apidog:

  1. Fügen Sie POST https://api.deepseek.com/responses als Endpunkt hinzu und speichern Sie Ihren Schlüssel in einer Umgebungsvariablen.
  2. Senden Sie eine minimale responses.create-Payload und bestätigen Sie die Form der Ausgabeelemente: ein reasoning-Element gefolgt von einem message-Element.
  3. Aktivieren Sie stream: true und beobachten Sie die Ereignissequenz live. Apidog zeigt jedes SSE-Ereignis bei seiner Ankunft an, was deutlich macht, ob Ihr Client auf response.output_text.delta warten sollte oder auf etwas, das nie kommt.
  4. Speichern Sie eine Anfrage mit einem angehängten function-Tool und bestätigen Sie, dass das function_call-Ausgabeformat dem entspricht, was Ihr Handler erwartet.

Wenn das V4-Pro Responses Rollout im August erfolgt, führen Sie dieselben gespeicherten Anfragen gegen den neuen Modellnamen erneut aus und vergleichen Sie das Verhalten. Laden Sie Apidog kostenlos herunter und bewahren Sie die gesamte Suite in einem Projekt auf.

FAQ

Welche DeepSeek-Modelle funktionieren mit der Responses API? Heute nur deepseek-v4-flash. Die Unterstützung für deepseek-v4-pro ist für Anfang August 2026 geplant.

Benötige ich ein neues SDK? Nein. Das offizielle OpenAI SDK funktioniert; richten Sie base_url auf https://api.deepseek.com und rufen Sie client.responses.create auf. Details zur Einrichtung finden Sie in unserem V4-Flash Public Beta Guide.

Funktioniert der Multi-Turn-Zustand wie bei OpenAI? Nein. Die DeepSeek-Implementierung ist zustandslos: previous_response_id, conversation und store werden nicht unterstützt. Senden Sie den gesamten Verlauf bei jedem Aufruf als Eingabeelemente.

Kann ich DeepSeek in Codex neben meinem OpenAI-Konto verwenden? Ja. Die Einrichtung fügt DeepSeek als Modell-Anbieter hinzu; das Skript-Menü wechselt zwischen den Modellen, und Ihre ursprüngliche Konfiguration wird gesichert, damit Sie sie wiederherstellen können.

Ist das dasselbe wie die Anthropic API-Kompatibilität? Separate Funktion. DeepSeek stellt auch einen Endpunkt im Anthropic-Format unter https://api.deepseek.com/anthropic bereit, wodurch die Claude Code-Integration funktioniert. Der Responses API-Endpunkt existiert für Agenten-Tools im OpenAI-Format wie Codex.

Was diese Veröffentlichung wirklich signalisiert

Die Modellqualität konvergiert, daher verlagert sich der Wettbewerb auf die Integrationsebene. DeepSeek hat sich angesehen, wo Entwickler tatsächlich arbeiten, innerhalb von Agenten wie Codex, und genau die notwendige Infrastruktur geschaffen, um dort ein Drop-in-Backend zu sein, bis hin zur Veröffentlichung, welche Parameter stillschweigend ignoriert werden. Diese Transparenz ist selten, und sie macht die Kompatibilitätsgeschichte glaubwürdig.

Das Vorgehen ist offensichtlich und klug: OpenAI liefert den Agenten, DeepSeek stellt die Tokens zu einem Zehntel des Preises bereit. Ob das 0731er-Modell in Ihrer Codebasis tatsächlich V4-Pro-Preview übertrifft, kann nur Ihre eigene Evaluation beantworten. Binden Sie es in Apidog ein, führen Sie Ihre Testsuite gegen beide aus und lassen Sie die Ergebnisse, nicht die Benchmark-Tabelle, entscheiden.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen