DeepSeek V4 Pro hat die Vorabversion am 12. August 2026 verlassen. Der GA-Build mit der Kennzeichnung 0813 bedient nun den deepseek-v4-pro-API-Endpunkt und wird mit Zahlen geliefert, die wie Tippfehler aussehen: ein 1M-Token-Kontextfenster, 384K Tokens maximale Ausgabe und Eingabepreise, die bei Cache-Treffern auf 0,003625 $ pro Million Tokens sinken. Wie Unite.AI berichtete, ist das Modell, das vier Monate in der Vorabversion verbrachte, nun DeepSeeks Flaggschiff.
Die Launch-Berichterstattung sagt Ihnen, was ausgeliefert wurde, nicht aber, wie Sie es aufrufen. Dieser Leitfaden behandelt den praktischen Teil: die erste Anfrage mit dem OpenAI SDK, Denkmodi und das Feld reasoning_content, Streaming, Tool-Aufrufe und die Mathematik des Prompt-Cachings, die entscheidet, ob dieser 1M-Kontext erschwinglich oder ruinös ist. Wenn Sie zuerst die Hintergrundgeschichte der Architektur erfahren möchten, lesen Sie Was ist DeepSeek V4 und kehren Sie dann zurück.
TL;DR
- DeepSeek-V4-Pro-0813 ist der GA-Snapshot hinter dem
deepseek-v4-pro-Endpunkt seit dem 12. August 2026, der Build, der in der Produktion angesteuert werden sollte. - Die API ist OpenAI-kompatibel: Richten Sie das
openai-SDK aufhttps://api.deepseek.comaus, setzen Siemodel="deepseek-v4-pro", fertig. Das Anthropic Messages-Format und DeepSeeks eigene Responses API funktionieren ebenfalls. - 1M-Token-Kontext, 384K maximale Ausgabe, drei Denkmodi (
non-think,think high,think max), die einreasoning_content-Feld zusammen mit der Antwort zurückgeben. - Preise: 0,435 $/M Eingabe (Cache-Fehlzugriff), 0,003625 $/M Eingabe (Cache-Treffer, 120x billiger), 0,87 $/M Ausgabe. Das Caching erfolgt automatisch bei wiederholten Prompt-Präfixen.
- DeepSeek warnte am 6. August, dass eine „erhebliche“ API-Preiserhöhung bevorsteht. Noch keine Zahlen oder Daten, also planen Sie mit Spielraum.
- Testen Sie den Endpunkt, überprüfen Sie den SSE-Stream und halten Sie Pro/Flash-Umgebungen in Apidog nebeneinander, bevor Sie es in etwas Reales integrieren.
Was GA-Build 0813 für Entwickler ändert
Die Vorabversion wurde im April 2026 veröffentlicht, das kleinere Geschwistermodell V4 Flash wurde im Juli ausgeliefert, und am 12. August wurde das Pro-Modell als Build 0813 zur allgemeinen Verfügbarkeit freigegeben, DeepSeeks üblicher Datumsstempelkonvention folgend (ähnlich wie v3-0324 einen V3-Snapshot kennzeichnete).

Drei Dinge ändern sich mit GA:
- Der Snapshot ist stabil. Vorabversionen können sich ändern, was Evals und Prompt-Optimierungen stillschweigend ungültig macht. Build 0813 ist ein festes Ziel, bis DeepSeek einen neuen Snapshot ankündigt.
- Der Endpunkt ist der Produktions-Alias. Über die offizielle API rufen Sie
deepseek-v4-proauf und erhalten den Build 0813; um den Snapshot explizit festzulegen, listet OpenRouter ihn alsdeepseek/deepseek-v4-pro-0813auf. - Die volle Funktionspalette ist aktiv. Denkmodi, Funktionsaufrufe, strukturierte Ausgaben, Prompt-Caching und die Multi-Format-API (OpenAI, Anthropic, Responses) sind alle am GA-Endpunkt verfügbar.
Unter der Haube ist V4 Pro ein Mixture-of-Experts-Modell mit 1,6 T Gesamtparametern und 49 B aktiven Parametern pro Token. Die wichtigste Ingenieursleistung ist die Effizienz: Zwei Aufmerksamkeits-Schemata, Compressed Sparse Attention und Heavily Compressed Attention, reduzieren die Single-Token-Inferenzrechenleistung auf 27 % der von V3.2 und den KV-Cache auf 10 %. Diese KV-Cache-Reduzierung ermöglicht es, einen 1M-Token-Kontext zu diesen Preisen bereitzustellen und nicht nur als Demo-Feature.
DeepSeek V4 Pro 0813: Spezifikationen auf einen Blick
| Spezifikation | DeepSeek V4 Pro 0813 |
|---|---|
| Veröffentlichung | GA am 12. August 2026 (Snapshot 0813) |
| Architektur | Mixture-of-Experts, 1,6 T Gesamtparameter, 49 Mrd. aktiv pro Token |
| Attention | Compressed Sparse Attention + Heavily Compressed Attention |
| Inferenzkosten vs. V3.2 | 27 % der Single-Token-Rechenleistung, 10 % des KV-Cache |
| Kontextfenster | 1.000.000 Tokens |
| Maximale Ausgabe | 384K Tokens |
| Denkmodi | non-think, think high, think max |
| Eingabepreis | 0,435 $/M Tokens (Cache-Fehlzugriff), 0,003625 $/M (Cache-Treffer) |
| Ausgabepreis | 0,87 $/M Tokens |
| API-Formate | OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses |
| Modell-ID | deepseek-v4-pro |
| Kleineres Geschwistermodell | deepseek-v4-flash (284B gesamt / 13B aktiv), 0,14 $/M Eingabe, 0,28 $/M Ausgabe |
Hinsichtlich der Leistungsfähigkeit listet DeepSeeks eigene Modellkarte SWE-bench Verified mit 80,6 %, Terminal Bench 2.0 mit 67,9 %, GPQA Diamond mit 90,1 % und LiveCodeBench mit 93,5 % für V4-Pro-Max auf, die Konfiguration mit maximaler Denkfähigkeit. Dies sind selbst gemeldete Herstellerzahlen, die noch keine dritte Partei verifiziert hat, daher führen Sie Ihre eigenen aufgabenspezifischen Bewertungen durch, bevor Sie etwas Wichtiges migrieren.
API-Schlüssel abrufen und erste Anfrage stellen
Die Einrichtung dauert etwa fünf Minuten:
- Erstellen Sie ein Konto auf der DeepSeek-Plattform (platform.deepseek.com) und laden Sie Guthaben auf, die API ist prepaid.
- Öffnen Sie API-Schlüssel, generieren Sie einen Schlüssel und kopieren Sie ihn sofort (er wird nur einmal angezeigt).
- Exportieren Sie ihn als Umgebungsvariable, anstatt ihn direkt in den Code einzufügen:
export DEEPSEEK_API_KEY="sk-..."
Die API spricht das OpenAI Chat Completions-Protokoll, daher ist das Standard openai-Paket der Client. Sowohl https://api.deepseek.com als auch https://api.deepseek.com/v1 funktionieren als Basis-URLs; der /v1-Teil steht für Protokollkompatibilität, nicht für eine Modellversion.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "You are a concise technical assistant."},
{"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
],
)
print(response.choices[0].message.content)
print(response.usage)
Drucken Sie response.usage vom ersten Tag an aus. Bei einem Modell, das bei Cache-Treffern so günstig und bei 1M-Token-Cache-Fehlern so teuer ist, ist die Token-Abrechnung der Unterschied zwischen einem Rundungsfehler und einer echten Rechnung.
Die gleiche Anfrage über rohes HTTP, nützlich für Smoke-Tests und für den Import in API-Tools:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "List three ways to version a REST API."}
]
}'
Die vollständige Parameterreferenz finden Sie in den offiziellen DeepSeek-Dokumenten, einschließlich des Anthropic-kompatiblen Endpunkts (nutzbar mit dem Anthropic SDK und Claude Code ohne Neuschreiben) und DeepSeeks eigener Responses API.
Arbeiten mit den drei Denkmodi
V4 Pro legt die Denkweise als Regler und nicht als separates Modell offen. Ein Endpunkt, drei Modi:
- non-think: Das Modell antwortet direkt. Am schnellsten und günstigsten, geeignet für Extraktion, Klassifizierung, Formatierung und Zusammenfassungen.
- think high: Das Modell denkt, bevor es antwortet, und gibt diese Denkweise in einem
reasoning_content-Feld zurück. Die Standardeinstellung für Codierung, Debugging und mehrstufige Analyse. - think max: maximales Denkbudget, die Konfiguration hinter den Benchmark-Zahlen von V4-Pro-Max. Sparen Sie es sich für wirklich schwierige Probleme auf.
Die Modi werden auf den Standardparameter reasoning_effort abgebildet, sodass keine anbieterspezifische Implementierung erforderlich ist:
response = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high", # "none" | "high" | "max"
messages=[
{"role": "user", "content": "Our API returns 502s under load but only behind the CDN. Walk through likely causes in order of probability."},
],
)
message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)
Zwei praktische Hinweise. Erstens, niemals reasoning_content zurück in den Konversationsverlauf einspeisen; senden Sie nur den content früherer Gesprächsrunden. Zweitens, Denk-Tokens werden als Output-Tokens zu 0,87 $/M abgerechnet, sodass 'think max' echtes Geld und echte Latenz kostet. Passen Sie den Modus an die Aufgabe an, anstatt standardmäßig das Maximum zu wählen.
Streaming-Antworten
Bei 384K maximaler Ausgabe und Denkmodi, die ausführlich argumentieren können, führen nicht-streamende Anfragen zu einer schlechten Benutzererfahrung. Setzen Sie stream=True und behandeln Sie beide Delta-Typen; in Denkmodi kommen reasoning_content-Blöcke zuerst an, dann die Antwort:
stream = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high",
stream=True,
messages=[
{"role": "user", "content": "Design a rate limiter for a public API. Compare token bucket and sliding window."},
],
)
for chunk in stream:
if not chunk.choices:
continue # final chunk may carry usage data only
delta = chunk.choices[0].delta
if getattr(delta, "reasoning_content", None):
print(delta.reasoning_content, end="", flush=True) # thinking phase
elif delta.content:
print(delta.content, end="", flush=True) # answer phase
Ein sinnvolles UI-Muster: Rendern Sie die Denkphase zusammengeklappt als „Denk“-Indikator und wechseln Sie dann zur normalen Darstellung, wenn content-Deltas beginnen. Unter der Haube sind dies standardmäßige Server-Sent Events; unser Leitfaden zu Streaming von API-Antworten mit SSE behandelt die Mechaniken.
Tool-Aufrufe und strukturierte Ausgaben
V4 Pro unterstützt Funktionsaufrufe im OpenAI-Stil, was bedeutet, dass bestehende Agenten-Loops ohne Modifikation portiert werden können. Definieren Sie Tools, lesen Sie tool_calls, führen Sie sie aus, fügen Sie Ergebnisse hinzu, wiederholen Sie:
tools = [{
"type": "function",
"function": {
"name": "get_endpoint_status",
"description": "Check the health of an internal API endpoint",
"parameters": {
"type": "object",
"properties": {
"endpoint": {"type": "string", "description": "Path, e.g. /v1/orders"}
},
"required": ["endpoint"],
},
},
}]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Is /v1/orders healthy right now?"}],
tools=tools,
)
print(response.choices[0].message.tool_calls)
Strukturierte Ausgaben funktionieren über den Standardparameter response_format, wenn Sie garantiert parsbares JSON benötigen. Eine vollständige Anleitung zu mehrstufigen Tool-Loops verdient einen eigenen Artikel; die offiziellen Dokumente behandeln die Details der Nachrichtenstruktur.
Prompt-Caching-Ökonomie: Die Zahl, die Ihre Architektur verändert
Hier ist die Spezifikation, die mehr Aufmerksamkeit verdient als die Benchmarks. DeepSeek speichert Prompt-Präfixe automatisch im Cache, ohne Cache-Control-Header, ohne TTL-Konfiguration, und wiederholte Präfixe werden mit 0,003625 $/M statt 0,435 $/M abgerechnet. Das ist ein 120-facher Rabatt für Eingaben, die die API bereits gesehen hat.
Rechnen Sie die Zahlen für eine realistische Arbeitslast durch. Angenommen, Sie entwickeln einen Codierungs-Agenten, der einen 200K-Token-Repository-Kontext verwaltet und 50 Aufrufe in einer Sitzung macht:
- Ohne Caching: 50 Aufrufe × 200K Tokens × 0,435 $/M ≈ 4,35 $ an Eingabekosten.
- Mit automatischem Caching: ein Cache-Fehlzugriff (0,087 $) + 49 Cache-Treffer (≈ 0,0007 $ pro Stück) ≈ 0,12 $.
Gleiche Sitzung, ungefähr 35x billiger, und alles, was es braucht, ist eine Prompt-Struktur: stabiler Inhalt zuerst (System-Prompt, Dokumentation, Repository-Kontext), flüchtiger Inhalt zuletzt (die neueste Nachricht des Benutzers, Zeitstempel, Anforderungs-IDs). Jede Änderung früh im Prompt macht das zwischengespeicherte Präfix von diesem Zeitpunkt an ungültig, sodass ein Zeitstempel in Ihrem System-Prompt jeden Aufruf stillschweigend in einen vollpreisigen Cache-Fehlzugriff umwandelt.
Dies stellt auch das 1M-Kontextfenster neu dar: Es zu füllen kostet bei einem Fehlzugriff 0,435 $, aber als stabiles Sitzungspräfix kostet es etwa ein Drittel eines Cents pro Aufruf. Für die allgemeine Theorie siehe Was ist Prompt-Caching.
deepseek-v4-pro in Apidog testen
Bevor V4 Pro überhaupt in die Nähe von Produktionscode kommt, sollten Sie den Endpunkt einem geeigneten Debugger unterziehen. Da DeepSeeks API OpenAI-kompatibel ist, erkennt Apidog sie ohne spezielle Behandlung:

- Endpunkt importieren. Fügen Sie den vorherigen Curl-Befehl in Apidog ein und er wird zu einer bearbeitbaren Anfrage, wobei Header, Authentifizierung und Body automatisch geparst werden.
- Umgebungen für Pro und Flash einrichten. Speichern Sie
base_urlund Ihren API-Schlüssel als Umgebungsvariablen und machen Sie auch den Modellnamen zu einer Variablen. Der Wechsel zwischendeepseek-v4-prounddeepseek-v4-flashwird zu einer Ein-Klick-Umgebungsänderung, was die Frage „Ist Pro das Dreifache des Flash-Preises bei diesem Prompt wert?“ zu einer empirischen Frage statt einer Debatte macht. - Den SSE-Stream überprüfen. Senden Sie eine Anfrage mit
"stream": trueund Apidog rendert den Ereignis-Stream als Live-Zeitleiste anstatt einer Wand aus rohendata:-Zeilen, wobei Deltas zusammengeführt werden, sodass Siereasoning_contentvor der Antwort ankommen sehen können. Wenn ein Think-Max-Aufruf langsam erscheint, zeigt Ihnen diese Ansicht genau, wohin die Zeit geflossen ist. - Die Sitzung als Sammlung speichern. Wenn DeepSeek den nächsten Snapshot ausliefert, führen Sie dieselben Anfragen erneut aus und vergleichen Sie das Verhalten, bevor Sie upgraden, denselben Workflow, den Teams im Allgemeinen für OpenAI-kompatible Endpunkte verwenden.
Der Antwort-Viewer zeigt auch den usage-Block bei jeder Anfrage an, was der schnellste Weg ist, Ihr Cache-Hit-Verhältnis zu überprüfen, während Sie die Prompt-Struktur optimieren.
Aktuelle Preise und die bevorstehende Erhöhung
Aktuelle Listenpreise für die beiden V4-Endpunkte:
| Modell | Eingabe (Fehlzugriff) | Eingabe (Cache-Treffer) | Ausgabe |
|---|---|---|---|
deepseek-v4-pro |
0,435 $/M | 0,003625 $/M | 0,87 $/M |
deepseek-v4-flash |
0,14 $/M | 0,28 $/M |
Selbst zu Pro-Preisen unterbietet dies westliche Spitzenmodelle deutlich. Aber planen Sie mit einem Vorbehalt: Am 6. August 2026, sechs Tage vor GA, warnte DeepSeek, dass eine „erhebliche“ API-Preiserhöhung bevorsteht, ohne Zahlen und ohne Gültigkeitsdatum.
Praktische Absicherungen, solange die Zahlen unbekannt sind:
- Messen Sie Ihre tatsächlichen Kosten pro Aufgabe jetzt, mit
usage-Daten aus realen Workloads, damit Sie jede angekündigte Erhöhung in Minuten modellieren können, anstatt zu raten. - Maximieren Sie Cache-Treffer. Wenn die Erhöhung proportional angewendet wird, behalten präfixlastige Architekturen den Großteil ihres Vorteils.
- Behalten Sie V4 Flash als Routing-Fallback. Mit 0,14 $/0,28 $ und 13B aktiven Parametern bewältigt es einfache Aufgaben mit hohem Volumen, sodass Pro für Anfragen reserviert ist, die es benötigen.
Für eine detailliertere Aufschlüsselung der V4-Preisstruktur und deren Vergleich über Anbieter hinweg, siehe unseren DeepSeek V4 API Preisleitfaden.
Häufig gestellte Fragen
Funktioniert mein bestehender OpenAI SDK-Code unverändert?
Fast. Ändern Sie base_url auf https://api.deepseek.com, tauschen Sie den API-Schlüssel aus und setzen Sie model="deepseek-v4-pro". Chat Completions, Streaming, Tools und strukturierte Ausgaben folgen den OpenAI-Formaten. Teams, die das Anthropic SDK verwenden, können stattdessen DeepSeeks Anthropic Messages-Endpunkt nutzen.
Wann sollte ich V4 Flash anstelle von V4 Pro verwenden?
Flash (284B gesamt, 13B aktiv) ist das Volumenmodell: Klassifizierung, Extraktion, einfacher Chat, alles latenzempfindliche, das keine tiefe Denkweise benötigt. Pro verdient seinen 3-fachen Ausgabepreis bei Agenten-Codierung, Langkontext-Analyse und Denkmodus-Workloads. Routen Sie nach Aufgabe, nicht nach Loyalität.
Kann ich V4 Pro 0813 in Cursor verwenden?
Ja, Cursor akzeptiert benutzerdefinierte OpenAI-kompatible Endpunkte, sodass der GA-Build als benutzerdefiniertes Modell eingesetzt werden kann. Die genaue Einrichtung erläutern wir in So verwenden Sie DeepSeek V4 Pro mit Cursor.
Zusammenfassung
Der erste Tag mit einem GA-Modell ist der richtige Zeitpunkt, um das Muskelgedächtnis aufzubauen: Schlüssel, erste Anfrage, Denkmodi, Streaming und ein Cache-bewusstes Prompt-Layout. V4 Pro belohnt diese letzte Gewohnheit mehr als jedes Modell zuvor, der 120-fache Cache-Rabatt macht die Prompt-Struktur zu einer Architektur-Entscheidung. Verbinden Sie die obigen Beispiele, beobachten Sie die usage-Zahlen und bewahren Sie eine gespeicherte Apidog-Sammlung auf, damit Sie das Verhalten erneut überprüfen können, wenn der nächste Snapshot oder die angekündigte Preisänderung eintrifft.
