Wie nutzt man die DeepSeek V4 Pro 0813 API?

DeepSeek V4 Pro ist als Build 0813 allgemein verfügbar. Rufen Sie die deepseek-v4-pro API mit Python auf: Setup, Denkmodi mit reasoning_content, Streaming, Tool-Aufrufe und 120-fache Prompt-Caching-Einsparungen.

@apidog

@apidog

13 August 2026

Wie nutzt man die DeepSeek V4 Pro 0813 API?

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

DeepSeek V4 Pro hat die Vorabversion am 12. August 2026 verlassen. Der GA-Build mit der Kennzeichnung 0813 bedient nun den deepseek-v4-pro-API-Endpunkt und wird mit Zahlen geliefert, die wie Tippfehler aussehen: ein 1M-Token-Kontextfenster, 384K Tokens maximale Ausgabe und Eingabepreise, die bei Cache-Treffern auf 0,003625 $ pro Million Tokens sinken. Wie Unite.AI berichtete, ist das Modell, das vier Monate in der Vorabversion verbrachte, nun DeepSeeks Flaggschiff.

Die Launch-Berichterstattung sagt Ihnen, was ausgeliefert wurde, nicht aber, wie Sie es aufrufen. Dieser Leitfaden behandelt den praktischen Teil: die erste Anfrage mit dem OpenAI SDK, Denkmodi und das Feld reasoning_content, Streaming, Tool-Aufrufe und die Mathematik des Prompt-Cachings, die entscheidet, ob dieser 1M-Kontext erschwinglich oder ruinös ist. Wenn Sie zuerst die Hintergrundgeschichte der Architektur erfahren möchten, lesen Sie Was ist DeepSeek V4 und kehren Sie dann zurück.

TL;DR

Was GA-Build 0813 für Entwickler ändert

Die Vorabversion wurde im April 2026 veröffentlicht, das kleinere Geschwistermodell V4 Flash wurde im Juli ausgeliefert, und am 12. August wurde das Pro-Modell als Build 0813 zur allgemeinen Verfügbarkeit freigegeben, DeepSeeks üblicher Datumsstempelkonvention folgend (ähnlich wie v3-0324 einen V3-Snapshot kennzeichnete).

Drei Dinge ändern sich mit GA:

  1. Der Snapshot ist stabil. Vorabversionen können sich ändern, was Evals und Prompt-Optimierungen stillschweigend ungültig macht. Build 0813 ist ein festes Ziel, bis DeepSeek einen neuen Snapshot ankündigt.
  2. Der Endpunkt ist der Produktions-Alias. Über die offizielle API rufen Sie deepseek-v4-pro auf und erhalten den Build 0813; um den Snapshot explizit festzulegen, listet OpenRouter ihn als deepseek/deepseek-v4-pro-0813 auf.
  3. Die volle Funktionspalette ist aktiv. Denkmodi, Funktionsaufrufe, strukturierte Ausgaben, Prompt-Caching und die Multi-Format-API (OpenAI, Anthropic, Responses) sind alle am GA-Endpunkt verfügbar.

Unter der Haube ist V4 Pro ein Mixture-of-Experts-Modell mit 1,6 T Gesamtparametern und 49 B aktiven Parametern pro Token. Die wichtigste Ingenieursleistung ist die Effizienz: Zwei Aufmerksamkeits-Schemata, Compressed Sparse Attention und Heavily Compressed Attention, reduzieren die Single-Token-Inferenzrechenleistung auf 27 % der von V3.2 und den KV-Cache auf 10 %. Diese KV-Cache-Reduzierung ermöglicht es, einen 1M-Token-Kontext zu diesen Preisen bereitzustellen und nicht nur als Demo-Feature.

DeepSeek V4 Pro 0813: Spezifikationen auf einen Blick

Spezifikation DeepSeek V4 Pro 0813
Veröffentlichung GA am 12. August 2026 (Snapshot 0813)
Architektur Mixture-of-Experts, 1,6 T Gesamtparameter, 49 Mrd. aktiv pro Token
Attention Compressed Sparse Attention + Heavily Compressed Attention
Inferenzkosten vs. V3.2 27 % der Single-Token-Rechenleistung, 10 % des KV-Cache
Kontextfenster 1.000.000 Tokens
Maximale Ausgabe 384K Tokens
Denkmodi non-think, think high, think max
Eingabepreis 0,435 $/M Tokens (Cache-Fehlzugriff), 0,003625 $/M (Cache-Treffer)
Ausgabepreis 0,87 $/M Tokens
API-Formate OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses
Modell-ID deepseek-v4-pro
Kleineres Geschwistermodell deepseek-v4-flash (284B gesamt / 13B aktiv), 0,14 $/M Eingabe, 0,28 $/M Ausgabe

Hinsichtlich der Leistungsfähigkeit listet DeepSeeks eigene Modellkarte SWE-bench Verified mit 80,6 %, Terminal Bench 2.0 mit 67,9 %, GPQA Diamond mit 90,1 % und LiveCodeBench mit 93,5 % für V4-Pro-Max auf, die Konfiguration mit maximaler Denkfähigkeit. Dies sind selbst gemeldete Herstellerzahlen, die noch keine dritte Partei verifiziert hat, daher führen Sie Ihre eigenen aufgabenspezifischen Bewertungen durch, bevor Sie etwas Wichtiges migrieren.

API-Schlüssel abrufen und erste Anfrage stellen

Die Einrichtung dauert etwa fünf Minuten:

  1. Erstellen Sie ein Konto auf der DeepSeek-Plattform (platform.deepseek.com) und laden Sie Guthaben auf, die API ist prepaid.
  2. Öffnen Sie API-Schlüssel, generieren Sie einen Schlüssel und kopieren Sie ihn sofort (er wird nur einmal angezeigt).
  3. Exportieren Sie ihn als Umgebungsvariable, anstatt ihn direkt in den Code einzufügen:
export DEEPSEEK_API_KEY="sk-..."

Die API spricht das OpenAI Chat Completions-Protokoll, daher ist das Standard openai-Paket der Client. Sowohl https://api.deepseek.com als auch https://api.deepseek.com/v1 funktionieren als Basis-URLs; der /v1-Teil steht für Protokollkompatibilität, nicht für eine Modellversion.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {"role": "system", "content": "You are a concise technical assistant."},
        {"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
    ],
)

print(response.choices[0].message.content)
print(response.usage)

Drucken Sie response.usage vom ersten Tag an aus. Bei einem Modell, das bei Cache-Treffern so günstig und bei 1M-Token-Cache-Fehlern so teuer ist, ist die Token-Abrechnung der Unterschied zwischen einem Rundungsfehler und einer echten Rechnung.

Die gleiche Anfrage über rohes HTTP, nützlich für Smoke-Tests und für den Import in API-Tools:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "List three ways to version a REST API."}
    ]
  }'

Die vollständige Parameterreferenz finden Sie in den offiziellen DeepSeek-Dokumenten, einschließlich des Anthropic-kompatiblen Endpunkts (nutzbar mit dem Anthropic SDK und Claude Code ohne Neuschreiben) und DeepSeeks eigener Responses API.

Arbeiten mit den drei Denkmodi

V4 Pro legt die Denkweise als Regler und nicht als separates Modell offen. Ein Endpunkt, drei Modi:

Die Modi werden auf den Standardparameter reasoning_effort abgebildet, sodass keine anbieterspezifische Implementierung erforderlich ist:

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high", # "none" | "high" | "max"
    messages=[
        {"role": "user", "content": "Our API returns 502s under load but only behind the CDN. Walk through likely causes in order of probability."},
    ],
)

message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)

Zwei praktische Hinweise. Erstens, niemals reasoning_content zurück in den Konversationsverlauf einspeisen; senden Sie nur den content früherer Gesprächsrunden. Zweitens, Denk-Tokens werden als Output-Tokens zu 0,87 $/M abgerechnet, sodass 'think max' echtes Geld und echte Latenz kostet. Passen Sie den Modus an die Aufgabe an, anstatt standardmäßig das Maximum zu wählen.

Streaming-Antworten

Bei 384K maximaler Ausgabe und Denkmodi, die ausführlich argumentieren können, führen nicht-streamende Anfragen zu einer schlechten Benutzererfahrung. Setzen Sie stream=True und behandeln Sie beide Delta-Typen; in Denkmodi kommen reasoning_content-Blöcke zuerst an, dann die Antwort:

stream = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",
    stream=True,
    messages=[
        {"role": "user", "content": "Design a rate limiter for a public API. Compare token bucket and sliding window."},
    ],
)

for chunk in stream:
    if not chunk.choices:
        continue # final chunk may carry usage data only
    delta = chunk.choices[0].delta
    if getattr(delta, "reasoning_content", None):
        print(delta.reasoning_content, end="", flush=True) # thinking phase
    elif delta.content:
        print(delta.content, end="", flush=True) # answer phase

Ein sinnvolles UI-Muster: Rendern Sie die Denkphase zusammengeklappt als „Denk“-Indikator und wechseln Sie dann zur normalen Darstellung, wenn content-Deltas beginnen. Unter der Haube sind dies standardmäßige Server-Sent Events; unser Leitfaden zu Streaming von API-Antworten mit SSE behandelt die Mechaniken.

Tool-Aufrufe und strukturierte Ausgaben

V4 Pro unterstützt Funktionsaufrufe im OpenAI-Stil, was bedeutet, dass bestehende Agenten-Loops ohne Modifikation portiert werden können. Definieren Sie Tools, lesen Sie tool_calls, führen Sie sie aus, fügen Sie Ergebnisse hinzu, wiederholen Sie:

tools = [{
    "type": "function",
    "function": {
        "name": "get_endpoint_status",
        "description": "Check the health of an internal API endpoint",
        "parameters": {
            "type": "object",
            "properties": {
                "endpoint": {"type": "string", "description": "Path, e.g. /v1/orders"}
            },
            "required": ["endpoint"],
        },
    },
}]

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Is /v1/orders healthy right now?"}],
    tools=tools,
)

print(response.choices[0].message.tool_calls)

Strukturierte Ausgaben funktionieren über den Standardparameter response_format, wenn Sie garantiert parsbares JSON benötigen. Eine vollständige Anleitung zu mehrstufigen Tool-Loops verdient einen eigenen Artikel; die offiziellen Dokumente behandeln die Details der Nachrichtenstruktur.

Prompt-Caching-Ökonomie: Die Zahl, die Ihre Architektur verändert

Hier ist die Spezifikation, die mehr Aufmerksamkeit verdient als die Benchmarks. DeepSeek speichert Prompt-Präfixe automatisch im Cache, ohne Cache-Control-Header, ohne TTL-Konfiguration, und wiederholte Präfixe werden mit 0,003625 $/M statt 0,435 $/M abgerechnet. Das ist ein 120-facher Rabatt für Eingaben, die die API bereits gesehen hat.

Rechnen Sie die Zahlen für eine realistische Arbeitslast durch. Angenommen, Sie entwickeln einen Codierungs-Agenten, der einen 200K-Token-Repository-Kontext verwaltet und 50 Aufrufe in einer Sitzung macht:

Gleiche Sitzung, ungefähr 35x billiger, und alles, was es braucht, ist eine Prompt-Struktur: stabiler Inhalt zuerst (System-Prompt, Dokumentation, Repository-Kontext), flüchtiger Inhalt zuletzt (die neueste Nachricht des Benutzers, Zeitstempel, Anforderungs-IDs). Jede Änderung früh im Prompt macht das zwischengespeicherte Präfix von diesem Zeitpunkt an ungültig, sodass ein Zeitstempel in Ihrem System-Prompt jeden Aufruf stillschweigend in einen vollpreisigen Cache-Fehlzugriff umwandelt.

Dies stellt auch das 1M-Kontextfenster neu dar: Es zu füllen kostet bei einem Fehlzugriff 0,435 $, aber als stabiles Sitzungspräfix kostet es etwa ein Drittel eines Cents pro Aufruf. Für die allgemeine Theorie siehe Was ist Prompt-Caching.

deepseek-v4-pro in Apidog testen

Bevor V4 Pro überhaupt in die Nähe von Produktionscode kommt, sollten Sie den Endpunkt einem geeigneten Debugger unterziehen. Da DeepSeeks API OpenAI-kompatibel ist, erkennt Apidog sie ohne spezielle Behandlung:

  1. Endpunkt importieren. Fügen Sie den vorherigen Curl-Befehl in Apidog ein und er wird zu einer bearbeitbaren Anfrage, wobei Header, Authentifizierung und Body automatisch geparst werden.
  2. Umgebungen für Pro und Flash einrichten. Speichern Sie base_url und Ihren API-Schlüssel als Umgebungsvariablen und machen Sie auch den Modellnamen zu einer Variablen. Der Wechsel zwischen deepseek-v4-pro und deepseek-v4-flash wird zu einer Ein-Klick-Umgebungsänderung, was die Frage „Ist Pro das Dreifache des Flash-Preises bei diesem Prompt wert?“ zu einer empirischen Frage statt einer Debatte macht.
  3. Den SSE-Stream überprüfen. Senden Sie eine Anfrage mit "stream": true und Apidog rendert den Ereignis-Stream als Live-Zeitleiste anstatt einer Wand aus rohen data:-Zeilen, wobei Deltas zusammengeführt werden, sodass Sie reasoning_content vor der Antwort ankommen sehen können. Wenn ein Think-Max-Aufruf langsam erscheint, zeigt Ihnen diese Ansicht genau, wohin die Zeit geflossen ist.
  4. Die Sitzung als Sammlung speichern. Wenn DeepSeek den nächsten Snapshot ausliefert, führen Sie dieselben Anfragen erneut aus und vergleichen Sie das Verhalten, bevor Sie upgraden, denselben Workflow, den Teams im Allgemeinen für OpenAI-kompatible Endpunkte verwenden.

Der Antwort-Viewer zeigt auch den usage-Block bei jeder Anfrage an, was der schnellste Weg ist, Ihr Cache-Hit-Verhältnis zu überprüfen, während Sie die Prompt-Struktur optimieren.

Aktuelle Preise und die bevorstehende Erhöhung

Aktuelle Listenpreise für die beiden V4-Endpunkte:

Modell Eingabe (Fehlzugriff) Eingabe (Cache-Treffer) Ausgabe
deepseek-v4-pro 0,435 $/M 0,003625 $/M 0,87 $/M
deepseek-v4-flash 0,14 $/M 0,28 $/M

Selbst zu Pro-Preisen unterbietet dies westliche Spitzenmodelle deutlich. Aber planen Sie mit einem Vorbehalt: Am 6. August 2026, sechs Tage vor GA, warnte DeepSeek, dass eine „erhebliche“ API-Preiserhöhung bevorsteht, ohne Zahlen und ohne Gültigkeitsdatum.

Praktische Absicherungen, solange die Zahlen unbekannt sind:

Für eine detailliertere Aufschlüsselung der V4-Preisstruktur und deren Vergleich über Anbieter hinweg, siehe unseren DeepSeek V4 API Preisleitfaden.

Häufig gestellte Fragen

Funktioniert mein bestehender OpenAI SDK-Code unverändert?

Fast. Ändern Sie base_url auf https://api.deepseek.com, tauschen Sie den API-Schlüssel aus und setzen Sie model="deepseek-v4-pro". Chat Completions, Streaming, Tools und strukturierte Ausgaben folgen den OpenAI-Formaten. Teams, die das Anthropic SDK verwenden, können stattdessen DeepSeeks Anthropic Messages-Endpunkt nutzen.

Wann sollte ich V4 Flash anstelle von V4 Pro verwenden?

Flash (284B gesamt, 13B aktiv) ist das Volumenmodell: Klassifizierung, Extraktion, einfacher Chat, alles latenzempfindliche, das keine tiefe Denkweise benötigt. Pro verdient seinen 3-fachen Ausgabepreis bei Agenten-Codierung, Langkontext-Analyse und Denkmodus-Workloads. Routen Sie nach Aufgabe, nicht nach Loyalität.

Kann ich V4 Pro 0813 in Cursor verwenden?

Ja, Cursor akzeptiert benutzerdefinierte OpenAI-kompatible Endpunkte, sodass der GA-Build als benutzerdefiniertes Modell eingesetzt werden kann. Die genaue Einrichtung erläutern wir in So verwenden Sie DeepSeek V4 Pro mit Cursor.

Zusammenfassung

Der erste Tag mit einem GA-Modell ist der richtige Zeitpunkt, um das Muskelgedächtnis aufzubauen: Schlüssel, erste Anfrage, Denkmodi, Streaming und ein Cache-bewusstes Prompt-Layout. V4 Pro belohnt diese letzte Gewohnheit mehr als jedes Modell zuvor, der 120-fache Cache-Rabatt macht die Prompt-Struktur zu einer Architektur-Entscheidung. Verbinden Sie die obigen Beispiele, beobachten Sie die usage-Zahlen und bewahren Sie eine gespeicherte Apidog-Sammlung auf, damit Sie das Verhalten erneut überprüfen können, wenn der nächste Snapshot oder die angekündigte Preisänderung eintrifft.

button

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen