Wie verwendet man die DeepSeek-V4.1-Flash API?

Die DeepSeek-V4.1-Flash API aufrufen: Modell-ID deepseek-flash, Basis-URLs, erster Aufruf in curl/Python/Node, Denkaufwand, Bildeingabe, Streaming, Preisgestaltung.

INEZA Felin-Michel

INEZA Felin-Michel

10 September 2026

Wie verwendet man die DeepSeek-V4.1-Flash API?

Apidog fĂĽr Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

DeepSeek-V4.1-Flash wurde heute, am 10. September 2026, für die API allgemein verfügbar (GA). Die Versionshinweise sind kurz, ändern aber drei Dinge für alle, die die DeepSeek API aufrufen: Es gibt von nun an nur noch eine Modell-ID zu verwenden, deepseek-flash; die Pro-Token-Preise sind erneut gesunken; und in vier Tagen, am 14. September, wird jede Anfrage an deepseek-v4-pro auf dieses Modell umgeleitet und zu Flash-Preisen abgerechnet.

Dieser letzte Punkt ist der Grund, warum es diesen Leitfaden gibt. Wenn Sie Produktionscode auf V4-Pro haben, können Sie kein Migrationsdatum wählen. Wenn Sie V4-Flash verwenden, werden Sie bereits unter dem alten Namen vom neuen Modell bedient. So oder so, die Parameter, die Sie heute senden, sollten Sie überprüfen.

Dieser Beitrag behandelt die praktische Seite: Modell-ID, Basis-URLs, einen ersten Aufruf in drei Sprachen, Denkaufwand, Bildeingabe, Streaming und Preisgestaltung. FĂĽr die Architektur und Benchmark-Story lesen Sie zuerst Was ist DeepSeek-V4.1-Flash.

Bevor Sie etwas in Code umsetzen, möchten Sie wahrscheinlich einen schnellen Weg, Anfragen zu senden und Antworten zu vergleichen. Apidog erledigt das: Richten Sie es auf https://api.deepseek.com aus, speichern Sie den Schlüssel als Variable und speichern Sie jeden funktionierenden Aufruf als wiederholbaren Test. Der Workflow befindet sich am Ende.

Button

TL;DR

Was sich für API-Aufrufer geändert hat

Hier ist die Änderung, entnommen den Versionshinweisen und dem Änderungsprotokoll.

Eine Modell-ID. Der kanonische Name ist jetzt deepseek-flash, ohne Versionsnummer. Verankern Sie Ihre Prompts und Tests am Verhalten, nicht an einer Versionszeichenfolge, da die nächste Flash-Veröffentlichung unter demselben Namen erscheinen wird.

Alte Namen werden weiterhin geroutet. deepseek-v4-flash und deepseek-v4-flash-vision-exp werden vorerst akzeptiert, aber die dahinter liegenden Modelle, V4-Flash und V4-Flash-Vision-Exp, sind eingestellt. Anfragen an diese Namen werden von V4.1-Flash bedient. Nichts bricht, aber Sie verwenden nicht das Modell, das Sie glauben. Benennen Sie es um, wenn Sie können.

Der Beta-Name ist weg. Die zweitägige Beta vom 8. September lief als deepseek-v4.1-flash-expires-on-0910. Sie ist wie versprochen abgelaufen. Wechseln Sie zu deepseek-flash.

Basis-URLs und -Formate sind unverändert. OpenAI-kompatible Aufrufe gehen an https://api.deepseek.com, Anthropic-kompatible Aufrufe an https://api.deepseek.com/anthropic, und das Responses API-Format, das die Flash-Linie bereits unterstützte, wird übernommen. Ihre SDK-Konfiguration ändert sich nicht.

V4-Pro hat noch vier Tage. Ab dem 14. September 2026 um 04:00 UTC (12:00 Beijing) wird jede deepseek-v4-pro-Anfrage an V4.1-Flash weitergeleitet und zu V4.1-Flash-Tarifen abgerechnet. DeepSeeks angegebener Grund ist, dass V4.1-Flash „V4 Pro in Leistung, Kosten, Geschwindigkeit und Gesamtzeit umfassend übertroffen hat“, unter Berufung auf Tests mehrerer Parteien. Dies ist eine Herstellerangabe. Der V4-Pro Migrationsleitfaden zur Außerbetriebnahme zeigt, wie Sie dies mit Ihren eigenen Prompts überprüfen können, bevor die Umstellung für Sie erfolgt.

Schritt 1: SchlĂĽssel abrufen

Melden Sie sich auf der DeepSeek-Plattform an, öffnen Sie „API Keys“ und erstellen Sie einen. Schlüssel beginnen mit sk-. Exportieren Sie ihn, anstatt ihn in den Quellcode einzufügen:

export DEEPSEEK_API_KEY="sk-your-key-here"

Es wird kein DeepSeek-spezifisches SDK benötigt. Die OpenAI- und Anthropic-Client-Bibliotheken funktionieren beide, sobald Sie die Basis-URL ändern.

Schritt 2: Ihren ersten Aufruf tätigen

Zuerst curl, weil es jede Variable auĂźer der API selbst entfernt:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-flash",
    "messages": [
      {"role": "system", "content": "Sie sind Support-Ingenieur fĂĽr eine Zahlungs-API."},
      {"role": "user", "content": "Ein Kunde erhält HTTP 402 auf /v1/charges. Listen Sie die drei wahrscheinlichsten Ursachen auf."}
    ],
    "stream": false
  }'

Derselbe Aufruf ĂĽber das OpenAI Python SDK:

# pip install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {"role": "system", "content": "Sie sind Support-Ingenieur fĂĽr eine Zahlungs-API."},
        {"role": "user", "content": "Ein Kunde erhält HTTP 402 auf /v1/charges. Listen Sie die drei wahrscheinlichsten Ursachen auf."},
    ],
)

print(response.choices[0].message.content)

Und Node:

// npm install openai
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await client.chat.completions.create({
  model: "deepseek-flash",
  messages: [
    { role: "user", content: "Schreiben Sie eine Postgres-Migration, die einen nullbaren refunded_at-Zeitstempel zu Rechnungen hinzufĂĽgt." },
  ],
});

console.log(completion.choices[0].message.content);

Wenn Sie die Einrichtung anhand der vorherigen Version und des V4-Flash API-Leitfadens vorgenommen haben, ist der einzige Unterschied die Modellzeichenfolge.

Schritt 3: Denkaufwand und Denkmodus

Die Modellkarte beschreibt den Denkaufwand als „kontinuierlich steuerbar“ auf einer Skala von 1 bis 100. Das ist eine Abkehr von den Low-/Medium-/High-Voreinstellungen, die die meisten APIs bieten, und bedeutet, dass Sie Kosten und Latenz pro Endpunkt anstatt pro Stufe anpassen können.

Die Parameterform, die diesen Wert von 1 bis 100 trägt, ist [ÜBERPRÜFEN] anhand der API-Dokumentation. Bis zur Bestätigung, gehen Sie vom V4-Flash-Muster aus: reasoning_effort plus ein thinking-Objekt, das über extra_body übergeben wird:

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Unser Redis-Cluster verliert 2% der SETs unter Last. Planen Sie die Untersuchung."}],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}},
)

Empfohlene Sampling-Einstellungen aus der Modellkarte: temperature 1.0, top_p 0.95 oder 1.0, und max_tokens von 256K oder mehr für lange Denktraces. Die maximale Ausgabe beträgt 384K Tokens.

Eine praktische Aufteilung: Denkmodus aus für Autovervollständigung, Klassifizierung und alles, worauf ein Benutzer wartet; Denkmodus an mit hohem Aufwand für Agenten-Schleifen, Multi-Datei-Refactorings und Debugging. Dann messen. Aufwand, den Sie in der Ausgabe nicht sehen können, ist Aufwand, den Sie ohnehin bezahlen.

Schritt 4: Ein Bild senden

V4.1-Flash ist nativ multimodal und wurde auf einem multimodalen Corpus von 45 Billionen Tokens mit einem von Grund auf neu trainierten DeepSeek-ViT-Encoder trainiert. Das Anfrageformat wird von V4-Flash-Vision-Exp ĂĽbernommen: Bilder sind Teile des content-Arrays der Benutzernachricht.

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Extrahieren Sie jeden Posten und die Gesamtsumme von diesem Beleg als JSON."},
            {"type": "image_url", "image_url": {"url": "https://cdn.example-shop.com/receipts/48213.png"}},
        ],
    }],
)

FĂĽr eine lokale Datei kodieren Sie diese als Base64-Daten-URL:

import base64

with open("receipt.png", "rb") as f:
    data_url = "data:image/png;base64," + base64.b64encode(f.read()).decode()

# dann {"url": data_url} im image_url-Teil ĂĽbergeben

Limits: Base64-Daten-URLs bis zu 32 MiB, externe URLs bis zu 8.192 Zeichen oder eine Datei-ID. Ein optionales detail-Feld wird akzeptiert. DeepSeek meldet DocVQA 95.6, was dem oben genannten Fall des Dokumentenlesens entspricht. Der Vision API-Leitfaden behandelt Multi-Image-Prompts, Detailebenen und die Kosten fĂĽr Bilder pro Anfrage.

Schritt 5: Die Antwort streamen

Setzen Sie stream=True und der Endpunkt gibt Server-Sent Events zurück. Begründungsinhalte und Antwortinhalte kommen als separate Deltas an, was wichtig ist, wenn Sie einen „Denk“-Zustand in einer Benutzeroberfläche rendern.

stream = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Erklären Sie Idempotenzschlüssel in einem Absatz."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    if delta.content:
        print(delta.content, end="", flush=True)

Wenn SSE neu für Sie ist, erklärt das Streamen von LLM-Antworten mit Server-Sent Events das Wire-Format und die Edge-Cases bei der Wiederverbindung.

Preise auf einen Blick

Von der offiziellen Preisseite, gĂĽltig ab dem 10. September 2026 um 04:00 UTC, in USD pro 1M Tokens:

deepseek-flash auĂźerhalb der Spitzenzeiten deepseek-flash Spitzenzeiten
Eingabe, Cache-Hit $0.003 $0.006
Eingabe, Cache-Miss $0.15 $0.30
Ausgabe $0.60 $1.20

Drei Dinge, die Sie wissen sollten:

Die API in Apidog testen

Sobald der erste Aufruf funktioniert, stellt sich die Frage, ob er weiterhin funktioniert. deepseek-flash trägt keine Version, daher wird das nächste Upgrade stillschweigend erfolgen. Hier ist ein Apidog-Workflow, der dies abfängt:

  1. Den Endpunkt hinzufĂĽgen. Erstellen Sie POST https://api.deepseek.com/chat/completions oder importieren Sie eine OpenAI-kompatible OpenAPI-Spezifikation, damit jede Route auf einmal ankommt.
  2. Den Schlüssel als Umgebungsvariable speichern. Fügen Sie DEEPSEEK_API_KEY in eine Apidog-Umgebung ein und setzen Sie den Header auf Bearer {{DEEPSEEK_API_KEY}}. Das Umschalten zwischen einem persönlichen Schlüssel und dem Produktionsschlüssel wird zu einem Dropdown-Menü.
  3. Eine Anfrage pro Aufwandsstufe speichern. Duplizieren Sie die Basisanfrage in Varianten: Denkmodus aus, Denkmodus an bei geringem Aufwand, Denkmodus an bei hohem Aufwand. Derselbe Prompt, unterschiedliche Parameter. Senden Sie alle drei und vergleichen Sie die Token-Nutzung und Latenz nebeneinander.
  4. Den Stream beobachten. Bei stream: true rendert Apidog SSE-Ereignisse, sobald sie eintreffen, sodass Begründungs-Deltas und Inhalts-Deltas als separate Zeilen anstatt einer Wand von data:-Präfixen angezeigt werden.
  5. Die Varianten in ein Testszenario umwandeln. Fügen Sie Assertionen zum Statuscode hinzu, zur Cache-Hit-Anzahl in usage, die beim zweiten Lauf über Null liegt, und zur Antwort, die die Felder enthält, die Ihre App parst. Führen Sie das Szenario nach jedem Modell-Update erneut aus und am 14. September, wenn die V4-Pro-Umleitung live geht.
  6. Im CI ausführen. apidog-cli führt dasselbe Szenario aus einer Pipeline aus, sodass eine stillschweigende Modelländerung einen Build fehlschlägt, anstatt einen Kunden zu beeinträchtigen.

Laden Sie Apidog herunter und die gesamte Einrichtung dauert etwa zehn Minuten.

FAQ

Vor der Umleitung

Die API-Oberfläche hat sich kaum verändert: gleiche Basis-URLs, gleiches Anforderungsformat, eine neue Modell-ID. Was sich geändert hat, sind der Preis und am 14. September die Umleitung jedes V4-Pro-Aufrufs. Benennen Sie deepseek-v4-flash in deepseek-flash um, wählen Sie ein Aufwandsniveau pro Endpunkt und führen Sie Ihre Prompts durch das neue Modell, bevor DeepSeek es für Sie tut.

Speichern Sie diese Prompts gleich als Tests. Apidog führt sie mit einem Klick erneut aus, und das nächste stillschweigende Flash-Upgrade wird als fehlgeschlagene Assertion anstatt als Support-Ticket angezeigt.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen