DeepSeek-V4.1-Flash Preise erklärt: Spitzen- und Nebenzeiten Tarife sowie Cache-Hit-Berechnung

Die vollständige USD- und CNY-Preistabelle für deepseek-flash, die prozentualen Reduzierungen gegenüber V4-Flash und die V4-Pro-Umleitung, Spitzenzeitfenster, umgerechnet in Ihre Zeitzone, sowie zwei Cache-Hit-Beispiele mit der dargestellten Arithmetik.

Medy Evrard

10 September 2026

DeepSeek-V4.1-Flash Preise erklärt: Spitzen- und Nebenzeiten Tarife sowie Cache-Hit-Berechnung

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

DeepSeek-V4.1-Flash wurde am 10. September 2026 für die API allgemein verfügbar (GA), und die Release Notes enthielten eine Preissenkung. Cache-Hit-Eingaben kosten jetzt außerhalb der Spitzenzeiten 0,003 $ pro Million Tokens, Cache-Miss-Eingaben 0,15 $, Ausgaben 0,60 $. Vier Tage später, am 14. September, beginnt DeepSeek, jede deepseek-v4-pro-Anfrage an V4.1-Flash weiterzuleiten und zu Flash-Preisen abzurechnen. Wenn Sie etwas über die DeepSeek-API betreiben, ändert sich Ihre Rechnung diese Woche, egal ob Sie Ihren Code anfassen oder nicht.

Dieser Beitrag ist die Preisgestaltungshälfte der Geschichte: die vollständigen USD- und CNY-Tabellen, die prozentualen Änderungen gegenüber V4-Flash und V4-Pro, wo die Spitzenzeiten in Ihrer Zeitzone liegen, und zwei Cache-Hit-Beispiele mit der gezeigten Rechnung. Für das Modell selbst beginnen Sie mit was DeepSeek-V4.1-Flash ist.

Ein Vorbehalt vorab. Jede Benchmark-Zahl in diesem Cluster ist eine von DeepSeek gemeldete Zahl aus der Modellkarte. Die Preise stammen von der Preisübersicht, verifiziert am 10. September. Der letzte Abschnitt zeigt, wie Sie Ihre eigenen Ausgaben mit Apidog messen können, indem Sie den usage-Block jeder Antwort lesen, anstatt einer Schätzung zu vertrauen.

button

Kurz gesagt (TL;DR)

Die vollständige Preistabelle

Alle Angaben beziehen sich auf 1 Mio. Tokens und sind ab dem 10. September 2026 um 04:00 Uhr UTC gültig.

deepseek-flash außerhalb der Spitzenzeiten deepseek-flash Spitzenzeit deepseek-v4-pro außerhalb der Spitzenzeiten deepseek-v4-pro Spitzenzeit
Eingabe, Cache-Hit $0.003 $0.006 $0.022 $0.044
Eingabe, Cache-Miss $0.15 $0.30 $0.66 $1.32
Ausgabe $0.60 $1.20 $1.98 $3.96
Parallelität 2,500 2,500 500 500

Die Spalten für deepseek-v4-pro sind noch vier Tage lang relevant. Ab dem 14. September um 04:00 Uhr UTC (12:00 Uhr Beijing) werden Anfragen an diesen Modellnamen von V4.1-Flash bedient und gemäß den ersten beiden Spalten abgerechnet. Der Leitfaden zur Einstellung und Migration von V4-Pro behandelt, was vorher getestet werden sollte.

Wenn Ihr Konto in Yuan abgerechnet wird, listet die zh-cn-Preisseite deepseek-flash wie folgt auf:

Außerhalb der Spitzenzeiten (CNY) Spitzenzeit (CNY)
Eingabe, Cache-Hit ¥0.02 ¥0.04
Eingabe, Cache-Miss ¥1.00 ¥2.00
Ausgabe ¥4.00 ¥8.00

Jede CNY-Zeile entspricht der USD-Zeile multipliziert mit etwa 6,67. Zwei Details, die die Tabelle weglässt: Kontext-Caching erfolgt automatisch, ohne dass ein Flag gesetzt werden muss, und die Modell-ID ist jetzt deepseek-flash. Die alten Namen deepseek-v4-flash und deepseek-v4-flash-vision-exp werden immer noch aufgelöst, landen aber zu diesen Tarifen auf V4.1-Flash.

Was sich gegenüber V4-Flash und V4-Pro geändert hat

Am 21. August 2026 wurde deepseek-v4-flash außerhalb der Spitzenzeiten mit 0,007 $ / 0,22 $ / 0,66 $ (Cache-Hit / Cache-Miss / Ausgabe) und zur Spitzenzeit mit 0,014 $ / 0,44 $ / 1,32 $ abgerechnet. Der Changelog besagt, dass die Preisgestaltung mit dieser Veröffentlichung „entsprechend reduziert“ wurde. Hier ist, was „entsprechend“ bedeutet, berechnet aus den beiden Listen:

Posten V4-Flash (21. Aug.) V4.1-Flash (10. Sep.) Reduzierung
Cache-Hit, außerhalb der Spitzenzeiten $0.007 $0.003 57%
Cache-Miss, außerhalb der Spitzenzeiten $0.22 $0.15 32%
Ausgabe, außerhalb der Spitzenzeiten $0.66 $0.60 9%

Die Spitzenzeit-Zeilen weisen identische Prozentsätze auf, da beide Listen zur Spitzenzeit verdoppelt werden. Das Muster ist beabsichtigt: die stärkste Kürzung betrifft Cache-Hits, die geringste die Ausgabe. DeepSeek kalkuliert Preise für Agenten-Schleifen, die bei jeder Runde ein langes Präfix erneut lesen, und der FP4 KV-Cache in V4.1 (890 Bytes pro Token, etwa ein Viertel des Platzbedarfs von V4-Flash) ist das, was einen Trefferpreis von 0,003 $ auf ihrer Seite nachhaltig macht.

Für V4-Pro-Benutzer sind die Zahlen größer, da die Umleitung zu Flash-Tarifen erfolgt:

DeepSeek sagt, dass V4.1-Flash „V4 Pro in Leistung, Kosten, Geschwindigkeit und Gesamtzeit umfassend übertroffen hat“, eine Behauptung, die Sie vor dem 14. mit Ihren eigenen Prompts überprüfen sollten. Für den längeren Verlauf der Preisgestaltung der Familie, einschließlich des Zeitraums, in dem DeepSeek die API-Preise erhöhte, enthält der DeepSeek V4 API-Preisübersicht die Historie.

Spitzenzeiten in Ihrer Zeitzone

Spitzenzeiten gelten nur von Montag bis Freitag, in zwei Blöcken: 01:00 bis 04:00 Uhr UTC und 06:00 bis 10:00 Uhr UTC. Das sind 9:00 bis 12:00 Uhr und 14:00 bis 18:00 Uhr Pekinger Zeit. Sieben Spitzenstunden pro Wochentag, 35 pro Woche, somit deckt die Spitzenzeit etwa 21 % der 168-Stunden-Woche ab. Alles andere, einschließlich des gesamten Samstags und Sonntags, wird zum Off-Peak-Tarif abgerechnet.

Fenster UTC Peking (UTC+8) US-Pazifik (PDT, UTC-7) Mitteleuropa (CEST, UTC+2)
Spitze 1 01:00 bis 04:00 09:00 bis 12:00 18:00 bis 21:00 (Vorabend) 03:00 bis 06:00
Spitze 2 06:00 bis 10:00 14:00 bis 18:00 23:00 bis 03:00 (über Nacht) 08:00 bis 12:00

Die Spalten für den Pazifik und Mitteleuropa verwenden die Sommerzeit. Nach der Zeitumstellung (25. Oktober in der EU, 1. November in den USA) verschieben sich beide Spalten um eine Stunde nach vorne. Die UTC-Grenzen bleiben unverändert.

Ein Arbeitstag an der US-Westküste berührt nie einen Spitzenblock. Ein mitteleuropäischer Vormittag liegt innerhalb von Spitze 2, und ein europäischer Nacht-Batch um 03:00 Uhr Ortszeit zahlt doppelt; die Verschiebung auf 23:00 Uhr MESZ (21:00 Uhr UTC) halbiert den Preis.

Cache-Hit-Berechnung, zweimal durchgeführt

Ein Treffer kostet 1/50 eines Fehlschlags (0,003 $ gegenüber 0,15 $), sodass das Verhältnis von wiederholtem Präfix zu neuen Tokens Ihre Eingabekosten stärker bestimmt als die reine Token-Anzahl. Wenn das Präfix-Caching für Sie neu ist, erklärt der Einführung in das Prompt-Caching, was als cachierbares Präfix zählt: identische Bytes am Anfang der Anfrage.

Beispiel 1: Eine Agenten-Schleife mit einem 20K-Token-Systemprompt, 1.000 Aufrufe zur Spitzenzeit.

Ein Support-Triage-Agent verwendet einen 20.000-Token-Systemprompt (Richtlinien, Tool-Schemas, Few-Shot-Beispiele), liest 2.000 neue Tokens Text pro Anruf und schreibt 1.000 Ausgabe-Tokens. Über 1.000 Anrufe:

  1. Die gesamte Eingabe beträgt 1.000 × 22.000 = 22 Mio. Tokens. Die gesamte Ausgabe beträgt 1 Mio. Tokens.
  2. Der erste Aufruf verfehlt alle 22.000 Tokens. Jeder spätere Aufruf trifft das 20.000-Token-Präfix und verfehlt seine 2.000 neuen Tokens.
  3. Getroffene Tokens: 999 × 20.000 = 19,98 Mio. Bei 0,006 $ pro 1 Mio.: 19,98 × 0,006 = 0,12 $.
  4. Verfehlte Tokens: 22.000 + 999 × 2.000 = 2,02 Mio. Bei 0,30 $ pro 1 Mio.: 2,02 × 0,30 = 0,61 $.
  5. Ausgabe: 1 Mio. × 1,20 $ = 1,20 $.
  6. Gesamt: 0,12 $ + 0,61 $ + 1,20 $ = 1,93 $.

Ohne Caching würde die Eingabe allein 22 × 0,30 $ = 6,60 $ kosten und der Auftrag 7,80 $. Caching reduziert die Rechnung um 75 %. Führen Sie die identische Schleife außerhalb der Spitzenzeiten aus und jede Zeile halbiert sich: 0,06 $ + 0,30 $ + 0,60 $ = 0,96 $.

Die gleichen 1.000 Aufrufe auf V4-Pro zur Spitzenzeit (Treffer 0,88 $, Fehlschläge 2,67 $, Ausgabe 3,96 $) belaufen sich auf insgesamt 7,51 $, den Betrag, den ein Pro-Kunde dem Wert von 1,93 $ gegenüberstellen sollte, wenn die Umleitung erfolgt.

Beispiel 2: Ein Batch-Job mit 10 Mio. Ausgabe-Tokens, außerhalb der Spitzenzeiten verschoben.

Ein Katalogteam generiert 10.000 Produktbeschreibungen. Jeder Anruf sendet 1.500 Tokens Produktdaten (einzigartig pro Artikel, also kein Cache-Vorteil) und erhält 1.000 Tokens Text zurück. Das sind 15 Mio. Eingabe-Tokens, alles Fehlschläge, und 10 Mio. Ausgabe-Tokens.

  1. Zur Spitzenzeit: Eingabe 15 × 0,30 $ = 4,50 $. Ausgabe 10 × 1,20 $ = 12,00 $. Gesamt 16,50 $.
  2. Außerhalb der Spitzenzeiten: Eingabe 15 × 0,15 $ = 2,25 $. Ausgabe 10 × 0,60 $ = 6,00 $. Gesamt 8,25 $.
  3. Einsparungen allein durch den Zeitpunkt: 8,25 $, ohne Änderung der Prompts.

Die Ausgabe dominiert diesen Auftrag und erhielt die kleinste Reduzierung in der Veröffentlichung, daher ist das Off-Peak-Fenster der größere Hebel. Es ist ein großzügiges Fenster: 15 Stunden an jedem Wochentag ab 10:00 Uhr UTC, plus 48 ununterbrochene Stunden jedes Wochenende.

Kontext, Ausgabe und warum Parallelität Teil des Preises ist

Beide Modellnamen verfügen über einen 1M-Token-Kontext und eine maximale Ausgabe von 384K-Tokens. Die Modellkarte empfiehlt eine maximale Token-Anzahl von 256K oder mehr, daher sollte diese Obergrenze bewusst festgelegt werden: Eine Antwort, die bis zu 384K Ausgabe-Tokens umfasst, kostet zur Spitzenzeit 0,46 $, was für ein Agenten-Transkript in Ordnung ist, aber ein Fehler für die automatische Vervollständigung wäre.

Die Parallelität beträgt 2.500 für Flash gegenüber 500 für Pro. Sie gehört in einen Preisartikel, weil der Off-Peak-Rabatt nur dann etwas wert ist, wenn Sie die Arbeit durch das Fenster schieben können, und weil der deepseek-v4-pro-Verkehr, der am 14. September umgeleitet wird, die Flash-Begrenzung erbt: Eine Pro-Integration, die früher hinter 500 Slots in der Warteschlange stand, erhält das Fünffache an Kapazität ohne Konfigurationsänderung.

Reale Ausgaben mit Apidog messen

Preistabellen geben Ihnen den Preis. Das usage-Objekt jeder Antwort sagt Ihnen, wofür Sie abgerechnet wurden. Hier ist ein Apidog-Workflow, der dies zu einer wiederholbaren Überprüfung macht.

  1. Den Endpunkt hinzufügen. Erstellen Sie POST https://api.deepseek.com/chat/completions, oder importieren Sie eine OpenAI-kompatible OpenAPI-Spezifikation.
  2. Preise in Umgebungen speichern. Erstellen Sie zwei Apidog-Umgebungen, deepseek-peak und deepseek-offpeak, die jeweils DEEPSEEK_API_KEY sowie PRICE_HIT, PRICE_MISS und PRICE_OUT als {{variables}} enthalten. Peak enthält 0.006 / 0.30 / 1.20; Off-Peak enthält 0.003 / 0.15 / 0.60.
  3. Einmal senden und usage lesen. DeepSeek teilt die Eingabe in prompt_cache_hit_tokens und prompt_cache_miss_tokens neben completion_tokens auf [VERIFIZIEREN]. Speichern Sie die Anfrage als Testfall.
  4. Ein Testszenario erstellen, das das Cache-Verhalten überprüft. Verketten Sie die gespeicherte Anfrage zweimal mit demselben 20K-Token-Systemprompt. Im zweiten Schritt stellen Sie sicher, dass das Hit-Token-Feld mindestens 19.000 beträgt und dass die berechneten Kosten (Hits × {{PRICE_HIT}} + Misses × {{PRICE_MISS}} + Ausgabe × {{PRICE_OUT}}, geteilt durch 1M) unter dem Budget bleiben. Ein Miss im zweiten Schritt bedeutet, dass sich das Präfix geändert hat, und die Überprüfung fängt dies ab, bevor die Rechnung kommt.
  5. Peak mit Off-Peak vergleichen. Führen Sie das Szenario in jeder Umgebung aus und vergleichen Sie die Kostenzeile, oder führen Sie es von CI mit apidog-cli nach einem Zeitplan aus, der eine UTC-Peak-Grenze überschreitet.

Laden Sie Apidog herunter, und das gesamte Szenario, einschließlich der Umgebungen, funktioniert mit dem kostenlosen Plan.

Wie sich dies auf Ihre Rechnung auswirkt

V4.1-Flash ist in jeder Hinsicht günstiger als V4-Flash und 70 bis 86 % günstiger als die V4-Pro-Tarife, die es ersetzt. Zwei Hebel sind wichtig: Halten Sie Ihr langes Präfix byte-identisch, damit es den Cache trifft, und planen Sie Batch-Arbeiten außerhalb der sieben Spitzenstunden an Wochentagen. Protokollieren Sie dann die usage bei jedem Aufruf, überprüfen Sie die Trefferzahl und lassen Sie sich von den Zahlen zeigen, ob die Preissenkung Ihre Rechnung erreicht hat.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen