DeepSeek-V4.1-Flash wurde am 10. September 2026 für die API allgemein verfügbar (GA), und die Release Notes enthielten eine Preissenkung. Cache-Hit-Eingaben kosten jetzt außerhalb der Spitzenzeiten 0,003 $ pro Million Tokens, Cache-Miss-Eingaben 0,15 $, Ausgaben 0,60 $. Vier Tage später, am 14. September, beginnt DeepSeek, jede deepseek-v4-pro-Anfrage an V4.1-Flash weiterzuleiten und zu Flash-Preisen abzurechnen. Wenn Sie etwas über die DeepSeek-API betreiben, ändert sich Ihre Rechnung diese Woche, egal ob Sie Ihren Code anfassen oder nicht.
Dieser Beitrag ist die Preisgestaltungshälfte der Geschichte: die vollständigen USD- und CNY-Tabellen, die prozentualen Änderungen gegenüber V4-Flash und V4-Pro, wo die Spitzenzeiten in Ihrer Zeitzone liegen, und zwei Cache-Hit-Beispiele mit der gezeigten Rechnung. Für das Modell selbst beginnen Sie mit was DeepSeek-V4.1-Flash ist.
Ein Vorbehalt vorab. Jede Benchmark-Zahl in diesem Cluster ist eine von DeepSeek gemeldete Zahl aus der Modellkarte. Die Preise stammen von der Preisübersicht, verifiziert am 10. September. Der letzte Abschnitt zeigt, wie Sie Ihre eigenen Ausgaben mit Apidog messen können, indem Sie den usage-Block jeder Antwort lesen, anstatt einer Schätzung zu vertrauen.
Kurz gesagt (TL;DR)
- Außerhalb der Spitzenzeiten kostet
deepseek-flash0,003 $ pro 1 Mio. Cache-Hit-Eingabe-Tokens, 0,15 $ pro 1 Mio. Cache-Miss-Eingabe-Tokens und 0,60 $ pro 1 Mio. Ausgabe-Tokens. Die Spitzenzeit ist genau doppelt so teuer. - Im Vergleich zu V4-Flash am 21. August: Cache-Hit-Eingabe um 57 % gesunken, Cache-Miss-Eingabe um 32 % gesunken, Ausgabe um 9 % gesunken.
- Im Vergleich zu V4-Pro zur Spitzenzeit: Eine umgeleitete Arbeitslast zahlt ab dem 14. September 77 % weniger für Cache-Miss-Eingaben und 70 % weniger für Ausgaben.
- Die Spitzenzeit ist von Montag bis Freitag, 01:00 bis 04:00 Uhr und 06:00 bis 10:00 Uhr UTC. Wochenenden sind vollständig außerhalb der Spitzenzeiten.
Die vollständige Preistabelle
Alle Angaben beziehen sich auf 1 Mio. Tokens und sind ab dem 10. September 2026 um 04:00 Uhr UTC gültig.
| deepseek-flash außerhalb der Spitzenzeiten | deepseek-flash Spitzenzeit | deepseek-v4-pro außerhalb der Spitzenzeiten | deepseek-v4-pro Spitzenzeit | |
|---|---|---|---|---|
| Eingabe, Cache-Hit | $0.003 | $0.006 | $0.022 | $0.044 |
| Eingabe, Cache-Miss | $0.15 | $0.30 | $0.66 | $1.32 |
| Ausgabe | $0.60 | $1.20 | $1.98 | $3.96 |
| Parallelität | 2,500 | 2,500 | 500 | 500 |
Die Spalten für deepseek-v4-pro sind noch vier Tage lang relevant. Ab dem 14. September um 04:00 Uhr UTC (12:00 Uhr Beijing) werden Anfragen an diesen Modellnamen von V4.1-Flash bedient und gemäß den ersten beiden Spalten abgerechnet. Der Leitfaden zur Einstellung und Migration von V4-Pro behandelt, was vorher getestet werden sollte.
Wenn Ihr Konto in Yuan abgerechnet wird, listet die zh-cn-Preisseite deepseek-flash wie folgt auf:
| Außerhalb der Spitzenzeiten (CNY) | Spitzenzeit (CNY) | |
|---|---|---|
| Eingabe, Cache-Hit | ¥0.02 | ¥0.04 |
| Eingabe, Cache-Miss | ¥1.00 | ¥2.00 |
| Ausgabe | ¥4.00 | ¥8.00 |
Jede CNY-Zeile entspricht der USD-Zeile multipliziert mit etwa 6,67. Zwei Details, die die Tabelle weglässt: Kontext-Caching erfolgt automatisch, ohne dass ein Flag gesetzt werden muss, und die Modell-ID ist jetzt deepseek-flash. Die alten Namen deepseek-v4-flash und deepseek-v4-flash-vision-exp werden immer noch aufgelöst, landen aber zu diesen Tarifen auf V4.1-Flash.
Was sich gegenüber V4-Flash und V4-Pro geändert hat
Am 21. August 2026 wurde deepseek-v4-flash außerhalb der Spitzenzeiten mit 0,007 $ / 0,22 $ / 0,66 $ (Cache-Hit / Cache-Miss / Ausgabe) und zur Spitzenzeit mit 0,014 $ / 0,44 $ / 1,32 $ abgerechnet. Der Changelog besagt, dass die Preisgestaltung mit dieser Veröffentlichung „entsprechend reduziert“ wurde. Hier ist, was „entsprechend“ bedeutet, berechnet aus den beiden Listen:
| Posten | V4-Flash (21. Aug.) | V4.1-Flash (10. Sep.) | Reduzierung |
|---|---|---|---|
| Cache-Hit, außerhalb der Spitzenzeiten | $0.007 | $0.003 | 57% |
| Cache-Miss, außerhalb der Spitzenzeiten | $0.22 | $0.15 | 32% |
| Ausgabe, außerhalb der Spitzenzeiten | $0.66 | $0.60 | 9% |
Die Spitzenzeit-Zeilen weisen identische Prozentsätze auf, da beide Listen zur Spitzenzeit verdoppelt werden. Das Muster ist beabsichtigt: die stärkste Kürzung betrifft Cache-Hits, die geringste die Ausgabe. DeepSeek kalkuliert Preise für Agenten-Schleifen, die bei jeder Runde ein langes Präfix erneut lesen, und der FP4 KV-Cache in V4.1 (890 Bytes pro Token, etwa ein Viertel des Platzbedarfs von V4-Flash) ist das, was einen Trefferpreis von 0,003 $ auf ihrer Seite nachhaltig macht.
Für V4-Pro-Benutzer sind die Zahlen größer, da die Umleitung zu Flash-Tarifen erfolgt:
- Cache-Miss-Eingabe zur Spitzenzeit: 1,32 $ werden zu 0,30 $, eine Reduzierung um 77 %.
- Ausgabe zur Spitzenzeit: 3,96 $ werden zu 1,20 $, eine Reduzierung um 70 %.
- Cache-Hit-Eingabe zur Spitzenzeit: 0,044 $ werden zu 0,006 $, eine Reduzierung um 86 %.
DeepSeek sagt, dass V4.1-Flash „V4 Pro in Leistung, Kosten, Geschwindigkeit und Gesamtzeit umfassend übertroffen hat“, eine Behauptung, die Sie vor dem 14. mit Ihren eigenen Prompts überprüfen sollten. Für den längeren Verlauf der Preisgestaltung der Familie, einschließlich des Zeitraums, in dem DeepSeek die API-Preise erhöhte, enthält der DeepSeek V4 API-Preisübersicht die Historie.
Spitzenzeiten in Ihrer Zeitzone
Spitzenzeiten gelten nur von Montag bis Freitag, in zwei Blöcken: 01:00 bis 04:00 Uhr UTC und 06:00 bis 10:00 Uhr UTC. Das sind 9:00 bis 12:00 Uhr und 14:00 bis 18:00 Uhr Pekinger Zeit. Sieben Spitzenstunden pro Wochentag, 35 pro Woche, somit deckt die Spitzenzeit etwa 21 % der 168-Stunden-Woche ab. Alles andere, einschließlich des gesamten Samstags und Sonntags, wird zum Off-Peak-Tarif abgerechnet.
| Fenster | UTC | Peking (UTC+8) | US-Pazifik (PDT, UTC-7) | Mitteleuropa (CEST, UTC+2) |
|---|---|---|---|---|
| Spitze 1 | 01:00 bis 04:00 | 09:00 bis 12:00 | 18:00 bis 21:00 (Vorabend) | 03:00 bis 06:00 |
| Spitze 2 | 06:00 bis 10:00 | 14:00 bis 18:00 | 23:00 bis 03:00 (über Nacht) | 08:00 bis 12:00 |
Die Spalten für den Pazifik und Mitteleuropa verwenden die Sommerzeit. Nach der Zeitumstellung (25. Oktober in der EU, 1. November in den USA) verschieben sich beide Spalten um eine Stunde nach vorne. Die UTC-Grenzen bleiben unverändert.
Ein Arbeitstag an der US-Westküste berührt nie einen Spitzenblock. Ein mitteleuropäischer Vormittag liegt innerhalb von Spitze 2, und ein europäischer Nacht-Batch um 03:00 Uhr Ortszeit zahlt doppelt; die Verschiebung auf 23:00 Uhr MESZ (21:00 Uhr UTC) halbiert den Preis.
Cache-Hit-Berechnung, zweimal durchgeführt
Ein Treffer kostet 1/50 eines Fehlschlags (0,003 $ gegenüber 0,15 $), sodass das Verhältnis von wiederholtem Präfix zu neuen Tokens Ihre Eingabekosten stärker bestimmt als die reine Token-Anzahl. Wenn das Präfix-Caching für Sie neu ist, erklärt der Einführung in das Prompt-Caching, was als cachierbares Präfix zählt: identische Bytes am Anfang der Anfrage.
Beispiel 1: Eine Agenten-Schleife mit einem 20K-Token-Systemprompt, 1.000 Aufrufe zur Spitzenzeit.
Ein Support-Triage-Agent verwendet einen 20.000-Token-Systemprompt (Richtlinien, Tool-Schemas, Few-Shot-Beispiele), liest 2.000 neue Tokens Text pro Anruf und schreibt 1.000 Ausgabe-Tokens. Über 1.000 Anrufe:
- Die gesamte Eingabe beträgt 1.000 × 22.000 = 22 Mio. Tokens. Die gesamte Ausgabe beträgt 1 Mio. Tokens.
- Der erste Aufruf verfehlt alle 22.000 Tokens. Jeder spätere Aufruf trifft das 20.000-Token-Präfix und verfehlt seine 2.000 neuen Tokens.
- Getroffene Tokens: 999 × 20.000 = 19,98 Mio. Bei 0,006 $ pro 1 Mio.: 19,98 × 0,006 = 0,12 $.
- Verfehlte Tokens: 22.000 + 999 × 2.000 = 2,02 Mio. Bei 0,30 $ pro 1 Mio.: 2,02 × 0,30 = 0,61 $.
- Ausgabe: 1 Mio. × 1,20 $ = 1,20 $.
- Gesamt: 0,12 $ + 0,61 $ + 1,20 $ = 1,93 $.
Ohne Caching würde die Eingabe allein 22 × 0,30 $ = 6,60 $ kosten und der Auftrag 7,80 $. Caching reduziert die Rechnung um 75 %. Führen Sie die identische Schleife außerhalb der Spitzenzeiten aus und jede Zeile halbiert sich: 0,06 $ + 0,30 $ + 0,60 $ = 0,96 $.
Die gleichen 1.000 Aufrufe auf V4-Pro zur Spitzenzeit (Treffer 0,88 $, Fehlschläge 2,67 $, Ausgabe 3,96 $) belaufen sich auf insgesamt 7,51 $, den Betrag, den ein Pro-Kunde dem Wert von 1,93 $ gegenüberstellen sollte, wenn die Umleitung erfolgt.
Beispiel 2: Ein Batch-Job mit 10 Mio. Ausgabe-Tokens, außerhalb der Spitzenzeiten verschoben.
Ein Katalogteam generiert 10.000 Produktbeschreibungen. Jeder Anruf sendet 1.500 Tokens Produktdaten (einzigartig pro Artikel, also kein Cache-Vorteil) und erhält 1.000 Tokens Text zurück. Das sind 15 Mio. Eingabe-Tokens, alles Fehlschläge, und 10 Mio. Ausgabe-Tokens.
- Zur Spitzenzeit: Eingabe 15 × 0,30 $ = 4,50 $. Ausgabe 10 × 1,20 $ = 12,00 $. Gesamt 16,50 $.
- Außerhalb der Spitzenzeiten: Eingabe 15 × 0,15 $ = 2,25 $. Ausgabe 10 × 0,60 $ = 6,00 $. Gesamt 8,25 $.
- Einsparungen allein durch den Zeitpunkt: 8,25 $, ohne Änderung der Prompts.
Die Ausgabe dominiert diesen Auftrag und erhielt die kleinste Reduzierung in der Veröffentlichung, daher ist das Off-Peak-Fenster der größere Hebel. Es ist ein großzügiges Fenster: 15 Stunden an jedem Wochentag ab 10:00 Uhr UTC, plus 48 ununterbrochene Stunden jedes Wochenende.
Kontext, Ausgabe und warum Parallelität Teil des Preises ist
Beide Modellnamen verfügen über einen 1M-Token-Kontext und eine maximale Ausgabe von 384K-Tokens. Die Modellkarte empfiehlt eine maximale Token-Anzahl von 256K oder mehr, daher sollte diese Obergrenze bewusst festgelegt werden: Eine Antwort, die bis zu 384K Ausgabe-Tokens umfasst, kostet zur Spitzenzeit 0,46 $, was für ein Agenten-Transkript in Ordnung ist, aber ein Fehler für die automatische Vervollständigung wäre.
Die Parallelität beträgt 2.500 für Flash gegenüber 500 für Pro. Sie gehört in einen Preisartikel, weil der Off-Peak-Rabatt nur dann etwas wert ist, wenn Sie die Arbeit durch das Fenster schieben können, und weil der deepseek-v4-pro-Verkehr, der am 14. September umgeleitet wird, die Flash-Begrenzung erbt: Eine Pro-Integration, die früher hinter 500 Slots in der Warteschlange stand, erhält das Fünffache an Kapazität ohne Konfigurationsänderung.
Reale Ausgaben mit Apidog messen
Preistabellen geben Ihnen den Preis. Das usage-Objekt jeder Antwort sagt Ihnen, wofür Sie abgerechnet wurden. Hier ist ein Apidog-Workflow, der dies zu einer wiederholbaren Überprüfung macht.

- Den Endpunkt hinzufügen. Erstellen Sie
POST https://api.deepseek.com/chat/completions, oder importieren Sie eine OpenAI-kompatible OpenAPI-Spezifikation. - Preise in Umgebungen speichern. Erstellen Sie zwei Apidog-Umgebungen,
deepseek-peakunddeepseek-offpeak, die jeweilsDEEPSEEK_API_KEYsowiePRICE_HIT,PRICE_MISSundPRICE_OUTals{{variables}}enthalten. Peak enthält 0.006 / 0.30 / 1.20; Off-Peak enthält 0.003 / 0.15 / 0.60. - Einmal senden und
usagelesen. DeepSeek teilt die Eingabe inprompt_cache_hit_tokensundprompt_cache_miss_tokensnebencompletion_tokensauf [VERIFIZIEREN]. Speichern Sie die Anfrage als Testfall. - Ein Testszenario erstellen, das das Cache-Verhalten überprüft. Verketten Sie die gespeicherte Anfrage zweimal mit demselben 20K-Token-Systemprompt. Im zweiten Schritt stellen Sie sicher, dass das Hit-Token-Feld mindestens 19.000 beträgt und dass die berechneten Kosten (Hits ×
{{PRICE_HIT}}+ Misses ×{{PRICE_MISS}}+ Ausgabe ×{{PRICE_OUT}}, geteilt durch 1M) unter dem Budget bleiben. Ein Miss im zweiten Schritt bedeutet, dass sich das Präfix geändert hat, und die Überprüfung fängt dies ab, bevor die Rechnung kommt. - Peak mit Off-Peak vergleichen. Führen Sie das Szenario in jeder Umgebung aus und vergleichen Sie die Kostenzeile, oder führen Sie es von CI mit
apidog-clinach einem Zeitplan aus, der eine UTC-Peak-Grenze überschreitet.
Laden Sie Apidog herunter, und das gesamte Szenario, einschließlich der Umgebungen, funktioniert mit dem kostenlosen Plan.
Wie sich dies auf Ihre Rechnung auswirkt
V4.1-Flash ist in jeder Hinsicht günstiger als V4-Flash und 70 bis 86 % günstiger als die V4-Pro-Tarife, die es ersetzt. Zwei Hebel sind wichtig: Halten Sie Ihr langes Präfix byte-identisch, damit es den Cache trifft, und planen Sie Batch-Arbeiten außerhalb der sieben Spitzenstunden an Wochentagen. Protokollieren Sie dann die usage bei jedem Aufruf, überprüfen Sie die Trefferzahl und lassen Sie sich von den Zahlen zeigen, ob die Preissenkung Ihre Rechnung erreicht hat.
