DeepSeek-V4.1-Flash wurde am 10. September 2026 auf der API allgemein verfügbar (GA) und brachte zwei Fakten mit sich, die „kostenlos“ zu einer echten Frage statt zu einem Marketing-Trick machen. Die Gewichte sind auf Hugging Face unter der MIT-Lizenz verfügbar, sodass das Modell selbst nichts kostet. Und die offizielle API berechnet Cache-Treffer-Input außerhalb der Spitzenzeiten mit 0,003 $ pro 1 Million Tokens, nahe genug bei Null, dass die Grenze zwischen kostenlos und nahezu kostenlos für die meisten Nebenprojekte irrelevant wird.
Es gibt immer noch keine permanente kostenlose Stufe (Free Tier) für die DeepSeek API. Wer Ihnen etwas anderes erzählt, beschreibt eine Router-Promo oder die Consumer-Chat-App. Dieser Leitfaden listet jede ehrliche Möglichkeit auf, V4.1-Flash kostenlos zu nutzen, zeigt dann die Kosten des kostenpflichtigen Weges auf, damit Sie entscheiden können, ob „nahezu kostenlos“ ausreicht. Wenn Sie zuerst die Architekturgeschichte wissen möchten, lesen Sie was DeepSeek-V4.1-Flash ist und kommen Sie dann zurück.
Zuerst ein Hinweis. Mehrere kostenlose Wege fĂĽhren ĂĽber Drittanbieter-Endpoints, die Sie ratenbegrenzen und manchmal Modelle stillschweigend austauschen. Wenn Sie diese mit Apidog testen, indem Sie Antworten aufzeichnen und das Modellfeld ĂĽberprĂĽfen, wird Ihr kostenloses Kontingent nicht fĂĽr Ihr eigenes Debugging verbraucht. Dieser Workflow wird am Ende dieses Leitfadens beschrieben.
TL;DR
Rangfolge von „kostenlos und ohne Verpflichtungen“ bis „nahezu kostenlos mit hinterlegter Karte“:
- Die DeepSeek-Chat-App unter chat.deepseek.com. Kostenlos, keine Karte erforderlich. Am besten zur manuellen Beurteilung der Ausgabequalität.
- Die offenen Gewichte auf Hugging Face. Kostenlos unter MIT, aber 552 Milliarden Parameter bedeuten, dass die Hardware die Kosten verursacht.
- Drittanbieter-Router wie OpenRouter. Kostenlose Stufen (Free Tiers) existieren fĂĽr einige Modelle zeitweise, mit Ratenbegrenzungen und Kompromissen bei den Datenrichtlinien.
- GebĂĽndelte Test-Credits in Codierungs-Tools. Nur nĂĽtzlich, wenn das Tool DeepSeek bereits als Backend integriert hat.
- Die offizielle API. Nicht kostenlos, aber ein Hobbyprojekt läuft außerhalb der Spitzenzeiten für etwa 1,35 $ pro Monat.
Option 1: Die DeepSeek Chat-App
Die Consumer-App unter chat.deepseek.com ist der reibungsloseste Weg. Melden Sie sich mit einer E-Mail-Adresse oder Telefonnummer an, keine Karte erforderlich, und beginnen Sie mit dem Prompting.
Zwei Vorbehalte. Erstens, welches Modell die App nach der heutigen Veröffentlichung bereitstellt, ist [ZU PRÜFEN]. Die Release Note behandelt die API, und die App hinkte der API zuvor hinterher oder lief mit einem separat angepassten Build. Zweitens ist die App eine Chat-Oberfläche, keine API. Sie können sie nicht skripten, Prompts stapeln oder in ein Produkt einbinden.
Die App beantwortet also eine Frage: Beherrscht V4.1-Flash Ihren Bereich gut genug, um eine Integration zu rechtfertigen? FĂĽgen Sie die Eingaben Ihrer Benutzer ein, Bilder eingeschlossen, da das Modell nativ multimodal ist. Wenn die Antworten ĂĽberzeugen, wechseln Sie zu einer der unten genannten Optionen.
Option 2: Die offenen Gewichte
DeepSeek veröffentlichte die V4.1-Flash Gewichte und den technischen Bericht unter der MIT-Lizenz. Sie können sie herunterladen, ausführen, feinabstimmen und Produkte darauf basierend versenden, ohne DeepSeek zu bezahlen oder um Erlaubnis zu bitten.

Der Haken ist die Größe. V4.1-Flash ist ein 552B-Parameter Mixture-of-Experts-Backbone (763B mit dem Vision-Encoder). Nur 8 Milliarden Parameter sind während des Prefills und 16 Milliarden während des Decodes aktiv, aber der vollständige Parametersatz muss immer noch irgendwo existieren. Bei 8 Bit sind das allein für den Backbone etwa 552 GB; bei 4 Bit etwa 280 GB. Eine einzelne Consumer-GPU kommt dem nicht nahe. Der KV-Cache ist die gute Nachricht: Bei 890 Bytes pro Token unter FP4-Caching benötigt ein vollständiger 1-Million-Token-Kontext etwa 0,9 GB.
„Kostenlos“ bedeutet hier lizenzfrei, nicht betriebsfrei. Lesen Sie wie man DeepSeek-V4.1-Flash lokal ausführt für die Hardware-Stufen und welche Inferenz-Engines Sie überprüfen sollten, bevor Sie 280 GB herunterladen. Wenn Sie die Hardware bereits besitzen, ist dies die beständigste kostenlose Option auf dieser Seite: keine Ratenbegrenzungen, keine Datenrichtlinien, kein stillschweigender Modellaustausch.
Option 3: Die offizielle API ist nicht kostenlos, aber sie ist nah dran
Die DeepSeek-Plattform funktioniert nach dem Pay-as-you-go-Prinzip. Sie laden ein Guthaben auf, erstellen einen SchlĂĽssel und werden pro Token abgerechnet. Es gibt keine permanente kostenlose Stufe (Free Tier).

Was ihr einen Platz auf einer „kostenlos“-Seite einbringt, ist der Preis. Hier ist die vollständige USD-Tabelle von der offiziellen Preisgestaltungsseite, gültig ab 10. September 2026, 04:00 UTC, pro 1 Million Tokens:
| Token-Typ | deepseek-flash auĂźerhalb der Spitzenzeiten | deepseek-flash Spitzenzeiten |
|---|---|---|
| Eingabe, Cache-Treffer | $0.003 | $0.006 |
| Eingabe, Cache-Fehlzugriff | $0.15 | $0.30 |
| Ausgabe | $0.60 | $1.20 |
Spitzenzeiten sind Montag bis Freitag, 01:00 bis 04:00 und 06:00 bis 10:00 UTC (09:00 bis 12:00 und 14:00 bis 18:00 Peking-Zeit). Alles andere, Wochenenden eingeschlossen, ist außerhalb der Spitzenzeiten zum halben Preis. Kontext-Caching ist automatisch, sodass wiederholte System-Prompts den Cache ohne zusätzlichen Code treffen.
Nun zur Berechnung. Angenommen, ein Nebenprojekt sendet 5 Millionen Tokens frischer (Cache-Fehlzugriff) Eingabe und generiert 1 Million Tokens Ausgabe in einem Monat, alles auĂźerhalb der Spitzenzeiten:
- 5 Millionen Cache-Fehlzugriffs-Eingaben zu 0,15 $ pro 1 Million = 0,75 $
- 1 Million Ausgaben zu 0,60 $ pro 1 Million = 0,60 $
- Gesamt: 1,35 $ pro Monat
Wenn ein Teil dieser Eingabe ein wiederholter System-Prompt ist, sinken die Kosten weiter. 1 Million Cache-Treffer-Tokens außerhalb der Spitzenzeiten kosten 0,003 $, sodass ein 2.000-Token-System-Prompt, der über 10.000 Anfragen (20 Millionen gecachte Tokens) wiederverwendet wird, sechs Cent hinzufügt. Die Rechnung beläuft sich auf Peanuts, und Sie erhalten das exakte Modell, das Sie angefordert haben, bei einer gleichzeitigen Anfragelimite von 2.500. Die V4.1-Flash Preisübersicht erklärt, wie sich die Berechnung mit der Prompt-Struktur verschiebt.
Ein minimaler Aufruf, mit dem Nutzungsblock gedruckt, damit Sie die Cache-Aufteilung sehen können:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "system", "content": "You classify support tickets as billing, bug, or feature request."},
{"role": "user", "content": "Customer says their August invoice shows two charges for one seat."},
],
)
print(response.choices[0].message.content)
print(response.usage)
Optionen 4 und 5: Router, kostenlose Stufen (Free Tiers) und gebĂĽndelte Credits
OpenRouter ist der übliche Ort, um nach einem kostenlosen Endpunkt für ein neues Open-Weight-Modell zu suchen. Router aggregieren mehrere Hosts hinter einer OpenAI-kompatiblen API, und Hosts betreiben manchmal eine kostenlose Stufe (Free Tier) für ein Modell, um Traffic anzuziehen. Ob V4.1-Flash heute dort gelistet ist und ob ein Host eine kostenlose Stufe dafür anbietet, ist [ZU PRÜFEN]; das Modell ist erst Stunden alt und die Einträge ändern sich schnell.

Drei Warnungen gelten fĂĽr jede kostenlose Stufe (Free Tier) eines Routers:
- Ratenbegrenzungen sind streng. Pro-Minute- und Pro-Tag-Limits können dazu führen, dass eine Testschleife das Tageskontingent in einer Stunde aufbraucht.
- Datenrichtlinien unterscheiden sich je nach Host. Kostenloser Traffic darf oft von einem Host protokolliert oder zum Training verwendet werden. Lesen Sie die Richtlinie, bevor Sie private Daten senden.
- Kostenlose Stufen ändern sich wöchentlich. Was am Montag kostenlos ist, kann am Freitag kostenpflichtig sein oder an einen anderen Host weitergeleitet werden. Bauen Sie keine Produktionsabhängigkeit darauf auf.
Das Problem, auf das man achten sollte, ist der stillschweigende Modellaustausch: Sie fragen V4.1-Flash an, und ein älteres Modell antwortet, weil der kostenlose Host ausgefallen ist. Das model-Feld der Antwort ist Ihre erste Verteidigungslinie, und der unten beschriebene Workflow überprüft dies.
Einige Codierungs-Tools, darunter Cursor und Codex-ähnliche Agenten, bündeln Test-Credits, die Sie für die vom Tool unterstützten Backends ausgeben können. Wenn ein Tool, das Sie bereits verwenden, DeepSeek als auswählbares Modell auflistet, sind diese Credits ein legitimer kostenloser Weg für die Dauer des Testzeitraums. Melden Sie sich nicht nur deshalb bei einem Tool an, um DeepSeek auf diese Weise zu erreichen; die Kreditmengen und berechtigten Modelle ändern sich zu oft, um sie zu dokumentieren.
Welche Option passt zu Ihrer Situation
| Option | Kosten | Modell garantiert? | Ratenbegrenzungen | Am besten geeignet fĂĽr |
|---|---|---|---|---|
| DeepSeek Chat-App | Kostenlos | Hängt vom App-Build ab | Nutzungslimits der App | Manuelle Bewertung, schnelle Überprüfungen |
| Offene Gewichte (MIT) | Kostenlose Lizenz, Ihre Hardware | Ja, Sie betreiben es | Keine | Datenschutz, Fine-Tuning, eigene GPUs |
| Offizielle API | Etwa 1,35 $/Monat im Hobbybereich | Ja | 2.500 gleichzeitige Anfragen | Alles, was Sie bereitstellen |
| Router Free Tier | Kostenlos, solange es dauert | Nein, Hosts wechseln | Pro-Minute- und Pro-Tag-Limits | Prototypen, Vergleiche |
| Gebündelte Tool-Credits | Kostenlos während der Testphase | Hängt vom Tool ab | Tool-definiert | Codieren innerhalb dieses Tools |
Wenn Sie planen, etwas zu veröffentlichen, investieren Sie den Dollar in die offizielle API. Wenn Sie evaluieren, beginnen Sie mit der Chat-App. Wenn Sie GPUs haben, schlagen die Gewichte jede andere Option.
Kostenlose Endpunkte in Apidog testen, ohne Kontingent zu verbrauchen
Die kostenlosen Wege haben zwei Fehlerquellen: Sie stoßen auf die Ratenbegrenzung, während Sie Ihren eigenen Code debuggen, und der Router liefert Ihnen ein anderes Modell, ohne dies mitzuteilen. Beides lässt sich günstig mit Apidog verhindern, das die API-Schicht vor jedem von Ihnen gewählten Endpunkt testet.
- Endpunkt einmal hinzufĂĽgen. Erstellen Sie
POST {{BASE_URL}}/chat/completionsmitBearer {{API_KEY}}im Authorization-Header. Jede Option auĂźer der Chat-App spricht dieselbe OpenAI-kompatible Form, sodass eine gespeicherte Anfrage alle abdeckt. - Erstellen Sie eine Umgebung pro Anbieter. Eine
official-Umgebung setztBASE_URLaufhttps://api.deepseek.commit Ihrem DeepSeek-Schlüssel; einerouter-Umgebung verweist auf den kostenlosen Host. Der Wechsel erfolgt über ein Dropdown-Menü. - Echte Antworten aufzeichnen, dann mocken. Senden Sie eine Handvoll repräsentativer Prompts über den kostenlosen Endpunkt, speichern Sie die Antworten und stellen Sie sie über Apidogs Mock-Server bereit. Während Sie Parsing, Wiederholungsversuche und die Benutzeroberfläche erstellen, greift Ihre App auf den Mock zu und das kostenlose Kontingent bleibt unberührt.
- Überprüfen Sie das Modellfeld. Speichern Sie die Anfrage als Testfall, der bestätigt, dass
modelin der Antwort die Zeichenfolge enthält, die der Host für V4.1-Flash zurückgibt. Führen Sie dies zu Beginn jeder Sitzung aus, und ein ausgetauschtes Modell lässt den Test fehlschlagen, bevor Sie eine Stunde damit verbringen, einer „Regression“ in Ihren Prompts nachzujagen. - Überprüfen Sie den Nutzungsblock. Überprüfen Sie, ob
usage.prompt_tokensundusage.completion_tokensgrößer als Null sind, und lesen Sie die Anzahl der Cache-Treffer auf der offiziellen API aus demselben Block ab. Nach einer Woche wissen Sie, was Ihnen eine kostenlose Stufe erspart hat und ob Ihre Prompts so gut gecacht werden, wie Sie angenommen haben.
Laden Sie Apidog herunter, und der Vorgang dauert weniger als zehn Minuten. Sobald die ĂśberprĂĽfungen vorhanden sind, fĂĽhrt apidog-cli diese in CI aus, sodass ein Router-Wechsel einen Build und nicht eine Demo unterbricht.
Häufig gestellte Fragen (FAQ)
- Ist DeepSeek-V4.1-Flash kostenlos nutzbar? Das Modell ist unter MIT lizenzfrei und kann kostenlos innerhalb der DeepSeek-Chat-App verwendet werden. Die offizielle API ist eine Pay-as-you-go-Lösung ohne permanente kostenlose Stufe (Free Tier). Ist DeepSeek kostenlos verfolgt, wie diese Aufteilung über die gesamte Modellreihe hinweg bestand.
- Hat die DeepSeek API eine kostenlose Testphase? Keine dauerhafte. Der kostengĂĽnstigste Weg ist die offizielle API auĂźerhalb der Spitzenzeiten: 5 Millionen Cache-Fehlzugriffs-Input-Tokens plus 1 Million Output-Tokens kosten 1,35 $.
- Was ist der günstigste Weg, V4.1-Flash über die API aufzurufen? Senden Sie außerhalb der Spitzenzeiten und strukturieren Sie Prompts so, dass gemeinsame Präfixe den Cache treffen, da ein Treffer 50-mal weniger kostet als ein Fehlzugriff. Was ist Prompt-Caching erklärt, wie man einen Prompt dafür anordnet.
- Kann ich V4.1-Flash auf einem Laptop ausführen? Nicht das vollständige Modell. 552 Milliarden Parameter entsprechen etwa 280 GB bei 4 Bit allein für den Backbone. Der oben verlinkte lokale Leitfaden behandelt, was auf jeder Hardware-Stufe realistisch ist.
- Ist eine kostenlose Router-Version dasselbe Modell wie die offizielle API? Nur wenn der Host dies angibt und Ihre Tests dies bestätigen. Überprüfen Sie das
model-Feld und vergleichen Sie die Ausgaben bei einem festen Prompt-Satz mit dem offiziellen Endpunkt. Die Anleitungen zu DeepSeek V4 kostenlos nutzen und V4 API kostenlos nutzen fĂĽhren dieselbe PrĂĽfung fĂĽr die vorherige Generation durch.
Wo Sie damit stehen
V4.1-Flash ist auf die zwei wichtigsten Arten kostenlos: Die Gewichte sind MIT-lizenziert, und die Chat-App kostet nichts. Alles zwischen diesen Extremen ist entweder eine kostenlose Stufe (Free Tier), die sich ändern wird, oder eine offizielle API, die so günstig ist, dass es sich nicht mehr lohnt, auf „kostenlos“ zu optimieren. Bei 1,35 $ pro Monat ist der günstigste Weg meistens zu bezahlen.
Welchen Endpunkt Sie auch wählen, schalten Sie Apidog davor: Mock-Antworten während der Entwicklung, überprüfen Sie das Modellfeld, protokollieren Sie die Nutzung. Kostenloses Kontingent ist eine Ressource. Nutzen Sie es für das Modell, nicht für Ihre eigenen Bugs.
