Gemini 3.6 Flash kostet $1.50 pro 1M Eingabetokens und $7.50 pro 1M Ausgabetokens. Das ist günstiger als das Modell, das es ersetzt. Google hat das Update am 21. Juli 2026 veröffentlicht, und für jeden, der seine API-Rechnung im Auge behält, ist die Schlagzeile einfach: Der bewährte Flash-Tarif wurde gleichzeitig schneller und kostengünstiger.
Dieser Leitfaden schlüsselt jede Zahl auf, die Sie zur Budgetplanung benötigen: die Raten pro Token, was Kontext-Caching hinzufügt, was der kostenlose Tarif abdeckt, und ein durchgerechnetes Beispiel, damit Sie die monatlichen Ausgaben vor dem Schreiben einer einzigen Codezeile vorhersagen können. Jede hier angegebene Zahl stammt aus Googles eigenen Gemini API Preisdokumenten und der Startankündigung. Wenn Sie zuerst eine vollständige Modellübersicht wünschen, lesen Sie was Gemini 3.6 Flash ist.
Ein Hinweis zur Namensgebung vor den Zahlen. Das Arbeitspferd ist auf Version 3.6 gesprungen, aber der günstigere Flash-Lite-Tarif bleibt bei 3.5. Gleiche Veröffentlichung, gemischte Versionierung. Halten Sie das auseinander, und die Preisgestaltung stimmt sauber überein.
Gemini 3.6 Flash Preise auf einen Blick
| Posten | Kosten |
|---|---|
| Eingabe | $1.50 pro 1M Tokens |
| Ausgabe (inklusive Denk-Tokens) | $7.50 pro 1M Tokens |
| Kontext-Caching, Lesevorgang für zwischengespeicherte Eingaben | $0.15 pro 1M Tokens |
| Kontext-Caching, Speicherung | $1.00 pro 1M Tokens pro Stunde |
| Kostenloser Tarif | Ja, über Google AI Studio (ratelimitiert) |
Zwei Dinge vorweg zu erwähnen. Der Ausgabepreis beinhaltet Denk-Tokens, sodass die Denkprozesse des Modells, bevor es antwortet, mit der Ausgaberate von $7.50 abgerechnet werden, nicht als separater Posten. Und Kontext-Caching besteht aus zwei Teilen: einer günstigen Leserate für zwischengespeicherte Eingaben plus einer stündlichen Speichergebühr, solange der Cache warm gehalten wird. Caching spart Geld bei wiederholtem Kontext, ist aber nicht kostenlos, daher treten die Einsparungen nur auf, wenn Sie dasselbe Prompt-Präfix häufig wiederverwenden.
Wie es sich im Vergleich zu Gemini 3.5 Flash schlägt
Die Ausgaberate ist von $9.00 pro 1M Tokens bei 3.5 Flash auf $7.50 bei 3.6 Flash gesunken. Das allein macht etwa 17% günstigere Kosten pro Ausgabetoken aus.
Die größere Geschichte ist das, was Google auf der DeepMind Flash Modellseite berichtet: 3.6 Flash produziert für dieselbe Aufgabe etwa 17% weniger Ausgabetokens. Es denkt in weniger Schritten und tätigt weniger Tool-Aufrufe bei mehrstufigen Aufgaben. Sie zahlen also einen niedrigeren Satz für eine kleinere Menge an Tokens. Die beiden Hebel verstärken sich gegenseitig, was wir weiter unten mit realer Arithmetik zeigen werden.
Wenn Sie Ihr Budget immer noch am alten Modell ausrichten, lohnt sich ein direkter Vergleich mit der Gemini 3.5 Flash Preisübersicht. Für einen vollständigen Funktions- und Benchmark-Vergleich siehe Gemini 3.6 Flash vs 3.5 Flash. Die Kurzversion für Ihren Geldbeutel: 3.6 Flash kostet weniger im Betrieb als das Modell, das es ersetzt, und der Unterschied wird bei längeren, agentenbasierten Workloads, bei denen sich die Token-Einsparungen summieren, größer.
Was Ihnen der kostenlose Tarif bietet
Es gibt einen echten kostenlosen Tarif, verfügbar über Google AI Studio. Sie können Gemini 3.6 Flash ohne Kreditkarte aufrufen und kostenlos Prototypen entwickeln.
Seien Sie ehrlich zu sich selbst bezüglich der Grenzen. Der kostenlose Tarif ist ratelimitiert und daher für Prototypen und leichte Tests konzipiert, nicht für den Produktionsverkehr. Und Google kann Daten aus dem kostenlosen Tarif zur Verbesserung seiner Produkte verwenden. Das bedeutet, dass der kostenlose Tarif der falsche Ort für sensible, proprietäre oder Kundendaten ist. Wenn Sie zu etwas Echtem übergehen, wechseln Sie zu einem kostenpflichtigen Schlüssel, bei dem diese Nutzungsbedingungen für Daten nicht gelten.
Für eine vollständige Anleitung, was der kostenlose Tarif ermöglicht und wie er eingerichtet wird, siehe wie man Gemini 3.6 Flash kostenlos nutzt. Es gibt hier keine Option „unbegrenzt kostenlos“, planen Sie also den Übergang zur kostenpflichtigen Nutzung, sobald Sie live gehen.
Ein durchgerechnetes Kostenbeispiel
Angenommen, Sie betreiben einen Agenten, der viel liest und wenig schreibt: 2M Eingabetokens und 500k Ausgabetokens pro Tag. Das ist eine realistische Form für einen abrufintensiven Assistenten, der Dokumente einliest und kurze Antworten zurückgibt.
Hier ist die tägliche Abrechnung für Gemini 3.6 Flash:
- Eingabe: 2M Tokens mal $1.50 pro 1M = $3.00
- Ausgabe: 500k Tokens mal $7.50 pro 1M = $3.75
- Gesamt täglich: $6.75
- Monatlich (30 Tage): etwa $202.50
Nun zur Zusammensetzung. Angenommen, dieselbe Aufgabe auf 3.5 Flash würde 600k Ausgabetokens erzeugen. Auf 3.6 Flash reduziert die 17%-ige Reduktion dies auf etwa 500k, was wir oben budgetiert haben. Vergleichen Sie nur die Ausgabezeile:
- 3.5 Flash Ausgabe: 600k mal $9.00 pro 1M = $5.40 pro Tag
- 3.6 Flash Ausgabe: 500k mal $7.50 pro 1M = $3.75 pro Tag
Das sind $1.65 weniger pro Tag, oder etwa $49.50 pro Monat, allein auf der Ausgabeseite. Die Ausgaberechnung sinkt um etwa 31%, obwohl die Preissenkung und die Token-Reduktion jeweils nur etwa 17% betragen. Günstigere Tokens multipliziert mit weniger Tokens – hier liegen die echten Einsparungen.
Flash-Lite ist noch günstiger
Wenn Ihre Aufgabe einfach ist, gibt es eine Stufe unter dem Arbeitspferd. Gemini 3.5 Flash-Lite kostet $0.30 pro 1M Eingabetokens und $2.50 pro 1M Ausgabetokens, mit Caching zu $0.03 pro 1M plus den gleichen $1.00 pro 1M pro Stunde Speicher. Es läuft auch schnell, etwa 350 Ausgabetokens pro Sekunde.
Führen Sie dieselbe Arbeitslast von 2M Eingaben und 500k Ausgaben auf Flash-Lite aus, und die tägliche Rechnung beträgt etwa $1.85, ungefähr $55.50 pro Monat. Das ist etwa 70% günstiger als 3.6 Flash für die gleiche Anzahl von Tokens.
Der Haken ist die Qualität. Flash-Lite ist für Aufgaben mit hohem Volumen und geringer Komplexität optimiert: Klassifizierung, Extraktion, Routing, kurze strukturierte Antworten. Es ist keine schwächere Version desselben; es ist ein anderer Punkt auf der Kosten-, Qualitäts- und Latenzkurve. Greifen Sie darauf zurück, wenn die Aufgabe einfach und das Volumen hoch ist, und behalten Sie 3.6 Flash für komplexere Denkprozesse. Für das vollständige Bild lesen Sie was ist Gemini 3.5 Flash-Lite, dann Gemini 3.5 Flash-Lite vs 3.6 Flash, um den richtigen Tarif pro Route zu wählen.
So kontrollieren und messen Sie Ihre Kosten
Vier Hebel halten die Rechnung niedrig:
- Wiederholten Kontext cachen. Wenn jede Anfrage einen langen System-Prompt oder dieselben Referenzdokumente teilt, berechnet Kontext-Caching $0.15 pro 1M für zwischengespeicherte Lesevorgänge anstatt $1.50. Denken Sie jedoch an die Speichergebühr von $1.00 pro 1M pro Stunde, sodass sich Caching auszahlt, wenn Sie das Präfix innerhalb der Stunde häufig wiederverwenden, nicht nur einmal.
- Prompts kürzen. Die Ausgabe ist fünfmal so teuer wie die Eingabe, aber überladene Eingaben summieren sich bei großem Umfang immer noch. Reduzieren Sie Boilerplate und begrenzen Sie die maximalen Ausgabetokens, damit eine unkontrollierte Antwort Sie nicht überraschen kann.
- Einfache Aufgaben an Flash-Lite weiterleiten. Senden Sie Klassifizierungen und Extraktionen an den günstigeren Tarif und reservieren Sie 3.6 Flash für mehrstufige Denkprozesse. Gemischtes Routing ist oft besser, als ein einziges Modell für alles zu wählen.
- Tatsächlichen Token-Verbrauch messen. Schätzungen lügen. Die
usageMetadatain jeder Gemini-Antwort teilt Ihnen genau mit, wie viele Eingabe-, Ausgabe- und Denk-Tokens ein Aufruf verbraucht hat, und das ist die Zahl, auf der Ihre Rechnung basiert.
Dieser letzte Punkt ist, wo ein API-Client seinen Wert beweist. In Apidog können Sie die POST-Anfrage an die Gemini API erstellen, Ihren Schlüssel in einer Umgebungsvariablen speichern und echte Aufrufe gegen Ihre echten Prompts senden. Lesen Sie die usageMetadata-Felder direkt aus der Antwort, um die tatsächlichen Token-Anzahlen pro Anfrage zu sehen, und fügen Sie dann Zusicherungen hinzu, damit eine Prompt-Änderung, die die Ausgabetokens verdoppelt, einen Test fehlschlagen lässt, anstatt stillschweigend Ihre Rechnung zu verdoppeln. Sie können diese API-Tests sogar planen, um sie regelmäßig auszuführen und Kostenregressionen frühzeitig zu erkennen. Möchten Sie mitmachen? Laden Sie Apidog herunter und richten Sie eine Anfrage an den Gemini-Endpunkt, bevor Sie ihn in die Produktion integrieren.
FAQ
Wie viel kostet Gemini 3.6 Flash pro 1M Tokens? $1.50 für Eingabe und $7.50 für Ausgabe. Lesevorgänge beim Kontext-Caching kosten $0.15 pro 1M, mit einer Speichergebühr von $1.00 pro 1M pro Stunde.
Enthält der Ausgabepreis Denk-Tokens? Ja. Die Denkprozesse des Modells, bevor es antwortet, werden mit der Ausgaberate von $7.50 abgerechnet. Es gibt keine separate Gebühr für Denk-Tokens, aber sie zählen zu Ihrer gesamten Ausgabe, daher bedeutet mehr Denkprozess eine höhere Rechnung.
Gibt es wirklich einen kostenlosen Tarif? Ja, über Google AI Studio, und dieser ist ratelimitiert. Er ist für Prototypen und Tests gedacht, nicht für die Produktion. Google kann Daten aus dem kostenlosen Tarif zur Verbesserung seiner Produkte verwenden, daher sollten Sie sensible Daten auf einem kostenpflichtigen Schlüssel speichern.
Ist Gemini 3.6 Flash günstiger als 3.5 Flash? Ja. Die Ausgaberate sank von $9.00 auf $7.50, und 3.6 Flash verwendet für dieselbe Aufgabe etwa 17% weniger Ausgabetokens. Beide Effekte summieren sich, sodass die tatsächliche Ausgaberechnung um etwa 31% sinken kann.
Wann sollte ich stattdessen Flash-Lite verwenden? Wenn die Aufgabe einfach und das Volumen hoch ist. Mit $0.30 für Eingabe und $2.50 für Ausgabe ist Flash-Lite etwa 70% günstiger für die gleiche Anzahl von Tokens, und es ist schnell, aber 3.6 Flash bewältigt schwierigere Denkprozesse besser.
Gemini 3.6 Flash ist ein seltenes Preis-Update, bei dem die Kosten gesunken und das Modell gleichzeitig besser geworden ist. Budgetieren Sie es mit $1.50 für Eingabe und $7.50 für Ausgabe, denken Sie daran, dass Denk-Tokens in der Ausgaberate enthalten sind, und verlassen Sie sich auf Caching plus Flash-Lite-Routing, um den Rest zu optimieren. Für den historischen Kontext, wie sich die Gemini API-Kosten über die Releases hinweg entwickelt haben, ist die Gemini 3.0 API Kostenübersicht ein nützlicher Anker. Messen Sie dann Ihre eigenen Aufrufe in Apidog, damit die Token-Anzahlen, die Sie planen, auch diejenigen sind, die Sie tatsächlich bezahlen.
