Gemini 3.8 Flash kostet 0,75 $ pro Million Eingabe-Tokens und 3,75 $ pro Million Ausgabe-Tokens, derselbe Einführungspreis, den Google für 3.7 Flash festgelegt hat. Dieser Preis gilt bis zum 31. Dezember 2026. Am 1. Januar 2027 verdoppelt er sich auf 1,50 $ und 7,50 $, und dieselbe Verdoppelung betrifft 3.6 Flash und 3.7 Flash am selben Tag. An den Preisen pro Token hat sich mit dieser Veröffentlichung nichts geändert.
Was sich geändert hat, ist die Anzahl der Tokens, die das Modell verbraucht. Google sagt, 3.8 Flash „arbeitet härter“: Es unternimmt mehr Denkprozesse, ruft Tools iterativ auf und „kann bei länger dauernden und komplexen Aufgaben designbedingt mehr Tokens verwenden“. Artificial Analysis hat den Effekt unabhängig gemessen: Das Ausführen seines Intelligence Index kostete bei 3.8 Flash auf hoher Denkstufe 0,58 $ pro Aufgabe gegenüber 0,40 $ bei 3.7 Flash, mit etwa 30 % mehr Ausgabe-Tokens pro Aufgabe. Derselbe Listenpreis, höhere Rechnung.
Dieser Leitfaden geht jede Zeile der offiziellen Gemini API-Preisseite durch, arbeitet ein Beispiel mit 1.000 Aufgaben pro Tag auf jeder Denkstufe durch und vergleicht den Preis mit Flash-Lite, Claude Sonnet 5 und GPT-5.6 Luna. Für den Modellüberblick beginnen Sie mit was Gemini 3.8 Flash ist.
Gemini 3.8 Flash-Preise auf einen Blick
Alle Preise gelten pro 1 Million Tokens auf der kostenpflichtigen Stufe.
| Tarif | Einführung (bis 31. Dez. 2026) | Standard (ab 1. Jan. 2027) |
|---|---|---|
| Eingabe (Text, Bild, Video, Audio, PDF) | 0,75 $ | 1,50 $ |
| Ausgabe (inkl. Denk-Tokens) | 3,75 $ | 7,50 $ |
| Kontext-Cache-Lesen | 0,075 $ | 0,15 $ |
| Cache-Speicher (pro 1 Mio. Tokens pro Stunde) | 0,50 $ | 1,00 $ |
| Batch API Eingabe (50% Rabatt) | 0,375 $ | 0,75 $ |
| Batch API Ausgabe (50% Rabatt) | 1,875 $ | 3,75 $ |
| Google Search Verankerung | 5.000 kostenlose Anfragen/Monat, geteilt über Gemini 3.x, danach 14 $ pro 1.000 | Gleich |
| Kostenlose Stufe | 0 $, ratenbegrenzt, Daten werden zur Verbesserung von Google-Produkten verwendet | Gleich |
Drei Details sind wichtiger als die Schlagzeilenzahlen. Der Ausgabepreis deckt Denk-Tokens ab, sodass interne Denkprozesse mit 3,75 $ abgerechnet werden, nicht mit 0,75 $. Der Einführungspreis hat ein festes Enddatum. Und die Zeilen für 3.7 Flash und 3.6 Flash enthalten die identische Verdoppelung zum 1. Januar, sodass ein älteres Flash Sie nicht vor der Erhöhung schützt. Der 3.7 Flash Preisaufschlüsselung deckt dieselben Raten für ein Modell ab, das weniger Tokens pro Aufgabe verbraucht.
Denk-Tokens sind Ausgabe-Tokens
Gemini 3.8 Flash denkt, bevor es antwortet, und jeder Token dieses Denkprozesses wird als Ausgabe gemessen. Die API meldet die Anzahl als usageMetadata.thoughtsTokenCount in einer generateContent-Antwort, getrennt von candidatesTokenCount (der sichtbaren Antwort) und promptTokenCount (Ihrer Eingabe). Beide Ausgabe-Kategorien werden zum selben Preis von 3,75 $ abgerechnet.
Sie steuern den Umfang mit thinking_level: low, medium oder high. Bei 3.8 Flash ist der Standard medium, nicht high wie bei Gemini 3 Pro. minimal ist entfallen und gibt einen Validierungsfehler zurück, sodass jede von früheren Modellen übernommene Konfiguration diesen Wert auf low abbilden muss. Die Denk-Dokumentation von Google beschreibt die Stufen als relativen Aufwand, nicht als Token-Budget, sodass Sie Denk-Tokens nicht direkt begrenzen können, wie es das alte Ganzzahl-Attribut thinking_budget erlaubte. Was jede Stufe für Latenz und Kosten bedeutet, finden Sie im 3.8 Flash Denk-Level-Leitfaden.
Eine schnelle Veranschaulichung mit fiktiven, aber realistischen Größen. Angenommen, eine Anfrage sendet 10.000 Eingabe-Tokens und erhält 2.000 sichtbare Ausgabe-Tokens plus 6.000 Denk-Tokens zurück. Bei Einführungspreisen:
- Eingabe: 10.000 x 0,75 $ / 1.000.000 = 0,0075 $
- Ausgabe: (2.000 + 6.000) x 3,75 $ / 1.000.000 = 0,03 $
- Gesamt: 0,0375 $ pro Anfrage
Das Denken macht 75 % der Ausgabekosten und 60 % der gesamten Anfrage aus. Ab dem 1. Januar kostet dieselbe Anfrage 0,015 $ + 0,06 $ = 0,075 $. „Gleicher Preis wie 3.7“ ist wahr, aber unvollständig: Der Preis blieb gleich, die Token-Anzahl änderte sich.
Warum die Kosten pro Aufgabe gestiegen sind, obwohl der Preis gleich blieb
Googles Startbeitrag ist direkt über den Kompromiss: Bei komplexen Aufgaben „führt das Modell zusätzliche Denkprozesse aus und ruft Tools iterativ auf“, um seine Arbeit dabei zu überprüfen. Mehr Schritte bedeuten mehr Denk-Tokens und, in Agent-Schleifen, mehr Tool-Aufrufe. Googles Ratschlag zur Minderung: thinking_level senken oder bei 3.7 Flash bleiben.
Artificial Analysis hat Zahlen dazu veröffentlicht. Ihr Intelligence Index führt neun Bewertungen durch; 3.8 Flash auf hoher Stufe erreichte 59 Punkte gegenüber 56 bei 3.7 Flash auf hoher Stufe, wobei durchschnittlich etwa 48.000 Ausgabe-Tokens pro Aufgabe verwendet wurden, ein Anstieg von 30 % gegenüber 3.7 Flash. Die Kosten für die Ausführung des Index pro Aufgabe:
| Konfiguration | Kosten pro Aufgabe (AA, Einführungspreise) | Zeit pro Aufgabe |
|---|---|---|
| Gemini 3.8 Flash, hoch | 0,58 $ | 2,5 Min. |
| Gemini 3.8 Flash, mittel | 0,41 $ | nicht veröffentlicht |
| Gemini 3.8 Flash, niedrig | 0,24 $ | 0,8 Min. |
| Gemini 3.7 Flash, hoch | 0,40 $ | 2,2 Min. |
Lesen Sie die Tabelle auf zwei Arten. Im Vergleich zu seinem Vorgänger kostet 3.8 Flash auf hoher Stufe 45 % mehr pro Aufgabe (0,58 $ / 0,40 $ = 1,45) für einen Drei-Punkte-Indexgewinn. Im Vergleich zu sich selbst senkt das Herabsetzen von hoch auf mittel die Kosten pro Aufgabe um 29 % (0,41 $ / 0,58 $ = 0,71), und niedrig senkt sie um 59 % (0,24 $ / 0,58 $ = 0,41). Mittel bei 3.8 Flash liegt innerhalb eines Cents von hoch bei 3.7 Flash, ein nützlicher Anhaltspunkt, wenn man entscheidet, ob man überhaupt upgraden sollte. Der 3.8 Flash vs. 3.7 Flash Vergleich geht diese Entscheidung nach Arbeitslast durch.
Artificial Analysis listet auch einen Mischpreis von 0,58 $ pro Million Tokens bei einem Eingabe-Ausgabe-Verhältnis von 3:1 auf. Dass dies mit den Kosten pro Aufgabe auf hoher Stufe übereinstimmt, ist Zufall; das eine ist ein Preis pro Token, das andere hängt davon ab, wie viele Tokens das Modell auszugeben wählt.
Sichern Sie sich den Einführungspreis vor dem 31. Dezember
„Sichern Sie sich“ braucht eine präzise Bedeutung, da der Einführungspreis kein Vertrag ist. Google rechnet die Nutzung zu dem Satz ab, der zum Zeitpunkt des Token-Verbrauchs gültig ist, sodass Sie die Nutzung im Jahr 2027 nicht zu Preisen von 2026 im Voraus bezahlen können, und der Wechsel zu 3.7 oder 3.6 Flash hilft nicht. Was Sie tun können, ist, diskretionäre Arbeiten in das Zeitfenster zu verschieben:
- Führen Sie jetzt Rückläufe und einmalige Dokumentenverarbeitung durch über die Batch API. Ein 100 Millionen Token-Rücklauf (75 Mio. Eingabe, 25 Mio. Ausgabe) kostet 75 x 0,375 $ + 25 x 1,875 $ = 28,13 $ + 46,88 $ = 74,99 $ im Batch dieses Jahr, und doppelt so viel, 149,98 $, im Januar.
- Erstellen Sie Ihr Evaluierungsset und Ihre Basis-Token-Zahlen, bevor sich die Preise ändern, damit die Januar-Rechnung nur eine sich ändernde Variable hat, nicht zwei.
- Legen Sie in diesem Quartal die Denkstufe pro Route fest. Jede Route, die standardmäßig auf
mediumbelassen wird, ist eine Route, deren Kosten Sie nicht überprüft haben. Routen, die Evaluierungen auflowbestehen, sollten vor Januar aufloweingestellt werden.
Wenn der Preis der entscheidende Faktor über Anbieter hinweg ist, bietet unser Vergleich der günstigsten LLM API-Anbieter einen vollständigen Überblick; der Vergleich von Fable 5.1 und GPT-5.6 Sol behandelt die Premium-Tarife.
Wie es sich im Vergleich zu Flash-Lite, Sonnet 5 und GPT-5.6 Luna verhält
Preise pro Token, pro 1 Million Tokens:
| Modell | Eingabe | Ausgabe | Anmerkungen |
|---|---|---|---|
| Gemini 3.8 Flash (Einführung) | 0,75 $ | 3,75 $ | Denken als Ausgabe abgerechnet; Cache-Lesen 0,075 $ |
| Gemini 3.8 Flash (ab 1. Jan.) | 1,50 $ | 7,50 $ | Cache-Lesen 0,15 $ |
| Gemini 3.5 Flash-Lite | 0,30 $ | 2,50 $ | Ca. 350 Tokens/s |
| Claude Sonnet 5 | 2 $ | 10 $ | Dauerhaft; die Preiserhöhung vom 1. September wurde storniert |
| GPT-5.6 Luna | 1 $ | 6 $ |
Bei Einführungspreisen ist die Eingabe von 3.8 Flash 2,5-mal teurer als die von Flash-Lite und die Ausgabe 1,5-mal. Im Vergleich zu Sonnet 5 ist 3.8 Flash sowohl bei der Eingabe (2 $ / 0,75 $) als auch bei der Ausgabe (10 $ / 3,75 $) etwa 2,7-mal günstiger. Auch im Vergleich zu Luna ist es günstiger: 0,75 $ gegenüber 1 $ bei der Eingabe, 3,75 $ gegenüber 6 $ bei der Ausgabe.
Das Bild kehrt sich am 1. Januar um. Bei 1,50 $ und 7,50 $ wird 3.8 Flash auf beiden Seiten teurer als Luna, und der Abstand zu Sonnet 5 verringert sich auf etwa das 1,3-fache (2 $ / 1,50 $ und 10 $ / 7,50 $). Flash-Lite bleibt durchweg günstiger. Wenn der Einführungspreis der Grund war, warum Sie 3.8 Flash gewählt haben, tragen Sie die Neubewertung im Januar jetzt in Ihren Kalender ein.
Der Vergleich pro Token ist nur die halbe Miete. Ein Modell, das weniger Tokens pro Antwort verbraucht, kann pro Aufgabe bei einem höheren Tarif weniger kosten, und der einzige Weg, dies herauszufinden, ist, denselben Aufgabensatz durch jeden Kandidaten zu laufen und die Nutzungszählungen auszulesen. Der 3.8 Flash API-Leitfaden zeigt, wie man usageMetadata sowohl von der Interactions API als auch von der älteren generateContent liest.
Kostenregressionen mit Apidog Token-Assertions erkennen
Der Fehlerfall bei 3.8 Flash ist keine falsche Antwort. Es ist eine richtige Antwort, die nach einer Prompt-Anpassung oder einer Änderung des Denk-Levels stillschweigend 40 % mehr Tokens verwendet hat, und niemand bemerkt es, bis die Rechnung kommt. Apidog behebt dies, indem es die Token-Anzahl als ein Feld behandelt, auf das man eine Assertion anwenden kann, ähnlich einem Statuscode.

- Speichern Sie den Schlüssel als Umgebungsvariable. Erstellen Sie
GEMINI_API_KEYin einer Apidog-Umgebung und referenzieren Sie ihn als{{GEMINI_API_KEY}}imx-goog-api-keyHeader, damit der Schlüssel niemals in einer gespeicherten Anfrage liegt. - Senden Sie einen Golden Prompt. Speichern Sie einen
POSTanhttps://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContentmit einem repräsentativen Prompt und einem explizitenthinkingConfig.thinkingLevel, einen pro Produktionsroute. - Assert auf die Nutzungsfelder. Fügen Sie ein Post-Processor-Skript hinzu, das
usageMetadataliest und den Test fehlschlagen lässt, wenn die Tokens eine von Ihrer Basislinie festgelegte Obergrenze überschreiten:
const usage = pm.response.json().usageMetadata;
pm.test("Denk-Tokens innerhalb des Budgets", () => {
pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("sichtbare Ausgabe innerhalb des Budgets", () => {
pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("Anfragekosten innerhalb des Budgets", () => {
const cost = usage.promptTokenCount * 0.75 / 1e6
+ (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
pm.expect(cost).to.be.below(0.05);
});
- Planen Sie es. Fügen Sie die Anfragen in ein Testszenario ein und führen Sie es nach einem Zeitplan aus, sodass ein Token-Nutzungssprung am selben Tag als fehlgeschlagener Lauf angezeigt wird; unser Leitfaden zum Planen von API-Tests in Apidog behandelt die Einrichtung. Aktualisieren Sie die beiden Ratenkonstanten am 1. Januar, und die Kosten-Assertion verfolgt weiterhin die Rechnung.
Dasselbe Szenario dient auch als Anbieter-Vergleich: Richten Sie eine Kopie auf Flash-Lite, Sonnet 5 oder Luna und vergleichen Sie die Nutzungsfelder nebeneinander. Laden Sie Apidog herunter, um das erste Szenario zu erstellen; der kostenlose Plan deckt diesen Workflow ab.
FAQ
Kostet Gemini 3.8 Flash mehr als 3.7 Flash? Pro Token, nein. Beide kosten 0,75 $ für die Eingabe und 3,75 $ für die Ausgabe bis zum 31. Dezember, danach 1,50 $ und 7,50 $. Pro Aufgabe, ja: Artificial Analysis maß 0,58 $ pro Indexaufgabe bei 3.8 Flash auf hoher Stufe gegenüber 0,40 $ bei 3.7 Flash, da 3.8 Flash etwa 30 % mehr Ausgabe-Tokens generiert.
Werden Denk-Tokens separat abgerechnet? Nein. Sie werden als Ausgabe-Tokens zu 3,75 $ pro Million (Einführung) abgerechnet und erscheinen unter usageMetadata.thoughtsTokenCount. Sie steuern sie indirekt über thinking_level; es gibt kein festes Token-Budget bei 3.8 Flash, und minimal gibt einen Fehler zurück.
Gibt es eine kostenlose Stufe für Gemini 3.8 Flash? Ja. Die kostenlose Stufe von AI Studio berechnet nichts für Eingabe oder Ausgabe, mit Ratenbegrenzungen, die in AI Studio angezeigt werden, und Google verwendet Daten der kostenlosen Stufe, um seine Produkte zu verbessern. Die Verbraucher-App Gemini bietet 3.8 Flash nur AI Pro- und Ultra-Abonnenten an. Details finden Sie im Leitfaden zur kostenlosen Nutzung.
Was passiert mit meinen Kosten am 1. Januar 2027? Eingabe-, Ausgabe-, Cache-Lese-, Cache-Speicher- und Batch-Preise verdoppeln sich alle. Bleibt der Token-Verbrauch pro Aufgabe gleich, verdoppelt sich auch Ihre Rechnung. Die 3.6 und 3.7 Flash-Zeilen verdoppeln sich am selben Datum.
Welche Denkstufe hält die Kosten niedrig? Gehen Sie von der Spanne von Artificial Analysis aus: niedrig 0,24 $, mittel 0,41 $, hoch 0,58 $ pro Indexaufgabe. Führen Sie Ihre eigenen Evaluierungen auf jeder Stufe durch, behalten Sie die niedrigste bei, die bestanden wird, und prüfen Sie die Token-Zahlen, damit die Einstellung nicht abweicht.
Was diese Woche zu tun ist
Gemini 3.8 Flash ist wie 3.7 Flash bepreist und verbraucht Tokens wie ein größeres Modell. Behandeln Sie die Denkstufe als Kosteneinstellung und legen Sie sie pro Route fest. Verschieben Sie batchfreundliche Arbeiten vor dem 31. Dezember in das Einführungsfenster. Ermitteln Sie jetzt Ihren Basis-Token-Verbrauch und prüfen Sie ihn, damit die Verdoppelung im Januar eine Änderung ist, die Sie einkalkuliert haben.
