Gemini 3.8 Flash Preise: Einführungspreise, Denk-Token und die realen Kosten pro Aufgabe

Gemini 3.8 Flash-Preise: 0,75 $/3,75 $ Einführungspreise, die sich am 1. Januar 2027 verdoppeln werden, Denk-Tokens werden als Output abgerechnet, Caching, Stapelverarbeitung und warum die Kosten pro Aufgabe auf 0,58 $ gestiegen sind.

Ashley Goolam

Ashley Goolam

3 September 2026

Gemini 3.8 Flash Preise: Einführungspreise, Denk-Token und die realen Kosten pro Aufgabe

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Gemini 3.8 Flash kostet 0,75 $ pro Million Eingabe-Tokens und 3,75 $ pro Million Ausgabe-Tokens, derselbe Einführungspreis, den Google für 3.7 Flash festgelegt hat. Dieser Preis gilt bis zum 31. Dezember 2026. Am 1. Januar 2027 verdoppelt er sich auf 1,50 $ und 7,50 $, und dieselbe Verdoppelung betrifft 3.6 Flash und 3.7 Flash am selben Tag. An den Preisen pro Token hat sich mit dieser Veröffentlichung nichts geändert.

Was sich geändert hat, ist die Anzahl der Tokens, die das Modell verbraucht. Google sagt, 3.8 Flash „arbeitet härter“: Es unternimmt mehr Denkprozesse, ruft Tools iterativ auf und „kann bei länger dauernden und komplexen Aufgaben designbedingt mehr Tokens verwenden“. Artificial Analysis hat den Effekt unabhängig gemessen: Das Ausführen seines Intelligence Index kostete bei 3.8 Flash auf hoher Denkstufe 0,58 $ pro Aufgabe gegenüber 0,40 $ bei 3.7 Flash, mit etwa 30 % mehr Ausgabe-Tokens pro Aufgabe. Derselbe Listenpreis, höhere Rechnung.

Dieser Leitfaden geht jede Zeile der offiziellen Gemini API-Preisseite durch, arbeitet ein Beispiel mit 1.000 Aufgaben pro Tag auf jeder Denkstufe durch und vergleicht den Preis mit Flash-Lite, Claude Sonnet 5 und GPT-5.6 Luna. Für den Modellüberblick beginnen Sie mit was Gemini 3.8 Flash ist.

Gemini 3.8 Flash-Preise auf einen Blick

Alle Preise gelten pro 1 Million Tokens auf der kostenpflichtigen Stufe.

Tarif Einführung (bis 31. Dez. 2026) Standard (ab 1. Jan. 2027)
Eingabe (Text, Bild, Video, Audio, PDF) 0,75 $ 1,50 $
Ausgabe (inkl. Denk-Tokens) 3,75 $ 7,50 $
Kontext-Cache-Lesen 0,075 $ 0,15 $
Cache-Speicher (pro 1 Mio. Tokens pro Stunde) 0,50 $ 1,00 $
Batch API Eingabe (50% Rabatt) 0,375 $ 0,75 $
Batch API Ausgabe (50% Rabatt) 1,875 $ 3,75 $
Google Search Verankerung 5.000 kostenlose Anfragen/Monat, geteilt über Gemini 3.x, danach 14 $ pro 1.000 Gleich
Kostenlose Stufe 0 $, ratenbegrenzt, Daten werden zur Verbesserung von Google-Produkten verwendet Gleich

Drei Details sind wichtiger als die Schlagzeilenzahlen. Der Ausgabepreis deckt Denk-Tokens ab, sodass interne Denkprozesse mit 3,75 $ abgerechnet werden, nicht mit 0,75 $. Der Einführungspreis hat ein festes Enddatum. Und die Zeilen für 3.7 Flash und 3.6 Flash enthalten die identische Verdoppelung zum 1. Januar, sodass ein älteres Flash Sie nicht vor der Erhöhung schützt. Der 3.7 Flash Preisaufschlüsselung deckt dieselben Raten für ein Modell ab, das weniger Tokens pro Aufgabe verbraucht.

Denk-Tokens sind Ausgabe-Tokens

Gemini 3.8 Flash denkt, bevor es antwortet, und jeder Token dieses Denkprozesses wird als Ausgabe gemessen. Die API meldet die Anzahl als usageMetadata.thoughtsTokenCount in einer generateContent-Antwort, getrennt von candidatesTokenCount (der sichtbaren Antwort) und promptTokenCount (Ihrer Eingabe). Beide Ausgabe-Kategorien werden zum selben Preis von 3,75 $ abgerechnet.

Sie steuern den Umfang mit thinking_level: low, medium oder high. Bei 3.8 Flash ist der Standard medium, nicht high wie bei Gemini 3 Pro. minimal ist entfallen und gibt einen Validierungsfehler zurück, sodass jede von früheren Modellen übernommene Konfiguration diesen Wert auf low abbilden muss. Die Denk-Dokumentation von Google beschreibt die Stufen als relativen Aufwand, nicht als Token-Budget, sodass Sie Denk-Tokens nicht direkt begrenzen können, wie es das alte Ganzzahl-Attribut thinking_budget erlaubte. Was jede Stufe für Latenz und Kosten bedeutet, finden Sie im 3.8 Flash Denk-Level-Leitfaden.

Eine schnelle Veranschaulichung mit fiktiven, aber realistischen Größen. Angenommen, eine Anfrage sendet 10.000 Eingabe-Tokens und erhält 2.000 sichtbare Ausgabe-Tokens plus 6.000 Denk-Tokens zurück. Bei Einführungspreisen:

Das Denken macht 75 % der Ausgabekosten und 60 % der gesamten Anfrage aus. Ab dem 1. Januar kostet dieselbe Anfrage 0,015 $ + 0,06 $ = 0,075 $. „Gleicher Preis wie 3.7“ ist wahr, aber unvollständig: Der Preis blieb gleich, die Token-Anzahl änderte sich.

Warum die Kosten pro Aufgabe gestiegen sind, obwohl der Preis gleich blieb

Googles Startbeitrag ist direkt über den Kompromiss: Bei komplexen Aufgaben „führt das Modell zusätzliche Denkprozesse aus und ruft Tools iterativ auf“, um seine Arbeit dabei zu überprüfen. Mehr Schritte bedeuten mehr Denk-Tokens und, in Agent-Schleifen, mehr Tool-Aufrufe. Googles Ratschlag zur Minderung: thinking_level senken oder bei 3.7 Flash bleiben.

Artificial Analysis hat Zahlen dazu veröffentlicht. Ihr Intelligence Index führt neun Bewertungen durch; 3.8 Flash auf hoher Stufe erreichte 59 Punkte gegenüber 56 bei 3.7 Flash auf hoher Stufe, wobei durchschnittlich etwa 48.000 Ausgabe-Tokens pro Aufgabe verwendet wurden, ein Anstieg von 30 % gegenüber 3.7 Flash. Die Kosten für die Ausführung des Index pro Aufgabe:

Konfiguration Kosten pro Aufgabe (AA, Einführungspreise) Zeit pro Aufgabe
Gemini 3.8 Flash, hoch 0,58 $ 2,5 Min.
Gemini 3.8 Flash, mittel 0,41 $ nicht veröffentlicht
Gemini 3.8 Flash, niedrig 0,24 $ 0,8 Min.
Gemini 3.7 Flash, hoch 0,40 $ 2,2 Min.

Lesen Sie die Tabelle auf zwei Arten. Im Vergleich zu seinem Vorgänger kostet 3.8 Flash auf hoher Stufe 45 % mehr pro Aufgabe (0,58 $ / 0,40 $ = 1,45) für einen Drei-Punkte-Indexgewinn. Im Vergleich zu sich selbst senkt das Herabsetzen von hoch auf mittel die Kosten pro Aufgabe um 29 % (0,41 $ / 0,58 $ = 0,71), und niedrig senkt sie um 59 % (0,24 $ / 0,58 $ = 0,41). Mittel bei 3.8 Flash liegt innerhalb eines Cents von hoch bei 3.7 Flash, ein nützlicher Anhaltspunkt, wenn man entscheidet, ob man überhaupt upgraden sollte. Der 3.8 Flash vs. 3.7 Flash Vergleich geht diese Entscheidung nach Arbeitslast durch.

Artificial Analysis listet auch einen Mischpreis von 0,58 $ pro Million Tokens bei einem Eingabe-Ausgabe-Verhältnis von 3:1 auf. Dass dies mit den Kosten pro Aufgabe auf hoher Stufe übereinstimmt, ist Zufall; das eine ist ein Preis pro Token, das andere hängt davon ab, wie viele Tokens das Modell auszugeben wählt.

Sichern Sie sich den Einführungspreis vor dem 31. Dezember

„Sichern Sie sich“ braucht eine präzise Bedeutung, da der Einführungspreis kein Vertrag ist. Google rechnet die Nutzung zu dem Satz ab, der zum Zeitpunkt des Token-Verbrauchs gültig ist, sodass Sie die Nutzung im Jahr 2027 nicht zu Preisen von 2026 im Voraus bezahlen können, und der Wechsel zu 3.7 oder 3.6 Flash hilft nicht. Was Sie tun können, ist, diskretionäre Arbeiten in das Zeitfenster zu verschieben:

Wenn der Preis der entscheidende Faktor über Anbieter hinweg ist, bietet unser Vergleich der günstigsten LLM API-Anbieter einen vollständigen Überblick; der Vergleich von Fable 5.1 und GPT-5.6 Sol behandelt die Premium-Tarife.

Wie es sich im Vergleich zu Flash-Lite, Sonnet 5 und GPT-5.6 Luna verhält

Preise pro Token, pro 1 Million Tokens:

Modell Eingabe Ausgabe Anmerkungen
Gemini 3.8 Flash (Einführung) 0,75 $ 3,75 $ Denken als Ausgabe abgerechnet; Cache-Lesen 0,075 $
Gemini 3.8 Flash (ab 1. Jan.) 1,50 $ 7,50 $ Cache-Lesen 0,15 $
Gemini 3.5 Flash-Lite 0,30 $ 2,50 $ Ca. 350 Tokens/s
Claude Sonnet 5 2 $ 10 $ Dauerhaft; die Preiserhöhung vom 1. September wurde storniert
GPT-5.6 Luna 1 $ 6 $

Bei Einführungspreisen ist die Eingabe von 3.8 Flash 2,5-mal teurer als die von Flash-Lite und die Ausgabe 1,5-mal. Im Vergleich zu Sonnet 5 ist 3.8 Flash sowohl bei der Eingabe (2 $ / 0,75 $) als auch bei der Ausgabe (10 $ / 3,75 $) etwa 2,7-mal günstiger. Auch im Vergleich zu Luna ist es günstiger: 0,75 $ gegenüber 1 $ bei der Eingabe, 3,75 $ gegenüber 6 $ bei der Ausgabe.

Das Bild kehrt sich am 1. Januar um. Bei 1,50 $ und 7,50 $ wird 3.8 Flash auf beiden Seiten teurer als Luna, und der Abstand zu Sonnet 5 verringert sich auf etwa das 1,3-fache (2 $ / 1,50 $ und 10 $ / 7,50 $). Flash-Lite bleibt durchweg günstiger. Wenn der Einführungspreis der Grund war, warum Sie 3.8 Flash gewählt haben, tragen Sie die Neubewertung im Januar jetzt in Ihren Kalender ein.

Der Vergleich pro Token ist nur die halbe Miete. Ein Modell, das weniger Tokens pro Antwort verbraucht, kann pro Aufgabe bei einem höheren Tarif weniger kosten, und der einzige Weg, dies herauszufinden, ist, denselben Aufgabensatz durch jeden Kandidaten zu laufen und die Nutzungszählungen auszulesen. Der 3.8 Flash API-Leitfaden zeigt, wie man usageMetadata sowohl von der Interactions API als auch von der älteren generateContent liest.

Kostenregressionen mit Apidog Token-Assertions erkennen

Der Fehlerfall bei 3.8 Flash ist keine falsche Antwort. Es ist eine richtige Antwort, die nach einer Prompt-Anpassung oder einer Änderung des Denk-Levels stillschweigend 40 % mehr Tokens verwendet hat, und niemand bemerkt es, bis die Rechnung kommt. Apidog behebt dies, indem es die Token-Anzahl als ein Feld behandelt, auf das man eine Assertion anwenden kann, ähnlich einem Statuscode.

Apidog Assertion Beispiel zur Token-Nutzung
  1. Speichern Sie den Schlüssel als Umgebungsvariable. Erstellen Sie GEMINI_API_KEY in einer Apidog-Umgebung und referenzieren Sie ihn als {{GEMINI_API_KEY}} im x-goog-api-key Header, damit der Schlüssel niemals in einer gespeicherten Anfrage liegt.
  2. Senden Sie einen Golden Prompt. Speichern Sie einen POST an https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent mit einem repräsentativen Prompt und einem expliziten thinkingConfig.thinkingLevel, einen pro Produktionsroute.
  3. Assert auf die Nutzungsfelder. Fügen Sie ein Post-Processor-Skript hinzu, das usageMetadata liest und den Test fehlschlagen lässt, wenn die Tokens eine von Ihrer Basislinie festgelegte Obergrenze überschreiten:
const usage = pm.response.json().usageMetadata;
pm.test("Denk-Tokens innerhalb des Budgets", () => {
  pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("sichtbare Ausgabe innerhalb des Budgets", () => {
  pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("Anfragekosten innerhalb des Budgets", () => {
  const cost = usage.promptTokenCount * 0.75 / 1e6
    + (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
  pm.expect(cost).to.be.below(0.05);
});
  1. Planen Sie es. Fügen Sie die Anfragen in ein Testszenario ein und führen Sie es nach einem Zeitplan aus, sodass ein Token-Nutzungssprung am selben Tag als fehlgeschlagener Lauf angezeigt wird; unser Leitfaden zum Planen von API-Tests in Apidog behandelt die Einrichtung. Aktualisieren Sie die beiden Ratenkonstanten am 1. Januar, und die Kosten-Assertion verfolgt weiterhin die Rechnung.

Dasselbe Szenario dient auch als Anbieter-Vergleich: Richten Sie eine Kopie auf Flash-Lite, Sonnet 5 oder Luna und vergleichen Sie die Nutzungsfelder nebeneinander. Laden Sie Apidog herunter, um das erste Szenario zu erstellen; der kostenlose Plan deckt diesen Workflow ab.

FAQ

Kostet Gemini 3.8 Flash mehr als 3.7 Flash? Pro Token, nein. Beide kosten 0,75 $ für die Eingabe und 3,75 $ für die Ausgabe bis zum 31. Dezember, danach 1,50 $ und 7,50 $. Pro Aufgabe, ja: Artificial Analysis maß 0,58 $ pro Indexaufgabe bei 3.8 Flash auf hoher Stufe gegenüber 0,40 $ bei 3.7 Flash, da 3.8 Flash etwa 30 % mehr Ausgabe-Tokens generiert.

Werden Denk-Tokens separat abgerechnet? Nein. Sie werden als Ausgabe-Tokens zu 3,75 $ pro Million (Einführung) abgerechnet und erscheinen unter usageMetadata.thoughtsTokenCount. Sie steuern sie indirekt über thinking_level; es gibt kein festes Token-Budget bei 3.8 Flash, und minimal gibt einen Fehler zurück.

Gibt es eine kostenlose Stufe für Gemini 3.8 Flash? Ja. Die kostenlose Stufe von AI Studio berechnet nichts für Eingabe oder Ausgabe, mit Ratenbegrenzungen, die in AI Studio angezeigt werden, und Google verwendet Daten der kostenlosen Stufe, um seine Produkte zu verbessern. Die Verbraucher-App Gemini bietet 3.8 Flash nur AI Pro- und Ultra-Abonnenten an. Details finden Sie im Leitfaden zur kostenlosen Nutzung.

Was passiert mit meinen Kosten am 1. Januar 2027? Eingabe-, Ausgabe-, Cache-Lese-, Cache-Speicher- und Batch-Preise verdoppeln sich alle. Bleibt der Token-Verbrauch pro Aufgabe gleich, verdoppelt sich auch Ihre Rechnung. Die 3.6 und 3.7 Flash-Zeilen verdoppeln sich am selben Datum.

Welche Denkstufe hält die Kosten niedrig? Gehen Sie von der Spanne von Artificial Analysis aus: niedrig 0,24 $, mittel 0,41 $, hoch 0,58 $ pro Indexaufgabe. Führen Sie Ihre eigenen Evaluierungen auf jeder Stufe durch, behalten Sie die niedrigste bei, die bestanden wird, und prüfen Sie die Token-Zahlen, damit die Einstellung nicht abweicht.

Was diese Woche zu tun ist

Gemini 3.8 Flash ist wie 3.7 Flash bepreist und verbraucht Tokens wie ein größeres Modell. Behandeln Sie die Denkstufe als Kosteneinstellung und legen Sie sie pro Route fest. Verschieben Sie batchfreundliche Arbeiten vor dem 31. Dezember in das Einführungsfenster. Ermitteln Sie jetzt Ihren Basis-Token-Verbrauch und prüfen Sie ihn, damit die Verdoppelung im Januar eine Änderung ist, die Sie einkalkuliert haben.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen