Gemini 3.8 Flash vs 3.7 Flash Vergleich: Was ist neu und lohnt sich ein Upgrade?

Gemini 3.8 Flash vs. 3.7 Flash: gleicher Preis, gleiche Geschwindigkeit und gleicher Kontext, aber +3 beim AA-Index, +12 bei tau3-Banking und 30 % mehr Ausgabetokens pro Aufgabe. Upgrade?

Medy Evrard

3 September 2026

Gemini 3.8 Flash vs 3.7 Flash Vergleich: Was ist neu und lohnt sich ein Upgrade?

Apidog fĂĽr Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Google hat Gemini 3.8 Flash am 2. September 2026 veröffentlicht, drei Wochen nach Gemini 3.7 Flash und sechs Wochen nach 3.6 Flash. Gleicher Einführungspreis (0,75 $ Eingabe, 3,75 $ Ausgabe pro Million Token bis zum 31. Dezember), gleicher 1M-Token-Kontext und, laut Google selbst, ungefähr die gleiche Geschwindigkeit. Was sich geändert hat, ist die Funktionsweise des Modells: Es unternimmt kleinere Denk-/Argumentationsschritte, überprüft seine eigene Ausgabe und ruft Tools in Schleifen auf. Das bringt ihm eine höhere Bewertung in jedem veröffentlichten Benchmark ein. Es führt aber auch dazu, dass jede Aufgabe mehr Token kostet.

Die Frage beim Upgrade ist also nicht „Ist 3.8 Flash besser?“ Auf dem Papier ja. Die Frage ist, ob die zusätzliche Qualität die zusätzlichen Token bei Ihrer Arbeitslast rechtfertigt und ob die beiden Breaking Changes Ihren Code beeinflussen. Dieser Vergleich behandelt, was gleich geblieben ist, was verbessert wurde, was es Sie kostet und eine Entscheidungsmatrix nach Arbeitslast. Quellen sind Googles Launch-Post, die Seite „What’s new in Gemini 3.8 Flash“ und die unabhängigen Tests von Artificial Analysis. Für das vollständige Datenblatt beginnen Sie mit „What Gemini 3.8 Flash is“.

Noch etwas vorab: Google sagt: „Gemini 3.7 Flash wird weiterhin vollständig unterstützt“ und hat kein Enddatum für den Support veröffentlicht. Niemand zwingt Sie dazu.

GegenĂĽberstellung

Gemini 3.8 Flash Gemini 3.7 Flash
Modell-ID gemini-3.8-flash gemini-3.7-flash
Veröffentlicht 2. September 2026 13. August 2026
Basis „Basiert auf Gemini 3.7 Flash“ (Modellkarte) n.a.
Kontext / max. Ausgabe 1.048.576 / 65.536 Token Gleich
Eingabepreis (EinfĂĽhrung, bis 31. Dez.) 0,75 $ pro Million 0,75 $ pro Million
Ausgabepreis (EinfĂĽhrung, bis 31. Dez.) 3,75 $ pro Million, Denkprozess inbegriffen 3,75 $ pro Million, Denkprozess inbegriffen
Standardpreis (ab 1. Jan. 2027) 1,50 $ / 7,50 $ 1,50 $ / 7,50 $
Kontext-Cache-Lesen 0,075 $ pro Million (EinfĂĽhrung) Gleich
Batch 50 % Rabatt, gleiche Warteschlangen-Token-Stufen Gleich
Denk-/Argumentationsstufen low, medium (Standard), high low, medium, high
minimal Denk-/Argumentationsstufe Validierungsfehler Akzeptiert (Googles Migrationshinweis: auf low mappen)
Wissensstand März 2026 In den 3.8-Dokumenten nicht erneut aufgeführt
Ausgabegeschwindigkeit (Artificial Analysis) ~300 Token/s (302,1 gemessen, hoch) „Ungefähr die gleiche Geschwindigkeit“ laut Google
Artificial Analysis Intelligenzindex 59 (hoch) 56 (hoch)
Support-Status Aktuell „Wird weiterhin vollständig unterstützt“, kein Enddatum

Was identisch ist

Zunächst der Preis. Beide Modelle finden sich in denselben Zeilen von Googles Preisseite: 0,75 $ Eingabe und 3,75 $ Ausgabe bis zum 31. Dezember, verdoppelt sich auf 1,50 $ und 7,50 $ am 1. Januar 2027. Caching, Batch-Rabatte und die 5.000 kostenlosen Google Search Grounding-Anfragen pro Monat (geteilt über alle Gemini 3.x Modelle) werden alle übernommen. Wenn Sie die detaillierte Aufschlüsselung wünschen, gelten die Spezifikationen und Preisreferenzen für 3.7 Flash Zeile für Zeile auch für 3.8 Flash.

Kontext- und Ausgabegrenzen sind unverändert bei 1.048.576 Eingabe-Token und 65.536 Ausgabe-Token. Auch die Modalitäten sind dieselben: Text, Bild, Video, Audio und PDF als Eingabe; Text als Ausgabe. Keines der Modelle unterstützt Audio-Generierung, Bild-Generierung oder die Live API.

Die Geschwindigkeit ist nahezu gleich. Logan Kilpatrick von Google beschrieb 3.8 Flash als „gleicher Preis wie 3.7, ist ~die gleiche Geschwindigkeit“. Artificial Analysis maß 302,1 Ausgabe-Token pro Sekunde bei seinem Lauf mit hoher Denk-/Argumentationsstufe. Das ist der Durchsatz, sobald das Modell zu schreiben beginnt; die Zeit bis zum ersten Token betrug beim selben Lauf 13,30 Sekunden, da das Modell bei high nachdenkt, bevor es spricht.

Die API-Oberfläche ist ebenfalls gleich. Die Interactions API ist jetzt Googles primärer Pfad für Gemini 3.x, und der veraltete generateContent-Endpunkt „bleibt vollständig unterstützt“ ohne Enddatum. Für 3.7 Flash geschriebener Code, der einen der Endpunkte verwendet, läuft nach einem Modell-String-Tausch gegen gemini-3.8-flash, mit den Ausnahmen, die unter „Breaking Changes“ behandelt werden.

Was verbessert wurde

Googles Schlagzeile für 3.8 Flash lautet „unser intelligentestes Flash-Modell“, entwickelt für „Softwareentwicklung mit langen Horizonten, autonome Agenten und komplexe Unternehmens-Workflows“. Die Designänderung hinter dieser Behauptung: Bei schwierigen Aufgaben „führt das Modell zusätzliche Denk-/Argumentationsschritte aus und ruft Tools iterativ auf“, unternimmt „kleinere Denk-/Argumentationsschritte“ und überprüft „seine Arbeit auf dem Weg dorthin“. Hier ist, was dies in den Benchmarks erzeugt, die Google und Artificial Analysis als Text veröffentlicht haben.

Googles eigene Tabellen. Google veröffentlichte drei numerische Vergleiche mit 3.7 Flash auf der DeepMind Flash-Seite. Diese wurden vom Anbieter durchgeführt.

Benchmark (Google-AusfĂĽhrung) 3.8 Flash 3.7 Flash Delta
Vals Finance Agent v2 61.4% 59.0% +2.4
HLE-Verified 54.9% 53.6% +1.3
Harvey Legal Agent Benchmark 10.0% 8.8% +1.2

Bescheidene, aber konstante Zuwächse, und in jeder Zeile übertrifft 3.8 Flash auch die größeren Modelle in Googles Tabelle (Claude Opus 5 mit 58,6 % bei Vals Finance, 54,4 % bei HLE-Verified); der Dreiervergleich mit Claude Fable 5.1 und GPT-5.6 Sol führt diesen Gedanken weiter. Das ist ein Flash-Modell zum Flash-Preis, das Modelle übertrifft, die pro Token ein Vielfaches kosten, und das ist der Punkt, den Google vermitteln möchte.

Artificial Analysis, unabhängig. Der Bericht von Artificial Analysis platziert 3.8 Flash bei 59 auf seinem Intelligenzindex bei high, ein Anstieg von 56 für 3.7 Flash und 52 für 3.6 Flash. Das sind drei Punkte pro Veröffentlichung, und es gleicht 3.8 Flash mit GPT-5.6 Sol bei xhigh und Grok 4.6 bei medium, einen Punkt über Claude Fable 5.1 bei medium. Bei τ³-Banking, seiner Tool-Nutzungsbewertung, erreichte 3.8 Flash 45 %, ein Sprung von 12 Punkten gegenüber 3.7 Flash. Wenn Sie Agenten mit echten Tool-Aufrufen betreiben, ist diese Zeile wichtiger als der Index.

Dokumentenlastige Agentenarbeit. Google sagt, 3.8 Flash „erledigt mehr als dreimal so viele Aufgaben wie Gemini 3.7 Flash“ bei langlaufenden, dokumentenlastigen Workflows. Interne Bewertung, kein öffentliches Messsystem, daher als richtungsweisend betrachten. Es passt jedoch zum Design des Modells: Mehr Verifizierungsschritte helfen am meisten dort, wo ein einziger Fehler einen 40-Schritte-Job zum Scheitern bringen würde.

Codierung, mit einer Lücke in den Aufzeichnungen. Bei DeepSWE v1.1 erzielte 3.7 Flash 65,3 %, ein Anstieg von 49,0 % bei 3.6 Flash. Google sagt, 3.8 Flash „übertrifft die meisten größeren Frontier-Modelle“ dort zu „einem Bruchteil der Kosten“, aber der genaue 3.8-Prozentsatz erscheint nur in den Bildtabellen der Modellkarte, nicht im Text, daher werden wir keine Zahl angeben. SWE-Bench Pro-, Terminal-bench- und OSWorld-Zahlen für 3.8 Flash sind überhaupt nicht im Text veröffentlicht. Wenn diese Benchmarks Ihre Entscheidung beeinflussen, warten Sie auf Tests von Drittanbietern.

Sicherheit und Injektionsresistenz. Google meldet einen „signifikanten Sprung“ bei Gray Swan Prompt-Injection-Tests, allerdings ohne genaue Zahlen. Die Deltas der Modellkarte im Vergleich zu 3.7 Flash sind gering: Mehrsprachige Sicherheit +5,4 Punkte, Text-zu-Text-Sicherheit -0,4, ungerechtfertigte Ablehnungen +1,1. Den letzten Punkt ist als leichte Zunahme übermäßiger Ablehnungen zu verstehen.

Was es Sie kostet

Die Preise pro Token haben sich nicht geändert. Die Kosten pro Aufgabe hingegen schon. Dies ist der Kompromiss, den Google offen darlegt: Das Modell „kann bei länger dauernden und komplexen Aufgaben systembedingt mehr Token verwenden“ und „könnte mehr Token verwenden, um die Leistung zu maximieren, insbesondere bei höheren Aufwandsstufen“.

Artificial Analysis hat dies quantifiziert. Beim Ausführen ihres Index verbrauchte 3.8 Flash durchschnittlich 48.000 Ausgabe-Token pro Aufgabe, 30 % mehr als 3.7 Flash. Bei identischer Preisgestaltung pro Token führt dies zu einer höheren Rechnung pro erledigter Aufgabe:

Konfiguration (Artificial Analysis) Kosten pro Aufgabe Zeit pro Aufgabe
Gemini 3.7 Flash, high 0,40 $ 2,2 Min.
Gemini 3.8 Flash, low 0,24 $ 0,8 Min.
Gemini 3.8 Flash, medium 0,41 $ nicht veröffentlicht
Gemini 3.8 Flash, high 0,58 $ 2,5 Min.

Drei Dinge ergeben sich aus dieser Tabelle. Erstens kostet 3.8 Flash bei high etwa 45 % mehr pro Aufgabe als 3.7 Flash bei high und benötigt 14 % mehr reale Rechenzeit. Zweitens liegt 3.8 Flash bei medium, dem Standardwert, innerhalb eines Cents von 3.7 Flash bei high, sodass ein Upgrade mit „gleichem Budget“ möglich ist, wenn die medium Qualität Ihren Anforderungen entspricht. Drittens ist 3.8 Flash bei low die günstigste und schnellste Zeile in der Tabelle, was es zur offensichtlichen Wahl für latenzkritische Routen macht, bei denen 3.7 Flash aus Gewohnheit auf high lief.

Die 3.8 Flash Preisaufschlüsselung berücksichtigt dies für tägliche Volumina. Kurz gesagt: Wenn Sie pro Aufgabe bezahlen, ist das Upgrade nicht kostenlos, und die Denkstufe ist der Drehregler, mit dem Sie entscheiden, wie viel Verbesserung Sie kaufen.

Kurze Ăśbersicht der Breaking Changes

Zwei Änderungen betreffen den bestehenden 3.7 Flash-Code direkt.

thinking_level: "minimal" gibt einen Validierungsfehler zurück. 3.8 Flash akzeptiert nur low, medium und high. Wenn eine 3.7-Konfiguration minimal enthält, weisen Sie es low zu. Der Leitfaden zu den Denk-/Argumentationsstufen beschreibt, was jede Stufe bewirkt und deren Kosten und Latenz.

Funktionsantworten müssen call_id und name enthalten. Jedes function_result in der Interactions API benötigt beide Felder, und jedes functionResponse im veralteten generateContent benötigt die passende id plus name. Code, der Ergebnisse nur nach Namen zurückgab, wird beim zweiten Durchlauf einer Tool-Schleife fehlschlagen.

Darüber hinaus führt der Migrationsleitfaden von 3.7 zu 3.8 Flash durch die Gemini 3-Regeln, die beim Übergang erneut überprüft werden sollten: temperature bei der Standardeinstellung 1.0 belassen (Google warnt, dass niedrigere Werte „Schleifen oder eine verschlechterte Leistung verursachen können“), thinking_level anstelle eines Integer-Wertes thinking_budget verwenden, candidate_count entfernen und Gedankensignaturen genau wie erhalten zurückgeben. Keines davon ist neu für 3.8, aber ein 3.7-Codebasis, die sie übersprungen hat, wird die Probleme jetzt aufzeigen.

Entscheidungsmatrix nach Arbeitslast

Arbeitslast Empfehlung Warum
Mehrstufige Agenten mit Tool-Aufrufen Upgrade, medium oder high +12 bei τ³-Banking; iterative Tool-Schleifen sind der Kern von 3.8
Langdokumentenextraktion und -prĂĽfung Upgrade Googles Behauptung der 3-fachen Aufgabenleistung zielt genau auf diesen Anwendungsfall ab
Agentengestützte Codierung in einem Testrahmen Upgrade, dann messen DeepSWE-Textzahl nicht veröffentlicht; vor dem Commit in Ihrem Repo überprüfen
Finanz-, Rechts- und Forschungsagenten Upgrade Alle drei veröffentlichten Google-Tabellen sprechen für 3.8
Hochvolumige Klassifizierung, Extraktion, Chat Bleiben Sie bei 3.7, oder 3.8 bei low Die Kosten pro Aufgabe sind hier die Metrik; low ist gĂĽnstiger als 3.7 bei high
Latenzkritische benutzerorientierte Endpunkte 3.8 bei low 0,8 Min. pro Aufgabe im AA-Testrahmen vs. 2,2 Min. fĂĽr 3.7 bei high
Alles, was minimal Thinking verwendet Zuerst migrieren Validierungsfehler, bis Sie es auf low mappen
Batch-Pipelines, die auf den Cent genau bepreist sind Bleiben Sie bei 3.7, bis neu bewertet Gleicher Preis pro Token, aber +30 % Ausgabe-Token ändern die Batch-Rechnung

Das Muster: Je schwieriger und länger die Aufgabe, desto mehr rechtfertigt 3.8 Flashs „arbeitet härter“-Design seine Token. Je kürzer und repetitiver die Aufgabe, desto weniger bringt es, und desto wichtiger ist die Denkstufe (oder das Beibehalten der aktuellen Version).

FĂĽhren Sie beide Modelle in Apidog gegen dasselbe Testszenario aus

Die oben genannten Zahlen pro Aufgabe stammen aus dem Testrahmen von Artificial Analysis, nicht aus Ihrem. Bevor Sie den Modell-String in der Produktion austauschen, fĂĽhren Sie Ihre eigenen Prompts durch beide Modelle und vergleichen Sie die Token-Anzahl. Apidog macht dies zu einer Zehn-Minuten-Aufgabe.

Setzen Sie GEMINI_API_KEY als Umgebungsvariable in einer Apidog-Umgebung und fügen Sie eine POST-Anfrage an https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent hinzu, wobei x-goog-api-key aus der Variablen gelesen wird. Machen Sie model ebenfalls zu einer Szenario-Variablen. Der Body ist für beide Läufe gleich:

{
  "contents": [{"parts": [{"text": "{{golden_prompt}}"}]}],
  "generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}

Erstellen Sie ein Testszenario mit zwei Schritten: Die Anfrage, bei der model auf gemini-3.7-flash gesetzt ist, dann dieselbe Anfrage mit gemini-3.8-flash. Fügen Sie bei jedem Schritt Assertions für usageMetadata.candidatesTokenCount und usageMetadata.thoughtsTokenCount mit einer Obergrenze hinzu, die Ihr Budget widerspiegelt, sowie eine JSON-Path-Assertion für jedes Feld, das Ihre Anwendung liest. Führen Sie das Szenario mit einem Datensatz von zehn oder zwanzig goldenen Prompts aus. Der Testbericht zeigt die Antwort jedes Schritts und die Assertionsergebnisse zusammen, sodass Sie die Token-Anzahlen beider Modelle aus einem Lauf ablesen können und die +30%-Zahl zu Ihrer Zahl wird, anstatt die eines Benchmarks zu sein.

Sobald die Zahlen stimmen, planen Sie das Szenario, sodass eine leise Erhöhung der Denk-Token nach einem Modell-Update einen Test fehlschlagen lässt, anstatt auf einer Rechnung aufzutauchen. Laden Sie Apidog herunter, um es einzurichten; der kostenlose Plan deckt diesen Workflow ab.

FAQ

Ist Gemini 3.8 Flash schneller als 3.7 Flash?

Nein. Googles eigene Beschreibung lautet „~die gleiche Geschwindigkeit“, und Artificial Analysis maß etwa 300 Ausgabe-Token pro Sekunde bei high. Da 3.8 Flash in mehr Schritten argumentiert, stieg die reale Rechenzeit pro Aufgabe in seinem Testrahmen (2,5 Minuten vs. 2,2 bei high). Das Herabsetzen auf low reduziert sie auf 0,8 Minuten.

Kostet Gemini 3.8 Flash mehr als 3.7 Flash?

Nicht pro Token. Beide kosten bis zum 31. Dezember 0,75 $ Eingabe und 3,75 $ Ausgabe, danach 1,50 $ und 7,50 $. Pro Aufgabe, ja: Artificial Analysis maĂź 0,58 $ bei high gegenĂĽber 0,40 $ fĂĽr 3.7 Flash bei high, da 3.8 Flash etwa 30 % mehr Ausgabe-Token schreibt.

Wird Google Gemini 3.7 Flash einstellen?

Google sagt, 3.7 Flash „bleibt vollständig unterstützt“ und hat kein Enddatum für den Support veröffentlicht. Sie können dabei bleiben. Der „What’s new in 3.7 Flash“-Post ist immer noch die Referenz für dieses Modell.

Was ändert sich, wenn ich zu 3.8 Flash wechsle?

Zwei Dinge: thinking_level: "minimal" gibt jetzt einen 400 INVALID_ARGUMENT Fehler zurück, und jede Funktionsantwort muss sowohl die Aufruf-ID (call_id in der Interactions API, id im veralteten generateContent) als auch name enthalten. Alles andere an der Gemini 3 API ist unverändert.

Wie verhält sich dieser Sprung im Vergleich zu 3.6 zu 3.7?

3.7 Flash war ein größerer Schritt: DeepSWE stieg von 49,0 % auf 65,3 %, und der Artificial Analysis Index von 52 auf 56. Der 3.8-Schritt beträgt +3 im Index und stellt eine Neugestaltung dar, wie das Modell Token ausgibt. Für die frühere Generation siehe 3.6 Flash vs 3.5 Flash, der die Preissenkung behandelt, die diese Reihe von Veröffentlichungen einleitete.

Die Kurzfassung

Führen Sie ein Upgrade durch, wenn Ihre Arbeitslast agentenbasiert, tool-lastig oder dokumentenlastig ist. Dort zeigen sowohl Google als auch Artificial Analysis Verbesserungen, und dort erkaufen die zusätzlichen Token erledigte Aufgaben. Bleiben Sie bei 3.7 Flash, oder wechseln Sie zu 3.8 bei low, wenn Sie kurze, repetitive Aufrufe ausführen, bei denen die Kosten pro Aufgabe die von Ihnen gemeldete Zahl sind. Beheben Sie in jedem Fall zuerst minimal und überprüfen Sie Ihre Funktionsantworten, messen Sie dann die Token-Anzahlen bei Ihren eigenen Prompts, bevor Sie einem fremden Testrahmen vertrauen, einschließlich unserem.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen