Was ist Gemini 3.8 Flash?

Gemini 3.8 Flash erklärt: Start im Sep 2026, Modell-ID, 1M Kontext, Denkebenen, Einführungspreis von $0.75/$3.75, Benchmarks vs. 3.7 Flash, warum es mehr Tokens verwendet.

Ashley Innocent

Ashley Innocent

3 September 2026

Was ist Gemini 3.8 Flash?

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Gemini 3.8 Flash ist Googles neuestes Modell der Flash-Klasse, das am 2. September 2026 zusammen mit einem zugangsbeschränkten Sicherheitszwilling namens Gemini 3.8 Flash Cyber veröffentlicht wurde. Es ist die dritte Flash-Veröffentlichung innerhalb von sechs Wochen, nach Gemini 3.6 Flash am 21. Juli und 3.7 Flash am 13. August, zum gleichen Einführungspreis wie 3.7 Flash: $0,75 pro Million Eingabetokens und $3,75 pro Million Ausgabetokens bis zum 31. Dezember 2026. Google nennt es „unser intelligentestes Flash-Modell, entwickelt für langfristige Softwareentwicklung, autonome Agenten und komplexe Unternehmensabläufe.“

Die wichtigste Änderung ist weder ein neuer Preis noch ein größeres Kontextfenster. Es ist das Verhalten. Google hat 3.8 Flash so konzipiert, dass es bei schwierigen Aufgaben „härter arbeitet“: Es unternimmt kleinere Denkschritte, überprüft seine Arbeit unterwegs und ruft Tools iterativ auf. Das bringt messbare Verbesserungen bei Agenten-Benchmarks und bedeutet, dass das Modell designbedingt mehr Tokens pro Aufgabe verbraucht. Artificial Analysis maß etwa 30 % mehr Ausgabetokens als bei 3.7 Flash. Wenn Sie Ihr Budget pro Token festlegen, ist der Preis konstant. Wenn Sie Ihr Budget pro Aufgabe festlegen, ist die Rechnung gestiegen.

Dieser Leitfaden behandelt die gesamte Einführung: Spezifikationen, den „härter arbeitenden“ Kompromiss, Benchmarks, Preise, Verfügbarkeit, den Cyber-Zwilling und was das Modell nicht kann. Jede Anfrage hier ist einfaches HTTP mit JSON, sodass Sie sie in Apidog erstellen und überprüfen können, bevor sie den Anwendungscode erreichen. Googles Ankündigungsbeitrag und die Modellseite sind die primären Quellen.

Gemini 3.8 Flash auf einen Blick

Spezifikation Wert
API Modell-ID gemini-3.8-flash (stabil, kein Vorschau-Suffix)
Veröffentlicht 2. September 2026
Basierend auf Gemini 3.7 Flash (gemäß DeepMind Modellkarte)
Kontextfenster 1.048.576 Eingabetokens
Max. Ausgabe 65.536 Tokens
Eingabemodalitäten Text, Bild, Video, Audio, PDF
Ausgabemodalitäten Nur Text
Denkstufen low, medium (Standard), high; minimal gibt einen Fehler zurück
Einführungspreis (bis 31. Dez. 2026) $0,75 Eingabe / $3,75 Ausgabe pro Million Tokens; Denkvorgang wird als Ausgabe abgerechnet
Standardpreis (ab 1. Jan. 2027) $1,50 Eingabe / $7,50 Ausgabe pro Million Tokens
Kontext-Caching $0,075 pro Million gecachter Tokens (Einführung), $0,15 Standard
Batch-API 50 % Rabatt: $0,375 / $1,875 Einführung
Wissensstand (Stichtag) März 2026
Verfügbarkeit für Entwickler Gemini API, Google AI Studio, Android Studio, Google Antigravity, Stitch, Gemini Enterprise
Verfügbarkeit für Endnutzer Gemini App (AI Pro und Ultra Abonnenten), KI-Modus in der Suche, Gemini in Google Tabellen
3.7 Flash Status Bleibt voll unterstützt; kein Enddatum der Unterstützung

Drei Zeilen verdienen einen zweiten Blick. Die Standard-Denkstufe ist medium, nicht high wie bei Gemini 3 Pro, sodass ein auf Pro abgestimmter Prompt hier weniger logisch schlussfolgert, es sei denn, Sie stellen die Stufe ein. Die Stufe minimal gibt einen Validierungsfehler zurück, anstatt stillschweigend auf low abzubilden; der Leitfaden zu den Denkstufen erklärt die Lösung. Und der Stichtag März 2026 enthält einen Vorbehalt in der Modellkarte: In einigen Bereichen kann das Wissen auf Januar 2025 beschränkt sein.

Was Gemini 3.8 Flash ist

Flash ist Googles Arbeitspferd-Stufe: das Modell, das den Großteil des Produktions-Traffics abwickeln soll, während Pro die schwierigsten Probleme löst. Google nennt 3.8 Flash „unser bislang intelligentestes Arbeitspferd-Modell“, und die DeepMind Modellkarte beschreibt es als auf 3.7 Flash basierend und nicht als ein neues Basismodell. Die ehrliche Formulierung ist also eine Verfeinerung eines drei Wochen zuvor veröffentlichten Modells, optimiert für langlaufende Softwareentwicklung und Agentenarbeit.

Der Veröffentlichungsrhythmus ist ungewöhnlich. 3.6 Flash erschien am 21. Juli zu $1,50 / $7,50, 3.7 Flash am 13. August zum Einführungspreis von $0,75 / $3,75 und 3.8 Flash am 2. September zum gleichen Preis. Google spricht von der „dritten Flash-Veröffentlichung in sechs Wochen“; Artificial Analysis zählt ein viertes Flash-Modell in weniger als vier Monaten, da ihre Zählung Gemini 3.5 Flash-Lite einschließt. Für jeden, der eine Modellkonfiguration pflegt, ist der Neuheiten-Beitrag zu 3.7 Flash drei Wochen alt und beschreibt bereits die vorherige Generation. Mit dieser Veröffentlichung wurden weder Gemini 3.8 Pro, Gemini 4 noch ein neues Flash-Lite ausgeliefert, und Google hat nicht mitgeteilt, wann ein Pro-Update kommen wird.

Das „härter arbeitende“ Design und was es Sie kostet

Googles Beschreibung der Änderung ist spezifisch. Bei komplexen Aufgaben führt 3.8 Flash „zusätzliche Denkschritte aus und ruft Tools iterativ auf.“ Es unternimmt „kleinere Denkschritte“ und „überprüft seine Arbeit unterwegs.“ Google ist direkt bezüglich der Konsequenz: Das Modell „kann designbedingt mehr Tokens bei länger laufenden und komplexen Aufgaben verwenden“, insbesondere bei höheren Anstrengungsstufen.

Artificial Analysis hat dies in ihrem unabhängigen Bericht gemessen. Beim Ausführen ihres Intelligenzindex erzielte 3.8 Flash auf hoher Denkleistung durchschnittlich 48.000 Ausgabetokens pro Aufgabe, ein Anstieg von 30 % gegenüber 3.7 Flash. Die Preise pro Token haben sich nicht geändert, sodass die Kosten pro Aufgabe von $0,40 bei 3.7 Flash (hoch) auf $0,58 bei 3.8 Flash (hoch) stiegen. Auch die Zeit pro Aufgabe stieg: 2,5 Minuten gegenüber 2,2 Minuten.

Derselbe Bericht zeigt den Hebel, den Sie haben. Auf medium sinken die Kosten pro Aufgabe auf $0,41, nahe an 3.7 Flash auf hoher Stufe. Auf low sinken sie auf $0,24 mit 0,8 Minuten pro Aufgabe. Die Denkstufe ist also jetzt eine Routing-Entscheidung, keine globale Einstellung: latenzempfindliche Endpunkte auf low, Agenten-Schleifen, die die Aufgabe unbedingt beenden müssen, auf medium oder high. Die Preisaufschlüsselung zeigt 1.000 Agenten-Aufgaben pro Tag auf jeder Stufe.

Die Geschwindigkeit ist unverändert. Logan Kilpatrick von Google beschrieb 3.8 Flash als „gleicher Preis wie 3.7, ~gleiche Geschwindigkeit“, und Artificial Analysis maß 302,1 Ausgabetokens pro Sekunde bei hoher Denkleistung. Ihre Zeit bis zum ersten Token von 13,30 Sekunden bei diesem Lauf bedeutet, dass das Modell nachdenkt, bevor es antwortet, nicht dass es sich um einen langsamen Netzwerkpfad handelt.

Was die Benchmarks sagen

Google veröffentlichte drei Benchmark-Tabellen in Textform auf der DeepMind Flash-Seite. Dies sind von Google ermittelte Zahlen.

Benchmark 3.8 Flash 3.7 Flash Claude Opus 5 GPT-5.6 Sol GPT-5.6 Terra Claude Sonnet 5
Vals Finance Agent v2 61,4% 59,0% 58,6% 53,8% 54,4% 53,9%
Harvey Legal Agent Benchmark 10,0% 8,8% 6,7% 2,5% 0,8% 5,0%
HLE-Verifiziert 54,9% 53,6% 54,4% 54,5% 51,1% 31,0%

Die Zuwächse gegenüber 3.7 Flash betragen 2,4, 1,2 und 1,3 Punkte. Bescheiden, aber die Finanz- und Rechtsreihen positionieren ein Flash-Modell vor Opus 5 und GPT-5.6 Sol, die pro Token um ein Vielfaches mehr kosten. Claude Fable 5.1, das am Vortag ausgeliefert wurde, erscheint nicht in Googles Tabellen; der Dreiervergleich verwendet Anthropic’s Opus 5 und Sonnet 5 als die nächstgelegenen veröffentlichten Einträge.

Google macht drei weitere Behauptungen ohne Zahlen in Textform. Auf DeepSWE v1.1 „übertrifft 3.8 Flash die meisten größeren Frontier-Modelle“ zu „einem Bruchteil der Kosten“; der Prozentsatz erscheint nur in den Bildtabellen der Modellkarte, daher geben wir hier keinen an (3.7 Flash erzielte 65,3 %). Bei dokumentenlastigen, langlaufenden Workflows zeigt eine interne Bewertung, dass es „mehr als dreimal so viele Aufgaben wie Gemini 3.7 Flash“ erledigt. Bei der Gray Swan Prompt-Injektion berichtet Google von einem „bedeutenden Sprung“ ohne Angabe einer Zahl. SWE-Bench Pro, Terminal-bench und OSWorld Ergebnisse werden für 3.8 Flash nicht in Textform veröffentlicht.

Die unabhängige Einschätzung stimmt überein. Artificial Analysis bewertet 3.8 Flash (hoch) mit 59 auf ihrem Intelligenzindex, gegenüber 56 für 3.7 Flash und 52 für 3.6 Flash. Das ist gleichauf mit GPT-5.6 Sol (xhoch) und Grok 4.6 (mittel) und liegt über GPT-5.6 Terra (max), Claude Fable 5.1 (mittel) und Muse Spark 1.2 (xhoch), alle mit 57. Bei ihrer τ³-Banking Tool-Nutzungsbewertung erreichte 3.8 Flash 45 %, 12 Punkte über 3.7 Flash. Der 3.8 vs. 3.7 Flash Vergleich wägt diese Verbesserungen gegen die Token-Kosten pro Arbeitslast ab.

Preise: gleicher Preis pro Token, mehr pro Aufgabe

Die Preisseite listet 3.8 Flash in denselben Zeilen wie 3.6 und 3.7 Flash, und alle drei verdoppeln sich am 1. Januar 2027.

Posten Bis 31. Dez. 2026 Ab 1. Jan. 2027
Eingabe $0,75 / 1 Mio. $1,50 / 1 Mio.
Ausgabe (inkl. Denkvorgang) $3,75 / 1 Mio. $7,50 / 1 Mio.
Gecachte Eingabe $0,075 / 1 Mio. $0,15 / 1 Mio.
Cache-Speicher $0,50 / 1 Mio. Tokens / Stunde $1,00 / 1 Mio. Tokens / Stunde
Batch-Eingabe / -Ausgabe $0,375 / $1,875 $0,75 / $3,75

Zwei Details verwirren die Leute. Denk-Tokens sind Ausgabe-Tokens: Sie werden zum Ausgabepreis abgerechnet und separat in usageMetadata.thoughtsTokenCount ausgewiesen, sodass eine kurze Antwort auf high mehr kosten kann als eine lange auf low. Und die Google Search-Grundlage hat ihren eigenen Zähler: 5.000 kostenlose Anfragen pro Monat, geteilt über alle Gemini 3.x-Modelle, danach $14 pro 1.000 Anfragen.

Ein ratenbegrenzter kostenloser Tarif existiert im AI Studio und der API, wobei Google anmerkt, dass Daten aus dem kostenlosen Tarif „zur Verbesserung unserer Produkte“ verwendet werden. Ratenbegrenzungen pro Modell werden im AI Studio und nicht in der Dokumentation angezeigt. Stufe 1 wird durch Verknüpfung eines Abrechnungskontos freigeschaltet, Stufe 2 nach Ausgaben von $100 und drei Tagen, Stufe 3 nach $1.000 und 30 Tagen. Der Leitfaden für kostenlosen Zugang erklärt, was der kostenlose Zugang bietet und was nicht, und der Batch-API-Leitfaden erklärt den 50%igen Rabatt für Jobs, die warten können.

Wie man es aufruft

Google betrachtet die Interactions API nun als den primären Weg für Gemini 3.x. generateContent wird als „veraltet“ angesehen, „bleibt aber voll unterstützt“ ohne Enddatum, und die meisten bestehenden Codes verwenden es noch. Ein minimaler Interactions-Aufruf:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Erkläre HTTP-Caching in 3 Sätzen.","generation_config":{"thinking_level":"medium"}}'

Mehrstufige Konversationen übergeben previous_interaction_id und lassen den Server den Status speichern. Funktionsaufrufe deklarieren Tools mit einem JSON-Schema, erhalten einen function_call-Schritt und erwarten ein function_result, das sowohl call_id als auch name enthält, die bei 3.8 Flash erforderlich sind (die veraltete generateContent-Methode benennt das Feld id). Die API-Anleitung zeigt beide Endpunkte in REST und Python, und der Leitfaden für Funktionsaufrufe erklärt die iterativen Tool-Schleifen, die das „härter arbeitende“ Design erzeugt, und wie man sie begrenzt.

Wenn Sie von 3.7 Flash wechseln, sind die Änderungen gering, führen aber zu Fehlern: minimales Denken wird abgelehnt, thinking_budget weicht thinking_level, candidate_count wird nicht unterstützt, und Google empfiehlt, temperature auf dem Standardwert 1.0 zu belassen, da eine Reduzierung „zu Schleifen oder einer verschlechterten Leistung führen kann.“ Der Migrationsleitfaden wandelt Googles Neuheiten-Notizen in eine Checkliste mit Vorher-Nachher-JSON um.

Was Gemini 3.8 Flash nicht kann

Die Modellseite ist explizit. Nicht unterstützt werden: Audioerzeugung, die Live-API und Bildgenerierung. Die Ausgabe ist nur Text, obwohl die Eingabe Text, Bild, Video, Audio und PDF akzeptiert. Bildsegmentierung wird bei Gemini 3-Modellen ebenfalls nicht unterstützt. Wenn Ihr Produkt Echtzeit-Sprach- oder Bildausgabe benötigt, ist dieses Modell die Schlussfolgerungs- und Tool-Aufruf-Schicht, nicht der gesamte Stack. Für günstigen Text mit hohem Durchsatz ohne intensive Schlussfolgerungen bleibt Gemini 3.5 Flash-Lite auf der Preisliste zu $0,30 / $2,50. Der Rest der Checkliste wird unterstützt, einschließlich Funktionsaufrufe, strukturierte Ausgaben, Kontext-Caching, Code-Ausführung, Search- und Maps-Anbindung, Batch-API und Computernutzung (Vorschau).

Gemini 3.8 Flash Cyber: der zugangsbeschränkte Zwilling

Gemini 3.8 Flash Cyber wurde am selben Tag ausgeliefert, und Sie können sich nicht dafür anmelden. Der Zugang erfolgt ausschließlich über das neue Fairwind-Programm, das „vertrauenswürdigen Regierungsbehörden, Betreibern kritischer Infrastrukturen und Software-Maintainern“ offensteht, mit Hintergrundüberprüfungen und Anforderungen wie Phishing-resistenter MFA. Es gibt keine öffentliche API, keine öffentlichen Preise und kein Self-Hosting. Es ersetzt den begrenzten Pilotversuch 3.5 Flash Cyber.

Googles Behauptungen sind umfassend: eine Erfolgsquote bei der Entdeckung von Schwachstellen in der realen Welt von über 70 % in 20 Programmiersprachen und ein Bericht des Chrome-Sicherheitsteams über „2,6-mal mehr korrekte Patches für Schwachstellen in Chrome als die besten kommerziellen Modelle, die viel größer sind.“ Beides sind von Google gemeldete Daten. Die Cyber-Erläuterung behandelt die Berechtigung, Verpflichtungen und was es für die vielen Teams bedeutet, die niemals Zugang erhalten werden.

Testen von Gemini 3.8 Flash-Anfragen in Apidog

Da die Kosten pro Aufgabe und nicht pro Token berechnet werden, ist der nützliche Test nicht „war der Aufruf erfolgreich“, sondern „wie viele Tokens wurden verbraucht“. Apidog handhabt dies als gewöhnlichen API-Test. Speichern Sie GEMINI_API_KEY als Umgebungsvariable, speichern Sie die Interactions- und generateContent-Anfragen als Endpunkte und prüfen Sie auf Status 200, die JSON-Felder, die Ihre App liest, und eine Obergrenze für usageMetadata.thoughtsTokenCount. Führen Sie denselben Prompt auf low, medium und high in einem Testszenario aus, und Sie erhalten die Token-Verteilung pro Stufe für Ihre eigenen Prompts anstelle der Durchschnittswerte von Artificial Analysis.

Streaming-Antworten werden als SSE dargestellt, was beim Debuggen von Gedanken-Zusammenfassungen mit includeThoughts: true hilft; der SSE-Testleitfaden erklärt dies Schritt für Schritt. Planen Sie das Szenario täglich, und eine Token-Regression führt zu einem Fehler, bevor sie auf der Rechnung landet. Laden Sie Apidog herunter, um es im kostenlosen Plan einzurichten.

Häufig gestellte Fragen

Ist Gemini 3.8 Flash ein neues Modell oder ein Update für 3.7 Flash? Die DeepMind Modellkarte sagt, es basiert auf Gemini 3.7 Flash. Betrachten Sie es als einen optimierten Nachfolger: gleicher Preis, gleiche Geschwindigkeit und gleiches Kontextfenster, mit mehr Schlussfolgerungs- und Tool-Aufrufschritten bei schwierigen Aufgaben. 3.7 Flash bleibt voll unterstützt, ohne Enddatum der Unterstützung.

Warum verwendet Gemini 3.8 Flash mehr Tokens als 3.7 Flash? Designbedingt. Google sagt, es „kann mehr Tokens für länger laufende und komplexe Aufgaben verwenden“, und Artificial Analysis maß 30 % mehr Ausgabe-Tokens in ihrem Index. Setzen Sie thinking_level auf medium oder low für Routen, die keine zusätzliche Schlussfolgerung benötigen; der Leitfaden zu den Denkstufen enthält die Kostentabelle pro Stufe.

Was ist das Kontextfenster von Gemini 3.8 Flash? 1.048.576 Eingabetokens und 65.536 Ausgabetokens, mit Kontext-Caching zu $0,075 pro Million gecachter Tokens bis zum 31. Dezember 2026.

Kann ich Gemini 3.8 Flash in der kostenlosen Gemini-App verwenden? Die Berichterstattung zur Einführung listet die Gemini-App für Google AI Pro- und Ultra-Abonnenten auf, nicht für den kostenlosen App-Tier. Entwickler erhalten einen ratenbegrenzten kostenlosen Tarif im AI Studio und der API.

Wie schneidet Gemini 3.8 Flash im Vergleich zu Claude Fable 5.1 ab? Artificial Analysis bewertet sie mit 59 und 57. Preislich kostet Claude Fable 5.1 $10 / $50 pro Million Tokens, etwa das 13-fache des Einführungspreises von 3.8 Flash für Eingabe und Ausgabe. Der Unterschied verringert sich, wenn man Tokens pro Aufgabe zählt.

Nächste Schritte

Gemini 3.8 Flash ist ein Arbeitspferd, das länger nachdenkt, und der Kompromiss ist explizit: einige Punkte mehr bei Agenten-Benchmarks und 12 Punkte bei der Tool-Nutzung, bezahlt mit etwa 30 % mehr Ausgabe-Tokens bei hoher Denkleistung. Wenn Ihre Agenten mit 3.7 Flash an ihre Grenzen stießen, kostet das Upgrade pro Token dasselbe. Wenn Ihr Traffic latenzkritischer Chat ist, stellen Sie low ein oder bleiben Sie bei 3.7 Flash, das weiterhin unterstützt wird. Beginnen Sie mit der API-Anleitung, senden Sie Ihre erste Anfrage von Apidog mit einer Token-Zählungsprüfung und lassen Sie die Zahlen, nicht den Einführungsbeitrag, die Denkleistung für jede Route bestimmen.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen