Gemini 3.8 Flash wird mit drei Denkebenen ausgeliefert: low, medium und high. Die Einstellung steuert, wie viel interne Überlegungen das Modell anstellt, bevor es antwortet, und bei diesem Modell bewegt sie drei Zahlen auf einmal: Latenz, Ausgabe-Tokens und Ihre Rechnung. Google hat 3.8 Flash so konzipiert, dass es bei komplexen Aufgaben „härter arbeitet“, daher ist die gewählte Ebene wichtiger als bei 3.7 Flash. Wenn Sie neu bei diesem Modell sind, bietet die Gemini 3.8 Flash Übersicht eine Einführung. Dieser Leitfaden behandelt ausschließlich die Einstellung.
Zwei Details verwirren Teams in der ersten Stunde. Die Standardstufe bei 3.8 Flash ist medium, nicht high (Gemini 3 Pro verwendet standardmäßig high, daher die Verwirrung). Und minimal, das von für Gemini 3.7 Flash geschriebenen Konfigurationen noch gesendet wird, wird nicht mehr akzeptiert: Die Anfrage schlägt die Validierung fehl, bevor ein einziges Token generiert wird. Google dokumentiert beides auf der Seite Neuerungen in Gemini 3.8 Flash.
Unten: Was jede Ebene tut, was sie pro Aufgabe kostet, wie man sie in beiden API-Formen einstellt, eine pro-Route-Strategie und ein wiederholbarer Test, der den Token- und Latenzunterschied vor dem Einsatz zeigt.
Denkebenen auf einen Blick
| Ebene | Googles Empfehlung | Kosten pro Aufgabe (AA) | Zeit pro Aufgabe (AA) | Wann darauf zurückgreifen |
|---|---|---|---|---|
low |
Minimiert Latenz und Kosten; einfache Anweisungsbefolgung, Chat, Routen mit hohem Durchsatz | $0.24 | 0.8 Min. | Benutzer-seitige Latenz ist wichtig; Transkriptsuche; Klassifikation |
medium (Standard) |
Der Standard für komplexen Code und agentische Arbeit | $0.41 | nicht im Text veröffentlicht | die meisten Routen; allgemeine Video-Frage-und-Antwort |
high |
Maximale Überlegungstiefe für die schwierigsten mehrstufigen Probleme | $0.58 | 2.5 Min. | dichte visuelle QA; Videos über 60 Minuten; Planungsschritte, die alles danach steuern |
minimal |
Nicht unterstützt auf 3.8 Flash | n/a | n/a | nie; auf low mappen |
Die Spalten für Kosten und Zeit sind Durchschnittswerte von Artificial Analysis, die ihren Intelligence Index auf jeder Ebene mit Googles Einführungspreisen pro Token ermittelt haben. Es handelt sich um unabhängige Zahlen, nicht um die von Google, und sie messen eine Benchmark-Arbeitslast, nicht Ihre Prompts. Verwenden Sie sie für Verhältnisse und messen Sie dann Ihre eigenen Routen.
Was jede Ebene tut
Jede 3.8 Flash-Antwort kann „Denk-Tokens“ enthalten: Überlegungen, die das Modell vor der sichtbaren Antwort generiert. Sie zahlen dafür als Ausgabe-Tokens (3,75 $ pro Million zum Einführungspreis bis 31.12.2026, 7,50 $ ab 01.01.2027), und die API meldet sie separat als usageMetadata.thoughtsTokenCount. Die Denkebene sagt dem Modell, wie viele dieser Überlegungen es anstellen soll.
lowhält die Überlegungen kurz. Das erste Token kommt am schnellsten und die Ausgaberechnung bleibt klein. Google positioniert es für latenzempfindliche Aufgaben: einfache Anweisungsbefolgung, Chat und Endpunkte mit hohem Durchsatz.mediumist der Gleichgewichtspunkt und der Standard. Google nennt es die Einstellung für komplexen Code und agentische Aufgaben, was das meiste ist, wofür Leute ein Flash-Klasse-Modell verwenden.highweist das Modell an, so tief wie möglich zu überlegen. Google reserviert es für die schwierigsten mehrstufigen Probleme.
Was dies bei 3.8 Flash anders macht, ist das neue Standardverhalten des Modells. Bei komplexen Aufgaben „führt es zusätzliche Überlegungsschritte aus und ruft Tools iterativ auf“ und „überprüft seine Arbeit auf dem Weg dorthin“. Google sagt deutlich, dass es „konstruktionsbedingt mehr Tokens für länger laufende und komplexe Aufgaben verwenden kann“ und dass „das Modell mehr Tokens verwenden könnte, um die Leistung zu maximieren, insbesondere bei höheren Anstrengungsebenen“. Die Denkebene ist die Drossel für dieses Verhalten. Es zu senken, ist Googles erster Vorschlag, wenn der Token-Verbrauch steigt; der zweite ist, bei 3.7 Flash zu bleiben, das weiterhin vollständig unterstützt wird.
Eine Einschränkung, die verinnerlicht werden sollte: thinking_level ist ein Enum, kein Budget. Das Integer thinking_budget aus früheren Modellen gibt es bei Gemini 3 nicht mehr, Sie können also nicht nach „höchstens 2.000 Denk-Tokens“ fragen. Sie wählen eine Ebene und überprüfen dann, was sie bei Ihren Prompts kostet, weshalb der Test am Ende dieses Leitfadens wichtig ist.
Der Standard ist medium, nicht high
Wird das Feld weggelassen, läuft 3.8 Flash auf medium. Das betrifft zwei Gruppen.
Teams, die auf Gemini 3 Pro prototypisierten, erwarten standardmäßig high und erhalten Antworten mittlerer Tiefe, ohne es zu bemerken. Teams, die thinking_budget während eines 3.7 Flash-Upgrades entfernt und es nicht durch eine Ebene ersetzt haben, landen überall auf „medium“, einschließlich der Chat-Routen, die auf low sein sollten.
Die Lösung für beide ist dieselbe: Setzen Sie thinking_level explizit bei jeder Anfrage, pro Route, in der Konfiguration, nicht im Code. Standardwerte kann Google ändern; Ihr Kostenprofil sollte sich nicht verschieben, wenn dies geschieht.
Warum minimal entfällt und wie der Fehler behoben wird
minimal funktionierte auf Gemini 3.7 Flash. Auf 3.8 Flash gehört es nicht mehr zu den unterstützten Einstellungen, und die Modellseite listet Denkebenen nur als low, medium und high auf. Wenn man es über REST sendet, wird die Anfrage abgelehnt, bevor das Modell läuft, mit einem 400 INVALID_ARGUMENT und der Meldung „Thinking level MINIMAL is not supported for this model. Please retry with other thinking level.“ (verifiziert mit einem Live-Aufruf am 3. September 2026). SDKs verpacken dies in ihrer eigenen Ausnahmeklasse, daher sollte man auf den Status 400 oder den Code INVALID_ARGUMENT abgleichen, nicht auf den Nachrichtentext.
Vorher:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "minimal" }
}
Nachher:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "low" }
}
Googles Migrationsanleitung ist eine direkte Zuordnung: minimal wird zu low. Zwei Versuchungen, die Sie vermeiden sollten, während Sie in dieser Konfiguration sind. Greifen Sie nicht nach thinking_budget, um eine kleinere Untergrenze zu erhalten; es wird bei Gemini 3-Modellen nicht unterstützt. Und senken Sie nicht die temperature, um "das Modell zu beruhigen"; Google sagt, Sie sollen sie bei allen Gemini 3-Modellen auf dem Standardwert 1.0 belassen, da eine Senkung zu Schleifen oder verschlechterter Ausgabe führen kann. Die vollständige Checkliste, einschließlich Gedankensignaturen und der call_id-Anforderung bei Funktionsantworten, finden Sie im 3.7 zu 3.8 Flash Migrationsleitfaden.
Da der Fehler zur Validierungszeit auftritt, fängt eine geplante Testanfrage auf jeder Ebene eine Konfigurationsregression auf minimal kostenlos ab.
Was jede Ebene pro Aufgabe kostet
Der Preis pro Token ändert sich nicht mit der Ebene. Googles Preisseite listet jeden 3.8 Flash-Aufruf zum Einführungspreis mit 0,75 $ für den Input und 3,75 $ für den Output pro Million Tokens auf, was sich am 01.01.2027 auf 1,50 $ und 7,50 $ verdoppelt. Der Unterschied zwischen den Ebenen ist rein die Token-Anzahl, die von Artificial Analysis gemessen wurde.
| Modell und Ebene | Kosten pro Aufgabe | Zeit pro Aufgabe |
|---|---|---|
Gemini 3.8 Flash low |
$0.24 | 0.8 Min. |
Gemini 3.8 Flash medium |
$0.41 | nicht im Text veröffentlicht |
Gemini 3.8 Flash high |
$0.58 | 2.5 Min. |
Gemini 3.7 Flash high |
$0.40 | 2.2 Min. |
Quelle: Artificial Analysis, Intelligence Index-Läufe zu Einführungspreisen. Aus der Tabelle ergeben sich drei Verhältnisse.
low läuft mit etwa 41 % der Kosten von high und etwa einem Drittel der tatsächlichen Zeit. Das ist der größte einzelne Hebel, den Sie bei diesem Modell haben.
medium auf 3.8 Flash kostet etwa so viel wie high auf 3.7 Flash (0,41 $ vs. 0,40 $). Wenn Sie mit 3.7 Flash auf high zufrieden waren, ist 3.8 Flash auf medium die vergleichbare Budgetlinie.
high auf 3.8 Flash kostet 45 % mehr pro Aufgabe als high auf 3.7 Flash, bei identischen Preisen pro Token, weil das Modell etwa 30 % mehr Ausgabe-Tokens emittiert (im Durchschnitt 48k pro Indexaufgabe). Das ist das "härter arbeiten"-Design, das sich auf der Rechnung zeigt. Ob sich die zusätzlichen Tokens auszahlen, hängt von der Arbeitslast ab; der Vergleich zwischen 3.8 Flash und 3.7 Flash zeigt, wo die Qualitätsgewinne liegen.
Eine Vorsicht bezüglich der Qualität: AAs Intelligence Index-Wert von 59 für 3.8 Flash ist ein high-Lauf. Sie haben keine Indexwerte für medium oder low im Text veröffentlicht, daher sollte man nicht davon ausgehen, dass die Qualitätskurve linear mit den Kosten verläuft. Testen Sie Ihre eigenen Bewertungen auf jeder Ebene, bevor Sie eine Route herunterstufen. Ein durchgerechnetes Beispiel für 1.000 Aufgaben pro Tag auf jeder Ebene und die Preisgrenze am 31. Dezember finden Sie unter Gemini 3.8 Flash-Preise.
Einstellung von thinking_level in der Interactions API
Die Interactions API ist Googles primäre Schnittstelle für Gemini 3.x. Die Ebene befindet sich in generation_config als snake_case-String:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" -H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
In Python:
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Explain HTTP caching in 3 sentences.",
generation_config={"thinking_level": "low"},
)
print(interaction.output_text)
Es ist ein Feld auf Anforderungsebene, daher sollte es bei jedem Aufruf gesetzt werden, einschließlich nachfolgender Schritte, die previous_interaction_id übergeben. Die Antwort kommt als Liste von Ausführungsschritten (Gedanken, Tool-Aufrufe), die mit model_output enden, und das SDK legt den endgültigen Text als output_text offen. Für die vollständige erste Schritt-für-Schritt-Anleitung, einschließlich Multi-Turn-Zustand und Streaming, siehe wie man die Gemini 3.8 Flash API verwendet.
Einstellung in der älteren generateContent-Funktion
Der meiste bestehende Gemini-Code ruft immer noch generateContent auf. Google bezeichnet es als "legacy", sagt aber, dass es weiterhin vollständig unterstützt wird und kein Enddatum hat, es besteht also keine Eile. Das Feld ist eine Ebene tiefer verschachtelt und in camelCase:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" -H 'Content-Type: application/json' -X POST \
-d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
In Python:
from google.genai import types
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Explain HTTP caching in 3 sentences.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="low")
),
)
print(response.usage_metadata.thoughts_token_count)
includeThoughts: true fügt Gedanken-Zusammenfassungen zur Antwort hinzu, als Teile, die mit thought: true gekennzeichnet sind: nützlich während der Kalibrierung einer Ebene, Rauschen, sobald Sie fertig sind. Die Zahl, die Sie interessiert, ist usageMetadata.thoughtsTokenCount, die genaue Anzahl, die als Ausgabe abgerechnet wird, und das Feld, das Ihre Tests überwachen sollten.
Eine Pro-Route-Strategie
Betrachten Sie die Ebene als eine Routing-Entscheidung, nicht als eine globale Einstellung. Eine praktikable Aufteilung:
- Chat, Autovervollständigung und alles, worauf eine Person wartet:
low. Hier liegt die Latenz des ersten Tokens. - Klassifikation, Extraktion und Transkriptsuche:
low, mit einem eigenen einmaligen Evaluierungslauf, um die Genauigkeit zu bestätigen. Googles eigenes Video-Beispiel platziert die Transkriptsuche beilow. - Codierungsagenten und Tool-Schleifen:
medium, der Standard. Eskalieren Sie einen einzelnen Planungsschritt aufhigh, wenn seine Ausgabe jeden späteren Schritt steuert, dann kehren Sie zurück. Bei 3.8 Flash führen Tool-Schleifen von Natur aus mehr Durchläufe aus, daher summiert sichhighüber eine ganze Schleife schnell. - Dokumentenintensive, langfristorientierte Workflows:
high, und leiten Sie sie über die Batch API mit 50 % Rabatt, wenn sie nicht interaktiv sind. - Video: Googles Dokumentation gibt drei Beispiele.
highfür dichte visuelle QA oder Videos über 60 Minuten,mediumfür allgemeine Video-Frage-und-Antwort,lowfür die Suche in einem Transkript.
Wenn low auf 3.8 Flash immer noch ein größeres Modell ist, als eine Route benötigt, existiert die Flash-Lite-Linie für diese Aufgabe; unser früherer Gemini 3.1 Flash-Lite-Leitfaden behandelt den Kompromiss, und Gemini 3.5 Flash-Lite ist der aktuelle Einstieg mit 0,30 $ für Input und 2,50 $ für Output.
Behalten Sie die Ebene in der pro-Route-Konfiguration und halten Sie gemini-3.7-flash hinter einem Flag. Wenn die Token-Anzahl einer Route nach dem Upgrade ansteigt, können Sie die Ebene oder das Modell ohne einen neuen Einsatz reduzieren.
Testen Sie alle drei Ebenen nebeneinander in Apidog
Das Lesen der AA-Tabelle liefert Ihnen die Verhältnisse. Nur Ihre Prompts sagen Ihnen die Zahlen. Hier ist ein Testszenario in Apidog, das einen goldenen Prompt auf jeder Ebene sendet und überprüft, was zurückkam. Es funktioniert mit beiden API-Formen; der Legacy-Endpunkt wird gezeigt, da usageMetadata dort ein Feld der obersten Ebene ist.
- Speichern Sie den Schlüssel als Umgebungsvariable. Erstellen Sie
GEMINI_API_KEYin einer Apidog-Umgebung und verweisen Sie darauf als{{GEMINI_API_KEY}}imx-goog-api-keyHeader. Fügen Sie eine zweite Variable hinzu,THINKING_LEVEL, damit eine gespeicherte Anfrage alle drei Schritte bedient. - Speichern Sie eine Anfrage. POST an
/v1beta/models/gemini-3.8-flash:generateContentmit Ihrem goldenen Prompt und"thinkingConfig": {"thinkingLevel": "{{THINKING_LEVEL}}"}. - Erstellen Sie ein dreistufiges Testszenario. Importieren Sie dieselbe Anfrage dreimal und überschreiben Sie
THINKING_LEVELin jedem Schritt auflow,mediumundhigh. - Bestätigen Sie die sich ändernden Felder. Bei jedem Schritt: Status ist 200 und
usageMetadata.thoughtsTokenCountexistiert. Imlow-Schritt bestätigen Sie, dassthoughtsTokenCountund die Antwortzeit unter der Obergrenze bleiben, die diese Route tolerieren kann (setzen Sie die Baseline nach Ihrem ersten Lauf). Ein Post-Processor-Skript kann die Zählung jedes Schritts in einer Variable speichern, so dass derhigh-Schritt bestätigen kann, dass er mindestens so viel überlegt hat wielow. Wenn sich diese Reihenfolge jemals umkehrt, hat sich das Modell oder der Standardwert unter Ihnen geändert. - Fügen Sie einen Schutzschritt hinzu. Senden Sie
thinkingLevel: "minimal"und bestätigen Sie, dass die Antwort kein 200 ist. Wenn Sie später Modell-IDs austauschen, sagt Ihnen dieser Schritt, ob das neue Modell dies immer noch ablehnt. - Planen Sie es ein. Führen Sie das Szenario täglich aus, damit eine Konfigurationsregression oder eine stille Verhaltensänderung als roter Lauf angezeigt wird, nicht als überraschende Rechnung. Die Mechanik ist in wie man API-Tests in Apidog plant beschrieben.
Für gestreamte Antworten gilt dasselbe Szenario mit SSE-Rendering; wie man LLM-APIs testet, die über SSE streamen behandelt die Einrichtung. Laden Sie Apidog herunter, um mitzumachen; der kostenlose Plan deckt dieses gesamte Szenario ab.
FAQ
Ändert die Denkebene den Preis pro Token?
Nein. Der Input kostet 0,75 $ und der Output 3,75 $ pro Million Tokens bei 3.8 Flash zum Einführungspreis, unabhängig von der Ebene. Die Ebene ändert, wie viele Output-Tokens das Modell als Denkvorgang generiert, und diese werden zum Output-Preis abgerechnet. Die Preisaufschlüsselung behandelt Caching, Batch und die Preiserhöhung am 1. Januar.
Kann ich stattdessen ein genaues Denk-Token-Budget festlegen?
Nicht bei Gemini 3-Modellen. thinking_budget wurde durch das thinking_level-Enum ersetzt, und 3.8 Flash akzeptiert nur low, medium und high. Wenn Sie eine Obergrenze benötigen, erzwingen Sie diese in Tests und Alarmierungen statt in der Anfrage.
Welche Ebene verwendet der Artificial Analysis Score von 59?
high. AA führte den Intelligence Index bei high für die Schlagzeilenbewertung durch und veröffentlichte Kosten und Zeit auch bei low und medium, aber keine Indexwerte auf diesen Ebenen. Betrachten Sie niedrigere Ebenen als ungetestet auf diesem Benchmark, bis Sie Ihre eigenen Bewertungen durchführen.
Soll ich die Temperatur senken, um das Denken zu reduzieren?
Nein. Googles Empfehlung für alle Gemini 3-Modelle ist, die temperature auf dem Standardwert 1.0 zu belassen. Eine Senkung kann zu Schleifen oder einer verschlechterten Ausgabe führen. Verwenden Sie thinking_level, um die Überlegungstiefe zu steuern.
Was, wenn selbst "low" zu langsam oder zu teuer ist?
Bleiben Sie bei Gemini 3.7 Flash, das laut Google weiterhin vollständig unterstützt wird und kein Enddatum hat, oder verschieben Sie die Route auf ein Flash-Lite-Modell. Der 3.8 vs. 3.7 Flash Vergleich zeigt, wo die zusätzlichen Tokens eine messbare Qualität kaufen und wo nicht.
Wählen Sie die Ebene pro Route und messen Sie sie dann
Drei Ebenen, ein Enum und ein Modell, das standardmäßig mehr überlegt als sein Vorgänger. Setzen Sie thinking_level explizit auf jeder Route, ordnen Sie alle verbleibenden minimal zu low zu und beobachten Sie usageMetadata.thoughtsTokenCount, wo jede Ebene landet. AAs Pro-Aufgabe-Zahlen (0,24 $, 0,41 $, 0,58 $) geben Ihnen die Form der Kurve; ein dreistufiges Szenario in Apidog liefert Ihnen Ihre eigenen Zahlen, bevor die Preisänderung am 31. Dezember sie doppelt so wichtig macht.
