Gemini 3.6 Flash vs 3.5 Flash: Alle Änderungen und lohnt sich das Upgrade?

Gemini 3.6 Flash vs. 3.5 Flash: gleicher Input für $1.50, Output auf $7.50 gesenkt, 17 % weniger Output-Tokens, höhere Bewertungen bei der Computernutzung. Was hat sich geändert und sollten Sie ein Upgrade durchführen?

Ashley Innocent

Ashley Innocent

22 July 2026

Gemini 3.6 Flash vs 3.5 Flash: Alle Änderungen und lohnt sich das Upgrade?

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Google hat seinen Flash-Tier am 21. Juli 2026 aktualisiert, und das Arbeitstier-Modell ist eine Version auf Gemini 3.6 Flash gesprungen. Wenn Sie 3.5 Flash in Produktion verwenden, hier die Kurzversion: 3.6 Flash ist ein günstigerer, token-effizienterer Drop-in-Ersatz, und die meisten Teams sollten ein Upgrade durchführen. Dieselbe Modellfamilie, derselbe 1M-Token-Kontext, derselbe Eingabepreis. Der Output kostet pro Token weniger, und das Modell schreibt weniger Output-Tokens, um dieselbe Aufgabe zu erledigen. Für eine vollständige Übersicht über das neue Modell, siehe was ist Gemini 3.6 Flash.

Button

Die kurze Antwort

Upgrade. Gemini 3.6 Flash behält den Eingabepreis von 1,50 $ pro Million, senkt den Ausgabepreis von 9,00 $ auf 7,50 $ pro Million und erzeugt etwa 17 % weniger Output-Tokens als 3.5 Flash bei denselben Aufgaben. Es erzielt auch höhere Werte bei Benchmarks für die Computernutzung (83,0 vs. 78,4 auf OSWorld-Verified) und benötigt weniger Denkschritte bei mehrstufigen Workflows. Der einzige Grund, zu warten: Sie haben 3.5 Flash in Produktion festgesetzt und validiert und können Ihre Evals noch nicht erneut ausführen.

Gemini 3.6 Flash vs 3.5 Flash im Vergleich

Hier ist der wichtige Vergleich, direkt aus den Startzahlen von Google. Die Details finden Sie im Google Blogbeitrag und auf der DeepMind Flash Modellseite.

Attribut Gemini 3.6 Flash Gemini 3.5 Flash
Modell-ID gemini-3.6-flash gemini-3.5-flash
Eingabepreis (pro 1M Tokens) $1.50 $1.50
Ausgabepreis (pro 1M Tokens) $7.50 $9.00
Output-Token-Effizienz ~17 % weniger Output-Tokens Baseline
Computernutzung (OSWorld-Verified) 83.0 78.4
Kontextfenster 1M Eingabe-Tokens 1M Eingabe-Tokens

Der Eingabepreis hat sich nicht geändert. Das Kontextfenster hat sich nicht geändert. Die Änderungen betreffen die Output-Seite der Bilanz und die Effizienz, mit der das Modell zu einer Antwort gelangt.

Was sich tatsächlich verbessert hat

Vier Dinge haben sich geändert, und das sind die Gründe für eine Migration.

Weniger Output-Tokens. Gemini 3.6 Flash erzeugt etwa 17 % weniger Output-Tokens als 3.5 Flash für dieselbe Arbeit. Output-Tokens umfassen Denk-Tokens, daher schreibt ein effizienterer Denker weniger, um dieselbe Antwort zu erreichen. Sie zahlen für jeden Output-Token, daher ist dies ein direkter Kostenfaktor, keine Schönheitsmetrik.

Niedrigerer Ausgabepreis. Google hat den Ausgabepreis von 9,00 $ auf 7,50 $ pro Million Tokens gesenkt. Das ist eine Preissenkung von 17 % auf den Pro-Token-Satz, zusätzlich zur oben genannten Reduzierung der Token-Anzahl.

Bessere Computernutzung. Bei OSWorld-Verified, dem Benchmark für die Steuerung einer echten Computerschnittstelle, erreicht 3.6 Flash einen Wert von 83,0 gegenüber 78,4 für 3.5 Flash. Wenn Sie Agenten erstellen, die UIs durchklicken, Formulare ausfüllen oder Tools bedienen, zeigt sich dieser Unterschied in weniger fehlgeschlagenen Schritten.

Weniger Denk- und Tool-Aufrufe. Bei mehrstufigen Agenten-Workflows erreicht 3.6 Flash das Ziel in weniger Denkschritten und weniger Tool-Aufrufen. Jeder vermiedene Tool-Aufruf ist ein Roundtrip, den Sie nicht bezahlen und auf den Sie nicht warten müssen, was die Token-Einsparungen bei allem Agenten-Bezogenem noch verstärkt. Die Präzision beim Codieren hat sich ebenfalls verbessert, was wichtig ist, wenn das Modell Dateien bearbeitet oder Diffs generiert, bei denen ein falscher Token den Build unterbricht.

Nichts davon ändert die Form der API. Es ist dasselbe Anforderungsformat, dieselben Modalitäten (Text, Bild, Video, Audio, PDF) als Input, derselbe Text als Output.

Was das für Ihre Rechnung bedeutet

Die beiden Kosteneffekte addieren sich. Sie erhalten einen niedrigeren Preis pro Output-Token UND weniger Output-Tokens, für die Sie bezahlen müssen. Sie multiplizieren sich, sie addieren sich nicht nur.

Hier ist ein anschauliches Beispiel. Angenommen, ein täglicher Job generiert 10 Millionen Output-Tokens mit 3.5 Flash:

Das sind ungefähr 31 % Einsparung auf der Output-Seite dieser Arbeitslast, und Sie haben keinen einzigen Prompt geändert. Ihre Eingabekosten bleiben gleich, da der Eingabepreis mit 1,50 $ pro Million identisch ist und sich Ihre Prompts nicht geändert haben. Bei Agenten-Workloads mit vielen Tool-Aufrufen kann der Rückgang größer sein, da weniger Roundtrips auch die gesamten Tokens über den gesamten Lauf reduzieren.

Ihre tatsächliche Zahl hängt von Ihrem Input-Output-Verhältnis ab. Jobs, die viel lesen und wenig schreiben (Klassifizierung, Extraktion), sehen eine geringere Gesamtänderung, da sich die Einsparungen auf den Output konzentrieren. Jobs, die viel schreiben (Entwürfe, Codegenerierung, lange Agenten-Traces), sehen die größten Vorteile. Für eine vollständige Aufschlüsselung der Tarife, des Caching und der Details zu den Denk-Tokens, siehe Gemini 3.6 Flash Pricing und die offiziellen Gemini API Pricing Docs.

Gibt es einen Grund, bei 3.5 Flash zu bleiben?

Ja, einen engen. Seien Sie ehrlich zu sich selbst, in welchem Fall Sie sich befinden.

Der legitime Grund, 3.5 Flash festzusetzen, ist, dass Sie es bereits in Produktion validiert haben und es derzeit nicht erneut testen können. Vielleicht haben Sie eine gesperrte Evaluierungs-Suite, die an eine Compliance-Abnahme gebunden ist. Vielleicht haben Sie prompt-optimierte Outputs, von denen ein nachgeschalteter Parser abhängt, und ein Regressionsfenster ist in diesem Sprint nicht offen. Modellwechsel ändern Outputs auf subtile Weise, und „billiger“ ist keinen stillen Bruch in einem System wert, das Sie heute nicht erneut validieren können. Bleiben Sie in diesem Fall bei gemini-3.5-flash festgesetzt, bis Sie ein Testfenster haben, und migrieren Sie dann bewusst.

Um es klarzustellen: 3.5 Flash verschwindet nicht an dem Tag, an dem 3.6 ausgeliefert wird. Es ist weiterhin über die API verfügbar, und es festzusetzen ist eine gültige kurzfristige Entscheidung. Dies ist ein „Wann“, kein „Ob“. Für die meisten Teams ohne eine feste Validierungssperre deuten sowohl die Kosten als auch die Qualität auf ein sofortiges Upgrade hin.

So migrieren Sie

Der mechanische Teil ist eine Zeile. In Ihrem API-Aufruf tauschen Sie die Modell-ID aus:

Das ist die gesamte Codeänderung. Der Request Body, die Authentifizierung und die Endpunkte sind dieselben, sodass sich sonst nichts in Ihrer Integration ändert. Für eine vollständige schrittweise Anleitung pro Anfrage, siehe So verwenden Sie die Gemini 3.6 Flash API und die Gemini API Docs.

Die eigentliche Arbeit ist die Verifizierung, nicht der Austausch. Bevor Sie die neue Modell-ID in Produktion nehmen:

  1. Führen Sie Ihre Evaluierungs-Suite erneut mit 3.6 Flash aus und vergleichen Sie die Qualitätsscores mit Ihrer 3.5 Flash Baseline.
  2. Führen Sie Ihre Regressionstests erneut aus, da sich Output-Form und Formulierung zwischen den Versionen verschieben können.
  3. Überprüfen Sie alles, was die Modellausgabe nach exakter Struktur parst (JSON-Schlüssel, Regexes, nachgeschaltete Schema-Validierung).
  4. Beobachten Sie Latenz und Token-Zahlen an einem Stichproben von realem Traffic, bevor Sie vollständig ausrollen.

Wenn Ihre Outputs einen anderen Dienst speisen, behandeln Sie den Austausch wie jedes Abhängigkeits-Upgrade: Ändern Sie ihn hinter einem Feature-Flag, vergleichen Sie, dann befördern Sie ihn.

Regressionstest des Austauschs in Apidog

Hier verdient Apidog seinen Platz bei der Migration. Apidog ist ein API-Client und eine Testplattform, daher ist es der natürliche Ort, um zu beweisen, dass 3.6 Flash sich korrekt verhält, bevor Sie ihm in Produktion vertrauen. Es führt das Modell nicht aus; es sendet die Anfragen und überprüft die Antworten.

Eine saubere Methode, die beiden Modelle A/B-Tests zu unterziehen:

  1. Speichern Sie Ihre bestehende Gemini-Anfrage. Erstellen Sie den POST-Aufruf an die Gemini API in Apidog, wobei Ihr API-Schlüssel in einer Umgebungsvariablen gespeichert ist, damit er niemals im Request Body landet.
  2. Duplizieren Sie sie. Ändern Sie genau eine Sache: die Modell-ID, von gemini-3.5-flash zu gemini-3.6-flash. Alles andere bleibt identisch, damit Sie Gleiches mit Gleichem vergleichen.
  3. Fügen Sie Assertions hinzu. Verifizieren Sie den Statuscode und die JSON-Felder, die Ihre App tatsächlich liest, damit eine Formänderung lautstark fehlschlägt, anstatt downstream zu leaken.
  4. Vergleichen Sie Antworten und Latenz. Starten Sie beide, legen Sie die Outputs nebeneinander und überprüfen Sie, ob die 3.6-Antwort immer noch jede Assertion besteht, die die 3.5-Antwort bestanden hat. Beachten Sie die Antwortzeit und den Token-Verbrauch bei jedem.
  5. Halten Sie die Assertions über die Zeit grün. Speichern Sie beides als Testszenario und planen Sie es als Regressionstest, damit eine zukünftige Modell- oder Prompt-Änderung den Vertrag nicht stillschweigend brechen kann.

Das ist der ehrliche Workflow: Duplizieren Sie die Anfrage, ändern Sie nur die Modell-ID und lassen Sie sich von den Assertions sagen, ob der Austausch sicher ist. Laden Sie Apidog herunter, wenn Sie den Vergleich mit Ihren eigenen Gemini-Aufrufen durchführen möchten.

Häufig gestellte Fragen

Ist Gemini 3.6 Flash ein Drop-in-Ersatz für 3.5 Flash? Mechanisch ja. Sie ändern die Modell-ID von gemini-3.5-flash zu gemini-3.6-flash, und der Rest der Anfrage bleibt gleich. Sie sollten Ihre Evals und Regressionstests vor der Produktion dennoch erneut ausführen, da sich die Output-Formulierung und -Struktur zwischen den Versionen verschieben können.

Hat sich der Eingabepreis geändert? Nein. Der Input bleibt bei 1,50 $ pro Million Tokens bei beiden Modellen. Nur der Ausgabepreis hat sich geändert, von 9,00 $ auf 7,50 $ pro Million.

Warum ist das Modell 3.6, aber die Lite- und Cyber-Varianten sind 3.5? Google hat bei dieser Aktualisierung nur das Arbeitstier-Flash-Modell auf 3.6 angehoben. Flash-Lite und Flash Cyber wurden als 3.5-Versionen ausgeliefert. Die Versionsnummern sind nicht innerhalb des Tiers synchron, lesen Sie also die Modell-ID, nicht nur die Familiennummer.

Wird meine Rechnung definitiv um 31 % sinken? Nein, diese Zahl ist ein anschauliches Beispiel für eine Output-intensive Arbeitslast. Ihre tatsächlichen Einsparungen hängen von Ihrem Input-Output-Token-Verhältnis ab. Output-intensive Jobs sparen am meisten; Lese-intensive Jobs sparen weniger, da der Rabatt auf den Output fällt.

Ist 3.5 Flash noch nutzbar? Ja. Es bleibt über die API verfügbar. Wenn Sie es validiert haben und noch nicht erneut testen können, ist es eine vernünftige kurzfristige Wahl, es festzusetzen. Planen Sie die Migration für Ihr nächstes Testfenster.

Für die vorherige Generation, die dieses Modell ersetzt, siehe was ist Gemini 3.5.

Für die meisten Teams stimmen die Berechnungen und die Benchmarks überein: Tauschen Sie die Modell-ID auf gemini-3.6-flash, führen Sie Ihre Evals und einen kurzen Regressionstest in Apidog durch und nutzen Sie das günstigere, effizientere Modell. Halten Sie 3.5 Flash nur dort fest, wo eine Validierungssperre Sie dazu zwingt, und migrieren Sie in dem Moment, in dem dieses Fenster sich öffnet.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen