Hier ist die Entscheidung gleich vorab. Wählen Sie Gemini 3.5 Flash-Lite, wenn Sie einfache Aufgaben in großen Mengen ausführen und Ihnen Kosten und Geschwindigkeit am wichtigsten sind: Klassifizierung, Extraktion, kurze Chat-Antworten, RAG-Antworten, Autovervollständigung. Wählen Sie Gemini 3.6 Flash, wenn die Qualität wichtiger ist als die Rechnung: mehrstufige Agenten, Werkzeugnutzung, Codierung, Computernutzung und Antworten, bei denen ein falsches Ergebnis teuer ist.
Beide Modelle wurden am 21. Juli 2026 im Rahmen von Googles Flash-Tier-Update ausgeliefert. Beide akzeptieren bis zu 1 Million Eingabetoken. Sie befinden sich an verschiedenen Punkten derselben Kurve, sodass die Frage nicht wirklich lautet, welches Modell "besser" ist. Es geht darum, welcher Kompromiss am besten zu der jeweiligen Aufgabe passt.
Zuerst eine Besonderheit bei der Namensgebung: Das Arbeitspferd sprang auf 3.6, aber die Lite-Stufe blieb bei 3.5. Sie vergleichen also ein 3.5er-Modell mit einem 3.6er-Modell, und das ist so beabsichtigt, kein Tippfehler. Mehr dazu in den FAQs.
Die kurze Antwort
Verwenden Sie standardmäßig Flash-Lite für alles Einfache, das Sie millionenfach ausführen, und greifen Sie zu 3.6 Flash, sobald die Aufgabe Argumentation, Tools oder Code erfordert. Wenn Sie sich nicht entscheiden können, beginnen Sie mit Flash-Lite, beobachten Sie, wo die Antworten unzureichend sind, und stufen Sie nur diese Aufrufe auf 3.6 Flash hoch. Sie benötigen selten ein einziges Modell für die gesamte App.
Preis und Geschwindigkeit im Vergleich
| Attribut | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash |
|---|---|---|
| Modell-ID | gemini-3.5-flash-lite |
gemini-3.6-flash |
| Eingabepreis | $0.30 / 1M tokens | $1.50 / 1M tokens |
| Ausgabepreis | $2.50 / 1M tokens | $7.50 / 1M tokens |
| Durchsatz | ~350 output tokens/sec | Nicht separat veröffentlicht |
| Kontextfenster | 1M tokens | 1M tokens |
| Kostenloser Tarif | Ja (ratelimitiert) | Ja (ratelimitiert) |
Flash-Lite ist bei jedem Token günstiger. Der Input kostet 5x weniger; der Output kostet 3x weniger. Google gibt einen Durchsatz von etwa 350 Ausgabetokens pro Sekunde für Flash-Lite an, was es in einem Chatfenster oder einem Autovervollständigungsfeld sofort wirken lässt. Google hat keine separate Tokens-pro-Sekunde-Angabe für 3.6 Flash veröffentlicht, aber 3.6 Flash produziert etwa 17 % weniger Ausgabetokens als das von ihm ersetzte 3.5 Flash, sodass es mehrstufige Aufgaben schneller erledigt, als der Listenpreis vermuten lässt. Sie können die aktuellen Tarife auf der Gemini API-Preisseite und in unserer Gemini 3.6 Flash Preisübersicht bestätigen.
Qualität und Benchmarks
Die Preisspanne verschafft Ihnen Spielraum bei schwierigen Aufgaben. Auf Terminal-Bench 2.1, das die agentenbasierte Terminalarbeit misst, erzielt Flash-Lite 54 Punkte und 3.6 Flash 78,0 Punkte. Diese 24-Punkte-Spanne erzählt die ganze Geschichte: bei wirklich mehrstufigen, werkzeuggesteuerten Aufgaben ist 3.6 Flash das deutlich stärkere Modell.

3.6 Flash erzielt auch 83,0 Punkte bei OSWorld-Verified, dem Benchmark für die Computernutzung, der die Steuerung eines echten Browsers oder Desktops misst. Flash-Lite zielt nicht auf diese Fähigkeit ab. Wenn Ihre Arbeitslast auf einem Bildschirm herumklickt, ist das eine Aufgabe für 3.6 Flash. Speziell beim Codieren erreicht 3.6 Flash 58,7 % bei SWE-Bench Pro und 49 % bei DeepSWE v1.1, Ergebnisse, die es in den Bereich der echten agentenbasierter Codierung bringen. Flash-Lite ist nicht für diese Arbeit ausgelegt.
Man sollte hier Flash-Lite gerecht werden. Seine 54 Punkte auf Terminal-Bench 2.1 sind ein Anstieg von 31 in der vorherigen Lite-Generation, sodass die günstige Stufe in dieser Runde deutlich leistungsfähiger wurde. Es ist kein schwaches Modell. Es ist ein Modell, das für eine andere Aufgabe optimiert wurde: schnelle, kostengünstige, ausreichend gute Argumentation bei Aufgaben, die sich nicht verzweigen. Googles eigene Flash-Modellseite und die Ankündigung zur Markteinführung beschreiben die beiden Modelle auf die gleiche Weise: eine Stufe für Volumen, eine Stufe für Tiefe.
Welches Modell für welche Aufgabe
Verwenden Sie dies als Startmatrix und passen Sie sie dann mit Ihren eigenen Bewertungen an.
| Aufgabe | Am besten geeignet |
|---|---|
| Klassifizierung oder Extraktion in großen Mengen | Flash-Lite |
| Chat-Assistenten und kurze Antworten | Flash-Lite |
| RAG-Antworten über abgerufenen Kontext | Flash-Lite |
| Autovervollständigungs-UX mit kritischer Latenz | Flash-Lite |
| Suchmaschinengerechte Pipelines für jede Anfrage | Flash-Lite |
| Mehrstufige Agenten | 3.6 Flash |
| Werkzeugnutzung und Funktionsaufrufketten | 3.6 Flash |
| Codierung und Code-Review | 3.6 Flash |
| Computernutzung (Browser oder Desktop) | 3.6 Flash |
| Antworten mit höherem Risiko, bei denen Fehler Geld kosten | 3.6 Flash |
Das Muster ist einfach. Flash-Lite gewinnt, wo die Aufgabe eng gefasst und das Volumen riesig ist. 3.6 Flash gewinnt, wo die Aufgabe verzweigt ist und die Kosten für einen Fehler hoch sind. Ein Modell, das Support-Tickets zehn Millionen Mal am Tag nach Kategorien kennzeichnet, gehört auf Flash-Lite. Ein Modell, das einen Stack-Trace liest, drei Dateien bearbeitet und einen Pull Request öffnet, gehört auf 3.6 Flash. Wenn Sie dies gegen das ältere 3.5 Flash anstelle von Flash-Lite abwägen, deckt unser 3.6 Flash vs 3.5 Flash Vergleich diesen Upgrade-Pfad ab.
Ein Kostenvergleich bei gleicher Arbeitslast
Zahlen machen den Kompromiss konkret. Nehmen wir an, ein täglicher Job sendet 10 Millionen Eingabetokens und generiert 2 Millionen Ausgabetokens, eine typische Form für eine Batch-Zusammenfassungs- oder Extraktionspipeline.
| Modell | Eingabe (10M) | Ausgabe (2M) | Tägliche Summe |
|---|---|---|---|
| Flash-Lite | $3.00 | $5.00 | $8.00 |
| 3.6 Flash | $15.00 | $15.00 | $30.00 |
Bei dieser Mischung kostet 3.6 Flash 3,75-mal mehr: 8,00 $ gegenüber 30,00 $ pro Tag, oder grob 240 $ gegenüber 900 $ pro Monat für dasselbe Volumen.
Der Multiplikator ist jedoch nicht fixiert. Da Flash-Lite bei der Eingabe 5x günstiger und bei der Ausgabe 3x günstiger ist, liegen Ihre tatsächlichen Einsparungen je nach Form Ihres Traffics irgendwo zwischen 3x und 5x. Eingabelastige Arbeiten (langer RAG-Kontext, große Dokumente, Klassifizierung großer Eingaben) tendieren zum 5-fachen Ende, und genau dafür ist Flash-Lite konzipiert. Ausgabelastige Generierung tendiert zum 3-fachen.
Die eigentliche Frage ist also nicht nur „Kann 3.6 Flash das?“ Es ist „Ist die Qualitätssteigerung es wert, bei meinem Volumen 3- bis 4-mal mehr pro Aufruf zu bezahlen?“ Für eine Pipeline im Suchmaschinenmaßstab lautet die Antwort in der Regel nein. Für einen Agenten, der Code bearbeitet oder ein Ticket einreicht, lautet die Antwort in der Regel ja.
So A/B-Tests in Apidog durchführen
Sie müssen nicht raten, welche Stufe gut genug ist. Die Gemini API ist ein einfacher REST-Endpunkt, sodass Sie denselben Prompt an beide Modelle senden und die Antworten direkt vergleichen können. Apidog ist ein API-Client, der genau für diese Art von Side-by-Side-Vergleich entwickelt wurde.

Hier ist ein Workflow, der nur wenige Minuten dauert:
- Erstellen Sie eine POST-Anfrage an den Gemini API-Endpunkt und speichern Sie Ihren API-Schlüssel in einer Apidog-Umgebungsvariablen, damit der Schlüssel niemals im Anfragetext oder in der Versionskontrolle liegt.
- Senden Sie die Anfrage einmal mit dem auf
gemini-3.5-flash-liteeingestellten Modell. Beachten Sie die Antwort und die von Apidog gemeldete Latenz. - Duplizieren Sie die Anfrage und ändern Sie eine Sache: die Modell-ID auf
gemini-3.6-flash. Derselbe Prompt, dieselben Parameter, sodass die einzige Variable das Modell ist. - Vergleichen Sie die beiden Antworten hinsichtlich der Qualität und vergleichen Sie die von Apidog für jeden Aufruf protokollierten Zeitangaben.
- Fügen Sie Zusicherungen zur Antwort hinzu (Statuscode, erwartete JSON-Felder, erforderlicher Inhalt), sodass „gut genug“ durch eine Überprüfung definiert wird und nicht durch eine visuelle Beurteilung.
Sobald die Anfragen existieren, speichern Sie sie und wandeln Sie sie in einen wiederholbaren Test um. Sie können die API-Tests in Apidog planen, um dieselben Prompts in regelmäßigen Abständen erneut auszuführen, was Qualitäts- oder Latenzabweichungen erfasst, wenn Google eines der Modelle aktualisiert. Seien Sie sich der Grenze bewusst: Apidog sendet die Anfragen und überprüft Ihre Zusicherungen, aber es führt das Modell nicht aus und sagt Ihnen auch nicht, welche Antwort intelligenter ist. Dieses Urteil bleibt bei Ihnen. Um mitzumachen, laden Sie Apidog herunter und richten Sie eine Anfrage an den Gemini-Endpunkt.
FAQ
Ist Flash-Lite einfach eine schlechtere Version von 3.6 Flash? Nein. Es ist ein anderer Punkt auf der Kosten-, Qualitäts- und Geschwindigkeitskurve. Flash-Lite ist günstiger und schneller mit einer niedrigeren Obergrenze für komplexe Argumentation; 3.6 Flash kostet mehr und argumentiert besser. Bei einfachen Aufgaben mit hohem Volumen ist Flash-Lite oft genau die richtige Antwort, weil es günstiger und schneller ist, nicht trotz dessen.
Warum heißt das eine 3.5 und das andere 3.6? Gemischte Versionierung. Bei diesem Update hat Google das Haupt-Flash-Arbeitspferd auf 3.6 verschoben, aber den Lite-Tier bei 3.5 belassen (dieselbe Veröffentlichung umfasste auch ein 3.5 Flash Cyber Security Modell). Dieselbe Familie, unterschiedliche Versionsnummern. Interpretieren Sie die 3.5 bei Flash-Lite nicht als „alt und aufgegeben“.
Teilen sie sich dasselbe Kontextfenster? Ja. Beide akzeptieren bis zu 1 Million Eingabetokens, sodass lange Kontext-Prompts kein Grund sind, das eine dem anderen vorzuziehen. Wählen Sie stattdessen basierend auf Argumentationsqualität, Preis und Geschwindigkeit.
Kann ich beide in einer App verwenden? Das ist das empfohlene Muster. Leiten Sie günstige, einfache, hochvolumige Aufrufe an Flash-Lite weiter und eskalieren Sie die schwierigen an 3.6 Flash. Da die API-Struktur identisch ist, ist der Wechsel eine Änderung eines einzigen Feldes, was die oben genannte Apidog A/B-Tests so schnell macht.
Können sie kostenlos getestet werden? Beide haben einen kostenlosen Tarif in Google AI Studio, der ratelimitiert ist, und Google kann Daten aus dem kostenlosen Tarif verwenden, um seine Produkte zu verbessern. Das ist für Tests in Ordnung; lesen Sie die Bedingungen, bevor Sie sensible Daten senden.
Fazit
Greifen Sie standardmäßig zu Flash-Lite für günstige, schnelle, einfache Arbeiten in großem Umfang und stufen Sie die schwierigen, verzweigten oder code-lastigen Aufrufe auf 3.6 Flash hoch, wo die 24-Punkte-Terminal-Bench-Lücke ihren 3- bis 4-fachen Preis rechtfertigt. Treffen Sie keine abstrakte Wahl: Senden Sie Ihre echten Prompts an beide, messen Sie Qualität und Latenz und lassen Sie die Zahlen entscheiden. Apidog macht diesen Vergleich zu einer Aufgabe mit zwei Anfragen.
