Was ist Gemini 3.6 Flash?

Gemini 3.6 Flash ist Googles neues Zugpferdemodell, allgemein verfügbar ab dem 21. Juli 2026. Günstiger und Token-effizienter als 3.5 Flash. Spezifikationen, Benchmarks, Preise und Zugang.

Ashley Innocent

Ashley Innocent

22 July 2026

Was ist Gemini 3.6 Flash?

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Gemini 3.6 Flash ist Googles neues „Arbeitspferd“-Modell. Es wurde am 21. Juli 2026 allgemein verfügbar und ist günstiger und token-effizienter als das von ihm ersetzte Gemini 3.5 Flash. Wenn Sie ein hohes API-Verkehrsaufkommen haben und solide Qualität wünschen, ohne Spitzenpreise zu zahlen, ist dies die Stufe, die Google für Sie entwickelt hat.

Dieser Leitfaden behandelt, was das Modell ist, was sich gegenüber der letzten Version geändert hat, die vollständigen Spezifikationen, wie es bei Benchmarks abschneidet, was es kostet und wie man darauf zugreift. Sie erfahren auch, wie Sie den API-Aufruf selbst senden und Regressionstests durchführen können, damit die Zahlen auf den Google-Seiten dem entsprechen, was Sie tatsächlich zurückerhalten.

Button

Was ist Gemini 3.6 Flash?

Gemini 3.6 Flash ist das Mittelklasse-Modell mit hohem Durchsatz in Googles Gemini-Familie. „Arbeitspferd“ ist das richtige Wort dafür. Das Modell ist für alltägliche Aufgaben optimiert, die den Großteil des Produktionsverkehrs ausmachen: Zusammenfassen, Extrahieren, Klassifizieren, Chat und mehrstufige Tool-Aufrufe. Es ist schnell, erschwinglich und liest Text, Bilder, Video, Audio und PDFs in einem einzigen Aufruf.

Google hat es am 21. Juli 2026 als eines von drei Modellen ausgeliefert. Die anderen beiden sind Gemini 3.5 Flash-Lite, eine günstigere und schnellere Stufe für hochvolumige Arbeiten, und Gemini 3.5 Flash Cyber, ein abgesichertes Sicherheitsmodell, auf das nur Regierungen und vertrauenswürdige Partner zugreifen können. Eine vollständige Aufschlüsselung der günstigen Stufe finden Sie in unserem Gemini 3.5 Flash-Lite Erklärungsartikel und des abgesicherten Sicherheitsmodells in unserem Gemini 3.5 Flash Cyber Erklärungsartikel.

Hier ist der Punkt, der Leute verwirrt: Die Versionsverwaltung ist gemischt. Das Arbeitspferd ist auf 3.6 gesprungen, aber Flash-Lite und Flash Cyber sind bei 3.5 geblieben. Die „neuen Flash-Modelle“ haben also nicht alle die gleiche Versionsnummer. Wenn Sie eine Modell-ID auswählen, lesen Sie sie sorgfältig. gemini-3.6-flash und gemini-3.5-flash-lite sind unterschiedliche Stufen, kein Tippfehler.

Google veröffentlichte die Ankündigung im Google Blog, und die Modellkarte befindet sich auf der DeepMind Flash-Seite.

Was ist neu gegenüber Gemini 3.5 Flash

Die wichtigste Änderung ist die Effizienz. Gemini 3.6 Flash verwendet etwa 17 % weniger Ausgabetokens als 3.5 Flash, um die gleiche Arbeit zu erledigen. Weniger Tokens bedeuten geringere Kosten und schnellere Antworten, da Ausgabetokens das sind, wofür Sie am meisten bezahlen und was am längsten zum Streamen benötigt wird.

Google hat auch den Ausgabepreis gesenkt. Bei 3.5 Flash zahlten Sie 9,00 $ pro Million Ausgabetokens. Bei 3.6 Flash zahlen Sie 7,50 $. Addieren Sie die Preissenkung zu den Token-Einsparungen hinzu, und die effektiven Kosten pro Aufgabe sinken stärker, als es die reinen Zahlen vermuten lassen.

Das Modell ist auch besser im Codieren und in der Computernutzung, und es erreicht Antworten in weniger logischen Schritten und mit weniger Tool-Aufrufen bei mehrstufigen Workflows. Das ist wichtig für Agenten. Jeder zusätzliche Logikschleife und Tool-Aufruf erhöht Latenz und Kosten, daher macht deren Reduzierung Agentenläufe von Anfang bis Ende günstiger und schneller.

Wenn Sie sich entscheiden, ob Sie bestehenden Traffic umstellen sollen, erläutern wir die Kompromisse in Gemini 3.6 Flash vs. 3.5 Flash.

Gemini 3.6 Flash Spezifikationen

Attribut Gemini 3.6 Flash
Modell-ID gemini-3.6-flash
Eingabekontextfenster 1M Tokens
Max. Ausgabe 64k Tokens
Eingabemodalitäten Text, Bild, Video, Audio, PDF
Ausgabe Nur Text
Eingabepreis 1,50 $ pro 1 Mio. Tokens
Ausgabepreis 7,50 $ pro 1 Mio. Tokens (inklusive Denk-Tokens)
Kostenlose Stufe Ja, über Google AI Studio (ratenbegrenzt)
Veröffentlicht 21. Juli 2026

Zwei Zahlen verdienen eine Anmerkung. Das 1M Eingabekontextfenster bedeutet, dass Sie dem Modell große Dokumente, lange Transkripte oder ganze Codebasen in einer einzigen Anfrage zuführen können. Die maximale Ausgabegrenze von 64k ist die Obergrenze für eine einzelne Antwort. Wenn Sie also eine buchgroße Generierung benötigen, müssen Sie die Arbeit auf mehrere Aufrufe aufteilen.

Wie es abschneidet

Benchmarks sind Stellvertreter, keine Versprechen, aber sie zeigen Ihnen, wo ein Modell stark ist. So schneidet Gemini 3.6 Flash bei den von Google gemeldeten öffentlichen Suiten ab.

Beim Codieren erreicht es 58,7 % auf SWE-Bench Pro, einem Test, der überprüft, ob ein Modell echte GitHub-Probleme in Produktions-Repositorys lösen kann. Es erzielt 49 % auf DeepSWE v1.1, einem weiteren Software-Engineering-Benchmark. Auf Terminal-bench 2.1, das die Ausführung von Befehlen in einem echten Terminal misst, erreicht es 78,0 %.

Bei der Computernutzung zeigt sich der Sprung am deutlichsten. Auf OSWorld-Verified, das die Fähigkeit eines Modells bewertet, einen Desktop und seine Anwendungen zu steuern, erreicht 3.6 Flash 83,0 %, gegenüber 78,4 % bei 3.5 Flash. Das ist ein signifikanter Gewinn für jeden, der Agenten entwickelt, die durch echte Benutzeroberflächen klicken.

In Bezug auf die Gesamtqualität erreicht es einen GDPVal-AA v2 Elo-Wert von 1421. GDPVal misst die Leistung bei realen professionellen Aufgaben, und der Elo-Wert bewertet Modelle im direkten Vergleich, ähnlich wie Schachbewertungen funktionieren, sodass eine höhere Zahl bedeutet, dass es mehr Vergleiche gewinnt.

Langer Kontext ist ein gemischtes Bild, und man sollte ehrlich damit umgehen. Bei 128k Tokens erreicht das Modell durchschnittlich 91,8 % bei der Abfrage, was stark ist. Bei einer Annäherung an das volle 1M-Token-Fenster mit punktweiser Abfrage sinkt die Genauigkeit auf 54,0 %. Einfach ausgedrückt: Das Modell bleibt bei großen Eingaben scharf, aber erwarten Sie keine perfekte Erinnerungsleistung, wenn Sie das gesamte Kontextfenster füllen. Testen Sie Ihre eigene Abfrage bei der Länge, die Sie tatsächlich verwenden.

Preise auf einen Blick

Gemini 3.6 Flash kostet 1,50 $ pro Million Eingabe-Tokens und 7,50 $ pro Million Ausgabe-Tokens. Der Ausgabepreis beinhaltet Denk-Tokens, sodass Argumentationen, die Sie nie in der endgültigen Antwort sehen, trotzdem auf die Rechnung gehen. Kontext-Caching kostet 0,15 $ pro Million Tokens plus 1,00 $ pro Million Tokens pro Stunde Speicherung, was hilfreich ist, wenn Sie denselben großen Prompt immer wieder senden.

Es gibt eine kostenlose Stufe über Google AI Studio. Diese ist ratenbegrenzt, und Google kann Daten aus der kostenlosen Stufe zur Verbesserung seiner Produkte verwenden, daher ist sie für Prototypen, nicht für die Produktion gedacht. Die Grenzen und das Kleingedruckte behandeln wir in wie man Gemini 3.6 Flash kostenlos nutzt, und die vollständige Kostenaufschlüsselung mit Beispielen in Gemini 3.6 Flash Preise. Googles eigene Zahlen finden Sie auf der Gemini API Preisübersichtsseite.

So greifen Sie auf Gemini 3.6 Flash zu

Sie haben mehrere Zugänge:

Für die meisten Entwickler ist die API der entscheidende Weg. Wir bieten eine Schritt-für-Schritt-Anleitung unter wie man die Gemini 3.6 Flash API verwendet, und wenn Sie von einer älteren Version kommen, behandelt unser Google Gemini 3 API-Leitfaden immer noch die Anforderungsstruktur und Authentifizierung. Die offizielle Referenz finden Sie unter ai.google.dev.

Wo es in Googles Produktpalette passt

Stellen Sie sich die Flash-Auffrischung als eine Kosten- und Qualitätsleiter vor. Gemini 3.5 Flash-Lite liegt unter 3.6 Flash: Es ist günstiger, mit 0,30 $ Eingabe und 2,50 $ Ausgabe pro Million Tokens, und es ist schnell, mit etwa 350 Ausgabe-Tokens pro Sekunde. Greifen Sie zu Flash-Lite für hochvolumige, latenzempfindliche Aufgaben, bei denen Sie nicht die volle Qualität des „Arbeitspferds“ benötigen. Greifen Sie zu 3.6 Flash, wenn die Aufgabe schwieriger ist oder die Ausgabe zuverlässiger sein muss.

Nun zu den ehrlichen Vorbehalten. Gemini 3.5 Pro ist nicht veröffentlicht. Google sagt, dass es immer noch mit Partnern getestet wird, daher gibt es in dieser Welle kein öffentliches Pro-Modell, und die meisten Berichte konzentrierten sich auf diese Lücke. Google hat auch einen Gemini 4 Pre-Training-Lauf angeteasert und ihn als den bisher ehrgeizigsten bezeichnet, aber angeteasert ist nicht ausgeliefert. Keines davon ist etwas, das Sie heute aufrufen können. Wenn Sie jetzt ein Spitzen-Flaggschiff benötigen, ist 3.6 Flash es nicht. Es ist ein schnelles Mittelklasse-Modell, das darauf ausgelegt ist, kostengünstig und schnell in großem Maßstab zu sein, und genau das liefert es.

Für die vorherige Generation bietet unser Was ist Gemini 3.5 Erklärungsartikel die Basis, auf der diese Modelle aufbauen.

Gemini 3.6 Flash in Apidog testen

Modellseiten zitieren Best-Case-Zahlen. Die einzige Möglichkeit zu wissen, was 3.6 Flash für Ihre Prompts bei Ihrer Kontextlänge zurückgibt, besteht darin, den Aufruf zu senden und die Antwort zu überprüfen. Hier bewährt sich ein API-Client.

Apidog ist ein API-Client und eine Testplattform, und es behandelt den Gemini-Endpunkt wie jeden anderen REST-Aufruf. Hier ist eine saubere Einrichtung:

  1. Erstellen Sie eine POST-Anfrage an den Gemini API-Endpunkt und stellen Sie das Modell auf gemini-3.6-flash ein.
  2. Speichern Sie Ihren API-Schlüssel in einer Apidog-Umgebungsvariable, anstatt ihn in die URL einzufügen. Dann können Sie ohne Bearbeitung der Anfrage zwischen einem Test-Schlüssel und einem Produktionsschlüssel wechseln.
  3. Senden Sie den Aufruf und lesen Sie die Antwort. Fügen Sie Behauptungen zum Statuscode und den JSON-Feldern hinzu, die Ihnen wichtig sind, damit eine fehlerhafte Nutzlast oder eine Schemaänderung lautstark fehlschlägt, anstatt unbemerkt zu bleiben.
  4. Speichern Sie es als Regressionstest und planen Sie die Ausführung, damit Sie es bemerken, wenn sich die Antwortform oder die Latenz nach einem Modell-Update ändert.

Seien Sie sich darüber im Klaren, was dies tut und was nicht. Apidog führt das Modell nicht aus und ist kein KI-Framework. Es ist das Werkzeug, das Sie verwenden, um die Anfrage zu erstellen, zu senden und die Antwort einem von Ihnen festgelegten Standard zu unterziehen. Wenn Google das nächste Flash-Update liefert, sagen Ihnen Ihre gespeicherten Tests innerhalb weniger Minuten, ob sich etwas, auf das Sie angewiesen sind, geändert hat. Laden Sie Apidog herunter, wenn Sie diese erste Anfrage einrichten möchten.

FAQ

Ist Gemini 3.6 Flash kostenlos? Es gibt eine kostenlose Stufe über Google AI Studio, diese ist jedoch ratenbegrenzt und für Prototypen gedacht. Google kann Daten aus der kostenlosen Stufe zur Verbesserung seiner Produkte verwenden. Für Produktions-Traffic zahlen Sie pro Token: 1,50 $ pro Million Eingabe, 7,50 $ pro Million Ausgabe.

Ist Gemini 3.6 Flash besser als 3.5 Flash? Für die meisten Arbeiten ja. Es verwendet etwa 17 % weniger Ausgabe-Tokens, der Ausgabepreis sank von 9,00 $ auf 7,50 $ pro Million, und es ist stärker beim Codieren und der Computernutzung, einschließlich eines Sprungs auf 83,0 % bei OSWorld-Verified von 78,4 %. Es ersetzt 3.5 Flash als Standard-"Arbeitspferd".

Ist Gemini 3.5 Pro veröffentlicht? Nein. Google sagt, dass es 3.5 Pro immer noch mit Partnern testet, daher gibt es in dieser Version kein öffentliches Pro-Modell. Ein Gemini 4 Pre-Training-Lauf wurde angeteasert, aber nicht ausgeliefert.

Was ist die Modell-ID? Es ist gemini-3.6-flash. Verwechseln Sie es nicht mit gemini-3.5-flash-lite, das die günstigere Flash-Lite-Stufe mit einer anderen Versionsnummer ist.

Was kann Gemini 3.6 Flash nicht? Es gibt nur Text aus, generiert also keine Bilder, Audio oder Video, auch wenn es diese als Eingabe lesen kann. Seine Erinnerungsleistung sinkt gegen Ende des 1M-Token-Fensters, auf etwa 54,0 % bei punktweiser Abfrage bei voller Länge. Und es ist ein Mittelklasse-"Arbeitspferd", kein Spitzen-Flaggschiff, wählen Sie also die richtige Stufe für wirklich schwierige Schlussfolgerungen.

Gemini 3.6 Flash ist das Modell, auf dem der Großteil des Gemini API-Verkehrs jetzt laufen sollte: günstiger, token-effizienter und besser bei agentischen Aufgaben als die Version, die es ersetzt. Bestätigen Sie die Teile, auf die Sie angewiesen sind, mit ein paar gespeicherten API-Tests, bevor Sie in großem Umfang migrieren. Wenn Flash-Lite, Cyber oder die zukünftigen Pro- und Gemini 4-Versionen erscheinen, wissen Sie genau, was sich in Ihren eigenen Antworten geändert hat.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen