Was ist Gemini 3.5 Flash-Lite

Gemini 3.5 Flash-Lite ist Googles günstigste und schnellste Gemini-Stufe: 0,30 $ pro Eingabe, ~350 Token/Sek. Erfahren Sie mehr über die Spezifikationen, Preise, Benchmarks und wie Sie es testen können.

Ashley Innocent

Ashley Innocent

22 July 2026

Was ist Gemini 3.5 Flash-Lite

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Google hat seine Flash-Stufe am 21. Juli 2026 aktualisiert, und Gemini 3.5 Flash-Lite ist das günstigste Ende davon. Es ist das günstigste, schnellste Gemini, das Sie heute nutzen können, entwickelt für Aufgaben mit hohem Volumen und geringer Latenz: Klassifizierung, Extraktion, kurze Chat-Antworten und einfache Retrieval-Antworten, bei denen Durchsatz und Kosten wichtiger sind als tiefgreifendes Denken. Wenn Sie täglich Millionen kleiner Anfragen abfeuern, ist dies die Stufe, die Google für Ihren Hot-Path vorsieht.

Die Aktualisierung umfasste drei Modelle gleichzeitig, und die Namensgebung verwirrt viele, also klären wir das schnell, bevor wir uns mit den Spezifikationen, Preisen, Benchmarks und der Möglichkeit, den Endpunkt selbst zu testen, befassen.

Button

Was ist Gemini 3.5 Flash-Lite?

Gemini 3.5 Flash-Lite ist das kleinste und günstigste Modell in Googles Gemini-Familie. Es ist auf Geschwindigkeit und Volumen abgestimmt, nicht auf die anspruchsvollsten Denkprozesse. Google gibt eine Geschwindigkeit von etwa 350 Ausgabetoken pro Sekunde an, sodass Antworten selbst unter Last nahezu sofort erscheinen. Sie rufen es über die Gemini API mit der Modell-ID gemini-3.5-flash-lite auf.

Stellen Sie es sich als die Stufe vor, die Sie für langweilige, sich wiederholende Aufgaben mit hoher Frequenz einsetzen. Support-Tickets verschlagworten. Felder aus einem Dokument extrahieren. Eine kurze Frage aus einem abgerufenen Textabschnitt beantworten. Ein Chat-Widget betreiben, das antworten muss, bevor der Benutzer eine Verzögerung bemerkt. Bei all diesen Aufgaben senden Sie viele Anfragen und möchten, dass jede davon günstig und schnell ist. Flash-Lite ist Googles Antwort für diese Art von Arbeitslast.

Es wurde als Teil einer Flash-Aktualisierung mit drei Modellen eingeführt: dem neuen Arbeitspferd Gemini 3.6 Flash, diesem Gemini 3.5 Flash-Lite und einem geschützten Sicherheitsmodell namens Gemini 3.5 Flash Cyber. Sie können Googles eigene Zusammenfassung im Google Blog und die Modelldetails auf der DeepMind Flash-Seite nachlesen. Flash-Lite befindet sich am unteren Ende dieses Stapels, was den Preis angeht, und am oberen Ende, was die Rohgeschwindigkeit betrifft.

Moment, warum ist es 3.5 und nicht 3.6?

Hier ist der verwirrende Teil. Das neue Arbeitspferdmodell ist Gemini 3.6 Flash. Aber Flash-Lite blieb bei 3.5, ebenso wie das geschützte Cyber-Sicherheitsmodell. Also eine Veröffentlichung, ein Tag, drei Modelle, zwei Versionsnummern. Das ist kein Tippfehler von Google oder ein Fehler in diesem Artikel. Google hat eine gemischte Versionierung veröffentlicht: Das Flaggschiff Flash sprang auf 3.6, während die Lite- und Cyber-Varianten die 3.5-Bezeichnung behielten.

Warum tut Google das? Die Versionsnummer verfolgt das Modell, nicht das Veröffentlichungsereignis. Das Arbeitspferd erhielt einen größeren Generationssprung, daher verdiente es die 3.6-Bezeichnung. Flash-Lite ist ebenfalls ein neues Modell, aber Google entschied sich, es an der 3.5-Linie auszurichten. Ärgerlich nachzuvollziehen, aber so wurden die Bezeichnungen festgelegt.

Eine weitere Verwirrungsquelle, die es jetzt zu beseitigen gilt. Gemini 3.5 Flash-Lite ist nicht das ältere Gemini 3.1 Flash-Lite der vorherigen Generation. Gleicher Name „Flash-Lite“, anderes Modell, andere Zahlen. Wenn Sie zuvor auf 3.1 Flash-Lite aufgebaut haben, ist dies der neuere, schnellere Ersatz, nicht eine Umbenennung dessen, was Sie bereits hatten. Überprüfen Sie die Modell-ID, bevor Sie annehmen: gemini-3.5-flash-lite ist das neue.

Spezifikationen und Preise

Hier ist, was Flash-Lite kostet und wie es sich verhält. Alle Preise gelten pro Million Token über die Gemini API.

Attribut Wert
Modell-ID gemini-3.5-flash-lite
Eingabepreis $0.30 / 1M Token
Ausgabepreis $2.50 / 1M Token
Geschwindigkeit ~350 Ausgabetoken/Sekunde
Kostenlose Stufe Ja (Google AI Studio, ratenbegrenzt)
Kontext-Caching $0.03 / 1M Token + $1.00 / 1M/Stunde Speicher

Diese 0,30 $ für die Eingabe und 2,50 $ für die Ausgabe sind der günstigste veröffentlichte Tarif im aktuellen Gemini-Angebot. Zum Vergleich: Das Arbeitspferd 3.6 Flash kostet 1,50 $ für die Eingabe und 7,50 $ für die Ausgabe, sodass Flash-Lite etwa ein Fünftel der Eingabekosten und ein Drittel der Ausgabekosten ausmacht. Wenn Sie Millionen kurzer Anrufe verarbeiten, ist dieser Unterschied der entscheidende Punkt. Aktuelle Zahlen können Sie in den Gemini API Preisdokumenten überprüfen, da Google diese Seite direkt aktualisiert.

Kontext-Caching senkt die Kosten weiter für Prompts, die Sie wiederholt senden, wie einen festen System-Prompt oder ein langes Referenzdokument. Sie zahlen einen geringen Betrag, um die Token zu cachen, plus eine stündliche Speichergebühr, und gecachte Eingaben sind bei jeder Wiederverwendung viel günstiger.

Wie gut ist die Leistung?

Die Schlagzeilenzahl: Gemini 3.5 Flash-Lite erreicht 54 % auf Terminal-Bench 2.1, gegenüber 31 % beim Vorgänger. Das ist ein echter Sprung für ein Modell der Lite-Klasse, und es bedeutet, dass die kleine Stufe nun wirklich nützlich ist für Aufgaben, die sie früher nicht bewältigen konnte.

Wo es glänzt: Klassifizierung, Extraktion, Chat-Antworten und einfache, retrieval-erweiterte Antworten. Das sind die Aufgaben, bei denen ein schnelles, günstiges Modell seinen Wert beweist. Eingaben in Kategorien sortieren, strukturierte Daten aus unübersichtlichem Text extrahieren, eine kurze Frage beantworten, die auf einem abgerufenen Passus basiert, einen leichtgewichtigen Assistenten reaktionsfähig halten. Flash-Lite erledigt all das gut und schnell.

Nun zur ehrlichen Grenze. Flash-Lite tauscht Qualität gegen Kosten und Geschwindigkeit. Es ist nicht das Modell für die anspruchsvollste agentische Codierung, lange mehrstufige Tool-Ketten oder tiefgreifende Denkprobleme. Wenn eine Aufgabe über viele Schritte hinweg geplant werden muss, Tools zuverlässig in Sequenz aufrufen oder sich durch einen kniffligen Codebasis denken muss, benötigen Sie stattdessen Gemini 3.6 Flash oder ein größeres Modell. Die Wahl von Flash-Lite für diese Arbeit spart Geld, bis falsche Antworten Sie mehr kosten, als Sie gespart haben. Passen Sie die Stufe an die Aufgabe an.

Wo Google Flash-Lite einsetzt

Google verkauft Flash-Lite nicht nur an Entwickler. Es integriert das Modell in die Google-Suche. Das ist ein nützliches Signal: Wenn Google ein Modell für Suchmaschinen-Traffic in großem Maßstab einsetzt, geht es davon aus, dass das Modell schnell und günstig genug ist, um eine enorme Anzahl von Anfragen zu verarbeiten, ohne bei Latenz oder Budget zu scheitern.

Für Sie ist das ein Beweis. Die gleichen Eigenschaften, die Flash-Lite für die Suche geeignet machen – hoher Durchsatz und niedrige Kosten pro Aufruf – sind genau die, die es für einen ausgelasteten Produktionsendpunkt passend machen. Wenn es den Suchverkehr bedienen kann, kann es auch Ihre Klassifizierungs-Pipeline bedienen.

Flash-Lite vs. Gemini 3.6 Flash: Welches sollten Sie wählen?

Kurz gesagt: Wählen Sie Flash-Lite, wenn die Aufgabe einfach, volumenstark und geschwindigkeitsempfindlich ist. Wählen Sie 3.6 Flash, wenn die Aufgabe stärkere Argumentation, Codierung oder mehrstufige Agentenarbeit erfordert.

Flash-Lite punktet bei Preis und Latenz. Es ist das günstigste Gemini und läuft mit etwa 350 Token pro Sekunde, daher ist es die richtige Standardwahl für Klassifizierung, Extraktion, kurze Chats und einfaches RAG in großem Maßstab. Gemini 3.6 Flash kostet pro Token mehr, argumentiert aber stärker, codiert besser und hält bei agentischen Workflows stand, wo Flash-Lite stolpern würde. Die 3.6 Flash-Preise spiegeln das wider: Sie zahlen für die zusätzliche Fähigkeit.

Ein praktisches Muster ist es, nach Schwierigkeitsgrad zu routen. Senden Sie die einfachen, häufigen Anfragen an Flash-Lite und eskalieren Sie die schwierigen an 3.6 Flash. Sie erhalten günstigen Durchsatz für den Großteil des Traffics und stärkere Argumentation nur dort, wo sie ihren Preis wert ist. Für einen vollständigen Vergleich von Geschwindigkeit, Preis und Qualität siehe Gemini 3.5 Flash-Lite vs. 3.6 Flash.

So greifen Sie darauf zu und testen es

Flash-Lite läuft auf der Gemini API. Der schnellste Einstieg ist über Google AI Studio: Besorgen Sie sich einen API-Schlüssel, und die kostenlose Stufe ermöglicht es Ihnen, das Modell auszuprobieren, bevor Sie die Abrechnung einrichten. Beachten Sie, dass die kostenlose Stufe ratenbegrenzt ist und Google Daten aus der kostenlosen Stufe zur Verbesserung seiner Produkte verwenden kann. Halten Sie daher sensible Eingaben mit einem kostenpflichtigen Schlüssel. Die vollständige Referenz finden Sie in den Gemini API-Dokumenten. Stellen Sie das Modell auf gemini-3.5-flash-lite ein, und Sie rufen die günstigste Stufe auf.

Sobald Ihre Anfragen funktionieren, möchten Sie, dass sie auch weiterhin funktionieren. Preise, Ratenbegrenzungen und Antwortformate ändern sich, wenn Google die API aktualisiert, und ein Lite-Modell, das schnell, aber gelegentlich falsch ist, benötigt Assertions, um Abweichungen zu erkennen. Hier hilft ein API-Client. Mit Apidog können Sie die POST-Anfrage an den Gemini-Endpunkt erstellen, Ihren API-Schlüssel als Umgebungsvariable speichern, damit er niemals im Anfragetext enthalten ist, und Assertions für den Statuscode und die JSON-Felder hinzufügen, von denen Sie abhängen.

Von dort aus können Sie diese Anfrage in einen gespeicherten Regressionstest umwandeln und planen, dass er ausgeführt wird, damit Sie eine fehlerhafte Antwort oder eine Preisänderung erkennen, bevor Ihre Benutzer es tun. Apidog führt das Modell nicht aus oder ersetzt die Gemini API; es ist der Client, den Sie verwenden, um den Endpunkt aufzurufen, zu validieren und zu überwachen. Laden Sie Apidog herunter, wenn Sie den gemini-3.5-flash-lite-Endpunkt zusammen mit dem Rest Ihres API-Stacks testen möchten.

Button

FAQ

Ist Gemini 3.5 Flash-Lite dasselbe wie Gemini 3.6 Flash? Nein. Es sind zwei verschiedene Modelle aus der gleichen Aktualisierung vom 21. Juli 2026. Flash-Lite ist die günstigste und schnellste Stufe für einfache Aufgaben mit hohem Volumen. 3.6 Flash ist das teurere Arbeitspferd mit stärkerer Argumentation und Codierung.

Warum ist es 3.5 und nicht 3.6? Gemischte Versionierung. Google hat das Arbeitspferd Flash auf 3.6 angehoben, aber Flash-Lite und das geschützte Cyber-Modell bei derselben Veröffentlichung unter der Bezeichnung 3.5 belassen. Die Nummer verfolgt die Modellreihe, nicht das Veröffentlichungsdatum.

Ist dies das alte Gemini 3.1 Flash-Lite? Nein. Gemini 3.5 Flash-Lite ist ein neueres Modell. Das ältere 3.1 Flash-Lite ist die vorherige Generation. Gleicher Familienname, anderes Modell und andere Version, überprüfen Sie also die Modell-ID gemini-3.5-flash-lite, um sicherzustellen, dass Sie die neue verwenden.

Ist Gemini 3.5 Flash-Lite kostenlos? Es gibt eine kostenlose Stufe über Google AI Studio, die ratenbegrenzt ist. Sie eignet sich gut zum Testen und für die leichte Nutzung. Für Produktionsvolumen wechseln Sie zu einem kostenpflichtigen API-Schlüssel, und Google kann Daten aus der kostenlosen Stufe zur Verbesserung seiner Produkte verwenden.

Wofür ist Flash-Lite am besten geeignet? Klassifizierung, Extraktion, kurze Chat-Antworten und einfache, retrieval-erweiterte Antworten in hohem Volumen. Es ist nicht die Wahl für anspruchsvolle agentische Codierung oder langes, mehrstufiges Denken, wo 3.6 Flash besser passt.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen