Gemini 3.7 Flash-Preise erklärt: Sichern Sie sich Tarife, bevor sie sich verdoppeln

Gemini 3.7 Flash Preise: 0,75 $/3,75 $ pro 1 Mio. Token bis zum 31. Dezember 2026, danach verdoppeln sich die Preise. Siehe detaillierte Kostenbeispiele und fünf Möglichkeiten, Ihre Token-Ausgaben zu senken.

Ashley Innocent

Ashley Innocent

14 August 2026

Gemini 3.7 Flash-Preise erklärt: Sichern Sie sich Tarife, bevor sie sich verdoppeln

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Google veröffentlichte Gemini 3.7 Flash am 13. August 2026, drei Wochen nach 3.6 Flash, und nennt es „unser intelligentestes Arbeitstier-Modell“. Für jeden, der seine API-Rechnung im Auge behält, liegt das wichtigste Detail nicht in den Benchmarks, sondern in der Preistabelle: Der Einführungstarif von 0,75 US-Dollar pro Million Input-Tokens und 3,75 US-Dollar pro Million Output-Tokens läuft am 31. Dezember 2026 aus. Ab dem 1. Januar 2027 verdoppeln sich beide Tarife.

Das bedeutet eine geplante Verdopplung um den Faktor 2 für jede Arbeitslast, die Sie auf diesem Modell aufbauen. Ein Chatbot, der heute 790 US-Dollar pro Monat kostet, kostet im Januar 1.575 US-Dollar pro Monat, ohne dass sich Ihr Code, Ihr Traffic oder Ihre Prompts ändern. Wenn Sie also ein 3.7 Flash-Projekt budgetieren, berücksichtigen Sie beide Preisstufen, nicht nur den Listenpreis.

Dieser Leitfaden führt Sie durch die beiden Preisstufen, die Token-Berechnung für drei reale Arbeitslasten, wie sich der Preis im Vergleich zu anderen Modell-APIs verhält und wo Sie Kosten senken können, bevor die Verdopplung eintritt. Falls Sie noch keine erste Anfrage gesendet haben, deckt der Gemini 3.7 Flash API Quickstart die Einrichtung ab. Sobald Sie Aufrufe tätigen, zeigt Apidog die usageMetadata-Token-Zählerstände in jeder Antwort an, sodass jede Schätzung unten zu einer Zahl wird, die Sie anhand des Live-Traffics überprüfen können.

Button

Das Wichtigste in Kürze

Die beiden Preisstufen

Gemini 3.7 Flash wurde mit einem zeitlich begrenzten Rabatt anstelle eines dauerhaften Preises eingeführt. Hier ist die vollständige Übersicht für die Gemini API:

Stufe Zeitraum Input (pro 1 Mio. Tokens) Output (pro 1 Mio. Tokens)
Einführung 13. August 2026 bis 31. Dezember 2026 0,75 $ 3,75 $
Standard Ab 1. Januar 2027 1,50 $ 7,50 $

Zwei Dinge fallen auf. Erstens ist der Einführungstarif die Hälfte dessen, was Gemini 3.6 Flash bei seiner Einführung kostete, was die nächsten viereinhalb Monate zum günstigsten Zeitraum macht, den diese Modellfamilie je hatte. Wenn Sie ein Upgrade von 3.6 in Betracht ziehen, deckt der Migrationsleitfaden von 3.6 zu 3.7 Flash den Austausch ab; allein die Preissenkung amortisiert die Kosten für die Regressionstests.

Zweitens kosten Output-Tokens bei beiden Stufen das 5-fache der Input-Tokens. Dieses Verhältnis prägt jede Optimierungsentscheidung, die später in diesem Leitfaden beschrieben wird: Das Kürzen eines ausführlichen System-Prompts spart ein paar Cent, während das Begrenzen einer ausufernden Ausgabe Euro spart.

Die oben genannten Tarife gelten für die Gemini API, die über einen AI Studio-Schlüssel abgerechnet wird. Vertex AI läuft über die Google Cloud-Abrechnung mit eigenen SKU-Nummern, und Funktionen wie Kontext-Caching und Batch-Verarbeitung haben eigene Einzelposten, daher sollten Sie die aktuellen Zahlen auf der offiziellen Preisübersicht überprüfen, bevor Sie ein Budget festlegen.

Was eine reale Arbeitslast kostet

Preise pro Million Tokens sind bedeutungslos, bis Sie sie mit dem Traffic multiplizieren. Hier sind drei Arbeitslastprofile mit den angegebenen Annahmen, sodass Sie Ihre eigenen Zahlen einsetzen können.

Arbeitslast 1: Ein Kundenservice-Chatbot

Nehmen wir 10.000 Anfragen pro Tag an. Jede Anfrage enthält etwa 2.000 Input-Tokens (System-Prompt, ein kurzes Verlaufsprotokoll, die Benutzernachricht) und liefert etwa 300 Output-Tokens zurück.

Posten Tägliche Tokens Einführungskosten/Tag Standardkosten/Tag
Input 20 Mio. 15,00 $ 30,00 $
Output 3 Mio. 11,25 $ 22,50 $
Gesamt 23 Mio. 26,25 $ 52,50 $

Das sind ungefähr 788 US-Dollar pro Monat bei Einführungstarifen und 1.575 US-Dollar pro Monat bei Standardtarifen über einen Monat mit 30 Tagen. Pro Gesprächsrunde zahlen Sie heute etwa ein Viertel Cent.

Arbeitslast 2: Eine PDF-Dokumenten-Pipeline

Gemini 3.7 Flash liest PDFs nativ, und sein GDP.pdf-Benchmark-Wert stieg von 22,0 % auf 34,0 % gegenüber 3.6 Flash, daher ist die Dokumentenextraktion eine Arbeitslast, die Google hier von Ihnen erwartet. Nehmen wir 500 Dokumente pro Tag an, die jeweils durchschnittlich 40.000 Input-Tokens (ein langer Vertrag oder Bericht) umfassen und eine strukturierte Zusammenfassung von 1.000 Tokens erzeugen.

Posten Tägliche Tokens Einführungskosten/Tag Standardkosten/Tag
Input 20 Mio. 15,00 $ 30,00 $
Output 0,5 Mio. 1,88 $ 3,75 $
Gesamt 20,5 Mio. 16,88 $ 33,75 $

Etwa 506 US-Dollar pro Monat jetzt, 1.013 US-Dollar ab Januar. Beachten Sie die Form: Der Input dominiert, da die Dokumente lang und die Zusammenfassungen kurz sind. Caching und Batch-Verarbeitung wirken sich bei dieser Arbeitslast am stärksten aus.

Arbeitslast 3: Eine Agenten-Schleife

Agenten erhöhen die Anzahl der Aufrufe. Nehmen wir 200 Aufgaben pro Tag an, wobei jede durchschnittlich 12 Modellaufrufe umfasst, wobei jeder Aufruf 8.000 Input-Tokens (der wachsende Kontext plus Tool-Ergebnisse) enthält und 400 Output-Tokens zurückgibt.

Posten Tägliche Tokens Einführungskosten/Tag Standardkosten/Tag
Input 19,2 Mio. 14,40 $ 28,80 $
Output 0,96 Mio. 3,60 $ 7,20 $
Gesamt 20,16 Mio. 18,00 $ 36,00 $

Das sind 540 US-Dollar pro Monat bei Einführungstarifen, 1.080 US-Dollar bei Standardtarifen. Die Lehre aus der Agenten-Abrechnung: Der Kontext wächst mit jedem Schritt, sodass die Anzahl der Aufrufe und die Kontextlänge sich potenzieren. Eine Aufgabe, die sich von 12 auf 20 Aufrufe ausdehnt, kostet Sie 67 % mehr, und nichts in der Preistabelle hat Sie davor gewarnt.

Noch eine Zahl, die Sie im Kopf behalten sollten: Die 64.000 Token-Ausgabeobergrenze begrenzt Ihren Worst Case pro Aufruf auf etwa 0,24 US-Dollar heute und 0,48 US-Dollar nächstes Jahr. Eine Wiederholungsschleife, die die Ausgabe bei jedem Versuch maximiert, wird schnell teuer, kann aber nicht unbegrenzt teuer werden.

Wie sich 3.7 Flash-Preise vergleichen

Exakte Token-Vergleiche zwischen Anbietern veralten innerhalb weniger Wochen, betrachten Sie dies also eher als Positionierung und nicht als Preisliste.

Gemini 3.7 Flash gehört zur Arbeitstier-Kategorie: deutlich günstiger als Spitzenmodelle wie Geminis eigene Pro-Linie, Claudes größere Modelle oder OpenAIs Flaggschiff-Stufe, während es Benchmark-Werte (65,3 % bei DeepSWE v1.1, 1588 WebDev Arena Elo) erreicht, die sich mit dem überschneiden, was Flaggschiff-Modelle vor nicht allzu langer Zeit erreichten. Googles Wette ist, dass der Großteil des Produktions-Traffics kein Spitzenmodell benötigt, und der Einführungsrabatt ist eine viermonatige Einladung, diese Behauptung an Ihrer eigenen Arbeitslast zu testen.

Auch das Wettbewerbsumfeld ist wichtig. Anbieter im Budget-Segment haben die Preise in die andere Richtung bewegt; DeepSeek erhöhte seine API-Tarife und zwang Teams, Token-Budgets zu überdenken, eine Geschichte, die im Leitfaden zur DeepSeek-Preiserhöhung und Kostenoptimierung behandelt wird. Die Erkenntnis lässt sich direkt auf Gemini übertragen: Jeder Preis, auf dem Sie eine Marge aufbauen, kann sich ändern, und Google hat Ihnen bereits das Datum und den Betrag mitgeteilt. Das ist mehr Vorwarnung, als die meisten Anbieter geben.

Wenn Ihr Traffic stoßweise oder experimentell ist, denken Sie daran, dass die Verdopplung nur dauerhafte Arbeitslasten betrifft. Ein Prototyp, der während des Einführungszeitraums 3 US-Dollar kostet, kostet später 6 US-Dollar. Das interessiert niemanden. Wenn eine Pipeline von 10.000 US-Dollar pro Monat zu 20.000 US-Dollar wird, ist das ein Posten, nach dem Ihr Finanzteam im Februar fragen wird.

Fünf Wege, die Token-Ausgaben zu senken

Das 5-fache Verhältnis der Output- zu Input-Preise und die Januar-Verdopplung weisen auf dieselben Stellschrauben hin.

Ausgabe-Tokens pro Endpunkt begrenzen. Setzen Sie maxOutputTokens in generationConfig auf den kleinsten Wert, den jeder Endpunkt benötigt. Eine Support-Antwort benötigt selten mehr als 500 Tokens; das Belassen der Obergrenze beim Standardwert von 64.000 kann dazu führen, dass eine fehlerhafte Generierung das 100-fache einer normalen kostet. Dies ist die einzelne Änderung mit dem höchsten Ertrag, da Output-Tokens den 5-fachen Multiplikator tragen.

Statischen Kontext cachen. Wenn jede Anfrage denselben 3.000-Token-System-Prompt und dasselbe Richtliniendokument erneut sendet, zahlen Sie den vollen Input-Preis für identische Bytes Tausende Male am Tag. Kontext-Caching berechnet wiederholte Tokens zu einem ermäßigten Tarif; überprüfen Sie die Gemini API-Dokumentation für die aktuelle Caching-Einrichtung und Tarife. Für den oben genannten Chatbot senkt das Caching eines 1.500-Token-statischen Präfixes die Input-Kosten um mehr als die Hälfte.

Nicht-interaktive Arbeit stapelweise verarbeiten. Die Dokumenten-Pipeline benötigt keine Reaktionen im Sub-Sekunden-Bereich. Die Batch-Verarbeitung tauscht Latenz gegen einen ermäßigten Tarif, und nächtliche Dokumentenverarbeitungen sind genau die Art von Traffic, für die sie geschaffen wurde.

Modell pro Route passend dimensionieren. Nicht jeder Aufruf benötigt 3.7 Flash. Klassifizierungs-, Routing- und kurze Extraktionsaufgaben laufen oft gut auf einem Flash-Lite-Tier-Modell zu einem Bruchteil der Kosten. Behalten Sie 3.7 Flash für die Aufrufe, die das nutzen, wofür Sie bezahlen: mehrstufige Planung, Debugging, Tool-Aufrufketten.

Prototypen auf der kostenlosen Stufe entwickeln. Das kostenlose Kontingent von AI Studio reicht aus, um Prompts und Antwortschemata festzulegen, bevor ein einziger abgerechneter Token verbraucht wird. Der Leitfaden zum kostenlosen Gemini API-Zugang erklärt, wie weit der kostenlose Weg reicht und wo seine Grenzen liegen.

Ausgaben pro Endpunkt mit Apidog verfolgen

Schätzungen liefern Ihnen ein Budget; Messungen pro Anfrage halten Sie im Rahmen. Jede Gemini-Antwort enthält einen usageMetadata-Block mit Prompt- und Output-Token-Zählern, was bedeutet, dass Ihre API-Testschicht auch als Kostenmessgerät fungieren kann.

In Apidog sieht der Workflow so aus:

  1. Speichern Sie eine Anfrage pro Produktions-Endpunkt (Chat-Runde, Dokumentenzusammenfassung, Agenten-Schritt) in einer Sammlung, wobei der API-Schlüssel an eine GEMINI_API_KEY-Umgebungsvariable gebunden ist.
  2. Erstellen Sie ein Testszenario, das jede Anfrage mit realistischen Payloads abfeuert und usageMetadata.promptTokenCount und usageMetadata.candidatesTokenCount aus der Antwort extrahiert.
  3. Fügen Sie Behauptungen (Assertions) zu diesen Zählerständen hinzu. Wenn eine Prompt-Bearbeitung den Chat-Endpunkt beispielsweise über 2.500 Input-Tokens hinausdrückt, schlägt das Szenario fehl, bevor die Änderung implementiert wird, und erhöht Ihre Rechnung stillschweigend um 25 %.
  4. Führen Sie das Szenario bei jeder Prompt- oder Schemaänderung erneut aus. Token-Anzahlen verschlechtern sich genauso wie die Latenz; der Unterschied ist, dass Token-Regressionen als Rechnung ankommen.

Multiplizieren Sie die gemessenen Zählerstände mit den in diesem Leitfaden angegebenen Stufentarifen, und Sie erhalten Kosten pro Endpunkt, die auf echten Antworten und nicht auf Vermutungen basieren. Teams, die bereits Assertions-basierte API-Suiten verwenden, werden das Muster erkennen; der API-Testleitfaden für QA-Ingenieure erklärt, wie man solche Szenarien über einen gesamten Dienst hinweg strukturiert.

Häufig gestellte Fragen (FAQ)

Wann verdoppeln sich die Preise für Gemini 3.7 Flash?

Am 1. Januar 2027. Der Einführungstarif von 0,75 US-Dollar pro 1 Mio. Input-Tokens und 3,75 US-Dollar pro 1 Mio. Output-Tokens läuft bis zum 31. Dezember 2026 und wechselt dann zum Standardtarif von 1,50 US-Dollar und 7,50 US-Dollar. Google hat beide Tarife bei der Einführung veröffentlicht, die Erhöhung ist also geplant und nicht spekulativ.

Ist Gemini 3.7 Flash günstiger als Gemini 3.6 Flash?

Beim Start, ja. Der Einführungspreis von 3.7 Flash ist die Hälfte des Einführungspreises von 3.6 Flash, während sich die Benchmarks durchweg verbessert haben (DeepSWE v1.1 stieg von 49,0 % auf 65,3 %). Die vollständigen Spezifikations- und Benchmark-Tabellen finden Sie in der Gemini 3.7 Flash Kurzübersicht, wenn Sie einen direkten Vergleich wünschen.

Gilt der Einführungspreis für Vertex AI?

Die Tarife in diesem Leitfaden sind Gemini API-Tarife, die über einen AI Studio-Schlüssel abgerechnet werden. Vertex AI wird über Google Cloud mit eigenen SKU-Nummern und Unternehmensbedingungen abgerechnet. Wenn Sie Produktions-Traffic auf Vertex ausführen, überprüfen Sie die aktuellen Zahlen in Ihrer GCP-Abrechnungskonsole und auf der offiziellen Preisübersicht, anstatt von Gleichheit auszugehen.

Was wird auf die Kosten für Input-Tokens angerechnet?

Alles, was Sie senden: Text, Bilder, Videos, Audio und PDF-Seiten werden alle in Tokens umgewandelt und zum Input-Tarif abgerechnet. Lange Dokumente und medienlastige Anfragen sind die Bereiche, in denen die Input-Kosten Menschen überraschen, weshalb das oben genannte Pipeline-Beispiel 40.000 Tokens pro Dokument annimmt. Der usageMetadata-Block in jeder Antwort zeigt Ihnen nachträglich die genaue Anzahl an.

Wie schätze ich Tokens, bevor ich eine Anfrage sende?

Verwenden Sie den countTokens-Endpunkt der API, um eine Payload zu messen, ohne etwas zu generieren, oder senden Sie eine Handvoll repräsentativer Anfragen und lesen Sie usageMetadata aus den Antworten. In jedem Fall messen Sie mit echten Payloads. Die Tokenizer-Intuition von anderen Anbietern lässt sich zwischen Modellfamilien schlecht übertragen.

Wo 3.7 Flash in Ihren Stack passt

Gemini 3.7 Flash zum Einführungspreis ist das Günstigste, was ein so leistungsfähiges Modell je war, und Google hat Ihnen das genaue Datum genannt, an dem dies nicht mehr zutrifft. Die rationale Vorgehensweise: Stellen Sie Ihren Haupt-Traffic jetzt darauf um, messen Sie den tatsächlichen Token-Verbrauch pro Endpunkt, während der Rabatt läuft, und nutzen Sie diese vier Monate Daten, um zu entscheiden, was auf 3.7 Flash bleibt, was auf ein leichteres Modell wechselt und wie die Standardrechnung aussehen wird, bevor sie ankommt.

Der Messteil dieses Plans erfordert Tools. Laden Sie Apidog herunter, um Ihre Gemini-Anfragen, Umgebungen, Token-Assertions und Kostenprüfungen in einem Arbeitsbereich zu verwalten, damit die Januarrechnung eine Zahl ist, die Sie vorhergesagt haben, anstatt eine, die Sie erst entdecken.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen