Google hat Gemini 3.7 Flash am 13. August 2026, drei Wochen nach 3.6 Flash, veröffentlicht und bezeichnet es als „unser intelligentestes Arbeitstier-Modell“. Die Schlagzeile für Entwickler: Agentic-Coding-Scores stiegen stark an (DeepSWE v1.1 ging von 49,0 % auf 65,3 %), der Einführungspreis beträgt die Hälfte dessen, womit 3.6 Flash gestartet wurde, und die API-Oberfläche ist unverändert. Wenn Sie bereits Gemini aufrufen, tauschen Sie eine Modell-ID aus. Wenn nicht, ist dies der günstigste Einstiegspunkt, den Google je für ein so leistungsfähiges Modell angeboten hat.
Dieser Leitfaden ist der praktische Schnellstart. Sie erhalten einen API-Schlüssel, tätigen Ihren ersten Aufruf in cURL, portieren ihn zu Python und Node.js, streamen Antworten, optimieren generationConfig und integrieren das Ganze in Apidog, damit Sie Prompts iterieren können, ohne Tokens in einer Code-Schleife zu verbrauchen. Die Spezifikationen aus der offiziellen Ankündigung: 1M Token Kontext, 64k Ausgabe, multimodale Eingabe, Funktionsaufrufe, Suche als Werkzeug und Computernutzung.
Wenn Sie mit der vorherigen Generation gearbeitet haben, übernimmt die Anforderungsstruktur die unseres Gemini 3 Flash Preview API-Leitfadens; dieser Artikel behandelt alles Neue im 3.7-Workflow.
TL;DR
- Modell-ID ist
gemini-3.7-flash. Endpunkt:POST https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContentmit Headerx-goog-api-key: <KEY>. - Der Einführungspreis beträgt 0,75 $ pro 1 Mio. Eingabe-Tokens und 3,75 $ pro 1 Mio. Ausgabe-Tokens bis zum 31. Dezember 2026. Ab dem 1. Januar 2027 verdoppelt er sich auf 1,50 $ bzw. 7,50 $.
- Spezifikationen: 1 Mio. Token Eingabekontext, 64k Token Ausgabebeschränkung. Die Eingabe akzeptiert Text, Bild, Video, Audio und PDF. Die Ausgabe ist Text.
- Benchmark-Deltas gegenüber 3.6 Flash: DeepSWE 49,0 % auf 65,3 %, FrontierCode 34,4 % auf 43,6 %, AutomationBench 17,0 % auf 30,4 %, WebDev Arena Elo 1538 auf 1588.
- Streaming verwendet `:streamGenerateContent?alt=sse`. Der Anfragetext behält Googles
contents- plusgenerationConfig-Schema bei. - Testen Sie den Endpunkt in Apidog, bevor Sie Anwendungscode schreiben: Importieren Sie die Spezifikation, speichern Sie den Schlüssel als Umgebungsvariable und beobachten Sie, wie SSE-Chunks live gerendert werden.
Wofür Gemini 3.7 Flash gut ist
Flash-Modelle tauschen ein wenig Spitzenintelligenz gegen Geschwindigkeit und Preis ein, und 3.7 verringert diesen Kompromiss stärker als jede frühere Veröffentlichung. Die Benchmark-Deltas gegenüber 3.6 Flash sind für einen Zeitraum von drei Wochen ungewöhnlich groß: DeepSWE v1.1 sprang von 49,0 % auf 65,3 %, FrontierCode 1.1 Main von 34,4 % auf 43,6 % und AutomationBench von 17,0 % auf 30,4 %. Der WebDev Arena Elo stieg um 50 Punkte, von 1538 auf 1588.

Betrachten Sie diese Zahlen als Signal für die Eignung der Arbeitslast. Greifen Sie zu 3.7 Flash, wenn:
- Sie Agenten-Schleifen ausführen. Der AutomationBench-Score hat sich fast verdoppelt, und Google sagt, das Modell „denkt gewissenhafter über mehrstufige Planung und Werkzeugaufrufe nach.“ Agenten-Pipelines mit vielen kurzen, werkzeugintensiven Schritten sind der Zielanwendungsfall.
- Sie Code generieren oder debuggen. Google behauptet, 3.7 sei besser beim Debuggen und fähiger, im ersten Versuch einsatzfähigen Code zu produzieren. Die DeepSWE- und FrontierCode-Zuwächse untermauern dies.
- Sie Dokumente verarbeiten. GDP.pdf sprang von 22,0 % auf 34,0 %, und PDF ist ein erstklassiger Eingabetyp. Die Langkontext-Abrufung hält ebenfalls stand: 97,0 % beim 128k-Nadeltest.
- Sie multimodale Eingaben mit begrenztem Budget benötigen. Text, Bild, Video, Audio und PDF werden alle über dasselbe
contents-Array eingegeben.
Für eine vollständige Funktionsübersicht, einschließlich des Harvey LAB-AA-Scores von 90,7 % im Rechtsbereich und der aktualisierten CBRN- und Cyber-Schutzmaßnahmen, siehe was neu ist in Gemini 3.7 Flash. Wissenswerter Kontext: Gemini 3.5 Pro ist noch immer verzögert, und Axios berichtet, dass Google Flash-Updates bewusst vor seinem nächsten Flaggschiff veröffentlicht.
API-Schlüssel abrufen
Zwei Wege, die nicht gleichwertig sind.
AI Studio (schneller Weg). Öffnen Sie aistudio.google.com/apikey, klicken Sie auf API-Schlüssel abrufen, wählen Sie ein Google Cloud-Projekt aus und kopieren Sie den String. Der Schlüssel funktioniert sofort mit generativelanguage.googleapis.com, und der kostenlose Tarif bietet Ihnen ausreichend Kontingent für Prototypen. Gemini 3.7 Flash ist in über 160 Ländern verfügbar.
Vertex AI (Produktionsweg). Wenn Ihre Infrastruktur auf GCP läuft, verwenden Sie Vertex. Die Authentifizierung wechselt von einem API-Schlüssel zu OAuth (Dienstkonten oder kurzlebige Tokens), Aufrufe werden über aiplatform.googleapis.com geleitet, und Sie erhalten IAM, Audit-Logs und regionale Endpunkte. Die Modell-ID und der Anfragetext bleiben identisch; nur die URL und der Authentifizierungsmechanismus ändern sich.
Prototypen in AI Studio entwickeln, vor dem Produktionsverkehr zu Vertex wechseln. So oder so, den Schlüssel einmal exportieren:
export GEMINI_API_KEY="AIza..."
Hardcoden Sie den Schlüssel niemals oder übergeben Sie ihn nicht als `?key=` Abfrageparameter in der Produktion; Abfrage-Strings landen in Server-Logs.
Endpunkt und Authentifizierung
Der Basisendpunkt für einen synchronen Aufruf:
POST https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent
Streaming tauscht das Methoden-Suffix und fügt das SSE-Flag hinzu:
POST https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:streamGenerateContent?alt=sse
Die Authentifizierung erfolgt über einen Header: x-goog-api-key: $GEMINI_API_KEY. Das ist der gesamte Handshake. Keine Bearer-Tokens, kein Signaturschema, keine Sitzungseinrichtung.
Ihre erste Anfrage in cURL
Hier ist ein vollständiger, funktionierender Aufruf:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"role": "user",
"parts": [{ "text": "Review this SQL for injection risk: SELECT * FROM orders WHERE id = ${orderId}" }]
}],
"generationConfig": {
"temperature": 0.3,
"maxOutputTokens": 1024
}
}'
Die Antwort gibt ein `candidates`-Array zurück. Jeder Kandidat enthält ein `content`-Objekt mit `parts` (Text oder Funktionsaufrufen, falls Sie Tools deklariert haben) und einem `finishReason`. Die Token-Zähler befinden sich in `usageMetadata` auf der obersten Ebene; achten Sie auf diesen Block, da Ausgabe-Tokens zum Einführungspreis fünfmal so viel kosten wie Eingabe-Tokens.
Beachten Sie das Schema: Google verwendet `contents` mit `role` und `parts`, nicht OpenAIs `messages`-Form. Stellen Sie diese Zuordnung zuerst richtig ein, wenn Sie von einem anderen Anbieter portieren.
Python-Schnellstart
Installieren oder aktualisieren Sie das offizielle SDK:
pip install --upgrade google-generativeai
Ein einfacher Aufruf mit einer Systemanweisung:
import os
import google.generativeai as genai
genai.configure(api_key=os.environ["GEMINI_API_KEY"])
model = genai.GenerativeModel(
model_name="gemini-3.7-flash",
system_instruction="You are a code reviewer. Flag issues as blocking or non-blocking.",
generation_config={
"temperature": 0.3,
"max_output_tokens": 2048,
},
)
response = model.generate_content(
"Review this Flask route for security issues:\n\n"
"@app.route('/user/<id>')\n"
"def get_user(id):\n"
" return db.execute(f'SELECT * FROM users WHERE id = {id}')"
)
print(response.text)
print("input tokens:", response.usage_metadata.prompt_token_count)
print("output tokens:", response.usage_metadata.candidates_token_count)
Multimodale Eingaben werden im selben `contents`-Array übertragen. Um eine PDF-Datei zu senden, laden Sie diese über die Files API hoch und referenzieren Sie sie als Teil:
invoice = genai.upload_file("q3-invoice.pdf")
response = model.generate_content([
invoice,
"Extract the invoice number, total, and due date as JSON.",
])
print(response.text)
Der Benchmark-Gewinn für GDP.pdf (22,0 % auf 34,0 %) zeigt sich genau bei dieser Arbeitslast: strukturierte Extraktion aus unübersichtlichen realen Dokumenten.
Node.js-Schnellstart
Das Node SDK ist @google/generative-ai und spiegelt die Python-Form wider:
import { GoogleGenerativeAI } from "@google/generative-ai";
const genAI = new GoogleGenerativeAI(process.env.GEMINI_API_KEY);
const model = genAI.getGenerativeModel({
model: "gemini-3.7-flash",
generationConfig: {
temperature: 0.3,
maxOutputTokens: 2048,
responseMimeType: "application/json",
responseSchema: {
type: "object",
properties: {
severity: { type: "string", enum: ["blocking", "non-blocking"] },
issues: { type: "array", items: { type: "string" } },
},
required: ["severity", "issues"],
},
},
});
const result = await model.generateContent(
"Review this Express handler: app.get('/search', (req, res) => res.send(eval(req.query.q)))"
);
console.log(JSON.parse(result.response.text()));
Die Zeile `responseSchema` ist wichtiger, als es scheint. Sie zwingt den Kandidaten in ein parsbares Objekt, sodass nachgeschalteter Code niemals Freitext berührt. Kombinieren Sie es mit `responseMimeType: "application/json"`, sonst wird es ignoriert.
Streaming
Für Chat-UIs und alles Benutzer-orientierte, streamen Sie. In Python fügen Sie stream=True hinzu:
stream = model.generate_content(
"Explain the N+1 query problem with a concrete ORM example.",
stream=True,
)
for chunk in stream:
if chunk.text:
print(chunk.text, end="", flush=True)
Über rohes HTTP rufen Sie `:streamGenerateContent?alt=sse` auf und parsen serverseitige Ereignisse (Server-Sent Events). Jede `data:`-Zeile enthält eine teilweise `candidates`-Nutzlast; der letzte Chunk enthält `usageMetadata`, sodass die Token-Abrechnung erst nach dem Schließen des Streams genau ist.
generationConfig optimieren
Die Parameter, die Sie am häufigsten ändern werden, in grober Reihenfolge ihres Einflusses:
| Parameter | Typ | Was es bewirkt |
|---|---|---|
maxOutputTokens |
Ganzzahl | Feste Obergrenze für die Ausgabe, bis zum 64k-Limit des Modells. Ihr wichtigster Kostenhebel. |
temperature |
Zahl | 0 bis 2. Verwenden Sie 0,2 bis 0,4 für Code und Extraktion, 0,7+ für kreativen Text. |
responseMimeType |
Zeichenkette | Setzen Sie application/json, um JSON-Ausgabe zu erzwingen. |
responseSchema |
Objekt | Erzwingt eine strikte Form, wenn es mit dem JSON-Mime-Typ gekoppelt ist. |
topP |
Zahl | Cutoff für Nucleus-Sampling. Lassen Sie ihn auf dem Standardwert, es sei denn, Sie optimieren bewusst. |
stopSequences |
Array | Strings, die die Generierung frühzeitig stoppen. Nützlich für delimiter-basiertes Parsen. |
Ausgabe-Tokens kosten 3,75 $ pro Million zum Einführungspreis und 7,50 $ ab Januar 2027, also begrenzen Sie die Ausgabe auf das, was Ihr Anwendungsfall benötigt, nicht auf die 64k-Obergrenze. Die vollständige Token-Berechnung, mit ausgearbeiteten Beispielen pro Arbeitslast, finden Sie in unserer Gemini 3.7 Flash Preisübersicht.
Über `generationConfig` hinaus akzeptiert der Anfragetext auch `tools` (Funktionsdeklarationen, Suche als Werkzeug, Computernutzung) und `toolConfig` zum Erzwingen von Tool-Aufrufen. Die Werkzeugnutzung ist der Bereich, in dem sich 3.7 Flash am meisten verbessert hat, und sie verdient eine eigene Anleitung: siehe das Gemini 3.7 Flash Tutorial für Funktionsaufrufe für Deklarationen, parallele Aufrufe und das Antwortschleifenmuster.
Testen Sie den Endpunkt in Apidog, bevor Sie Anwendungscode schreiben
Die Prompt-Iteration innerhalb eines Python-Skripts ist langsam und teuer: bearbeiten, erneut ausführen, scrollen, wiederholen, und jeder Zyklus verbraucht Tokens. Der schnellere Weg ist, die Anforderungsform zuerst in einem API-Client festzulegen und sie dann in Code zu portieren, sobald die Antworten korrekt aussehen.
Apidog verarbeitet das Gemini-Anfrageschema nativ. Die Einrichtung:
- Erstellen Sie ein Projekt und importieren Sie die Generative Language API OpenAPI-Spezifikation aus den API-Docs von Google. Die Sammlung kommt bereits benannt an, sodass
generateContentnur eine Suche entfernt ist. - Fügen Sie eine Umgebungsvariable namens
GEMINI_API_KEYhinzu und binden Sie diese auf Umgebungsebene an denx-goog-api-keyHeader. Jede Anfrage erbt sie, und der Schlüssel erscheint niemals in einem gespeicherten Anfragetext. - Speichern Sie die Modell-ID als Variable, die auf
gemini-3.7-flashgesetzt ist. Wenn Sie A/B-Tests gegengemini-3.6-flashdurchführen möchten, ändern Sie eine Variable, anstatt URLs in einem Dutzend gespeicherter Anfragen zu bearbeiten. - Erstellen Sie das
contents-Array im visuellen JSON-Editor. Verschachtelte Teile werden sauber gerendert, und die Schema-Validierung fängt einen falsch formatierten Body ab, bevor Sie auch nur ein einziges Token für eine 400 ausgeben. - Rufen Sie den Streaming-Endpunkt auf. Apidog rendert SSE-Chunks live, sodass Sie beobachten können, wie die Antwort genau so zusammengesetzt wird, wie Ihr SDK sie sehen würde, Latenz inbegriffen.
- Speichern Sie gute Antworten als Beispiele. Spätere Testläufe greifen auf das Fixture statt auf die Live-API zu. Dies ist der größte Token-Sparer im gesamten Workflow.
Sobald Anfragen gespeichert sind, verketten Sie diese zu Testszenarien mit Zusicherungen zu `finishReason`, Antwortschema und `usageMetadata`-Token-Zählern. Das verwandelt einen manuellen Smoke-Test in eine Regressionssuite, die Sie bei jeder Prompt-Änderung ausführen können; dasselbe Muster, das QA-Teams verwenden, wird in unserem API-Testleitfaden für QA-Ingenieure behandelt.
Fehlerbehandlung und Ratenbegrenzungen
Gemini-Fehler geben ein Top-Level-error-Objekt mit code, status und message zurück. Diejenigen, denen Sie begegnen werden:
| Code | Status | Bedeutung | Behebung |
|---|---|---|---|
| 400 | INVALID_ARGUMENT |
Falsch formatierter Body, falsche Rolle, leere contents. |
Validieren Sie den Body in Apidog vor dem Senden. |
| 401 | UNAUTHENTICATED |
Fehlender oder widerrufener Schlüssel. | Re-exportieren Sie GEMINI_API_KEY; bestätigen Sie, dass der Schlüssel in AI Studio aktiv ist. |
| 403 | PERMISSION_DENIED |
Projekt fehlt Zugriff oder Abrechnung. | Überprüfen Sie Projekteinstellungen und Abrechnungsstatus. |
| 429 | RESOURCE_EXHAUSTED |
Ratenbegrenzung oder tägliches Kontingent erreicht. | Mit Jitter zurückfahren, Anfragen bündeln oder Stufen upgraden. |
| 500 | INTERNAL |
Vorübergehender Serverfehler. | Mit exponentiellem Backoff wiederholen. |
| 503 | UNAVAILABLE |
Dienst überlastet. | Nach einigen Sekunden erneut versuchen; auf Vertex, eine andere Region ausprobieren. |
Drei Gewohnheiten halten die Produktion stabil:
- Umschließen Sie jeden Aufruf in einen Wiederholungs-Helfer, der 429- und 5xx-Fehler mit jittered exponentiellem Backoff behandelt. Die SDKs versuchen es von sich aus einige Male erneut, aber ein dünner Wrapper bietet Ihnen Logging und Circuit-Breaking, die Sie kontrollieren.
- Erfinden Sie keine Ratenbegrenzungen. Limits variieren je nach Stufe und ändern sich im Laufe der Zeit; lesen Sie die aktuellen Werte auf der Gemini API Preis- und Limitseite und alarmieren Sie bei 80 % des Kontingents.
- Pinnen Sie die Modell-ID hinter einer Umgebungsvariablen fest. Wenn eine 3.7-Verhaltensänderung einen Prompt bricht, wird das Zurückrollen auf
gemini-3.6-flashzu einer Konfigurationsänderung statt eines Deployments.
FAQ
Ist Gemini 3.7 Flash kostenlos nutzbar?
AI Studio bietet einen kostenlosen Tarif mit täglichem Kontingent, das für Prototypen ausreicht, und der kostenpflichtige Einführungspreis beträgt 0,75 $ pro 1 Mio. Eingabe-Tokens bis zum 31. Dezember 2026. Wenn Sie den kostenlosen Weg weiter ausdehnen möchten, deckt unser Leitfaden für den kostenlosen Gemini API-Zugang die Tarife und ihre Limits ab.
Was ist der Unterschied zwischen dem Aufruf über AI Studio und Vertex AI?
Gleiches Modell, gleicher Anfragetext, unterschiedliche Implementierung. AI Studio verwendet einen API-Schlüssel für generativelanguage.googleapis.com; Vertex verwendet OAuth für aiplatform.googleapis.com und fügt IAM, Audit-Logging und regionale Endpunkte hinzu. Beginnen Sie mit AI Studio, wechseln Sie zu Vertex, wenn der Verkehr ernst wird.
Kann ich Bilder, Audio und PDFs an Gemini 3.7 Flash senden?
Ja. Die Eingabe ist multimodal: Text, Bild, Video, Audio und PDF reisen alle als Teile im contents-Array, inline als Base64 oder per Referenz über die Files API. Die Ausgabe ist nur Text.
Wie groß sind das Kontextfenster und das Ausgabemaximum?
1 Mio. Tokens rein, 64k Tokens raus. Der 128k-Nadel-Abrufwert von 97,0 % deutet darauf hin, dass die Langkontext-Abrufung weit über das hinaus zuverlässig ist, was die meisten Apps benötigen, aber das Chunking langer Eingaben spart immer noch Geld, da jedes Eingabe-Token abgerechnet wird.
Sollte ich von Gemini 3.6 Flash upgraden?
Für Agenten- und Codierungs-Workloads sind die Benchmark-Lücken groß genug, dass die Antwort in der Regel ja lautet, und der Modell-ID-Tausch ist eine Zeile. Verhaltensunterschiede, die vor der Umstellung des Produktionsverkehrs einen Regressionstest wert sind, werden im 3.6 zu 3.7 Flash Migrationsleitfaden behandelt.
Wo 3.7 Flash in Ihren Stack passt
Gemini 3.7 Flash ist eine seltene Veröffentlichung, bei der der Preis gesunken ist, während die Leistungsfähigkeit gestiegen ist. Bis Ende 2026 zahlen Sie die Hälfte des Einführungspreises von 3.6 Flash für ein Modell, das bei DeepSWE 16 Punkte höher und bei AutomationBench fast doppelt so hoch abschneidet. Die sinnvolle Standardeinstellung: Leiten Sie Agenten-Schleifen, Code-Aufgaben und Dokumentenextraktion jetzt an 3.7 Flash, berücksichtigen Sie das Einführungsratenfenster für die Budgetplanung und halten Sie einen Rollback-Pfad zu 3.6 hinter einer Umgebungsvariablen bereit.
Beginnen Sie mit dem obigen cURL-Aufruf, bestätigen Sie die Antwortform und verschieben Sie die Anfrage dann in einen API-Client, bevor Sie Anwendungscode schreiben. Laden Sie Apidog herunter, um die Gemini-Spezifikation zu importieren, Ihren Schlüssel einmal zu binden und synchrone, Streaming- und Tool-Aufrufe von einem Arbeitsbereich aus zu testen. Wenn der Prompt korrekt ist, dauert die Python- oder Node-Portierung nur Minuten, da Sie bereits wissen, wie der Netzwerkverkehr aussieht.
