Wie benutzt man die Gemini 3.7 Flash API?

Praktischer Schnellstart für die Gemini 3.7 Flash API: einen Schlüssel erhalten, den Endpunkt in cURL, Python und Node.js aufrufen, Antworten streamen und alles in Apidog testen.

Ashley Innocent

Ashley Innocent

14 August 2026

Wie benutzt man die Gemini 3.7 Flash API?

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Google hat Gemini 3.7 Flash am 13. August 2026, drei Wochen nach 3.6 Flash, veröffentlicht und bezeichnet es als „unser intelligentestes Arbeitstier-Modell“. Die Schlagzeile für Entwickler: Agentic-Coding-Scores stiegen stark an (DeepSWE v1.1 ging von 49,0 % auf 65,3 %), der Einführungspreis beträgt die Hälfte dessen, womit 3.6 Flash gestartet wurde, und die API-Oberfläche ist unverändert. Wenn Sie bereits Gemini aufrufen, tauschen Sie eine Modell-ID aus. Wenn nicht, ist dies der günstigste Einstiegspunkt, den Google je für ein so leistungsfähiges Modell angeboten hat.

Dieser Leitfaden ist der praktische Schnellstart. Sie erhalten einen API-Schlüssel, tätigen Ihren ersten Aufruf in cURL, portieren ihn zu Python und Node.js, streamen Antworten, optimieren generationConfig und integrieren das Ganze in Apidog, damit Sie Prompts iterieren können, ohne Tokens in einer Code-Schleife zu verbrauchen. Die Spezifikationen aus der offiziellen Ankündigung: 1M Token Kontext, 64k Ausgabe, multimodale Eingabe, Funktionsaufrufe, Suche als Werkzeug und Computernutzung.

Wenn Sie mit der vorherigen Generation gearbeitet haben, übernimmt die Anforderungsstruktur die unseres Gemini 3 Flash Preview API-Leitfadens; dieser Artikel behandelt alles Neue im 3.7-Workflow.

Button

TL;DR

Wofür Gemini 3.7 Flash gut ist

Flash-Modelle tauschen ein wenig Spitzenintelligenz gegen Geschwindigkeit und Preis ein, und 3.7 verringert diesen Kompromiss stärker als jede frühere Veröffentlichung. Die Benchmark-Deltas gegenüber 3.6 Flash sind für einen Zeitraum von drei Wochen ungewöhnlich groß: DeepSWE v1.1 sprang von 49,0 % auf 65,3 %, FrontierCode 1.1 Main von 34,4 % auf 43,6 % und AutomationBench von 17,0 % auf 30,4 %. Der WebDev Arena Elo stieg um 50 Punkte, von 1538 auf 1588.

Betrachten Sie diese Zahlen als Signal für die Eignung der Arbeitslast. Greifen Sie zu 3.7 Flash, wenn:

Für eine vollständige Funktionsübersicht, einschließlich des Harvey LAB-AA-Scores von 90,7 % im Rechtsbereich und der aktualisierten CBRN- und Cyber-Schutzmaßnahmen, siehe was neu ist in Gemini 3.7 Flash. Wissenswerter Kontext: Gemini 3.5 Pro ist noch immer verzögert, und Axios berichtet, dass Google Flash-Updates bewusst vor seinem nächsten Flaggschiff veröffentlicht.

API-Schlüssel abrufen

Zwei Wege, die nicht gleichwertig sind.

AI Studio (schneller Weg). Öffnen Sie aistudio.google.com/apikey, klicken Sie auf API-Schlüssel abrufen, wählen Sie ein Google Cloud-Projekt aus und kopieren Sie den String. Der Schlüssel funktioniert sofort mit generativelanguage.googleapis.com, und der kostenlose Tarif bietet Ihnen ausreichend Kontingent für Prototypen. Gemini 3.7 Flash ist in über 160 Ländern verfügbar.

Vertex AI (Produktionsweg). Wenn Ihre Infrastruktur auf GCP läuft, verwenden Sie Vertex. Die Authentifizierung wechselt von einem API-Schlüssel zu OAuth (Dienstkonten oder kurzlebige Tokens), Aufrufe werden über aiplatform.googleapis.com geleitet, und Sie erhalten IAM, Audit-Logs und regionale Endpunkte. Die Modell-ID und der Anfragetext bleiben identisch; nur die URL und der Authentifizierungsmechanismus ändern sich.

Prototypen in AI Studio entwickeln, vor dem Produktionsverkehr zu Vertex wechseln. So oder so, den Schlüssel einmal exportieren:

export GEMINI_API_KEY="AIza..."

Hardcoden Sie den Schlüssel niemals oder übergeben Sie ihn nicht als `?key=` Abfrageparameter in der Produktion; Abfrage-Strings landen in Server-Logs.

Endpunkt und Authentifizierung

Der Basisendpunkt für einen synchronen Aufruf:

POST https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent

Streaming tauscht das Methoden-Suffix und fügt das SSE-Flag hinzu:

POST https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:streamGenerateContent?alt=sse

Die Authentifizierung erfolgt über einen Header: x-goog-api-key: $GEMINI_API_KEY. Das ist der gesamte Handshake. Keine Bearer-Tokens, kein Signaturschema, keine Sitzungseinrichtung.

Ihre erste Anfrage in cURL

Hier ist ein vollständiger, funktionierender Aufruf:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{
      "role": "user",
      "parts": [{ "text": "Review this SQL for injection risk: SELECT * FROM orders WHERE id = ${orderId}" }]
    }],
    "generationConfig": {
      "temperature": 0.3,
      "maxOutputTokens": 1024
    }
  }'

Die Antwort gibt ein `candidates`-Array zurück. Jeder Kandidat enthält ein `content`-Objekt mit `parts` (Text oder Funktionsaufrufen, falls Sie Tools deklariert haben) und einem `finishReason`. Die Token-Zähler befinden sich in `usageMetadata` auf der obersten Ebene; achten Sie auf diesen Block, da Ausgabe-Tokens zum Einführungspreis fünfmal so viel kosten wie Eingabe-Tokens.

Beachten Sie das Schema: Google verwendet `contents` mit `role` und `parts`, nicht OpenAIs `messages`-Form. Stellen Sie diese Zuordnung zuerst richtig ein, wenn Sie von einem anderen Anbieter portieren.

Python-Schnellstart

Installieren oder aktualisieren Sie das offizielle SDK:

pip install --upgrade google-generativeai

Ein einfacher Aufruf mit einer Systemanweisung:

import os
import google.generativeai as genai

genai.configure(api_key=os.environ["GEMINI_API_KEY"])

model = genai.GenerativeModel(
    model_name="gemini-3.7-flash",
    system_instruction="You are a code reviewer. Flag issues as blocking or non-blocking.",
    generation_config={
        "temperature": 0.3,
        "max_output_tokens": 2048,
    },
)

response = model.generate_content(
    "Review this Flask route for security issues:\n\n"
    "@app.route('/user/<id>')\n"
    "def get_user(id):\n"
    "    return db.execute(f'SELECT * FROM users WHERE id = {id}')"
)

print(response.text)
print("input tokens:", response.usage_metadata.prompt_token_count)
print("output tokens:", response.usage_metadata.candidates_token_count)

Multimodale Eingaben werden im selben `contents`-Array übertragen. Um eine PDF-Datei zu senden, laden Sie diese über die Files API hoch und referenzieren Sie sie als Teil:

invoice = genai.upload_file("q3-invoice.pdf")

response = model.generate_content([
    invoice,
    "Extract the invoice number, total, and due date as JSON.",
])
print(response.text)

Der Benchmark-Gewinn für GDP.pdf (22,0 % auf 34,0 %) zeigt sich genau bei dieser Arbeitslast: strukturierte Extraktion aus unübersichtlichen realen Dokumenten.

Node.js-Schnellstart

Das Node SDK ist @google/generative-ai und spiegelt die Python-Form wider:

import { GoogleGenerativeAI } from "@google/generative-ai";

const genAI = new GoogleGenerativeAI(process.env.GEMINI_API_KEY);

const model = genAI.getGenerativeModel({
  model: "gemini-3.7-flash",
  generationConfig: {
    temperature: 0.3,
    maxOutputTokens: 2048,
    responseMimeType: "application/json",
    responseSchema: {
      type: "object",
      properties: {
        severity: { type: "string", enum: ["blocking", "non-blocking"] },
        issues: { type: "array", items: { type: "string" } },
      },
      required: ["severity", "issues"],
    },
  },
});

const result = await model.generateContent(
  "Review this Express handler: app.get('/search', (req, res) => res.send(eval(req.query.q)))"
);

console.log(JSON.parse(result.response.text()));

Die Zeile `responseSchema` ist wichtiger, als es scheint. Sie zwingt den Kandidaten in ein parsbares Objekt, sodass nachgeschalteter Code niemals Freitext berührt. Kombinieren Sie es mit `responseMimeType: "application/json"`, sonst wird es ignoriert.

Streaming

Für Chat-UIs und alles Benutzer-orientierte, streamen Sie. In Python fügen Sie stream=True hinzu:

stream = model.generate_content(
    "Explain the N+1 query problem with a concrete ORM example.",
    stream=True,
)

for chunk in stream:
    if chunk.text:
        print(chunk.text, end="", flush=True)

Über rohes HTTP rufen Sie `:streamGenerateContent?alt=sse` auf und parsen serverseitige Ereignisse (Server-Sent Events). Jede `data:`-Zeile enthält eine teilweise `candidates`-Nutzlast; der letzte Chunk enthält `usageMetadata`, sodass die Token-Abrechnung erst nach dem Schließen des Streams genau ist.

generationConfig optimieren

Die Parameter, die Sie am häufigsten ändern werden, in grober Reihenfolge ihres Einflusses:

Parameter Typ Was es bewirkt
maxOutputTokens Ganzzahl Feste Obergrenze für die Ausgabe, bis zum 64k-Limit des Modells. Ihr wichtigster Kostenhebel.
temperature Zahl 0 bis 2. Verwenden Sie 0,2 bis 0,4 für Code und Extraktion, 0,7+ für kreativen Text.
responseMimeType Zeichenkette Setzen Sie application/json, um JSON-Ausgabe zu erzwingen.
responseSchema Objekt Erzwingt eine strikte Form, wenn es mit dem JSON-Mime-Typ gekoppelt ist.
topP Zahl Cutoff für Nucleus-Sampling. Lassen Sie ihn auf dem Standardwert, es sei denn, Sie optimieren bewusst.
stopSequences Array Strings, die die Generierung frühzeitig stoppen. Nützlich für delimiter-basiertes Parsen.

Ausgabe-Tokens kosten 3,75 $ pro Million zum Einführungspreis und 7,50 $ ab Januar 2027, also begrenzen Sie die Ausgabe auf das, was Ihr Anwendungsfall benötigt, nicht auf die 64k-Obergrenze. Die vollständige Token-Berechnung, mit ausgearbeiteten Beispielen pro Arbeitslast, finden Sie in unserer Gemini 3.7 Flash Preisübersicht.

Über `generationConfig` hinaus akzeptiert der Anfragetext auch `tools` (Funktionsdeklarationen, Suche als Werkzeug, Computernutzung) und `toolConfig` zum Erzwingen von Tool-Aufrufen. Die Werkzeugnutzung ist der Bereich, in dem sich 3.7 Flash am meisten verbessert hat, und sie verdient eine eigene Anleitung: siehe das Gemini 3.7 Flash Tutorial für Funktionsaufrufe für Deklarationen, parallele Aufrufe und das Antwortschleifenmuster.

Testen Sie den Endpunkt in Apidog, bevor Sie Anwendungscode schreiben

Die Prompt-Iteration innerhalb eines Python-Skripts ist langsam und teuer: bearbeiten, erneut ausführen, scrollen, wiederholen, und jeder Zyklus verbraucht Tokens. Der schnellere Weg ist, die Anforderungsform zuerst in einem API-Client festzulegen und sie dann in Code zu portieren, sobald die Antworten korrekt aussehen.

Apidog verarbeitet das Gemini-Anfrageschema nativ. Die Einrichtung:

  1. Erstellen Sie ein Projekt und importieren Sie die Generative Language API OpenAPI-Spezifikation aus den API-Docs von Google. Die Sammlung kommt bereits benannt an, sodass generateContent nur eine Suche entfernt ist.
  2. Fügen Sie eine Umgebungsvariable namens GEMINI_API_KEY hinzu und binden Sie diese auf Umgebungsebene an den x-goog-api-key Header. Jede Anfrage erbt sie, und der Schlüssel erscheint niemals in einem gespeicherten Anfragetext.
  3. Speichern Sie die Modell-ID als Variable, die auf gemini-3.7-flash gesetzt ist. Wenn Sie A/B-Tests gegen gemini-3.6-flash durchführen möchten, ändern Sie eine Variable, anstatt URLs in einem Dutzend gespeicherter Anfragen zu bearbeiten.
  4. Erstellen Sie das contents-Array im visuellen JSON-Editor. Verschachtelte Teile werden sauber gerendert, und die Schema-Validierung fängt einen falsch formatierten Body ab, bevor Sie auch nur ein einziges Token für eine 400 ausgeben.
  5. Rufen Sie den Streaming-Endpunkt auf. Apidog rendert SSE-Chunks live, sodass Sie beobachten können, wie die Antwort genau so zusammengesetzt wird, wie Ihr SDK sie sehen würde, Latenz inbegriffen.
  6. Speichern Sie gute Antworten als Beispiele. Spätere Testläufe greifen auf das Fixture statt auf die Live-API zu. Dies ist der größte Token-Sparer im gesamten Workflow.

Sobald Anfragen gespeichert sind, verketten Sie diese zu Testszenarien mit Zusicherungen zu `finishReason`, Antwortschema und `usageMetadata`-Token-Zählern. Das verwandelt einen manuellen Smoke-Test in eine Regressionssuite, die Sie bei jeder Prompt-Änderung ausführen können; dasselbe Muster, das QA-Teams verwenden, wird in unserem API-Testleitfaden für QA-Ingenieure behandelt.

Fehlerbehandlung und Ratenbegrenzungen

Gemini-Fehler geben ein Top-Level-error-Objekt mit code, status und message zurück. Diejenigen, denen Sie begegnen werden:

Code Status Bedeutung Behebung
400 INVALID_ARGUMENT Falsch formatierter Body, falsche Rolle, leere contents. Validieren Sie den Body in Apidog vor dem Senden.
401 UNAUTHENTICATED Fehlender oder widerrufener Schlüssel. Re-exportieren Sie GEMINI_API_KEY; bestätigen Sie, dass der Schlüssel in AI Studio aktiv ist.
403 PERMISSION_DENIED Projekt fehlt Zugriff oder Abrechnung. Überprüfen Sie Projekteinstellungen und Abrechnungsstatus.
429 RESOURCE_EXHAUSTED Ratenbegrenzung oder tägliches Kontingent erreicht. Mit Jitter zurückfahren, Anfragen bündeln oder Stufen upgraden.
500 INTERNAL Vorübergehender Serverfehler. Mit exponentiellem Backoff wiederholen.
503 UNAVAILABLE Dienst überlastet. Nach einigen Sekunden erneut versuchen; auf Vertex, eine andere Region ausprobieren.

Drei Gewohnheiten halten die Produktion stabil:

FAQ

Ist Gemini 3.7 Flash kostenlos nutzbar?

AI Studio bietet einen kostenlosen Tarif mit täglichem Kontingent, das für Prototypen ausreicht, und der kostenpflichtige Einführungspreis beträgt 0,75 $ pro 1 Mio. Eingabe-Tokens bis zum 31. Dezember 2026. Wenn Sie den kostenlosen Weg weiter ausdehnen möchten, deckt unser Leitfaden für den kostenlosen Gemini API-Zugang die Tarife und ihre Limits ab.

Was ist der Unterschied zwischen dem Aufruf über AI Studio und Vertex AI?

Gleiches Modell, gleicher Anfragetext, unterschiedliche Implementierung. AI Studio verwendet einen API-Schlüssel für generativelanguage.googleapis.com; Vertex verwendet OAuth für aiplatform.googleapis.com und fügt IAM, Audit-Logging und regionale Endpunkte hinzu. Beginnen Sie mit AI Studio, wechseln Sie zu Vertex, wenn der Verkehr ernst wird.

Kann ich Bilder, Audio und PDFs an Gemini 3.7 Flash senden?

Ja. Die Eingabe ist multimodal: Text, Bild, Video, Audio und PDF reisen alle als Teile im contents-Array, inline als Base64 oder per Referenz über die Files API. Die Ausgabe ist nur Text.

Wie groß sind das Kontextfenster und das Ausgabemaximum?

1 Mio. Tokens rein, 64k Tokens raus. Der 128k-Nadel-Abrufwert von 97,0 % deutet darauf hin, dass die Langkontext-Abrufung weit über das hinaus zuverlässig ist, was die meisten Apps benötigen, aber das Chunking langer Eingaben spart immer noch Geld, da jedes Eingabe-Token abgerechnet wird.

Sollte ich von Gemini 3.6 Flash upgraden?

Für Agenten- und Codierungs-Workloads sind die Benchmark-Lücken groß genug, dass die Antwort in der Regel ja lautet, und der Modell-ID-Tausch ist eine Zeile. Verhaltensunterschiede, die vor der Umstellung des Produktionsverkehrs einen Regressionstest wert sind, werden im 3.6 zu 3.7 Flash Migrationsleitfaden behandelt.

Wo 3.7 Flash in Ihren Stack passt

Gemini 3.7 Flash ist eine seltene Veröffentlichung, bei der der Preis gesunken ist, während die Leistungsfähigkeit gestiegen ist. Bis Ende 2026 zahlen Sie die Hälfte des Einführungspreises von 3.6 Flash für ein Modell, das bei DeepSWE 16 Punkte höher und bei AutomationBench fast doppelt so hoch abschneidet. Die sinnvolle Standardeinstellung: Leiten Sie Agenten-Schleifen, Code-Aufgaben und Dokumentenextraktion jetzt an 3.7 Flash, berücksichtigen Sie das Einführungsratenfenster für die Budgetplanung und halten Sie einen Rollback-Pfad zu 3.6 hinter einer Umgebungsvariablen bereit.

Beginnen Sie mit dem obigen cURL-Aufruf, bestätigen Sie die Antwortform und verschieben Sie die Anfrage dann in einen API-Client, bevor Sie Anwendungscode schreiben. Laden Sie Apidog herunter, um die Gemini-Spezifikation zu importieren, Ihren Schlüssel einmal zu binden und synchrone, Streaming- und Tool-Aufrufe von einem Arbeitsbereich aus zu testen. Wenn der Prompt korrekt ist, dauert die Python- oder Node-Portierung nur Minuten, da Sie bereits wissen, wie der Netzwerkverkehr aussieht.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen