Sie rufen Gemini 3.6 Flash mit der Modell-ID gemini-3.6-flash über die Gemini API von Google auf. Das ist der Kern der Sache. Google hat das Flash-Update am 21. Juli 2026 veröffentlicht, und 3.6 Flash ist die leistungsstarke Stufe: günstigere Ausgabe als 3.5 Flash, ein 1M-Token-Kontextfenster und Eingaben für Text, Bilder, Videos, Audio und PDFs. Dieser Leitfaden führt Sie von null zu einer getesteten Anfrage. Sie besorgen sich einen Schlüssel, tätigen Ihren ersten Aufruf in curl und Python, lernen die wichtigen Parameter kennen und richten einen Regressionstest ein, damit der Aufruf nach der Bereitstellung weiterhin funktioniert.

Was Sie vor dem Start benötigen
Drei Dinge, und keines davon kostet zu Beginn Geld.
- Ein Google-Konto. So melden Sie sich an, um einen Schlüssel zu erhalten.
- Ein Gemini API-Schlüssel. Er ist kostenlos bei Google AI Studio erhältlich, und der nächste Abschnitt behandelt dies.
- Eine Möglichkeit, eine HTTP-Anfrage zu senden. curl funktioniert von jedem Terminal aus. Python funktioniert, wenn Sie lieber Code schreiben möchten. Sie können auch einen API-Client wie Apidog verwenden, wenn Sie eine Benutzeroberfläche für das Ganze wünschen. Wir zeigen alle drei.
Es ist keine vorherige Abrechnungseinrichtung erforderlich. Die kostenlose Stufe läuft über AI Studio und ist ratenbegrenzt, sodass Sie ohne hinterlegte Karte testen können. Mehr zu diesen Limits weiter unten.
Einen Gemini API-Schlüssel erhalten
Gehen Sie zu Google AI Studio und melden Sie sich mit Ihrem Google-Konto an. Klicken Sie auf „API-Schlüssel erhalten“ und dann auf „API-Schlüssel erstellen“. Kopieren Sie den angezeigten String und speichern Sie ihn an einem sicheren Ort. Behandeln Sie ihn wie ein Passwort: Jeder, der den Schlüssel besitzt, kann Ausgaben über Ihr Konto tätigen.

Fügen Sie den Schlüssel nicht in clientseitigen Code ein und committen Sie ihn nicht in ein Repository. Legen Sie ihn stattdessen als Umgebungsvariable fest:
export GEMINI_API_KEY="your_key_here"
Das offizielle Python SDK liest diese Variable eigenständig, wodurch das Geheimnis aus Ihren Quelldateien ferngehalten wird. Die kanonischen Einrichtungsschritte finden Sie in den Gemini API-Dokumenten von Google.
Ihren ersten API-Aufruf tätigen
Der REST-Endpunkt ist ein POST an die generateContent-Methode des Modells. Hier ist er in curl:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
-H "x-goog-api-key: YOUR_API_KEY" \
-H "Content-Type: application/json" \
-X POST \
-d '{
"contents": [
{
"parts": [
{"text": "Explain how APIs work"}
]
}
]
}'
Der Schlüssel wird im x-goog-api-key-Header platziert. Der Body ist ein contents-Array; jeder Eintrag hat ein parts-Array; jeder Teil hier ist ein text-String. Diese Verschachtelung mag für einen einzelnen Prompt umständlich erscheinen, aber es ist die gleiche Form, die es Ihnen später ermöglicht, Text mit Bildern und Dateien in einer einzigen Anfrage zu mischen.
Bevorzugen Sie Python? Installieren Sie das SDK mit pip install google-genai, dann:
from google import genai
client = genai.Client() # reads GEMINI_API_KEY from the environment
resp = client.models.generate_content(
model="gemini-3.6-flash",
contents="Explain how APIs work",
)
print(resp.text)
Der Client nimmt GEMINI_API_KEY selbst auf, sodass sich kein Schlüssel in Ihrem Code befindet. resp.text enthält die generierte Antwort. Das ist ein funktionierender Aufruf in fünf Zeilen.
Unter der Haube gibt die API JSON zurück. Der generierte Text befindet sich unter candidates[0].content.parts[0].text. Dies ist wichtig zu beachten, da dies genau das Feld ist, auf das Sie später in diesem Leitfaden bei der Umwandlung dieses Aufrufs in einen Test zugreifen werden.
Wichtige Parameter, die Sie kennen sollten
Die reine Anfrage funktioniert, aber einige Einstellungen ändern das, was Sie zurückbekommen.
- Systemanweisung. Legen Sie eine Persona oder eine Reihe von Regeln fest, die für die gesamte Konversation gelten und vom Benutzerprompt getrennt sind. Verwenden Sie dies für „Antworten Sie nur in JSON“ oder „Sie sind ein wortkarger Code-Reviewer“. Dies steuert Ton und Format weitaus zuverlässiger, als Anweisungen in jede Nachricht zu stopfen.
- Maximale Ausgabe-Tokens. Begrenzen Sie die Länge der Antwort. 3.6 Flash kann bis zu 64k Ausgabe-Tokens erzeugen. Erhöhen Sie also die Begrenzung für lange Generierungen und verringern Sie sie, wenn Sie Kosten und Latenz kontrollieren möchten.
- Multimodale Eingaben. Das Modell liest Text, Bilder, Videos, Audio und PDFs im selben Aufruf. Sie fügen diese als zusätzliche Einträge im
parts-Array neben Ihrem Text hinzu. Die Ausgabe ist ausschließlich Text, betrachten Sie es also als viele Arten von Eingaben hinein, Worte heraus. Das Kontextfenster fasst bis zu 1M Eingabe-Tokens, was Platz für ein langes PDF oder ein vollständiges Videotranskript bietet. - Denken und Argumentation. 3.6 Flash argumentiert, bevor es auf schwierige Prompts antwortet. Das verbessert mehrstufige Aufgaben, und deshalb enthält der Ausgabepreis Denk-Tokens (mehr dazu im nächsten Abschnitt). Sie können den Argumentationsaufwand anpassen, wenn Sie Tiefe gegen Geschwindigkeit eintauschen möchten.
Die vollständige Parameterliste finden Sie in den Gemini API-Dokumenten. Erraten Sie keine Feldnamen; die Dokumente sind die Quelle der Wahrheit und werden aktualisiert, wenn die API dies tut.
Preise und die kostenlose Stufe
Gemini 3.6 Flash kostet 1,50 $ pro 1M Eingabe-Tokens und 7,50 $ pro 1M Ausgabe-Tokens. Dieser Ausgabepreis ist eine Reduzierung gegenüber den 9,00 $, die 3.5 Flash verlangte, und 3.6 Flash neigt auch dazu, bei derselben Aufgabe etwa 17 % weniger Ausgabe-Tokens zu generieren, sodass sich die Einsparungen summieren. Ein Detail, das Sie sich merken sollten: Der Ausgabepreis beinhaltet Denk-Tokens. Die interne Argumentation des Modells wird zum Ausgabepreis abgerechnet, sodass ein Prompt, der intensive Argumentation auslöst, mehr kosten kann, als die sichtbare Antwortlänge vermuten lässt. Planen Sie dies ein. Wir schlüsseln die vollständige Berechnung in unserem Gemini 3.6 Flash Preisleitfaden auf.
Die kostenlose Stufe läuft über AI Studio und ist real, aber ratenbegrenzt: Es gibt eine Obergrenze für Anfragen pro Minute und pro Tag, und Google darf kostenlose Daten nutzen, um seine Produkte zu verbessern. Sie ist für Prototyping gedacht, nicht für den Produktionsbetrieb. Zum Lernen und Testen ist sie ausreichend. Um zu sehen, wie weit sie reicht, lesen Sie wie Sie Gemini 3.6 Flash kostenlos nutzen können. Wenn Sie diese Grenze überschreiten, aktivieren Sie die Abrechnung, und derselbe Schlüssel funktioniert weiterhin, ohne dass Codeänderungen erforderlich sind.
Die Gemini API in Apidog testen und debuggen
curl beweist, dass der Aufruf einmal funktioniert. Es sagt Ihnen nicht, wann Google ein Antwortfeld ändert, wann Ihr Schlüssel abläuft oder wann eine Bereitstellung die Anfrage stillschweigend unterbricht. Dafür wünschen Sie sich einen gespeicherten, wiederholbaren Test. Hier verdient Apidog seinen Platz im Workflow.
Apidog ist ein API-Client und eine Testplattform. Hier ist der Ablauf für den Gemini-Aufruf, von Anfang bis Ende:
- Anfrage erstellen. Fügen Sie eine neue POST-Anfrage mit der URL
https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContenthinzu. Fügen Sie den zuvor verwendeten JSON-Body in den Anfrage-Body ein. - Schlüssel in einer Umgebungsvariablen speichern. Fügen Sie eine Variable namens
GEMINI_API_KEYzu einer Apidog-Umgebung hinzu und referenzieren Sie diese dann imx-goog-api-key-Header als{{GEMINI_API_KEY}}. Das Geheimnis bleibt außerhalb der geteilten Anfrage, und Sie können Schlüssel pro Umgebung (dev, staging, prod) wechseln, ohne den Aufruf selbst zu ändern. - Assertionen hinzufügen. Nachdem die Anfrage ausgeführt wurde, prüfen Sie die JSON-Antwort: Der Status ist 200, und
candidates[0].content.parts[0].textexistiert und ist nicht leer. Nun bedeutet ein erfolgreicher Durchlauf, dass die API tatsächlich geantwortet hat und nicht nur etwas zurückgegeben wurde. - Speichern und planen. Behalten Sie die Anfrage in einer Sammlung und planen Sie sie als Regressionstest. Führen Sie ihn zeitgesteuert oder innerhalb von CI aus, und Sie werden sofort erfahren, wenn der Gemini-Aufruf nicht mehr wie erwartet funktioniert, bevor Ihre Benutzer es tun.
Laden Sie Apidog herunter, und Sie können diesen Test in wenigen Minuten ausführen. Das ist die ehrliche Passung hier: Apidog führt das Modell nicht aus, es stellt sicher, dass die API, von der Ihre App abhängt, weiterhin so reagiert, wie Ihre App es erwartet.
Häufige Fehler und Lösungen
Drei Fehler decken die meisten Probleme ab, auf die Sie anfangs stoßen werden.
- 401 Unauthorized (ungültiger Schlüssel). Der Schlüssel ist falsch, widerrufen oder fehlt im Header. Überprüfen Sie, ob
x-goog-api-keygenau den String von AI Studio enthält und ob Ihre Umgebungsvariable korrekt aufgelöst wurde. Ein nachgestelltes Leerzeichen oder ein nicht expandiertes{{GEMINI_API_KEY}}ist der übliche Übeltäter. - 429 Too Many Requests (Ratenbegrenzung). Sie haben die Pro-Minute- oder Pro-Tag-Grenze der kostenlosen Stufe erreicht. Verlangsamen Sie die Anfragerate, fügen Sie einen Wiederholungsversuch mit Backoff hinzu oder aktivieren Sie die Abrechnung, um die Obergrenze zu erhöhen. Enge Testschleifen lösen dies schnell aus.
- 404 Not Found (Modell nicht gefunden). Dies ist fast immer ein Tippfehler in der Modell-ID. Es ist
gemini-3.6-flash, genau. Nichtgemini-3.5-flash, nichtgemini-flash-3.6. Die Lite-Stufe in derselben Veröffentlichung istgemini-3.5-flash-lite, ein anderes Modell der 3.5-Linie, verwechseln Sie diese also nicht.
FAQ
Was ist die genaue Modell-ID für Gemini 3.6 Flash? Es ist gemini-3.6-flash. Verwenden Sie sie als Modellnamen im SDK und im REST-URL-Pfad direkt vor :generateContent.
Ist die Gemini 3.6 Flash API kostenlos nutzbar? Es gibt eine kostenlose Stufe über AI Studio, die ratenbegrenzt ist. Sie eignet sich gut zum Prototyping und Lernen. Für den Produktionsbetrieb muss die Abrechnung aktiviert werden. Details finden Sie unter wie Sie sie kostenlos nutzen können.
Was kann ich an das Modell senden? Text, Bilder, Videos, Audio und PDF, bis zu einem 1M-Token-Kontextfenster. Die Ausgabe ist ausschließlich Text.
Warum war meine Rechnung höher als die sichtbaren Antworten? Der Ausgabepreis von 7,50 $ pro 1M Tokens beinhaltet die Denk-Tokens des Modells. Prompts, die intensive Argumentation erfordern, werden höher abgerechnet, als die Länge der Antwort auf dem Bildschirm zeigt.
Ist dies dasselbe wie die ältere Gemini 3.5 Flash API? Die Aufrufform ist dieselbe. Wenn Sie also die Gemini 3.5 API verwendet haben, tauschen Sie die Modell-ID aus und sind fertig. 3.6 Flash senkt den Ausgabepreis und verwendet bei derselben Aufgabe weniger Ausgabe-Tokens.
Kann ich denselben Schlüssel in curl, Python und Apidog verwenden? Ja. Ein Schlüssel von AI Studio funktioniert in allen. Bewahren Sie ihn in jedem Tool als Umgebungsvariable auf, anstatt ihn fest zu codieren, und Sie können ihn an einer Stelle rotieren oder widerrufen.
Wie geht es weiter?
Sie haben einen Schlüssel, einen funktionierenden Aufruf in curl und Python, die wichtigen Parameter und einen gespeicherten Regressionstest, der den Endpunkt überwacht. Beginnen Sie mit der kostenlosen Stufe, bewahren Sie Ihren Schlüssel in einer Umgebungsvariablen auf und verlassen Sie sich für alles jenseits der Grundlagen auf die offiziellen Dokumente. Wenn der Aufruf zu etwas wird, wovon Ihre App abhängt, integrieren Sie ihn in einen Apidog-Test, damit eine stille API-Änderung niemals zuerst Ihre Benutzer erreicht.
