Vous appelez Gemini 3.6 Flash avec l'ID de modèle gemini-3.6-flash via l'API Gemini de Google. C'est le cœur du sujet. Google a lancé le rafraîchissement de Flash le 21 juillet 2026, et 3.6 Flash est le niveau "cheval de trait" : un coût de sortie moins cher que 3.5 Flash, une fenêtre contextuelle d'1M de tokens, et des entrées texte, image, vidéo, audio et PDF. Ce guide vous mènera de zéro à une requête testée. Vous obtiendrez une clé, effectuerez votre premier appel en curl et Python, apprendrez les paramètres importants, et configurerez un test de régression pour que l'appel continue de fonctionner après son déploiement.

bouton
Ce dont vous avez besoin avant de commencer
Trois choses, et aucune ne coûte d'argent pour commencer.
- Un compte Google. C'est ainsi que vous vous connectez pour obtenir une clé.
- Une clé API Gemini. Elle est gratuite depuis Google AI Studio, et la section suivante la couvre.
- Un moyen d'envoyer une requête HTTP. curl fonctionne depuis n'importe quel terminal. Python fonctionne si vous préférez écrire du code. Vous pouvez également utiliser un client API comme Apidog si vous voulez une interface utilisateur pour l'ensemble. Nous montrerons les trois.
Aucune configuration de facturation n'est requise au préalable. Le niveau gratuit fonctionne via AI Studio et est soumis à des limites de débit, vous pouvez donc tester sans carte enregistrée. Plus d'informations sur ces limites ci-dessous.
Obtenez une clé API Gemini
Rendez-vous sur Google AI Studio et connectez-vous avec votre compte Google. Cliquez sur "Obtenir une clé API", puis sur "Créer une clé API". Copiez la chaîne qu'il vous fournit et stockez-la en lieu sûr. Traitez-la comme un mot de passe : toute personne qui a la clé peut l'utiliser pour facturer votre compte.

Ne collez pas la clé dans le code côté client et ne la committez pas dans un dépôt. Définissez-la plutôt comme une variable d'environnement :
export GEMINI_API_KEY="votre_clé_ici"
Le SDK Python officiel lit cette variable de lui-même, ce qui maintient le secret hors de vos fichiers sources. Pour les étapes de configuration canoniques, consultez la documentation de l'API Gemini de Google.
Faites votre premier appel API
Le point de terminaison REST est une requête POST vers la méthode generateContent du modèle. Voici comment le faire en curl :
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
-H "x-goog-api-key: VOTRE_CLE_API" \
-H "Content-Type: application/json" \
-X POST \
-d '{
"contents": [
{
"parts": [
{"text": "Expliquez comment fonctionnent les API"}
]
}
]
}'
La clé se trouve dans l'en-tête x-goog-api-key. Le corps est un tableau contents ; chaque entrée a un tableau parts ; chaque partie ici est une chaîne text. Cette imbrication semble complexe pour une seule invite, mais c'est la même forme qui vous permet ensuite de mélanger du texte avec des images et des fichiers dans une seule requête.
Vous préférez Python ? Installez le SDK avec pip install google-genai, puis :
from google import genai
client = genai.Client() # lit GEMINI_API_KEY depuis l'environnement
resp = client.models.generate_content(
model="gemini-3.6-flash",
contents="Expliquez comment fonctionnent les API",
)
print(resp.text)
Le client récupère GEMINI_API_KEY de lui-même, il n'y a donc pas de clé dans votre code. resp.text contient la réponse générée. C'est un appel fonctionnel en cinq lignes.
En arrière-plan, l'API renvoie du JSON. Le texte généré se trouve à l'emplacement candidates[0].content.parts[0].text. Il est important de le noter maintenant, car c'est exactement le champ que vous utiliserez pour vos assertions lorsque vous transformerez cet appel en test plus tard dans ce guide.
Paramètres clés à connaître
La requête de base fonctionne, mais une poignée de paramètres modifient ce que vous obtenez en retour.
- Instruction système. Définissez une persona ou un ensemble de règles qui s'appliquent à toute la conversation, distinctes de l'invite utilisateur. Utilisez-la pour "Répondre uniquement en JSON" ou "Vous êtes un réviseur de code laconique". Elle guide le ton et le format de manière bien plus fiable que de fourrer des instructions dans chaque message.
- Tokens de sortie maximum. Limitez la longueur de la réponse. 3.6 Flash peut produire jusqu'à 64k tokens de sortie, donc augmentez la limite pour les générations longues et diminuez-la lorsque vous voulez contrôler le coût et la latence.
- Entrées multimodales. Le modèle lit le texte, les images, la vidéo, l'audio et les PDF dans le même appel. Vous les ajoutez comme entrées supplémentaires dans le tableau
partsà côté de votre texte. La sortie est uniquement du texte, il faut donc penser à cela comme à de nombreux types d'entrées, pour des mots en sortie. La fenêtre contextuelle peut contenir jusqu'à 1 million de tokens d'entrée, ce qui laisse de la place pour un long PDF ou une transcription vidéo complète. - Réflexion et raisonnement. 3.6 Flash raisonne avant de répondre aux invites difficiles. C'est ce qui améliore le travail en plusieurs étapes, et c'est la raison pour laquelle le prix de sortie inclut les tokens de réflexion (plus d'informations à ce sujet dans la section suivante). Vous pouvez ajuster l'effort de raisonnement lorsque vous souhaitez échanger la profondeur contre la vitesse.
La liste complète des paramètres se trouve dans la documentation de l'API Gemini. N'inventez pas les noms de champs ; la documentation est la source de vérité, et elle est mise à jour en même temps que l'API.
Tarification et niveau gratuit
Gemini 3.6 Flash coûte 1,50 $ par million de tokens d'entrée et 7,50 $ par million de tokens de sortie. Ce taux de sortie est une réduction par rapport aux 9,00 $ facturés par 3.5 Flash, et 3.6 Flash a également tendance à générer environ 17 % de tokens de sortie en moins pour la même tâche, donc les économies se cumulent. Un détail à intégrer : le prix de sortie inclut les tokens de réflexion. Le raisonnement interne du modèle est facturé au taux de sortie, donc une invite qui déclenche un raisonnement intense peut coûter plus cher que ne le suggère la longueur visible de la réponse. Prévoyez-le. Nous détaillons tous les calculs dans notre guide de tarification de Gemini 3.6 Flash.
Le niveau gratuit fonctionne via AI Studio, et il est réel, mais il est soumis à des limites de débit : un nombre plafonné de requêtes par minute et par jour, et Google peut utiliser les données du niveau gratuit pour améliorer ses produits. Il est conçu pour le prototypage, pas pour le trafic de production. Pour l'apprentissage et les tests, c'est largement suffisant. Pour voir jusqu'où cela s'étend, lisez comment utiliser Gemini 3.6 Flash gratuitement. Lorsque vous dépassez cette limite, vous activez la facturation et la même clé continue de fonctionner, sans aucune modification de code nécessaire.
Tester et déboguer l'API Gemini dans Apidog
curl prouve que l'appel fonctionne une fois. Il ne vous dira pas quand Google modifie un champ de réponse, quand votre clé expire ou quand un déploiement casse discrètement la requête. Pour cela, vous avez besoin d'un test enregistré et reproductible. C'est là qu'Apidog gagne sa place dans le flux de travail.
Apidog est une plateforme client API et de test. Voici le déroulement pour l'appel Gemini, du début à la fin :
- Créez la requête. Ajoutez une nouvelle requête POST avec l'URL
https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent. Collez le corps JSON précédent dans le corps de la requête. - Stockez la clé dans une variable d'environnement. Ajoutez une variable nommée
GEMINI_API_KEYà un environnement Apidog, puis référencez-la dans l'en-têtex-goog-api-keycomme{{GEMINI_API_KEY}}. Le secret reste en dehors de la requête partagée, et vous pouvez échanger les clés par environnement (dev, staging, prod) sans toucher à l'appel lui-même. - Ajoutez des assertions. Une fois la requête exécutée, faites des assertions sur la réponse JSON : le statut est 200, et
candidates[0].content.parts[0].textexiste et n'est pas vide. Maintenant, une exécution réussie signifie que l'API a réellement répondu, et pas seulement qu'elle a renvoyé quelque chose. - Enregistrez-le et planifiez-le. Conservez la requête dans une collection et planifiez-la comme test de régression. Exécutez-la à intervalles réguliers ou au sein de votre CI, et vous saurez au moment où l'appel Gemini cesse de fonctionner correctement, avant vos utilisateurs.
Téléchargez Apidog et vous pourrez exécuter ce test en quelques minutes. C'est la véritable adéquation ici : Apidog n'exécute pas le modèle, il s'assure que l'API dont dépend votre application continue de répondre comme prévu par votre application.
Erreurs courantes et correctifs
Trois types d'échecs couvrent la plupart de ce que vous rencontrerez au début.
- 401 Non autorisé (clé invalide). La clé est incorrecte, révoquée ou manquante dans l'en-tête. Vérifiez que
x-goog-api-keycontient la chaîne exacte d'AI Studio et que votre variable d'environnement a bien été résolue. Un espace en trop ou un{{GEMINI_API_KEY}}non étendu est généralement le coupable. - 429 Trop de requêtes (limite de débit). Vous avez atteint le plafond par minute ou par jour du niveau gratuit. Ralentissez le rythme des requêtes, ajoutez une nouvelle tentative avec un délai exponentiel, ou activez la facturation pour augmenter le plafond. Les boucles de test serrées déclenchent cela rapidement.
- 404 Introuvable (modèle introuvable). C'est presque toujours une faute de frappe dans l'ID du modèle. C'est
gemini-3.6-flash, exactement. Pasgemini-3.5-flash, pasgemini-flash-3.6. Le niveau Lite de cette même version estgemini-3.5-flash-lite, un modèle différent de la ligne 3.5, donc ne les confondez pas.
FAQ
Quel est l'ID de modèle exact pour Gemini 3.6 Flash ? C'est gemini-3.6-flash. Utilisez-le comme nom de modèle dans le SDK, et dans le chemin d'URL REST juste avant :generateContent.
L'API Gemini 3.6 Flash est-elle gratuite ? Il existe un niveau gratuit via AI Studio, mais il est soumis à des limites de débit. Il est suffisant pour le prototypage et l'apprentissage. Le trafic de production nécessite l'activation de la facturation. Pour plus de détails, consultez comment l'utiliser gratuitement.
Que puis-je envoyer au modèle ? Texte, images, vidéo, audio et PDF, jusqu'à une fenêtre contextuelle d'1M de tokens. La sortie est uniquement du texte.
Pourquoi ma facture est-elle plus élevée que ne le suggèrent les réponses visibles ? Le prix de sortie de 7,50 $ par million de tokens inclut les tokens de réflexion du modèle. Les invites nécessitant un raisonnement intensif sont facturées plus cher que ce qu'indique la longueur de la réponse à l'écran.
Est-ce la même chose que l'ancienne API Gemini 3.5 Flash ? La forme de l'appel est la même, donc si vous avez utilisé l'API Gemini 3.5, vous échangez l'ID du modèle et vous avez terminé. 3.6 Flash réduit le prix de sortie et utilise moins de tokens de sortie pour le même travail.
Puis-je utiliser la même clé dans curl, Python et Apidog ? Oui. Une seule clé d'AI Studio fonctionne pour tous. Gardez-la dans une variable d'environnement dans chaque outil plutôt que de la coder en dur, et vous pourrez la faire tourner ou la révoquer à un seul endroit.
Où aller à partir d'ici
Vous avez une clé, un appel fonctionnel en curl et Python, les paramètres importants, et un test de régression enregistré qui surveille le point de terminaison. Commencez par le niveau gratuit, conservez votre clé dans une variable d'environnement, et fiez-vous à la documentation officielle pour tout ce qui dépasse les bases. Lorsque l'appel devient quelque chose dont votre application dépend, encapsulez-le dans un test Apidog afin qu'une modification silencieuse de l'API n'atteigne jamais vos utilisateurs en premier.
bouton
