Gemini 3.6 Flash est le nouveau modèle de prédilection de Google. Il a été mis à la disposition générale le 21 juillet 2026, et il est moins cher et plus efficace en termes de jetons que le Gemini 3.5 Flash qu'il remplace. Si vous envoyez un trafic API important et que vous souhaitez une qualité solide sans payer les prix des modèles phares, c'est le niveau que Google a conçu pour vous.
Ce guide couvre ce qu'est le modèle, ce qui a changé par rapport à la version précédente, les spécifications complètes, ses performances sur les benchmarks, son coût et comment y accéder. Vous verrez également comment envoyer et tester vous-même l'appel API par régression, afin que les chiffres des pages de Google correspondent à ce que vous obtenez réellement.
Qu'est-ce que Gemini 3.6 Flash ?
Gemini 3.6 Flash est le modèle de milieu de gamme à haut débit de la famille Gemini de Google. "Modèle de prédilection" est le mot juste pour le décrire. Le modèle est optimisé pour les tâches quotidiennes qui constituent l'essentiel du trafic de production : résumé, extraction, classification, chat et appels d'outils multi-étapes. Il est rapide, abordable et lit le texte, les images, la vidéo, l'audio et les PDF en un seul appel.

Google l'a lancé comme l'un des trois modèles le 21 juillet 2026. Les deux autres sont Gemini 3.5 Flash-Lite, un niveau moins cher et plus rapide pour les travaux à volume élevé, et Gemini 3.5 Flash Cyber, un modèle de sécurité cloisonné auquel seuls les gouvernements et les partenaires de confiance peuvent accéder. Vous pouvez lire l'analyse complète du niveau bon marché dans notre explication qu'est-ce que Gemini 3.5 Flash-Lite, et celle du modèle de sécurité cloisonné dans qu'est-ce que Gemini 3.5 Flash Cyber.

Voici ce qui déroute les gens : le versioning est mixte. Le modèle de prédilection est passé à la version 3.6, mais Flash-Lite et Flash Cyber sont restés à la version 3.5. Ainsi, "les nouveaux modèles Flash" n'ont pas tous le même numéro de version. Lorsque vous choisissez un ID de modèle, lisez-le attentivement. gemini-3.6-flash et gemini-3.5-flash-lite sont des niveaux différents, pas une faute de frappe.
Google a publié l'annonce sur le blog de Google, et la fiche du modèle se trouve sur la page Flash de DeepMind.
Quoi de neuf par rapport à Gemini 3.5 Flash
Le changement majeur est l'efficacité. Gemini 3.6 Flash utilise environ 17 % moins de jetons de sortie que 3.5 Flash pour accomplir le même travail. Moins de jetons signifie des factures moins élevées et des réponses plus rapides, car les jetons de sortie sont ce pour quoi vous payez le plus et ce qui prend le plus de temps à être diffusé.
Google a également réduit le prix de la sortie. Avec 3.5 Flash, vous payiez 9,00 $ par million de jetons de sortie. Avec 3.6 Flash, vous payez 7,50 $. Ajoutez cette réduction de prix aux économies de jetons et le coût effectif par tâche diminue plus que ce que les chiffres bruts ne le suggèrent.
Le modèle est également meilleur en matière de codage et d'utilisation de l'ordinateur, et il parvient à des réponses en moins d'étapes de raisonnement et moins d'appels d'outils sur les workflows multi-étapes. C'est important pour les agents. Chaque boucle de raisonnement et chaque appel d'outil supplémentaire ajoutent de la latence et des coûts, donc les réduire rend les exécutions d'agents moins chères et plus rapides du début à la fin.
Si vous décidez de migrer le trafic existant, nous examinons les compromis dans Gemini 3.6 Flash vs 3.5 Flash.
Spécifications de Gemini 3.6 Flash
| Attribut | Gemini 3.6 Flash |
|---|---|
| ID du modèle | gemini-3.6-flash |
| Fenêtre de contexte d'entrée | 1M jetons |
| Sortie maximale | 64k jetons |
| Modalités d'entrée | Texte, image, vidéo, audio, PDF |
| Sortie | Texte seulement |
| Prix d'entrée | 1,50 $ par 1M jetons |
| Prix de sortie | 7,50 $ par 1M jetons (inclut les jetons de réflexion) |
| Niveau gratuit | Oui, via Google AI Studio (limité en débit) |
| Lancé le | 21 juillet 2026 |
Deux chiffres méritent d'être notés. La fenêtre de contexte d'entrée de 1M signifie que vous pouvez alimenter le modèle avec de grands documents, de longues transcriptions ou des bases de code entières en une seule requête. La limite de sortie maximale de 64k est le plafond d'une seule réponse, donc si vous avez besoin de générer des textes de la taille d'un livre, vous devrez découper le travail en plusieurs appels.
Ses performances
Les benchmarks sont des indicateurs, pas des promesses, mais ils vous indiquent les points forts d'un modèle. Voici comment Gemini 3.6 Flash se positionne sur les suites publiques rapportées par Google.
En matière de codage, il atteint 58,7 % sur SWE-Bench Pro, un test qui vérifie si un modèle peut résoudre de véritables problèmes GitHub dans des dépôts de production. Il obtient 49 % sur DeepSWE v1.1, un autre benchmark d'ingénierie logicielle. Sur Terminal-bench 2.1, qui mesure l'exécution de commandes dans un terminal réel, il atteint 78,0 %.
L'utilisation de l'ordinateur est là où le bond est le plus visible. Sur OSWorld-Verified, qui évalue un modèle pilotant un bureau et ses applications, 3.6 Flash atteint 83,0 %, contre 78,4 % sur 3.5 Flash. C'est un gain significatif pour quiconque crée des agents qui interagissent avec de véritables interfaces.
En termes de qualité générale, il affiche un score Elo GDPVal-AA v2 de 1421. GDPVal mesure les performances sur des tâches professionnelles réelles, et le score Elo évalue les modèles en confrontation directe, comme les classements aux échecs, donc un nombre plus élevé signifie qu'il gagne plus de confrontations.
Le contexte long est un tableau mitigé, et il convient d'être honnête à ce sujet. À 128k jetons, le modèle atteint en moyenne 91,8 % en matière de récupération, ce qui est solide. Si l'on pousse vers la fenêtre complète de 1M de jetons avec une récupération ponctuelle, la précision chute à 54,0 %. En clair, le modèle reste performant sur de grandes entrées, mais ne présumez pas d'un rappel parfait lorsque vous remplissez toute la fenêtre contextuelle. Testez votre propre récupération à la longueur que vous utilisez réellement.
Tarification en un coup d'œil
Gemini 3.6 Flash coûte 1,50 $ par million de jetons d'entrée et 7,50 $ par million de jetons de sortie. Le prix de sortie inclut les jetons de réflexion, de sorte que le raisonnement que vous ne voyez jamais dans la réponse finale est tout de même facturé. La mise en cache contextuelle coûte 0,15 $ par million de jetons plus 1,00 $ par million de jetons par heure de stockage, ce qui est utile lorsque vous envoyez le même grand prompt à plusieurs reprises.
Un niveau gratuit est disponible via Google AI Studio. Il est limité en débit, et Google peut utiliser les données du niveau gratuit pour améliorer ses produits, il est donc destiné au prototypage, pas à la production. Nous couvrons les limites et les détails dans comment utiliser Gemini 3.6 Flash gratuitement, et la répartition complète des coûts avec des exemples détaillés dans la tarification de Gemini 3.6 Flash. Les chiffres de Google se trouvent sur la page de tarification de l'API Gemini.
Comment accéder à Gemini 3.6 Flash
- API Gemini via Google AI Studio. Obtenez une clé et vous pourrez appeler
gemini-3.6-flashdepuis n'importe quel client REST ou SDK. Android Studio l'intègre également pour le développement d'applications. - Google Antigravity, la surface de développement d'agents de Google, met le modèle à disposition.
- Plateforme d'agents d'entreprise Gemini pour les équipes créant des agents gouvernés au travail.
- L'application Gemini si vous voulez simplement discuter directement avec elle.
Pour la plupart des développeurs, l'API est la voie la plus importante. Nous avons un guide étape par étape dans comment utiliser l'API Gemini 3.6 Flash, et si vous venez d'une version plus ancienne, notre guide de l'API Google Gemini 3 couvre toujours la structure des requêtes et l'authentification. La référence officielle se trouve sur ai.google.dev.
Où il se positionne dans la gamme de Google
Considérez la mise à jour Flash comme une échelle coût-qualité. Gemini 3.5 Flash-Lite se situe en dessous de 3.6 Flash : il est moins cher, à 0,30 $ d'entrée et 2,50 $ de sortie par million de jetons, et il est rapide, à environ 350 jetons de sortie par seconde. Utilisez Flash-Lite pour les tâches à volume élevé et sensibles à la latence où vous n'avez pas besoin de la qualité maximale du modèle de prédilection. Optez pour 3.6 Flash lorsque la tâche est plus difficile ou que la sortie doit être plus fiable.
Maintenant, les avertissements honnêtes. Gemini 3.5 Pro n'est pas encore sorti. Google affirme qu'il est toujours en phase de test avec des partenaires, il n'y a donc pas de modèle Pro public dans cette vague, et la plupart des articles ont souligné cette lacune. Google a également évoqué une pré-formation de Gemini 4, la qualifiant de la plus ambitieuse à ce jour, mais annoncer n'est pas livrer. Aucun des deux n'est quelque chose que vous pouvez appeler aujourd'hui. Si vous avez besoin d'un modèle phare de pointe en ce moment, 3.6 Flash n'est pas celui-là. C'est un modèle de milieu de gamme rapide conçu pour être bon marché et rapide à grande échelle, et c'est exactement ce qu'il offre.
Pour la génération précédente, notre explication qu'est-ce que Gemini 3.5 vous donne la base sur laquelle ces modèles s'améliorent.
Tester Gemini 3.6 Flash dans Apidog
Les pages des modèles citent les chiffres optimaux. La seule façon de savoir ce que 3.6 Flash renvoie pour vos invites, à la longueur de votre contexte, est d'envoyer l'appel et de vérifier la réponse. C'est là qu'un client API prouve son utilité.
Apidog est un client et une plateforme de test d'API, et il traite le point de terminaison Gemini comme n'importe quel autre appel REST. Voici une configuration simple :
- Créez une requête
POSTvers le point de terminaison de l'API Gemini et définissez le modèle surgemini-3.6-flash. - Stockez votre clé API dans une variable d'environnement Apidog au lieu de la coller dans l'URL. Vous pourrez ensuite basculer entre une clé de test et une clé de production sans modifier la requête.
- Envoyez l'appel et lisez la réponse. Ajoutez des assertions sur le code de statut et les champs JSON qui vous intéressent, afin qu'une charge utile incorrecte ou un changement de schéma échoue bruyamment au lieu de passer inaperçu.
- Enregistrez-le comme test de régression et planifiez son exécution afin de détecter tout changement de forme de réponse ou de latence après une mise à jour du modèle.
Soyez clair sur ce que cela fait et ne fait pas. Apidog n'exécute pas le modèle et n'est pas un framework d'IA. C'est l'outil que vous utilisez pour construire la requête, l'envoyer et maintenir la réponse à une norme que vous avez définie. Lorsque Google livrera la prochaine mise à jour de Flash, vos tests enregistrés vous diront en quelques minutes si quelque chose sur lequel vous comptez a bougé. Téléchargez Apidog si vous souhaitez configurer cette première requête.
FAQ
Gemini 3.6 Flash est-il gratuit ? Un niveau gratuit est disponible via Google AI Studio, mais il est limité en débit et destiné au prototypage. Google peut utiliser les données du niveau gratuit pour améliorer ses produits. Pour le trafic de production, vous payez par jeton : 1,50 $ par million d'entrée, 7,50 $ par million de sortie.
Gemini 3.6 Flash est-il meilleur que 3.5 Flash ? Pour la plupart des tâches, oui. Il utilise environ 17 % moins de jetons de sortie, le prix de sortie est passé de 9,00 $ à 7,50 $ par million, et il est plus performant en codage et en utilisation de l'ordinateur, y compris un bond à 83,0 % sur OSWorld-Verified contre 78,4 %. Il remplace 3.5 Flash en tant que modèle de prédilection par défaut.
Gemini 3.5 Pro est-il sorti ? Non. Google affirme qu'il est toujours en phase de test de 3.5 Pro avec des partenaires, il n'y a donc pas de modèle Pro public dans cette version. Une pré-formation de Gemini 4 a été évoquée mais non livrée.
Quel est l'ID du modèle ? C'est gemini-3.6-flash. Ne le confondez pas avec gemini-3.5-flash-lite, qui est le niveau Flash-Lite moins cher avec un numéro de version différent.
Que ne peut pas faire Gemini 3.6 Flash ? Il ne produit que du texte, il ne générera donc pas d'images, d'audio ou de vidéo même s'il peut les lire en entrée. Son rappel diminue vers la fin de la fenêtre de 1M de jetons, autour de 54,0 % sur la récupération ponctuelle à pleine longueur. Et c'est un modèle de prédilection de milieu de gamme, pas un modèle phare de pointe, alors choisissez le bon niveau pour un raisonnement vraiment difficile.
Gemini 3.6 Flash est le modèle sur lequel la plupart du trafic de l'API Gemini devrait désormais fonctionner : plus abordable, plus efficace en termes de jetons, et meilleur pour les tâches agentiques que la version qu'il remplace. Confirmez les éléments dont vous dépendez avec quelques tests API enregistrés avant de migrer à grande échelle. Lorsque Flash-Lite, Cyber, ou les éventuels Pro et Gemini 4 arriveront, vous saurez exactement ce qui a changé dans vos propres réponses.
