Gemini 3.6 Flash coûte 1,50 $ par million de jetons d'entrée et 7,50 $ par million de jetons de sortie. C'est moins cher que le modèle qu'il remplace. Google a lancé cette mise à jour le 21 juillet 2026, et pour quiconque surveille une facture d'API, le titre est simple : le niveau Flash, le modèle le plus utilisé, est devenu plus rapide et moins cher en même temps.
Ce guide détaille chaque chiffre dont vous avez besoin pour établir votre budget : les tarifs par jeton, ce qu'ajoute la mise en cache de contexte, ce que couvre le niveau gratuit, et un exemple détaillé pour que vous puissiez prévoir vos dépenses mensuelles avant d'écrire une ligne de code. Chaque chiffre ici provient des propres documents de tarification de l'API Gemini de Google et de l'annonce de lancement. Si vous souhaitez d'abord un aperçu complet du modèle, lisez qu'est-ce que Gemini 3.6 Flash.
Une note de dénomination avant les chiffres. Le modèle le plus utilisé est passé à la version 3.6, mais le niveau Flash-Lite, moins cher, reste à la version 3.5. Même lancement, versionnement mixte. Gardez cela à l'esprit et les prix s'aligneront clairement.
Tarification de Gemini 3.6 Flash en un coup d'œil
| Élément | Coût |
|---|---|
| Entrée | 1,50 $ par million de jetons |
| Sortie (inclut les jetons de réflexion) | 7,50 $ par million de jetons |
| Mise en cache de contexte, lecture d'entrée mise en cache | 0,15 $ par million de jetons |
| Mise en cache de contexte, stockage | 1,00 $ par million de jetons par heure |
| Niveau gratuit | Oui, via Google AI Studio (limité en débit) |
Deux choses à signaler d'emblée. Le prix de sortie inclut les jetons de réflexion, donc le raisonnement effectué par le modèle avant de répondre est facturé au tarif de sortie de 7,50 $, et non sur une ligne distincte. Et la mise en cache de contexte comporte deux parties : un faible coût de lecture pour l'entrée mise en cache, plus des frais de stockage horaires tant que vous maintenez le cache actif. La mise en cache permet d'économiser de l'argent sur le contexte répété, mais elle n'est pas gratuite, donc les économies n'apparaissent que si vous réutilisez fréquemment le même préfixe d'invite.
Comparaison avec Gemini 3.5 Flash
Le tarif de sortie est passé de 9,00 $ par million de jetons sur 3.5 Flash à 7,50 $ sur 3.6 Flash. Cela représente à lui seul environ 17 % de moins par jeton de sortie.
L'information principale est ce que Google rapporte sur la page du modèle DeepMind Flash : 3.6 Flash produit environ 17 % moins de jetons de sortie pour la même tâche. Il raisonne en moins d'étapes et effectue moins d'appels d'outils sur les tâches multi-étapes. Vous payez donc un tarif inférieur sur un plus petit nombre de jetons. Les deux effets se cumulent, ce que nous allons illustrer avec des calculs réels ci-dessous.
Si vous budgétisez encore par rapport à l'ancien modèle, la répartition des prix de Gemini 3.5 Flash mérite une lecture comparative. Pour une comparaison complète des fonctionnalités et des performances, consultez Gemini 3.6 Flash vs 3.5 Flash. En bref pour votre portefeuille : 3.6 Flash coûte moins cher à exécuter que le modèle qu'il remplace, et l'écart se creuse sur les charges de travail plus longues et autonomes où les économies de jetons s'accumulent.
Ce que le niveau gratuit vous offre
Il existe un véritable niveau gratuit, disponible via Google AI Studio. Vous pouvez appeler Gemini 3.6 Flash sans carte de crédit et prototyper gratuitement.
Soyez honnête avec vous-même concernant les limites. Le niveau gratuit est limité en débit, il est donc conçu pour le prototypage et les tests légers, pas pour le trafic de production. Et Google peut utiliser les données du niveau gratuit pour améliorer ses produits. Cela signifie que le niveau gratuit n'est pas l'endroit approprié pour les données sensibles, propriétaires ou clients. Lorsque vous passez à quelque chose de réel, utilisez une clé payante où ces conditions d'utilisation des données ne s'appliquent pas.
Pour un guide complet sur ce que le niveau gratuit permet et comment le configurer, consultez comment utiliser Gemini 3.6 Flash gratuitement. Il n'y a pas d'option "gratuit illimité" ici, alors prévoyez de passer à une utilisation payante une fois que vous aurez déployé votre solution.
Un exemple de coût détaillé
Imaginons que vous utilisez un agent qui lit beaucoup et écrit peu : 2 millions de jetons d'entrée et 500 000 jetons de sortie par jour. C'est une configuration réaliste pour un assistant axé sur la récupération d'informations qui extrait des documents et renvoie des réponses courtes.
Voici la facture quotidienne avec Gemini 3.6 Flash :
- Entrée : 2 millions de jetons multipliés par 1,50 $ par million = 3,00 $
- Sortie : 500 000 jetons multipliés par 7,50 $ par million = 3,75 $
- Total quotidien : 6,75 $
- Mensuel (30 jours) : environ 202,50 $
Maintenant, la capitalisation. Supposons que la même tâche sur 3.5 Flash ait émis 600 000 jetons de sortie. Sur 3.6 Flash, la réduction de 17 % ramène ce chiffre à environ 500 000, ce que nous avons budgétisé ci-dessus. Comparons uniquement la ligne de sortie :
- Sortie 3.5 Flash : 600 000 multipliés par 9,00 $ par million = 5,40 $ par jour
- Sortie 3.6 Flash : 500 000 multipliés par 7,50 $ par million = 3,75 $ par jour
C'est 1,65 $ de moins par jour, soit environ 49,50 $ par mois, uniquement du côté de la sortie. La facture de sortie diminue d'environ 31 %, même si la baisse de prix et la réduction des jetons ne sont chacune que d'environ 17 %. Des jetons moins chers multipliés par moins de jetons, c'est là que résident les véritables économies.
Flash-Lite est encore moins cher
Si votre tâche est simple, il existe un niveau inférieur au modèle le plus utilisé. Gemini 3.5 Flash-Lite coûte 0,30 $ par million de jetons d'entrée et 2,50 $ par million de jetons de sortie, avec une mise en cache à 0,03 $ par million plus les mêmes frais de stockage de 1,00 $ par million par heure. Il est également rapide, produisant environ 350 jetons de sortie par seconde.
Exécutez la même charge de travail de 2 millions de jetons d'entrée et 500 000 de sortie sur Flash-Lite et la facture quotidienne sera d'environ 1,85 $, soit environ 55,50 $ par mois. C'est environ 70 % moins cher que 3.6 Flash pour des nombres de jetons identiques.
Le hic, c'est la qualité. Flash-Lite est optimisé pour les tâches à volume élevé et à faible complexité : classification, extraction, routage, réponses courtes et structurées. Ce n'est pas une version plus faible de la même chose ; c'est un point différent sur la courbe coût, qualité et latence. Optez pour lui lorsque la tâche est simple et le volume élevé, et gardez 3.6 Flash pour les raisonnements plus complexes. Pour une vue d'ensemble complète, lisez qu'est-ce que Gemini 3.5 Flash-Lite, puis Gemini 3.5 Flash-Lite vs 3.6 Flash pour choisir le bon niveau par route.
Comment contrôler et mesurer vos coûts
Quatre leviers permettent de réduire la facture :
- Mettez en cache le contexte répété. Si chaque requête partage une longue invite système ou les mêmes documents de référence, la mise en cache de contexte facture 0,15 $ par million pour les lectures mises en cache au lieu de 1,50 $. N'oubliez pas les frais de stockage de 1,00 $ par million par heure, donc la mise en cache est rentable si vous réutilisez fréquemment le préfixe dans l'heure, et non une seule fois.
- Élaguez les invites. La sortie coûte cinq fois le prix de l'entrée, mais une entrée gonflée s'accumule tout de même à grande échelle. Supprimez le texte passe-partout et limitez le nombre maximal de jetons de sortie afin qu'une réponse incontrôlable ne vous surprenne pas.
- Dirigez les tâches simples vers Flash-Lite. Envoyez la classification et l'extraction vers le niveau le moins cher et réservez 3.6 Flash pour le raisonnement en plusieurs étapes. Le routage mixte est souvent plus efficace que de choisir un seul modèle pour tout.
- Mesurez l'utilisation réelle des jetons. Les estimations sont trompeuses. Le champ
usageMetadatadans chaque réponse Gemini vous indique exactement combien de jetons d'entrée, de sortie et de réflexion un appel a consommé, et c'est ce chiffre qui sert de base à votre facture.
Ce dernier point est l'endroit où un client API prouve sa valeur. Dans Apidog, vous pouvez construire la requête POST vers l'API Gemini, stocker votre clé dans une variable d'environnement, et envoyer de véritables appels avec vos invites réelles. Lisez les champs usageMetadata directement depuis la réponse pour voir le nombre réel de jetons par requête, puis ajoutez des assertions afin qu'un changement d'invite qui double les jetons de sortie échoue à un test au lieu de doubler silencieusement votre facture. Vous pouvez même planifier ces tests d'API pour qu'ils s'exécutent régulièrement et détecter les régressions de coûts précocement. Vous voulez suivre ? Téléchargez Apidog et dirigez une requête vers le point d'accès Gemini avant de l'intégrer en production.
FAQ
Combien coûte Gemini 3.6 Flash par million de jetons ? 1,50 $ pour l'entrée et 7,50 $ pour la sortie. Les lectures de mise en cache de contexte coûtent 0,15 $ par million, avec des frais de stockage de 1,00 $ par million par heure.
Le prix de sortie inclut-il les jetons de réflexion ? Oui. Le raisonnement effectué par le modèle avant de répondre est facturé au tarif de sortie de 7,50 $. Il n'y a pas de frais distincts pour les jetons de réflexion, mais ils sont pris en compte dans votre total de sortie, donc plus de raisonnement signifie une facture plus élevée.
Existe-t-il réellement un niveau gratuit ? Oui, via Google AI Studio, et il est limité en débit. Il est destiné au prototypage et aux tests, pas à la production. Google peut utiliser les données du niveau gratuit pour améliorer ses produits, donc conservez les données sensibles sur une clé payante.
Gemini 3.6 Flash est-il moins cher que 3.5 Flash ? Oui. Le tarif de sortie est passé de 9,00 $ à 7,50 $, et 3.6 Flash utilise environ 17 % moins de jetons de sortie pour la même tâche. Les deux effets se cumulent, de sorte que la facture de sortie réelle peut baisser d'environ 31 %.
Quand devrais-je utiliser Flash-Lite à la place ? Lorsque la tâche est simple et que le volume est élevé. À 0,30 $ pour l'entrée et 2,50 $ pour la sortie, Flash-Lite est environ 70 % moins cher pour les mêmes nombres de jetons, et il est rapide, mais 3.6 Flash gère mieux les raisonnements plus complexes.
Gemini 3.6 Flash est une rare mise à jour tarifaire où le prix a baissé et le modèle s'est amélioré en même temps. Prévoyez-le à 1,50 $ en entrée et 7,50 $ en sortie, rappelez-vous que les jetons de réflexion sont inclus dans le tarif de sortie, et appuyez-vous sur la mise en cache ainsi que sur le routage vers Flash-Lite pour réduire le reste. Pour un contexte historique sur l'évolution des coûts de l'API Gemini à travers les versions, la ventilation des coûts de l'API Gemini 3.0 est un point de référence utile. Ensuite, mesurez vos propres appels dans Apidog afin que les nombres de jetons que vous prévoyez soient ceux que vous payez réellement.
