Gemini 3.7 Flash : Tarification Expliquée – Sécurisez Vos Tarifs Avant le Doublement

Tarification de Gemini 3.7 Flash : 0,75 $/3,75 $ par million de jetons jusqu'au 31 décembre 2026, après quoi les tarifs doublent. Consultez des exemples de coûts détaillés et cinq façons de réduire vos dépenses en jetons.

Ashley Innocent

Ashley Innocent

14 August 2026

Gemini 3.7 Flash : Tarification Expliquée – Sécurisez Vos Tarifs Avant le Doublement

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Google a lancé Gemini 3.7 Flash le 13 août 2026, trois semaines après 3.6 Flash, et le qualifie de « notre modèle de charge de travail le plus intelligent ». Pour quiconque surveille une facture d'API, le détail le plus important se trouve dans le tableau des prix, pas dans les benchmarks : le tarif de lancement de 0,75 $ par million de tokens d'entrée et 3,75 $ par million de tokens de sortie expire le 31 décembre 2026. À partir du 1er janvier 2027, les deux tarifs doublent.

C'est un doublement prévu (x2) pour chaque charge de travail que vous construisez sur ce modèle. Un chatbot qui coûte 790 $ par mois aujourd'hui coûtera 1 575 $ par mois en janvier sans aucun changement à votre code, votre trafic ou vos prompts. Donc, lorsque vous budgétisez un projet 3.7 Flash, modélisez les deux niveaux, et non le prix affiché.

Ce guide détaille les deux niveaux, le calcul des tokens pour trois charges de travail réelles, comment le prix se compare aux autres API de modèles, et où réduire les dépenses avant le doublement. Si vous n'avez pas encore envoyé de première requête, le guide de démarrage rapide de l'API Gemini 3.7 Flash couvre la configuration. Une fois que vous effectuez des appels, Apidog affiche les décomptes de tokens usageMetadata dans chaque réponse, de sorte que chaque estimation ci-dessous devient un chiffre que vous pouvez vérifier par rapport au trafic réel.

button

TL;DR

Les deux niveaux de prix

Gemini 3.7 Flash a été lancé avec une réduction à durée limitée plutôt qu'un prix permanent. Voici le tableau complet pour l'API Gemini :

Niveau Période Entrée (par million de tokens) Sortie (par million de tokens)
Lancement 13 août 2026 au 31 décembre 2026 $0.75 $3.75
Standard À partir du 1er janvier 2027 $1.50 $7.50

Deux choses se démarquent. Premièrement, le tarif de lancement est la moitié de ce que Gemini 3.6 Flash coûtait à son lancement, ce qui fait des quatre mois et demi à venir la période la moins chère que cette famille de modèles ait jamais connue. Si vous envisagez une mise à niveau depuis 3.6, le guide de migration de 3.6 vers 3.7 Flash couvre l'échange ; la réduction de prix à elle seule rentabilise les tests de régression.

Deuxièmement, les tokens de sortie coûtent 5 fois plus cher que les tokens d'entrée aux deux niveaux. Ce ratio influence chaque décision d'optimisation plus loin dans ce guide : réduire un prompt système verbeux économise quelques centimes, tandis que limiter une sortie excessive économise des dollars.

Les tarifs ci-dessus couvrent l'API Gemini facturée via une clé AI Studio. Vertex AI fonctionne via la facturation de Google Cloud avec ses propres SKU, et des fonctionnalités comme la mise en cache du contexte et le traitement par lots ont leurs propres postes de facturation. Par conséquent, confirmez les chiffres actuels sur la page officielle des tarifs avant d'engager un budget.

Ce que coûte une charge de travail réelle

Les prix par million de tokens ne signifient rien tant que vous ne les multipliez pas par le trafic. Voici trois profils de charge de travail avec les hypothèses énoncées, afin que vous puissiez y substituer vos propres chiffres.

Charge de travail 1 : un chatbot de support client

Supposons 10 000 requêtes par jour. Chaque requête contient environ 2 000 tokens d'entrée (prompt système, une courte fenêtre d'historique, le message utilisateur) et renvoie environ 300 tokens de sortie.

Poste Tokens quotidiens Coût/jour (lancement) Coût/jour (standard)
Entrée 20M $15.00 $30.00
Sortie 3M $11.25 $22.50
Total 23M $26.25 $52.50

C'est environ 788 $ par mois aux tarifs de lancement et 1 575 $ par mois aux tarifs standards sur un mois de 30 jours. Par tour de conversation, vous payez environ un quart de centime aujourd'hui.

Charge de travail 2 : un pipeline de documents PDF

Gemini 3.7 Flash lit les PDF nativement, et son score de benchmark GDP.pdf est passé de 22,0 % à 34,0 % par rapport à 3.6 Flash, donc l'extraction de documents est une charge de travail que Google s'attend à ce que vous exécutiez ici. Supposons 500 documents par jour, chacun avec une moyenne de 40 000 tokens d'entrée (un long contrat ou rapport), produisant un résumé structuré de 1 000 tokens.

Poste Tokens quotidiens Coût/jour (lancement) Coût/jour (standard)
Entrée 20M $15.00 $30.00
Sortie 0.5M $1.88 $3.75
Total 20.5M $16.88 $33.75

Environ 506 $ par mois maintenant, 1 013 $ à partir de janvier. Remarquez la forme : l'entrée domine parce que les documents sont longs et les résumés courts. La mise en cache et le traitement par lots ont le plus grand impact sur cette charge de travail.

Charge de travail 3 : une boucle d'agents

Les agents multiplient les appels. Supposons 200 tâches par jour, chacune avec une moyenne de 12 appels de modèle, où chaque appel contient 8 000 tokens d'entrée (le contexte croissant plus les résultats des outils) et renvoie 400 tokens de sortie.

Poste Tokens quotidiens Coût/jour (lancement) Coût/jour (standard)
Entrée 19.2M $14.40 $28.80
Sortie 0.96M $3.60 $7.20
Total 20.16M $18.00 $36.00

C'est 540 $ par mois aux tarifs de lancement, 1 080 $ au tarif standard. La leçon de la facturation des agents : le contexte se développe à chaque étape, de sorte que le nombre d'appels et la longueur du contexte se cumulent. Une tâche qui passe de 12 à 20 appels vous coûte 67 % de plus, et rien dans le tableau des prix ne vous avait prévenu.

Un autre chiffre à garder à l'esprit : la limite de sortie de 64 000 tokens plafonne votre pire scénario par appel à environ 0,24 $ aujourd'hui et 0,48 $ l'année prochaine. Une boucle de réessai qui maximise la sortie à chaque tentative devient rapidement coûteuse, mais elle ne peut pas devenir infiniment coûteuse.

Comparaison des tarifs de 3.7 Flash

Les comparaisons exactes de prix par token entre fournisseurs deviennent obsolètes en quelques semaines, alors considérez cela comme un positionnement, pas une grille tarifaire.

Gemini 3.7 Flash se situe dans la catégorie des modèles « chevaux de bataille » : bien moins cher que les modèles de pointe comme la gamme Pro de Gemini, les modèles plus grands de Claude ou le niveau phare d'OpenAI, tout en affichant des scores de benchmark (65,3 % sur DeepSWE v1.1, un Elo de 1588 sur WebDev Arena) qui chevauchent ce que les modèles phares affichaient il n'y a pas si longtemps. Le pari de Google est que la plupart du trafic de production n'a pas besoin d'un modèle de pointe, et la réduction de lancement est une invitation de quatre mois à tester cette affirmation sur votre propre charge de travail.

Le contexte concurrentiel est également important. Les fournisseurs de modèles à bas prix ont fait évoluer leurs tarifs dans l'autre direction ; DeepSeek a augmenté ses tarifs d'API et a poussé les équipes à repenser leurs budgets de tokens, une histoire couverte dans le guide d'augmentation des prix et d'optimisation des coûts de DeepSeek. La conclusion se transpose directement à Gemini : tout prix sur lequel vous construisez une marge peut changer, et Google vous a déjà communiqué la date et le montant. C'est plus d'avertissement que la plupart des fournisseurs n'en donnent.

Si votre trafic est irrégulier ou expérimental, rappelez-vous que le doublement n'affecte que les charges de travail soutenues. Un prototype qui coûte 3 $ pendant la période de lancement coûte 6 $ plus tard. Personne ne s'en soucie. Un pipeline de 10 000 $ par mois qui devient 20 000 $ est un poste que votre équipe financière interrogera en février.

Cinq façons de réduire les dépenses de tokens

Le rapport de prix de 5x entre les tokens de sortie et d'entrée et le doublement de janvier pointent vers le même ensemble de leviers.

Limitez les tokens de sortie par endpoint. Définissez maxOutputTokens dans generationConfig à la plus petite valeur dont chaque endpoint a besoin. Une réponse de support a rarement besoin de plus de 500 tokens ; laisser la limite par défaut à 64k signifie qu'une génération confuse peut coûter 100 fois plus cher qu'une génération normale. C'est le changement qui offre le meilleur rendement car les tokens de sortie ont un multiplicateur de 5x.

Mettez en cache votre contexte statique. Si chaque requête renvoie le même prompt système et document de politique de 3 000 tokens, vous payez le prix d'entrée complet pour des octets identiques des milliers de fois par jour. La mise en cache du contexte facture les tokens répétés à un tarif réduit ; consultez la documentation de l'API Gemini pour la configuration et les tarifs actuels de la mise en cache. Pour le chatbot ci-dessus, la mise en cache d'un préfixe statique de 1 500 tokens réduit la facture d'entrée de presque la moitié.

Traitez le travail non interactif par lots. Le pipeline de documents n'a pas besoin de réponses en moins d'une seconde. Le traitement par lots échange la latence contre un tarif réduit, et les exécutions de documents nocturnes sont exactement le type de trafic pour lequel il existe.

Adaptez la taille du modèle par route. Toutes les requêtes n'ont pas besoin de 3.7 Flash. Les tâches de classification, de routage et d'extraction courtes fonctionnent souvent très bien sur un modèle de niveau Flash-Lite pour une fraction du coût. Gardez 3.7 Flash pour les appels qui utilisent ce pour quoi vous payez : planification en plusieurs étapes, débogage, chaînes d'appels d'outils.

Prototyper sur le niveau gratuit. Le quota gratuit d'AI Studio est suffisant pour figer les prompts et les schémas de réponse avant qu'un seul token facturé ne soit consommé. Le guide d'accès gratuit à l'API Gemini couvre l'étendue du chemin gratuit et ses limites.

Suivez les dépenses par endpoint avec Apidog

Les estimations vous donnent un budget ; la mesure par requête vous permet de le respecter. Chaque réponse Gemini inclut un bloc usageMetadata avec les décomptes de tokens d'entrée et de sortie, ce qui signifie que votre couche de test d'API peut également servir de compteur de coûts.

Dans Apidog, le flux de travail ressemble à ceci :

  1. Enregistrez une requête par endpoint de production (tour de chat, résumé de document, étape d'agent) dans une collection, avec la clé API liée à une variable d'environnement GEMINI_API_KEY.
  2. Construisez un scénario de test qui déclenche chaque requête avec des charges utiles réalistes et extrait usageMetadata.promptTokenCount et usageMetadata.candidatesTokenCount de la réponse.
  3. Ajoutez des assertions sur ces décomptes. Si une modification de prompt pousse l'endpoint de chat au-delà, disons, de 2 500 tokens d'entrée, le scénario échoue avant que le changement ne soit déployé et augmente discrètement votre facture de 25 %.
  4. Réexécutez le scénario à chaque modification de prompt ou de schéma. Les décomptes de tokens régressent de la même manière que la latence ; la différence est que les régressions de tokens arrivent sous forme de facture.

Multipliez les décomptes mesurés par les prix des niveaux de ce guide et vous obtiendrez des chiffres de coût par endpoint basés sur des réponses réelles plutôt que des suppositions. Les équipes qui utilisent déjà des suites d'API basées sur des assertions reconnaîtront le schéma ; le guide de test d'API pour les ingénieurs QA explique comment structurer de tels scénarios pour un service entier.

FAQ

Quand les tarifs de Gemini 3.7 Flash doublent-ils ?

Le 1er janvier 2027. Le tarif de lancement de 0,75 $ par million de tokens d'entrée et 3,75 $ par million de tokens de sortie est valable jusqu'au 31 décembre 2026, puis passe au tarif standard de 1,50 $ et 7,50 $. Google a publié les deux niveaux lors du lancement, donc l'augmentation est prévue, et non spéculative.

Gemini 3.7 Flash est-il moins cher que Gemini 3.6 Flash ?

Au lancement, oui. Le prix de lancement de 3.7 Flash est la moitié du prix de lancement de 3.6 Flash, tandis que les benchmarks se sont améliorés dans l'ensemble (DeepSWE v1.1 est passé de 49,0 % à 65,3 %). Les spécifications complètes et les tableaux de benchmarks se trouvent dans la référence rapide de Gemini 3.7 Flash si vous souhaitez une comparaison côte à côte.

Le prix de lancement s'applique-t-il sur Vertex AI ?

Les tarifs de ce guide sont les tarifs de l'API Gemini facturés via une clé AI Studio. Vertex AI facture via Google Cloud avec ses propres SKU et conditions d'entreprise. Si vous exécutez du trafic de production sur Vertex, confirmez les chiffres actuels dans votre console de facturation GCP et sur la page officielle des tarifs au lieu de supposer une parité.

Qu'est-ce qui est comptabilisé dans la facture des tokens d'entrée ?

Tout ce que vous envoyez : texte, images, vidéo, audio et pages PDF sont tous convertis en tokens et facturés au tarif d'entrée. Les documents longs et les requêtes riches en médias sont les endroits où les coûts d'entrée surprennent les gens, c'est pourquoi l'exemple de pipeline ci-dessus suppose 40 000 tokens par document. Le bloc usageMetadata dans chaque réponse vous indique le décompte exact après coup.

Comment estimer les tokens avant d'envoyer une requête ?

Utilisez l'endpoint countTokens de l'API pour mesurer une charge utile sans rien générer, ou envoyez une poignée de requêtes représentatives et lisez usageMetadata à partir des réponses. Dans les deux cas, mesurez avec des charges utiles réelles. L'intuition des tokenizers d'autres fournisseurs se transpose mal entre les familles de modèles.

Où 3.7 Flash s'intègre dans votre pile

Gemini 3.7 Flash, avec son tarif de lancement, est le modèle le plus capable qui ait jamais été aussi bon marché, et Google vous a indiqué la date exacte à laquelle cela ne sera plus vrai. La stratégie rationnelle : déplacez votre trafic de travail sur ce modèle dès maintenant, mesurez la consommation réelle de tokens par endpoint pendant que la réduction est active, et utilisez ces quatre mois de données pour décider ce qui reste sur 3.7 Flash, ce qui passe à un modèle plus léger, et à quoi ressemblera la facture au tarif standard avant qu'elle n'arrive.

La partie mesure de ce plan nécessite des outils. Téléchargez Apidog pour conserver vos requêtes Gemini, environnements, assertions de tokens et vérifications de coûts dans un seul espace de travail, afin que la facture de janvier soit un chiffre que vous avez prédit plutôt qu'un que vous découvrez.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API