Gemini 3.8 Flash coûte 0,75 $ par million de jetons d'entrée et 3,75 $ par million de jetons de sortie, soit le même tarif de lancement que Google avait fixé pour 3.7 Flash. Ce tarif est valable jusqu'au 31 décembre 2026. Le 1er janvier 2027, il doublera pour atteindre 1,50 $ et 7,50 $, et le même doublement s'appliquera à 3.6 Flash et 3.7 Flash le même jour. Rien concernant le prix par jeton n'a changé avec cette version.
Ce qui a changé, c'est le nombre de jetons que le modèle utilise. Google affirme que 3.8 Flash « travaille plus dur » : il effectue plus d'étapes de raisonnement, appelle des outils de manière itérative, et « peut utiliser plus de jetons sur des tâches plus longues et plus complexes, par conception ». Artificial Analysis a mesuré l'effet de manière indépendante : l'exécution de son Intelligence Index a coûté 0,58 $ par tâche sur 3.8 Flash en mode de réflexion élevé contre 0,40 $ sur 3.7 Flash, avec environ 30 % de jetons de sortie supplémentaires par tâche. Même prix affiché, facture plus élevée.
Ce guide parcourt chaque ligne de la page officielle des tarifs de l'API Gemini, propose un exemple de 1 000 tâches par jour à chaque niveau de réflexion, et compare le tarif à celui de Flash-Lite, Claude Sonnet 5 et GPT-5.6 Luna. Pour un aperçu du modèle, commencez par ce qu'est Gemini 3.8 Flash.
Tarifs Gemini 3.8 Flash en un coup d'œil
Tous les prix sont par million de jetons sur le niveau payant.
| Tarif | Intro (jusqu'au 31 déc. 2026) | Standard (à partir du 1er janv. 2027) |
|---|---|---|
| Entrée (texte, image, vidéo, audio, PDF) | 0,75 $ | 1,50 $ |
| Sortie (inclut les jetons de réflexion) | 3,75 $ | 7,50 $ |
| Lecture du cache de contexte | 0,075 $ | 0,15 $ |
| Stockage du cache (par 1M de jetons par heure) | 0,50 $ | 1,00 $ |
| Entrée API de lot (50 % de réduction) | 0,375 $ | 0,75 $ |
| Sortie API de lot (50 % de réduction) | 1,875 $ | 3,75 $ |
| Ancrage Google Search | 5 000 requêtes gratuites/mois partagées entre Gemini 3.x, puis 14 $ pour 1 000 | Idem |
| Niveau gratuit | 0 $, avec limites de débit, données utilisées pour améliorer les produits Google | Idem |
Trois détails importent plus que les chiffres principaux. La tarification de sortie couvre les jetons de réflexion, donc le raisonnement interne est facturé à 3,75 $, et non à 0,75 $. Le tarif de lancement a une date de fin ferme. Et les lignes 3.7 Flash et 3.6 Flash subissent le même doublement au 1er janvier, donc un Flash plus ancien ne vous protège pas de l'augmentation. Le détail des prix de 3.7 Flash couvre les mêmes tarifs sur un modèle qui utilise moins de jetons par tâche.
Les jetons de réflexion sont des jetons de sortie
Gemini 3.8 Flash raisonne avant de répondre, et chaque jeton de ce raisonnement est mesuré comme de la sortie. L'API rapporte le nombre comme usageMetadata.thoughtsTokenCount dans une réponse generateContent, distinct de candidatesTokenCount (la réponse visible) et promptTokenCount (votre entrée). Les deux catégories de sortie sont facturées au même tarif de 3,75 $.
Vous contrôlez la quantité avec thinking_level : low (faible), medium (moyen) ou high (élevé). Sur 3.8 Flash, la valeur par défaut est medium, et non high comme sur Gemini 3 Pro. minimal a disparu et renvoie une erreur de validation, donc toute configuration héritée de modèles précédents doit mapper cette valeur à low. La documentation de Google sur la réflexion décrit les niveaux comme un effort relatif, et non un budget de jetons, vous ne pouvez donc pas plafonner les jetons de réflexion directement comme l'ancien entier thinking_budget le permettait. L'impact de chaque niveau sur la latence et le coût est détaillé dans le guide des niveaux de réflexion de 3.8 Flash.
Une illustration rapide avec des tailles fictives mais réalistes. Supposons qu'une requête envoie 10 000 jetons d'entrée et reçoit en retour 2 000 jetons de sortie visibles plus 6 000 jetons de réflexion. Aux tarifs de lancement :
- Entrée : 10 000 x 0,75 $ / 1 000 000 = 0,0075 $
- Sortie : (2 000 + 6 000) x 3,75 $ / 1 000 000 = 0,03 $
- Total : 0,0375 $ par requête
La réflexion représente 75 % du coût de sortie et 60 % de la requête totale. À partir du 1er janvier, la même requête coûtera 0,015 $ + 0,06 $ = 0,075 $. « Même prix que 3.7 » est vrai mais incomplet : le tarif a été maintenu, mais le nombre de jetons a changé.
Pourquoi le coût par tâche a augmenté alors que le prix n'a pas changé
La publication de lancement de Google est directe concernant le compromis : sur les tâches complexes, le modèle « exécute des étapes de raisonnement supplémentaires et appelle des outils de manière itérative », vérifiant son travail en cours de route. Plus d'étapes signifie plus de jetons de réflexion et, dans les boucles d'agents, plus de tours d'appel d'outils. Le conseil de mitigation de Google : réduire le thinking_level, ou rester sur 3.7 Flash.
Artificial Analysis a chiffré cela. Son Intelligence Index exécute neuf évaluations ; 3.8 Flash en mode élevé a obtenu un score de 59 contre 56 pour 3.7 Flash en mode élevé, utilisant environ 48 000 jetons de sortie par tâche en moyenne, soit une augmentation de 30 % par rapport à 3.7 Flash. Le coût pour exécuter l'indice par tâche :
| Configuration | Coût par tâche (AA, tarifs d'intro) | Temps par tâche |
|---|---|---|
| Gemini 3.8 Flash, élevé | 0,58 $ | 2,5 min |
| Gemini 3.8 Flash, moyen | 0,41 $ | non publié |
| Gemini 3.8 Flash, faible | 0,24 $ | 0,8 min |
| Gemini 3.7 Flash, élevé | 0,40 $ | 2,2 min |
Interprétez le tableau de deux manières. Par rapport à son prédécesseur, 3.8 Flash en mode élevé coûte 45 % de plus par tâche (0,58 $ / 0,40 $ = 1,45) pour un gain de trois points d'indice. Par rapport à lui-même, passer du mode élevé au mode moyen réduit le coût par tâche de 29 % (0,41 $ / 0,58 $ = 0,71), et le mode faible le réduit de 59 % (0,24 $ / 0,58 $ = 0,41). Le mode moyen sur 3.8 Flash se situe à un centime près du mode élevé sur 3.7 Flash, un point de repère utile pour décider s'il faut passer à la version supérieure. La comparaison 3.8 Flash vs 3.7 Flash aborde cette décision en fonction de la charge de travail.
Artificial Analysis indique également un prix moyen de 0,58 $ par million de jetons avec un ratio entrée/sortie de 3:1. Le fait que cela corresponde au coût de haut niveau par tâche est une coïncidence ; l'un est un tarif par jeton, l'autre dépend du nombre de jetons que le modèle choisit de dépenser.
Profitez du tarif de lancement avant le 31 décembre
« Profiter » a besoin d'une signification précise, car le tarif de lancement n'est pas un contrat. Google facture l'utilisation au tarif en vigueur au moment de la consommation des jetons, vous ne pouvez donc pas prépayer l'utilisation de 2027 aux prix de 2026, et passer à 3.7 ou 3.6 Flash ne vous aidera pas. Ce que vous pouvez faire, c'est déplacer le travail discrétionnaire dans cette période :
- Effectuez dès maintenant les remplissages rétrospectifs et le traitement ponctuel de documents via l'API Batch. Un remplissage rétrospectif de 100 millions de jetons (75M d'entrée, 25M de sortie) coûte 75 x 0,375 $ + 25 x 1,875 $ = 28,13 $ + 46,88 $ = 74,99 $ en lot cette année, et le double, soit 149,98 $, en janvier.
- Constituez votre ensemble d'évaluation et vos comptages de jetons de référence avant le changement de prix, afin que la facture de janvier n'ait qu'une seule variable en mouvement, et non deux.
- Décidez du niveau de réflexion par itinéraire ce trimestre. Chaque itinéraire laissé par défaut sur
mediumest un itinéraire dont le coût n'a pas été examiné. Les itinéraires qui réussissent les évaluations en modelowdevraient être réglés surlowavant janvier.
Si le prix est le facteur décisif parmi les fournisseurs, notre comparatif des fournisseurs d'API LLM les moins chers présente l'ensemble du marché ; la comparaison Fable 5.1 et GPT-5.6 Sol couvre les niveaux premium.
Comparaison avec Flash-Lite, Sonnet 5 et GPT-5.6 Luna
Tarifs par jeton, par million de jetons :
| Modèle | Entrée | Sortie | Remarques |
|---|---|---|---|
| Gemini 3.8 Flash (intro) | 0,75 $ | 3,75 $ | Réflexion facturée comme sortie ; lecture du cache 0,075 $ |
| Gemini 3.8 Flash (à partir du 1er janv.) | 1,50 $ | 7,50 $ | Lecture du cache 0,15 $ |
| Gemini 3.5 Flash-Lite | 0,30 $ | 2,50 $ | Environ 350 jetons/s |
| Claude Sonnet 5 | 2 $ | 10 $ | Permanent ; l'augmentation du 1er sept. a été annulée |
| GPT-5.6 Luna | 1 $ | 6 $ |
Aux tarifs de lancement, l'entrée de 3.8 Flash est 2,5 fois celle de Flash-Lite et la sortie est 1,5 fois. Par rapport à Sonnet 5, 3.8 Flash est environ 2,7 fois moins cher pour l'entrée (2 $ / 0,75 $) et la sortie (10 $ / 3,75 $). Par rapport à Luna, il est également moins cher : 0,75 $ contre 1 $ en entrée, 3,75 $ contre 6 $ en sortie.
La situation s'inverse le 1er janvier. À 1,50 $ et 7,50 $, 3.8 Flash devient plus cher que Luna des deux côtés, et l'écart avec Sonnet 5 se réduit à environ 1,3x (2 $ / 1,50 $ et 10 $ / 7,50 $). Flash-Lite reste moins cher tout au long. Si le tarif de lancement est la raison pour laquelle vous avez choisi 3.8 Flash, inscrivez dès maintenant la réévaluation de janvier à votre calendrier.
La comparaison par jeton n'est qu'une partie de l'équation. Un modèle qui dépense moins de jetons par réponse peut coûter moins cher par tâche à un tarif plus élevé, et la seule façon de le savoir est d'exécuter le même ensemble de tâches sur chaque candidat et de récupérer les comptes d'utilisation. Le guide de l'API 3.8 Flash montre comment lire usageMetadata à partir de l'API Interactions et de l'ancien generateContent.
Détectez les régressions de coûts avec les assertions de jetons Apidog
Le mode d'échec avec 3.8 Flash n'est pas une mauvaise réponse. C'est une bonne réponse qui a discrètement utilisé 40 % de jetons en plus après une modification de l'invite ou un changement de niveau de réflexion, et personne ne le remarque avant la facture. Apidog corrige cela en traitant le nombre de jetons comme un champ sur lequel faire une assertion, comme un code de statut.

- Stockez la clé comme variable d'environnement. Créez
GEMINI_API_KEYdans un environnement Apidog et référencez-la comme{{GEMINI_API_KEY}}dans l'en-têtex-goog-api-key, afin que la clé ne se trouve jamais dans une requête enregistrée. - Envoyez une invite "golden". Enregistrez une requête
POSTvershttps://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContentavec une invite représentative et unthinkingConfig.thinkingLevelexplicite, un par route de production. - Affirmez les champs d'utilisation. Ajoutez un script de post-traitement qui lit
usageMetadataet fait échouer le test si les jetons dépassent un plafond défini à partir de votre ligne de base :
const usage = pm.response.json().usageMetadata;
pm.test("thinking tokens within budget", () => {
pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("visible output within budget", () => {
pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("request cost within budget", () => {
const cost = usage.promptTokenCount * 0.75 / 1e6
+ (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
pm.expect(cost).to.be.below(0.05);
});
- Planifiez-le. Placez les requêtes dans un scénario de test et exécutez-le selon un calendrier, de sorte qu'une augmentation de l'utilisation des jetons apparaisse comme un échec le jour même ; notre guide sur la planification des tests API dans Apidog couvre la configuration. Mettez à jour les deux constantes de tarif le 1er janvier et l'assertion de coût continuera de suivre la facture.
Le même scénario sert également de comparaison entre fournisseurs : dirigez une copie vers Flash-Lite, Sonnet 5 ou Luna et comparez les champs d'utilisation côte à côte. Téléchargez Apidog pour construire le premier scénario ; le plan gratuit couvre ce flux de travail.
FAQ
Gemini 3.8 Flash coûte-t-il plus cher que 3.7 Flash ? Par jeton, non. Les deux sont à 0,75 $ en entrée et 3,75 $ en sortie jusqu'au 31 décembre, puis 1,50 $ et 7,50 $. Par tâche, oui : Artificial Analysis a mesuré 0,58 $ par tâche d'index sur 3.8 Flash en mode élevé contre 0,40 $ sur 3.7 Flash, car 3.8 Flash génère environ 30 % de jetons de sortie supplémentaires.
Les jetons de réflexion sont-ils facturés séparément ? Non. Ils sont facturés comme des jetons de sortie à 3,75 $ par million (intro) et apparaissent dans usageMetadata.thoughtsTokenCount. Vous les contrôlez indirectement via thinking_level ; il n'y a pas de budget de jetons strict sur 3.8 Flash, et minimal renvoie une erreur.
Existe-t-il un niveau gratuit pour Gemini 3.8 Flash ? Oui. Le niveau gratuit d'AI Studio ne facture rien pour l'entrée ou la sortie, avec des limites de débit affichées dans AI Studio, et Google utilise les données du niveau gratuit pour améliorer ses produits. L'application grand public Gemini ne propose 3.8 Flash qu'aux abonnés AI Pro et Ultra. Les détails sont dans le guide d'utilisation gratuite.
Qu'advient-il de mes coûts au 1er janvier 2027 ? Les tarifs d'entrée, de sortie, de lecture de cache, de stockage de cache et de traitement par lots doublent tous. Si l'utilisation des jetons par tâche reste la même, votre facture doublera également. Les lignes 3.6 et 3.7 Flash doublent à la même date.
Quel niveau de réflexion permet de réduire les coûts ? Basez-vous sur l'éventail d'Artificial Analysis : faible 0,24 $, moyen 0,41 $, élevé 0,58 $ par tâche d'index. Exécutez vos propres évaluations à chaque niveau, conservez le niveau le plus bas qui réussit, et affirmez les comptes de jetons afin que le réglage ne puisse pas dériver.
Ce qu'il faut faire cette semaine
Gemini 3.8 Flash est tarifé comme 3.7 Flash et dépense des jetons comme un modèle plus grand. Considérez le niveau de réflexion comme un paramètre de coût et définissez-le par itinéraire. Déplacez le travail compatible avec les traitements par lots dans la fenêtre de lancement avant le 31 décembre. Établissez votre utilisation de jetons de référence dès maintenant et affirmez-la, de sorte que le doublement de janvier soit un changement que vous avez anticipé.
