Gemini 3.8 Flash vs 3.7 Flash : Nouveautés et faut-il mettre à jour ?

Gemini 3.8 Flash contre 3.7 Flash : même prix, vitesse et contexte, mais +3 sur l'indice AA, +12 sur tau3-Banking, et 30 % de jetons de sortie supplémentaires par tâche. Faut-il mettre à niveau ?

Medy Evrard

3 September 2026

Gemini 3.8 Flash vs 3.7 Flash : Nouveautés et faut-il mettre à jour ?

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Google a lancé Gemini 3.8 Flash le 2 septembre 2026, trois semaines après Gemini 3.7 Flash et six semaines après 3.6 Flash. Même prix de lancement (0,75 $ en entrée, 3,75 $ en sortie par million de jetons jusqu'au 31 décembre), même contexte de 1 million de jetons, et, selon la propre formulation de Google, à peu près la même vitesse. Ce qui a changé, c'est la façon dont le modèle fonctionne : il effectue des étapes de raisonnement plus petites, vérifie sa propre sortie et appelle des outils en boucle. Cela lui vaut un score plus élevé sur chaque référence publiée. Cela rend également chaque tâche plus coûteuse en jetons.

La question de la mise à niveau n'est donc pas « 3.8 Flash est-il meilleur ? » Sur le papier, oui. La question est de savoir si la qualité supplémentaire justifie les jetons supplémentaires pour votre charge de travail, et si les deux changements majeurs affectent votre code. Cette comparaison examine ce qui est resté inchangé, ce qui a été amélioré, ce que cela vous coûte, et une matrice de décision par charge de travail. Les sources sont le billet de lancement de Google, la page Nouveautés de Gemini 3.8 Flash, et les tests indépendants d'Artificial Analysis. Pour la fiche technique complète, commencez par ce qu'est Gemini 3.8 Flash.

Une dernière chose d'emblée : Google déclare que « Gemini 3.7 Flash reste entièrement pris en charge » et n'a publié aucune date de dépréciation. Personne ne vous force la main.

Comparaison côte à côte

Gemini 3.8 Flash Gemini 3.7 Flash
ID du modèle gemini-3.8-flash gemini-3.7-flash
Date de sortie 2 septembre 2026 13 août 2026
Base « Basé sur Gemini 3.7 Flash » (fiche modèle) n/a
Contexte / sortie max 1 048 576 / 65 536 jetons Identique
Prix d'entrée (lancement, jusqu'au 31 déc.) 0,75 $ par million 0,75 $ par million
Prix de sortie (lancement, jusqu'au 31 déc.) 3,75 $ par million, réflexion incluse 3,75 $ par million, réflexion incluse
Prix standard (à partir du 1er janv. 2027) 1,50 $ / 7,50 $ 1,50 $ / 7,50 $
Lecture du cache de contexte 0,075 $ par million (lancement) Identique
Traitement par lots 50 % de réduction, mêmes niveaux de jetons en file d'attente Identique
Niveaux de réflexion low, medium (par défaut), high low, medium, high
Niveau de réflexion minimal Erreur de validation Accepté (Note de migration de Google : le mapper à low)
Date limite de connaissance Mars 2026 Non répété dans la documentation 3.8
Vitesse de sortie (Artificial Analysis) ~300 jetons/s (302,1 mesurés, élevé) « Environ la même vitesse » selon Google
Indice d'intelligence Artificial Analysis 59 (élevé) 56 (élevé)
Statut du support Actuel « Reste entièrement pris en charge », pas de date de fin de vie

Ce qui est identique

Le prix, tout d'abord. Les deux modèles figurent sur les mêmes lignes de la page de tarification de Google : 0,75 $ en entrée et 3,75 $ en sortie jusqu'au 31 décembre, doublant à 1,50 $ et 7,50 $ le 1er janvier 2027. La mise en cache, les réductions pour les lots, et les 5 000 requêtes d'ancrage Google Search gratuites par mois (partagées entre tous les modèles Gemini 3.x) sont tous reportés. Si vous souhaitez une ventilation ligne par ligne, la référence des spécifications et tarifs de 3.7 Flash s'applique toujours à 3.8 Flash ligne pour ligne.

Les limites de contexte et de sortie restent inchangées à 1 048 576 jetons en entrée et 65 536 jetons en sortie. Les modalités sont également les mêmes : texte, image, vidéo, audio et PDF en entrée ; texte en sortie. Aucun des modèles ne fait de génération audio, de génération d'images ou n'utilise l'API Live.

La vitesse est un quasi-ex-aequo. Logan Kilpatrick de Google a décrit 3.8 Flash comme ayant « le même prix que 3.7, et une vitesse similaire ». Artificial Analysis a mesuré 302,1 jetons de sortie par seconde lors de son exécution à raisonnement élevé. C'est le débit une fois que le modèle commence à écrire ; le temps de premier jeton sur la même exécution était de 13,30 secondes, car au niveau high, le modèle réfléchit avant de parler.

La surface de l'API est également la même. L'API Interactions est désormais la voie principale de Google pour Gemini 3.x, et le point de terminaison generateContent hérité « reste entièrement pris en charge » sans date de fin de vie. Le code écrit pour 3.7 Flash sur l'un ou l'autre point de terminaison fonctionne avec gemini-3.8-flash après un changement de chaîne de modèle, avec les exceptions couvertes par les changements majeurs.

Ce qui a été amélioré

Le titre de Google pour 3.8 Flash est « notre modèle Flash le plus intelligent », conçu pour « l'ingénierie logicielle à long terme, les agents autonomes et les flux de travail d'entreprise complexes ». Le changement de conception derrière cette affirmation : sur les tâches difficiles, le modèle « exécute des étapes de raisonnement supplémentaires et appelle des outils de manière itérative », effectuant « des étapes de raisonnement plus petites » et vérifiant « son travail en cours de route ». Voici ce que cela produit sur les benchmarks que Google et Artificial Analysis ont publiés sous forme de texte.

Les propres tableaux de Google. Google a publié trois comparaisons numériques avec 3.7 Flash sur la page DeepMind Flash. Celles-ci sont réalisées par le fournisseur.

Benchmark (réalisé par Google) 3.8 Flash 3.7 Flash Delta
Agent financier Vals v2 61.4% 59.0% +2.4
HLE-Vérifié 54.9% 53.6% +1.3
Benchmark de l'agent juridique Harvey 10.0% 8.8% +1.2

Des gains modestes et constants, et dans chaque ligne, 3.8 Flash surpasse également les modèles plus grands du tableau de Google (Claude Opus 5 à 58,6 % sur Vals Finance, 54,4 % sur HLE-Verified) ; la comparaison à trois voies avec Claude Fable 5.1 et GPT-5.6 Sol approfondit ce sujet. Il s'agit d'un modèle au prix Flash qui surpasse des modèles coûtant plusieurs fois plus cher par jeton, ce qui est le point que Google souhaite que vous reteniez.

Artificial Analysis, indépendamment. L'article d'Artificial Analysis place 3.8 Flash à 59 sur son indice d'intelligence au niveau high, contre 56 pour 3.7 Flash et 52 pour 3.6 Flash. C'est trois points par version, et cela place 3.8 Flash à égalité avec GPT-5.6 Sol au niveau xhigh et Grok 4.6 au niveau medium, un point au-dessus de Claude Fable 5.1 au niveau medium. Sur τ³-Banking, son évaluation d'utilisation d'outils, 3.8 Flash a obtenu 45 %, un bond de 12 points par rapport à 3.7 Flash. Si vous utilisez des agents avec de véritables appels d'outils, cette ligne est plus importante que l'indice.

Travail d'agent lourd en documents. Google affirme que 3.8 Flash « accomplit plus de trois fois plus de tâches que Gemini 3.7 Flash » sur les workflows de longue durée et gourmands en documents. Évaluation interne, pas de harnais public, donc à considérer comme une indication. Cependant, cela correspond à la conception du modèle : davantage d'étapes de vérification sont plus utiles là où une seule erreur fait dérailler un travail de 40 étapes.

Codage, avec une lacune dans les données. Sur DeepSWE v1.1, 3.7 Flash a obtenu un score de 65,3 %, contre 49,0 % pour 3.6 Flash. Google affirme que 3.8 Flash « surpasse la plupart des grands modèles frontières » à « une fraction du coût », mais le pourcentage exact de 3.8 n'apparaît que dans les tableaux d'images de la fiche modèle, pas en texte, nous n'imprimerons donc pas de chiffre. Les chiffres de SWE-Bench Pro, Terminal-bench et OSWorld pour 3.8 Flash ne sont pas du tout publiés en texte. Si ces benchmarks guident votre décision, attendez les exécutions tierces.

Sécurité et résistance à l'injection. Google signale un « bond significatif » sur les tests d'injection de prompt Gray Swan sans donner de chiffre. Les deltas de la fiche modèle par rapport à 3.7 Flash sont faibles : sécurité multilingue +5,4 points, sécurité texte-à-texte -0,4, refus injustifiés +1,1. Interprétez ce dernier point comme une légère augmentation des refus excessifs.

Ce que cela vous coûte

Les prix par jeton n'ont pas bougé. Le coût par tâche, oui. C'est le compromis que Google déclare ouvertement : le modèle « peut utiliser plus de jetons sur des tâches plus longues et complexes, de par sa conception », et « pourrait utiliser plus de jetons pour maximiser les performances, surtout à des niveaux d'effort plus élevés ».

Artificial Analysis l'a quantifié. En exécutant son indice, 3.8 Flash a produit en moyenne 48 000 jetons de sortie par tâche, soit 30 % de plus que 3.7 Flash. Avec une tarification par jeton identique, cela se traduit par une facture plus élevée par tâche accomplie :

Configuration (Artificial Analysis) Coût par tâche Temps par tâche
Gemini 3.7 Flash, high 0,40 $ 2,2 min
Gemini 3.8 Flash, low 0,24 $ 0,8 min
Gemini 3.8 Flash, medium 0,41 $ non publié
Gemini 3.8 Flash, high 0,58 $ 2,5 min

Trois points ressortent de ce tableau. Premièrement, 3.8 Flash au niveau high coûte environ 45 % de plus par tâche que 3.7 Flash au niveau high, et prend 14 % de temps réel en plus. Deuxièmement, 3.8 Flash au niveau medium, qui est le niveau par défaut, se situe à un centime près de 3.7 Flash au niveau high, donc une mise à niveau « à budget égal » est possible si la qualité medium répond à vos exigences. Troisièmement, 3.8 Flash au niveau low est la ligne la moins chère et la plus rapide du tableau, ce qui en fait le choix évident pour les routes sensibles à la latence où 3.7 Flash fonctionnait au niveau high par habitude.

La ventilation des prix de 3.8 Flash intègre cela dans les volumes quotidiens. En bref : si vous payez par tâche, la mise à niveau n'est pas gratuite, et le niveau de réflexion est le cadran que vous utilisez pour décider de l'ampleur de l'amélioration que vous achetez.

Changements majeurs en bref

Deux changements affectent directement le code 3.7 Flash existant.

thinking_level: "minimal" renvoie une erreur de validation. 3.8 Flash n'accepte que low, medium et high. Si une configuration 3.7 utilise minimal, mappez-la à low. Le guide des niveaux de réflexion explique ce que fait chaque niveau, ainsi que leur coût et leur latence.

Les réponses de fonction doivent inclure call_id et name. Chaque function_result sur l'API Interactions nécessite les deux champs, et chaque functionResponse sur l'ancien generateContent nécessite l'id correspondant plus name. Le code qui renvoyait des résultats indexés uniquement par le nom échouera au deuxième tour d'une boucle d'outils.

Au-delà de cela, le guide de migration de 3.7 vers 3.8 Flash passe en revue les règles de Gemini 3 qu'il convient de vérifier à nouveau lors de la transition : garder temperature à la valeur par défaut 1.0 (Google avertit que des valeurs plus basses « peuvent entraîner des boucles ou une dégradation des performances »), utiliser thinking_level au lieu d'un thinking_budget entier, supprimer candidate_count, et renvoyer les signatures de pensée exactement telles que reçues. Aucun de ces éléments n'est nouveau pour 3.8, mais une base de code 3.7 qui les aurait ignorés fera apparaître les problèmes maintenant.

Matrice de décision par charge de travail

Charge de travail Recommandation Pourquoi
Agents multi-étapes avec appels d'outils Mettre à niveau, medium ou high +12 sur τ³-Banking ; les boucles d'outils itératives sont la raison d'être de 3.8
Extraction et révision de documents longs Mettre à niveau L'affirmation de Google concernant la complétion de tâches 3 fois plus rapide vise cette forme exacte
Codage agentique dans un harnais Mettre à niveau, puis mesurer Chiffre texte DeepSWE non publié ; vérifiez sur votre dépôt avant de vous engager
Agents financiers, juridiques et de recherche Mettre à niveau Les trois tableaux Google publiés vont tous dans le sens de 3.8
Classification, extraction, chat à volume élevé Rester sur 3.7, ou 3.8 à low Le coût par tâche est la métrique ici ; low est moins cher que 3.7 à high
Points de terminaison orientés utilisateur sensibles à la latence 3.8 à low 0,8 min par tâche sur le harnais d'AA contre 2,2 pour 3.7 à high
Tout ce qui utilise une réflexion minimal Migrer d'abord Erreur de validation tant que vous ne l'avez pas mappé à low
Pipelines de lots facturés au centime près Rester sur 3.7 jusqu'à une nouvelle évaluation Même prix par jeton, mais +30 % de jetons de sortie modifie la facture du lot

Le schéma : plus la tâche est difficile et longue, plus la conception de 3.8 Flash qui « travaille plus fort » justifie ses jetons. Plus la tâche est courte et répétitive, moins elle a d'impact, et plus le niveau de réflexion (ou le maintien de la version actuelle) est important.

Exécutez les deux modèles dans le même scénario de test dans Apidog

Les chiffres par tâche ci-dessus proviennent du harnais d'Artificial Analysis, pas du vôtre. Avant d'échanger la chaîne de modèle en production, exécutez vos propres invites sur les deux modèles et comparez le nombre de jetons. Apidog rend cela faisable en dix minutes.

Définissez GEMINI_API_KEY comme variable d'environnement dans un environnement Apidog et ajoutez une requête POST à https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent avec x-goog-api-key lisant à partir de la variable. Faites de model une variable de scénario également. Le corps est le même pour les deux exécutions :

{
  "contents": [{"parts": [{"text": "{{golden_prompt}}"}]}],
  "generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}

Construisez un scénario de test en deux étapes : la requête avec model défini sur gemini-3.7-flash, puis la même requête avec gemini-3.8-flash. À chaque étape, ajoutez des assertions sur usageMetadata.candidatesTokenCount et usageMetadata.thoughtsTokenCount avec un plafond qui reflète votre budget, plus une assertion de chemin JSON sur le champ que votre application lit. Exécutez le scénario sur un ensemble de données de dix ou vingt invites de référence. Le rapport de test affiche la réponse de chaque étape et les résultats des assertions ensemble, de sorte que vous lisez le nombre de jetons des deux modèles à partir d'une seule exécution et que le chiffre de +30 % devient votre propre chiffre au lieu de celui d'un benchmark.

Une fois que les chiffres vous semblent corrects, planifiez le scénario afin qu'une augmentation discrète des jetons de réflexion après une mise à jour de modèle échoue un test au lieu d'apparaître sur une facture. Téléchargez Apidog pour le configurer ; le plan gratuit couvre ce workflow.

FAQ

Gemini 3.8 Flash est-il plus rapide que 3.7 Flash ?

Non. La propre description de Google est « environ la même vitesse », et Artificial Analysis a mesuré environ 300 jetons de sortie par seconde au niveau high. Parce que 3.8 Flash raisonne en plus d'étapes, le temps réel par tâche a augmenté sur son harnais (2,5 minutes contre 2,2 au niveau high). Passer à low le ramène à 0,8 minute.

Gemini 3.8 Flash coûte-t-il plus cher que 3.7 Flash ?

Pas par jeton. Les deux sont à 0,75 $ en entrée et 3,75 $ en sortie jusqu'au 31 décembre, puis 1,50 $ et 7,50 $. Par tâche, oui : Artificial Analysis a mesuré 0,58 $ au niveau high contre 0,40 $ pour 3.7 Flash au niveau high, car 3.8 Flash écrit environ 30 % de jetons de sortie en plus.

Google va-t-il arrêter Gemini 3.7 Flash ?

Google affirme que 3.7 Flash « reste entièrement pris en charge » et n'a publié aucune date de dépréciation. Vous pouvez continuer à l'utiliser. L'article sur les nouveautés de 3.7 Flash reste la référence pour ce modèle.

Qu'est-ce qui ne fonctionnera plus si je passe à 3.8 Flash ?

Deux choses : thinking_level: "minimal" renvoie désormais une erreur 400 INVALID_ARGUMENT, et chaque réponse de fonction doit inclure à la fois l'ID d'appel (call_id sur l'API Interactions, id sur l'ancien generateContent) et name. Tout le reste de l'API Gemini 3 reste inchangé.

Comment ce saut se compare-t-il à celui de 3.6 à 3.7 ?

3.7 Flash représentait une étape plus importante : DeepSWE est passé de 49,0 % à 65,3 %, et l'indice d'Artificial Analysis de 52 à 56. L'étape 3.8 est un gain de +3 sur l'indice et une refonte de la manière dont le modèle utilise les jetons. Pour la génération précédente, voir 3.6 Flash vs 3.5 Flash, qui couvre la réduction de prix qui a initié cette série de versions.

En bref

Mettez à niveau si votre charge de travail est agentique, gourmande en outils ou en documents. C'est là que Google et Artificial Analysis montrent des gains, et où les jetons supplémentaires permettent d'accomplir des tâches. Restez sur 3.7 Flash, ou passez à 3.8 au niveau low, si vous effectuez des appels courts et répétitifs où le coût par tâche est le chiffre que vous déclarez. Dans tous les cas, corrigez minimal et vérifiez d'abord vos réponses de fonction, puis mesurez le nombre de jetons sur vos propres invites avant de faire confiance au harnais de quiconque, y compris le nôtre.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API