Qu'est-ce que Gemini 3.8 Flash ?

Gemini 3.8 Flash expliqué : lancement en septembre 2026, ID du modèle, contexte de 1M, niveaux de réflexion, prix de lancement de 0,75 $ / 3,75 $, benchmarks comparés à 3.7 Flash, pourquoi il utilise plus de jetons.

Ashley Innocent

Ashley Innocent

3 September 2026

Qu'est-ce que Gemini 3.8 Flash ?

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Gemini 3.8 Flash est le tout nouveau modèle de Google de la catégorie Flash, lancé le 2 septembre 2026, aux côtés d'un modèle jumeau de sécurité contrôlé appelé Gemini 3.8 Flash Cyber. Il s'agit de la troisième version Flash en six semaines, après Gemini 3.6 Flash le 21 juillet et 3.7 Flash le 13 août, au même prix de lancement que 3.7 Flash : 0,75 $ par million de jetons d'entrée et 3,75 $ par million de jetons de sortie jusqu'au 31 décembre 2026. Google le présente comme « notre modèle Flash le plus intelligent, conçu pour l'ingénierie logicielle à long terme, les agents autonomes et les flux de travail d'entreprise complexes ».

Le changement majeur n'est pas un nouveau prix ou une fenêtre contextuelle plus grande. C'est le comportement. Google a conçu 3.8 Flash pour « travailler plus dur » sur les tâches difficiles : il effectue de plus petites étapes de raisonnement, vérifie son travail en cours de route et appelle des outils de manière itérative. Cela se traduit par des gains mesurables sur les benchmarks d'agents, et cela signifie que le modèle dépense plus de jetons par tâche, par conception. Artificial Analysis a mesuré environ 30 % de jetons de sortie en plus que 3.7 Flash. Si vous budgétisez par jeton, le prix est stable. Si vous budgétisez par tâche, la facture a augmenté.

Ce guide couvre l'ensemble du lancement : les spécifications, le compromis du « travailler plus dur », les benchmarks, la tarification, la disponibilité, le jumeau Cyber, et ce que le modèle ne peut pas faire. Chaque requête ici est du simple HTTP avec JSON, vous pouvez donc les construire et les inspecter dans Apidog avant qu'elles n'atteignent le code de l'application. Le billet de blog de lancement de Google et la page du modèle sont les sources principales.

Gemini 3.8 Flash en un coup d'œil

Spécification Valeur
ID du modèle API gemini-3.8-flash (stable, sans suffixe de prévisualisation)
Date de sortie 2 septembre 2026
Basé sur Gemini 3.7 Flash (selon la fiche modèle DeepMind)
Fenêtre de contexte 1 048 576 jetons d'entrée
Sortie maximale 65 536 jetons
Modalités d'entrée Texte, image, vidéo, audio, PDF
Modalités de sortie Texte uniquement
Niveaux de réflexion low, medium (par défaut), high ; minimal renvoie une erreur
Prix de lancement (jusqu'au 31 déc. 2026) 0,75 $ entrée / 3,75 $ sortie par million de jetons ; la réflexion est facturée comme sortie
Prix standard (à partir du 1er janv. 2027) 1,50 $ entrée / 7,50 $ sortie par million de jetons
Mise en cache du contexte 0,075 $ par million de jetons mis en cache (lancement), 0,15 $ standard
API par lots 50 % de réduction : 0,375 $ / 1,875 $ en lancement
Date limite de connaissance Mars 2026
Disponibilité développeur API Gemini, Google AI Studio, Android Studio, Google Antigravity, Stitch, Gemini Enterprise
Disponibilité grand public Application Gemini (abonnés AI Pro et Ultra), Mode AI dans la Recherche, Gemini dans Google Sheets
Statut de 3.7 Flash Entièrement pris en charge ; pas de date de fin de support

Trois lignes méritent un second regard. Le niveau de réflexion par défaut est medium, et non high comme sur Gemini 3 Pro, de sorte qu'une invite réglée sur Pro raisonnera moins ici à moins que vous ne définissiez le niveau. Le niveau minimal renvoie une erreur de validation plutôt que de se mapper silencieusement à low ; le guide des niveaux de réflexion couvre la correction. Et la date limite de mars 2026 est assortie d'une mise en garde sur la fiche du modèle : dans certains domaines, les connaissances peuvent être limitées à janvier 2025.

Ce qu'est Gemini 3.8 Flash

Flash est la catégorie de modèles la plus utilisée de Google : le modèle destiné à gérer la majeure partie du trafic de production tandis que Pro s'occupe des problèmes les plus difficiles. Google qualifie 3.8 Flash de son « modèle de travail le plus intelligent à ce jour », et la fiche modèle DeepMind le décrit comme basé sur 3.7 Flash plutôt que sur un nouveau modèle de base. La présentation honnête est donc un raffinement d'un modèle sorti trois semaines plus tôt, optimisé pour l'ingénierie logicielle à long terme et le travail d'agent.

Le rythme est inhabituel. 3.6 Flash est arrivé le 21 juillet à 1,50 $ / 7,50 $, 3.7 Flash le 13 août au taux de lancement de 0,75 $ / 3,75 $, et 3.8 Flash le 2 septembre au même taux. La formulation de Google est « troisième version Flash en six semaines » ; Artificial Analysis compte un quatrième modèle Flash en moins de quatre mois car leur décompte inclut 3.5 Flash-Lite. Pour quiconque maintient une configuration de modèle, le billet de blog sur les nouveautés de 3.7 Flash a trois semaines et décrit déjà la génération précédente. Aucun Gemini 3.8 Pro, Gemini 4 ou nouveau Flash-Lite n'a été livré avec cette version, et Google n'a pas précisé quand une mise à jour Pro sera disponible.

La conception « travaille plus dur » et ce que cela vous coûte

La description du changement par Google est spécifique. Sur les tâches complexes, 3.8 Flash « exécute des étapes de raisonnement supplémentaires et appelle des outils de manière itérative ». Il prend de « plus petites étapes de raisonnement » et « vérifie son travail en cours de route ». Google est direct sur la conséquence : le modèle « peut utiliser plus de jetons sur les tâches plus longues et complexes, par conception », en particulier à des niveaux d'effort plus élevés.

Artificial Analysis l'a mesuré dans son rapport indépendant. En utilisant leur Index d'Intelligence, 3.8 Flash à raisonnement élevé a généré en moyenne 48 000 jetons de sortie par tâche, soit une augmentation de 30 % par rapport à 3.7 Flash. Les prix par jeton n'ont pas changé, le coût par tâche est donc passé de 0,40 $ sur 3.7 Flash élevé à 0,58 $ sur 3.8 Flash élevé. Le temps par tâche a également augmenté : 2,5 minutes contre 2,2 minutes.

Le même rapport montre le levier dont vous disposez. Au niveau medium, le coût par tâche tombe à 0,41 $, proche de 3.7 Flash à niveau élevé. Au niveau low, il tombe à 0,24 $ avec 0,8 minute par tâche. Le niveau de réflexion est donc désormais une décision de routage, et non un réglage global : des points de terminaison sensibles à la latence sur low, des boucles d'agents qui doivent terminer le travail sur medium ou high. La répartition des prix détaille 1 000 tâches d'agent par jour à chaque niveau.

La vitesse est inchangée. Logan Kilpatrick de Google a décrit 3.8 Flash comme ayant « le même prix que 3.7, et à peu près la même vitesse », et Artificial Analysis a mesuré 302,1 jetons de sortie par seconde à un raisonnement élevé. Leur temps de 13,30 secondes avant le premier jeton sur cette exécution correspond à la réflexion du modèle avant qu'il ne réponde, et non à un chemin réseau lent.

Ce que disent les benchmarks

Google a publié trois tableaux de benchmarks sous forme de texte sur la page DeepMind Flash. Ce sont des chiffres produits par Google.

Benchmark 3.8 Flash 3.7 Flash Claude Opus 5 GPT-5.6 Sol GPT-5.6 Terra Claude Sonnet 5
Agent Financier Vals v2 61.4% 59.0% 58.6% 53.8% 54.4% 53.9%
Benchmark d'Agent Légal Harvey 10.0% 8.8% 6.7% 2.5% 0.8% 5.0%
HLE-Vérifié 54.9% 53.6% 54.4% 54.5% 51.1% 31.0%

Les gains par rapport à 3.7 Flash sont de 2,4, 1,2 et 1,3 points. Modestes, mais les lignes finance et juridique placent un modèle au prix Flash devant Opus 5 et GPT-5.6 Sol, qui coûtent plusieurs fois plus cher par jeton. Claude Fable 5.1, qui a été lancé la veille, n'apparaît pas dans les tableaux de Google ; la comparaison à trois voies utilise les lignes Opus 5 et Sonnet 5 d'Anthropic comme les entrées publiées les plus proches.

Google fait trois autres affirmations sans chiffres sous forme de texte. Sur DeepSWE v1.1, 3.8 Flash « surpasse la plupart des modèles frontières plus grands » pour « une fraction du coût » ; le pourcentage n'apparaît que dans les tableaux d'images de la fiche du modèle, nous n'en affichons donc pas (3.7 Flash a obtenu un score de 65,3 %). Sur les flux de travail longs et riches en documents, une évaluation interne montre qu'il « accomplit plus de trois fois plus de tâches que Gemini 3.7 Flash ». Sur l'injection de prompt Gray Swan, Google rapporte un « bond significatif » sans chiffre. Les résultats de SWE-Bench Pro, Terminal-bench et OSWorld ne sont pas publiés sous forme de texte pour 3.8 Flash.

Le point de vue indépendant concorde. Artificial Analysis attribue à 3.8 Flash (élevé) un score de 59 sur son Index d'Intelligence, contre 56 pour 3.7 Flash et 52 pour 3.6 Flash. Cela le place à égalité avec GPT-5.6 Sol (très élevé) et Grok 4.6 (moyen), et au-dessus de GPT-5.6 Terra (max), Claude Fable 5.1 (moyen) et Muse Spark 1.2 (très élevé), tous à 57. Sur leur évaluation de l'utilisation d'outils τ³-Banking, 3.8 Flash a obtenu un score de 45 %, soit 12 points de plus que 3.7 Flash. La comparaison 3.8 vs 3.7 Flash met en balance ces gains et le coût des jetons par charge de travail.

Tarification : même prix par jeton, plus cher par tâche

La page de tarification liste 3.8 Flash sur les mêmes lignes que 3.6 et 3.7 Flash, et les trois doublent au 1er janvier 2027.

Élément Jusqu'au 31 déc. 2026 À partir du 1er janv. 2027
Entrée 0,75 $ / 1M 1,50 $ / 1M
Sortie (inclut la réflexion) 3,75 $ / 1M 7,50 $ / 1M
Entrée mise en cache 0,075 $ / 1M 0,15 $ / 1M
Stockage de cache 0,50 $ / 1M jetons / heure 1,00 $ / 1M jetons / heure
Entrée / sortie par lots 0,375 $ / 1,875 $ 0,75 $ / 3,75 $

Deux détails peuvent dérouter les utilisateurs. Les jetons de réflexion sont des jetons de sortie : facturés au tarif de sortie et signalés séparément dans usageMetadata.thoughtsTokenCount, de sorte qu'une réponse courte à high peut coûter plus cher qu'une réponse longue à low. Et le grounding de Google Search a son propre compteur : 5 000 requêtes gratuites par mois partagées sur tous les modèles Gemini 3.x, puis 14 $ pour 1 000 requêtes.

Un niveau gratuit avec des limites de débit existe dans AI Studio et l'API, Google indiquant que les données du niveau gratuit sont « utilisées pour améliorer nos produits ». Les limites de débit par modèle sont affichées dans AI Studio plutôt que dans la documentation. Le niveau 1 est débloqué en liant un compte de facturation, le niveau 2 après 100 $ de dépenses et trois jours, le niveau 3 après 1 000 $ et 30 jours. Le guide d'accès gratuit couvre ce que le chemin gratuit vous permet et ne vous permet pas d'obtenir, et le guide de l'API par lots couvre la réduction de 50 % pour les tâches qui peuvent attendre.

Comment l'appeler

Google considère désormais l'API Interactions comme la voie principale pour Gemini 3.x. generateContent est « considéré comme obsolète » mais « reste entièrement pris en charge » sans date de fin de support, et la plupart du code existant l'utilise toujours. Une requête Interactions minimale :

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"medium"}}'

Les conversations à plusieurs tours passent previous_interaction_id et permettent au serveur de conserver l'état. L'appel de fonction déclare les outils avec un schéma JSON, reçoit une étape function_call, et attend un function_result contenant à la fois call_id et name, qui sont requis sur 3.8 Flash (l'ancien generateContent orthographie le champ id). La présentation de l'API montre les deux points de terminaison en REST et Python, et le guide d'appel de fonctions couvre les boucles d'outils itératives produites par la conception « travaille plus dur » et comment les limiter.

Si vous passez de 3.7 Flash, les changements sont mineurs mais peuvent provoquer des erreurs : la réflexion minimal est rejetée, thinking_budget cède la place à thinking_level, candidate_count n'est pas pris en charge, et Google recommande de laisser temperature à la valeur par défaut de 1.0 car la réduire « peut entraîner des boucles ou des performances dégradées ». Le guide de migration transforme les notes de nouveauté de Google en une liste de contrôle avec des JSON avant et après.

Ce que Gemini 3.8 Flash ne peut pas faire

La page du modèle est explicite. Non pris en charge : la génération audio, l'API Live et la génération d'images. La sortie est du texte uniquement, même si l'entrée accepte le texte, l'image, la vidéo, l'audio et le PDF. La segmentation d'images n'est pas non plus prise en charge sur les modèles Gemini 3. Si votre produit nécessite une sortie vocale ou d'image en temps réel, ce modèle est la couche de raisonnement et d'appel d'outils, pas l'ensemble de la pile. Pour un texte bon marché et à haut débit sans raisonnement lourd, Gemini 3.5 Flash-Lite reste sur la liste de prix à 0,30 $ / 2,50 $. Le reste de la liste de contrôle est pris en charge, y compris l'appel de fonctions, les sorties structurées, la mise en cache de contexte, l'exécution de code, le grounding Search et Maps, l'API Batch et l'utilisation de Computer en prévisualisation.

Gemini 3.8 Flash Cyber : le jumeau contrôlé

Gemini 3.8 Flash Cyber a été lancé le même jour, et vous ne pouvez pas vous y inscrire. L'accès n'est possible que via le nouveau programme Fairwind, ouvert aux « autorités gouvernementales de confiance, aux opérateurs d'infrastructures critiques et aux mainteneurs de logiciels », avec des vérifications d d'antécédents et des exigences telles que l'authentification multifacteur résistante au phishing. Il n'y a pas d'API publique, pas de tarification publique et pas d'auto-hébergement. Il remplace le pilote limité 3.5 Flash Cyber.

Les affirmations de Google sont importantes : un taux de réussite de découverte de vulnérabilités réelles supérieur à 70 % sur 20 langages de programmation, et un rapport de l'équipe de sécurité de Chrome faisant état de « 2,6 fois plus de correctifs corrects pour les vulnérabilités de Chrome que les meilleurs modèles commerciaux beaucoup plus grands ». Les deux sont des rapports de Google. L'explication sur Cyber couvre l'éligibilité, les obligations et ce que cela signifie pour les nombreuses équipes qui n'y auront jamais accès.

Tester les requêtes Gemini 3.8 Flash dans Apidog

Parce que l'histoire des coûts est par tâche plutôt que par jeton, le test utile n'est pas « l'appel a-t-il réussi » mais « combien de jetons a-t-il consommés ». Apidog gère cela comme un test d'API ordinaire. Stockez GEMINI_API_KEY comme variable d'environnement, enregistrez les requêtes Interactions et generateContent comme points de terminaison, et affirmez sur le statut 200, les champs JSON que votre application lit, et un plafond sur usageMetadata.thoughtsTokenCount. Exécutez la même invite à low, medium et high dans un scénario de test et vous obtiendrez la répartition des jetons par niveau pour vos propres invites au lieu des moyennes d'Artificial Analysis.

Les réponses en streaming s'affichent en SSE, ce qui aide lors du débogage des résumés de pensées avec includeThoughts: true ; le guide de test SSE explique cela. Planifiez le scénario quotidiennement et une régression de jetons échoue une assertion avant d'atterrir sur la facture. Téléchargez Apidog pour le configurer sur le plan gratuit.

FAQ

Gemini 3.8 Flash est-il un nouveau modèle ou une mise à jour de 3.7 Flash ? La fiche modèle DeepMind indique qu'il est basé sur Gemini 3.7 Flash. Considérez-le comme un successeur optimisé : même prix, même vitesse et même fenêtre contextuelle, avec plus d'étapes de raisonnement et d'appel d'outils sur les tâches difficiles. 3.7 Flash reste entièrement pris en charge, sans date de fin de support.

Pourquoi Gemini 3.8 Flash utilise-t-il plus de jetons que 3.7 Flash ? C'est sa conception. Google affirme qu'il « peut utiliser plus de jetons sur les tâches plus longues et complexes », et Artificial Analysis a mesuré 30 % de jetons de sortie supplémentaires sur leur index. Réduisez le thinking_level à medium ou low sur les routes qui n'ont pas besoin de raisonnement supplémentaire ; le guide des niveaux de réflexion contient le tableau des coûts par niveau.

Quelle est la fenêtre de contexte de Gemini 3.8 Flash ? 1 048 576 jetons d'entrée et 65 536 jetons de sortie, avec une mise en cache de contexte à 0,075 $ par million de jetons mis en cache jusqu'au 31 décembre 2026.

Puis-je utiliser Gemini 3.8 Flash dans l'application Gemini gratuite ? La couverture de lancement liste l'application Gemini pour les abonnés Google AI Pro et Ultra, et non le niveau d'application gratuit. Les développeurs bénéficient d'un niveau gratuit avec des limites de débit dans AI Studio et l'API.

Comment Gemini 3.8 Flash se compare-t-il à Claude Fable 5.1 ? Artificial Analysis les note à 59 et 57. En termes de prix, Claude Fable 5.1 coûte 10 $ / 50 $ par million de jetons, soit environ 13 fois le tarif de lancement de 3.8 Flash pour l'entrée et la sortie. L'écart se réduit une fois que vous comptez les jetons par tâche.

Où aller ensuite

Gemini 3.8 Flash est un cheval de bataille qui réfléchit plus longtemps, et le compromis est explicite : quelques points de plus sur les benchmarks d'agents et 12 points sur l'utilisation d'outils, payés avec environ 30 % de jetons de sortie supplémentaires à un raisonnement élevé. Si vos agents rencontraient des difficultés avec 3.7 Flash, la mise à niveau coûte le même prix par jeton. Si votre trafic est un chat sensible à la latence, réglez low ou restez sur 3.7 Flash, qui est toujours pris en charge. Commencez par la présentation de l'API, envoyez votre première requête depuis Apidog avec une assertion de nombre de jetons attachée, et laissez le chiffre, et non le billet de lancement, décider du niveau de réflexion pour chaque route.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API