Gemini 3.6 Flash vs 3.5 Flash : les différences et faut-il faire la mise à jour ?

Gemini 3.6 Flash contre 3.5 Flash : même coût d'entrée de 1,50 $, coût de la sortie ramené à 7,50 $, 17 % de tokens de sortie en moins, scores d'utilisation informatique plus élevés. Qu'est-ce qui a changé et devriez-vous effectuer la mise à niveau ?

Ashley Innocent

Ashley Innocent

22 July 2026

Gemini 3.6 Flash vs 3.5 Flash : les différences et faut-il faire la mise à jour ?

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Google a mis à jour sa gamme Flash le 21 juillet 2026, et le modèle phare a évolué vers Gemini 3.6 Flash. Si vous utilisez 3.5 Flash en production, voici la version courte : 3.6 Flash est un remplacement direct moins cher et plus efficace en termes de jetons, et la plupart des équipes devraient effectuer la mise à niveau. Même famille de modèles, même contexte de 1M de jetons, même prix d'entrée. La sortie coûte moins cher par jeton, et le modèle génère moins de jetons de sortie pour accomplir la même tâche. Pour un aperçu complet du nouveau modèle, consultez qu'est-ce que Gemini 3.6 Flash.

bouton

La réponse courte

Mettez à niveau. Gemini 3.6 Flash conserve le prix d'entrée de 1,50 $ par million de jetons, réduit le prix de sortie de 9,00 $ à 7,50 $ par million, et produit environ 17 % moins de jetons de sortie que 3.5 Flash pour les mêmes tâches. Il obtient également de meilleurs scores aux benchmarks d'utilisation informatique (83,0 contre 78,4 sur OSWorld-Verified) et nécessite moins d'étapes de raisonnement dans les flux de travail à plusieurs étapes. La seule raison de ne pas le faire : vous avez épinglé et validé 3.5 Flash en production et ne pouvez pas encore relancer vos évaluations.

Gemini 3.6 Flash vs 3.5 Flash côte à côte

Voici la comparaison qui compte, directement à partir des chiffres de lancement de Google. Les détails se trouvent sur le billet de blog de Google et la page du modèle DeepMind Flash.

Attribut Gemini 3.6 Flash Gemini 3.5 Flash
ID du modèle gemini-3.6-flash gemini-3.5-flash
Prix d'entrée (par 1M de jetons) 1,50 $ 1,50 $
Prix de sortie (par 1M de jetons) 7,50 $ 9,00 $
Efficacité des jetons de sortie ~17 % moins de jetons de sortie référence
Utilisation informatique (OSWorld-Verified) 83,0 78,4
Fenêtre de contexte 1M de jetons d'entrée 1M de jetons d'entrée

Le prix d'entrée n'a pas bougé. La fenêtre de contexte n'a pas bougé. Les changements concernent le côté de la sortie et l'efficacité avec laquelle le modèle parvient à une réponse.

Ce qui s'est réellement amélioré

Quatre choses ont changé, et ce sont les raisons de migrer.

Moins de jetons de sortie. Gemini 3.6 Flash produit environ 17 % moins de jetons de sortie que 3.5 Flash pour le même travail. Les jetons de sortie incluent les jetons de réflexion, donc un raisonneur plus efficace écrit moins pour arriver à la même réponse. Vous payez pour chaque jeton de sortie, il s'agit donc d'une ligne de coût directe, et non d'une métrique de vanité.

Prix de sortie inférieur. Google a réduit le prix de sortie de 9,00 $ à 7,50 $ par million de jetons. Il s'agit d'une réduction de prix de 17 % sur le tarif par jeton, en plus de la réduction du nombre de jetons mentionnée ci-dessus.

Meilleure utilisation informatique. Sur OSWorld-Verified, le benchmark pour piloter une interface informatique réelle, 3.6 Flash obtient un score de 83,0 contre 78,4 pour 3.5 Flash. Si vous créez des agents qui cliquent sur des interfaces utilisateur, remplissent des formulaires ou utilisent des outils, cet écart se traduit par moins d'étapes échouées.

Moins d'étapes de raisonnement et d'appels d'outils. Dans les flux de travail d'agents à plusieurs étapes, 3.6 Flash atteint l'objectif en moins d'étapes de raisonnement et moins d'appels d'outils. Chaque appel d'outil évité est un aller-retour que vous ne payez pas et que vous n'attendez pas, ce qui s'ajoute aux économies de jetons pour tout ce qui est agentique. La précision du codage s'est également améliorée, ce qui est important si le modèle modifie des fichiers ou génère des diffs où un jeton incorrect brise la construction.

Rien de tout cela ne change la forme de l'API. C'est le même format de requête, les mêmes modalités d'entrée (texte, image, vidéo, audio, PDF), le même texte de sortie.

Ce que cela signifie pour votre facture

Les deux effets de coût se cumulent. Vous obtenez un prix inférieur par jeton de sortie ET moins de jetons de sortie à payer. Ils se multiplient, ils ne s'additionnent pas seulement.

Voici un exemple illustratif. Supposons qu'une tâche quotidienne génère 10 millions de jetons de sortie sur 3.5 Flash :

C'est environ 31 % de réduction sur le coût de sortie de cette charge de travail, et vous n'avez pas changé une seule invite. Votre coût d'entrée reste stable car le prix d'entrée est identique à 1,50 $ par million et vos invites n'ont pas changé. Sur les charges de travail d'agents avec de nombreux appels d'outils, la baisse peut être plus importante, car moins d'allers-retours réduisent également le nombre total de jetons sur l'ensemble de l'exécution.

Votre chiffre réel dépend de votre ratio entrée-sortie. Les tâches qui lisent beaucoup et écrivent peu (classification, extraction) voient un changement total plus faible car les économies sont concentrées sur la sortie. Les tâches qui écrivent beaucoup (rédaction, génération de code, longues traces d'agents) voient les plus grands avantages. Pour une ventilation complète des tarifs, de la mise en cache et des détails des jetons de réflexion, consultez les tarifs de Gemini 3.6 Flash et la documentation officielle des tarifs de l'API Gemini.

Y a-t-il une raison de rester sur 3.5 Flash ?

Oui, une raison limitée. Soyez honnête avec vous-même quant à votre situation.

La raison légitime de bloquer 3.5 Flash est que vous l'avez déjà validé en production et que vous ne pouvez pas refaire les tests pour le moment. Peut-être avez-vous une suite d'évaluation verrouillée liée à une approbation de conformité. Peut-être avez-vous des sorties ajustées par des invites dont dépend un analyseur en aval, et une fenêtre de régression n'est pas ouverte ce sprint. Les échanges de modèles modifient les sorties de manière subtile, et un prix « moins cher » ne vaut pas une panne silencieuse dans un système que vous ne pouvez pas revalider aujourd'hui. Dans ce cas, restez bloqué sur gemini-3.5-flash jusqu'à ce que vous ayez une fenêtre de test, puis migrez délibérément.

Pour être clair : 3.5 Flash ne disparaîtra pas le jour où 3.6 sera livré. Il est toujours disponible via l'API, et le fait de s'y bloquer est un choix valable à court terme. C'est un « quand », pas un « si ». Pour la plupart des équipes sans verrouillage de validation strict, l'argent et la qualité militent en faveur d'une mise à niveau dès maintenant.

Comment migrer

La partie mécanique tient en une ligne. Dans votre appel API, échangez l'ID du modèle :

C'est tout le changement de code. Le corps de la requête, l'authentification et les points de terminaison sont les mêmes, donc rien d'autre dans votre intégration ne bouge. Pour une procédure pas à pas complète, requête par requête, consultez comment utiliser l'API Gemini 3.6 Flash et la documentation de l'API Gemini.

Le vrai travail est la vérification, pas l'échange. Avant de déployer le nouvel ID de modèle en production :

  1. Relancez votre suite d'évaluation sur 3.6 Flash et comparez les scores de qualité à votre référence 3.5 Flash.
  2. Relancez vos tests de régression, car la forme et le phrasé des sorties peuvent varier entre les versions.
  3. Vérifiez tout ce qui analyse la sortie du modèle par structure exacte (clés JSON, expressions régulières, validation de schéma en aval).
  4. Surveillez la latence et le nombre de jetons sur un échantillon de trafic réel avant de déployer complètement.

Si vos sorties alimentent un autre service, traitez l'échange comme toute mise à niveau de dépendance : modifiez-le derrière un indicateur, comparez, puis promouvez.

Test de régression de l'échange dans Apidog

C'est là que Apidog prend toute sa place dans la migration. Apidog est un client API et une plateforme de test, c'est donc l'endroit naturel pour prouver que 3.6 Flash se comporte bien avant de lui faire confiance en production. Il n'exécute pas le modèle ; il envoie les requêtes et vérifie les réponses.

Une manière propre de faire de l'A/B testing entre les deux modèles :

  1. Enregistrez votre requête Gemini existante. Créez l'appel POST à l'API Gemini dans Apidog, avec votre clé API stockée dans une variable d'environnement afin qu'elle ne figure jamais dans le corps de la requête.
  2. Dupliquez-la. Changez une seule chose : l'ID du modèle, de gemini-3.5-flash à gemini-3.6-flash. Tout le reste reste identique afin de comparer des éléments similaires.
  3. Ajoutez des assertions. Affirmez le code de statut et les champs JSON que votre application lit réellement, afin qu'un changement de forme échoue bruyamment au lieu de se propager en aval.
  4. Comparez les réponses et la latence. Exécutez les deux, placez les sorties côte à côte et vérifiez que la réponse 3.6 passe toujours chaque assertion que la réponse 3.5 a passée. Notez le temps de réponse et l'utilisation des jetons pour chacune.
  5. Maintenez les assertions au vert au fil du temps. Enregistrez les deux comme scénario de test et planifiez-le comme test de régression afin qu'un futur changement de modèle ou d'invite ne puisse pas rompre le contrat silencieusement.

C'est le flux de travail honnête : dupliquez la requête, changez uniquement l'ID du modèle, et laissez les assertions vous dire si l'échange est sûr. Téléchargez Apidog si vous voulez exécuter la comparaison avec vos propres appels Gemini.

FAQ

Gemini 3.6 Flash est-il un remplacement direct de 3.5 Flash ? Mécaniquement, oui. Vous changez l'ID du modèle de gemini-3.5-flash à gemini-3.6-flash et le reste de la requête reste identique. Vous devriez quand même relancer vos évaluations et vos tests de régression avant la production, car le phrasé et la structure des sorties peuvent varier entre les versions.

Le prix d'entrée a-t-il changé ? Non. L'entrée reste à 1,50 $ par million de jetons sur les deux modèles. Seul le prix de sortie a changé, passant de 9,00 $ à 7,50 $ par million.

Pourquoi le modèle est-il 3.6 alors que les variantes Lite et Cyber sont 3.5 ? Google n'a mis à jour que le modèle Flash principal à 3.6 lors de cette révision. Flash-Lite et Flash Cyber ont été livrés en versions 3.5. Les numéros de version ne sont pas synchronisés sur toute la gamme, lisez donc l'ID du modèle, et pas seulement le numéro de famille.

Ma facture baissera-t-elle certainement de 31 % ? Non, ce chiffre est un exemple illustratif pour une charge de travail à forte sortie. Vos économies réelles dépendent de votre ratio jetons d'entrée/jetons de sortie. Les tâches à forte sortie économisent le plus ; les tâches à forte lecture économisent moins car la réduction s'applique à la sortie.

3.5 Flash est-il toujours utilisable ? Oui. Il reste disponible via l'API. Si vous l'avez validé et que vous ne pouvez pas encore refaire les tests, le bloquer est un choix raisonnable à court terme. Planifiez la migration pour votre prochaine fenêtre de test.

Pour la génération précédente que ce modèle remplace, consultez qu'est-ce que Gemini 3.5.

Pour la plupart des équipes, les calculs et les benchmarks sont d'accord : changez l'ID du modèle pour gemini-3.6-flash, exécutez vos évaluations et un rapide test de régression dans Apidog, et adoptez le modèle moins cher et plus efficace. Gardez 3.5 Flash épinglé uniquement là où un verrou de validation vous y contraint, et migrez dès que cette fenêtre s'ouvre.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API