Google a lancé Gemini 3.7 Flash le 13 août 2026, trois semaines après 3.6 Flash, le qualifiant de « notre modèle de travail le plus intelligent ». Les écarts de référence confirment cette confiance. DeepSWE passe de 49,0 % à 65,3 %, AutomationBench grimpe de 17,0 % à 30,4 %, et le prix de lancement de 0,75 $ par million de jetons d'entrée est la moitié de ce que 3.6 Flash coûtait au lancement.
Cette combinaison soulève une question à laquelle chaque équipe API est confrontée ce trimestre : un modèle Gemini rapide et bon marché peut-il désormais couvrir les charges de travail que vous acheminiez vers Claude ou GPT ? Cette comparaison s'en tient à ce que vous pouvez vérifier : les fenêtres contextuelles, les modalités, le support des outils, la structure tarifaire et les schémas de requête avec lesquels vous vous intégrerez ; là où les chiffres des concurrents ne sont pas comparables, cela est précisé. Et parce que la réponse honnête à « quelle API devriez-vous utiliser » est « celle qui fonctionne le mieux sur votre charge de travail », la dernière section montre comment exécuter les trois côte à côte dans Apidog avant de vous engager.
Si vous choisissez finalement Gemini et souhaitez les étapes de configuration, le guide de démarrage rapide de l'API Gemini 3.7 Flash couvre les clés, les points d'accès et les premières requêtes.
En bref
- Gemini 3.7 Flash : Contexte de 1M de jetons, limite de sortie de 64k, entrée native via texte, image, vidéo, audio et PDF, plus l'appel de fonctions, la recherche comme outil et l'utilisation d'ordinateurs.
- Prix de lancement : 0,75 $ par million de jetons d'entrée et 3,75 $ par million de jetons de sortie jusqu'au 31 décembre 2026, doublant à 1,50 $ et 7,50 $ le 1er janvier 2027.
- Gains de codage par rapport à 3.6 Flash : DeepSWE v1.1 de 49,0 % à 65,3 %, FrontierCode 1.1 Main de 34,4 % à 43,6 %, AutomationBench de 17,0 % à 30,4 %.
- Claude Fable 5 et GPT-5.6 Sol restent en tête pour la profondeur de codage de pointe et la cohérence des agents, à un prix par jeton plusieurs fois supérieur.
- Les trois fournisseurs utilisent des schémas de requête incompatibles : Google
contents, Anthropic Messages, OpenAImessages. - Les benchmarks prédisent des moyennes, pas votre charge de travail ; réalisez un test comparatif de 20 prompts sur les trois APIs avant de vous décider.
Comment lire cette comparaison
Il ne s'agit pas d'une confrontation entre modèles de pointe. Claude Fable 5 et GPT-5.6 Sol sont des modèles phares dont le prix reflète une capacité maximale ; Gemini 3.7 Flash est un modèle de travail dont le prix est adapté au volume. Google le met à disposition pendant que son modèle phare est en attente : Axios a rapporté que Gemini 3.5 Pro reste retardé, avec des mises à jour Flash qui arrivent avant.
La comparaison vaut toujours la peine d'être faite : les scores de lancement de 3.7 Flash chevauchent désormais la fourchette où se trouvaient les modèles de pointe il y a quelques semaines, ce qui modifie le calcul du routage même si les modèles phares restent en avance.
Deux mises en garde s'appliquent tout au long. Premièrement, chaque chiffre ici est une donnée fournie par le fournisseur lors de la semaine de lancement ; traitez-les comme indicatifs jusqu'à ce que des évaluations indépendantes soient disponibles. Deuxièmement, les variantes de benchmarks comptent. Google rapporte FrontierCode 1.1 Main, tandis que les chiffres publiés pour Claude et GPT lors de leurs lancements provenaient du split Extended, donc ces colonnes ne partagent jamais de tableau ici.
Spécifications côte à côte
La fiche technique montre que Gemini 3.7 Flash se défend bien face à des modèles qui coûtent bien plus cher. Tous les détails techniques se trouvent sur la page du modèle Gemini Flash.
| Gemini 3.7 Flash | Claude Fable 5 | GPT-5.6 Sol | |
|---|---|---|---|
| Développeur | Anthropic | OpenAI | |
| Fenêtre contextuelle | 1M de jetons | 1M de jetons | 1.05M de jetons |
| Limite de sortie | 64k jetons | Voir la documentation du fournisseur | Voir la documentation du fournisseur |
| Modalités d'entrée | Texte, image, vidéo, audio, PDF | Texte, image | Texte, image |
| Sortie | Texte | Texte | Texte |
| Support des outils | Appel de fonctions, recherche comme outil, utilisation d'ordinateurs | Appel de fonctions, utilisation d'outils | Appel de fonctions, outils intégrés |
| Schéma de requête | Google contents + generationConfig |
Anthropic Messages | OpenAI messages |
| Authentification | En-tête x-goog-api-key |
En-tête x-api-key + version |
Jeton Bearer |
| Tarification (par 1M de jetons) | 0,75 $ entrée / 3,75 $ sortie intro ; 1,50 $ / 7,50 $ à partir de janv. 2027 | Niveau de pointe premium | Niveau de pointe premium |
| Positionnement | Modèle de travail à haut volume | Travail d'agent à long terme | Profondeur de codage à l'échelle d'un dépôt |
Les fenêtres contextuelles sont désormais effectivement égales, donc cette ligne ne décide plus rien. Les lignes des modalités et des prix sont celles où les trois divergent, et les sections suivantes les détaillent toutes les deux.
Tâches de codage et d'agent
Les principales affirmations de Google pour 3.7 Flash sont axées sur les développeurs : meilleure capacité de débogage, plus apte à produire du code déployable du premier coup, et plus diligent dans la planification multi-étapes et les appels d'outils. Les chiffres génération-sur-génération, confirmés dans la couverture de lancement de 9to5Google, étayent ces affirmations.
| Benchmark | Gemini 3.6 Flash | Gemini 3.7 Flash |
|---|---|---|
| DeepSWE v1.1 (correctifs à l'échelle du dépôt) | 49.0% | 65.3% |
| FrontierCode 1.1 Main | 34.4% | 43.6% |
| WebDev Arena (Elo) | 1538 | 1588 |
| GDP.pdf (raisonnement documentaire) | 22.0% | 34.0% |
| AutomationBench (tâches d'agent) | 17.0% | 30.4% |
Le bond d'AutomationBench est celui que les développeurs d'agents devraient examiner attentivement. Presque doubler un benchmark agentique en trois semaines suggère que l'affirmation « réfléchit plus diligemment aux appels d'outils » est plus que du marketing.
Comment cela se compare-t-il à Claude et GPT ? Sur DeepSWE v1.1, le niveau de pointe a affiché 73,0 % pour GPT-5.6 Sol Max à son lancement, avec Grok 4.6 à 65,9 % ; notre comparaison Grok 4.6 vs GPT-5.6 Sol vs Claude Fable 5 couvre ces résultats en détail. Sol Max conserve une réelle avance sur la correction de bugs à l'échelle d'un dépôt, et la force de Claude Fable 5 est sa cohérence à travers les évaluations de codage et d'agents, où il est rarement pire que deuxième. Gemini 3.7 Flash n'a pas comblé cet écart. Il est arrivé à portée de main à une fraction du coût, ce qui est une proposition de valeur différente de « le meilleur score gagne ».
Deux chiffres spécialisés complètent le tableau : 90,7 % sur Harvey LAB-AA pour le raisonnement juridique, et 97,0 % sur la récupération de 128k aiguilles, le score qui rend la fenêtre de 1M fiable en pratique.
Entrée multimodale
C'est la différence structurelle la plus nette entre les trois API. Gemini 3.7 Flash accepte du texte, des images, des vidéos, de l'audio et des PDF dans le même tableau contents via un seul point d'accès. Claude et GPT gèrent bien le texte et les images, mais les charges de travail vidéo et audio passent généralement par des étapes de transcription ou de prétraitement séparées avant que le texte n'atteigne le modèle.
Si votre produit touche des documents, le bond de 22,0 % à 34,0 % sur GDP.pdf est le signal pertinent : ce benchmark mesure le raisonnement sur des PDF réels avec des tableaux, des scans et des mises en page cassées. Alimenter un contrat ou une facture directement dans le modèle sans pipeline OCR supprime une étape entière sujette aux erreurs de votre architecture.
La règle pratique : pour le chat texte et image, la modalité est un point d'égalité. Pour les images vidéo, les enregistrements d'appels ou les piles de documents, Gemini est le seul des trois où le pipeline d'entrée se résume à un seul appel API.
Philosophie de tarification
Les trois fournisseurs utilisent des stratégies de tarification différentes, et la différence indique à qui s'adresse chaque modèle.
Google fixe le prix de 3.7 Flash pour la conquête de parts de marché. Le tarif de lancement de 0,75 $ par million de jetons d'entrée et 3,75 $ par million de jetons de sortie est valable jusqu'au 31 décembre 2026, et il représente la moitié du coût de 3.6 Flash au lancement. Le 1er janvier 2027, le tarif standard prendra le relais à 1,50 $ et 7,50 $, soit un doublement net. Cette date limite est une fonction de contrainte : Google veut que votre trafic soit engagé avant la réinitialisation du prix. Le calcul complet des jetons, avec des exemples concrets pour les chatbots et les boucles d'agents, se trouve dans notre analyse détaillée des prix de Gemini 3.7 Flash.
Anthropic et OpenAI tarifient leurs modèles phares comme des capacités premium. Les tarifs varient selon les niveaux et changent souvent, mais la forme est constante : les jetons de sortie des modèles de pointe coûtent plusieurs fois le prix de Flash, et les deux fournisseurs vendent le premium sur moins d'échecs, et non sur des jetons moins chers. Anthropic ajoute un paramètre d'effort qui échange le coût contre la capacité au sein d'un modèle ; OpenAI classe par taille de modèle à la place.
La philosophie qui l'emporte dépend de votre économie des échecs. Un modèle bon marché qui échoue à une tâche génère un travail de réparation coûtant plus cher que les jetons économisés ; un modèle premium ne justifie son prix que s'il prévient ces échecs. Comparez le coût par tâche accomplie, et non le coût par jeton, et réévaluez après le 1er janvier 2027, lorsque les tarifs de Gemini doubleront.
Ergonomie de l'API
Les différences de schémas sont la taxe que vous payez lorsque vous changez de fournisseur ou que vous routez entre eux. Voici la même requête en un tour sous les trois formes.
L'API Gemini de Google enveloppe les tours dans contents avec parts, et les paramètres de génération se trouvent dans generationConfig :
{
"contents": [
{ "role": "user", "parts": [{ "text": "Summarize this changelog." }] }
],
"generationConfig": { "temperature": 0.3, "maxOutputTokens": 1024 }
}
L'API Messages d'Anthropic place le modèle et un max_tokens requis au niveau supérieur, avec l'invite système comme son propre champ :
{
"model": "claude-fable-5",
"max_tokens": 1024,
"system": "You summarize changelogs in three bullets.",
"messages": [{ "role": "user", "content": "Summarize this changelog." }]
}
OpenAI intègre l'invite système dans le tableau messages lui-même :
{
"model": "gpt-5.6-sol",
"messages": [
{ "role": "system", "content": "You summarize changelogs in three bullets." },
{ "role": "user", "content": "Summarize this changelog." }
]
}
Le cas du texte semble suffisamment proche pour être géré avec un adaptateur. L'utilisation d'outils est l'endroit où l'abstraction fuit : Google déclare les fonctions dans un tableau tools avec functionDeclarations et contrôle l'invocation via toolConfig, Anthropic utilise son propre schéma d'outils avec différents blocs de réponse, et OpenAI a de nouveau son propre format de fonction. Les formes de morceaux de streaming diffèrent également, même si tous trois utilisent des événements envoyés par le serveur. Les passerelles et les points d'accès de compatibilité normalisent la forme de chat de base, mais les parties multimodales et les appels d'outils survivent rarement à la traduction proprement ; nous avons documenté le même problème chez les différents fournisseurs dans la comparaison des formats d'API pour DeepSeek V4 Pro.
Le conseil d'intégration est peu glamour : gardez une fine couche de fournisseur entre votre produit et le modèle. Les équipes qui le font changent de fournisseur en quelques jours au lieu de trimestres.
Quand choisir lequel
Benchmarks et schémas condensés en une liste de décisions :
- Choisissez Gemini 3.7 Flash pour le trafic d'agents à volume élevé, les pipelines multimodaux qui ingèrent des vidéos, de l'audio ou des PDF, et toute charge de travail où le coût par appel plafonne la marge du produit. C'est aussi le bac à sable évident pour les expériences d'utilisation d'ordinateurs ; notre analyse de l'utilisation d'ordinateurs par rapport aux API structurées couvre le moment où cette capacité est rentable.
- Choisissez Claude Fable 5 pour le travail autonome à long terme : sessions d'agents de plusieurs heures, tâches où une étape déraillée fait perdre une heure de progression, et les charges de travail qui récompensent le réglage coût-capacité du paramètre d'effort.
- Choisissez GPT-5.6 Sol pour les agents de codage à l'échelle d'un dépôt qui opèrent sur de grandes bases de code existantes avec une supervision minimale, et pour les équipes qui souhaitent l'écosystème tiers le plus riche autour de l'API.
- Choisissez un routeur si vous le pouvez. Le modèle sur lequel la plupart des équipes de production convergent : un modèle par défaut bon marché gère l'essentiel du trafic, et les 10 % les plus difficiles sont acheminés vers un modèle de pointe. Les chiffres de lancement de Gemini 3.7 Flash en font un défaut crédible dans cette architecture, ce qui n'était pas le cas de 3.6 Flash.
Testez les trois fournisseurs dans un seul espace de travail Apidog
La comparaison qui compte est celle que vous exécutez sur vos propres prompts. Apidog contient des collections pour Google, Anthropic et OpenAI dans un seul projet, de sorte que le test comparatif prend un après-midi au lieu d'un sprint :
- Créez trois environnements, un par fournisseur, chacun ayant sa propre URL de base et son en-tête d'authentification :
x-goog-api-keypour Gemini,x-api-keypour Anthropic, un jeton Bearer pour OpenAI. Changer de fournisseur devient un menu déroulant, pas un changement de code. - Collectez 20 prompts réels de votre produit. Incluez votre prompt système, vos définitions d'outils si vous utilisez l'appel de fonctions, et au moins cinq cas connus difficiles.
- Ajoutez des assertions pour ce qui vous importe : validité de la réponse, nombre de jetons du bloc d'utilisation de chaque fournisseur, seuils de latence. Pour les charges de travail d'appel d'outils, affirmez que le JSON d'appel d'outil s'analyse et correspond à votre schéma ; les modèles échouent bien plus souvent à ce niveau que dans le texte.
- Exécutez chaque suite trois fois par modèle. La sortie des LLM varie ; trois exécutions exposent la variance qu'une seule démonstration cache. Comparez le taux de succès et le coût par tâche réussie.
- Conservez la suite. Les nouvelles versions de modèles arrivent maintenant à quelques semaines d'intervalle ; 3.7 Flash a suivi 3.6 de trois semaines. Les équipes disposant d'un banc d'essai permanent prennent des décisions en un après-midi plutôt que par anecdote.
FAQ
Gemini 3.7 Flash est-il meilleur que Claude ou GPT pour le codage ?
Pas au plus haut niveau. GPT-5.6 Sol Max a obtenu 73,0 % sur DeepSWE v1.1 contre 65,3 % pour 3.7 Flash, et Claude Fable 5 est en tête pour la cohérence à travers les benchmarks de codage et d'agents. Ce qui a changé, c'est le rapport prix/score : 3.7 Flash atteint des scores qui se situaient en territoire de pointe il y a quelques semaines, tout en facturant des tarifs de modèle de travail.
Combien Gemini 3.7 Flash est-il moins cher que Claude ou GPT ?
Jusqu'au 31 décembre 2026, Gemini 3.7 Flash coûte 0,75 $ par million de jetons d'entrée et 3,75 $ par million de jetons de sortie. Les modèles de pointe de Claude et GPT facturent plusieurs fois plus par jeton ; consultez les pages de tarification en direct avant de modéliser vos coûts. N'oubliez pas que le tarif de lancement doublera le 1er janvier 2027.
Puis-je appeler Gemini 3.7 Flash via le SDK OpenAI ?
Google expose un point d'accès compatible OpenAI qui gère la forme de chat de base, de sorte qu'un échange de base_url fonctionne pour le texte en entrée et en sortie. Les parties multimodales et les appels d'outils ne se mappent pas proprement, utilisez donc le schéma natif contents pour tout ce qui dépasse le simple chat. Le tutoriel d'appel de fonctions pour Gemini 3.7 Flash montre le format d'outil natif de bout en bout.
Gemini 3.7 Flash prend-il en charge l'utilisation d'ordinateurs et l'ancrage de la recherche ?
Oui. Il est livré avec l'appel de fonctions, la recherche comme outil et l'utilisation d'ordinateurs, ainsi que des garde-fous de sécurité CBRN et cyber mis à jour. L'amélioration d'AutomationBench de 17,0 % à 30,4 % est le proxy publié le plus proche de l'amélioration de la boucle agentique.
Où Gemini 3.7 Flash est-il disponible ?
L'API Gemini avec une clé AI Studio, Google AI Studio, l'application Gemini, Gemini Spark pour les abonnés AI Pro et Ultra, Google Antigravity, Android Studio et Gemini Enterprise, dans plus de 160 pays. Les équipes de production GCP peuvent l'appeler via Vertex AI avec OAuth au lieu d'une clé API.
Où 3.7 Flash s'intègre dans votre pile
La mauvaise conclusion de cette comparaison est que « Gemini a rattrapé la frontière ». Ce n'est pas le cas ; Sol possède toujours la profondeur de codage à l'échelle d'un dépôt et Fable 5 possède toujours la fiabilité à long terme. La bonne conclusion est que le seuil a bougé : les prix des modèles de travail permettent désormais d'obtenir des scores qui justifiaient des tarifs premium il y a un trimestre, ce qui réinitialise le comportement par défaut dans toute architecture de routeur. Les modèles de classe Flash gèrent l'essentiel, les modèles phares gèrent les escalades.
La décision est mesurable, alors mesurez-la. Connectez les trois fournisseurs à un seul espace de travail, exécutez vos prompts réels avec des assertions, et laissez le coût par tâche accomplie choisir le gagnant. Téléchargez Apidog gratuitement, configurez les trois environnements, et vous aurez des preuves au niveau du fournisseur avant la fin de la période de tarification de lancement.

