Gemini 4 Argon domine 13 des 19 lignes du tableau de lancement de Google, fait match nul sur 1 (CWE-bench v1, avec GPT-6 Astra) et est en retrait sur 5 : FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 et OSWorld-2.0. Le problème est l'accès. Argon n'est disponible aujourd'hui qu'aux défenseurs du programme Fairwind, donc personne en dehors de la liste de partenaires de Google et de quelques organisations de benchmark ne peut encore reproduire ces chiffres.
Ci-dessous : le tableau complet avec ceux qui ont mesuré chaque ligne, les cinq défaites, les petits caractères, les scores cyber, les classements tiers, et comment construire votre propre évaluation dans Apidog avant l'ouverture de l'accès. Pour un aperçu du modèle, commencez par ce qu'est Gemini 4 Argon. Pour la décision d'achat, consultez Argon vs GPT-6 Astra vs Claude Opus 5.5.
Le tableau complet, avec qui a mesuré chaque ligne
Ce sont des résultats rapportés par Google depuis l'article de lancement et le PDF de méthodologie d'évaluation, qui est intitulé "résultats en date d'octobre 2026". Google a calculé lui-même 10 des 19 scores d'Argon ; les 9 autres proviennent de classements publics. Les chiffres des concurrents proviennent de ces classements, des propres tests de Google, ou des cartes système et des articles de blog des fournisseurs, et les harnais diffèrent selon la ligne. Le gras indique le leader de la ligne.
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | Qui l'a mesuré |
|---|---|---|---|---|---|
| Indice Vals | 68,9% | 63,1% | 65,8% | 67,0% | Vals AI |
| AutomationBench | 51,3% | 41,4% | 31,4% | 42,5% | Classement Zapier (ensemble privé) |
| Vals Finance Agent v2 | 65,4% | 53,5% | 58,9% | 58,6% | Vals AI |
| Harvey Legal Agent | 19,6% | 5,4% | 6,7% | 3,8% | Vals AI |
| DeepSWE v1.1 | 77,9% | 74,1% | 67,4% | 74,2% | Argon auto-calculé ; classement Astra ; cartes système Anthropic |
| FrontierSWE v2 | 55,0% | 65,5% | 56,3% | 62,3% | Classement Proximal |
| Vibe Code Bench | 91,9% | 89,6% | 90,3% | 90,3% | Vals AI |
| Terminal-bench 4.0 | 57,4% | 58,2% | 57,9% | 66,4% | Argon auto-calculé ; classement des concurrents |
| PostTrainBench | 45,3% | 44,3% | 40,2% | 49,3% | Auto-calculé pour tous les modèles |
| Terminal-Bench Science 0.1 | 57,6% | 68,1% | 52,6% | 63,3% | Argon auto-calculé ; classement des concurrents |
| LABBench 2 | 88,8% | 85,4% | 68,6% | 73,1% | Auto-calculé pour tous les modèles |
| RiemannBench | 76,0% | 72,0% | 65,6% | 69,6% | Classement Surge |
| GraphWalks jusqu'à 128K | 99,7% | 98,7% | 91,4% | 90,6% | Auto-calculé pour tous les modèles |
| GraphWalks 256K à 1M | 84,2% | 71,8% | 65,0% | 66,8% | Auto-calculé pour tous les modèles |
| Agent’s Last Exam | 39,5% | 34,2% | n/r | 38,2% | Argon auto-calculé ; classement des concurrents |
| OSWorld-2.0 (hors ligne) | 69,2% | 72,6% | n/r | n/r | Argon auto-calculé ; Astra depuis l'article de blog d'OpenAI |
| Chartography | 71,6% | 71,0% | 46,2% | 66,3% | Classement Surge |
| LVBench | 91,7% | 87,5% | 79,7% | 83,7% | Auto-calculé pour tous les modèles |
| CWE-bench v1 | 68,0% | 68,0% | 58,0% | 67,0% | Classement public |
n/r = non rapporté. Grok 4.7, qui ne figure pas dans le tableau de Google, obtient également un score de 68% dans le classement CWE-bench, ce qui en fait un match nul à trois.
Triées par source, 9 lignes proviennent de classements publics pour chaque modèle (Vals AI, Zapier, Proximal, Surge et CWE-bench). Argon domine 7 de ces 9 lignes et fait match nul sur 1. Google a exécuté lui-même 5 lignes pour les quatre modèles, et Argon en domine 4. Les 5 autres associent un score Argon exécuté par Google à des chiffres concurrents provenant d'ailleurs, et c'est là qu'Argon perd le plus : 3 de ses 5 défaites se trouvent dans ces lignes mixtes. Si l'auto-calcul flattait Argon, on s'attendrait au contraire.
Là où Argon est en retrait, et pourquoi c'est important pour le codage agentique
- FrontierSWE v2 : 55,0% contre 65,5% pour Astra. Argon est dernier des quatre, derrière Fable 5.1 (56,3%) et Opus 5.5 (62,3%), sur un classement qui a noté tous les modèles.
- Terminal-bench 4.0 : 57,4% contre 66,4% pour Opus 5.5. Encore dernier, bien qu'Astra et Fable 5.1 soient à un point près.
- PostTrainBench : 45,3% contre 49,3% pour Opus 5.5. Deuxième place, sur une ligne que Google a exécutée pour tous les modèles.
- Terminal-Bench Science 0.1 : 57,6% contre 68,1% pour Astra. Troisième, seulement devant Fable 5.1. Google a exécuté la tentative d'Argon avec un délai d'attente de vérificateur de 6x.
- OSWorld-2.0 (hors ligne) : 69,2% contre 72,6% pour Astra. Anthropic ne rapporte qu'un score combiné en ligne et hors ligne, donc aucun modèle Claude n'apparaît.
Le codage agentique se partage en 2 pour 2. Argon remporte DeepSWE v1.1 et Vibe Code Bench, puis termine dernier sur FrontierSWE v2 et Terminal-bench 4.0. La victoire DeepSWE mélange les harnais : Argon a fonctionné sur un harnais d'agent mini-swe, le chiffre d'Astra provient du classement public, et les chiffres de Claude proviennent des cartes système. Vibe Code Bench est plus clair, puisque Vals AI a noté les quatre, mais la marge est de 1,6 points.
Si votre charge de travail concerne des agents très dépendants du terminal ou des tâches de référentiel longues, pondérez ces deux dernières lignes au-delà du nombre de titres. Astra détient l'avance sur FrontierSWE ; notre prise en main de GPT-6 Astra montre ce qu'est l'utilisation de ce modèle aujourd'hui. Du côté d'Anthropic, la répartition des benchmarks de Claude Fable 5.1 couvre les propres chiffres de lancement de Fable.
Bloomberg rapporte que des employés anonymes de Google ayant un accès affirment qu'Argon est décevant pour certains travaux de codage et de conception front-end par rapport à ses scores de benchmark. Google a qualifié cette caractérisation d'inexacte.
Mises en garde méthodologiques qui modifient la lecture du tableau
- Effort maximal des deux côtés. Argon a fonctionné "avec l'API Gemini avec les réglages de réflexion les plus élevés". Pour Astra, Fable 5.1 et Opus 5.5, Google utilise par défaut les "réglages de réflexion/raisonnement maximum disponibles". Cela compare les plafonds, pas le comportement par défaut ou le coût.
- Images LVBench. Google a exécuté LVBench lui-même pour les quatre modèles, sans outils. Gemini a échantillonné la vidéo à 1 FPS. Astra a obtenu 800 images, Fable 5.1 en a obtenu 300 et Opus 5.5 en a obtenu 600, "en raison des limitations de l'API". Les modèles n'ont pas reçu d'entrées identiques.
- OSWorld meilleur sur trois. Le score d'Argon est "maximisé sur 3 exécutions avec une seule tentative par exécution", c'est le meilleur résultat plutôt qu'une moyenne.
- Fenêtre de l'Agent's Last Exam. Argon a fonctionné sur le harnais ALE-Claw avec une fenêtre de 5 heures.
- Filtres de sécurité activés. L'Agent's Last Exam et OSWorld ont été exécutés avec des filtres de sécurité activés, et les réponses signalées sont revenues sous forme de chaînes vides. Si quoi que ce soit, cela va à l'encontre d'Argon.
Les lignes cyber de la page cyber de DeepMind
La page cyber de DeepMind ajoute quatre scores au-delà du tableau de lancement :
| Éval cyber | Gemini 4 Argon | Comparaison |
|---|---|---|
| Découverte de vulnérabilités réelles | 85,8% | Gemini 3.8 Flash Cyber 71,0% |
| Benchmark de test de pénétration Wiz | 70,9% | Gemini 3.8 Flash Cyber 58,2% |
| Succès d'attaque Gray Swan IPI (k=15, plus bas est mieux) | 0,7% | Le plus bas du tableau ; Kimi K3 le plus élevé à 52,7% |
| CWE-bench v1 | 68% | Égalité à trois avec Grok 4.7 et GPT-6 Astra ; Opus 5.5 à 67% |
L'évaluation des vulnérabilités a utilisé un harnais interne Antigravity "non spécialisé dans la cybersécurité", avec accès au code source. Le test Wiz donne au modèle "uniquement accès au site web en cours d'exécution et à son comportement public, sans le code source de l'application". Les deux comparaisons principales sont effectuées par rapport au modèle cyber précédent de Google, pas aux concurrents. Notre explicatif sur la cyberdéfense d'Argon couvre ce que cela signifie pour les API que vous exécutez.
Classements tiers
Ces organisations ont publié les scores quelques minutes après le lancement, elles avaient donc un accès pré-lancement.
- Artificial Analysis classe Gemini 4 Argon (Élevé) à un indice d'intelligence de 53, #8 sur 223. Ce classement compte chaque paramètre de raisonnement séparément. Par modèle distinct, Argon fait match nul avec Fable 5.1 et GPT-6 Astra et se situe derrière Opus 5.5 (58 au maximum) et Sonnet 5.5 (56 au maximum). AA rapporte un taux d'hallucination de 15% sur AA-Omniscience (Astra au maximum, 51%), avec une précision de 50% contre 63%. L'exécution de l'indice a coûté 1,99 $ par tâche, avec environ 62K jetons de sortie par tâche contre environ 27K pour Astra au maximum. Artificial Analysis ne montre aucune donnée de vitesse ou de latence.
- Vals AI place Argon à 68,90% sur l'indice Vals, #1 sur 41 et le premier modèle Gemini à le surpasser, à 15,68 $ par test. Vals AI indique une sortie maximale de 262K pour la configuration testée, en dessous des 1M annoncés par Google.
- Arena classe Argon #1 sur Texte à 1525, marqué Préliminaire sur 4 942 votes, et #8 sur WebDev.
Pourquoi les médias publient 12, 13 et 14 victoires
Les médias ont publié trois décomptes de victoires différents. Voici le nouveau décompte des 19 lignes de Google :
| Compté contre | Victoires d'Argon | Égalités | Défaites d'Argon | Non rapporté |
|---|---|---|---|---|
| Meilleur des trois rivaux | 13 | 1 | 5 | 0 |
| GPT-6 Astra seulement | 14 | 1 | 4 | 0 |
| Claude Opus 5.5 seulement | 14 | 0 | 4 | 1 |
| Claude Fable 5.1 seulement | 15 | 0 | 2 | 2 |
Un 13 est juste face à l'ensemble du domaine. Un 14 est juste en face à face contre Astra ou Opus 5.5. Un 12 ne correspond à aucune de ces configurations des 19 lignes complètes, il faut donc vérifier quelles lignes cette source a comptées. Les marges varient également : Harvey Legal Agent (19,6% contre 6,7%) est large ; Chartography est de 0,6 points.
Comment exécuter votre propre évaluation le jour de l'ouverture de l'accès
Les benchmarks décrivent le harnais de Google ; vos prompts décrivent votre produit. Créez l'évaluation aujourd'hui sur un modèle que vous pouvez appeler, puis pointez-la sur Argon avec un seul changement.
- Choisissez de vrais prompts qui correspondent aux lignes qui vous intéressent : une correction de référentiel, une tâche de terminal, une question sur un document long.
- Dans Apidog, créez un environnement avec
GEMINI_API_KEYetGEMINI_MODELdéfinis surgemini-3.8-flash. Google n'a pas publié l'ID de modèle d'Argon, cette variable est donc la seule valeur que vous changerez. - Enregistrez chaque prompt comme une requête qui lit le modèle depuis
{{GEMINI_MODEL}}, regroupée dans un scénario de test. - Ajoutez des assertions sur la sortie (statut, champs requis, contenu attendu) et sur
usageMetadata, y compris un plafond surthoughtsTokenCountdimensionné à votre limite de coût. - Exécutez le scénario sur 3.8 Flash maintenant et conservez le rapport comme votre ligne de base.
Le jour où l'ID d'Argon sera livré, échangez la variable et réexécutez. Google déclare que "tous les nouveaux modèles" seront lancés sur l'API Interactions, alors enregistrez également une version Interactions de chaque requête. Notre comparaison Argon vs Gemini 3.8 Flash couvre ce à quoi s'attendre en termes de prix et de limites.
FAQ
- Les benchmarks de Gemini 4 Argon sont-ils vérifiés indépendamment ? En partie. Neuf des 19 lignes proviennent de classements publics pour chaque modèle, et Artificial Analysis, Vals AI et Arena ont publié leurs propres résultats. Les autres sont exécutés par Google pour Argon.
- Quel est le score DeepSWE de Gemini 4 Argon ? 77,9% sur DeepSWE v1.1, devant Opus 5.5 (74,2%) et Astra (74,1%). L'exécution d'Argon a utilisé un harnais d'agent mini-swe, tandis que les chiffres des concurrents proviennent d'un classement et de cartes système.
- Argon bat-il GPT-6 Astra sur les benchmarks ? En face à face dans le tableau de Google, Argon gagne 14 lignes, fait match nul sur 1 et en perd 4. Sur Artificial Analysis, ils sont à égalité à 53.
- Puis-je réexécuter ces benchmarks moi-même ? Pas encore. Argon est limité aux partenaires Fairwind, et Google n'a pas donné de date de sortie publique ; notre suivi de la date de sortie d'Argon suit le déploiement.
Étape suivante
Construisez le scénario maintenant, exécutez-le sur 3.8 Flash, et conservez le rapport. Quand Argon sera disponible, vous aurez vos propres chiffres quelques minutes après l'échange. Téléchargez Apidog pour le configurer.
