Benchmarks Gemini 4 Argon : Les 19 tests complets, comment Google les a exécutés et les 5 qu'il perd

Benchmarks Argon de Gemini 4 : les 19 lignes indiquant l'auteur de chaque mesure, les 5 qu'il perd, les mises en garde méthodologiques de Google, et les scores AA, Vals et Arena.

INEZA Felin-Michel

INEZA Felin-Michel

2 October 2026

Benchmarks Gemini 4 Argon : Les 19 tests complets, comment Google les a exécutés et les 5 qu'il perd

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Gemini 4 Argon domine 13 des 19 lignes du tableau de lancement de Google, fait match nul sur 1 (CWE-bench v1, avec GPT-6 Astra) et est en retrait sur 5 : FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 et OSWorld-2.0. Le problème est l'accès. Argon n'est disponible aujourd'hui qu'aux défenseurs du programme Fairwind, donc personne en dehors de la liste de partenaires de Google et de quelques organisations de benchmark ne peut encore reproduire ces chiffres.

Ci-dessous : le tableau complet avec ceux qui ont mesuré chaque ligne, les cinq défaites, les petits caractères, les scores cyber, les classements tiers, et comment construire votre propre évaluation dans Apidog avant l'ouverture de l'accès. Pour un aperçu du modèle, commencez par ce qu'est Gemini 4 Argon. Pour la décision d'achat, consultez Argon vs GPT-6 Astra vs Claude Opus 5.5.

Le tableau complet, avec qui a mesuré chaque ligne

Ce sont des résultats rapportés par Google depuis l'article de lancement et le PDF de méthodologie d'évaluation, qui est intitulé "résultats en date d'octobre 2026". Google a calculé lui-même 10 des 19 scores d'Argon ; les 9 autres proviennent de classements publics. Les chiffres des concurrents proviennent de ces classements, des propres tests de Google, ou des cartes système et des articles de blog des fournisseurs, et les harnais diffèrent selon la ligne. Le gras indique le leader de la ligne.

Benchmark Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 Qui l'a mesuré
Indice Vals 68,9% 63,1% 65,8% 67,0% Vals AI
AutomationBench 51,3% 41,4% 31,4% 42,5% Classement Zapier (ensemble privé)
Vals Finance Agent v2 65,4% 53,5% 58,9% 58,6% Vals AI
Harvey Legal Agent 19,6% 5,4% 6,7% 3,8% Vals AI
DeepSWE v1.1 77,9% 74,1% 67,4% 74,2% Argon auto-calculé ; classement Astra ; cartes système Anthropic
FrontierSWE v2 55,0% 65,5% 56,3% 62,3% Classement Proximal
Vibe Code Bench 91,9% 89,6% 90,3% 90,3% Vals AI
Terminal-bench 4.0 57,4% 58,2% 57,9% 66,4% Argon auto-calculé ; classement des concurrents
PostTrainBench 45,3% 44,3% 40,2% 49,3% Auto-calculé pour tous les modèles
Terminal-Bench Science 0.1 57,6% 68,1% 52,6% 63,3% Argon auto-calculé ; classement des concurrents
LABBench 2 88,8% 85,4% 68,6% 73,1% Auto-calculé pour tous les modèles
RiemannBench 76,0% 72,0% 65,6% 69,6% Classement Surge
GraphWalks jusqu'à 128K 99,7% 98,7% 91,4% 90,6% Auto-calculé pour tous les modèles
GraphWalks 256K à 1M 84,2% 71,8% 65,0% 66,8% Auto-calculé pour tous les modèles
Agent’s Last Exam 39,5% 34,2% n/r 38,2% Argon auto-calculé ; classement des concurrents
OSWorld-2.0 (hors ligne) 69,2% 72,6% n/r n/r Argon auto-calculé ; Astra depuis l'article de blog d'OpenAI
Chartography 71,6% 71,0% 46,2% 66,3% Classement Surge
LVBench 91,7% 87,5% 79,7% 83,7% Auto-calculé pour tous les modèles
CWE-bench v1 68,0% 68,0% 58,0% 67,0% Classement public

n/r = non rapporté. Grok 4.7, qui ne figure pas dans le tableau de Google, obtient également un score de 68% dans le classement CWE-bench, ce qui en fait un match nul à trois.

Triées par source, 9 lignes proviennent de classements publics pour chaque modèle (Vals AI, Zapier, Proximal, Surge et CWE-bench). Argon domine 7 de ces 9 lignes et fait match nul sur 1. Google a exécuté lui-même 5 lignes pour les quatre modèles, et Argon en domine 4. Les 5 autres associent un score Argon exécuté par Google à des chiffres concurrents provenant d'ailleurs, et c'est là qu'Argon perd le plus : 3 de ses 5 défaites se trouvent dans ces lignes mixtes. Si l'auto-calcul flattait Argon, on s'attendrait au contraire.

Là où Argon est en retrait, et pourquoi c'est important pour le codage agentique

Le codage agentique se partage en 2 pour 2. Argon remporte DeepSWE v1.1 et Vibe Code Bench, puis termine dernier sur FrontierSWE v2 et Terminal-bench 4.0. La victoire DeepSWE mélange les harnais : Argon a fonctionné sur un harnais d'agent mini-swe, le chiffre d'Astra provient du classement public, et les chiffres de Claude proviennent des cartes système. Vibe Code Bench est plus clair, puisque Vals AI a noté les quatre, mais la marge est de 1,6 points.

Si votre charge de travail concerne des agents très dépendants du terminal ou des tâches de référentiel longues, pondérez ces deux dernières lignes au-delà du nombre de titres. Astra détient l'avance sur FrontierSWE ; notre prise en main de GPT-6 Astra montre ce qu'est l'utilisation de ce modèle aujourd'hui. Du côté d'Anthropic, la répartition des benchmarks de Claude Fable 5.1 couvre les propres chiffres de lancement de Fable.

Bloomberg rapporte que des employés anonymes de Google ayant un accès affirment qu'Argon est décevant pour certains travaux de codage et de conception front-end par rapport à ses scores de benchmark. Google a qualifié cette caractérisation d'inexacte.

Mises en garde méthodologiques qui modifient la lecture du tableau

Les lignes cyber de la page cyber de DeepMind

La page cyber de DeepMind ajoute quatre scores au-delà du tableau de lancement :

Éval cyber Gemini 4 Argon Comparaison
Découverte de vulnérabilités réelles 85,8% Gemini 3.8 Flash Cyber 71,0%
Benchmark de test de pénétration Wiz 70,9% Gemini 3.8 Flash Cyber 58,2%
Succès d'attaque Gray Swan IPI (k=15, plus bas est mieux) 0,7% Le plus bas du tableau ; Kimi K3 le plus élevé à 52,7%
CWE-bench v1 68% Égalité à trois avec Grok 4.7 et GPT-6 Astra ; Opus 5.5 à 67%

L'évaluation des vulnérabilités a utilisé un harnais interne Antigravity "non spécialisé dans la cybersécurité", avec accès au code source. Le test Wiz donne au modèle "uniquement accès au site web en cours d'exécution et à son comportement public, sans le code source de l'application". Les deux comparaisons principales sont effectuées par rapport au modèle cyber précédent de Google, pas aux concurrents. Notre explicatif sur la cyberdéfense d'Argon couvre ce que cela signifie pour les API que vous exécutez.

Classements tiers

Ces organisations ont publié les scores quelques minutes après le lancement, elles avaient donc un accès pré-lancement.

Pourquoi les médias publient 12, 13 et 14 victoires

Les médias ont publié trois décomptes de victoires différents. Voici le nouveau décompte des 19 lignes de Google :

Compté contre Victoires d'Argon Égalités Défaites d'Argon Non rapporté
Meilleur des trois rivaux 13 1 5 0
GPT-6 Astra seulement 14 1 4 0
Claude Opus 5.5 seulement 14 0 4 1
Claude Fable 5.1 seulement 15 0 2 2

Un 13 est juste face à l'ensemble du domaine. Un 14 est juste en face à face contre Astra ou Opus 5.5. Un 12 ne correspond à aucune de ces configurations des 19 lignes complètes, il faut donc vérifier quelles lignes cette source a comptées. Les marges varient également : Harvey Legal Agent (19,6% contre 6,7%) est large ; Chartography est de 0,6 points.

Comment exécuter votre propre évaluation le jour de l'ouverture de l'accès

Les benchmarks décrivent le harnais de Google ; vos prompts décrivent votre produit. Créez l'évaluation aujourd'hui sur un modèle que vous pouvez appeler, puis pointez-la sur Argon avec un seul changement.

  1. Choisissez de vrais prompts qui correspondent aux lignes qui vous intéressent : une correction de référentiel, une tâche de terminal, une question sur un document long.
  2. Dans Apidog, créez un environnement avec GEMINI_API_KEY et GEMINI_MODEL définis sur gemini-3.8-flash. Google n'a pas publié l'ID de modèle d'Argon, cette variable est donc la seule valeur que vous changerez.
  3. Enregistrez chaque prompt comme une requête qui lit le modèle depuis {{GEMINI_MODEL}}, regroupée dans un scénario de test.
  4. Ajoutez des assertions sur la sortie (statut, champs requis, contenu attendu) et sur usageMetadata, y compris un plafond sur thoughtsTokenCount dimensionné à votre limite de coût.
  5. Exécutez le scénario sur 3.8 Flash maintenant et conservez le rapport comme votre ligne de base.

Le jour où l'ID d'Argon sera livré, échangez la variable et réexécutez. Google déclare que "tous les nouveaux modèles" seront lancés sur l'API Interactions, alors enregistrez également une version Interactions de chaque requête. Notre comparaison Argon vs Gemini 3.8 Flash couvre ce à quoi s'attendre en termes de prix et de limites.

FAQ

Étape suivante

Construisez le scénario maintenant, exécutez-le sur 3.8 Flash, et conservez le rapport. Quand Argon sera disponible, vous aurez vos propres chiffres quelques minutes après l'échange. Téléchargez Apidog pour le configurer.

bouton

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API