Gemini 4 Argon domine le classement des benchmarks de Google sur 13 des 19 lignes face à GPT-6 Astra, Claude Opus 5.5 et Claude Fable 5.1, mais un fait l'emporte sur tout score : vous pouvez acheter Astra et Opus 5.5 aujourd'hui, et vous ne pouvez pas acheter Argon. Le nouveau modèle de pointe de Google n'est disponible aujourd'hui qu'aux défenseurs du programme Fairwind, à 2 $/10 $ par million de jetons pendant une période de lancement et 4 $/20 $ après, ce qui correspond exactement au coût d'Opus 5.5.
Cette comparaison aligne les quatre modèles sur le prix et les limites, regroupe les lignes de benchmark par modèle gagnant, explique pourquoi les chiffres ne sont pas directement comparables, et se termine par un guide de routage et un moyen de tester les trois sur vos propres invites dans Apidog. Nouveau sur Argon ? Commencez par qu'est-ce que Gemini 4 Argon ; pour les dates, consultez le guide des dates de sortie d'Argon.
Prix et limites côte à côte
Le tableau de Google inclut Claude Fable 5.1, il obtient donc également une colonne. Les prix sont par million de jetons, tirés de la page de chaque fournisseur : l'annonce de lancement de Google, la page du modèle GPT-6 Astra d'OpenAI et la page de tarification d'Anthropic.
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| Pouvez-vous l'appeler aujourd'hui ? | Non, Fairwind seulement | Oui | Oui | Oui |
| ID du modèle API | Non publié | gpt-6-astra |
claude-opus-5-5 |
claude-fable-5-1 |
| Entrée | 2 $ intro, puis 4 $ | 10 $ | 4 $ | 10 $ |
| Entrée en cache | 0,10 $ intro, puis 0,20 $ | 1 $ | 0,20 $ | 0,25 $ |
| Sortie | 10 $ intro, puis 20 $ | 50 $ | 20 $ | 50 $ |
| Sortie max. | 1M (limite annoncée par Google) | 128K | 128K (300K sur Batch, bêta) | 128K |
| Fenêtre de contexte | Non publiée | 1 050 000 (922K entrée max.) | 1M | 1M |
| Surtaxe pour invite longue | Non précisée | Au-delà de 272K d'entrée : 2x entrée et cache, 1,5x sortie, sur la requête complète | Aucune | Aucune |
Trois choses ressortent. Le prix standard d'Argon correspond à celui d'Opus 5.5 pour l'entrée, l'entrée en cache et la sortie, de sorte que son avantage de prix sur Anthropic ne dure que pendant la période de lancement, et Google n'a pas précisé de date. Astra et Fable 5.1 sont listés à 2,5x les tarifs standard d'entrée et de sortie d'Argon et 5x ses tarifs d'introduction. Et le chiffre de 1M de sortie est celui de Google : Vals AI liste une sortie maximale de 262K pour la configuration d'Argon qu'il a testée. Pour le calcul du coût par requête, voir la tarification de Gemini 4 Argon.
Où chaque modèle domine dans le tableau de Google
Avant les chiffres : ceci est le tableau de Google. Les scores d'Argon sont rapportés par Google, certains auto-calculés et d'autres provenant de classements ; les scores des concurrents sont principalement les chiffres des fournisseurs eux-mêmes ou les résultats de classements publics, aux paramètres de raisonnement maximum disponibles. Les systèmes diffèrent, considérez donc les petits écarts comme du bruit.
| Qui mène | Benchmark | Argon | Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Argon : travail de connaissance | Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| Argon : travail de connaissance | AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| Argon : travail de connaissance | Harvey’s Legal Agent Benchmark | 19.6% | 5.4% | 6.7% | 3.8% |
| Argon : codage | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| Argon : contexte long | GraphWalks 256K à 1M (F1) | 84.2% | 71.8% | 65.0% | 66.8% |
| Argon : multimodal | LVBench | 91.7% | 87.5% | 79.7% | 83.7% |
| Argon : multimodal | Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
| Astra | FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| Astra | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| Astra | OSWorld-2.0 (hors ligne, partiel) | 69.2% | 72.6% | non rapporté | non rapporté |
| Opus 5.5 | Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| Opus 5.5 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| Égalité | CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
Les autres victoires nettes d'Argon sont Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks jusqu'à 128K et Agent’s Last Exam. Fable 5.1 ne mène aucune ligne. Sur CWE-bench v1, le classement cyber de DeepMind montre une égalité à trois à 68% entre Argon, Astra et Grok 4.7, avec Opus 5.5 à 67%.
Sur Gemini 4 Argon vs Fable 5.1, Argon obtient des scores plus élevés sur 15 des 17 lignes où les deux rapportent un chiffre ; Fable ne le dépasse que sur FrontierSWE v2 (56,3% vs 55,0%) et Terminal-bench 4.0 (57,9% vs 57,4%). Les propres chiffres d'Anthropic se trouvent dans notre article sur les benchmarks de Claude Fable 5.1, et le tableau complet de 19 lignes se trouve dans les benchmarks de Gemini 4 Argon.
Trois mises en garde avant de faire confiance aux écarts
Les chiffres des concurrents ne sont pas des exécutions de Google. La méthodologie de Google indique que les résultats pour les modèles non-Gemini « proviennent des chiffres auto-déclarés par les fournisseurs, sauf mention contraire », et plusieurs lignes proviennent de classements publics gérés par Vals AI, Proximal et Surge.
Les systèmes diffèrent. Sur DeepSWE v1.1, Google a auto-calculé les 77,9% d'Argon avec un système mini-swe-agent, tandis que le score d'Astra provient du classement public et les scores d'Anthropic des fiches système. Sur LVBench, Gemini a échantillonné la vidéo à 1 image par seconde, tandis qu'Astra a obtenu 800 images, Opus 5.5 600 et Fable 5.1 300, « en raison de limitations de l'API ».
Le même modèle obtient des scores différents selon les tableaux. Le chiffre de Terminal-bench 4.0 d'Opus 5.5 diffère entre les tableaux selon le système et le paramètre d'effort ; Anthropic rapporte ses 66,4% à un effort très élevé. Ne mélangez donc jamais les sources dans un même tableau.
Ce que disent les évaluateurs tiers
Les classements indépendants réduisent l'écart. Artificial Analysis liste Argon au #8 sur 223, mais cette liste compte chaque paramètre de raisonnement séparément. Par modèle distinct, Argon (53) est à égalité avec GPT-6 Astra et Claude Fable 5.1 et se situe derrière Claude Opus 5.5 (58 au max) et Claude Sonnet 5.5 (56). AA liste également le taux d'hallucination d'Argon sur AA-Omniscience à 15%, contre 51% pour Astra à son réglage maximum.
Sur Arena, Argon se classe premier en Texte à 1525, marqué Préliminaire sur 4 942 votes, avec Opus 5.5 en quatrième position. Vals AI le classe premier sur 41 modèles sur l'indice Vals, le premier modèle Gemini à le dépasser.
Tout le monde chez Google n'est pas convaincu : Bloomberg a rapporté que certains employés ayant accès disent qu'Argon est décevant sur certains travaux de codage et de conception front-end par rapport à ses benchmarks, une caractérisation que Google a qualifiée d'inexacte.
Vers lequel router
Il n'y a pas de meilleur modèle de pointe unique en 2026. Routez par tâche, et gardez la colonne Argon pour le jour de sa sortie :
| Tâche | Router aujourd'hui | Quand Argon sera disponible |
|---|---|---|
| Agents d'automatisation juridique, financière et de bureau | Opus 5.5 (67,0% Vals Index) | Testez Argon : il domine les quatre lignes de travail de connaissance |
| Agents de codage intensif en terminal | Opus 5.5 (66,4% Terminal-bench 4.0) | Opus 5.5 mène toujours |
| Ingénierie logicielle agentique | Astra (65,5% FrontierSWE v2) ou Opus 5.5 | Argon domine DeepSWE mais est derrière FrontierSWE ; testez les deux |
| Agents d'utilisation informatique et d'interface graphique | Astra (72,6% OSWorld-2.0) | Astra domine OSWorld ; Argon domine Agent’s Last Exam |
| Raisonnement sur des invites de plus de 256K jetons | Opus 5.5 (sans surtaxe) ou Astra (surtaxe au-delà de 272K) | Argon (84,2% GraphWalks 256K à 1M) |
| Compréhension vidéo et de graphiques | Astra (87,5% LVBench) | Argon (91,7%), avec la mise en garde sur le nombre d'images |
| Ingénierie scientifique et ML | Astra (Terminal-Bench Science), Opus 5.5 (PostTrainBench) | Argon domine LABBench 2 et RiemannBench ; testez-le |
| Réponses uniques de plus de 128K jetons | Opus 5.5 sur Batch (300K, bêta) | Argon, jusqu'à 1M annoncé par Google |
| Travail à volume élevé et sensible aux coûts | Opus 5.5 (4 $/20 $) | Argon à 2 $/10 $ tant que l'introduction dure |
Si le prix compte plus que les scores maximum, notre comparaison GPT-6 Sol vs Claude Opus 5.5 couvre la gamme Sol moins chère d'OpenAI face à Opus.
Comparez les trois sur vos propres invites
Les tableaux des fournisseurs ne peuvent pas vous dire comment chaque modèle gère vos invites. Une petite évaluation dans Apidog le peut, et vous pouvez la construire aujourd'hui.
- Créez un projet avec trois requêtes : GPT-6 Astra, Claude Opus 5.5 et une requête Gemini dont le champ de modèle indique
{{GEMINI_MODEL}}, défini surgemini-3.8-flashjusqu'à ce que Google publie l'ID d'Argon. Notre guide de l'API GPT-6 Astra et qu'est-ce que Claude Opus 5.5 couvrent le format de requête de chaque fournisseur. - Stockez la clé API de chaque fournisseur comme variable d'environnement, et placez l'invite dans une variable partagée afin que les trois requêtes reçoivent une entrée identique.
- Ajoutez des assertions : statut 200, une réponse non vide, des jetons de sortie sous un plafond, et un coût calculé en dessous de votre budget aux tarifs publiés de chaque fournisseur.
- Exécutez les trois comme un scénario de test et comparez les résultats de chaque requête dans le rapport de test.
L'assertion de coût est de l'arithmétique simple. Pour une requête avec 20 000 jetons d'entrée et 4 000 jetons de sortie, Astra coûte 20 000 x 10 $/1M + 4 000 x 50 $/1M = 0,20 $ + 0,20 $ = 0,40 $. Opus 5.5 coûte 0,08 $ + 0,08 $ = 0,16 $. Argon coûterait 0,08 $ aux tarifs d'introduction et 0,16 $ aux tarifs standard. Le prix par jeton n'est cependant pas le coût par tâche : Artificial Analysis a mesuré Argon à environ 62K jetons de sortie par tâche contre environ 27K pour Astra à l'effort maximal, alors mesurez les jetons de sortie sur vos propres invites.
Lorsque Argon sera disponible, changez GEMINI_MODEL, relancez le scénario, et vous aurez une comparaison avec les mêmes invites contre les deux modèles que vous pouvez acheter maintenant.
FAQ
Gemini 4 Argon est-il meilleur que GPT-6 Astra ? Ils sont à égalité à 53 sur Artificial Analysis. Dans le tableau de Google, Argon obtient des scores plus élevés sur la plupart des lignes, mais Astra gagne FrontierSWE v2, Terminal-Bench Science 0.1 et OSWorld-2.0, et Astra est celui que vous pouvez appeler aujourd'hui.
Gemini 4 Argon vs Claude Opus 5.5 : lequel est le meilleur ? Le tableau de Google favorise Argon sur la plupart des lignes ; Opus 5.5 gagne Terminal-bench 4.0 et PostTrainBench et domine Artificial Analysis 58 à 53. Aux tarifs standard, ils coûtent le même prix.
Gemini 4 Argon est-il moins cher que Claude Opus 5.5 ? Pendant la période de lancement, il est deux fois moins cher (2 $/10 $ vs 4 $/20 $). Après cela, les prix catalogue sont identiques, et Google n'a pas précisé quand la période de lancement se termine.
Quel modèle a la plus grande limite de sortie ? Argon, avec une limite annoncée de 1M de jetons, bien que Vals AI liste 262K pour la configuration qu'il a testée. Les autres plafonnent la sortie synchrone à 128K. Notre guide des 1M de jetons de sortie explique ce que cela signifie pour votre client.
Puis-je utiliser Gemini 4 Argon aujourd'hui ? Uniquement via le programme Fairwind de Google, pour un ensemble de partenaires de cyberdéfense approuvés. Les clients API payants et les abonnés Google AI Ultra viendront ensuite, sans date précise.
Choisissez par charge de travail, puis testez
Argon semble le plus performant pour le travail de connaissance, les contextes longs et les lignes multimodales ; Astra sur FrontierSWE, Terminal-Bench Science et OSWorld ; Opus 5.5 sur le travail en terminal et l'ingénierie ML, au prix qu'Argon facturera après son introduction. Basez-vous sur les deux que vous pouvez acheter maintenant, gardez le modèle Gemini dans une variable, et relancez votre scénario le jour où Argon sera disponible. Pour configurer la comparaison à trois requêtes dans un seul projet, téléchargez Apidog.
