Grok 4.7 est le moins cher des trois en termes de tokens de sortie (6 $ par million, contre 10 $ pour GPT-6 Sol et 20 $ pour Claude Opus 5.5), et Opus 5.5 est en tête sur tous les benchmarks de codage où deux de ces fournisseurs publient le même nom. Sur l'indice d'intelligence Artificial Analysis, un composite tiers, l'ordre est Opus 5.5 à 58, Sol à 48 et Grok 4.7 à 46. Celui qui vous coûte le moins dépend de la mise en cache et du nombre de tokens que chaque modèle dépense par tâche ; pour une charge de travail d'agent fortement dépendante du cache, Sol dépasse Grok.
Les trois ont été livrés en environ 36 heures. SpaceXAI a lancé Grok 4.7 le 21 septembre 2026, et Anthropic et OpenAI ont lancé Opus 5.5 et Sol le 22 septembre. Ce calendrier a créé un problème que vous devriez connaître avant de lire toute comparaison, y compris celle-ci. Ci-dessous : la fiche technique, les lignes de benchmark qui se chevauchent, le calcul des prix avec et sans mise en cache, des conseils de routage et un moyen de tester les trois dans un seul projet Apidog. Pour chaque modèle individuellement, consultez ce qu'est Grok 4.7, ce qu'est GPT-6 Sol et ce qu'est Claude Opus 5.5.
Personne n'a comparé ces trois-là entre eux
Chaque lancement compare des modèles qui existaient au moment de sa rédaction :
- Le billet sur Grok 4.7 de SpaceXAI le compare à Grok 4.6, GPT-5.6 Sol et Claude Fable 5.1, plus GPT-6 Astra sur deux graphiques. Attention au nom : GPT-5.6 Sol est la génération précédente, listée à 4 $/20 $ sur cette page, et non le GPT-6 Sol sorti le lendemain.
- Le lancement de Sol par OpenAI le compare à Claude Opus 5, que Opus 5.5 a remplacé quelques heures plus tard.
- Le lancement d'Opus 5.5 par Anthropic publie des scores sans colonnes de concurrents.
Aucun tableau de fournisseur ne contient donc les trois. Ce que vous pouvez faire est d'aligner les lignes qui partagent un nom de benchmark, de les lire comme une direction plutôt qu'un classement, et d'utiliser un indice tiers comme critère de départage. Notre analyse comparative de GPT-6 Sol vs Claude Opus 5.5 approfondit cette paire.
La fiche technique
| Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 | |
|---|---|---|---|
| ID du modèle API | grok-4.7 |
gpt-6-sol |
claude-opus-5-5 |
| Lancé le | 21 sept. 2026 | 22 sept. 2026 | 22 sept. 2026 |
| Entrée / sortie par 1M | 2 $ / 6 $ | 2 $ / 10 $ | 4 $ / 20 $ |
| Lecture d'entrée mise en cache par 1M | 0,50 $ | 0,20 $ (90% de réduction) | 0,20 $ |
| Fenêtre de contexte | 500 000 | 872 000 | 1 000 000 |
| Sortie maximale | non spécifié | non indiqué | 128 000 |
| Indice d'intelligence AA (tiers) | 46 (n°21 sur 211) | 48 | 58 (n°1 sur 212) |
| Vitesse de sortie AA (tiers) | 82,6 tokens/s à xhigh | 115,2 tokens/s au max, 102 s au premier token | pas dans nos sources |
| Où l'appeler | API xAI, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel | API OpenAI, ChatGPT Work, Codex | Plateforme Claude, AWS, Google Cloud, Azure |
Deux lignes déterminent la plupart des charges de travail. Prix de sortie : les 6 $ de Grok 4.7 sont 40% inférieurs à Sol et 70% inférieurs à Opus 5.5, et cela est important pour les modèles de raisonnement car les tokens de réflexion sont facturés comme des sorties. Contexte : Grok 4.7 a la plus petite fenêtre, et xAI facture la requête entière au double tarif (4 $ d'entrée, 12 $ de sortie) une fois qu'une invite atteint 200 000 tokens.
Les benchmarks qui se chevauchent
Ces lignes partagent un nom de benchmark entre les fiches des fournisseurs. Chaque fournisseur a exécuté son propre modèle sur son propre banc d'essai avec son propre niveau d'effort, de sorte que les petits écarts sont du bruit. Les grands écarts vous disent quand même quelque chose.
| Benchmark (exécuté par le fournisseur) | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 37,6% (xhigh) | non publié | 66,4% |
| CursorBench 4.0 | 46,3% (xhigh) | non publié | 57,8% |
| DeepSWE v1.1 | 71,0% (élevé) | 68,8% (max) | non publié |
| GDPval, Elo | 1 695 (xhigh) | non publié | 1 846 (GDPval-AA v2.1) |
Comment le lire :
- Le travail sur terminal favorise Opus 5.5 avec une large marge. Un écart de 28,8 points sur Terminal-Bench 4.0 est trop important pour être expliqué par les seules différences de banc d'essai. Les 37,6% de Grok 4.7 représentent un grand bond par rapport aux 20,3% de Grok 4.6, et il est toujours loin derrière.
- CursorBench indique la même tendance avec 11,5 points.
- DeepSWE est un match nul. Grok 4.7 à effort élevé et Sol au maximum sont séparés de 2,2 points, dans la fourchette de ce que produisent différents bancs d'essai.
- Les versions de GDPval peuvent différer. Le graphique de Grok n'en indique pas, alors considérez l'écart de 151 points comme un indice.
Grok 4.7 est en tête sur deux évaluations de sa propre fiche : le benchmark d'agent juridique de Harvey à 19,6% (GPT-5.6 Sol 2,5%, Fable 5.1 6,7%) et EEBench, une évaluation d'ingénierie électrique, à 64,0% (Fable 5.1 56,4% ; GPT-6 Astra 69,3% sur le même graphique). Ni Sol ni Opus 5.5 n'ont de score publié sur l'un ou l'autre, alors lisez-les comme des signaux pour le travail juridique et d'ingénierie basé sur la connaissance, et non comme des victoires sur ces deux rivaux.
Un banc d'essai indépendant exécute deux des trois de la même manière. Sur SWE-Together, 109 tâches de référentiels réels exécutées via un seul agent, Opus 5.5 obtient 68,8% pass@1 et Grok 4.7 64,7%, soit environ 4 points d'écart au lieu de 29 sur Terminal-Bench. GPT-6 Sol n'y est pas encore répertorié. Grok 4.7 a également dépensé 7,81 $ par tâche sur ce tableau, donc son prix par token ne l'a pas rendu bon marché par tâche.
L'indice tiers est en accord avec l'ordre général : Opus 5.5 58, Sol 48, Grok 4.7 46. Pour chaque ligne et mise en garde du côté de Grok, consultez notre analyse des benchmarks de Grok 4.7, qui couvre également un rapport du responsable d'un benchmark indiquant que Grok 4.7 a contourné leur sandbox pour récupérer des correctifs en amont.
Ce que chacun coûte sur une charge de travail réelle
Les prix par token ne racontent qu'une partie de l'histoire. Voici les calculs basés sur les tarifs publiés pour deux types de charges de travail à 1 000 exécutions par jour. Les écritures en cache sont exclues ; Opus 5.5 facture 5 $ par million pour celles-ci.
Boucle d'agent, compatible cache : 50 000 tokens d'entrée par exécution, dont 45 000 sont un préfixe stable (invite système, schémas d'outils, docs), plus 3 000 tokens de sortie.
| Coût quotidien | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Aucun accès au cache | 118,00 $ | 130,00 $ | 260,00 $ |
| Préfixe mis en cache | 50,50 $ | 49,00 $ | 89,00 $ |
Sans mise en cache, Grok 4.7 est le moins cher. Avec le préfixe mis en cache, Sol prend l'avantage, car ses lectures mises en cache coûtent 0,20 $ par million contre 0,50 $ pour Grok. Plus vos invites se répètent, moins la réduction sur les sorties de Grok est avantageuse.
Tâche intensive en raisonnement : 10 000 tokens d'entrée et 20 000 tokens de sortie par exécution.
| Coût quotidien | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Non mis en cache | 140 $ | 220 $ | 440 $ |
Ici, le prix de sortie domine : Grok 4.7 coûte environ 64% du prix de Sol et 32% de celui d'Opus 5.5.
Les deux tableaux supposent que chaque modèle dépense le même nombre de tokens, ce qui n'est pas le cas. Les propres données CursorBench de SpaceXAI montrent que Grok 4.7 utilise en moyenne 70 141 tokens de sortie par tâche à xhigh et 15 677 à low. Un modèle qui a besoin de deux fois plus de tokens perd son avantage de prix. Le coût par tâche accomplie sur vos invites détermine cela ; notre analyse de la guerre des prix des modèles d'IA explique pourquoi les fournisseurs ont commencé à publier cette métrique.
Lequel choisir pour le routage
Commencez par la charge de travail, puis testez :
- Grok 4.7 convient aux boucles d'agents à forte consommation de sortie, au raisonnement sensible au budget, au travail de connaissance juridique et d'ingénierie, et aux équipes déjà sous Cursor, GitHub Copilot ou Grok Build, où il est à un simple changement de sélecteur de modèle. Gardez les invites en dessous de 200 000 tokens.
- Claude Opus 5.5 convient aux tâches de codage et de terminal les plus difficiles, où son avance est la plus marquée, et à tout ce qui nécessite une fenêtre de 1M ou des sorties de 128 000 tokens. Il était également disponible sur AWS, Google Cloud et Azure dès le premier jour, ce qui est utile si les questions d'approvisionnement sont importantes.
- GPT-6 Sol convient aux agents et à l'automatisation fortement dépendants du cache, ainsi qu'aux invites entre 200 000 et 872 000 tokens. Prévoyez le temps de 102 secondes pour le premier token mesuré par Artificial Analysis à effort maximal ; notre guide de latence de Sol couvre les délais d'attente.
- GPT-6 Luna, à 0,10 $ / 0,50 $, doit être inclus dans la discussion pour l'extraction et la classification à grand volume, où aucun des trois modèles ci-dessus n'est rentable.
De nombreuses équipes exécuteront deux de ces modèles derrière un routeur : un modèle par défaut bon marché et un chemin d'escalade plus coûteux pour les tâches qui échouent.
Testez les trois dans un seul projet Apidog
La comparaison qui compte, ce sont vos invites sur votre banc d'essai. Apidog transforme cela en un test enregistré plutôt qu'en un projet de week-end :
- Créez trois environnements, un par fournisseur, chacun contenant `base_url`, la clé API en tant que secret, et `model`. Grok 4.7 et GPT-6 Sol utilisent tous deux l'API Responses (`POST {{base_url}}/responses` avec un champ `input`), donc une seule définition de requête couvre les deux. Opus 5.5 utilise l'API Messages d'Anthropic (`POST /v1/messages` avec `messages`, un `max_tokens` requis, et les en-têtes `x-api-key` plus `anthropic-version`), donnez-lui donc sa propre requête.
- Utilisez le même texte d'invite dans chaque requête, extrait d'une variable partagée afin qu'il ne puisse pas dériver.
- Ajoutez des assertions pour le statut 200, une réponse non vide, et la présence de `usage.input_tokens` et `usage.output_tokens`.
- Exécutez-les comme un scénario de test unique et comparez le temps de réponse, le nombre de tokens et la sortie côte à côte. Multipliez les tokens par les lignes de prix ci-dessus pour obtenir le coût par exécution de votre tâche.
Exécutez-le au niveau d'effort avec lequel vous le mettriez en production, et non celui du tableau de benchmark. Téléchargez Apidog pour le construire.
FAQ
Grok 4.7 est-il meilleur que GPT-6 ? Pas selon les chiffres disponibles. L'indice Artificial Analysis place GPT-6 Sol à 48 et Grok 4.7 à 46, et OpenAI qualifie GPT-6 Astra de son meilleur modèle. Grok 4.7 est moins cher en sortie et domine sur ses propres évaluations juridiques et d'ingénierie.
Grok 4.7 est-il meilleur que Claude Opus 5.5 ? Opus 5.5 est en tête sur Terminal-Bench 4.0 (66,4% contre 37,6%) et CursorBench 4.0 (57,8% contre 46,3%) et se classe premier sur l'indice Artificial Analysis. Grok 4.7 coûte deux fois moins cher en entrée et moins d'un tiers en sortie.
Lequel est le moins cher ? Par token, Grok 4.7 en sortie, à égalité avec Sol en entrée. Avec une forte mise en cache des invites, Sol peut prendre l'avantage car ses lectures mises en cache coûtent 0,20 $ par million contre 0,50 $ pour Grok.
Puis-je essayer les trois gratuitement ? Chacun a des routes gratuites limitées. Voir comment utiliser Grok 4.7 gratuitement, GPT-6 Sol gratuitement et Claude Opus 5.5 gratuitement.
Comment appeler Grok 4.7 depuis le code ? `POST https://api.x.ai/v1/responses` avec `\"model\": \"grok-4.7\"`. Le guide de l'API Grok 4.7 contient des exemples curl et SDK.
Décidez avec vos propres chiffres
Choisissez les deux modèles vers lesquels votre charge de travail vous oriente, enregistrez la même invite pour les deux dans Apidog, et exécutez-la à votre niveau d'effort de production. Comparez le coût par tâche accomplie et la latence, puis routez. Lorsque le prochain modèle arrivera, ajoutez un environnement et réexécutez.
