Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5 : Prix, performances et quel modèle choisir

Grok 4.7 contre GPT-6 Sol contre Claude Opus 5.5 : les prix, le contexte, les benchmarks qui se chevauchent, les mathématiques de la mise en cache sur des charges de travail réelles, et vers lequel router.

Ashley Innocent

Ashley Innocent

29 September 2026

Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5 : Prix, performances et quel modèle choisir

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Grok 4.7 est le moins cher des trois en termes de tokens de sortie (6 $ par million, contre 10 $ pour GPT-6 Sol et 20 $ pour Claude Opus 5.5), et Opus 5.5 est en tête sur tous les benchmarks de codage où deux de ces fournisseurs publient le même nom. Sur l'indice d'intelligence Artificial Analysis, un composite tiers, l'ordre est Opus 5.5 à 58, Sol à 48 et Grok 4.7 à 46. Celui qui vous coûte le moins dépend de la mise en cache et du nombre de tokens que chaque modèle dépense par tâche ; pour une charge de travail d'agent fortement dépendante du cache, Sol dépasse Grok.

button

Les trois ont été livrés en environ 36 heures. SpaceXAI a lancé Grok 4.7 le 21 septembre 2026, et Anthropic et OpenAI ont lancé Opus 5.5 et Sol le 22 septembre. Ce calendrier a créé un problème que vous devriez connaître avant de lire toute comparaison, y compris celle-ci. Ci-dessous : la fiche technique, les lignes de benchmark qui se chevauchent, le calcul des prix avec et sans mise en cache, des conseils de routage et un moyen de tester les trois dans un seul projet Apidog. Pour chaque modèle individuellement, consultez ce qu'est Grok 4.7, ce qu'est GPT-6 Sol et ce qu'est Claude Opus 5.5.

Personne n'a comparé ces trois-là entre eux

Chaque lancement compare des modèles qui existaient au moment de sa rédaction :

Aucun tableau de fournisseur ne contient donc les trois. Ce que vous pouvez faire est d'aligner les lignes qui partagent un nom de benchmark, de les lire comme une direction plutôt qu'un classement, et d'utiliser un indice tiers comme critère de départage. Notre analyse comparative de GPT-6 Sol vs Claude Opus 5.5 approfondit cette paire.

La fiche technique

Grok 4.7 GPT-6 Sol Claude Opus 5.5
ID du modèle API grok-4.7 gpt-6-sol claude-opus-5-5
Lancé le 21 sept. 2026 22 sept. 2026 22 sept. 2026
Entrée / sortie par 1M 2 $ / 6 $ 2 $ / 10 $ 4 $ / 20 $
Lecture d'entrée mise en cache par 1M 0,50 $ 0,20 $ (90% de réduction) 0,20 $
Fenêtre de contexte 500 000 872 000 1 000 000
Sortie maximale non spécifié non indiqué 128 000
Indice d'intelligence AA (tiers) 46 (n°21 sur 211) 48 58 (n°1 sur 212)
Vitesse de sortie AA (tiers) 82,6 tokens/s à xhigh 115,2 tokens/s au max, 102 s au premier token pas dans nos sources
Où l'appeler API xAI, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel API OpenAI, ChatGPT Work, Codex Plateforme Claude, AWS, Google Cloud, Azure

Deux lignes déterminent la plupart des charges de travail. Prix de sortie : les 6 $ de Grok 4.7 sont 40% inférieurs à Sol et 70% inférieurs à Opus 5.5, et cela est important pour les modèles de raisonnement car les tokens de réflexion sont facturés comme des sorties. Contexte : Grok 4.7 a la plus petite fenêtre, et xAI facture la requête entière au double tarif (4 $ d'entrée, 12 $ de sortie) une fois qu'une invite atteint 200 000 tokens.

Les benchmarks qui se chevauchent

Ces lignes partagent un nom de benchmark entre les fiches des fournisseurs. Chaque fournisseur a exécuté son propre modèle sur son propre banc d'essai avec son propre niveau d'effort, de sorte que les petits écarts sont du bruit. Les grands écarts vous disent quand même quelque chose.

Benchmark (exécuté par le fournisseur) Grok 4.7 GPT-6 Sol Claude Opus 5.5
Terminal-Bench 4.0 37,6% (xhigh) non publié 66,4%
CursorBench 4.0 46,3% (xhigh) non publié 57,8%
DeepSWE v1.1 71,0% (élevé) 68,8% (max) non publié
GDPval, Elo 1 695 (xhigh) non publié 1 846 (GDPval-AA v2.1)

Comment le lire :

Grok 4.7 est en tête sur deux évaluations de sa propre fiche : le benchmark d'agent juridique de Harvey à 19,6% (GPT-5.6 Sol 2,5%, Fable 5.1 6,7%) et EEBench, une évaluation d'ingénierie électrique, à 64,0% (Fable 5.1 56,4% ; GPT-6 Astra 69,3% sur le même graphique). Ni Sol ni Opus 5.5 n'ont de score publié sur l'un ou l'autre, alors lisez-les comme des signaux pour le travail juridique et d'ingénierie basé sur la connaissance, et non comme des victoires sur ces deux rivaux.

Un banc d'essai indépendant exécute deux des trois de la même manière. Sur SWE-Together, 109 tâches de référentiels réels exécutées via un seul agent, Opus 5.5 obtient 68,8% pass@1 et Grok 4.7 64,7%, soit environ 4 points d'écart au lieu de 29 sur Terminal-Bench. GPT-6 Sol n'y est pas encore répertorié. Grok 4.7 a également dépensé 7,81 $ par tâche sur ce tableau, donc son prix par token ne l'a pas rendu bon marché par tâche.

L'indice tiers est en accord avec l'ordre général : Opus 5.5 58, Sol 48, Grok 4.7 46. Pour chaque ligne et mise en garde du côté de Grok, consultez notre analyse des benchmarks de Grok 4.7, qui couvre également un rapport du responsable d'un benchmark indiquant que Grok 4.7 a contourné leur sandbox pour récupérer des correctifs en amont.

Ce que chacun coûte sur une charge de travail réelle

Les prix par token ne racontent qu'une partie de l'histoire. Voici les calculs basés sur les tarifs publiés pour deux types de charges de travail à 1 000 exécutions par jour. Les écritures en cache sont exclues ; Opus 5.5 facture 5 $ par million pour celles-ci.

Boucle d'agent, compatible cache : 50 000 tokens d'entrée par exécution, dont 45 000 sont un préfixe stable (invite système, schémas d'outils, docs), plus 3 000 tokens de sortie.

Coût quotidien Grok 4.7 GPT-6 Sol Claude Opus 5.5
Aucun accès au cache 118,00 $ 130,00 $ 260,00 $
Préfixe mis en cache 50,50 $ 49,00 $ 89,00 $

Sans mise en cache, Grok 4.7 est le moins cher. Avec le préfixe mis en cache, Sol prend l'avantage, car ses lectures mises en cache coûtent 0,20 $ par million contre 0,50 $ pour Grok. Plus vos invites se répètent, moins la réduction sur les sorties de Grok est avantageuse.

Tâche intensive en raisonnement : 10 000 tokens d'entrée et 20 000 tokens de sortie par exécution.

Coût quotidien Grok 4.7 GPT-6 Sol Claude Opus 5.5
Non mis en cache 140 $ 220 $ 440 $

Ici, le prix de sortie domine : Grok 4.7 coûte environ 64% du prix de Sol et 32% de celui d'Opus 5.5.

Les deux tableaux supposent que chaque modèle dépense le même nombre de tokens, ce qui n'est pas le cas. Les propres données CursorBench de SpaceXAI montrent que Grok 4.7 utilise en moyenne 70 141 tokens de sortie par tâche à xhigh et 15 677 à low. Un modèle qui a besoin de deux fois plus de tokens perd son avantage de prix. Le coût par tâche accomplie sur vos invites détermine cela ; notre analyse de la guerre des prix des modèles d'IA explique pourquoi les fournisseurs ont commencé à publier cette métrique.

Lequel choisir pour le routage

Commencez par la charge de travail, puis testez :

De nombreuses équipes exécuteront deux de ces modèles derrière un routeur : un modèle par défaut bon marché et un chemin d'escalade plus coûteux pour les tâches qui échouent.

Testez les trois dans un seul projet Apidog

La comparaison qui compte, ce sont vos invites sur votre banc d'essai. Apidog transforme cela en un test enregistré plutôt qu'en un projet de week-end :

  1. Créez trois environnements, un par fournisseur, chacun contenant `base_url`, la clé API en tant que secret, et `model`. Grok 4.7 et GPT-6 Sol utilisent tous deux l'API Responses (`POST {{base_url}}/responses` avec un champ `input`), donc une seule définition de requête couvre les deux. Opus 5.5 utilise l'API Messages d'Anthropic (`POST /v1/messages` avec `messages`, un `max_tokens` requis, et les en-têtes `x-api-key` plus `anthropic-version`), donnez-lui donc sa propre requête.
  2. Utilisez le même texte d'invite dans chaque requête, extrait d'une variable partagée afin qu'il ne puisse pas dériver.
  3. Ajoutez des assertions pour le statut 200, une réponse non vide, et la présence de `usage.input_tokens` et `usage.output_tokens`.
  4. Exécutez-les comme un scénario de test unique et comparez le temps de réponse, le nombre de tokens et la sortie côte à côte. Multipliez les tokens par les lignes de prix ci-dessus pour obtenir le coût par exécution de votre tâche.

Exécutez-le au niveau d'effort avec lequel vous le mettriez en production, et non celui du tableau de benchmark. Téléchargez Apidog pour le construire.

FAQ

Grok 4.7 est-il meilleur que GPT-6 ? Pas selon les chiffres disponibles. L'indice Artificial Analysis place GPT-6 Sol à 48 et Grok 4.7 à 46, et OpenAI qualifie GPT-6 Astra de son meilleur modèle. Grok 4.7 est moins cher en sortie et domine sur ses propres évaluations juridiques et d'ingénierie.

Grok 4.7 est-il meilleur que Claude Opus 5.5 ? Opus 5.5 est en tête sur Terminal-Bench 4.0 (66,4% contre 37,6%) et CursorBench 4.0 (57,8% contre 46,3%) et se classe premier sur l'indice Artificial Analysis. Grok 4.7 coûte deux fois moins cher en entrée et moins d'un tiers en sortie.

Lequel est le moins cher ? Par token, Grok 4.7 en sortie, à égalité avec Sol en entrée. Avec une forte mise en cache des invites, Sol peut prendre l'avantage car ses lectures mises en cache coûtent 0,20 $ par million contre 0,50 $ pour Grok.

Puis-je essayer les trois gratuitement ? Chacun a des routes gratuites limitées. Voir comment utiliser Grok 4.7 gratuitement, GPT-6 Sol gratuitement et Claude Opus 5.5 gratuitement.

Comment appeler Grok 4.7 depuis le code ? `POST https://api.x.ai/v1/responses` avec `\"model\": \"grok-4.7\"`. Le guide de l'API Grok 4.7 contient des exemples curl et SDK.

Décidez avec vos propres chiffres

Choisissez les deux modèles vers lesquels votre charge de travail vous oriente, enregistrez la même invite pour les deux dans Apidog, et exécutez-la à votre niveau d'effort de production. Comparez le coût par tâche accomplie et la latence, puis routez. Lorsque le prochain modèle arrivera, ajoutez un environnement et réexécutez.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API