GPT-6.1 Sol vs Claude Sonnet 5.5 : Même prix 2$/10$, lancés à un jour d'intervalle, aucun benchmark commun

GPT-6.1 Sol contre Claude Sonnet 5.5 : même prix de 2$/10$, lancés à un jour d'intervalle, aucun benchmark partagé. Spécifications, affirmations des fournisseurs, et comment les tester vous-même.

Medy Evrard

30 September 2026

GPT-6.1 Sol vs Claude Sonnet 5.5 : Même prix 2$/10$, lancés à un jour d'intervalle, aucun benchmark commun

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

GPT-6.1 Sol et Claude Sonnet 5.5 sont tous deux tarifés à 2 $ par million de tokens d'entrée et 10 $ par million de tokens de sortie, et ils ont été lancés à un jour d'intervalle : Sonnet 5.5 le 28 septembre 2026 et GPT-6.1 Sol le 29 septembre. Aucun des fournisseurs n'a comparé l'un à l'autre. OpenAI a comparé GPT-6.1 Sol à Claude Opus 5.5 et Fable 5.1, et Anthropic a comparé Sonnet 5.5 à GPT-6 Sol, le précédent Sol. La manière honnête de choisir est de les exécuter tous les deux sur vos propres tâches et de comparer le coût par tâche, et non le prix par token.

Ci-dessous : les spécifications et les prix côte à côte, ce que chaque fournisseur déclare et contre quel modèle, les chiffres de tiers (tous sur GPT-6 Sol, pas 6.1), et une méthode pour effectuer la comparaison vous-même dans Apidog. Pour chaque modèle séparément, consultez qu'est-ce que GPT-6.1 Sol et qu'est-ce que Claude Sonnet 5.5.

GPT-6.1 Sol vs Claude Sonnet 5.5 : spécifications et tarifs

Sources : la page de tarification d'OpenAI, l'aperçu de Sonnet 5.5 et la tarification d'Anthropic, plus la page du modèle GPT-6.1 Sol liée ci-dessous.

GPT-6.1 Sol Claude Sonnet 5.5
ID du modèle gpt-6.1-sol claude-sonnet-5-5 (Bedrock : anthropic.claude-sonnet-5-5)
Lancé le 29 sept. 2026 28 sept. 2026
Entrée / sortie par 1M 2 $ / 10 $ 2 $ / 10 $
Lectures de cache par 1M 0,10 $ 0,20 $
Écritures de cache par 1M 2,50 $ 2,50 $ (5 minutes), 4 $ (1 heure)
Traitement par lots par 1M 1 $ / 5 $ 1 $ / 5 $
Prompts de plus de 272K tokens d'entrée 4 $ en entrée, 0,20 $ mis en cache, 15 $ en sortie pour l'ensemble de la requête Pas de surcoût sur la fenêtre de 1M
Niveau plus rapide Rapide à 4 $ / 20 $ ; Ultra-rapide « bientôt disponible » Mode rapide non disponible
Fenêtre de contexte 1 050 000 (922 000 en entrée max) 1M
Sortie maximale 128 000 128K (300K en traitement par lots avec un en-tête bêta)
Date limite de connaissance 30 avr. 2026 Juin 2026
Niveaux d'effort low, medium (par défaut), high, xhigh, max ; pas de none low, medium, high (API par défaut), xhigh, max ; la réflexion ne peut pas être désactivée (réglage le plus bas : between_tools)
Forme de l'API Réponses (avec outils), Complétions de chat (sans outils), Traitement par lots Messages, Traitement par lots
Autres plateformes OpenRouter (openai/gpt-6.1-sol) Bedrock, Google Cloud, Microsoft Foundry, Claude Platform sur AWS
Accès gratuit Aucun. Plus, Pro, Business, Enterprise et Edu l'obtiennent dans ChatGPT Work et Codex (pas Chat ; Enterprise et Edu une fois qu'un administrateur l'active, selon la documentation des modèles) ; pas de niveau API gratuit Tout le monde peut discuter avec sur Claude.ai ; l'API facture par token

Deux lignes sont les plus importantes pour le coût. Les lectures de cache de GPT-6.1 Sol coûtent la moitié de celles de Sonnet 5.5, donc réutiliser un long prompt système est moins cher sur OpenAI. Au-delà de 272K tokens d'entrée, l'équilibre s'inverse : la page du modèle GPT-6.1 Sol facture la requête complète à 2x les taux d'entrée et de cache et 1.5x la sortie, tandis que Sonnet 5.5 reste à 2 $ et 10 $. Un prompt de 400 000 tokens avec une réponse de 5 000 tokens coûte environ 1,68 $ sur GPT-6.1 Sol et 0,85 $ sur Sonnet 5.5, sans cache.

Ce que chaque fournisseur déclare, et contre quel modèle

OpenAI sur GPT-6.1 Sol Anthropic sur Claude Sonnet 5.5
Comparé à GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 Sonnet 5, Opus 5.5, GPT-6 Sol (GPT-5.6 Sol dans deux graphiques)
Inclut l'autre modèle Non Non (GPT-6.1 Sol n'existait pas encore)
Titre « Intelligence proche d'Astra » à un cinquième des prix standard des tokens d'Astra 30 %+ plus rapide que Sonnet 5, jusqu'à 30 % de moins par tâche
Qui a réalisé les chiffres OpenAI (résultats des concurrents issus de rapports publics, selon sa note de bas de page) Anthropic, plus Cognition, Cursor, Artificial Analysis et Surge AI pour les benchmarks nommés

Le post de lancement de GPT-6.1 Sol d'OpenAI indique ces résultats rapportés par OpenAI dans son texte :

Le post de lancement de Sonnet 5.5 d'Anthropic inclut une colonne GPT-6 Sol :

Le détail des benchmarks de Sonnet 5.5 couvre le reste du tableau d'Anthropic.

Opus 5.5 apparaît sur les deux graphiques, et les deux fournisseurs rapportent AutomationBench et Terminal-Bench Science, il est donc tentant de faire le lien entre les deux. Les chiffres ne correspondent pas. OpenAI rapporte AutomationBench 1.0.6 à effort moyen dans son propre banc d'essai, tandis que le tableau récapitulatif de la fiche système d'Anthropic exécute ses modèles Claude à effort maximal (Sonnet 5.5 44.7, Opus 5.5 42.5 ; GPT-6 Sol 32.0). Anthropic donne à Sonnet 5.5 59,9 % sur Terminal-Bench Science, mais le texte d'OpenAI ne donne aucun score brut pour GPT-6.1 Sol. Et OpenAI a testé l'utilisation de l'ordinateur sur OSWorld 2.0 hors ligne, Anthropic sur OSWorld 2.1. La comparaison GPT-6 Sol vs Claude Opus 5.5 a rencontré le même problème.

Ce que des tiers ont mesuré (sur GPT-6 Sol, pas 6.1)

Chaque comparaison tierce dans les résultats de recherche associe Sonnet 5.5 à GPT-6 Sol. La plus complète est Artificial Analysis, dont l'Intelligence Index v4.3.2 regroupe 10 évaluations :

Effort Indice Sonnet 5.5 Coût par tâche Sonnet 5.5 Indice GPT-6 Sol Coût par tâche GPT-6 Sol
moyen 41 0,59 $ 40 0,25 $
élevé 47 1,08 $ 43 0,38 $
très élevé 52 2,74 $ 44 0,52 $
max 56 7,60 $ 48 1,05 $

À effort maximal, la même page mesure Sonnet 5.5 à 138 tokens de sortie par seconde et GPT-6 Sol à 76. Sonnet 5.5 obtient un score plus élevé et coûte plus cher par tâche à chaque effort indiqué, malgré des prix catalogue identiques ; la consommation de tokens est la différence. Sonnet 5.5 à effort élevé (47, 1,08 $) se situe à côté de GPT-6 Sol à effort maximal (48, 1,05 $).

Les données des graphiques d'Anthropic sont à double tranchant. Sur AA-Briefcase, GPT-6 Sol coûte moins cher par tâche à chaque effort (0,34 $ contre 1,64 $ à effort moyen) tandis que Sonnet 5.5 obtient un score plus élevé. Sur FrontierCode, Sonnet 5.5 à effort élevé atteint 49,4 % pour 0,42 $ par tâche, contre 49,3 % pour GPT-6 Sol à effort maximal pour 2,07 $.

Tout cela concerne l'ancien Sol. OpenAI affirme que GPT-6.1 Sol surpasse GPT-6 Sol avec le même effort ou un effort moindre sur plusieurs benchmarks, il faut donc s'attendre à ce que sa ligne évolue une fois que des tiers l'auront testé.

Où chacun est probablement plus fort, selon le cadre des fournisseurs

GPT-6.1 Sol. OpenAI le positionne pour le « codage complexe, l'utilisation informatique et le travail professionnel lorsque vous souhaitez des performances proches d'Astra à un coût inférieur ». Ses gains déclarés concernent l'automatisation agentique, l'utilisation informatique et les tâches scientifiques, ainsi que moins d'erreurs factuelles à faible effort. Côté prix, il favorise les charges de travail intensives en cache de moins de 272K tokens d'entrée, et c'est le seul des deux à proposer un niveau de vitesse payant (Fast).

Claude Sonnet 5.5. Anthropic le positionne pour les tâches quotidiennes bien définies, les corrections de bugs, et les documents, diapositives et feuilles de calcul peaufinés, et affirme qu'Opus 5.5 « reste clairement plus fort pour les travaux complexes et ouverts » (voir Sonnet 5.5 vs Opus 5.5). Ses points forts rapportés sont le codage agentique (70,6 % sur Terminal-Bench 4.0 à effort maximal, exécuté par Anthropic), le travail de connaissance et l'utilisation informatique (80,1 % partiel sur OSWorld 2.1). Côté prix, il favorise les prompts de plus de 272K tokens, et il fonctionne sur Bedrock, Google Cloud et Microsoft Foundry.

Deux comportements faussent un test naïf. L'effort par défaut diffère (medium pour GPT-6.1 Sol, high pour Sonnet 5.5 sur l'API), il faut donc comparer des réglages correspondants. Et aucun ne prend en compte les réglages d'échantillonnage : Sonnet 5.5 renvoie 400 sur les temperature, top_p ou top_k non par défaut, et les directives GPT-6 d'OpenAI indiquent de réduire temperature et top_p lorsque l'effort n'est pas none. Contrôlez la variance avec des exécutions répétées.

Effectuez la comparaison vous-même dans Apidog

  1. Choisissez 20 à 50 tâches de votre trafic réel avec des réponses vérifiables, comme un champ JSON ou une étiquette. Ensuite, dans Apidog :
  2. Créez un environnement avec OPENAI_API_KEY et ANTHROPIC_API_KEY comme secrets, plus EFFORT.
  3. Enregistrez deux requêtes qui partagent une variable {{prompt}}. Les formes diffèrent (référence des réponses, référence des messages) ; la comparaison des formats d'API explique pourquoi :
POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json

{"model": "gpt-6.1-sol", "reasoning": {"effort": "{{EFFORT}}"},
 "max_output_tokens": 25000, "input": "{{prompt}}"}
POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json

{"model": "claude-sonnet-5-5", "max_tokens": 25000,
 "output_config": {"effort": "{{EFFORT}}"},
 "messages": [{"role": "user", "content": "{{prompt}}"}]}
  1. Ajoutez des assertions pour chaque forme, puis une sur la réponse elle-même par rapport à une colonne expected :
Vérification Réponses OpenAI Messages Anthropic
Terminé normalement $.status est égal à completed $.stop_reason est égal à end_turn
Réponse présente $.output[*].type contient message $.content[*].type contient text
Tokens de sortie, raisonnement inclus $.usage.output_tokens $.usage.output_tokens
Lectures de cache $.usage.input_tokens_details.cached_tokens $.usage.cache_read_input_tokens
Écritures de cache $.usage.input_tokens_details.cache_write_tokens $.usage.cache_creation_input_tokens
  1. Tarifiez chaque réponse dans un script de post-traitement. Les input_tokens d'OpenAI incluent les tokens mis en cache et les tokens d'écriture de cache, il faut donc les soustraire avant d'appliquer le tarif de 2 $ (mise en cache des prompts OpenAI). Les input_tokens d'Anthropic ne comptent que les tokens après le dernier point de rupture du cache (mise en cache des prompts Anthropic). Appliquez la règle des 272K du côté d'OpenAI.
  2. Mettez les deux requêtes dans un scénario de test, conservez les prompts sur une seule ligne, sans guillemets, dans un CSV, et exécutez-le depuis l'interface CLI d'Apidog à chaque niveau d'effort qui vous intéresse :
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  -d prompts.csv --env-var "EFFORT=medium" -r cli,junit

Divisez le total des dépenses par le nombre de tâches réussies : c'est votre coût par tâche. Exécutez au moins medium et high sur les deux, car le même nom d'effort n'est pas calibré de la même manière chez les différents fournisseurs. Pour plus de détails sur les requêtes, consultez le guide de l'API GPT-6.1 Sol et comment utiliser l'API Claude Sonnet 5.5.

FAQ

GPT-6.1 Sol est-il moins cher que Claude Sonnet 5.5 ? Prix catalogue identique, 2 $/10 $ par 1M. Les lectures de cache de GPT-6.1 Sol sont moins chères ; Sonnet 5.5 est moins cher au-delà de 272K tokens d'entrée. Le coût réel dépend des tokens utilisés par tâche.

Lequel est le meilleur en codage ? Il n'y a pas de benchmark commun. Anthropic rapporte que Sonnet 5.5 est supérieur à GPT-6 Sol sur FrontierCode ; OpenAI rapporte que GPT-6.1 Sol bat le meilleur score DeepSWE de GPT-6 Sol de 6,4 pp. Testez sur votre propre dépôt.

Lequel est le plus rapide ? Artificial Analysis a mesuré Sonnet 5.5 à 138 tokens par seconde et GPT-6 Sol à 76, tous deux à effort maximal. Il n'y a pas encore de chiffre tiers pour GPT-6.1 Sol.

L'un des deux est-il gratuit ? GPT-6.1 Sol n'a pas de niveau gratuit. Sonnet 5.5 est disponible dans les applications de chat Claude.ai, mais l'API facture par token. Voir comment utiliser Claude Sonnet 5.5 gratuitement.

Choisissez en exécutant les deux

Prenez dix tâches de votre backlog, exécutez les deux modèles à medium et high, et comparez le coût par tâche réussie. Téléchargez Apidog pour conserver la paire comme un scénario que vous pourrez réexécuter lorsque Artificial Analysis publiera les chiffres de GPT-6.1 Sol ou que l'un ou l'autre des fournisseurs livrera un nouveau snapshot.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API