GPT-6.1 Sol et Claude Sonnet 5.5 sont tous deux tarifés à 2 $ par million de tokens d'entrée et 10 $ par million de tokens de sortie, et ils ont été lancés à un jour d'intervalle : Sonnet 5.5 le 28 septembre 2026 et GPT-6.1 Sol le 29 septembre. Aucun des fournisseurs n'a comparé l'un à l'autre. OpenAI a comparé GPT-6.1 Sol à Claude Opus 5.5 et Fable 5.1, et Anthropic a comparé Sonnet 5.5 à GPT-6 Sol, le précédent Sol. La manière honnête de choisir est de les exécuter tous les deux sur vos propres tâches et de comparer le coût par tâche, et non le prix par token.
Ci-dessous : les spécifications et les prix côte à côte, ce que chaque fournisseur déclare et contre quel modèle, les chiffres de tiers (tous sur GPT-6 Sol, pas 6.1), et une méthode pour effectuer la comparaison vous-même dans Apidog. Pour chaque modèle séparément, consultez qu'est-ce que GPT-6.1 Sol et qu'est-ce que Claude Sonnet 5.5.
GPT-6.1 Sol vs Claude Sonnet 5.5 : spécifications et tarifs
Sources : la page de tarification d'OpenAI, l'aperçu de Sonnet 5.5 et la tarification d'Anthropic, plus la page du modèle GPT-6.1 Sol liée ci-dessous.
| GPT-6.1 Sol | Claude Sonnet 5.5 | |
|---|---|---|
| ID du modèle | gpt-6.1-sol |
claude-sonnet-5-5 (Bedrock : anthropic.claude-sonnet-5-5) |
| Lancé le | 29 sept. 2026 | 28 sept. 2026 |
| Entrée / sortie par 1M | 2 $ / 10 $ | 2 $ / 10 $ |
| Lectures de cache par 1M | 0,10 $ | 0,20 $ |
| Écritures de cache par 1M | 2,50 $ | 2,50 $ (5 minutes), 4 $ (1 heure) |
| Traitement par lots par 1M | 1 $ / 5 $ | 1 $ / 5 $ |
| Prompts de plus de 272K tokens d'entrée | 4 $ en entrée, 0,20 $ mis en cache, 15 $ en sortie pour l'ensemble de la requête | Pas de surcoût sur la fenêtre de 1M |
| Niveau plus rapide | Rapide à 4 $ / 20 $ ; Ultra-rapide « bientôt disponible » | Mode rapide non disponible |
| Fenêtre de contexte | 1 050 000 (922 000 en entrée max) | 1M |
| Sortie maximale | 128 000 | 128K (300K en traitement par lots avec un en-tête bêta) |
| Date limite de connaissance | 30 avr. 2026 | Juin 2026 |
| Niveaux d'effort | low, medium (par défaut), high, xhigh, max ; pas de none |
low, medium, high (API par défaut), xhigh, max ; la réflexion ne peut pas être désactivée (réglage le plus bas : between_tools) |
| Forme de l'API | Réponses (avec outils), Complétions de chat (sans outils), Traitement par lots | Messages, Traitement par lots |
| Autres plateformes | OpenRouter (openai/gpt-6.1-sol) |
Bedrock, Google Cloud, Microsoft Foundry, Claude Platform sur AWS |
| Accès gratuit | Aucun. Plus, Pro, Business, Enterprise et Edu l'obtiennent dans ChatGPT Work et Codex (pas Chat ; Enterprise et Edu une fois qu'un administrateur l'active, selon la documentation des modèles) ; pas de niveau API gratuit | Tout le monde peut discuter avec sur Claude.ai ; l'API facture par token |
Deux lignes sont les plus importantes pour le coût. Les lectures de cache de GPT-6.1 Sol coûtent la moitié de celles de Sonnet 5.5, donc réutiliser un long prompt système est moins cher sur OpenAI. Au-delà de 272K tokens d'entrée, l'équilibre s'inverse : la page du modèle GPT-6.1 Sol facture la requête complète à 2x les taux d'entrée et de cache et 1.5x la sortie, tandis que Sonnet 5.5 reste à 2 $ et 10 $. Un prompt de 400 000 tokens avec une réponse de 5 000 tokens coûte environ 1,68 $ sur GPT-6.1 Sol et 0,85 $ sur Sonnet 5.5, sans cache.
Ce que chaque fournisseur déclare, et contre quel modèle
| OpenAI sur GPT-6.1 Sol | Anthropic sur Claude Sonnet 5.5 | |
|---|---|---|
| Comparé à | GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 | Sonnet 5, Opus 5.5, GPT-6 Sol (GPT-5.6 Sol dans deux graphiques) |
| Inclut l'autre modèle | Non | Non (GPT-6.1 Sol n'existait pas encore) |
| Titre | « Intelligence proche d'Astra » à un cinquième des prix standard des tokens d'Astra | 30 %+ plus rapide que Sonnet 5, jusqu'à 30 % de moins par tâche |
| Qui a réalisé les chiffres | OpenAI (résultats des concurrents issus de rapports publics, selon sa note de bas de page) | Anthropic, plus Cognition, Cursor, Artificial Analysis et Surge AI pour les benchmarks nommés |
Le post de lancement de GPT-6.1 Sol d'OpenAI indique ces résultats rapportés par OpenAI dans son texte :
- AutomationBench 1.0.6, effort moyen : +2,2 pp par rapport à Opus 5.5 à environ un tiers du coût, et +4,8 pp par rapport à GPT-6 Sol.
- Terminal-Bench Science 0.1, effort maximal : 5,47 $ par tâche, contre 23,21 $ pour Opus 5.5. GPT-6 Astra obtient toujours le score le plus élevé, à 68,1 %.
- OSWorld 2.0 hors ligne, effort maximal : +7 pp par rapport à GPT-6 Sol pour moins de la moitié du coût.
Le post de lancement de Sonnet 5.5 d'Anthropic inclut une colonne GPT-6 Sol :
- FrontierCode 1.1, réalisé par Cognition : Sonnet 5.5 obtient 52,1 % à xhigh (46,2 % à max) contre 49,3 % pour GPT-6 Sol. À un effort élevé, Anthropic affirme que Sonnet 5.5 correspond au meilleur score de GPT-6 Sol pour environ un cinquième du coût.
- GDPval-AA v2.1 et AA-Briefcase v1.1, réalisés par Artificial Analysis : 1844 contre 1487, et 1811 contre 1483.
Le détail des benchmarks de Sonnet 5.5 couvre le reste du tableau d'Anthropic.
Opus 5.5 apparaît sur les deux graphiques, et les deux fournisseurs rapportent AutomationBench et Terminal-Bench Science, il est donc tentant de faire le lien entre les deux. Les chiffres ne correspondent pas. OpenAI rapporte AutomationBench 1.0.6 à effort moyen dans son propre banc d'essai, tandis que le tableau récapitulatif de la fiche système d'Anthropic exécute ses modèles Claude à effort maximal (Sonnet 5.5 44.7, Opus 5.5 42.5 ; GPT-6 Sol 32.0). Anthropic donne à Sonnet 5.5 59,9 % sur Terminal-Bench Science, mais le texte d'OpenAI ne donne aucun score brut pour GPT-6.1 Sol. Et OpenAI a testé l'utilisation de l'ordinateur sur OSWorld 2.0 hors ligne, Anthropic sur OSWorld 2.1. La comparaison GPT-6 Sol vs Claude Opus 5.5 a rencontré le même problème.
Ce que des tiers ont mesuré (sur GPT-6 Sol, pas 6.1)
Chaque comparaison tierce dans les résultats de recherche associe Sonnet 5.5 à GPT-6 Sol. La plus complète est Artificial Analysis, dont l'Intelligence Index v4.3.2 regroupe 10 évaluations :
| Effort | Indice Sonnet 5.5 | Coût par tâche Sonnet 5.5 | Indice GPT-6 Sol | Coût par tâche GPT-6 Sol |
|---|---|---|---|---|
| moyen | 41 | 0,59 $ | 40 | 0,25 $ |
| élevé | 47 | 1,08 $ | 43 | 0,38 $ |
| très élevé | 52 | 2,74 $ | 44 | 0,52 $ |
| max | 56 | 7,60 $ | 48 | 1,05 $ |
À effort maximal, la même page mesure Sonnet 5.5 à 138 tokens de sortie par seconde et GPT-6 Sol à 76. Sonnet 5.5 obtient un score plus élevé et coûte plus cher par tâche à chaque effort indiqué, malgré des prix catalogue identiques ; la consommation de tokens est la différence. Sonnet 5.5 à effort élevé (47, 1,08 $) se situe à côté de GPT-6 Sol à effort maximal (48, 1,05 $).
Les données des graphiques d'Anthropic sont à double tranchant. Sur AA-Briefcase, GPT-6 Sol coûte moins cher par tâche à chaque effort (0,34 $ contre 1,64 $ à effort moyen) tandis que Sonnet 5.5 obtient un score plus élevé. Sur FrontierCode, Sonnet 5.5 à effort élevé atteint 49,4 % pour 0,42 $ par tâche, contre 49,3 % pour GPT-6 Sol à effort maximal pour 2,07 $.
Tout cela concerne l'ancien Sol. OpenAI affirme que GPT-6.1 Sol surpasse GPT-6 Sol avec le même effort ou un effort moindre sur plusieurs benchmarks, il faut donc s'attendre à ce que sa ligne évolue une fois que des tiers l'auront testé.
Où chacun est probablement plus fort, selon le cadre des fournisseurs
GPT-6.1 Sol. OpenAI le positionne pour le « codage complexe, l'utilisation informatique et le travail professionnel lorsque vous souhaitez des performances proches d'Astra à un coût inférieur ». Ses gains déclarés concernent l'automatisation agentique, l'utilisation informatique et les tâches scientifiques, ainsi que moins d'erreurs factuelles à faible effort. Côté prix, il favorise les charges de travail intensives en cache de moins de 272K tokens d'entrée, et c'est le seul des deux à proposer un niveau de vitesse payant (Fast).
Claude Sonnet 5.5. Anthropic le positionne pour les tâches quotidiennes bien définies, les corrections de bugs, et les documents, diapositives et feuilles de calcul peaufinés, et affirme qu'Opus 5.5 « reste clairement plus fort pour les travaux complexes et ouverts » (voir Sonnet 5.5 vs Opus 5.5). Ses points forts rapportés sont le codage agentique (70,6 % sur Terminal-Bench 4.0 à effort maximal, exécuté par Anthropic), le travail de connaissance et l'utilisation informatique (80,1 % partiel sur OSWorld 2.1). Côté prix, il favorise les prompts de plus de 272K tokens, et il fonctionne sur Bedrock, Google Cloud et Microsoft Foundry.
Deux comportements faussent un test naïf. L'effort par défaut diffère (medium pour GPT-6.1 Sol, high pour Sonnet 5.5 sur l'API), il faut donc comparer des réglages correspondants. Et aucun ne prend en compte les réglages d'échantillonnage : Sonnet 5.5 renvoie 400 sur les temperature, top_p ou top_k non par défaut, et les directives GPT-6 d'OpenAI indiquent de réduire temperature et top_p lorsque l'effort n'est pas none. Contrôlez la variance avec des exécutions répétées.
Effectuez la comparaison vous-même dans Apidog
- Choisissez 20 à 50 tâches de votre trafic réel avec des réponses vérifiables, comme un champ JSON ou une étiquette. Ensuite, dans Apidog :
- Créez un environnement avec
OPENAI_API_KEYetANTHROPIC_API_KEYcomme secrets, plusEFFORT. - Enregistrez deux requêtes qui partagent une variable
{{prompt}}. Les formes diffèrent (référence des réponses, référence des messages) ; la comparaison des formats d'API explique pourquoi :
POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json
{"model": "gpt-6.1-sol", "reasoning": {"effort": "{{EFFORT}}"},
"max_output_tokens": 25000, "input": "{{prompt}}"}
POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json
{"model": "claude-sonnet-5-5", "max_tokens": 25000,
"output_config": {"effort": "{{EFFORT}}"},
"messages": [{"role": "user", "content": "{{prompt}}"}]}
- Ajoutez des assertions pour chaque forme, puis une sur la réponse elle-même par rapport à une colonne
expected:
| Vérification | Réponses OpenAI | Messages Anthropic |
|---|---|---|
| Terminé normalement | $.status est égal à completed |
$.stop_reason est égal à end_turn |
| Réponse présente | $.output[*].type contient message |
$.content[*].type contient text |
| Tokens de sortie, raisonnement inclus | $.usage.output_tokens |
$.usage.output_tokens |
| Lectures de cache | $.usage.input_tokens_details.cached_tokens |
$.usage.cache_read_input_tokens |
| Écritures de cache | $.usage.input_tokens_details.cache_write_tokens |
$.usage.cache_creation_input_tokens |
- Tarifiez chaque réponse dans un script de post-traitement. Les
input_tokensd'OpenAI incluent les tokens mis en cache et les tokens d'écriture de cache, il faut donc les soustraire avant d'appliquer le tarif de 2 $ (mise en cache des prompts OpenAI). Lesinput_tokensd'Anthropic ne comptent que les tokens après le dernier point de rupture du cache (mise en cache des prompts Anthropic). Appliquez la règle des 272K du côté d'OpenAI. - Mettez les deux requêtes dans un scénario de test, conservez les prompts sur une seule ligne, sans guillemets, dans un CSV, et exécutez-le depuis l'interface CLI d'Apidog à chaque niveau d'effort qui vous intéresse :
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
-d prompts.csv --env-var "EFFORT=medium" -r cli,junit
Divisez le total des dépenses par le nombre de tâches réussies : c'est votre coût par tâche. Exécutez au moins medium et high sur les deux, car le même nom d'effort n'est pas calibré de la même manière chez les différents fournisseurs. Pour plus de détails sur les requêtes, consultez le guide de l'API GPT-6.1 Sol et comment utiliser l'API Claude Sonnet 5.5.
FAQ
GPT-6.1 Sol est-il moins cher que Claude Sonnet 5.5 ? Prix catalogue identique, 2 $/10 $ par 1M. Les lectures de cache de GPT-6.1 Sol sont moins chères ; Sonnet 5.5 est moins cher au-delà de 272K tokens d'entrée. Le coût réel dépend des tokens utilisés par tâche.
Lequel est le meilleur en codage ? Il n'y a pas de benchmark commun. Anthropic rapporte que Sonnet 5.5 est supérieur à GPT-6 Sol sur FrontierCode ; OpenAI rapporte que GPT-6.1 Sol bat le meilleur score DeepSWE de GPT-6 Sol de 6,4 pp. Testez sur votre propre dépôt.
Lequel est le plus rapide ? Artificial Analysis a mesuré Sonnet 5.5 à 138 tokens par seconde et GPT-6 Sol à 76, tous deux à effort maximal. Il n'y a pas encore de chiffre tiers pour GPT-6.1 Sol.
L'un des deux est-il gratuit ? GPT-6.1 Sol n'a pas de niveau gratuit. Sonnet 5.5 est disponible dans les applications de chat Claude.ai, mais l'API facture par token. Voir comment utiliser Claude Sonnet 5.5 gratuitement.
Choisissez en exécutant les deux
Prenez dix tâches de votre backlog, exécutez les deux modèles à medium et high, et comparez le coût par tâche réussie. Téléchargez Apidog pour conserver la paire comme un scénario que vous pourrez réexécuter lorsque Artificial Analysis publiera les chiffres de GPT-6.1 Sol ou que l'un ou l'autre des fournisseurs livrera un nouveau snapshot.
