GPT-5.6 d'OpenAI a atteint la disponibilité générale le 9 juillet 2026, après un aperçu restreint de deux semaines, et sa version phare Sol est arrivée avec des chiffres de lancement qui revendiquent le titre de leader en matière d'agents. Claude Fable 5 d'Anthropic a porté l'étendard du « modèle le plus performant » de l'autre côté depuis début juin. Si vous choisissez un modèle phare pour un travail réel ce trimestre, vous avez maintenant deux réponses crédibles et une pile de titres contradictoires.
Voici la partie que la plupart des comparaisons enterrent : aucun modèle ne l'emporte sur tous les plans, et les chiffres des fournisseurs eux-mêmes le confirment. Selon les rapports de lancement d'OpenAI, Sol mène largement les benchmarks agentiques généralistes. Le même rapport montre que Claude Fable 5 est en avance sur SWE-Bench Pro de près de 16 points. Toute comparaison qui désigne un gagnant absolu essaie de vous vendre quelque chose.
Celui-ci ne le fera donc pas. Ci-dessous se trouve la répartition des benchmarks avec chaque chiffre attribué, ce que cette répartition signifie pour votre travail, la tarification des deux côtés, les différences d'interfaces API, et un guide de décision. Nous avons couvert ce qu'est GPT-5.6 Sol dans une explication séparée, et l'annonce officielle de GPT-5.6 est la source principale des affirmations d'OpenAI.
Le verdict d'emblée
| Tâche à accomplir | Meilleur choix aujourd'hui | Les preuves |
|---|---|---|
| Exécution large de tâches agentiques | GPT-5.6 Sol | Agents’ Last Exam ~53 contre 46,9 pour GPT-5.5, selon OpenAI |
| Ingénierie logicielle approfondie | Claude Fable 5 | SWE-Bench Pro 80,3 % contre 64,6 % pour Sol, selon le propre graphique d'OpenAI |
| Travail d'agent piloté par terminal | GPT-5.6 Sol, de peu | Terminal-Bench 2.1 : 88,8 %, 91,9 % avec ultra, selon OpenAI |
| Prix affiché le plus bas par token | GPT-5.6 Sol | 5,00 $ / 30,00 $ par million de tokens contre 10,00 $ / 50,00 $ publiés pour Fable 5 |
| Exécution multi-agents parallèle intégrée | GPT-5.6 | Le paramètre ultra exécute quatre agents en parallèle par défaut |
| Un modèle qui gagne tout | Aucun des deux | Ce modèle n'existe pas actuellement |
Une mise en garde s'applique à l'ensemble du tableau : chaque chiffre de benchmark est rapporté par le fournisseur, publié au lancement, et n'a pas encore été reproduit indépendamment. Lisez-le comme une carte d'affirmations, non comme un classement établi. Le seul benchmark qui compte est votre propre charge de travail, et nous vous montrerons comment l'exécuter côte à côte dans Apidog vers la fin.
La répartition des benchmarks, selon OpenAI
Trois chiffres définissent cette comparaison, et tous trois proviennent des documents de lancement d'OpenAI. Cette source peut être interprétée de différentes manières, alors gardez cela à l'esprit.
| Benchmark | GPT-5.6 Sol | Claude Fable 5 | Source |
|---|---|---|---|
| Agents’ Last Exam | ~53 (rapports varient de 52,7 à 53,6) | Environ 13 points derrière Sol | OpenAI, jour du lancement |
| SWE-Bench Pro | 64,6 % | 80,3 % | OpenAI, jour du lancement |
| Terminal-Bench 2.1 | 88,8 % (91,9 % avec ultra) | Non indiqué dans le graphique d'OpenAI | OpenAI, jour du lancement |
Pour Agents’ Last Exam, OpenAI rapporte Sol à environ 53, une augmentation par rapport aux 46,9 de GPT-5.5 et environ 13 points d'avance sur Claude Fable 5. Il s'agit d'un véritable saut générationnel sur un benchmark conçu autour de tâches agentiques longues et multi-étapes, et c'est le chiffre qu'OpenAI a mis en avant.
Sur SWE-Bench Pro, la situation s'inverse. Le propre graphique comparatif d'OpenAI montre Claude Fable 5 à 80,3 % contre 64,6 % pour Sol. Il faut le reconnaître : publier une perte de 15,7 points dans ses propres documents de lancement est inhabituel, et cela rend le reste du graphique plus facile à prendre au sérieux. Cela correspond également à ce que SWE-Bench Pro mesure, à savoir la résolution de problèmes d'ingénierie logicielle difficiles et réels de bout en bout dans des dépôts existants.
Terminal-Bench 2.1 complète le tableau pour Sol. OpenAI rapporte 88,8 % pour Sol standard et 91,9 % lorsque l'ultra répartit le travail sur quatre agents parallèles. Notez que le chiffre 'ultra' correspond à un mode d'exécution différent avec une consommation de tokens délibérément plus élevée, et non au même modèle réfléchissant plus intensément.
Deux vérifications d'honnêteté avant de pondérer tout cela. Premièrement, ce sont des affirmations du jour du lancement provenant du fournisseur qui a le plus à gagner ; personne en dehors d'OpenAI ne les a encore reproduites, et les choix de harnais d'évaluation peuvent faire varier les scores de plusieurs points. Deuxièmement, les benchmarks uniques compressent beaucoup d'informations. Le compte-rendu de Simon Willison du premier jour est une lecture indépendante utile sur la version, et notre analyse détaillée des benchmarks de GPT-5.6 Sol explique en détail ce que chaque test mesure.
Ce que signifie cette répartition
Le schéma de ces trois chiffres n'est pas aléatoire. Il esquisse deux spécialités différentes.
L'avantage de Sol est son étendue. Agents’ Last Exam et Terminal-Bench récompensent tous deux un modèle capable de planifier sur de nombreuses étapes, d'orchestrer des outils, de récupérer des erreurs et de mener à bien des tâches variées. Si votre charge de travail ressemble à des flottes d'agents gérant des tickets, des recherches, l'automatisation des opérations ou des pipelines pilotés par terminal, les chiffres d'OpenAI suggèrent que Sol est le plus performant.
L'avantage de Fable 5 est sa profondeur. SWE-Bench Pro est le proxy public le plus proche pour « ce modèle peut-il faire de l'ingénierie logicielle difficile et réelle dans une codebase existante sans qu'un humain n'ait à la démêler après ». Une avance de 15,7 points là, concédée par le concurrent, n'est pas du bruit même après de généreuses marges d'erreur. Si votre charge de travail concerne des refactorisations à l'échelle d'un dépôt, des débogages complexes ou de longues exécutions d'ingénierie sur un seul projet, c'est le chiffre qui devrait ancrer votre choix par défaut.
Ce qui signifie que la bonne question n'est pas « quel modèle est le meilleur ». C'est plutôt « laquelle de ces deux tâches ressemble le plus à mon travail ». Choisir en fonction d'un classement agrégé optimise pour une charge de travail que vous n'avez pas.
Comparaison des tarifs
OpenAI a publié une tarification de disponibilité générale claire pour les trois niveaux de GPT-5.6. La tarification de Fable 5 d'Anthropic ci-dessous est celle qui a été publiée au lancement ; confirmez les tarifs actuels sur la page de tarification d'Anthropic avant d'établir votre budget, car les conditions d'accès sont passées aux crédits d'utilisation pour les abonnés en juillet.
| Modèle | Entrée par 1 million de tokens | Sortie par 1 million de tokens |
|---|---|---|
| gpt-5.6-sol (l'alias gpt-5.6 renvoie ici) | 5,00 $ | 30,00 $ |
| gpt-5.6-terra | 2,50 $ | 15,00 $ |
| gpt-5.6-luna | 1,00 $ | 6,00 $ |
| claude-fable-5 | 10,00 $ (publié ; à vérifier) | 50,00 $ (publié ; à vérifier) |
Sur la grille tarifaire, Sol coûte la moitié de Fable 5 par token dans les deux sens. C'est un écart significatif, mais le prix affiché est un faible indicateur du coût réel d'une tâche. Les deux modèles tokenisent différemment, produisent des longueurs de sortie différentes pour la même requête, et consomment des quantités de raisonnement différentes pour arriver à une réponse. Un modèle moins cher par token et plus verbeux par tâche peut finalement revenir au même prix.
Le caching réduit encore l'écart des deux côtés. GPT-5.6 prend en charge les points d'arrêt de cache explicites, avec des écritures en cache facturées à 1,25 fois le taux d'entrée non mis en cache, les lectures en cache bénéficiant d'une remise de 90 %, et une durée de vie minimale du cache de 30 minutes. Le caching des prompts de Fable 5 accorde également une remise de 90 % sur les accès au cache, ce qui est deux fois plus important compte tenu de son tarif de base plus élevé. Notre analyse détaillée des tarifs de Claude Fable 5 explique où ces économies se manifestent en pratique. Dans tous les cas, le chiffre à suivre est le coût par tâche accomplie, et non le coût par million de tokens.
Où les interfaces API diffèrent
Les deux entreprises proposent désormais bien plus qu'un simple point d'accès pour la complétion de chat, et les formes diffèrent suffisamment pour influencer le choix.
- L'interface de GPT-5.6, selon la documentation développeur d'OpenAI, est centrée sur le contrôle et l'orchestration au sein de l'API Responses :
- Six niveaux d'effort de raisonnement, de zéro à maximum, pour que vous puissiez ajuster la profondeur par requête.
- Le mode Pro comme paramètre (reasoning.mode: “pro”) sur les trois modèles pour les charges de travail axées sur la qualité. C'est un réglage, pas un modèle séparé.
- Ultra, un paramètre multi-agents qui exécute quatre agents en parallèle par défaut. Il échange une consommation de tokens plus élevée contre des résultats plus rapides en temps réel, et est disponible dans ChatGPT Work sur les plans Pro et Enterprise, ainsi que Codex à partir du plan Plus.
- L'appel d'outils programmatique, où le modèle écrit du JavaScript qui orchestre vos appels d'outils dans un environnement d'exécution V8 isolé sans accès réseau.
- Raisonnement persistant entre les tours, exécution multi-agents en version bêta, et paramètres de détail de vision qui préservent les dimensions originales de l'image.
Claude Fable 5 se situe au sommet de la famille Claude 5, introduit aux côtés de Claude Mythos 5 dans l'annonce d'Anthropic. Son interface publiée comprend une fenêtre contextuelle de 1 million de tokens par défaut, jusqu'à 128K tokens de sortie par requête, et un paramètre de repli côté serveur qui peut rediriger une requête refusée pour des raisons de sécurité vers Claude Opus 4.8 au sein du même appel API. Anthropic présente le modèle pour des raisonnements exigeants et des travaux agentiques à long terme, et il dispose de sa propre pile agentique autour de Claude Code et des workflows de sous-agents. Notre explication détaillée de Claude Fable 5 couvre toutes les spécifications.
Les fenêtres contextuelles sont presque à parité : 1 million pour Fable 5 est confirmé, et les premières documentations indiquent également 1 million pour GPT-5.6, bien que la page des spécifications d'OpenAI devrait être votre source de vérité à ce sujet. La plus grande différence est philosophique. OpenAI expose des primitives d'orchestration (parallélisme, appels d'outils programmatiques, réglages d'effort) comme des fonctionnalités API de premier ordre. Anthropic propose un moteur de modèle unique et profond avec une infrastructure de fiabilité autour. Aucune des deux approches n'est erronée ; elles correspondent à la même distinction largeur contre profondeur que les benchmarks démontrent.
Un guide de décision pratique
Éliminez le bruit du lancement et le choix se résume à quelques questions.
- Choisissez GPT-5.6 Sol par défaut lorsque :
- Votre charge de travail implique des flottes d'agents, l'orchestration d'outils ou de nombreuses tâches variées s'exécutant sans surveillance.
- Vous souhaitez le parallélisme et le contrôle de l'effort par requête comme des primitives API plutôt que comme quelque chose que vous construisez.
- La pression budgétaire sur les tokens est réelle et la grille tarifaire de 5,00 $ / 30,00 $, ainsi que Terra et Luna comme niveaux inférieurs, correspond à votre économie unitaire.
- Choisissez Claude Fable 5 par défaut lorsque :
- La tâche est de l'ingénierie logicielle complexe dans un dépôt réel, là où l'écart du SWE-Bench Pro est significatif.
- Vous exécutez des sessions longues et approfondies sur une seule tâche et vous vous souciez davantage de la capacité maximale par tâche que du débit de la flotte.
- Vous êtes déjà investi dans la chaîne d'outils Claude et ses mécanismes de repli et de mise en cache.
Utilisez les deux lorsque vous le pouvez. Ce sont des API HTTP avec des SDK matures, et le routage par type de tâche (Sol pour les flux à forte orchestration, Fable 5 pour ceux à forte ingénierie) est une architecture normale en 2026, et non exotique.
Testez les deux sur votre propre charge de travail
Les benchmarks des fournisseurs vous ont donné une liste restreinte de deux options. Vos propres requêtes devraient faire la décision finale, et cela prend un après-midi, pas un sprint.
Les deux modèles sont accessibles via HTTP simple : GPT-5.6 via l'API Responses d'OpenAI et Fable 5 via l'API Messages d'Anthropic. Dans Apidog, enregistrez chaque modèle comme son propre environnement avec l'URL de base, l'en-tête d'authentification et l'ID de modèle comme variables. Ensuite, créez une collection de requêtes avec 10 à 20 prompts extraits de votre charge de travail réelle, les tickets, les diffs et les chaînes d'appels d'outils que vous gérez chaque semaine, et exécutez cet ensemble contre chaque environnement.
Comparez deux choses par requête. Premièrement, la qualité de la réponse, jugée par le propriétaire de cette charge de travail. Deuxièmement, les champs d'utilisation dans chaque corps de réponse, car le nombre de tokens multiplié par la grille tarifaire vous donne le coût réel par tâche, c'est là que l'hypothèse « Sol est deux fois moins cher » est mise à l'épreuve par rapport aux sorties plus concises ou plus longues de Fable 5 sur vos données. Si vos agents doivent orchestrer des outils internes, simulez d'abord ces points d'accès aux outils afin que les deux modèles planifient avec des réponses identiques et stables. Une heure de preuves comparatives vaut mieux que n'importe quel graphique de lancement.
FAQ
GPT-5.6 Sol est-il meilleur que Claude Fable 5 ?
Pour certaines tâches, selon les chiffres de lancement d'OpenAI. Sol mène Agents’ Last Exam d'environ 13 points, tandis que Fable 5 mène SWE-Bench Pro de 15,7 points sur les mêmes graphiques. Il n'y a pas de gagnant unique et honnête. Adaptez le modèle à la tâche : l'exécution large de tâches agentiques favorise Sol, l'ingénierie logicielle approfondie favorise Fable 5.
Quel modèle est le moins cher à exécuter ?
La grille tarifaire de Sol est la moitié de la tarification publiée de Fable 5 : 5,00 $ / 30,00 $ par million de tokens contre 10,00 $ / 50,00 $ (vérifiez les tarifs actuels d'Anthropic avant de budgétiser). Le coût réel dépend de la tokenisation, de la longueur de la sortie et du caching, alors mesurez le coût par tâche accomplie sur vos propres requêtes avant de considérer l'écart de 2x comme définitif.
Puis-je utiliser les deux modèles dans un seul produit ?
Oui, et de nombreuses équipes le font. Les deux sont des API HTTP standard, vous pouvez donc acheminer les flux à forte orchestration vers Sol et les flux à forte ingénierie vers Fable 5 derrière une seule interface. Notre guide sur comment utiliser l'API Claude Fable 5 couvre le côté Anthropic, y compris l'authentification et la forme des requêtes.
Ces chiffres de benchmark sont-ils vérifiés indépendamment ?
Non. Chaque chiffre de cet article est rapporté par le fournisseur à partir des documents de lancement d'OpenAI du 9 juillet, y compris le résultat SWE-Bench Pro où Fable 5 l'emporte. Les reproductions indépendantes apparaissent généralement quelques semaines après une sortie en disponibilité générale. D'ici là, traitez tout cela comme des affirmations et accordez plus de poids à vos propres tests.
La comparaison qui compte est la vôtre
Le verdict partagé est la conclusion, non une échappatoire. Les propres graphiques de lancement d'OpenAI attribuent à Sol la couronne de l'étendue agentique et à Fable 5 la couronne de l'ingénierie logicielle, et les deux entreprises ont lancé des modèles phares réels et utilisables à quelques semaines d'intervalle. Choisir en fonction d'un classement agrégé ignore la seule variable qui détermine votre résultat : à quoi ressemble votre charge de travail.
Alors, effectuez le test. Prenez 15 requêtes réelles du travail de la semaine dernière, téléchargez Apidog, configurez les deux API comme des environnements, et comparez la qualité et le coût par tâche sur vos propres données. Vous aurez une réponse défendable avant que la première reproduction indépendante du benchmark ne soit livrée.
