Anthropic a lancé Claude Fable 5.1 le 1er septembre 2026, avec un tableau de référence qui le compare à Fable 5, Opus 5 et GPT-5.6 Sol sur neuf tests. Le titre que tous les médias ont repris était Terminal-Bench-Science, où Fable 5.1 a obtenu 52,6 % contre 24,7 % pour Fable 5. Le chiffre moins relayé par les médias était CursorBench, où l'écart avec Opus 5 est de 3,4 points sur un modèle qui coûte deux fois plus cher.
Ce guide rassemble tous les chiffres publiés en un seul endroit avec attribution, explique ce que chaque référence mesure, sépare les grands des petits écarts, puis aborde la partie que la couverture du lancement a ignorée : ce sont tous des résultats exécutés par le fournisseur, Mythos 5.1 surpasse Fable 5.1 sur le seul test de codage agentique où les deux ont été publiés, et la bonne réponse à un tableau de lancement est d'exécuter vos propres évaluations. La source principale est le billet de lancement d'Anthropic ; le contexte du modèle est dans ce qu'est Claude Fable 5.1.
Le tableau complet
| Référence | Ce qu'il mesure | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Recherche scientifique agentique dans un terminal | 52,6 % | 24,7 % | 29,0 % | 22,4 % |
| Terminal-Bench 4.0 | Codage agentique dans un terminal | 55,8 % | 42,0 % | 52,3 % | 37,3 % |
| GDPval-AA v2 | Travail de connaissance économiquement valuable (Elo) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (crédit partiel) | Utilisation d'ordinateur sur de vraies tâches de bureau | 77,9 % | 72,9 % | 75,4 % | non rapporté |
| OSWorld 2.0 (strict) | Idem, achèvement complet de la tâche uniquement | 41,7 % | 36,1 % | 39,6 % | non rapporté |
| L'Examen Final de l'Humanité (sans outils) | Questions de raisonnement de niveau expert | 60,9 % | 57,8 % | 56,6 % | non rapporté |
| L'Examen Final de l'Humanité (avec outils) | Idem, avec recherche et code | 65,0 % | 63,8 % | 63,6 % | non rapporté |
| AutomationBench | Flux de travail métier de bout en bout | 31,4 % | 17,1 % | 26,9 % | 19,6 % |
| CursorBench 3.2.0 | Tâches de codage de style IDE | 73,4 % | 70,5 % | 70,0 % | 67,2 % |
Anthropic a également publié un chiffre pour Mythos 5.1 : 60,9 % sur Terminal-Bench 4.0. VentureBeat a également rapporté un résultat Browserbase de 82 % pour Fable 5.1 contre 74 % pour Opus 5 et 57 % pour Fable 5 sur les tâches d'agent de navigateur les plus difficiles ; ce chiffre provient de la couverture de presse plutôt que du billet de lancement, il faut donc le pondérer en conséquence.
Les grands écarts
Terminal-Bench-Science 0.1 : 52,6 % contre 24,7 % (Fable 5) et 29,0 % (Opus 5). C'est le résultat. Fable 5.1 fait plus que doubler son prédécesseur et presque doubler Opus 5 sur un benchmark qui place le modèle dans un terminal avec des outils scientifiques et lui demande d'effectuer des recherches en plusieurs étapes. C'est la preuve la plus claire que l'accent mis par Anthropic sur la « résolution de problèmes à long terme » a produit quelque chose de mesurable. Il s'agit également d'un benchmark de version 0.1, ce qui signifie que l'ensemble des tâches est jeune et que les scores sont susceptibles de changer à mesure qu'il mûrit.

AutomationBench : 31,4 % contre 17,1 % (Fable 5) et 26,9 % (Opus 5). Un benchmark de flux de travail métier de bout en bout sur plusieurs applications, où les chiffres absolus sont faibles pour tout le monde. Fable 5.1 fait presque doubler Fable 5 ici et devance Opus 5 de 4,5 points. Si votre produit automatise des tâches métier multi-applications, c'est la ligne à laquelle il faut prêter attention.
Terminal-Bench 4.0 : 55,8 % contre 42,0 % (Fable 5). Un bond de 13,8 points par rapport à Fable 5 sur le codage agentique, ce qui est le chiffre mis en avant par le billet de lancement d'Anthropic dans la section codage. Contre Opus 5, l'avance est de 3,5 points. Opus 5 avait déjà dépassé Fable 5 sur ce benchmark en juillet, donc l'avantage de la catégorie Fable sur la catégorie Opus en matière de codage agentique est de retour, mais plus étroit qu'il ne l'était en juin. Le détail des benchmarks d'Opus 5 contient les chiffres de juillet.

GDPval-AA v2 : 1853 contre 1723 (Fable 5). Un gain de 130 Elo par rapport à Fable 5 sur les tâches de travail de connaissance, et le benchmark qu'Anthropic utilise pour ses revendications concernant les documents, les feuilles de calcul et les présentations. Contre Opus 5, l'écart est de 29 Elo, ce qui est faible.
Les petits écarts
CursorBench 3.2.0 : 73,4 % contre 70,5 % (Fable 5) et 70,0 % (Opus 5). Tâches de codage de style IDE. Trois points de plus que l'un ou l'autre modèle. C'est le benchmark qui compte le plus pour la plus grande population de développeurs, et c'est là que l'avance de Fable 5.1 est la plus mince. Si votre charge de travail est « aidez-moi dans mon éditeur », le tableau de lancement ne justifie pas à lui seul un prix 2x.

OSWorld 2.0 : 77,9 % / 41,7 % contre 75,4 % / 39,6 % (Opus 5). Utilisation de l'ordinateur. Deux points de plus qu'Opus 5 sur les deux scores, cinq de plus que Fable 5. Réel, pas dramatique. Notez le score strict : moins de la moitié des tâches sont entièrement accomplies sur n'importe quel modèle. L'utilisation de l'ordinateur reste le point faible de la frontière.
L'Examen Final de l'Humanité : 60,9 % / 65,0 % contre 56,6 % / 63,6 % (Opus 5). Sans outils, une avance de 4,3 points sur Opus 5, ce qui est le plus grand des petits écarts. Avec des outils, elle se réduit à 1,4 point, car la recherche et l'exécution de code égalisent les chances. Le chiffre sans outils est la meilleure mesure du raisonnement brut ; le chiffre avec outils est plus proche de la façon dont le modèle est utilisé.

Fable 5.1 vs GPT-5.6 Sol
Anthropic a publié quatre lignes avec une colonne GPT-5.6 Sol, et Fable 5.1 mène sur les quatre : Terminal-Bench-Science de 30,2 points, Terminal-Bench 4.0 de 18,5, AutomationBench de 11,8 et CursorBench de 6,2. GDPval-AA affiche 1853 contre 1711. Deux mises en garde. Ce sont les exécutions d'Anthropic d'un modèle concurrent, et les cinq lignes sans colonne GPT-5.6 Sol sont manquantes pour une raison qu'Anthropic n'a pas indiquée. Notre comparaison GPT-5.6 Sol vs Fable 5 couvrait le match précédent ; sur ces chiffres, Fable 5.1 élargit tous les écarts que Fable 5 avait.
Ce que la couverture de lancement a omis
Chaque chiffre est fourni par le fournisseur. Anthropic les a tous exécutés, y compris la colonne des concurrents, et aucun laboratoire indépendant n'en avait reproduit aucun au moment du lancement. L'historique des benchmarks d'Anthropic s'est généralement avéré solide, mais les écarts de CursorBench et OSWorld sont suffisamment petits pour qu'un harnais ou un choix de notation différent puisse les inverser.
Mythos 5.1 est le véritable plafond. La fiche système et le billet de lancement d'Anthropic indiquent que Fable 5.1 et Mythos 5.1 sont « le même modèle mais avec des niveaux de protection différents », et Anthropic a publié Mythos 5.1 à 60,9 % sur Terminal-Bench 4.0 contre 55,8 % pour Fable 5.1. Cet écart de cinq points est le coût des protections sur le codage agentique, et cela signifie que « le modèle le plus capable d'Anthropic largement diffusé » a un meilleur frère connu au-dessus de lui. La comparaison Mythos 5.1 vs Fable 5.1 couvre qui peut y accéder.
L'effort n'a pas été précisé. La documentation sur l'effort d'Anthropic indique que les gains de Fable 5.1 sont les plus importants à xhigh et max. Le billet de lancement ne précise pas quel niveau d'effort a produit chaque score, ni quel effort les modèles de comparaison ont utilisé. Étant donné que l'effort est le principal levier de qualité sur ces modèles, cette omission est importante lorsque vous essayez de reproduire un chiffre.
Le multilingue est stable. Anthropic déclare que la performance multilingue est comparable à celle de Fable 5, et non améliorée. Si votre charge de travail n'est pas en anglais, le tableau de lancement surestime le gain.
Les chiffres de protection sont un autre type de benchmark. Anthropic rapporte 85 % de faux positifs en biologie en moins sur les requêtes bénignes et environ 60 % d'interventions cybernétiques en moins par session Claude Code par rapport à Fable 5. Ceux-ci sont mesurés sur le propre trafic d'Anthropic et ne sont pas reproductibles en externe, mais pour un utilisateur de Fable 5 qui a rencontré des refus, ils peuvent être plus importants que n'importe quelle ligne de capacité.
Ce qu'il faut tester soi-même
Un tableau de lancement vous indique où regarder. Vos évaluations vous indiquent si vous devez agir. Quatre tests qui correspondent aux lignes ci-dessus :
- Une tâche d'agent à long terme de votre propre produit, exécutée jusqu'à son achèvement sur Fable 5.1 à
high, Opus 5 àxhighet Fable 5 àhigh. C'est l'analogue de Terminal-Bench-Science et AutomationBench, et c'est là que le prix 2x paie ou ne paie pas. - Vos dix invites de codage les plus difficiles avec le même effort sur Fable 5.1 et Opus 5. Si les résultats sont égaux, vous avez reproduit l'histoire de CursorBench et Opus 5 est la réponse.
- Un balayage d'effort sur Fable 5.1 seul, de
lowàmax, sur une tâche de routine. La revendication d'Anthropic est quemediumcorrespond à Fable 5 et quelowrivalise avec Opus 5 en termes de coût par tâche. Vérifiez-le. - Un décompte des refus sur vos invites bénignes de sécurité ou de sciences de la vie, Fable 5 versus Fable 5.1. C'est la revendication de 60 % et 85 %, et c'est celle que vous pouvez vérifier en un après-midi.
Créez les quatre sous forme de requêtes dans Apidog avec model et effort comme variables d'environnement, ajoutez des assertions sur stop_reason et sur la présence d'une chaîne attendue dans la réponse, et exécutez la collection par modèle. L'historique des exécutions vous donne un tableau d'évaluation reproductible sans aucune nouvelle infrastructure. Téléchargez Apidog pour le configurer ; la procédure pas à pas de l'API contient les formes de requête.

Comment les benchmarks se rapportent à la décision
- Agents à long terme, recherche, automatisation : les écarts sont grands et cohérents. Fable 5.1 est le modèle, et la ventilation des prix montre que les lectures de cache moins chères réduisent l'écart de coût sur précisément ces charges de travail.
- Codage IDE, Q&A de connaissances, raisonnement assisté par outils : les écarts avec Opus 5 sont de un à quatre points. La propre règle d'Anthropic s'applique : restez sur Opus 5 à moins qu'il n'échoue à vos évaluations à un effort plus élevé. La comparaison Fable 5.1 vs Opus 5 l'explique.
- Venant de Fable 5 : chaque ligne s'est améliorée, le prix n'a pas changé et le taux de faux positifs a diminué. La comparaison Fable 5.1 vs Fable 5 couvre le coût de la migration.
FAQ
Quel est le meilleur résultat de benchmark de Claude Fable 5.1 ? Terminal-Bench-Science 0.1 à 52,6 %, plus du double des 24,7 % de Fable 5 et devant les 29,0 % d'Opus 5 et les 22,4 % de GPT-5.6 Sol. Tous les chiffres proviennent d'Anthropic.
Comment Fable 5.1 se compare-t-il à Opus 5 en matière de codage ? 55,8 % contre 52,3 % sur Terminal-Bench 4.0 et 73,4 % contre 70,0 % sur CursorBench 3.2.0, selon les chiffres d'Anthropic. Des avantages réels mais étroits d'environ trois points.
Fable 5.1 est-il meilleur que GPT-5.6 Sol ? Sur les quatre benchmarks où Anthropic a publié les deux, oui, de 6 à 30 points. Anthropic a exécuté les chiffres de GPT-5.6 Sol elle-même, et cinq de ses neuf lignes n'ont pas d'entrée GPT-5.6 Sol.
Les benchmarks de Fable 5.1 sont-ils vérifiés indépendamment ? Pas au lancement. Chaque chiffre est exécuté par Anthropic. Considérez-les comme des affirmations à tester sur votre propre charge de travail.
Quel est le score de Mythos 5.1 ? Anthropic a publié un chiffre : 60,9 % sur Terminal-Bench 4.0, cinq points au-dessus des 55,8 % de Fable 5.1. Les deux sont le même modèle avec des protections différentes.
Quel niveau d'effort a produit ces scores ? Anthropic ne l'a pas précisé. Son conseil est que les gains de Fable 5.1 sont les plus importants à xhigh et max, donc supposez un effort élevé et attendez-vous à des scores inférieurs pour des réglages plus bas.
