Anthropic a lancé Claude Opus 5 le 24 juillet 2026 avec un ensemble d'affirmations de benchmark qui ressemblent à un balayage complet. Plus du double d'Opus 4.8 sur une évaluation. Trois fois le modèle le mieux classé suivant sur une autre. Dépassant Fable 5 pour un tiers du coût sur une troisième.
Cela ne les rend pas fausses. Cela signifie que vous devez les lire de la même manière que vous liriez le tableau de lancement de n'importe quel fournisseur : attentivement, en prêtant attention à ce qui est mesuré et à ce qui est omis. Ce guide regroupe chaque affirmation de benchmark publiée pour Opus 5 dans un tableau attribué, explique ce que chaque chiffre peut et ne peut pas soutenir, nomme le plafond qu'Anthropic place au-dessus de son propre modèle, et se termine par un plan d'évaluation que vous pouvez exécuter vous-même dans Apidog.
Pour le modèle lui-même (claude-opus-5, contexte de 1M, sortie maximale de 128k, date de coupure des connaissances en mai 2026), commencez par ce qu'est Claude Opus 5. La source principale ci-dessous est l'annonce de lancement de Claude Opus 5 d'Anthropic.
Chaque affirmation publiée, dans un tableau
Voici l'ensemble complet des déclarations de benchmark faites par Anthropic lors du lancement. La colonne de comparaison est aussi importante que la colonne de résultat, car plusieurs d'entre elles sont exprimées par rapport à un autre modèle plutôt que comme un score.
| Benchmark | Affirmation d'Anthropic | Exprimé comme | Comparé à |
|---|---|---|---|
| Frontier-Bench v0.1 | Dépasse tous les autres modèles ; plus du double du score d'Opus 4.8, à un coût par tâche inférieur | Ratio plus affirmation de coût | Opus 4.8 et le domaine |
| ARC-AGI 3 | Environ 3 fois le score du modèle le mieux classé suivant | Ratio | Modèle le mieux classé suivant non nommé |
| OSWorld 2.0 | Dépasse Fable 5 à un tiers du coût | Ordinal plus affirmation de coût | Fable 5 |
| CursorBench 3.2 | À moins de 0,5 % du pic de Fable 5, à moitié prix | Écart plus affirmation de coût | Fable 5 |
| Zapier AutomationBench | Taux de réussite environ 1,5 fois celui du modèle le mieux classé suivant | Ratio | Modèle le mieux classé suivant non nommé |
| Chimie organique | +10,2 points par rapport à Opus 4.8 | Delta absolu | Opus 4.8 |
| Analyse de protéines | +7,7 points par rapport à Opus 4.8 | Delta absolu | Opus 4.8 |
| Exploitation en cybersécurité | Derrière Mythos 5 | Ordinal | Mythos 5 |
| Recherche en biologie autonome | Derrière Mythos 5 | Ordinal | Mythos 5 |
Source de tout ce qui précède : l'annonce de lancement et la documentation du modèle d'Anthropic. Aucune tierce partie n'a publié de reproduction de ces résultats au moment de la rédaction.

Deux choses sautent aux yeux avant de lire un chiffre individuel. Seules deux des neuf lignes indiquent un mouvement absolu en points. Et Anthropic fournit lui-même les deux dernières lignes, où son nouveau fleuron perd.
Le problème du ratio, et pourquoi il est important
Quatre des affirmations (Frontier-Bench, ARC-AGI 3, AutomationBench, et dans une certaine mesure CursorBench) sont exprimées comme des ratios ou des écarts plutôt que comme des scores. C'est une réelle limitation, pas un détail, et il est important d'être précis sur les raisons.
Un ratio cache le dénominateur. « Environ 3 fois le modèle le mieux classé suivant » sur ARC-AGI 3 signifie quelque chose de différent selon la position du domaine. Si le modèle le mieux classé suivant obtient 8 %, alors 3 fois équivaut à 24 % : un véritable mouvement sur un benchmark que personne n'est près de résoudre. Si le modèle le mieux classé suivant obtient 25 %, alors 3 fois équivaut à 75 %, un résultat catégoriquement différent. Les deux sont honnêtement descriptibles comme « 3x ». Vous ne pouvez pas savoir lequel s'est produit, et Anthropic ne l'a pas dit.
Doubler est plus facile en bas d'une échelle. « Plus du double du score d'Opus 4.8 » sur Frontier-Bench v0.1 est le même type de problème. Sur un benchmark difficile et nouveau où le précédent fleuron obtenait un score à un ou deux chiffres, doubler représente un saut absolu plus petit que ce que la formulation implique. Sur un benchmark où 4.8 obtenait déjà 40 %, doubler serait extraordinaire. La chaîne de version est un indice ici : v0.1 est un benchmark sans historique publié, sans reproductions communautaires et sans point de saturation établi.
Le « modèle le mieux classé suivant » n'est pas nommé. Deux affirmations comparent Opus 5 à un concurrent non spécifié. Ce concurrent pourrait être Fable 5, Mythos 5, ou un modèle d'un autre laboratoire. L'ensemble de comparaison détermine la signification du ratio, et il n'est pas divulgué.
Les écarts ont besoin d'unités. « À moins de 0,5 % du pic de Fable 5 » sur CursorBench 3.2 ne précise pas s'il s'agit de 0,5 point de pourcentage ou d'une différence relative de 0,5 %, et « pic » suggère une exécution avec la meilleure configuration plutôt qu'une exécution par défaut. Sur un benchmark de codage, la différence entre un paramètre effort par défaut et un paramètre maximal n'est pas triviale. Notre analyse des benchmarks de Fable 5 explique comment les propres chiffres de ce modèle ont été présentés.
Les deux chiffres scientifiques sont les affirmations les plus claires de l'ensemble précisément parce qu'elles évitent tout cela : +10,2 points en chimie organique et +7,7 points en analyse de protéines sont des deltas absolus par rapport à une base de référence nommée. Vous n'obtenez toujours pas le score de départ, mais vous savez exactement de combien le modèle a progressé.
Les affirmations de coût par tâche dépendent de la configuration
Trois des affirmations d'Anthropic associent capacité et coût : un coût par tâche inférieur sur Frontier-Bench, un tiers du coût sur OSWorld 2.0, et la moitié du prix sur CursorBench 3.2.
La moitié du prix catalogue est vérifiable et tient la route. Opus 5 coûte 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie, identique à Opus 4.8 et exactement la moitié du prix de Fable 5 (10 $/50 $). Cela est publié sur la page de tarification d'Anthropic et n'est pas du tout un résultat de benchmark. Le calcul complet, incluant les écritures en cache, les taux de traitement par lots et la prime du mode rapide, se trouve dans notre analyse de la tarification d'Opus 5.
Le coût par *tâche* est une quantité différente. Il dépend du nombre de tokens consommés par l'exécution, ce qui dépend du niveau d'effort, de l'activation de la réflexion (thinking), du nombre de tours effectués par la boucle agentique et du nombre de sous-agents générés. Les propres directives de prompt d'Anthropic notent qu'Opus 5 produit des réponses par défaut plus longues qu'Opus 4.8, délègue plus facilement aux sous-agents et étend plus souvent la portée des tâches. Ces trois facteurs augmentent la consommation de tokens dans les charges de travail réelles, de sorte qu'une exécution optimisée pour un graphique de coût par tâche n'est pas automatiquement la configuration que vous déploieriez.

Rien de tout cela ne rend l'histoire des coûts fausse. La moitié du prix catalogue est la moitié du prix catalogue, et notre comparaison Opus 5 vs Fable 5 explique où cet écart est réellement rentable. Cela signifie que le ratio coût par tâche est un artefact d'une configuration spécifique, et le vôtre sera différent. Mesurez-le.
Le plafond qu'Anthropic se fixe
La ligne la plus utile dans le matériel de lancement est celle qui n'est pas une victoire. Anthropic déclare clairement qu'Opus 5 est toujours en retrait de **Mythos 5** en matière d'exploitation en cybersécurité et de recherche en biologie autonome. Fable 5 conserve également la désignation de « modèle le plus capable largement diffusé ».

Cela mérite d'être répété car la couverture médiatique l'a largement omis. Opus 5 n'est pas le sommet de la pile Claude. Le résumé honnête est une capacité de classe frontière à la moitié du prix de la frontière, avec un plafond nommé au-dessus. Pour la recherche en sécurité de pointe ou le travail scientifique autonome, la réponse du benchmark est toujours de classe Mythos, couverte dans notre explication du modèle de classe Mythos et Fable 5 vs Mythos 5.
Il y a aussi une conséquence opérationnelle. Anthropic a livré une option fallbacks: "default" (derrière l'en-tête bêta server-side-fallback-2026-07-01) qui bascule automatiquement vers Opus 4.8 lorsque Opus 5 refuse une demande de catégorie cyber. Un modèle avec des refus cyber plus stricts a besoin d'une porte de sortie, et l'existence de cette porte de sortie vous dit quelque chose que le graphique ne dit pas.
Ce que les benchmarks ne couvrent pas du tout
Les benchmarks mesurent l'achèvement des tâches. Ils ne mesurent pas les choses qui décident si un modèle fonctionne dans votre produit :
- Dérive comportementale lors de la migration. Opus 5 vérifie son propre travail sans y être invité. Si vos prompts contiennent toujours des instructions « double-vérifiez votre réponse » d'Opus 4.8, vous obtiendrez une sur-vérification et des tokens gaspillés. Le guide de prompting d'Anthropic pour Opus 5 indique de les supprimer.
- Longueur de la sortie. Les réponses par défaut et les livrables écrits sont plus longs qu'avec Opus 4.8. Réduire l'effort réduit les tokens de réflexion, pas la longueur visible. Vous devez demander explicitement la concision.
- Modes de défaillance avec la réflexion désactivée. Avec
thinking: {type: "disabled"}, les appels d'outils apparaissent occasionnellement sous forme de texte brut qui ne s'exécute jamais et empoisonne ensuite les tours ultérieurs dans une boucle agentique, et les balises XML internes peuvent parfois fuir dans la sortie visible. Aucun graphique de benchmark ne vous montre cela. - Recalibrage de l'effort. Les niveaux d'effort ont été recalibrés sur Opus 5, et Anthropic recommande de refaire un balayage plutôt que de reprendre les paramètres de 4.8. Un résultat de benchmark à un niveau d'effort ne vous dit rien sur votre débit à un autre. Consultez le guide des paramètres d'effort.
- L'erreur 400 que vous rencontrerez. La combinaison de
thinking: {type: "disabled"}avec un effortxhighoumaxrenvoie une erreur 400, appliquée par requête. C'est un détail de migration, pas de capacité, et c'est couvert dans le guide de migration d'Opus 4.8 vers Opus 5.
Ce que vous devez réellement tester vous-même
Les benchmarks des fournisseurs sont une hypothèse de départ. Voici une évaluation compacte que vous pouvez exécuter en un après-midi et qui vous en dira plus sur Opus 5 pour votre charge de travail que tous les chiffres ci-dessus combinés.
1. Constituez un petit ensemble de tâches à partir de votre propre historique. Vingt à cinquante tâches réelles : tickets fermés, PR fusionnées, fils de discussion de support que votre modèle aurait pu gérer. Les entrées réelles sont meilleures que les synthétiques car elles portent votre formatage, votre ambiguïté et vos cas limites réels.
2. Fixez la configuration et notez-la. ID du modèle exactement claude-opus-5, plus votre niveau d'output_config.effort, si la réflexion est activée, et votre max_tokens. Une configuration non fixée rend toute comparaison ultérieure sans signification.
3. Évaluez le coût par tâche résolue, et non le coût par token. Lisez le bloc usage de chaque réponse et enregistrez les tokens d'entrée, de sortie, de lecture et d'écriture de cache par tâche. Divisez ensuite le total des dépenses par les tâches qui ont effectivement passé votre contrôle d'acceptation. C'est le chiffre qu'Anthropic revendique dans son graphique, c'est donc le chiffre à reproduire.
4. Exécutez un véritable balayage d'effort. Le même ensemble de tâches à low, medium, high et xhigh. Le recalibrage signifie que low et medium sont significativement plus performants sur Opus 5 que sur les modèles Opus précédents, et de nombreuses charges de travail trouveront qu'un niveau moins cher passe tout aussi souvent. Surveillez max_tokens à l'extrémité supérieure.
5. Testez la boucle agentique, pas le tour unique. La plupart des benchmarks de lancement sont agentiques (OSWorld, CursorBench, AutomationBench). Les vérifications ponctuelles à un seul tour ne les reproduiront pas. Exécutez plusieurs tours avec vos outils réels attachés et comptez les tours, pas seulement les résultats.
6. Comparez avec votre système actuel sur le même ensemble de tâches. Quoi que vous exécutiez aujourd'hui, Opus 4.8 ou Sonnet 5 ou autre chose, exécutez-le avec le même harnais. Un résultat relatif sur vos propres données vaut plus qu'un score absolu sur celles de quelqu'un d'autre.
7. Enregistrez les refus séparément. Le travail lié à la cybersécurité rencontrera des refus plus souvent qu'avec 4.8. Comptez-les avant de décider si l'en-tête de repli (fallback header) vaut la peine d'être configuré.
Pour la méthodologie de comparaison lors d'un lancement précédent, notre article sur les benchmarks de Sonnet 5 détaille le même exercice, et le guide de l'API Opus 5 contient les formats de requête.
Exécution de l'évaluation dans Apidog
L'évaluation ci-dessus est un ensemble de requêtes HTTP avec des en-têtes d'authentification, des corps JSON, des réponses en streaming et un bloc usage que vous devez lire à chaque appel. C'est un travail API ordinaire, ce que Apidog gère.

Une configuration réalisable :
- Créez une requête vers le point d'accès Anthropic Messages et stockez votre clé API comme variable d'environnement plutôt que de la coller dans le corps.
- Dupliquez cette requête une fois par niveau d'effort afin de pouvoir envoyer le même prompt de
lowàxhighet comparer les réponses côte à côte. - Activez le streaming et inspectez directement les événements SSE lorsque vous avez besoin de voir comment les tokens de réflexion s'accumulent avant que la réponse visible ne commence.
- Inspectez les payloads d'appels d'outils dans la réponse pour confirmer que le modèle émet réellement des appels d'outils structurés plutôt que de les décrire en prose, ce qui est l'artefact de pensée désactivée à surveiller.
- Ajoutez une assertion sur les champs
usageafin que les hits de cache et les totaux de tokens soient capturés à chaque exécution au lieu d'être évalués visuellement. - Enregistrez l'ensemble comme une collection afin que le prochain lancement de modèle soit un échange d'ID de modèle, pas une reconstruction.
Voici la requête de base :
curl https://api.anthropic.com/v1/messages \
--header "x-api-key: $ANTHROPIC_API_KEY" \
--header "anthropic-version: 2023-06-01" \
--header "content-type: application/json" \
--data '{
"model": "claude-opus-5",
"max_tokens": 8192,
"output_config": {"effort": "medium"},
"messages": [
{"role": "user", "content": "Corrige le test échoué dans ce diff."}
]
}'
Modifiez un champ par exécution, gardez tout le reste fixe, et enregistrez le bloc usage à chaque fois. Téléchargez Apidog si vous souhaitez suivre ce modèle avec les environnements et les assertions déjà configurés.
Le résumé honnête
L'histoire des benchmarks d'Opus 5 est vraiment solide : le plus grand bond par rapport à son prédécesseur qu'Anthropic ait revendiqué pour une version Opus, à des prix catalogue inchangés. Elle est également entièrement gérée par le fournisseur, non reproduite au 25 juillet 2026, et largement exprimée en ratios qui cachent leurs dénominateurs. Ces deux choses sont vraies simultanément.
Considérez le tableau en haut de cette page comme l'hypothèse d'Anthropic concernant son propre modèle. Ensuite, allez obtenir vos propres chiffres. L'écart entre un graphique de lancement et une charge de travail en production est l'endroit où chaque migration de modèle est réellement décidée, et le guide des piliers d'Opus 5 couvre le reste des changements.
FAQ
Les benchmarks de Claude Opus 5 sont-ils vérifiés de manière indépendante ? Non. Au 25 juillet 2026, tous les résultats de benchmark publiés pour Opus 5 proviennent d'Anthropic. Aucun laboratoire tiers ou évaluateur indépendant n'a publié de reproduction. Lisez-les comme des chiffres rapportés par le fournisseur.
Quelle est l'affirmation de benchmark la plus importante pour Opus 5 ? Frontier-Bench v0.1, où Anthropic affirme qu'Opus 5 fait plus que doubler le score d'Opus 4.8 à un coût par tâche inférieur. Anthropic n'a pas publié les scores sous-jacents, seulement le ratio, et Frontier-Bench v0.1 est un nouveau benchmark sans historique établi.
Claude Opus 5 est-il le modèle Claude le plus performant ? Non. Fable 5 conserve la désignation de « modèle le plus capable largement diffusé », et Anthropic déclare qu'Opus 5 est toujours en retrait de Mythos 5 en matière d'exploitation en cybersécurité et de recherche en biologie autonome. L'argument d'Opus 5 est une capacité de classe frontière à la moitié du prix de Fable 5, pas le sommet de la pile.
Dans quelle mesure Opus 5 est-il meilleur qu'Opus 4.8 pour les tâches scientifiques ? Anthropic rapporte +10,2 points en chimie organique et +7,7 points en analyse de protéines par rapport à Opus 4.8. Ce sont les deux affirmations exprimées en deltas absolus plutôt qu'en ratios, ce qui les rend les plus faciles à interpréter, bien que les scores de référence n'aient pas été publiés.
Opus 5 bat-il Fable 5 ? Selon les chiffres d'Anthropic, il dépasse Fable 5 sur OSWorld 2.0 à un tiers du coût et se situe à moins de 0,5 % du pic de Fable 5 sur CursorBench 3.2 à moitié prix. Fable 5 conserve toujours la désignation de capacité globale. Voir la comparaison complète.
Que devrais-je évaluer moi-même ? Le coût par tâche résolue sur vingt à cinquante tâches réelles de votre propre backlog, exécutées à plusieurs niveaux d'effort, avec vos outils réels attachés et des boucles multi-tours activées. Comparez-le à ce que vous utilisez aujourd'hui avec le même dispositif.
