Chaque article grand public sur le lancement de Claude Opus 5 le 24 juillet 2026 a mentionné la même fonctionnalité. Fortune l'a décrit comme un moyen de basculer entre le coût et la capacité. CNBC, Bloomberg et TechCrunch l'ont tous souligné. Aucun d'entre eux n'a dit ce que c'est, quels sont les niveaux, ce qui se passe lorsque vous en changez un, ou ce que cela fait à votre facture.
C'est un paramètre de requête appelé effort, il a cinq niveaux sur Opus 5, et il est par défaut à high. C'est toute la fonctionnalité. Ce qui en fait un sujet digne d'un article, c'est qu'Anthropic a recalibré les niveaux pour ce modèle, ce qui signifie que les paramètres que vous aviez réglés sur Opus 4.8 sont maintenant incorrects, et une combinaison spécifique de paramètres renvoie une erreur 400 qui apparaîtra dans de nombreux journaux de migration cette semaine.
Ce qu'est réellement le paramètre effort
Le paramètre effort se trouve dans l'objet output_config d'une requête Messages API :
{
"model": "claude-opus-5",
"max_tokens": 8192,
"output_config": { "effort": "high" },
"messages": [
{ "role": "user", "content": "Refactorisez ce module et expliquez les compromis." }
]
}
Il contrôle la quantité de raisonnement interne que le modèle effectue avant de répondre. Opus 5 exécute par défaut une réflexion adaptative, et l'effort est le cadran qui détermine la générosité avec laquelle ce budget de réflexion est dépensé. Un effort plus élevé signifie plus de jetons de raisonnement, plus de coût et plus de latence. Un effort plus faible signifie moins de ces trois éléments.
Les interfaces utilisateur exposent la même idée sous la forme d'un sélecteur d'effort plutôt qu'un champ JSON brut, ce qui explique le cadrage par la presse d'un interrupteur coût-vs-capacité. En dessous se trouve ce paramètre. Si vous développez sur l'API, le paramètre est ce que vous contrôlez réellement, c'est donc de cela que le reste de cet article parle. La forme complète de la requête se trouve dans notre guide détaillé de l'API Opus 5, et la référence des paramètres se trouve dans l'aperçu des modèles d'Anthropic.
Une chose que l'effort n'est pas : un contrôle de la verbosité. Le guide de prompt pour Opus 5 d'Anthropic est explicite sur le fait que la réduction de l'effort diminue la réflexion, et non la longueur de la réponse visible. Opus 5 produit déjà des réponses par défaut et des livrables plus longs qu'Opus 4.8. Si vous souhaitez une sortie plus courte, demandez une sortie plus courte dans le prompt. Passer à low ne le fera pas pour vous.
Les cinq niveaux
| Niveau | Ce qu'il fait | Cas d'usage typique |
|---|---|---|
low |
Raisonnement minimal avant de répondre | Classification à grand volume, extraction, routage, résumés courts |
medium |
Raisonnement modéré | Q&A sur un contexte récupéré, modifications de fichier unique, transformations structurées |
high |
Par défaut. Raisonnement substantiel | Travail général lorsque vous n'avez encore rien mesuré |
xhigh |
Raisonnement étendu | Codage et boucles agentiques. Point de départ recommandé par Anthropic pour les deux |
max |
Budget de raisonnement maximal | Problèmes difficiles à résoudre en un coup où une mauvaise réponse coûte plus cher que les jetons |
Deux choses concernant ce tableau sont faciles à ignorer.
Le niveau par défaut est high, et non low ni xhigh. Si vous envoyez une requête sans aucun output_config, vous obtenez high. Cela est important pour la prévision des coûts : une requête non modifiée sur Opus 5 effectue un travail de raisonnement réel et vous est facturée, alors que la même requête non modifiée sur Opus 4.8 ne faisait aucune réflexion. Ce changement est l'une des deux modifications majeures de la migration d'Opus 4.8 vers Opus 5, et c'est celle qui est la plus susceptible de surprendre une équipe financière.
Et xhigh est la recommandation pour le codage et les tâches agentiques, pas max. Anthropic positionne xhigh comme le point de départ pour ces charges de travail. max existe au-dessus, mais commencer par là signifie payer pour une marge dont vous ne pourrez probablement pas mesurer le bénéfice. Commencez par xhigh, puis descendez.
Ce que le recalibrage a changé
Voici la partie qui explique pourquoi transporter les paramètres d'un modèle à l'autre est une mauvaise idée.
Anthropic a recalibré la signification de chaque niveau d'effort sur Opus 5. L'étiquette medium sur Opus 5 ne décrit pas la même quantité de raisonnement que medium décrivait sur Opus 4.8. La recommandation d'Anthropic est d'effectuer un nouveau balayage d'effort sur Opus 5 plutôt que de porter votre configuration 4.8.
La conséquence pratique est plus intéressante que l'avertissement. Sur les modèles Opus précédents, low et medium étaient principalement théoriques pour le travail sérieux : ils étaient bon marché, et aussi nettement moins performants, de sorte que les équipes laissaient tout à high ou au-dessus et en payaient le prix. Sur Opus 5, les niveaux inférieurs sont significativement plus performants qu'auparavant, ce qui est la première fois que low et medium sont réellement utilisables sur un modèle de niveau Opus pour des tâches de production.
C'est le véritable levier de coût dans ce lancement, et c'est celui que la couverture médiatique a résumé par le mot "bascule". Opus 5 coûte 5 $ par million de jetons d'entrée et 25 $ par million de jetons de sortie, soit le même prix qu'Opus 4.8. Les jetons de raisonnement sont facturés du côté de la sortie. Donc, la différence entre l'exécution d'un pipeline de classification à high et son exécution à low n'est pas une erreur d'arrondi, c'est une fraction importante de vos dépenses de sortie sur une charge de travail où le raisonnement supplémentaire ne vous apportait de toute façon pas de précision. Notre répartition des prix d'Opus 5 contient la grille tarifaire complète, y compris la réduction de 50 % sur les lots et le minimum de cache de 512 jetons, qui s'ajoutent tous deux à un réglage d'effort inférieur.
Si vous recherchez des économies sur l'ensemble de votre parc Claude plutôt que sur un seul point de terminaison, les leviers présentés dans la réduction de votre facture d'API Claude s'appliquent également ici, avec l'effort maintenant ajouté à la liste.
L'interaction de xhigh et max avec max_tokens
max_tokens limite ensemble les jetons de réflexion et les jetons de réponse. C'est un plafond strict pour toute la partie sortie de la requête, pas seulement le texte visible.
Augmentez l'effort et vous augmentez la part de ce plafond que le modèle consacre au raisonnement avant de commencer à écrire. Poussez l'effort à xhigh ou max tout en laissant max_tokens à une valeur que vous aviez définie pour un modèle qui ne réfléchissait pas, et le modèle peut épuiser le budget de raisonnement et tronquer avant de terminer la réponse. Vous obtenez une réponse tronquée sans rien d'évidemment incorrect dans la requête.
La solution est de lui donner de la marge. La recommandation d'Anthropic est de commencer à max_tokens: 64000 lorsque vous utilisez xhigh ou max sur Opus 5 :
{
"model": "claude-opus-5",
"max_tokens": 64000,
"output_config": { "effort": "xhigh" },
"messages": [
{ "role": "user", "content": "Corrigez le test d'intégration qui échoue et expliquez la cause profonde." }
]
}
Un max_tokens élevé est un plafond, pas un achat. Vous êtes facturé pour les jetons réellement produits, donc définir 64000 ne signifie pas payer pour 64000. Cela signifie que le modèle n'est pas contraint de s'arrêter en pleine réflexion.
L'erreur 400 que personne n'a encore documentée
Celle-ci va générer des tickets de support.
Désactiver la réflexion et demander un effort élevé sont des instructions contradictoires, et Opus 5 rejette purement et simplement cette combinaison. L'envoi de thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une 400, appliquée par requête :
{
"model": "claude-opus-5",
"max_tokens": 8192,
"thinking": { "type": "disabled" },
"output_config": { "effort": "xhigh" }
}
Cette requête échoue. Désactiver la réflexion vous limite à un effort high. Les combinaisons valides sont donc :
- Réflexion activée (par défaut) avec n'importe lequel des cinq niveaux.
- Réflexion désactivée uniquement avec
low,mediumouhigh.
Le chemin de migration qui produit cette erreur est prévisible : une équipe reporte thinking: {type: "disabled"} d'une configuration Opus 4.8 où c'était inoffensif, puis augmente séparément l'effort à xhigh car c'est la recommandation pour le codage. Les deux modifications semblent raisonnables isolément. Ensemble, elles déclenchent une 400.
Le propre conseil d'Anthropic est de ne pas désactiver la réflexion sur Opus 5 du tout. Lorsque la réflexion est désactivée, deux modes d'échec apparaissent occasionnellement : le modèle écrit les appels d'outils comme du texte brut qui ne s'exécute jamais, et des balises XML internes fuient dans la sortie visible. Dans une boucle agentique, le texte divulgué empoisonne alors les tours ultérieurs. Le moyen recommandé de contrôler les coûts sur Opus 5 est un niveau d'effort inférieur, et non une réflexion désactivée. Nous approfondissons ces deux artefacts dans le guide de prompting d'Opus 5.
Comment effectuer un balayage d'effort sur vos propres évaluations
Anthropic vous dit de refaire un balayage. Voici une procédure qui peut être réalisée en un après-midi.
- 1. Figez un ensemble de tâches. Extrayez 30 à 50 invites réelles des journaux de production, pas des exemples synthétiques. Incluez les cas difficiles qui vous préoccupent réellement. Les différences d'effort disparaissent sur les tâches faciles, c'est précisément pourquoi un ensemble d'échantillons propre ne vous dira rien.
- 2. Écrivez le critère de succès avant de regarder n'importe quelle sortie. Les tests sont réussis, le JSON est validé par rapport à un schéma, le champ extrait correspond à la vérité terrain, un évaluateur humain dit oui ou non. Si votre critère est une sensation, votre balayage produira une sensation.
- 3. Exécutez chaque invite à chaque niveau. Cinq niveaux fois 40 invites, cela fait 200 appels. Sur Opus 5, c'est suffisamment bon marché pour ne pas y penser, et vous pouvez l'envoyer via l'API Batch à moitié prix puisque rien n'est sensible à la latence.
- 4. Capturez trois nombres par exécution, pas un seul : succès ou échec,
usage.output_tokens, et la latence réelle. Le blocusagedans la réponse est l'endroit où réside le véritable signal de coût, car il compte les jetons de raisonnement que vous devineriez autrement. - 5. Choisissez le niveau le moins cher qui satisfait vos critères, puis confirmez-le sur un ensemble de validation que vous n'avez pas utilisé pour le réglage. Les équipes qui ignorent l'ensemble de validation ont tendance à livrer un réglage adapté à 40 invites spécifiques.
- 6. Réexécutez-le sur le modèle suivant. La raison même de l'existence de ce balayage est que les niveaux ont été recalibrés entre 4.8 et 5. Supposons que cela se reproduise.
Comparaison des niveaux côte à côte dans Apidog
La partie mécanique d'un balayage consiste à envoyer un corps de requête cinq fois avec un champ modifié et à aligner les résultats. Cela représente une bonne quantité de copier-coller de commandes curl, et c'est la partie qu'Apidog rend propre.
Une configuration qui fonctionne :
- Créez une requête vers le point de terminaison Anthropic Messages et stockez votre clé comme variable d'environnement plutôt que de la coller dans le corps de la requête. Les clés ne doivent pas être partagées avec l'équipe.
- Enregistrez la requête fonctionnelle dans une collection, puis dupliquez-la cinq fois et modifiez uniquement
output_config.effortdans chaque copie. - Inspectez l'objet
usagesur chaque réponse afin de voir directement les jetons de sortie par niveau, ainsi quecache_read_input_tokenslorsque vous vérifiez si votre mise en cache fonctionne. - Activez le streaming et lisez les événements SSE si vous voulez observer où la latence se situe réellement entre
xhighetlow. - Ajoutez une assertion selon laquelle
stop_reasonest présent et n'est pasmax_tokens, afin qu'une réponsexhightronquée échoue bruyamment dans votre collection au lieu de ressembler silencieusement à une réponse courte.
Cette dernière assertion est celle qui vaut la peine d'être configurée en premier, car une troncature à effort élevé est la chose la plus susceptible de mal tourner. Téléchargez Apidog si vous souhaitez construire la collection de comparaison pendant votre lecture. Rien ici ne l'exige ; cela vaut juste mieux que de maintenir cinq scripts shell.
Le véritable plafond
L'effort rend Opus 5 moins cher à bien exécuter. Cela ne fait pas d'Opus 5 le sommet de la pile Claude.
Les chiffres de lancement d'Anthropic pour Opus 5 sont solides : plus du double du score de Frontier-Bench v0.1 d'Opus 4.8, environ 3x le modèle suivant le plus performant sur ARC-AGI 3, et à moins de 0,5 % de Fable 5 sur CursorBench 3.2 à moitié prix. Tous ces chiffres sont des données fournies par le fournisseur, publiées par Anthropic, et aucun n'a été reproduit indépendamment au 25 juillet 2026. Traitez-les comme des affirmations avec une source, et non comme des mesures neutres, et consultez notre analyse des benchmarks d'Opus 5 pour les mises en garde concernant chacun d'eux.
Au-dessus d'Opus 5, Fable 5 reste le modèle le plus performant largement diffusé par Anthropic, à 10 $ par million de jetons d'entrée et 50 $ par million de jetons de sortie. Et Opus 5 est toujours en retrait par rapport à Mythos 5 en matière d'exploitation de cybersécurité et de recherche en biologie autonome, ce qu'Anthropic déclare directement. L'exécution d'Opus 5 à max ne comble aucun de ces écarts. Le résumé honnête est une capacité de pointe à la moitié du prix de pointe, avec un plafond nommé au-dessus. La question de savoir si la différence de prix en vaut la peine pour votre charge de travail est celle que nous abordons dans Opus 5 vs Fable 5.
FAQ
Quel est le niveau d'effort par défaut sur Claude Opus 5 ? high. Une requête sans champ output_config s'exécute avec un effort high et une réflexion adaptative activée.
Quels sont les cinq niveaux d'effort ? low, medium, high, xhigh et max. Anthropic recommande de commencer à xhigh pour le codage et le travail agentique, et de descendre à partir de là en fonction de vos propres évaluations.
Pourquoi ma requête renvoie-t-elle une 400 lorsque je règle l'effort sur xhigh ? Presque certainement parce que vous avez également envoyé thinking: {type: "disabled"}. Désactiver la réflexion plafonne l'effort à high, et la combinaison est rejetée par requête. Soit supprimez le bloc de désactivation de la réflexion, soit réduisez l'effort à high ou moins.
Puis-je réutiliser mes paramètres d'effort Opus 4.8 sur Opus 5 ? Non. Les niveaux ont été recalibrés, donc la même étiquette signifie une quantité de raisonnement différente. Anthropic vous demande d'effectuer un nouveau balayage. La liste complète des changements se trouve dans le guide de migration.
La réduction de l'effort rend-elle les réponses plus courtes ? Non. L'effort contrôle le raisonnement, pas la longueur visible, et les réponses par défaut d'Opus 5 sont plus longues que celles d'Opus 4.8. Demandez explicitement la concision dans l'invite si vous souhaitez une sortie plus courte.
Quel max_tokens dois-je utiliser avec xhigh ou max ? Commencez à 64000. max_tokens plafonne la réflexion et la réponse ensemble, donc un budget dimensionné pour un modèle sans réflexion tronquera. Vous n'êtes facturé que pour les jetons produits, donc le plafond élevé ne coûte rien en soi.
Pour la fiche technique complète, la matrice de disponibilité et le contexte tarifaire de tout cela, commencez par ce qu'est Claude Opus 5.
