Claude Opus 5 a été lancé le 24 juillet 2026 au prix de 5 $ par million de jetons d'entrée et 25 $ par million de jetons de sortie. C'est le même tarif qu'Anthropic facturait pour Opus 4.8, et exactement la moitié de ce que coûte Fable 5. La couverture du lancement a repris ce titre, et il est exact jusqu'à un certain point.
Ce que la couverture a omis, c'est la partie qui détermine votre facture : les écritures de cache, les succès de cache, les tarifs par lot, le mode rapide, le multiplicateur régional et les changements de comportement qui modifient discrètement le nombre de jetons. Ce guide vous fournit le tableau des prix complet, puis calcule le coût sur des formes de requêtes réelles afin que vous puissiez établir un budget avant de lancer. Pour vérifier les chiffres par rapport à votre propre trafic, envoyez les requêtes depuis Apidog et lisez le bloc usage sur chaque réponse.
Le tableau complet des prix de Claude Opus 5
Chaque tarif ci-dessous provient de la documentation tarifaire d'Anthropic et s'applique à l'ID de modèle claude-opus-5.
| Catégorie de jeton | Prix par million de jetons |
|---|---|
| Entrée (standard) | 5,00 $ |
| Sortie (standard) | 25,00 $ |
| Écriture cache de prompt, TTL 5 minutes | 6,25 $ |
| Écriture cache de prompt, TTL 1 heure | 10,00 $ |
| Succès et rafraîchissements du cache | 0,50 $ |
| Entrée API par lot | 2,50 $ |
| Sortie API par lot | 12,50 $ |
| Entrée mode rapide | 10,00 $ |
| Sortie mode rapide | 50,00 $ |
Quelques points à retenir :
- Les succès de cache coûtent un dixième de l'entrée standard. C'est le levier le plus important du tableau.
- L'écriture de cache de 5 minutes entraîne une prime de 1,25x par rapport à l'entrée standard ; l'écriture d'1 heure entraîne un facteur de 2x.
- Le mode par lot offre une réduction forfaitaire de 50 % tant pour l'entrée que pour la sortie.
- Le mode rapide correspond exactement au double du prix standard pour une vitesse de sortie 2,5 fois supérieure. Il s'agit d'un aperçu de recherche, API propriétaire uniquement (pas Bedrock, Google Cloud ou Microsoft Foundry), et il ne se combine pas avec l'API par lot.
- Il n'y a pas de prime pour les contextes longs. La fenêtre de contexte de 1 million de jetons est la valeur par défaut et le maximum, et les jetons au-delà de tout seuil sont facturés au même tarif de 5 $. Certains modèles concurrents facturent plus une fois que vous dépassez un niveau de contexte. Opus 5 ne le fait pas.

Ce dernier point fixe un plafond strict pour une seule requête. L'appel API Messages le plus cher possible est de 1 million de jetons d'entrée plus le maximum de sortie de 128 000 : 5,00 $ + 3,20 $, soit 8,20 $. Sur l'API par lot, où la sortie maximale passe à 300 000 avec l'en-tête bêta output-300k-2026-03-24, le côté sortie plafonne à 3,75 $.
Le point de référence : identique à 4.8, moitié de Fable 5
Voici où se situe Opus 5 par rapport aux modèles auxquels vous êtes le plus susceptible de le comparer.
| Modèle | Entrée / MTok | Sortie / MTok |
|---|---|---|
| Claude Opus 5 | 5,00 $ | 25,00 $ |
| Claude Opus 4.8 | 5,00 $ | 25,00 $ |
| Claude Fable 5 | 10,00 $ | 50,00 $ |
| Claude Sonnet 5 (intro, jusqu'au 31 août 2026) | 2,00 $ | 10,00 $ |
| Claude Sonnet 5 (à partir du 1er sept. 2026) | 3,00 $ | 15,00 $ |
Deux lectures de ce tableau sont importantes.
Premièrement, la mise à niveau d'Opus 4.8 ne coûte rien par jeton. Le tarif est identique, et l'a été pour les versions 4.5, 4.6, 4.7 et 4.8. L'échange d'ID de modèle n'affecte pas votre économie unitaire. Ce qu'il modifie, c'est votre volume de jetons, ce que nous aborderons ci-dessous. Le détail des prix d'Opus 4.8 reste valable pour tout ce qui utilise l'ancien ID.
Deuxièmement, Opus 5 représente la moitié du prix de Fable 5. Les chiffres de lancement d'Anthropic affirment qu'Opus 5 se situe à 0,5 % du pic de Fable 5 sur CursorBench 3.2 et le dépasse sur OSWorld 2.0 à environ un tiers du coût par tâche. Il s'agit de chiffres fournis par le fournisseur issus du billet de lancement d'Opus 5, et personne ne les a reproduits de manière indépendante au 25 juillet 2026. Traitez-les comme des affirmations, pas des résultats établis. La comparaison Opus 5 vs Fable 5 examine où l'écart de prix en vaut la peine, et la page des prix de Fable 5 contient les détails du niveau supérieur.
Exemple concret 1 : une seule requête
Commençons par la forme la plus simple. Un appel de résumé avec 8 000 jetons d'entrée et 1 200 jetons de sortie.
- Entrée : 8 000 / 1 000 000 x 5,00 $ = 0,040 $
- Sortie : 1 200 / 1 000 000 x 25,00 $ = 0,030 $
- Total : 0,070 $ par appel
À 10 000 appels par mois, cela représente 700 $. La même charge de travail sur Fable 5 coûte 0,140 $ par appel, soit 1 400 $ par mois. Sur Sonnet 5 au tarif de lancement, cela coûte 0,028 $ par appel, soit 280 $.
Notez que la sortie représente 43 % de la facture pour une requête avec près de sept fois plus d'entrée que de sortie. La sortie coûte cinq fois plus cher que l'entrée, le volume de sortie domine donc plus rapidement que la plupart des gens ne s'y attendent. Cela est plus important sur Opus 5 que sur 4.8, car les jetons de pensée sont facturés comme de la sortie et la pensée adaptative est désormais activée par défaut.
Exemple concret 2 : une longue session agentique avec mise en cache
C'est là que se trouve le vrai argent, et les vraies économies. Prenons un agent de codage avec une invite système de 120 000 jetons plus le contexte du dépôt, exécutant une session de 40 tours. Chaque tour ajoute 1 500 jetons de nouvelle conversation et produit 2 500 jetons de sortie.
Sans mise en cache des invites, vous renvoyez le contexte complet à chaque tour :
| Poste | Jetons | Tarif | Coût |
|---|---|---|---|
| Entrée (120 000 x 40, plus 60 000 nouveaux) | 4 860 000 | 5,00 $ | 24,30 $ |
| Sortie (2 500 x 40) | 100 000 | 25,00 $ | 2,50 $ |
| Total | 26,80 $ |
Avec un cache de prompt de 5 minutes sur le préfixe de 120 000 jetons :
| Poste | Jetons | Tarif | Coût |
|---|---|---|---|
| Écriture cache, une fois | 120 000 | 6,25 $ | 0,75 $ |
| Lectures cache (39 tours) | 4 680 000 | 0,50 $ | 2,34 $ |
| Nouvelle entrée (1 500 x 40) | 60 000 | 5,00 $ | 0,30 $ |
| Sortie (2 500 x 40) | 100 000 | 25,00 $ | 2,50 $ |
| Total | 5,89 $ |
C'est une réduction de 78 %, et la sortie représente désormais 42 % de la facture au lieu de 9 %. Une fois le cache correctement mis en place, la sortie est la prochaine chose à optimiser.
Une mise en garde concernant le TTL de 5 minutes : les lectures de cache le rafraîchissent, de sorte qu'une session avec des tours espacés de moins de cinq minutes reste active après une seule écriture. Si votre agent reste inactif plus longtemps, utilisez l'écriture d'une heure à 10 $ par million. Dans ce cas, cela augmente l'écriture de 0,75 $ à 1,20 $ et le total à 6,34 $, soit toujours 76 % en dessous de l'exécution sans cache.
Exemple concret 3 : traitement par lot
Pour tout ce qui ne nécessite pas de réponse synchrone, l'API par lot offre une réduction forfaitaire de 50 %. Prenons 50 000 documents de 1 200 jetons d'entrée et 150 jetons de sortie chacun.
| Voie | Coût entrée | Coût sortie | Total |
|---|---|---|---|
| Standard | 60 M jetons x 5,00 $ = 300,00 $ | 7,5 M jetons x 25,00 $ = 187,50 $ | 487,50 $ |
| Par lot | 60 M jetons x 2,50 $ = 150,00 $ | 7,5 M jetons x 12,50 $ = 93,75 $ | 243,75 $ |
Mêmes jetons, même modèle, 243,75 $ économisés. Le compromis est la latence, pas la qualité. Si votre tâche de classification, d'enrichissement ou d'évaluation tolère une livraison asynchrone, l'exécuter sur le point de terminaison standard vous fait perdre la moitié du budget potentiel.
Exemple concret 4 : le coût réel du mode rapide
Le mode rapide double le tarif à 10 $ / 50 $ pour une vitesse de sortie environ 2,5 fois supérieure. Exécutez la requête de l'exemple 1 avec ce mode et vous obtenez 0,080 $ d'entrée plus 0,060 $ de sortie, soit 0,140 $ par appel, exactement le double.
Cela positionne Opus 5 au même prix que le tarif standard de Fable 5 : vous payez des prix de pointe pour la latence, et non pour la capacité. Cela en vaut la peine pour les interfaces interactives où un utilisateur voit les jetons apparaître, mais est difficile à justifier pour le travail en arrière-plan. Il ne se combine pas avec l'API par lot, de sorte que les deux leviers de coût sont mutuellement exclusifs par conception.
Les quatre leviers qui impactent réellement votre facture
Ces quatre éléments sont spécifiques à Opus 5, et précisent l'ampleur des économies réalisées.
1. Le minimum du cache de prompt est passé à 512 jetons
Sur Opus 4.8, le minimum cachable était de 1 024 jetons. Sur Opus 5, il est de 512. Les invites auparavant trop courtes pour être mises en cache le sont désormais sans aucune modification de code, au-delà de l'ajout du bloc de contrôle de cache.
Le calcul du seuil de rentabilité est meilleur que la plupart des gens ne l'imaginent. Une écriture de cache coûte 1,25x l'entrée standard, une lecture coûte 0,1x. Résolvons pour le point où la mise en cache est avantageuse :
- TTL 5 minutes : seuil de rentabilité à 1,3 requêtes. Vous êtes gagnant à partir du deuxième appel.
- TTL 1 heure : seuil de rentabilité à 2,1 requêtes. Vous êtes gagnant à partir du troisième appel.
Concrètement, une invite système de 700 jetons réutilisée sur 1 000 appels en rafale coûte 3,50 $ sans cache. Avec cache, elle coûte 0,0044 $ pour l'écriture plus 999 lectures à 0,00035 $, soit un total de 0,354 $. Cette invite n'aurait pas pu être mise en cache du tout sur Opus 4.8.
2. Traitement par lot à 50 %
Abordé ci-dessus, mais il convient de le répéter en tant que levier : vérifiez quelles charges de travail nécessitent réellement une réponse synchrone. Les exécutions d'évaluation, les rétrocomptages, les résumés nocturnes et la classification de contenu n'en ont généralement pas besoin.
3. Les niveaux d'effort low et medium sont enfin utilisables
output_config.effort contrôle la quantité de "réflexion" du modèle, et les jetons de "réflexion" sont facturés comme de la sortie à 25 $ par million. Opus 5 a recalibré les niveaux d'effort, et Anthropic déclare que low et medium sont significativement plus performants que sur les modèles Opus précédents. Le niveau par défaut est high ; xhigh reste le point de départ recommandé pour le codage et le travail agentique.
Les économies sont directement proportionnelles au volume de jetons de "réflexion". Si une tâche utilise en moyenne 8 000 jetons de "réflexion" à xhigh et 1 500 à low, vous économisez 6 500 jetons de sortie, soit 0,1625 $ par tâche, ce qui représente 16 250 $ sur 100 000 tâches. Ces chiffres sont illustratifs : l'écart réel dépend de vos invites, c'est pourquoi Anthropic vous conseille d'effectuer une nouvelle analyse de l'effort par rapport à vos propres évaluations plutôt que de conserver les paramètres de la version 4.8. Le guide des paramètres d'effort couvre cette analyse.
Un piège : la réduction de l'effort diminue les jetons de "réflexion", mais pas la longueur visible de la réponse. Les réponses par défaut et les livrables écrits d'Opus 5 sont plus longs que ceux d'Opus 4.8, et l'effort ne corrigera pas cela. Si vous voulez des réponses plus courtes, demandez des réponses plus courtes.
4. Réduction de la surcharge d'invite système pour l'utilisation d'outils
Lorsque vous envoyez des définitions d'outils, l'API injecte une invite système que vous payez. Sur Opus 5, cette surcharge est de 286 jetons pour le choix d'outil auto ou none, contre 290 sur Opus 4.8 et 675 sur Opus 4.7.
Soyons honnêtes quant à l'ampleur de cette économie. Par rapport à 4.8, la différence de quatre jetons représente 20 $ sur un million de requêtes : du bruit. Par rapport à 4.7, la différence de 389 jetons représente 0,001945 $ par requête, soit 1 945 $ par million de requêtes. Si vous utilisez toujours 4.7, c'est une somme non négligeable ; sur 4.8, c'est une erreur d'arrondi.
Pour les leviers applicables à l'ensemble de la gamme Claude, notre guide sur la réduction de votre facture API Claude offre une perspective plus large.
Deux postes que les gens oublient
Le multiplicateur inference_geo: "us" est de 1,1x. Si vous épinglez l'inférence à une infrastructure uniquement américaine pour des raisons de conformité ou de résidence des données, chaque catégorie de jetons est multipliée par 1,1 : entrée 5,50 $, sortie 27,50 $, succès du cache 0,55 $, traitement par lot 2,75 $ / 13,75 $. La charge de travail de l'exemple 1 passe de 700 $ par mois à 770 $. Sur une facture de 50 000 $, cela représente un poste de 5 000 $, alors assurez-vous d'avoir besoin de cet épinglage avant de le configurer.
Le niveau de priorité (Priority Tier) n'est pas pris en charge sur Opus 5. Opus 4.8 le conserve. Si votre planification de capacité dépend des engagements du niveau de priorité, c'est une réelle contrainte pour la transition. Le guide de migration d'Opus 4.8 vers Opus 5 le couvre, ainsi que les changements API importants.
Changements de comportement qui apparaissent sur votre facture
Les tarifs par jeton représentent la moitié de la facture. Le volume de jetons est l'autre moitié, et trois changements de comportement d'Opus 5 augmentent ce volume si vous ne faites rien.
- La "réflexion" est activée par défaut. Sur Opus 4.8, une requête sans champ
thinkings'exécutait sans "réflexion". Sur Opus 5, la même requête exécute une "réflexion" adaptative, et ces jetons sont facturés comme de la sortie. Étant donné quemax_tokensplafonne la "réflexion" et la réponse combinées, certaines de ces charges de travail commenceront également à être tronquées. - Opus 5 délègue plus facilement aux sous-agents. Chaque sous-agent a son propre ensemble de jetons facturés. Limitez ou définissez la portée de la délégation sur les charges de travail sensibles au coût.
- Opus 5 vérifie son propre travail sans y être invité. Si vous avez conservé les instructions "vérifiez votre travail", le guide d'ingénierie des invites d'Anthropic indique de les supprimer. La sur-vérification génère des jetons.
Aucun de ces éléments ne modifie le prix par jeton. Tous modifient ce que vous payez.
Confirmer vos dépenses réelles avec Apidog
Le moyen le plus rapide de cesser de deviner est de lire l'objet usage sur chaque réponse. Il rapporte séparément input_tokens, output_tokens, cache_creation_input_tokens et cache_read_input_tokens, ce qui est la ventilation exacte dont vous avez besoin pour vérifier les calculs ci-dessus par rapport à votre propre trafic.

Apidog est une plateforme de développement et de test d'API, elle gère donc bien cela. Dirigez une requête vers le point de terminaison Messages avec "model": "claude-opus-5", puis :
- Dupliquez la requête enregistrée une fois par niveau d'effort et comparez le volume de jetons de "réflexion" côte à côte sur des invites identiques.
- Affirmez que
usage.cache_read_input_tokensest supérieur à zéro, afin qu'un cache silencieusement défectueux apparaisse comme un test échoué au lieu d'une facture surprise. - Stockez les clés comme variables d'environnement plutôt que dans le corps de la requête, afin qu'une clé de développement n'exécute jamais un lot de taille de production.
- Surveillez le flux SSE pour voir où vont les jetons de sortie sur les longues générations.
Téléchargez Apidog pour effectuer ces vérifications en parallèle du guide détaillé de notre guide API Opus 5.
Ce que vous achetez réellement à 5 $ / 25 $
Opus 5 offre un excellent rapport prix-capacité, et il ne s'agit pas du sommet de la pile Claude. Fable 5 reste le modèle largement diffusé le plus performant d'Anthropic, et Opus 5 est toujours en retrait par rapport à Mythos 5 en matière d'exploitation de cybersécurité et de recherche en biologie autonome. Anthropic l'affirme clairement. Le cadrage honnête est une capacité de pointe à la moitié du prix de pointe, avec un plafond nommé au-dessus. Notre explication du modèle de classe Mythos couvre ce qui se situe au-dessus de cette ligne.
Pour la plupart des équipes, la vraie question n'est pas Opus 5 contre le plafond. Il s'agit de savoir si la charge de travail nécessite Opus du tout, ou si Sonnet 5 à 2 $ / 10 $ (passant à 3 $ / 15 $ le 1er septembre 2026) fait le travail pour 40 % du prix. Exécutez les deux contre vos propres évaluations avant d'engager un budget. Les spécifications complètes et la disponibilité se trouvent dans notre aperçu de Claude Opus 5 ; l'aperçu des modèles d'Anthropic contient le tableau canonique.
FAQ
Combien coûte Claude Opus 5 ? 5 $ par million de jetons d'entrée et 25 $ par million de jetons de sortie sur l'API standard. Les succès de cache coûtent 0,50 $, les exécutions par lot coûtent 2,50 $ / 12,50 $, et le mode rapide coûte 10 $ / 50 $.
Claude Opus 5 est-il plus cher qu'Opus 4.8 ? Par jeton, non : les tarifs sont identiques. Votre facture peut néanmoins augmenter, car la "réflexion" est activée par défaut et les réponses par défaut sont plus longues. Mesurez le volume de jetons plutôt que de supposer la parité.
Y a-t-il une majoration pour les contextes longs sur la fenêtre de 1 million de jetons ? Non. La fenêtre de contexte de 1 million de jetons est à la fois la valeur par défaut et le maximum, et il n'y a pas de niveau premium pour les entrées longues.
Quelle est la manière la moins chère d'exécuter Claude Opus 5 ? Mettez en cache agressivement (le minimum de 512 jetons signifie que presque tout préfixe réutilisé est admissible), exécutez les tâches non urgentes via l'API par lot pour une réduction forfaitaire de 50 %, et balayez les niveaux d'effort pour trouver le plus bas qui passe vos évaluations. Le guide sur la voie gratuite et la moins chère en dit plus.
L'épinglage régional coûte-t-il plus cher ? Oui. La définition de inference_geo: "us" applique un multiplicateur de 1,1x à chaque catégorie de jetons, y compris les succès de cache et les lots.
