Claude Sonnet 5.5 coûte 2 $ par million de jetons d'entrée et 10 $ par million de jetons de sortie sur l'API Claude, soit le même prix que Sonnet 5. Les lectures de cache coûtent 0,20 $ par million, l'API Batch réduit les deux tarifs de moitié à 1 $ et 5 $, la fenêtre contextuelle complète de 1 million de jetons est facturée au tarif standard, et le mode rapide n'est pas proposé. L'augmentation prévue du 1er septembre de Sonnet 5 à 3 $/15 $ a été annulée, le prix standard est donc maintenant de 2 $/10 $.
Ce guide répertorie chaque poste tarifaire de Claude Sonnet 5.5, présente trois exemples de coûts avec les calculs détaillés, et explique pourquoi l'effort influence davantage votre facture que le tarif par jeton. Nouveau sur le modèle ? Commencez par ce qu'est Claude Sonnet 5.5, ou lisez comment utiliser Claude Sonnet 5.5 gratuitement. Pour vérifier les chiffres par rapport à votre propre trafic, envoyez la requête depuis Apidog et lisez le bloc usage sur chaque réponse.
Tableau des tarifs de l'API Claude Sonnet 5.5
Prix par million de jetons (MTok), tirés des documents tarifaires d'Anthropic :
| Poste | Prix par MTok |
|---|---|
| Entrée | $2.00 |
| Écriture cache de 5 minutes | $2.50 |
| Écriture cache de 1 heure | $4.00 |
| Lecture cache | $0.20 |
| Sortie | $10.00 |
| Entrée Batch | $1.00 |
| Sortie Batch | $5.00 |
Trois détails modifient ce que vous payez :
- Inférence limitée aux États-Unis.
inference_geo: "us"coûte 1,1x sur chaque catégorie de jetons sur l'API Claude et la plateforme Claude sur AWS (entrée à 2,20 $, sortie à 11 $, lectures de cache à 0,22 $). Le déploiement de Foundry dans la zone de données américaine applique le même multiplicateur de 1,1x ; Bedrock et Google Cloud facturent séparément. - Pas de surcoût pour le contexte long. Une requête de 900 000 jetons coûte le même prix par jeton qu'une requête de 9 000 jetons.
- Même tokenizer que Sonnet 5. Vos nombres de jetons sont transférés sans modification.
Comparaison du prix catalogue de Sonnet 5.5
| Modèle | Entrée | Sortie | Notes |
|---|---|---|---|
| Claude Sonnet 5.5 | $2 | $10 | Lecture cache 0,20 $ ; contexte de 1M ; pas de mode rapide |
| Claude Sonnet 5 | $2 | $10 | Lecture cache 0,20 $ ; augmentation de 3 $/15 $ annulée |
| Claude Opus 5.5 | $4 | $20 | Lecture cache 0,20 $ ; mode rapide 8 $/40 $ |
| Claude Haiku 4.5 | $1 | $5 | contexte de 200k |
| GPT-6 Sol | $2 | $10 | 90 % de réduction sur l'entrée en cache ; contexte de 872k |
| GPT-6 Luna | $0.10 | $0.50 | contexte de 1M |
Sonnet 5.5 coûte la moitié d'Opus 5.5 pour l'entrée, la sortie et les écritures de cache. Il partage le même prix catalogue de 2 $/10 $ avec GPT-6 Sol, donc le choix entre les deux dépend des résultats par tâche. Pour le contexte, voir les tarifs de Claude Sonnet 5, la guerre des prix des modèles d'IA de septembre 2026 et les tarifs de GPT-6 Sol.
Exemples concrets : ce que coûtent les requêtes réelles
La formule pour chaque ligne : jetons ÷ 1 000 000 × prix par MTok. Calculez le prix de chaque poste, puis additionnez.
Exemple 1 : une requête de type chat
3 000 jetons d'entrée, 800 jetons de sortie, sans mise en cache.
- Entrée : 3 000 ÷ 1 000 000 × 2 $ = 0,006 $
- Sortie : 800 ÷ 1 000 000 × 10 $ = 0,008 $
- Total : 0,006 $ + 0,008 $ = 0,014 $
Un millier de ces requêtes coûtent 14 $. La sortie représente 21 % des jetons mais 57 % de la facture, la longueur de la sortie importe donc plus que la longueur de l'invite.
Exemple 2 : un agent relisant un préfixe de 50 000 jetons
Une boucle d'agent envoie le même préfixe de 50 000 jetons (invite système, outils, contexte de dépôt) sur 20 appels. Seul le préfixe est facturé ici.
Sans cache : 20 × 50 000 = 1 000 000 jetons ; 1 000 000 ÷ 1 000 000 × 2 $ = 2,00 $
Avec cache, avec une écriture de 5 minutes :
- L'appel 1 écrit le cache : 50 000 ÷ 1 000 000 × 2,50 $ = 0,125 $
- Les appels 2 à 20 le lisent : 19 × 50 000 = 950 000 jetons ; 950 000 ÷ 1 000 000 × 0,20 $ = 0,19 $
- Total : 0,125 $ + 0,19 $ = 0,315 $
Cela représente une économie de 1,685 $, soit environ 84 %. L'écriture de 5 minutes n'est rentable que si les appels se situent dans la fenêtre ; pour des boucles plus lentes, une écriture d'une heure coûte 50 000 ÷ 1 000 000 × 4 $ = 0,20 $, donc le total est de 0,20 $ + 0,19 $ = 0,39 $, soit toujours environ 80 % de moins que sans cache. Le même raisonnement est appliqué pour Opus dans nos calculs de coût de mise en cache des invites ; le taux de lecture de 0,20 $ est identique.
Exemple 3 : un travail par lots de 10 000 requêtes
Même forme que l'exemple 1, envoyé via l'API Batch.
- Entrée : 10 000 × 3 000 = 30 000 000 jetons ; 30 × 1 $ = 30 $
- Sortie : 10 000 × 800 = 8 000 000 jetons ; 8 × 5 $ = 40 $
- Total Batch : 70 $, contre 30 × 2 $ + 8 × 10 $ = 140 $ aux tarifs standards
Le traitement par lots augmente également le plafond de sortie de 128 000 à 300 000 jetons avec la version bêta output-300k-2026-03-24.
Coût par tâche, pas par jeton
La carte tarifaire vous indique ce que coûte un jeton, et non combien de jetons votre tâche consomme. Ce deuxième chiffre varie bien plus avec l'effort qu'avec n'importe quel écart de tarif entre les modèles.
Anthropic affirme que, d'après ses tests, Sonnet 5.5 « coûte jusqu'à 30 % de moins par tâche que son prédécesseur ». Le billet de lancement représente également le coût à chaque niveau d'effort. Les exécutions de Terminal-Bench 4.0 sont celles d'Anthropic, FrontierCode a été exécuté par Cognition, et les coûts d'index proviennent de Artificial Analysis :
| Effort | Terminal-Bench 4.0 (score, $/tentative) | FrontierCode v1.1 (score, $/tâche) | Index AA (score, coût d'exécution) |
|---|---|---|---|
| faible | 20.0%, $0.76 | 29.3%, $0.19 | 35.8, $544 |
| moyen | 28.8%, $0.83 | 36.5%, $0.24 | 40.7, $701 |
| élevé | 43.0%, $1.94 | 49.4%, $0.42 | 46.7, $1,176 |
| très élevé | 61.5%, $5.30 | 52.1%, $1.59 | 51.9, $2,738 |
| max | 70.6%, $12.54 | 46.2%, $20.78 | 56.0, $8,977 |
Ce qui ressort :
- Le niveau max coûte environ 6,5 fois plus cher que le niveau élevé sur Terminal-Bench (12,54 $ ÷ 1,94 $ = 6,46). L'index d'Artificial Analysis a coûté environ 16,5 fois plus cher à exécuter au niveau max qu'au niveau faible (8 977 $ ÷ 544 $).
- Plus d'effort n'est pas toujours mieux. FrontierCode passe de 52,1 % au niveau très élevé à 46,2 % au niveau max, tandis que le coût par tâche augmente de 13x (20,78 $ ÷ 1,59 $). La note de bas de page d'Anthropic indique qu'au niveau max, le modèle a plus souvent exécuté une compétence de révision qui déploie des sous-agents, ce qui a provoqué un dépassement de délai ou des modifications hors de portée dans les cas examinés par Cognition.
- Opus à un effort moindre est compétitif. Opus 5.5 au niveau moyen a obtenu un score de 57,6 % sur Terminal-Bench pour 2,94 $, contre 43,0 % pour Sonnet 5.5 au niveau élevé pour 1,94 $. Notre comparaison Sonnet 5.5 vs Opus 5.5 explique ce compromis.
La verbosité au niveau max est l'autre piège. Le rapport d'OfficeChai sur les données d'Artificial Analysis situe Sonnet 5.5 à environ 193 000 jetons de sortie par tâche d'index au niveau max, avec un coût par tâche environ 50 % supérieur à Sonnet 5. Simon Willison a rapporté sur Hacker News qu'une exécution à effort maximal a consommé 128 000 jetons de réflexion et s'est épuisée avant de produire la réponse.
Six leviers pour réduire la facture
- Définissez l'effort intentionnellement. L'API est par défaut à
high(élevé) ; Claude Code et les applications Claude sont par défaut àmedium(moyen). Le guide d'invite d'Anthropic suggèremediumoulow(faible) pour le chat etxhigh(très élevé) oumax(maximal) uniquement pour des gains de qualité mesurés. Ne reprenez pas les paramètres de Sonnet 5 ; l'échelle a été recalibrée. - Utilisez
between_toolslà où vous aviez désactivé la réflexion.thinking: {"type": "disabled"}renvoie maintenant une erreur 400 ;{"type": "between_tools"}le remplace aux niveauxlow,mediumethigh. - Mettez en cache tout ce qui est réutilisé. L'invite minimale pouvant être mise en cache est de 512 jetons (1 024 sur Sonnet 5). La modification du niveau d'
effortentre les requêtes invalide le cache, alors maintenez-le stable. - Traitez par lots ce qui peut attendre. Moitié prix sur l'entrée et la sortie.
- Maintenez
max_tokensjuste. Le guide d'Anthropic considèrestop_reason: "max_tokens"comme une réponse échouée, donc une réponse tronquée est une dépense sans rien à livrer. - Éliminez le travail non demandé. Sonnet 5.5 ajoute des tests, des documents et des fichiers que vous n'avez pas demandés, et démarre des cycles de révision supplémentaires aux niveaux
xhighetmax. Le paragraphe d'invite système suggéré par Anthropic a réduit le coût de session d'environ un tiers au niveaumaxsans modification de la qualité.
Où d'autre payez-vous pour Sonnet 5.5
- Forfaits Claude (claude.com/pricing) : Le plan Gratuit est à 0 $ et inclut Sonnet dans le chat, sans Claude Code. Le plan Pro est à 17 $/mois facturé annuellement ou 20 $ mensuellement. Le plan Max commence à 100 $/mois. Les places d'équipe sont à 20 $/25 $ (standard) ou 100 $/125 $ (premium), annuellement/mensuellement. Aucun d'entre eux n'inclut l'accès à l'API.
- GitHub Copilot : Pro (10 $/mois), Pro+, Max, Business et Enterprise, facturés au prix catalogue du fournisseur. Copilot Pro comprend 1 500 crédits IA par mois à 0,01 $ chacun, soit environ 15 $ de jetons, ou environ 1 070 requêtes de l'exemple 1 (15 $ ÷ 0,014 $). Copilot Free et Student ne peuvent pas le sélectionner.
- Cursor : mêmes tarifs du pool Autres Modèles (Pro, Pro Plus et Ultra), plus 10 % pour les endpoints uniquement américains (2,20 $/11 $).
- OpenRouter : 2 $/10 $, ou 1 $/5 $ sur la variante
:batch. Pas de variante:free. - Vercel AI Gateway : 2 $/10 $ avec des lectures de cache à 0,20 $. Le crédit gratuit de 5 $ ne couvre pas Sonnet 5.5.
- Bedrock, Google Cloud, Foundry : page de tarifs propre à chaque cloud. Bedrock ne prend en charge que le niveau Standard, sans Batch.
Plutôt à la recherche de crédits ? Voir existe-t-il une API Claude Sonnet 5.5 gratuite.
Suivez le coût par requête dans Apidog
Chaque réponse Messages contient un objet usage avec input_tokens, output_tokens et les comptes de cache. C'est suffisant pour estimer le prix de n'importe quel appel dans Apidog :

- Stockez votre clé en tant que variable d'environnement
ANTHROPIC_API_KEY. - Enregistrez cette requête une fois par niveau d'effort (
low,medium,high) avec la même invite :
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 4000,
"thinking": {"type": "between_tools"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
}'
- Ajoutez un post-processeur qui calcule le prix de l'appel et échoue en cas de troncature :
const body = pm.response.json();
const u = body.usage;
const cost = (u.input_tokens * 2 + u.output_tokens * 10) / 1e6;
pm.environment.set("last_call_usd", cost.toFixed(5));
pm.test("not truncated", () => pm.expect(body.stop_reason).to.not.eql("max_tokens"));
- Exécutez les trois et comparez
usage.output_tokenset le coût côte à côte. Si vous utilisez le cache, ajoutez les comptes de cache à leurs propres tarifs.
Le processus complet de la requête est détaillé dans comment utiliser l'API Claude Sonnet 5.5.
FAQ
Combien coûte Claude Sonnet 5.5 par million de jetons ? 2 $ pour l'entrée et 10 $ pour la sortie sur l'API Claude. Les lectures de cache coûtent 0,20 $ ; l'API Batch facture 1 $ et 5 $.
Sonnet 5.5 est-il plus cher que Sonnet 5 ? Non. Le prix par jeton est identique, et Anthropic affirme que Sonnet 5.5 coûte jusqu'à 30 % de moins par tâche dans ses tests.
Y a-t-il une majoration au-delà de 200 000 jetons ? Non. La fenêtre complète de 1M est facturée au tarif standard.
Sonnet 5.5 dispose-t-il d'un mode rapide ? Non. Le mode rapide n'est disponible que sur Opus 5.5, Opus 5 et Opus 4.8.
Claude Sonnet 5.5 est-il gratuit ? Dans l'application de chat Claude, oui : tout le monde peut discuter avec sur le plan Gratuit. L'API fonctionne avec des crédits prépayés ; le guide de l'API gratuite couvre les programmes de crédits.
Étape suivante : estimez le coût de votre propre charge de travail
Prenez vos trois formes de requêtes les plus courantes, exécutez chacune à deux niveaux d'effort, et multipliez les chiffres d'usage par le tableau ci-dessus. Vous verrez rapidement si le niveau medium maintient votre barre de qualité ou si le niveau high justifie ses jetons supplémentaires. Téléchargez Apidog pour garder ces requêtes et le script de coût côte à côte.
