Tarifs Claude Sonnet 5.5 : Ventilation Complète des Coûts (API, Mise en cache, Traitement par lots, Forfaits)

Tarification de Claude Sonnet 5.5 : 2 $/10 $ par million de jetons, 0,20 $ pour les lectures du cache, traitement par lots à moitié prix. Exemples de coûts détaillés, coûts d'effort et prix des forfaits.

Ashley Goolam

Ashley Goolam

29 September 2026

Tarifs Claude Sonnet 5.5 : Ventilation Complète des Coûts (API, Mise en cache, Traitement par lots, Forfaits)

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Claude Sonnet 5.5 coûte 2 $ par million de jetons d'entrée et 10 $ par million de jetons de sortie sur l'API Claude, soit le même prix que Sonnet 5. Les lectures de cache coûtent 0,20 $ par million, l'API Batch réduit les deux tarifs de moitié à 1 $ et 5 $, la fenêtre contextuelle complète de 1 million de jetons est facturée au tarif standard, et le mode rapide n'est pas proposé. L'augmentation prévue du 1er septembre de Sonnet 5 à 3 $/15 $ a été annulée, le prix standard est donc maintenant de 2 $/10 $.

Ce guide répertorie chaque poste tarifaire de Claude Sonnet 5.5, présente trois exemples de coûts avec les calculs détaillés, et explique pourquoi l'effort influence davantage votre facture que le tarif par jeton. Nouveau sur le modèle ? Commencez par ce qu'est Claude Sonnet 5.5, ou lisez comment utiliser Claude Sonnet 5.5 gratuitement. Pour vérifier les chiffres par rapport à votre propre trafic, envoyez la requête depuis Apidog et lisez le bloc usage sur chaque réponse.

Tableau des tarifs de l'API Claude Sonnet 5.5

Prix par million de jetons (MTok), tirés des documents tarifaires d'Anthropic :

Poste Prix par MTok
Entrée $2.00
Écriture cache de 5 minutes $2.50
Écriture cache de 1 heure $4.00
Lecture cache $0.20
Sortie $10.00
Entrée Batch $1.00
Sortie Batch $5.00

Trois détails modifient ce que vous payez :

Comparaison du prix catalogue de Sonnet 5.5

Modèle Entrée Sortie Notes
Claude Sonnet 5.5 $2 $10 Lecture cache 0,20 $ ; contexte de 1M ; pas de mode rapide
Claude Sonnet 5 $2 $10 Lecture cache 0,20 $ ; augmentation de 3 $/15 $ annulée
Claude Opus 5.5 $4 $20 Lecture cache 0,20 $ ; mode rapide 8 $/40 $
Claude Haiku 4.5 $1 $5 contexte de 200k
GPT-6 Sol $2 $10 90 % de réduction sur l'entrée en cache ; contexte de 872k
GPT-6 Luna $0.10 $0.50 contexte de 1M

Sonnet 5.5 coûte la moitié d'Opus 5.5 pour l'entrée, la sortie et les écritures de cache. Il partage le même prix catalogue de 2 $/10 $ avec GPT-6 Sol, donc le choix entre les deux dépend des résultats par tâche. Pour le contexte, voir les tarifs de Claude Sonnet 5, la guerre des prix des modèles d'IA de septembre 2026 et les tarifs de GPT-6 Sol.

Exemples concrets : ce que coûtent les requêtes réelles

La formule pour chaque ligne : jetons ÷ 1 000 000 × prix par MTok. Calculez le prix de chaque poste, puis additionnez.

Exemple 1 : une requête de type chat

3 000 jetons d'entrée, 800 jetons de sortie, sans mise en cache.

Un millier de ces requêtes coûtent 14 $. La sortie représente 21 % des jetons mais 57 % de la facture, la longueur de la sortie importe donc plus que la longueur de l'invite.

Exemple 2 : un agent relisant un préfixe de 50 000 jetons

Une boucle d'agent envoie le même préfixe de 50 000 jetons (invite système, outils, contexte de dépôt) sur 20 appels. Seul le préfixe est facturé ici.

Sans cache : 20 × 50 000 = 1 000 000 jetons ; 1 000 000 ÷ 1 000 000 × 2 $ = 2,00 $

Avec cache, avec une écriture de 5 minutes :

Cela représente une économie de 1,685 $, soit environ 84 %. L'écriture de 5 minutes n'est rentable que si les appels se situent dans la fenêtre ; pour des boucles plus lentes, une écriture d'une heure coûte 50 000 ÷ 1 000 000 × 4 $ = 0,20 $, donc le total est de 0,20 $ + 0,19 $ = 0,39 $, soit toujours environ 80 % de moins que sans cache. Le même raisonnement est appliqué pour Opus dans nos calculs de coût de mise en cache des invites ; le taux de lecture de 0,20 $ est identique.

Exemple 3 : un travail par lots de 10 000 requêtes

Même forme que l'exemple 1, envoyé via l'API Batch.

Le traitement par lots augmente également le plafond de sortie de 128 000 à 300 000 jetons avec la version bêta output-300k-2026-03-24.

Coût par tâche, pas par jeton

La carte tarifaire vous indique ce que coûte un jeton, et non combien de jetons votre tâche consomme. Ce deuxième chiffre varie bien plus avec l'effort qu'avec n'importe quel écart de tarif entre les modèles.

Anthropic affirme que, d'après ses tests, Sonnet 5.5 « coûte jusqu'à 30 % de moins par tâche que son prédécesseur ». Le billet de lancement représente également le coût à chaque niveau d'effort. Les exécutions de Terminal-Bench 4.0 sont celles d'Anthropic, FrontierCode a été exécuté par Cognition, et les coûts d'index proviennent de Artificial Analysis :

Effort Terminal-Bench 4.0 (score, $/tentative) FrontierCode v1.1 (score, $/tâche) Index AA (score, coût d'exécution)
faible 20.0%, $0.76 29.3%, $0.19 35.8, $544
moyen 28.8%, $0.83 36.5%, $0.24 40.7, $701
élevé 43.0%, $1.94 49.4%, $0.42 46.7, $1,176
très élevé 61.5%, $5.30 52.1%, $1.59 51.9, $2,738
max 70.6%, $12.54 46.2%, $20.78 56.0, $8,977

Ce qui ressort :

La verbosité au niveau max est l'autre piège. Le rapport d'OfficeChai sur les données d'Artificial Analysis situe Sonnet 5.5 à environ 193 000 jetons de sortie par tâche d'index au niveau max, avec un coût par tâche environ 50 % supérieur à Sonnet 5. Simon Willison a rapporté sur Hacker News qu'une exécution à effort maximal a consommé 128 000 jetons de réflexion et s'est épuisée avant de produire la réponse.

Six leviers pour réduire la facture

  1. Définissez l'effort intentionnellement. L'API est par défaut à high (élevé) ; Claude Code et les applications Claude sont par défaut à medium (moyen). Le guide d'invite d'Anthropic suggère medium ou low (faible) pour le chat et xhigh (très élevé) ou max (maximal) uniquement pour des gains de qualité mesurés. Ne reprenez pas les paramètres de Sonnet 5 ; l'échelle a été recalibrée.
  2. Utilisez between_tools là où vous aviez désactivé la réflexion. thinking: {"type": "disabled"} renvoie maintenant une erreur 400 ; {"type": "between_tools"} le remplace aux niveaux low, medium et high.
  3. Mettez en cache tout ce qui est réutilisé. L'invite minimale pouvant être mise en cache est de 512 jetons (1 024 sur Sonnet 5). La modification du niveau d'effort entre les requêtes invalide le cache, alors maintenez-le stable.
  4. Traitez par lots ce qui peut attendre. Moitié prix sur l'entrée et la sortie.
  5. Maintenez max_tokens juste. Le guide d'Anthropic considère stop_reason: "max_tokens" comme une réponse échouée, donc une réponse tronquée est une dépense sans rien à livrer.
  6. Éliminez le travail non demandé. Sonnet 5.5 ajoute des tests, des documents et des fichiers que vous n'avez pas demandés, et démarre des cycles de révision supplémentaires aux niveaux xhigh et max. Le paragraphe d'invite système suggéré par Anthropic a réduit le coût de session d'environ un tiers au niveau max sans modification de la qualité.

Où d'autre payez-vous pour Sonnet 5.5

Plutôt à la recherche de crédits ? Voir existe-t-il une API Claude Sonnet 5.5 gratuite.

Suivez le coût par requête dans Apidog

Chaque réponse Messages contient un objet usage avec input_tokens, output_tokens et les comptes de cache. C'est suffisant pour estimer le prix de n'importe quel appel dans Apidog :

  1. Stockez votre clé en tant que variable d'environnement ANTHROPIC_API_KEY.
  2. Enregistrez cette requête une fois par niveau d'effort (low, medium, high) avec la même invite :
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 4000,
    "thinking": {"type": "between_tools"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
  }'
  1. Ajoutez un post-processeur qui calcule le prix de l'appel et échoue en cas de troncature :
const body = pm.response.json();
const u = body.usage;
const cost = (u.input_tokens * 2 + u.output_tokens * 10) / 1e6;
pm.environment.set("last_call_usd", cost.toFixed(5));
pm.test("not truncated", () => pm.expect(body.stop_reason).to.not.eql("max_tokens"));
  1. Exécutez les trois et comparez usage.output_tokens et le coût côte à côte. Si vous utilisez le cache, ajoutez les comptes de cache à leurs propres tarifs.

Le processus complet de la requête est détaillé dans comment utiliser l'API Claude Sonnet 5.5.

FAQ

Combien coûte Claude Sonnet 5.5 par million de jetons ? 2 $ pour l'entrée et 10 $ pour la sortie sur l'API Claude. Les lectures de cache coûtent 0,20 $ ; l'API Batch facture 1 $ et 5 $.

Sonnet 5.5 est-il plus cher que Sonnet 5 ? Non. Le prix par jeton est identique, et Anthropic affirme que Sonnet 5.5 coûte jusqu'à 30 % de moins par tâche dans ses tests.

Y a-t-il une majoration au-delà de 200 000 jetons ? Non. La fenêtre complète de 1M est facturée au tarif standard.

Sonnet 5.5 dispose-t-il d'un mode rapide ? Non. Le mode rapide n'est disponible que sur Opus 5.5, Opus 5 et Opus 4.8.

Claude Sonnet 5.5 est-il gratuit ? Dans l'application de chat Claude, oui : tout le monde peut discuter avec sur le plan Gratuit. L'API fonctionne avec des crédits prépayés ; le guide de l'API gratuite couvre les programmes de crédits.

Étape suivante : estimez le coût de votre propre charge de travail

Prenez vos trois formes de requêtes les plus courantes, exécutez chacune à deux niveaux d'effort, et multipliez les chiffres d'usage par le tableau ci-dessus. Vous verrez rapidement si le niveau medium maintient votre barre de qualité ou si le niveau high justifie ses jetons supplémentaires. Téléchargez Apidog pour garder ces requêtes et le script de coût côte à côte.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API