Performances de Claude Sonnet 5.5 : Chiffres Anthropic, Résultats Indépendants et Analyse

Les benchmarks de Claude Sonnet 5.5 : 70,6 % sur Terminal-Bench 4.0, 81,3 % sur SWE-Bench Pro, indice AA 56. Qui a effectué chaque test, quels sont les coûts en effort, comment lancer votre propre évaluation.

Medy Evrard

29 September 2026

Performances de Claude Sonnet 5.5 : Chiffres Anthropic, Résultats Indépendants et Analyse

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Claude Sonnet 5.5 obtient 70,6% sur Terminal-Bench 4.0, 55,5% sur CursorBench 4.0, 46,2% sur FrontierCode 1.1 à effort maximal (52,1% à xhigh) et 81,3 sur SWE-Bench Pro, en hausse par rapport aux 10,3%, 34,1%, 42,4% et 63,2% de Sonnet 5. Opus 5.5 devance la plupart des lignes du tableau de lancement d'environ 2 à 3 points, mais est en retrait sur Terminal-Bench. Artificial Analysis évalue indépendamment Sonnet 5.5 à 56 sur son Intelligence Index, ce qui le place au 3e rang sur 216.

Ci-dessous : les benchmarks complets de Claude Sonnet 5.5, qui les a exécutés, les changements d'effort, et comment tester le modèle sur votre propre trafic dans Apidog. Pour les spécifications, consultez qu'est-ce que Claude Sonnet 5.5.

Le tableau de lancement

Le billet de lancement d'Anthropic compare quatre modèles (les marques "n/r" indiquent un tiret). Les cellules de Sonnet 5.5 sont à effort maximal, sauf indication contraire ; l'API utilise par défaut "high", Claude Code et les applications "medium".

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ n/r
FrontierCode 1.1 (Principal) 46.2% Max² / 52.1% Xhigh 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% n/r
GDPval-AA v2.1³ 1844 1449 1846 1487⁴
AA-Briefcase v1.1³ 1811 1359 1822 1483⁴
Examen Final de l'Humanité (avec outils) 64.5% 54.9% 67.7% n/r
OSWorld 2.1 (partiel) 80.1% 57.0% 81.8% n/r
Cartographie (sans outils) 61.6% 15.6% 64.4% 53.6%⁴

Les notes de bas de page, en termes simples :

  1. Le score Terminal-Bench d'Opus 5.5 est à xhigh, son meilleur ; à max, il a obtenu 64,8%.
  2. FrontierCode pénalise les modifications hors de portée. Au maximum, Sonnet 5.5 a plus souvent exécuté la compétence de révision de code de Claude Code, se dispersant en de nombreux sous-agents ; dans deux cas examinés par Cognition, cela a provoqué un dépassement de délai ou des modifications hors de portée.
  3. Artificial Analysis a exécuté les deux tests de travail intellectuel sur un déploiement de pré-version avec un bug de sortie structurée, corrigé depuis. Anthropic s'attend à un effet minime, voire à une sous-estimation de Sonnet 5.5.
  4. OpenAI a récemment corrigé un bug de compréhension d'image de GPT-6 Sol que les scores AA et Surge AI pourraient ne pas refléter.

Qui a exécuté chaque benchmark

Anthropic a exécuté tous les tests elle-même, sauf si un tiers est nommé. Les lignes inter-fournisseurs partagent un nom de benchmark, pas un harnais ou un réglage d'effort.

Exécuteur Benchmark Conditions
Anthropic Terminal-Bench 4.0, HLE, OSWorld 2.1 TB: Claude Code --bare, 5 essais, protections activées. HLE: recherche et exécution de code. OSWorld: 108 tâches
Cognition FrontierCode 1.1 Claude dans Claude Code, GPT dans Codex CLI
Cursor CursorBench 4.0 Harnais de production de Cursor ; Anthropic a estimé le coût au prix catalogue
Artificial Analysis GDPval-AA, AA-Briefcase Déploiement de pré-version
Anthropic Cartographie Le benchmark de Surge AI, noté avec Gemini 3.5 Flash ; le score de Sol provient de Surge

Le mécanisme de secours (fallback) a été sollicité dans 1,5 % des essais de Terminal-Bench de Sonnet 5.5, mais dans 10 % de ceux d'Opus 5.5 (fiche système §8.5), il convient donc de prendre avec prudence l'avance de 4,2 points de Sonnet.

Extras de la fiche système

Les lignes un à six sont le résumé d'effort maximal de la fiche système.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5
SWE-Bench Pro 81.3 63.2 89.9
SWE-Bench Multilingue 90.3 78.3 93.9
SWE-Bench Multimodal 54.3 28.1 61.4
HLE, sans outils 56.9 43.1 64.4
HealthBench Professionnel 69.2 57.8 65.6
AutomationBench (exécuté par Zapier) 44.7 10.7 42.5
DeepSWE v1.1 71.0% n/r n/r
Terminal-Bench-Science 0.1 59.9% n/r 58.7%
FrontierSWE v2 (exécuté par Proximal) 61.9% n/r 62.3%
ArXivMath (sans outils / avec outils) 86.8% / 95.2% n/r 91.2% / 96.9%
ProgramBench (contexte long) 79.7% 77.3% 91.2%
OSWorld 2.1, réussite stricte 43.5% 25.6% 48.7%
Toolathlon-Verified (Réussite@1) 77.8% 74.7% 77.8%
OfficeQA / OfficeQA Pro 76.9% / 65.6% 75.1% / 62.1% 78.9% / 67.7%

Sonnet 5.5 devance Opus 5.5 sur HealthBench Professional, AutomationBench et Terminal-Bench-Science ; Opus mène le plus largement sur ProgramBench, SWE-Bench Pro et HLE sans outils. Le score de 80,1% d'OSWorld est un crédit partiel ; seulement 43,5% des tâches sont réussies directement.

L'effort change la donne

Les graphiques de lancement, en score (coût). Le coût de Terminal-Bench est par tentative, les autres par tâche. Deux graphiques montrent GPT-5.6 Sol (*) car les chiffres de GPT-6 Sol n'ont pas été publiés.

Modèle Faible Moyen Élevé Très élevé Max
Terminal-Bench 4.0
Sonnet 5.5 20.0% ($0.76) 28.8% ($0.83) 43.0% ($1.94) 61.5% ($5.30) 70.6% ($12.54)
Opus 5.5 38.5% ($1.29) 57.6% ($2.94) 64.2% ($3.88) 66.4% ($7.35) 64.8% ($11.24)
Sonnet 5 3.2% ($3.78) 4.4% ($4.83) 4.5% ($8.20) 7.0% ($9.95) 10.3% ($11.62)
GPT-5.6 Sol* 7.9% ($1.46) 20.9% ($2.69) 26.1% ($4.12) 28.5% ($5.39) 37.3% ($7.89)
FrontierCode 1.1 Principal
Sonnet 5.5 29.3% ($0.19) 36.5% ($0.24) 49.4% ($0.42) 52.1% ($1.59) 46.2% ($20.78)
Opus 5.5 47.3% ($0.40) 54.6% ($0.80) 54.0% ($1.09) 51.4% ($2.25) 54.4% ($6.19)
Sonnet 5 28.7% ($2.39) 35.2% ($3.81) 39.4% ($6.10) 42.7% ($10.07) 42.4% ($17.12)
GPT-6 Sol 37.3% ($0.43) 45.9% ($0.77) 47.7% ($1.04) 48.4% ($1.32) 49.3% ($2.07)
CursorBench 4.0
Sonnet 5.5 35.8% ($0.50) 39.2% ($0.70) 47.8% ($1.67) 53.1% ($3.88) 55.5% ($9.67)
Opus 5.5 43.7% ($1.17) 52.5% ($2.91) 56.0% ($3.97) 56.0% ($6.98) 57.8% ($13.43)
Sonnet 5 24.1% ($1.39) 28.0% ($2.31) 30.8% ($3.48) 32.0% ($4.55) 34.1% ($7.17)
GPT-5.6 Sol* 24.6% ($0.87) 31.1% ($1.77) 35.7% ($2.85) 37.7% ($4.40) 41.7% ($8.23)
AA-Briefcase v1.1 (Elo)
Sonnet 5.5 1264 ($0.87) 1461 ($1.64) 1634 ($3.95) 1746 ($9.63) 1811 ($29.19)
Opus 5.5 1285 ($1.15) 1642 ($4.40) 1705 ($6.27) 1780 ($12.27) 1822 ($21.05)
Sonnet 5 923 ($0.82) 1056 ($1.73) 1177 ($3.76) 1274 ($7.56) 1359 ($14.43)
GPT-6 Sol 905 ($0.12) 1142 ($0.34) 1289 ($0.63) 1364 ($1.19) 1483 ($2.67)

Résultats indépendants

Artificial Analysis attribue à Sonnet 5.5 un score de 56 sur l'Intelligence Index v4.3.2, le classant 3ème sur 216, derrière seulement Opus 5.5 à max et xhigh. Sonnet 5 a obtenu un score de 38. Coût pour exécuter l'index :

Effort Score de l'index Coût d'exécution
max 55.98 8 977 $
xhigh 51.85 2 738 $
high 46.74 1 176 $
medium 40.74 701 $
low 35.84 544 $

Le niveau maximal coûte 7,6 fois plus cher que le niveau élevé pour 9,2 points supplémentaires. La lecture d'AA par OfficeChai place Sonnet 5.5 hors de la frontière de Pareto, le plus compétitif en termes de coûts à un niveau élevé, et compte environ 193 000 jetons de sortie par tâche d'index au maximum.

Benchmarks de sécurité

Injection de prompt, selon la fiche système :

Les évaluations cyber ont été exécutées sans protections : 46,1% sur CyScenarioBench (Sonnet 5 : 0,7%, Opus 5.5 : 67,6%). C'est le premier Sonnet avec des protections cyber, et Anthropic avertit d'un plus grand nombre de refus, même sur des tâches de sécurité bénignes. Consultez notre guide d'injection de prompt.

Exécutez votre propre évaluation

Les benchmarks ne ressemblent pas à votre trafic, et le guide de prompt d'Anthropic indique que l'effort est recalibré, donc ne réutilisez pas les paramètres de Sonnet 5. Dans Apidog :

  1. Stockez ANTHROPIC_API_KEY comme variable d'environnement et enregistrez 20 à 50 prompts réels sous forme de requêtes Messages.
  2. Affirmez le statut 200, un stop_reason autre que "max_tokens" ou "refusal", et que le contenu contient la bonne réponse.
  3. Exécutez-le en low, medium, high et xhigh, un passage pour chaque ; changer l'effort invalide le cache de prompts.
  4. Enregistrez le taux de réussite et le nombre de jetons dans usage, au prix de 2 $ en entrée et 10 $ en sortie par million.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 16000,
    "output_config": {"effort": "high"},
    "messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
  }'

Déployez le niveau d'effort le plus bas dont vous acceptez le taux de réussite. Consultez tester les applications LLM et tester les API des agents IA, puis téléchargez Apidog pour créer la collection.

FAQ

Sonnet 5.5 bat-il Opus 5.5 ? Oui, sur Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science et Chartography avec outils. Opus 5.5 mène ou fait jeu égal sur les autres.

Quel est le score SWE-Bench de Sonnet 5.5 ? 81,3 sur SWE-Bench Pro et 90,3 sur Multilingual, à effort maximal.

Pourquoi y a-t-il deux chiffres pour FrontierCode ? 46,2% est le score maximal, 52,1% est le score xhigh ; l'expansion des sous-agents du mode maximal a entraîné des pénalités pour les modifications hors de portée.

Dois-je passer de Sonnet 5 ? Oui, en ce qui concerne les benchmarks, mais lisez d'abord les changements d'API majeurs dans Sonnet 5.5 vs Sonnet 5.

Étape suivante

Commencez par le niveau high (ou medium pour un codage agentique bien spécifié), comme le suggère Anthropic, et laissez votre évaluation dans Apidog décider si une montée en puissance est rentable.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API