Claude Sonnet 5.5 obtient 70,6% sur Terminal-Bench 4.0, 55,5% sur CursorBench 4.0, 46,2% sur FrontierCode 1.1 à effort maximal (52,1% à xhigh) et 81,3 sur SWE-Bench Pro, en hausse par rapport aux 10,3%, 34,1%, 42,4% et 63,2% de Sonnet 5. Opus 5.5 devance la plupart des lignes du tableau de lancement d'environ 2 à 3 points, mais est en retrait sur Terminal-Bench. Artificial Analysis évalue indépendamment Sonnet 5.5 à 56 sur son Intelligence Index, ce qui le place au 3e rang sur 216.
Ci-dessous : les benchmarks complets de Claude Sonnet 5.5, qui les a exécutés, les changements d'effort, et comment tester le modèle sur votre propre trafic dans Apidog. Pour les spécifications, consultez qu'est-ce que Claude Sonnet 5.5.
Le tableau de lancement
Le billet de lancement d'Anthropic compare quatre modèles (les marques "n/r" indiquent un tiret). Les cellules de Sonnet 5.5 sont à effort maximal, sauf indication contraire ; l'API utilise par défaut "high", Claude Code et les applications "medium".
| Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | n/r |
| FrontierCode 1.1 (Principal) | 46.2% Max² / 52.1% Xhigh | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | n/r |
| GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487⁴ |
| AA-Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483⁴ |
| Examen Final de l'Humanité (avec outils) | 64.5% | 54.9% | 67.7% | n/r |
| OSWorld 2.1 (partiel) | 80.1% | 57.0% | 81.8% | n/r |
| Cartographie (sans outils) | 61.6% | 15.6% | 64.4% | 53.6%⁴ |
Les notes de bas de page, en termes simples :
- Le score Terminal-Bench d'Opus 5.5 est à xhigh, son meilleur ; à max, il a obtenu 64,8%.
- FrontierCode pénalise les modifications hors de portée. Au maximum, Sonnet 5.5 a plus souvent exécuté la compétence de révision de code de Claude Code, se dispersant en de nombreux sous-agents ; dans deux cas examinés par Cognition, cela a provoqué un dépassement de délai ou des modifications hors de portée.
- Artificial Analysis a exécuté les deux tests de travail intellectuel sur un déploiement de pré-version avec un bug de sortie structurée, corrigé depuis. Anthropic s'attend à un effet minime, voire à une sous-estimation de Sonnet 5.5.
- OpenAI a récemment corrigé un bug de compréhension d'image de GPT-6 Sol que les scores AA et Surge AI pourraient ne pas refléter.
Qui a exécuté chaque benchmark
Anthropic a exécuté tous les tests elle-même, sauf si un tiers est nommé. Les lignes inter-fournisseurs partagent un nom de benchmark, pas un harnais ou un réglage d'effort.
| Exécuteur | Benchmark | Conditions |
|---|---|---|
| Anthropic | Terminal-Bench 4.0, HLE, OSWorld 2.1 | TB: Claude Code --bare, 5 essais, protections activées. HLE: recherche et exécution de code. OSWorld: 108 tâches |
| Cognition | FrontierCode 1.1 | Claude dans Claude Code, GPT dans Codex CLI |
| Cursor | CursorBench 4.0 | Harnais de production de Cursor ; Anthropic a estimé le coût au prix catalogue |
| Artificial Analysis | GDPval-AA, AA-Briefcase | Déploiement de pré-version |
| Anthropic | Cartographie | Le benchmark de Surge AI, noté avec Gemini 3.5 Flash ; le score de Sol provient de Surge |
Le mécanisme de secours (fallback) a été sollicité dans 1,5 % des essais de Terminal-Bench de Sonnet 5.5, mais dans 10 % de ceux d'Opus 5.5 (fiche système §8.5), il convient donc de prendre avec prudence l'avance de 4,2 points de Sonnet.
Extras de la fiche système
Les lignes un à six sont le résumé d'effort maximal de la fiche système.
| Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 81.3 | 63.2 | 89.9 |
| SWE-Bench Multilingue | 90.3 | 78.3 | 93.9 |
| SWE-Bench Multimodal | 54.3 | 28.1 | 61.4 |
| HLE, sans outils | 56.9 | 43.1 | 64.4 |
| HealthBench Professionnel | 69.2 | 57.8 | 65.6 |
| AutomationBench (exécuté par Zapier) | 44.7 | 10.7 | 42.5 |
| DeepSWE v1.1 | 71.0% | n/r | n/r |
| Terminal-Bench-Science 0.1 | 59.9% | n/r | 58.7% |
| FrontierSWE v2 (exécuté par Proximal) | 61.9% | n/r | 62.3% |
| ArXivMath (sans outils / avec outils) | 86.8% / 95.2% | n/r | 91.2% / 96.9% |
| ProgramBench (contexte long) | 79.7% | 77.3% | 91.2% |
| OSWorld 2.1, réussite stricte | 43.5% | 25.6% | 48.7% |
| Toolathlon-Verified (Réussite@1) | 77.8% | 74.7% | 77.8% |
| OfficeQA / OfficeQA Pro | 76.9% / 65.6% | 75.1% / 62.1% | 78.9% / 67.7% |
Sonnet 5.5 devance Opus 5.5 sur HealthBench Professional, AutomationBench et Terminal-Bench-Science ; Opus mène le plus largement sur ProgramBench, SWE-Bench Pro et HLE sans outils. Le score de 80,1% d'OSWorld est un crédit partiel ; seulement 43,5% des tâches sont réussies directement.
L'effort change la donne
Les graphiques de lancement, en score (coût). Le coût de Terminal-Bench est par tentative, les autres par tâche. Deux graphiques montrent GPT-5.6 Sol (*) car les chiffres de GPT-6 Sol n'ont pas été publiés.
| Modèle | Faible | Moyen | Élevé | Très élevé | Max |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | |||||
| Sonnet 5.5 | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Opus 5.5 | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| Sonnet 5 | 3.2% ($3.78) | 4.4% ($4.83) | 4.5% ($8.20) | 7.0% ($9.95) | 10.3% ($11.62) |
| GPT-5.6 Sol* | 7.9% ($1.46) | 20.9% ($2.69) | 26.1% ($4.12) | 28.5% ($5.39) | 37.3% ($7.89) |
| FrontierCode 1.1 Principal | |||||
| Sonnet 5.5 | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| Opus 5.5 | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| Sonnet 5 | 28.7% ($2.39) | 35.2% ($3.81) | 39.4% ($6.10) | 42.7% ($10.07) | 42.4% ($17.12) |
| GPT-6 Sol | 37.3% ($0.43) | 45.9% ($0.77) | 47.7% ($1.04) | 48.4% ($1.32) | 49.3% ($2.07) |
| CursorBench 4.0 | |||||
| Sonnet 5.5 | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| Opus 5.5 | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| Sonnet 5 | 24.1% ($1.39) | 28.0% ($2.31) | 30.8% ($3.48) | 32.0% ($4.55) | 34.1% ($7.17) |
| GPT-5.6 Sol* | 24.6% ($0.87) | 31.1% ($1.77) | 35.7% ($2.85) | 37.7% ($4.40) | 41.7% ($8.23) |
| AA-Briefcase v1.1 (Elo) | |||||
| Sonnet 5.5 | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| Opus 5.5 | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
| Sonnet 5 | 923 ($0.82) | 1056 ($1.73) | 1177 ($3.76) | 1274 ($7.56) | 1359 ($14.43) |
| GPT-6 Sol | 905 ($0.12) | 1142 ($0.34) | 1289 ($0.63) | 1364 ($1.19) | 1483 ($2.67) |
- La plupart des gains sont atteints à xhigh. Le niveau max ajoute 9,1 points sur Terminal-Bench pour 2,4 fois le coût, 2,4 sur CursorBench pour 2,5 fois.
- FrontierCode max obtient des scores inférieurs et coûte 13 fois plus cher que xhigh (46,2% à 20,78 $ contre 52,1% à 1,59 $).
- Opus 5.5 à effort moindre est le vrai rival. Sur Terminal-Bench, Opus à "medium" obtient 57,6% pour 2,94 $ ; Sonnet à "high" obtient 43,0% pour 1,94 $. Opus à "high" (64,2%, 3,88 $) bat Sonnet à "xhigh" (61,5%, 5,30 $). Voir Sonnet 5.5 vs Opus 5.5.
- "High" est le point idéal en termes de coût pour Sonnet. FrontierCode à "high" : 49,4% pour 0,42 $, égalant le meilleur score de GPT-6 Sol (49,3%) pour environ un cinquième du coût (répartition des prix).
Résultats indépendants
Artificial Analysis attribue à Sonnet 5.5 un score de 56 sur l'Intelligence Index v4.3.2, le classant 3ème sur 216, derrière seulement Opus 5.5 à max et xhigh. Sonnet 5 a obtenu un score de 38. Coût pour exécuter l'index :
| Effort | Score de l'index | Coût d'exécution |
|---|---|---|
| max | 55.98 | 8 977 $ |
| xhigh | 51.85 | 2 738 $ |
| high | 46.74 | 1 176 $ |
| medium | 40.74 | 701 $ |
| low | 35.84 | 544 $ |
Le niveau maximal coûte 7,6 fois plus cher que le niveau élevé pour 9,2 points supplémentaires. La lecture d'AA par OfficeChai place Sonnet 5.5 hors de la frontière de Pareto, le plus compétitif en termes de coûts à un niveau élevé, et compte environ 193 000 jetons de sortie par tâche d'index au maximum.
- L'exécution de Terminal-Bench 4.0 par AA : 63,6%, contre 70,6% pour Anthropic.
- Le faible score de Sonnet 5 est réel : AA a mesuré 14,1% (voir benchmarks de Sonnet 5).
- AA-Omniscience (selon OfficeChai) : 54% de précision et un taux d'hallucination de 47%, contre 66% et 59% pour Opus 5.5.
- Non mesuré encore : vitesse de sortie et temps de première réponse, donc la mention "30% plus rapide" reste une affirmation d'Anthropic. Aucune liste LMArena pour l'instant.
Benchmarks de sécurité
Injection de prompt, selon la fiche système :
- Gray Swan : succès d'attaque de 0,4%, 2,7% et 3,4% à k=1, 10 et 15 (Sonnet 5 : 0,7%, 5,1%, 6,7%). L'utilisation d'un ordinateur via GUI est la plus faible avec 12,5% (k=15).
- Shade, codage : 3,01% sans protections, principalement via le mécanisme de secours cyber de Sonnet 5 ; Sonnet 5.5 lui-même a été compromis sur 4 des 5 901 requêtes.
- Utilisation du navigateur : aucune attaque n'a réussi sur 110 scénarios.
Les évaluations cyber ont été exécutées sans protections : 46,1% sur CyScenarioBench (Sonnet 5 : 0,7%, Opus 5.5 : 67,6%). C'est le premier Sonnet avec des protections cyber, et Anthropic avertit d'un plus grand nombre de refus, même sur des tâches de sécurité bénignes. Consultez notre guide d'injection de prompt.
Exécutez votre propre évaluation
Les benchmarks ne ressemblent pas à votre trafic, et le guide de prompt d'Anthropic indique que l'effort est recalibré, donc ne réutilisez pas les paramètres de Sonnet 5. Dans Apidog :
- Stockez
ANTHROPIC_API_KEYcomme variable d'environnement et enregistrez 20 à 50 prompts réels sous forme de requêtes Messages. - Affirmez le statut 200, un
stop_reasonautre que"max_tokens"ou"refusal", et que le contenu contient la bonne réponse. - Exécutez-le en
low,medium,highetxhigh, un passage pour chaque ; changer l'effort invalide le cache de prompts. - Enregistrez le taux de réussite et le nombre de jetons dans
usage, au prix de 2 $ en entrée et 10 $ en sortie par million.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 16000,
"output_config": {"effort": "high"},
"messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
}'
Déployez le niveau d'effort le plus bas dont vous acceptez le taux de réussite. Consultez tester les applications LLM et tester les API des agents IA, puis téléchargez Apidog pour créer la collection.
FAQ
Sonnet 5.5 bat-il Opus 5.5 ? Oui, sur Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science et Chartography avec outils. Opus 5.5 mène ou fait jeu égal sur les autres.
Quel est le score SWE-Bench de Sonnet 5.5 ? 81,3 sur SWE-Bench Pro et 90,3 sur Multilingual, à effort maximal.
Pourquoi y a-t-il deux chiffres pour FrontierCode ? 46,2% est le score maximal, 52,1% est le score xhigh ; l'expansion des sous-agents du mode maximal a entraîné des pénalités pour les modifications hors de portée.
Dois-je passer de Sonnet 5 ? Oui, en ce qui concerne les benchmarks, mais lisez d'abord les changements d'API majeurs dans Sonnet 5.5 vs Sonnet 5.
Étape suivante
Commencez par le niveau high (ou medium pour un codage agentique bien spécifié), comme le suggère Anthropic, et laissez votre évaluation dans Apidog décider si une montée en puissance est rentable.
