Claude Sonnet 5.5 erreicht 70,6 % bei Terminal-Bench 4.0, 55,5 % bei CursorBench 4.0, 46,2 % bei FrontierCode 1.1 bei maximaler Anstrengung (52,1 % bei xhigh) und 81,3 bei SWE-Bench Pro, gegenüber Sonnet 5’s 10,3 %, 34,1 %, 42,4 % und 63,2. Opus 5.5 führt die meisten Zeilen der Starttabelle um etwa 2 bis 3 Punkte an, liegt aber bei Terminal-Bench zurück. Artificial Analysis bewertet Sonnet 5.5 unabhängig mit 56 auf seinem Intelligence Index, Platz 3 von 216.
Unten: die vollständigen Benchmarks von Claude Sonnet 5.5, wer sie ausgeführt hat, welche Aufwandsänderungen es gibt und wie Sie das Modell in Apidog mit Ihrem eigenen Traffic testen können. Für Spezifikationen siehe Was ist Claude Sonnet 5.5.
Die Starttabelle
Anthropic’s Startbeitrag vergleicht vier Modelle („n/r“ kennzeichnet einen Bindestrich). Die Zellen von Sonnet 5.5 zeigen die maximale Anstrengung an, sofern nicht anders vermerkt; die API verwendet standardmäßig „high“, Claude Code und die Apps „medium“.
| Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | n/r |
| FrontierCode 1.1 (Haupt) | 46.2% Max² / 52.1% Xhigh | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | n/r |
| GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487⁴ |
| AA-Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483⁴ |
| Humanity’s Last Exam (mit Tools) | 64.5% | 54.9% | 67.7% | n/r |
| OSWorld 2.1 (teilweise) | 80.1% | 57.0% | 81.8% | n/r |
| Chartography (ohne Tools) | 61.6% | 15.6% | 64.4% | 53.6%⁴ |
Die Fußnoten, einfach erklärt:
- Der Terminal-Bench-Score von Opus 5.5 liegt bei xhigh, seinem besten Wert; bei max erreichte er 64,8 %.
- FrontierCode bestraft nicht vorgesehene Bearbeitungen. Bei max führte Sonnet 5.5 häufiger die Code-Review-Fähigkeit von Claude Code aus, wodurch es sich auf viele Unteragenten verteilte; in zwei von Cognition untersuchten Fällen führte dies zu einem Timeout oder nicht vorgesehenen Bearbeitungen.
- Artificial Analysis führte beide Wissensarbeitstests auf einer Vorabversion mit einem Fehler in der strukturierten Ausgabe durch, der inzwischen behoben wurde. Anthropic erwartet einen geringen Effekt, wenn überhaupt, der Sonnet 5.5 unterbewertet.
- OpenAI hat kürzlich einen Fehler in der Bildverständnisfunktion von GPT-6 Sol behoben, den die Scores von AA und Surge AI möglicherweise nicht widerspiegeln.
Wer hat welchen Benchmark ausgeführt
Anthropic führte jeden Test selbst durch, sofern kein Dritter genannt wird. Reihen von verschiedenen Anbietern teilen sich einen Benchmark-Namen, nicht aber eine Testumgebung oder Aufwandseinstellung.
| Ausführender | Benchmark | Bedingungen |
|---|---|---|
| Anthropic | Terminal-Bench 4.0, HLE, OSWorld 2.1 | TB: Claude Code --bare, 5 Versuche, Schutzmaßnahmen aktiviert. HLE: Suche und Codeausführung. OSWorld: 108 Aufgaben |
| Cognition | FrontierCode 1.1 | Claude in Claude Code, GPT in Codex CLI |
| Cursor | CursorBench 4.0 | Cursors Produktionsumgebung; Anthropic schätzte die Kosten zum Listenpreis |
| Artificial Analysis | GDPval-AA, AA-Briefcase | Vorabversion |
| Anthropic | Chartography | Surge AI’s Benchmark, bewertet mit Gemini 3.5 Flash; Sols Ergebnis von Surge |
Der Fallback betraf 1,5 % der Terminal-Bench-Versuche von Sonnet 5.5, aber 10 % derer von Opus 5.5 (Systemkarte §8.5), daher sollte Sonnets Vorsprung von 4,2 Punkten mit Vorsicht betrachtet werden.
Zusätze zur Systemkarte
Die Zeilen eins bis sechs sind die Zusammenfassung der maximalen Anstrengung der Systemkarte.
| Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 81.3 | 63.2 | 89.9 |
| SWE-Bench Multilingual | 90.3 | 78.3 | 93.9 |
| SWE-Bench Multimodal | 54.3 | 28.1 | 61.4 |
| HLE, ohne Tools | 56.9 | 43.1 | 64.4 |
| HealthBench Professional | 69.2 | 57.8 | 65.6 |
| AutomationBench (Zapiers Ausführung) | 44.7 | 10.7 | 42.5 |
| DeepSWE v1.1 | 71.0% | n/r | n/r |
| Terminal-Bench-Science 0.1 | 59.9% | n/r | 58.7% |
| FrontierSWE v2 (Proximal’s Ausführung) | 61.9% | n/r | 62.3% |
| ArXivMath (ohne Tools / mit Tools) | 86.8% / 95.2% | n/r | 91.2% / 96.9% |
| ProgramBench (langer Kontext) | 79.7% | 77.3% | 91.2% |
| OSWorld 2.1, strenger Pass | 43.5% | 25.6% | 48.7% |
| Toolathlon-Verified (Pass@1) | 77.8% | 74.7% | 77.8% |
| OfficeQA / OfficeQA Pro | 76.9% / 65.6% | 75.1% / 62.1% | 78.9% / 67.7% |
Sonnet 5.5 übertrifft Opus 5.5 bei HealthBench Professional, AutomationBench und Terminal-Bench-Science; Opus führt am deutlichsten bei ProgramBench, SWE-Bench Pro und HLE ohne Tools. Die 80,1 % von OSWorld sind eine Teilleistung; nur 43,5 % der Aufgaben bestehen vollständig.
Aufwand verändert das Bild
Die Startdiagramme, als Ergebnis (Kosten). Die Kosten für Terminal-Bench gelten pro Versuch, die anderen pro Aufgabe. Zwei Diagramme zeigen GPT-5.6 Sol (*), da die Zahlen für GPT-6 Sol nicht veröffentlicht wurden.
| Modell | Niedrig | Mittel | Hoch | Sehr hoch | Max |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | |||||
| Sonnet 5.5 | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Opus 5.5 | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| Sonnet 5 | 3.2% ($3.78) | 4.4% ($4.83) | 4.5% ($8.20) | 7.0% ($9.95) | 10.3% ($11.62) |
| GPT-5.6 Sol* | 7.9% ($1.46) | 20.9% ($2.69) | 26.1% ($4.12) | 28.5% ($5.39) | 37.3% ($7.89) |
| FrontierCode 1.1 Haupt | |||||
| Sonnet 5.5 | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| Opus 5.5 | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| Sonnet 5 | 28.7% ($2.39) | 35.2% ($3.81) | 39.4% ($6.10) | 42.7% ($10.07) | 42.4% ($17.12) |
| GPT-6 Sol | 37.3% ($0.43) | 45.9% ($0.77) | 47.7% ($1.04) | 48.4% ($1.32) | 49.3% ($2.07) |
| CursorBench 4.0 | |||||
| Sonnet 5.5 | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| Opus 5.5 | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| Sonnet 5 | 24.1% ($1.39) | 28.0% ($2.31) | 30.8% ($3.48) | 32.0% ($4.55) | 34.1% ($7.17) |
| GPT-5.6 Sol* | 24.6% ($0.87) | 31.1% ($1.77) | 35.7% ($2.85) | 37.7% ($4.40) | 41.7% ($8.23) |
| AA-Briefcase v1.1 (Elo) | |||||
| Sonnet 5.5 | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| Opus 5.5 | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
| Sonnet 5 | 923 ($0.82) | 1056 ($1.73) | 1177 ($3.76) | 1274 ($7.56) | 1359 ($14.43) |
| GPT-6 Sol | 905 ($0.12) | 1142 ($0.34) | 1289 ($0.63) | 1364 ($1.19) | 1483 ($2.67) |
- Die meisten Verbesserungen werden bei „sehr hoch“ erreicht. „Max“ fügt 9,1 Punkte bei Terminal-Bench für 2,4-fache Kosten hinzu, 2,4 bei CursorBench für 2,5-fache Kosten.
- FrontierCode erzielt bei „max“ niedrigere Ergebnisse und kostet 13x mehr als bei „sehr hoch“ (46,2 % für 20,78 $ gegenüber 52,1 % für 1,59 $).
- Opus 5.5 bei geringerem Aufwand ist der eigentliche Konkurrent. Bei Terminal-Bench erreicht Opus bei „mittel“ 57,6 % für 2,94 $; Sonnet bei „hoch“ 43,0 % für 1,94 $. Opus bei „hoch“ (64,2 %, 3,88 $) schlägt Sonnet bei „sehr hoch“ (61,5 %, 5,30 $). Siehe Sonnet 5.5 vs Opus 5.5.
- „Hoch“ ist Sonnets kostengünstigster Bereich. FrontierCode bei „hoch“: 49,4 % für 0,42 $, was dem besten Ergebnis von GPT-6 Sol (49,3 %) zu etwa einem Fünftel der Kosten entspricht (Preisübersicht).
Unabhängige Ergebnisse
Artificial Analysis bewertet Sonnet 5.5 mit 56 auf dem Intelligence Index v4.3.2, Platz 3 von 216, nur hinter Opus 5.5 bei max und xhigh. Sonnet 5 erzielte 38 Punkte. Kosten für die Ausführung des Indexes:
| Aufwand | Index-Score | Kosten für die Ausführung |
|---|---|---|
| max | 55.98 | 8.977 $ |
| sehr hoch | 51.85 | 2.738 $ |
| hoch | 46.74 | 1.176 $ |
| mittel | 40.74 | 701 $ |
| niedrig | 35.84 | 544 $ |
„Max“ kostet 7,6-mal mehr als „hoch“ für 9,2 zusätzliche Punkte. OfficeChais Interpretation von AA platziert Sonnet 5.5 außerhalb der Pareto-Grenze, am kostengünstigsten bei „hoch“, und zählt etwa 193.000 Ausgabe-Tokens pro Index-Aufgabe bei „max“.
- AAs eigene Terminal-Bench 4.0 Ausführung: 63,6 % gegenüber Anthropics 70,6 %.
- Der niedrige Score von Sonnet 5 ist real: AA maß 14,1 % (siehe Sonnet 5 Benchmarks).
- AA-Omniscience (laut OfficeChai): 54 % Genauigkeit und eine Halluzinationsrate von 47 %, gegenüber 66 % und 59 % für Opus 5.5.
- Noch nicht gemessen: Ausgabegeschwindigkeit und Zeit bis zum ersten Token, daher bleibt „30 %+ schneller“ die Behauptung von Anthropic. Noch keine LMArena-Listung.
Sicherheits-Benchmarks
Prompt-Injection, gemäß Systemkarte:
- Gray Swan: Angriffserfolg 0,4 %, 2,7 % und 3,4 % bei k=1, 10 und 15 (Sonnet 5: 0,7 %, 5,1 %, 6,7 %). Die GUI-Computernutzung ist am schwächsten mit 12,5 % (k=15).
- Shade, Codierung: 3,01 % ohne Schutzmaßnahmen, hauptsächlich über den Sonnet 5 Cyber-Fallback; Sonnet 5.5 selbst wurde bei 4 von 5.901 Anfragen kompromittiert.
- Browsernutzung: Kein Angriff war in 110 Szenarien erfolgreich.
Cyber-Evaluierungen wurden ohne Schutzmaßnahmen durchgeführt: 46,1 % bei CyScenarioBench (Sonnet 5: 0,7 %, Opus 5.5: 67,6 %). Es ist das erste Sonnet mit Cyber-Schutzmaßnahmen, und Anthropic warnt vor mehr Ablehnungen selbst bei gutartigen Sicherheitsaufgaben. Siehe unseren Leitfaden zur Prompt-Injection.
Führen Sie Ihre eigene Bewertung durch
Benchmarks sehen nicht wie Ihr Traffic aus, und Anthropics Prompt-Leitfaden besagt, dass der Aufwand neu kalibriert wird. Verwenden Sie daher keine Sonnet 5-Einstellungen wieder. In Apidog:
- Speichern Sie
ANTHROPIC_API_KEYals Umgebungsvariable und speichern Sie 20 bis 50 echte Prompts als Nachrichtenanfragen. - Überprüfen Sie den Status 200, einen
stop_reason, der nicht"max_tokens"oder"refusal"ist, und den Inhalt, den eine korrekte Antwort benötigt. - Führen Sie ihn mit
niedrig,mittel,hochundsehr hochaus, jeweils einen Durchlauf; eine Änderung des Aufwands invalidiert den Prompt-Cache. - Zeichnen Sie die Erfolgsrate und die Token-Anzahlen in
usageauf, preislich bei 2 $ Input und 10 $ Output pro Million.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 16000,
"output_config": {"effort": "high"},
"messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
}'
Verwenden Sie den niedrigsten Aufwand, dessen Erfolgsrate Sie akzeptieren. Siehe Testen von LLM-Anwendungen und Testen von AI-Agent-APIs, dann laden Sie Apidog herunter, um die Sammlung zu erstellen.
FAQ
Schlägt Sonnet 5.5 Opus 5.5? Bei Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science und Chartography mit Tools, ja. Opus 5.5 führt oder liegt gleichauf mit dem Rest.
Was ist der SWE-Bench-Score von Sonnet 5.5? 81,3 bei SWE-Bench Pro und 90,3 bei Multilingual, bei maximaler Anstrengung.
Warum gibt es zwei FrontierCode-Zahlen? 46,2 % ist „max“, 52,1 % ist „sehr hoch“; die Subagenten-Verzweigung von „max“ führte zu Überschreitungsstrafen.
Sollte ich von Sonnet 5 upgraden? Ja, laut Benchmarks, aber lesen Sie zuerst die bahnbrechenden API-Änderungen in Sonnet 5.5 vs Sonnet 5.
Nächster Schritt
Beginnen Sie mit hoch (oder mittel für gut spezifizierte agentische Codierung), wie von Anthropic vorgeschlagen, und lassen Sie Ihre Bewertung in Apidog entscheiden, ob sich ein Upgrade lohnt.
