Claude Sonnet 5.5 Benchmarks: Anthropics Zahlen, unabhängige Ergebnisse und was sie bedeuten

Claude Sonnet 5.5 Benchmarks: 70,6% Terminal-Bench 4.0, 81,3 SWE-Bench Pro, AA-Index 56. Wer hat jeden Test durchgeführt, welche Aufwände entstanden, wie Sie Ihre eigene Evaluation durchführen können.

Medy Evrard

29 September 2026

Claude Sonnet 5.5 Benchmarks: Anthropics Zahlen, unabhängige Ergebnisse und was sie bedeuten

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Claude Sonnet 5.5 erreicht 70,6 % bei Terminal-Bench 4.0, 55,5 % bei CursorBench 4.0, 46,2 % bei FrontierCode 1.1 bei maximaler Anstrengung (52,1 % bei xhigh) und 81,3 bei SWE-Bench Pro, gegenüber Sonnet 5’s 10,3 %, 34,1 %, 42,4 % und 63,2. Opus 5.5 führt die meisten Zeilen der Starttabelle um etwa 2 bis 3 Punkte an, liegt aber bei Terminal-Bench zurück. Artificial Analysis bewertet Sonnet 5.5 unabhängig mit 56 auf seinem Intelligence Index, Platz 3 von 216.

Unten: die vollständigen Benchmarks von Claude Sonnet 5.5, wer sie ausgeführt hat, welche Aufwandsänderungen es gibt und wie Sie das Modell in Apidog mit Ihrem eigenen Traffic testen können. Für Spezifikationen siehe Was ist Claude Sonnet 5.5.

Die Starttabelle

Anthropic’s Startbeitrag vergleicht vier Modelle („n/r“ kennzeichnet einen Bindestrich). Die Zellen von Sonnet 5.5 zeigen die maximale Anstrengung an, sofern nicht anders vermerkt; die API verwendet standardmäßig „high“, Claude Code und die Apps „medium“.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ n/r
FrontierCode 1.1 (Haupt) 46.2% Max² / 52.1% Xhigh 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% n/r
GDPval-AA v2.1³ 1844 1449 1846 1487⁴
AA-Briefcase v1.1³ 1811 1359 1822 1483⁴
Humanity’s Last Exam (mit Tools) 64.5% 54.9% 67.7% n/r
OSWorld 2.1 (teilweise) 80.1% 57.0% 81.8% n/r
Chartography (ohne Tools) 61.6% 15.6% 64.4% 53.6%⁴

Die Fußnoten, einfach erklärt:

  1. Der Terminal-Bench-Score von Opus 5.5 liegt bei xhigh, seinem besten Wert; bei max erreichte er 64,8 %.
  2. FrontierCode bestraft nicht vorgesehene Bearbeitungen. Bei max führte Sonnet 5.5 häufiger die Code-Review-Fähigkeit von Claude Code aus, wodurch es sich auf viele Unteragenten verteilte; in zwei von Cognition untersuchten Fällen führte dies zu einem Timeout oder nicht vorgesehenen Bearbeitungen.
  3. Artificial Analysis führte beide Wissensarbeitstests auf einer Vorabversion mit einem Fehler in der strukturierten Ausgabe durch, der inzwischen behoben wurde. Anthropic erwartet einen geringen Effekt, wenn überhaupt, der Sonnet 5.5 unterbewertet.
  4. OpenAI hat kürzlich einen Fehler in der Bildverständnisfunktion von GPT-6 Sol behoben, den die Scores von AA und Surge AI möglicherweise nicht widerspiegeln.

Wer hat welchen Benchmark ausgeführt

Anthropic führte jeden Test selbst durch, sofern kein Dritter genannt wird. Reihen von verschiedenen Anbietern teilen sich einen Benchmark-Namen, nicht aber eine Testumgebung oder Aufwandseinstellung.

Ausführender Benchmark Bedingungen
Anthropic Terminal-Bench 4.0, HLE, OSWorld 2.1 TB: Claude Code --bare, 5 Versuche, Schutzmaßnahmen aktiviert. HLE: Suche und Codeausführung. OSWorld: 108 Aufgaben
Cognition FrontierCode 1.1 Claude in Claude Code, GPT in Codex CLI
Cursor CursorBench 4.0 Cursors Produktionsumgebung; Anthropic schätzte die Kosten zum Listenpreis
Artificial Analysis GDPval-AA, AA-Briefcase Vorabversion
Anthropic Chartography Surge AI’s Benchmark, bewertet mit Gemini 3.5 Flash; Sols Ergebnis von Surge

Der Fallback betraf 1,5 % der Terminal-Bench-Versuche von Sonnet 5.5, aber 10 % derer von Opus 5.5 (Systemkarte §8.5), daher sollte Sonnets Vorsprung von 4,2 Punkten mit Vorsicht betrachtet werden.

Zusätze zur Systemkarte

Die Zeilen eins bis sechs sind die Zusammenfassung der maximalen Anstrengung der Systemkarte.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5
SWE-Bench Pro 81.3 63.2 89.9
SWE-Bench Multilingual 90.3 78.3 93.9
SWE-Bench Multimodal 54.3 28.1 61.4
HLE, ohne Tools 56.9 43.1 64.4
HealthBench Professional 69.2 57.8 65.6
AutomationBench (Zapiers Ausführung) 44.7 10.7 42.5
DeepSWE v1.1 71.0% n/r n/r
Terminal-Bench-Science 0.1 59.9% n/r 58.7%
FrontierSWE v2 (Proximal’s Ausführung) 61.9% n/r 62.3%
ArXivMath (ohne Tools / mit Tools) 86.8% / 95.2% n/r 91.2% / 96.9%
ProgramBench (langer Kontext) 79.7% 77.3% 91.2%
OSWorld 2.1, strenger Pass 43.5% 25.6% 48.7%
Toolathlon-Verified (Pass@1) 77.8% 74.7% 77.8%
OfficeQA / OfficeQA Pro 76.9% / 65.6% 75.1% / 62.1% 78.9% / 67.7%

Sonnet 5.5 übertrifft Opus 5.5 bei HealthBench Professional, AutomationBench und Terminal-Bench-Science; Opus führt am deutlichsten bei ProgramBench, SWE-Bench Pro und HLE ohne Tools. Die 80,1 % von OSWorld sind eine Teilleistung; nur 43,5 % der Aufgaben bestehen vollständig.

Aufwand verändert das Bild

Die Startdiagramme, als Ergebnis (Kosten). Die Kosten für Terminal-Bench gelten pro Versuch, die anderen pro Aufgabe. Zwei Diagramme zeigen GPT-5.6 Sol (*), da die Zahlen für GPT-6 Sol nicht veröffentlicht wurden.

Modell Niedrig Mittel Hoch Sehr hoch Max
Terminal-Bench 4.0
Sonnet 5.5 20.0% ($0.76) 28.8% ($0.83) 43.0% ($1.94) 61.5% ($5.30) 70.6% ($12.54)
Opus 5.5 38.5% ($1.29) 57.6% ($2.94) 64.2% ($3.88) 66.4% ($7.35) 64.8% ($11.24)
Sonnet 5 3.2% ($3.78) 4.4% ($4.83) 4.5% ($8.20) 7.0% ($9.95) 10.3% ($11.62)
GPT-5.6 Sol* 7.9% ($1.46) 20.9% ($2.69) 26.1% ($4.12) 28.5% ($5.39) 37.3% ($7.89)
FrontierCode 1.1 Haupt
Sonnet 5.5 29.3% ($0.19) 36.5% ($0.24) 49.4% ($0.42) 52.1% ($1.59) 46.2% ($20.78)
Opus 5.5 47.3% ($0.40) 54.6% ($0.80) 54.0% ($1.09) 51.4% ($2.25) 54.4% ($6.19)
Sonnet 5 28.7% ($2.39) 35.2% ($3.81) 39.4% ($6.10) 42.7% ($10.07) 42.4% ($17.12)
GPT-6 Sol 37.3% ($0.43) 45.9% ($0.77) 47.7% ($1.04) 48.4% ($1.32) 49.3% ($2.07)
CursorBench 4.0
Sonnet 5.5 35.8% ($0.50) 39.2% ($0.70) 47.8% ($1.67) 53.1% ($3.88) 55.5% ($9.67)
Opus 5.5 43.7% ($1.17) 52.5% ($2.91) 56.0% ($3.97) 56.0% ($6.98) 57.8% ($13.43)
Sonnet 5 24.1% ($1.39) 28.0% ($2.31) 30.8% ($3.48) 32.0% ($4.55) 34.1% ($7.17)
GPT-5.6 Sol* 24.6% ($0.87) 31.1% ($1.77) 35.7% ($2.85) 37.7% ($4.40) 41.7% ($8.23)
AA-Briefcase v1.1 (Elo)
Sonnet 5.5 1264 ($0.87) 1461 ($1.64) 1634 ($3.95) 1746 ($9.63) 1811 ($29.19)
Opus 5.5 1285 ($1.15) 1642 ($4.40) 1705 ($6.27) 1780 ($12.27) 1822 ($21.05)
Sonnet 5 923 ($0.82) 1056 ($1.73) 1177 ($3.76) 1274 ($7.56) 1359 ($14.43)
GPT-6 Sol 905 ($0.12) 1142 ($0.34) 1289 ($0.63) 1364 ($1.19) 1483 ($2.67)

Unabhängige Ergebnisse

Artificial Analysis bewertet Sonnet 5.5 mit 56 auf dem Intelligence Index v4.3.2, Platz 3 von 216, nur hinter Opus 5.5 bei max und xhigh. Sonnet 5 erzielte 38 Punkte. Kosten für die Ausführung des Indexes:

Aufwand Index-Score Kosten für die Ausführung
max 55.98 8.977 $
sehr hoch 51.85 2.738 $
hoch 46.74 1.176 $
mittel 40.74 701 $
niedrig 35.84 544 $

„Max“ kostet 7,6-mal mehr als „hoch“ für 9,2 zusätzliche Punkte. OfficeChais Interpretation von AA platziert Sonnet 5.5 außerhalb der Pareto-Grenze, am kostengünstigsten bei „hoch“, und zählt etwa 193.000 Ausgabe-Tokens pro Index-Aufgabe bei „max“.

Sicherheits-Benchmarks

Prompt-Injection, gemäß Systemkarte:

Cyber-Evaluierungen wurden ohne Schutzmaßnahmen durchgeführt: 46,1 % bei CyScenarioBench (Sonnet 5: 0,7 %, Opus 5.5: 67,6 %). Es ist das erste Sonnet mit Cyber-Schutzmaßnahmen, und Anthropic warnt vor mehr Ablehnungen selbst bei gutartigen Sicherheitsaufgaben. Siehe unseren Leitfaden zur Prompt-Injection.

Führen Sie Ihre eigene Bewertung durch

Benchmarks sehen nicht wie Ihr Traffic aus, und Anthropics Prompt-Leitfaden besagt, dass der Aufwand neu kalibriert wird. Verwenden Sie daher keine Sonnet 5-Einstellungen wieder. In Apidog:

  1. Speichern Sie ANTHROPIC_API_KEY als Umgebungsvariable und speichern Sie 20 bis 50 echte Prompts als Nachrichtenanfragen.
  2. Überprüfen Sie den Status 200, einen stop_reason, der nicht "max_tokens" oder "refusal" ist, und den Inhalt, den eine korrekte Antwort benötigt.
  3. Führen Sie ihn mit niedrig, mittel, hoch und sehr hoch aus, jeweils einen Durchlauf; eine Änderung des Aufwands invalidiert den Prompt-Cache.
  4. Zeichnen Sie die Erfolgsrate und die Token-Anzahlen in usage auf, preislich bei 2 $ Input und 10 $ Output pro Million.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 16000,
    "output_config": {"effort": "high"},
    "messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
  }'

Verwenden Sie den niedrigsten Aufwand, dessen Erfolgsrate Sie akzeptieren. Siehe Testen von LLM-Anwendungen und Testen von AI-Agent-APIs, dann laden Sie Apidog herunter, um die Sammlung zu erstellen.

FAQ

Schlägt Sonnet 5.5 Opus 5.5? Bei Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science und Chartography mit Tools, ja. Opus 5.5 führt oder liegt gleichauf mit dem Rest.

Was ist der SWE-Bench-Score von Sonnet 5.5? 81,3 bei SWE-Bench Pro und 90,3 bei Multilingual, bei maximaler Anstrengung.

Warum gibt es zwei FrontierCode-Zahlen? 46,2 % ist „max“, 52,1 % ist „sehr hoch“; die Subagenten-Verzweigung von „max“ führte zu Überschreitungsstrafen.

Sollte ich von Sonnet 5 upgraden? Ja, laut Benchmarks, aber lesen Sie zuerst die bahnbrechenden API-Änderungen in Sonnet 5.5 vs Sonnet 5.

Nächster Schritt

Beginnen Sie mit hoch (oder mittel für gut spezifizierte agentische Codierung), wie von Anthropic vorgeschlagen, und lassen Sie Ihre Bewertung in Apidog entscheiden, ob sich ein Upgrade lohnt.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen