Claude Haiku 5.5 erreicht 72,4 % bei OSWorld 2.1, 1620 bei GDPval-AA v2.1, 46,4 % bei FrontierCode 1.1 und 39,2 % bei Terminal-Bench 4.0. Haiku 4.5 erreichte 15,7 %, 735 und 0,0 % bei dreien davon. Alle sind Max-Aufwand-Werte; beim Standard-Aufwand medium sinkt GDPval-AA auf 1277. Bisher hat noch kein unabhängiges Labor Ergebnisse für Haiku 5.5 veröffentlicht.
Unten: jeder Claude Haiku 5.5 Benchmark, wer ihn durchgeführt hat, wie sich der Aufwand auf Score und Kosten auswirkt und wie Sie das Modell in Apidog mit Ihrem eigenen Traffic testen können. Für Spezifikationen und Preise beginnen Sie mit was ist Claude Haiku 5.5.
Die Starttabelle
Jede Haiku 5.5 Zelle verwendet adaptives Denken bei maximalem Aufwand, in der Regel gemittelt über fünf Versuche (Terminal-Bench verwendete zehn pro Aufgabe). „n/r“ bedeutet, dass kein Ergebnis veröffentlicht wurde.
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, Offline-Subset | 72.4% | 15.7% | 48.9% | 83.9% |
| Letzte Prüfung der Menschheit, ohne Werkzeuge | 45.9% | 10.2% | n/r | 56.9% |
| Letzte Prüfung der Menschheit, mit Werkzeugen | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (Haupt) | 46.4% | n/r | 42.4% | 52.1% (xhoch) |
| Kartografie, ohne Werkzeuge | 46.4% | 6.4% | 29.1% | 61.6% |
Wer jeden Benchmark durchgeführt hat
Anthropic führte die meisten Tests selbst durch. Zeilen über verschiedene Anbieter hinweg teilen sich einen Benchmark-Namen, nicht immer eine Testumgebung oder Aufwandseinstellung.
| Benchmark | Wer es durchgeführt hat | Bedingungen |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, unabhängig | GDPval-AA: 220 Aufgaben, 44 Berufe, Elo verankert an DeepSeek V4.1 Flash (max) bei 1600; Briefcase: mehrwöchige Projekte |
| FrontierCode 1.1 | Cognition | Claude in Claude Code, GPT in Codex; Haupt = die 100 schwierigsten von 150 Aufgaben |
| Kartografie | Anthropic, auf dem Benchmark von Surge AI | Gemini 3.5 Flash Grader; Luna-Score von Surge AI |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 Aufgaben, je 10 Versuche, Schutzmaßnahmen aktiviert |
| OSWorld 2.1 | Anthropic | 82 von 108 Aufgaben, 1080p, bis zu 500 Schritte |
| Letzte Prüfung der Menschheit | Anthropic | 980K-Token-Aufgabenbudget, Opus 4.6 Grader |
Zwei GPT-6 Luna Zellen benötigen Kontext. Anthropic führte Lunas OSWorld-Score über die OpenAI-API für dieselben 82 Aufgaben aus. Lunas Terminal-Bench 16,4 % stammen aus der öffentlichen Bestenliste (Codex CLI, maximaler Aufwand). Bei Terminal-Bench stoppten Schutzmaßnahmen 1,8 % der Haiku 5.5 Versuche (12 von 660), und jeder wurde als Fehlschlag gewertet.
Die FrontierCode-Falle
Die Starttabelle zeigt Haiku 5.5 bei Max (46,4 %) neben Sonnet 5.5 bei xhoch (52,1 %), Sonnets bestem Score. Die Systemkarte liefert die vergleichbaren Zahlen:
| FrontierCode 1.1 | Haupt | Erweitert |
|---|---|---|
| Haiku 5.5, max | 46.4% | 58.4% |
| Haiku 5.5, xhoch | 45.8% | n/r |
| Sonnet 5.5, max | 46.2% | 59.1% |
| Sonnet 5.5, xhoch | 52.1% | 64.4% |
Bei maximalem Aufwand übertrifft Haiku 5.5 Sonnet 5.5 bei Haupt um 46,4 % zu 46,2 %. Bei den besten Einstellungen jedes Modells führt Sonnet mit 5,7 Punkten Vorsprung. Geben Sie an, welchen Aufwand Sie meinen, wenn Sie eines davon zitieren.
Zusätze zur Systemkarte
Die Systemkarte ergänzt Zeilen, die der Startbeitrag übersprungen hat. Alle sind, sofern nicht anders vermerkt, Werte bei maximalem Aufwand.
| Benchmark | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-bench Mehrsprachig | 83.7 | 67.4 | 90.3 |
| SWE-bench Multimodal | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1, strikte Erfolgsquote | 37.1% | n/r | 48.8% |
| Kartografie, mit Werkzeugen | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench Professional (längenbereinigt) | 64.8% | 32.2% | 69.2% |
Die 72,4 % von OSWorld sind eine Teilleistung; nur 37,1 % der Aufgaben bestehen vollständig. Die Kartografie verdoppelt sich fast mit Werkzeugen (46,4 % auf 86,2 %), daher geben Sie Haiku 5.5 Werkzeuge für die Diagrammarbeit.
Standard-Aufwand erzielt niedrigere Werte
Haiku 5.5 verwendet standardmäßig medium in der Claude API und in Claude Code. Die Systemkarte berichtet diese Ergebnisse bei Standard-Aufwand:
| Benchmark | Medium (Standard) | Max | Hinweis |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | Medium verwendete etwa ein Zehntel der Ausgabetoken von Max |
| AA-Briefcase v1.1 | 1372 | 1578 | Medium verwendete weniger als ein Viertel der Ausgabetoken von Max |
| HealthBench Professional | 59.9% | 64.8% | Niedrig 57,9 %, hoch 61,3 % |
Rufen Sie die API ohne output_config.effort auf und erwarten Sie die linke Spalte. Die Dokumentation zum Aufwand behandelt alle fünf Stufen.
Score und Kosten nach Aufwand
Aus den Startdiagrammen, als Score (Kosten). Die Kosten für OSWorld und Terminal-Bench sind pro Versuch; GDPval-AA ist pro Aufgabe.
| Modell | Niedrig | Medium | Hoch | Xhoch | Max |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42.0% ($0.07) | 53.3% ($0.13) | 61.3% ($0.18) | 67.6% ($0.28) | 72.4% ($0.61) |
| Sonnet 5.5 | 57.9% ($0.68) | 66.0% ($0.93) | 73.2% ($1.38) | 81.1% ($2.22) | 83.9% ($5.73) |
| GPT-6 Luna | 19.2% ($0.04) | 37.5% ($0.13) | 42.3% ($0.14) | 44.8% ($0.17) | 48.9% ($0.21) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12.7% ($0.42) | 20.3% ($0.68) | 24.8% ($1.04) | 31.5% ($1.75) | 39.2% ($2.64) |
| Sonnet 5.5 | 20.0% ($0.62) | 28.8% ($0.68) | 43.0% ($1.46) | 61.5% ($4.34) | 70.6% ($10.44) |
- Max ist für den letzten Schritt teuer. Bei GDPval-AA kostet Max etwa das 28-fache von Medium für 343 weitere Elo-Punkte. Bei OSWorld kostet Max über das Doppelte von Xhoch für 4,8 Punkte.
- Haiku 5.5 bei Medium schlägt Luna bei Max auf OSWorld: 53,3 % für 0,13 $ gegenüber 48,9 % für 0,21 $. Luna ist jedoch auf jeder anderen vergleichbaren Stufe günstiger; auf Medium kosten beide etwa gleich viel. Siehe Haiku 5.5 vs GPT-6 Luna.
- Haiku 5.5 bei Max schlägt Sonnet 5.5 bei Medium auf OSWorld (72,4 % für 0,61 $ gegenüber 66,0 % für 0,93 $).
- Terminal-Bench ist die Ausnahme. Sonnet 5.5 bei Hoch (43,0 %, 1,46 $) schlägt Haiku 5.5 bei Max (39,2 %, 2,64 $) für weniger Geld. Sonnet-Kosten verwenden den neuen 0,10 $-Cache-Lese-Preis.
Die Kosten basieren auf Listenpreisen: 0,10 $ / 0,50 $ pro Million Token für Prompts bis zu 100K Token, darüber höhere Preise (siehe die Preisübersicht).
Wo Haiku 5.5 noch hinterherhinkt
Sonnet 5.5 führt jede Zeile der Starttabelle an. Haikus einziger direkter Sieg ist FrontierCode bei gleichem maximalen Aufwand. Die größte Lücke ist Terminal-Bench 4.0: 39,2 % versus 70,6 %. SWE-Bench Pro (64,8 versus 81,3) und SWE-bench Multimodal (30,7 versus 54,3) zeigen dasselbe Muster.
Anthropic stimmt zu: Sonnet 5.5 und Opus 5.5 „bleiben bessere Optionen für komplexe agentenbasierte Kodierungsaufgaben.“ Haiku 5.5 eignet sich für eng gefasste Arbeiten: Komprimierung, Zusammenfassung, Klassifizierung, Browsernutzung und Subagenten unter einem größeren Modell. Der Betrieb als günstiger Subagent wird in Haiku 5.5 in Claude Code behandelt.
Unabhängige Ergebnisse: noch keine
Stand 8. Oktober 2026 hat noch kein unabhängiges Labor Ergebnisse für Haiku 5.5 veröffentlicht. Die Haiku 5.5-Seite von Artificial Analysis gibt einen 404-Fehler zurück, und ihre Bestenliste führt nur Claude 4.5 Haiku auf. Vals, LMArena, SWE-bench und Aider zeigten ebenfalls nichts. Es gibt keine Geschwindigkeitsangabe von Drittanbietern; Anthropic bezeichnet Haiku 5.5 als sein „schnellstes Modell bis heute“ bei Standardgeschwindigkeit, langsamer als Opus im Fast Mode.
Die nächstgelegene externe Zahl stammt von Cursor. Deren Modelldokumentation besagt, dass Haiku 5.5 „48,4 % auf CursorBench bei maximalem Aufwand erzielt“, ein Anstieg von 30,9 % bei niedrigem Aufwand. Bei ausgeschaltetem Denken meldet Cursor 22,1 % bis 26,2 % bei denselben Aufwandsstufen, bei denen mit eingeschaltetem Denken 30,9 % bis 42,3 % erzielt wurden.
Was Kunden berichten
Diese stammen aus dem Launch-Beitrag von Anthropic und wurden nicht unabhängig überprüft:
- HubSpot: 92,8 % im Durchschnitt über drei Durchläufe auf seiner simulierten CRM-Portal-Suite, der beste Score, den es auf dieser Suite je gesehen hat.
- AlphaSense: 0,84 gegenüber 0,76 von Haiku 4.5 bei 400 „Ask in Document“-Anfragen, was als statistisch signifikant bezeichnet wird.
- Box: 11 Punkte höher als Haiku 4.5 bei etwa halber Latenz, in frühen Tests.
- Asana: über 30 % geringere Latenz für Aufgabenabschlüsse im Vergleich zu seinem aktuellen Modell.
- Cognition: Devin Fusion erreicht einen FrontierCode-Score von 66,2 mit Haiku 5.5 als Sidekick und Opus 5.5 als Lead. Dies ist ein Zwei-Modell-System, nicht Haiku allein.
Führen Sie Ihre eigene Evaluierung durch
Benchmarks sehen nicht wie Ihr Traffic aus. Anthropic’s Prompting-Anleitung schlägt vor, xhoch oder max nur dort zu verwenden, wo Ihre Evaluierungen einen Gewinn zeigen, und dieselben Evaluierungen mit Sonnet 5.5 durchzuführen, um zu vergleichen. In Apidog:
- Speichern Sie
ANTHROPIC_API_KEYals Umgebungsvariable und speichern Sie 20 bis 50 echte Prompts als Nachrichtenanfragen. - Fügen Sie Assertionen hinzu: Status 200, einen
stop_reason, der nicht"max_tokens"oder"refusal"ist, und den Inhalt, den eine korrekte Antwort benötigt. - Führen Sie den Satz bei
low,mediumundhighaus. Das Ändern des Aufwands macht den Prompt-Cache ungültig. - Erfassen Sie die Erfolgsquote und die Token-Anzahlen in
usage. Der neue Tokenizer erzeugt etwa 30 % mehr Token als der von Haiku 4.5 für denselben Text. - Duplizieren Sie die Sammlung, tauschen Sie
claude-sonnet-5-5ein und vergleichen Sie beide Modelle in einem Projekt.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
}'
Senden Sie keine temperature, top_p, top_k oder eine Assistenten-Vorausfüllung; jede davon gibt einen 400er-Fehler bei Haiku 5.5 zurück. Wählen Sie Antwortblöcke nach type aus, da ein thinking-Block zuerst kommen kann. Siehe die API-Anleitung und Testen von LLM-Anwendungen.
FAQ
Ist Claude Haiku 5.5 besser als Sonnet 5.5? Nicht nach Anthropic’s Zahlen. Sonnet 5.5 führt jede Zeile der Starttabelle an; Haiku übertrifft es nur bei FrontierCode, wenn beide bei maximalem Aufwand laufen (46,4 % vs. 46,2 %). Siehe Haiku 5.5 vs Haiku 4.5 für die Upgrade-Ansicht.
Wie hoch ist der SWE-bench Score von Haiku 5.5? 64,8 bei SWE-Bench Pro, 83,7 bei SWE-bench Mehrsprachig und 30,7 bei SWE-bench Multimodal, alle bei maximalem Aufwand.
Mit welchem Aufwand wurden die Benchmarks durchgeführt? Maximal, normalerweise gemittelt über fünf Versuche. Der API-Standard ist Medium, wo GDPval-AA 1277 anstelle von 1620 erzielt.
Gibt es unabhängige Haiku 5.5 Benchmarks? Noch nicht. Artificial Analysis führte GDPval-AA und AA-Briefcase unabhängig durch, aber Anthropic veröffentlichte diese Scores; AA hat keine Haiku 5.5-Seite.
Ist GPT-6 Luna günstiger? Normalerweise. Luna kostet weniger bei jeder GDPval-AA-Aufwandsstufe und jeder OSWorld-Stufe außer Medium, wo beide etwa gleich viel kosten. Haiku 5.5 erzielt bei beiden höhere Werte.
Nächster Schritt
Beginnen Sie mit medium und erhöhen Sie den Aufwand nur dort, wo sich der Gewinn Ihrer Erfolgsquote auszahlt. Laden Sie Apidog herunter, erstellen Sie die oben genannte Evaluierungssammlung und bewahren Sie die Ergebnisse in Apidog neben Ihrer Sonnet 5.5-Baseline auf, bevor Sie den Produktions-Traffic umstellen.
