Claude Haiku 5.5 Benchmarks

Claude Haiku 5.5 Benchmarks: 72,4 % OSWorld, 1620 GDPval-AA, 39,2 % Terminal-Bench bei maximalem Aufwand. Wer jeden Test durchgeführt hat, Kosten pro Aufwand und Ihre eigene Bewertung.

Ashley Goolam

Ashley Goolam

8 October 2026

Claude Haiku 5.5 Benchmarks

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Claude Haiku 5.5 erreicht 72,4 % bei OSWorld 2.1, 1620 bei GDPval-AA v2.1, 46,4 % bei FrontierCode 1.1 und 39,2 % bei Terminal-Bench 4.0. Haiku 4.5 erreichte 15,7 %, 735 und 0,0 % bei dreien davon. Alle sind Max-Aufwand-Werte; beim Standard-Aufwand medium sinkt GDPval-AA auf 1277. Bisher hat noch kein unabhängiges Labor Ergebnisse für Haiku 5.5 veröffentlicht.

Unten: jeder Claude Haiku 5.5 Benchmark, wer ihn durchgeführt hat, wie sich der Aufwand auf Score und Kosten auswirkt und wie Sie das Modell in Apidog mit Ihrem eigenen Traffic testen können. Für Spezifikationen und Preise beginnen Sie mit was ist Claude Haiku 5.5.

button

Die Starttabelle

Jede Haiku 5.5 Zelle verwendet adaptives Denken bei maximalem Aufwand, in der Regel gemittelt über fünf Versuche (Terminal-Bench verwendete zehn pro Aufgabe). „n/r“ bedeutet, dass kein Ergebnis veröffentlicht wurde.

Benchmark Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, Offline-Subset 72.4% 15.7% 48.9% 83.9%
Letzte Prüfung der Menschheit, ohne Werkzeuge 45.9% 10.2% n/r 56.9%
Letzte Prüfung der Menschheit, mit Werkzeugen 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 (Haupt) 46.4% n/r 42.4% 52.1% (xhoch)
Kartografie, ohne Werkzeuge 46.4% 6.4% 29.1% 61.6%

Wer jeden Benchmark durchgeführt hat

Anthropic führte die meisten Tests selbst durch. Zeilen über verschiedene Anbieter hinweg teilen sich einen Benchmark-Namen, nicht immer eine Testumgebung oder Aufwandseinstellung.

Benchmark Wer es durchgeführt hat Bedingungen
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, unabhängig GDPval-AA: 220 Aufgaben, 44 Berufe, Elo verankert an DeepSeek V4.1 Flash (max) bei 1600; Briefcase: mehrwöchige Projekte
FrontierCode 1.1 Cognition Claude in Claude Code, GPT in Codex; Haupt = die 100 schwierigsten von 150 Aufgaben
Kartografie Anthropic, auf dem Benchmark von Surge AI Gemini 3.5 Flash Grader; Luna-Score von Surge AI
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 Aufgaben, je 10 Versuche, Schutzmaßnahmen aktiviert
OSWorld 2.1 Anthropic 82 von 108 Aufgaben, 1080p, bis zu 500 Schritte
Letzte Prüfung der Menschheit Anthropic 980K-Token-Aufgabenbudget, Opus 4.6 Grader

Zwei GPT-6 Luna Zellen benötigen Kontext. Anthropic führte Lunas OSWorld-Score über die OpenAI-API für dieselben 82 Aufgaben aus. Lunas Terminal-Bench 16,4 % stammen aus der öffentlichen Bestenliste (Codex CLI, maximaler Aufwand). Bei Terminal-Bench stoppten Schutzmaßnahmen 1,8 % der Haiku 5.5 Versuche (12 von 660), und jeder wurde als Fehlschlag gewertet.

Die FrontierCode-Falle

Die Starttabelle zeigt Haiku 5.5 bei Max (46,4 %) neben Sonnet 5.5 bei xhoch (52,1 %), Sonnets bestem Score. Die Systemkarte liefert die vergleichbaren Zahlen:

FrontierCode 1.1 Haupt Erweitert
Haiku 5.5, max 46.4% 58.4%
Haiku 5.5, xhoch 45.8% n/r
Sonnet 5.5, max 46.2% 59.1%
Sonnet 5.5, xhoch 52.1% 64.4%

Bei maximalem Aufwand übertrifft Haiku 5.5 Sonnet 5.5 bei Haupt um 46,4 % zu 46,2 %. Bei den besten Einstellungen jedes Modells führt Sonnet mit 5,7 Punkten Vorsprung. Geben Sie an, welchen Aufwand Sie meinen, wenn Sie eines davon zitieren.

Zusätze zur Systemkarte

Die Systemkarte ergänzt Zeilen, die der Startbeitrag übersprungen hat. Alle sind, sofern nicht anders vermerkt, Werte bei maximalem Aufwand.

Benchmark Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench Mehrsprachig 83.7 67.4 90.3
SWE-bench Multimodal 30.7 19.8 54.3
OSWorld 2.1, strikte Erfolgsquote 37.1% n/r 48.8%
Kartografie, mit Werkzeugen 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Professional (längenbereinigt) 64.8% 32.2% 69.2%

Die 72,4 % von OSWorld sind eine Teilleistung; nur 37,1 % der Aufgaben bestehen vollständig. Die Kartografie verdoppelt sich fast mit Werkzeugen (46,4 % auf 86,2 %), daher geben Sie Haiku 5.5 Werkzeuge für die Diagrammarbeit.

Standard-Aufwand erzielt niedrigere Werte

Haiku 5.5 verwendet standardmäßig medium in der Claude API und in Claude Code. Die Systemkarte berichtet diese Ergebnisse bei Standard-Aufwand:

Benchmark Medium (Standard) Max Hinweis
GDPval-AA v2.1 1277 1620 Medium verwendete etwa ein Zehntel der Ausgabetoken von Max
AA-Briefcase v1.1 1372 1578 Medium verwendete weniger als ein Viertel der Ausgabetoken von Max
HealthBench Professional 59.9% 64.8% Niedrig 57,9 %, hoch 61,3 %

Rufen Sie die API ohne output_config.effort auf und erwarten Sie die linke Spalte. Die Dokumentation zum Aufwand behandelt alle fünf Stufen.

Score und Kosten nach Aufwand

Aus den Startdiagrammen, als Score (Kosten). Die Kosten für OSWorld und Terminal-Bench sind pro Versuch; GDPval-AA ist pro Aufgabe.

Modell Niedrig Medium Hoch Xhoch Max
OSWorld 2.1
Haiku 5.5 42.0% ($0.07) 53.3% ($0.13) 61.3% ($0.18) 67.6% ($0.28) 72.4% ($0.61)
Sonnet 5.5 57.9% ($0.68) 66.0% ($0.93) 73.2% ($1.38) 81.1% ($2.22) 83.9% ($5.73)
GPT-6 Luna 19.2% ($0.04) 37.5% ($0.13) 42.3% ($0.14) 44.8% ($0.17) 48.9% ($0.21)
GDPval-AA v2.1
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Terminal-Bench 4.0
Haiku 5.5 12.7% ($0.42) 20.3% ($0.68) 24.8% ($1.04) 31.5% ($1.75) 39.2% ($2.64)
Sonnet 5.5 20.0% ($0.62) 28.8% ($0.68) 43.0% ($1.46) 61.5% ($4.34) 70.6% ($10.44)

Die Kosten basieren auf Listenpreisen: 0,10 $ / 0,50 $ pro Million Token für Prompts bis zu 100K Token, darüber höhere Preise (siehe die Preisübersicht).

Wo Haiku 5.5 noch hinterherhinkt

Sonnet 5.5 führt jede Zeile der Starttabelle an. Haikus einziger direkter Sieg ist FrontierCode bei gleichem maximalen Aufwand. Die größte Lücke ist Terminal-Bench 4.0: 39,2 % versus 70,6 %. SWE-Bench Pro (64,8 versus 81,3) und SWE-bench Multimodal (30,7 versus 54,3) zeigen dasselbe Muster.

Anthropic stimmt zu: Sonnet 5.5 und Opus 5.5 „bleiben bessere Optionen für komplexe agentenbasierte Kodierungsaufgaben.“ Haiku 5.5 eignet sich für eng gefasste Arbeiten: Komprimierung, Zusammenfassung, Klassifizierung, Browsernutzung und Subagenten unter einem größeren Modell. Der Betrieb als günstiger Subagent wird in Haiku 5.5 in Claude Code behandelt.

Unabhängige Ergebnisse: noch keine

Stand 8. Oktober 2026 hat noch kein unabhängiges Labor Ergebnisse für Haiku 5.5 veröffentlicht. Die Haiku 5.5-Seite von Artificial Analysis gibt einen 404-Fehler zurück, und ihre Bestenliste führt nur Claude 4.5 Haiku auf. Vals, LMArena, SWE-bench und Aider zeigten ebenfalls nichts. Es gibt keine Geschwindigkeitsangabe von Drittanbietern; Anthropic bezeichnet Haiku 5.5 als sein „schnellstes Modell bis heute“ bei Standardgeschwindigkeit, langsamer als Opus im Fast Mode.

Die nächstgelegene externe Zahl stammt von Cursor. Deren Modelldokumentation besagt, dass Haiku 5.5 „48,4 % auf CursorBench bei maximalem Aufwand erzielt“, ein Anstieg von 30,9 % bei niedrigem Aufwand. Bei ausgeschaltetem Denken meldet Cursor 22,1 % bis 26,2 % bei denselben Aufwandsstufen, bei denen mit eingeschaltetem Denken 30,9 % bis 42,3 % erzielt wurden.

Was Kunden berichten

Diese stammen aus dem Launch-Beitrag von Anthropic und wurden nicht unabhängig überprüft:

Führen Sie Ihre eigene Evaluierung durch

Benchmarks sehen nicht wie Ihr Traffic aus. Anthropic’s Prompting-Anleitung schlägt vor, xhoch oder max nur dort zu verwenden, wo Ihre Evaluierungen einen Gewinn zeigen, und dieselben Evaluierungen mit Sonnet 5.5 durchzuführen, um zu vergleichen. In Apidog:

  1. Speichern Sie ANTHROPIC_API_KEY als Umgebungsvariable und speichern Sie 20 bis 50 echte Prompts als Nachrichtenanfragen.
  2. Fügen Sie Assertionen hinzu: Status 200, einen stop_reason, der nicht "max_tokens" oder "refusal" ist, und den Inhalt, den eine korrekte Antwort benötigt.
  3. Führen Sie den Satz bei low, medium und high aus. Das Ändern des Aufwands macht den Prompt-Cache ungültig.
  4. Erfassen Sie die Erfolgsquote und die Token-Anzahlen in usage. Der neue Tokenizer erzeugt etwa 30 % mehr Token als der von Haiku 4.5 für denselben Text.
  5. Duplizieren Sie die Sammlung, tauschen Sie claude-sonnet-5-5 ein und vergleichen Sie beide Modelle in einem Projekt.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
  }'

Senden Sie keine temperature, top_p, top_k oder eine Assistenten-Vorausfüllung; jede davon gibt einen 400er-Fehler bei Haiku 5.5 zurück. Wählen Sie Antwortblöcke nach type aus, da ein thinking-Block zuerst kommen kann. Siehe die API-Anleitung und Testen von LLM-Anwendungen.

FAQ

Ist Claude Haiku 5.5 besser als Sonnet 5.5? Nicht nach Anthropic’s Zahlen. Sonnet 5.5 führt jede Zeile der Starttabelle an; Haiku übertrifft es nur bei FrontierCode, wenn beide bei maximalem Aufwand laufen (46,4 % vs. 46,2 %). Siehe Haiku 5.5 vs Haiku 4.5 für die Upgrade-Ansicht.

Wie hoch ist der SWE-bench Score von Haiku 5.5? 64,8 bei SWE-Bench Pro, 83,7 bei SWE-bench Mehrsprachig und 30,7 bei SWE-bench Multimodal, alle bei maximalem Aufwand.

Mit welchem Aufwand wurden die Benchmarks durchgeführt? Maximal, normalerweise gemittelt über fünf Versuche. Der API-Standard ist Medium, wo GDPval-AA 1277 anstelle von 1620 erzielt.

Gibt es unabhängige Haiku 5.5 Benchmarks? Noch nicht. Artificial Analysis führte GDPval-AA und AA-Briefcase unabhängig durch, aber Anthropic veröffentlichte diese Scores; AA hat keine Haiku 5.5-Seite.

Ist GPT-6 Luna günstiger? Normalerweise. Luna kostet weniger bei jeder GDPval-AA-Aufwandsstufe und jeder OSWorld-Stufe außer Medium, wo beide etwa gleich viel kosten. Haiku 5.5 erzielt bei beiden höhere Werte.

Nächster Schritt

Beginnen Sie mit medium und erhöhen Sie den Aufwand nur dort, wo sich der Gewinn Ihrer Erfolgsquote auszahlt. Laden Sie Apidog herunter, erstellen Sie die oben genannte Evaluierungssammlung und bewahren Sie die Ergebnisse in Apidog neben Ihrer Sonnet 5.5-Baseline auf, bevor Sie den Produktions-Traffic umstellen.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen