Claude Haiku 5.5 Benchmarks

Les benchmarks de Claude Haiku 5.5 : 72,4 % à OSWorld, 1620 à GDPval-AA, 39,2 % à Terminal-Bench à effort maximal. Qui a exécuté chaque test, les coûts par effort, et votre propre évaluation.

Ashley Goolam

Ashley Goolam

8 October 2026

Claude Haiku 5.5 Benchmarks

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Claude Haiku 5.5 obtient 72,4 % sur OSWorld 2.1, 1620 sur GDPval-AA v2.1, 46,4 % sur FrontierCode 1.1 et 39,2 % sur Terminal-Bench 4.0. Haiku 4.5 a obtenu 15,7 %, 735 et 0,0 % sur trois de ces benchmarks. Tous sont des chiffres d'effort maximal ; avec l'effort medium par défaut, GDPval-AA chute à 1277. Aucun laboratoire indépendant n'a encore publié les résultats de Haiku 5.5.

Ci-dessous : tous les benchmarks de Claude Haiku 5.5, qui les a exécutés, comment l'effort affecte le score et le coût, et comment tester le modèle sur votre propre trafic dans Apidog. Pour les spécifications et les tarifs, commencez par qu'est-ce que Claude Haiku 5.5.

bouton

Le tableau de lancement

Chaque cellule de Haiku 5.5 utilise une réflexion adaptative à effort maximal, généralement moyennée sur cinq essais (Terminal-Bench en a utilisé dix par tâche). « n/r » signifie qu'aucun résultat n'a été publié.

Benchmark Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, offline subset 72.4% 15.7% 48.9% 83.9%
Humanity’s Last Exam, no tools 45.9% 10.2% n/r 56.9%
Humanity’s Last Exam, with tools 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 (Main) 46.4% n/r 42.4% 52.1% (xhigh)
Chartography, no tools 46.4% 6.4% 29.1% 61.6%

Qui a exécuté chaque benchmark

Anthropic a exécuté la plupart des tests lui-même. Les lignes inter-fournisseurs partagent un nom de benchmark, mais pas toujours un harnais ou un réglage d'effort.

Benchmark Qui l'a exécuté Conditions
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, indépendamment GDPval-AA : 220 tâches, 44 occupations, Elo ancré à DeepSeek V4.1 Flash (max) à 1600 ; Briefcase : projets de plusieurs semaines
FrontierCode 1.1 Cognition Claude dans Claude Code, GPT dans Codex ; Main = les 100 plus difficiles des 150 tâches
Chartography Anthropic, sur le benchmark de Surge AI Évaluateur Gemini 3.5 Flash ; score Luna de Surge AI
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 tâches, 10 essais chacun, protections activées
OSWorld 2.1 Anthropic 82 des 108 tâches, 1080p, jusqu'à 500 étapes
Humanity’s Last Exam Anthropic Budget de tâche de 980K tokens, évaluateur Opus 4.6

Deux cellules de GPT-6 Luna nécessitent un contexte. Anthropic a exécuté le score OSWorld de Luna via l'API d'OpenAI sur les mêmes 82 tâches. Le 16,4 % de Terminal-Bench de Luna provient du classement public (Codex CLI, effort maximal). Sur Terminal-Bench, les mesures de protection ont arrêté 1,8 % des essais de Haiku 5.5 (12 sur 660), et chacun a été compté comme un échec.

Le piège FrontierCode

Le tableau de lancement place Haiku 5.5 à son maximum (46,4 %) à côté de Sonnet 5.5 à xhigh (52,1 %), le meilleur score de Sonnet. La fiche système donne les chiffres comparables :

FrontierCode 1.1 Main Extended
Haiku 5.5, max 46.4% 58.4%
Haiku 5.5, xhigh 45.8% n/r
Sonnet 5.5, max 46.2% 59.1%
Sonnet 5.5, xhigh 52.1% 64.4%

À effort maximal, Haiku 5.5 devance Sonnet 5.5 sur Main, 46,4 % contre 46,2 %. Au meilleur réglage de chaque modèle, Sonnet mène de 5,7 points. Précisez l'effort que vous utilisez lorsque vous citez l'un ou l'autre.

Suppléments de la fiche système

La fiche système ajoute des lignes que la publication de lancement a omises. Toutes sont à effort maximal sauf indication contraire.

Benchmark Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench Multilingual 83.7 67.4 90.3
SWE-bench Multimodal 30.7 19.8 54.3
OSWorld 2.1, strict pass rate 37.1% n/r 48.8%
Chartography, with tools 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Professional (length-adjusted) 64.8% 32.2% 69.2%

Les 72,4 % d'OSWorld représentent un crédit partiel ; seulement 37,1 % des tâches sont réussies complètement. Chartography double presque avec les outils (46,4 % à 86,2 %), il faut donc donner des outils à Haiku 5.5 pour le travail graphique.

L'effort par défaut donne des scores inférieurs

Haiku 5.5 utilise par défaut medium sur l'API Claude et dans Claude Code. La fiche système rapporte ces résultats d'effort par défaut :

Benchmark Medium (par défaut) Max Note
GDPval-AA v2.1 1277 1620 Le niveau medium a utilisé environ un dixième des tokens de sortie du niveau max
AA-Briefcase v1.1 1372 1578 Le niveau medium a utilisé moins d'un quart des tokens de sortie du niveau max
HealthBench Professional 59.9% 64.8% Faible 57.9%, élevé 61.3%

Appelez l'API sans output_config.effort et attendez-vous à la colonne de gauche. La documentation sur l'effort couvre les cinq niveaux.

Score et coût par effort

D'après les graphiques de lancement, sous forme de score (coût). Le coût d'OSWorld et Terminal-Bench est par tentative ; celui de GDPval-AA est par tâche.

Modèle Faible Medium Élevé Xhigh Max
OSWorld 2.1
Haiku 5.5 42.0% (0,07 $) 53.3% (0,13 $) 61.3% (0,18 $) 67.6% (0,28 $) 72.4% (0,61 $)
Sonnet 5.5 57.9% (0,68 $) 66.0% (0,93 $) 73.2% (1,38 $) 81.1% (2,22 $) 83.9% (5,73 $)
GPT-6 Luna 19.2% (0,04 $) 37.5% (0,13 $) 42.3% (0,14 $) 44.8% (0,17 $) 48.9% (0,21 $)
GDPval-AA v2.1
Haiku 5.5 1125 (0,012 $) 1277 (0,030 $) 1420 (0,089 $) 1513 (0,27 $) 1620 (0,87 $)
Sonnet 5.5 1179 (0,22 $) 1324 (0,27 $) 1551 (0,62 $) 1731 (1,88 $) 1840 (6,78 $)
GPT-6 Luna 1036 (0,004 $) 1262 (0,02 $) 1344 (0,03 $) 1364 (0,05 $) 1437 (0,09 $)
Terminal-Bench 4.0
Haiku 5.5 12.7% (0,42 $) 20.3% (0,68 $) 24.8% (1,04 $) 31.5% (1,75 $) 39.2% (2,64 $)
Sonnet 5.5 20.0% (0,62 $) 28.8% (0,68 $) 43.0% (1,46 $) 61.5% (4,34 $) 70.6% (10,44 $)

Les coûts utilisent les prix catalogue : 0,10 $/0,50 $ par million de tokens pour les prompts jusqu'à 100K tokens, plus élevé au-delà (voir le détail des prix).

Là où Haiku 5.5 est encore en retrait

Sonnet 5.5 est en tête de chaque ligne du tableau de lancement. La seule victoire en tête-à-tête de Haiku est sur FrontierCode à effort maximal égal. L'écart le plus important est Terminal-Bench 4.0 : 39,2 % contre 70,6 %. SWE-Bench Pro (64,8 contre 81,3) et SWE-bench Multimodal (30,7 contre 54,3) montrent le même schéma.

Anthropic est d'accord : Sonnet 5.5 et Opus 5.5 « restent de meilleurs choix pour les tâches de codage agentique complexes ». Haiku 5.5 convient aux travaux à portée étroite : compaction, résumé, classification, utilisation de navigateur et sous-agents sous un modèle plus grand. L'utiliser comme sous-agent bon marché est couvert dans Haiku 5.5 dans Claude Code.

Résultats indépendants : aucun pour l'instant

Au 8 octobre 2026, aucun laboratoire indépendant n'a publié de résultats pour Haiku 5.5. La page Haiku 5.5 d'Artificial Analysis renvoie une erreur 404, et son classement ne liste que Claude 4.5 Haiku. Vals, LMArena, SWE-bench et Aider n'ont rien montré non plus. Il n'y a pas de chiffre de vitesse tiers ; Anthropic qualifie Haiku 5.5 de « modèle le plus rapide à ce jour » à vitesse standard, plus lent qu'Opus en mode rapide.

Le chiffre extérieur le plus proche provient de Cursor. Sa documentation du modèle indique que Haiku 5.5 « obtient 48,4 % sur CursorBench à effort maximal », contre 30,9 % à effort faible. Avec la réflexion désactivée, Cursor rapporte de 22,1 % à 26,2 % aux mêmes niveaux d'effort où la réflexion activée a obtenu de 30,9 % à 42,3 %.

Ce que les clients rapportent

Ces informations proviennent de la publication de lancement d'Anthropic et n'ont pas été vérifiées indépendamment :

Exécutez votre propre évaluation

Les benchmarks ne ressemblent pas à votre trafic. Le guide de prompt d'Anthropic suggère d'utiliser xhigh ou max uniquement lorsque vos évaluations montrent un gain, et d'exécuter les mêmes évaluations sur Sonnet 5.5 pour comparer. Dans Apidog :

  1. Stockez ANTHROPIC_API_KEY comme variable d'environnement et enregistrez 20 à 50 prompts réels sous forme de requêtes Messages.
  2. Ajoutez des assertions : statut 200, un stop_reason autre que `"max_tokens"` ou `"refusal"`, et le contenu qu'une réponse correcte nécessite.
  3. Exécutez l'ensemble en low, medium et high. Changer l'effort invalide le cache des prompts.
  4. Enregistrez le taux de réussite et le nombre de tokens dans usage. Le nouveau tokenizer produit environ 30 % de tokens en plus que celui de Haiku 4.5 pour le même texte.
  5. Dupliquez la collection, échangez avec claude-sonnet-5-5, et comparez les deux modèles dans un seul projet.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
  }'

N'envoyez pas temperature, top_p, top_k ou un pré-remplissage d'assistant ; chacun renvoie une erreur 400 sur Haiku 5.5. Sélectionnez les blocs de réponse par type, car un bloc thinking peut apparaître en premier. Consultez le guide de l'API et le test des applications LLM.

FAQ

Claude Haiku 5.5 est-il meilleur que Sonnet 5.5 ? Pas selon les chiffres d'Anthropic. Sonnet 5.5 mène chaque ligne du tableau de lancement ; Haiku ne le dépasse que sur FrontierCode lorsque les deux fonctionnent au maximum (46,4 % contre 46,2 %). Voir Haiku 5.5 vs Haiku 4.5 pour la vue de la mise à niveau.

Quel est le score SWE-bench de Haiku 5.5 ? 64,8 sur SWE-Bench Pro, 83,7 sur SWE-bench Multilingual et 30,7 sur SWE-bench Multimodal, tous à effort maximal.

À quel niveau d'effort les benchmarks ont-ils été exécutés ? Au maximum, généralement moyenné sur cinq essais. Le réglage par défaut de l'API est medium, où GDPval-AA obtient 1277 au lieu de 1620.

Existe-t-il des benchmarks indépendants pour Haiku 5.5 ? Pas encore. Artificial Analysis a exécuté GDPval-AA et AA-Briefcase indépendamment, mais Anthropic a publié ces scores ; AA n'a pas de page pour Haiku 5.5.

GPT-6 Luna est-il moins cher ? Généralement. Luna coûte moins cher à chaque niveau d'effort de GDPval-AA et à chaque niveau d'OSWorld, sauf au niveau medium, où les deux coûtent à peu près le même prix. Haiku 5.5 obtient de meilleurs scores sur les deux.

Étape suivante

Commencez par medium et n'augmentez l'effort que là où le gain de votre taux de réussite est rentable. Téléchargez Apidog, construisez la collection d'évaluation ci-dessus, et conservez les résultats dans Apidog à côté de votre référence Sonnet 5.5 avant de basculer le trafic de production.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API