Claude Haiku 5.5 obtient 72,4 % sur OSWorld 2.1, 1620 sur GDPval-AA v2.1, 46,4 % sur FrontierCode 1.1 et 39,2 % sur Terminal-Bench 4.0. Haiku 4.5 a obtenu 15,7 %, 735 et 0,0 % sur trois de ces benchmarks. Tous sont des chiffres d'effort maximal ; avec l'effort medium par défaut, GDPval-AA chute à 1277. Aucun laboratoire indépendant n'a encore publié les résultats de Haiku 5.5.
Ci-dessous : tous les benchmarks de Claude Haiku 5.5, qui les a exécutés, comment l'effort affecte le score et le coût, et comment tester le modèle sur votre propre trafic dans Apidog. Pour les spécifications et les tarifs, commencez par qu'est-ce que Claude Haiku 5.5.
Le tableau de lancement
Chaque cellule de Haiku 5.5 utilise une réflexion adaptative à effort maximal, généralement moyennée sur cinq essais (Terminal-Bench en a utilisé dix par tâche). « n/r » signifie qu'aucun résultat n'a été publié.
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, offline subset | 72.4% | 15.7% | 48.9% | 83.9% |
| Humanity’s Last Exam, no tools | 45.9% | 10.2% | n/r | 56.9% |
| Humanity’s Last Exam, with tools | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (Main) | 46.4% | n/r | 42.4% | 52.1% (xhigh) |
| Chartography, no tools | 46.4% | 6.4% | 29.1% | 61.6% |
Qui a exécuté chaque benchmark
Anthropic a exécuté la plupart des tests lui-même. Les lignes inter-fournisseurs partagent un nom de benchmark, mais pas toujours un harnais ou un réglage d'effort.
| Benchmark | Qui l'a exécuté | Conditions |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, indépendamment | GDPval-AA : 220 tâches, 44 occupations, Elo ancré à DeepSeek V4.1 Flash (max) à 1600 ; Briefcase : projets de plusieurs semaines |
| FrontierCode 1.1 | Cognition | Claude dans Claude Code, GPT dans Codex ; Main = les 100 plus difficiles des 150 tâches |
| Chartography | Anthropic, sur le benchmark de Surge AI | Évaluateur Gemini 3.5 Flash ; score Luna de Surge AI |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 tâches, 10 essais chacun, protections activées |
| OSWorld 2.1 | Anthropic | 82 des 108 tâches, 1080p, jusqu'à 500 étapes |
| Humanity’s Last Exam | Anthropic | Budget de tâche de 980K tokens, évaluateur Opus 4.6 |
Deux cellules de GPT-6 Luna nécessitent un contexte. Anthropic a exécuté le score OSWorld de Luna via l'API d'OpenAI sur les mêmes 82 tâches. Le 16,4 % de Terminal-Bench de Luna provient du classement public (Codex CLI, effort maximal). Sur Terminal-Bench, les mesures de protection ont arrêté 1,8 % des essais de Haiku 5.5 (12 sur 660), et chacun a été compté comme un échec.
Le piège FrontierCode
Le tableau de lancement place Haiku 5.5 à son maximum (46,4 %) à côté de Sonnet 5.5 à xhigh (52,1 %), le meilleur score de Sonnet. La fiche système donne les chiffres comparables :
| FrontierCode 1.1 | Main | Extended |
|---|---|---|
| Haiku 5.5, max | 46.4% | 58.4% |
| Haiku 5.5, xhigh | 45.8% | n/r |
| Sonnet 5.5, max | 46.2% | 59.1% |
| Sonnet 5.5, xhigh | 52.1% | 64.4% |
À effort maximal, Haiku 5.5 devance Sonnet 5.5 sur Main, 46,4 % contre 46,2 %. Au meilleur réglage de chaque modèle, Sonnet mène de 5,7 points. Précisez l'effort que vous utilisez lorsque vous citez l'un ou l'autre.
Suppléments de la fiche système
La fiche système ajoute des lignes que la publication de lancement a omises. Toutes sont à effort maximal sauf indication contraire.
| Benchmark | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-bench Multilingual | 83.7 | 67.4 | 90.3 |
| SWE-bench Multimodal | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1, strict pass rate | 37.1% | n/r | 48.8% |
| Chartography, with tools | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench Professional (length-adjusted) | 64.8% | 32.2% | 69.2% |
Les 72,4 % d'OSWorld représentent un crédit partiel ; seulement 37,1 % des tâches sont réussies complètement. Chartography double presque avec les outils (46,4 % à 86,2 %), il faut donc donner des outils à Haiku 5.5 pour le travail graphique.
L'effort par défaut donne des scores inférieurs
Haiku 5.5 utilise par défaut medium sur l'API Claude et dans Claude Code. La fiche système rapporte ces résultats d'effort par défaut :
| Benchmark | Medium (par défaut) | Max | Note |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | Le niveau medium a utilisé environ un dixième des tokens de sortie du niveau max |
| AA-Briefcase v1.1 | 1372 | 1578 | Le niveau medium a utilisé moins d'un quart des tokens de sortie du niveau max |
| HealthBench Professional | 59.9% | 64.8% | Faible 57.9%, élevé 61.3% |
Appelez l'API sans output_config.effort et attendez-vous à la colonne de gauche. La documentation sur l'effort couvre les cinq niveaux.
Score et coût par effort
D'après les graphiques de lancement, sous forme de score (coût). Le coût d'OSWorld et Terminal-Bench est par tentative ; celui de GDPval-AA est par tâche.
| Modèle | Faible | Medium | Élevé | Xhigh | Max |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42.0% (0,07 $) | 53.3% (0,13 $) | 61.3% (0,18 $) | 67.6% (0,28 $) | 72.4% (0,61 $) |
| Sonnet 5.5 | 57.9% (0,68 $) | 66.0% (0,93 $) | 73.2% (1,38 $) | 81.1% (2,22 $) | 83.9% (5,73 $) |
| GPT-6 Luna | 19.2% (0,04 $) | 37.5% (0,13 $) | 42.3% (0,14 $) | 44.8% (0,17 $) | 48.9% (0,21 $) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 (0,012 $) | 1277 (0,030 $) | 1420 (0,089 $) | 1513 (0,27 $) | 1620 (0,87 $) |
| Sonnet 5.5 | 1179 (0,22 $) | 1324 (0,27 $) | 1551 (0,62 $) | 1731 (1,88 $) | 1840 (6,78 $) |
| GPT-6 Luna | 1036 (0,004 $) | 1262 (0,02 $) | 1344 (0,03 $) | 1364 (0,05 $) | 1437 (0,09 $) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12.7% (0,42 $) | 20.3% (0,68 $) | 24.8% (1,04 $) | 31.5% (1,75 $) | 39.2% (2,64 $) |
| Sonnet 5.5 | 20.0% (0,62 $) | 28.8% (0,68 $) | 43.0% (1,46 $) | 61.5% (4,34 $) | 70.6% (10,44 $) |
- Le niveau « max » est coûteux pour sa dernière étape. Sur GDPval-AA, le niveau max coûte environ 28 fois le niveau medium pour 343 points Elo supplémentaires. Sur OSWorld, le niveau max coûte plus de deux fois le niveau xhigh pour 4,8 points.
- Haiku 5.5 au niveau medium bat Luna au niveau max sur OSWorld : 53,3 % pour 0,13 $ contre 48,9 % pour 0,21 $. Luna est cependant moins cher à tous les autres niveaux correspondants ; au niveau medium, les deux coûtent à peu près le même prix. Voir Haiku 5.5 vs GPT-6 Luna.
- Haiku 5.5 au niveau max bat Sonnet 5.5 au niveau medium sur OSWorld (72,4 % pour 0,61 $ contre 66,0 % pour 0,93 $).
- Terminal-Bench est l'exception. Sonnet 5.5 au niveau high (43,0 %, 1,46 $) bat Haiku 5.5 au niveau max (39,2 %, 2,64 $) pour moins cher. Les coûts de Sonnet utilisent le nouveau prix de 0,10 $ pour la lecture du cache.
Les coûts utilisent les prix catalogue : 0,10 $/0,50 $ par million de tokens pour les prompts jusqu'à 100K tokens, plus élevé au-delà (voir le détail des prix).
Là où Haiku 5.5 est encore en retrait
Sonnet 5.5 est en tête de chaque ligne du tableau de lancement. La seule victoire en tête-à-tête de Haiku est sur FrontierCode à effort maximal égal. L'écart le plus important est Terminal-Bench 4.0 : 39,2 % contre 70,6 %. SWE-Bench Pro (64,8 contre 81,3) et SWE-bench Multimodal (30,7 contre 54,3) montrent le même schéma.
Anthropic est d'accord : Sonnet 5.5 et Opus 5.5 « restent de meilleurs choix pour les tâches de codage agentique complexes ». Haiku 5.5 convient aux travaux à portée étroite : compaction, résumé, classification, utilisation de navigateur et sous-agents sous un modèle plus grand. L'utiliser comme sous-agent bon marché est couvert dans Haiku 5.5 dans Claude Code.
Résultats indépendants : aucun pour l'instant
Au 8 octobre 2026, aucun laboratoire indépendant n'a publié de résultats pour Haiku 5.5. La page Haiku 5.5 d'Artificial Analysis renvoie une erreur 404, et son classement ne liste que Claude 4.5 Haiku. Vals, LMArena, SWE-bench et Aider n'ont rien montré non plus. Il n'y a pas de chiffre de vitesse tiers ; Anthropic qualifie Haiku 5.5 de « modèle le plus rapide à ce jour » à vitesse standard, plus lent qu'Opus en mode rapide.
Le chiffre extérieur le plus proche provient de Cursor. Sa documentation du modèle indique que Haiku 5.5 « obtient 48,4 % sur CursorBench à effort maximal », contre 30,9 % à effort faible. Avec la réflexion désactivée, Cursor rapporte de 22,1 % à 26,2 % aux mêmes niveaux d'effort où la réflexion activée a obtenu de 30,9 % à 42,3 %.
Ce que les clients rapportent
Ces informations proviennent de la publication de lancement d'Anthropic et n'ont pas été vérifiées indépendamment :
- HubSpot : 92,8 % en moyenne sur trois exécutions de sa suite de portail CRM simulée, le meilleur score qu'il ait jamais vu sur cette suite.
- AlphaSense : 0,84 contre 0,76 pour Haiku 4.5 sur 400 requêtes « Ask in Document », ce qu'il qualifie de statistiquement significatif.
- Box : 11 points de plus que Haiku 4.5 avec environ la moitié de la latence, lors des premiers tests.
- Asana : plus de 30 % de latence en moins pour l'achèvement des tâches par rapport à son modèle actuel.
- Cognition : Devin Fusion détient un score FrontierCode de 66,2 avec Haiku 5.5 comme acolyte et Opus 5.5 comme leader. Il s'agit d'un système à deux modèles, pas de Haiku seul.
Exécutez votre propre évaluation
Les benchmarks ne ressemblent pas à votre trafic. Le guide de prompt d'Anthropic suggère d'utiliser xhigh ou max uniquement lorsque vos évaluations montrent un gain, et d'exécuter les mêmes évaluations sur Sonnet 5.5 pour comparer. Dans Apidog :
- Stockez
ANTHROPIC_API_KEYcomme variable d'environnement et enregistrez 20 à 50 prompts réels sous forme de requêtes Messages. - Ajoutez des assertions : statut 200, un
stop_reasonautre que `"max_tokens"` ou `"refusal"`, et le contenu qu'une réponse correcte nécessite. - Exécutez l'ensemble en
low,mediumethigh. Changer l'effort invalide le cache des prompts. - Enregistrez le taux de réussite et le nombre de tokens dans
usage. Le nouveau tokenizer produit environ 30 % de tokens en plus que celui de Haiku 4.5 pour le même texte. - Dupliquez la collection, échangez avec
claude-sonnet-5-5, et comparez les deux modèles dans un seul projet.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
}'
N'envoyez pas temperature, top_p, top_k ou un pré-remplissage d'assistant ; chacun renvoie une erreur 400 sur Haiku 5.5. Sélectionnez les blocs de réponse par type, car un bloc thinking peut apparaître en premier. Consultez le guide de l'API et le test des applications LLM.
FAQ
Claude Haiku 5.5 est-il meilleur que Sonnet 5.5 ? Pas selon les chiffres d'Anthropic. Sonnet 5.5 mène chaque ligne du tableau de lancement ; Haiku ne le dépasse que sur FrontierCode lorsque les deux fonctionnent au maximum (46,4 % contre 46,2 %). Voir Haiku 5.5 vs Haiku 4.5 pour la vue de la mise à niveau.
Quel est le score SWE-bench de Haiku 5.5 ? 64,8 sur SWE-Bench Pro, 83,7 sur SWE-bench Multilingual et 30,7 sur SWE-bench Multimodal, tous à effort maximal.
À quel niveau d'effort les benchmarks ont-ils été exécutés ? Au maximum, généralement moyenné sur cinq essais. Le réglage par défaut de l'API est medium, où GDPval-AA obtient 1277 au lieu de 1620.
Existe-t-il des benchmarks indépendants pour Haiku 5.5 ? Pas encore. Artificial Analysis a exécuté GDPval-AA et AA-Briefcase indépendamment, mais Anthropic a publié ces scores ; AA n'a pas de page pour Haiku 5.5.
GPT-6 Luna est-il moins cher ? Généralement. Luna coûte moins cher à chaque niveau d'effort de GDPval-AA et à chaque niveau d'OSWorld, sauf au niveau medium, où les deux coûtent à peu près le même prix. Haiku 5.5 obtient de meilleurs scores sur les deux.
Étape suivante
Commencez par medium et n'augmentez l'effort que là où le gain de votre taux de réussite est rentable. Téléchargez Apidog, construisez la collection d'évaluation ci-dessus, et conservez les résultats dans Apidog à côté de votre référence Sonnet 5.5 avant de basculer le trafic de production.
