Claude Haiku 5.5 obtiene un 72.4% en OSWorld 2.1, 1620 en GDPval-AA v2.1, 46.4% en FrontierCode 1.1 y 39.2% en Terminal-Bench 4.0. Haiku 4.5 obtuvo 15.7%, 735 y 0.0% en tres de esos. Todos son números de esfuerzo máximo; con el esfuerzo predeterminado medium, GDPval-AA cae a 1277. Ningún laboratorio independiente ha publicado resultados de Haiku 5.5 todavía.
A continuación: cada benchmark de Claude Haiku 5.5, quién lo ejecutó, cómo el esfuerzo afecta la puntuación y el costo, y cómo probar el modelo en tu propio tráfico en Apidog. Para especificaciones y precios, comienza con qué es Claude Haiku 5.5.
La tabla de lanzamiento
Cada celda de Haiku 5.5 utiliza pensamiento adaptativo con el máximo esfuerzo, generalmente promediado en cinco pruebas (Terminal-Bench utilizó diez por tarea). "n/r" significa que no se publicó ningún resultado.
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, subconjunto offline | 72.4% | 15.7% | 48.9% | 83.9% |
| Humanity’s Last Exam, sin herramientas | 45.9% | 10.2% | n/r | 56.9% |
| Humanity’s Last Exam, con herramientas | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (Principal) | 46.4% | n/r | 42.4% | 52.1% (xhigh) |
| Chartography, sin herramientas | 46.4% | 6.4% | 29.1% | 61.6% |
Quién ejecutó cada benchmark
Anthropic ejecutó la mayoría de las pruebas por sí misma. Las filas de diferentes proveedores comparten un nombre de benchmark, no siempre un arnés o una configuración de esfuerzo.
| Benchmark | Quién lo ejecutó | Condiciones |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, independientemente | GDPval-AA: 220 tareas, 44 ocupaciones, Elo anclado a DeepSeek V4.1 Flash (máximo) en 1600; Briefcase: proyectos de varias semanas |
| FrontierCode 1.1 | Cognition | Claude en Claude Code, GPT en Codex; Principal = las 100 tareas más difíciles de 150 |
| Chartography | Anthropic, en el benchmark de Surge AI | Evaluador Gemini 3.5 Flash; puntuación de Luna de Surge AI |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 tareas, 10 pruebas cada una, salvaguardas activas |
| OSWorld 2.1 | Anthropic | 82 de 108 tareas, 1080p, hasta 500 pasos |
| Humanity’s Last Exam | Anthropic | Presupuesto de tarea de 980K tokens, evaluador Opus 4.6 |
Dos celdas de GPT-6 Luna necesitan contexto. Anthropic ejecutó la puntuación de OSWorld de Luna a través de la API de OpenAI en las mismas 82 tareas. El 16.4% de Terminal-Bench de Luna proviene de la tabla de clasificación pública (Codex CLI, esfuerzo máximo). En Terminal-Bench, las salvaguardas detuvieron el 1.8% de las pruebas de Haiku 5.5 (12 de 660), y cada una se contó como un fallo.
La trampa de FrontierCode
La tabla de lanzamiento sitúa a Haiku 5.5 en su máximo (46.4%) junto a Sonnet 5.5 en xhigh (52.1%), la mejor puntuación de Sonnet. La tarjeta del sistema proporciona los números comparables:
| FrontierCode 1.1 | Principal | Extendido |
|---|---|---|
| Haiku 5.5, máx. | 46.4% | 58.4% |
| Haiku 5.5, xhigh | 45.8% | n/r |
| Sonnet 5.5, máx. | 46.2% | 59.1% |
| Sonnet 5.5, xhigh | 52.1% | 64.4% |
Con el máximo esfuerzo, Haiku 5.5 supera ligeramente a Sonnet 5.5 en Principal, 46.4% a 46.2%. En la mejor configuración de cada modelo, Sonnet lidera por 5.7 puntos. Indica a qué nivel de esfuerzo te refieres cuando cites cualquiera de los dos.
Extras de la tarjeta del sistema
La tarjeta del sistema añade filas que la publicación de lanzamiento omitió. Todas son de esfuerzo máximo a menos que se indique lo contrario.
| Benchmark | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-bench Multilingual | 83.7 | 67.4 | 90.3 |
| SWE-bench Multimodal | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1, tasa de aprobación estricta | 37.1% | n/r | 48.8% |
| Chartography, con herramientas | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench Professional (ajustado por longitud) | 64.8% | 32.2% | 69.2% |
El 72.4% de OSWorld es crédito parcial; solo el 37.1% de las tareas pasan directamente. Chartography casi se duplica con herramientas (46.4% a 86.2%), así que proporciona herramientas a Haiku 5.5 para el trabajo con gráficos.
El esfuerzo predeterminado puntúa más bajo
Haiku 5.5 se configura por defecto en medium en la API de Claude y en Claude Code. La tarjeta del sistema informa estos resultados de esfuerzo predeterminado:
| Benchmark | Medio (predeterminado) | Máximo | Nota |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | Medio usó aproximadamente una décima parte de los tokens de salida del máximo |
| AA-Briefcase v1.1 | 1372 | 1578 | Medio usó menos de un cuarto de los tokens de salida del máximo |
| HealthBench Professional | 59.9% | 64.8% | Bajo 57.9%, alto 61.3% |
Llama a la API sin output_config.effort y espera la columna izquierda. Los documentos de esfuerzo cubren los cinco niveles.
Puntuación y costo por esfuerzo
De los gráficos de lanzamiento, como puntuación (costo). El costo de OSWorld y Terminal-Bench es por intento; GDPval-AA es por tarea.
| Modelo | Bajo | Medio | Alto | Xalto | Máximo |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42.0% ($0.07) | 53.3% ($0.13) | 61.3% ($0.18) | 67.6% ($0.28) | 72.4% ($0.61) |
| Sonnet 5.5 | 57.9% ($0.68) | 66.0% ($0.93) | 73.2% ($1.38) | 81.1% ($2.22) | 83.9% ($5.73) |
| GPT-6 Luna | 19.2% ($0.04) | 37.5% ($0.13) | 42.3% ($0.14) | 44.8% ($0.17) | 48.9% ($0.21) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12.7% ($0.42) | 20.3% ($0.68) | 24.8% ($1.04) | 31.5% ($1.75) | 39.2% ($2.64) |
| Sonnet 5.5 | 20.0% ($0.62) | 28.8% ($0.68) | 43.0% ($1.46) | 61.5% ($4.34) | 70.6% ($10.44) |
- El máximo es costoso por su último paso. En GDPval-AA, el máximo cuesta aproximadamente 28 veces más que el medio por 343 puntos Elo adicionales. En OSWorld, el máximo cuesta más del doble que xhigh por 4.8 puntos.
- Haiku 5.5 en medio supera a Luna en máximo en OSWorld: 53.3% por $0.13 frente a 48.9% por $0.21. Luna es más barata en todos los demás niveles coincidentes; sin embargo, en medio, los dos cuestan aproximadamente lo mismo. Ver Haiku 5.5 vs GPT-6 Luna.
- Haiku 5.5 en máximo supera a Sonnet 5.5 en medio en OSWorld (72.4% por $0.61 frente a 66.0% por $0.93).
- Terminal-Bench es la excepción. Sonnet 5.5 en alto (43.0%, $1.46) supera a Haiku 5.5 en máximo (39.2%, $2.64) por menos dinero. Los costos de Sonnet utilizan el nuevo precio de lectura de caché de $0.10.
Los costos utilizan precios de lista: $0.10/$0.50 por millón de tokens para prompts de hasta 100K tokens, más altos por encima de eso (ver el desglose de precios).
Dónde Haiku 5.5 aún se queda atrás
Sonnet 5.5 lidera cada fila de la tabla de lanzamiento. La única victoria directa de Haiku es en FrontierCode con esfuerzo máximo igualado. La brecha más amplia se encuentra en Terminal-Bench 4.0: 39.2% versus 70.6%. SWE-Bench Pro (64.8 versus 81.3) y SWE-bench Multimodal (30.7 versus 54.3) muestran el mismo patrón.
Anthropic está de acuerdo: Sonnet 5.5 y Opus 5.5 "siguen siendo mejores opciones para tareas de codificación agéntica complejas". Haiku 5.5 se adapta a trabajos de alcance limitado: compactación, resumen, clasificación, uso del navegador y subagentes bajo un modelo más grande. Su ejecución como subagente económico se cubre en Haiku 5.5 en Claude Code.
Resultados independientes: ninguno todavía
Hasta el 8 de octubre de 2026, ningún laboratorio independiente ha publicado resultados de Haiku 5.5. La página de Haiku 5.5 de Artificial Analysis devuelve un error 404, y su tabla de clasificación solo enumera a Claude 4.5 Haiku. Vals, LMArena, SWE-bench y Aider tampoco mostraron nada. No hay cifras de velocidad de terceros; Anthropic denomina a Haiku 5.5 su "modelo más rápido hasta la fecha" a velocidad estándar, más lento que Opus en modo rápido.
El número externo más cercano proviene de Cursor. Sus documentos del modelo indican que Haiku 5.5 "obtiene un 48.4% en CursorBench con el máximo esfuerzo", frente al 30.9% con esfuerzo bajo. Con el pensamiento desactivado, Cursor informa del 22.1% al 26.2% en los mismos niveles de esfuerzo donde el pensamiento activado obtuvo del 30.9% al 42.3%.
Lo que informan los clientes
Estos datos provienen de la publicación de lanzamiento de Anthropic y no fueron verificados de forma independiente:
- HubSpot: 92.8% promediado en tres ejecuciones en su suite de portal CRM simulada, la mejor puntuación que ha visto en esa suite.
- AlphaSense: 0.84 frente a 0.76 de Haiku 4.5 en 400 consultas de "Preguntar en Documento", lo que considera estadísticamente significativo.
- Box: 11 puntos más alto que Haiku 4.5 con aproximadamente la mitad de latencia, en pruebas iniciales.
- Asana: más de un 30% menos de latencia para la finalización de tareas en comparación con su modelo actual.
- Cognition: Devin Fusion mantiene una puntuación FrontierCode de 66.2 con Haiku 5.5 como compañero y Opus 5.5 como líder. Eso es un sistema de dos modelos, no Haiku solo.
Ejecuta tu propia evaluación
Los benchmarks no se parecen a tu tráfico. La guía de prompting de Anthropic sugiere usar xhigh o max solo donde tus evaluaciones muestren una ganancia, y ejecutar las mismas evaluaciones en Sonnet 5.5 para comparar. En Apidog:
- Almacena
ANTHROPIC_API_KEYcomo variable de entorno y guarda de 20 a 50 prompts reales como solicitudes de Mensajes. - Añade aserciones: estado 200, una
stop_reasondiferente de"max_tokens"o"refusal", y el contenido que una respuesta correcta necesita. - Ejecuta el conjunto en
low,mediumyhigh. Cambiar el esfuerzo invalida la caché de prompts. - Registra la tasa de aprobación y el recuento de tokens en
usage. El nuevo tokenizador produce aproximadamente un 30% más de tokens que el de Haiku 4.5 para el mismo texto. - Duplica la colección, sustituye por
claude-sonnet-5-5y compara ambos modelos en un solo proyecto.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Clasifica este ticket de soporte como facturación, error o solicitud de función: ..."}]
}'
No envíes temperature, top_p, top_k o un prefill de asistente; cada uno devuelve un 400 en Haiku 5.5. Selecciona los bloques de respuesta por type, ya que un bloque thinking puede aparecer primero. Consulta la guía de la API y la prueba de aplicaciones LLM.
Preguntas frecuentes
¿Es Claude Haiku 5.5 mejor que Sonnet 5.5? No según los números de Anthropic. Sonnet 5.5 lidera cada fila de la tabla de lanzamiento; Haiku solo lo supera ligeramente en FrontierCode cuando ambos se ejecutan al máximo (46.4% vs 46.2%). Consulta Haiku 5.5 vs Haiku 4.5 para la vista de actualización.
¿Cuál es la puntuación de Haiku 5.5 en SWE-bench? 64.8 en SWE-Bench Pro, 83.7 en SWE-bench Multilingual y 30.7 en SWE-bench Multimodal, todo con el máximo esfuerzo.
¿Con qué esfuerzo se ejecutaron los benchmarks? Máximo, generalmente promediado en cinco pruebas. El valor predeterminado de la API es medio, donde GDPval-AA puntúa 1277 en lugar de 1620.
¿Existen benchmarks independientes de Haiku 5.5? Todavía no. Artificial Analysis ejecutó GDPval-AA y AA-Briefcase de forma independiente, pero Anthropic publicó esas puntuaciones; AA no tiene una página de Haiku 5.5.
¿Es GPT-6 Luna más barato? Generalmente sí. Luna cuesta menos en cada nivel de esfuerzo de GDPval-AA y en cada nivel de OSWorld, excepto en el medio, donde los dos cuestan aproximadamente lo mismo. Haiku 5.5 puntúa más alto en ambos.
Siguiente paso
Comienza en medium y aumenta el esfuerzo solo cuando la ganancia en tu tasa de aprobación lo justifique. Descarga Apidog, crea la colección de evaluación anterior y mantén los resultados en Apidog junto a tu línea base de Sonnet 5.5 antes de cambiar el tráfico de producción.
