Evaluaciones comparativas de Claude Haiku 5.5

Resultados de referencia de Claude Haiku 5.5: 72.4% en OSWorld, 1620 GDPval-AA, 39.2% en Terminal-Bench con el máximo esfuerzo. Quién realizó cada prueba, costos por esfuerzo y tu propia evaluación.

Ashley Goolam

Ashley Goolam

8 October 2026

Evaluaciones comparativas de Claude Haiku 5.5

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Claude Haiku 5.5 obtiene un 72.4% en OSWorld 2.1, 1620 en GDPval-AA v2.1, 46.4% en FrontierCode 1.1 y 39.2% en Terminal-Bench 4.0. Haiku 4.5 obtuvo 15.7%, 735 y 0.0% en tres de esos. Todos son números de esfuerzo máximo; con el esfuerzo predeterminado medium, GDPval-AA cae a 1277. Ningún laboratorio independiente ha publicado resultados de Haiku 5.5 todavía.

A continuación: cada benchmark de Claude Haiku 5.5, quién lo ejecutó, cómo el esfuerzo afecta la puntuación y el costo, y cómo probar el modelo en tu propio tráfico en Apidog. Para especificaciones y precios, comienza con qué es Claude Haiku 5.5.

botón

La tabla de lanzamiento

Cada celda de Haiku 5.5 utiliza pensamiento adaptativo con el máximo esfuerzo, generalmente promediado en cinco pruebas (Terminal-Bench utilizó diez por tarea). "n/r" significa que no se publicó ningún resultado.

Benchmark Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, subconjunto offline 72.4% 15.7% 48.9% 83.9%
Humanity’s Last Exam, sin herramientas 45.9% 10.2% n/r 56.9%
Humanity’s Last Exam, con herramientas 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 (Principal) 46.4% n/r 42.4% 52.1% (xhigh)
Chartography, sin herramientas 46.4% 6.4% 29.1% 61.6%

Quién ejecutó cada benchmark

Anthropic ejecutó la mayoría de las pruebas por sí misma. Las filas de diferentes proveedores comparten un nombre de benchmark, no siempre un arnés o una configuración de esfuerzo.

Benchmark Quién lo ejecutó Condiciones
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, independientemente GDPval-AA: 220 tareas, 44 ocupaciones, Elo anclado a DeepSeek V4.1 Flash (máximo) en 1600; Briefcase: proyectos de varias semanas
FrontierCode 1.1 Cognition Claude en Claude Code, GPT en Codex; Principal = las 100 tareas más difíciles de 150
Chartography Anthropic, en el benchmark de Surge AI Evaluador Gemini 3.5 Flash; puntuación de Luna de Surge AI
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 tareas, 10 pruebas cada una, salvaguardas activas
OSWorld 2.1 Anthropic 82 de 108 tareas, 1080p, hasta 500 pasos
Humanity’s Last Exam Anthropic Presupuesto de tarea de 980K tokens, evaluador Opus 4.6

Dos celdas de GPT-6 Luna necesitan contexto. Anthropic ejecutó la puntuación de OSWorld de Luna a través de la API de OpenAI en las mismas 82 tareas. El 16.4% de Terminal-Bench de Luna proviene de la tabla de clasificación pública (Codex CLI, esfuerzo máximo). En Terminal-Bench, las salvaguardas detuvieron el 1.8% de las pruebas de Haiku 5.5 (12 de 660), y cada una se contó como un fallo.

La trampa de FrontierCode

La tabla de lanzamiento sitúa a Haiku 5.5 en su máximo (46.4%) junto a Sonnet 5.5 en xhigh (52.1%), la mejor puntuación de Sonnet. La tarjeta del sistema proporciona los números comparables:

FrontierCode 1.1 Principal Extendido
Haiku 5.5, máx. 46.4% 58.4%
Haiku 5.5, xhigh 45.8% n/r
Sonnet 5.5, máx. 46.2% 59.1%
Sonnet 5.5, xhigh 52.1% 64.4%

Con el máximo esfuerzo, Haiku 5.5 supera ligeramente a Sonnet 5.5 en Principal, 46.4% a 46.2%. En la mejor configuración de cada modelo, Sonnet lidera por 5.7 puntos. Indica a qué nivel de esfuerzo te refieres cuando cites cualquiera de los dos.

Extras de la tarjeta del sistema

La tarjeta del sistema añade filas que la publicación de lanzamiento omitió. Todas son de esfuerzo máximo a menos que se indique lo contrario.

Benchmark Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench Multilingual 83.7 67.4 90.3
SWE-bench Multimodal 30.7 19.8 54.3
OSWorld 2.1, tasa de aprobación estricta 37.1% n/r 48.8%
Chartography, con herramientas 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Professional (ajustado por longitud) 64.8% 32.2% 69.2%

El 72.4% de OSWorld es crédito parcial; solo el 37.1% de las tareas pasan directamente. Chartography casi se duplica con herramientas (46.4% a 86.2%), así que proporciona herramientas a Haiku 5.5 para el trabajo con gráficos.

El esfuerzo predeterminado puntúa más bajo

Haiku 5.5 se configura por defecto en medium en la API de Claude y en Claude Code. La tarjeta del sistema informa estos resultados de esfuerzo predeterminado:

Benchmark Medio (predeterminado) Máximo Nota
GDPval-AA v2.1 1277 1620 Medio usó aproximadamente una décima parte de los tokens de salida del máximo
AA-Briefcase v1.1 1372 1578 Medio usó menos de un cuarto de los tokens de salida del máximo
HealthBench Professional 59.9% 64.8% Bajo 57.9%, alto 61.3%

Llama a la API sin output_config.effort y espera la columna izquierda. Los documentos de esfuerzo cubren los cinco niveles.

Puntuación y costo por esfuerzo

De los gráficos de lanzamiento, como puntuación (costo). El costo de OSWorld y Terminal-Bench es por intento; GDPval-AA es por tarea.

Modelo Bajo Medio Alto Xalto Máximo
OSWorld 2.1
Haiku 5.5 42.0% ($0.07) 53.3% ($0.13) 61.3% ($0.18) 67.6% ($0.28) 72.4% ($0.61)
Sonnet 5.5 57.9% ($0.68) 66.0% ($0.93) 73.2% ($1.38) 81.1% ($2.22) 83.9% ($5.73)
GPT-6 Luna 19.2% ($0.04) 37.5% ($0.13) 42.3% ($0.14) 44.8% ($0.17) 48.9% ($0.21)
GDPval-AA v2.1
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Terminal-Bench 4.0
Haiku 5.5 12.7% ($0.42) 20.3% ($0.68) 24.8% ($1.04) 31.5% ($1.75) 39.2% ($2.64)
Sonnet 5.5 20.0% ($0.62) 28.8% ($0.68) 43.0% ($1.46) 61.5% ($4.34) 70.6% ($10.44)

Los costos utilizan precios de lista: $0.10/$0.50 por millón de tokens para prompts de hasta 100K tokens, más altos por encima de eso (ver el desglose de precios).

Dónde Haiku 5.5 aún se queda atrás

Sonnet 5.5 lidera cada fila de la tabla de lanzamiento. La única victoria directa de Haiku es en FrontierCode con esfuerzo máximo igualado. La brecha más amplia se encuentra en Terminal-Bench 4.0: 39.2% versus 70.6%. SWE-Bench Pro (64.8 versus 81.3) y SWE-bench Multimodal (30.7 versus 54.3) muestran el mismo patrón.

Anthropic está de acuerdo: Sonnet 5.5 y Opus 5.5 "siguen siendo mejores opciones para tareas de codificación agéntica complejas". Haiku 5.5 se adapta a trabajos de alcance limitado: compactación, resumen, clasificación, uso del navegador y subagentes bajo un modelo más grande. Su ejecución como subagente económico se cubre en Haiku 5.5 en Claude Code.

Resultados independientes: ninguno todavía

Hasta el 8 de octubre de 2026, ningún laboratorio independiente ha publicado resultados de Haiku 5.5. La página de Haiku 5.5 de Artificial Analysis devuelve un error 404, y su tabla de clasificación solo enumera a Claude 4.5 Haiku. Vals, LMArena, SWE-bench y Aider tampoco mostraron nada. No hay cifras de velocidad de terceros; Anthropic denomina a Haiku 5.5 su "modelo más rápido hasta la fecha" a velocidad estándar, más lento que Opus en modo rápido.

El número externo más cercano proviene de Cursor. Sus documentos del modelo indican que Haiku 5.5 "obtiene un 48.4% en CursorBench con el máximo esfuerzo", frente al 30.9% con esfuerzo bajo. Con el pensamiento desactivado, Cursor informa del 22.1% al 26.2% en los mismos niveles de esfuerzo donde el pensamiento activado obtuvo del 30.9% al 42.3%.

Lo que informan los clientes

Estos datos provienen de la publicación de lanzamiento de Anthropic y no fueron verificados de forma independiente:

Ejecuta tu propia evaluación

Los benchmarks no se parecen a tu tráfico. La guía de prompting de Anthropic sugiere usar xhigh o max solo donde tus evaluaciones muestren una ganancia, y ejecutar las mismas evaluaciones en Sonnet 5.5 para comparar. En Apidog:

  1. Almacena ANTHROPIC_API_KEY como variable de entorno y guarda de 20 a 50 prompts reales como solicitudes de Mensajes.
  2. Añade aserciones: estado 200, una stop_reason diferente de "max_tokens" o "refusal", y el contenido que una respuesta correcta necesita.
  3. Ejecuta el conjunto en low, medium y high. Cambiar el esfuerzo invalida la caché de prompts.
  4. Registra la tasa de aprobación y el recuento de tokens en usage. El nuevo tokenizador produce aproximadamente un 30% más de tokens que el de Haiku 4.5 para el mismo texto.
  5. Duplica la colección, sustituye por claude-sonnet-5-5 y compara ambos modelos en un solo proyecto.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Clasifica este ticket de soporte como facturación, error o solicitud de función: ..."}]
  }'

No envíes temperature, top_p, top_k o un prefill de asistente; cada uno devuelve un 400 en Haiku 5.5. Selecciona los bloques de respuesta por type, ya que un bloque thinking puede aparecer primero. Consulta la guía de la API y la prueba de aplicaciones LLM.

Preguntas frecuentes

¿Es Claude Haiku 5.5 mejor que Sonnet 5.5? No según los números de Anthropic. Sonnet 5.5 lidera cada fila de la tabla de lanzamiento; Haiku solo lo supera ligeramente en FrontierCode cuando ambos se ejecutan al máximo (46.4% vs 46.2%). Consulta Haiku 5.5 vs Haiku 4.5 para la vista de actualización.

¿Cuál es la puntuación de Haiku 5.5 en SWE-bench? 64.8 en SWE-Bench Pro, 83.7 en SWE-bench Multilingual y 30.7 en SWE-bench Multimodal, todo con el máximo esfuerzo.

¿Con qué esfuerzo se ejecutaron los benchmarks? Máximo, generalmente promediado en cinco pruebas. El valor predeterminado de la API es medio, donde GDPval-AA puntúa 1277 en lugar de 1620.

¿Existen benchmarks independientes de Haiku 5.5? Todavía no. Artificial Analysis ejecutó GDPval-AA y AA-Briefcase de forma independiente, pero Anthropic publicó esas puntuaciones; AA no tiene una página de Haiku 5.5.

¿Es GPT-6 Luna más barato? Generalmente sí. Luna cuesta menos en cada nivel de esfuerzo de GDPval-AA y en cada nivel de OSWorld, excepto en el medio, donde los dos cuestan aproximadamente lo mismo. Haiku 5.5 puntúa más alto en ambos.

Siguiente paso

Comienza en medium y aumenta el esfuerzo solo cuando la ganancia en tu tasa de aprobación lo justifique. Descarga Apidog, crea la colección de evaluación anterior y mantén los resultados en Apidog junto a tu línea base de Sonnet 5.5 antes de cambiar el tráfico de producción.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs