Benchmarks de Claude Sonnet 5.5: Cifras de Anthropic, resultados independientes y qué significan

Puntos de referencia de Claude Sonnet 5.5: 70.6% Terminal-Bench 4.0, 81.3 SWE-Bench Pro, índice AA 56. Quién ejecutó cada prueba, los costos de esfuerzo, cómo ejecutar tu propia evaluación.

Medy Evrard

29 September 2026

Benchmarks de Claude Sonnet 5.5: Cifras de Anthropic, resultados independientes y qué significan

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Claude Sonnet 5.5 obtiene una puntuación del 70.6% en Terminal-Bench 4.0, 55.5% en CursorBench 4.0, 46.2% en FrontierCode 1.1 con el máximo esfuerzo (52.1% en xhigh) y 81.3 en SWE-Bench Pro, superando los 10.3%, 34.1%, 42.4% y 63.2 de Sonnet 5. Opus 5.5 lidera la mayoría de las filas de la tabla de lanzamiento por aproximadamente 2 a 3 puntos, pero se queda atrás en Terminal-Bench. Artificial Analysis puntúa de forma independiente a Sonnet 5.5 con 56 en su Índice de Inteligencia, el número 3 de 216.

A continuación: los benchmarks completos de Claude Sonnet 5.5, quiénes los ejecutaron, qué cambios de esfuerzo hubo y cómo probar el modelo en su propio tráfico en Apidog. Para las especificaciones, vea qué es Claude Sonnet 5.5.

La tabla de lanzamiento

La publicación de lanzamiento de Anthropic compara cuatro modelos ("n/r" marca un guion). Las celdas de Sonnet 5.5 son de esfuerzo máximo a menos que se indique lo contrario; la API predetermina a alto, Claude Code y las aplicaciones a medio.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ n/r
FrontierCode 1.1 (Principal) 46.2% Max² / 52.1% Xhigh 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% n/r
GDPval-AA v2.1³ 1844 1449 1846 1487⁴
AA-Briefcase v1.1³ 1811 1359 1822 1483⁴
Último Examen de la Humanidad (con herramientas) 64.5% 54.9% 67.7% n/r
OSWorld 2.1 (parcial) 80.1% 57.0% 81.8% n/r
Cartografía (sin herramientas) 61.6% 15.6% 64.4% 53.6%⁴

Las notas al pie, en términos sencillos:

  1. La puntuación de Terminal-Bench de Opus 5.5 es en xhigh, su mejor; en max obtuvo 64.8%.
  2. FrontierCode penaliza las ediciones fuera de alcance. En max, Sonnet 5.5 ejecutó con mayor frecuencia la habilidad de revisión de código de Claude Code, extendiéndose a muchos subagentes; en dos casos examinados por Cognition, esto causó un tiempo de espera agotado o ediciones fuera de alcance.
  3. Artificial Analysis ejecutó ambas pruebas de trabajo de conocimiento en una implementación previa al lanzamiento con un error de salida estructurada, ya corregido. Anthropic espera un pequeño efecto, si acaso subestimando a Sonnet 5.5.
  4. OpenAI recientemente corrigió un error de comprensión de imágenes de GPT-6 Sol que las puntuaciones de AA y Surge AI pueden no reflejar.

Quién ejecutó cada benchmark

Anthropic ejecutó cada prueba directamente a menos que se nombre a un tercero. Las filas de diferentes proveedores comparten el nombre del benchmark, no un arnés o configuración de esfuerzo.

Ejecutor Benchmark Condiciones
Anthropic Terminal-Bench 4.0, HLE, OSWorld 2.1 TB: Claude Code --bare, 5 pruebas, salvaguardias activadas. HLE: búsqueda y ejecución de código. OSWorld: 108 tareas
Cognition FrontierCode 1.1 Claude en Claude Code, GPT en Codex CLI
Cursor CursorBench 4.0 Arnés de producción de Cursor; Anthropic estimó el coste al precio de lista
Artificial Analysis GDPval-AA, AA-Briefcase Despliegue pre-lanzamiento
Anthropic Chartography Benchmark de Surge AI, calificado con Gemini 3.5 Flash; la puntuación de Sol de Surge

El fallback afectó al 1.5% de las pruebas de Terminal-Bench de Sonnet 5.5, pero al 10% de las de Opus 5.5 (tarjeta del sistema §8.5), así que interprete la ventaja de 4.2 puntos de Sonnet con cautela.

Extras de la tarjeta del sistema

Las filas de la uno a la seis son el resumen de esfuerzo máximo de la tarjeta del sistema.

Benchmark Sonnet 5.5 Sonnet 5 Opus 5.5
SWE-Bench Pro 81.3 63.2 89.9
SWE-Bench Multilingual 90.3 78.3 93.9
SWE-Bench Multimodal 54.3 28.1 61.4
HLE, sin herramientas 56.9 43.1 64.4
HealthBench Professional 69.2 57.8 65.6
AutomationBench (ejecución de Zapier) 44.7 10.7 42.5
DeepSWE v1.1 71.0% n/r n/r
Terminal-Bench-Science 0.1 59.9% n/r 58.7%
FrontierSWE v2 (ejecución de Proximal) 61.9% n/r 62.3%
ArXivMath (sin herramientas / con herramientas) 86.8% / 95.2% n/r 91.2% / 96.9%
ProgramBench (contexto largo) 79.7% 77.3% 91.2%
OSWorld 2.1, aprobación estricta 43.5% 25.6% 48.7%
Toolathlon-Verified (Aprobación@1) 77.8% 74.7% 77.8%
OfficeQA / OfficeQA Pro 76.9% / 65.6% 75.1% / 62.1% 78.9% / 67.7%

Sonnet 5.5 supera a Opus 5.5 en HealthBench Professional, AutomationBench y Terminal-Bench-Science; Opus lidera con mayor amplitud en ProgramBench, SWE-Bench Pro y HLE sin herramientas. El 80.1% de OSWorld es crédito parcial; solo el 43.5% de las tareas se aprueban por completo.

El esfuerzo cambia el panorama

Los gráficos de lanzamiento, como puntuación (coste). El coste de Terminal-Bench es por intento, los demás por tarea. Dos gráficos muestran GPT-5.6 Sol (*) porque los números de GPT-6 Sol no fueron publicados.

Modelo Bajo Medio Alto Muy alto Máximo
Terminal-Bench 4.0
Sonnet 5.5 20.0% ($0.76) 28.8% ($0.83) 43.0% ($1.94) 61.5% ($5.30) 70.6% ($12.54)
Opus 5.5 38.5% ($1.29) 57.6% ($2.94) 64.2% ($3.88) 66.4% ($7.35) 64.8% ($11.24)
Sonnet 5 3.2% ($3.78) 4.4% ($4.83) 4.5% ($8.20) 7.0% ($9.95) 10.3% ($11.62)
GPT-5.6 Sol* 7.9% ($1.46) 20.9% ($2.69) 26.1% ($4.12) 28.5% ($5.39) 37.3% ($7.89)
FrontierCode 1.1 Principal
Sonnet 5.5 29.3% ($0.19) 36.5% ($0.24) 49.4% ($0.42) 52.1% ($1.59) 46.2% ($20.78)
Opus 5.5 47.3% ($0.40) 54.6% ($0.80) 54.0% ($1.09) 51.4% ($2.25) 54.4% ($6.19)
Sonnet 5 28.7% ($2.39) 35.2% ($3.81) 39.4% ($6.10) 42.7% ($10.07) 42.4% ($17.12)
GPT-6 Sol 37.3% ($0.43) 45.9% ($0.77) 47.7% ($1.04) 48.4% ($1.32) 49.3% ($2.07)
CursorBench 4.0
Sonnet 5.5 35.8% ($0.50) 39.2% ($0.70) 47.8% ($1.67) 53.1% ($3.88) 55.5% ($9.67)
Opus 5.5 43.7% ($1.17) 52.5% ($2.91) 56.0% ($3.97) 56.0% ($6.98) 57.8% ($13.43)
Sonnet 5 24.1% ($1.39) 28.0% ($2.31) 30.8% ($3.48) 32.0% ($4.55) 34.1% ($7.17)
GPT-5.6 Sol* 24.6% ($0.87) 31.1% ($1.77) 35.7% ($2.85) 37.7% ($4.40) 41.7% ($8.23)
AA-Briefcase v1.1 (Elo)
Sonnet 5.5 1264 ($0.87) 1461 ($1.64) 1634 ($3.95) 1746 ($9.63) 1811 ($29.19)
Opus 5.5 1285 ($1.15) 1642 ($4.40) 1705 ($6.27) 1780 ($12.27) 1822 ($21.05)
Sonnet 5 923 ($0.82) 1056 ($1.73) 1177 ($3.76) 1274 ($7.56) 1359 ($14.43)
GPT-6 Sol 905 ($0.12) 1142 ($0.34) 1289 ($0.63) 1364 ($1.19) 1483 ($2.67)

Resultados independientes

Artificial Analysis puntúa a Sonnet 5.5 con 56 en su Índice de Inteligencia v4.3.2, el número 3 de 216, solo por detrás de Opus 5.5 en máximo y muy alto. Sonnet 5 obtuvo 38. Coste para ejecutar el índice:

Esfuerzo Puntuación del índice Coste de ejecución
máximo 55.98 $8,977
muy alto 51.85 $2,738
alto 46.74 $1,176
medio 40.74 $701
bajo 35.84 $544

Máximo cuesta 7.6 veces más que alto por 9.2 puntos adicionales. La interpretación de OfficeChai de AA sitúa a Sonnet 5.5 fuera de la frontera de Pareto, siendo más competitivo en costes en alto, y cuenta aproximadamente 193,000 tokens de salida por tarea de índice en máximo.

Benchmarks de seguridad

Inyección de prompt, según la tarjeta del sistema:

Las evaluaciones cibernéticas se ejecutaron sin salvaguardias: 46.1% en CyScenarioBench (Sonnet 5: 0.7%, Opus 5.5: 67.6%). Es el primer Sonnet con salvaguardias cibernéticas, y Anthropic advierte de más rechazos incluso en tareas de seguridad benignas. Vea nuestra guía de inyección de prompt.

Ejecute su propia evaluación

Los benchmarks no se parecen a su tráfico, y la guía de prompting de Anthropic dice que el esfuerzo se recalibra, así que no reutilice las configuraciones de Sonnet 5. En Apidog:

  1. Almacene ANTHROPIC_API_KEY como una variable de entorno y guarde de 20 a 50 prompts reales como solicitudes de Mensajes.
  2. Afirme el estado 200, una stop_reason diferente de "max_tokens" o "refusal", y que el contenido necesite una respuesta correcta.
  3. Ejecútelo en bajo, medio, alto y muy alto, una pasada cada uno; cambiar el esfuerzo invalida la caché de prompts.
  4. Registre la tasa de aprobación y los recuentos de tokens en usage, con un precio de $2 de entrada y $10 de salida por millón.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 16000,
    "output_config": {"effort": "high"},
    "messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
  }'

Despliegue el esfuerzo más bajo cuya tasa de aprobación acepte. Vea pruebas de aplicaciones LLM y pruebas de APIs de agentes de IA, luego descargue Apidog para construir la colección.

Preguntas frecuentes

¿Sonnet 5.5 supera a Opus 5.5? En Terminal-Bench 4.0, HealthBench Professional, AutomationBench y Terminal-Bench-Science y Cartografía con herramientas, sí. Opus 5.5 lidera o empata en el resto.

¿Cuál es la puntuación de SWE-Bench de Sonnet 5.5? 81.3 en SWE-Bench Pro y 90.3 en Multilingual, con el máximo esfuerzo.

¿Por qué hay dos números de FrontierCode? 46.2% es máximo, 52.1% es muy alto; la ramificación de subagentes de máximo incurrió en penalizaciones por fuera de alcance.

¿Debería actualizar de Sonnet 5? Sí, según los benchmarks, pero primero lea los cambios de API que rompen la compatibilidad en Sonnet 5.5 vs Sonnet 5.

Siguiente paso

Comience en alto (o medio para codificación agéntica bien especificada), como sugiere Anthropic, y deje que su evaluación en Apidog decida si un aumento de esfuerzo vale la pena.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs