Claude Sonnet 5.5 obtiene una puntuación del 70.6% en Terminal-Bench 4.0, 55.5% en CursorBench 4.0, 46.2% en FrontierCode 1.1 con el máximo esfuerzo (52.1% en xhigh) y 81.3 en SWE-Bench Pro, superando los 10.3%, 34.1%, 42.4% y 63.2 de Sonnet 5. Opus 5.5 lidera la mayoría de las filas de la tabla de lanzamiento por aproximadamente 2 a 3 puntos, pero se queda atrás en Terminal-Bench. Artificial Analysis puntúa de forma independiente a Sonnet 5.5 con 56 en su Índice de Inteligencia, el número 3 de 216.
A continuación: los benchmarks completos de Claude Sonnet 5.5, quiénes los ejecutaron, qué cambios de esfuerzo hubo y cómo probar el modelo en su propio tráfico en Apidog. Para las especificaciones, vea qué es Claude Sonnet 5.5.
La tabla de lanzamiento
La publicación de lanzamiento de Anthropic compara cuatro modelos ("n/r" marca un guion). Las celdas de Sonnet 5.5 son de esfuerzo máximo a menos que se indique lo contrario; la API predetermina a alto, Claude Code y las aplicaciones a medio.
| Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | n/r |
| FrontierCode 1.1 (Principal) | 46.2% Max² / 52.1% Xhigh | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | n/r |
| GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487⁴ |
| AA-Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483⁴ |
| Último Examen de la Humanidad (con herramientas) | 64.5% | 54.9% | 67.7% | n/r |
| OSWorld 2.1 (parcial) | 80.1% | 57.0% | 81.8% | n/r |
| Cartografía (sin herramientas) | 61.6% | 15.6% | 64.4% | 53.6%⁴ |
Las notas al pie, en términos sencillos:
- La puntuación de Terminal-Bench de Opus 5.5 es en xhigh, su mejor; en max obtuvo 64.8%.
- FrontierCode penaliza las ediciones fuera de alcance. En max, Sonnet 5.5 ejecutó con mayor frecuencia la habilidad de revisión de código de Claude Code, extendiéndose a muchos subagentes; en dos casos examinados por Cognition, esto causó un tiempo de espera agotado o ediciones fuera de alcance.
- Artificial Analysis ejecutó ambas pruebas de trabajo de conocimiento en una implementación previa al lanzamiento con un error de salida estructurada, ya corregido. Anthropic espera un pequeño efecto, si acaso subestimando a Sonnet 5.5.
- OpenAI recientemente corrigió un error de comprensión de imágenes de GPT-6 Sol que las puntuaciones de AA y Surge AI pueden no reflejar.
Quién ejecutó cada benchmark
Anthropic ejecutó cada prueba directamente a menos que se nombre a un tercero. Las filas de diferentes proveedores comparten el nombre del benchmark, no un arnés o configuración de esfuerzo.
| Ejecutor | Benchmark | Condiciones |
|---|---|---|
| Anthropic | Terminal-Bench 4.0, HLE, OSWorld 2.1 | TB: Claude Code --bare, 5 pruebas, salvaguardias activadas. HLE: búsqueda y ejecución de código. OSWorld: 108 tareas |
| Cognition | FrontierCode 1.1 | Claude en Claude Code, GPT en Codex CLI |
| Cursor | CursorBench 4.0 | Arnés de producción de Cursor; Anthropic estimó el coste al precio de lista |
| Artificial Analysis | GDPval-AA, AA-Briefcase | Despliegue pre-lanzamiento |
| Anthropic | Chartography | Benchmark de Surge AI, calificado con Gemini 3.5 Flash; la puntuación de Sol de Surge |
El fallback afectó al 1.5% de las pruebas de Terminal-Bench de Sonnet 5.5, pero al 10% de las de Opus 5.5 (tarjeta del sistema §8.5), así que interprete la ventaja de 4.2 puntos de Sonnet con cautela.
Extras de la tarjeta del sistema
Las filas de la uno a la seis son el resumen de esfuerzo máximo de la tarjeta del sistema.
| Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 81.3 | 63.2 | 89.9 |
| SWE-Bench Multilingual | 90.3 | 78.3 | 93.9 |
| SWE-Bench Multimodal | 54.3 | 28.1 | 61.4 |
| HLE, sin herramientas | 56.9 | 43.1 | 64.4 |
| HealthBench Professional | 69.2 | 57.8 | 65.6 |
| AutomationBench (ejecución de Zapier) | 44.7 | 10.7 | 42.5 |
| DeepSWE v1.1 | 71.0% | n/r | n/r |
| Terminal-Bench-Science 0.1 | 59.9% | n/r | 58.7% |
| FrontierSWE v2 (ejecución de Proximal) | 61.9% | n/r | 62.3% |
| ArXivMath (sin herramientas / con herramientas) | 86.8% / 95.2% | n/r | 91.2% / 96.9% |
| ProgramBench (contexto largo) | 79.7% | 77.3% | 91.2% |
| OSWorld 2.1, aprobación estricta | 43.5% | 25.6% | 48.7% |
| Toolathlon-Verified (Aprobación@1) | 77.8% | 74.7% | 77.8% |
| OfficeQA / OfficeQA Pro | 76.9% / 65.6% | 75.1% / 62.1% | 78.9% / 67.7% |
Sonnet 5.5 supera a Opus 5.5 en HealthBench Professional, AutomationBench y Terminal-Bench-Science; Opus lidera con mayor amplitud en ProgramBench, SWE-Bench Pro y HLE sin herramientas. El 80.1% de OSWorld es crédito parcial; solo el 43.5% de las tareas se aprueban por completo.
El esfuerzo cambia el panorama
Los gráficos de lanzamiento, como puntuación (coste). El coste de Terminal-Bench es por intento, los demás por tarea. Dos gráficos muestran GPT-5.6 Sol (*) porque los números de GPT-6 Sol no fueron publicados.
| Modelo | Bajo | Medio | Alto | Muy alto | Máximo |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | |||||
| Sonnet 5.5 | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Opus 5.5 | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| Sonnet 5 | 3.2% ($3.78) | 4.4% ($4.83) | 4.5% ($8.20) | 7.0% ($9.95) | 10.3% ($11.62) |
| GPT-5.6 Sol* | 7.9% ($1.46) | 20.9% ($2.69) | 26.1% ($4.12) | 28.5% ($5.39) | 37.3% ($7.89) |
| FrontierCode 1.1 Principal | |||||
| Sonnet 5.5 | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| Opus 5.5 | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| Sonnet 5 | 28.7% ($2.39) | 35.2% ($3.81) | 39.4% ($6.10) | 42.7% ($10.07) | 42.4% ($17.12) |
| GPT-6 Sol | 37.3% ($0.43) | 45.9% ($0.77) | 47.7% ($1.04) | 48.4% ($1.32) | 49.3% ($2.07) |
| CursorBench 4.0 | |||||
| Sonnet 5.5 | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| Opus 5.5 | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| Sonnet 5 | 24.1% ($1.39) | 28.0% ($2.31) | 30.8% ($3.48) | 32.0% ($4.55) | 34.1% ($7.17) |
| GPT-5.6 Sol* | 24.6% ($0.87) | 31.1% ($1.77) | 35.7% ($2.85) | 37.7% ($4.40) | 41.7% ($8.23) |
| AA-Briefcase v1.1 (Elo) | |||||
| Sonnet 5.5 | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| Opus 5.5 | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
| Sonnet 5 | 923 ($0.82) | 1056 ($1.73) | 1177 ($3.76) | 1274 ($7.56) | 1359 ($14.43) |
| GPT-6 Sol | 905 ($0.12) | 1142 ($0.34) | 1289 ($0.63) | 1364 ($1.19) | 1483 ($2.67) |
- La mayoría de las ganancias se obtienen con muy alto. Máximo añade 9.1 puntos en Terminal-Bench por 2.4 veces el coste, 2.4 en CursorBench por 2.5 veces.
- FrontierCode en máximo obtiene puntuaciones más bajas y cuesta 13 veces más que en muy alto (46.2% a $20.78 vs 52.1% a $1.59).
- Opus 5.5 con menor esfuerzo es el verdadero rival. En Terminal-Bench, Opus en medio obtiene 57.6% por $2.94; Sonnet en alto obtiene 43.0% por $1.94. Opus en alto (64.2%, $3.88) supera a Sonnet en muy alto (61.5%, $5.30). Vea Sonnet 5.5 vs Opus 5.5.
- Alto es el punto óptimo de coste de Sonnet. FrontierCode en alto: 49.4% por $0.42, igualando lo mejor de GPT-6 Sol (49.3%) a aproximadamente una quinta parte del coste (desglose de precios).
Resultados independientes
Artificial Analysis puntúa a Sonnet 5.5 con 56 en su Índice de Inteligencia v4.3.2, el número 3 de 216, solo por detrás de Opus 5.5 en máximo y muy alto. Sonnet 5 obtuvo 38. Coste para ejecutar el índice:
| Esfuerzo | Puntuación del índice | Coste de ejecución |
|---|---|---|
| máximo | 55.98 | $8,977 |
| muy alto | 51.85 | $2,738 |
| alto | 46.74 | $1,176 |
| medio | 40.74 | $701 |
| bajo | 35.84 | $544 |
Máximo cuesta 7.6 veces más que alto por 9.2 puntos adicionales. La interpretación de OfficeChai de AA sitúa a Sonnet 5.5 fuera de la frontera de Pareto, siendo más competitivo en costes en alto, y cuenta aproximadamente 193,000 tokens de salida por tarea de índice en máximo.
- Ejecución de Terminal-Bench 4.0 de AA: 63.6%, frente al 70.6% de Anthropic.
- La baja puntuación de Sonnet 5 es real: AA midió 14.1% (ver benchmarks de Sonnet 5).
- AA-Omnisciencia (según OfficeChai): 54% de precisión y una tasa de alucinación del 47%, frente al 66% y 59% para Opus 5.5.
- Aún no medido: velocidad de salida y tiempo hasta el primer token, por lo que la afirmación de "30%+ más rápido" sigue siendo de Anthropic. Todavía no hay una lista en LMArena.
Benchmarks de seguridad
Inyección de prompt, según la tarjeta del sistema:
- Cisne Gris: éxito del ataque 0.4%, 2.7% y 3.4% en k=1, 10 y 15 (Sonnet 5: 0.7%, 5.1%, 6.7%). El uso de la computadora con GUI es el más débil con 12.5% (k=15).
- Sombra, codificación: 3.01% sin salvaguardias, principalmente a través del fallback cibernético de Sonnet 5; Sonnet 5.5 en sí mismo fue comprometido en 4 de 5,901 solicitudes.
- Uso del navegador: ningún ataque tuvo éxito en 110 escenarios.
Las evaluaciones cibernéticas se ejecutaron sin salvaguardias: 46.1% en CyScenarioBench (Sonnet 5: 0.7%, Opus 5.5: 67.6%). Es el primer Sonnet con salvaguardias cibernéticas, y Anthropic advierte de más rechazos incluso en tareas de seguridad benignas. Vea nuestra guía de inyección de prompt.
Ejecute su propia evaluación
Los benchmarks no se parecen a su tráfico, y la guía de prompting de Anthropic dice que el esfuerzo se recalibra, así que no reutilice las configuraciones de Sonnet 5. En Apidog:
- Almacene
ANTHROPIC_API_KEYcomo una variable de entorno y guarde de 20 a 50 prompts reales como solicitudes de Mensajes. - Afirme el estado 200, una
stop_reasondiferente de"max_tokens"o"refusal", y que el contenido necesite una respuesta correcta. - Ejecútelo en
bajo,medio,altoymuy alto, una pasada cada uno; cambiar el esfuerzo invalida la caché de prompts. - Registre la tasa de aprobación y los recuentos de tokens en
usage, con un precio de $2 de entrada y $10 de salida por millón.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 16000,
"output_config": {"effort": "high"},
"messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
}'
Despliegue el esfuerzo más bajo cuya tasa de aprobación acepte. Vea pruebas de aplicaciones LLM y pruebas de APIs de agentes de IA, luego descargue Apidog para construir la colección.
Preguntas frecuentes
¿Sonnet 5.5 supera a Opus 5.5? En Terminal-Bench 4.0, HealthBench Professional, AutomationBench y Terminal-Bench-Science y Cartografía con herramientas, sí. Opus 5.5 lidera o empata en el resto.
¿Cuál es la puntuación de SWE-Bench de Sonnet 5.5? 81.3 en SWE-Bench Pro y 90.3 en Multilingual, con el máximo esfuerzo.
¿Por qué hay dos números de FrontierCode? 46.2% es máximo, 52.1% es muy alto; la ramificación de subagentes de máximo incurrió en penalizaciones por fuera de alcance.
¿Debería actualizar de Sonnet 5? Sí, según los benchmarks, pero primero lea los cambios de API que rompen la compatibilidad en Sonnet 5.5 vs Sonnet 5.
Siguiente paso
Comience en alto (o medio para codificación agéntica bien especificada), como sugiere Anthropic, y deje que su evaluación en Apidog decida si un aumento de esfuerzo vale la pena.
