Claude Opus 5 Benchmarks: Qué revelan los números

Todas las afirmaciones de benchmark de Claude Opus 5 en una tabla atribuida: Frontier-Bench, ARC-AGI 3, OSWorld 2.0, CursorBench 3.2, AutomationBench. Todos ejecutados por el proveedor, ninguno reproducido.

Ashley Innocent

Ashley Innocent

25 July 2026

Claude Opus 5 Benchmarks: Qué revelan los números

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Anthropic lanzó Claude Opus 5 el 24 de julio de 2026 con un conjunto de afirmaciones de rendimiento que parecían un éxito rotundo. Más del doble de Opus 4.8 en una evaluación. Tres veces el siguiente mejor modelo en otra. Superó a Fable 5 a un tercio del coste en una tercera.

Eso no los hace incorrectos. Pero sí significa que debe leerlos de la misma manera que leería el gráfico de lanzamiento de cualquier proveedor: con cuidado, prestando atención a lo que se mide y a lo que se omite. Esta guía agrupa todas las afirmaciones de rendimiento publicadas de Opus 5 en una tabla atribuida, explica lo que cada número puede y no puede respaldar, nombra el techo que Anthropic pone por encima de su propio modelo y finaliza con un plan de evaluación que puede ejecutar usted mismo en Apidog.

botón

Para el modelo en sí (claude-opus-5, 1M de contexto, 128k de salida máxima, corte de conocimiento de mayo de 2026), comience con qué es Claude Opus 5. La fuente principal a continuación es la publicación de lanzamiento de Claude Opus 5 de Anthropic.

Todas las afirmaciones publicadas, en una tabla

Aquí está el conjunto completo de declaraciones de rendimiento que Anthropic hizo en el lanzamiento. La columna de comparación importa tanto como la columna de resultados, porque varias de ellas se expresan en relación con otro modelo en lugar de como una puntuación.

Benchmark Afirmación de Anthropic Expresado como Comparado con
Frontier-Bench v0.1 Supera a todos los demás modelos; más del doble de la puntuación de Opus 4.8, con un coste por tarea menor Proporción más afirmación de coste Opus 4.8 y el campo
ARC-AGI 3 Aproximadamente 3 veces la puntuación del siguiente mejor modelo Proporción Siguiente mejor modelo sin nombre
OSWorld 2.0 Supera a Fable 5 a un tercio del coste Ordinal más afirmación de coste Fable 5
CursorBench 3.2 Dentro del 0.5% del pico de Fable 5, a mitad de precio Brecha más afirmación de coste Fable 5
Zapier AutomationBench Tasa de aprobación aproximadamente 1.5 veces la del siguiente mejor modelo Proporción Siguiente mejor modelo sin nombre
Química orgánica +10.2 puntos sobre Opus 4.8 Diferencia absoluta Opus 4.8
Análisis de proteínas +7.7 puntos sobre Opus 4.8 Diferencia absoluta Opus 4.8
Explotación de ciberseguridad Por detrás de Mythos 5 Ordinal Mythos 5
Investigación biológica autónoma Por detrás de Mythos 5 Ordinal Mythos 5

Fuente de todo lo anterior: la publicación de lanzamiento de Anthropic y la documentación del modelo. Ningún tercero ha publicado una reproducción de ninguno de estos resultados al momento de escribir este artículo.

Dos cosas resaltan antes de leer cualquier número individual. Solo dos de las nueve filas dan un movimiento absoluto en puntos. Y Anthropic mismo proporciona las dos últimas filas, donde su nuevo buque insignia pierde.

El problema de la proporción y por qué importa

Cuatro de las afirmaciones (Frontier-Bench, ARC-AGI 3, AutomationBench y, en cierto modo, CursorBench) se expresan como proporciones o brechas en lugar de puntuaciones. Esa es una limitación real, no una objeción menor, y vale la pena ser específico sobre por qué.

Una proporción oculta el denominador. "Aproximadamente 3 veces el siguiente mejor modelo" en ARC-AGI 3 significa algo diferente dependiendo de dónde se encuentre el campo. Si el siguiente mejor modelo puntúa un 8%, entonces 3 veces es un 24%: un movimiento real en un benchmark que nadie está cerca de resolver. Si el siguiente mejor modelo puntúa un 25%, entonces 3 veces es un 75%, un resultado categóricamente diferente. Ambos son describibles honestamente como "3 veces". No se puede saber cuál ocurrió, y Anthropic no lo dijo.

Duplicar es más fácil en la parte inferior de una escala. "Más del doble de la puntuación de Opus 4.8" en Frontier-Bench v0.1 es el mismo tipo de problema. En un benchmark difícil y nuevo donde el anterior buque insignia puntuaba en los dígitos simples o bajos, duplicar es un salto absoluto menor de lo que implica la frase. En un benchmark donde 4.8 ya puntuaba un 40%, duplicar sería extraordinario. La cadena de versión es una pista aquí: v0.1 es un benchmark sin historial publicado, sin reproducciones comunitarias y sin un punto de saturación establecido.

"Siguiente mejor modelo" no tiene nombre. Dos afirmaciones comparan Opus 5 con un competidor no especificado. Ese competidor podría ser Fable 5, Mythos 5 o un modelo de otro laboratorio. El conjunto de comparación determina cuánto significa la proporción, y no se divulga.

Las brechas necesitan unidades. "Dentro del 0.5% del pico de Fable 5" en CursorBench 3.2 no dice si se trata de 0.5 puntos porcentuales o una diferencia relativa del 0.5%, y "pico" sugiere una ejecución con la mejor configuración en lugar de una predeterminada. En un benchmark de codificación, la diferencia entre una configuración predeterminada de effort y una al máximo no es trivial. Nuestro desglose de los benchmarks de Fable 5 cubre cómo se enmarcaron los propios números de ese modelo.

Las dos cifras científicas son las afirmaciones más claras del conjunto precisamente porque evitan todo esto: +10.2 puntos en química orgánica y +7.7 puntos en análisis de proteínas son diferencias absolutas frente a una línea de base nombrada. Todavía no se obtiene la puntuación inicial, pero se sabe exactamente cuánto se movió el modelo.

Las afirmaciones de coste por tarea dependen de la configuración

Tres de las afirmaciones de Anthropic combinan capacidad con coste: menor coste por tarea en Frontier-Bench, un tercio del coste en OSWorld 2.0, la mitad del precio en CursorBench 3.2.

La mitad del precio de lista es verificable y se mantiene. Opus 5 cuesta $5 por millón de tokens de entrada y $25 por millón de salida, idéntico a Opus 4.8 y exactamente la mitad de los $10/$50 de Fable 5. Esto se publica en la página de precios de Anthropic y no es un resultado de benchmark en absoluto. La aritmética completa, incluyendo escrituras en caché, tasas por lotes y la prima del modo rápido, se encuentra en nuestro desglose de precios de Opus 5.

El coste por tarea es una cantidad diferente. Depende de cuántos tokens consumió la ejecución, lo que a su vez depende del nivel de esfuerzo, de si se habilitó el "pensamiento", de cuántos turnos tomó el bucle agéntico y de cuántos subagentes se generaron. La propia guía de prompts de Anthropic señala que Opus 5 produce respuestas predeterminadas más largas que Opus 4.8, delega más fácilmente a subagentes y expande el alcance de la tarea con más frecuencia. Los tres factores aumentan el consumo de tokens en cargas de trabajo reales, por lo que una ejecución ajustada para un gráfico de coste por tarea no es automáticamente la configuración que se enviaría.

Nada de esto hace que la historia del coste sea falsa. La mitad del precio de lista es la mitad del precio de lista, y nuestra comparación de Opus 5 vs Fable 5 analiza dónde realmente paga esa diferencia. Significa que la proporción de coste por tarea es un artefacto de una configuración específica, y la suya diferirá. Mídalo.

El techo que Anthropic se impone a sí mismo

La línea más útil en el material de lanzamiento es la que no es una victoria. Anthropic afirma claramente que Opus 5 aún está por detrás de Mythos 5 en explotación de ciberseguridad y en investigación biológica autónoma. Fable 5 también mantiene la designación de "modelo más capaz ampliamente lanzado".

Vale la pena reiterar esto porque la cobertura de prensa lo omitió en gran medida. Opus 5 no es la cima de la pila de Claude. El resumen honesto es capacidad de clase fronteriza a la mitad del precio fronterizo, con un techo nombrado por encima. Para la investigación de seguridad fronteriza o el trabajo científico autónomo, la respuesta de referencia sigue siendo la clase Mythos, cubierta en nuestro explicación del modelo de clase Mythos y en Fable 5 vs Mythos 5.

También hay una consecuencia operativa. Anthropic envió una opción `fallbacks: "default"` (detrás del encabezado beta `server-side-fallback-2026-07-01`) que automáticamente recurre a Opus 4.8 cuando Opus 5 rechaza una solicitud de categoría cibernética. Un modelo con rechazos cibernéticos más estrictos necesita una vía de escape, y la existencia de esa vía de escape le dice algo que el gráfico no.

Lo que los benchmarks no cubren en absoluto

Los benchmarks miden la finalización de tareas. No miden las cosas que deciden si un modelo funciona en su producto:

Qué probar realmente usted mismo

Los benchmarks del proveedor son una hipótesis inicial. Aquí tiene una evaluación compacta que puede ejecutar en una tarde y que le dirá más sobre Opus 5 para su carga de trabajo que todos los números anteriores combinados.

1. Construya un pequeño conjunto de tareas a partir de su propio historial. Veinte a cincuenta tareas reales: tickets cerrados, PR fusionados, hilos de soporte que su modelo habría manejado. Las entradas reales superan a las sintéticas porque llevan su formato real, ambigüedad y casos extremos.

2. Fije la configuración y anótela. ID del modelo exactamente claude-opus-5, más su nivel output_config.effort, si el pensamiento está activado y sus max_tokens. Una configuración no fijada hace que cualquier comparación posterior carezca de sentido.

3. Calcule el coste por tarea resuelta, no el coste por token. Lea el bloque usage en cada respuesta y registre los tokens de entrada, salida, lectura de caché y escritura de caché por tarea. Luego divida el gasto total por las tareas que realmente pasaron su verificación de aceptación. Este es el número que afirma el gráfico de Anthropic, por lo que es el número a reproducir.

4. Realice un barrido de esfuerzo real. Mismo conjunto de tareas en low, medium, high y xhigh. La recalibración significa que low y medium son significativamente más fuertes en Opus 5 que en modelos Opus anteriores, y muchas cargas de trabajo encontrarán que un nivel más económico pasa con la misma frecuencia. Observe max_tokens en el extremo superior.

5. Pruebe el bucle agéntico, no el turno único. La mayoría de los benchmarks de lanzamiento son agénticos (OSWorld, CursorBench, AutomationBench). Las verificaciones puntuales de un solo turno no los reproducirán. Ejecute multiturno con sus herramientas reales conectadas y cuente los turnos, no solo los resultados.

6. Compare con su modelo actual en el mismo conjunto de tareas. Sea lo que sea que ejecute hoy, Opus 4.8 o Sonnet 5 o cualquier otra cosa, ejecútelo a través del arnés idéntico. Un resultado relativo en sus propios datos vale más que una puntuación absoluta en los de otra persona.

7. Registre los rechazos por separado. El trabajo relacionado con la ciberseguridad encontrará rechazos con más frecuencia que en 4.8. Cuéntelos antes de decidir si vale la pena conectar el encabezado de retroceso.

Para la metodología de comparación en un lanzamiento anterior, nuestro artículo sobre los benchmarks de Sonnet 5 describe el mismo ejercicio, y la guía de la API de Opus 5 tiene las formas de solicitud.

Ejecutando la evaluación en Apidog

La evaluación anterior es un montón de solicitudes HTTP con encabezados de autenticación, cuerpos JSON, respuestas de transmisión y un bloque usage que necesita leer en cada llamada. Ese es un trabajo de API ordinario, que es lo que maneja Apidog.

Una configuración viable:

  1. Cree una solicitud contra el endpoint de mensajes de Anthropic y guarde su clave de API como una variable de entorno en lugar de pegarla en el cuerpo.
  2. Duplique esa solicitud una vez por cada nivel de esfuerzo para que pueda enviar el mismo prompt en low, medium, high y xhigh y comparar las respuestas una al lado de la otra.
  3. Active la transmisión e inspeccione los eventos SSE directamente cuando necesite ver cómo se acumulan los tokens de pensamiento antes de que comience la respuesta visible.
  4. Inspeccione las cargas útiles de las llamadas a herramientas en la respuesta para confirmar que el modelo realmente está emitiendo llamadas a herramientas estructuradas en lugar de describirlas en prosa, que es el artefacto de pensamiento deshabilitado que vale la pena observar.
  5. Agregue una aserción en los campos usage para que los aciertos de caché y los totales de tokens se capturen en cada ejecución en lugar de estimarse a ojo.
  6. Guarde todo como una colección para que el próximo lanzamiento del modelo sea un intercambio de ID de modelo, no una reconstrucción.

Aquí está la solicitud base:

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 8192,
    "output_config": {"effort": "medium"},
    "messages": [
      {"role": "user", "content": "Fix the failing test in this diff."}
    ]
  }'

Cambie un campo por ejecución, mantenga todo lo demás fijo y registre el bloque usage cada vez. Descargue Apidog si desea seguir ese patrón con los entornos y las aserciones ya configurados.

El resumen honesto

La historia de los benchmarks de Opus 5 es genuinamente sólida: el mayor salto sobre su predecesor que Anthropic ha afirmado para un lanzamiento de Opus, con un precio de lista sin cambios. También es completamente ejecutado por el proveedor, no reproducido al 25 de julio de 2026, y declarado en gran medida en proporciones que ocultan sus denominadores. Ambas cosas son ciertas a la vez.

Trate la tabla al principio de esta página como la hipótesis de Anthropic sobre su propio modelo. Luego, obtenga sus propios números. La brecha entre un gráfico de lanzamiento y una carga de trabajo de producción es donde realmente se decide cada migración de modelo, y la guía fundamental de Opus 5 cubre el resto de lo que cambió.

botón

Preguntas Frecuentes (FAQ)

¿Los benchmarks de Claude Opus 5 están verificados de forma independiente? No. A partir del 25 de julio de 2026, todos los resultados de benchmark publicados de Opus 5 provienen de Anthropic. Ningún laboratorio de terceros o evaluador independiente ha publicado una reproducción. Léalos como cifras reportadas por el proveedor.

¿Cuál es la afirmación de benchmark más grande de Opus 5? Frontier-Bench v0.1, donde Anthropic dice que Opus 5 más que duplica la puntuación de Opus 4.8 con un coste por tarea menor. Anthropic no publicó las puntuaciones subyacentes, solo la proporción, y Frontier-Bench v0.1 es un benchmark nuevo sin un historial establecido.

¿Es Claude Opus 5 el modelo Claude más capaz? No. Fable 5 mantiene la designación de "el modelo más capaz ampliamente lanzado", y Anthropic afirma que Opus 5 aún está por detrás de Mythos 5 en explotación de ciberseguridad e investigación biológica autónoma. La propuesta de Opus 5 es capacidad de clase fronteriza a la mitad del precio de Fable 5, no la cima de la pila.

¿Cuánto mejor es Opus 5 que Opus 4.8 en tareas científicas? Anthropic informa +10.2 puntos en química orgánica y +7.7 puntos en análisis de proteínas sobre Opus 4.8. Estas son las dos afirmaciones expresadas como diferencias absolutas en lugar de proporciones, lo que las hace las más fáciles de interpretar, aunque las puntuaciones base no se publicaron.

¿Opus 5 supera a Fable 5? Según los números de Anthropic, supera a Fable 5 en OSWorld 2.0 a un tercio del coste y se sitúa dentro del 0.5% del pico de Fable 5 en CursorBench 3.2 a la mitad de precio. Fable 5 aún ostenta la designación de capacidad general. Consulte la comparación completa.

¿Qué debo comparar yo mismo? El coste por tarea resuelta en veinte a cincuenta tareas reales de su propia lista de pendientes, ejecutadas en múltiples niveles de esfuerzo, con sus herramientas reales conectadas y bucles multiturno habilitados. Compare con lo que ejecute hoy en el mismo arnés.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs