Claude Fable 5.1 Benchmarks: Qué Dicen Realmente los Números

Cada benchmark de Claude Fable 5.1 con atribución: Terminal-Bench-Science 52.6%, Terminal-Bench 4.0 55.8%, CursorBench 73.4%, frente a Fable 5, Opus 5 y GPT-5.6 Sol.

INEZA Felin-Michel

INEZA Felin-Michel

2 September 2026

Claude Fable 5.1 Benchmarks: Qué Dicen Realmente los Números

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Anthropic lanzó Claude Fable 5.1 el 1 de septiembre de 2026, con una tabla comparativa que lo compara con Fable 5, Opus 5 y GPT-5.6 Sol en nueve pruebas. El titular que todos los medios publicaron fue Terminal-Bench-Science, donde Fable 5.1 obtuvo un 52.6% frente al 24.7% de Fable 5. El número que menos medios publicaron fue CursorBench, donde la diferencia con Opus 5 es de 3.4 puntos en un modelo que cuesta el doble.

Esta guía reúne todos los números publicados en un solo lugar con atribución, explica lo que mide cada benchmark, separa las grandes diferencias de las pequeñas y luego cubre la parte que la cobertura de lanzamiento omitió: todos estos son resultados ejecutados por el proveedor, Mythos 5.1 supera a Fable 5.1 en la única prueba de codificación agentiva donde ambos fueron publicados, y la respuesta correcta a una tabla de lanzamiento es ejecutar tus propias evaluaciones. La fuente principal es la publicación de lanzamiento de Anthropic; el contexto del modelo está en qué es Claude Fable 5.1.

La tabla completa

Benchmark Lo que mide Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 Investigación científica agentiva en una terminal 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 Codificación agentiva en una terminal 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 Trabajo de conocimiento de valor económico (Elo) 1853 1723 1824 1711
OSWorld 2.0 (crédito parcial) Uso de la computadora en tareas de escritorio reales 77.9% 72.9% 75.4% no reportado
OSWorld 2.0 (estricto) Lo mismo, solo finalización completa de la tarea 41.7% 36.1% 39.6% no reportado
Examen Final de la Humanidad (sin herramientas) Preguntas de razonamiento a nivel experto 60.9% 57.8% 56.6% no reportado
Examen Final de la Humanidad (con herramientas) Lo mismo, con búsqueda y código 65.0% 63.8% 63.6% no reportado
AutomationBench Flujos de trabajo empresariales de extremo a extremo 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 Tareas de codificación estilo IDE 73.4% 70.5% 70.0% 67.2%

Anthropic también publicó un número de Mythos 5.1: 60.9% en Terminal-Bench 4.0. VentureBeat también informó un resultado del 82% en Browserbase para Fable 5.1 frente al 74% de Opus 5 y el 57% de Fable 5 en las tareas de agente de navegador más difíciles; esa cifra proviene de la cobertura de prensa en lugar de la publicación de lanzamiento, así que considérela en consecuencia.

Las grandes diferencias

Terminal-Bench-Science 0.1: 52.6% vs 24.7% (Fable 5) y 29.0% (Opus 5). Este es el resultado. Fable 5.1 duplica con creces a su predecesor y casi duplica a Opus 5 en un benchmark que coloca al modelo en una terminal con herramientas científicas y le pide que realice investigaciones de varios pasos. Es la evidencia más clara de que el enfoque declarado de Anthropic en la "resolución de problemas a largo plazo" produjo algo medible. También es un benchmark de la versión 0.1, lo que significa que el conjunto de tareas es joven y es probable que las puntuaciones cambien a medida que madure.

AutomationBench: 31.4% vs 17.1% (Fable 5) y 26.9% (Opus 5). Un benchmark de flujos de trabajo empresariales de extremo a extremo a través de aplicaciones, donde los números absolutos son bajos para todos. Fable 5.1 casi duplica a Fable 5 aquí y aventaja a Opus 5 en 4.5 puntos. Si tu producto automatiza tareas comerciales de múltiples aplicaciones, esta es la fila que te interesa.

Terminal-Bench 4.0: 55.8% vs 42.0% (Fable 5). Un salto de 13.8 puntos sobre Fable 5 en codificación agentiva, que es el número con el que Anthropic lideró la sección de codificación en su publicación de lanzamiento. Frente a Opus 5, la ventaja es de 3.5 puntos. Opus 5 ya había superado a Fable 5 en este benchmark en julio, por lo que la ventaja de la familia Fable sobre la familia Opus en codificación agentiva ha vuelto, pero es más estrecha de lo que era en junio. El desglose de benchmarks de Opus 5 tiene los números de julio.

GDPval-AA v2: 1853 vs 1723 (Fable 5). Una ganancia de 130 Elo sobre Fable 5 en tareas de trabajo de conocimiento, y el benchmark al que Anthropic se refiere para sus afirmaciones sobre documentos, hojas de cálculo y presentaciones. Frente a Opus 5, la brecha es de 29 Elo, que es pequeña.

Las pequeñas diferencias

CursorBench 3.2.0: 73.4% vs 70.5% (Fable 5) y 70.0% (Opus 5). Tareas de codificación estilo IDE. Tres puntos por encima de cualquiera de los modelos. Este es el benchmark que más importa a la mayor población de desarrolladores, y es donde la ventaja de Fable 5.1 es más delgada. Si tu carga de trabajo es "ayúdame en mi editor", la tabla de lanzamiento no justifica un precio 2 veces mayor por sí sola.

OSWorld 2.0: 77.9% / 41.7% vs 75.4% / 39.6% (Opus 5). Uso de la computadora. Dos puntos por encima de Opus 5 en ambas puntuaciones, cinco por encima de Fable 5. Real, no dramático. Tenga en cuenta la puntuación estricta: menos de la mitad de las tareas se completaron totalmente en cualquier modelo. El uso de la computadora sigue siendo el área más débil de la frontera.

Examen Final de la Humanidad: 60.9% / 65.0% vs 56.6% / 63.6% (Opus 5). Sin herramientas, una ventaja de 4.3 puntos sobre Opus 5, que es la mayor de las pequeñas diferencias. Con herramientas, se reduce a 1.4 puntos, porque la búsqueda y la ejecución de código igualan el campo. El número sin herramientas es la mejor medida del razonamiento puro; el número con herramientas se acerca más a cómo se usa el modelo.

Fable 5.1 vs GPT-5.6 Sol

Anthropic publicó cuatro filas con una columna para GPT-5.6 Sol, y Fable 5.1 lidera las cuatro: Terminal-Bench-Science por 30.2 puntos, Terminal-Bench 4.0 por 18.5, AutomationBench por 11.8 y CursorBench por 6.2. GDPval-AA muestra 1853 frente a 1711. Dos advertencias. Estas son ejecuciones de Anthropic de un modelo competidor, y las cinco filas sin una columna para GPT-5.6 Sol faltan por una razón que Anthropic no declaró. Nuestra comparación de GPT-5.6 Sol vs Fable 5 cubrió el enfrentamiento anterior; según estos números, Fable 5.1 amplía cada brecha que Fable 5 tenía.

Lo que la cobertura de lanzamiento omitió

Todos los números son ejecutados por el proveedor. Anthropic los ejecutó todos, incluida la columna del competidor, y ningún laboratorio independiente había reproducido ninguno de ellos en el momento del lanzamiento. El historial de benchmarks de Anthropic generalmente se ha mantenido, pero las diferencias en CursorBench y OSWorld son lo suficientemente pequeñas como para que un arnés o una elección de puntuación diferente puedan invertirlos.

Mythos 5.1 es el verdadero techo. La tarjeta del sistema y la publicación de lanzamiento de Anthropic dicen que Fable 5.1 y Mythos 5.1 son "el mismo modelo pero con diferentes niveles de salvaguardas", y publicó Mythos 5.1 con un 60.9% en Terminal-Bench 4.0 frente al 55.8% de Fable 5.1. Esa diferencia de cinco puntos es el costo de las salvaguardas en la codificación agentiva, y significa que "el modelo más capaz ampliamente lanzado de Anthropic" tiene un hermano mejor conocido por encima de él. La comparación de Mythos 5.1 vs Fable 5.1 cubre quién puede acceder a él.

No se especificó el esfuerzo. La documentación de esfuerzo de Anthropic dice que las ganancias de Fable 5.1 son mayores en xhigh y max. La publicación de lanzamiento no dice qué nivel de esfuerzo produjo cada puntuación, o a qué esfuerzo se ejecutaron los modelos de comparación. Dado que el esfuerzo es el principal factor de calidad en estos modelos, esa omisión es importante cuando se intenta reproducir un número.

El rendimiento multilingüe es plano. Anthropic afirma que el rendimiento multilingüe está a la par con Fable 5, no mejorado. Si su carga de trabajo no es en inglés, la tabla de lanzamiento exagera la ganancia.

Los números de salvaguarda son un tipo diferente de benchmark. Anthropic informa un 85% menos de falsos positivos en biología en solicitudes benignas y alrededor de un 60% menos de intervenciones cibernéticas por sesión de Claude Code en comparación con Fable 5. Estos se miden en el propio tráfico de Anthropic y no son reproducibles externamente, pero para un usuario de Fable 5 que encontró rechazos, pueden importar más que cualquier fila de capacidad.

Qué probar por tu cuenta

Una tabla de lanzamiento te dice dónde buscar. Tus evaluaciones te dicen si debes cambiarte. Cuatro pruebas que se corresponden con las filas anteriores:

  1. Una tarea de agente de largo plazo de tu propio producto, ejecutada hasta su finalización en Fable 5.1 en high, Opus 5 en xhigh y Fable 5 en high. Este es el análogo de Terminal-Bench-Science y AutomationBench, y es donde el precio 2x se justifica o no.
  2. Tus diez indicaciones de codificación más difíciles con el mismo esfuerzo en Fable 5.1 y Opus 5. Si los resultados empatan, habrás reproducido la historia de CursorBench y Opus 5 es la respuesta.
  3. Un barrido de esfuerzo en Fable 5.1 solo, de low a max, en una tarea rutinaria. La afirmación de Anthropic es que medium iguala a Fable 5 y low compite con Opus 5 en costo por tarea. Compruébalo.
  4. Un recuento de rechazos en tus indicaciones benignas de seguridad o ciencias de la vida, Fable 5 versus Fable 5.1. Esa es la afirmación del 60% y 85%, y es la que puedes verificar en una tarde.

Cree las cuatro como solicitudes en Apidog con model y effort como variables de entorno, agregue aserciones sobre stop_reason y sobre la presencia de una cadena esperada en la respuesta, y ejecute la colección por modelo. El historial de ejecuciones le brinda una tabla de evaluación reproducible sin ninguna infraestructura nueva. Descargue Apidog para configurarlo; el tutorial de la API tiene las formas de solicitud.

Cómo se mapean los benchmarks a la decisión

Preguntas frecuentes

¿Cuál es el mejor resultado de benchmark de Claude Fable 5.1? Terminal-Bench-Science 0.1 con 52.6%, más del doble del 24.7% de Fable 5 y por delante del 29.0% de Opus 5 y del 22.4% de GPT-5.6 Sol. Todas las cifras son de Anthropic.

¿Cómo se compara Fable 5.1 con Opus 5 en codificación? 55.8% vs 52.3% en Terminal-Bench 4.0 y 73.4% vs 70.0% en CursorBench 3.2.0, según los números de Anthropic. Ventajas reales pero estrechas de unos tres puntos.

¿Es Fable 5.1 mejor que GPT-5.6 Sol? En los cuatro benchmarks donde Anthropic publicó ambos, sí, por 6 a 30 puntos. Anthropic ejecutó los números de GPT-5.6 Sol por sí misma, y cinco de sus nueve filas no tienen una entrada para GPT-5.6 Sol.

¿Están verificados de forma independiente los benchmarks de Fable 5.1? No en el momento del lanzamiento. Cada número es ejecutado por Anthropic. Trátelos como afirmaciones a probar en su propia carga de trabajo.

¿Qué puntuación obtiene Mythos 5.1? Anthropic publicó un número: 60.9% en Terminal-Bench 4.0, cinco puntos por encima del 55.8% de Fable 5.1. Ambos son el mismo modelo con diferentes salvaguardas.

¿Qué nivel de esfuerzo produjo estas puntuaciones? Anthropic no lo dijo. Su guía es que las ganancias de Fable 5.1 son mayores en xhigh y max, así que asuma un alto esfuerzo y espere que configuraciones más bajas obtengan puntuaciones más bajas.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs