Claude Fable 5 Benchmarks: Qué Dicen los Números

Benchmarks de Claude Fable 5 explicados: supera a FrontierCode, CursorBench, FrontierBench y al Finance Benchmark de Hebbia, además del resultado de la migración de Stripe.

INEZA Felin-Michel

INEZA Felin-Michel

10 June 2026

Claude Fable 5 Benchmarks: Qué Dicen los Números

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Cuando Anthropic lanzó Claude Fable 5 el 9 de junio de 2026, calificó el modelo como de última generación en casi todos los puntos de referencia que probó. Si vino aquí buscando benchmarks limpios de Claude Fable 5 con números exactos junto a cada evaluación, hay una advertencia honesta de antemano: el anuncio de Anthropic reportó las posiciones de los benchmarks (dónde se clasifica Fable 5 frente a otros modelos frontera) más que marcadores numéricos completos en su texto, y varios de los gráficos principales llegaron como imágenes en lugar de tablas copiables. Así que este resumen se centra en lo que realmente significan las posiciones, dónde se sitúa Fable 5 y cómo puede ejecutar su propia evaluación rápida si desea números que usted controle. Para una comparación más amplia de la frontera actual, nuestro desglose de Opus 4.8 frente a GPT-5.5 y Gemini 3.5 es un compañero útil.

Fable 5 se lanza a $10 por millón de tokens de entrada y $50 por millón de tokens de salida, bajo la identificación de modelo claude-fable-5. Se sitúa un nivel por encima de Opus 4.8 tanto en capacidad como en precio, y Anthropic lo posiciona como el Claude más potente disponible públicamente para ingeniería de software, trabajo de conocimiento, visión e investigación científica.

TL;DR (En resumen)

Claude Fable 5 ocupa el primer lugar entre los modelos frontera en FrontierCode y FrontierBench (ambos de Cognition), es de última generación en CursorBench y obtiene la puntuación más alta en el Finance Benchmark de Hebbia. Muestra una clara fortaleza en el trabajo autónomo de largo plazo. Anthropic informó estos resultados como posiciones, por lo que las puntuaciones públicas exactas son limitadas. Trate las clasificaciones como direccionales, no como definitivas.

El resultado principal

La única frase que enmarca cada discusión sobre los benchmarks de Claude Fable 5: Anthropic describe el modelo como de última generación en casi todos los benchmarks que ejecutó, cubriendo ingeniería de software, trabajo de conocimiento, visión e investigación científica. Es una afirmación amplia, y las afirmaciones amplias merecen una lectura cuidadosa.

"De última generación en casi todos los benchmarks" significa que Fable 5 encabeza la clasificación o se sitúa en el nivel superior en la mayoría de las evaluaciones que Anthropic decidió reportar. No significa que Fable 5 gane cada prueba por un amplio margen, y no significa que laboratorios independientes hayan reproducido cada resultado. Lo que señala es consistencia: un modelo que es el mejor en su clase en codificación pero mediocre en el razonamiento de documentos no obtendría esa frase. Fable 5 parece mantener el primer puesto en categorías que suelen intercambiarse.

Esa amplitud importa más que cualquier gráfico individual. Muchos modelos despuntan en un benchmark favorito y flaquean en otros. Un modelo que se mantiene cerca de la cima en codificación, finanzas, visión y ciencia es más difícil de manipular, porque no se pueden afinar cuatro habilidades no relacionadas a la vez sin una capacidad genuina subyacente. Si está decidiendo si Fable 5 vale la pena el salto desde un nivel más económico, la amplitud de las posiciones es la parte a considerar. Para una introducción completa al modelo en sí, consulte qué es Claude Fable 5.

Un segundo tema atraviesa los resultados: el trabajo a largo plazo. Anthropic dice que Fable 5 "mantiene el enfoque a través de millones de tokens en tareas de larga duración" y trabaja de forma autónoma durante más tiempo que cualquier Claude anterior. Varias de las posiciones a continuación no son pruebas de precisión de un solo intento. Recompensan un modelo que puede mantener un plan coherente durante miles de pasos sin desviarse. Ahí es donde el liderazgo reportado de Fable 5 es más amplio, y también es la capacidad más difícil de capturar en un solo número.

Benchmarks de codificación: FrontierCode y CursorBench

La codificación es donde la historia de los benchmarks de Fable 5 es más sólida y concreta.

En FrontierCode, una evaluación de codificación de Cognition (el equipo detrás del agente de codificación Devin), Anthropic informa que Fable 5 es el modelo frontera con la puntuación más alta, y mantiene ese liderazgo incluso con un esfuerzo medio. El calificador "esfuerzo" merece una pausa. Muchos modelos frontera pueden ser impulsados a una mayor precisión gastando más computación de inferencia (más tokens de razonamiento, más intentos, configuraciones de mayor esfuerzo). Un modelo que ya lidera con un esfuerzo medio está llegando a la cima sin la configuración más cara, una mejor señal para el uso diario que un número que solo aparece con el gasto máximo.

En CursorBench, Anthropic describe a Fable 5 como de última generación y enmarca el resultado en torno al alcance en lugar de una cifra de precisión única. La frase del anuncio es que Fable 5 "abrió una clase de problemas de largo plazo que estaban fuera del alcance" de los modelos anteriores. CursorBench se inclina hacia el trabajo de ingeniería de múltiples archivos y múltiples pasos que exigen las bases de código reales, por lo que una posición de última generación aquí habla más de codificación agéntica que de escritura de funciones aisladas.

Ambos resultados apuntan en la misma dirección: Fable 5 está diseñado para la ingeniería sostenida, no para completar fragmentos. Si pasa el día en un agente de codificación que planifica, edita entre archivos, ejecuta pruebas e itera, estos son los benchmarks que se corresponden con su flujo de trabajo. Un modelo que encabeza FrontierCode con un esfuerzo medio y empuja a CursorBench a un nuevo territorio debería mantenerse en sesiones de agente largas en lugar de deteriorarse después de unos pocos turnos.

Conocimiento y finanzas: Finance Benchmark (Hebbia)

Fuera del código, el resultado más claro del trabajo de conocimiento proviene del Finance Benchmark creado por Hebbia, una empresa centrada en la IA para el trabajo financiero y legal intensivo en documentos.

Anthropic informa que Fable 5 obtiene la puntuación más alta de cualquier modelo en este benchmark, con ganancias concentradas en tres áreas: razonamiento de documentos, gráficos y tablas. Esa combinación es reveladora. El análisis financiero rara vez es una pregunta de trivia. Es leer un documento extenso, rastrear un número a través de varias páginas, conciliar un gráfico con el texto que lo describe y extraer la celda correcta de una tabla densa sin malinterpretar la columna. Esas son exactamente las habilidades que enfatiza el Finance Benchmark, y las que hacen tropezar a los modelos que son fuertes en prosa pero débiles en datos estructurados.

El ángulo de visión también es importante aquí. Los gráficos y las tablas suelen ser imágenes o diseños mixtos, por lo que una puntuación alta en el Finance Benchmark es en parte un resultado de visión. Se alinea con la afirmación más amplia de Anthropic de que Fable 5 es fuerte en visión, y sugiere que el modelo maneja los documentos desordenados y del mundo real con los que tratan los trabajadores del conocimiento, en lugar de entradas de texto limpio solamente.

Para los desarrolladores, la lectura práctica es que Fable 5 es un candidato para pipelines de extracción de documentos, herramientas de análisis financiero y cualquier flujo de trabajo donde la entrada es un PDF lleno de números en lugar de una carga útil JSON ordenada. Si su producto lee contratos, extractos o informes y tiene que ser preciso con las cifras, esta es la posición a observar. Valide con sus propios documentos antes de confiar en un benchmark para predecir sus resultados.

Razonamiento a largo plazo: FrontierBench (Cognition)

La segunda evaluación de Cognition, FrontierBench, es donde la historia de la autonomía se convierte en una posición de benchmark. Anthropic informa que Fable 5 es el modelo con la puntuación más alta en FrontierBench y destaca el razonamiento a largo plazo como la razón.

El razonamiento a largo plazo es la capacidad de mantener un objetivo y un plan coherentes a lo largo de una tarea larga: muchos pasos, muchos tokens, muchas oportunidades para perder el hilo. La mayoría de los benchmarks recompensan una respuesta correcta a una pregunta contenida. FrontierBench, según el enfoque de Anthropic, recompensa un modelo que puede mantenerse en la tarea mientras la ventana de contexto se llena con su propio trabajo intermedio. Ese es un músculo diferente, y el que Anthropic sigue señalando con frases como "mantiene el enfoque a través de millones de tokens".

Esta es también la posición más difícil de verificar desde fuera, precisamente porque es difícil de medir. Una evaluación a largo plazo debe definir qué significa "mantenerse en la tarea", cómo se puntúa el progreso parcial y cómo evitar que un modelo manipule la métrica al estancarse. Por lo tanto, trate la posición de FrontierBench como una fuerte señal direccional de que Fable 5 está diseñado para agentes autónomos y de larga duración, sin olvidar que la puntuación a largo plazo es un área en evolución donde la metodología aún varía entre laboratorios. Junto con CursorBench, la historia es consistente: la ventaja de Fable 5 se trata menos de responder una pregunta difícil y más de no desmoronarse en una larga.

Rendimiento en el mundo real más allá de los benchmarks

Los benchmarks son una aproximación. Los dos resultados que Anthropic destacó de implementaciones reales son posiblemente más informativos que cualquier clasificación, porque muestran al modelo realizando un trabajo en lugar de pasar una prueba.

El primero es una migración de la base de código de Stripe. Anthropic informa que Fable 5 migró una base de código Ruby de 50 millones de líneas para Stripe en un solo día, un trabajo que el equipo estimó que habría tomado dos meses o más. Lea eso con atención. Una migración de 50 millones de líneas no es un rompecabezas de codificación. Es una tarea extensa, repetitiva y pesada en contexto a través de miles de archivos donde pequeñas inconsistencias se acumulan en compilaciones rotas. La señal no es que Fable 5 sea inteligente; es que puede sostener ediciones correctas y consistentes a una escala enorme sin desviarse, la capacidad de largo plazo que los benchmarks insinúan, mostrada en un sistema de producción genuino.

El segundo es una prueba de Slay the Spire. Slay the Spire es un roguelike de construcción de mazos, y Anthropic lo usó para investigar la memoria en lugar de la codificación. Con la memoria de archivo persistente habilitada, Fable 5 mostró una mejora de 3x sobre Opus 4.8 en el juego. El mecanismo es la parte interesante: la ganancia provino de permitir que el modelo escribiera notas en archivos y las leyera en ejecuciones posteriores, acumulando estrategia de la misma manera que lo haría un jugador humano. Esto apunta a un modelo que mejora significativamente cuando se le da memoria duradera, en lugar de comenzar de cero en cada sesión.

¿Qué le dicen estas cosas que los benchmarks no? Dos cosas. Primero, resistencia a la escala: una pregunta de benchmark es pequeña por diseño, y el resultado de Stripe muestra un comportamiento a una escala que ninguna evaluación estándar alcanza. Segundo, la memoria y el uso de herramientas como multiplicadores de fuerza. El resultado de Slay the Spire no se trata del coeficiente intelectual bruto del modelo, sino de cómo el modelo mejora cuando se conecta a un entorno con estado persistente. Ambas son propiedades que solo se ven cuando un modelo está incrustado en un sistema real, razón por la cual también son más difíciles de comparar entre proveedores. Si está evaluando Fable 5 para un agente que funciona durante horas y mantiene sus propias notas, estas señales importan más que un porcentaje de precisión único.

Cómo interpretar estos resultados

Un resumen de benchmarks que solo elogia no es útil. Aquí están las advertencias a tener en cuenta junto con las posiciones.

Los propietarios de los benchmarks son socios. FrontierCode y FrontierBench provienen de Cognition, y el Finance Benchmark de Hebbia. Son organizaciones creíbles que construyen evaluaciones serias, y su participación es un punto a favor, no una señal de alarma. Pero también son socios en la narrativa del lanzamiento, y un benchmark diseñado por una parte tiende a recompensar las capacidades que le interesan a esa parte. Eso no invalida los resultados; significa que debería buscar una reproducción independiente antes de considerarlos definitivos. Compare con comparaciones neutrales como nuestro análisis de MiniMax M3 frente a Opus 4.7 frente a GPT-5.5 para ver cómo los modelos de Anthropic se comparan con otros marcos.

La configuración de "esfuerzo" cambia el panorama. El resultado de FrontierCode se informó con un esfuerzo medio, lo cual es alentador. Pero el esfuerzo es una variable real en estas evaluaciones. Dos modelos comparados con diferentes niveles de esfuerzo no se comparan de manera justa, y un número citado sin su configuración de esfuerzo está incompleto. Cuando vea una puntuación de Fable 5 en línea, verifique qué esfuerzo y cuántos intentos la produjeron antes de compararla con cualquier otra cosa.

Las puntuaciones públicas son limitadas. El anuncio de Anthropic se basó en las posiciones, y los gráficos detallados llegaron como imágenes, por lo que este artículo se mantiene cualitativo sobre las evaluaciones específicas. Otros medios han llenado el vacío con números, pero esas cifras varían y no todas son rastreables a una fuente primaria, por lo que aún no deberían anclar una decisión de compra. Cuando Cognition y Hebbia publiquen sus propias clasificaciones, prefiera esas.

La posición no es el margen. "El más alto en puntuación" le indica el rango, no la brecha. Un modelo puede liderar por un punto o por veinte, y los dos significan cosas diferentes para saber si la actualización vale la pena el precio de $10/$50. Sin las puntuaciones subyacentes, trate el liderazgo como real pero no cuantificado.

Nada de esto es una razón para desestimar los resultados. Fable 5 liderando en codificación, finanzas, visión y razonamiento a largo plazo, además de las implementaciones de Stripe y Slay the Spire, es una imagen fuerte y coherente. Es una razón para verificar en su propia carga de trabajo antes de comprometerse, el movimiento correcto con cualquier modelo nuevo, independientemente de quién lo haya creado. La descripción general de los modelos es el lugar para confirmar las identificaciones actuales, los precios y los límites de contexto antes de conectar cualquier cosa.

Ejecute su propio benchmark con Apidog

El benchmark más fiable es el que utiliza sus indicaciones y su definición de "bueno". No necesita una herramienta de investigación para obtener una lectura útil. Construya una evaluación DIY (hágalo usted mismo) ligera enviando una indicación de prueba fija a la API de Fable 5 y comparando la respuesta con Opus 4.8 en tres ejes que puede medir directamente: calidad de salida, latencia y costo de tokens.

Aquí hay una forma sencilla de hacerlo con Apidog, una plataforma API para diseñar, probar y documentar solicitudes. La idea es crear una solicitud en Apidog, apuntarla a cada modelo y leer la respuesta, el tiempo y el uso de tokens uno al lado del otro.

Configure una solicitud POST al endpoint de mensajes de Claude y guárdela como una solicitud reutilizable en Apidog para poder volver a ejecutarla sin volver a escribir nada.

POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json

Déle un cuerpo con una tarea fija. Elija una indicación que se parezca a su trabajo real, no un juguete. Una instrucción estilo migración es una buena prueba de estrés para un modelo de codificación:

{
  "model": "claude-fable-5",
  "max_tokens": 2048,
  "messages": [
    {
      "role": "user",
      "content": "Refactor this Ruby method to use keyword arguments and add RSpec tests. Return only the updated code:\n\ndef charge(amount, currency, customer_id, idempotency_key)\n  # ...\nend"
    }
  ]
}

Ejecútelo una vez contra claude-fable-5. Luego duplique la solicitud, cambie el campo model a claude-opus-4-8 y ejecute la misma indicación. Debido a que la entrada es idéntica, cualquier diferencia en la salida es del modelo, no de la indicación.

Ahora lea las tres señales que Apidog muestra para cada llamada:

Repita esto en cinco o diez indicaciones que reflejen su uso real, y tendrá un benchmark pequeño y honesto que le dirá lo que las clasificaciones públicas no pueden: si la ventaja de Fable 5 se muestra en sus tareas a un precio que está dispuesto a pagar. Puede descargar Apidog y tener esto configurado en unos minutos. Para un desglose de costos más profundo, nuestra guía de precios de Fable 5 hace los cálculos.

botón

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs