Si ha comenzado a desarrollar con Claude Fable 5 y ha notado que un puñado de solicitudes se comportan de manera diferente al resto, está viendo las salvaguardias de Claude Fable 5 en acción. Fable 5 se lanzó el 9 de junio de 2026 con el ID de modelo claude-fable-5, e incluye una capa de enrutamiento de seguridad incorporada porque es un modelo de clase Mythos diseñado para ser seguro para uso general. El mecanismo es sencillo una vez que se comprende: los clasificadores buscan consultas en algunas áreas sensibles y, cuando una se activa, la solicitud es respondida por Claude Opus 4.8 en lugar del modelo Fable 5 completo. Esto ocurre en menos del 5% de las sesiones en promedio, por lo que la mayoría de los desarrolladores rara vez lo encuentran. Este artículo explica cómo funciona el enrutamiento de seguridad, qué temas cubre, cómo se siente en la práctica y por qué Anthropic eligió enrutar en lugar de rechazar.
En resumen
Claude Fable 5 ejecuta clasificadores que detectan consultas en tres áreas sensibles y las enrutan a Claude Opus 4.8 en lugar del modelo Fable 5 completo. Las salvaguardias se activan en menos del 5% de las sesiones en promedio. Las tres áreas protegidas son ciberseguridad, biología y química, y destilación de modelos. No se configura nada y los precios no cambian.
Qué hacen las salvaguardias
La idea central detrás de las salvaguardias de Claude Fable 5 es una decisión de enrutamiento, no un filtro general. Cada solicitud que envía a claude-fable-5 pasa por un conjunto de clasificadores. Esos clasificadores examinan la consulta y deciden si se encuentra dentro de una de las categorías protegidas. Para la abrumadora mayoría de las solicitudes, la respuesta es no, y la solicitud es manejada por el modelo Fable 5 completo exactamente como cabría esperar.

Cuando un clasificador marca una solicitud como sensible, esta no se rechaza directamente. En su lugar, se recurre a Claude Opus 4.8, que responde a la consulta en lugar de Fable 5. Desde el punto de vista de su aplicación, la respuesta sigue llegando a través de la misma llamada a la API y el mismo ID de modelo. La diferencia es que el modelo subyacente que generó la respuesta fue Opus 4.8 en lugar del modelo Fable 5 completo. Esa distinción importa porque los dos modelos pueden producir resultados diferentes y comportarse de manera distinta en los temas donde se aplica la alternativa.
Vale la pena reiterarlo porque es el corazón del diseño. Fable 5 es un modelo de clase Mythos, lo que significa que se sitúa en el extremo de alta capacidad de la línea de productos de Anthropic. Hacer que un modelo tan capaz sea seguro para el uso público general implica establecer barreras alrededor del estrecho conjunto de capacidades que conllevan el mayor riesgo. En lugar de intentar que Fable 5 por sí mismo rechazara esas consultas, Anthropic construyó una capa que las redirige discretamente a un modelo cuyo comportamiento en esos temas está bien comprendido y se considera seguro para exponer ampliamente. Si desea información sobre la clase de modelo en sí, consulte la explicación sobre qué es un modelo de clase Mythos.
El enrutamiento es automático y reside en el lado de Anthropic. No hay ningún parámetro que pase, ningún encabezado que establezca ni ninguna bandera en su solicitud que lo active o desactive. Los clasificadores se ejecutan en cada sesión, y la alternativa se activa solo cuando uno de ellos se dispara.
Las tres áreas protegidas
Las salvaguardias de Claude Fable 5 cubren tres categorías. Cada una es un dominio donde un modelo de alta capacidad podría reducir significativamente la barrera para causar daño, por lo que cada una está restringida. Las descripciones a continuación cubren lo que está restringido, no cómo hacer algo en estas áreas.
Ciberseguridad
La primera área protegida es la ciberseguridad ofensiva. Esto cubre aspectos como el desarrollo de exploits, tareas cibernéticas ofensivas y flujos de trabajo de hacking agencial donde se le pediría a un modelo que realizara o acelerara un ataque. Cuando los clasificadores detectan una consulta de este tipo, la solicitud se enruta a Opus 4.8.

Las salvaguardias de ciberseguridad están diseñadas para evitar que Fable 5 progrese en tareas de evaluación cibernética que miden la capacidad ofensiva. Un socio externo que probó el modelo encontró que las salvaguardias de Fable 5 contra consultas cibernéticas dañinas se encontraban entre las más "robustas" que habían probado, usando la propia palabra de la fuente. El enfoque aquí es defensivo: el objetivo es evitar que el modelo avance el trabajo de un atacante, dejando las preguntas de seguridad ordinarias, el trabajo defensivo y el material educativo sin afectar.
Biología y química
La segunda área protegida cubre consultas de biología y química que abordan las capacidades más peligrosas en esos campos. Ejemplos incluyen el diseño de AAV y consultas relacionadas con armas biológicas. Al igual que con la ciberseguridad, cuando un clasificador marca una de estas solicitudes, la respuesta proviene de Opus 4.8 en lugar del modelo Fable 5 completo.

La intención es mantener las capacidades de biología y química de mayor riesgo detrás de una barrera de seguridad, dejando intacta la vasta mayoría de preguntas científicas, médicas y educativas en este espacio. La mayoría de los desarrolladores que construyen herramientas de biología o química nunca activarán la alternativa, porque la barrera está dirigida a una franja estrecha de contenido genuinamente peligroso.
Destilación
La tercera área protegida es la destilación de modelos. Esto cubre intentos de extraer el modelo para entrenar modelos competidores, por ejemplo, probándolo sistemáticamente para capturar su comportamiento y reproducirlo en otro lugar. Las consultas que parecen intentos de destilación se enrutan a Opus 4.8 de la misma manera que las consultas cibernéticas y biológicas.
La destilación es diferente en carácter de las otras dos áreas. No se trata de prevenir daños físicos en el mundo real; se trata de proteger el modelo mismo de ser copiado. Pero el mecanismo de enrutamiento es idéntico, lo que mantiene el sistema general simple: una capa de clasificador, un objetivo de respaldo, tres categorías.
Con qué frecuencia se activa y cómo se siente en la práctica
La cifra principal es que las salvaguardias de Claude Fable 5 se activan en menos del 5% de las sesiones en promedio. Para la mayoría de las aplicaciones, eso significa que el respaldo es un evento raro en lugar de una presencia constante. Si está construyendo un asistente de codificación de propósito general, una herramienta de escritura, un bot de soporte al cliente o la mayoría de otros productos comunes, es posible que pase mucho tiempo sin verlo nunca.
¿Cómo se siente cuando sucede? Desde fuera, muy poco cambia. Su llamada a la API tiene éxito, obtiene una respuesta, y la respuesta es coherente y relevante. Lo que no puede ver directamente es que la respuesta fue generada por Opus 4.8 en lugar del modelo Fable 5 completo. Debido a que los dos modelos son diferentes, la salida sobre esos temas específicos puede diferir en tono, profundidad o enfoque de lo que Fable 5 habría producido.
En la práctica, esto significa algunas cosas sobre cómo observará el sistema:
- Una pequeña fracción de las solicitudes, concentradas en las tres áreas protegidas, será atendida por Opus 4.8.
- Las salidas sobre esos temas pueden no coincidir con el estilo o el perfil de capacidad que usted espera de Fable 5 en temas no relacionados.
- En el caso típico, no obtendrá un error o una negativa rotunda; la solicitud se completa normalmente.
- El comportamiento es consistente: el mismo tipo de consulta sensible tiende a enrutarse de la misma manera.
Si su producto nunca toca la ciberseguridad, la biología, la química o cualquier cosa que se parezca a la extracción de modelos, es probable que nunca note las salvaguardias. Si su producto se encuentra en uno de esos dominios, la alternativa será una parte más regular de su experiencia, y vale la pena diseñar en torno a ella. Una forma práctica de ver esto por sí mismo es enviar una serie de prompts a través de la API y observar cuáles se comportan de manera diferente. Cuando pruebe la API de Fable 5 en una herramienta como Apidog, puede guardar una colección de prompts y ejecutarlos repetidamente para identificar qué categorías activan la alternativa.
Por qué enrutar en lugar de rechazar
Una pregunta natural es por qué Anthropic construyó una capa de enrutamiento en lugar de simplemente hacer que Fable 5 rechazara las consultas sensibles como lo hacen muchos modelos. La respuesta se reduce a un objetivo de diseño de capacidad con seguridad.
Una negativa es un callejón sin salida. El usuario pregunta algo, el modelo se niega y la interacción se detiene. Ese es el resultado correcto para solicitudes genuinamente maliciosas, pero es un instrumento tosco. Muchas consultas que rozan un área sensible son legítimas: un investigador de seguridad haciendo una pregunta defensiva, un estudiante investigando un tema de biología, un desarrollador depurando algo que parece hostil a un clasificador. Una negativa rotunda trata a todos de la misma manera y produce una experiencia frustrante para las personas que realizan un trabajo legítimo.
El enrutamiento a Opus 4.8 es una respuesta más suave. En lugar de negarse, el sistema entrega la consulta a un modelo cuyo comportamiento en estas áreas se comprende bien y se considera seguro para exponer al público. El usuario sigue obteniendo una respuesta; simplemente proviene de un modelo con un perfil de capacidad diferente en ese conjunto limitado de temas. Esto mantiene a Fable 5 ampliamente útil con toda su capacidad para todo lo que está fuera de las áreas protegidas, al tiempo que garantiza que las capacidades de mayor riesgo no estén disponibles con toda su fuerza para el público en general.
El caso de la ciberseguridad muestra claramente el marco. El objetivo de la salvaguardia no es bloquear el trabajo de seguridad en general, sino evitar que el modelo avance en tareas cibernéticas ofensivas. La seguridad defensiva, la educación y las preguntas de ingeniería ordinarias deben fluir normalmente. El hecho de que el socio externo encontrara que las salvaguardias de Fable 5 contra consultas cibernéticas dañinas se encontraban entre las más "robustas" que probaron, demuestra lo bien que se mantiene este límite defensivo. Anthropic publica más sobre su enfoque general en su página de seguridad y escalado responsable, y los detalles de lanzamiento de ambos modelos se encuentran en el anuncio de Fable 5 y Mythos 5.
Fable 5 vs Mythos 5 en salvaguardias
Fable 5 tiene una contraparte llamada Claude Mythos 5. Mythos 5 es el mismo modelo subyacente con salvaguardias levantadas en algunas áreas. No es una arquitectura diferente o un sistema más capaz en el sentido general; es Fable 5 sin parte del enrutamiento que mantiene segura la versión pública.
Dado que la eliminación de esas salvaguardias cambia el perfil de riesgo, Mythos 5 no es público. El acceso está restringido a los socios del Proyecto Glasswing, que incluyen ciberdefensores y proveedores de infraestructura, junto con investigadores de biología seleccionados. Estas son organizaciones e individuos cuyo trabajo requiere genuinamente las capacidades sin restricciones y que operan bajo una supervisión adecuada. Para una comparación detallada de los dos modelos, consulte Fable 5 vs Mythos 5.
La conclusión práctica para la mayoría de los desarrolladores es breve: usted está desarrollando sobre Fable 5, las salvaguardias son parte de él y no existe una ruta pública a la versión sin restricciones. Si su trabajo se encuadra en una de las categorías de socios, el camino a Mythos 5 pasa por Project Glasswing, no por un indicador de API.
Qué significa esto para su aplicación
Para la aplicación típica, las salvaguardias de Claude Fable 5 no requieren nada de usted. No hay un paso de configuración, ningún interruptor que ajustar, ni manejo especial que deba agregar a su código de solicitud. Los clasificadores y la alternativa residen completamente en el lado de Anthropic. Usted llama a la API con el ID de modelo claude-fable-5, y el enrutamiento ocurre de forma transparente.
Lo principal que debe internalizar es que una pequeña fracción de sus solicitudes puede ser atendida por Opus 4.8 en lugar de Fable 5, y que esto puede afectar los resultados y el comportamiento en los temas protegidos. Si su producto aborda la ciberseguridad, la biología, la química o cualquier cosa que se asemeje a la extracción de modelos, planifique la alternativa como parte normal de la experiencia en lugar de como un caso excepcional. Para todos los demás, es lo suficientemente raro como para que rara vez merezca una atención especial.
Algunos puntos concretos a tener en cuenta:
- No hay nada que configurar. Las salvaguardias son automáticas y no se pueden desactivar a través de la API.
- El costo no cambia. El precio de Fable 5 se mantiene en $10 por millón de tokens de entrada y $50 por millón de tokens de salida, independientemente de si una solicitud determinada fue atendida por Fable 5 o recurrió a Opus 4.8. La alternativa no lo cambia a un precio diferente. Si desea el desglose completo de precios, consulte la guía de precios de Claude Fable 5.
- Si construye en dominios sensibles, espere la alternativa. Diseñe sus prompts, sus evaluaciones y las expectativas de sus usuarios teniendo en cuenta el enrutamiento.
- Pruebe antes de implementar. Ejecute un conjunto representativo de prompts a través de la API y observe qué categorías se comportan de manera diferente para no llevarse sorpresas en producción.
Dado que la respuesta regresa a través de la misma llamada y el mismo ID de modelo, no siempre puede saber por una única respuesta qué modelo la generó. Eso es intencional y está bien para la mayoría de los casos de uso. Si necesita comprender el límite de comportamiento con precisión, el enfoque más fiable es crear un conjunto de pruebas que ejercite los límites de las tres áreas protegidas y observar las diferencias directamente. La guía de uso de la API de Opus 4.8 es un antecedente útil, ya que Opus 4.8 es el modelo al que recurren sus solicitudes de temas sensibles.
La versión corta es que las salvaguardias de Claude Fable 5 son una capa de enrutamiento silenciosa y automática que envía una pequeña parte de las solicitudes sensibles a Opus 4.8, dejando todo lo demás con la capacidad completa de Fable 5 sin configuración y sin cambios en su costo. Si desarrolla en ciberseguridad, biología, química o en cualquier área cercana a la extracción de modelos, su siguiente paso es preparar un pequeño conjunto de prompts de prueba, ejecutarlos a través de la API y observar cómo se comportan las áreas protegidas para que su aplicación esté lista para la alternativa. Para un contexto más amplio sobre la familia de modelos, comience con qué es Claude Fable 5 y la descripción general de modelos, luego pase a integrarlo en su stack con la guía de la API de Fable 5. Cuando esté listo para probar, Apidog le ofrece un lugar para ejecutar y comparar esos prompts.
