GPT-5.6 Sol de OpenAI alcanzó la disponibilidad general el 9 de julio de 2026, después de una vista previa restringida de dos semanas, y su nivel insignia Sol llegó con cifras de lanzamiento que reclaman la corona agentica. Claude Fable 5 de Anthropic ha llevado la bandera del "modelo más capaz" desde principios de junio. Si estás eligiendo un modelo insignia para el trabajo real este trimestre, ahora tienes dos respuestas creíbles y un montón de titulares contradictorios.
Aquí está la parte que la mayoría de las comparaciones ocultan: ninguno de los modelos lo gana todo, y los propios números de los proveedores lo dicen. Según el informe de lanzamiento de OpenAI, Sol lidera los amplios puntos de referencia agenticos por un amplio margen. El mismo informe muestra a Claude Fable 5 por delante en SWE-Bench Pro por casi 16 puntos. Cualquier comparación que corone a un ganador absoluto te está vendiendo algo.
Así que esta no lo hará. A continuación, se detalla el desglose de los puntos de referencia con cada número atribuido, lo que ese desglose significa para el trabajo que realizas, los precios de ambos lados, las diferencias en la superficie de la API y una guía de decisión. Cubrimos qué es GPT-5.6 Sol en una explicación separada, y el anuncio oficial de GPT-5.6 es la fuente principal de las afirmaciones de OpenAI.
El veredicto por adelantado
| Tarea a realizar | Opción más fuerte hoy | La evidencia |
|---|---|---|
| Ejecución de tareas agenticas amplias | GPT-5.6 Sol | Agents’ Last Exam ~53 vs 46.9 de GPT-5.5, según OpenAI |
| Ingeniería de software profunda | Claude Fable 5 | SWE-Bench Pro 80.3% vs 64.6% de Sol, según el propio gráfico de OpenAI |
| Trabajo de agente impulsado por terminal | GPT-5.6 Sol, por poco | Terminal-Bench 2.1: 88.8%, 91.9% con ultra, según OpenAI |
| Precio de lista más bajo por token | GPT-5.6 Sol | $5 / $30 por 1M de tokens vs $10 / $50 publicados de Fable 5 |
| Ejecución multi-agente paralela incorporada | GPT-5.6 | La configuración ultra ejecuta cuatro agentes en paralelo por defecto |
| Un modelo que lo gana todo | Ninguno | Ese modelo no existe en este momento |
Una advertencia rige toda la tabla: cada cifra de referencia es reportada por el proveedor, publicada en el lanzamiento y aún no reproducida independientemente. Léelo como un mapa de afirmaciones, no como una clasificación establecida. El único punto de referencia que establece algo es tu propia carga de trabajo, y te mostraremos cómo ejecutarla lado a lado en Apidog casi al final.
El desglose de los puntos de referencia, según OpenAI
Tres números definen esta comparación, y los tres provienen de los materiales de lanzamiento de OpenAI. Esa fuente tiene sus dos caras, así que tenlo en cuenta.
| Punto de referencia | GPT-5.6 Sol | Claude Fable 5 | Fuente |
|---|---|---|---|
| Agents’ Last Exam | ~53 (los informes varían de 52.7 a 53.6) | Aproximadamente 13 puntos detrás de Sol | OpenAI, día de lanzamiento |
| SWE-Bench Pro | 64.6% | 80.3% | OpenAI, día de lanzamiento |
| Terminal-Bench 2.1 | 88.8% (91.9% con ultra) | No indicado en el gráfico de OpenAI | OpenAI, día de lanzamiento |
En Agents’ Last Exam, OpenAI informa que Sol está en aproximadamente 53, un aumento desde el 46.9 de GPT-5.5 y aproximadamente 13 puntos por delante de Claude Fable 5. Eso es un verdadero salto generacional en un punto de referencia construido alrededor de tareas agenticas largas y de múltiples pasos, y es el número con el que OpenAI lideró.
En SWE-Bench Pro, la situación se invierte. El propio gráfico comparativo de OpenAI muestra a Claude Fable 5 con un 80.3% frente al 64.6% de Sol. Demos el crédito donde corresponde: publicar una pérdida de 15.7 puntos en tus propios materiales de lanzamiento es inusual, y hace que el resto del gráfico sea más fácil de tomar en serio. También coincide con lo que mide SWE-Bench Pro, que es resolver problemas difíciles de ingeniería de software de repositorio real de principio a fin.
Terminal-Bench 2.1 completa el caso de Sol. OpenAI informa un 88.8% para Sol estándar y un 91.9% cuando ultra distribuye el trabajo entre cuatro agentes paralelos. Ten en cuenta que el número "ultra" es un modo de ejecución diferente con un gasto de tokens deliberadamente mayor, no el mismo modelo pensando más arduamente.
Dos verificaciones de honestidad antes de que le des peso a esto. Primero, estas son afirmaciones del día de lanzamiento del proveedor con más que ganar; nadie fuera de OpenAI las ha reproducido todavía, y las elecciones de los arneses de evaluación pueden mover las puntuaciones por puntos. Segundo, los puntos de referencia individuales comprimen mucho. El escrito del primer día de Simon Willison es una lectura independiente útil sobre el lanzamiento, y nuestro desglose de los puntos de referencia de GPT-5.6 Sol explica en detalle lo que mide cada prueba.
Qué significa el desglose
El patrón en esos tres números no es aleatorio. Esboza dos especialidades diferentes.
La ventaja de Sol es la amplitud. Agents’ Last Exam y Terminal-Bench recompensan a un modelo que puede planificar a través de muchos pasos, orquestar herramientas, recuperarse de errores y llevar a cabo diversas tareas hasta su finalización. Si tu carga de trabajo se parece a flotas de agentes gestionando tickets, ejecuciones de investigación, automatización de operaciones o tuberías impulsadas por terminal, los números de OpenAI sugieren que Sol es el ejecutante más fuerte.
La ventaja de Fable 5 es la profundidad. SWE-Bench Pro es el proxy público más cercano para "¿puede este modelo hacer ingeniería de software difícil y real en una base de código existente sin que un humano lo desenrede después?". Una ventaja de 15.7 puntos allí, admitida por el competidor, no es ruido incluso después de márgenes de error generosos. Si tu carga de trabajo son refactorizaciones a escala de repositorio, depuración complicada o ejecuciones largas de ingeniería de proyectos únicos, ese es el número que debería fijar tu valor predeterminado.
Lo que significa que la pregunta correcta no es "¿qué modelo es mejor?". Es "¿cuál de estos dos trabajos se parece más al mío?". Elegir por el agregado de la clasificación optimiza para una carga de trabajo que no tienes.
Cómo se compara el precio
OpenAI publicó precios claros de disponibilidad general en los tres niveles de GPT-5.6. El precio de Fable 5 de Anthropic a continuación es lo que se publicó en el lanzamiento; confirma las tarifas actuales en la página de precios de Anthropic antes de presupuestar, ya que los términos de acceso cambiaron a créditos de uso para suscriptores en julio.
| Modelo | Entrada por 1M de tokens | Salida por 1M de tokens |
|---|---|---|
| gpt-5.6-sol (el alias gpt-5.6 básico se dirige aquí) | $5.00 | $30.00 |
| gpt-5.6-terra | $2.50 | $15.00 |
| gpt-5.6-luna | $1.00 | $6.00 |
| claude-fable-5 | $10.00 (publicado; verificar) | $50.00 (publicado; verificar) |
Según la tabla de tarifas, Sol cuesta la mitad que Fable 5 por token en ambas direcciones. Esa es una brecha significativa, pero el precio de lista es un predictor débil de lo que cuesta una tarea. Los dos modelos tokenizan de manera diferente, producen diferentes longitudes de salida para el mismo prompt y consumen diferentes cantidades de razonamiento para llegar a una respuesta. Un modelo que es más barato por token y más conversador por tarea puede resultar igual.
El almacenamiento en caché reduce aún más la brecha en ambos lados. GPT-5.6 admite puntos de interrupción de caché explícitos con escrituras en caché facturadas a 1.25 veces la tasa de entrada sin caché, lecturas de caché que mantienen un 90% de descuento y una vida mínima de caché de 30 minutos. El almacenamiento en caché de prompts de Fable 5 también descuenta los aciertos de caché en un 90%, lo que importa el doble a su tarifa base más alta. Nuestro desglose de precios de Claude Fable 5 cubre dónde se ven esos ahorros en la práctica. De cualquier manera, el número a seguir es el costo por tarea completada, no el costo por millón de tokens.
Dónde difieren las superficies de la API
Ambas compañías ahora ofrecen mucho más que un endpoint de finalización de chat, y las formas difieren lo suficiente como para influir en la elección.
La superficie de GPT-5.6, según la documentación para desarrolladores de OpenAI, se centra en el control y la orquestación dentro de la API de Respuestas:
- Seis niveles de esfuerzo de razonamiento, desde ninguno hasta el máximo, para que puedas ajustar la profundidad por solicitud.
- Modo Pro como una configuración (reasoning.mode: "pro") en los tres modelos para cargas de trabajo que priorizan la calidad. Es un ajuste, no un modelo separado.
- Ultra, una configuración multi-agente que ejecuta cuatro agentes en paralelo por defecto. Intercambia un mayor gasto de tokens por resultados más rápidos en tiempo real, y vive en ChatGPT Work en planes Pro y Enterprise, además de Codex desde Plus en adelante.
- Llamada programática de herramientas, donde el modelo escribe JavaScript que orquesta tus llamadas a herramientas dentro de un tiempo de ejecución V8 aislado sin acceso a la red.
- Razonamiento persistente entre turnos, ejecución multi-agente en beta y configuraciones de detalle de visión que preservan las dimensiones originales de la imagen.
Claude Fable 5 se sitúa en la cima de la familia Claude 5, introducido junto a Claude Mythos 5 en el anuncio de Anthropic. Su superficie publicada incluye una ventana de contexto de 1 millón de tokens como predeterminada, hasta 128K tokens de salida por solicitud, y un parámetro de retrocesos del lado del servidor que puede redirigir una solicitud rechazada por seguridad a Claude Opus 4.8 dentro de la misma llamada a la API. Anthropic presenta el modelo para razonamientos exigentes y trabajo agentico de largo alcance, y tiene su propia pila agentica alrededor de Claude Code y flujos de trabajo de sub-agentes. Nuestra explicación de Claude Fable 5 cubre la hoja de especificaciones completa.
Las ventanas de contexto están cerca de la paridad: el 1M de Fable 5 está confirmado, y los primeros informes de cobertura de la documentación también informan que GPT-5.6 tiene 1M, aunque la página de especificaciones de OpenAI debería ser tu fuente de la verdad allí. La mayor diferencia es la filosofía. OpenAI está exponiendo primitivas de orquestación (paralelismo, llamadas programáticas a herramientas, diales de esfuerzo) como características de API de primera clase. Anthropic está lanzando un motor de modelo único profundo con plomería de confiabilidad a su alrededor. Ninguno de los enfoques es incorrecto; se mapean a la misma división de amplitud versus profundidad que muestran los puntos de referencia.
Una guía práctica de decisión
Quita el ruido del lanzamiento y la elección se reduce a unas pocas preguntas.
Elige GPT-5.6 Sol como tu valor predeterminado cuando:
- Tu carga de trabajo son flotas de agentes, orquestación de herramientas o muchas tareas variadas ejecutándose sin supervisión.
- Deseas paralelismo y control de esfuerzo por solicitud como primitivas de API en lugar de algo que tú construyas.
- La presión del presupuesto de tokens es real y la tabla de tarifas de $5 / $30, además de Terra y Luna como escalones inferiores, se ajusta a tu economía unitaria.
Elige Claude Fable 5 como tu valor predeterminado cuando:
- El trabajo es ingeniería de software difícil en un repositorio real, donde la brecha de SWE-Bench Pro lo indica.
- Ejecutas sesiones largas y profundas de una sola tarea y te importa más la capacidad máxima por tarea que el rendimiento de la flota.
- Ya estás invertido en la cadena de herramientas de Claude y su comportamiento de retroceso y almacenamiento en caché.
Ejecuta ambos cuando puedas. Estas son APIs HTTP estándar con SDKs maduros, y el enrutamiento por tipo de tarea (Sol para flujos intensivos en orquestación, Fable 5 para los intensivos en ingeniería) es una arquitectura normal en 2026, no exótica.
Prueba ambos con tu propia carga de trabajo
Los puntos de referencia del proveedor te dieron una lista corta de dos. Tus propios prompts deberían tomar la decisión final, y esto lleva una tarde, no un sprint.
Ambos modelos son accesibles a través de HTTP simple: GPT-5.6 a través de la API de Respuestas de OpenAI y Fable 5 a través de la API de Mensajes de Anthropic. En Apidog, guarda cada uno como su propio entorno con la URL base, el encabezado de autenticación y el ID del modelo como variables. Luego, crea una colección de solicitudes con 10 a 20 prompts extraídos de tu carga de trabajo real, los tickets, las diferencias y las cadenas de llamadas a herramientas que gestionas semanalmente, y ejecuta el conjunto contra cada entorno.
Compara dos cosas por prompt. Primero, la calidad de la respuesta, juzgada por quien sea el propietario de esa carga de trabajo. Segundo, los campos de uso en cada cuerpo de respuesta, porque el recuento de tokens multiplicado por la tabla de tarifas te da el costo real por tarea, que es donde la suposición de "Sol es la mitad del precio" se pone a prueba contra las salidas más concisas o más largas de Fable 5 en tus datos. Si tus agentes van a orquestar herramientas internas, simula primero esos endpoints de herramientas para que ambos modelos planifiquen contra respuestas idénticas y estables. Una hora de evidencia lado a lado supera cualquier gráfico de lanzamiento.
Preguntas Frecuentes
¿Es GPT-5.6 Sol mejor que Claude Fable 5?
En algunos trabajos, según los números de lanzamiento de OpenAI. Sol lidera Agents’ Last Exam por aproximadamente 13 puntos, mientras que Fable 5 lidera SWE-Bench Pro por 15.7 puntos en los mismos gráficos. No hay un ganador único honesto. Empareja el modelo con el trabajo: la ejecución de tareas agenticas amplias favorece a Sol, la ingeniería de software profunda favorece a Fable 5.
¿Qué modelo es más barato de ejecutar?
La tabla de tarifas de Sol es la mitad del precio publicado de Fable 5: $5 / $30 por 1M de tokens frente a $10 / $50 (verifica las tarifas actuales de Anthropic antes de presupuestar). El costo real depende de la tokenización, la longitud de salida y el almacenamiento en caché, así que mide el costo por tarea completada con tus propios prompts antes de tratar la brecha de 2x como establecida.
¿Puedo usar ambos modelos en un solo producto?
Sí, y muchos equipos lo hacen. Ambas son APIs HTTP estándar, por lo que puedes dirigir los flujos intensivos en orquestación a Sol y los flujos intensivos en ingeniería a Fable 5 detrás de una interfaz. Nuestra guía sobre cómo usar la API de Claude Fable 5 cubre el lado de Anthropic, incluyendo la autenticación y la forma de la solicitud.
¿Están verificados independientemente estos números de referencia?
No. Cada cifra en este artículo es reportada por el proveedor a partir de los materiales de lanzamiento de OpenAI del 9 de julio, incluido el resultado de SWE-Bench Pro donde Fable 5 gana. Las reproducciones independientes suelen aparecer semanas después de un lanzamiento de disponibilidad general. Hasta entonces, trata todo como afirmaciones y da más peso a tus propias pruebas.
La comparación que importa es la tuya
El veredicto dividido es el hallazgo, no una excusa. Los propios gráficos de lanzamiento de OpenAI entregan a Sol la corona de amplitud agentica y a Fable 5 la corona de ingeniería de software, y ambas compañías lanzaron modelos insignia reales y utilizables con semanas de diferencia. Elegir por la clasificación agregada ignora la única variable que decide tu resultado: cómo es tu carga de trabajo.
Así que haz la prueba. Extrae 15 prompts reales del trabajo de la semana pasada, descarga Apidog, configura ambas APIs como entornos y compara la calidad y el costo por tarea con tus propios datos. Tendrás una respuesta defendible antes de que se publique la primera reproducción independiente del benchmark.
