OpenAI ocultó la parte más interesante del lanzamiento de GPT-5.6 Sol bajo las noticias sobre la restricción gubernamental. Junto con la nueva familia de modelos, OpenAI lanzó dos nuevos controles de razonamiento: un esfuerzo de razonamiento "máximo" que le da a Sol el mayor tiempo para pensar, y un modo "ultra" que, en palabras de OpenAI, "va más allá de un solo agente al aprovechar subagentes para acelerar el trabajo complejo". Este último representa un cambio real en cómo se comporta una sola llamada al modelo.
Primero, la realidad del acceso. GPT-5.6 Sol está en una vista previa limitada solo a través de la API de OpenAI y Codex. Aún no está en ChatGPT, y está restringido a aproximadamente 20 socios cuyos nombres fueron aprobados individualmente por el gobierno de EE. UU. Por lo tanto, no puedes activar el modo ultra hoy a menos que seas uno de ellos. Este artículo es para desarrolladores que desean comprender qué cambian los subagentes dentro de una llamada al modelo en el diseño de agentes, la latencia y el costo, para que puedas decidir si vale la pena esperar. OpenAI dice que la disponibilidad general en ChatGPT, Codex y la API llegará en las próximas semanas.
TL;DR
- El esfuerzo de razonamiento "máximo" es una versión más profunda de una configuración existente: más tiempo de pensamiento, un agente, una cadena de trabajo.
- El modo "ultra" es novedoso en su tipo: el modelo genera sus propios subagentes para dividir el trabajo complejo, según OpenAI.
- Aún no puedes usar ninguno de los dos. GPT-5.6 es una vista previa restringida por el gobierno, solo para API y Codex, no en ChatGPT.
- El resultado de Sol tiene un precio de $30 por 1 millón de tokens, por lo que el modo ultra que se ramifica en subagentes no es barato. Resérvalo para trabajos difíciles y paralelizables.
- Esta es la misma idea de orquestador multiagente que otros laboratorios están implementando, ahora integrada en una sola llamada al modelo. Para probar el patrón de orquestación hoy, debes usar un modelo al que tengas acceso.
Qué hace el esfuerzo de razonamiento "máximo"
OpenAI ya permitía ajustar la intensidad con la que un modelo de razonamiento trabaja a través de una configuración de esfuerzo de razonamiento. GPT-5.6 añade un nuevo nivel superior llamado "máximo". Configúralo, y Sol obtendrá el mayor tiempo para razonar profundamente antes de responder.
Piensa en el "máximo" como girar una perilla que ya conoces. El modelo sigue funcionando como un solo agente y sigue produciendo una única cadena de razonamiento. Estás pagando por más de ese razonamiento, en tokens y tiempo real, para exprimir el último ápice de precisión en un problema difícil. La compensación es familiar: un pensamiento más profundo cuesta más y lleva más tiempo, y la mayoría de las indicaciones no lo necesitan. El "máximo" es la configuración correcta cuando una pregunta difícil requiere una deliberación adicional, como una refactorización sutil o un plan con muchas matemáticas. No cambia la forma del trabajo. Cambia cuánto tiempo dedica el único trabajador a ello.
Qué cambia el modo "ultra"
Ultra es un animal diferente. Según OpenAI, el modo ultra "va más allá de un solo agente al aprovechar subagentes para acelerar el trabajo complejo". En lugar de que un modelo se esfuerce en un problema en una sola cadena, el modelo orquesta varios subagentes que abordan partes de la tarea, y luego une su trabajo.
Si has construido sistemas de agentes a mano, ya lo has hecho de la manera difícil. Escribes un orquestador. Este descompone una tarea en subtareas, las distribuye a llamadas de modelo separadas, luego recopila los resultados y produce una respuesta final. Gestionas las indicaciones, el estado, los reintentos y el código de unión entre cada paso.
El modo ultra integra ese patrón dentro de la llamada al modelo. Preguntas una vez. El modelo decide cómo dividir el trabajo, ejecuta los subagentes y devuelve un resultado. La orquestación que solías controlar ahora ocurre detrás de una única llamada a la API. Esa es la parte genuinamente novedosa. Para el contexto más amplio de la familia, la descripción general de GPT-5.6 Sol cubre los niveles, la nomenclatura y por qué todo está bloqueado detrás de una vista previa gubernamental.
Qué cambia para el diseño de agentes
Mueve la orquestación al modelo y tres cosas cambian en la forma en que construyes.
- Menos código "pegamento". La lógica de descomposición, distribución y fusión que solía residir en tu aplicación puede reducirse. Describes el objetivo y dejas que el modelo se encargue del desglose. Eso significa una menor superficie a mantener y menos lugares donde tu orquestación pueda desincronizarse con el comportamiento del modelo.
- Menos control. La otra cara de la moneda es que renuncias a la visibilidad. Cuando eres dueño del orquestador, ves cada subtarea, resultado intermedio y reintento, y puedes registrarlos o intervenir. Con subagentes dentro de una sola llamada, esa maquinaria es opaca. Ves la entrada y la salida final, no las ramificaciones intermedias. Para flujos de trabajo que necesitan un rastro de auditoría, un orquestador construido a mano sigue siendo superior.
- Diferentes modos de fallo. Un solo agente falla de maneras que normalmente puedes rastrear. Un modelo que ejecuta subagentes internos falla de maneras que son más difíciles de atribuir. ¿Un subagente se desvió? ¿El paso de fusión omitió algo? No siempre podrás saberlo desde fuera, lo cual es importante cuando estás depurando un agente de producción.
Esta es la misma tensión que atraviesa todo sistema multiagente, reubicada. Para ver cómo los orquestadores dedicados lo enmarcan, Fugu Ultra vs. Fable 5 vs. Mythos analiza un modelo construido explícitamente como un orquestador multiagente, un contraste útil con OpenAI al integrar la idea dentro de un solo modelo.
Latencia y costo: por qué el modo ultra no es gratuito
Los subagentes trabajan en paralelo, por lo que para la tarea correcta, ultra puede terminar más rápido que un solo agente avanzando laboriosamente por cada paso en secuencia. Esa es la propuesta de "acelerar el trabajo complejo".
En cuanto al costo, debes ser honesto. Sol es el nivel insignia, y su salida tiene un precio de $30 por cada millón de tokens, con la entrada a $5 por cada millón (Terra y Luna son niveles más baratos en la misma familia). Ahora, imagina el modo ultra generando varios subagentes, cada uno generando sus propios tokens de razonamiento y salida. Esos tokens se suman en cada subagente, por lo que una sola llamada en modo ultra puede consumir mucho más que una sola llamada en modo máximo para la misma indicación. Ultra intercambia tokens por velocidad y profundidad en trabajos difíciles y paralelizables. Si tu tarea no se descompone en piezas independientes, estás pagando por subagentes que se esperan entre sí o duplican esfuerzos. Ese es el caso de un uso excesivo.
El almacenamiento en caché de prompts reduce la factura. GPT-5.6 admite puntos de interrupción de caché explícitos con una vida útil mínima de caché de 30 minutos. Las escrituras en caché se facturan a 1.25x la tasa de entrada sin caché, y las lecturas en caché obtienen un descuento del 90% en la entrada almacenada. Si tus subagentes comparten un contexto común grande, como un gran prompt del sistema o una base de código fija, almacenarlo en caché una vez y leerlo de forma económica en varias llamadas supone un ahorro real. No cambia el costo de los tokens de salida, que es donde el modo ultra gasta más.
Dónde ayuda el modo ultra y dónde es excesivo
Usa el modo ultra cuando la tarea se divida en partes independientes que se beneficien del trabajo paralelo y donde la precisión justifique el gasto. Piensa en un cambio grande en una base de código que afecte a muchos archivos a la vez, una tarea de investigación que abarque varias fuentes, o un trabajo de agente complejo con ramas paralelas. Estos son los trabajos para los que OpenAI está posicionando a Sol, incluyendo el trabajo de codificación y científico.
Evita el modo ultra cuando la tarea sea secuencial, pequeña o sensible a la latencia con un presupuesto ajustado: una respuesta corta, una edición de un solo archivo, una clasificación rápida. Para esos casos, ultra activa subagentes que no tienen nada que paralelizar, y el esfuerzo de razonamiento máximo o incluso el esfuerzo predeterminado es la elección honesta.
Aquí hay una forma directa de decidir. Si no pudieras dividir la tarea entre varios contratistas humanos trabajando al mismo tiempo, el modelo probablemente tampoco podrá obtener mucho valor de los subagentes. El trabajo secuencial sigue siendo secuencial sin importar cuántos agentes le asignes.
Cómo encaja esto en la tendencia más amplia de los multiagentes
OpenAI no es el primero en la idea de que varios agentes coordinados superan a uno. Otros laboratorios han lanzado modelos y frameworks donde un controlador delega en especialistas y une los resultados. Lo nuevo es el empaquetado: OpenAI ofrece ese patrón como un modo en un solo modelo en lugar de un sistema separado que tú ensamblas.
Eso es una apuesta sobre hacia dónde se dirige la construcción de agentes. Si la orquestación dentro del modelo se vuelve lo suficientemente buena, muchas capas de orquestación hechas a mano se volverán redundantes para casos comunes. Si sigue siendo opaca y difícil de depurar, los equipos que necesiten control seguirán construyendo las suyas. Ambas cosas pueden ser ciertas a la vez, con ultra manejando los casos fáciles y la orquestación personalizada encargándose de aquellos que necesitan un rastro de auditoría. El análisis de los benchmarks de GPT-5.6 Sol profundiza en si los números respaldan las afirmaciones de orquestación, enmarcado en torno a la única decisión que puedes tomar ahora mismo: esperar o avanzar.
Qué puedes hacer hoy
No puedes ejecutar el modo ultra, por lo que la acción práctica es construir y probar el patrón de orquestación en un modelo al que puedas llamar. Los modelos frontera disponibles ahora mismo, como Claude Mythos 5, Claude Fable 5, GPT-5.5, Gemini 3.5 Pro, GLM-5.2 y Fugu Ultra, todos exponen puntos finales de chat compatibles con OpenAI o estándar que puedes conectar hoy.
Ahí es donde encaja Apidog. Puedes enviar solicitudes a cualquiera de estas APIs de modelo, establecer parámetros como el esfuerzo de razonamiento donde el modelo lo admita, verificar las respuestas y guardar las llamadas como escenarios de prueba reutilizables. Cuando obtengas tu acceso a la vista previa de GPT-5.6, la misma configuración estará lista: cambia el punto final y el identificador del modelo, y estarás probando Sol el día que accedas. No estás probando Sol hoy, porque nadie fuera de los socios aprobados puede hacerlo. Estás preparando tu arnés de prueba para que el primer día no sea un caos.

Conclusión
El modo ultra es la parte más innovadora del lanzamiento de GPT-5.6: la orquestación que solía residir en tu código, ahora integrada dentro de una sola llamada al modelo. También es algo que aún no puedes tocar, y cuando puedas, no será barato, por lo que la disciplina consiste en ajustar la configuración al trabajo. Usa el modo máximo cuando un trabajador necesite pensar más a fondo. Opta por el modo ultra solo cuando la tarea realmente se divida en partes paralelas que justifiquen el costo de los tokens.
¿Quieres tener tu arnés de prueba listo para el día en que Sol se abra? Descarga Apidog y comienza a probar las APIs de modelos frontera a las que puedes llamar hoy.
