OpenAI anunció GPT-5.6 Sol el 26 de junio de 2026 con una pila de números de referencia que parecen un récord impecable. El estado del arte en Terminal-Bench, el único modelo que supera el 50% en el Examen Final del Agente en modo código, evaluaciones cibernéticas que igualan a un competidor principal en un tercio de los tokens. La advertencia que debes leer primero: no puedes ejecutar nada de esto. Sol se envía como una vista previa limitada y controlada por el gobierno a través de la API de OpenAI y solo Codex, restringida a aproximadamente 20 socios cuyos nombres fueron aprobados individualmente por el gobierno de EE. UU. No está en ChatGPT y hoy no hay nada para inscribirse.
Así que los puntos de referencia no son consejos de compra. Responden una pregunta, y solo una: ¿vale la pena esperar por GPT-5.6 Sol, o deberías seguir adelante con un modelo que ya puedes usar? Esto es lo que este artículo aclara. Recorremos lo que mide cada punto de referencia principal, ponemos cada número junto a la línea de base de GPT-5.5 y Claude Mythos 5 que ya tienes, y terminamos con un veredicto honesto de esperar o seguir adelante. Cada cifra aquí proviene del propio marco de OpenAI y de la cobertura secundaria temprana, no de una prueba que ejecutamos.
TL;DR
- GPT-5.6 Sol está en una vista previa limitada: solo API de OpenAI y Codex, no en ChatGPT, aproximadamente 20 socios aprobados por el gobierno. La disponibilidad general será "en las próximas semanas" según OpenAI.
- Las puntuaciones reportadas son sólidas pero de fuente secundaria. Trátalas como afirmaciones de OpenAI, no como resultados medidos, hasta que el modelo se abra.
- Cifras destacadas (según OpenAI / cobertura temprana): SOTA de Terminal-Bench 2.1, modo código de Agent’s Last Exam por encima del 50%, paridad de ExploitBench en aproximadamente un tercio de los tokens de salida.
- Espera si tu trabajo es codificación agencial, tareas de terminal largas o seguridad defensiva y puedes posponerlo unas semanas.
- No te molestes en esperar si necesitas un modelo en producción ahora. Las alternativas que puedes probar hoy cierran la mayor parte de la brecha.
Lee esto antes de leer las puntuaciones
Los puntos de referencia te dicen lo que un modelo puede hacer. No te dicen si puedes usarlo. Para GPT-5.6 Sol, esos son dos hechos diferentes, y el segundo domina en este momento.
El lanzamiento está controlado por la administración de EE. UU. bajo una orden ejecutiva del 2 de junio de 2026 que estableció la evaluación comparativa y la valoración para los nuevos modelos de IA. OpenAI acordó esto como un paso temporal. En sus palabras, citadas por MacRumors, "Estamos dando este paso a corto plazo porque creemos que es el camino más sólido hacia una mayor disponibilidad en las próximas semanas". OpenAI dice que la disponibilidad general en ChatGPT, Codex y la API llegará en las próximas semanas. Hasta entonces, las puntuaciones son un adelanto de algo que no puedes comprar.
Ese marco importa para cómo lees el resto de este artículo. Una ventaja de 4 puntos en Terminal-Bench es significativa si puedes implementarla. Es una razón para seguir observando, no para detener tu hoja de ruta, si no puedes. Si quieres una imagen completa de qué es Sol y por qué está bloqueado, nuestro explicador de GPT-5.6 Sol cubre la familia y la restricción. Los identificadores exactos del modelo de API aún no se han publicado, por lo que no hay nada que configurar incluso si quisieras.
Terminal-Bench 2.1: el número destacado
Terminal-Bench mide qué tan bien un modelo completa tareas reales en una terminal: editar archivos, ejecutar comandos, encadenar herramientas, recuperarse de errores. Es el proxy público más cercano para "¿puede esta cosa hacer trabajo de codificación agencial de principio a fin" en lugar de responder a un solo mensaje. Es por eso que OpenAI lo presentó.

Según OpenAI y la cobertura temprana, en Terminal-Bench 2.1, la nueva configuración "ultra", Sol Ultra, obtiene aproximadamente un 91.91%, con Sol estándar alrededor del 88.8%. Las bases de referencia que ya tienes para el contexto: Claude Mythos 5 alrededor del 88% y GPT-5.5 alrededor del 83.4%. Si esto se mantiene, el modo estándar de Sol empata aproximadamente con Mythos 5, y Sol Ultra se distancia unos puntos del resto.
La parte "ultra" está haciendo un trabajo real en esa puntuación máxima. Según el anuncio de OpenAI, el modo ultra "va más allá de un solo agente al aprovechar subagentes para acelerar el trabajo complejo". Así que el 91.91% no es un modelo pensando más profundamente; es un modelo que genera ayudantes. Esa es una genuina capacidad de cambio, y también significa que la cifra principal no se mapea limpiamente en una sola llamada a GPT-5.5. Para una comparación directa de los modelos que puedes ejecutar hoy, nuestra comparación de Claude Opus 4.8 vs GPT-5.5 vs Gemini 3.5 es la mejor referencia mientras Sol permanece bloqueado.
Examen Final del Agente: la afirmación de "único modelo que supera el 50%"
El Examen Final del Agente es un punto de referencia agencial difícil diseñado para resistir la saturación: tareas de varios pasos donde el modelo tiene que planificar, usar herramientas y seguir adelante sin que un humano lo encauce. El modo código es la parte que enfatiza específicamente el trabajo de software.
Según la cobertura temprana, GPT-5.6 Sol obtiene aproximadamente un 50.9% en modo código y se describe como el único modelo por encima del 50%. Ese encuadre es el punto. En un punto de referencia donde la mayoría de los modelos de vanguardia se sitúan en los 40, superar la mitad es el tipo de salto en el que OpenAI quiere anclar el lanzamiento.
Léelo con la misma cautela que la cifra de Terminal-Bench. El 50.9% es una afirmación de informes secundarios, no un número que hayamos medido, y "el único modelo por encima del 50%" es una instantánea que otros laboratorios superarán en semanas. La lectura honesta: si tu trabajo es genuinamente de codificación agencial y de largo plazo, donde un modelo tiene que llevar una tarea a su finalización, este es el punto de referencia que argumenta a favor de esperar. Si tu trabajo es de codificación de solicitud y respuesta más corta, la brecha con un modelo que ya ejecutas es menor de lo que sugiere el titular.
ExploitBench: eficiencia sobre puntuación bruta
El tercer punto de referencia es el más interesante para la decisión de esperar o seguir adelante, porque no se trata realmente de una puntuación más alta. ExploitBench (y el relacionado ExploitGym) miden la capacidad de ciberseguridad. Sol está ajustado para encontrar vulnerabilidades de software y escribir correcciones mientras resiste los esfuerzos para crear cadenas de exploits completas. Esta es una postura defensiva, no un modelo de hacking ofensivo, y OpenAI lo llama su "pila de seguridad más robusta hasta la fecha".
Según la cobertura temprana, en ExploitBench Sol es competitivo con Mythos Preview de Anthropic mientras usa aproximadamente un tercio de los tokens de salida. El mismo patrón aparece en el lado científico: en GeneBench v1, OpenAI reporta una mejora sobre GPT-5.5 usando menos tokens.

La historia de los tokens es la que tiene consecuencias presupuestarias reales. Si Sol alcanza un nivel de calidad similar con un tercio de los tokens de salida, el costo efectivo por tarea resuelta cae muy por debajo de lo que la tarifa de $5 de entrada / $30 de salida por millón de tokens sugiere en papel. Ese es el argumento de eficiencia para esperar: no que Sol sea más inteligente en cada mensaje, sino que puede llegar a la misma respuesta de manera más económica en las cargas de trabajo para las que está ajustado. La tarjeta del sistema de seguridad de implementación de OpenAI es donde se documenta el marco de seguridad y cibernético, y vale la pena leerla antes de tratar cualquier número cibernético como una base.
Cómo leer estas puntuaciones frente a tu línea de base
Une los tres puntos de referencia y aparecerá una forma. El caso de Sol es más sólido en trabajos largos, agenciales y que requieren muchas herramientas: tareas de terminal, codificación de varios pasos, barridos de seguridad defensivos. En esos, afirma unos pocos puntos de ventaja sobre Mythos 5 y una brecha más amplia sobre GPT-5.5, además de una ventaja en eficiencia de tokens.
Lo que los puntos de referencia no muestran es igual de importante. No hay un límite de tokens de salida máximo publicado, ni un corte de conocimiento declarado, ni una lista de modalidades confirmada. La ventana de contexto se reporta como aproximadamente 1.5M tokens por un medio y "no especificada" por otro, así que trátala como no confirmada.
El veredicto: esperar o seguir adelante
Aquí está el corte honesto.
Espera si: tu carga de trabajo principal es codificación agencial, sesiones de terminal largas o seguridad defensiva, y puedes esperar unas semanas. La ventaja de Terminal-Bench, el resultado del Examen Final del Agente y la eficiencia de tokens de ExploitBench apuntan exactamente a ese perfil. Si unos pocos puntos porcentuales en esas tareas cambian tu economía, vale la pena observar Sol de cerca. Espera la disponibilidad general y, lo que es más importante, los puntos de referencia independientes que confirmen o desinflen las cifras de lanzamiento.
No te molestes en esperar si: necesitas un modelo en producción ahora, o tu trabajo es codificación de solicitud y respuesta más corta, chat, resumen o clasificación. No puedes obtener Sol hoy de todos modos, los IDs del modelo ni siquiera están publicados, y las alternativas que puedes ejecutar ahora mismo cierran la mayor parte de la brecha en el trabajo diario. Esperar a que un modelo bloqueado se envíe antes de solucionar un problema que tienes hoy es la decisión incorrecta. La medida más inteligente es elegir un modelo de vanguardia que realmente puedas usar; nuestro resumen de los modelos de vanguardia que puedes usar hoy relaciona cada uno con el trabajo para el que se está promocionando Sol.
Una nota más honesta: incluso cuando llegue la GA, la primera ola será GPT-5.6 en toda la línea de niveles, incluyendo Terra y Luna, no solo Sol. Terra se posiciona como aproximadamente 2 veces más barata que GPT-5.5 con un rendimiento similar, que es el nivel que la mayoría de los equipos terminarán usando. Así que "esperar a Sol" puede significar realmente esperar para elegir el nivel correcto, y esa es una decisión más tranquila de lo que implican los titulares de los puntos de referencia.
Dónde encaja Apidog mientras esperas
Aún no puedes probar Sol. Pero mientras tanto, puedes probar todo lo demás a lo que recurrirías. Mythos 5, GPT-5.5, Gemini y el resto exponen API compatibles con OpenAI o API HTTP estándar, y puedes controlarlos, afirmar sus respuestas y comparar comportamientos en Apidog hoy mismo. Configura una solicitud, dirígela al punto final de cada modelo y tendrás un arnés repetible para la decisión de la que trata este artículo.

Ese arnés también es tu preparación para el primer día de Sol. El día en que llegue tu acceso anticipado, o se abra la GA, simplemente cambiarás el punto final y el ID del modelo y ejecutarás los mismos escenarios que ya construiste. Sin nuevas herramientas, sin prisas. Descarga Apidog para construir esas pruebas contra los modelos que puedes usar ahora, así estarás listo en el momento en que se abra el restringido.
Conclusión
Los puntos de referencia de GPT-5.6 Sol son sólidos, específicamente en el trabajo agencial y de seguridad para el que fue ajustado, y siguen siendo solo afirmaciones bajo una restricción gubernamental que no puedes superar hoy. Espera si ese perfil de vanguardia es tu trabajo y puedes aguantar unas semanas. De lo contrario, sigue adelante con un modelo que puedas implementar ahora y revisa cuando Sol obtenga números independientes y un punto final público.
Crea tu arnés de evaluación contra los modelos que puedes usar hoy en Apidog, para que estés listo para probar Sol el día que obtengas acceso.
