OpenAI lanzó GPT-5.6 con disponibilidad general el 9 de julio de 2026, y el acceso a la API es de autoservicio: cualquier cuenta de API puede llamarlo hoy mismo, sin lista de espera y sin restricciones de plan. La vista previa limitada que se ejecutó hasta principios de julio es historia. Lo que cambió para los desarrolladores es la forma del lanzamiento en sí. En lugar de un modelo, obtienes tres: Sol, Terra y Luna, cada uno con su propio precio, además de seis niveles de esfuerzo de razonamiento y controles explícitos de caché de prompts.
Eso implica más decisiones que un típico intercambio de modelos, y las configuraciones predeterminadas que eliges en la primera semana tienden a quedarse. Esta guía detalla los IDs de modelo y cuándo cada uno de ellos merece su lugar, tu primera solicitud en Python y curl, el esfuerzo de razonamiento, la configuración de la caché, la nueva superficie de la API de Respuestas y cómo migrar de GPT-5.5 sin sorpresas. Si quieres el contexto completo del nivel insignia primero, la descripción general de GPT-5.6 Sol cubre su posicionamiento y benchmarks; este artículo es más práctico.
Al final, tendrás llamadas funcionales a los tres niveles y una forma repetible de compararlos con tus propios prompts en Apidog, para que las decisiones de costo y calidad provengan de tus datos y no de la publicación de lanzamiento.
En resumen
- Tres IDs de modelo, una generación:
gpt-5.6-sol(razonamiento más profundo),gpt-5.6-terra(equilibrado),gpt-5.6-luna(más rápido y barato). El alias simplegpt-5.6se enruta a Sol. - El acceso a la API es de autoservicio para cualquier cuenta de OpenAI API. No quedan restricciones.
- Precios por 1M de tokens: Sol $5 entrada / $30 salida, Terra $2.50 / $15, Luna $1 / $6.
- El esfuerzo de razonamiento tiene seis niveles, de
noneamax. El modo Pro es una configuración (reasoning.mode: "pro") en los tres modelos, no un modelo separado. - Llegó el almacenamiento en caché explícito de prompts:
prompt_cache_options.mode: "explicit"más unttl. Las escrituras se facturan a 1.25x, las lecturas mantienen el 90% de descuento, y los cachés duran al menos 30 minutos. - Migrar de GPT-5.5 es un pase de ajuste: prueba un nivel de esfuerzo más bajo y elimina las directivas de brevedad de tus prompts.
Los tres IDs de modelo y cuándo elegir cada uno
GPT-5.6 rompe con la nomenclatura habitual de OpenAI. El número es la generación; Sol, Terra y Luna son niveles de capacidad duraderos que avanzarán a su propio ritmo, como explica la cobertura de lanzamiento de MarkTechPost. El nivel en el que te estandarizas hoy mantendrá su significado en la próxima generación.
| ID de Modelo | Nivel | Entrada / salida por 1M de tokens | Recúrrele cuando |
|---|---|---|---|
gpt-5.6-sol |
Insignia | $5 / $30 | Razonamiento profundo, orquestación de agentes, depuración difícil |
gpt-5.6-terra |
Equilibrado | $2.50 / $15 | Funciones de producto cotidianas, trabajo de clase GPT-5.5 a menor coste |
gpt-5.6-luna |
Rápido | $1 / $6 | Clasificación, extracción, enrutamiento, borrador inicial |
Sol es el modelo insignia. OpenAI informa que alcanza aproximadamente 53 en el Examen Final de Agentes frente a 46.9 para GPT-5.5, así que tómalo como una afirmación del día del lanzamiento y verifícalo con tus propias tareas. Terra es la opción pragmática: OpenAI lo posiciona como competitivo con GPT-5.5 a aproximadamente la mitad del coste. Luna existe para trabajos de alto volumen y sensibles a la latencia donde te importan más las economías unitarias que la profundidad.
Una configuración predeterminada sensata: prototipa en Terra, escala a Sol solo cuando Terra falle de manera medible, y empuja las rutas de alto volumen a Luna una vez que el prompt sea estable. El desglose de precios de GPT-5.6 profundiza en cómo estas tarifas se comparan entre generaciones y rivales.
Un alias que vale la pena conocer: gpt-5.6 sin sufijo se enruta a Sol. Fija los IDs de nivel explícitos en el código de producción para que cada llamada indique exactamente su costo.
Tu primera solicitud
Los IDs de modelo a continuación coinciden exactamente con los documentos para desarrolladores de OpenAI. Necesitas una clave API de OpenAI con la facturación habilitada; nada más.
Chat Completions funciona sin cambios, por lo que el código existente solo necesita un intercambio de modelo:
from openai import OpenAI
client = OpenAI()
response = client.chat.completions.create(
model="gpt-5.6-sol",
messages=[
{"role": "system", "content": "You are a concise code reviewer."},
{"role": "user", "content": "Review this for edge cases: def parse_price(raw): return float(raw.strip('$'))"}
]
)
print(response.choices[0].message.content)
La misma llamada en curl:
curl https://api.openai.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-d '{
"model": "gpt-5.6-sol",
"messages": [
{"role": "user", "content": "Explain idempotency keys in one paragraph."}
]
}'
Para nuevas construcciones, apunta a la API de Respuestas. Todas las adiciones de disponibilidad general se encuentran allí, y acepta un bloque de razonamiento directamente:
response = client.responses.create(
model="gpt-5.6-terra",
input="Summarize the trade-offs between webhooks and polling.",
reasoning={"effort": "low"}
)
print(response.output_text)
Ejecuta el mismo prompt contra los tres niveles antes de escribir otra línea de código de integración. Las diferencias en tono, longitud y latencia son más fáciles de sentir que de leer.
Seleccionar un esfuerzo de razonamiento
GPT-5.6 expone seis niveles de esfuerzo de razonamiento: none, low, medium, high, xhigh y max.
none desactiva el razonamiento. Úsalo cuando la tarea sea mecánica y la latencia importe más que la profundidad: reformateo, extracción contra un esquema claro, relleno de plantillas. Luna en none se comporta como un modelo de completado clásico rápido, y esa combinación es donde su tarifa de entrada de $1 brilla.
max se encuentra en el otro extremo. Resérvalo para problemas donde una respuesta incorrecta cuesta más que una lenta: errores sutiles de concurrencia, revisiones de arquitectura, planificación en varios pasos. Espera esperas más largas y una factura mayor.
La mayoría de las cargas de trabajo se encuentran en el medio. Comienza en medium, avanza un nivel a la vez y mide la calidad antes de aceptar el costo adicional de subir. Moverse hacia abajo a menudo es gratis: la propia guía de migración de OpenAI dice que muchas cargas de trabajo de GPT-5.5 mantienen la calidad un nivel más bajo en GPT-5.6.
El modo Pro es independiente del esfuerzo. Establece reasoning.mode: "pro" y el modelo priorizará la calidad de la respuesta sobre la velocidad. Funciona en los tres niveles y es una configuración, no un ID de modelo diferente, por lo que no hay un identificador Pro específico que buscar. Las cargas de trabajo que priorizan la calidad, como los resúmenes legales o los análisis post mortem de incidentes, son su dominio. Para conocer la forma y las restricciones exactas de la solicitud, consulta la referencia de la API de OpenAI.
Configuración de la caché de prompts
GPT-5.6 añade un control explícito de caché. Establece prompt_cache_options.mode en "explicit" y decides qué se almacena en caché en lugar de depender de la detección automática de prefijos:
response = client.responses.create(
model="gpt-5.6-luna",
input=[
{"role": "system", "content": SUPPORT_PLAYBOOK},
{"role": "user", "content": ticket_text}
],
prompt_cache_options={"mode": "explicit"}
)
Un campo ttl en el mismo objeto de opciones establece cuánto tiempo permanece activo el prefijo en caché; lo que sea que solicites, el mínimo es de 30 minutos. Los valores ttl aceptados y las reglas de colocación de puntos de interrupción se encuentran en la referencia de la API de OpenAI.
La economía es simple. Las escrituras en caché se facturan a 1.25x la tasa de entrada sin caché. Las lecturas en caché mantienen el 90% de descuento. Así, el almacenamiento en caché compensa a partir del segundo acceso: dos pases sin caché sobre un prefijo cuestan 2.0x su precio por token, mientras que una escritura más una lectura cuesta 1.35x.
Un ejemplo práctico. Digamos que un bot de soporte envía una guía de 40.000 tokens en cada llamada a Luna. Sin caché, ese prefijo cuesta $0.04 por llamada a la tasa de entrada de $1 por 1M de Luna. Con el almacenamiento en caché explícito, la primera llamada escribe por $0.05, y cada lectura dentro del TTL cuesta $0.004. En una ráfaga de 100 llamadas, eso es $0.45 en lugar de $4.00, aproximadamente un 89% de descuento en la parte estática de tu factura. La vida útil mínima de 30 minutos significa que el tráfico en ráfagas con interrupciones de menos de media hora también sigue obteniendo lecturas baratas.
La regla general: cualquier prompt con un prefijo estático grande que se reutilice al menos dos veces dentro del TTL debería ejecutarse en modo explícito.
Novedades de la API de Respuestas en disponibilidad general
Se lanzaron tres adiciones con la disponibilidad general, todas en la API de Respuestas:
- Llamada programática a herramientas. En lugar del "baile" de ida y vuelta donde el modelo emite una llamada a herramienta, espera tu resultado y luego emite la siguiente, el modelo escribe JavaScript que orquesta tus herramientas. Ese código se ejecuta en un entorno de ejecución V8 aislado sin acceso a la red, por lo que puede hacer bucles, ramificar y combinar resultados de herramientas sin que tu servidor tenga que enviar mensajes de un lado a otro.
- Multi-agente, en beta. Una solicitud puede distribuir el trabajo a subagentes que se ejecutan en paralelo, útil cuando una tarea se divide en piezas independientes.
- Razonamiento persistente. El contexto de razonamiento se mantiene entre turnos a través de
reasoning.context, por lo que un agente de múltiples turnos no reconstruye su cadena de pensamiento desde cero en cada llamada.
También hay nuevas configuraciones de detalle de visión, original y auto, que preservan las dimensiones originales de la imagen. Las formas de solicitud y los parámetros para todo esto se encuentran en la referencia de la API de OpenAI; los mecanismos anteriores son sobre los que diseñar.
Migrando desde GPT-5.5
La guía de OpenAI es directa: trata la migración como un pase de ajuste, no solo un cambio de identificador de modelo. Si tu integración sigue el flujo de trabajo de nuestra guía de la API de GPT-5.5, tres ajustes importan.
Primero, prueba tu esfuerzo de razonamiento actual y un nivel inferior. GPT-5.6 a menudo mantiene la calidad un paso por debajo, lo que representa una reducción directa de costos para el mismo tráfico.
Segundo, espera respuestas más cortas. GPT-5.6 escribe una salida notablemente más concisa con menos introducciones genéricas. Si tus prompts contienen directivas como "sé conciso" o "salta el preámbulo", elimínalas y vuelve a probar, porque las instrucciones de brevedad apiladas ahora pueden excederse. El artículo del día del lanzamiento de Simon Willison es una lectura independiente útil sobre cómo se comporta la familia en la práctica.
Tercero, observa el uso de tokens en caché en tus respuestas mientras ajustas, y realiza un benchmark con un conjunto de tareas representativo antes de activar el tráfico de producción. Una salida comparable en Terra a la mitad del precio de GPT-5.5 es el resultado que vale la pena verificar primero.
Probando la API en Apidog
Curl demuestra que el endpoint funciona. Elegir entre tres niveles requiere algo repetible. Descarga Apidog y configura un pequeño sistema de comparación:

- Crea un entorno con tu
OPENAI_API_KEYmás tres variables:MODEL_SOL=gpt-5.6-sol,MODEL_TERRA=gpt-5.6-terra,MODEL_LUNA=gpt-5.6-luna. - Crea una solicitud POST a la API y referencia
{{MODEL_SOL}}en el cuerpo, luego duplícala dos veces e intercambia las otras variables. - Envía el mismo prompt con formato de producción a través de los tres y lee las respuestas una al lado de la otra.
- Verifica el bloque de uso en cada respuesta. Multiplica el recuento de tokens por la tasa de cada nivel y obtendrás una proyección de costos por solicitud basada en tus propios prompts, no en el benchmark de otra persona.
El mismo sistema demuestra su valía durante el ajuste del esfuerzo. Cambia el nivel de esfuerzo en una solicitud guardada, reenvíala y observa cómo se mueven los tokens de salida; ese número multiplicado por la tasa por token es tu curva calidad-costo, visible una solicitud a la vez.
Preguntas frecuentes
¿Está la API de GPT-5.6 disponible para todos?
Sí. Desde el 9 de julio de 2026, cualquier cuenta de OpenAI API puede llamar a los tres modelos de autoservicio. La restricción de vista previa previa al lanzamiento se levantó antes de la disponibilidad general, y el acceso a la API no depende de tu plan de ChatGPT. Los niveles de plan solo configuran el producto de chat, donde los usuarios de Free y Go obtienen Terra y los planes de pago desbloquean el selector completo de modelos.
¿Cuáles son la ventana de contexto y la fecha límite de conocimiento de GPT-5.6?
Según la cobertura de la documentación inicial, la familia tiene una ventana de contexto de 1 millón de tokens, una salida máxima de 128K y una fecha límite de conocimiento del 16 de febrero de 2026. La página del modelo de OpenAI es la fuente oficial; trata estas como cifras informadas hasta que las confirmes para tu cuenta.
¿Cuál es la diferencia entre el modo pro y ultra?
El modo Pro es una configuración de la API (reasoning.mode: "pro") que funciona en los tres modelos y prioriza la calidad de la respuesta sobre la velocidad. Ultra es una configuración multi-agente que ejecuta cuatro agentes en paralelo por defecto, y se encuentra en ChatGPT Work en los planes Pro y Enterprise, además de Codex desde Plus en adelante. El desglose del modo ultra de GPT-5.6 cubre cuándo el gasto extra deliberado de tokens vale la pena.
¿Debo construir sobre Chat Completions o la API de Respuestas?
El código existente de Chat Completions sigue funcionando con un simple intercambio de ID de modelo, por lo que no hay una reescritura forzada. Las nuevas construcciones deben apuntar a la API de Respuestas: la llamada programática a herramientas, el multi-agente y el razonamiento persistente se lanzaron allí, y la documentación de GPT-5.6 de OpenAI se centra en ella.
Conclusiones
No necesitas un proyecto de migración para empezar. Elige Terra, ejecuta un prompt real de tu producto a través de él con un esfuerzo medium, luego baja un nivel y compara. Implementa el almacenamiento en caché explícito si tus prompts comparten un gran prefijo estático; el ahorro del 89% en el ejemplo anterior es típico de lo que un gran prompt de sistema devuelve. Solo entonces decide dónde Sol y Luna encajan en tu stack.
Mantén también el sistema de comparación de tres niveles. Sol, Terra y Luna avanzarán a sus propios ritmos, por lo que la próxima versión será una nueva ejecución de solicitudes guardadas en lugar de un proyecto de investigación. Apidog mantiene esas solicitudes, entornos y recuentos de tokens en un solo lugar, lo que convierte cada futuro lanzamiento de modelo en una tarde de pruebas en lugar de una suposición.
