OpenAI rebaja precios de la API GPT-5.6: Luna 80% menos, Terra 20% menos (Nuevo desglose de precios)

OpenAI redujo los precios de la API de GPT-5.6 el 30 de julio de 2026: Luna bajó un 80% a 0,20 $/1,20 $ por millón de tokens, Terra un 20% a 2 $/12 $. Lista de precios completa (antigua vs. nueva), por qué OpenAI recortó los precios y cómo redirigir tus cargas de trabajo.

Ashley Innocent

Ashley Innocent

31 July 2026

OpenAI rebaja precios de la API GPT-5.6: Luna 80% menos, Terra 20% menos (Nuevo desglose de precios)

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

OpenAI redujo los precios de la API en dos de sus tres modelos GPT-5.6 el 30 de julio de 2026. GPT-5.6 Luna ahora cuesta un 80% menos: $0.20 por millón de tokens de entrada y $1.20 por millón de tokens de salida. GPT-5.6 Terra bajó un 20% a $2 de entrada y $12 de salida. GPT-5.6 Sol, el modelo de razonamiento insignia, mantiene sus tarifas de $5 y $30, pero obtiene un nuevo modo Rápido que funciona 2.5 veces más rápido al doble del precio estándar.

Si construyó su modelo de costos en torno a los precios de lanzamiento de GPT-5.6, esos cálculos ahora están desactualizados. Esta publicación cubre la nueva tabla de tarifas, por qué OpenAI redujo los precios, cómo se comparan los números con el nivel Gemini Flash de Google y qué cambiar en su propio enrutamiento de API esta semana. Y dado que la forma más rápida de comparar los costos de los modelos es probar la misma solicitud en cada nivel, herramientas como Apidog facilitan el envío de una misma instrucción a Sol, Terra y Luna en paralelo y la medición del gasto de tokens antes de comprometerse.

botón

La nueva tabla de tarifas de GPT-5.6

Aquí está el antes y el después completo, por millón de tokens:

Modelo Entrada antigua Nueva entrada Salida antigua Nueva salida Cambio
GPT-5.6 Sol $5.00 $5.00 $30.00 $30.00 Sin cambios
GPT-5.6 Terra $2.50 $2.00 $15.00 $12.00 -20%
GPT-5.6 Luna $1.00 $0.20 $6.00 $1.20 -80%

Los nuevos precios entraron en vigor el 30 de julio de 2026 y se aplican al nivel de API estándar. La diferencia entre la parte superior e inferior de la familia saltó de 5x en disponibilidad general el 9 de julio a 25x hoy. Esa brecha cambia la decisión de enrutamiento. Hace tres semanas, enviar una tarea a Luna en lugar de Sol le ahorraba el 80% de la factura. Ahora le ahorra el 96%.

Los descuentos de caché de instrucciones aún se aplican además de estas tarifas. OpenAI no ha publicado precios separados de entrada en caché para las nuevas tarifas de Luna y Terra en el anuncio, así que consulte la página oficial de precios antes de actualizar las previsiones de facturación que dependen de las lecturas de caché.

Qué pasó con Sol

El precio de lista de Sol no ha cambiado, pero sus opciones de velocidad sí. OpenAI introdujo un modo Rápido para Sol: 2.5 veces más rápido en la generación de tokens al doble de la tarifa estándar. El modo Rápido reemplaza el nivel de Procesamiento Prioritario anterior, por lo que si su tráfico de producción funciona hoy con Procesamiento Prioritario, debe migrar esa configuración y volver a verificar la línea de factura en la que aterriza.

La lectura práctica: OpenAI está segmentando Sol por latencia en lugar de descontarlo. Los equipos que necesitan un razonamiento de primera línea a velocidades interactivas pagan una prima por ello. Todos los demás se dirigen hacia abajo en la familia, que es exactamente hacia donde lo empujan los recortes de precios.

Por qué OpenAI redujo los precios

OpenAI enmarca los recortes como ganancias de eficiencia traspasadas, en lugar de una estrategia de pérdida de liderazgo. El anuncio atribuye los siguientes cuatro factores:

Ese último detalle es el que vale la pena recordar. OpenAI dice que Sol reescribió autónomamente los kernels de servicio, reduciendo la sobrecarga de servicio de extremo a extremo en un 20% y mejorando la eficiencia de generación de tokens en más del 15%. "Hacer que la inteligencia avanzada sea más abundante y asequible es fundamental para la misión de OpenAI", dijo la compañía en el anuncio. Independientemente de lo que se piense del marco de la misión, el mecanismo es concreto: el modelo ahora es lo suficientemente barato como para servir, lo que permite a OpenAI reducir el precio de Luna en un 80% y aun así proteger el margen.

También hay un obvio impulsor competitivo. La cobertura de VentureBeat enmarca el recorte como una respuesta directa al nivel Flash de Google. El precio de lista combinado de Luna (entrada más salida) es ahora de $1.40 por millón de tokens, lo que lo sitúa por debajo tanto de Gemini 3.5 Flash-Lite a $2.80 como de Gemini 3.6 Flash a $9. El extremo económico de la frontera es donde se encuentra el volumen, y OpenAI lo quiere de vuelta.

Lo que el recorte significa para sus cargas de trabajo

El recorte del 80% de Luna es el que cambia las decisiones de arquitectura, no el recorte del 20% de Terra. Algunos cambios concretos:

Los bucles de agente se vuelven baratos. Las cargas de trabajo agentivas queman tokens en largas cadenas: planificar, llamar a una herramienta, leer el resultado, reintentar. A $1 de entrada y $6 de salida, ejecutar esos bucles en Luna era defendible. A $0.20 y $1.20, es lo predeterminado. El propio anuncio de OpenAI destaca los bucles de agente complejos como la carga de trabajo que el nuevo precio de Luna desbloquea.

La clasificación, extracción y resumen se mueven a niveles inferiores. Si mantuvo estas tareas en Terra porque el margen de calidad de Luna le parecía escaso, vuelva a ejecutar la evaluación. La calidad no cambió; el precio sí. Una carga de trabajo que cuesta $100 al día en Terra cuesta alrededor de $11 en Luna con las nuevas tarifas.

Terra como predeterminado es más barato de defender. Nuestro desglose de Sol vs Terra vs Luna recomendó Terra como el valor predeterminado sensato para el trabajo diario. Ese consejo se mantiene, y ahora cuesta un 20% menos seguirlo.

El dial de esfuerzo sigue siendo más importante que la tabla de tarifas. GPT-5.6 expone seis niveles de esfuerzo de razonamiento, y un esfuerzo mayor produce más tokens del lado de la salida, que es la dirección cara en cada nivel. Un recorte de precios no soluciona una configuración de esfuerzo sobreaprovisionada.

Cómo volver a verificar sus propios números

No confíe ciegamente en los porcentajes; mida su tráfico real. El flujo de trabajo que detecta sorpresas temprano:

  1. Extraiga una muestra representativa de instrucciones de producción.
  2. Envíe las mismas solicitudes a gpt-5.6-luna, gpt-5.6-terra y gpt-5.6-sol y capture los recuentos de tokens por respuesta.
  3. Multiplique por las nuevas tarifas y compare con la calidad en su propio conjunto de evaluación.

Apidog hace que el paso 2 sea rápido: defina el endpoint de finalización del chat una vez, cambie el ID del modelo con una variable de entorno y ejecute el mismo escenario de prueba contra los tres niveles. El visor de respuestas muestra el bloque usage por llamada, por lo que obtiene recuentos reales de tokens de entrada y salida en lugar de estimaciones. Si está conectando GPT-5.6 a una aplicación por primera vez, nuestra guía para usar la API de GPT-5.6 explica la autenticación, los ID de modelo y la forma de la solicitud. También puede simular el endpoint mientras espera la aprobación del presupuesto, luego cambiar al tráfico en vivo sin reescribir las pruebas. Descargue Apidog gratis para ejecutar la comparación.

El panorama general: la guerra de precios está en marcha

Este es el tercer movimiento importante de precios en el extremo económico de la frontera este verano. Google actualizó su nivel Flash en julio, Anthropic lanzó Claude Opus 5 a la mitad del precio de Fable 5, y ahora OpenAI ha bajado el precio de Luna por debajo de ambas opciones de Gemini Flash. La calidad del modelo todavía separa a los modelos insignia, pero el nivel de caballo de batalla está convergiendo en una regla simple: el que sea más barato este mes gana los trabajos por lotes.

Para los equipos de API, eso significa que la elección del modelo ya no es una decisión anual. Construya su integración de modo que el ID del modelo sea un valor de configuración, mantenga un conjunto de evaluación permanente y vuelva a ejecutar la comparación de costos cada vez que un proveedor se mueva. Los equipos que tratan el enrutamiento del modelo como infraestructura, con pruebas y monitoreo a su alrededor, capturan cada recorte de precios en días en lugar de trimestres.

Preguntas Frecuentes

¿Cuáles son los nuevos precios de la API de GPT-5.6?

A partir del 30 de julio de 2026: Luna cuesta $0.20 por millón de tokens de entrada y $1.20 por millón de tokens de salida; Terra cuesta $2 y $12; Sol no ha cambiado a $5 y $30. Sol también obtuvo un modo Rápido al doble de la tarifa estándar para un procesamiento 2.5 veces más rápido.

¿GPT-5.6 Sol obtuvo un recorte de precios?

No. Las tarifas estándar de Sol no han cambiado. Los cambios en Sol son estructurales: un nuevo modo Rápido reemplaza el nivel de Procesamiento Prioritario, intercambiando el doble del precio por 2.5 veces la velocidad.

¿Es GPT-5.6 Luna ahora más barato que Gemini Flash?

Según el precio de lista, sí. La tarifa combinada de entrada y salida de Luna es de $1.40 por millón de tokens, frente a los $2.80 de Gemini 3.5 Flash-Lite y los $9 de Gemini 3.6 Flash. Sin embargo, el precio no es calidad: ejecute ambos contra su propio conjunto de evaluación antes de cambiar. Si desea la ruta gratuita primero, consulte cómo usar GPT-5.6 gratis.

¿Los recortes de precios se aplican automáticamente?

Sí. Las nuevas tarifas se aplican al uso estándar de la API a partir del 30 de julio de 2026 sin necesidad de cambios en el código. Solo necesita actuar si utiliza el Procesamiento Prioritario en Sol, que será reemplazado por el modo Rápido.

Qué hacer esta semana

La nueva tabla de tarifas recompensa a los equipos que se mueven rápido. Vuelva a ejecutar su modelo de costos con los nuevos números, reevalúe qué cargas de trabajo puede absorber Luna a un 96% por debajo del precio de Sol, y verifique si el recorte del 20% de Terra cambia algún umbral de enrutamiento. Luego verifique con tráfico real en lugar de cálculos de precios de lista: un escenario de prueba en Apidog, tres ID de modelo, y los números de usage le dirán exactamente cuánto vale el recorte para usted.

botón

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs