GPT-6 Astra para desarrolladores: API, precios, 1M de contexto y novedades frente a GPT-5.6 Sol

Guía de la API de GPT-6 Astra: ID de modelo gpt-6-astra, precios de $10/$50 con contexto largo, tarifas para los modos Batch y Fast, 1.05M de contexto, cinco niveles de esfuerzo y los cambios disruptivos de GPT-5.6 Sol.

Medy Evrard

5 September 2026

GPT-6 Astra para desarrolladores: API, precios, 1M de contexto y novedades frente a GPT-5.6 Sol

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

OpenAI lanzó GPT-6 Astra el 3 de septiembre de 2026, primero a un conjunto limitado de organizaciones y luego, durante los días siguientes, a todos los usuarios de ChatGPT Plus, Pro, Business y Enterprise, la API de OpenAI, Microsoft Azure y AWS Bedrock. El ID del modelo es gpt-6-astra, tiene una ventana de contexto de 1,050,000 tokens, y OpenAI lo llama "el mejor modelo para ingeniería de software hasta la fecha". También es el primer modelo que OpenAI ha calificado como Crítico para capacidad de ciberseguridad, lo que define cómo se comporta en la API.

Esta es la guía práctica. Cubre el ID del modelo y los puntos finales, su primera solicitud, los cinco niveles de esfuerzo de razonamiento, la tabla de precios completa que incluye las tarifas de contexto largo y modo Rápido, los cambios que rompen una integración de GPT-5.6 Sol, y si el precio 2.5 veces superior a la tarifa promocional de Sol es suficiente. La página del modelo de OpenAI es la fuente oficial de los números a continuación. Para saber cómo se siente trabajar con él, lea nuestro análisis práctico de dos días; esta pieza se centra en la API.

En resumen

GPT-6 Astra de un vistazo

Elemento Valor
ID del modelo gpt-6-astra
Ventana de contexto 1,050,000 tokens
Salida máxima 128,000 tokens
Fecha límite de conocimiento 30 de abril de 2026
Modalidades Entrada: texto, imagen. Salida: texto
Puntos finales Chat Completions, Responses, Batch
No compatible Realtime, Assistants, fine-tuning
Características Streaming, salidas estructuradas, llamada de función, búsqueda de archivos, búsqueda web, caché de prompts, entrada de imagen
Herramientas integradas Uso de computadora, búsqueda web, búsqueda de archivos, intérprete de código, generación de imágenes
Esfuerzo de razonamiento low, medium, high, xhigh, max
Límites de tasa (Nivel 5) 15,000 RPM, 40,000,000 TPM
También disponible en Microsoft Azure, AWS Bedrock; OpenRouter como openai/gpt-6-astra
Manejo de datos Retención Cero de Datos para clientes de API elegibles

Los espacios de trabajo Enterprise tienen Astra desactivado por defecto; un administrador debe habilitarlo. En ChatGPT, el uso de Astra cuenta contra el límite de suscripción existente, y los planes Pro, Business y Enterprise también reciben GPT-6 Astra Pro.

Gráfico mostrando las diferencias entre GPT-6 Astra, GPT-5.6 Sol y GPT-5.6 Luna con respecto a la respuesta a las instrucciones, el tiempo de respuesta y la precisión.

Su primera solicitud

La API de Responses es la superficie principal, y es necesaria para las herramientas. Una llamada mínima en Python:

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "medium"},
    input=[
        {"role": "developer", "content": "Eres un ingeniero de API senior. Prioriza la acción. Pregunta solo cuando la respuesta cambiaría el resultado."},
        {"role": "user", "content": "Revisa esta operación OpenAPI en busca de fallos de autenticación y validación, luego propone tres casos de prueba."},
    ],
)

print(response.output_text)
print(response.usage)

La misma solicitud en curl:

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "reasoning": {"effort": "medium"},
    "input": "Revisa esta operación OpenAPI en busca de fallos de autenticación y validación, luego propone tres casos de prueba."
  }'

Chat Completions sigue funcionando para texto plano: cambie el punto final y la forma del mensaje, y elimine cualquier campo temperature o top_p, que la guía de OpenAI dice que deben eliminarse. En el momento en que necesite una llamada a función o una herramienta integrada, pase a Responses. Nuestra guía de la API de Responses cubre la forma de la solicitud en profundidad.

El mensaje del desarrollador es más importante de lo que solía ser. La guía del modelo de OpenAI dice que Astra "pide aclaraciones con más facilidad" que sus predecesores y recomienda indicarle que priorice la acción. También es "más sensible a las instrucciones contenidas en las habilidades" y otros archivos adjuntos, por lo que debe indicar que las instrucciones del usuario prevalecen cuando entran en conflicto. Y por defecto utiliza listas y tablas; si desea prosa, pídala.

Esfuerzo de razonamiento: cinco niveles, sin “none”

GPT-5.6 exponía seis niveles de esfuerzo, desde none hasta max. Astra expone cinco: low, medium, high, xhigh y max. El consejo de migración de OpenAI es directo: si actualmente ejecuta none o minimal, pase a low y evalúe. Todo lo demás mantiene su configuración actual.

Esa eliminación cambia el extremo más económico de su carga de trabajo. Luna en none era la opción de finalización clásica rápida en la familia GPT-5.6, y no hay un equivalente en Astra. Astra es un modelo de razonamiento en cada configuración, razón por la cual enrutar el trabajo mecánico a GPT-5.6 Terra o Luna y reservar Astra para las llamadas difíciles sigue siendo el patrón sensato.

En el otro extremo, max es donde se ejecutaron los benchmarks de lanzamiento ("las puntuaciones de evaluación son las máximas en cualquier esfuerzo") y donde Artificial Analysis midió un tiempo hasta el primer token de más de siete minutos en su ejecución de máximo esfuerzo. Presupueste la latencia antes de presupuestar los tokens.

Lo que cuesta GPT-6 Astra

Por millón de tokens, de la página de precios de OpenAI:

Nivel Entrada Entrada en caché Salida
Estándar $10.00 $1.00 $50.00
Estándar, contexto largo (más de 272K de entrada) $20.00 $2.00 $75.00
Batch / Flex $5.00 $0.50 $25.00
Batch, contexto largo $10.00 $1.00 $37.50
Modo Rápido $20.00 $2.00 $100.00
Modo Rápido, contexto largo $40.00 $4.00 $150.00

Las escrituras en caché se facturan a $12.50 por millón. El modo Rápido ofrece "hasta 2 veces la velocidad de procesamiento Estándar al doble del precio Estándar".

Para comparar, la familia actual de GPT-5.6:

Modelo Entrada Entrada en caché Salida
GPT-5.6 Sol (promoción hasta al menos el 21 de noviembre de 2026) $4.00 $0.40 $20.00
GPT-5.6 Terra $2.00 $0.20 $12.00
GPT-5.6 Luna $0.20 $0.02 $1.20

El precio de lista de Sol es $5 y $30; la tarifa de $4 y $20 ha estado vigente desde el 21 de agosto y OpenAI dice que se mantendrá al menos hasta el 21 de noviembre. Frente a eso, Astra es 2.5 veces más caro en entrada y 2.5 veces más en salida. Frente al precio de lista de Sol, es 2 veces y 1.67 veces más caro.

Un ejemplo práctico. Una ejecución de agente que lee una instantánea de una base de código de 200,000 tokens una vez, la reutiliza como un prefijo en caché en 30 llamadas, y escribe un total de 60,000 tokens de salida:

La proporción se mantiene en 2.5x. Lo que OpenAI argumenta, y lo que usted debe medir, es que Astra termina en menos llamadas y menos tokens de salida. En Terminal-Bench 4.0 afirma un costo por tarea aproximadamente un 9% menor que Sol a pesar de la tarifa más alta, y aproximadamente un 65% menos de tokens de salida que Claude Opus 5 en Agents’ Last Exam. Si esto se mantiene para su carga de trabajo, la factura por tarea puede nivelarse. Si no, pagará 2.5x.

Dos factores mantienen la factura baja. El umbral de 272K es el que hay que vigilar: un prompt que lo cruza duplica las tarifas de entrada y caché, así que recorte las salidas de las herramientas y almacene en caché el prefijo estático. Y Batch reduce todo a la mitad para el trabajo que puede esperar.

Migrando desde GPT-5.6 Sol: qué se rompe

OpenAI publicó una lista corta, y vale la pena tomarla literalmente.

  1. Los parámetros de muestreo han desaparecido. Elimine temperature, top_p y top_logprobs. En Chat Completions también elimine logprobs; en Responses elimine message.output_text.logprobs de include. La guía de OpenAI es eliminarlos en lugar de confiar en que la API los ignore, así que revise su código cliente.
  2. El límite inferior de esfuerzo es low. Cualquier configuración de none o minimal pasa a low.
  3. La retención de caché cambió de forma. Reemplace prompt_cache_retention por prompt_cache_options.ttl configurado en "30m". El modo de caché explícito que configuró para GPT-5.6 se mantiene en lo demás.
  4. Las herramientas necesitan Responses. Chat Completions es compatible para texto, pero la llamada de función y las herramientas integradas residen en la API de Responses.
  5. Los prompts quieren menos ambigüedad de usted y más de él. Agregue la línea de "priorizar la acción", declare que las instrucciones del usuario tienen prioridad sobre los archivos de habilidades, y solicite prosa donde su interfaz de usuario espere prosa.

Nada en la lista afecta las salidas estructuradas o las definiciones de funciones, por lo que un esquema que funcionaba en Sol funciona en Astra. El cambio de comportamiento que la mayoría de los equipos notan primero es la "pregunta": un prompt de Sol que se ejecutaba hasta completarse ahora puede detenerse con una pregunta aclaratoria. Responda a ella en el mensaje del desarrollador al principio y dejará de preguntar.

¿Vale la pena 2.5 veces el precio de Sol?

Para el trabajo con agentes y de contexto largo, los números de lanzamiento dicen que sí. Todas las cifras a continuación son ejecutadas por OpenAI, con el mejor esfuerzo para cada modelo:

Benchmark GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
Terminal-Bench 4.0 57.9% 37.3% 55.8%
DeepSWE v1.1 74.1% 72.7% 67.4%
FrontierCode 1.1 Extended 64.5% 60.6% 63.6%
Tareas internas de migración de bases de datos 63.9% 42.7% 57.8%
OSWorld 2.0 72.6% 65.7% -
MRCR v2 8-needle, 512K a 1M 96.3% 73.8% -
GPQA Diamond 96.0% 94.6% 93.7%
Examen Final de la Humanidad (con herramientas) 57.2% - 65.0%

Las brechas en Terminal-Bench y la migración de bases de datos son las que importan a los desarrolladores: 20 puntos por encima de Sol en el trabajo de terminal con agentes, y una puntuación de recuperación de contexto largo que hace que la ventana de 1M sea utilizable en lugar de nominal. La brecha en DeepSWE es pequeña, y Claude Fable 5.1 aún lidera en el Examen Final de la Humanidad por casi ocho puntos, por lo que no es una victoria limpia. En el índice independiente de Artificial Analysis, Astra ocupa el segundo lugar entre 202 modelos. Nuestro desglose de benchmarks de Fable 5.1 tiene la otra parte de esa comparación.

Donde Sol mantiene su trabajo: llamadas cortas y de alto volumen donde el límite inferior de esfuerzo y la tarifa de 2.5x dominan, y cualquier cosa que necesite latencia al estilo none. Donde Astra se lo gana: ejecuciones largas de agentes, contexto de repositorio completo, uso de computadora y cualquier tarea donde el modo de fallo de Sol era divagar o rendirse.

Pruebe el cambio antes de implementarlo

La migración es lo suficientemente pequeña como para hacerla en una tarde y lo suficientemente trascendente como para medirla. En Apidog, mantenga el ID del modelo como una variable de entorno para que la misma solicitud guardada se ejecute contra gpt-5.6-sol y gpt-6-astra con un solo cambio. Agregue aserciones en usage.input_tokens, usage.output_tokens y el recuento de tokens en caché, luego envíe un conjunto representativo de tareas a través de ambos y compare los totales; esa es la pregunta del 2.5x respondida con su propio tráfico en lugar de un gráfico de lanzamiento.

Dos comprobaciones más pertenecen al mismo proyecto. Envíe una solicitud que aún contenga temperature y registre lo que se devuelve, para que aprenda el comportamiento en una prueba en lugar de en producción. Y asegúrese de que un prompt largo permanezca por debajo de los 272K tokens de entrada, porque cruzar esa línea duplica silenciosamente la tarifa. Programe el conjunto como una regresión y descargue Apidog si aún no lo tiene; la guía de la API de GPT-5.6 muestra la misma configuración en la generación anterior.

Preguntas frecuentes

¿Cuál es el ID del modelo GPT-6 Astra? gpt-6-astra, con una única instantánea. También se expone a través de Azure y AWS Bedrock, y en OpenRouter como openai/gpt-6-astra.

¿GPT-6 Astra es compatible con fine-tuning o la API Realtime? No. La página del modelo enumera Chat Completions, Responses y Batch como compatibles, con Realtime, Assistants y fine-tuning como no compatibles.

¿Cuál es la ventana de contexto y la salida máxima? 1,050,000 tokens de entrada y 128,000 tokens de salida. Los prompts superiores a 272K tokens de entrada se facturan a la tarifa de contexto largo.

¿Por qué falló mi solicitud después de cambiar de Sol? Lo más probable es un temperature o top_p restante, un nivel de esfuerzo none o prompt_cache_retention. Astra eliminó los tres; consulte la lista de migración anterior.

¿Puede una solicitud detenerse por sí sola? Sí. OpenAI ejecuta un monitor de desalineación en las solicitudes que utilizan herramientas, y en la API una tarea marcada se detiene en lugar de pausarse para su revisión. Las ejecuciones largas de agentes son las más expuestas, así que hágalas reanudables. La publicación sobre el umbral cibernético crítico de GPT-6 Astra explica las salvaguardas detrás de ese comportamiento.

Qué hacer esta semana

Mueva una carga de trabajo de agente a gpt-6-astra en la API de Responses, elimine los parámetros de muestreo, establezca el esfuerzo en medium, y mida los tokens y el tiempo de ejecución en comparación con Sol en las mismas entradas. Si el costo por tarea resulta igual o mejor, migre el resto. Si no, tendrá un número, que es más de lo que la mayoría de los equipos tendrán para el viernes.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs