Si trasladó una carga de trabajo de agente a GPT-6 Astra a principios de septiembre, ya tiene tres semanas de facturas y ya conoce la magnitud del problema. Astra factura 10 dólares por millón de tokens de entrada y 50 dólares por millón de salida. Un bucle de larga duración con un "system prompt" extenso y un esquema de herramientas adjunto consume eso más rápido de lo que cualquier hoja de cálculo predecía.
El 22 de septiembre, OpenAI lanzó GPT-6 Sol a 2 y 10 dólares. La misma familia de modelos, la misma superficie de API, una quinta parte del precio en cada línea de la factura.
Esta es la migración. Lo que cambia en su código, que es casi nada. Lo que cambia en su factura, que es todo. Y la parte que la mayoría de la cobertura del día del lanzamiento omitió: OpenAI sigue diciendo que Astra es el mejor modelo, y la comparación publicada cara a cara entre los dos no es lo que parece.
TL;DR
gpt-6-astraagpt-6-soles un intercambio de cadena de modelo para la mayoría de los llamadores. La ventana de contexto, la salida máxima, los endpoints, las herramientas integradas, las características soportadas y los niveles de límite de tasa son idénticos.- Cada tarifa baja exactamente 5 veces: entrada de $10 a $2, entrada en caché de $1 a $0.20, escrituras en caché de $12.50 a $2.50, salida de $50 a $10. Su factura se divide por cinco independientemente de la mezcla de tokens.
- Sol añade un esfuerzo de razonamiento
none. También restringe la llamada a funciones de Chat Completions areasoning_effort: "none", el único cambio que puede romper una integración que funciona. - La fecha de corte de conocimiento de Sol es el 20 de abril de 2026. La de Astra es el 30 de abril de 2026.
- OpenAI dice que Astra "sigue siendo nuestro mejor modelo en todos los aspectos". El benchmark publicado Sol-versus-Astra ejecuta Astra en
lowcontra Sol enxhigh, por lo que mide la eficiencia de costos, no el límite de capacidad.
La tabla de precios
Ambos conjuntos de tarifas provienen de las páginas de modelos de OpenAI, gpt-6-astra y gpt-6-sol, consultadas el 23 de septiembre de 2026.
| Métrica, por 1M de tokens | GPT-6 Astra | GPT-6 Sol | Cambio |
|---|---|---|---|
| Entrada | $10 | $2 | 5 veces más barato |
| Entrada en caché | $1 | $0.20 | 5 veces más barato |
| Escrituras en caché | $12.50 | $2.50 | 5 veces más barato |
| Salida | $50 | $10 | 5 veces más barato |
Los modificadores de facturación coinciden en ambos modelos. Las prompts de más de 272K tokens de entrada se facturan a 2 veces las tarifas de entrada y caché y 1.5 veces la salida para toda la solicitud. El modo Batch y Flex son a mitad de precio. El modo Fast es el doble, y en Astra no conlleva SLA de latencia.

Dado que las cuatro tarifas bajan por el mismo factor, no es necesario modelar su mezcla de tokens para predecir el ahorro. Tomemos una carga de trabajo de agente concreta: 10,000 solicitudes al día, cada una con un prefijo en caché de 30,000 tokens, 10,000 tokens de entrada nueva y 3,000 tokens de salida.
| Componente | Tokens diarios | Astra | Sol |
|---|---|---|---|
| Entrada en caché | 300M | $300 | $60 |
| Entrada nueva | 100M | $1,000 | $200 |
| Salida | 30M | $1,500 | $300 |
| Total | $2,800 | $560 |
Cambie la mezcla hacia la salida, cámbiela hacia la caché, ejecute con un contexto de 272K y pague el multiplicador de prompt largo: la proporción se mantiene en cinco.
Para tener una idea de por qué esto importa, OpenAI informó que su propio investigador mediano gasta más de $600 al día en agentes de codificación, con el percentil 90 en $7,000 al día. Divida eso por cinco y el número de experimentos que un equipo puede permitirse cambia. El contexto más amplio para ambos lanzamientos se encuentra en nuestro análisis de la guerra de precios de modelos de IA de septiembre de 2026.
Una aclaración a tener en cuenta: OpenAI describe a Sol como un 50% más barato que GPT-5.6, y la comparación es con los precios promocionales de GPT-5.6, que es la propia palabra de OpenAI. Frente a las tarifas de lista de GPT-5.6 que documentamos en su momento en nuestra publicación de precios de GPT-5.6, el recorte es mayor. Frente a Astra es un factor de 5x directo.
Lo que permanece exactamente igual
Esta es la sección que hace que la migración sea barata.
| GPT-6 Astra | GPT-6 Sol | |
|---|---|---|
| ID del modelo | gpt-6-astra |
gpt-6-sol |
| Ventana de contexto | 1,050,000 | 1,050,000 |
| Tokens de entrada máx. | 922,000 | 922,000 |
| Tokens de salida máx. | 128,000 | 128,000 |
| Modalidades | texto, imagen de entrada; texto de salida | texto, imagen de entrada; texto de salida |
| Endpoints | Chat Completions, Responses, Batch | Chat Completions, Responses, Batch |
| No soportado | Tiempo real, Asistentes, fine-tuning, embeddings, audio | igual |
| Herramientas integradas | búsqueda web, búsqueda de archivos, generación de imágenes, intérprete de código, shell alojado, aplicar parche, habilidades, uso de computadora, MCP, búsqueda de herramientas | misma lista |
| Características | streaming, salidas estructuradas, llamada a funciones, búsqueda de archivos, entrada de imagen, búsqueda web, caché de prompt | misma lista |
| Límites de tasa del Nivel 5 | 15,000 RPM, 40M TPM | 15,000 RPM, 40M TPM |
| Instantáneas | gpt-6-astra |
gpt-6-sol |
La ventana de contexto es el titular. Sol no es un modelo de contexto más corto: tiene la misma ventana de 1,050,000 tokens y el mismo techo de entrada de 922,000 tokens que Astra. Nada de su fragmentación, su presupuesto de recuperación o su estrategia de compactación tiene que cambiar.
Lo que realmente cambia en su código
Cuatro cosas, en el orden en que probablemente le afectarán.
1. Llamada a funciones de Chat Completions. En Astra, Chat Completions funciona y la llamada a herramientas requiere la API Responses. En Sol, Chat Completions soporta la llamada a funciones solo cuando reasoning_effort es "none". Si está llamando a herramientas a través de Chat Completions con cualquier otro esfuerzo, esa solicitud deja de hacer lo que hacía. La propia guía de GPT-6 de OpenAI dice que use Responses para el razonamiento con herramientas. Si ya está usando Responses, esto no le cuesta nada.
2. El nivel de esfuerzo none. Astra soporta desde low hasta max. Sol soporta todos esos más none, que es la palanca que lo hace viable para trabajos de clasificación y extracción donde los tokens de razonamiento son pura sobrecarga. El valor predeterminado en ambos es medium.
3. Fecha de corte de conocimiento. Astra está entrenado hasta el 30 de abril de 2026, Sol hasta el 20 de abril de 2026. Diez días es poco, pero si una prompt asume conocimiento de finales de abril, pruebe la suposición.
4. Parámetros no soportados. Siempre que el esfuerzo de razonamiento no sea none, temperature, top_p y top_logprobs deben estar ausentes, y Chat Completions también elimina logprobs. Astra aplica la misma regla, por lo que una integración limpia de Astra ya cumple. Solo importa si se mueve a reasoning_effort: "none" en Sol y piensa en volver a poner temperature.
Aquí está el antes y después para una llamada Responses típica. La diferencia es una línea.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
- model="gpt-6-astra",
+ model="gpt-6-sol",
reasoning={"effort": "xhigh"},
tools=[{"type": "function", "name": "run_api_test", "parameters": {...}}],
input=[
{"role": "developer", "content": "Eres un ingeniero de API senior. Prefiere la acción."},
{"role": "user", "content": "Lee esta operación OpenAPI y propón tres casos de prueba negativos."},
],
)
Tenga en cuenta el nivel de esfuerzo en ese ejemplo. Moverse a Sol y mantener el mismo esfuerzo no es la migración interesante. Moverse a Sol y aumentar el esfuerzo sí lo es, porque ahora tiene cinco veces el presupuesto para gastar en tokens de razonamiento por el mismo dinero.
Lo que sacrifica
Sea honesto sobre esta parte, porque las cifras de lanzamiento son fáciles de malinterpretar.
OpenAI dice que Astra sigue siendo el mejor modelo. La publicación del lanzamiento afirma que Astra "sigue siendo nuestro mejor modelo en todos los aspectos". Ese es el propio marco del proveedor para su propio nuevo lanzamiento, y es la frase que hay que citar a cualquiera que le diga que Sol reemplaza a Astra.
La comparación publicada cara a cara no es una comparación de capacidad. En AutomationBench 1.0.6, Sol en xhigh obtiene un 33.2% a $0.27 por tarea, y Astra en low obtiene un 30.3% a 3.9 veces el costo por tarea de Sol. Lea los niveles de esfuerzo. Sol está a tope, Astra está al mínimo. Lo que ese emparejamiento demuestra es que el techo de Sol supera el suelo de Astra a aproximadamente una cuarta parte del costo por tarea, lo cual es un resultado real y útil. No dice nada sobre Sol en xhigh contra Astra en max. Ningún número publicado cubre esa comparación. Si su carga de trabajo es una en la que Astra con alto esfuerzo fue lo que finalmente la hizo funcionar, Sol es una prueba, no un reemplazo directo.
Latencia en el extremo superior. Artificial Analysis midió la variante de razonamiento máximo de GPT-6 Sol en 115.2 tokens de salida por segundo con un tiempo de 102.15 segundos para el primer token. Esa cifra es de terceros, no de OpenAI, y describe específicamente la variante max, por lo que no le dice lo que hacen medium o none. Tómelo como una advertencia de que el modelo barato no es automáticamente el modelo rápido con alto esfuerzo, y mida su propio nivel de esfuerzo en lugar de heredar el número.
Disponibilidad. Sol llega a ChatGPT Work y Codex para usuarios Plus, Pro, Business, Enterprise y Edu, y aún no está en Chat. La API está lista; la superficie de Chat no.
Para lo que Astra hace que justifica mantenerlo en algún lugar de la pila, nuestra prueba práctica de dos días, el informe sobre el uso de la computadora con Astra y el explicador del umbral cibernético crítico siguen siendo válidos, y la hoja de especificaciones completa está en nuestra guía de la API de GPT-6 Astra.
Decida con sus propias solicitudes, no con benchmarks
AutomationBench no ejecuta sus prompts. La única comparación que resuelve una migración es el mismo conjunto de solicitudes, enviado a ambos IDs de modelo, puntuado según sus propios criterios. Configure eso una vez y se pagará solo con cada lanzamiento futuro. En Apidog, coloque el ID del modelo en una variable de entorno, guarde la solicitud una vez y cambie de entorno para redirigirla:
{
"model": "{{MODEL_ID}}",
"reasoning": { "effort": "xhigh" },
"input": [
{ "role": "user", "content": "{{TEST_PROMPT}}" }
]
}
Cree un escenario de prueba a partir de 20 o 30 prompts de producción reales, agregue aserciones para la forma de respuesta de la que depende su analizador (presencia de output_text, argumentos de llamada de herramienta válidos contra su esquema JSON, sin truncamiento en max_output_tokens), luego ejecútelo dos veces, una por entorno. Apidog registra el cuerpo y el tiempo transcurrido para cada solicitud, por lo que obtiene la corrección y la latencia lado a lado sin escribir un arnés. El bloque usage en cada respuesta le da el recuento de tokens para valorar la comparación correctamente.
Vale la pena añadir dos aserciones para esta migración específicamente: compruebe que las llamadas a herramientas sigan llegando si estaba usando Chat Completions, y juzgue por su prompt más lento en lugar del promedio, porque el riesgo de latencia se encuentra en un alto esfuerzo con entradas largas.
Lista de verificación de migración
- Confirme que está usando la API Responses dondequiera que llame a herramientas. Si llama a herramientas a través de Chat Completions, muévase antes de cambiar de modelo.
- Cambie
gpt-6-astraagpt-6-soly deje todo lo demás como está para la primera ejecución. - Vuelva a ejecutar su conjunto de regresión contra ambos ID y compare las salidas, no solo los códigos de estado.
- Pruebe un paso más en el esfuerzo de razonamiento en Sol. Ahora tiene el presupuesto para ello.
- Vuelva a verificar cualquier prompt que dependa de conocimientos de finales de abril de 2026.
- Mantenga una ruta de Astra detrás de una bandera para las tareas en las que el rendimiento superior era lo que pagaba.
El resultado final
Astra a Sol es la rara migración en la que la superficie de la API no se mueve, la ventana de contexto no se encoge y el precio cae por un factor fijo en cada medidor. El trabajo no está en el código. Está en las veinte prompts que ejecuta en ambos modelos para averiguar si su tarea más difícil estaba utilizando el margen de Astra o simplemente pagando por él.
Realice esa comparación antes de activar la bandera, y tenga en cuenta la propia frase de OpenAI mientras lee los resultados: Astra sigue siendo su mejor modelo. Sol es el que puede permitirse dejar funcionando.
