Se você moveu uma carga de trabalho de agente para o GPT-6 Astra no início de setembro, você já tem três semanas de faturas e já conhece a dimensão do problema. O Astra cobra US$10 por milhão de tokens de entrada e US$50 por milhão de tokens de saída. Um loop de longa duração com um prompt de sistema robusto e um esquema de ferramenta anexado consome isso mais rapidamente do que qualquer planilha previu.
Em 22 de setembro, a OpenAI lançou o GPT-6 Sol por US$2 e US$10. Mesma família de modelos, mesma superfície de API, um quinto do preço em cada linha da fatura.
Esta é a migração. O que muda no seu código é quase nada. O que muda na sua fatura é tudo. E a parte que a maioria da cobertura do dia do lançamento ignorou: a OpenAI ainda diz que o Astra é o melhor modelo, e a comparação direta publicada entre os dois não é o que parece ser.
TL;DR
- A troca de
gpt-6-astraparagpt-6-solé uma simples alteração de string do modelo para a maioria dos usuários. Janela de contexto, saída máxima, endpoints, ferramentas integradas, recursos suportados e níveis de limite de taxa são idênticos. - Cada taxa cai exatamente 5x: entrada de US$10 para US$2, entrada em cache de US$1 para US$0,20, gravações de cache de US$12,50 para US$2,50, saída de US$50 para US$10. Sua fatura será dividida por cinco, independentemente da combinação de tokens.
- Sol adiciona um esforço de raciocínio
none. Ele também restringe a chamada de função de Chat Completions areasoning_effort: "none", a única mudança que pode quebrar uma integração funcional. - O corte de conhecimento do Sol é 20 de abril de 2026. O do Astra é 30 de abril de 2026.
- A OpenAI diz que o Astra "continua sendo nosso melhor modelo em todos os aspectos". O benchmark Sol versus Astra publicado executa o Astra em
lowcontra o Sol emxhigh, então ele mede a eficiência de custo, não o limite de capacidade.
A tabela de preços
Ambos os conjuntos de taxas vêm das páginas de modelos da OpenAI, gpt-6-astra e gpt-6-sol, consultadas em 23 de setembro de 2026.
| Métrica, por 1M tokens | GPT-6 Astra | GPT-6 Sol | Mudança |
|---|---|---|---|
| Entrada | $10 | $2 | 5x mais barato |
| Entrada em cache | $1 | $0.20 | 5x mais barato |
| Gravações de cache | $12.50 | $2.50 | 5x mais barato |
| Saída | $50 | $10 | 5x mais barato |
Os modificadores de faturamento coincidem em ambos os modelos. Prompts com mais de 272K tokens de entrada são cobrados com 2x as taxas de entrada e cache e 1.5x a saída para toda a solicitação. O modo Batch e Flex custam metade do preço. O modo rápido custa o dobro, e no Astra ele não possui SLA de latência.

Como todas as quatro taxas caem pelo mesmo fator, você não precisa modelar sua combinação de tokens para prever a economia. Considere uma carga de trabalho de agente concreta: 10.000 solicitações por dia, cada uma com um prefixo em cache de 30.000 tokens, 10.000 tokens de entrada nova e 3.000 tokens de saída.
| Componente | Tokens diários | Astra | Sol |
|---|---|---|---|
| Entrada em cache | 300M | $300 | $60 |
| Entrada nova | 100M | $1,000 | $200 |
| Saída | 30M | $1,500 | $300 |
| Total | $2,800 | $560 |
Mude a combinação para a saída, mude para o cache, execute com 272K de contexto e pague o multiplicador de prompt longo: a proporção permanece em cinco.
Para entender por que isso é importante, a OpenAI relatou que seu próprio pesquisador mediano gasta mais de US$600 por dia em agentes de codificação, com o percentil 90 gastando US$7.000 por dia. Divida esses valores por cinco e o número de experimentos que uma equipe pode pagar muda. O contexto mais amplo para ambos os lançamentos está em nossa análise da guerra de preços de modelos de IA de setembro de 2026.
Uma ressalva a ser observada: a OpenAI descreve o Sol como 50% mais barato que o GPT-5.6, e a comparação é contra o preço promocional do GPT-5.6, o que é uma declaração da própria OpenAI. Contra as taxas de tabela do GPT-5.6 que documentamos na época em nossa postagem sobre preços do GPT-5.6, o corte é maior. Contra o Astra, é uma redução direta de 5x.
O que permanece exatamente o mesmo
Esta é a seção que torna a migração barata.
| GPT-6 Astra | GPT-6 Sol | |
|---|---|---|
| ID do Modelo | gpt-6-astra |
gpt-6-sol |
| Janela de contexto | 1.050.000 | 1.050.000 |
| Tokens de entrada máx. | 922.000 | 922.000 |
| Tokens de saída máx. | 128.000 | 128.000 |
| Modalidades | texto, imagem entrada; texto saída | texto, imagem entrada; texto saída |
| Endpoints | Chat Completions, Responses, Batch | Chat Completions, Responses, Batch |
| Não suportado | Realtime, Assistants, fine-tuning, embeddings, áudio | o mesmo |
| Ferramentas integradas | pesquisa web, pesquisa de arquivos, geração de imagens, interpretador de código, shell hospedado, aplicar patch, habilidades, uso de computador, MCP, pesquisa de ferramentas | mesma lista |
| Recursos | streaming, saídas estruturadas, chamada de função, pesquisa de arquivos, entrada de imagem, pesquisa web, cache de prompt | mesma lista |
| Limites de taxa Nível 5 | 15.000 RPM, 40M TPM | 15.000 RPM, 40M TPM |
| Snapshots | gpt-6-astra |
gpt-6-sol |
A janela de contexto é o destaque. O Sol não é um modelo de contexto mais curto: ele possui a mesma janela de 1.050.000 tokens e o mesmo teto de entrada de 922.000 tokens que o Astra. Nada em sua estratégia de fragmentação, orçamento de recuperação ou compactação precisa ser alterado.
O que realmente muda no seu código
Quatro coisas, na ordem em que provavelmente causarão problemas.
- 1. Chamada de função de Chat Completions. No Astra, Chat Completions funciona e a chamada de ferramenta exige a API Responses. No Sol, Chat Completions suporta chamada de função apenas quando
reasoning_efforté"none". Se você estiver chamando ferramentas via Chat Completions com qualquer outro esforço, essa solicitação para de fazer o que fazia. O próprio guia do GPT-6 da OpenAI diz para usar Responses para raciocínio com ferramentas. Se você já usa Responses, isso não custará nada. - 2. O nível de esforço
none. O Astra suporta delowamax. O Sol suporta todos esses maisnone, que é a alavanca que o torna viável para trabalhos de classificação e extração onde os tokens de raciocínio são pura sobrecarga. O padrão em ambos émedium. - 3. Limite de conhecimento. O Astra é treinado até 30 de abril de 2026, o Sol até 20 de abril de 2026. Dez dias é pouco, mas se um prompt assumir conhecimento do final de abril, teste a suposição.
- 4. Parâmetros não suportados. Sempre que o esforço de raciocínio não for
none,temperature,top_petop_logprobsdevem estar ausentes, e Chat Completions também descartalogprobs. O Astra impõe a mesma regra, então uma integração limpa do Astra já está em conformidade. Isso só importa se você mudar parareasoning_effort: "none"no Sol e pensar em colocartemperaturede volta.
Aqui está o antes e depois para uma chamada típica de Responses. A diferença é de uma linha.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
- model="gpt-6-astra",
+ model="gpt-6-sol",
reasoning={"effort": "xhigh"},
tools=[{"type": "function", "name": "run_api_test", "parameters": {...}}],
input=[
{"role": "developer", "content": "You are a senior API engineer. Bias towards action."},
{"role": "user", "content": "Read this OpenAPI operation and propose three negative test cases."},
],
)
Observe o nível de esforço nesse exemplo. Mover para o Sol e manter o mesmo esforço não é a migração interessante. Mover para o Sol e aumentar o esforço é, porque você tem cinco vezes o orçamento para gastar em tokens de raciocínio pelo mesmo valor.
O que você abre mão
Seja honesto sobre esta parte, porque os números de lançamento são fáceis de interpretar mal.
A OpenAI diz que o Astra ainda é o melhor modelo. A postagem de lançamento afirma que o Astra "continua sendo nosso melhor modelo em todos os aspectos". Essa é a própria abordagem do fornecedor sobre seu novo lançamento, e é a frase a ser citada a qualquer um que lhe diga que o Sol substitui o Astra.
A comparação direta publicada não é uma comparação de capacidade. No AutomationBench 1.0.6, o Sol em xhigh atinge 33,2% a US$0,27 por tarefa, e o Astra em low atinge 30,3% a 3,9 vezes o custo por tarefa do Sol. Observe os níveis de esforço. O Sol está no máximo, o Astra está no mínimo. O que essa combinação demonstra é que o limite do Sol supera o piso do Astra a aproximadamente um quarto do custo por tarefa, o que é um resultado real e útil. Não diz nada sobre o Sol em xhigh contra o Astra em max. Nenhum número publicado cobre esse confronto. Se sua carga de trabalho é uma em que o Astra com alto esforço foi o que finalmente a fez funcionar, o Sol é um teste, não uma troca.
Latência no limite superior. A Artificial Analysis mediu a variante de raciocínio máximo do GPT-6 Sol em 115,2 tokens de saída por segundo com um tempo até o primeiro token de 102,15 segundos. Esse número é de terceiros, não da OpenAI, e descreve especificamente a variante max, então não informa o que medium ou none fazem. Trate-o como um aviso de que o modelo barato não é automaticamente o modelo rápido em alto esforço, e meça seu próprio nível de esforço em vez de herdar o número.
Disponibilidade. O Sol chega ao ChatGPT Work e Codex para usuários Plus, Pro, Business, Enterprise e Edu, e ainda não está no Chat. A API está pronta; a interface de Chat não está.
Para o que o Astra faz que justifica mantê-lo em algum lugar na pilha, nosso teste prático de dois dias, o artigo sobre uso de computador e o explicador de Limite Cibernético Crítico ainda são válidos, e a ficha técnica completa está em nosso guia da API GPT-6 Astra.
Decida com suas próprias requisições, não com benchmarks
O AutomationBench não executa seus prompts. A única comparação que resolve uma migração é o mesmo conjunto de requisições, enviado a ambos os IDs de modelo, pontuado com base em seus próprios critérios. Configure isso uma vez e ele se pagará em cada lançamento futuro. No Apidog, coloque o ID do modelo em uma variável de ambiente, salve a requisição uma vez e alterne os ambientes para redirecioná-la:
{
"model": "{{MODEL_ID}}",
"reasoning": { "effort": "xhigh" },
"input": [
{ "role": "user", "content": "{{TEST_PROMPT}}" }
]
}
Construa um cenário de teste a partir de 20 ou 30 prompts de produção reais, adicione asserções para o formato de resposta do qual seu parser depende (output_text presente, argumentos de chamada de ferramenta válidos em relação ao seu JSON Schema, sem truncamento em max_output_tokens), então execute-o duas vezes, uma para cada ambiente. O Apidog registra o corpo e o tempo decorrido para cada requisição, para que você obtenha correção e latência lado a lado sem precisar escrever um harness. O bloco usage em cada resposta fornece a contagem de tokens para precificar a comparação adequadamente.
Duas asserções valem a pena adicionar especificamente para esta migração: verifique se as chamadas de ferramenta ainda chegam se você estava usando Chat Completions, e julgue pelo seu prompt mais lento em vez do seu médio, porque o risco de latência reside em alto esforço em entradas longas.
Lista de verificação da migração
- Confirme que você está usando a API Responses em qualquer lugar onde você chama ferramentas. Se você chama ferramentas via Chat Completions, mude antes de trocar os modelos.
- Troque
gpt-6-astraporgpt-6-sole deixe todo o resto inalterado para a primeira execução. - Reexecute seu conjunto de regressão contra ambos os IDs e compare as saídas, não apenas os códigos de status.
- Experimente um nível acima no esforço de raciocínio no Sol. Você tem o orçamento para isso agora.
- Verifique novamente qualquer prompt que dependa de conhecimento do final de abril de 2026.
- Mantenha um caminho Astra atrás de um sinalizador para as tarefas em que o teto era o que você estava pagando.
Conclusão
A migração do Astra para o Sol é a rara situação em que a superfície da API não muda, a janela de contexto não diminui, e o preço cai por um fator fixo em cada métrica. O trabalho não está no código. Está nos vinte prompts que você executa em ambos os modelos para descobrir se sua tarefa mais difícil estava usando a capacidade do Astra ou apenas pagando por ela.
Execute essa comparação antes de virar a chave, e mantenha em mente a própria frase da OpenAI enquanto lê os resultados: Astra ainda é o melhor modelo deles. Sol é aquele que você pode se dar ao luxo de manter em execução.
