A OpenAI lançou o GPT-6 Astra em 3 de setembro de 2026, primeiro para um conjunto limitado de organizações e, nos dias seguintes, para todos os usuários do ChatGPT Plus, Pro, Business e Enterprise, a API da OpenAI, Microsoft Azure e AWS Bedrock. O ID do modelo é gpt-6-astra, ele possui uma janela de contexto de 1.050.000 tokens, e a OpenAI o chama de “o melhor modelo para engenharia de software até hoje”. É também o primeiro modelo que a OpenAI classificou como Crítico para capacidade de cibersegurança, o que molda seu comportamento na API.
Este é o guia prático. Ele aborda o ID do modelo e os endpoints, sua primeira requisição, os cinco níveis de esforço de raciocínio, a tabela completa de preços, incluindo as taxas para contexto longo e modo Rápido, as mudanças que quebram uma integração com o GPT-5.6 Sol, e se o preço 2,5x sobre a taxa promocional do Sol compensa. A página do modelo da OpenAI é a fonte oficial dos números abaixo. Para saber como é trabalhar com ele, leia nosso hands-on de dois dias; este artigo se concentra na API.
TL;DR
- ID do Modelo
gpt-6-astra, um snapshot. Chat Completions, Responses e Batch. Sem Realtime, sem Assistants, sem fine-tuning. A chamada de ferramenta requer a API Responses. - Contexto de 1.050.000 tokens, saída máxima de 128.000, corte de conhecimento em 30 de abril de 2026. Entrada de texto e imagem, saída de texto.
- Preço padrão: $10 de entrada, $1 de leitura em cache, $12,50 de escrita em cache, $50 de saída por milhão de tokens. Prompts com mais de 272K tokens de entrada são cobrados a $20 / $2 / $75. Batch e Flex têm preço pela metade. O modo Rápido é o dobro.
- Esforço de raciocínio:
low,medium,high,xhigh,max.noneeminimalforam removidos. - Quebras da Sol:
temperature,top_pe logprobs foram removidos;prompt_cache_retentionse tornaprompt_cache_options.ttl. - O GPT-5.6 Sol está com promoção de $4 / $20 até pelo menos 21 de novembro de 2026, então o Astra custa 2,5x em ambos os lados.
GPT-6 Astra em resumo
| Item | Valor |
|---|---|
| ID do Modelo | gpt-6-astra |
| Janela de contexto | 1.050.000 tokens |
| Saída máxima | 128.000 tokens |
| Corte de conhecimento | 30 de abril de 2026 |
| Modalidades | Entrada: texto, imagem. Saída: texto |
| Endpoints | Chat Completions, Responses, Batch |
| Não suportado | Realtime, Assistants, fine-tuning |
| Recursos | Streaming, saídas estruturadas, chamada de função, busca de arquivo, busca na web, caching de prompt, entrada de imagem |
| Ferramentas integradas | Uso de computador, busca na web, busca de arquivo, interpretador de código, geração de imagem |
| Esforço de raciocínio | low, medium, high, xhigh, max |
| Limites de taxa (Tier 5) | 15.000 RPM, 40.000.000 TPM |
| Também disponível em | Microsoft Azure, AWS Bedrock; OpenRouter como openai/gpt-6-astra |
| Tratamento de dados | Retenção Zero de Dados para clientes API elegíveis |
Os espaços de trabalho Enterprise têm o Astra desativado por padrão; um administrador precisa habilitá-lo. No ChatGPT, o uso do Astra conta contra a franquia de assinatura existente, e os planos Pro, Business e Enterprise também recebem o GPT-6 Astra Pro.

Sua primeira requisição
A API Responses é a principal interface, e é necessária para ferramentas. Uma chamada Python mínima:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
reasoning={"effort": "medium"},
input=[
{"role": "developer", "content": "You are a senior API engineer. Bias towards action. Ask only when the answer would change the result."},
{"role": "user", "content": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."},
],
)
print(response.output_text)
print(response.usage)
A mesma requisição em curl:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."
}'
Chat Completions ainda funciona para texto simples: troque o endpoint e o formato da mensagem, e remova quaisquer campos temperature ou top_p, que a orientação da OpenAI sugere remover. No momento em que você precisar de chamada de função ou de uma ferramenta integrada, mude para Responses. Nosso guia da API Responses cobre o formato da requisição em profundidade.
A mensagem do desenvolvedor importa mais do que antes. A orientação do modelo da OpenAI diz que o Astra “pede esclarecimentos com mais facilidade” do que seus predecessores e recomenda instruí-lo a ter um viés para a ação. Ele também é “mais sensível às instruções contidas em habilidades” e outros arquivos anexados, então declare que as instruções do usuário prevalecem em caso de conflito. E ele padroniza para listas e tabelas; se você quiser prosa, peça por ela.
Esforço de raciocínio: cinco níveis, sem “none”
O GPT-5.6 expunha seis níveis de esforço, de none a max. O Astra expõe cinco: low, medium, high, xhigh e max. O conselho de migração da OpenAI é direto: se você usa none ou minimal hoje, mude para low e avalie. Todo o resto mantém sua configuração atual.
Essa remoção altera o lado mais barato da sua carga de trabalho. O Luna em none era a opção rápida de conclusão clássica na família GPT-5.6, e não há equivalente no Astra. O Astra é um modelo de raciocínio em todas as configurações, e é por isso que rotear o trabalho mecânico para o GPT-5.6 Terra ou Luna e reservar o Astra para as chamadas difíceis continua sendo o padrão sensato.
No outro extremo, max é onde os benchmarks de lançamento foram executados (“os scores de avaliação são o máximo em qualquer esforço”) e onde a Artificial Analysis mediu um tempo para o primeiro token acima de sete minutos em sua execução de esforço máximo. Orce a latência antes de orçar os tokens.
Quanto custa o GPT-6 Astra
Por milhão de tokens, da página de preços da OpenAI:
| Nível | Entrada | Entrada em cache | Saída |
|---|---|---|---|
| Padrão | $10,00 | $1,00 | $50,00 |
| Padrão, contexto longo (mais de 272K de entrada) | $20,00 | $2,00 | $75,00 |
| Batch / Flex | $5,00 | $0,50 | $25,00 |
| Batch, contexto longo | $10,00 | $1,00 | $37,50 |
| Modo rápido | $20,00 | $2,00 | $100,00 |
| Modo rápido, contexto longo | $40,00 | $4,00 | $150,00 |
Escritas em cache custam $12,50 por milhão. O modo rápido entrega “até 2x a velocidade de processamento Padrão com 2x o preço Padrão.”
Para comparação, a família GPT-5.6 atual:
| Modelo | Entrada | Entrada em cache | Saída |
|---|---|---|---|
| GPT-5.6 Sol (promoção até pelo menos 21 de novembro de 2026) | $4,00 | $0,40 | $20,00 |
| GPT-5.6 Terra | $2,00 | $0,20 | $12,00 |
| GPT-5.6 Luna | $0,20 | $0,02 | $1,20 |
O preço de tabela do Sol é $5 e $30; a taxa de $4 e $20 está em vigor desde 21 de agosto e a OpenAI diz que se mantém pelo menos até 21 de novembro. Em comparação, o Astra é 2,5x na entrada e 2,5x na saída. Contra o preço de tabela do Sol, é 2x e 1,67x.
Um exemplo prático. Uma execução de agente que lê um snapshot de base de código de 200.000 tokens uma vez, o reutiliza como um prefixo em cache em 30 chamadas e escreve 60.000 tokens de saída no total:
- Astra: $2,00 para a primeira leitura, depois 29 leituras em cache a $0,20 cada ($5,80), mais $3,00 de saída. Cerca de $10,80.
- Sol em promoção: $0,80 para a primeira leitura, $2,32 para as leituras em cache, $1,20 de saída. Cerca de $4,32.
A proporção se mantém em 2,5x. O que a OpenAI argumenta, e o que você deve medir, é que o Astra finaliza em menos chamadas e menos tokens de saída. No Terminal-Bench 4.0, ele afirma um custo por tarefa aproximadamente 9% menor do que o Sol, apesar da taxa mais alta, e cerca de 65% menos tokens de saída do que o Claude Opus 5 no Agents’ Last Exam. Se isso se mantiver para sua carga de trabalho, a fatura por tarefa pode sair nivelada. Caso contrário, você paga 2,5x.
Duas alavancas mantêm a conta baixa. O limite de 272K é o que deve ser observado: um prompt que o ultrapassa dobra as taxas de entrada e cache, então corte as saídas das ferramentas e armazene em cache o prefixo estático. E o Batch reduz tudo pela metade para trabalhos que podem esperar.
Migrando do GPT-5.6 Sol: o que quebra
A OpenAI publicou uma lista curta, e vale a pena levá-la ao pé da letra.
- Parâmetros de amostragem foram removidos. Remova
temperature,top_petop_logprobs. Em Chat Completions, remova tambémlogprobs; em Responses, removamessage.output_text.logprobsdeinclude. A orientação da OpenAI é removê-los em vez de depender da API ignorá-los, então faça uma busca em seu código cliente. - O piso de esforço é
low. Qualquer configuraçãononeouminimalmuda paralow. - A retenção de cache mudou de formato. Substitua
prompt_cache_retentionporprompt_cache_options.ttlconfigurado para"30m". O modo de cache explícito que você configurou para o GPT-5.6 se mantém. - Ferramentas precisam de Responses. Chat Completions é suportado para texto, mas a chamada de função e as ferramentas integradas estão na API Responses.
- Prompts querem menos hesitação de você e mais dele. Adicione a linha de viés para a ação, declare que as instruções do usuário têm precedência sobre os arquivos de habilidade e solicite prosa onde sua interface de usuário espera prosa.
Nada na lista toca em saídas estruturadas ou definições de função, então um esquema que funcionava no Sol funcionará no Astra. A mudança de comportamento que a maioria das equipes percebe primeiro é o questionamento: um prompt do Sol que era executado até a conclusão agora pode parar com uma pergunta de esclarecimento. Responda-a na mensagem do desenvolvedor logo no início e ele para de perguntar.
Vale a pena 2,5x o Sol?
Para trabalho agêntico e de contexto longo, os números de lançamento dizem que sim. Todos os valores abaixo são executados pela OpenAI, no melhor esforço para cada modelo:
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% |
| FrontierCode 1.1 Extended | 64,5% | 60,6% | 63,6% |
| Tarefas internas de migração de banco de dados | 63,9% | 42,7% | 57,8% |
| OSWorld 2.0 | 72,6% | 65,7% | - |
| MRCR v2 8-agulhas, 512K a 1M | 96,3% | 73,8% | - |
| GPQA Diamond | 96,0% | 94,6% | 93,7% |
| Humanity’s Last Exam (com ferramentas) | 57,2% | - | 65,0% |
As lacunas do Terminal-Bench e da migração de banco de dados são as que importam para os desenvolvedores: 20 pontos a mais que o Sol em trabalho agêntico de terminal, e uma pontuação de recuperação de contexto longo que torna a janela de 1M utilizável em vez de nominal. A lacuna do DeepSWE é pequena, e o Claude Fable 5.1 ainda lidera no Humanity’s Last Exam por quase oito pontos, então isso não é uma vitória completa. No índice independente da Artificial Analysis, o Astra ocupa o segundo lugar entre 202 modelos. Nossa análise detalhada do benchmark do Fable 5.1 apresenta o outro lado dessa comparação.
Onde o Sol mantém seu trabalho: chamadas curtas de alto volume onde o piso de esforço e a taxa de 2,5x dominam, e qualquer coisa que precise de latência no estilo none. Onde o Astra ganha: execuções de agente longas, contexto de repositório inteiro, uso de computador e qualquer tarefa onde o modo de falha do Sol era desviar ou desistir.
Teste a troca antes de implantar
A migração é pequena o suficiente para ser feita em uma tarde e significativa o suficiente para ser medida. No Apidog, mantenha o ID do modelo como uma variável de ambiente para que a mesma requisição salva seja executada contra gpt-5.6-sol e gpt-6-astra com uma única troca. Adicione asserções em usage.input_tokens, usage.output_tokens e a contagem de tokens em cache, então envie um conjunto representativo de tarefas por ambos e compare os totais; essa é a pergunta de 2,5x respondida com seu próprio tráfego em vez de um gráfico de lançamento.
Mais duas verificações pertencem ao mesmo projeto. Envie uma requisição que ainda contenha temperature e registre o que retorna, para que você aprenda o comportamento em um teste em vez de em produção. E afirme que um prompt longo permanece abaixo de 272K tokens de entrada, porque cruzar essa linha dobra silenciosamente a taxa. Agende o conjunto como uma regressão e Baixe o Apidog se ainda não o tiver; o guia da API GPT-5.6 mostra a mesma configuração na geração anterior.
FAQ
- Qual é o ID do modelo GPT-6 Astra?
gpt-6-astra, com um único snapshot. Ele também é exposto via Azure e AWS Bedrock, e no OpenRouter comoopenai/gpt-6-astra. - O GPT-6 Astra suporta fine-tuning ou a API Realtime? Não. A página do modelo lista Chat Completions, Responses e Batch como suportados, com Realtime, Assistants e fine-tuning não suportados.
- Qual é a janela de contexto e a saída máxima? 1.050.000 tokens de entrada e 128.000 tokens de saída. Prompts acima de 272K tokens de entrada são cobrados na taxa de contexto longo.
- Por que minha requisição falhou depois de mudar do Sol? Provavelmente um
temperatureoutop_prestante, um nível de esforçonone, ouprompt_cache_retention. O Astra removeu todos os três; veja a lista de migração acima. - Uma requisição pode parar sozinha? Sim. A OpenAI executa um monitor de desalinhamento em requisições que usam ferramentas, e na API uma tarefa sinalizada para em vez de pausar para revisão. Longas execuções de agentes são as mais expostas, então as torne resumíveis. O post sobre o limiar crítico de cibersegurança explica as salvaguardas por trás desse comportamento.
O que fazer esta semana
Mova uma carga de trabalho de agente para gpt-6-astra na API Responses, remova os parâmetros de amostragem, defina o esforço como medium e meça os tokens e o tempo real em comparação com o Sol nas mesmas entradas. Se o custo por tarefa for igual ou melhor, migre o restante. Caso contrário, você terá um número, o que é mais do que a maioria das equipes terá até sexta-feira.
