GPT-6 Astra para Desenvolvedores: API, Preços, 1M de Contexto e as Mudanças do GPT-5.6 Sol

Guia da API GPT-6 Astra: ID do modelo gpt-6-astra, preços de $10/$50 com contexto longo, taxas dos modos Batch e Fast, 1,05M de contexto, cinco níveis de esforço e as quebras de compatibilidade do GPT-5.6 Sol.

Medy Evrard

5 setembro 2026

GPT-6 Astra para Desenvolvedores: API, Preços, 1M de Contexto e as Mudanças do GPT-5.6 Sol

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

A OpenAI lançou o GPT-6 Astra em 3 de setembro de 2026, primeiro para um conjunto limitado de organizações e, nos dias seguintes, para todos os usuários do ChatGPT Plus, Pro, Business e Enterprise, a API da OpenAI, Microsoft Azure e AWS Bedrock. O ID do modelo é gpt-6-astra, ele possui uma janela de contexto de 1.050.000 tokens, e a OpenAI o chama de “o melhor modelo para engenharia de software até hoje”. É também o primeiro modelo que a OpenAI classificou como Crítico para capacidade de cibersegurança, o que molda seu comportamento na API.

Este é o guia prático. Ele aborda o ID do modelo e os endpoints, sua primeira requisição, os cinco níveis de esforço de raciocínio, a tabela completa de preços, incluindo as taxas para contexto longo e modo Rápido, as mudanças que quebram uma integração com o GPT-5.6 Sol, e se o preço 2,5x sobre a taxa promocional do Sol compensa. A página do modelo da OpenAI é a fonte oficial dos números abaixo. Para saber como é trabalhar com ele, leia nosso hands-on de dois dias; este artigo se concentra na API.

TL;DR

GPT-6 Astra em resumo

Item Valor
ID do Modelo gpt-6-astra
Janela de contexto 1.050.000 tokens
Saída máxima 128.000 tokens
Corte de conhecimento 30 de abril de 2026
Modalidades Entrada: texto, imagem. Saída: texto
Endpoints Chat Completions, Responses, Batch
Não suportado Realtime, Assistants, fine-tuning
Recursos Streaming, saídas estruturadas, chamada de função, busca de arquivo, busca na web, caching de prompt, entrada de imagem
Ferramentas integradas Uso de computador, busca na web, busca de arquivo, interpretador de código, geração de imagem
Esforço de raciocínio low, medium, high, xhigh, max
Limites de taxa (Tier 5) 15.000 RPM, 40.000.000 TPM
Também disponível em Microsoft Azure, AWS Bedrock; OpenRouter como openai/gpt-6-astra
Tratamento de dados Retenção Zero de Dados para clientes API elegíveis

Os espaços de trabalho Enterprise têm o Astra desativado por padrão; um administrador precisa habilitá-lo. No ChatGPT, o uso do Astra conta contra a franquia de assinatura existente, e os planos Pro, Business e Enterprise também recebem o GPT-6 Astra Pro.

Sua primeira requisição

A API Responses é a principal interface, e é necessária para ferramentas. Uma chamada Python mínima:

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "medium"},
    input=[
        {"role": "developer", "content": "You are a senior API engineer. Bias towards action. Ask only when the answer would change the result."},
        {"role": "user", "content": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."},
    ],
)

print(response.output_text)
print(response.usage)

A mesma requisição em curl:

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "reasoning": {"effort": "medium"},
    "input": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."
  }'

Chat Completions ainda funciona para texto simples: troque o endpoint e o formato da mensagem, e remova quaisquer campos temperature ou top_p, que a orientação da OpenAI sugere remover. No momento em que você precisar de chamada de função ou de uma ferramenta integrada, mude para Responses. Nosso guia da API Responses cobre o formato da requisição em profundidade.

A mensagem do desenvolvedor importa mais do que antes. A orientação do modelo da OpenAI diz que o Astra “pede esclarecimentos com mais facilidade” do que seus predecessores e recomenda instruí-lo a ter um viés para a ação. Ele também é “mais sensível às instruções contidas em habilidades” e outros arquivos anexados, então declare que as instruções do usuário prevalecem em caso de conflito. E ele padroniza para listas e tabelas; se você quiser prosa, peça por ela.

Esforço de raciocínio: cinco níveis, sem “none”

O GPT-5.6 expunha seis níveis de esforço, de none a max. O Astra expõe cinco: low, medium, high, xhigh e max. O conselho de migração da OpenAI é direto: se você usa none ou minimal hoje, mude para low e avalie. Todo o resto mantém sua configuração atual.

Essa remoção altera o lado mais barato da sua carga de trabalho. O Luna em none era a opção rápida de conclusão clássica na família GPT-5.6, e não há equivalente no Astra. O Astra é um modelo de raciocínio em todas as configurações, e é por isso que rotear o trabalho mecânico para o GPT-5.6 Terra ou Luna e reservar o Astra para as chamadas difíceis continua sendo o padrão sensato.

No outro extremo, max é onde os benchmarks de lançamento foram executados (“os scores de avaliação são o máximo em qualquer esforço”) e onde a Artificial Analysis mediu um tempo para o primeiro token acima de sete minutos em sua execução de esforço máximo. Orce a latência antes de orçar os tokens.

Quanto custa o GPT-6 Astra

Por milhão de tokens, da página de preços da OpenAI:

Nível Entrada Entrada em cache Saída
Padrão $10,00 $1,00 $50,00
Padrão, contexto longo (mais de 272K de entrada) $20,00 $2,00 $75,00
Batch / Flex $5,00 $0,50 $25,00
Batch, contexto longo $10,00 $1,00 $37,50
Modo rápido $20,00 $2,00 $100,00
Modo rápido, contexto longo $40,00 $4,00 $150,00

Escritas em cache custam $12,50 por milhão. O modo rápido entrega “até 2x a velocidade de processamento Padrão com 2x o preço Padrão.”

Para comparação, a família GPT-5.6 atual:

Modelo Entrada Entrada em cache Saída
GPT-5.6 Sol (promoção até pelo menos 21 de novembro de 2026) $4,00 $0,40 $20,00
GPT-5.6 Terra $2,00 $0,20 $12,00
GPT-5.6 Luna $0,20 $0,02 $1,20

O preço de tabela do Sol é $5 e $30; a taxa de $4 e $20 está em vigor desde 21 de agosto e a OpenAI diz que se mantém pelo menos até 21 de novembro. Em comparação, o Astra é 2,5x na entrada e 2,5x na saída. Contra o preço de tabela do Sol, é 2x e 1,67x.

Um exemplo prático. Uma execução de agente que lê um snapshot de base de código de 200.000 tokens uma vez, o reutiliza como um prefixo em cache em 30 chamadas e escreve 60.000 tokens de saída no total:

A proporção se mantém em 2,5x. O que a OpenAI argumenta, e o que você deve medir, é que o Astra finaliza em menos chamadas e menos tokens de saída. No Terminal-Bench 4.0, ele afirma um custo por tarefa aproximadamente 9% menor do que o Sol, apesar da taxa mais alta, e cerca de 65% menos tokens de saída do que o Claude Opus 5 no Agents’ Last Exam. Se isso se mantiver para sua carga de trabalho, a fatura por tarefa pode sair nivelada. Caso contrário, você paga 2,5x.

Duas alavancas mantêm a conta baixa. O limite de 272K é o que deve ser observado: um prompt que o ultrapassa dobra as taxas de entrada e cache, então corte as saídas das ferramentas e armazene em cache o prefixo estático. E o Batch reduz tudo pela metade para trabalhos que podem esperar.

Migrando do GPT-5.6 Sol: o que quebra

A OpenAI publicou uma lista curta, e vale a pena levá-la ao pé da letra.

  1. Parâmetros de amostragem foram removidos. Remova temperature, top_p e top_logprobs. Em Chat Completions, remova também logprobs; em Responses, remova message.output_text.logprobs de include. A orientação da OpenAI é removê-los em vez de depender da API ignorá-los, então faça uma busca em seu código cliente.
  2. O piso de esforço é low. Qualquer configuração none ou minimal muda para low.
  3. A retenção de cache mudou de formato. Substitua prompt_cache_retention por prompt_cache_options.ttl configurado para "30m". O modo de cache explícito que você configurou para o GPT-5.6 se mantém.
  4. Ferramentas precisam de Responses. Chat Completions é suportado para texto, mas a chamada de função e as ferramentas integradas estão na API Responses.
  5. Prompts querem menos hesitação de você e mais dele. Adicione a linha de viés para a ação, declare que as instruções do usuário têm precedência sobre os arquivos de habilidade e solicite prosa onde sua interface de usuário espera prosa.

Nada na lista toca em saídas estruturadas ou definições de função, então um esquema que funcionava no Sol funcionará no Astra. A mudança de comportamento que a maioria das equipes percebe primeiro é o questionamento: um prompt do Sol que era executado até a conclusão agora pode parar com uma pergunta de esclarecimento. Responda-a na mensagem do desenvolvedor logo no início e ele para de perguntar.

Vale a pena 2,5x o Sol?

Para trabalho agêntico e de contexto longo, os números de lançamento dizem que sim. Todos os valores abaixo são executados pela OpenAI, no melhor esforço para cada modelo:

Benchmark GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
Terminal-Bench 4.0 57,9% 37,3% 55,8%
DeepSWE v1.1 74,1% 72,7% 67,4%
FrontierCode 1.1 Extended 64,5% 60,6% 63,6%
Tarefas internas de migração de banco de dados 63,9% 42,7% 57,8%
OSWorld 2.0 72,6% 65,7% -
MRCR v2 8-agulhas, 512K a 1M 96,3% 73,8% -
GPQA Diamond 96,0% 94,6% 93,7%
Humanity’s Last Exam (com ferramentas) 57,2% - 65,0%

As lacunas do Terminal-Bench e da migração de banco de dados são as que importam para os desenvolvedores: 20 pontos a mais que o Sol em trabalho agêntico de terminal, e uma pontuação de recuperação de contexto longo que torna a janela de 1M utilizável em vez de nominal. A lacuna do DeepSWE é pequena, e o Claude Fable 5.1 ainda lidera no Humanity’s Last Exam por quase oito pontos, então isso não é uma vitória completa. No índice independente da Artificial Analysis, o Astra ocupa o segundo lugar entre 202 modelos. Nossa análise detalhada do benchmark do Fable 5.1 apresenta o outro lado dessa comparação.

Onde o Sol mantém seu trabalho: chamadas curtas de alto volume onde o piso de esforço e a taxa de 2,5x dominam, e qualquer coisa que precise de latência no estilo none. Onde o Astra ganha: execuções de agente longas, contexto de repositório inteiro, uso de computador e qualquer tarefa onde o modo de falha do Sol era desviar ou desistir.

Teste a troca antes de implantar

A migração é pequena o suficiente para ser feita em uma tarde e significativa o suficiente para ser medida. No Apidog, mantenha o ID do modelo como uma variável de ambiente para que a mesma requisição salva seja executada contra gpt-5.6-sol e gpt-6-astra com uma única troca. Adicione asserções em usage.input_tokens, usage.output_tokens e a contagem de tokens em cache, então envie um conjunto representativo de tarefas por ambos e compare os totais; essa é a pergunta de 2,5x respondida com seu próprio tráfego em vez de um gráfico de lançamento.

Mais duas verificações pertencem ao mesmo projeto. Envie uma requisição que ainda contenha temperature e registre o que retorna, para que você aprenda o comportamento em um teste em vez de em produção. E afirme que um prompt longo permanece abaixo de 272K tokens de entrada, porque cruzar essa linha dobra silenciosamente a taxa. Agende o conjunto como uma regressão e Baixe o Apidog se ainda não o tiver; o guia da API GPT-5.6 mostra a mesma configuração na geração anterior.

FAQ

O que fazer esta semana

Mova uma carga de trabalho de agente para gpt-6-astra na API Responses, remova os parâmetros de amostragem, defina o esforço como medium e meça os tokens e o tempo real em comparação com o Sol nas mesmas entradas. Se o custo por tarefa for igual ou melhor, migre o restante. Caso contrário, você terá um número, o que é mais do que a maioria das equipes terá até sexta-feira.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs