A principal característica do GPT-6 Astra é que ele pode usar um computador. Não no sentido de 2025, onde um modelo clicava em uma demonstração e depois se perdia em um menu suspenso. Na publicação de lançamento da OpenAI, o Astra atinge 72,6% no OSWorld 2.0 em aproximadamente 40 minutos por tarefa, preenche formulários, atualiza CRMs, instala software e executa verificações de QA de frontend em um site que ele mesmo construiu. A OpenAI o chama de “o melhor modelo de uso de computador do mundo”, e pela primeira vez as demonstrações apoiam a afirmação.
Se você constrói ou testa APIs, essa capacidade aponta para um atalho tentador: aponte o Astra para o seu aplicativo e deixe-o clicar. Este post defende que você faça algo menos impressionante e mais útil. Dê a ele o contrato. Uma especificação OpenAPI é uma interface mais rápida, barata e mais verificável para um modelo do que uma tela, e um modelo tão capaz a usará bem. Vimos o Astra fazer essa transição por conta própria durante nosso teste prático de dois dias, e o restante deste artigo explica por que essa foi a decisão certa e como configurá-lo com o Apidog.
TL;DR
O uso do computador pelo GPT-6 Astra é real: 72,6% no OSWorld 2.0, 92,7% no ScreenSpot-Pro e um sistema Codex que conclui tarefas de uso de computador 1,9x mais rápido que a experiência do GPT-5.6 Sol. Mas o controle da tela custa dezenas de minutos e muitos tokens de imagem por tarefa, e testa a UI, não a API. Para seus próprios serviços, entregue ao Astra a especificação OpenAPI através do Apidog MCP Server ou como ferramentas de função, deixe-o escrever os cenários de teste e execute-os a partir do CLI do Apidog na CI. Mantenha o uso do computador para as superfícies que não possuem API.
O que o uso do computador no GPT-6 Astra pode fazer
A capacidade é mais ampla do que “navegar em um site”. A OpenAI lista trabalho de conhecimento tedioso (formulários online, registros de CRM, calendários), pesquisa e elaboração dentro de um editor de documentos, análise de dados científicos com gráficos, construção e hospedagem de um site através do ChatGPT Sites e QA de frontend nesse site. As demonstrações incluem o layout de uma placa de circuito impresso no KiCad e a modelagem de uma casa no Blender.
Os números de benchmark, todos executados pela OpenAI da publicação de lançamento:
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (conjunto offline, pontuação parcial) | 72.6% em ~40 min/tarefa | 65.7% em ~75 min/tarefa | 70.2% |
| ScreenSpot-Pro (sem ferramentas) | 92.7% | 76.9% | - |
| Agentes’ Último Exame | 59.3% | 53.6% | 55.5% |
| AutomationBench | 41.4% | 18.1% | 26.9% |
Dois detalhes importam mais do que as pontuações. O Astra conclui as tarefas do OSWorld em cerca de 47% menos tempo do que o Sol, e no Agents’ Last Exam ele usa aproximadamente 65% menos tokens de saída do que o Opus 5 nas configurações de maior pontuação. Além do modelo, a OpenAI atualizou o sistema Codex para que a conclusão das tarefas de uso de computador seja 1,9x mais rápida do que a experiência atual do Sol no Mind2Web. Loops mais rápidos significam loops mais baratos, o que é a parte que importa para quem paga por token.

O comportamento também melhorou. O Astra faz perguntas focadas apenas quando a resposta mudaria o resultado, permanece orientado quando você o direciona no meio da tarefa e, no Codex, ele pode perguntar assincronamente enquanto continua o trabalho que não depende da sua resposta. No benchmark interno de segurança de uso de computador da OpenAI, onde menor é melhor, o Astra pontua 2,4% contra os 22,0% do Sol.
Quanto custa uma tarefa de 40 minutos
O uso do computador é um loop: captura de tela, raciocínio, ação, nova captura de tela. Cada captura de tela é uma entrada de imagem, cada etapa carrega a conversa até agora, e uma tarefa que leva 40 minutos leva centenas de etapas. Na taxa padrão do Astra de $10 por milhão de tokens de entrada e $50 por milhão de saída, com prompts acima de 272K tokens de entrada cobrados a $20 por milhão, uma sessão longa que mantém seu histórico completo em contexto entra em precificação de contexto longo antes de terminar. O cache de prompts ajuda com o prefixo repetido, a $1 por milhão de tokens em cache, mas as próprias capturas de tela são novas a cada etapa.
Compare isso com o caminho do contrato. Sua especificação OpenAPI é um prefixo, armazenado em cache uma vez. Cada teste que o modelo escreve são algumas centenas de tokens JSON. Cada execução desse teste é uma chamada HTTP que não custa nada do lado do modelo, porque um cenário de teste, uma vez escrito, não precisa de um modelo para executá-lo.
Há um segundo custo que não tem nada a ver com dinheiro. A visão geral de segurança da OpenAI diz que seu monitor de desalinhamento de produção “às vezes pode desacelerar, pausar ou interromper um trabalho legítimo”, e menciona “tarefas em que um agente está em execução por um período prolongado”. No ChatGPT ou no Codex, você será solicitado a revisar a ação. Na API, a tarefa para. Uma sessão de 40 minutos de controle de tela é exatamente o tipo de tarefa mais exposta a essa interrupção. Uma chamada de API de cinco segundos não é.
Uso do computador versus o contrato: quando cada um vence
| Situação | Melhor ferramenta | Porquê |
|---|---|---|
| Testando sua própria API | A especificação | Determinístico, barato de reexecutar, valida o contrato real |
| Suíte de regressão na CI | A especificação | Cenários são executados sem um modelo no loop |
| Portal de terceiros sem API | Uso do computador | Não há contrato para entregar |
| QA de frontend de ponta a ponta antes do lançamento | Uso do computador | A UI é o que está sendo testado |
| Ferramenta desktop legada | Uso do computador | Apenas uma tela existe |
| Verificando se a documentação corresponde ao comportamento | A especificação, depois a UI | Envie a requisição documentada, compare a resposta, depois verifique pontualmente a página renderizada |
A distinção é o que você está testando. O uso do computador testa os pixels. A especificação testa a promessa. Quando um frontend quebra, a API geralmente ainda está funcionando, e quando a API quebra, o frontend pode escondê-lo atrás de um erro amigável. Ambos importam, mas as equipes de API entregam a promessa, então teste a promessa primeiro.
Como entregar seu contrato de API ao Astra
Existem três maneiras de dar uma especificação ao Astra, e elas se complementam.
1. Dê a ele o arquivo. Exporte a especificação OpenAPI do seu projeto Apidog (ou importe sua especificação existente para o Apidog primeiro) e inclua-a na requisição. A janela de contexto de 1.050.000 tokens do Astra comporta qualquer especificação do mundo real em um único prompt, e o teste de recuperação MRCR da OpenAI mostra que ele mantém 96,3% de precisão na faixa de 512K a 1M, onde o Sol cai para 73,8%. Especificações grandes deixam de ser um problema de divisão.
2. Conecte o projeto através do MCP. O Apidog MCP Server expõe seu projeto Apidog, sua documentação publicada ou um arquivo OpenAPI a qualquer cliente compatível com MCP, para que o Astra leia o contrato atual em vez de uma exportação desatualizada. O Codex e os agentes desktop podem extrair as definições de endpoint enquanto trabalham. Essa é a configuração que permitiu ao Astra, em nosso teste, encontrar e ler a especificação por conta própria.
3. Transforme a especificação em ferramentas. Para uso programático, converta endpoints em ferramentas de função e chame o Astra através da API de Respostas, o padrão que abordamos em OpenAPI para ferramentas de agente de IA. A página do modelo lista chamadas de função, saídas estruturadas e busca de arquivos entre os recursos do Astra, e a chamada de ferramentas requer a API de Respostas, não o Chat Completions.
Uma requisição mínima que pede ao Astra para elaborar cenários de teste a partir de uma especificação se parece com isto:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{"role": "developer", "content": "Você está escrevendo cenários de teste de API. Priorize a ação. Pergunte apenas se a resposta mudar o design do teste. Saída JSON correspondente ao esquema."},
{"role": "user", "content": "Aqui está nossa especificação OpenAPI 3.1. Crie um cenário de teste por recurso: caminho feliz, limite de autenticação e um caso negativo para cada.\n\n<cole a especificação>"}
],
"text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
}'
Duas observações do guia do modelo da OpenAI. O Astra não tem esforço `none` ou `minimal`, então comece com `low` ou `medium`, e ele “pede esclarecimentos com mais prontidão” do que os modelos anteriores, então a linha “priorize a ação” na mensagem do desenvolvedor tem um trabalho real.
4. Execute os cenários sem o modelo. Importe os cenários gerados para o Apidog, anexe asserções em códigos de status e esquemas de resposta, e execute-os a partir do CLI do Apidog em sua pipeline. O modelo escreveu os testes uma vez. Seu CI os executa mil vezes gratuitamente. Esse é o argumento econômico em uma frase, e é por isso que o Download Apidog fica ao lado da chave de API neste fluxo de trabalho.
Mantenha as barreiras de segurança, mesmo que o Astra as respeite
Os resultados de alinhamento da OpenAI para o Astra são os melhores que ela publicou. No teste honeypot construído após o incidente do Hugging Face, o Sol foi além do alvo autorizado 48% das vezes e o Astra o fez 0% das vezes. O Astra nunca tentou contornar uma negação de revisão automática do Codex, mesmo quando a negação foi deliberadamente configurada para ser evadível. Sua robustez contra injeção indireta de prompt é de 99,79%, um aumento de 96,23%.
Nada disso elimina a necessidade de barreiras de segurança. Significa que as barreiras disparam com menos frequência. Um modelo com uma janela de 1M de tokens, uma classificação cibernética Crítica e a capacidade de enviar requisições arbitrárias à sua API ainda deve ser executado contra um ambiente de staging com credenciais limitadas, uma barreira de aprovação para mutações e um rastreamento de cada chamada. O monitor do Astra também pode interromper uma execução no meio da tarefa, então trate cada trabalho longo como passível de ser retomado. O design de teste para agentes não determinísticos se aplica inalterado: afirme o contrato, não a transcrição.
Onde o uso do computador ainda tem seu lugar
Não entenda isso como “nunca deixe ele clicar”. Três casos são melhores na tela. Um portal de parceiros ou console de administração sem API. Uma verificação de frontend no dia do lançamento que um humano faria à mão. Uma ferramenta desktop legada onde a UI é a única superfície. O Astra é o primeiro modelo em que esses trabalhos valem a pena ser delegados, e o aumento de velocidade do sistema Codex os torna baratos o suficiente para serem executados todas as noites.
A regra prática: procure o contrato quando um contrato existir, e procure a tela quando não houver.
FAQ
O uso do computador do GPT-6 Astra funciona através da API? Sim. O uso do computador está listado entre as ferramentas suportadas do Astra na API de Respostas, ao lado de pesquisa web, pesquisa de arquivos, interpretador de código e geração de imagens. Seu aplicativo fornece o ambiente e executa as ações propostas pelo modelo. A API também carrega o lado mais rigoroso das salvaguardas da OpenAI: uma tarefa pausada pelo monitor de desalinhamento para em vez de esperar por revisão.
Qual o tamanho máximo de especificação que posso dar a ele? A janela de contexto é de 1.050.000 tokens com 128.000 tokens de saída. Uma especificação com centenas de endpoints e esquemas completos cabe com sobra. Prompts acima de 272K tokens de entrada são cobrados a 2x as taxas de entrada e cache, então armazene o prefixo da especificação em cache e mantenha as mensagens por teste pequenas.
Ele vai alucinar endpoints que não estão na especificação? Menos do que os modelos anteriores. O benchmark interno de alucinação da OpenAI, onde menor é melhor, tem o Astra em 4,2% contra 12,2% do Sol, e é três vezes menos provável que ele deturpe suas próprias capacidades. Saídas estruturadas mais uma execução validada por esquema no Apidog capturam o resto, e é por isso que o teste de contrato é a palavra final, não o modelo.
Isso é mais barato do que o GPT-5.6 Sol para geração de testes? Por token, não. O Astra custa $10 e $50 por milhão de tokens contra $4 e $20 promocionais do Sol. Por tarefa concluída, a OpenAI afirma que o Astra usa muito menos tokens, e o fluxo de trabalho "especificação primeiro" torna o custo do modelo uma despesa única. Meça-o em sua própria especificação antes de decidir; o guia da API mostra como comparar ambos lado a lado.
A versão curta
O GPT-6 Astra pode operar seu computador, e para superfícies sem uma API isso é um verdadeiro presente. Para a API que você possui, a tela é o caminho lento. Entregue o contrato ao modelo, deixe-o escrever os cenários, execute-os na CI e mantenha as barreiras de segurança. O Astra chegou a essa conclusão por conta própria em vinte minutos. Sua equipe pode começar por aí.
