OpenAI Reduz Drasticamente Preços da API GPT-5.6: Luna Cai 80%, Terra Cai 20% (Nova Tabela de Preços)

A OpenAI reduziu os preços da API GPT-5.6 em 30 de julho de 2026: Luna caiu 80% para US$0,20/US$1,20 por milhão de tokens, Terra 20% para US$2/US$12. Tabela completa de preços antigos x novos, por que a OpenAI reduziu os preços e como redirecionar suas cargas de trabalho.

Ashley Innocent

Ashley Innocent

31 julho 2026

OpenAI Reduz Drasticamente Preços da API GPT-5.6: Luna Cai 80%, Terra Cai 20% (Nova Tabela de Preços)

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

A OpenAI cortou os preços da API em dois dos seus três modelos GPT-5.6 em 30 de julho de 2026. O GPT-5.6 Luna agora custa 80% menos: US$ 0,20 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída. O GPT-5.6 Terra caiu 20%, para US$ 2 de entrada e US$ 12 de saída. O GPT-5.6 Sol, o modelo de raciocínio carro-chefe, mantém suas taxas de US$ 5 e US$ 30, mas ganha um novo modo Rápido que funciona 2,5x mais rápido pelo dobro do preço padrão.

Se você construiu seu modelo de custos com base nos preços de lançamento do GPT-5.6, essa matemática agora está desatualizada. Este post aborda a nova tabela de preços, por que a OpenAI cortou os preços, como os números se comparam ao nível Gemini Flash do Google e o que mudar no seu próprio roteamento de API esta semana. E como a maneira mais rápida de comparar os custos dos modelos é testar a mesma solicitação em cada nível, ferramentas como o Apidog simplificam o envio de um prompt através de Sol, Terra e Luna lado a lado e a medição do consumo de tokens antes de você se comprometer.

botão

A nova tabela de preços do GPT-5.6

Aqui está o antes e o depois completo, por milhão de tokens:

Modelo Entrada antiga Nova entrada Saída antiga Nova saída Mudança
GPT-5.6 Sol $5.00 $5.00 $30.00 $30.00 Sem mudança
GPT-5.6 Terra $2.50 $2.00 $15.00 $12.00 -20%
GPT-5.6 Luna $1.00 $0.20 $6.00 $1.20 -80%

Os novos preços entraram em vigor em 30 de julho de 2026 e se aplicam ao nível padrão da API. A diferença entre o topo e a base da família saltou de 5x na disponibilidade geral em 9 de julho para 25x hoje. Essa lacuna altera a decisão de roteamento. Há três semanas, enviar uma tarefa para Luna em vez de Sol economizava 80% da conta. Agora economiza 96%.

Os descontos de cache de prompts ainda se aplicam além dessas taxas. A OpenAI não publicou preços de entrada em cache separados para as novas taxas de Luna e Terra no anúncio, então verifique a página oficial de preços antes de atualizar as previsões de faturamento que dependem de leituras de cache.

O que aconteceu com Sol

O preço de tabela de Sol permanece inalterado, mas suas opções de velocidade mudaram. A OpenAI introduziu um modo Rápido para Sol: geração de tokens 2,5x mais rápida pelo dobro da taxa padrão. O modo Rápido substitui o nível anterior de Processamento Prioritário, então, se o seu tráfego de produção hoje roda com Processamento Prioritário, você precisará migrar essa configuração e verificar novamente a linha da fatura em que ela se encaixa.

A leitura prática: a OpenAI está segmentando Sol por latência em vez de dar descontos. Equipes que precisam de raciocínio de ponta em velocidades interativas pagam um prêmio por isso. Todos os outros roteiam para a família (de modelos inferiores), que é exatamente para onde os cortes de preços o impulsionam.

Por que a OpenAI cortou os preços

A OpenAI enquadra os cortes como ganhos de eficiência repassados, em vez de uma jogada para atrair clientes. O anúncio credita quatro alavancas:

Esse último é o detalhe que vale a pena lembrar. A OpenAI diz que Sol reescreveu autonomamente os kernels de serviço, cortando a sobrecarga de serviço de ponta a ponta em 20% e melhorando a eficiência da geração de tokens em mais de 15%. “Tornar a inteligência avançada mais abundante e acessível é central para a missão da OpenAI”, disse a empresa no anúncio. Seja o que for que você pense sobre o enquadramento da missão, o mecanismo é concreto: o modelo agora é barato o suficiente para ser servido, de modo que a OpenAI pode reduzir o preço de Luna em 80% e ainda proteger a margem.

Há também um impulsionador competitivo óbvio. A cobertura do VentureBeat enquadra o corte como uma resposta direta ao nível Flash do Google. O preço de tabela combinado de Luna (entrada mais saída) é agora de US$ 1,40 por milhão de tokens, superando tanto o Gemini 3.5 Flash-Lite em US$ 2,80 quanto o Gemini 3.6 Flash em US$ 9. O lado mais barato da fronteira é onde o volume reside, e a OpenAI o quer de volta.

O que o corte significa para suas cargas de trabalho

O corte de 80% em Luna é o que muda as decisões de arquitetura, não o ajuste de 20% em Terra. Algumas mudanças concretas:

Loops de agentes ficam baratos. Cargas de trabalho agenticas consomem tokens em longas cadeias: planejar, chamar uma ferramenta, ler o resultado, tentar novamente. Com US$ 1 de entrada e US$ 6 de saída, executar esses loops em Luna era defensável. Com US$ 0,20 e US$ 1,20, é o padrão. O próprio anúncio da OpenAI destaca os loops de agentes complexos como a carga de trabalho que o novo preço de Luna desbloqueia.

Classificação, extração e sumarização descem de nível. Se você manteve essas tarefas em Terra porque a margem de qualidade de Luna parecia pequena, refaça a avaliação. A qualidade não mudou; o preço mudou. Uma carga de trabalho que custa US$ 100 por dia em Terra custa cerca de US$ 11 em Luna com as novas taxas.

Terra como padrão fica mais barato para defender. Nossa análise Sol vs Terra vs Luna recomendou Terra como o padrão sensato para o trabalho diário. Esse conselho se mantém, e agora custa 20% menos para seguir.

O ajuste de esforço ainda importa mais do que a tabela de preços. O GPT-5.6 expõe seis níveis de esforço de raciocínio, e um esforço maior produz mais tokens de saída, que é a direção mais cara em todos os níveis. Um corte de preço não corrige uma configuração de esforço superdimensionada.

Como verificar novamente seus próprios números

Não confie cegamente nas porcentagens; meça seu tráfego real. O fluxo de trabalho que detecta surpresas cedo:

  1. Obtenha uma amostra representativa de prompts de produção.
  2. Envie as mesmas solicitações para gpt-5.6-luna, gpt-5.6-terra e gpt-5.6-sol e capture a contagem de tokens por resposta.
  3. Multiplique pelas novas taxas e compare com a qualidade em seu próprio conjunto de avaliação.

O Apidog torna a etapa 2 rápida: defina o endpoint de conclusão de chat uma vez, alterne o ID do modelo com uma variável de ambiente e execute o mesmo cenário de teste contra todos os três níveis. O visualizador de resposta mostra o bloco de uso por chamada, para que você obtenha contagens reais de tokens de entrada e saída em vez de estimativas. Se você está conectando o GPT-5.6 a um aplicativo pela primeira vez, nosso guia para usar a API GPT-5.6 aborda autenticação, IDs de modelo e o formato da solicitação. Você também pode simular o endpoint enquanto espera pela aprovação do orçamento e, em seguida, alternar para o tráfego em tempo real sem reescrever os testes. Baixe o Apidog gratuitamente para fazer a comparação.

A visão geral: a guerra de preços está em andamento

Esta é a terceira grande movimentação de preços na ponta barata da fronteira neste verão. O Google atualizou seu nível Flash em julho, a Anthropic lançou o Claude Opus 5 pela metade do preço do Fable 5, e agora a OpenAI cortou o Luna para um valor inferior às duas opções do Gemini Flash. A qualidade do modelo ainda separa os carros-chefe, mas o nível de "cavalo de batalha" está convergindo para uma regra simples: quem for mais barato neste mês ganha os trabalhos em lote.

Para equipes de API, isso significa que a escolha do modelo não é mais uma decisão anual. Construa sua integração para que o ID do modelo seja um valor de configuração, mantenha um conjunto de avaliação constante e execute novamente a comparação de custos sempre que um fornecedor se mover. As equipes que tratam o roteamento de modelos como infraestrutura, com testes e monitoramento ao redor, capturam cada corte de preço em dias, em vez de trimestres.

Perguntas Frequentes

Quais são os novos preços da API GPT-5.6?

A partir de 30 de julho de 2026: Luna custa US$ 0,20 por milhão de tokens de entrada e US$ 1,20 por milhão de saída; Terra custa US$ 2 e US$ 12; Sol permanece inalterado em US$ 5 e US$ 30. Sol também ganhou um modo Rápido pelo dobro da taxa padrão para processamento 2,5x mais rápido.

O GPT-5.6 Sol teve um corte de preço?

Não. As taxas padrão de Sol permanecem inalteradas. As mudanças em Sol são estruturais: um novo modo Rápido substitui o nível de Processamento Prioritário, trocando o dobro do preço por 2,5x de velocidade.

O GPT-5.6 Luna agora é mais barato que o Gemini Flash?

Pelo preço de tabela, sim. A taxa combinada de entrada e saída de Luna é de US$ 1,40 por milhão de tokens, contra US$ 2,80 para Gemini 3.5 Flash-Lite e US$ 9 para Gemini 3.6 Flash. Preço não é qualidade, porém: execute ambos contra seu próprio conjunto de avaliação antes de mudar. Se você quiser a rota gratuita primeiro, veja como usar o GPT-5.6 gratuitamente.

Os cortes de preços se aplicam automaticamente?

Sim. As novas taxas se aplicam ao uso padrão da API a partir de 30 de julho de 2026, sem necessidade de alterações no código. Você só precisa agir se usar Processamento Prioritário em Sol, que está sendo substituído pelo modo Rápido.

O que fazer esta semana

A nova tabela de preços recompensa as equipes que agem rápido. Refaça seu modelo de custos com os novos números, reavalie quais cargas de trabalho Luna pode absorver com 96% abaixo do preço de Sol, e verifique se o ajuste de 20% de Terra altera quaisquer limites de roteamento. Em seguida, verifique com tráfego real em vez de cálculos de tabela de preços: um cenário de teste no Apidog, três IDs de modelo, e os números de uso dirão exatamente o que o corte vale para você.

botão

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs