GPT-5.6 Sol vs Terra vs Luna: Qual modelo usar?

GPT-5.6 Sol vs Terra vs Luna comparados: preços, benchmarks e níveis de esforço, além de um guia trabalho a trabalho para escolher o modelo GPT-5.6 da OpenAI certo.

Ashley Innocent

Ashley Innocent

10 julho 2026

GPT-5.6 Sol vs Terra vs Luna: Qual modelo usar?

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

A OpenAI disponibilizou o GPT-5.6 ao público em 9 de julho de 2026, e a primeira decisão que ele impõe não tem a ver com a atualização. É uma escolha de menu. A versão é lançada como três modelos, gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna, situados em três pontos da curva de custo-capacidade. Escolha muito alto e você paga as taxas Sol por um trabalho que o Terra faz muito bem. Escolha muito baixo e seu agente travará em tarefas para as quais o Luna nunca foi projetado.

Os nomes seguem um sistema: o número marca a geração, enquanto Sol, Terra e Luna são níveis duradouros que avançam em sua própria cadência. Nosso explicador de nomenclatura do GPT-5.6 cobre essa estrutura em profundidade, então este guia pula a história. O que você encontrará aqui é a decisão de compra: o que cada nível faz bem, onde a armadilha de preços se esconde e como resolver a escolha com seus próprios prompts em vez de gráficos de lançamento.

A resposta em 30 segundos

Modelo Preço por 1M de tokens Escolha-o quando
gpt-5.6-sol $5 entrada / $30 saída A tarefa é realmente difícil: codificação agentiva, orquestração de ferramentas em várias etapas, pesquisa profunda
gpt-5.6-terra $2.50 entrada / $15 saída Quase todo o resto. O padrão para trabalho de produção
gpt-5.6-luna $1 entrada / $6 saída Volume e latência prevalecem: classificação, extração, roteamento, rascunhos de primeira passagem

Terra é o padrão sensato. A OpenAI o posiciona como competitivo com o GPT-5.5 por aproximadamente metade do preço, o que significa que a classe de modelo que a maioria dos aplicativos de produção usava no mês passado agora custa a metade. Sol justifica seu prêmio apenas quando a tarefa é difícil o suficiente para mostrar uma diferença mensurável. Luna vence sempre que você multiplica os preços por token por milhões de solicitações.

Se você prefere testar a confiar, é um bom instinto. Todos os três modelos aceitam as mesmas chamadas da API de Respostas, então você pode executar um conjunto de prompts contra cada nível no Apidog e deixar as saídas resolverem a discussão. A configuração leva dez minutos; mais sobre isso abaixo.

Para que cada nível foi construído

Todos os três modelos estão ativos na API para qualquer conta. O acesso é self-service, sem restrições de plano, e os IDs de modelo acima vêm diretamente da documentação de desenvolvedores da OpenAI. A cobertura inicial da documentação relata uma janela de contexto de 1M de tokens, saída máxima de 128K e um corte de conhecimento em 16 de fevereiro de 2026 para toda a família; trate-os como figuras reportadas até que a página de modelos da OpenAI os confirme para sua conta.

Sol: o carro-chefe para problemas difíceis

Sol é o nível de raciocínio profundo, e os benchmarks de lançamento concentram seus ganhos exatamente onde você esperaria: trabalho agentivo de longo prazo. Segundo a OpenAI, Sol pontua cerca de 53 no Agents’ Last Exam contra 46,9 para GPT-5.5, atinge 88,8% no Terminal-Bench 2.1 e salta de 47,5 para 62,6 no OSWorld 2.0. Essas são alegações do dia do lançamento, então trate-as com cautela. Mas o padrão é consistente: planejamento, uso de ferramentas e recuperação de erros melhoraram muito mais do que a qualidade de texto rotineira.

Não é uma vitória total. No SWE-Bench Pro, Claude Fable 5 lidera com 80,3% contra 64,6% do Sol, então “carro-chefe” não significa “melhor em tudo”. Detalhamos onde os números parecem mais fortes e mais fracos em nossa análise dos benchmarks do GPT-5.6 Sol.

Terra: o padrão para trabalho de produção

A proposta do Terra é econômica em vez de heroica. A OpenAI o posiciona como competitivo com o GPT-5.5, sendo aproximadamente 2x mais barato, e essa abordagem por si só decide a maioria das cargas de trabalho reais. Se o seu produto funcionou bem com o GPT-5.5, o Terra oferece a mesma classe de capacidade pela metade do custo. Assistentes de chat, sumarização, pipelines de conteúdo, a maioria das configurações de RAG: este é o nível para começar, e do qual você precisaria argumentar para sair.

Luna: economia unitária e velocidade

Luna lida com o trabalho onde ninguém lê o raciocínio: classificação, extração de entidades, roteamento de solicitações, rascunhos de primeira passagem que um humano ou um modelo maior revisa. Com $1 de entrada / $6 de saída, ele custa um quinto do Sol em ambos os lados do medidor, e é o mais rápido dos três. O erro comum é emocional, não técnico: as equipes pulam o Luna porque “mais barato” soa como “pior”, e então pagam as taxas do Terra por tarefas com saídas de uma palavra.

A armadilha no padrão

Aqui está o detalhe que inflaciona as contas discretamente: o alias puro gpt-5.6 é roteado para Sol. Ao usar a string de modelo óbvia, você escolheu o nível mais caro sem nunca ter decidido isso.

{
  "model": "gpt-5.6-terra",
  "input": "Classify this support ticket by urgency and product area.",
  "reasoning": { "effort": "medium" }
}

A diferença se acumula rapidamente. Um serviço que processa 50M de tokens de entrada e 10M de saída por mês paga cerca de $275 no Terra, $550 no Sol e $110 no Luna. O mesmo tráfego, uma diferença de 5x, decidida por uma única string. Para a tabela de preços completa, incluindo descontos de cache, consulte nossa análise de preços do GPT-5.6. O artigo de lançamento de Simon Willison também vale a pena para a primeira análise independente de um desenvolvedor sobre o lançamento.

Correlacione o modelo à sua carga de trabalho

Três cenários cobrem a maior parte do espaço de decisão.

Um pipeline de codificação agentiva. Escolha Sol. Os ganhos de benchmark se encontram aqui, assim como os recursos GA: a chamada programática de ferramentas permite que o modelo escreva JavaScript que orquestra suas chamadas de ferramentas, executado em um ambiente de execução V8 isolado sem acesso à rede, e o raciocínio persistido carrega contexto entre as etapas. Quando uma execução leva 40 etapas e uma decisão ruim na etapa 12 desperdiça as próximas 28, a qualidade do modelo é o item mais barato no pipeline. O perfil completo do Sol cobre o que mais o carro-chefe muda.

Um assistente de chat de produção. Escolha Terra. Os usuários julgam a latência e a utilidade, não as diferenças de benchmark, e em perguntas rotineiras eles não conseguem distinguir Sol de Terra. Encaminhe a rara consulta difícil para Sol por trás de uma heurística se seus logs provarem que você precisa; não pague taxas de carro-chefe por “como redefinir minha senha”.

Um pipeline de documentos de alto volume. Escolha Luna e, em seguida, adicione cache. O GPT-5.6 suporta pontos de interrupção de cache explícitos (prompt_cache_options.mode: "explicit" com um campo ttl); leituras de cache mantêm o desconto de 90%, gravações são cobradas a 1,25x a taxa de entrada, e o conteúdo em cache vive por pelo menos 30 minutos. Para trabalhos de extração que reutilizam um prompt de sistema longo em milhares de documentos, Luna mais caching explícito se enquadra em uma classe de custo diferente dos outros dois. As novas configurações de detalhe de visão (original e auto) também preservam as dimensões da imagem de origem, o que é importante ao extrair campos de digitalizações.

Níveis de esforço mudam a matemática

O nível é apenas metade do ajuste. O GPT-5.6 expõe seis níveis de esforço de raciocínio em cada nível: none, low, medium, high, xhigh e max. Isso transforma três modelos em uma grade, e a comparação de células mais interessante não é Sol contra Terra na mesma configuração. É Terra em high contra Sol em medium. Terra com mais tempo de raciocínio pode fechar grande parte da lacuna de qualidade pela metade do preço do token, e se isso fecha o suficiente para suas tarefas é uma questão empírica, não de especificação.

A própria orientação de migração da OpenAI aponta para a mesma direção: trate a mudança como um ajuste fino, não uma troca de nome de modelo. Primeiro, avalie tarefas representativas e teste seu nível de esforço atual junto com um nível inferior. Uma observação adicional sobre prompts da documentação: o GPT-5.6 escreve respostas visivelmente mais curtas, com menos introduções genéricas, então remova o clichê “seja conciso” dos prompts que você usar, ou as respostas ficarão tão concisas a ponto de serem inúteis.

Para trabalho que prioriza a qualidade, onde você prefere esperar a rodar novamente, o modo profissional (reasoning.mode: "pro") está disponível em todos os três modelos. É uma configuração, não um modelo separado, então você pode ativá-lo no Terra tão facilmente quanto no Sol.

Teste os três antes de se comprometer

A resposta honesta para “qual modelo você deve usar” é: aquele que se sai melhor com seus prompts. Benchmarks são tarefas da OpenAI; seu tráfego de produção não é.

O teste é barato de executar. Colete de 10 a 20 tarefas reais de seus logs, incluindo as mais complexas. Baixe o Apidog, salve a URL base da OpenAI e a chave da API uma vez, depois coloque o ID do modelo em uma variável de ambiente para que uma definição de requisição cubra todos os três níveis. Alterne {{model}} entre gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna, execute o mesmo conjunto de prompts e compare duas coisas lado a lado: a qualidade da saída em relação ao seu próprio padrão, e a contagem de tokens de usage em cada resposta. Multiplique essas contagens pela tabela de preços e a tabela de custo por tarefa se escreverá sozinha.

Duas descobertas aparecem na maioria desses testes comparativos. Terra se iguala a Sol em uma parcela maior de tarefas do que a diferença de preço implica. E Luna se mantém em trabalhos de saída estruturada, na via de classificação e extração, com muito mais frequência do que seu preço sugere. Você só descobre onde sua carga de trabalho quebra esse padrão executando-a.

Onde o Ultra se encaixa

Ultra é a única opção nesta linha que não é um ID de modelo de API. É uma configuração multi-agente que executa quatro agentes em paralelo por padrão, gastando mais tokens deliberadamente em troca de resultados mais rápidos em problemas difíceis. Segundo a OpenAI, o Ultra eleva a pontuação do Terminal-Bench 2.1 do Sol de 88,8% para 91,9%.

A disponibilidade é restrita por plano no lado do produto: o Ultra está disponível no ChatGPT Work nos planos Pro e Enterprise, e no Codex a partir do Plus. O produto de chat tem seu próprio mapa de níveis, de acordo com o centro de ajuda da OpenAI:

Plano ChatGPT Acesso ao GPT-5.6
Gratuito / Go Terra
Plus Sol, Terra e Luna com controle de esforço por modelo (Sol a partir de esforço médio)
Pro / Business / Enterprise Tudo o acima, mais Sol Pro
ChatGPT Work (Pro / Enterprise), Codex (Plus e superior) Ultra

Se sua carga de trabalho de agente paralelo reside em código em vez de chat, observe a beta multi-agente na API de Respostas; é o irmão do lado da API da mesma ideia.

FAQ

O gpt-5.6-terra é bom o suficiente para substituir o GPT-5.5 em produção?

Para a maioria das cargas de trabalho, sim. A OpenAI posiciona o Terra como competitivo com o GPT-5.5 por aproximadamente metade do preço, e a mesma superfície da API de Respostas significa que a troca é de baixo risco. Execute suas avaliações antes de migrar e fique atento ao comprimento da saída, já que as respostas do GPT-5.6 são mais curtas por design.

O que acontece se eu chamar o alias puro gpt-5.6?

Sua solicitação é roteada para Sol e cobrada pelas taxas Sol, $5 por 1M de tokens de entrada e $30 por 1M de saída. Nada quebra, o que é o problema; o custo aparece mais tarde na fatura. Fixe gpt-5.6-terra ou gpt-5.6-luna explicitamente onde um nível mais barato realiza o trabalho.

Posso trocar de nível sem alterar minha integração?

Sim. Sol, Terra e Luna compartilham a mesma superfície da API de Respostas, então a mudança entre eles é uma alteração de uma linha na string do modelo. Os níveis de esforço e o modo profissional também funcionam em todos os três. Nosso guia sobre como usar a API GPT-5.6 detalha o formato da requisição de ponta a ponta.

Preciso de um plano específico do ChatGPT para usar esses modelos na API?

Não. O acesso à API é self-service para qualquer conta de API, sem restrição de plano em nenhum dos três modelos. Os níveis de plano do ChatGPT controlam apenas o produto de chat, e o Ultra é a única capacidade que permanece no lado do produto (ChatGPT Work e Codex) em vez de ser lançado como um modelo de API.

Sua primeira hora com os níveis

Comece com o Terra e faça os outros níveis provarem seu valor. Escale para Sol apenas onde suas próprias avaliações mostrarem uma lacuna que valha a pena pagar o dobro, o que geralmente significa trabalho agentivo e de longo prazo. Reduza para Luna sempre que as saídas forem curtas e o volume for alto. Fixe IDs de modelo explícitos em todos os lugares para que o alias Sol-por-padrão nunca escolha por você, e ajuste os níveis de esforço antes de mudar de nível, porque o Terra em high é a atualização de qualidade mais barata da linha.

Então pare de ler e meça. Carregue seus dez prompts de produção mais complexos no Apidog, aponte uma requisição para todos os três IDs de modelo com uma variável de ambiente, e deixe suas próprias contagens de tokens e saídas tomarem a decisão. Todo o exercício custa menos de um dólar em gastos com API e resolve uma decisão que se acumula a cada mês.

button

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs