GPT-6 Luna para Workloads de API de Alto Volume: A Matemática do Custo em Volumes Reais de Requisições

Qual o custo real do GPT-6 Luna em escala: cálculo detalhado do custo por milhão de requisições para classificação de alto QPS, recuperação de 200 mil tokens e um preenchimento retroativo de 12 milhões de registros, com o desconto de 90% para leitura em cache aplicado.

Medy Evrard

23 setembro 2026

GPT-6 Luna para Workloads de API de Alto Volume: A Matemática do Custo em Volumes Reais de Requisições

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Toda equipe de backend tem uma lista de tarefas que, obviamente, seriam melhores com um modelo de linguagem e que ninguém nunca lançou. Classificar cinco milhões de eventos de suporte por dia. Enriquecer um catálogo de doze milhões de linhas. Pontuar cada webhook de entrada antes que ele chegue à fila. O motivo é sempre o mesmo: multiplique o custo por solicitação pelo seu número real de solicitações e o valor deixa de ser um erro de arredondamento.

GPT-6 Luna, anunciado em 22 de setembro de 2026, custa $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída, possui uma janela de contexto de 1.000.000 tokens e aplica um desconto de 90% para leituras de entrada em cache. Isso é barato o suficiente para tornar várias dessas tarefas engavetadas viáveis, e barato o suficiente para fazer as pessoas pararem de fazer as contas, que é como você acaba explicando uma fatura de cinco dígitos.

botão

Então, aqui está a aritmética: três formatos de carga de trabalho realistas, o custo por milhão de solicitações para cada um e as três variáveis que decidem sua fatura muito antes do preço de tabela.

As taxas com as quais você está trabalhando

Modelo ID da API Entrada por 1M Leitura em cache por 1M Saída por 1M Contexto
GPT-6 Luna gpt-6-luna $0,10 $0,01 $0,50 1.000.000
GPT-6 Sol gpt-6-sol $2,00 $0,20 $10,00 872.000
GPT-6 Astra n/d $10,00 n/d $50,00 n/d
Claude Opus 5.5 claude-opus-5-5 $4,00 $0,20 (escrita $5,00) $20,00 1.000.000

A coluna "Leitura em cache" para Sol e Luna é o desconto publicado de 90% aplicado à taxa de entrada, não um número publicado separadamente. A Anthropic publica sua taxa de leitura em cache diretamente e também cobra $5,00 por milhão para gravar o cache, o que importa em volume: uma carga de trabalho com alta rotatividade de prefixo paga esse custo de escrita repetidamente.

Uma correção de enquadramento antes dos números. A OpenAI descreve Sol e Luna como 50% mais baratos que os preços promocionais do GPT-5.6. Promocional é a própria palavra da OpenAI e está fazendo um trabalho real: a comparação é feita contra uma taxa com desconto, não a taxa na qual o GPT-5.6 foi lançado. Em relação ao preço de tabela do GPT-5.6 Luna de $1 de entrada e $6 de saída que nossa cobertura de lançamento documentou, o GPT-6 Luna representa um corte de 90% na entrada e 92% na saída.

Carga de trabalho A: classificação de alto QPS

O formato que a maioria das equipes busca primeiro: um prompt de sistema estável, esquemas de ferramentas e uma taxonomia, além de uma pequena carga útil variável, retornando um veredito estruturado curto. Assuma 1.500 tokens de prefixo estável, 500 tokens de carga útil variável, 120 tokens de saída e 5.000.000 de solicitações por dia.

Modelo Custo por 1M solicitações, frio Custo por 1M solicitações, prefixo em cache
GPT-6 Luna $260 $125
GPT-6 Sol $5.200 $2.500
Claude Opus 5.5 $10.400 $4.700
GPT-6 Astra $26.000 não publicado
GPT-5.6 Luna, preço de tabela $2.720 não aplicável

Com 5.000.000 de solicitações por dia, isso representa $625 no Luna com um prefixo em cache, cerca de $18.750 por mês. O mesmo tráfego no Sol sem cache custa $26.000 por dia, e no Astra $130.000.

Duas coisas se destacam nessa tabela. O desconto de cache corta esta fatura em 52% enquanto nada na carga de trabalho mudou; a única diferença é se os 1.500 tokens iniciais permaneceram byte idênticos entre as chamadas. E a lacuna de nível em volume é uma ordem de magnitude, não uma porcentagem. Escolher Luna em vez de Sol aqui é uma decisão vinte vezes maior, não um ajuste.

Carga de trabalho B: recuperação de contexto grande

Aqui, a janela de 1.000.000 tokens do Luna deixa de ser apenas uma linha na ficha técnica. Assuma um pacote de conhecimento de 200.000 tokens mantido estável em todas as chamadas, uma consulta de 2.000 tokens, 600 tokens de saída e 50.000 solicitações por dia.

Frio Prefixo em cache
GPT-6 Luna, por solicitação $0,0205 $0,0025
GPT-6 Luna, por dia $1.025 $125
GPT-6 Sol, por solicitação $0,410 $0,050
GPT-6 Sol, por dia $20.500 $2.500

O cache reduz 88% da fatura do Luna aqui, contra 52% na carga de trabalho A. Essa diferença é o ponto principal: o desconto é escalável com a proporção de prefixo estável para tokens novos. Um prefixo de 200.000 tokens relido 50.000 vezes por dia é o formato onde o cache de prompts mais compensa.

A janela do Luna também é maior que os 872.000 tokens do Sol, então uma carga útil de 900.000 tokens não cabe no modelo mais caro, mas cabe no mais barato. Isso inverte a regra usual de roteamento "promover para um modelo maior quando a carga útil cresce", coberta em detalhes em o que o GPT-6 Luna realmente é.

Carga de trabalho C: o backfill único

Os trabalhos em lote são onde o novo preço muda o que é possível, não apenas o que é barato. Assuma uma passagem de enriquecimento de 12.000.000 registros: 900 tokens de instrução estável, 300 tokens por registro, 250 tokens de saída.

GPT-6 Luna GPT-6 Sol
Entrada, fria $1.440 $28.800
Saída $1.500 $30.000
Total, frio $2.940 $58.800
Total, prefixo em cache $1.968 não calculado

Um backfill de doze milhões de registros por menos de $3.000, ou menos de $2.000 se o prefixo da instrução permanecer em cache. Esse é um número que uma equipe pode ter aprovado em uma única mensagem. O mesmo trabalho no Sol exige uma conversa sobre orçamento.

Observe a proporção aqui. A saída agora é metade da fatura, o que leva diretamente ao que realmente determina seu custo.

As três variáveis que decidem a fatura

1. Tokens de saída, porque são cobrados cinco vezes mais que os de entrada

A taxa de saída do Luna é 5 vezes a sua taxa de entrada. Na carga de trabalho A com o prefixo em cache, a entrada custa $65 por milhão de solicitações e 120 tokens de saída custam $60. Relaxe o formato da resposta para 400 tokens e a saída salta para $200, levando o total de $125 para $265 por milhão de solicitações. Um esquema de resposta escolhido em uma tarde mais que dobrou a fatura.

A solução é entediante e eficaz: restrinja a saída. Retorne um enum, não uma frase. Retorne uma pontuação, não uma explicação, e busque a explicação apenas para a pequena fração de casos que um humano revisa. Fixe o formato com um esquema JSON para que o modelo não possa preencher:

{
  "model": "gpt-6-luna",
  "response_format": {
    "type": "json_schema",
    "json_schema": {
      "name": "triage",
      "strict": true,
      "schema": {
        "type": "object",
        "properties": {
          "category": { "enum": ["billing", "outage", "how_to", "abuse"] },
          "severity": { "type": "integer", "minimum": 1, "maximum": 4 }
        },
        "required": ["category", "severity"],
        "additionalProperties": false
      }
    }
  }
}

Confirme os nomes dos parâmetros com a referência atual do modelo da OpenAI antes de construir sobre este formato. O ID do modelo `gpt-6-luna` é a parte confirmada do material de lançamento.

2. Taxa de acerto do cache, porque é o único 50% a 88% gratuito que você obterá

Tudo acima assume que o prefixo permanece byte idêntico. Em produção, geralmente não é o caso, porque alguém injeta um ID de solicitação no prompt do sistema ou constrói o array de ferramentas a partir de um dicionário cuja ordem das chaves se altera entre os processos. Dois clássicos assassinos de cache estão agora fora dessa lista: com o GPT-6, mudar o esforço de raciocínio ou a disponibilidade da ferramenta não invalida mais o cache, e pontos de interrupção explícitos permitem que você decida onde o prefixo em cache termina. Um Dashboard de Cache de Prompt e uma ferramenta de diagnóstico tornam a taxa de acerto algo que você mede em vez de apenas assumir, e o GitHub relata mais de 50% menos tokens de prompt precisando de processamento novo em bilhões de solicitações. Os mecanismos são abordados em nosso passo a passo do cache de prompts do GPT-6.

Em volume, trate a taxa de acerto como um SLI de produção. Uma refatoração de prefixo que silenciosamente o derruba de 95% de acertos para 40% custa à carga de trabalho A aproximadamente $400 por dia e não produz erros, alertas ou testes falhos.

3. Retentativas, porque elas se multiplicam

Uma taxa de retentativa de 5% na carga de trabalho A adiciona cerca de $31 por dia. Tolerável. Os mesmos 5% na carga de trabalho B custam $50 por dia se as retentativas errarem o cache e $6 se acertarem, e a diferença reside inteiramente em saber se sua retentativa reconstrói o prompt do zero. Retentativas que regeneram um prefixo são a resiliência mais cara que você pode comprar. Reutilize o corpo exato da solicitação.

A armadilha da latência em alto QPS

Barato não é rápido, e em alto QPS isso é um problema. Medições de terceiros da Artificial Analysis colocam o GPT-6 Luna em 153,9 tokens de saída por segundo com um tempo para o primeiro token de 124,23 segundos, e o GPT-6 Sol em 102,15 segundos. Duas ressalvas se aplicam e ambas são importantes: esses são números de terceiros, e não publicados pelo fornecedor, e são medidos nas variantes de raciocínio **máximo**, a configuração mais lenta disponível.

Mesmo assim, a direção importa. Dois minutos para o primeiro token estourarão um tempo limite padrão do cliente HTTP, inativarão um balanceador de carga e excederão o limite de execução na maioria dos runtimes serverless. Caminhos síncronos de alto QPS pertencem a baixo esforço com streaming; alto esforço pertence a trabalhos em lote e workers de fila onde nada espera por um socket. Dimensione os tempos limite em relação à latência medida no nível de esforço que você entrega, e não em relação ao preço.

Onde o piso de qualidade se encontra

Luna não é o modelo mais inteligente da família e a OpenAI não afirma que seja. Astra "continua sendo nosso melhor modelo em todas as áreas", nas próprias palavras da OpenAI. O que a OpenAI publica: Luna no esforço máximo atinge 66,6% no DeepSWE 1.1, comparável a Claude Opus 5 e Claude Fable 5 em esforço médio, com 93% menos custo por tarefa do que Opus 5 e 96% menos do que Fable 5. No AutomationBench 1.0.6 em alto esforço, ele supera seu predecessor em 5,4 pontos com 58% menos custo por tarefa. No OSWorld 2.0 offline em esforço máximo, ele supera o GPT-5.6 Sol em esforço médio por um décimo do custo.

Esses são números do fornecedor medidos contra o Claude Opus 5, não o Opus 5.5, que foi lançado no mesmo dia, então trate-os como direcionais. A leitura operacional é que Luna é o modelo mais barato que atinge o nível para trabalhos bem especificados e verificáveis, e "verificável" é a palavra chave.

Prove o modelo de custo antes de se comprometer com ele

A aritmética da planilha é uma hipótese. Teste-a em tráfego real: pegue uma amostra de 500 solicitações de payloads de produção, execute-a contra Luna e Sol como dois ambientes e registre as contagens de tokens, latência e conformidade do esquema.

No Apidog, isso é um endpoint salvo com o ID do modelo como uma variável de ambiente, executado como um cenário de teste contra um arquivo de dados de payloads reais. Adicione três asserções e o conjunto se torna um guarda-chuva de custo em vez de uma verificação de correção: afirme que a resposta corresponde ao seu esquema JSON, afirme que `usage.completion_tokens` permanece dentro do seu orçamento de saída por solicitação e afirme que `usage.prompt_tokens_details.cached_tokens` é diferente de zero, para que uma refatoração de prefixo que mate sua taxa de acerto de cache falhe na CI em vez de aparecer na fatura do próximo mês. Confirme esses nomes de campo de uso com a referência atual da API antes de fazer asserções sobre eles.

Essa última asserção é a que ninguém escreve e todo mundo precisa. O modo de falha de uma carga de trabalho de LLM de alto volume quase nunca é uma interrupção. É uma fatura 4x maior por trás de um dashboard verde.

Para ver como o preço do Luna se compara ao GPT-6 Sol e Claude Opus 5.5 ao longo da semana, veja nossa análise da guerra de preços de modelos de IA de setembro de 2026.

A versão resumida

Encaminhe trabalhos de alto volume, bem especificados e programaticamente verificáveis para Luna e mantenha a parte estável do seu prompt byte idêntica. Limite os tokens de saída, porque eles são cobrados cinco vezes mais que os de entrada. Meça a taxa de acerto do cache como uma métrica de produção. Mantenha alto esforço fora dos caminhos síncronos até que você tenha medido o tempo do primeiro token no seu próprio tráfego. Faça isso, e as tarefas que nunca foram lançadas porque a aritmética não funcionava valem a pena ser precificadas novamente esta semana.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs