Preços Gemini 3.8 Flash: taxas de introdução, tokens de processamento e o custo real por tarefa

Preços do Gemini 3.8 Flash: tarifas introdutórias de $0.75/$3.75, que dobram em 1º de janeiro de 2027; tokens de 'pensamento' cobrados como saída; caching; processamento em lote; e o motivo pelo qual o custo por tarefa subiu para $0.58.

Ashley Goolam

Ashley Goolam

3 setembro 2026

Preços Gemini 3.8 Flash: taxas de introdução, tokens de processamento e o custo real por tarefa

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

O Gemini 3.8 Flash custa $0.75 por milhão de tokens de entrada e $3.75 por milhão de tokens de saída, a mesma taxa de introdução que o Google estabeleceu para o 3.7 Flash. Essa taxa é válida até 31 de dezembro de 2026. Em 1º de janeiro de 2027, ela dobra para $1.50 e $7.50, e a mesma duplicação afeta o 3.6 Flash e o 3.7 Flash no mesmo dia. Nada sobre o preço por token mudou com este lançamento.

O que mudou foi a quantidade de tokens que o modelo gasta. O Google diz que o 3.8 Flash “trabalha mais”: ele realiza mais etapas de raciocínio, chama ferramentas iterativamente e “pode usar mais tokens em tarefas mais longas e complexas, por design”. A Artificial Analysis mediu o efeito independentemente: executar seu Índice de Inteligência custou $0.58 por tarefa no 3.8 Flash em pensamento alto versus $0.40 no 3.7 Flash, com cerca de 30% mais tokens de saída por tarefa. Mesmo preço de tabela, conta mais alta.

Este guia examina cada linha na página oficial de preços da API Gemini, apresenta um exemplo de 1.000 tarefas por dia em cada nível de raciocínio e compara a taxa com o Flash-Lite, Claude Sonnet 5 e GPT-5.6 Luna. Para uma visão geral do modelo, comece com o que é o Gemini 3.8 Flash.

Preços do Gemini 3.8 Flash em resumo

Todos os preços são por 1 milhão de tokens na camada paga.

Taxa Introdução (até 31 de dezembro de 2026) Padrão (a partir de 1º de janeiro de 2027)
Entrada (texto, imagem, vídeo, áudio, PDF) $0.75 $1.50
Saída (inclui tokens de raciocínio) $3.75 $7.50
Leitura de cache de contexto $0.075 $0.15
Armazenamento em cache (por 1M tokens por hora) $0.50 $1.00
Entrada da API em lote (50% de desconto) $0.375 $0.75
Saída da API em lote (50% de desconto) $1.875 $3.75
Aterramento da Pesquisa Google 5.000 requisições gratuitas/mês compartilhadas entre Gemini 3.x, depois $14 por 1.000 Mesmo
Camada gratuita $0, com limite de taxa, dados usados para melhorar produtos Google Mesmo

Três detalhes importam mais do que os números de destaque. O preço da saída cobre os tokens de raciocínio, então o raciocínio interno é cobrado a $3.75, não $0.75. A taxa de introdução tem uma data de término fixa. E as linhas do 3.7 Flash e 3.6 Flash têm a mesma duplicação em 1º de janeiro, então um Flash mais antigo não o protege do aumento. O detalhamento de preços do 3.7 Flash cobre as mesmas taxas em um modelo que gasta menos tokens por tarefa.

Tokens de raciocínio são tokens de saída

O Gemini 3.8 Flash raciocina antes de responder, e cada token desse raciocínio é medido como saída. A API reporta a contagem como usageMetadata.thoughtsTokenCount em uma resposta generateContent, separada de candidatesTokenCount (a resposta visível) e promptTokenCount (sua entrada). Ambos os grupos de saída são cobrados à mesma taxa de $3.75.

Você controla a quantidade com thinking_level: low (baixo), medium (médio) ou high (alto). No 3.8 Flash, o padrão é medium, não high como no Gemini 3 Pro. minimal foi removido e retorna um erro de validação, então qualquer configuração herdada de modelos anteriores precisa ter esse valor mapeado para low. A documentação de raciocínio do Google descreve os níveis como esforço relativo, não um orçamento de tokens, então você não pode limitar os tokens de raciocínio diretamente como o antigo thinking_budget inteiro permitia. O que cada nível faz à latência e ao custo está no guia de níveis de raciocínio do 3.8 Flash.

Uma ilustração rápida com tamanhos fictícios, mas realistas. Suponha que uma requisição envie 10.000 tokens de entrada e receba de volta 2.000 tokens de saída visíveis mais 6.000 tokens de raciocínio. Nas taxas de introdução:

O raciocínio é 75% da cobrança de saída e 60% da requisição inteira. A partir de 1º de janeiro, a mesma requisição custa $0.015 + $0.06 = $0.075. “Mesmo preço que o 3.7” é verdadeiro e incompleto: a taxa se manteve, a contagem de tokens se moveu.

Por que o custo por tarefa aumentou enquanto o preço não

A publicação de lançamento do Google é direta sobre a troca: em tarefas complexas, o modelo “executa etapas de raciocínio extras e chama ferramentas iterativamente”, verificando seu trabalho ao longo do caminho. Mais etapas significam mais tokens de raciocínio e, em loops de agente, mais turnos de chamada de ferramentas. O conselho de mitigação do Google: reduzir o thinking_level, ou permanecer no 3.7 Flash.

A Artificial Analysis colocou números nisso. Seu Índice de Inteligência executa nove avaliações; o 3.8 Flash em nível alto obteve 59 pontos contra 56 do 3.7 Flash em nível alto, usando cerca de 48.000 tokens de saída por tarefa em média, um aumento de 30% em relação ao 3.7 Flash. O custo para executar o índice por tarefa:

Configuração Custo por tarefa (AA, taxas de introdução) Tempo por tarefa
Gemini 3.8 Flash, alto $0.58 2.5 min
Gemini 3.8 Flash, médio $0.41 não publicado
Gemini 3.8 Flash, baixo $0.24 0.8 min
Gemini 3.7 Flash, alto $0.40 2.2 min

Leia a tabela de duas maneiras. Em comparação com seu predecessor, o 3.8 Flash em nível alto custa 45% mais por tarefa ($0.58 / $0.40 = 1.45) para um ganho de três pontos no índice. Em comparação consigo mesmo, a queda de alto para médio reduz o custo por tarefa em 29% ($0.41 / $0.58 = 0.71), e o baixo o reduz em 59% ($0.24 / $0.58 = 0.41). O médio no 3.8 Flash fica a um centavo do alto no 3.7 Flash, uma âncora útil ao decidir se vale a pena atualizar. A comparação entre 3.8 Flash e 3.7 Flash aborda essa decisão por carga de trabalho.

A Artificial Analysis também lista um preço combinado de $0.58 por milhão de tokens em uma proporção de entrada para saída de 3:1. Que isso corresponda ao custo por tarefa em nível alto é uma coincidência; um é uma taxa por token, o outro depende de quantos tokens o modelo escolhe gastar.

Garanta a taxa de introdução antes de 31 de dezembro

“Garantir” precisa de um significado preciso, pois a taxa de introdução não é um contrato. O Google cobra o uso pela taxa em vigor quando os tokens são consumidos, então você não pode pré-pagar o uso de 2027 com preços de 2026, e mudar para o 3.7 ou 3.6 Flash não ajuda. O que você pode fazer é mover trabalhos discricionários para o período:

Se o preço for o fator decisivo entre os provedores, nosso resumo dos provedores de API LLM mais baratos apresenta todo o campo; a comparação entre Fable 5.1 e GPT-5.6 Sol cobre as camadas premium.

Como se compara ao Flash-Lite, Sonnet 5 e GPT-5.6 Luna

Taxas por token, por 1 milhão de tokens:

Modelo Entrada Saída Notas
Gemini 3.8 Flash (introdução) $0.75 $3.75 Raciocínio cobrado como saída; leitura de cache $0.075
Gemini 3.8 Flash (a partir de 1º de janeiro) $1.50 $7.50 Leitura de cache $0.15
Gemini 3.5 Flash-Lite $0.30 $2.50 Cerca de 350 tok/s
Claude Sonnet 5 $2 $10 Permanente; o aumento de 1º de setembro foi cancelado
GPT-5.6 Luna $1 $6

Nas taxas de introdução, a entrada do 3.8 Flash é 2.5x a do Flash-Lite e a saída é 1.5x. Em comparação com o Sonnet 5, o 3.8 Flash é cerca de 2.7x mais barato tanto na entrada ($2 / $0.75) quanto na saída ($10 / $3.75). Em comparação com o Luna, também é mais barato: $0.75 vs $1 na entrada, $3.75 vs $6 na saída.

O cenário muda em 1º de janeiro. A $1.50 e $7.50, o 3.8 Flash se torna mais caro que o Luna em ambos os lados, e a diferença para o Sonnet 5 diminui para cerca de 1.3x ($2 / $1.50 e $10 / $7.50). O Flash-Lite permanece mais barato em todo o período. Se a taxa de introdução é o motivo pelo qual você escolheu o 3.8 Flash, coloque a reavaliação de janeiro na agenda agora.

A comparação por token é apenas metade disso. Um modelo que gasta menos tokens por resposta pode custar menos por tarefa a uma taxa mais alta, e a única maneira de saber é executar o mesmo conjunto de tarefas em cada candidato e ler as contagens de uso. O guia da API 3.8 Flash mostra como ler usageMetadata tanto da API de Interações quanto do legado generateContent.

Detecte regressões de custo com asserções de token Apidog

O modo de falha com o 3.8 Flash não é uma resposta errada. É uma resposta correta que silenciosamente usou 40% mais tokens após um ajuste no prompt ou uma mudança no nível de raciocínio, e ninguém percebe até a fatura. O Apidog resolve isso tratando a contagem de tokens como um campo para asserir, como um código de status.

  1. Armazene a chave como uma variável de ambiente. Crie GEMINI_API_KEY em um ambiente Apidog e referencie-a como {{GEMINI_API_KEY}} no cabeçalho x-goog-api-key, para que a chave nunca esteja em uma requisição salva.
  2. Envie um prompt modelo. Salve um POST para https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent com um prompt representativo e um thinkingConfig.thinkingLevel explícito, um por rota de produção.
  3. Asserte nos campos de uso. Adicione um script de pós-processamento que leia usageMetadata e falhe no teste se os tokens excederem um limite definido a partir de sua base:
const usage = pm.response.json().usageMetadata;
pm.test("tokens de raciocínio dentro do orçamento", () => {
  pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("saída visível dentro do orçamento", () => {
  pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("custo da requisição dentro do orçamento", () => {
  const cost = usage.promptTokenCount * 0.75 / 1e6
    + (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
  pm.expect(cost).to.be.below(0.05);
});
  1. Agende. Coloque as requisições em um cenário de teste e execute-o em um cronograma, para que um salto no uso de tokens apareça como uma falha no mesmo dia; nosso guia sobre como agendar testes de API no Apidog cobre a configuração. Atualize as duas constantes de taxa em 1º de janeiro e a asserção de custo continuará acompanhando a fatura.

O mesmo cenário serve como uma comparação entre provedores: aponte uma cópia para Flash-Lite, Sonnet 5 ou Luna e compare os campos de uso lado a lado. Baixe o Apidog para construir o primeiro cenário; o plano gratuito cobre este fluxo de trabalho.

Perguntas Frequentes

O Gemini 3.8 Flash custa mais que o 3.7 Flash? Por token, não. Ambos custam $0.75 de entrada e $3.75 de saída até 31 de dezembro, depois $1.50 e $7.50. Por tarefa, sim: a Artificial Analysis mediu $0.58 por tarefa de índice no 3.8 Flash em nível alto versus $0.40 no 3.7 Flash, porque o 3.8 Flash gera cerca de 30% mais tokens de saída.

Os tokens de raciocínio são cobrados separadamente? Não. Eles são cobrados como tokens de saída a $3.75 por milhão (introdução) e aparecem em usageMetadata.thoughtsTokenCount. Você os controla indiretamente através de thinking_level; não há um orçamento de tokens fixo no 3.8 Flash, e minimal retorna um erro.

Existe uma camada gratuita para o Gemini 3.8 Flash? Sim. A camada gratuita do AI Studio não cobra nada por entrada ou saída, com limites de taxa mostrados no AI Studio, e o Google usa dados da camada gratuita para melhorar seus produtos. O aplicativo Gemini para consumidores serve o 3.8 Flash apenas para assinantes do AI Pro e Ultra. Detalhes estão no guia de uso gratuito.

O que acontece com meus custos em 1º de janeiro de 2027? As taxas de entrada, saída, leitura de cache, armazenamento em cache e em lote dobram. Se o uso de tokens por tarefa permanecer o mesmo, sua fatura também dobra. As linhas do 3.6 e 3.7 Flash dobram na mesma data.

Qual nível de raciocínio mantém os custos baixos? Comece pela distribuição da Artificial Analysis: baixo $0.24, médio $0.41, alto $0.58 por tarefa de índice. Execute suas próprias avaliações em cada nível, mantenha o mais baixo que passar e asserte nas contagens de tokens para que a configuração não se altere.

O que fazer esta semana

O Gemini 3.8 Flash tem preço semelhante ao 3.7 Flash e gasta tokens como um modelo maior. Trate o nível de raciocínio como uma configuração de custo e defina-o por rota. Mova o trabalho compatível com processamento em lote para a janela de introdução antes de 31 de dezembro. Baseie seu uso de tokens agora e asserte sobre ele, para que a duplicação de janeiro seja uma mudança que você já precificou.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs