Gemini 3.7 Flash: Preços Explicados – Garanta Suas Taxas Antes Que Dobrem

Preços do Gemini 3.7 Flash: $0,75/$3,75 por 1M de tokens até 31 de dezembro de 2026; depois as taxas dobram. Veja exemplos de custos detalhados e cinco maneiras de reduzir seus gastos com tokens.

Ashley Innocent

Ashley Innocent

14 agosto 2026

Gemini 3.7 Flash: Preços Explicados – Garanta Suas Taxas Antes Que Dobrem

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

O Google lançou o Gemini 3.7 Flash em 13 de agosto de 2026, três semanas após o 3.6 Flash, e o chama de “nosso modelo mais inteligente para tarefas pesadas”. Para quem está de olho na conta da API, o detalhe mais importante está na tabela de preços, não nos benchmarks: a taxa introdutória de US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída expira em 31 de dezembro de 2026. A partir de 1º de janeiro de 2027, ambas as taxas dobram.

Isso representa um aumento programado de 2x em cada carga de trabalho que você construir com este modelo. Um chatbot que custa US$ 790 por mês hoje custará US$ 1.575 por mês em janeiro, sem nenhuma alteração no seu código, no seu tráfego ou nos seus prompts. Portanto, ao orçar um projeto 3.7 Flash, considere ambos os níveis, não apenas o preço de tabela.

Este guia aborda os dois níveis, o cálculo de tokens para três cargas de trabalho reais, como o preço se compara a outras APIs de modelo e onde cortar gastos antes que o aumento aconteça. Se você ainda não enviou uma primeira solicitação, o guia de início rápido da API Gemini 3.7 Flash cobre a configuração. Uma vez que você esteja fazendo chamadas, o Apidog exibe as contagens de tokens de usageMetadata em cada resposta, para que cada estimativa abaixo se torne um número que você pode verificar com o tráfego real.

button

TL;DR

Os dois níveis de preço

O Gemini 3.7 Flash foi lançado com um desconto por tempo limitado, em vez de um preço permanente. Aqui está o panorama completo para a API Gemini:

Nível Período Entrada (por 1M de tokens) Saída (por 1M de tokens)
Introdutório 13 de agosto de 2026 a 31 de dezembro de 2026 $0.75 $3.75
Padrão A partir de 1º de janeiro de 2027 $1.50 $7.50

Duas coisas se destacam. Primeiro, a taxa introdutória é metade do que o Gemini 3.6 Flash custava quando foi lançado, o que torna os próximos quatro meses e meio a janela de preços mais barata que esta família de modelos já teve. Se você está considerando um upgrade do 3.6, o guia de migração do 3.6 para o 3.7 Flash cobre a troca; o corte de preço por si só compensa o teste de regressão.

Segundo, os tokens de saída custam 5x mais do que os tokens de entrada em ambos os níveis. Essa proporção molda cada decisão de otimização mais adiante neste guia: cortar um prompt de sistema prolixo economiza centavos, enquanto limitar a saída descontrolada economiza dólares.

As taxas acima cobrem a API Gemini faturada por meio de uma chave do AI Studio. O Vertex AI opera com faturamento do Google Cloud, com seus próprios SKUs, e recursos como cache de contexto e processamento em lote têm seus próprios itens de linha, portanto, confirme os números atuais na página oficial de preços antes de comprometer um orçamento.

Quanto custa uma carga de trabalho real

Preços por milhão de tokens não significam nada até que você os multiplique pelo tráfego. Aqui estão três perfis de carga de trabalho com as suposições declaradas, para que você possa substituir por seus próprios números.

Carga de trabalho 1: um chatbot de suporte ao cliente

Assuma 10.000 solicitações por dia. Cada solicitação carrega cerca de 2.000 tokens de entrada (prompt do sistema, uma pequena janela de histórico, a mensagem do usuário) e retorna cerca de 300 tokens de saída.

Item Tokens diários Custo introdutório/dia Custo padrão/dia
Entrada 20M $15.00 $30.00
Saída 3M $11.25 $22.50
Total 23M $26.25 $52.50

Isso equivale a aproximadamente US$ 788 por mês nas taxas introdutórias e US$ 1.575 por mês nas taxas padrão, em um mês de 30 dias. Por turno de conversa, você está pagando cerca de um quarto de centavo hoje.

Carga de trabalho 2: um pipeline de documentos PDF

O Gemini 3.7 Flash lê PDFs nativamente, e sua pontuação de benchmark GDP.pdf subiu de 22,0% para 34,0% em relação ao 3.6 Flash, então a extração de documentos é uma carga de trabalho que o Google espera que você execute aqui. Assuma 500 documentos por dia, cada um com uma média de 40.000 tokens de entrada (um contrato ou relatório longo), produzindo um resumo estruturado de 1.000 tokens.

Item Tokens diários Custo introdutório/dia Custo padrão/dia
Entrada 20M $15.00 $30.00
Saída 0.5M $1.88 $3.75
Total 20.5M $16.88 $33.75

Cerca de US$ 506 por mês agora, US$ 1.013 a partir de janeiro. Observe o formato: a entrada domina porque os documentos são longos e os resumos são curtos. Cache e processamento em lote afetam esta carga de trabalho mais severamente.

Carga de trabalho 3: um loop de agente

Agentes multiplicam chamadas. Assuma 200 tarefas por dia, cada uma com uma média de 12 chamadas de modelo, onde cada chamada carrega 8.000 tokens de entrada (o contexto crescente mais os resultados da ferramenta) e retorna 400 tokens de saída.

Item Tokens diários Custo introdutório/dia Custo padrão/dia
Entrada 19.2M $14.40 $28.80
Saída 0.96M $3.60 $7.20
Total 20.16M $18.00 $36.00

Isso custa US$ 540 por mês nas taxas introdutórias, US$ 1.080 na taxa padrão. A lição do faturamento de agentes: o contexto cresce a cada passo, então a contagem de chamadas e o comprimento do contexto se acumulam. Uma tarefa que aumenta de 12 chamadas para 20 custa 67% mais, e nada na tabela de preços o avisou.

Mais um número que vale a pena ter em mente: o limite de saída de 64 mil define seu pior cenário por chamada em cerca de US$ 0,24 hoje e US$ 0,48 no próximo ano. Um loop de repetição que maximiza a saída a cada tentativa fica caro rapidamente, mas não pode ficar ilimitadamente caro.

Como o preço do 3.7 Flash se compara

Comparações exatas por token entre provedores ficam desatualizadas em semanas, então trate isso como posicionamento, não uma tabela de preços.

O Gemini 3.7 Flash se encaixa na categoria de modelo para tarefas pesadas: muito mais barato que modelos de ponta como a linha Pro do próprio Gemini, os modelos maiores da Claude ou o nível principal da OpenAI, enquanto apresenta pontuações de benchmark (65,3% no DeepSWE v1.1, um Elo de 1588 no WebDev Arena) que se sobrepõem ao que os modelos principais registraram não muito tempo atrás. A aposta do Google é que a maioria do tráfego de produção não precisa de um modelo de ponta, e o desconto introdutório é um convite de quatro meses para testar essa afirmação em sua própria carga de trabalho.

O cenário competitivo também importa. Provedores de nível de orçamento têm movido os preços na outra direção; a DeepSeek aumentou suas taxas de API e levou as equipes a repensar os orçamentos de tokens, uma história coberta no guia de aumento de preços e otimização de custos da DeepSeek. A lição se transfere diretamente para o Gemini: qualquer preço sobre o qual você constrói uma margem pode mudar, e o Google já lhe disse a data e o valor. Isso é mais aviso do que a maioria dos provedores oferece.

Se seu tráfego é intermitente ou experimental, lembre-se que o aumento só afeta cargas de trabalho sustentadas. Um protótipo que custa US$ 3 durante o período introdutório custa US$ 6 depois. Ninguém se importa. Um pipeline de US$ 10.000 por mês que se torna US$ 20.000 é um item de linha que sua equipe financeira perguntará em fevereiro.

Cinco maneiras de cortar gastos com tokens

A proporção de preço de 5x entre saída e entrada e o aumento de janeiro apontam para o mesmo conjunto de alavancas.

Limite os tokens de saída por endpoint. Defina maxOutputTokens em generationConfig para o menor valor que cada endpoint precisa. Uma resposta de suporte raramente precisa de mais de 500 tokens; deixar o limite no padrão de 64 mil significa que uma geração confusa pode custar 100x o valor normal. Esta é a mudança com maior retorno, porque os tokens de saída carregam o multiplicador de 5x.

Armazene em cache seu contexto estático. Se cada solicitação reenvia o mesmo prompt de sistema de 3.000 tokens e documento de política, você está pagando o preço total de entrada por bytes idênticos milhares de vezes por dia. O cache de contexto cobra tokens repetidos a uma taxa com desconto; verifique a documentação da API Gemini para a configuração e taxas de cache atuais. Para o chatbot acima, armazenar em cache um prefixo estático de 1.500 tokens corta a conta de entrada em mais da metade.

Processe trabalhos não interativos em lote. O pipeline de documentos não precisa de respostas em microssegundos. O processamento em lote troca latência por uma taxa com desconto, e execuções noturnas de documentos são exatamente o tipo de tráfego para o qual ele existe.

Dimensione o modelo corretamente por rota. Nem toda chamada precisa do 3.7 Flash. Tarefas de classificação, roteamento e extração curtas frequentemente funcionam bem em um modelo de nível Flash-Lite por uma fração do custo. Mantenha o 3.7 Flash para as chamadas que usam o que você está pagando: planejamento multi-etapas, depuração, cadeias de chamadas de ferramentas.

Prototipagem no nível gratuito. A cota gratuita do AI Studio é suficiente para definir prompts e esquemas de resposta antes que um único token faturado seja usado. O guia de acesso gratuito à API Gemini cobre até onde o caminho gratuito se estende e onde seus limites se encontram.

Rastreie os gastos por endpoint com o Apidog

Estimativas lhe dão um orçamento; a medição por solicitação o mantém dentro dele. Toda resposta do Gemini inclui um bloco usageMetadata com contagens de tokens de prompt e saída, o que significa que sua camada de teste de API pode funcionar como um medidor de custos.

No Apidog, o fluxo de trabalho se parece com este:

  1. Salve uma solicitação por endpoint de produção (turno de chat, resumo de documento, passo de agente) em uma coleção, com a chave da API vinculada a uma variável de ambiente GEMINI_API_KEY.
  2. Crie um cenário de teste que dispara cada solicitação contra payloads realistas e extrai usageMetadata.promptTokenCount e usageMetadata.candidatesTokenCount da resposta.
  3. Adicione asserções nessas contagens. Se uma edição de prompt empurra o endpoint de chat para além, digamos, 2.500 tokens de entrada, o cenário falha antes que a alteração seja implementada e silenciosamente aumenta sua conta em 25%.
  4. Execute novamente o cenário a cada alteração de prompt ou esquema. As contagens de tokens regridem da mesma forma que a latência; a diferença é que as regressões de tokens chegam como uma fatura.

Multiplique as contagens medidas pelos preços dos níveis neste guia e você terá números de custo por endpoint baseados em respostas reais, em vez de suposições. Equipes que já executam suítes de API baseadas em asserções reconhecerão o padrão; o guia de teste de API para engenheiros de QA abrange como estruturar cenários como esses em todo um serviço.

FAQ

Quando o preço do Gemini 3.7 Flash dobra?

Em 1º de janeiro de 2027. A taxa introdutória de US$ 0,75 por 1 milhão de tokens de entrada e US$ 3,75 por 1 milhão de tokens de saída vigora até 31 de dezembro de 2026, e então passa para a taxa padrão de US$ 1,50 e US$ 7,50. O Google publicou ambos os níveis no lançamento, então o aumento é programado, não especulativo.

O Gemini 3.7 Flash é mais barato que o Gemini 3.6 Flash?

No lançamento, sim. O preço introdutório do 3.7 Flash é metade do preço de lançamento do 3.6 Flash, enquanto os benchmarks melhoraram em todos os aspectos (DeepSWE v1.1 passou de 49,0% para 65,3%). As especificações completas e tabelas de benchmark estão no guia de referência rápida do Gemini 3.7 Flash se você quiser a comparação lado a lado.

O preço introdutório se aplica ao Vertex AI?

As taxas neste guia são as da API Gemini faturadas por meio de uma chave do AI Studio. O Vertex AI fatura por meio do Google Cloud com seus próprios SKUs e termos empresariais. Se você executa tráfego de produção no Vertex, confirme os números atuais no seu console de faturamento do GCP e na página oficial de preços, em vez de assumir paridade.

O que conta para a fatura de tokens de entrada?

Tudo o que você envia: texto, imagens, vídeo, áudio e páginas PDF são convertidos em tokens e cobrados pela taxa de entrada. Documentos longos e solicitações com muitos arquivos de mídia são onde os custos de entrada surpreendem as pessoas, razão pela qual o exemplo de pipeline acima assume 40.000 tokens por documento. O bloco usageMetadata em cada resposta informa a contagem exata após o fato.

Como faço para estimar os tokens antes de enviar uma solicitação?

Use o endpoint countTokens da API para medir um payload sem gerar nada, ou envie algumas solicitações representativas e leia usageMetadata das respostas. De qualquer forma, meça com payloads reais. A intuição do tokenizer de outros provedores se transfere mal entre famílias de modelos.

Onde o 3.7 Flash se encaixa na sua pilha

O Gemini 3.7 Flash, com preço introdutório, é o mais barato que um modelo tão capaz já foi, e o Google informou a data exata em que isso deixará de ser verdade. A jogada racional: transfira seu tráfego de trabalho pesado para ele agora, meça o consumo real de tokens por endpoint enquanto o desconto estiver ativo e use esses quatro meses de dados para decidir o que permanece no 3.7 Flash, o que migra para um modelo mais leve e como será a conta da taxa padrão antes que ela chegue.

A parte de medição desse plano precisa de ferramentas. Baixe o Apidog para manter suas solicitações Gemini, ambientes, asserções de token e verificações de custo em um só espaço de trabalho, para que a fatura de janeiro seja um número que você previu em vez de um que você descobre.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs