O Gemini 3.6 Flash custa US$1,50 por 1M de tokens de entrada e US$7,50 por 1M de tokens de saída. Isso é mais barato que o modelo que ele substitui. O Google lançou a atualização em 21 de julho de 2026, e para qualquer um que esteja acompanhando uma conta de API, a notícia principal é simples: a camada Flash, o motor de trabalho, ficou mais rápida e menos cara ao mesmo tempo.
Este guia detalha cada número que você precisa para seu orçamento: as taxas por token, o que o cache de contexto adiciona, o que a camada gratuita cobre e um exemplo prático para que você possa prever os gastos mensais antes de escrever uma linha de código. Cada valor aqui vem da própria documentação de preços da API Gemini do Google e do anúncio de lançamento. Se você quiser uma visão geral completa do modelo primeiro, leia o que é o Gemini 3.6 Flash.
Uma observação sobre a nomenclatura antes dos números. O motor de trabalho saltou para a versão 3.6, mas a camada Flash-Lite, mais barata, permanece na 3.5. Mesmo lançamento, versões mistas. Mantenha isso em mente e os preços se alinharão perfeitamente.
Preços do Gemini 3.6 Flash em um piscar de olhos
| Item | Custo |
|---|---|
| Entrada | US$1,50 por 1M de tokens |
| Saída (inclui tokens de raciocínio) | US$7,50 por 1M de tokens |
| Cache de contexto, leitura de entrada em cache | US$0,15 por 1M de tokens |
| Cache de contexto, armazenamento | US$1,00 por 1M de tokens por hora |
| Camada gratuita | Sim, via Google AI Studio (com limite de taxa) |
Duas coisas para destacar de imediato. O preço de saída inclui tokens de raciocínio, então o raciocínio que o modelo faz antes de responder é cobrado na taxa de saída de US$7,50, e não em uma linha separada. E o cache de contexto tem duas partes: uma taxa de leitura barata para entrada em cache, mais uma taxa de armazenamento por hora enquanto você mantiver o cache ativo. O cache economiza dinheiro em contextos repetidos, mas não é gratuito, então as economias só aparecem quando você reutiliza o mesmo prefixo de prompt com frequência.
Como se compara ao Gemini 3.5 Flash
A taxa de saída caiu de US$9,00 por 1M de tokens no 3.5 Flash para US$7,50 no 3.6 Flash. Somente isso representa cerca de 17% mais barato por token de saída.
A história maior é o que o Google relata na página do modelo DeepMind Flash: o 3.6 Flash produz aproximadamente 17% menos tokens de saída para a mesma tarefa. Ele raciocina em menos etapas e faz menos chamadas de ferramentas em trabalhos de várias etapas. Assim, você está pagando uma taxa mais baixa por uma quantidade menor de tokens. Os dois fatores se somam, o que mostraremos com aritmética real abaixo.
Se você ainda está orçando com base no modelo antigo, a análise de preços do Gemini 3.5 Flash vale a pena ser lida lado a lado. Para uma comparação completa de recursos e benchmarks, veja Gemini 3.6 Flash vs 3.5 Flash. A versão resumida para o seu bolso: o 3.6 Flash custa menos para rodar do que o modelo que ele substitui, e a diferença aumenta em cargas de trabalho mais longas e baseadas em agentes, onde a economia de tokens se acumula.
O que a camada gratuita oferece
Existe uma camada gratuita real, disponível através do Google AI Studio. Você pode chamar o Gemini 3.6 Flash sem cartão de crédito e prototipar gratuitamente.
Seja honesto consigo mesmo sobre os limites. A camada gratuita tem limite de taxa, então é feita para prototipagem e testes leves, não para tráfego de produção. E o Google pode usar dados da camada gratuita para melhorar seus produtos. Isso significa que a camada gratuita é o lugar errado para dados sensíveis, proprietários ou de clientes. Quando você passar para algo real, mude para uma chave paga onde esses termos de uso de dados não se aplicam.
Para o passo a passo completo do que a camada gratuita permite e como configurá-la, veja como usar o Gemini 3.6 Flash gratuitamente. Não há opção de "gratuito ilimitado" aqui, então planeje migrar para o uso pago assim que lançar.
Um exemplo de custo prático
Digamos que você execute um agente que lê muito e escreve pouco: 2M de tokens de entrada e 500k de tokens de saída por dia. Essa é uma configuração realista para um assistente que foca em recuperação de informações, que busca documentos e retorna respostas curtas.
- Entrada: 2M de tokens vezes US$1,50 por 1M = US$3,00
- Saída: 500k de tokens vezes US$7,50 por 1M = US$3,75
- Total diário: US$6,75
- Mensal (30 dias): cerca de US$202,50
Agora o efeito composto. Suponha que a mesma tarefa no 3.5 Flash emitisse 600k tokens de saída. No 3.6 Flash, a redução de 17% a diminui para aproximadamente 500k, que é o que orçamos acima. Compare apenas a linha de saída:
- Saída do 3.5 Flash: 600k vezes US$9,00 por 1M = US$5,40 por dia
- Saída do 3.6 Flash: 500k vezes US$7,50 por 1M = US$3,75 por dia
Isso representa US$1,65 a menos por dia, ou cerca de US$49,50 por mês, somente no lado da saída. A conta de saída cai cerca de 31%, embora o corte de preço e a redução de tokens sejam cada um de apenas cerca de 17%. Tokens mais baratos vezes menos tokens é onde a verdadeira economia reside.
Flash-Lite é ainda mais barato
Se sua tarefa é simples, existe uma camada abaixo do motor de trabalho. O Gemini 3.5 Flash-Lite custa US$0,30 por 1M de tokens de entrada e US$2,50 por 1M de tokens de saída, com cache a US$0,03 por 1M mais o mesmo US$1,00 por 1M por hora de armazenamento. Ele também é rápido, com cerca de 350 tokens de saída por segundo.
Execute a mesma carga de trabalho de 2M de entrada e 500k de saída no Flash-Lite e a conta diária será de cerca de US$1,85, aproximadamente US$55,50 por mês. Isso é cerca de 70% mais barato que o 3.6 Flash para as mesmas quantidades de tokens.
A pegadinha é a qualidade. O Flash-Lite é ajustado para trabalhos de alto volume e baixa complexidade: classificação, extração, roteamento, respostas estruturadas curtas. Não é uma versão mais fraca da mesma coisa; é um ponto diferente na curva de custo, qualidade e latência. Use-o quando a tarefa for simples e o volume alto, e mantenha o 3.6 Flash para o raciocínio mais difícil. Para uma visão completa, leia o que é o Gemini 3.5 Flash-Lite, e então Gemini 3.5 Flash-Lite vs 3.6 Flash para escolher a camada certa por rota.
Como controlar e medir seus custos
Quatro alavancas para manter a conta baixa:
- Armazene em cache contextos repetidos. Se cada solicitação compartilha um prompt de sistema longo ou os mesmos documentos de referência, o cache de contexto cobra US$0,15 por 1M em leituras em cache em vez de US$1,50. Apenas lembre-se da taxa de armazenamento de US$1,00 por 1M por hora, então o cache compensa quando você reutiliza o prefixo frequentemente dentro da hora, não apenas uma vez.
- Reduza os prompts. A saída custa cinco vezes o preço da entrada, mas entradas inchadas ainda se acumulam em escala. Corte o "boilerplate" (texto padrão repetitivo) e limite o máximo de tokens de saída para que uma resposta descontrolada não o surpreenda.
- Encaminhe tarefas simples para o Flash-Lite. Envie classificação e extração para a camada mais barata e reserve o 3.6 Flash para raciocínio em várias etapas. O roteamento misto geralmente supera a escolha de um único modelo para tudo.
- Meça o uso real de tokens. Estimativas enganam. O
usageMetadataem cada resposta Gemini informa exatamente quantos tokens de entrada, saída e raciocínio uma chamada consumiu, e esse é o número em que sua fatura se baseia.
Esse último ponto é onde um cliente de API prova seu valor. No Apidog você pode construir a solicitação POST para a API Gemini, armazenar sua chave em uma variável de ambiente e enviar chamadas reais contra seus prompts reais. Leia os campos usageMetadata diretamente da resposta para ver as contagens reais de tokens por solicitação, então adicione asserções para que uma mudança de prompt que duplique os tokens de saída falhe em um teste em vez de dobrar silenciosamente sua conta. Você pode até agendar esses testes de API para rodar em uma cadência e detectar regressões de custo precocemente. Quer acompanhar? Baixe o Apidog e aponte uma solicitação para o endpoint Gemini antes de conectá-lo à produção.
FAQ
Quanto custa o Gemini 3.6 Flash por 1M de tokens? US$1,50 para entrada e US$7,50 para saída. As leituras do cache de contexto custam US$0,15 por 1M, com uma taxa de armazenamento de US$1,00 por 1M por hora.
O preço de saída inclui tokens de raciocínio? Sim. O raciocínio que o modelo faz antes de responder é cobrado na taxa de saída de US$7,50. Não há cobrança separada para tokens de raciocínio, mas eles contam para o seu total de saída, então mais raciocínio significa uma conta maior.
Existe realmente uma camada gratuita? Sim, através do Google AI Studio, e ela tem limite de taxa. É destinada a prototipagem e testes, não a produção. O Google pode usar dados da camada gratuita para melhorar seus produtos, então mantenha dados sensíveis em uma chave paga.
O Gemini 3.6 Flash é mais barato que o 3.5 Flash? Sim. A taxa de saída caiu de US$9,00 para US$7,50, e o 3.6 Flash usa cerca de 17% menos tokens de saída para a mesma tarefa. Ambos os efeitos se somam, então a conta de saída no mundo real pode cair cerca de 31%.
Quando devo usar o Flash-Lite em vez disso? Quando a tarefa é simples e o volume é alto. Com US$0,30 de entrada e US$2,50 de saída, o Flash-Lite é aproximadamente 70% mais barato para as mesmas contagens de tokens, e é rápido, mas o 3.6 Flash lida melhor com raciocínio mais complexo.
O Gemini 3.6 Flash é uma rara atualização de preços onde o número diminuiu e o modelo melhorou ao mesmo tempo. Orce-o em US$1,50 de entrada e US$7,50 de saída, lembre-se de que os tokens de raciocínio são cobrados na taxa de saída e dependa do cache mais o roteamento para Flash-Lite para cortar o restante. Para um contexto histórico de como os custos da API Gemini mudaram entre os lançamentos, a análise de custos da API Gemini 3.0 é um ponto de referência útil. Depois, meça suas próprias chamadas no Apidog para que as contagens de tokens que você planeja sejam as que você realmente paga.
