Gemini 3.5 Flash-Lite x 3.6 Flash: Qual usar?

Gemini 3.5 Flash-Lite vs 3.6 Flash comparados: preço, velocidade, benchmarks, uma matriz de casos de uso e um exemplo de custo para a mesma carga de trabalho, para que você escolha a camada certa rapidamente.

Ashley Innocent

Ashley Innocent

22 julho 2026

Gemini 3.5 Flash-Lite x 3.6 Flash: Qual usar?

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Aqui está a decisão de antemão. Escolha o Gemini 3.5 Flash-Lite quando estiver executando tarefas simples em alto volume e se importar mais com custo e velocidade: classificação, extração, respostas curtas de chat, respostas RAG, preenchimento automático. Escolha o Gemini 3.6 Flash quando a qualidade for mais importante que a fatura: agentes multi-etapas, uso de ferramentas, codificação, uso de computador e respostas onde um resultado errado é caro.

Ambos os modelos foram lançados na atualização da camada Flash do Google em 21 de julho de 2026. Ambos aceitam até 1M de tokens de entrada. Eles se situam em pontos diferentes na mesma curva, então a questão não é qual modelo é "melhor". É qual troca se encaixa no trabalho à sua frente.

Uma peculiaridade de nomenclatura para esclarecer primeiro: o modelo principal saltou para 3.6, mas a camada Lite permaneceu em 3.5. Então você está comparando um modelo 3.5 com um modelo 3.6, e isso é esperado, não um erro de digitação. Mais sobre isso nas Perguntas Frequentes.

button

A resposta curta

Por padrão, use o Flash-Lite para qualquer coisa simples que você executa milhões de vezes, e recorra ao 3.6 Flash no momento em que a tarefa exigir raciocínio, ferramentas ou código. Se você não conseguir decidir, comece com o Flash-Lite, observe onde as respostas ficam aquém e promova apenas essas chamadas para o 3.6 Flash. Raramente você precisa de um único modelo para todo o aplicativo.

Preço e velocidade lado a lado

Atributo Gemini 3.5 Flash-Lite Gemini 3.6 Flash
ID do Modelo gemini-3.5-flash-lite gemini-3.6-flash
Preço de entrada $0.30 / 1M tokens $1.50 / 1M tokens
Preço de saída $2.50 / 1M tokens $7.50 / 1M tokens
Taxa de transferência ~350 tokens de saída/seg Não publicado separadamente
Janela de contexto 1M tokens 1M tokens
Camada gratuita Sim (com limite de taxa) Sim (com limite de taxa)

O Flash-Lite é mais barato em cada token. A entrada custa 5x menos; a saída custa 3x menos. O Google publica uma taxa de transferência de cerca de 350 tokens de saída por segundo para o Flash-Lite, o que o faz parecer instantâneo em uma caixa de chat ou campo de preenchimento automático. O Google não publicou um número separado de tokens por segundo para o 3.6 Flash, mas o 3.6 Flash produz cerca de 17% menos tokens de saída do que o 3.5 Flash que ele substitui, então ele conclui o trabalho multi-etapa mais rápido do que o preço sugerido. Você pode confirmar as taxas atuais na página de preços da API Gemini e em nossa análise de preços do Gemini 3.6 Flash.

Qualidade e benchmarks

A diferença de preço oferece margem para tarefas difíceis. No Terminal-Bench 2.1, que mede o trabalho de agente de terminal, o Flash-Lite pontua 54 e o 3.6 Flash pontua 78.0. Essa diferença de 24 pontos é toda a história: em trabalhos genuinamente multi-etapas e impulsionados por ferramentas, o 3.6 Flash é o modelo mais forte por uma margem clara.

O 3.6 Flash também registra 83.0 no OSWorld-Verified, o benchmark de uso de computador que mede a operação de um navegador ou desktop real. O Flash-Lite não visa essa habilidade. Se sua carga de trabalho envolve cliques em uma tela, isso é um trabalho para o 3.6 Flash. Especificamente em codificação, o 3.6 Flash registra 58.7% no SWE-Bench Pro e 49% no DeepSWE v1.1, o tipo de pontuação que o coloca em território real de codificação agente. O Flash-Lite não é destinado a esse trabalho.

Vale a pena ser justo com o Flash-Lite aqui. Sua pontuação de 54 no Terminal-Bench 2.1 é um aumento em relação aos 31 da geração Lite anterior, então a camada barata ficou muito mais capaz nesta rodada. Não é um modelo fraco. É um modelo ajustado para um trabalho diferente: raciocínio rápido, barato e razoavelmente bom em tarefas que não se ramificam. A própria página do modelo Flash do Google e o anúncio de lançamento enquadram os dois da mesma forma: uma camada para volume, uma camada para profundidade.

Qual modelo para qual trabalho

Use isto como uma matriz inicial e, em seguida, ajuste com suas próprias avaliações.

Tarefa Melhor ajuste
Classificação ou extração de alto volume Flash-Lite
Assistentes de chat e respostas curtas Flash-Lite
Respostas RAG sobre contexto recuperado Flash-Lite
UX tipo preenchimento automático, crítica para latência Flash-Lite
Pipelines em escala de pesquisa, a cada requisição Flash-Lite
Agentes multi-etapas 3.6 Flash
Uso de ferramentas e cadeias de chamadas de função 3.6 Flash
Codificação e revisão de código 3.6 Flash
Uso de computador (navegador ou desktop) 3.6 Flash
Respostas de alto risco onde erros custam dinheiro 3.6 Flash

O padrão é simples. O Flash-Lite vence onde a tarefa é limitada e o volume é enorme. O 3.6 Flash vence onde a tarefa se ramifica e o custo de errar é alto. Um modelo que marca tickets de suporte por categoria dez milhões de vezes ao dia pertence ao Flash-Lite. Um modelo que lê um rastreamento de pilha, edita três arquivos e abre uma solicitação de pull pertence ao 3.6 Flash. Se você está comparando isso com o antigo 3.5 Flash em vez do Flash-Lite, nossa comparação 3.6 Flash vs 3.5 Flash cobre esse caminho de atualização.

Uma comparação de custos na mesma carga de trabalho

Os números tornam a troca concreta. Digamos que um trabalho diário envie 10M de tokens de entrada e gere 2M de tokens de saída, um formato típico para um pipeline de sumarização ou extração em lote.

Modelo Entrada (10M) Saída (2M) Total diário
Flash-Lite $3.00 $5.00 $8.00
3.6 Flash $15.00 $15.00 $30.00

Nessa combinação, o 3.6 Flash custa 3.75x mais: $8.00 versus $30.00 por dia, ou aproximadamente $240 versus $900 por mês para o mesmo volume.

O múltiplo não é fixo, no entanto. Como o Flash-Lite é 5x mais barato na entrada e 3x mais barato na saída, suas economias reais ficam entre 3x e 5x, dependendo do formato do seu tráfego. O trabalho pesado de entrada (contexto RAG longo, documentos grandes, classificação de grandes entradas) inclina-se para o lado de 5x, e essas são exatamente as cargas de trabalho para as quais o Flash-Lite foi construído. A geração pesada de saída inclina-se para 3x.

Então, a verdadeira questão não é apenas "o 3.6 Flash consegue fazer isso?" É "o aumento de qualidade vale a pena pagar de 3x a 4x mais por chamada, no meu volume?" Para um pipeline em escala de pesquisa, a resposta geralmente é não. Para um agente que edita código ou registra um ticket, a resposta geralmente é sim.

Como fazer A/B testing de ambos no Apidog

Você não precisa adivinhar qual camada é boa o suficiente. A API Gemini é um endpoint REST simples, então você pode enviar o mesmo prompt para ambos os modelos e comparar as respostas diretamente. O Apidog é um cliente de API construído exatamente para esse tipo de verificação lado a lado.

Aqui está um fluxo de trabalho que leva alguns minutos:

  1. Crie uma requisição POST para o endpoint da API Gemini e armazene sua chave de API em uma variável de ambiente do Apidog, para que a chave nunca esteja no corpo da requisição ou no controle de versão.
  2. Envie-o uma vez com o modelo configurado como gemini-3.5-flash-lite. Anote a resposta e a latência que o Apidog registra.
  3. Duplique a requisição e mude uma coisa: o ID do modelo para gemini-3.6-flash. O mesmo prompt, os mesmos parâmetros, então a única variável é o modelo.
  4. Compare as duas respostas em termos de qualidade e compare os tempos que o Apidog registra para cada chamada.
  5. Adicione asserções na resposta (código de status, campos JSON esperados, conteúdo necessário) para que "bom o suficiente" seja definido por uma verificação, e não por avaliação visual.

Uma vez que as requisições existam, salve-as e transforme-as em um teste repetível. Você pode agendar os testes de API no Apidog para executar os mesmos prompts em um determinado ritmo, o que captura desvios de qualidade ou latência quando o Google atualiza qualquer um dos modelos. Seja claro sobre o limite: o Apidog envia as requisições e verifica suas asserções, mas ele não executa o modelo e não dirá qual resposta é mais inteligente. Esse julgamento fica com você. Para acompanhar, baixe o Apidog e aponte uma requisição para o endpoint Gemini.

FAQ

O Flash-Lite é apenas uma versão pior do 3.6 Flash? Não. É um ponto diferente na curva de custo, qualidade e velocidade. O Flash-Lite é mais barato e rápido com um limite inferior para raciocínio difícil; o 3.6 Flash custa mais e raciocina melhor. Em tarefas simples de alto volume, o Flash-Lite é frequentemente a resposta certa precisamente porque é mais barato e rápido, e não apesar disso.

Por que um é chamado 3.5 e o outro 3.6? Versões mistas. Nesta atualização, o Google moveu o modelo Flash principal para 3.6, mas manteve a camada Lite em 3.5 (a mesma versão também incluiu um modelo de segurança cibernética 3.5 Flash). Mesma família, números de versão diferentes. Não interprete o 3.5 no Flash-Lite como "antigo e abandonado".

Eles compartilham a mesma janela de contexto? Sim. Ambos aceitam até 1M de tokens de entrada, então prompts de contexto longo não são um motivo para escolher um sobre o outro. Escolha com base na qualidade do raciocínio, preço e velocidade.

Posso usar ambos em um único aplicativo? Esse é o padrão recomendado. Encaminhe chamadas baratas, simples e de alto volume para o Flash-Lite e escale as mais difíceis para o 3.6 Flash. Como a forma da API é idêntica, a troca é uma mudança de um campo, o que torna o A/B testing no Apidog tão rápido de executar.

Eles são gratuitos para experimentar? Ambos possuem uma camada gratuita no Google AI Studio, com limite de taxa, e o Google pode usar dados da camada gratuita para melhorar seus produtos. Isso é bom para testes; leia os termos antes de enviar qualquer coisa sensível.

Conclusão

Recorra ao Flash-Lite como seu padrão para trabalhos baratos, rápidos e simples em escala, e promova as chamadas difíceis, ramificadas ou que envolvam código para o 3.6 Flash, onde a diferença de 24 pontos no Terminal-Bench justifica seu preço de 3x a 4x. Não escolha de forma abstrata: envie seus prompts reais para ambos, meça a qualidade e a latência, e deixe os números decidirem. O Apidog torna essa comparação um trabalho de duas requisições.

button

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs