O que é Gemini 3.5 Flash-Lite?

Gemini 3.5 Flash-Lite é o nível Gemini mais barato e mais rápido da Google: entrada de US$ 0,30, ~350 tokens/seg. Confira as especificações, preços, benchmarks e como testá-lo.

Ashley Innocent

Ashley Innocent

22 julho 2026

O que é Gemini 3.5 Flash-Lite?

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

O Google atualizou sua camada Flash em 21 de julho de 2026, e o Gemini 3.5 Flash-Lite é a opção mais econômica dela. É o Gemini mais barato e rápido que você pode usar hoje, construído para trabalhos de alto volume e sensíveis à latência: classificação, extração, respostas curtas de chat e respostas de recuperação simples, onde o throughput e o custo importam mais do que o raciocínio profundo. Se você está disparando milhões de pequenas requisições por dia, esta é a camada que o Google quer no seu caminho crítico.

A atualização lançou três modelos de uma vez, e a nomenclatura confunde as pessoas, então vamos esclarecer isso rapidamente e depois entrar nas especificações, preços, benchmarks e como testar o endpoint por conta própria.

botão

O que é o Gemini 3.5 Flash-Lite?

Gemini 3.5 Flash-Lite é o modelo menor e mais barato da família Gemini do Google. Ele é ajustado para velocidade e volume, não para o raciocínio mais complexo. O Google o estima em aproximadamente 350 tokens de saída por segundo, então as respostas parecem quase instantâneas mesmo sob carga. Você o chama através da API Gemini com o ID do modelo `gemini-3.5-flash-lite`.

Pense nele como a camada que você direciona para trabalhos chatos, repetitivos e de alta frequência. Marcação de tickets de suporte. Extração de campos de um documento. Resposta a uma pergunta curta de um trecho de texto recuperado. Alimentar um widget de chat que precisa responder antes que o usuário perceba um atraso. Em cada um desses casos, você está enviando muitas requisições e deseja que cada uma seja barata e rápida. O Flash-Lite é a resposta do Google para esse tipo de carga de trabalho.

Ele chegou como parte de uma atualização Flash de três modelos: o novo modelo principal Gemini 3.6 Flash, este Gemini 3.5 Flash-Lite e um modelo de segurança restrito chamado Gemini 3.5 Flash Cyber. Você pode ler a própria visão geral do Google no blog do Google e os detalhes do modelo na página do DeepMind Flash. O Flash-Lite está na base dessa pilha em termos de preço e no topo em termos de velocidade bruta.

Espera, por que é 3.5 e não 3.6?

Aqui está a parte confusa. O novo modelo principal é o Gemini 3.6 Flash. Mas o Flash-Lite permaneceu na versão 3.5, assim como o modelo de segurança Cyber restrito. Então, um lançamento, um dia, três modelos, dois números de versão. Isso não é um erro de digitação por parte do Google ou um erro neste artigo. O Google lançou com versionamento misto: o carro-chefe Flash saltou para 3.6, enquanto as variantes Lite e Cyber mantiveram o rótulo 3.5.

Por que o Google faz isso? O número da versão rastreia o modelo, não o evento de lançamento. O modelo principal teve um salto geracional maior, então ganhou a tag 3.6. O Flash-Lite também é um modelo novo, mas o Google optou por mantê-lo alinhado com a linha 3.5. Chato de acompanhar, mas foi assim que os rótulos foram definidos.

Mais uma fonte de confusão que vale a pena dissipar agora. O Gemini 3.5 Flash-Lite não é o antigo Gemini 3.1 Flash-Lite da geração anterior. Mesmo nome "Flash-Lite", modelo diferente, números diferentes. Se você construiu com o 3.1 Flash-Lite anteriormente, este é o substituto mais novo e rápido, não uma renomeação do que você já tinha. Verifique o ID do modelo antes de presumir: `gemini-3.5-flash-lite` é o novo.

Especificações e preços

Aqui está o custo do Flash-Lite e como ele se comporta. Todos os preços são por milhão de tokens através da API Gemini.

Atributo Valor
ID do modelo gemini-3.5-flash-lite
Preço de entrada $0.30 / 1M tokens
Preço de saída $2.50 / 1M tokens
Velocidade ~350 tokens de saída/segundo
Camada gratuita Sim (Google AI Studio, com limite de taxa)
Cache de contexto $0.03 / 1M tokens + $1.00 / 1M/hr de armazenamento

Esses $0.30 de entrada e $2.50 de saída são as taxas publicadas mais baratas na linha atual do Gemini. Para comparação, o modelo principal 3.6 Flash custa $1.50 de entrada e $7.50 de saída, então o Flash-Lite é aproximadamente um quinto do custo de entrada e um terço do custo de saída. Quando você está processando milhões de chamadas curtas, essa diferença é o ponto principal. Você pode confirmar os números atuais na documentação de preços da API Gemini, já que o Google atualiza essa página diretamente.

O cache de contexto reduz ainda mais o custo para prompts que você envia repetidamente, como um prompt de sistema fixo ou um documento de referência longo. Você paga uma pequena taxa para armazenar os tokens em cache, além de uma taxa de armazenamento por hora, e a entrada em cache é muito mais barata a cada reutilização.

Qual é o seu desempenho?

O número principal: o Gemini 3.5 Flash-Lite pontua 54% no Terminal-Bench 2.1, um aumento em relação aos 31% do seu predecessor. Isso é um salto real para um modelo da classe Lite, e significa que a camada pequena agora é realmente útil para tarefas que antes passavam despercebidas.

Onde ele brilha: classificação, extração, respostas de chat e respostas simples aumentadas por recuperação. Esses são os trabalhos onde um modelo rápido e barato se paga. Organizar entradas em categorias, extrair dados estruturados de textos desorganizados, responder a uma pergunta curta baseada em um trecho recuperado, manter um assistente leve responsivo. O Flash-Lite lida com tudo isso bem e rapidamente.

Agora, o limite honesto. O Flash-Lite troca qualidade por custo e velocidade. Não é o modelo para a codificação agêntica mais difícil, cadeias de ferramentas de várias etapas longas ou problemas de raciocínio profundo. Quando uma tarefa precisa planejar vários passos, chamar ferramentas de forma confiável em sequência ou raciocinar através de uma base de código complicada, você vai querer o Gemini 3.6 Flash ou um modelo maior. Escolher o Flash-Lite para esse trabalho economiza dinheiro até o momento em que as respostas erradas custam mais do que você economizou. Adeque a camada à tarefa.

Onde o Google usa o Flash-Lite

O Google não está apenas vendendo o Flash-Lite para desenvolvedores. Ele está integrando o modelo ao Google Search. Isso é um sinal útil: quando o Google coloca um modelo diante do tráfego em escala de pesquisa, ele está apostando que o modelo é rápido e barato o suficiente para rodar em um número enorme de consultas sem falhar em termos de latência ou orçamento.

Para você, isso é um ponto de prova. As mesmas propriedades que fazem o Flash-Lite se encaixar na Pesquisa, alto throughput e baixo custo por chamada, são exatamente o que o fazem se encaixar em um endpoint de produção movimentado. Se ele pode atender ao tráfego de Pesquisa, ele pode atender ao seu pipeline de classificação.

Flash-Lite vs Gemini 3.6 Flash: qual você deve escolher?

Versão curta: escolha o Flash-Lite quando o trabalho for simples, de alto volume e sensível à velocidade. Escolha o 3.6 Flash quando o trabalho exigir raciocínio mais forte, codificação ou trabalho de agente em várias etapas.

O Flash-Lite vence em preço e latência. É o Gemini mais barato e executa cerca de 350 tokens por segundo, sendo o padrão certo para classificação, extração, chats curtos e RAG simples em escala. O Gemini 3.6 Flash custa mais por token, mas raciocina melhor, codifica melhor e se sustenta em fluxos de trabalho agênticos onde o Flash-Lite tropeçaria. O preço do 3.6 Flash reflete isso: você paga pela capacidade extra.

Um padrão prático é rotear por dificuldade. Envie as chamadas fáceis e frequentes para o Flash-Lite e escale as difíceis para o 3.6 Flash. Você obtém throughput barato na maior parte do tráfego e raciocínio mais forte apenas onde isso justifica o custo. Para uma comparação completa de velocidade, preço e qualidade, veja Gemini 3.5 Flash-Lite vs 3.6 Flash.

Como acessar e testá-lo

O Flash-Lite funciona na API Gemini. A maneira mais rápida de começar é pelo Google AI Studio: obtenha uma chave de API, e a camada gratuita permite que você experimente o modelo antes de configurar o faturamento. Observe que a camada gratuita tem limite de taxa, e o Google pode usar dados da camada gratuita para melhorar seus produtos, então mantenha entradas sensíveis em uma chave paga. A referência completa está nos documentos da API Gemini. Defina o modelo para `gemini-3.5-flash-lite` e você estará chamando a camada mais barata.

Depois que suas requisições funcionarem, você vai querer que elas continuem funcionando. Preços, limites de taxa e formatos de resposta mudam conforme o Google atualiza a API, e um modelo Lite que é rápido, mas ocasionalmente impreciso, precisa de asserções para detectar desvios. É aí que um cliente de API ajuda. Com o Apidog, você pode construir a requisição `POST` para o endpoint Gemini, armazenar sua chave de API como uma variável de ambiente para que ela nunca esteja no corpo da requisição, e adicionar asserções sobre o código de status e os campos JSON dos quais você depende.

A partir daí, você pode transformar essa requisição em um teste de regressão salvo e agendá-lo para execução, de modo a detectar uma resposta quebrada ou uma mudança de preço antes que seus usuários o façam. O Apidog não executa o modelo nem substitui a API Gemini; ele é o cliente que você usa para chamar, validar e monitorar o endpoint. Baixe o Apidog se quiser testar o endpoint `gemini-3.5-flash-lite` juntamente com o restante da sua pilha de APIs.

botão

FAQ

O Gemini 3.5 Flash-Lite é o mesmo que o Gemini 3.6 Flash? Não. São dois modelos diferentes da mesma atualização de 21 de julho de 2026. O Flash-Lite é a camada mais barata e rápida para trabalhos simples de alto volume. O 3.6 Flash é o modelo principal mais caro, com raciocínio e codificação mais fortes.

Por que é 3.5 e não 3.6? Versionamento misto. O Google elevou o modelo principal Flash para 3.6, mas manteve o Flash-Lite e o modelo Cyber restrito com o rótulo 3.5 no mesmo lançamento. O número rastreia a linha do modelo, não a data de lançamento.

Este é o antigo Gemini 3.1 Flash-Lite? Não. O Gemini 3.5 Flash-Lite é um modelo mais novo. O 3.1 Flash-Lite antigo é da geração anterior. Mesmo nome de família, modelo e versão diferentes, então verifique o ID do modelo `gemini-3.5-flash-lite` para ter certeza de que você está usando o novo.

O Gemini 3.5 Flash-Lite é gratuito? Existe uma camada gratuita através do Google AI Studio, e ela tem limite de taxa. É bom para testes e uso leve. Para volume de produção, você passa para uma chave de API paga, e o Google pode usar dados da camada gratuita para melhorar seus produtos.

No que o Flash-Lite é melhor? Classificação, extração, respostas curtas de chat e respostas simples aumentadas por recuperação em alto volume. Não é a escolha para codificação agêntica difícil ou raciocínio de várias etapas longas, onde o 3.6 Flash se encaixa melhor.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs