Gemini 3.6 Flash é o novo modelo "burro de carga" do Google. Ele se tornou geralmente disponível em 21 de julho de 2026, e é mais barato e mais eficiente em tokens do que o Gemini 3.5 Flash que ele substitui. Se você envia tráfego de API de alto volume e deseja qualidade sólida sem pagar preços de carro-chefe, este é o nível que o Google construiu para você.
Este guia aborda o que é o modelo, o que mudou da última versão, as especificações completas, como ele se sai nos benchmarks, quanto custa e como obter acesso. Você também verá como enviar e testar a chamada de API por regressão, para que os números nas páginas do Google correspondam ao que você realmente recebe de volta.
O que é o Gemini 3.6 Flash?
Gemini 3.6 Flash é o modelo de médio porte e alto rendimento da família Gemini do Google. "Burro de carga" é a palavra certa para ele. O modelo é ajustado para os trabalhos diários que compõem a maior parte do tráfego de produção: sumarização, extração, classificação, chat e chamadas de ferramentas multi-etapas. É rápido, acessível e lê texto, imagens, vídeo, áudio e PDFs em uma única chamada.

O Google o lançou como um dos três modelos em 21 de julho de 2026. Os outros dois são Gemini 3.5 Flash-Lite, um nível mais barato e rápido para trabalhos de alto volume, e Gemini 3.5 Flash Cyber, um modelo de segurança restrito que apenas governos e parceiros confiáveis podem acessar. Você pode ler a análise completa do nível barato em nosso explicador o que é Gemini 3.5 Flash-Lite, e o modelo de segurança restrito em o que é Gemini 3.5 Flash Cyber.

Aqui está a parte que confunde as pessoas: o versionamento é misto. O "burro de carga" saltou para 3.6, mas o Flash-Lite e o Flash Cyber permaneceram em 3.5. Então "os novos modelos Flash" não estão todos no mesmo número de versão. Ao escolher um ID de modelo, leia-o com atenção. gemini-3.6-flash e gemini-3.5-flash-lite são níveis diferentes, não um erro de digitação.
O Google publicou o anúncio no blog do Google, e o cartão do modelo está na página DeepMind Flash.
O que há de novo em relação ao Gemini 3.5 Flash
A principal mudança é a eficiência. O Gemini 3.6 Flash usa cerca de 17% menos tokens de saída do que o 3.5 Flash para concluir o mesmo trabalho. Menos tokens significam contas mais baixas e respostas mais rápidas, porque os tokens de saída são o que você paga mais caro e o que leva mais tempo para serem transmitidos.
O Google também cortou o preço da saída. No 3.5 Flash, você pagava US$ 9,00 por milhão de tokens de saída. No 3.6 Flash, você paga US$ 7,50. Empilhe o corte de preço em cima da economia de tokens e o custo efetivo por tarefa cai mais do que os números sozinhos sugerem.
O modelo também é melhor em codificação e uso de computador, e alcança respostas em menos etapas de raciocínio e menos chamadas de ferramentas em fluxos de trabalho de várias etapas. Isso é importante para agentes. Cada loop de raciocínio extra e chamada de ferramenta adiciona latência e custo, então reduzi-los torna as execuções de agentes mais baratas e rápidas do início ao fim.
Se você está decidindo se deve mover o tráfego existente, analisamos as vantagens e desvantagens em Gemini 3.6 Flash vs 3.5 Flash.
Especificações do Gemini 3.6 Flash
| Atributo | Gemini 3.6 Flash |
|---|---|
| ID do Modelo | gemini-3.6-flash |
| Janela de contexto de entrada | 1M tokens |
| Saída máxima | 64k tokens |
| Modalidades de entrada | Texto, imagem, vídeo, áudio, PDF |
| Saída | Somente texto |
| Preço de entrada | $1.50 por 1M tokens |
| Preço de saída | $7.50 por 1M tokens (inclui tokens de "pensamento") |
| Nível gratuito | Sim, via Google AI Studio (com limite de taxa) |
| Lançado | 21 de julho de 2026 |
Dois números merecem uma nota. A janela de contexto de entrada de 1M significa que você pode alimentar o modelo com grandes documentos, transcrições longas ou bases de código inteiras em uma única solicitação. O limite de saída máxima de 64k é o teto para uma única resposta, então se você precisar de geração do tamanho de um livro, você dividirá o trabalho em várias chamadas.
Como ele se comporta
Benchmarks são proxies, não promessas, mas eles dizem onde um modelo é forte. Veja como o Gemini 3.6 Flash se sai nos conjuntos públicos que o Google relatou.
Em codificação, ele atinge 58,7% no SWE-Bench Pro, um teste que verifica se um modelo pode resolver problemas reais do GitHub em repositórios de produção. Ele pontua 49% no DeepSWE v1.1, outro benchmark de engenharia de software. No Terminal-bench 2.1, que mede a execução de comandos em um terminal real, ele atinge 78,0%.
O uso do computador é onde o salto se mostra mais. No OSWorld-Verified, que avalia um modelo dirigindo um desktop e seus aplicativos, o 3.6 Flash atinge 83,0%, acima dos 78,4% no 3.5 Flash. Isso é um ganho significativo para quem está construindo agentes que interagem com interfaces reais.
Em qualidade geral, ele registra um Elo GDPVal-AA v2 de 1421. O GDPVal mede o desempenho em tarefas profissionais do mundo real, e a pontuação Elo classifica os modelos frente a frente, da mesma forma que as classificações de xadrez, então um número maior significa que ele vence mais confrontos.
Contexto longo é uma imagem mista, e vale a pena ser honesto sobre isso. Com 128k tokens, o modelo atinge uma média de 91,8% em recuperação, o que é forte. Ao avançar para a janela de 1M de tokens com recuperação pontual, a precisão cai para 54,0%. Em termos simples, o modelo permanece afiado em entradas grandes, mas não presuma recuperação perfeita quando você preenche a janela de contexto inteira. Teste sua própria recuperação no comprimento que você realmente usa.
Preços em resumo
O Gemini 3.6 Flash custa US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída. O preço de saída inclui tokens de "pensamento", então o raciocínio que você nunca vê na resposta final ainda conta para a conta. O cache de contexto custa US$ 0,15 por milhão de tokens mais US$ 1,00 por milhão de tokens por hora de armazenamento, o que ajuda quando você envia o mesmo prompt grande repetidamente.
Existe um nível gratuito através do Google AI Studio. Ele tem limite de taxa e o Google pode usar dados do nível gratuito para melhorar seus produtos, então é para prototipagem, não para produção. Cobrimos os limites e as letras miúdas em como usar o Gemini 3.6 Flash gratuitamente, e a análise completa dos custos com exemplos em preços do Gemini 3.6 Flash. Os próprios números do Google estão na página de preços da API Gemini.
Como acessar o Gemini 3.6 Flash
Você tem algumas portas de entrada:
- API Gemini através do Google AI Studio. Pegue uma chave e você pode chamar
gemini-3.6-flashde qualquer cliente REST ou SDK. O Android Studio também o conecta para desenvolvimento de aplicativos. - Google Antigravity, a superfície de desenvolvimento agentic do Google, tem o modelo disponível.
- Gemini Enterprise Agent Platform para equipes que constroem agentes governados no trabalho.
- O aplicativo Gemini se você quiser apenas conversar diretamente com ele.
Para a maioria dos desenvolvedores, a API é o caminho que importa. Temos um passo a passo detalhado em como usar a API Gemini 3.6 Flash, e se você está vindo de uma versão mais antiga, nosso guia da API Google Gemini 3 ainda cobre a forma da solicitação e a autenticação. A referência oficial está em ai.google.dev.
Onde ele se encaixa na linha do Google
Pense na atualização do Flash como uma escada de custo e qualidade. O Gemini 3.5 Flash-Lite fica abaixo do 3.6 Flash: é mais barato, a US$ 0,30 de entrada e US$ 2,50 de saída por milhão de tokens, e é rápido, com aproximadamente 350 tokens de saída por segundo. Opte pelo Flash-Lite para trabalhos de alto volume e sensíveis à latência, onde você não precisa da qualidade total do "burro de carga". Opte pelo 3.6 Flash quando a tarefa for mais difícil ou a saída precisar ser mais confiável.
Agora, os avisos honestos. O Gemini 3.5 Pro não foi lançado. O Google diz que ainda está testando com parceiros, então não há um modelo Pro público nesta onda, e a maioria das coberturas destacou essa lacuna. O Google também provocou uma execução de pré-treinamento do Gemini 4 e a chamou de sua mais ambiciosa até agora, mas provocada não é enviada. Nenhuma das duas é algo que você possa chamar hoje. Se você precisa de um carro-chefe de ponta agora, o 3.6 Flash não é isso. É um modelo de nível médio rápido construído para ser barato e ágil em escala, e é exatamente isso que ele entrega.
Para a geração anterior, nosso explicador o que é Gemini 3.5 oferece a base que esses modelos aprimoram.
Testando o Gemini 3.6 Flash no Apidog
As páginas de modelos citam números de melhor caso. A única maneira de saber o que o 3.6 Flash retorna para seus prompts, no seu comprimento de contexto, é enviar a chamada e verificar a resposta. É aí que um cliente de API se destaca.
Apidog é um cliente de API e plataforma de teste, e ele trata o endpoint Gemini como qualquer outra chamada REST. Aqui está uma configuração limpa:
- Crie uma solicitação
POSTpara o endpoint da API Gemini e defina o modelo comogemini-3.6-flash. - Armazene sua chave de API em uma variável de ambiente do Apidog em vez de colá-la na URL. Assim, você pode alternar entre uma chave de teste e uma chave de produção sem editar a solicitação.
- Envie a chamada e leia a resposta. Adicione asserções sobre o código de status e os campos JSON que você se importa, para que uma carga útil ruim ou uma mudança de esquema falhe ruidosamente em vez de passar despercebida.
- Salve-o como um teste de regressão e programe-o para ser executado para que você perceba quando uma forma de resposta ou latência muda após uma atualização do modelo.
Seja claro sobre o que isso faz e não faz. O Apidog não executa o modelo e não é um framework de IA. É a ferramenta que você usa para construir a solicitação, enviá-la e manter a resposta em um padrão que você define. Quando o Google lançar a próxima atualização do Flash, seus testes salvos dirão em minutos se algo que você depende mudou. Baixe o Apidog se você quiser configurar essa primeira solicitação.
FAQ
O Gemini 3.6 Flash é gratuito? Existe um nível gratuito através do Google AI Studio, mas ele tem limite de taxa e é destinado à prototipagem. O Google pode usar dados do nível gratuito para melhorar seus produtos. Para tráfego de produção, você paga por token: US$ 1,50 por milhão de entrada, US$ 7,50 por milhão de saída.
O Gemini 3.6 Flash é melhor que o 3.5 Flash? Para a maioria dos trabalhos, sim. Ele usa cerca de 17% menos tokens de saída, o preço de saída caiu de US$ 9,00 para US$ 7,50 por milhão, e é mais forte em codificação e uso de computador, incluindo um salto para 83,0% no OSWorld-Verified de 78,4%. Ele substitui o 3.5 Flash como o "burro de carga" padrão.
O Gemini 3.5 Pro foi lançado? Não. O Google diz que ainda está testando o 3.5 Pro com parceiros, então não há um modelo Pro público neste lançamento. Uma execução de pré-treinamento do Gemini 4 foi provocada, mas não lançada.
Qual é o ID do modelo? É gemini-3.6-flash. Não o confunda com gemini-3.5-flash-lite, que é o nível Flash-Lite mais barato em um número de versão diferente.
O que o Gemini 3.6 Flash não pode fazer? Ele apenas gera texto, então não irá gerar imagens, áudio ou vídeo, embora possa lê-los como entrada. Sua recuperação cai no final da janela de 1M de tokens, cerca de 54,0% em recuperação pontual no comprimento total. E é um "burro de carga" de nível médio, não um carro-chefe de ponta, então escolha o nível certo para raciocínios genuinamente difíceis.
Gemini 3.6 Flash é o modelo que a maioria do tráfego da API Gemini deve usar agora: mais barato, mais eficiente em tokens e melhor em trabalho agentic do que a versão que ele substitui. Confirme as peças das quais você depende com alguns testes de API salvos antes de migrar em escala. Quando o Flash-Lite, Cyber, ou os eventuais Pro e Gemini 4 forem lançados, você saberá exatamente o que mudou em suas próprias respostas.
