O que é Gemini 3.6 Flash?

Gemini 3.6 Flash é o novo modelo carro-chefe do Google, com disponibilidade geral em 21 de julho de 2026. Mais barato e mais eficiente em tokens do que o 3.5 Flash. Especificações, benchmarks, preços e acesso.

Ashley Innocent

Ashley Innocent

22 julho 2026

O que é Gemini 3.6 Flash?

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Gemini 3.6 Flash é o novo modelo "burro de carga" do Google. Ele se tornou geralmente disponível em 21 de julho de 2026, e é mais barato e mais eficiente em tokens do que o Gemini 3.5 Flash que ele substitui. Se você envia tráfego de API de alto volume e deseja qualidade sólida sem pagar preços de carro-chefe, este é o nível que o Google construiu para você.

Este guia aborda o que é o modelo, o que mudou da última versão, as especificações completas, como ele se sai nos benchmarks, quanto custa e como obter acesso. Você também verá como enviar e testar a chamada de API por regressão, para que os números nas páginas do Google correspondam ao que você realmente recebe de volta.

button

O que é o Gemini 3.6 Flash?

Gemini 3.6 Flash é o modelo de médio porte e alto rendimento da família Gemini do Google. "Burro de carga" é a palavra certa para ele. O modelo é ajustado para os trabalhos diários que compõem a maior parte do tráfego de produção: sumarização, extração, classificação, chat e chamadas de ferramentas multi-etapas. É rápido, acessível e lê texto, imagens, vídeo, áudio e PDFs em uma única chamada.

O Google o lançou como um dos três modelos em 21 de julho de 2026. Os outros dois são Gemini 3.5 Flash-Lite, um nível mais barato e rápido para trabalhos de alto volume, e Gemini 3.5 Flash Cyber, um modelo de segurança restrito que apenas governos e parceiros confiáveis podem acessar. Você pode ler a análise completa do nível barato em nosso explicador o que é Gemini 3.5 Flash-Lite, e o modelo de segurança restrito em o que é Gemini 3.5 Flash Cyber.

Aqui está a parte que confunde as pessoas: o versionamento é misto. O "burro de carga" saltou para 3.6, mas o Flash-Lite e o Flash Cyber permaneceram em 3.5. Então "os novos modelos Flash" não estão todos no mesmo número de versão. Ao escolher um ID de modelo, leia-o com atenção. gemini-3.6-flash e gemini-3.5-flash-lite são níveis diferentes, não um erro de digitação.

O Google publicou o anúncio no blog do Google, e o cartão do modelo está na página DeepMind Flash.

O que há de novo em relação ao Gemini 3.5 Flash

A principal mudança é a eficiência. O Gemini 3.6 Flash usa cerca de 17% menos tokens de saída do que o 3.5 Flash para concluir o mesmo trabalho. Menos tokens significam contas mais baixas e respostas mais rápidas, porque os tokens de saída são o que você paga mais caro e o que leva mais tempo para serem transmitidos.

O Google também cortou o preço da saída. No 3.5 Flash, você pagava US$ 9,00 por milhão de tokens de saída. No 3.6 Flash, você paga US$ 7,50. Empilhe o corte de preço em cima da economia de tokens e o custo efetivo por tarefa cai mais do que os números sozinhos sugerem.

O modelo também é melhor em codificação e uso de computador, e alcança respostas em menos etapas de raciocínio e menos chamadas de ferramentas em fluxos de trabalho de várias etapas. Isso é importante para agentes. Cada loop de raciocínio extra e chamada de ferramenta adiciona latência e custo, então reduzi-los torna as execuções de agentes mais baratas e rápidas do início ao fim.

Se você está decidindo se deve mover o tráfego existente, analisamos as vantagens e desvantagens em Gemini 3.6 Flash vs 3.5 Flash.

Especificações do Gemini 3.6 Flash

Atributo Gemini 3.6 Flash
ID do Modelo gemini-3.6-flash
Janela de contexto de entrada 1M tokens
Saída máxima 64k tokens
Modalidades de entrada Texto, imagem, vídeo, áudio, PDF
Saída Somente texto
Preço de entrada $1.50 por 1M tokens
Preço de saída $7.50 por 1M tokens (inclui tokens de "pensamento")
Nível gratuito Sim, via Google AI Studio (com limite de taxa)
Lançado 21 de julho de 2026

Dois números merecem uma nota. A janela de contexto de entrada de 1M significa que você pode alimentar o modelo com grandes documentos, transcrições longas ou bases de código inteiras em uma única solicitação. O limite de saída máxima de 64k é o teto para uma única resposta, então se você precisar de geração do tamanho de um livro, você dividirá o trabalho em várias chamadas.

Como ele se comporta

Benchmarks são proxies, não promessas, mas eles dizem onde um modelo é forte. Veja como o Gemini 3.6 Flash se sai nos conjuntos públicos que o Google relatou.

Em codificação, ele atinge 58,7% no SWE-Bench Pro, um teste que verifica se um modelo pode resolver problemas reais do GitHub em repositórios de produção. Ele pontua 49% no DeepSWE v1.1, outro benchmark de engenharia de software. No Terminal-bench 2.1, que mede a execução de comandos em um terminal real, ele atinge 78,0%.

O uso do computador é onde o salto se mostra mais. No OSWorld-Verified, que avalia um modelo dirigindo um desktop e seus aplicativos, o 3.6 Flash atinge 83,0%, acima dos 78,4% no 3.5 Flash. Isso é um ganho significativo para quem está construindo agentes que interagem com interfaces reais.

Em qualidade geral, ele registra um Elo GDPVal-AA v2 de 1421. O GDPVal mede o desempenho em tarefas profissionais do mundo real, e a pontuação Elo classifica os modelos frente a frente, da mesma forma que as classificações de xadrez, então um número maior significa que ele vence mais confrontos.

Contexto longo é uma imagem mista, e vale a pena ser honesto sobre isso. Com 128k tokens, o modelo atinge uma média de 91,8% em recuperação, o que é forte. Ao avançar para a janela de 1M de tokens com recuperação pontual, a precisão cai para 54,0%. Em termos simples, o modelo permanece afiado em entradas grandes, mas não presuma recuperação perfeita quando você preenche a janela de contexto inteira. Teste sua própria recuperação no comprimento que você realmente usa.

Preços em resumo

O Gemini 3.6 Flash custa US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída. O preço de saída inclui tokens de "pensamento", então o raciocínio que você nunca vê na resposta final ainda conta para a conta. O cache de contexto custa US$ 0,15 por milhão de tokens mais US$ 1,00 por milhão de tokens por hora de armazenamento, o que ajuda quando você envia o mesmo prompt grande repetidamente.

Existe um nível gratuito através do Google AI Studio. Ele tem limite de taxa e o Google pode usar dados do nível gratuito para melhorar seus produtos, então é para prototipagem, não para produção. Cobrimos os limites e as letras miúdas em como usar o Gemini 3.6 Flash gratuitamente, e a análise completa dos custos com exemplos em preços do Gemini 3.6 Flash. Os próprios números do Google estão na página de preços da API Gemini.

Como acessar o Gemini 3.6 Flash

Você tem algumas portas de entrada:

Para a maioria dos desenvolvedores, a API é o caminho que importa. Temos um passo a passo detalhado em como usar a API Gemini 3.6 Flash, e se você está vindo de uma versão mais antiga, nosso guia da API Google Gemini 3 ainda cobre a forma da solicitação e a autenticação. A referência oficial está em ai.google.dev.

Onde ele se encaixa na linha do Google

Pense na atualização do Flash como uma escada de custo e qualidade. O Gemini 3.5 Flash-Lite fica abaixo do 3.6 Flash: é mais barato, a US$ 0,30 de entrada e US$ 2,50 de saída por milhão de tokens, e é rápido, com aproximadamente 350 tokens de saída por segundo. Opte pelo Flash-Lite para trabalhos de alto volume e sensíveis à latência, onde você não precisa da qualidade total do "burro de carga". Opte pelo 3.6 Flash quando a tarefa for mais difícil ou a saída precisar ser mais confiável.

Agora, os avisos honestos. O Gemini 3.5 Pro não foi lançado. O Google diz que ainda está testando com parceiros, então não há um modelo Pro público nesta onda, e a maioria das coberturas destacou essa lacuna. O Google também provocou uma execução de pré-treinamento do Gemini 4 e a chamou de sua mais ambiciosa até agora, mas provocada não é enviada. Nenhuma das duas é algo que você possa chamar hoje. Se você precisa de um carro-chefe de ponta agora, o 3.6 Flash não é isso. É um modelo de nível médio rápido construído para ser barato e ágil em escala, e é exatamente isso que ele entrega.

Para a geração anterior, nosso explicador o que é Gemini 3.5 oferece a base que esses modelos aprimoram.

Testando o Gemini 3.6 Flash no Apidog

As páginas de modelos citam números de melhor caso. A única maneira de saber o que o 3.6 Flash retorna para seus prompts, no seu comprimento de contexto, é enviar a chamada e verificar a resposta. É aí que um cliente de API se destaca.

Apidog é um cliente de API e plataforma de teste, e ele trata o endpoint Gemini como qualquer outra chamada REST. Aqui está uma configuração limpa:

  1. Crie uma solicitação POST para o endpoint da API Gemini e defina o modelo como gemini-3.6-flash.
  2. Armazene sua chave de API em uma variável de ambiente do Apidog em vez de colá-la na URL. Assim, você pode alternar entre uma chave de teste e uma chave de produção sem editar a solicitação.
  3. Envie a chamada e leia a resposta. Adicione asserções sobre o código de status e os campos JSON que você se importa, para que uma carga útil ruim ou uma mudança de esquema falhe ruidosamente em vez de passar despercebida.
  4. Salve-o como um teste de regressão e programe-o para ser executado para que você perceba quando uma forma de resposta ou latência muda após uma atualização do modelo.

Seja claro sobre o que isso faz e não faz. O Apidog não executa o modelo e não é um framework de IA. É a ferramenta que você usa para construir a solicitação, enviá-la e manter a resposta em um padrão que você define. Quando o Google lançar a próxima atualização do Flash, seus testes salvos dirão em minutos se algo que você depende mudou. Baixe o Apidog se você quiser configurar essa primeira solicitação.

FAQ

O Gemini 3.6 Flash é gratuito? Existe um nível gratuito através do Google AI Studio, mas ele tem limite de taxa e é destinado à prototipagem. O Google pode usar dados do nível gratuito para melhorar seus produtos. Para tráfego de produção, você paga por token: US$ 1,50 por milhão de entrada, US$ 7,50 por milhão de saída.

O Gemini 3.6 Flash é melhor que o 3.5 Flash? Para a maioria dos trabalhos, sim. Ele usa cerca de 17% menos tokens de saída, o preço de saída caiu de US$ 9,00 para US$ 7,50 por milhão, e é mais forte em codificação e uso de computador, incluindo um salto para 83,0% no OSWorld-Verified de 78,4%. Ele substitui o 3.5 Flash como o "burro de carga" padrão.

O Gemini 3.5 Pro foi lançado? Não. O Google diz que ainda está testando o 3.5 Pro com parceiros, então não há um modelo Pro público neste lançamento. Uma execução de pré-treinamento do Gemini 4 foi provocada, mas não lançada.

Qual é o ID do modelo? É gemini-3.6-flash. Não o confunda com gemini-3.5-flash-lite, que é o nível Flash-Lite mais barato em um número de versão diferente.

O que o Gemini 3.6 Flash não pode fazer? Ele apenas gera texto, então não irá gerar imagens, áudio ou vídeo, embora possa lê-los como entrada. Sua recuperação cai no final da janela de 1M de tokens, cerca de 54,0% em recuperação pontual no comprimento total. E é um "burro de carga" de nível médio, não um carro-chefe de ponta, então escolha o nível certo para raciocínios genuinamente difíceis.

Gemini 3.6 Flash é o modelo que a maioria do tráfego da API Gemini deve usar agora: mais barato, mais eficiente em tokens e melhor em trabalho agentic do que a versão que ele substitui. Confirme as peças das quais você depende com alguns testes de API salvos antes de migrar em escala. Quando o Flash-Lite, Cyber, ou os eventuais Pro e Gemini 4 forem lançados, você saberá exatamente o que mudou em suas próprias respostas.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs