O Google lançou o Gemini 3.8 Flash em 2 de setembro de 2026, três semanas após o Gemini 3.7 Flash e seis semanas após o 3.6 Flash. O mesmo preço de lançamento (US$ 0,75 de entrada, US$ 3,75 de saída por milhão de tokens até 31 de dezembro), o mesmo contexto de 1 milhão de tokens e, segundo a própria Google, aproximadamente a mesma velocidade. O que mudou é como o modelo funciona: ele executa etapas de raciocínio menores, verifica sua própria saída e chama ferramentas em loops. Isso lhe confere uma pontuação mais alta em todos os benchmarks publicados. Também faz com que cada tarefa custe mais tokens.
Então, a questão da atualização não é “o 3.8 Flash é melhor?” No papel, sim. A questão é se a qualidade extra compensa os tokens extras em sua carga de trabalho e se as duas alterações disruptivas afetam seu código. Esta comparação detalha o que permaneceu o mesmo, o que melhorou, quanto custa e uma matriz de decisão por carga de trabalho. As fontes são o post de lançamento do Google, a página O que há de novo no Gemini 3.8 Flash e os testes independentes da Artificial Analysis. Para a folha de especificações completa, comece com o que é o Gemini 3.8 Flash.
Mais uma coisa logo de cara: o Google afirma que “o Gemini 3.7 Flash continua totalmente suportado” e não publicou nenhuma data de descontinuação. Ninguém está te forçando a mudar.
Comparativo
| Gemini 3.8 Flash | Gemini 3.7 Flash | |
|---|---|---|
| ID do Modelo | gemini-3.8-flash |
gemini-3.7-flash |
| Lançado | 2 de setembro de 2026 | 13 de agosto de 2026 |
| Base | “Baseado no Gemini 3.7 Flash” (ficha do modelo) | n/a |
| Contexto / saída máxima | 1.048.576 / 65.536 tokens | Mesmo |
| Preço de entrada (lançamento, até 31 de dez) | US$ 0,75 por milhão | US$ 0,75 por milhão |
| Preço de saída (lançamento, até 31 de dez) | US$ 3,75 por milhão, raciocínio incluído | US$ 3,75 por milhão, raciocínio incluído |
| Preço padrão (a partir de 1º de jan de 2027) | US$ 1,50 / US$ 7,50 | US$ 1,50 / US$ 7,50 |
| Leitura de cache de contexto | US$ 0,075 por milhão (lançamento) | Mesmo |
| Processamento em lote | 50% de desconto, mesmos níveis de tokens enfileirados | Mesmo |
| Níveis de raciocínio | low, medium (padrão), high |
low, medium, high |
Nível de raciocínio minimal |
Erro de validação | Aceito (nota de migração do Google: mapeie para low) |
| Data de corte do conhecimento | Março de 2026 | Não reafirmado na documentação do 3.8 |
| Velocidade de saída (Artificial Analysis) | ~300 tokens/s (302,1 medidos, alto) | “Cerca da mesma velocidade” segundo o Google |
| Índice de Inteligência Artificial Analysis | 59 (alto) | 56 (alto) |
| Status de suporte | Atual | “Permanece totalmente suportado”, sem data de descontinuação |
O que é idêntico
Preço, em primeiro lugar. Ambos os modelos aparecem nas mesmas linhas da página de preços do Google: US$ 0,75 de entrada e US$ 3,75 de saída até 31 de dezembro, duplicando para US$ 1,50 e US$ 7,50 em 1º de janeiro de 2027. Cache, descontos em lote e as 5.000 solicitações gratuitas de 'grounding' do Google Search por mês (compartilhadas entre todos os modelos Gemini 3.x) são todos mantidos. Se você deseja o detalhamento por linha, a referência de especificações e preços do 3.7 Flash ainda se aplica ao 3.8 Flash linha por linha.
Os limites de contexto e saída permanecem inalterados em 1.048.576 tokens de entrada e 65.536 tokens de saída. As modalidades também são as mesmas: texto, imagem, vídeo, áudio e PDF de entrada; texto de saída. Nenhum dos modelos realiza geração de áudio, geração de imagem ou a Live API.
A velocidade é um quase empate. Logan Kilpatrick, do Google, descreveu o 3.8 Flash como “mesmo preço que o 3.7, é ~a mesma velocidade”. A Artificial Analysis mediu 302,1 tokens de saída por segundo em sua execução de alto raciocínio. Isso é a vazão assim que o modelo começa a escrever; o tempo para o primeiro token na mesma execução foi de 13,30 segundos, porque em high o modelo pensa antes de falar.
A superfície da API também é a mesma. A API de Interações é agora o caminho principal do Google para o Gemini 3.x, e o endpoint generateContent legado “permanece totalmente suportado” sem data de descontinuação. O código escrito para o 3.7 Flash em qualquer um dos endpoints funciona com gemini-3.8-flash após uma troca da string do modelo, com as exceções cobertas em alterações disruptivas.
O que melhorou
A manchete do Google para o 3.8 Flash é “nosso modelo Flash mais inteligente”, construído para “engenharia de software de longo horizonte, agentes autônomos e fluxos de trabalho empresariais complexos”. A mudança de design por trás dessa afirmação: em tarefas difíceis, o modelo “executa etapas de raciocínio extras e chama ferramentas iterativamente”, dando “passos de raciocínio menores” e verificando “seu trabalho ao longo do caminho”. Veja o que isso produz nos benchmarks que o Google e a Artificial Analysis publicaram em texto.
Tabelas do próprio Google. O Google publicou três comparações numéricas com o 3.7 Flash na página DeepMind Flash. Estas são execuções do fornecedor.
| Benchmark (execução Google) | 3.8 Flash | 3.7 Flash | Delta |
|---|---|---|---|
| Vals Finance Agent v2 | 61,4% | 59,0% | +2,4 |
| HLE-Verified | 54,9% | 53,6% | +1,3 |
| Harvey Legal Agent Benchmark | 10,0% | 8,8% | +1,2 |
Ganhos modestos e consistentes, e em cada linha o 3.8 Flash também supera os modelos maiores na tabela do Google (Claude Opus 5 com 58,6% no Vals Finance, 54,4% no HLE-Verified); a comparação tripla com Claude Fable 5.1 e GPT-5.6 Sol aprofunda essa discussão. É um modelo com preço Flash superando modelos que custam várias vezes mais por token, o que é o ponto que o Google quer que você entenda.
Artificial Analysis, de forma independente. O relatório da Artificial Analysis coloca o 3.8 Flash em 59 em seu Índice de Inteligência em high, acima de 56 para o 3.7 Flash e 52 para o 3.6 Flash. São três pontos por lançamento, e isso empata o 3.8 Flash com o GPT-5.6 Sol em xhigh e o Grok 4.6 em medium, um ponto acima do Claude Fable 5.1 em medium. No τ³-Banking, sua avaliação de uso de ferramentas, o 3.8 Flash obteve 45%, um salto de 12 pontos em relação ao 3.7 Flash. Se você executa agentes com chamadas de ferramentas reais, essa linha importa mais do que o índice.
Trabalho de agente com muitos documentos. O Google afirma que o 3.8 Flash “completa mais de três vezes mais tarefas que o Gemini 3.7 Flash” em fluxos de trabalho longos e com muitos documentos. Avaliação interna, sem 'harness' público, então trate como indicativo. No entanto, alinha-se com o design do modelo: mais etapas de verificação ajudam mais onde um único erro pode desviar um trabalho de 40 etapas.
Codificação, com uma lacuna no registro. No DeepSWE v1.1, o 3.7 Flash marcou 65,3%, acima dos 49,0% do 3.6 Flash. O Google afirma que o 3.8 Flash “supera a maioria dos modelos de ponta maiores” nessa área por “uma fração do custo”, mas a porcentagem exata do 3.8 aparece apenas nas tabelas de imagem da ficha do modelo, não em texto, então não imprimiremos um número. Os números de SWE-Bench Pro, Terminal-bench e OSWorld para o 3.8 Flash não são publicados em texto. Se esses benchmarks orientam sua decisão, aguarde por execuções de terceiros.
Segurança e resistência à injeção. O Google relata um “salto significativo” nos testes de injeção de prompt Gray Swan sem um número. Os deltas da ficha do modelo em relação ao 3.7 Flash são pequenos: segurança multilíngue +5,4 pontos, segurança texto-para-texto -0,4, recusas injustificadas +1,1. Interprete este último como um leve aumento na recusa excessiva.
Qual o custo
Os preços por token não se moveram. O custo por tarefa, sim. Esta é a compensação que o Google declara abertamente: o modelo “pode usar mais tokens em tarefas mais longas e complexas, por design”, e “pode usar mais tokens para maximizar o desempenho, especialmente em níveis de esforço mais altos”.
A Artificial Analysis quantificou isso. Ao executar seu índice, o 3.8 Flash teve uma média de 48.000 tokens de saída por tarefa, 30% a mais que o 3.7 Flash. Com preços idênticos por token, isso se traduz em uma conta mais alta por tarefa concluída:
| Configuração (Artificial Analysis) | Custo por tarefa | Tempo por tarefa |
|---|---|---|
Gemini 3.7 Flash, high |
US$ 0,40 | 2,2 min |
Gemini 3.8 Flash, low |
US$ 0,24 | 0,8 min |
Gemini 3.8 Flash, medium |
US$ 0,41 | não publicado |
Gemini 3.8 Flash, high |
US$ 0,58 | 2,5 min |
Três coisas decorrem dessa tabela. Primeiro, o 3.8 Flash em high custa cerca de 45% a mais por tarefa do que o 3.7 Flash em high, e leva 14% mais tempo de execução. Segundo, o 3.8 Flash em medium, que é o padrão, fica a um centavo do 3.7 Flash em high, então uma atualização de “mesmo orçamento” está disponível se a qualidade medium atender aos seus requisitos. Terceiro, o 3.8 Flash em low é a linha mais barata e rápida da tabela, o que o torna a escolha óbvia para rotas sensíveis à latência onde o 3.7 Flash estava rodando em high por hábito.
O detalhamento de preços do 3.8 Flash integra isso aos volumes diários. A versão curta: se você está pagando por tarefa, a atualização não é gratuita, e o nível de raciocínio é o controle que você usa para decidir quanto da melhoria você compra.
Alterações disruptivas em resumo
Duas mudanças afetam diretamente o código existente do 3.7 Flash.
thinking_level: "minimal" retorna um erro de validação. O 3.8 Flash aceita apenas low, medium e high. Se uma configuração do 3.7 usar minimal, mapeie-o para low. O guia de níveis de raciocínio aborda o que cada nível faz e o custo e latência de cada um.
As respostas de função devem conter call_id e name. Todo function_result na API de Interações precisa de ambos os campos, e todo functionResponse no generateContent legado precisa do id correspondente mais o name. O código que retornava resultados apenas com name falhará na segunda volta de um loop de ferramentas.
Além disso, o guia de migração do 3.7 para o 3.8 Flash percorre as regras do Gemini 3 que vale a pena verificar novamente na transição: mantenha temperature no padrão 1.0 (o Google alerta que valores mais baixos “podem causar loops ou desempenho degradado”), use thinking_level em vez de um inteiro thinking_budget, descarte candidate_count, e passe as assinaturas de pensamento de volta exatamente como recebidas. Nenhuma dessas é novidade no 3.8, mas uma base de código 3.7 que as ignorou enfrentará os problemas agora.
Matriz de decisão por carga de trabalho
| Carga de trabalho | Recomendação | Porquê |
|---|---|---|
| Agentes multi-etapas com chamadas de ferramentas | Atualize, medium ou high |
+12 no τ³-Banking; loops de ferramentas iterativos são o ponto principal do 3.8 |
| Extração e revisão de documentos longos | Atualize | A afirmação do Google de 3x mais tarefas concluídas visa exatamente este formato |
| Codificação agentica em um 'harness' | Atualize, depois meça | Número de texto DeepSWE não publicado; verifique em seu repositório antes de implementar |
| Agentes financeiros, jurídicos e de pesquisa | Atualize | As três tabelas publicadas pelo Google favorecem o 3.8 |
| Classificação, extração, chat de alto volume | Mantenha o 3.7, ou 3.8 em low |
O custo por tarefa é a métrica aqui; low é mais barato que o 3.7 em high |
| Endpoints voltados para o usuário sensíveis à latência | 3.8 em low |
0,8 min por tarefa no 'harness' da AA vs 2,2 para o 3.7 em high |
Qualquer coisa usando raciocínio minimal |
Migre primeiro | Erro de validação até que você o mapeie para low |
| Pipelines em lote com preço preciso | Mantenha o 3.7 até ser reavaliado | Mesmo preço por token, mas +30% de tokens de saída muda a conta do lote |
O padrão: quanto mais difícil e longa a tarefa, mais o design “trabalha mais” do 3.8 Flash justifica seus tokens. Quanto mais curta e repetitiva a tarefa, menos ele faz, e mais o nível de raciocínio (ou a permanência) importa.
Execute ambos os modelos no mesmo cenário de teste no Apidog
Os números por tarefa acima vêm do 'harness' da Artificial Analysis, não do seu. Antes de trocar a string do modelo em produção, execute seus próprios prompts em ambos os modelos e compare a contagem de tokens. O Apidog torna isso um trabalho de dez minutos.
Defina GEMINI_API_KEY como uma variável de ambiente em um ambiente Apidog e adicione uma solicitação POST para https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent com x-goog-api-key lendo da variável. Torne model uma variável de cenário também. O corpo é o mesmo para ambas as execuções:
{
"contents": [{"parts": [{"text": "{{golden_prompt}}"}]}],
"generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}
Crie um cenário de teste com duas etapas: a solicitação com model definido como gemini-3.7-flash, e depois a mesma solicitação com gemini-3.8-flash. Em cada etapa, adicione asserções em usageMetadata.candidatesTokenCount e usageMetadata.thoughtsTokenCount com um limite que reflita seu orçamento, além de uma asserção de caminho JSON sobre qualquer campo que sua aplicação leia. Execute o cenário com um conjunto de dados de dez ou vinte prompts de referência. O relatório de teste mostra a resposta de cada etapa e os resultados da asserção juntos, para que você leia a contagem de tokens de ambos os modelos em uma única execução e o valor de +30% se torne o seu número em vez do de um benchmark.
Assim que os números estiverem corretos, agende o cenário para que um aumento silencioso nos tokens de raciocínio após uma atualização do modelo falhe em um teste em vez de aparecer em uma fatura. Baixe o Apidog para configurá-lo; o plano gratuito cobre este fluxo de trabalho.
Perguntas Frequentes
O Gemini 3.8 Flash é mais rápido que o 3.7 Flash?
Não. A própria descrição do Google é “~a mesma velocidade”, e a Artificial Analysis mediu cerca de 300 tokens de saída por segundo em high. Como o 3.8 Flash raciocina em mais etapas, o tempo total por tarefa aumentou em seu 'harness' (2,5 minutos vs 2,2 em high). Diminuir para low o reduz para 0,8 minutos.
O Gemini 3.8 Flash custa mais que o 3.7 Flash?
Não por token. Ambos custam US$ 0,75 de entrada e US$ 3,75 de saída até 31 de dezembro, depois US$ 1,50 e US$ 7,50. Por tarefa, sim: a Artificial Analysis mediu US$ 0,58 em high contra US$ 0,40 para o 3.7 Flash em high, porque o 3.8 Flash escreve cerca de 30% mais tokens de saída.
O Google descontinuará o Gemini 3.7 Flash?
O Google afirma que o 3.7 Flash “continua totalmente suportado” e não publicou nenhuma data de descontinuação. Você pode permanecer nele. O post sobre as novidades do 3.7 Flash ainda é a referência para esse modelo.
O que quebra quando mudo para o 3.8 Flash?
Duas coisas: thinking_level: "minimal" agora retorna um erro 400 INVALID_ARGUMENT, e cada resposta de função deve incluir tanto o ID da chamada (call_id na API de Interações, id no generateContent legado) quanto o name. Todo o resto na API Gemini 3 permanece inalterado.
Como esse salto se compara ao 3.6 para o 3.7?
O 3.7 Flash foi um passo maior: o DeepSWE passou de 49,0% para 65,3%, e o índice Artificial Analysis de 52 para 56. O passo do 3.8 é de +3 no índice e um redesenho de como o modelo gasta tokens. Para a geração anterior, veja 3.6 Flash vs 3.5 Flash, que aborda o corte de preço que iniciou esta série de lançamentos.
Em resumo
Atualize se sua carga de trabalho for agêntica, pesada em ferramentas ou pesada em documentos. É aí que o Google e a Artificial Analysis mostram ganhos, e onde os tokens extras estão comprando tarefas concluídas. Mantenha o 3.7 Flash, ou mude para o 3.8 em low, se você estiver executando chamadas curtas e repetitivas onde o custo por tarefa é o número que você relata. De qualquer forma, corrija o minimal e verifique suas respostas de função primeiro, e então meça a contagem de tokens em seus próprios prompts antes de confiar no 'harness' de qualquer um, incluindo o nosso.
