Gemini 3.8 Flash vs 3.7 Flash: o que mudou e vale a pena atualizar?

Gemini 3.8 Flash vs. 3.7 Flash: mesmo preço, velocidade e contexto, mas +3 no índice AA, +12 no tau3-Banking e 30% mais tokens de saída por tarefa. Atualizar?

Medy Evrard

3 setembro 2026

Gemini 3.8 Flash vs 3.7 Flash: o que mudou e vale a pena atualizar?

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

O Google lançou o Gemini 3.8 Flash em 2 de setembro de 2026, três semanas após o Gemini 3.7 Flash e seis semanas após o 3.6 Flash. O mesmo preço de lançamento (US$ 0,75 de entrada, US$ 3,75 de saída por milhão de tokens até 31 de dezembro), o mesmo contexto de 1 milhão de tokens e, segundo a própria Google, aproximadamente a mesma velocidade. O que mudou é como o modelo funciona: ele executa etapas de raciocínio menores, verifica sua própria saída e chama ferramentas em loops. Isso lhe confere uma pontuação mais alta em todos os benchmarks publicados. Também faz com que cada tarefa custe mais tokens.

Então, a questão da atualização não é “o 3.8 Flash é melhor?” No papel, sim. A questão é se a qualidade extra compensa os tokens extras em sua carga de trabalho e se as duas alterações disruptivas afetam seu código. Esta comparação detalha o que permaneceu o mesmo, o que melhorou, quanto custa e uma matriz de decisão por carga de trabalho. As fontes são o post de lançamento do Google, a página O que há de novo no Gemini 3.8 Flash e os testes independentes da Artificial Analysis. Para a folha de especificações completa, comece com o que é o Gemini 3.8 Flash.

Mais uma coisa logo de cara: o Google afirma que “o Gemini 3.7 Flash continua totalmente suportado” e não publicou nenhuma data de descontinuação. Ninguém está te forçando a mudar.

Comparativo

Gemini 3.8 Flash Gemini 3.7 Flash
ID do Modelo gemini-3.8-flash gemini-3.7-flash
Lançado 2 de setembro de 2026 13 de agosto de 2026
Base “Baseado no Gemini 3.7 Flash” (ficha do modelo) n/a
Contexto / saída máxima 1.048.576 / 65.536 tokens Mesmo
Preço de entrada (lançamento, até 31 de dez) US$ 0,75 por milhão US$ 0,75 por milhão
Preço de saída (lançamento, até 31 de dez) US$ 3,75 por milhão, raciocínio incluído US$ 3,75 por milhão, raciocínio incluído
Preço padrão (a partir de 1º de jan de 2027) US$ 1,50 / US$ 7,50 US$ 1,50 / US$ 7,50
Leitura de cache de contexto US$ 0,075 por milhão (lançamento) Mesmo
Processamento em lote 50% de desconto, mesmos níveis de tokens enfileirados Mesmo
Níveis de raciocínio low, medium (padrão), high low, medium, high
Nível de raciocínio minimal Erro de validação Aceito (nota de migração do Google: mapeie para low)
Data de corte do conhecimento Março de 2026 Não reafirmado na documentação do 3.8
Velocidade de saída (Artificial Analysis) ~300 tokens/s (302,1 medidos, alto) “Cerca da mesma velocidade” segundo o Google
Índice de Inteligência Artificial Analysis 59 (alto) 56 (alto)
Status de suporte Atual “Permanece totalmente suportado”, sem data de descontinuação

O que é idêntico

Preço, em primeiro lugar. Ambos os modelos aparecem nas mesmas linhas da página de preços do Google: US$ 0,75 de entrada e US$ 3,75 de saída até 31 de dezembro, duplicando para US$ 1,50 e US$ 7,50 em 1º de janeiro de 2027. Cache, descontos em lote e as 5.000 solicitações gratuitas de 'grounding' do Google Search por mês (compartilhadas entre todos os modelos Gemini 3.x) são todos mantidos. Se você deseja o detalhamento por linha, a referência de especificações e preços do 3.7 Flash ainda se aplica ao 3.8 Flash linha por linha.

Os limites de contexto e saída permanecem inalterados em 1.048.576 tokens de entrada e 65.536 tokens de saída. As modalidades também são as mesmas: texto, imagem, vídeo, áudio e PDF de entrada; texto de saída. Nenhum dos modelos realiza geração de áudio, geração de imagem ou a Live API.

A velocidade é um quase empate. Logan Kilpatrick, do Google, descreveu o 3.8 Flash como “mesmo preço que o 3.7, é ~a mesma velocidade”. A Artificial Analysis mediu 302,1 tokens de saída por segundo em sua execução de alto raciocínio. Isso é a vazão assim que o modelo começa a escrever; o tempo para o primeiro token na mesma execução foi de 13,30 segundos, porque em high o modelo pensa antes de falar.

A superfície da API também é a mesma. A API de Interações é agora o caminho principal do Google para o Gemini 3.x, e o endpoint generateContent legado “permanece totalmente suportado” sem data de descontinuação. O código escrito para o 3.7 Flash em qualquer um dos endpoints funciona com gemini-3.8-flash após uma troca da string do modelo, com as exceções cobertas em alterações disruptivas.

O que melhorou

A manchete do Google para o 3.8 Flash é “nosso modelo Flash mais inteligente”, construído para “engenharia de software de longo horizonte, agentes autônomos e fluxos de trabalho empresariais complexos”. A mudança de design por trás dessa afirmação: em tarefas difíceis, o modelo “executa etapas de raciocínio extras e chama ferramentas iterativamente”, dando “passos de raciocínio menores” e verificando “seu trabalho ao longo do caminho”. Veja o que isso produz nos benchmarks que o Google e a Artificial Analysis publicaram em texto.

Tabelas do próprio Google. O Google publicou três comparações numéricas com o 3.7 Flash na página DeepMind Flash. Estas são execuções do fornecedor.

Benchmark (execução Google) 3.8 Flash 3.7 Flash Delta
Vals Finance Agent v2 61,4% 59,0% +2,4
HLE-Verified 54,9% 53,6% +1,3
Harvey Legal Agent Benchmark 10,0% 8,8% +1,2

Ganhos modestos e consistentes, e em cada linha o 3.8 Flash também supera os modelos maiores na tabela do Google (Claude Opus 5 com 58,6% no Vals Finance, 54,4% no HLE-Verified); a comparação tripla com Claude Fable 5.1 e GPT-5.6 Sol aprofunda essa discussão. É um modelo com preço Flash superando modelos que custam várias vezes mais por token, o que é o ponto que o Google quer que você entenda.

Artificial Analysis, de forma independente. O relatório da Artificial Analysis coloca o 3.8 Flash em 59 em seu Índice de Inteligência em high, acima de 56 para o 3.7 Flash e 52 para o 3.6 Flash. São três pontos por lançamento, e isso empata o 3.8 Flash com o GPT-5.6 Sol em xhigh e o Grok 4.6 em medium, um ponto acima do Claude Fable 5.1 em medium. No τ³-Banking, sua avaliação de uso de ferramentas, o 3.8 Flash obteve 45%, um salto de 12 pontos em relação ao 3.7 Flash. Se você executa agentes com chamadas de ferramentas reais, essa linha importa mais do que o índice.

Trabalho de agente com muitos documentos. O Google afirma que o 3.8 Flash “completa mais de três vezes mais tarefas que o Gemini 3.7 Flash” em fluxos de trabalho longos e com muitos documentos. Avaliação interna, sem 'harness' público, então trate como indicativo. No entanto, alinha-se com o design do modelo: mais etapas de verificação ajudam mais onde um único erro pode desviar um trabalho de 40 etapas.

Codificação, com uma lacuna no registro. No DeepSWE v1.1, o 3.7 Flash marcou 65,3%, acima dos 49,0% do 3.6 Flash. O Google afirma que o 3.8 Flash “supera a maioria dos modelos de ponta maiores” nessa área por “uma fração do custo”, mas a porcentagem exata do 3.8 aparece apenas nas tabelas de imagem da ficha do modelo, não em texto, então não imprimiremos um número. Os números de SWE-Bench Pro, Terminal-bench e OSWorld para o 3.8 Flash não são publicados em texto. Se esses benchmarks orientam sua decisão, aguarde por execuções de terceiros.

Segurança e resistência à injeção. O Google relata um “salto significativo” nos testes de injeção de prompt Gray Swan sem um número. Os deltas da ficha do modelo em relação ao 3.7 Flash são pequenos: segurança multilíngue +5,4 pontos, segurança texto-para-texto -0,4, recusas injustificadas +1,1. Interprete este último como um leve aumento na recusa excessiva.

Qual o custo

Os preços por token não se moveram. O custo por tarefa, sim. Esta é a compensação que o Google declara abertamente: o modelo “pode usar mais tokens em tarefas mais longas e complexas, por design”, e “pode usar mais tokens para maximizar o desempenho, especialmente em níveis de esforço mais altos”.

A Artificial Analysis quantificou isso. Ao executar seu índice, o 3.8 Flash teve uma média de 48.000 tokens de saída por tarefa, 30% a mais que o 3.7 Flash. Com preços idênticos por token, isso se traduz em uma conta mais alta por tarefa concluída:

Configuração (Artificial Analysis) Custo por tarefa Tempo por tarefa
Gemini 3.7 Flash, high US$ 0,40 2,2 min
Gemini 3.8 Flash, low US$ 0,24 0,8 min
Gemini 3.8 Flash, medium US$ 0,41 não publicado
Gemini 3.8 Flash, high US$ 0,58 2,5 min

Três coisas decorrem dessa tabela. Primeiro, o 3.8 Flash em high custa cerca de 45% a mais por tarefa do que o 3.7 Flash em high, e leva 14% mais tempo de execução. Segundo, o 3.8 Flash em medium, que é o padrão, fica a um centavo do 3.7 Flash em high, então uma atualização de “mesmo orçamento” está disponível se a qualidade medium atender aos seus requisitos. Terceiro, o 3.8 Flash em low é a linha mais barata e rápida da tabela, o que o torna a escolha óbvia para rotas sensíveis à latência onde o 3.7 Flash estava rodando em high por hábito.

O detalhamento de preços do 3.8 Flash integra isso aos volumes diários. A versão curta: se você está pagando por tarefa, a atualização não é gratuita, e o nível de raciocínio é o controle que você usa para decidir quanto da melhoria você compra.

Alterações disruptivas em resumo

Duas mudanças afetam diretamente o código existente do 3.7 Flash.

thinking_level: "minimal" retorna um erro de validação. O 3.8 Flash aceita apenas low, medium e high. Se uma configuração do 3.7 usar minimal, mapeie-o para low. O guia de níveis de raciocínio aborda o que cada nível faz e o custo e latência de cada um.

As respostas de função devem conter call_id e name. Todo function_result na API de Interações precisa de ambos os campos, e todo functionResponse no generateContent legado precisa do id correspondente mais o name. O código que retornava resultados apenas com name falhará na segunda volta de um loop de ferramentas.

Além disso, o guia de migração do 3.7 para o 3.8 Flash percorre as regras do Gemini 3 que vale a pena verificar novamente na transição: mantenha temperature no padrão 1.0 (o Google alerta que valores mais baixos “podem causar loops ou desempenho degradado”), use thinking_level em vez de um inteiro thinking_budget, descarte candidate_count, e passe as assinaturas de pensamento de volta exatamente como recebidas. Nenhuma dessas é novidade no 3.8, mas uma base de código 3.7 que as ignorou enfrentará os problemas agora.

Matriz de decisão por carga de trabalho

Carga de trabalho Recomendação Porquê
Agentes multi-etapas com chamadas de ferramentas Atualize, medium ou high +12 no τ³-Banking; loops de ferramentas iterativos são o ponto principal do 3.8
Extração e revisão de documentos longos Atualize A afirmação do Google de 3x mais tarefas concluídas visa exatamente este formato
Codificação agentica em um 'harness' Atualize, depois meça Número de texto DeepSWE não publicado; verifique em seu repositório antes de implementar
Agentes financeiros, jurídicos e de pesquisa Atualize As três tabelas publicadas pelo Google favorecem o 3.8
Classificação, extração, chat de alto volume Mantenha o 3.7, ou 3.8 em low O custo por tarefa é a métrica aqui; low é mais barato que o 3.7 em high
Endpoints voltados para o usuário sensíveis à latência 3.8 em low 0,8 min por tarefa no 'harness' da AA vs 2,2 para o 3.7 em high
Qualquer coisa usando raciocínio minimal Migre primeiro Erro de validação até que você o mapeie para low
Pipelines em lote com preço preciso Mantenha o 3.7 até ser reavaliado Mesmo preço por token, mas +30% de tokens de saída muda a conta do lote

O padrão: quanto mais difícil e longa a tarefa, mais o design “trabalha mais” do 3.8 Flash justifica seus tokens. Quanto mais curta e repetitiva a tarefa, menos ele faz, e mais o nível de raciocínio (ou a permanência) importa.

Execute ambos os modelos no mesmo cenário de teste no Apidog

Os números por tarefa acima vêm do 'harness' da Artificial Analysis, não do seu. Antes de trocar a string do modelo em produção, execute seus próprios prompts em ambos os modelos e compare a contagem de tokens. O Apidog torna isso um trabalho de dez minutos.

Defina GEMINI_API_KEY como uma variável de ambiente em um ambiente Apidog e adicione uma solicitação POST para https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent com x-goog-api-key lendo da variável. Torne model uma variável de cenário também. O corpo é o mesmo para ambas as execuções:

{
  "contents": [{"parts": [{"text": "{{golden_prompt}}"}]}],
  "generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}

Crie um cenário de teste com duas etapas: a solicitação com model definido como gemini-3.7-flash, e depois a mesma solicitação com gemini-3.8-flash. Em cada etapa, adicione asserções em usageMetadata.candidatesTokenCount e usageMetadata.thoughtsTokenCount com um limite que reflita seu orçamento, além de uma asserção de caminho JSON sobre qualquer campo que sua aplicação leia. Execute o cenário com um conjunto de dados de dez ou vinte prompts de referência. O relatório de teste mostra a resposta de cada etapa e os resultados da asserção juntos, para que você leia a contagem de tokens de ambos os modelos em uma única execução e o valor de +30% se torne o seu número em vez do de um benchmark.

Assim que os números estiverem corretos, agende o cenário para que um aumento silencioso nos tokens de raciocínio após uma atualização do modelo falhe em um teste em vez de aparecer em uma fatura. Baixe o Apidog para configurá-lo; o plano gratuito cobre este fluxo de trabalho.

Perguntas Frequentes

O Gemini 3.8 Flash é mais rápido que o 3.7 Flash?

Não. A própria descrição do Google é “~a mesma velocidade”, e a Artificial Analysis mediu cerca de 300 tokens de saída por segundo em high. Como o 3.8 Flash raciocina em mais etapas, o tempo total por tarefa aumentou em seu 'harness' (2,5 minutos vs 2,2 em high). Diminuir para low o reduz para 0,8 minutos.

O Gemini 3.8 Flash custa mais que o 3.7 Flash?

Não por token. Ambos custam US$ 0,75 de entrada e US$ 3,75 de saída até 31 de dezembro, depois US$ 1,50 e US$ 7,50. Por tarefa, sim: a Artificial Analysis mediu US$ 0,58 em high contra US$ 0,40 para o 3.7 Flash em high, porque o 3.8 Flash escreve cerca de 30% mais tokens de saída.

O Google descontinuará o Gemini 3.7 Flash?

O Google afirma que o 3.7 Flash “continua totalmente suportado” e não publicou nenhuma data de descontinuação. Você pode permanecer nele. O post sobre as novidades do 3.7 Flash ainda é a referência para esse modelo.

O que quebra quando mudo para o 3.8 Flash?

Duas coisas: thinking_level: "minimal" agora retorna um erro 400 INVALID_ARGUMENT, e cada resposta de função deve incluir tanto o ID da chamada (call_id na API de Interações, id no generateContent legado) quanto o name. Todo o resto na API Gemini 3 permanece inalterado.

Como esse salto se compara ao 3.6 para o 3.7?

O 3.7 Flash foi um passo maior: o DeepSWE passou de 49,0% para 65,3%, e o índice Artificial Analysis de 52 para 56. O passo do 3.8 é de +3 no índice e um redesenho de como o modelo gasta tokens. Para a geração anterior, veja 3.6 Flash vs 3.5 Flash, que aborda o corte de preço que iniciou esta série de lançamentos.

Em resumo

Atualize se sua carga de trabalho for agêntica, pesada em ferramentas ou pesada em documentos. É aí que o Google e a Artificial Analysis mostram ganhos, e onde os tokens extras estão comprando tarefas concluídas. Mantenha o 3.7 Flash, ou mude para o 3.8 em low, se você estiver executando chamadas curtas e repetitivas onde o custo por tarefa é o número que você relata. De qualquer forma, corrija o minimal e verifique suas respostas de função primeiro, e então meça a contagem de tokens em seus próprios prompts antes de confiar no 'harness' de qualquer um, incluindo o nosso.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs