O que é o Gemini 3.8 Flash?

Gemini 3.8 Flash explicado: Lançamento em setembro de 2026, ID do modelo, 1M de contexto, níveis de raciocínio, preço de introdução de US$0,75/US$3,75, benchmarks vs 3.7 Flash, por que ele usa mais tokens.

Ashley Innocent

Ashley Innocent

3 setembro 2026

O que é o Gemini 3.8 Flash?

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

Gemini 3.8 Flash é o mais novo modelo da camada Flash do Google, lançado em 2 de setembro de 2026, juntamente com um modelo gêmeo de segurança restrita chamado Gemini 3.8 Flash Cyber. É o terceiro lançamento Flash em seis semanas, seguindo o Gemini 3.6 Flash em 21 de julho e o 3.7 Flash em 13 de agosto, com o mesmo preço introdutório do 3.7 Flash: $0.75 por milhão de tokens de entrada e $3.75 por milhão de tokens de saída até 31 de dezembro de 2026. O Google o descreve como "nosso modelo Flash mais inteligente, projetado para engenharia de software de longo prazo, agentes autônomos e fluxos de trabalho empresariais complexos".

A principal mudança não é um novo preço ou uma janela de contexto maior. É o comportamento. O Google projetou o 3.8 Flash para "trabalhar mais arduamente" em tarefas difíceis: ele executa etapas de raciocínio menores, verifica seu trabalho ao longo do caminho e chama ferramentas iterativamente. Isso gera ganhos mensuráveis em benchmarks de agentes, e significa que o modelo gasta mais tokens por tarefa, por design. A Artificial Analysis mediu cerca de 30% mais tokens de saída do que o 3.7 Flash. Se você orça por token, o preço é o mesmo. Se você orça por tarefa, a conta aumentou.

Este guia aborda todo o lançamento: especificações, a compensação do "trabalho mais árduo", benchmarks, preços, disponibilidade, o modelo Cyber gêmeo e o que o modelo não consegue fazer. Cada solicitação aqui é HTTP simples com JSON, para que você possa construí-las e inspecioná-las no Apidog antes que cheguem ao código do aplicativo. A publicação de lançamento do Google e a página do modelo são as fontes primárias.

Gemini 3.8 Flash em resumo

Especificação Valor
ID do modelo da API gemini-3.8-flash (estável, sem sufixo de pré-visualização)
Lançamento 2 de setembro de 2026
Baseado em Gemini 3.7 Flash (conforme o cartão do modelo DeepMind)
Janela de contexto 1.048.576 tokens de entrada
Saída máxima 65.536 tokens
Modalidades de entrada Texto, imagem, vídeo, áudio, PDF
Modalidades de saída Somente texto
Níveis de raciocínio low, medium (padrão), high; minimal retorna um erro
Preço introdutório (até 31 de dezembro de 2026) $0.75 entrada / $3.75 saída por milhão de tokens; raciocínio cobrado como saída
Preço padrão (a partir de 1º de janeiro de 2027) $1.50 entrada / $7.50 saída por milhão de tokens
Cache de contexto $0.075 por milhão de tokens em cache (introdução), $0.15 padrão
API em lote 50% de desconto: $0.375 / $1.875 introdutório
Corte de conhecimento Março de 2026
Disponibilidade para desenvolvedores Gemini API, Google AI Studio, Android Studio, Google Antigravity, Stitch, Gemini Enterprise
Disponibilidade para consumidores Aplicativo Gemini (assinantes AI Pro e Ultra), Modo AI na Pesquisa, Gemini no Google Sheets
Status do 3.7 Flash Permanece totalmente suportado; sem data de descontinuação

Três linhas merecem uma segunda olhada. O nível de raciocínio padrão é medium, não high como no Gemini 3 Pro, então um prompt ajustado no Pro raciocina menos aqui, a menos que você defina o nível. O nível minimal retorna um erro de validação em vez de ser silenciosamente mapeado para low; o guia de níveis de raciocínio aborda a correção. E o corte de conhecimento de março de 2026 vem com uma ressalva no cartão do modelo: em alguns domínios, o conhecimento pode ser limitado a janeiro de 2025.

O que é o Gemini 3.8 Flash

Flash é a camada de "cavalo de batalha" do Google: o modelo destinado a lidar com a maior parte do tráfego de produção, enquanto o Pro lida com os problemas mais difíceis. O Google chama o 3.8 Flash de seu "modelo de trabalho mais inteligente até agora", e o cartão do modelo DeepMind o descreve como baseado no 3.7 Flash, em vez de um novo modelo base. Portanto, a descrição honesta é um refinamento de um modelo lançado três semanas antes, ajustado para engenharia de software de longa duração e trabalho de agente.

Imagem ilustrativa do Gemini 3.8 Flash

A cadência é incomum. O 3.6 Flash foi lançado em 21 de julho por $1.50 / $7.50, o 3.7 Flash em 13 de agosto com a taxa introdutória de $0.75 / $3.75, e o 3.8 Flash em 2 de setembro com a mesma taxa. A fraseologia do Google é "terceiro lançamento Flash em seis semanas"; a Artificial Analysis conta um quarto modelo Flash em menos de quatro meses porque sua contagem inclui o 3.5 Flash-Lite. Para qualquer um que mantenha uma configuração de modelo, a publicação de novidades do 3.7 Flash tem três semanas e já descreve a geração anterior. Nenhum Gemini 3.8 Pro, Gemini 4 ou novo Flash-Lite foi lançado com esta versão, e o Google não informou quando uma atualização Pro estará disponível.

O design de "trabalho mais árduo" e o que ele custa

A descrição do Google sobre a mudança é específica. Em tarefas complexas, o 3.8 Flash "executa etapas de raciocínio extras e chama ferramentas iterativamente". Ele executa "etapas de raciocínio menores" e "verifica seu trabalho ao longo do caminho". O Google é direto sobre a consequência: o modelo "pode usar mais tokens em tarefas mais longas e complexas, por design", especialmente em níveis de esforço mais altos.

A Artificial Analysis mediu isso em seu relatório independente. Rodando seu Índice de Inteligência, o 3.8 Flash com raciocínio alto teve uma média de 48.000 tokens de saída por tarefa, um aumento de 30% em relação ao 3.7 Flash. Os preços por token não se alteraram, então o custo por tarefa subiu de $0.40 no 3.7 Flash alto para $0.58 no 3.8 Flash alto. O tempo por tarefa também aumentou: 2.5 minutos versus 2.2 minutos.

O mesmo relatório mostra a alavanca que você tem. Em medium, o custo por tarefa cai para $0.41, próximo ao 3.7 Flash em alto. Em low, ele cai para $0.24 com 0.8 minutos por tarefa. Assim, o nível de raciocínio é agora uma decisão de roteamento, não uma configuração global: endpoints sensíveis à latência em low, loops de agente que devem concluir o trabalho em medium ou high. O detalhamento de preços analisa 1.000 tarefas de agente por dia em cada nível.

A velocidade não mudou. Logan Kilpatrick, do Google, descreveu o 3.8 Flash como "mesmo preço que o 3.7, tem ~a mesma velocidade", e a Artificial Analysis mediu 302.1 tokens de saída por segundo com raciocínio alto. O tempo de 13.30 segundos para o primeiro token nessa execução é o modelo pensando antes de responder, não um caminho de rede lento.

O que os benchmarks dizem

O Google publicou três tabelas de benchmark em formato de texto na página DeepMind Flash. Estes são números gerados pelo Google.

Benchmark 3.8 Flash 3.7 Flash Claude Opus 5 GPT-5.6 Sol GPT-5.6 Terra Claude Sonnet 5
Agente de Finanças Vals v2 61.4% 59.0% 58.6% 53.8% 54.4% 53.9%
Benchmark de Agente Legal Harvey 10.0% 8.8% 6.7% 2.5% 0.8% 5.0%
HLE-Verificado 54.9% 53.6% 54.4% 54.5% 51.1% 31.0%

Os ganhos sobre o 3.7 Flash são de 2.4, 1.2 e 1.3 pontos. Modestos, mas as linhas de finanças e legal colocam um modelo com preço Flash à frente do Opus 5 e GPT-5.6 Sol, que custam várias vezes mais por token. O Claude Fable 5.1, lançado no dia anterior, não aparece nas tabelas do Google; a comparação de três vias usa as linhas Opus 5 e Sonnet 5 da Anthropic como as entradas publicadas mais próximas.

O Google faz mais três afirmações sem números em formato de texto. No DeepSWE v1.1, o 3.8 Flash "supera a maioria dos modelos de fronteira maiores" a "uma fração do custo"; a porcentagem aparece apenas nas tabelas de imagem do cartão do modelo, então não estamos imprimindo uma (o 3.7 Flash marcou 65.3%). Em fluxos de trabalho de longa duração e com muitos documentos, uma avaliação interna mostra que ele "conclui mais de três vezes o número de tarefas do Gemini 3.7 Flash". Na injeção de prompt Gray Swan, o Google relata um "salto significativo" sem números. Os resultados de SWE-Bench Pro, Terminal-bench e OSWorld não são publicados em texto para o 3.8 Flash.

A visão independente se alinha. A Artificial Analysis pontua o 3.8 Flash (alto) em 59 em seu Índice de Inteligência, acima dos 56 para o 3.7 Flash e 52 para o 3.6 Flash. Isso o iguala ao GPT-5.6 Sol (xhigh) e Grok 4.6 (médio), e o coloca acima do GPT-5.6 Terra (máx), Claude Fable 5.1 (médio) e Muse Spark 1.2 (xhigh), todos com 57. Em sua avaliação de uso de ferramentas τ³-Banking, o 3.8 Flash marcou 45%, 12 pontos acima do 3.7 Flash. A comparação 3.8 vs 3.7 Flash pondera esses ganhos em relação ao custo por token por carga de trabalho.

Preços: mesmo por token, mais por tarefa

A página de preços lista o 3.8 Flash nas mesmas linhas que o 3.6 e 3.7 Flash, e todos os três dobram em 1º de janeiro de 2027.

Item Até 31 de dezembro de 2026 A partir de 1º de janeiro de 2027
Entrada $0.75 / 1M $1.50 / 1M
Saída (inclui raciocínio) $3.75 / 1M $7.50 / 1M
Entrada em cache $0.075 / 1M $0.15 / 1M
Armazenamento em cache $0.50 / 1M tokens / hora $1.00 / 1M tokens / hora
Entrada / saída em lote $0.375 / $1.875 $0.75 / $3.75

Dois detalhes confundem as pessoas. Tokens de raciocínio são tokens de saída: cobrados na taxa de saída e relatados separadamente em usageMetadata.thoughtsTokenCount, então uma resposta curta em high pode custar mais do que uma longa em low. E o "grounding" na Pesquisa Google tem seu próprio medidor: 5.000 requisições gratuitas por mês compartilhadas entre todos os modelos Gemini 3.x, depois $14 por 1.000 requisições.

Existe uma camada gratuita com limite de taxa no AI Studio e na API, com o Google observando que os dados da camada gratuita são "usados para melhorar nossos produtos". Os limites de taxa por modelo são mostrados no AI Studio, em vez de na documentação. A Camada 1 é desbloqueada ao vincular uma conta de faturamento, a Camada 2 após $100 de gastos e três dias, e a Camada 3 após $1.000 e 30 dias. O guia de acesso gratuito cobre o que o caminho gratuito oferece e não oferece, e o guia da API em Lote cobre o desconto de 50% para trabalhos que podem esperar.

Como chamá-lo

O Google agora trata a API de Interações como o caminho principal para o Gemini 3.x. generateContent é "considerado legado", mas "permanece totalmente suportado" sem data de descontinuação, e a maioria do código existente ainda o utiliza. Uma solicitação mínima de Interações:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"medium"}}'

Conversas multi-turn passam previous_interaction_id e permitem que o servidor mantenha o estado. A chamada de função declara ferramentas com um esquema JSON, recebe uma etapa function_call e espera um function_result contendo tanto call_id quanto name, que são obrigatórios no 3.8 Flash (o generateContent legado usa o campo id). O passo a passo da API mostra ambos os endpoints em REST e Python, e o guia de chamada de função aborda os loops iterativos de ferramentas que o design de "trabalho mais árduo" produz e como limitá-los.

Se você está migrando do 3.7 Flash, as mudanças são pequenas, mas causam erros: o raciocínio minimal é rejeitado, thinking_budget dá lugar a thinking_level, candidate_count não é suportado, e o Google recomenda deixar a temperature no padrão 1.0 porque diminuí-la "pode causar loops ou degradação de desempenho". O guia de migração transforma as notas de novidades do Google em uma lista de verificação com JSON de antes e depois.

O que o Gemini 3.8 Flash não consegue fazer

A página do modelo é explícita. Não suportado: geração de áudio, a API Live e geração de imagens. A saída é apenas texto, mesmo que a entrada aceite texto, imagem, vídeo, áudio e PDF. A segmentação de imagem também não é suportada nos modelos Gemini 3. Se o seu produto precisa de saída de voz ou imagem em tempo real, este modelo é a camada de raciocínio e chamada de ferramentas, não toda a pilha. Para texto barato e de alto rendimento sem raciocínio pesado, o Gemini 3.5 Flash-Lite permanece na lista de preços a $0.30 / $2.50. O restante da lista de verificação é suportado, incluindo chamada de função, saídas estruturadas, cache de contexto, execução de código, "grounding" na Pesquisa e Mapas, API em Lote e uso de Computador em pré-visualização.

Gemini 3.8 Flash Cyber: o gêmeo restrito

O Gemini 3.8 Flash Cyber foi lançado no mesmo dia, e você não pode se inscrever para ele. O acesso ocorre apenas através do novo Programa Fairwind, aberto a "autoridades governamentais confiáveis, operadores de infraestrutura crítica e mantenedores de software", com verificações de antecedentes e requisitos como MFA resistente a phishing. Não há API pública, preços públicos e auto-hospedagem. Ele substitui o piloto limitado do 3.5 Flash Cyber.

As afirmações do Google são grandes: uma taxa de sucesso na descoberta de vulnerabilidades no mundo real acima de 70% em 20 linguagens de programação, e um relatório da equipe de segurança do Chrome de "2.6 vezes mais patches corretos para vulnerabilidades no Chrome do que os melhores modelos comerciais que são muito maiores". Ambos são relatados pelo Google. O explicador Cyber cobre a elegibilidade, obrigações e o que isso significa para as muitas equipes que nunca terão acesso.

Testando solicitações do Gemini 3.8 Flash no Apidog

Como a história de custo é por tarefa e não por token, o teste útil não é "a chamada foi bem-sucedida", mas "quantos tokens ela consumiu". O Apidog lida com isso como um teste de API comum. Armazene GEMINI_API_KEY como uma variável de ambiente, salve as solicitações de Interações e generateContent como endpoints e faça asserções no status 200, nos campos JSON que seu aplicativo lê e em um limite para usageMetadata.thoughtsTokenCount. Execute o mesmo prompt em low, medium e high em um cenário de teste e você obterá a distribuição de tokens por nível para seus próprios prompts, em vez das médias da Artificial Analysis.

As respostas de streaming são renderizadas como SSE, o que ajuda na depuração de resumos de raciocínio com includeThoughts: true; o guia de teste de SSE detalha isso. Agende o cenário diariamente e uma regressão de tokens falha em uma asserção antes de chegar à fatura. Baixe o Apidog para configurá-lo no plano gratuito.

FAQ

O Gemini 3.8 Flash é um novo modelo ou uma atualização para o 3.7 Flash? O cartão do modelo DeepMind afirma que ele é baseado no Gemini 3.7 Flash. Trate-o como um sucessor ajustado: mesmo preço, velocidade e janela de contexto, com mais raciocínio e etapas de chamada de ferramentas em tarefas difíceis. O 3.7 Flash permanece totalmente suportado, sem data de descontinuação.

Por que o Gemini 3.8 Flash usa mais tokens do que o 3.7 Flash? Por design. O Google afirma que ele "pode usar mais tokens em tarefas mais longas e complexas", e a Artificial Analysis mediu 30% mais tokens de saída em seu índice. Diminua o thinking_level para medium ou low em rotas que não precisam do raciocínio extra; o guia de níveis de raciocínio tem a tabela de custos por nível.

Qual é a janela de contexto do Gemini 3.8 Flash? 1.048.576 tokens de entrada e 65.536 tokens de saída, com cache de contexto a $0.075 por milhão de tokens em cache até 31 de dezembro de 2026.

Posso usar o Gemini 3.8 Flash no aplicativo Gemini gratuito? A cobertura de lançamento lista o aplicativo Gemini para assinantes do Google AI Pro e Ultra, não para a camada de aplicativo gratuito. Desenvolvedores obtêm uma camada gratuita com limite de taxa no AI Studio e na API.

Como o Gemini 3.8 Flash se compara ao Claude Fable 5.1? A Artificial Analysis os pontua em 59 e 57. Quanto ao preço, o Claude Fable 5.1 custa $10 / $50 por milhão de tokens, cerca de 13 vezes a taxa introdutória do 3.8 Flash tanto na entrada quanto na saída. A diferença diminui quando você considera os tokens por tarefa.

Próximos passos

O Gemini 3.8 Flash é um "cavalo de batalha" que pensa por mais tempo, e a troca é explícita: alguns pontos a mais em benchmarks de agentes e 12 pontos no uso de ferramentas, pagos com cerca de 30% mais tokens de saída em raciocínio alto. Se seus agentes estavam batendo em uma parede no 3.7 Flash, a atualização custa o mesmo por token. Se seu tráfego é de chat sensível à latência, defina low ou permaneça no 3.7 Flash, que ainda é suportado. Comece com o passo a passo da API, envie sua primeira solicitação do Apidog com uma asserção de contagem de tokens anexada, e deixe o número, não a publicação de lançamento, decidir o nível de raciocínio para cada rota.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs