O Google lançou o Gemini 3.7 Flash em 13 de agosto de 2026, três semanas após o 3.6 Flash, e o chamou de “nosso modelo de força de trabalho mais inteligente”. Os deltas de benchmark apoiam a confiança. O DeepSWE salta de 49,0% para 65,3%, o AutomationBench sobe de 17,0% para 30,4%, e o preço introdutório de US$ 0,75 por 1M de tokens de entrada chega a metade do custo do 3.6 Flash no lançamento.
Essa combinação levanta uma questão que toda equipe de API enfrenta neste trimestre: um modelo Gemini rápido e barato agora cobre cargas de trabalho que você estava direcionando para Claude ou GPT? Esta comparação se atém ao que você pode verificar: janelas de contexto, modalidades, suporte a ferramentas, estrutura de preços e os esquemas de requisição com os quais você fará a integração; onde os números dos concorrentes não são comparáveis, isso é indicado. E como a resposta honesta para “qual API você deve usar” é “aquela que vence na sua carga de trabalho”, a seção final mostra como executar todas as três lado a lado no Apidog antes de você se comprometer.
Se você acabar escolhendo o Gemini e quiser os passos de configuração, o guia rápido da API Gemini 3.7 Flash cobre chaves, endpoints e primeiras requisições.
TL;DR
- Gemini 3.7 Flash: contexto de 1M de tokens, limite de saída de 64k, entrada nativa para texto, imagem, vídeo, áudio e PDF, além de chamada de função, pesquisa como ferramenta e uso de computador.
- Preço introdutório: US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída até 31 de dezembro de 2026, dobrando para US$ 1,50 e US$ 7,50 em 1º de janeiro de 2027.
- Ganhos de codificação sobre o 3.6 Flash: DeepSWE v1.1 de 49,0% para 65,3%, FrontierCode 1.1 Main de 34,4% para 43,6%, AutomationBench de 17,0% para 30,4%.
- Claude Fable 5 e GPT-5.6 Sol ainda lideram em profundidade de codificação de fronteira e consistência de agente, a várias vezes o preço por token.
- Os três provedores usam esquemas de requisição incompatíveis: Google
contents, Anthropic Messages, OpenAImessages. - Benchmarks preveem médias, não sua carga de trabalho; execute um comparativo de 20 prompts em todas as três APIs antes de decidir.
Como ler esta comparação
Este não é um confronto entre modelos de ponta. Claude Fable 5 e GPT-5.6 Sol são modelos carro-chefe precificados para capacidade máxima; Gemini 3.7 Flash é um modelo de força de trabalho precificado para volume. O Google está lançando-o enquanto seu carro-chefe espera: a Axios relatou que o Gemini 3.5 Pro permanece atrasado, com as atualizações Flash chegando antes dele.
A comparação ainda vale a pena: os resultados de lançamento do 3.7 Flash agora se sobrepõem à faixa onde os modelos de ponta estavam semanas atrás, e isso muda o cálculo de roteamento, mesmo que os modelos carro-chefe permaneçam à frente.
Duas ressalvas se aplicam. Primeiro, cada número aqui é um valor reportado pelo fornecedor na semana de lançamento; trate-os como direcionais até que avaliações independentes cheguem. Segundo, as variantes de benchmark importam. O Google reporta FrontierCode 1.1 Main, enquanto os números publicados para Claude e GPT em seus lançamentos vieram do split Extended, então essas colunas nunca compartilham uma tabela aqui.
Especificações lado a lado
A ficha técnica é onde o Gemini 3.7 Flash se destaca contra modelos que custam muito mais. Detalhes técnicos completos estão na página do modelo Gemini Flash.
| Gemini 3.7 Flash | Claude Fable 5 | GPT-5.6 Sol | |
|---|---|---|---|
| Desenvolvedor | Anthropic | OpenAI | |
| Janela de contexto | 1M de tokens | 1M de tokens | 1,05M de tokens |
| Limite de saída | 64k de tokens | Ver documentação do provedor | Ver documentação do provedor |
| Modalidades de entrada | Texto, imagem, vídeo, áudio, PDF | Texto, imagem | Texto, imagem |
| Saída | Texto | Texto | Texto |
| Suporte a ferramentas | Chamada de função, pesquisa como ferramenta, uso de computador | Chamada de função, uso de ferramenta | Chamada de função, ferramentas integradas |
| Esquema de requisição | Google contents + generationConfig |
Anthropic Messages | OpenAI messages |
| Autenticação | cabeçalho x-goog-api-key |
x-api-key + cabeçalho de versão |
Token de portador |
| Preço (por 1M de tokens) | US$ 0,75 entrada / US$ 3,75 saída introdutório; US$ 1,50 / US$ 7,50 a partir de janeiro de 2027 | Nível de fronteira premium | Nível de fronteira premium |
| Posicionamento | Modelo de força de trabalho de alto volume | Trabalho de agente de longo prazo | Profundidade de codificação em escala de repositório |
As janelas de contexto agora são efetivamente iguais, então essa linha não decide mais nada. As linhas de modalidade e precificação são onde os três divergem, e as próximas seções desdobram ambos.
Tarefas de codificação e agente
As principais afirmações do Google para o 3.7 Flash são voltadas para desenvolvedores: melhor na depuração, mais capaz de produzir código implementável na primeira tentativa e mais diligente no planejamento de várias etapas e chamadas de ferramentas. Os números de geração em geração, confirmados na cobertura de lançamento do 9to5Google, apoiam as afirmações.
| Benchmark | Gemini 3.6 Flash | Gemini 3.7 Flash |
|---|---|---|
| DeepSWE v1.1 (correções em escala de repositório) | 49,0% | 65,3% |
| FrontierCode 1.1 Main | 34,4% | 43,6% |
| WebDev Arena (Elo) | 1538 | 1588 |
| GDP.pdf (raciocínio sobre documentos) | 22,0% | 34,0% |
| AutomationBench (tarefas de agente) | 17,0% | 30,4% |
O salto do AutomationBench é o que os construtores de agentes devem observar. Quase dobrar um benchmark de agenticidade em três semanas sugere que a afirmação “pensa com mais diligência nas chamadas de ferramentas” é mais do que marketing.
Como isso se compara a Claude e GPT? No DeepSWE v1.1, o nível de fronteira registrou 73,0% para GPT-5.6 Sol Max em seu lançamento, com Grok 4.6 em 65,9%; nossa comparação Grok 4.6 vs GPT-5.6 Sol vs Claude Fable 5 cobre esses resultados em profundidade. Sol Max mantém uma vantagem real na correção de bugs em escala de repositório, e a força de Claude Fable 5 é a consistência em avaliações de codificação e agente, onde raramente é pior do que o segundo. O Gemini 3.7 Flash não fechou essa lacuna. Ele chegou a uma distância impressionante por uma fração do custo, o que é uma proposta de valor diferente de "melhor pontuação vence".
Dois números especializados completam o quadro: 90,7% no Harvey LAB-AA para raciocínio jurídico e 97,0% na recuperação de 128k agulhas, a pontuação que torna a janela de 1M confiável na prática.
Entrada multimodal
Esta é a diferença estrutural mais clara entre as três APIs. O Gemini 3.7 Flash aceita texto, imagens, vídeo, áudio e PDF no mesmo array contents em um único endpoint. Claude e GPT lidam bem com texto e imagens, mas as cargas de trabalho de vídeo e áudio geralmente são roteadas por etapas separadas de transcrição ou pré-processamento antes que o texto chegue ao modelo.
Se o seu produto lida com documentos, o salto do GDP.pdf de 22,0% para 34,0% é o sinal relevante: esse benchmark mede o raciocínio sobre PDFs do mundo real com tabelas, digitalizações e layouts quebrados. Alimentar um contrato ou uma fatura diretamente no modelo sem um pipeline de OCR remove uma etapa inteira propensa a falhas da sua arquitetura.
A regra prática: para chat de texto e imagem, a modalidade é indiferente. Para quadros de vídeo, gravações de chamadas ou pilhas de documentos, o Gemini é o único dos três em que o pipeline de entrada se resume a uma única chamada de API.
Filosofia de precificação
Os três fornecedores estão executando diferentes estratégias de precificação, e a diferença informa para quem cada modelo é destinado.
O Google precifica o 3.7 Flash para conquistar mercado. A taxa introdutória de US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída se mantém até 31 de dezembro de 2026, e é metade do que o 3.6 Flash custou no lançamento. Em 1º de janeiro de 2027, a taxa padrão assume a US$ 1,50 e US$ 7,50, um limpo 2x. Esse prazo é um fator determinante: o Google quer seu tráfego comprometido antes que o preço seja redefinido. A matemática completa dos tokens, com exemplos detalhados para chatbots e loops de agente, está em nossa análise de preços do Gemini 3.7 Flash.
Anthropic e OpenAI precificam seus modelos carro-chefe como capacidades premium. As taxas variam por nível e mudam frequentemente, mas o formato é consistente: os tokens de saída de ponta custam várias vezes o que o Flash cobra, e ambos os fornecedores vendem o premium com base em menos execuções com falha, não em tokens mais baratos. A Anthropic adiciona um parâmetro de esforço que troca custo por capacidade dentro de um modelo; a OpenAI segmenta por tamanhos de modelo.
Qual filosofia vence depende da sua economia de falhas. Um modelo barato que falha em uma tarefa gera trabalho de reparo custando mais do que os tokens economizados; um modelo premium ganha sua taxa apenas quando evita essas falhas. Compare o custo por tarefa concluída, não o custo por token, e reprecifique após 1º de janeiro de 2027, quando as taxas do Gemini dobram.
Ergonomia da API
As diferenças de esquema são o custo que você paga ao trocar de provedor ou rotear entre eles. Aqui está a mesma requisição de uma única volta nos três formatos.
A API Gemini do Google agrupa as "turns" em contents com parts, e as configurações de geração ficam em generationConfig:
{
"contents": [
{ "role": "user", "parts": [{ "text": "Summarize this changelog." }] }
],
"generationConfig": { "temperature": 0.3, "maxOutputTokens": 1024 }
}
A API Messages da Anthropic coloca o modelo e um max_tokens obrigatório no nível superior, com o prompt de sistema como seu próprio campo:
{
"model": "claude-fable-5",
"max_tokens": 1024,
"system": "You summarize changelogs in three bullets.",
"messages": [{ "role": "user", "content": "Summarize this changelog." }]
}
A OpenAI incorpora o prompt de sistema no próprio array messages:
{
"model": "gpt-5.6-sol",
"messages": [
{ "role": "system", "content": "You summarize changelogs in three bullets." },
{ "role": "user", "content": "Summarize this changelog." }
]
}
O caso de texto parece próximo o suficiente para ser resolvido com um adaptador. O uso de ferramentas é onde a abstração vaza: o Google declara funções em um array tools com functionDeclarations e controla a invocação através de toolConfig, a Anthropic usa seu próprio esquema de ferramentas com diferentes blocos de resposta, e a OpenAI tem seu próprio formato de função novamente. As formas de chunk de streaming também diferem, mesmo que todos os três usem eventos enviados pelo servidor. Gateways e endpoints de compatibilidade normalizam a forma básica de chat, mas partes multimodais e chamadas de ferramentas raramente sobrevivem à tradução de forma limpa; documentamos o mesmo problema entre fornecedores na comparação de formatos de API para DeepSeek V4 Pro.
O conselho de integração é pouco glamoroso: mantenha uma fina camada de provedor entre seu produto e o modelo. Equipes que fazem isso trocam de provedor em dias, em vez de trimestres.
Quando escolher cada um
Benchmarks e esquemas condensados em uma lista de decisões:
- Escolha Gemini 3.7 Flash para tráfego de agentes de alto volume, pipelines multimodais que ingerem vídeo, áudio ou PDFs, e qualquer carga de trabalho onde o custo por chamada limite a margem do produto. Também é a sandbox óbvia para experimentos de uso de computador; nossa análise de uso de computador versus APIs estruturadas aborda quando essa capacidade se justifica.
- Escolha Claude Fable 5 para trabalho autônomo de longo prazo: sessões de agente de várias horas, tarefas onde uma etapa que falha desperdiça uma hora de progresso, e cargas de trabalho que recompensam o dial de custo-capacidade do parâmetro de esforço.
- Escolha GPT-5.6 Sol para agentes de codificação em escala de repositório que operam em grandes bases de código existentes com supervisão mínima, e para equipes que desejam o ecossistema de terceiros mais profundo em torno da API.
- Escolha um roteador, se puder. O padrão em que a maioria das equipes de produção converge: um modelo padrão barato lida com a maior parte do tráfego, e os 10% mais difíceis escalam para um modelo de ponta. Os números de lançamento do Gemini 3.7 Flash o tornam um padrão credível nessa arquitetura, o que não era verdade para o 3.6 Flash.
Teste todos os três provedores em um único espaço de trabalho Apidog
A comparação que importa é aquela que você executa com seus próprios prompts. O Apidog mantém coleções para Google, Anthropic e OpenAI em um único projeto, então o comparativo leva uma tarde em vez de um sprint:
- Crie três ambientes, um por provedor, cada um com sua própria URL base e cabeçalho de autenticação:
x-goog-api-keypara Gemini,x-api-keypara Anthropic, um Token de Portador para OpenAI. Trocar de provedor se torna uma seleção em lista suspensa, não uma alteração de código. - Reúna 20 prompts reais do seu produto. Inclua seu prompt de sistema, suas definições de ferramenta se você usa chamada de função, e pelo menos cinco casos notoriamente difíceis.
- Adicione asserções para o que lhe interessa: validade da resposta, contagem de tokens do bloco de uso de cada provedor, limites de latência. Para cargas de trabalho de chamada de ferramentas, afirme que o JSON da chamada de ferramenta é analisável e corresponde ao seu esquema; os modelos falham mais nisso do que na prosa.
- Execute cada suíte três vezes por modelo. A saída de LLMs varia; três execuções expõem a variância que uma única demonstração esconde. Compare a taxa de sucesso e o custo por tarefa bem-sucedida.
- Mantenha a suíte. Os lançamentos de modelos agora ocorrem com semanas de diferença; o 3.7 Flash seguiu o 3.6 em três semanas. Equipes com uma estrutura de teste permanente decidem novamente em uma tarde, em vez de por anedotas.
FAQ
O Gemini 3.7 Flash é melhor que o Claude ou GPT para codificação?
Não no topo. O GPT-5.6 Sol Max registrou 73,0% no DeepSWE v1.1 contra 65,3% do 3.7 Flash, e o Claude Fable 5 lidera em consistência em benchmarks de codificação e agente. O que mudou é a relação preço-pontuação: o 3.7 Flash atinge pontuações que estavam em território de fronteira semanas atrás, cobrando taxas de modelo de força de trabalho.
Quanto mais barato é o Gemini 3.7 Flash do que o Claude ou GPT?
Até 31 de dezembro de 2026, o Gemini 3.7 Flash custa US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída. Os modelos Claude e GPT de fronteira cobram várias vezes mais por token; verifique as páginas de preços ao vivo antes de modelar os custos. Lembre-se que a taxa introdutória dobra em 1º de janeiro de 2027.
Posso chamar o Gemini 3.7 Flash através do SDK da OpenAI?
O Google expõe um endpoint compatível com OpenAI que lida com o formato básico de chat, então uma troca de base_url funciona para entrada de texto, saída de texto. Partes multimodais e chamadas de ferramentas não são mapeadas de forma limpa, então use o esquema nativo contents para qualquer coisa além do chat simples. O tutorial de chamada de função para Gemini 3.7 Flash mostra o formato de ferramenta nativo de ponta a ponta.
O Gemini 3.7 Flash suporta uso de computador e busca com fundamentação?
Sim. Ele vem com chamada de função, pesquisa como ferramenta e uso de computador, além de guardrails atualizados de segurança CBRN e cibernética. A melhoria do AutomationBench de 17,0% para 30,4% é o proxy publicado mais próximo de quão melhor o loop de agenticidade se tornou.
Onde o Gemini 3.7 Flash está disponível?
A API Gemini com uma chave AI Studio, Google AI Studio, o aplicativo Gemini, Gemini Spark para assinantes AI Pro e Ultra, Google Antigravity, Android Studio e Gemini Enterprise, em mais de 160 países. Equipes de produção GCP podem chamá-lo através do Vertex AI com OAuth em vez de uma chave de API.
Onde o 3.7 Flash se encaixa na sua pilha
A conclusão errada desta comparação é “o Gemini alcançou a fronteira”. Não o fez; Sol ainda domina a profundidade de codificação em escala de repositório e Fable 5 ainda domina a confiabilidade de longo prazo. A conclusão correta é que o patamar subiu: preços de modelo de força de trabalho agora compram pontuações que justificavam taxas premium há um trimestre, o que redefine o padrão em qualquer arquitetura de roteador. Modelos da classe Flash lidam com o grosso, modelos carro-chefe lidam com as escaladas.
A decisão é mensurável, então meça-a. Conecte todos os três provedores em um único espaço de trabalho, execute seus prompts reais com asserções e deixe o custo por tarefa concluída escolher o vencedor. Baixe o Apidog gratuitamente, configure os três ambientes e você terá evidências em nível de provedor antes que a janela de preços introdutórios se feche.

