Gemini 4 Argon Benchmarks: Todos os 19 Resultados, Como o Google os Executou e os 5 que Perde

Benchmarks do Gemini 4 Argon: todas as 19 linhas com quem mediu cada um, os 5 que ele perde, as ressalvas sobre a metodologia do Google, e as pontuações de AA, Vals e Arena.

INEZA Felin-Michel

INEZA Felin-Michel

2 outubro 2026

Gemini 4 Argon Benchmarks: Todos os 19 Resultados, Como o Google os Executou e os 5 que Perde

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

O Gemini 4 Argon lidera 13 das 19 linhas na tabela de lançamento do Google, empata em 1 (CWE-bench v1, com GPT-6 Astra) e fica atrás em 5: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 e OSWorld-2.0. O problema é o acesso. O Argon está disponível hoje apenas para defensores do Fairwind Program, então ninguém fora da lista de parceiros do Google e de algumas organizações de benchmark pode recalcular esses números ainda.

Abaixo: a tabela completa com quem mediu cada linha, as cinco perdas, as letras miúdas, as pontuações cibernéticas, placares de terceiros e como construir sua própria avaliação no Apidog antes que o acesso seja liberado. Para a visão geral do modelo, comece com o que é o Gemini 4 Argon. Para a decisão de compra, veja Argon vs GPT-6 Astra vs Claude Opus 5.5.

A tabela completa, com quem mediu cada linha

Estes são os resultados relatados pelo Google da postagem de lançamento e do PDF da metodologia de avaliação, que é intitulado "resultados a partir de outubro de 2026". O Google calculou 10 das 19 pontuações do Argon; as outras 9 vêm de placares públicos. Os números dos rivais vêm desses placares, das próprias execuções do Google ou dos cartões de sistema e posts de blog dos fornecedores, e os harnesses (estruturas de teste) diferem por linha. O negrito marca o líder da linha.

Benchmark Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 Quem mediu
Vals Index 68.9% 63.1% 65.8% 67.0% Vals AI
AutomationBench 51.3% 41.4% 31.4% 42.5% Placar Zapier (conjunto privado)
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6% Vals AI
Harvey Legal Agent 19.6% 5.4% 6.7% 3.8% Vals AI
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2% Argon auto-calculado; placar Astra; cartões de sistema Anthropic
FrontierSWE v2 55.0% 65.5% 56.3% 62.3% Placar Proximal
Vibe Code Bench 91.9% 89.6% 90.3% 90.3% Vals AI
Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4% Argon auto-calculado; placar dos rivais
PostTrainBench 45.3% 44.3% 40.2% 49.3% Auto-calculado para todos os modelos
Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3% Argon auto-calculado; placar dos rivais
LABBench 2 88.8% 85.4% 68.6% 73.1% Auto-calculado para todos os modelos
RiemannBench 76.0% 72.0% 65.6% 69.6% Placar Surge
GraphWalks até 128K 99.7% 98.7% 91.4% 90.6% Auto-calculado para todos os modelos
GraphWalks 256K a 1M 84.2% 71.8% 65.0% 66.8% Auto-calculado para todos os modelos
Agent’s Last Exam 39.5% 34.2% n/i 38.2% Argon auto-calculado; placar dos rivais
OSWorld-2.0 (offline) 69.2% 72.6% n/i n/i Argon auto-calculado; Astra do post de blog da OpenAI
Chartography 71.6% 71.0% 46.2% 66.3% Placar Surge
LVBench 91.7% 87.5% 79.7% 83.7% Auto-calculado para todos os modelos
CWE-bench v1 68.0% 68.0% 58.0% 67.0% Placar público

n/i = não informado. Grok 4.7, que não está na tabela do Google, também pontua 68% no placar CWE-bench, então esse empate é triplo.

Ordenadas por fonte, 9 linhas vêm de placares públicos para todos os modelos (Vals AI, Zapier, Proximal, Surge e CWE-bench). Argon lidera 7 dessas 9 e empata em 1. O Google executou 5 linhas para todos os quatro modelos, e Argon lidera 4. As outras 5 combinam uma pontuação Argon executada pelo Google com números rivais de outros lugares, e é aí que Argon mais perde: 3 de suas 5 perdas estão nessas linhas mistas. Se o auto-cálculo tivesse favorecido o Argon, seria de esperar o oposto.

Onde Argon fica atrás e por que isso é importante para a codificação com agentes

A codificação com agentes se divide em 2 a 2. Argon vence DeepSWE v1.1 e Vibe Code Bench, depois termina em último em FrontierSWE v2 e Terminal-bench 4.0. A vitória em DeepSWE mistura harnesses: Argon rodou em um harness de agente mini-swe, o número do Astra é do placar público, e os números do Claude são dos cartões de sistema. O Vibe Code Bench é mais claro, já que a Vals AI pontuou todos os quatro, mas a margem é de 1.6 pontos.

Se sua carga de trabalho envolve agentes pesados em terminal ou tarefas de repositório longas, pese essas duas últimas colocações acima da contagem principal. Astra mantém a liderança no FrontierSWE; nosso hands-on com GPT-6 Astra mostra como é usar esse modelo hoje. Pelo lado da Anthropic, a análise dos benchmarks do Claude Fable 5.1 cobre os números de lançamento do próprio Fable.

A Bloomberg relata que funcionários anônimos do Google com acesso dizem que o Argon decepciona em alguns trabalhos de codificação e design de front-end em relação às suas pontuações de benchmark. O Google classificou essa caracterização como imprecisa.

Ressalvas metodológicas que mudam como você lê a tabela

As linhas de cyber da página de cyber da DeepMind

A página de cyber da DeepMind adiciona quatro pontuações além da tabela de lançamento:

Avaliação Cyber Gemini 4 Argon Comparação
Descoberta de vulnerabilidade no mundo real 85.8% Gemini 3.8 Flash Cyber 71.0%
Wiz Penetration Test Benchmark 70.9% Gemini 3.8 Flash Cyber 58.2%
Sucesso de ataque IPI do Gray Swan (k=15, menor é melhor) 0.7% O mais baixo no gráfico; Kimi K3 o mais alto com 52.7%
CWE-bench v1 68% Empate triplo com Grok 4.7 e GPT-6 Astra; Opus 5.5 com 67%

A avaliação de vulnerabilidade usou um harness interno Antigravity "que não é especializado em cyber", com acesso ao código-fonte. O teste Wiz dá ao modelo "acesso apenas ao site em execução e seu comportamento público, sem o código-fonte do aplicativo". Ambas as comparações principais são contra o modelo cyber anterior do Google, não contra os rivais. Nosso explicador da defesa cibernética do Argon cobre o que isso significa para as APIs que você executa.

Placares de terceiros

Essas organizações publicaram pontuações minutos após o lançamento, então tiveram acesso pré-lançamento.

Por que os veículos publicam 12, 13 e 14 vitórias

Os veículos imprimiram três contagens diferentes de vitórias. Aqui está a recontagem das 19 linhas do Google:

Contado contra Vitórias Argon Empates Perdas Argon Não informado
Melhor dos três rivais 13 1 5 0
Apenas GPT-6 Astra 14 1 4 0
Apenas Claude Opus 5.5 14 0 4 1
Apenas Claude Fable 5.1 15 0 2 2

Um 13 está correto contra todo o campo. Um 14 está correto frente a frente contra Astra ou Opus 5.5. Um 12 não corresponde a nenhuma dessas enquadramentos das 19 linhas completas, então verifique quais linhas essa fonte contou. As margens também variam: Harvey Legal Agent (19.6% contra 6.7%) é ampla; Chartography é 0.6 pontos.

Como executar sua própria avaliação no dia em que o acesso for liberado

Benchmarks descrevem a estrutura do Google; seus prompts descrevem seu produto. Construa a avaliação hoje em um modelo que você possa chamar, então aponte-a para o Argon com uma única mudança.

  1. Escolha prompts reais que correspondam às linhas que lhe interessam: uma correção de repositório, uma tarefa de terminal, uma pergunta de documento longo.
  2. No Apidog, crie um ambiente com `GEMINI_API_KEY` e `GEMINI_MODEL` definidos para `gemini-3.8-flash`. O Google não publicou o ID do modelo Argon, então essa variável é o único valor que você mudará.
  3. Salve cada prompt como uma requisição que lê o modelo de `{{GEMINI_MODEL}}`, agrupada em um cenário de teste.
  4. Adicione asserções na saída (status, campos obrigatórios, conteúdo esperado) e em `usageMetadata`, incluindo um limite em `thoughtsTokenCount` dimensionado para o seu teto de custo.
  5. Execute o cenário no 3.8 Flash agora e guarde o relatório como sua linha de base.

No dia em que o ID do Argon for lançado, troque a variável e execute novamente. O Google diz que "todos os novos modelos" serão lançados na API Interactions, então salve uma versão Interactions de cada requisição também. Nossa comparação entre Argon e Gemini 3.8 Flash aborda o que esperar em termos de preço e limites.

FAQ

Os benchmarks do Gemini 4 Argon são verificados independentemente? Parcialmente. Nove das 19 linhas vêm de placares públicos para todos os modelos, e Artificial Analysis, Vals AI e Arena publicaram seus próprios resultados. O restante é executado pelo Google para o Argon.

Qual é a pontuação DeepSWE do Gemini 4 Argon? 77.9% no DeepSWE v1.1, à frente de Opus 5.5 (74.2%) e Astra (74.1%). A execução do Argon usou um harness de agente mini-swe, enquanto os números dos rivais vêm de um placar e cartões de sistema.

Argon supera o GPT-6 Astra em benchmarks? Frente a frente na tabela do Google, Argon vence 14 linhas, empata em 1 e perde 4. Na Artificial Analysis, eles empatam em 53.

Posso executar esses benchmarks novamente por conta própria? Ainda não. O Argon está limitado aos parceiros do Fairwind, e o Google não divulgou uma data de lançamento pública; nosso rastreador de data de lançamento do Argon acompanha a implementação.

Próximo passo

Construa o cenário agora, execute-o no 3.8 Flash e guarde o relatório. Quando o Argon for liberado, você terá seus próprios números minutos após a troca. Baixe o Apidog para configurá-lo.

button

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs