O Gemini 4 Argon lidera 13 das 19 linhas na tabela de lançamento do Google, empata em 1 (CWE-bench v1, com GPT-6 Astra) e fica atrás em 5: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 e OSWorld-2.0. O problema é o acesso. O Argon está disponível hoje apenas para defensores do Fairwind Program, então ninguém fora da lista de parceiros do Google e de algumas organizações de benchmark pode recalcular esses números ainda.
Abaixo: a tabela completa com quem mediu cada linha, as cinco perdas, as letras miúdas, as pontuações cibernéticas, placares de terceiros e como construir sua própria avaliação no Apidog antes que o acesso seja liberado. Para a visão geral do modelo, comece com o que é o Gemini 4 Argon. Para a decisão de compra, veja Argon vs GPT-6 Astra vs Claude Opus 5.5.
A tabela completa, com quem mediu cada linha
Estes são os resultados relatados pelo Google da postagem de lançamento e do PDF da metodologia de avaliação, que é intitulado "resultados a partir de outubro de 2026". O Google calculou 10 das 19 pontuações do Argon; as outras 9 vêm de placares públicos. Os números dos rivais vêm desses placares, das próprias execuções do Google ou dos cartões de sistema e posts de blog dos fornecedores, e os harnesses (estruturas de teste) diferem por linha. O negrito marca o líder da linha.
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | Quem mediu |
|---|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% | Vals AI |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | Placar Zapier (conjunto privado) |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Vals AI |
| Harvey Legal Agent | 19.6% | 5.4% | 6.7% | 3.8% | Vals AI |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% | Argon auto-calculado; placar Astra; cartões de sistema Anthropic |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | Placar Proximal |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | Vals AI |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | Argon auto-calculado; placar dos rivais |
| PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% | Auto-calculado para todos os modelos |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | Argon auto-calculado; placar dos rivais |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | Auto-calculado para todos os modelos |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | Placar Surge |
| GraphWalks até 128K | 99.7% | 98.7% | 91.4% | 90.6% | Auto-calculado para todos os modelos |
| GraphWalks 256K a 1M | 84.2% | 71.8% | 65.0% | 66.8% | Auto-calculado para todos os modelos |
| Agent’s Last Exam | 39.5% | 34.2% | n/i | 38.2% | Argon auto-calculado; placar dos rivais |
| OSWorld-2.0 (offline) | 69.2% | 72.6% | n/i | n/i | Argon auto-calculado; Astra do post de blog da OpenAI |
| Chartography | 71.6% | 71.0% | 46.2% | 66.3% | Placar Surge |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | Auto-calculado para todos os modelos |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% | Placar público |
n/i = não informado. Grok 4.7, que não está na tabela do Google, também pontua 68% no placar CWE-bench, então esse empate é triplo.
Ordenadas por fonte, 9 linhas vêm de placares públicos para todos os modelos (Vals AI, Zapier, Proximal, Surge e CWE-bench). Argon lidera 7 dessas 9 e empata em 1. O Google executou 5 linhas para todos os quatro modelos, e Argon lidera 4. As outras 5 combinam uma pontuação Argon executada pelo Google com números rivais de outros lugares, e é aí que Argon mais perde: 3 de suas 5 perdas estão nessas linhas mistas. Se o auto-cálculo tivesse favorecido o Argon, seria de esperar o oposto.
Onde Argon fica atrás e por que isso é importante para a codificação com agentes
- FrontierSWE v2: 55.0% contra 65.5% do Astra. Argon é o último de quatro, atrás de Fable 5.1 (56.3%) e Opus 5.5 (62.3%), em um placar que avaliou todos os modelos.
- Terminal-bench 4.0: 57.4% contra 66.4% do Opus 5.5. Último novamente, embora Astra e Fable 5.1 estejam a um ponto.
- PostTrainBench: 45.3% contra 49.3% do Opus 5.5. Segundo lugar, em uma linha que o Google executou para todos os modelos.
- Terminal-Bench Science 0.1: 57.6% contra 68.1% do Astra. Terceiro, apenas à frente de Fable 5.1. O Google executou a tentativa do Argon com um tempo limite de verificador de 6x.
- OSWorld-2.0 (subconjunto offline): 69.2% contra 72.6% do Astra. A Anthropic relata apenas uma pontuação combinada online e offline, então nenhum modelo Claude aparece.
A codificação com agentes se divide em 2 a 2. Argon vence DeepSWE v1.1 e Vibe Code Bench, depois termina em último em FrontierSWE v2 e Terminal-bench 4.0. A vitória em DeepSWE mistura harnesses: Argon rodou em um harness de agente mini-swe, o número do Astra é do placar público, e os números do Claude são dos cartões de sistema. O Vibe Code Bench é mais claro, já que a Vals AI pontuou todos os quatro, mas a margem é de 1.6 pontos.
Se sua carga de trabalho envolve agentes pesados em terminal ou tarefas de repositório longas, pese essas duas últimas colocações acima da contagem principal. Astra mantém a liderança no FrontierSWE; nosso hands-on com GPT-6 Astra mostra como é usar esse modelo hoje. Pelo lado da Anthropic, a análise dos benchmarks do Claude Fable 5.1 cobre os números de lançamento do próprio Fable.
A Bloomberg relata que funcionários anônimos do Google com acesso dizem que o Argon decepciona em alguns trabalhos de codificação e design de front-end em relação às suas pontuações de benchmark. O Google classificou essa caracterização como imprecisa.
Ressalvas metodológicas que mudam como você lê a tabela
- Esforço máximo de ambos os lados. Argon rodou "com a API Gemini com as configurações de raciocínio mais elevadas". Para Astra, Fable 5.1 e Opus 5.5, o Google usa as "configurações máximas de raciocínio/pensamento disponíveis". Isso compara os limites, não o comportamento padrão ou o custo.
- Frames LVBench. O Google executou o LVBench para todos os quatro modelos, sem ferramentas. O Gemini amostrou vídeo a 1 FPS. Astra obteve 800 frames, Fable 5.1 obteve 300 e Opus 5.5 obteve 600, "devido a limitações da API". Os modelos não viram as mesmas entradas.
- OSWorld o melhor de três. A pontuação do Argon é "maximizada em 3 execuções com uma única tentativa por execução", a melhor execução em vez de uma média.
- Janela de Last Exam do Agente. Argon rodou no harness ALE-Claw com uma janela de 5 horas.
- Filtros de segurança ativados. O Last Exam do Agente e o OSWorld rodaram com filtros de segurança ativados, e as respostas sinalizadas vieram como strings vazias. Se algo, isso funciona contra o Argon.
As linhas de cyber da página de cyber da DeepMind
A página de cyber da DeepMind adiciona quatro pontuações além da tabela de lançamento:
| Avaliação Cyber | Gemini 4 Argon | Comparação |
|---|---|---|
| Descoberta de vulnerabilidade no mundo real | 85.8% | Gemini 3.8 Flash Cyber 71.0% |
| Wiz Penetration Test Benchmark | 70.9% | Gemini 3.8 Flash Cyber 58.2% |
| Sucesso de ataque IPI do Gray Swan (k=15, menor é melhor) | 0.7% | O mais baixo no gráfico; Kimi K3 o mais alto com 52.7% |
| CWE-bench v1 | 68% | Empate triplo com Grok 4.7 e GPT-6 Astra; Opus 5.5 com 67% |
A avaliação de vulnerabilidade usou um harness interno Antigravity "que não é especializado em cyber", com acesso ao código-fonte. O teste Wiz dá ao modelo "acesso apenas ao site em execução e seu comportamento público, sem o código-fonte do aplicativo". Ambas as comparações principais são contra o modelo cyber anterior do Google, não contra os rivais. Nosso explicador da defesa cibernética do Argon cobre o que isso significa para as APIs que você executa.
Placares de terceiros
Essas organizações publicaram pontuações minutos após o lançamento, então tiveram acesso pré-lançamento.
- A Artificial Analysis lista Gemini 4 Argon (Alto) com um Índice de Inteligência de 53, #8 de 223. Esse ranking conta cada configuração de raciocínio separadamente. Por modelo distinto, Argon empata com Fable 5.1 e GPT-6 Astra e fica atrás de Opus 5.5 (58 no máximo) e Sonnet 5.5 (56 no máximo). A AA relata uma taxa de alucinação de 15% em AA-Omniscience (Astra no máximo, 51%), com precisão de 50% contra 63%. A execução do índice custou US$ 1,99 por tarefa, com cerca de 62 mil tokens de saída por tarefa contra cerca de 27 mil para Astra no máximo. A Artificial Analysis não mostra dados de velocidade ou latência.
- A Vals AI coloca o Argon em 68,90% no Vals Index, #1 de 41 e o primeiro modelo Gemini a liderá-lo, a US$ 15,68 por teste. A Vals AI lista um máximo de 262K de saída para a configuração que testou, abaixo do 1M declarado pelo Google.
- A Arena classifica o Argon #1 em Texto com 1525, marcado como Preliminar em 4.942 votos, e #8 em WebDev.
Por que os veículos publicam 12, 13 e 14 vitórias
Os veículos imprimiram três contagens diferentes de vitórias. Aqui está a recontagem das 19 linhas do Google:
| Contado contra | Vitórias Argon | Empates | Perdas Argon | Não informado |
|---|---|---|---|---|
| Melhor dos três rivais | 13 | 1 | 5 | 0 |
| Apenas GPT-6 Astra | 14 | 1 | 4 | 0 |
| Apenas Claude Opus 5.5 | 14 | 0 | 4 | 1 |
| Apenas Claude Fable 5.1 | 15 | 0 | 2 | 2 |
Um 13 está correto contra todo o campo. Um 14 está correto frente a frente contra Astra ou Opus 5.5. Um 12 não corresponde a nenhuma dessas enquadramentos das 19 linhas completas, então verifique quais linhas essa fonte contou. As margens também variam: Harvey Legal Agent (19.6% contra 6.7%) é ampla; Chartography é 0.6 pontos.
Como executar sua própria avaliação no dia em que o acesso for liberado
Benchmarks descrevem a estrutura do Google; seus prompts descrevem seu produto. Construa a avaliação hoje em um modelo que você possa chamar, então aponte-a para o Argon com uma única mudança.
- Escolha prompts reais que correspondam às linhas que lhe interessam: uma correção de repositório, uma tarefa de terminal, uma pergunta de documento longo.
- No Apidog, crie um ambiente com `GEMINI_API_KEY` e `GEMINI_MODEL` definidos para `gemini-3.8-flash`. O Google não publicou o ID do modelo Argon, então essa variável é o único valor que você mudará.
- Salve cada prompt como uma requisição que lê o modelo de `{{GEMINI_MODEL}}`, agrupada em um cenário de teste.
- Adicione asserções na saída (status, campos obrigatórios, conteúdo esperado) e em `usageMetadata`, incluindo um limite em `thoughtsTokenCount` dimensionado para o seu teto de custo.
- Execute o cenário no 3.8 Flash agora e guarde o relatório como sua linha de base.
No dia em que o ID do Argon for lançado, troque a variável e execute novamente. O Google diz que "todos os novos modelos" serão lançados na API Interactions, então salve uma versão Interactions de cada requisição também. Nossa comparação entre Argon e Gemini 3.8 Flash aborda o que esperar em termos de preço e limites.
FAQ
Os benchmarks do Gemini 4 Argon são verificados independentemente? Parcialmente. Nove das 19 linhas vêm de placares públicos para todos os modelos, e Artificial Analysis, Vals AI e Arena publicaram seus próprios resultados. O restante é executado pelo Google para o Argon.
Qual é a pontuação DeepSWE do Gemini 4 Argon? 77.9% no DeepSWE v1.1, à frente de Opus 5.5 (74.2%) e Astra (74.1%). A execução do Argon usou um harness de agente mini-swe, enquanto os números dos rivais vêm de um placar e cartões de sistema.
Argon supera o GPT-6 Astra em benchmarks? Frente a frente na tabela do Google, Argon vence 14 linhas, empata em 1 e perde 4. Na Artificial Analysis, eles empatam em 53.
Posso executar esses benchmarks novamente por conta própria? Ainda não. O Argon está limitado aos parceiros do Fairwind, e o Google não divulgou uma data de lançamento pública; nosso rastreador de data de lançamento do Argon acompanha a implementação.
Próximo passo
Construa o cenário agora, execute-o no 3.8 Flash e guarde o relatório. Quando o Argon for liberado, você terá seus próprios números minutos após a troca. Baixe o Apidog para configurá-lo.
