Gemini 4 Argon Benchmarks: Todas las 19 pruebas, cómo Google las ejecutó y las 5 en las que pierde

Benchmarks de Gemini 4 Argon: todas las 19 filas con quién midió cada una, los 5 que pierde, las salvedades sobre la metodología de Google, y las puntuaciones de AA, Vals y Arena.

INEZA Felin-Michel

INEZA Felin-Michel

2 October 2026

Gemini 4 Argon Benchmarks: Todas las 19 pruebas, cómo Google las ejecutó y las 5 en las que pierde

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Gemini 4 Argon lidera 13 de las 19 filas de la tabla de lanzamiento de Google, empata en 1 (CWE-bench v1, con GPT-6 Astra) y queda por detrás en 5: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 y OSWorld-2.0. El problema es el acceso. Argon está disponible hoy solo para los defensores del programa Fairwind, por lo que nadie fuera de la lista de socios de Google y unas pocas organizaciones de evaluación comparativa puede volver a ejecutar estos números todavía.

Abajo: la tabla completa con quién midió cada fila, las cinco pérdidas, la letra pequeña, las puntuaciones cibernéticas, los marcadores de terceros y cómo construir su propia evaluación en Apidog antes de que se abra el acceso. Para una descripción general del modelo, comience con qué es Gemini 4 Argon. Para la decisión de compra, consulte Argon vs GPT-6 Astra vs Claude Opus 5.5.

La tabla completa, con quién midió cada fila

Estos son los resultados informados por Google de la publicación de lanzamiento y el PDF de metodología de evaluación, que lleva el encabezado "resultados a octubre de 2026". Google calculó 10 de las 19 puntuaciones de Argon; las otras 9 provienen de tablas de clasificación públicas. Los números de los rivales provienen de esas tablas de clasificación, de las propias ejecuciones de Google o de las tarjetas del sistema y las publicaciones de blog de los proveedores, y los arneses difieren por fila. El texto en negrita marca al líder de la fila.

Benchmark Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 Quién lo midió
Vals Index 68.9% 63.1% 65.8% 67.0% Vals AI
AutomationBench 51.3% 41.4% 31.4% 42.5% Tabla de clasificación de Zapier (conjunto privado)
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6% Vals AI
Harvey Legal Agent 19.6% 5.4% 6.7% 3.8% Vals AI
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2% Argon autocalculado; tabla de clasificación de Astra; tarjetas del sistema Anthropic
FrontierSWE v2 55.0% 65.5% 56.3% 62.3% Tabla de clasificación de Proximal
Vibe Code Bench 91.9% 89.6% 90.3% 90.3% Vals AI
Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4% Argon autocalculado; tabla de clasificación de rivales
PostTrainBench 45.3% 44.3% 40.2% 49.3% Autocalculado para todos los modelos
Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3% Argon autocalculado; tabla de clasificación de rivales
LABBench 2 88.8% 85.4% 68.6% 73.1% Autocalculado para todos los modelos
RiemannBench 76.0% 72.0% 65.6% 69.6% Tabla de clasificación de Surge
GraphWalks hasta 128K 99.7% 98.7% 91.4% 90.6% Autocalculado para todos los modelos
GraphWalks 256K a 1M 84.2% 71.8% 65.0% 66.8% Autocalculado para todos los modelos
Agent’s Last Exam 39.5% 34.2% n/i 38.2% Argon autocalculado; tabla de clasificación de rivales
OSWorld-2.0 (sin conexión) 69.2% 72.6% n/i n/i Argon autocalculado; Astra del blog de OpenAI
Chartography 71.6% 71.0% 46.2% 66.3% Tabla de clasificación de Surge
LVBench 91.7% 87.5% 79.7% 83.7% Autocalculado para todos los modelos
CWE-bench v1 68.0% 68.0% 58.0% 67.0% Tabla de clasificación pública

n/i = no informado. Grok 4.7, que no está en la tabla de Google, también obtiene un 68% en la tabla de clasificación de CWE-bench, por lo que ese empate es a tres bandas.

Ordenado por fuente, 9 filas provienen de tablas de clasificación públicas para cada modelo (Vals AI, Zapier, Proximal, Surge y CWE-bench). Argon lidera 7 de esas 9 y empata en 1. Google ejecutó 5 filas por sí mismo para los cuatro modelos, y Argon lidera 4. Las otras 5 combinan una puntuación de Argon ejecutada por Google con números rivales de otros lugares, y ahí es donde Argon pierde más: 3 de sus 5 pérdidas se encuentran en esas filas mixtas. Si la autocalculación favoreciera a Argon, cabría esperar lo contrario.

Donde Argon se queda atrás y por qué es importante para la codificación agencial

La codificación agencial se divide en 2 a 2. Argon gana DeepSWE v1.1 y Vibe Code Bench, luego termina último en FrontierSWE v2 y Terminal-bench 4.0. La victoria de DeepSWE mezcla arneses: Argon se ejecutó en un arnés de agente mini-swe, el número de Astra es de la tabla de clasificación pública y los números de Claude son de las tarjetas del sistema. Vibe Code Bench es más limpio, ya que Vals AI puntuó los cuatro, pero el margen es de 1.6 puntos.

Si su carga de trabajo son agentes pesados en la terminal o tareas de repositorio largas, considere esas dos filas de último lugar por encima del recuento principal. Astra mantiene la ventaja en FrontierSWE; nuestro hands-on de GPT-6 Astra muestra cómo es usar ese modelo hoy. Por el lado de Anthropic, el desglose de benchmarks de Claude Fable 5.1 cubre los números de lanzamiento de Fable.

Bloomberg informa que empleados anónimos de Google con acceso dicen que Argon decepciona en algunos trabajos de codificación y diseño de interfaz en relación con sus puntuaciones de referencia. Google calificó esa caracterización de inexacta.

Advertencias metodológicas que cambian cómo se lee la tabla

Las filas cibernéticas de la página cibernética de DeepMind

La página cibernética de DeepMind añade cuatro puntuaciones más allá de la tabla de lanzamiento:

Evaluación cibernética Gemini 4 Argon Comparación
Descubrimiento de vulnerabilidades en el mundo real 85.8% Gemini 3.8 Flash Cyber 71.0%
Wiz Penetration Test Benchmark 70.9% Gemini 3.8 Flash Cyber 58.2%
Éxito del ataque IPI de Gray Swan (k=15, cuanto más bajo, mejor) 0.7% El más bajo de la tabla; Kimi K3 el más alto con 52.7%
CWE-bench v1 68% Triple empate con Grok 4.7 y GPT-6 Astra; Opus 5.5 con 67%

La evaluación de vulnerabilidades utilizó un arnés interno de Antigravity "que no está especializado en ciberseguridad", con acceso a la fuente. La prueba Wiz le da al modelo "acceso solo al sitio web en ejecución y su comportamiento público, sin el código fuente de la aplicación". Ambas comparaciones principales son contra el modelo cibernético anterior de Google, no contra rivales. Nuestro explicador de defensa cibernética de Argon cubre lo que esto significa para las API que ejecuta.

Marcadores de terceros

Estas organizaciones publicaron puntuaciones minutos después del lanzamiento, por lo que tuvieron acceso previo al lanzamiento.

Por qué los medios publican 12, 13 y 14 victorias

Los medios han publicado tres recuentos de victorias diferentes. Aquí está el recuento de las 19 filas de Google:

Comparado con Victorias de Argon Empates Pérdidas de Argon No informado
Mejor de los tres rivales 13 1 5 0
Solo GPT-6 Astra 14 1 4 0
Solo Claude Opus 5.5 14 0 4 1
Solo Claude Fable 5.1 15 0 2 2

Un 13 es correcto contra todo el campo. Un 14 es correcto en un enfrentamiento directo contra Astra u Opus 5.5. Un 12 no coincide con ninguno de estos encuadres de las 19 filas completas, así que verifique qué filas contó esa fuente. Los márgenes también varían: Harvey Legal Agent (19.6% frente a 6.7%) es amplio; Chartography es de 0.6 puntos.

Cómo ejecutar su propia evaluación el día en que se abra el acceso

Los benchmarks describen el arnés de Google; sus indicaciones describen su producto. Cree la evaluación hoy en un modelo al que pueda llamar, luego apúntela a Argon con un solo cambio.

  1. Elija indicaciones reales que coincidan con las filas que le interesan: una corrección de repositorio, una tarea de terminal, una pregunta de documento largo.
  2. En Apidog, cree un entorno con GEMINI_API_KEY y GEMINI_MODEL configurados como gemini-3.8-flash. Google no ha publicado la ID de modelo de Argon, por lo que esta variable es el único valor que cambiará.
  3. Guarde cada indicación como una solicitud que lee el modelo de {{GEMINI_MODEL}}, agrupada en un escenario de prueba.
  4. Agregue aserciones en la salida (estado, campos requeridos, contenido esperado) y en usageMetadata, incluyendo un límite en thoughtsTokenCount ajustado a su tope de costo.
  5. Ejecute el escenario en 3.8 Flash ahora y guarde el informe como su línea base.

El día en que se envíe la ID de Argon, cambie la variable y vuelva a ejecutar. Google dice que "todos los modelos nuevos" se lanzarán en la API de interacciones, así que guarde también una versión de interacciones de cada solicitud. Nuestra comparación de Argon vs Gemini 3.8 Flash cubre qué esperar en cuanto a precios y límites.

Preguntas frecuentes

¿Están verificados independientemente los benchmarks de Gemini 4 Argon? Parcialmente. Nueve de las 19 filas provienen de tablas de clasificación públicas para cada modelo, y Artificial Analysis, Vals AI y Arena publicaron sus propios resultados. El resto son ejecutados por Google para Argon.

¿Cuál es la puntuación DeepSWE de Gemini 4 Argon? 77.9% en DeepSWE v1.1, por delante de Opus 5.5 (74.2%) y Astra (74.1%). La ejecución de Argon utilizó un arnés de agente mini-swe, mientras que los números de los rivales provienen de una tabla de clasificación y tarjetas de sistema.

¿Argon supera a GPT-6 Astra en los benchmarks? En un enfrentamiento directo en la tabla de Google, Argon gana 14 filas, empata 1 y pierde 4. En Artificial Analysis empatan en 53.

¿Puedo volver a ejecutar estos benchmarks yo mismo? Todavía no. Argon está limitado a los socios de Fairwind, y Google no ha dado una fecha de lanzamiento pública; nuestro rastreador de fechas de lanzamiento de Argon sigue el despliegue.

Siguiente paso

Cree el escenario ahora, ejecútelo en 3.8 Flash y guarde el informe. Cuando Argon se abra, tendrá sus propios números minutos después del cambio. Descargue Apidog para configurarlo.

button

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs