Gemini 4 Argon lidera 13 de las 19 filas de la tabla de lanzamiento de Google, empata en 1 (CWE-bench v1, con GPT-6 Astra) y queda por detrás en 5: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 y OSWorld-2.0. El problema es el acceso. Argon está disponible hoy solo para los defensores del programa Fairwind, por lo que nadie fuera de la lista de socios de Google y unas pocas organizaciones de evaluación comparativa puede volver a ejecutar estos números todavía.
Abajo: la tabla completa con quién midió cada fila, las cinco pérdidas, la letra pequeña, las puntuaciones cibernéticas, los marcadores de terceros y cómo construir su propia evaluación en Apidog antes de que se abra el acceso. Para una descripción general del modelo, comience con qué es Gemini 4 Argon. Para la decisión de compra, consulte Argon vs GPT-6 Astra vs Claude Opus 5.5.
La tabla completa, con quién midió cada fila
Estos son los resultados informados por Google de la publicación de lanzamiento y el PDF de metodología de evaluación, que lleva el encabezado "resultados a octubre de 2026". Google calculó 10 de las 19 puntuaciones de Argon; las otras 9 provienen de tablas de clasificación públicas. Los números de los rivales provienen de esas tablas de clasificación, de las propias ejecuciones de Google o de las tarjetas del sistema y las publicaciones de blog de los proveedores, y los arneses difieren por fila. El texto en negrita marca al líder de la fila.
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | Quién lo midió |
|---|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% | Vals AI |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | Tabla de clasificación de Zapier (conjunto privado) |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Vals AI |
| Harvey Legal Agent | 19.6% | 5.4% | 6.7% | 3.8% | Vals AI |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% | Argon autocalculado; tabla de clasificación de Astra; tarjetas del sistema Anthropic |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | Tabla de clasificación de Proximal |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | Vals AI |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | Argon autocalculado; tabla de clasificación de rivales |
| PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% | Autocalculado para todos los modelos |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | Argon autocalculado; tabla de clasificación de rivales |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | Autocalculado para todos los modelos |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | Tabla de clasificación de Surge |
| GraphWalks hasta 128K | 99.7% | 98.7% | 91.4% | 90.6% | Autocalculado para todos los modelos |
| GraphWalks 256K a 1M | 84.2% | 71.8% | 65.0% | 66.8% | Autocalculado para todos los modelos |
| Agent’s Last Exam | 39.5% | 34.2% | n/i | 38.2% | Argon autocalculado; tabla de clasificación de rivales |
| OSWorld-2.0 (sin conexión) | 69.2% | 72.6% | n/i | n/i | Argon autocalculado; Astra del blog de OpenAI |
| Chartography | 71.6% | 71.0% | 46.2% | 66.3% | Tabla de clasificación de Surge |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | Autocalculado para todos los modelos |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% | Tabla de clasificación pública |
n/i = no informado. Grok 4.7, que no está en la tabla de Google, también obtiene un 68% en la tabla de clasificación de CWE-bench, por lo que ese empate es a tres bandas.
Ordenado por fuente, 9 filas provienen de tablas de clasificación públicas para cada modelo (Vals AI, Zapier, Proximal, Surge y CWE-bench). Argon lidera 7 de esas 9 y empata en 1. Google ejecutó 5 filas por sí mismo para los cuatro modelos, y Argon lidera 4. Las otras 5 combinan una puntuación de Argon ejecutada por Google con números rivales de otros lugares, y ahí es donde Argon pierde más: 3 de sus 5 pérdidas se encuentran en esas filas mixtas. Si la autocalculación favoreciera a Argon, cabría esperar lo contrario.
Donde Argon se queda atrás y por qué es importante para la codificación agencial
- FrontierSWE v2: 55.0% frente al 65.5% de Astra. Argon es el último de los cuatro, por detrás de Fable 5.1 (56.3%) y Opus 5.5 (62.3%), en una tabla de clasificación que puntuó a todos los modelos.
- Terminal-bench 4.0: 57.4% frente al 66.4% de Opus 5.5. Último de nuevo, aunque Astra y Fable 5.1 están a un punto.
- PostTrainBench: 45.3% frente al 49.3% de Opus 5.5. Segundo lugar, en una fila que Google ejecutó para todos los modelos.
- Terminal-Bench Science 0.1: 57.6% frente al 68.1% de Astra. Tercero, solo por delante de Fable 5.1. Google ejecutó el intento de Argon con un tiempo de espera del verificador de 6x.
- OSWorld-2.0 (subconjunto sin conexión): 69.2% frente al 72.6% de Astra. Anthropic solo informa una puntuación combinada en línea y sin conexión, por lo que no aparece ningún modelo de Claude.
La codificación agencial se divide en 2 a 2. Argon gana DeepSWE v1.1 y Vibe Code Bench, luego termina último en FrontierSWE v2 y Terminal-bench 4.0. La victoria de DeepSWE mezcla arneses: Argon se ejecutó en un arnés de agente mini-swe, el número de Astra es de la tabla de clasificación pública y los números de Claude son de las tarjetas del sistema. Vibe Code Bench es más limpio, ya que Vals AI puntuó los cuatro, pero el margen es de 1.6 puntos.
Si su carga de trabajo son agentes pesados en la terminal o tareas de repositorio largas, considere esas dos filas de último lugar por encima del recuento principal. Astra mantiene la ventaja en FrontierSWE; nuestro hands-on de GPT-6 Astra muestra cómo es usar ese modelo hoy. Por el lado de Anthropic, el desglose de benchmarks de Claude Fable 5.1 cubre los números de lanzamiento de Fable.
Bloomberg informa que empleados anónimos de Google con acceso dicen que Argon decepciona en algunos trabajos de codificación y diseño de interfaz en relación con sus puntuaciones de referencia. Google calificó esa caracterización de inexacta.
Advertencias metodológicas que cambian cómo se lee la tabla
- Máximo esfuerzo por ambas partes. Argon se ejecutó "con la API de Gemini con los ajustes de pensamiento más altos". Para Astra, Fable 5.1 y Opus 5.5, Google utiliza por defecto los "ajustes máximos de pensamiento/razonamiento disponibles". Esto compara los límites, no el comportamiento predeterminado o el costo.
- Marcos de LVBench. Google ejecutó LVBench por sí mismo para los cuatro modelos, sin herramientas. Gemini muestreó video a 1 FPS. Astra obtuvo 800 fotogramas, Fable 5.1 obtuvo 300 y Opus 5.5 obtuvo 600, "debido a limitaciones de la API". Los modelos no vieron las mismas entradas.
- OSWorld el mejor de tres. La puntuación de Argon es "el máximo de 3 ejecuciones con un solo intento por ejecución", la mejor ejecución en lugar de un promedio.
- Ventana de Agent’s Last Exam. Argon se ejecutó en el arnés ALE-Claw con una ventana de 5 horas.
- Filtros de seguridad activados. Agent’s Last Exam y OSWorld se ejecutaron con filtros de seguridad activados, y las respuestas marcadas se devolvieron como cadenas vacías. En todo caso, eso va en contra de Argon.
Las filas cibernéticas de la página cibernética de DeepMind
La página cibernética de DeepMind añade cuatro puntuaciones más allá de la tabla de lanzamiento:
| Evaluación cibernética | Gemini 4 Argon | Comparación |
|---|---|---|
| Descubrimiento de vulnerabilidades en el mundo real | 85.8% | Gemini 3.8 Flash Cyber 71.0% |
| Wiz Penetration Test Benchmark | 70.9% | Gemini 3.8 Flash Cyber 58.2% |
| Éxito del ataque IPI de Gray Swan (k=15, cuanto más bajo, mejor) | 0.7% | El más bajo de la tabla; Kimi K3 el más alto con 52.7% |
| CWE-bench v1 | 68% | Triple empate con Grok 4.7 y GPT-6 Astra; Opus 5.5 con 67% |
La evaluación de vulnerabilidades utilizó un arnés interno de Antigravity "que no está especializado en ciberseguridad", con acceso a la fuente. La prueba Wiz le da al modelo "acceso solo al sitio web en ejecución y su comportamiento público, sin el código fuente de la aplicación". Ambas comparaciones principales son contra el modelo cibernético anterior de Google, no contra rivales. Nuestro explicador de defensa cibernética de Argon cubre lo que esto significa para las API que ejecuta.
Marcadores de terceros
Estas organizaciones publicaron puntuaciones minutos después del lanzamiento, por lo que tuvieron acceso previo al lanzamiento.
- Artificial Analysis enumera a Gemini 4 Argon (Alto) con un Índice de Inteligencia de 53, #8 de 223. Esa clasificación cuenta cada configuración de razonamiento por separado. Por modelo distinto, Argon empata con Fable 5.1 y GPT-6 Astra y se sitúa por detrás de Opus 5.5 (58 en el máximo) y Sonnet 5.5 (56 en el máximo). AA informa una tasa de alucinaciones del 15% en AA-Omniscience (Astra en el máximo, 51%), con una precisión del 50% frente al 63%. La ejecución del índice costó $1.99 por tarea, con aproximadamente 62K tokens de salida por tarea frente a aproximadamente 27K para Astra en el máximo. Artificial Analysis no muestra datos de velocidad o latencia.
- Vals AI sitúa a Argon en el 68.90% en el Vals Index, #1 de 41 y el primer modelo Gemini en encabezarlo, a $15.68 por prueba. Vals AI enumera una salida máxima de 262K para la configuración que probó, por debajo de los 1M declarados por Google.
- Arena clasifica a Argon en el #1 en Texto con 1525, marcado como Preliminar en 4.942 votos, y en el #8 en WebDev.
Por qué los medios publican 12, 13 y 14 victorias
Los medios han publicado tres recuentos de victorias diferentes. Aquí está el recuento de las 19 filas de Google:
| Comparado con | Victorias de Argon | Empates | Pérdidas de Argon | No informado |
|---|---|---|---|---|
| Mejor de los tres rivales | 13 | 1 | 5 | 0 |
| Solo GPT-6 Astra | 14 | 1 | 4 | 0 |
| Solo Claude Opus 5.5 | 14 | 0 | 4 | 1 |
| Solo Claude Fable 5.1 | 15 | 0 | 2 | 2 |
Un 13 es correcto contra todo el campo. Un 14 es correcto en un enfrentamiento directo contra Astra u Opus 5.5. Un 12 no coincide con ninguno de estos encuadres de las 19 filas completas, así que verifique qué filas contó esa fuente. Los márgenes también varían: Harvey Legal Agent (19.6% frente a 6.7%) es amplio; Chartography es de 0.6 puntos.
Cómo ejecutar su propia evaluación el día en que se abra el acceso
Los benchmarks describen el arnés de Google; sus indicaciones describen su producto. Cree la evaluación hoy en un modelo al que pueda llamar, luego apúntela a Argon con un solo cambio.
- Elija indicaciones reales que coincidan con las filas que le interesan: una corrección de repositorio, una tarea de terminal, una pregunta de documento largo.
- En Apidog, cree un entorno con
GEMINI_API_KEYyGEMINI_MODELconfigurados comogemini-3.8-flash. Google no ha publicado la ID de modelo de Argon, por lo que esta variable es el único valor que cambiará. - Guarde cada indicación como una solicitud que lee el modelo de
{{GEMINI_MODEL}}, agrupada en un escenario de prueba. - Agregue aserciones en la salida (estado, campos requeridos, contenido esperado) y en
usageMetadata, incluyendo un límite enthoughtsTokenCountajustado a su tope de costo. - Ejecute el escenario en 3.8 Flash ahora y guarde el informe como su línea base.
El día en que se envíe la ID de Argon, cambie la variable y vuelva a ejecutar. Google dice que "todos los modelos nuevos" se lanzarán en la API de interacciones, así que guarde también una versión de interacciones de cada solicitud. Nuestra comparación de Argon vs Gemini 3.8 Flash cubre qué esperar en cuanto a precios y límites.
Preguntas frecuentes
¿Están verificados independientemente los benchmarks de Gemini 4 Argon? Parcialmente. Nueve de las 19 filas provienen de tablas de clasificación públicas para cada modelo, y Artificial Analysis, Vals AI y Arena publicaron sus propios resultados. El resto son ejecutados por Google para Argon.
¿Cuál es la puntuación DeepSWE de Gemini 4 Argon? 77.9% en DeepSWE v1.1, por delante de Opus 5.5 (74.2%) y Astra (74.1%). La ejecución de Argon utilizó un arnés de agente mini-swe, mientras que los números de los rivales provienen de una tabla de clasificación y tarjetas de sistema.
¿Argon supera a GPT-6 Astra en los benchmarks? En un enfrentamiento directo en la tabla de Google, Argon gana 14 filas, empata 1 y pierde 4. En Artificial Analysis empatan en 53.
¿Puedo volver a ejecutar estos benchmarks yo mismo? Todavía no. Argon está limitado a los socios de Fairwind, y Google no ha dado una fecha de lanzamiento pública; nuestro rastreador de fechas de lanzamiento de Argon sigue el despliegue.
Siguiente paso
Cree el escenario ahora, ejecútelo en 3.8 Flash y guarde el informe. Cuando Argon se abra, tendrá sus propios números minutos después del cambio. Descargue Apidog para configurarlo.
