Gemini 4 Argon Benchmarks: Alle 19 Ergebnisse, wie Google testete und 5 Niederlagen

Gemini 4 Argon Benchmarks: alle 19 Zeilen mit der Angabe, wer die jeweiligen Messungen durchgeführt hat, die 5, bei denen es unterliegt, Googles methodologische Vorbehalte sowie die AA-, Vals- und Arena-Scores.

INEZA Felin-Michel

INEZA Felin-Michel

2 October 2026

Gemini 4 Argon Benchmarks: Alle 19 Ergebnisse, wie Google testete und 5 Niederlagen

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Gemini 4 Argon führt 13 der 19 Zeilen in Googles Launch-Tabelle direkt an, liegt bei 1 (CWE-bench v1, mit GPT-6 Astra) gleichauf und liegt bei 5 zurück: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 und OSWorld-2.0. Der Haken ist der Zugang. Argon ist heute nur für Verteidiger des Fairwind-Programms verfügbar, sodass niemand außerhalb der Partnerliste von Google und einiger Benchmark-Organisationen diese Zahlen derzeit erneut ausführen kann.

Unten: die vollständige Tabelle mit den Messverantwortlichen jeder Zeile, den fünf Verlusten, dem Kleingedruckten, den Cyber-Scores, Scoreboards von Drittanbietern und wie Sie Ihren eigenen Eval in Apidog erstellen können, bevor der Zugang freigeschaltet wird. Für den Modellüberblick beginnen Sie mit was Gemini 4 Argon ist. Für die Kaufentscheidung siehe Argon vs. GPT-6 Astra vs. Claude Opus 5.5.

Die vollständige Tabelle, mit den Messverantwortlichen jeder Zeile

Dies sind von Google gemeldete Ergebnisse aus dem Launch-Post und dem Evals-Methodik-PDF, das mit „Ergebnisse Stand Oktober 2026“ überschrieben ist. Google hat 10 der 19 Argon-Scores selbst berechnet; die anderen 9 stammen von öffentlichen Ranglisten. Die Zahlen der Konkurrenten stammen von diesen Ranglisten, Googles eigenen Läufen oder den Systemkarten und Blogposts der Anbieter, und die Harnesses unterscheiden sich je nach Zeile. Fett markiert den Zeilenführer.

Benchmark Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 Wer es gemessen hat
Vals Index 68.9% 63.1% 65.8% 67.0% Vals AI
AutomationBench 51.3% 41.4% 31.4% 42.5% Zapier-Rangliste (privater Satz)
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6% Vals AI
Harvey Legal Agent 19.6% 5.4% 6.7% 3.8% Vals AI
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2% Argon selbst berechnet; Astra-Rangliste; Anthropic-Systemkarten
FrontierSWE v2 55.0% 65.5% 56.3% 62.3% Proximal-Rangliste
Vibe Code Bench 91.9% 89.6% 90.3% 90.3% Vals AI
Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4% Argon selbst berechnet; Konkurrenten-Rangliste
PostTrainBench 45.3% 44.3% 40.2% 49.3% Selbst berechnet für alle Modelle
Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3% Argon selbst berechnet; Konkurrenten-Rangliste
LABBench 2 88.8% 85.4% 68.6% 73.1% Selbst berechnet für alle Modelle
RiemannBench 76.0% 72.0% 65.6% 69.6% Surge-Rangliste
GraphWalks bis zu 128K 99.7% 98.7% 91.4% 90.6% Selbst berechnet für alle Modelle
GraphWalks 256K bis 1M 84.2% 71.8% 65.0% 66.8% Selbst berechnet für alle Modelle
Agent’s Last Exam 39.5% 34.2% n/a 38.2% Argon selbst berechnet; Konkurrenten-Rangliste
OSWorld-2.0 (offline) 69.2% 72.6% n/a n/a Argon selbst berechnet; Astra von OpenAIs Blogpost
Chartography 71.6% 71.0% 46.2% 66.3% Surge-Rangliste
LVBench 91.7% 87.5% 79.7% 83.7% Selbst berechnet für alle Modelle
CWE-bench v1 68.0% 68.0% 58.0% 67.0% Öffentliche Rangliste

n/a = nicht gemeldet. Grok 4.7, das nicht in Googles Tabelle enthalten ist, erreicht ebenfalls 68% auf der CWE-bench-Rangliste, sodass diese Gleichheit dreifach ist.

Nach Quelle sortiert, stammen 9 Zeilen von öffentlichen Ranglisten für jedes Modell (Vals AI, Zapier, Proximal, Surge und CWE-bench). Argon führt 7 dieser 9 an und liegt bei 1 gleichauf. Google hat 5 Zeilen selbst für alle vier Modelle ausgeführt, und Argon führt 4 an. Die anderen 5 paaren einen von Google ausgeführten Argon-Score mit Zahlen von Konkurrenten aus anderen Quellen, und hier verliert Argon am meisten: 3 seiner 5 Niederlagen liegen in diesen gemischten Zeilen. Wenn das selbstständige Berechnen Argon geschmeichelt hätte, würde man das Gegenteil erwarten.

Wo Argon zurückliegt und warum das für agentisches Codieren wichtig ist

Agentisches Codieren teilt sich 2 zu 2. Argon gewinnt DeepSWE v1.1 und Vibe Code Bench, belegt dann den letzten Platz bei FrontierSWE v2 und Terminal-bench 4.0. Der DeepSWE-Sieg mischt Harnesses: Argon lief auf einem Mini-SWE-Agent-Harness, Astras Zahl stammt aus der öffentlichen Rangliste, und die Claude-Zahlen stammen aus Systemkarten. Vibe Code Bench ist sauberer, da Vals AI alle vier bewertet hat, aber der Unterschied beträgt 1,6 Punkte.

Wenn Ihre Arbeitslast terminal-lastige Agenten oder lange Repository-Aufgaben umfasst, gewichten Sie diese beiden letzten Plätze stärker als die Überschriftenzahl. Astra führt bei FrontierSWE; unser GPT-6 Astra Hands-on zeigt, wie sich dieses Modell heute nutzen lässt. Für Anthropic's Seite deckt die Claude Fable 5.1 Benchmarks-Aufschlüsselung Fables eigene Startzahlen ab.

Bloomberg berichtet, dass anonyme Google-Mitarbeiter mit Zugang sagen, Argon sei bei einigen Codierungs- und Front-End-Designarbeiten im Vergleich zu seinen Benchmark-Scores enttäuschend. Google bezeichnete diese Charakterisierung als ungenau.

Methodische Vorbehalte, die die Interpretation der Tabelle verändern

Die Cyber-Zeilen von DeepMinds Cyber-Seite

Die DeepMind Cyber-Seite fügt vier Werte jenseits der Starttabelle hinzu:

Cyber-Bewertung Gemini 4 Argon Vergleich
Entdeckung von realen Schwachstellen 85.8% Gemini 3.8 Flash Cyber 71.0%
Wiz Penetration Test Benchmark 70.9% Gemini 3.8 Flash Cyber 58.2%
Gray Swan IPI Angriffs-Erfolg (k=15, niedriger ist besser) 0.7% Niedrigster in der Tabelle; Kimi K3 am höchsten mit 52.7%
CWE-bench v1 68% Dreifacher Gleichstand mit Grok 4.7 und GPT-6 Astra; Opus 5.5 bei 67%

Die Schwachstellenbewertung nutzte ein internes Antigravity-Harness „das nicht auf Cyber spezialisiert ist“, mit Quellzugang. Der Wiz-Test gibt dem Modell „nur Zugang zur laufenden Website und ihrem öffentlichen Verhalten, ohne den Quellcode der Anwendung“. Beide Schlagzeilen-Vergleiche beziehen sich auf Googles früheres Cyber-Modell, nicht auf Konkurrenten. Unser Argon Cyber-Verteidigungs-Erklärer behandelt, was dies für die von Ihnen betriebenen APIs bedeutet.

Scoreboards von Drittanbietern

Diese Organisationen veröffentlichten Scores innerhalb weniger Minuten nach dem Start, sie hatten also Vorabzugriff.

Warum Medien 12, 13 und 14 Siege veröffentlichen

Die Medien haben drei verschiedene Siegzahlen veröffentlicht. Hier ist die Neuberechnung aus Googles 19 Zeilen:

Verglichen mit Argon gewinnt Gleichstände Argon verliert Nicht gemeldet
Bestes aus allen drei Rivalen 13 1 5 0
Nur GPT-6 Astra 14 1 4 0
Nur Claude Opus 5.5 14 0 4 1
Nur Claude Fable 5.1 15 0 2 2

Eine 13 stimmt gegen das gesamte Feld. Eine 14 stimmt im direkten Vergleich mit Astra oder Opus 5.5. Eine 12 passt zu keiner dieser Einordnungen der gesamten 19 Zeilen, prüfen Sie also, welche Zeilen diese Quelle gezählt hat. Auch die Margen variieren: Harvey Legal Agent (19,6% gegenüber 6,7%) ist groß; Chartography beträgt 0,6 Punkte.

So führen Sie Ihre eigene Bewertung am Tag der Freischaltung durch

Benchmarks beschreiben Googles Harness; Ihre Prompts beschreiben Ihr Produkt. Erstellen Sie die Bewertung noch heute auf einem Modell, das Sie aufrufen können, und richten Sie sie dann mit einer Änderung auf Argon aus.

  1. Wählen Sie echte Prompts, die zu den Zeilen passen, die Ihnen wichtig sind: eine Repository-Korrektur, eine Terminal-Aufgabe, eine Frage zu langen Dokumenten.
  2. Erstellen Sie in Apidog eine Umgebung mit GEMINI_API_KEY und GEMINI_MODEL, die auf gemini-3.8-flash eingestellt sind. Google hat die Modell-ID von Argon nicht veröffentlicht, daher ist diese Variable der einzige Wert, den Sie ändern werden.
  3. Speichern Sie jeden Prompt als eine Anfrage, die das Modell von {{GEMINI_MODEL}} liest, gruppiert in einem Testszenario.
  4. Fügen Sie Assertions auf die Ausgabe (Status, erforderliche Felder, erwarteter Inhalt) und auf usageMetadata hinzu, einschließlich einer Obergrenze für thoughtsTokenCount, die an Ihr Kostenlimit angepasst ist.
  5. Führen Sie das Szenario jetzt auf 3.8 Flash aus und speichern Sie den Bericht als Ihre Basislinie.

Am Tag, an dem Argons ID freigegeben wird, tauschen Sie die Variable aus und führen sie erneut aus. Google sagt, dass „alle neuen Modelle“ über die Interactions API gestartet werden, speichern Sie also auch eine Interactions-Version jeder Anfrage. Unser Vergleich zwischen Argon und Gemini 3.8 Flash behandelt, was Sie bei Preis und Limits erwarten können.

FAQ

Sind die Benchmarks von Gemini 4 Argon unabhängig verifiziert? Teilweise. Neun der 19 Zeilen stammen von öffentlichen Bestenlisten für jedes Modell, und Artificial Analysis, Vals AI und Arena haben eigene Ergebnisse veröffentlicht. Der Rest wurde von Google für Argon durchgeführt.

Wie lautet der DeepSWE-Score von Gemini 4 Argon? 77,9% auf DeepSWE v1.1, vor Opus 5.5 (74,2%) und Astra (74,1%). Argons Durchlauf verwendete einen Mini-SWE-Agent-Harness, während die Zahlen der Rivalen von einer Bestenliste und Systemkarten stammen.

Schlägt Argon GPT-6 Astra bei Benchmarks? Im direkten Vergleich in Googles Tabelle gewinnt Argon 14 Zeilen, liegt bei 1 gleichauf und verliert 4. Bei Artificial Analysis liegen sie bei 53 gleichauf.

Kann ich diese Benchmarks selbst erneut ausführen? Noch nicht. Argon ist auf Fairwind-Partner beschränkt, und Google hat noch kein öffentliches Veröffentlichungsdatum bekannt gegeben; unser Argon-Veröffentlichungsdatum-Tracker verfolgt den Rollout.

Nächster Schritt

Erstellen Sie das Szenario jetzt, führen Sie es auf 3.8 Flash aus und bewahren Sie den Bericht auf. Wenn Argon freigegeben wird, haben Sie Ihre eigenen Zahlen Minuten nach dem Wechsel. Laden Sie Apidog herunter, um es einzurichten.

button

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen