Gemini 4 Argon führt 13 der 19 Zeilen in Googles Launch-Tabelle direkt an, liegt bei 1 (CWE-bench v1, mit GPT-6 Astra) gleichauf und liegt bei 5 zurück: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 und OSWorld-2.0. Der Haken ist der Zugang. Argon ist heute nur für Verteidiger des Fairwind-Programms verfügbar, sodass niemand außerhalb der Partnerliste von Google und einiger Benchmark-Organisationen diese Zahlen derzeit erneut ausführen kann.
Unten: die vollständige Tabelle mit den Messverantwortlichen jeder Zeile, den fünf Verlusten, dem Kleingedruckten, den Cyber-Scores, Scoreboards von Drittanbietern und wie Sie Ihren eigenen Eval in Apidog erstellen können, bevor der Zugang freigeschaltet wird. Für den Modellüberblick beginnen Sie mit was Gemini 4 Argon ist. Für die Kaufentscheidung siehe Argon vs. GPT-6 Astra vs. Claude Opus 5.5.
Die vollständige Tabelle, mit den Messverantwortlichen jeder Zeile
Dies sind von Google gemeldete Ergebnisse aus dem Launch-Post und dem Evals-Methodik-PDF, das mit „Ergebnisse Stand Oktober 2026“ überschrieben ist. Google hat 10 der 19 Argon-Scores selbst berechnet; die anderen 9 stammen von öffentlichen Ranglisten. Die Zahlen der Konkurrenten stammen von diesen Ranglisten, Googles eigenen Läufen oder den Systemkarten und Blogposts der Anbieter, und die Harnesses unterscheiden sich je nach Zeile. Fett markiert den Zeilenführer.
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | Wer es gemessen hat |
|---|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% | Vals AI |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | Zapier-Rangliste (privater Satz) |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Vals AI |
| Harvey Legal Agent | 19.6% | 5.4% | 6.7% | 3.8% | Vals AI |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% | Argon selbst berechnet; Astra-Rangliste; Anthropic-Systemkarten |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | Proximal-Rangliste |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | Vals AI |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | Argon selbst berechnet; Konkurrenten-Rangliste |
| PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% | Selbst berechnet für alle Modelle |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | Argon selbst berechnet; Konkurrenten-Rangliste |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | Selbst berechnet für alle Modelle |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | Surge-Rangliste |
| GraphWalks bis zu 128K | 99.7% | 98.7% | 91.4% | 90.6% | Selbst berechnet für alle Modelle |
| GraphWalks 256K bis 1M | 84.2% | 71.8% | 65.0% | 66.8% | Selbst berechnet für alle Modelle |
| Agent’s Last Exam | 39.5% | 34.2% | n/a | 38.2% | Argon selbst berechnet; Konkurrenten-Rangliste |
| OSWorld-2.0 (offline) | 69.2% | 72.6% | n/a | n/a | Argon selbst berechnet; Astra von OpenAIs Blogpost |
| Chartography | 71.6% | 71.0% | 46.2% | 66.3% | Surge-Rangliste |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | Selbst berechnet für alle Modelle |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% | Öffentliche Rangliste |
n/a = nicht gemeldet. Grok 4.7, das nicht in Googles Tabelle enthalten ist, erreicht ebenfalls 68% auf der CWE-bench-Rangliste, sodass diese Gleichheit dreifach ist.
Nach Quelle sortiert, stammen 9 Zeilen von öffentlichen Ranglisten für jedes Modell (Vals AI, Zapier, Proximal, Surge und CWE-bench). Argon führt 7 dieser 9 an und liegt bei 1 gleichauf. Google hat 5 Zeilen selbst für alle vier Modelle ausgeführt, und Argon führt 4 an. Die anderen 5 paaren einen von Google ausgeführten Argon-Score mit Zahlen von Konkurrenten aus anderen Quellen, und hier verliert Argon am meisten: 3 seiner 5 Niederlagen liegen in diesen gemischten Zeilen. Wenn das selbstständige Berechnen Argon geschmeichelt hätte, würde man das Gegenteil erwarten.
Wo Argon zurückliegt und warum das für agentisches Codieren wichtig ist
- FrontierSWE v2: 55,0% gegenüber Astras 65,5%. Argon ist der letzte von vier, hinter Fable 5.1 (56,3%) und Opus 5.5 (62,3%), auf einer Rangliste, die jedes Modell bewertet hat.
- Terminal-bench 4.0: 57,4% gegenüber Opus 5.5s 66,4%. Wieder letzter, obwohl Astra und Fable 5.1 innerhalb eines Punktes liegen.
- PostTrainBench: 45,3% gegenüber Opus 5.5s 49,3%. Zweiter Platz, in einer Zeile, die Google für alle Modelle ausgeführt hat.
- Terminal-Bench Science 0.1: 57,6% gegenüber Astras 68,1%. Dritter, nur vor Fable 5.1. Google hat Argons Versuch mit einem 6-fachen Verifizierer-Timeout durchgeführt.
- OSWorld-2.0 (Offline-Subset): 69,2% gegenüber Astras 72,6%. Anthropic meldet nur eine kombinierte Online- und Offline-Punktzahl, daher erscheinen keine Claude-Modelle.
Agentisches Codieren teilt sich 2 zu 2. Argon gewinnt DeepSWE v1.1 und Vibe Code Bench, belegt dann den letzten Platz bei FrontierSWE v2 und Terminal-bench 4.0. Der DeepSWE-Sieg mischt Harnesses: Argon lief auf einem Mini-SWE-Agent-Harness, Astras Zahl stammt aus der öffentlichen Rangliste, und die Claude-Zahlen stammen aus Systemkarten. Vibe Code Bench ist sauberer, da Vals AI alle vier bewertet hat, aber der Unterschied beträgt 1,6 Punkte.
Wenn Ihre Arbeitslast terminal-lastige Agenten oder lange Repository-Aufgaben umfasst, gewichten Sie diese beiden letzten Plätze stärker als die Überschriftenzahl. Astra führt bei FrontierSWE; unser GPT-6 Astra Hands-on zeigt, wie sich dieses Modell heute nutzen lässt. Für Anthropic's Seite deckt die Claude Fable 5.1 Benchmarks-Aufschlüsselung Fables eigene Startzahlen ab.
Bloomberg berichtet, dass anonyme Google-Mitarbeiter mit Zugang sagen, Argon sei bei einigen Codierungs- und Front-End-Designarbeiten im Vergleich zu seinen Benchmark-Scores enttäuschend. Google bezeichnete diese Charakterisierung als ungenau.
Methodische Vorbehalte, die die Interpretation der Tabelle verändern
- Maximaler Einsatz auf beiden Seiten. Argon lief „mit der Gemini API mit den höchsten Denk-Einstellungen“. Für Astra, Fable 5.1 und Opus 5.5 verwendet Google standardmäßig die „maximal verfügbaren Denk-/Begründungseinstellungen“. Dies vergleicht Obergrenzen, nicht das Standardverhalten oder die Kosten.
- LVBench-Frames. Google führte LVBench selbst für alle vier Modelle ohne Tools aus. Gemini sampelte Videos mit 1 FPS. Astra erhielt 800 Frames, Fable 5.1 300 und Opus 5.5 600, „aufgrund von API-Beschränkungen“. Die Modelle sahen keine identischen Eingaben.
- OSWorld best of three. Argons Wert ist „maximiert über 3 Läufe mit einem einzelnen Versuch pro Lauf“, ein bester Lauf statt eines Durchschnitts.
- Agent’s Last Exam Zeitfenster. Argon lief auf dem ALE-Claw-Harness mit einem 5-Stunden-Fenster.
- Sicherheitsfilter aktiviert. Agent’s Last Exam und OSWorld liefen mit aktivierten Sicherheitsfiltern, und als problematisch markierte Antworten kamen als leere Strings zurück. Wenn überhaupt, wirkt sich das negativ auf Argon aus.
Die Cyber-Zeilen von DeepMinds Cyber-Seite
Die DeepMind Cyber-Seite fügt vier Werte jenseits der Starttabelle hinzu:
| Cyber-Bewertung | Gemini 4 Argon | Vergleich |
|---|---|---|
| Entdeckung von realen Schwachstellen | 85.8% | Gemini 3.8 Flash Cyber 71.0% |
| Wiz Penetration Test Benchmark | 70.9% | Gemini 3.8 Flash Cyber 58.2% |
| Gray Swan IPI Angriffs-Erfolg (k=15, niedriger ist besser) | 0.7% | Niedrigster in der Tabelle; Kimi K3 am höchsten mit 52.7% |
| CWE-bench v1 | 68% | Dreifacher Gleichstand mit Grok 4.7 und GPT-6 Astra; Opus 5.5 bei 67% |
Die Schwachstellenbewertung nutzte ein internes Antigravity-Harness „das nicht auf Cyber spezialisiert ist“, mit Quellzugang. Der Wiz-Test gibt dem Modell „nur Zugang zur laufenden Website und ihrem öffentlichen Verhalten, ohne den Quellcode der Anwendung“. Beide Schlagzeilen-Vergleiche beziehen sich auf Googles früheres Cyber-Modell, nicht auf Konkurrenten. Unser Argon Cyber-Verteidigungs-Erklärer behandelt, was dies für die von Ihnen betriebenen APIs bedeutet.
Scoreboards von Drittanbietern
Diese Organisationen veröffentlichten Scores innerhalb weniger Minuten nach dem Start, sie hatten also Vorabzugriff.
- Artificial Analysis listet Gemini 4 Argon (High) mit einem Intelligence Index von 53, #8 von 223. Dieser Rang zählt jede Denk-Einstellung separat. Nach unterschiedlichen Modellen liegt Argon gleichauf mit Fable 5.1 und GPT-6 Astra und hinter Opus 5.5 (58 max) und Sonnet 5.5 (56 max). AA meldet eine Halluzinationsrate von 15% auf AA-Omniscience (Astra max, 51%), mit einer Genauigkeit von 50% gegenüber 63%. Das Ausführen des Index kostete 1,99 $ pro Aufgabe, bei etwa 62K Ausgabe-Tokens pro Aufgabe gegenüber etwa 27K für Astra max. Artificial Analysis zeigt keine Geschwindigkeits- oder Latenzdaten.
- Vals AI platziert Argon mit 68,90% auf dem Vals Index, #1 von 41 und das erste Gemini-Modell, das diesen anführt, zu einem Preis von 15,68 $ pro Test. Vals AI listet eine maximale Ausgabe von 262K für die getestete Konfiguration, unter Googles angegebenen 1M.
- Arena platziert Argon auf #1 bei Text mit 1525, als vorläufig markiert bei 4.942 Stimmen, und #8 bei WebDev.
Warum Medien 12, 13 und 14 Siege veröffentlichen
Die Medien haben drei verschiedene Siegzahlen veröffentlicht. Hier ist die Neuberechnung aus Googles 19 Zeilen:
| Verglichen mit | Argon gewinnt | Gleichstände | Argon verliert | Nicht gemeldet |
|---|---|---|---|---|
| Bestes aus allen drei Rivalen | 13 | 1 | 5 | 0 |
| Nur GPT-6 Astra | 14 | 1 | 4 | 0 |
| Nur Claude Opus 5.5 | 14 | 0 | 4 | 1 |
| Nur Claude Fable 5.1 | 15 | 0 | 2 | 2 |
Eine 13 stimmt gegen das gesamte Feld. Eine 14 stimmt im direkten Vergleich mit Astra oder Opus 5.5. Eine 12 passt zu keiner dieser Einordnungen der gesamten 19 Zeilen, prüfen Sie also, welche Zeilen diese Quelle gezählt hat. Auch die Margen variieren: Harvey Legal Agent (19,6% gegenüber 6,7%) ist groß; Chartography beträgt 0,6 Punkte.
So führen Sie Ihre eigene Bewertung am Tag der Freischaltung durch
Benchmarks beschreiben Googles Harness; Ihre Prompts beschreiben Ihr Produkt. Erstellen Sie die Bewertung noch heute auf einem Modell, das Sie aufrufen können, und richten Sie sie dann mit einer Änderung auf Argon aus.
- Wählen Sie echte Prompts, die zu den Zeilen passen, die Ihnen wichtig sind: eine Repository-Korrektur, eine Terminal-Aufgabe, eine Frage zu langen Dokumenten.
- Erstellen Sie in Apidog eine Umgebung mit
GEMINI_API_KEYundGEMINI_MODEL, die aufgemini-3.8-flasheingestellt sind. Google hat die Modell-ID von Argon nicht veröffentlicht, daher ist diese Variable der einzige Wert, den Sie ändern werden. - Speichern Sie jeden Prompt als eine Anfrage, die das Modell von
{{GEMINI_MODEL}}liest, gruppiert in einem Testszenario. - Fügen Sie Assertions auf die Ausgabe (Status, erforderliche Felder, erwarteter Inhalt) und auf
usageMetadatahinzu, einschließlich einer Obergrenze fürthoughtsTokenCount, die an Ihr Kostenlimit angepasst ist. - Führen Sie das Szenario jetzt auf 3.8 Flash aus und speichern Sie den Bericht als Ihre Basislinie.
Am Tag, an dem Argons ID freigegeben wird, tauschen Sie die Variable aus und führen sie erneut aus. Google sagt, dass „alle neuen Modelle“ über die Interactions API gestartet werden, speichern Sie also auch eine Interactions-Version jeder Anfrage. Unser Vergleich zwischen Argon und Gemini 3.8 Flash behandelt, was Sie bei Preis und Limits erwarten können.
FAQ
Sind die Benchmarks von Gemini 4 Argon unabhängig verifiziert? Teilweise. Neun der 19 Zeilen stammen von öffentlichen Bestenlisten für jedes Modell, und Artificial Analysis, Vals AI und Arena haben eigene Ergebnisse veröffentlicht. Der Rest wurde von Google für Argon durchgeführt.
Wie lautet der DeepSWE-Score von Gemini 4 Argon? 77,9% auf DeepSWE v1.1, vor Opus 5.5 (74,2%) und Astra (74,1%). Argons Durchlauf verwendete einen Mini-SWE-Agent-Harness, während die Zahlen der Rivalen von einer Bestenliste und Systemkarten stammen.
Schlägt Argon GPT-6 Astra bei Benchmarks? Im direkten Vergleich in Googles Tabelle gewinnt Argon 14 Zeilen, liegt bei 1 gleichauf und verliert 4. Bei Artificial Analysis liegen sie bei 53 gleichauf.
Kann ich diese Benchmarks selbst erneut ausführen? Noch nicht. Argon ist auf Fairwind-Partner beschränkt, und Google hat noch kein öffentliches Veröffentlichungsdatum bekannt gegeben; unser Argon-Veröffentlichungsdatum-Tracker verfolgt den Rollout.
Nächster Schritt
Erstellen Sie das Szenario jetzt, führen Sie es auf 3.8 Flash aus und bewahren Sie den Bericht auf. Wenn Argon freigegeben wird, haben Sie Ihre eigenen Zahlen Minuten nach dem Wechsel. Laden Sie Apidog herunter, um es einzurichten.
