Gemini 4 Argon Benchmarkları: 19 Testin Tamamı, Google Nasıl Yaptı ve Kaybettiği 5 Alan

Gemini 4 Argon kıyaslamaları: her birini kimin ölçtüğünü içeren tüm 19 satır, kaybettiği 5 alan, Google'ın metodoloji uyarıları ve AA, Vals ve Arena skorları.

INEZA Felin-Michel

INEZA Felin-Michel

2 October 2026

Gemini 4 Argon Benchmarkları: 19 Testin Tamamı, Google Nasıl Yaptı ve Kaybettiği 5 Alan

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Gemini 4 Argon, Google'ın lansman tablosundaki 19 satırın 13'ünde açıkça lider, 1'inde berabere (CWE-bench v1, GPT-6 Astra ile) ve 5'inde geride: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 ve OSWorld-2.0. Buradaki püf nokta erişim. Argon bugün yalnızca Fairwind Programı savunucularına açıktır, bu nedenle Google'ın iş ortağı listesi dışındaki hiç kimse ve birkaç kıyaslama kuruluşu bu sayıları henüz yeniden çalıştıramaz.

Aşağıda: her bir satırı kimin ölçtüğünü gösteren tam tablo, beş kayıp, dipnotlar, siber puanlar, üçüncü taraf puan tabloları ve erişim açılmadan önce Apidog'da kendi değerlendirmenizi nasıl oluşturacağınız bulunmaktadır. Model hakkında genel bir bakış için Gemini 4 Argon'un ne olduğunu öğrenmekle başlayın. Satın alma kararı için Argon, GPT-6 Astra ve Claude Opus 5.5 karşılaştırmasına bakın.

Her bir satırı kimin ölçtüğünü gösteren tam tablo

Bunlar, "Ekim 2026 itibarıyla sonuçlar" başlıklı lansman gönderisinden ve değerlendirme metodolojisi PDF'inden alınan Google tarafından bildirilen sonuçlardır. Google, 19 Argon puanının 10'unu kendisi hesapladı; diğer 9'u herkese açık lider tablolarından geliyor. Rakip sayılar bu lider tablolarından, Google'ın kendi çalışmalarından veya satıcıların sistem kartlarından ve blog gönderilerinden geliyor ve her satırda kullanılan araçlar farklılık gösteriyor. Kalın yazılanlar satır liderini belirtir.

Kıyaslama Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 Kim ölçtü
Vals Endeksi %68,9 %63,1 %65,8 %67,0 Vals AI
AutomationBench %51,3 %41,4 %31,4 %42,5 Zapier lider tablosu (özel set)
Vals Finans Aracısı v2 %65,4 %53,5 %58,9 %58,6 Vals AI
Harvey Yasal Aracı %19,6 %5,4 %6,7 %3,8 Vals AI
DeepSWE v1.1 %77,9 %74,1 %67,4 %74,2 Argon kendi kendine hesapladı; Astra lider tablosu; Anthropic sistem kartları
FrontierSWE v2 %55,0 %65,5 %56,3 %62,3 Proximal lider tablosu
Vibe Kod Kıyaslaması %91,9 %89,6 %90,3 %90,3 Vals AI
Terminal-bench 4.0 %57,4 %58,2 %57,9 %66,4 Argon kendi kendine hesapladı; rakiplerin lider tablosu
PostTrainBench %45,3 %44,3 %40,2 %49,3 Tüm modeller için kendi kendine hesaplandı
Terminal-Bench Science 0.1 %57,6 %68,1 %52,6 %63,3 Argon kendi kendine hesapladı; rakiplerin lider tablosu
LABBench 2 %88,8 %85,4 %68,6 %73,1 Tüm modeller için kendi kendine hesaplandı
RiemannBench %76,0 %72,0 %65,6 %69,6 Surge lider tablosu
GraphWalks 128K'ye kadar %99,7 %98,7 %91,4 %90,6 Tüm modeller için kendi kendine hesaplandı
GraphWalks 256K ila 1M %84,2 %71,8 %65,0 %66,8 Tüm modeller için kendi kendine hesaplandı
Aracının Son Sınavı %39,5 %34,2 bildirilmedi %38,2 Argon kendi kendine hesapladı; rakiplerin lider tablosu
OSWorld-2.0 (çevrimdışı) %69,2 %72,6 bildirilmedi bildirilmedi Argon kendi kendine hesapladı; Astra OpenAI'ın blog gönderisinden
Çartografi %71,6 %71,0 %46,2 %66,3 Surge lider tablosu
LVBench %91,7 %87,5 %79,7 %83,7 Tüm modeller için kendi kendine hesaplandı
CWE-bench v1 %68,0 %68,0 %58,0 %67,0 Herkese açık lider tablosu

n/r = bildirilmedi. Google'ın tablosunda yer almayan Grok 4.7 de CWE-bench lider tablosunda %68 puan alıyor, bu nedenle bu beraberlik üç yönlüdür.

Kaynağa göre sıralandığında, 9 satır her model için herkese açık lider tablolarından geliyor (Vals AI, Zapier, Proximal, Surge ve CWE-bench). Argon bu 9'un 7'sine liderlik ediyor ve 1'inde berabere kalıyor. Google, dört modelin tamamı için 5 satırı kendisi çalıştırdı ve Argon 4'üne liderlik ediyor. Diğer 5 satırda ise Google tarafından çalıştırılan bir Argon puanı ile başka yerlerden gelen rakip sayılar eşleştiriliyor ve Argon'un en çok kaybettiği yer burası: 5 kaybının 3'ü bu karma satırlarda yer alıyor. Kendi kendine hesaplama Argon'u daha iyi göstermiş olsaydı, tam tersini beklerdiniz.

Argon'un geride kaldığı yerler ve bunun ajanslı kodlama için neden önemli olduğu

Ajanslı kodlama 2'ye 2 ayrılıyor. Argon, DeepSWE v1.1 ve Vibe Code Bench'i kazanırken, FrontierSWE v2 ve Terminal-bench 4.0'da sonuncu oldu. DeepSWE zaferi, kullanılan araçları karıştırıyor: Argon bir mini-swe ajan aracı üzerinde çalıştı, Astra'nın sayısı herkese açık lider tablosundan ve Claude sayıları sistem kartlarından geliyor. Vibe Code Bench daha temiz, çünkü Vals AI dördünü de puanladı, ancak fark 1,6 puan.

İş yükünüz yoğun terminal ajanları veya uzun depolama görevleriyse, bu iki sonuncu sırayı başlık sayısının üzerinde değerlendirin. Astra, FrontierSWE liderliğini elinde tutuyor; GPT-6 Astra uygulamalı incelememiz, bu modelin bugün nasıl kullanıldığını gösteriyor. Anthropic tarafı için, Claude Fable 5.1 kıyaslama dökümü Fable'ın kendi lansman sayılarını kapsıyor.

Bloomberg, erişimi olan isimsiz Google çalışanlarının, Argon'un bazı kodlama ve ön uç tasarım çalışmalarında kıyaslama puanlarına göre yetersiz kaldığını söylediğini bildiriyor. Google bu tanımlamayı yanlış olarak nitelendirdi.

Tabloyu okumanızı değiştiren metodoloji uyarıları

DeepMind'ın siber sayfasındaki siber satırlar

DeepMind siber sayfası, lansman tablosunun ötesinde dört puan daha ekliyor:

Siber değerlendirme Gemini 4 Argon Karşılaştırma
Gerçek dünya güvenlik açığı keşfi %85,8 Gemini 3.8 Flash Cyber %71,0
Wiz Penetrasyon Testi Kıyaslaması %70,9 Gemini 3.8 Flash Cyber %58,2
Gray Swan IPI saldırı başarısı (k=15, düşük daha iyidir) %0,7 Grafikte en düşük; Kimi K3 en yüksek %52,7
CWE-bench v1 %68 Grok 4.7 ve GPT-6 Astra ile üç yönlü beraberlik; Opus 5.5 %67

Güvenlik açığı değerlendirmesi, kaynak erişimi olan "siber alanda uzmanlaşmamış" dahili bir Antigravity aracı kullandı. Wiz testi, modele "yalnızca çalışan web sitesine ve genel davranışına, uygulama kaynak kodu olmadan erişim" sağlıyor. Her iki başlık karşılaştırması da Google'ın önceki siber modeliyle yapılıyor, rakiplerle değil. Argon siber savunma açıklamamız, bunların çalıştırdığınız API'ler için ne anlama geldiğini kapsıyor.

Üçüncü taraf puan tabloları

Bu kuruluşlar lansmandan dakikalar sonra puanları yayınladı, yani ön-sürüm erişimine sahiplerdi.

Yayın organları neden 12, 13 ve 14 galibiyet yayınlıyor?

Yayın organları üç farklı galibiyet sayısı yayınladı. İşte Google'ın 19 satırından yeniden sayım:

Kime karşı sayıldı Argon galibiyetleri Beraberlikler Argon kayıpları Bildirilmedi
Üç rakibin en iyisine karşı 13 1 5 0
Sadece GPT-6 Astra 14 1 4 0
Sadece Claude Opus 5.5 14 0 4 1
Sadece Claude Fable 5.1 15 0 2 2

13, tüm alana karşı doğrudur. 14, Astra veya Opus 5.5'e karşı bire bir doğrudur. 12, tam 19 satırın hiçbir çerçevesine uymuyor, bu yüzden o kaynağın hangi satırları saydığını kontrol edin. Farklar da değişir: Harvey Legal Agent (%19,6'ya karşı %6,7) geniştir; Chartography 0,6 puandır.

Erişim açıldığı gün kendi değerlendirmenizi nasıl çalıştırırsınız?

Kıyaslamalar Google'ın araçlarını tanımlar; komutlarınız ürününüzü tanımlar. Erişebileceğiniz bir model üzerinde değerlendirmeyi bugün oluşturun, ardından tek bir değişiklikle Argon'a yönlendirin.

  1. İlgilendiğiniz satırlara uyan gerçek komutları seçin: bir depo düzeltmesi, bir terminal görevi, uzun bir belge sorusu.
  2. Apidog'da, GEMINI_API_KEY ve GEMINI_MODEL'ı gemini-3.8-flash olarak ayarlayan bir ortam oluşturun. Google, Argon'un model kimliğini henüz yayınlamadı, bu nedenle değiştireceğiniz tek değer bu değişkendir.
  3. Her bir komutu, modeli {{GEMINI_MODEL}}'den okuyan bir istek olarak kaydedin ve bir test senaryosunda gruplandırın.
  4. Çıkışa (durum, gerekli alanlar, beklenen içerik) ve usageMetadata'ya, maliyet sınırınıza göre boyutlandırılmış thoughtsTokenCount üzerinde bir tavan dahil olmak üzere onaylamalar ekleyin.
  5. Senaryoyu şimdi 3.8 Flash üzerinde çalıştırın ve raporu temeliniz olarak saklayın.

Argon'un kimliği yayınlandığı gün, değişkeni değiştirin ve tekrar çalıştırın. Google, "tüm yeni modellerin" Interactions API üzerinde başlatılacağını söylüyor, bu nedenle her isteğin bir Interactions sürümünü de kaydedin. Argon ve Gemini 3.8 Flash karşılaştırmamız, fiyat ve sınırlar hakkında ne beklemeniz gerektiğini kapsıyor.

Sıkça Sorulan Sorular

Sonraki adım

Senaryoyu şimdi oluşturun, 3.8 Flash üzerinde çalıştırın ve raporu saklayın. Argon kullanıma açıldığında, değişimin ardından dakikalar içinde kendi sayılarınıza sahip olacaksınız. Kurulum için Apidog'u indirin.

düğme

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin