Gemini 4 Argon, Google'ın lansman tablosundaki 19 satırın 13'ünde açıkça lider, 1'inde berabere (CWE-bench v1, GPT-6 Astra ile) ve 5'inde geride: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 ve OSWorld-2.0. Buradaki püf nokta erişim. Argon bugün yalnızca Fairwind Programı savunucularına açıktır, bu nedenle Google'ın iş ortağı listesi dışındaki hiç kimse ve birkaç kıyaslama kuruluşu bu sayıları henüz yeniden çalıştıramaz.
Aşağıda: her bir satırı kimin ölçtüğünü gösteren tam tablo, beş kayıp, dipnotlar, siber puanlar, üçüncü taraf puan tabloları ve erişim açılmadan önce Apidog'da kendi değerlendirmenizi nasıl oluşturacağınız bulunmaktadır. Model hakkında genel bir bakış için Gemini 4 Argon'un ne olduğunu öğrenmekle başlayın. Satın alma kararı için Argon, GPT-6 Astra ve Claude Opus 5.5 karşılaştırmasına bakın.
Her bir satırı kimin ölçtüğünü gösteren tam tablo
Bunlar, "Ekim 2026 itibarıyla sonuçlar" başlıklı lansman gönderisinden ve değerlendirme metodolojisi PDF'inden alınan Google tarafından bildirilen sonuçlardır. Google, 19 Argon puanının 10'unu kendisi hesapladı; diğer 9'u herkese açık lider tablolarından geliyor. Rakip sayılar bu lider tablolarından, Google'ın kendi çalışmalarından veya satıcıların sistem kartlarından ve blog gönderilerinden geliyor ve her satırda kullanılan araçlar farklılık gösteriyor. Kalın yazılanlar satır liderini belirtir.
| Kıyaslama | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | Kim ölçtü |
|---|---|---|---|---|---|
| Vals Endeksi | %68,9 | %63,1 | %65,8 | %67,0 | Vals AI |
| AutomationBench | %51,3 | %41,4 | %31,4 | %42,5 | Zapier lider tablosu (özel set) |
| Vals Finans Aracısı v2 | %65,4 | %53,5 | %58,9 | %58,6 | Vals AI |
| Harvey Yasal Aracı | %19,6 | %5,4 | %6,7 | %3,8 | Vals AI |
| DeepSWE v1.1 | %77,9 | %74,1 | %67,4 | %74,2 | Argon kendi kendine hesapladı; Astra lider tablosu; Anthropic sistem kartları |
| FrontierSWE v2 | %55,0 | %65,5 | %56,3 | %62,3 | Proximal lider tablosu |
| Vibe Kod Kıyaslaması | %91,9 | %89,6 | %90,3 | %90,3 | Vals AI |
| Terminal-bench 4.0 | %57,4 | %58,2 | %57,9 | %66,4 | Argon kendi kendine hesapladı; rakiplerin lider tablosu |
| PostTrainBench | %45,3 | %44,3 | %40,2 | %49,3 | Tüm modeller için kendi kendine hesaplandı |
| Terminal-Bench Science 0.1 | %57,6 | %68,1 | %52,6 | %63,3 | Argon kendi kendine hesapladı; rakiplerin lider tablosu |
| LABBench 2 | %88,8 | %85,4 | %68,6 | %73,1 | Tüm modeller için kendi kendine hesaplandı |
| RiemannBench | %76,0 | %72,0 | %65,6 | %69,6 | Surge lider tablosu |
| GraphWalks 128K'ye kadar | %99,7 | %98,7 | %91,4 | %90,6 | Tüm modeller için kendi kendine hesaplandı |
| GraphWalks 256K ila 1M | %84,2 | %71,8 | %65,0 | %66,8 | Tüm modeller için kendi kendine hesaplandı |
| Aracının Son Sınavı | %39,5 | %34,2 | bildirilmedi | %38,2 | Argon kendi kendine hesapladı; rakiplerin lider tablosu |
| OSWorld-2.0 (çevrimdışı) | %69,2 | %72,6 | bildirilmedi | bildirilmedi | Argon kendi kendine hesapladı; Astra OpenAI'ın blog gönderisinden |
| Çartografi | %71,6 | %71,0 | %46,2 | %66,3 | Surge lider tablosu |
| LVBench | %91,7 | %87,5 | %79,7 | %83,7 | Tüm modeller için kendi kendine hesaplandı |
| CWE-bench v1 | %68,0 | %68,0 | %58,0 | %67,0 | Herkese açık lider tablosu |
n/r = bildirilmedi. Google'ın tablosunda yer almayan Grok 4.7 de CWE-bench lider tablosunda %68 puan alıyor, bu nedenle bu beraberlik üç yönlüdür.
Kaynağa göre sıralandığında, 9 satır her model için herkese açık lider tablolarından geliyor (Vals AI, Zapier, Proximal, Surge ve CWE-bench). Argon bu 9'un 7'sine liderlik ediyor ve 1'inde berabere kalıyor. Google, dört modelin tamamı için 5 satırı kendisi çalıştırdı ve Argon 4'üne liderlik ediyor. Diğer 5 satırda ise Google tarafından çalıştırılan bir Argon puanı ile başka yerlerden gelen rakip sayılar eşleştiriliyor ve Argon'un en çok kaybettiği yer burası: 5 kaybının 3'ü bu karma satırlarda yer alıyor. Kendi kendine hesaplama Argon'u daha iyi göstermiş olsaydı, tam tersini beklerdiniz.
Argon'un geride kaldığı yerler ve bunun ajanslı kodlama için neden önemli olduğu
- FrontierSWE v2: Astra'nın %65,5'ine karşılık %55,0. Argon, her modeli puanlayan bir lider tablosunda Fable 5.1 (%56,3) ve Opus 5.5 (%62,3) gerisinde, dördüncü sırada yer alıyor.
- Terminal-bench 4.0: Opus 5.5'in %66,4'üne karşılık %57,4. Astra ve Fable 5.1 bir puan içinde olsa da yine sonuncu.
- PostTrainBench: Opus 5.5'in %49,3'üne karşılık %45,3. Tüm modeller için Google tarafından çalıştırılan bir satırda ikinci sırada.
- Terminal-Bench Science 0.1: Astra'nın %68,1'ine karşılık %57,6. Yalnızca Fable 5.1'in önünde üçüncü sırada. Google, Argon'un denemesini 6 kat doğrulayıcı zaman aşımı ile çalıştırdı.
- OSWorld-2.0 (çevrimdışı alt küme): Astra'nın %72,6'sına karşılık %69,2. Anthropic yalnızca birleşik çevrimiçi ve çevrimdışı puan bildiriyor, bu nedenle hiçbir Claude modeli görünmüyor.
Ajanslı kodlama 2'ye 2 ayrılıyor. Argon, DeepSWE v1.1 ve Vibe Code Bench'i kazanırken, FrontierSWE v2 ve Terminal-bench 4.0'da sonuncu oldu. DeepSWE zaferi, kullanılan araçları karıştırıyor: Argon bir mini-swe ajan aracı üzerinde çalıştı, Astra'nın sayısı herkese açık lider tablosundan ve Claude sayıları sistem kartlarından geliyor. Vibe Code Bench daha temiz, çünkü Vals AI dördünü de puanladı, ancak fark 1,6 puan.
İş yükünüz yoğun terminal ajanları veya uzun depolama görevleriyse, bu iki sonuncu sırayı başlık sayısının üzerinde değerlendirin. Astra, FrontierSWE liderliğini elinde tutuyor; GPT-6 Astra uygulamalı incelememiz, bu modelin bugün nasıl kullanıldığını gösteriyor. Anthropic tarafı için, Claude Fable 5.1 kıyaslama dökümü Fable'ın kendi lansman sayılarını kapsıyor.
Bloomberg, erişimi olan isimsiz Google çalışanlarının, Argon'un bazı kodlama ve ön uç tasarım çalışmalarında kıyaslama puanlarına göre yetersiz kaldığını söylediğini bildiriyor. Google bu tanımlamayı yanlış olarak nitelendirdi.
Tabloyu okumanızı değiştiren metodoloji uyarıları
- Her iki tarafta da maksimum çaba. Argon, “en yüksek düşünme ayarlarına sahip Gemini API ile” çalıştırıldı. Astra, Fable 5.1 ve Opus 5.5 için Google, “mevcut en yüksek düşünme/muhakeme ayarlarına” varsayılan olarak ayarlandı. Bu, tavanları karşılaştırır, varsayılan davranışı veya maliyeti değil.
- LVBench kareleri. Google, LVBench'i dört modelin tamamı için, araçlar olmadan kendisi çalıştırdı. Gemini videoyu 1 FPS'de örnekledi. Astra 800 kare, Fable 5.1 300 kare ve Opus 5.5 600 kare aldı, "API sınırlamaları nedeniyle". Modeller aynı girdileri görmedi.
- OSWorld en iyi üç. Argon'un puanı, "her çalıştırmada tek bir deneme ile 3 çalıştırma üzerinden maksimize edilmiştir," yani bir ortalama yerine en iyi çalıştırma puanıdır.
- Agent's Last Exam penceresi. Argon, ALE-Claw aracı üzerinde 5 saatlik bir pencere ile çalıştı.
- Güvenlik filtreleri açık. Agent's Last Exam ve OSWorld güvenlik filtreleri etkin olarak çalıştırıldı ve işaretlenen yanıtlar boş dizeler olarak geri döndü. Aslında bu, Argon'a karşı işleyen bir durumdur.
DeepMind'ın siber sayfasındaki siber satırlar
DeepMind siber sayfası, lansman tablosunun ötesinde dört puan daha ekliyor:
| Siber değerlendirme | Gemini 4 Argon | Karşılaştırma |
|---|---|---|
| Gerçek dünya güvenlik açığı keşfi | %85,8 | Gemini 3.8 Flash Cyber %71,0 |
| Wiz Penetrasyon Testi Kıyaslaması | %70,9 | Gemini 3.8 Flash Cyber %58,2 |
| Gray Swan IPI saldırı başarısı (k=15, düşük daha iyidir) | %0,7 | Grafikte en düşük; Kimi K3 en yüksek %52,7 |
| CWE-bench v1 | %68 | Grok 4.7 ve GPT-6 Astra ile üç yönlü beraberlik; Opus 5.5 %67 |
Güvenlik açığı değerlendirmesi, kaynak erişimi olan "siber alanda uzmanlaşmamış" dahili bir Antigravity aracı kullandı. Wiz testi, modele "yalnızca çalışan web sitesine ve genel davranışına, uygulama kaynak kodu olmadan erişim" sağlıyor. Her iki başlık karşılaştırması da Google'ın önceki siber modeliyle yapılıyor, rakiplerle değil. Argon siber savunma açıklamamız, bunların çalıştırdığınız API'ler için ne anlama geldiğini kapsıyor.
Üçüncü taraf puan tabloları
Bu kuruluşlar lansmandan dakikalar sonra puanları yayınladı, yani ön-sürüm erişimine sahiplerdi.
- Artificial Analysis, Gemini 4 Argon'u (Yüksek) 53 İstihbarat Endeksi'nde, 223 model arasında 8. sırada listeliyor. Bu sıralama her akıl yürütme ayarını ayrı ayrı sayar. Farklı modellere göre, Argon Fable 5.1 ve GPT-6 Astra ile berabere kalırken, Opus 5.5 (maksimum 58) ve Sonnet 5.5'in (maksimum 56) gerisinde kalıyor. AA, AA-Omniscience'da %15 halüsinasyon oranı (Astra maksimumda %51) bildirirken, doğruluk %50'ye karşı %63'tür. Endeksi çalıştırmanın maliyeti görev başına 1,99 dolardı, görev başına yaklaşık 62 bin çıktı tokeni, Astra için ise maksimumda yaklaşık 27 bin. Artificial Analysis hız veya gecikme verisi göstermiyor.
- Vals AI, Argon'u Vals Endeksi'nde %68,90 ile 41 model arasında 1. sıraya ve onu zirveye taşıyan ilk Gemini modeli olarak yerleştiriyor, test başına 15,68 dolar maliyetle. Vals AI, test ettiği yapılandırma için Google'ın belirttiği 1 milyonun altında 262 bin maksimum çıktı listeliyor.
- Arena, Argon'u Metin'de 1525 puanla 1. sıraya (4.942 oyla Ön olarak işaretlendi) ve WebDev'de 8. sıraya yerleştiriyor.
Yayın organları neden 12, 13 ve 14 galibiyet yayınlıyor?
Yayın organları üç farklı galibiyet sayısı yayınladı. İşte Google'ın 19 satırından yeniden sayım:
| Kime karşı sayıldı | Argon galibiyetleri | Beraberlikler | Argon kayıpları | Bildirilmedi |
|---|---|---|---|---|
| Üç rakibin en iyisine karşı | 13 | 1 | 5 | 0 |
| Sadece GPT-6 Astra | 14 | 1 | 4 | 0 |
| Sadece Claude Opus 5.5 | 14 | 0 | 4 | 1 |
| Sadece Claude Fable 5.1 | 15 | 0 | 2 | 2 |
13, tüm alana karşı doğrudur. 14, Astra veya Opus 5.5'e karşı bire bir doğrudur. 12, tam 19 satırın hiçbir çerçevesine uymuyor, bu yüzden o kaynağın hangi satırları saydığını kontrol edin. Farklar da değişir: Harvey Legal Agent (%19,6'ya karşı %6,7) geniştir; Chartography 0,6 puandır.
Erişim açıldığı gün kendi değerlendirmenizi nasıl çalıştırırsınız?
Kıyaslamalar Google'ın araçlarını tanımlar; komutlarınız ürününüzü tanımlar. Erişebileceğiniz bir model üzerinde değerlendirmeyi bugün oluşturun, ardından tek bir değişiklikle Argon'a yönlendirin.
- İlgilendiğiniz satırlara uyan gerçek komutları seçin: bir depo düzeltmesi, bir terminal görevi, uzun bir belge sorusu.
- Apidog'da,
GEMINI_API_KEYveGEMINI_MODEL'ıgemini-3.8-flasholarak ayarlayan bir ortam oluşturun. Google, Argon'un model kimliğini henüz yayınlamadı, bu nedenle değiştireceğiniz tek değer bu değişkendir. - Her bir komutu, modeli
{{GEMINI_MODEL}}'den okuyan bir istek olarak kaydedin ve bir test senaryosunda gruplandırın. - Çıkışa (durum, gerekli alanlar, beklenen içerik) ve
usageMetadata'ya, maliyet sınırınıza göre boyutlandırılmışthoughtsTokenCountüzerinde bir tavan dahil olmak üzere onaylamalar ekleyin. - Senaryoyu şimdi 3.8 Flash üzerinde çalıştırın ve raporu temeliniz olarak saklayın.
Argon'un kimliği yayınlandığı gün, değişkeni değiştirin ve tekrar çalıştırın. Google, "tüm yeni modellerin" Interactions API üzerinde başlatılacağını söylüyor, bu nedenle her isteğin bir Interactions sürümünü de kaydedin. Argon ve Gemini 3.8 Flash karşılaştırmamız, fiyat ve sınırlar hakkında ne beklemeniz gerektiğini kapsıyor.
Sıkça Sorulan Sorular
- Gemini 4 Argon'un kıyaslamaları bağımsız olarak doğrulandı mı? Kısmen. 19 satırın dokuzu her model için herkese açık lider tablolarından geliyor ve Artificial Analysis, Vals AI ile Arena kendi sonuçlarını yayınladı. Geri kalanı Argon için Google tarafından çalıştırıldı.
- Gemini 4 Argon'un DeepSWE puanı nedir? DeepSWE v1.1'de %77,9, Opus 5.5 (%74,2) ve Astra (%74,1) önünde. Argon'un çalışması bir mini-swe ajan aracı kullandı, rakip sayılar ise bir lider tablosu ve sistem kartlarından geliyor.
- Argon, kıyaslamalarda GPT-6 Astra'yı yeniyor mu? Google'ın tablosunda bire birde, Argon 14 satırı kazanıyor, 1'inde berabere kalıyor ve 4'ünü kaybediyor. Artificial Analysis'te ise 53'te berabere kalıyorlar.
- Bu kıyaslamaları kendim yeniden çalıştırabilir miyim? Henüz değil. Argon Fairwind iş ortaklarıyla sınırlıdır ve Google henüz halka açık bir yayın tarihi vermedi; Argon yayın tarihi takipçimiz yayını takip ediyor.
Sonraki adım
Senaryoyu şimdi oluşturun, 3.8 Flash üzerinde çalıştırın ve raporu saklayın. Argon kullanıma açıldığında, değişimin ardından dakikalar içinde kendi sayılarınıza sahip olacaksınız. Kurulum için Apidog'u indirin.
düğme
