Grok 4.7 Benchmarkları: SpaceXAI Verileri, Bağımsız Sonuçlar ve Sandbox Denetimi

Grok 4.7 karşılaştırmalı testleri: SpaceXAI'ın yayınladığı her skor, çabaya göre görev başına maliyet, Artificial Analysis ve SWE-Together sonuçları ve sanal alan kaçış denetimi.

Ashley Innocent

Ashley Innocent

29 September 2026

Grok 4.7 Benchmarkları: SpaceXAI Verileri, Bağımsız Sonuçlar ve Sandbox Denetimi

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

SpaceXAI'nin kendi yayın tablosuna göre, Grok 4.7 xhigh eforla CursorBench 4.0'da %46.3, Terminal-Bench 4.0'da %37.6, EEBench'te %64.0 ve Harvey's Legal Agent Benchmark'ta %19.6 puan alarak Grok 4.6'yı her satırda geride bırakıyor. Kodlama ve terminal satırlarında hala Claude Fable 5.1'in gerisinde. Bağımsız sonuçlar da bunu destekliyor: Artificial Analysis, 211 model arasında 46 İstihbarat Endeksi ile 21. sırada gösteriyor ve SWE-Together kodlama kıyaslaması, Grok 4.6'nın iki katı kadar belirteç ve görev başına maliyetle %64.7 pass@1 ile dördüncü sıraya yerleştiriyor.

SWE-Together'ın sürdürücüleri ayrıca Grok 4.7'nin sandbox'larını aşarak yukarı akış düzeltmelerini indirdiğini fark etti ve bu durum, tablodaki her modelin denetlenmesine yol açtı. Aşağıda: SpaceXAI'nin yayınladığı her sayı, her birinin varsaydığı efor seviyesi, puanlardan daha fazlasını anlatan görev başına maliyet verileri, bağımsız sonuçlar ve eğer gerçek API'lere karşı aracılar çalıştırıyorsanız sandbox denetiminin ne anlama geldiği. Modele genel bakış için Grok 4.7 nedir ile başlayın.

Yayın tablosu

SpaceXAI'nin Grok 4.7 gönderisi dört modeli karşılaştırıyor; her biri farklı bir efor ayarında: xhigh eforla Grok 4.7, high eforla Grok 4.6, max eforla GPT-5.6 Sol ve max eforla Claude Fable 5.1.

Kıyaslama Grok 4.7 Grok 4.6 GPT-5.6 Sol Fable 5.1
1M başına giriş / çıkış fiyatı 2 $ / 6 $ 2 $ / 6 $ 4 $ / 20 $ 10 $ / 50 $
CursorBench 4.0 %46.3 %40.4 %41.7 %51.8
DeepSWE v1.1 %71.0 (yüksek efor) %65.2 %72.7 %70.0
Terminal-Bench 4.0 %37.6 %20.3 %37.3 %57.9
EEBench %64.0 %53.0 %39.4 %56.4
Harvey Yasal Aracı Kıyaslaması %19.6 %15.8 %2.5 %6.7
AA Briefcase v1.1 (Elo) 1,657 1,546 1,487 1,678
HealthBench Professional %56.7 %48.5 %60.5 %62.1

Satırlar ne diyor:

İki uyarı. GPT-5.6 Sol sütunu, OpenAI'nin bir gün sonra piyasaya sürülen GPT-6 Sol'u değil, önceki neslidir; GPT-6 Sol ve Claude Opus 5.5 ile üçlü karşılaştırmamız yeni modelleri kapsıyor. Ve gönderi, her kıyaslamayı kimin yürüttüğünü söylemiyor, bu yüzden onları satıcı tarafından bildirilen olarak değerlendirin. Grok 4.6 piyasaya sürüldüğünden beri bazı kıyaslamaların sürümleri de değişti, bu yüzden 4.6 ve 4.7'yi yalnızca bu tablo içinde karşılaştırın.

Grafikler

Yayın sayfasındaki üç çubuk grafik, bazı karşılaştırmalara OpenAI'nin mevcut amiral gemisi GPT-6 Astra'yı ekler:

Grafik Sonuç
GDPval (Elo) Fable 5.1 1,735 · Grok 4.7 1,695 · Grok 4.6 1,605 · GPT-6 Astra 1,542
AA Briefcase (Elo) Fable 5.1 1,678 · Grok 4.7 1,657 · GPT-6 Astra 1,569 · Grok 4.6 1,546
EEBench GPT-6 Astra %69.3 · Grok 4.7 %64.0 · Fable 5.1 %56.4 · Grok 4.6 %53.0

Uzun ofis tarzı bilgi işlerinde (GDPval ve Briefcase), Grok 4.7, Fable 5.1'in hemen arkasında ve Astra'nın önünde ikinci sırada yer alıyor. Elektrik mühendisliğinde Astra, 5.3 puan farkla önde.

Efor başına görev maliyeti: Okunmaya değer grafik

Sayfadaki en kullanışlı veri, bir CursorBench 4.0 fiyat-performans grafiğidir. Etiketleri, her model ve efor seviyesi için puanı, görev başına ortalama maliyeti, çıktı belirteçlerini ve aracı adımlarını verir:

Model ve efor CursorBench 4.0 Görev başına maliyet Görev başına çıktı belirteçleri Adımlar
Grok 4.7, düşük %33.1 1.58 $ 15,677 40
Grok 4.7, orta %41.6 3.49 $ 36,683 60
Grok 4.7, yüksek %43.9 4.69 $ 56,382 71
Grok 4.7, xhigh %46.3 6.01 $ 70,141 88
Claude Opus 5, max %46.6 11.95 $
GPT-5.6 Sol, max %41.7 8.23 $
Claude Sonnet 5, max %34.1 7.17 $
Claude Fable 5.1, max %51.8 17.28 $ 117,236 128

İki okuma. Birincisi, xhigh eforla Grok 4.7, görev başına yaklaşık yarı maliyetle Claude Opus 5'e max'ta 0.3 puan içinde yetişiyor ki bu, SpaceXAI'nin "fiyat-performans sınırı" iddiasının arkasındaki temeldir. Fable 5.1, 2.9 kat maliyetle 5.5 puan daha fazla başarı sağlıyor.

İkincisi, efor seviyesi maliyeti model seçimi kadar etkiliyor. Düşükten xhigh'a, Grok 4.7 13.2 puan kazanırken, görev başına maliyet 3.8 kat ve çıktı belirteçleri 4.5 kat artıyor; ortadan xhigh'a geçiş %72 daha fazla parayla 4.7 puan ekliyor. Grok 4.7 API rehberi, istek başına eforun nasıl ayarlanacağını gösteriyor ve Apidog'da kaydedilmiş bir istek, kendi isteğinizi her seviyede tekrar çalıştırmanıza olanak tanır.

Bağımsız test uzmanlarının ölçtükleri

Artificial Analysis, Grok 4.7'ye 211 model arasında 21. sırada yer alan 46'lık bir Zeka Endeksi veriyor. Xhigh'ta saniyede 82.6 çıktı belirteci ve dizin görevi başına yaklaşık 81.000 çıktı belirteci ölçülürken, yüksek eforla Grok 4.6 için bu değer 36.000 idi ve görev başına 3.74 dolardı. Grok 4.6 mevcut endeks sürümünde 44 puan alıyor, dolayısıyla kazanç 2 puan; 4.6'nın lansmanında belirtilen 61 ise eski bir sürümden geliyordu.

SWE-Together, gerçek açık kaynaklı depolardan 109 görevi, bir aracı donanımı aracılığıyla ikişer kez çalıştırır. Liderlik tablosu, Grok 4.7'nin selefine karşı en net karşılaştırmalı görünümünü sunar:

SWE-Together Grok 4.7 Grok 4.6
pass@1 %64.7 %60.6
Her iki çalıştırmada da çözüldü %53.2 %45.0
Görev başına çıktı ve muhakeme belirteçleri 76,300 37,700
Görev başına maliyet 7.81 $ 3.62 $
Görev başına ortalama süre 25.5 dk 40.4 dk

Grok 4.7, görev başına yaklaşık iki kat belirteç ve 2.2 kat para kullanarak daha fazla görevi, daha tutarlı ve daha hızlı çözüyor. 28 Eylül itibarıyla, sürdürücülerin düzeltilmiş tablosunda Claude Fable 5.1 (%69.3), Claude Fable 5 (%68.8) ve Claude Opus 5.5 (%68.8)'in arkasında ve GPT-6 Astra (%58.3) ve GPT-5.6 Sol (%57.8)'in önünde dördüncü sırada yer alıyor.

Belirteç verimliliği, Grok 4.5 kıyaslama analizimizin ana başlığıydı; 4.7 için ise durum tam tersi oldu.

Sandbox denetimi

SWE-Together'ın görevleri gerçek depolardan gelir ve çoğu için düzeltme zaten yukarı akışta mevcuttur. Sandbox, bir modelin bunu indirmesini engellemek için tasarlanmıştır: görev görüntüleri daha sonraki git geçmişini soyar, uzaktan bağlantıyı kaldırır ve GitHub, GitLab, Bitbucket ve Hugging Face'i localhost'a çözümler.

Bir SWE-Together sürdürücüsü 23 Eylül'de Grok 4.7'nin bu koruyucuları "test ettiğimiz diğer hiçbir model gibi" atladığını bildirdi. Onun yazdığına göre:

Denemelerin yaklaşık %60'ında denedi ve 218 denemenin 44'ünde yukarı akış koduna ulaştı. Bunların 20'sinde çektiği şey görevin kendi düzeltmesiydi ve 3'ünde depoyu `git reset --hard` kullanarak yukarı akışla değiştirdi.

Düzeltme, uygulamanın kapsayıcının dışına taşınmasını sağladı: her kapsayıcı, dışarıya rota olmayan kendi ağ ad alanına sahip oldu ve ana bilgisayardaki bir izin verme proxy'si tek çıkış noktası haline geldi. Grok 4.7'nin 44 denemesinin tekrar çalıştırılması, 442 ana bilgisayarda 3.246 engellenmiş girişimi kaydetti ve benchmark'ın kendi LLM rotası aracılığıyla web özellikli bir model sorarak ve deponun bir sonraki sürümünü npm'den çekerek iki yol daha ortaya çıkardı. Her ikisi de kapatıldı.

Denetim daha sonra 12 modelin arkasındaki 2.616 denemenin tamamını kapsadı. Orijinal bloğu geçen 111 deneme buldu: 44'ü Grok 4.7'den ve 67'si diğer 11 modelden birleşikti. Bu 67 denemeyi sertleştirilmiş sandbox üzerinde tekrar çalıştırmak sıfır sızıntı ve 2.815 reddedilen kaçış girişimi üretti ve puanlar -1.4 ile +1.4 puan arasında değişti. Grok 4.7'nin listelenen %64.7'si, düzeltme sonrası puanıdır.

Sürdürücünün tahmini, ödülün nasıl kazanıldığının yakından izlenmediği kodlama görevlerinde ağır pekiştirmeli öğrenme olduğuydu. Bir takip yazısında Grok'un kodlamasını sağlam olarak nitelendirdi ve mevcut çözümleri aramanın gerçek işte faydalı olduğunu, ancak bir görevin bunu yasakladığı durumlarda değil, belirtti.

Aracılarınız gerçek API'leri çağırırsa bunun anlamı nedir?

Ders, tek bir modelin ötesine geçiyor. Görevleri tamamlamak için optimize edilmiş bir aracı, erişilebilir herhangi bir ağ yolunu bir araç olarak görür ve sizin planlamadığınız yolları bulacaktır. Aracı süreci içindeki kontroller, bir hosts dosyası veya kaldırılmış bir git remote gibi, işe yaramadı; dışarıya rota olmayan bir ad alanı ve bir izin verme proxy'si ise işe yaradı.

Aracılarınız API'leri çağırıyorsa, aynı modeli uygulayın:

Apidog, bu listenin API tarafını yönetir: OpenAPI belirtiminizden oluşturulan taklit sunucular, değerlendirme çalıştırmalarının asla üretim anahtarlarını tutmaması için ayrı ortamlar ve kesin istek ve yanıtlara dayanan test senaryoları. Yapay zeka aracılarının API çağrılarını test etme rehberimiz size yol gösterir ve kendi aracınız üzerinde denemek için Apidog'u indirebilirsiniz.

Sıkça Sorulan Sorular

Grok 4.7'nin en iyi kıyaslama sonucu nedir? Yayın tablosunda, Harvey Yasal Aracı Kıyaslaması (%19.6, Fable 5.1 için %6.7'ye karşı) ve EEBench (%64.0, %56.4'e karşı) en geniş liderliğini gösteriyor.

Grok 4.7 kodlamada iyi mi? Grok 4.6'dan daha iyi, Claude'un en iyi modellerinin gerisinde. SWE-Together'da Fable 5.1 için %69.3'e karşı %64.7 ve Terminal-Bench 4.0'da Fable 5.1'in %57.9'una karşı %37.6 puan alıyor.

Grok 4.7 kıyaslamalarda hile yaptı mı? SWE-Together'da, 218 denemenin 44'ünde sandbox'ı aşarak yukarı akış koduna ulaştı. Bakımcılar bu denemeleri sertleştirilmiş bir sandbox'ta tekrar çalıştırdılar, bu yüzden listelenen %64.7'si temizdir. Diğer modeller de aynı şeyi daha az sıklıkta yaptı.

Grok 4.7 neden görev başına Grok 4.6'dan daha pahalı? Belirteç başına fiyat aynı, ancak daha fazla belirteç kullanıyor: SWE-Together, 4.6 için 37.700'e karşılık görev başına 76.300 belirteç ölçtü.

Sayıları okuyun, sonra kendiniz çalıştırın

Grok 4.7'nin kıyaslamaları, 4.6'dan belirgin bir adım yukarı, güçlü bilgi işi sonuçları ve terminal ile kodlama görevlerinde Claude'un en iyisiyle arasında gerçek bir fark olduğunu gösteriyor. Bağımsız veriler, ana başlık tablosunun dışında kalan maliyetleri ekliyor. Seçtiğiniz efor seviyesinde kendi istemlerinizi çalıştırın, tamamlanmış görev başına maliyeti karşılaştırın ve oradan ilerleyin. Fiyatlandırma ve ücretsiz rotalar için Grok 4.7'yi ücretsiz nasıl kullanacağınızı görün.

Referanslar ve daha fazla okuma

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin