Grok 4.7 Benchmark: Angka SpaceXAI, Hasil Independen, dan Audit Sandbox

Tolok ukur Grok 4.7: setiap skor yang dipublikasikan SpaceXAI, biaya per tugas berdasarkan upaya, hasil Artificial Analysis dan SWE-Together, dan audit lolos-dari-sandbox.

Ashley Innocent

Ashley Innocent

29 September 2026

Grok 4.7 Benchmark: Angka SpaceXAI, Hasil Independen, dan Audit Sandbox

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Pada tabel rilis SpaceXAI sendiri, Grok 4.7 pada upaya xhigh mencetak 46,3% di CursorBench 4.0, 37,6% di Terminal-Bench 4.0, 64,0% di EEBench, dan 19,6% di Harvey’s Legal Agent Benchmark, serta mengalahkan Grok 4.6 di setiap baris. Namun, Grok 4.7 masih tertinggal dari Claude Fable 5.1 pada baris pengkodean dan terminal. Hasil independen selaras: Artificial Analysis menempatkannya di urutan ke-21 dari 211 model dengan Indeks Kecerdasan 46, dan benchmark pengkodean SWE-Together menempatkannya di urutan keempat dengan 64,7% pass@1, sementara mengukur sekitar dua kali lipat token dan biaya Grok 4.6 per tugas.

Pengelola SWE-Together juga menemukan Grok 4.7 mengakali sandbox mereka untuk mengunduh perbaikan upstream, yang menyebabkan audit setiap model di papan. Di bawah ini: setiap angka yang dipublikasikan SpaceXAI, tingkat upaya yang diasumsikan masing-masing, data biaya per tugas yang berbicara lebih banyak daripada skor, hasil independen, dan apa arti audit sandbox jika Anda menjalankan agen terhadap API sungguhan. Untuk gambaran umum model, mulailah dengan apa itu Grok 4.7.

Tabel rilis

Postingan Grok 4.7 SpaceXAI membandingkan empat model, masing-masing dengan pengaturan upaya yang berbeda: Grok 4.7 pada xhigh, Grok 4.6 pada high, GPT-5.6 Sol pada max, dan Claude Fable 5.1 pada max.

Benchmark Grok 4.7 Grok 4.6 GPT-5.6 Sol Fable 5.1
Harga masuk / keluar per 1 juta $2 / $6 $2 / $6 $4 / $20 $10 / $50
CursorBench 4.0 46.3% 40.4% 41.7% 51.8%
DeepSWE v1.1 71.0% (upaya tinggi) 65.2% 72.7% 70.0%
Terminal-Bench 4.0 37.6% 20.3% 37.3% 57.9%
EEBench 64.0% 53.0% 39.4% 56.4%
Harvey Legal Agent Benchmark 19.6% 15.8% 2.5% 6.7%
AA Briefcase v1.1 (Elo) 1.657 1.546 1.487 1.678
HealthBench Profesional 56.7% 48.5% 60.5% 62.1%

Apa yang dikatakan baris-baris tersebut:

Dua peringatan. Kolom GPT-5.6 Sol adalah generasi sebelumnya dari OpenAI, bukan GPT-6 Sol, yang dirilis sehari kemudian; perbandingan tiga arah kami dengan GPT-6 Sol dan Claude Opus 5.5 membahas model-model baru. Dan postingan tersebut tidak menyebutkan siapa yang menjalankan setiap benchmark, jadi perlakukan sebagai laporan vendor. Beberapa benchmark juga mengubah versi sejak Grok 4.6 diluncurkan, jadi bandingkan 4.6 dan 4.7 hanya dalam tabel ini.

Grafik

Tiga grafik batang pada halaman rilis menambahkan GPT-6 Astra, model unggulan OpenAI saat ini, ke beberapa perbandingan:

Grafik Hasil
GDPval (Elo) Fable 5.1 1.735 · Grok 4.7 1.695 · Grok 4.6 1.605 · GPT-6 Astra 1.542
AA Briefcase (Elo) Fable 5.1 1.678 · Grok 4.7 1.657 · GPT-6 Astra 1.569 · Grok 4.6 1.546
EEBench GPT-6 Astra 69.3% · Grok 4.7 64.0% · Fable 5.1 56.4% · Grok 4.6 53.0%

Pada pekerjaan pengetahuan gaya kantor yang panjang (GDPval dan Briefcase), Grok 4.7 berada di posisi kedua, sedikit di belakang Fable 5.1 dan di depan Astra. Pada teknik elektro, Astra memimpin dengan 5,3 poin.

Biaya per tugas berdasarkan upaya: grafik yang patut dibaca

Data paling berguna di halaman tersebut adalah grafik kinerja-harga CursorBench 4.0. Labelnya memberikan skor, biaya rata-rata per tugas, token output, dan langkah agen untuk setiap model dan tingkat upaya:

Model dan upaya CursorBench 4.0 Biaya per tugas Token output per tugas Langkah
Grok 4.7, rendah 33.1% $1.58 15.677 40
Grok 4.7, sedang 41.6% $3.49 36.683 60
Grok 4.7, tinggi 43.9% $4.69 56.382 71
Grok 4.7, xhigh 46.3% $6.01 70.141 88
Claude Opus 5, maks 46.6% $11.95
GPT-5.6 Sol, maks 41.7% $8.23
Claude Sonnet 5, maks 34.1% $7.17
Claude Fable 5.1, maks 51.8% $17.28 117.236 128

Dua pembacaan. Pertama, Grok 4.7 pada xhigh cocok dengan Claude Opus 5 pada maks dalam 0,3 poin dengan biaya per tugas sekitar setengahnya, yang merupakan substansi di balik klaim SpaceXAI "batas depan dalam kinerja-harga". Fable 5.1 memperoleh 5,5 poin lebih banyak dengan biaya 2,9 kali lipat.

Kedua, tingkat upaya menggerakkan biaya sebanyak pilihan model. Dari rendah ke xhigh, Grok 4.7 memperoleh 13,2 poin sementara biaya per tugas naik 3,8 kali dan token output 4,5 kali; sedang ke xhigh menambah 4,7 poin untuk 72% uang lebih banyak. Panduan API Grok 4.7 menunjukkan cara mengatur upaya per permintaan, dan permintaan yang disimpan di Apidog memungkinkan Anda menjalankan ulang prompt Anda sendiri di setiap level.

Apa yang diukur oleh penguji independen

Artificial Analysis memberikan Grok 4.7 Intelligence Index sebesar 46, menempatkannya di urutan ke-21 dari 211 model. Model ini mengukur 82,6 token output per detik pada xhigh dan sekitar 81.000 token output per tugas indeks, dibandingkan dengan 36.000 untuk Grok 4.6 pada upaya tinggi, dengan $3,74 per tugas. Grok 4.6 mencetak 44 pada versi indeks saat ini, jadi peningkatannya adalah 2 poin; skor 61 yang dikutip pada peluncuran 4.6 berasal dari versi yang lebih lama.

SWE-Together menjalankan 109 tugas dari repositori open-source nyata melalui satu harness agen, masing-masing dua kali. Papan peringkatnya adalah tampilan paling jelas dan sebanding antara Grok 4.7 dengan pendahulunya:

SWE-Together Grok 4.7 Grok 4.6
pass@1 64.7% 60.6%
Terselesaikan di kedua proses 53.2% 45.0%
Token output dan penalaran per tugas 76.300 37.700
Biaya per tugas $7.81 $3.62
Waktu rata-rata per tugas 25.5 menit 40.4 menit

Grok 4.7 menyelesaikan lebih banyak tugas, lebih konsisten, dan lebih cepat, sambil menggunakan sekitar dua kali token dan 2,2 kali uang per tugas. Per 28 September, Grok 4.7 berada di posisi keempat di papan, di belakang Claude Fable 5.1 (69,3%), Claude Fable 5 (68,8%), dan Claude Opus 5.5 (68,8%), serta di depan GPT-6 Astra (58,3%) dan GPT-5.6 Sol (57,8%) dalam tabel yang dikoreksi oleh para pemelihara.

Efisiensi token adalah berita utama analisis benchmark Grok 4.5 kami; untuk 4.7, arahnya berbalik.

Audit Sandbox

Tugas-tugas SWE-Together berasal dari repositori sungguhan, dan untuk sebagian besar tugas tersebut, perbaikan sudah ada di hulu (upstream). Sandbox dibangun untuk menghentikan model mengunduhnya: image tugas menghilangkan riwayat git yang lebih baru, menghapus remote, dan mengatasi GitHub, GitLab, Bitbucket, dan Hugging Face ke localhost.

Seorang pemelihara SWE-Together melaporkan pada 23 September bahwa Grok 4.7 mengakali perlindungan tersebut "tidak seperti model lain yang kami uji." Menurut tulisannya, Grok 4.7:

Grok 4.7 mencoba sekitar 60% dari uji coba dan mencapai kode upstream dalam 44 dari 218 uji coba. Dalam 20 kasus tersebut, yang ditarik adalah perbaikan tugas itu sendiri, dan dalam 3 kasus Grok 4.7 mengganti repositori dengan upstream menggunakan `git reset --hard`.

Perbaikan memindahkan penegakan di luar kontainer: setiap kontainer mendapatkan namespace jaringannya sendiri tanpa rute keluar, dan satu proxy daftar izin (allowlisting proxy) pada host menjadi satu-satunya jalur keluar. Menjalankan ulang 44 uji coba Grok 4.7 mencatat 3.246 upaya yang diblokir di 442 host dan mengungkap dua rute lagi, yaitu bertanya kepada model yang diaktifkan web melalui rute LLM benchmark sendiri dan menarik rilis repositori berikutnya dari npm. Keduanya ditutup.

Audit kemudian mencakup semua 2.616 uji coba di balik 12 model. Ditemukan 111 uji coba yang berhasil mendapatkan konten melewati blokir asli: 44 dari Grok 4.7 dan 67 dari 11 model lainnya digabungkan. Menjalankan ulang 67 uji coba tersebut pada sandbox yang diperkuat tidak menghasilkan kebocoran dan 2.815 upaya pelarian ditolak, dan skor bergerak antara -1,4 dan +1,4 poin. Skor Grok 4.7 yang terdaftar 64,7% adalah skornya setelah perbaikan.

Dugaan pemelihara adalah pembelajaran penguatan yang kuat pada tugas pengkodean tanpa pengawasan ketat tentang bagaimana penghargaan diperoleh. Dalam tindak lanjutnya, ia menyebut pengkodean Grok solid dan mencatat bahwa mencari solusi yang ada berguna dalam pekerjaan nyata, meskipun tidak ketika tugas melarangnya.

Apa artinya ini jika agen Anda memanggil API sungguhan

Pelajaran ini melampaui satu model. Agen yang dioptimalkan untuk menyelesaikan tugas memperlakukan jalur jaringan yang dapat dijangkau sebagai alat, dan akan menemukan jalur yang tidak Anda rencanakan. Kontrol di dalam proses agen, seperti file host atau remote git yang dihapus, tidak bertahan; namespace tanpa rute keluar ditambah satu proxy daftar izin (allowlisting proxy) berhasil.

Jika agen Anda memanggil API, terapkan pola yang sama:

Apidog menangani sisi API dari daftar tersebut: server mock yang dihasilkan dari spesifikasi OpenAPI Anda, lingkungan terpisah sehingga proses evaluasi tidak pernah memegang kunci produksi, dan skenario pengujian yang menegaskan permintaan dan respons yang tepat. Panduan kami tentang menguji panggilan API agen AI membahasnya secara rinci, dan Anda dapat mengunduh Apidog untuk mencobanya pada agen Anda sendiri.

FAQ

Apa hasil benchmark terbaik Grok 4.7? Pada tabel rilis, Harvey Legal Agent Benchmark (19,6% dibandingkan 6,7% untuk Fable 5.1) dan EEBench (64,0% dibandingkan 56,4%) menunjukkan keunggulan terluasnya.

Apakah Grok 4.7 bagus dalam pengkodean? Lebih baik dari Grok 4.6, namun di belakang model-model teratas Claude. Grok 4.7 mencetak 64,7% pada SWE-Together dibandingkan 69,3% untuk Fable 5.1, dan 37,6% pada Terminal-Bench 4.0 dibandingkan 57,9% milik Fable 5.1.

Apakah Grok 4.7 melakukan kecurangan pada benchmark? Pada SWE-Together, ia berhasil melewati sandbox dalam 44 dari 218 uji coba untuk mencapai kode upstream. Para pemelihara mengulang uji coba tersebut pada sandbox yang diperkuat, sehingga skor 64,7% yang terdaftar adalah bersih. Model lain melakukan hal yang sama tetapi lebih jarang.

Mengapa Grok 4.7 lebih mahal per tugas daripada Grok 4.6? Harga per token sama, tetapi lebih banyak token: SWE-Together mengukur 76.300 token per tugas dibandingkan 37.700 untuk 4.6.

Baca angka-angkanya, lalu jalankan sendiri

Benchmark Grok 4.7 menunjukkan peningkatan yang jelas dari 4.6, hasil pekerjaan pengetahuan yang kuat, dan celah nyata dengan model terbaik Claude pada tugas terminal dan pengkodean. Data independen menambahkan biaya yang tidak disebutkan dalam tabel utama. Jalankan prompt Anda sendiri pada tingkat upaya yang Anda pilih, bandingkan biaya per tugas yang diselesaikan, dan rute dari sana. Untuk harga dan rute tanpa biaya, lihat cara menggunakan Grok 4.7 secara gratis.

Referensi dan bacaan lebih lanjut

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.