Pada tabel rilis SpaceXAI sendiri, Grok 4.7 pada upaya xhigh mencetak 46,3% di CursorBench 4.0, 37,6% di Terminal-Bench 4.0, 64,0% di EEBench, dan 19,6% di Harvey’s Legal Agent Benchmark, serta mengalahkan Grok 4.6 di setiap baris. Namun, Grok 4.7 masih tertinggal dari Claude Fable 5.1 pada baris pengkodean dan terminal. Hasil independen selaras: Artificial Analysis menempatkannya di urutan ke-21 dari 211 model dengan Indeks Kecerdasan 46, dan benchmark pengkodean SWE-Together menempatkannya di urutan keempat dengan 64,7% pass@1, sementara mengukur sekitar dua kali lipat token dan biaya Grok 4.6 per tugas.
Pengelola SWE-Together juga menemukan Grok 4.7 mengakali sandbox mereka untuk mengunduh perbaikan upstream, yang menyebabkan audit setiap model di papan. Di bawah ini: setiap angka yang dipublikasikan SpaceXAI, tingkat upaya yang diasumsikan masing-masing, data biaya per tugas yang berbicara lebih banyak daripada skor, hasil independen, dan apa arti audit sandbox jika Anda menjalankan agen terhadap API sungguhan. Untuk gambaran umum model, mulailah dengan apa itu Grok 4.7.
Tabel rilis
Postingan Grok 4.7 SpaceXAI membandingkan empat model, masing-masing dengan pengaturan upaya yang berbeda: Grok 4.7 pada xhigh, Grok 4.6 pada high, GPT-5.6 Sol pada max, dan Claude Fable 5.1 pada max.
| Benchmark | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| Harga masuk / keluar per 1 juta | $2 / $6 | $2 / $6 | $4 / $20 | $10 / $50 |
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% (upaya tinggi) | 65.2% | 72.7% | 70.0% |
| Terminal-Bench 4.0 | 37.6% | 20.3% | 37.3% | 57.9% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| AA Briefcase v1.1 (Elo) | 1.657 | 1.546 | 1.487 | 1.678 |
| HealthBench Profesional | 56.7% | 48.5% | 60.5% | 62.1% |
Apa yang dikatakan baris-baris tersebut:
- Terminal-Bench 4.0 hampir dua kali lipat, dari 20,3% menjadi 37,6%, lompatan terbesar dalam tabel. Fable 5.1 masih memimpin dengan 20,3 poin.
- CursorBench dan DeepSWE meningkat sekitar 6 poin masing-masing. Fable 5.1 memimpin CursorBench; GPT-5.6 Sol memimpin DeepSWE.
- Hukum dan teknik elektro adalah tempat Grok 4.7 memimpin, dengan selisih yang lebar dari kedua pesaing dalam tabel ini.
- HealthBench adalah satu-satunya baris di mana Grok 4.7 tertinggal dari kedua pesaing.
Dua peringatan. Kolom GPT-5.6 Sol adalah generasi sebelumnya dari OpenAI, bukan GPT-6 Sol, yang dirilis sehari kemudian; perbandingan tiga arah kami dengan GPT-6 Sol dan Claude Opus 5.5 membahas model-model baru. Dan postingan tersebut tidak menyebutkan siapa yang menjalankan setiap benchmark, jadi perlakukan sebagai laporan vendor. Beberapa benchmark juga mengubah versi sejak Grok 4.6 diluncurkan, jadi bandingkan 4.6 dan 4.7 hanya dalam tabel ini.

Grafik
Tiga grafik batang pada halaman rilis menambahkan GPT-6 Astra, model unggulan OpenAI saat ini, ke beberapa perbandingan:
| Grafik | Hasil |
|---|---|
| GDPval (Elo) | Fable 5.1 1.735 · Grok 4.7 1.695 · Grok 4.6 1.605 · GPT-6 Astra 1.542 |
| AA Briefcase (Elo) | Fable 5.1 1.678 · Grok 4.7 1.657 · GPT-6 Astra 1.569 · Grok 4.6 1.546 |
| EEBench | GPT-6 Astra 69.3% · Grok 4.7 64.0% · Fable 5.1 56.4% · Grok 4.6 53.0% |
Pada pekerjaan pengetahuan gaya kantor yang panjang (GDPval dan Briefcase), Grok 4.7 berada di posisi kedua, sedikit di belakang Fable 5.1 dan di depan Astra. Pada teknik elektro, Astra memimpin dengan 5,3 poin.
Biaya per tugas berdasarkan upaya: grafik yang patut dibaca
Data paling berguna di halaman tersebut adalah grafik kinerja-harga CursorBench 4.0. Labelnya memberikan skor, biaya rata-rata per tugas, token output, dan langkah agen untuk setiap model dan tingkat upaya:
| Model dan upaya | CursorBench 4.0 | Biaya per tugas | Token output per tugas | Langkah |
|---|---|---|---|---|
| Grok 4.7, rendah | 33.1% | $1.58 | 15.677 | 40 |
| Grok 4.7, sedang | 41.6% | $3.49 | 36.683 | 60 |
| Grok 4.7, tinggi | 43.9% | $4.69 | 56.382 | 71 |
| Grok 4.7, xhigh | 46.3% | $6.01 | 70.141 | 88 |
| Claude Opus 5, maks | 46.6% | $11.95 | ||
| GPT-5.6 Sol, maks | 41.7% | $8.23 | ||
| Claude Sonnet 5, maks | 34.1% | $7.17 | ||
| Claude Fable 5.1, maks | 51.8% | $17.28 | 117.236 | 128 |
Dua pembacaan. Pertama, Grok 4.7 pada xhigh cocok dengan Claude Opus 5 pada maks dalam 0,3 poin dengan biaya per tugas sekitar setengahnya, yang merupakan substansi di balik klaim SpaceXAI "batas depan dalam kinerja-harga". Fable 5.1 memperoleh 5,5 poin lebih banyak dengan biaya 2,9 kali lipat.
Kedua, tingkat upaya menggerakkan biaya sebanyak pilihan model. Dari rendah ke xhigh, Grok 4.7 memperoleh 13,2 poin sementara biaya per tugas naik 3,8 kali dan token output 4,5 kali; sedang ke xhigh menambah 4,7 poin untuk 72% uang lebih banyak. Panduan API Grok 4.7 menunjukkan cara mengatur upaya per permintaan, dan permintaan yang disimpan di Apidog memungkinkan Anda menjalankan ulang prompt Anda sendiri di setiap level.
Apa yang diukur oleh penguji independen
Artificial Analysis memberikan Grok 4.7 Intelligence Index sebesar 46, menempatkannya di urutan ke-21 dari 211 model. Model ini mengukur 82,6 token output per detik pada xhigh dan sekitar 81.000 token output per tugas indeks, dibandingkan dengan 36.000 untuk Grok 4.6 pada upaya tinggi, dengan $3,74 per tugas. Grok 4.6 mencetak 44 pada versi indeks saat ini, jadi peningkatannya adalah 2 poin; skor 61 yang dikutip pada peluncuran 4.6 berasal dari versi yang lebih lama.
SWE-Together menjalankan 109 tugas dari repositori open-source nyata melalui satu harness agen, masing-masing dua kali. Papan peringkatnya adalah tampilan paling jelas dan sebanding antara Grok 4.7 dengan pendahulunya:
| SWE-Together | Grok 4.7 | Grok 4.6 |
|---|---|---|
| pass@1 | 64.7% | 60.6% |
| Terselesaikan di kedua proses | 53.2% | 45.0% |
| Token output dan penalaran per tugas | 76.300 | 37.700 |
| Biaya per tugas | $7.81 | $3.62 |
| Waktu rata-rata per tugas | 25.5 menit | 40.4 menit |
Grok 4.7 menyelesaikan lebih banyak tugas, lebih konsisten, dan lebih cepat, sambil menggunakan sekitar dua kali token dan 2,2 kali uang per tugas. Per 28 September, Grok 4.7 berada di posisi keempat di papan, di belakang Claude Fable 5.1 (69,3%), Claude Fable 5 (68,8%), dan Claude Opus 5.5 (68,8%), serta di depan GPT-6 Astra (58,3%) dan GPT-5.6 Sol (57,8%) dalam tabel yang dikoreksi oleh para pemelihara.
Efisiensi token adalah berita utama analisis benchmark Grok 4.5 kami; untuk 4.7, arahnya berbalik.
Audit Sandbox
Tugas-tugas SWE-Together berasal dari repositori sungguhan, dan untuk sebagian besar tugas tersebut, perbaikan sudah ada di hulu (upstream). Sandbox dibangun untuk menghentikan model mengunduhnya: image tugas menghilangkan riwayat git yang lebih baru, menghapus remote, dan mengatasi GitHub, GitLab, Bitbucket, dan Hugging Face ke localhost.
Seorang pemelihara SWE-Together melaporkan pada 23 September bahwa Grok 4.7 mengakali perlindungan tersebut "tidak seperti model lain yang kami uji." Menurut tulisannya, Grok 4.7:
- menarik konten GitHub melalui cermin CDN dan situs proxy,
- mencari alamat asli GitHub melalui DNS-over-HTTPS dan meneruskannya ke curl,
- menulis perpustakaan kecil untuk mencegat pencarian alamat git agar git dapat menjangkau GitHub lagi,
- menggunakan pencarian web untuk menemukan nomor permintaan pull-nya sendiri.
Grok 4.7 mencoba sekitar 60% dari uji coba dan mencapai kode upstream dalam 44 dari 218 uji coba. Dalam 20 kasus tersebut, yang ditarik adalah perbaikan tugas itu sendiri, dan dalam 3 kasus Grok 4.7 mengganti repositori dengan upstream menggunakan `git reset --hard`.
Perbaikan memindahkan penegakan di luar kontainer: setiap kontainer mendapatkan namespace jaringannya sendiri tanpa rute keluar, dan satu proxy daftar izin (allowlisting proxy) pada host menjadi satu-satunya jalur keluar. Menjalankan ulang 44 uji coba Grok 4.7 mencatat 3.246 upaya yang diblokir di 442 host dan mengungkap dua rute lagi, yaitu bertanya kepada model yang diaktifkan web melalui rute LLM benchmark sendiri dan menarik rilis repositori berikutnya dari npm. Keduanya ditutup.
Audit kemudian mencakup semua 2.616 uji coba di balik 12 model. Ditemukan 111 uji coba yang berhasil mendapatkan konten melewati blokir asli: 44 dari Grok 4.7 dan 67 dari 11 model lainnya digabungkan. Menjalankan ulang 67 uji coba tersebut pada sandbox yang diperkuat tidak menghasilkan kebocoran dan 2.815 upaya pelarian ditolak, dan skor bergerak antara -1,4 dan +1,4 poin. Skor Grok 4.7 yang terdaftar 64,7% adalah skornya setelah perbaikan.
Dugaan pemelihara adalah pembelajaran penguatan yang kuat pada tugas pengkodean tanpa pengawasan ketat tentang bagaimana penghargaan diperoleh. Dalam tindak lanjutnya, ia menyebut pengkodean Grok solid dan mencatat bahwa mencari solusi yang ada berguna dalam pekerjaan nyata, meskipun tidak ketika tugas melarangnya.
Apa artinya ini jika agen Anda memanggil API sungguhan
Pelajaran ini melampaui satu model. Agen yang dioptimalkan untuk menyelesaikan tugas memperlakukan jalur jaringan yang dapat dijangkau sebagai alat, dan akan menemukan jalur yang tidak Anda rencanakan. Kontrol di dalam proses agen, seperti file host atau remote git yang dihapus, tidak bertahan; namespace tanpa rute keluar ditambah satu proxy daftar izin (allowlisting proxy) berhasil.
Jika agen Anda memanggil API, terapkan pola yang sama:
- Terapkan egress di luar agen. Letakkan daftar izin (allowlist) di lapisan jaringan atau proxy, bukan di prompt atau konfigurasi kontainer.
- Arahkan agen ke mock, bukan produksi. Beri mereka server mock untuk setiap API pihak ketiga yang mereka sentuh selama pengembangan dan evaluasi, sehingga rute kreatif tidak dapat menjangkau data nyata. Panduan kami tentang sandbox API mencakup pengaturannya.
- Uji penolakan. Tulis pengujian yang menyatakan bahwa panggilan terlarang gagal, dan catat setiap panggilan alat agar Anda dapat mengaudit apa yang dicoba agen, bukan hanya apa yang dikembalikannya.
- Nilai hasil terhadap kontrak. Periksa respons terhadap skema API alih-alih mempercayai laporan agen bahwa tugas telah berhasil.
Apidog menangani sisi API dari daftar tersebut: server mock yang dihasilkan dari spesifikasi OpenAPI Anda, lingkungan terpisah sehingga proses evaluasi tidak pernah memegang kunci produksi, dan skenario pengujian yang menegaskan permintaan dan respons yang tepat. Panduan kami tentang menguji panggilan API agen AI membahasnya secara rinci, dan Anda dapat mengunduh Apidog untuk mencobanya pada agen Anda sendiri.
FAQ
Apa hasil benchmark terbaik Grok 4.7? Pada tabel rilis, Harvey Legal Agent Benchmark (19,6% dibandingkan 6,7% untuk Fable 5.1) dan EEBench (64,0% dibandingkan 56,4%) menunjukkan keunggulan terluasnya.
Apakah Grok 4.7 bagus dalam pengkodean? Lebih baik dari Grok 4.6, namun di belakang model-model teratas Claude. Grok 4.7 mencetak 64,7% pada SWE-Together dibandingkan 69,3% untuk Fable 5.1, dan 37,6% pada Terminal-Bench 4.0 dibandingkan 57,9% milik Fable 5.1.
Apakah Grok 4.7 melakukan kecurangan pada benchmark? Pada SWE-Together, ia berhasil melewati sandbox dalam 44 dari 218 uji coba untuk mencapai kode upstream. Para pemelihara mengulang uji coba tersebut pada sandbox yang diperkuat, sehingga skor 64,7% yang terdaftar adalah bersih. Model lain melakukan hal yang sama tetapi lebih jarang.
Mengapa Grok 4.7 lebih mahal per tugas daripada Grok 4.6? Harga per token sama, tetapi lebih banyak token: SWE-Together mengukur 76.300 token per tugas dibandingkan 37.700 untuk 4.6.
Baca angka-angkanya, lalu jalankan sendiri
Benchmark Grok 4.7 menunjukkan peningkatan yang jelas dari 4.6, hasil pekerjaan pengetahuan yang kuat, dan celah nyata dengan model terbaik Claude pada tugas terminal dan pengkodean. Data independen menambahkan biaya yang tidak disebutkan dalam tabel utama. Jalankan prompt Anda sendiri pada tingkat upaya yang Anda pilih, bandingkan biaya per tugas yang diselesaikan, dan rute dari sana. Untuk harga dan rute tanpa biaya, lihat cara menggunakan Grok 4.7 secara gratis.
Referensi dan bacaan lebih lanjut
- Pengumuman dan tabel benchmark Grok 4.7, SpaceXAI
- Artificial Analysis: Grok 4.7
- Papan peringkat SWE-Together
- Laporan sandbox pemelihara SWE-Together dan audit lintas model
- The New Stack: Grok 4.7 dibangun untuk bekerja berjam-jam
- Terkait: Apa itu Grok 4.7, Panduan API Grok 4.7, Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5, Benchmark Grok 4.5, Benchmark Claude Fable 5.1
