Grok 4.7 adalah yang termurah di antara ketiganya dalam hal token keluaran ($6 per juta, dibandingkan $10 untuk GPT-6 Sol dan $20 untuk Claude Opus 5.5), dan Opus 5.5 memimpin pada setiap benchmark coding di mana dua vendor ini mempublikasikan nama yang sama. Pada Artificial Analysis Intelligence Index, sebuah komposit pihak ketiga, urutannya adalah Opus 5.5 di 58, Sol di 48, dan Grok 4.7 di 46. Mana yang lebih murah bagi Anda tergantung pada caching dan berapa banyak token yang dihabiskan setiap model per tugas; pada beban kerja agen yang banyak menggunakan cache, Sol sedikit mengungguli Grok.
Ketiganya dikirim dalam waktu sekitar 36 jam. SpaceXAI merilis Grok 4.7 pada 21 September 2026, dan Anthropic serta OpenAI merilis Opus 5.5 dan Sol pada 22 September. Waktu perilisan ini menciptakan masalah yang harus Anda ketahui sebelum membaca perbandingan apa pun, termasuk yang satu ini. Di bawah ini: lembar spesifikasi, baris benchmark yang tumpang tindih, perhitungan harga dengan dan tanpa caching, saran perutean, dan cara menguji ketiganya dalam satu proyek Apidog. Untuk setiap model secara terpisah, lihat apa itu Grok 4.7, apa itu GPT-6 Sol, dan apa itu Claude Opus 5.5.
Tidak Ada yang Membandingkan Ketiganya Satu Sama Lain
Setiap peluncuran membandingkan dengan model yang ada saat laporan ditulis:
- Postingan Grok 4.7 dari SpaceXAI SpaceXAI membandingkan dengan Grok 4.6, GPT-5.6 Sol, dan Claude Fable 5.1, ditambah GPT-6 Astra pada dua grafik. Perhatikan namanya: GPT-5.6 Sol adalah generasi sebelumnya, terdaftar dengan harga $4/$20 di halaman itu, bukan GPT-6 Sol yang dirilis keesokan harinya.
- Peluncuran Sol oleh OpenAI membandingkan dengan Claude Opus 5, yang digantikan oleh Opus 5.5 beberapa jam kemudian.
- Peluncuran Opus 5.5 oleh Anthropic mempublikasikan skor tanpa kolom pesaing.
Jadi tidak ada tabel vendor yang mencakup ketiganya. Yang bisa Anda lakukan adalah menyelaraskan baris yang memiliki nama benchmark yang sama, membacanya sebagai petunjuk arah daripada peringkat, dan menggunakan indeks pihak ketiga sebagai penentu. Perbandingan GPT-6 Sol vs Claude Opus 5.5 kami membahas lebih dalam tentang pasangan itu.
Lembar Spesifikasi
| Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 | |
|---|---|---|---|
| ID model API | grok-4.7 |
gpt-6-sol |
claude-opus-5-5 |
| Dirilis | 21 Sep 2026 | 22 Sep 2026 | 22 Sep 2026 |
| Input / output per 1 Juta | $2 / $6 | $2 / $10 | $4 / $20 |
| Pembacaan input yang di-cache per 1 Juta | $0.50 | $0.20 (diskon 90%) | $0.20 |
| Jendela konteks | 500,000 | 872,000 | 1,000,000 |
| Output maks | tidak tercantum | tidak disebutkan | 128,000 |
| Indeks Kecerdasan AA (pihak ketiga) | 46 (#21 dari 211) | 48 | 58 (#1 dari 212) |
| Kecepatan output AA (pihak ketiga) | 82.6 token/dtk pada xhigh | 115.2 token/dtk pada maks, 102 dtk untuk token pertama | tidak ada dalam sumber kami |
| Tempat memanggilnya | xAI API, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel | OpenAI API, ChatGPT Work, Codex | Claude Platform, AWS, Google Cloud, Azure |
Dua baris menentukan sebagian besar beban kerja. Harga keluaran: $6 Grok 4.7 adalah 40% di bawah Sol dan 70% di bawah Opus 5.5, dan itu penting untuk model penalaran karena token berpikir ditagih sebagai keluaran. Konteks: Grok 4.7 memiliki jendela terkecil, dan xAI menagih seluruh permintaan dengan tarif ganda (input $4, output $12) setelah sebuah prompt mencapai 200.000 token.
Benchmark yang Tumpang Tindih
Baris-baris ini memiliki nama benchmark yang sama di seluruh lembar vendor. Setiap vendor menjalankan modelnya sendiri pada alat pengujinya sendiri dengan pengaturan upaya sendiri, jadi celah kecil adalah noise. Celah besar masih memberi tahu Anda sesuatu.
| Benchmark (dijalankan vendor) | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 37.6% (xhigh) | tidak diterbitkan | 66.4% |
| CursorBench 4.0 | 46.3% (xhigh) | tidak diterbitkan | 57.8% |
| DeepSWE v1.1 | 71.0% (tinggi) | 68.8% (maks) | tidak diterbitkan |
| GDPval, Elo | 1,695 (xhigh) | tidak diterbitkan | 1,846 (GDPval-AA v2.1) |
Cara membacanya:
- Pekerjaan terminal sangat menguntungkan Opus 5.5. Selisih 28,8 poin pada Terminal-Bench 4.0 terlalu besar untuk dijelaskan hanya dengan perbedaan alat uji. 37,6% Grok 4.7 adalah lompatan besar dari 20,3% Grok 4.6, dan masih jauh di belakang.
- CursorBench menunjuk ke arah yang sama dengan selisih 11,5 poin.
- DeepSWE setara. Grok 4.7 pada upaya tinggi dan Sol pada upaya maks berjarak 2,2 poin, berada dalam batas yang dihasilkan oleh alat uji yang berbeda.
- Versi GDPval mungkin berbeda. Grafik Grok tidak menyebutkan versi, jadi perlakukan selisih 151 poin sebagai petunjuk.
Grok 4.7 memang memimpin pada dua evaluasi dari lembar datanya sendiri: Harvey’s Legal Agent Benchmark sebesar 19,6% (GPT-5.6 Sol 2,5%, Fable 5.1 6,7%) dan EEBench, evaluasi teknik elektro, sebesar 64,0% (Fable 5.1 56,4%; GPT-6 Astra 69,3% pada grafik yang sama). Baik Sol maupun Opus 5.5 tidak memiliki skor yang dipublikasikan pada keduanya, jadi bacalah ini sebagai sinyal untuk pekerjaan pengetahuan hukum dan teknik, bukan kemenangan atas dua pesaing ini.
Satu alat uji independen menjalankan dua dari ketiganya dengan cara yang sama. Pada SWE-Together, 109 tugas repositori nyata dijalankan melalui satu alat agen, Opus 5.5 mencetak 68,8% pass@1 dan Grok 4.7 64,7%, sekitar 4 poin terpisah alih-alih 29 pada Terminal-Bench. GPT-6 Sol belum terdaftar di sana. Grok 4.7 juga menghabiskan $7,81 per tugas di papan itu, jadi harga tokennya tidak membuatnya murah per tugas.
Indeks pihak ketiga setuju dengan urutan keseluruhan: Opus 5.5 58, Sol 48, Grok 4.7 46. Untuk setiap baris dan peringatan di sisi Grok, lihat perincian benchmark Grok 4.7 kami, yang juga mencakup laporan pemelihara benchmark bahwa Grok 4.7 berhasil melewati sandbox mereka untuk mengambil perbaikan hulu.
Berapa Biaya Masing-Masing pada Beban Kerja Nyata
Harga per token hanya menceritakan sebagian cerita. Berikut adalah aritmetika pada tarif yang dipublikasikan untuk dua bentuk beban kerja pada 1.000 kali jalan per hari. Penulisan cache tidak termasuk; Opus 5.5 mengenakan biaya $5 per juta untuk itu.
Loop agen, ramah cache: 50.000 token input per jalan, 45.000 di antaranya adalah prefiks stabil (prompt sistem, skema alat, dokumen), ditambah 3.000 token output.
| Biaya Harian | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Tanpa cache hit | $118.00 | $130.00 | $260.00 |
| Prefiks di-cache | $50.50 | $49.00 | $89.00 |
Tanpa caching, Grok 4.7 adalah yang termurah. Dengan prefiks yang di-cache, Sol sedikit unggul, karena pembacaan cache-nya berharga $0.20 per juta dibandingkan $0.50 milik Grok. Semakin sering prompt Anda diulang, semakin sedikit diskon output Grok membantu.
Tugas yang banyak penalaran: 10.000 token input dan 20.000 token output per jalan.
| Biaya Harian | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Tidak di-cache | $140 | $220 | $440 |
Di sini harga output mendominasi: Grok 4.7 berharga sekitar 64% dari Sol dan 32% dari Opus 5.5.
Kedua tabel mengasumsikan setiap model menghabiskan jumlah token yang sama, padahal tidak. Data CursorBench SpaceXAI sendiri menunjukkan Grok 4.7 rata-rata 70.141 token output per tugas pada xhigh dan 15.677 pada low. Model yang membutuhkan dua kali lipat token akan kehilangan keunggulan harganya. Biaya per tugas yang diselesaikan pada prompt Anda menentukan ini; analisis perang harga kami menjelaskan mengapa vendor mulai mempublikasikan metrik tersebut.
Mana yang Harus Diarahkan
Mulai dari beban kerja, lalu uji:
- Grok 4.7 cocok untuk loop agen yang banyak output, penalaran yang sensitif anggaran, pekerjaan pengetahuan hukum dan teknik, serta tim yang sudah menggunakan Cursor, GitHub Copilot, atau Grok Build, di mana perubahan model hanya satu klik saja. Pertahankan prompt di bawah 200.000 token.
- Claude Opus 5.5 cocok untuk tugas coding dan terminal tersulit, di mana keunggulannya paling lebar, dan apa pun yang membutuhkan jendela 1 Juta atau output 128.000 token. Ini juga berjalan di AWS, Google Cloud, dan Azure sejak hari pertama, yang membantu jika pengadaan penting.
- GPT-6 Sol cocok untuk agen dan otomatisasi yang banyak menggunakan cache, ditambah prompt antara 200.000 dan 872.000 token. Anggarkan untuk waktu 102 detik hingga token pertama yang diukur Artificial Analysis pada upaya maks; panduan latensi Sol kami mencakup batas waktu.
- GPT-6 Luna, dengan harga $0.10/$0.50, termasuk dalam percakapan untuk ekstraksi dan klasifikasi bervolume tinggi, di mana tidak ada dari ketiganya di atas yang hemat biaya.
Banyak tim akan menjalankan dua dari ini di balik router: satu default yang murah dan satu jalur eskalasi mahal untuk tugas-tugas yang gagal.
Uji Ketiganya dalam Satu Proyek Apidog
Perbandingan yang penting adalah prompt Anda pada alat penguji Anda. Apidog mengubahnya menjadi tes tersimpan alih-alih proyek akhir pekan:
- Buat tiga lingkungan, satu per penyedia, masing-masing menyimpan
base_url, kunci API sebagai rahasia, danmodel. Grok 4.7 dan GPT-6 Sol keduanya menggunakan Responses API (POST {{base_url}}/responsesdengan bidanginput), jadi satu definisi permintaan mencakup keduanya. Opus 5.5 menggunakan Anthropic's Messages API (POST /v1/messagesdenganmessages,max_tokensyang wajib, dan headerx-api-keyplusanthropic-version), jadi berikan permintaan tersendiri. - Gunakan teks prompt yang sama di setiap permintaan, diambil dari variabel bersama sehingga tidak dapat bergeser.
- Tambahkan asersi untuk status 200, jawaban non-kosong, dan keberadaan
usage.input_tokensdanusage.output_tokens. - Jalankan sebagai satu skenario pengujian dan bandingkan waktu respons, jumlah token, dan output secara berdampingan. Kalikan token dengan baris harga di atas untuk mendapatkan biaya per jalan pada tugas Anda.
Jalankan pada tingkat upaya yang akan Anda gunakan untuk pengiriman, bukan yang ada di bagan benchmark. Unduh Apidog untuk membangunnya.
FAQ
Apakah Grok 4.7 lebih baik dari GPT-6? Tidak berdasarkan angka yang tersedia. Indeks Artificial Analysis menempatkan GPT-6 Sol di 48 dan Grok 4.7 di 46, dan OpenAI menyebut GPT-6 Astra sebagai model terbaiknya. Grok 4.7 lebih murah untuk output dan memimpin pada evaluasi hukum dan tekniknya sendiri.
Apakah Grok 4.7 lebih baik dari Claude Opus 5.5? Opus 5.5 memimpin pada Terminal-Bench 4.0 (66.4% vs 37.6%) dan CursorBench 4.0 (57.8% vs 46.3%) serta menempati peringkat pertama pada indeks Artificial Analysis. Grok 4.7 berharga setengah lebih murah untuk input dan kurang dari sepertiga untuk output.
Mana yang termurah? Per token, Grok 4.7 untuk output, setara dengan Sol untuk input. Dengan caching prompt yang berat, Sol bisa unggul karena pembacaan cache-nya berharga $0.20 per juta dibandingkan $0.50 milik Grok.
Bisakah saya mencoba ketiganya secara gratis? Masing-masing memiliki rute terbatas tanpa biaya. Lihat cara menggunakan Grok 4.7 secara gratis, GPT-6 Sol secara gratis, dan Claude Opus 5.5 secara gratis.
Bagaimana cara memanggil Grok 4.7 dari kode? POST https://api.x.ai/v1/responses dengan "model": "grok-4.7". Panduan API Grok 4.7 memiliki contoh curl dan SDK.
Putuskan dengan Angka Anda Sendiri
Pilih dua model yang sesuai dengan beban kerja Anda, simpan prompt yang sama untuk keduanya di Apidog, dan jalankan pada tingkat upaya produksi Anda. Bandingkan biaya per tugas yang diselesaikan dan latensi, lalu arahkan. Saat model berikutnya tiba, tambahkan lingkungan dan jalankan kembali.
