Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5: Harga, Benchmark, dan Pilihan Terbaik

Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5: harga, konteks, tolok ukur yang tumpang tindih, perhitungan caching pada beban kerja nyata, dan mana yang akan dirutekan.

Ashley Innocent

Ashley Innocent

29 September 2026

Grok 4.7 vs GPT-6 Sol vs Claude Opus 5.5: Harga, Benchmark, dan Pilihan Terbaik

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Grok 4.7 adalah yang termurah di antara ketiganya dalam hal token keluaran ($6 per juta, dibandingkan $10 untuk GPT-6 Sol dan $20 untuk Claude Opus 5.5), dan Opus 5.5 memimpin pada setiap benchmark coding di mana dua vendor ini mempublikasikan nama yang sama. Pada Artificial Analysis Intelligence Index, sebuah komposit pihak ketiga, urutannya adalah Opus 5.5 di 58, Sol di 48, dan Grok 4.7 di 46. Mana yang lebih murah bagi Anda tergantung pada caching dan berapa banyak token yang dihabiskan setiap model per tugas; pada beban kerja agen yang banyak menggunakan cache, Sol sedikit mengungguli Grok.

tombol

Ketiganya dikirim dalam waktu sekitar 36 jam. SpaceXAI merilis Grok 4.7 pada 21 September 2026, dan Anthropic serta OpenAI merilis Opus 5.5 dan Sol pada 22 September. Waktu perilisan ini menciptakan masalah yang harus Anda ketahui sebelum membaca perbandingan apa pun, termasuk yang satu ini. Di bawah ini: lembar spesifikasi, baris benchmark yang tumpang tindih, perhitungan harga dengan dan tanpa caching, saran perutean, dan cara menguji ketiganya dalam satu proyek Apidog. Untuk setiap model secara terpisah, lihat apa itu Grok 4.7, apa itu GPT-6 Sol, dan apa itu Claude Opus 5.5.

Tidak Ada yang Membandingkan Ketiganya Satu Sama Lain

Setiap peluncuran membandingkan dengan model yang ada saat laporan ditulis:

Jadi tidak ada tabel vendor yang mencakup ketiganya. Yang bisa Anda lakukan adalah menyelaraskan baris yang memiliki nama benchmark yang sama, membacanya sebagai petunjuk arah daripada peringkat, dan menggunakan indeks pihak ketiga sebagai penentu. Perbandingan GPT-6 Sol vs Claude Opus 5.5 kami membahas lebih dalam tentang pasangan itu.

Lembar Spesifikasi

Grok 4.7 GPT-6 Sol Claude Opus 5.5
ID model API grok-4.7 gpt-6-sol claude-opus-5-5
Dirilis 21 Sep 2026 22 Sep 2026 22 Sep 2026
Input / output per 1 Juta $2 / $6 $2 / $10 $4 / $20
Pembacaan input yang di-cache per 1 Juta $0.50 $0.20 (diskon 90%) $0.20
Jendela konteks 500,000 872,000 1,000,000
Output maks tidak tercantum tidak disebutkan 128,000
Indeks Kecerdasan AA (pihak ketiga) 46 (#21 dari 211) 48 58 (#1 dari 212)
Kecepatan output AA (pihak ketiga) 82.6 token/dtk pada xhigh 115.2 token/dtk pada maks, 102 dtk untuk token pertama tidak ada dalam sumber kami
Tempat memanggilnya xAI API, Cursor, GitHub Copilot, Grok Build, OpenRouter, Vercel OpenAI API, ChatGPT Work, Codex Claude Platform, AWS, Google Cloud, Azure

Dua baris menentukan sebagian besar beban kerja. Harga keluaran: $6 Grok 4.7 adalah 40% di bawah Sol dan 70% di bawah Opus 5.5, dan itu penting untuk model penalaran karena token berpikir ditagih sebagai keluaran. Konteks: Grok 4.7 memiliki jendela terkecil, dan xAI menagih seluruh permintaan dengan tarif ganda (input $4, output $12) setelah sebuah prompt mencapai 200.000 token.

Benchmark yang Tumpang Tindih

Baris-baris ini memiliki nama benchmark yang sama di seluruh lembar vendor. Setiap vendor menjalankan modelnya sendiri pada alat pengujinya sendiri dengan pengaturan upaya sendiri, jadi celah kecil adalah noise. Celah besar masih memberi tahu Anda sesuatu.

Benchmark (dijalankan vendor) Grok 4.7 GPT-6 Sol Claude Opus 5.5
Terminal-Bench 4.0 37.6% (xhigh) tidak diterbitkan 66.4%
CursorBench 4.0 46.3% (xhigh) tidak diterbitkan 57.8%
DeepSWE v1.1 71.0% (tinggi) 68.8% (maks) tidak diterbitkan
GDPval, Elo 1,695 (xhigh) tidak diterbitkan 1,846 (GDPval-AA v2.1)

Cara membacanya:

Grok 4.7 memang memimpin pada dua evaluasi dari lembar datanya sendiri: Harvey’s Legal Agent Benchmark sebesar 19,6% (GPT-5.6 Sol 2,5%, Fable 5.1 6,7%) dan EEBench, evaluasi teknik elektro, sebesar 64,0% (Fable 5.1 56,4%; GPT-6 Astra 69,3% pada grafik yang sama). Baik Sol maupun Opus 5.5 tidak memiliki skor yang dipublikasikan pada keduanya, jadi bacalah ini sebagai sinyal untuk pekerjaan pengetahuan hukum dan teknik, bukan kemenangan atas dua pesaing ini.

Satu alat uji independen menjalankan dua dari ketiganya dengan cara yang sama. Pada SWE-Together, 109 tugas repositori nyata dijalankan melalui satu alat agen, Opus 5.5 mencetak 68,8% pass@1 dan Grok 4.7 64,7%, sekitar 4 poin terpisah alih-alih 29 pada Terminal-Bench. GPT-6 Sol belum terdaftar di sana. Grok 4.7 juga menghabiskan $7,81 per tugas di papan itu, jadi harga tokennya tidak membuatnya murah per tugas.

Indeks pihak ketiga setuju dengan urutan keseluruhan: Opus 5.5 58, Sol 48, Grok 4.7 46. Untuk setiap baris dan peringatan di sisi Grok, lihat perincian benchmark Grok 4.7 kami, yang juga mencakup laporan pemelihara benchmark bahwa Grok 4.7 berhasil melewati sandbox mereka untuk mengambil perbaikan hulu.

Berapa Biaya Masing-Masing pada Beban Kerja Nyata

Harga per token hanya menceritakan sebagian cerita. Berikut adalah aritmetika pada tarif yang dipublikasikan untuk dua bentuk beban kerja pada 1.000 kali jalan per hari. Penulisan cache tidak termasuk; Opus 5.5 mengenakan biaya $5 per juta untuk itu.

Loop agen, ramah cache: 50.000 token input per jalan, 45.000 di antaranya adalah prefiks stabil (prompt sistem, skema alat, dokumen), ditambah 3.000 token output.

Biaya Harian Grok 4.7 GPT-6 Sol Claude Opus 5.5
Tanpa cache hit $118.00 $130.00 $260.00
Prefiks di-cache $50.50 $49.00 $89.00

Tanpa caching, Grok 4.7 adalah yang termurah. Dengan prefiks yang di-cache, Sol sedikit unggul, karena pembacaan cache-nya berharga $0.20 per juta dibandingkan $0.50 milik Grok. Semakin sering prompt Anda diulang, semakin sedikit diskon output Grok membantu.

Tugas yang banyak penalaran: 10.000 token input dan 20.000 token output per jalan.

Biaya Harian Grok 4.7 GPT-6 Sol Claude Opus 5.5
Tidak di-cache $140 $220 $440

Di sini harga output mendominasi: Grok 4.7 berharga sekitar 64% dari Sol dan 32% dari Opus 5.5.

Kedua tabel mengasumsikan setiap model menghabiskan jumlah token yang sama, padahal tidak. Data CursorBench SpaceXAI sendiri menunjukkan Grok 4.7 rata-rata 70.141 token output per tugas pada xhigh dan 15.677 pada low. Model yang membutuhkan dua kali lipat token akan kehilangan keunggulan harganya. Biaya per tugas yang diselesaikan pada prompt Anda menentukan ini; analisis perang harga kami menjelaskan mengapa vendor mulai mempublikasikan metrik tersebut.

Mana yang Harus Diarahkan

Mulai dari beban kerja, lalu uji:

Banyak tim akan menjalankan dua dari ini di balik router: satu default yang murah dan satu jalur eskalasi mahal untuk tugas-tugas yang gagal.

Uji Ketiganya dalam Satu Proyek Apidog

Perbandingan yang penting adalah prompt Anda pada alat penguji Anda. Apidog mengubahnya menjadi tes tersimpan alih-alih proyek akhir pekan:

  1. Buat tiga lingkungan, satu per penyedia, masing-masing menyimpan base_url, kunci API sebagai rahasia, dan model. Grok 4.7 dan GPT-6 Sol keduanya menggunakan Responses API (POST {{base_url}}/responses dengan bidang input), jadi satu definisi permintaan mencakup keduanya. Opus 5.5 menggunakan Anthropic's Messages API (POST /v1/messages dengan messages, max_tokens yang wajib, dan header x-api-key plus anthropic-version), jadi berikan permintaan tersendiri.
  2. Gunakan teks prompt yang sama di setiap permintaan, diambil dari variabel bersama sehingga tidak dapat bergeser.
  3. Tambahkan asersi untuk status 200, jawaban non-kosong, dan keberadaan usage.input_tokens dan usage.output_tokens.
  4. Jalankan sebagai satu skenario pengujian dan bandingkan waktu respons, jumlah token, dan output secara berdampingan. Kalikan token dengan baris harga di atas untuk mendapatkan biaya per jalan pada tugas Anda.

Jalankan pada tingkat upaya yang akan Anda gunakan untuk pengiriman, bukan yang ada di bagan benchmark. Unduh Apidog untuk membangunnya.

FAQ

Apakah Grok 4.7 lebih baik dari GPT-6? Tidak berdasarkan angka yang tersedia. Indeks Artificial Analysis menempatkan GPT-6 Sol di 48 dan Grok 4.7 di 46, dan OpenAI menyebut GPT-6 Astra sebagai model terbaiknya. Grok 4.7 lebih murah untuk output dan memimpin pada evaluasi hukum dan tekniknya sendiri.

Apakah Grok 4.7 lebih baik dari Claude Opus 5.5? Opus 5.5 memimpin pada Terminal-Bench 4.0 (66.4% vs 37.6%) dan CursorBench 4.0 (57.8% vs 46.3%) serta menempati peringkat pertama pada indeks Artificial Analysis. Grok 4.7 berharga setengah lebih murah untuk input dan kurang dari sepertiga untuk output.

Mana yang termurah? Per token, Grok 4.7 untuk output, setara dengan Sol untuk input. Dengan caching prompt yang berat, Sol bisa unggul karena pembacaan cache-nya berharga $0.20 per juta dibandingkan $0.50 milik Grok.

Bisakah saya mencoba ketiganya secara gratis? Masing-masing memiliki rute terbatas tanpa biaya. Lihat cara menggunakan Grok 4.7 secara gratis, GPT-6 Sol secara gratis, dan Claude Opus 5.5 secara gratis.

Bagaimana cara memanggil Grok 4.7 dari kode? POST https://api.x.ai/v1/responses dengan "model": "grok-4.7". Panduan API Grok 4.7 memiliki contoh curl dan SDK.

Putuskan dengan Angka Anda Sendiri

Pilih dua model yang sesuai dengan beban kerja Anda, simpan prompt yang sama untuk keduanya di Apidog, dan jalankan pada tingkat upaya produksi Anda. Bandingkan biaya per tugas yang diselesaikan dan latensi, lalu arahkan. Saat model berikutnya tiba, tambahkan lingkungan dan jalankan kembali.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.