Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: harga, batas keluaran, posisi masing-masing di tabel benchmark Google, dan mana yang sebaiknya digunakan hari ini.

Ashley Innocent

Ashley Innocent

2 October 2026

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Gemini 4 Argon memimpin tabel benchmark Google pada 13 dari 19 baris melawan GPT-6 Astra, Claude Opus 5.5, dan Claude Fable 5.1, namun satu fakta lebih penting dari skor apa pun: Anda bisa membeli Astra dan Opus 5.5 hari ini, dan Anda tidak bisa membeli Argon. Model frontier baru Google saat ini hanya tersedia untuk pembela Program Fairwind, dengan harga $2/$10 per juta token selama periode perkenalan dan $4/$20 setelahnya, yang persis sama dengan biaya Opus 5.5.

Perbandingan ini menyandingkan keempat model berdasarkan harga dan batasannya, mengelompokkan baris benchmark berdasarkan model mana yang memenangkannya, menjelaskan mengapa angka-angkanya tidak sebanding (apples to apples), dan diakhiri dengan panduan rute serta cara untuk menguji ketiganya dengan perintah Anda sendiri di Apidog. Baru mengenal Argon? Mulai dengan apa itu Gemini 4 Argon; untuk waktu peluncuran, lihat panduan tanggal rilis Argon.

button

Harga dan batasan berdampingan

Tabel Google menyertakan Claude Fable 5.1, jadi ia juga mendapat kolom. Harga per 1 juta token, dari halaman masing-masing vendor: pos peluncuran Google, halaman model GPT-6 Astra OpenAI, dan halaman harga Anthropic.

Gemini 4 Argon GPT-6 Astra Claude Opus 5.5 Claude Fable 5.1
Bisakah Anda menggunakannya hari ini? Tidak, hanya Fairwind Ya Ya Ya
ID model API Tidak dipublikasikan gpt-6-astra claude-opus-5-5 claude-fable-5-1
Input $2 perkenalan, lalu $4 $10 $4 $10
Input cache $0.10 perkenalan, lalu $0.20 $1 $0.20 $0.25
Output $10 perkenalan, lalu $20 $50 $20 $50
Output maks 1M (batas yang dinyatakan Google) 128K 128K (300K pada Batch, beta) 128K
Jendela konteks Tidak dipublikasikan 1.050.000 (922K input maks) 1M 1M
Biaya tambahan prompt panjang Tidak disebutkan Lebih dari 272K input: 2x input dan cache, 1.5x output, pada permintaan penuh Tidak ada Tidak ada

Tiga hal menonjol. Harga standar Argon cocok dengan Opus 5.5 pada input, input cache, dan output, sehingga keunggulan harganya atas Anthropic hanya bertahan selama periode perkenalan, dan Google belum menentukan tanggal berakhirnya. Astra dan Fable 5.1 terdaftar dengan harga 2,5x tarif input dan output standar Argon dan 5x tarif perkenalannya. Dan angka output 1 juta adalah milik Google: Vals AI mencantumkan output maks 262K untuk konfigurasi Argon yang diujinya. Untuk perhitungan biaya per permintaan, lihat harga Gemini 4 Argon.

Di mana setiap model unggul dalam tabel Google

Sebelum angka-angka: ini adalah tabel Google. Skor Argon dilaporkan oleh Google, beberapa dihitung sendiri dan beberapa dari papan peringkat; skor pesaing sebagian besar adalah angka milik vendor sendiri atau hasil papan peringkat publik, pada pengaturan penalaran maksimum jika tersedia. Alat uji berbeda, jadi anggap celah kecil sebagai kebisingan.

Siapa yang memimpin Benchmark Argon Astra Fable 5.1 Opus 5.5
Argon: pekerjaan pengetahuan Indeks Vals 68.9% 63.1% 65.8% 67.0%
Argon: pekerjaan pengetahuan AutomationBench 51.3% 41.4% 31.4% 42.5%
Argon: pekerjaan pengetahuan Benchmark Agen Hukum Harvey 19.6% 5.4% 6.7% 3.8%
Argon: coding DeepSWE v1.1 77.9% 74.1% 67.4% 74.2%
Argon: konteks panjang GraphWalks 256K hingga 1M (F1) 84.2% 71.8% 65.0% 66.8%
Argon: multimodal LVBench 91.7% 87.5% 79.7% 83.7%
Argon: multimodal Chartography 71.6% 71.0% 46.2% 66.3%
Astra FrontierSWE v2 55.0% 65.5% 56.3% 62.3%
Astra Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3%
Astra OSWorld-2.0 (offline, sebagian) 69.2% 72.6% tidak dilaporkan tidak dilaporkan
Opus 5.5 Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4%
Opus 5.5 PostTrainBench 45.3% 44.3% 40.2% 49.3%
Seri CWE-bench v1 68.0% 68.0% 58.0% 67.0%

Kemenangan mutlak Argon lainnya adalah Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks hingga 128K, dan Agent’s Last Exam. Fable 5.1 tidak memimpin baris mana pun. Pada CWE-bench v1, papan peringkat siber DeepMind menunjukkan hasil seri tiga arah sebesar 68% antara Argon, Astra, dan Grok 4.7, dengan Opus 5.5 sebesar 67%.

Pada perbandingan Gemini 4 Argon vs Fable 5.1, Argon mencetak skor lebih tinggi pada 15 dari 17 baris di mana keduanya melaporkan angka; Fable hanya mengungguli pada FrontierSWE v2 (56.3% vs 55.0%) dan Terminal-bench 4.0 (57.9% vs 57.4%). Angka-angka Anthropic sendiri ada di pos benchmark Claude Fable 5.1 kami, dan tabel 19 baris lengkapnya ada di benchmark Gemini 4 Argon.

Tiga peringatan sebelum Anda mempercayai celah

Angka pesaing bukan hasil uji Google. Metodologi Google menyatakan bahwa hasil untuk model non-Gemini “bersumber dari angka yang dilaporkan sendiri oleh penyedia kecuali disebutkan lain,” dan beberapa baris berasal dari papan peringkat publik yang dijalankan oleh Vals AI, Proximal, dan Surge.

Alat uji berbeda. Pada DeepSWE v1.1, Google menghitung sendiri 77.9% Argon dengan alat uji mini-swe-agent, sementara skor Astra berasal dari papan peringkat publik dan skor Anthropic berasal dari kartu sistem. Pada LVBench, Gemini mengambil sampel video dengan 1 frame per detik, sementara Astra mendapat 800 frame, Opus 5.5 mendapat 600, dan Fable 5.1 mendapat 300, “karena batasan API.”

Model yang sama mencetak skor berbeda di berbagai grafik. Angka Terminal-bench 4.0 Opus 5.5 berbeda antar grafik tergantung pada alat uji dan pengaturan upaya; Anthropic melaporkan 66.4% pada upaya xhigh. Jadi, jangan pernah mencampur sumber dalam satu tabel.

Apa kata evaluator pihak ketiga

Papan peringkat independen mempersempit kesenjangan. Artificial Analysis menempatkan Argon di posisi #8 dari 223, tetapi daftar tersebut menghitung setiap pengaturan penalaran secara terpisah. Berdasarkan model yang berbeda, Argon (53) seri dengan GPT-6 Astra dan Claude Fable 5.1 dan berada di belakang Claude Opus 5.5 (58 pada maks) dan Claude Sonnet 5.5 (56). AA juga mencantumkan tingkat halusinasi Argon pada AA-Omniscience sebesar 15%, dibandingkan 51% untuk Astra pada pengaturan maksimumnya.

Di Arena, Argon menempati peringkat pertama dalam kategori Teks dengan 1525, ditandai sebagai Awal dengan 4.942 suara, dengan Opus 5.5 di posisi keempat. Vals AI menempatkannya di posisi pertama dari 41 model pada Indeks Vals, model Gemini pertama yang menduduki puncak.

Tidak semua orang di dalam Google yakin: Bloomberg melaporkan bahwa beberapa karyawan yang memiliki akses mengatakan Argon kurang memuaskan pada beberapa pekerjaan coding dan desain front-end relatif terhadap benchmark-nya, sebuah karakterisasi yang disebut Google tidak akurat.

Mana yang harus dirutekan

Tidak ada model frontier terbaik tunggal pada tahun 2026. Rute berdasarkan tugas, dan biarkan kolom Argon untuk hari peluncurannya:

Tugas Rute hari ini Saat Argon diluncurkan
Agen otomatisasi hukum, keuangan, dan kantor Opus 5.5 (67.0% Indeks Vals) Uji Argon: ia memimpin keempat baris pekerjaan pengetahuan
Agen coding yang banyak menggunakan terminal Opus 5.5 (66.4% Terminal-bench 4.0) Opus 5.5 masih memimpin
Rekayasa perangkat lunak agen Astra (65.5% FrontierSWE v2) atau Opus 5.5 Argon memimpin DeepSWE tetapi tertinggal dari FrontierSWE; uji keduanya
Penggunaan komputer dan agen GUI Astra (72.6% OSWorld-2.0) Astra memimpin OSWorld; Argon memimpin Agent’s Last Exam
Penalaran dengan prompt 256K+ token Opus 5.5 (tanpa biaya tambahan) atau Astra (biaya tambahan lebih dari 272K) Argon (84.2% GraphWalks 256K hingga 1M)
Pemahaman video dan grafik Astra (87.5% LVBench) Argon (91.7%), dengan peringatan jumlah frame
Ilmu pengetahuan dan rekayasa ML Astra (Terminal-Bench Science), Opus 5.5 (PostTrainBench) Argon memimpin LABBench 2 dan RiemannBench; ujilah
Respons tunggal lebih dari 128K token Opus 5.5 pada Batch (300K, beta) Argon, hingga 1M yang dinyatakan Google
Pekerjaan bervolume tinggi, sensitif biaya Opus 5.5 ($4/$20) Argon seharga $2/$10 selama periode perkenalan

Jika harga lebih penting daripada skor puncak, perbandingan GPT-6 Sol vs Claude Opus 5.5 kami mencakup lini Sol yang lebih murah dari OpenAI dibandingkan Opus.

Bandingkan ketiganya dengan prompt Anda sendiri

Tabel vendor tidak dapat memberi tahu Anda bagaimana setiap model menangani prompt Anda. Evaluasi kecil di Apidog bisa melakukannya, dan Anda bisa membangunnya hari ini.

  1. Buat satu proyek dengan tiga permintaan: GPT-6 Astra, Claude Opus 5.5, dan permintaan Gemini yang bidang modelnya terbaca {{GEMINI_MODEL}}, diatur ke gemini-3.8-flash sampai Google mempublikasikan ID Argon. Panduan API GPT-6 Astra kami dan apa itu Claude Opus 5.5 mencakup format permintaan masing-masing vendor.
  2. Simpan kunci API setiap vendor sebagai variabel lingkungan, dan tempatkan prompt dalam satu variabel bersama agar ketiga permintaan mendapatkan input yang identik.
  3. Tambahkan pernyataan (assertions): status 200, jawaban tidak kosong, token output di bawah batas atas, dan biaya terhitung di bawah anggaran Anda pada tarif yang dipublikasikan setiap vendor.
  4. Jalankan ketiganya sebagai satu skenario pengujian dan bandingkan hasil setiap permintaan dalam laporan pengujian.

Pernyataan biaya adalah aritmatika sederhana. Untuk permintaan dengan 20.000 input dan 4.000 token output, Astra berharga 20.000 x $10/1M + 4.000 x $50/1M = $0.20 + $0.20 = $0.40. Opus 5.5 berharga $0.08 + $0.08 = $0.16. Argon akan berharga $0.08 pada tarif perkenalan dan $0.16 pada tarif standar. Harga per token bukanlah biaya per tugas: Artificial Analysis mengukur Argon sekitar 62K token output per tugas dibandingkan sekitar 27K untuk Astra pada upaya maksimum, jadi ukur token output pada prompt Anda sendiri.

Saat Argon diluncurkan, ubah GEMINI_MODEL, jalankan ulang skenario, dan Anda akan memiliki perbandingan prompt yang sama dengan dua model yang dapat Anda beli sekarang.

FAQ

Apakah Gemini 4 Argon lebih baik dari GPT-6 Astra? Keduanya seri pada angka 53 di Artificial Analysis. Dalam tabel Google, Argon mencetak skor lebih tinggi di sebagian besar baris, tetapi Astra memenangkan FrontierSWE v2, Terminal-Bench Science 0.1, dan OSWorld-2.0, dan Astra adalah yang dapat Anda gunakan hari ini.

Gemini 4 Argon vs Claude Opus 5.5: mana yang lebih baik? Tabel Google mengunggulkan Argon di sebagian besar baris; Opus 5.5 memenangkan Terminal-bench 4.0 dan PostTrainBench serta memimpin Artificial Analysis 58 banding 53. Dengan tarif standar, harganya sama.

Apakah Gemini 4 Argon lebih murah dari Claude Opus 5.5? Selama periode perkenalan, harganya setengah ($2/$10 vs $4/$20). Setelah itu, harga daftar identik, dan Google belum mengatakan kapan periode perkenalan berakhir.

Model mana yang memiliki batas output terbesar? Argon, dengan batas 1 juta token yang dinyatakan, meskipun Vals AI mencantumkan 262K untuk konfigurasi yang diujinya. Yang lain membatasi output sinkron pada 128K. Panduan token output 1 juta kami mencakup apa artinya itu bagi klien Anda.

Bisakah saya menggunakan Gemini 4 Argon hari ini? Hanya melalui Program Fairwind Google, untuk sekelompok mitra pertahanan siber yang telah diverifikasi. Pelanggan API berbayar dan pelanggan Google AI Ultra akan menyusul, tanpa tanggal yang ditentukan.

Pilih berdasarkan beban kerja, lalu uji

Argon terlihat terkuat pada pekerjaan pengetahuan, konteks panjang, dan baris multimodal; Astra pada FrontierSWE, Terminal-Bench Science, dan OSWorld; Opus 5.5 pada pekerjaan terminal dan rekayasa ML, dengan harga yang akan dikenakan Argon setelah perkenalannya. Bangun di atas dua model yang bisa Anda beli sekarang, simpan model Gemini dalam variabel, dan jalankan ulang skenario Anda pada hari Argon dibuka. Untuk menyiapkan perbandingan tiga permintaan dalam satu proyek, unduh Apidog.

button

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.