Gemini 4 Argon memimpin tabel benchmark Google pada 13 dari 19 baris melawan GPT-6 Astra, Claude Opus 5.5, dan Claude Fable 5.1, namun satu fakta lebih penting dari skor apa pun: Anda bisa membeli Astra dan Opus 5.5 hari ini, dan Anda tidak bisa membeli Argon. Model frontier baru Google saat ini hanya tersedia untuk pembela Program Fairwind, dengan harga $2/$10 per juta token selama periode perkenalan dan $4/$20 setelahnya, yang persis sama dengan biaya Opus 5.5.
Perbandingan ini menyandingkan keempat model berdasarkan harga dan batasannya, mengelompokkan baris benchmark berdasarkan model mana yang memenangkannya, menjelaskan mengapa angka-angkanya tidak sebanding (apples to apples), dan diakhiri dengan panduan rute serta cara untuk menguji ketiganya dengan perintah Anda sendiri di Apidog. Baru mengenal Argon? Mulai dengan apa itu Gemini 4 Argon; untuk waktu peluncuran, lihat panduan tanggal rilis Argon.
Harga dan batasan berdampingan
Tabel Google menyertakan Claude Fable 5.1, jadi ia juga mendapat kolom. Harga per 1 juta token, dari halaman masing-masing vendor: pos peluncuran Google, halaman model GPT-6 Astra OpenAI, dan halaman harga Anthropic.
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| Bisakah Anda menggunakannya hari ini? | Tidak, hanya Fairwind | Ya | Ya | Ya |
| ID model API | Tidak dipublikasikan | gpt-6-astra |
claude-opus-5-5 |
claude-fable-5-1 |
| Input | $2 perkenalan, lalu $4 | $10 | $4 | $10 |
| Input cache | $0.10 perkenalan, lalu $0.20 | $1 | $0.20 | $0.25 |
| Output | $10 perkenalan, lalu $20 | $50 | $20 | $50 |
| Output maks | 1M (batas yang dinyatakan Google) | 128K | 128K (300K pada Batch, beta) | 128K |
| Jendela konteks | Tidak dipublikasikan | 1.050.000 (922K input maks) | 1M | 1M |
| Biaya tambahan prompt panjang | Tidak disebutkan | Lebih dari 272K input: 2x input dan cache, 1.5x output, pada permintaan penuh | Tidak ada | Tidak ada |
Tiga hal menonjol. Harga standar Argon cocok dengan Opus 5.5 pada input, input cache, dan output, sehingga keunggulan harganya atas Anthropic hanya bertahan selama periode perkenalan, dan Google belum menentukan tanggal berakhirnya. Astra dan Fable 5.1 terdaftar dengan harga 2,5x tarif input dan output standar Argon dan 5x tarif perkenalannya. Dan angka output 1 juta adalah milik Google: Vals AI mencantumkan output maks 262K untuk konfigurasi Argon yang diujinya. Untuk perhitungan biaya per permintaan, lihat harga Gemini 4 Argon.
Di mana setiap model unggul dalam tabel Google
Sebelum angka-angka: ini adalah tabel Google. Skor Argon dilaporkan oleh Google, beberapa dihitung sendiri dan beberapa dari papan peringkat; skor pesaing sebagian besar adalah angka milik vendor sendiri atau hasil papan peringkat publik, pada pengaturan penalaran maksimum jika tersedia. Alat uji berbeda, jadi anggap celah kecil sebagai kebisingan.
| Siapa yang memimpin | Benchmark | Argon | Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Argon: pekerjaan pengetahuan | Indeks Vals | 68.9% | 63.1% | 65.8% | 67.0% |
| Argon: pekerjaan pengetahuan | AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| Argon: pekerjaan pengetahuan | Benchmark Agen Hukum Harvey | 19.6% | 5.4% | 6.7% | 3.8% |
| Argon: coding | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| Argon: konteks panjang | GraphWalks 256K hingga 1M (F1) | 84.2% | 71.8% | 65.0% | 66.8% |
| Argon: multimodal | LVBench | 91.7% | 87.5% | 79.7% | 83.7% |
| Argon: multimodal | Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
| Astra | FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| Astra | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| Astra | OSWorld-2.0 (offline, sebagian) | 69.2% | 72.6% | tidak dilaporkan | tidak dilaporkan |
| Opus 5.5 | Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| Opus 5.5 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| Seri | CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
Kemenangan mutlak Argon lainnya adalah Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks hingga 128K, dan Agent’s Last Exam. Fable 5.1 tidak memimpin baris mana pun. Pada CWE-bench v1, papan peringkat siber DeepMind menunjukkan hasil seri tiga arah sebesar 68% antara Argon, Astra, dan Grok 4.7, dengan Opus 5.5 sebesar 67%.
Pada perbandingan Gemini 4 Argon vs Fable 5.1, Argon mencetak skor lebih tinggi pada 15 dari 17 baris di mana keduanya melaporkan angka; Fable hanya mengungguli pada FrontierSWE v2 (56.3% vs 55.0%) dan Terminal-bench 4.0 (57.9% vs 57.4%). Angka-angka Anthropic sendiri ada di pos benchmark Claude Fable 5.1 kami, dan tabel 19 baris lengkapnya ada di benchmark Gemini 4 Argon.
Tiga peringatan sebelum Anda mempercayai celah
Angka pesaing bukan hasil uji Google. Metodologi Google menyatakan bahwa hasil untuk model non-Gemini “bersumber dari angka yang dilaporkan sendiri oleh penyedia kecuali disebutkan lain,” dan beberapa baris berasal dari papan peringkat publik yang dijalankan oleh Vals AI, Proximal, dan Surge.
Alat uji berbeda. Pada DeepSWE v1.1, Google menghitung sendiri 77.9% Argon dengan alat uji mini-swe-agent, sementara skor Astra berasal dari papan peringkat publik dan skor Anthropic berasal dari kartu sistem. Pada LVBench, Gemini mengambil sampel video dengan 1 frame per detik, sementara Astra mendapat 800 frame, Opus 5.5 mendapat 600, dan Fable 5.1 mendapat 300, “karena batasan API.”
Model yang sama mencetak skor berbeda di berbagai grafik. Angka Terminal-bench 4.0 Opus 5.5 berbeda antar grafik tergantung pada alat uji dan pengaturan upaya; Anthropic melaporkan 66.4% pada upaya xhigh. Jadi, jangan pernah mencampur sumber dalam satu tabel.
Apa kata evaluator pihak ketiga
Papan peringkat independen mempersempit kesenjangan. Artificial Analysis menempatkan Argon di posisi #8 dari 223, tetapi daftar tersebut menghitung setiap pengaturan penalaran secara terpisah. Berdasarkan model yang berbeda, Argon (53) seri dengan GPT-6 Astra dan Claude Fable 5.1 dan berada di belakang Claude Opus 5.5 (58 pada maks) dan Claude Sonnet 5.5 (56). AA juga mencantumkan tingkat halusinasi Argon pada AA-Omniscience sebesar 15%, dibandingkan 51% untuk Astra pada pengaturan maksimumnya.
Di Arena, Argon menempati peringkat pertama dalam kategori Teks dengan 1525, ditandai sebagai Awal dengan 4.942 suara, dengan Opus 5.5 di posisi keempat. Vals AI menempatkannya di posisi pertama dari 41 model pada Indeks Vals, model Gemini pertama yang menduduki puncak.
Tidak semua orang di dalam Google yakin: Bloomberg melaporkan bahwa beberapa karyawan yang memiliki akses mengatakan Argon kurang memuaskan pada beberapa pekerjaan coding dan desain front-end relatif terhadap benchmark-nya, sebuah karakterisasi yang disebut Google tidak akurat.
Mana yang harus dirutekan
Tidak ada model frontier terbaik tunggal pada tahun 2026. Rute berdasarkan tugas, dan biarkan kolom Argon untuk hari peluncurannya:
| Tugas | Rute hari ini | Saat Argon diluncurkan |
|---|---|---|
| Agen otomatisasi hukum, keuangan, dan kantor | Opus 5.5 (67.0% Indeks Vals) | Uji Argon: ia memimpin keempat baris pekerjaan pengetahuan |
| Agen coding yang banyak menggunakan terminal | Opus 5.5 (66.4% Terminal-bench 4.0) | Opus 5.5 masih memimpin |
| Rekayasa perangkat lunak agen | Astra (65.5% FrontierSWE v2) atau Opus 5.5 | Argon memimpin DeepSWE tetapi tertinggal dari FrontierSWE; uji keduanya |
| Penggunaan komputer dan agen GUI | Astra (72.6% OSWorld-2.0) | Astra memimpin OSWorld; Argon memimpin Agent’s Last Exam |
| Penalaran dengan prompt 256K+ token | Opus 5.5 (tanpa biaya tambahan) atau Astra (biaya tambahan lebih dari 272K) | Argon (84.2% GraphWalks 256K hingga 1M) |
| Pemahaman video dan grafik | Astra (87.5% LVBench) | Argon (91.7%), dengan peringatan jumlah frame |
| Ilmu pengetahuan dan rekayasa ML | Astra (Terminal-Bench Science), Opus 5.5 (PostTrainBench) | Argon memimpin LABBench 2 dan RiemannBench; ujilah |
| Respons tunggal lebih dari 128K token | Opus 5.5 pada Batch (300K, beta) | Argon, hingga 1M yang dinyatakan Google |
| Pekerjaan bervolume tinggi, sensitif biaya | Opus 5.5 ($4/$20) | Argon seharga $2/$10 selama periode perkenalan |
Jika harga lebih penting daripada skor puncak, perbandingan GPT-6 Sol vs Claude Opus 5.5 kami mencakup lini Sol yang lebih murah dari OpenAI dibandingkan Opus.
Bandingkan ketiganya dengan prompt Anda sendiri
Tabel vendor tidak dapat memberi tahu Anda bagaimana setiap model menangani prompt Anda. Evaluasi kecil di Apidog bisa melakukannya, dan Anda bisa membangunnya hari ini.
- Buat satu proyek dengan tiga permintaan: GPT-6 Astra, Claude Opus 5.5, dan permintaan Gemini yang bidang modelnya terbaca
{{GEMINI_MODEL}}, diatur kegemini-3.8-flashsampai Google mempublikasikan ID Argon. Panduan API GPT-6 Astra kami dan apa itu Claude Opus 5.5 mencakup format permintaan masing-masing vendor. - Simpan kunci API setiap vendor sebagai variabel lingkungan, dan tempatkan prompt dalam satu variabel bersama agar ketiga permintaan mendapatkan input yang identik.
- Tambahkan pernyataan (assertions): status 200, jawaban tidak kosong, token output di bawah batas atas, dan biaya terhitung di bawah anggaran Anda pada tarif yang dipublikasikan setiap vendor.
- Jalankan ketiganya sebagai satu skenario pengujian dan bandingkan hasil setiap permintaan dalam laporan pengujian.
Pernyataan biaya adalah aritmatika sederhana. Untuk permintaan dengan 20.000 input dan 4.000 token output, Astra berharga 20.000 x $10/1M + 4.000 x $50/1M = $0.20 + $0.20 = $0.40. Opus 5.5 berharga $0.08 + $0.08 = $0.16. Argon akan berharga $0.08 pada tarif perkenalan dan $0.16 pada tarif standar. Harga per token bukanlah biaya per tugas: Artificial Analysis mengukur Argon sekitar 62K token output per tugas dibandingkan sekitar 27K untuk Astra pada upaya maksimum, jadi ukur token output pada prompt Anda sendiri.
Saat Argon diluncurkan, ubah GEMINI_MODEL, jalankan ulang skenario, dan Anda akan memiliki perbandingan prompt yang sama dengan dua model yang dapat Anda beli sekarang.
FAQ
Apakah Gemini 4 Argon lebih baik dari GPT-6 Astra? Keduanya seri pada angka 53 di Artificial Analysis. Dalam tabel Google, Argon mencetak skor lebih tinggi di sebagian besar baris, tetapi Astra memenangkan FrontierSWE v2, Terminal-Bench Science 0.1, dan OSWorld-2.0, dan Astra adalah yang dapat Anda gunakan hari ini.
Gemini 4 Argon vs Claude Opus 5.5: mana yang lebih baik? Tabel Google mengunggulkan Argon di sebagian besar baris; Opus 5.5 memenangkan Terminal-bench 4.0 dan PostTrainBench serta memimpin Artificial Analysis 58 banding 53. Dengan tarif standar, harganya sama.
Apakah Gemini 4 Argon lebih murah dari Claude Opus 5.5? Selama periode perkenalan, harganya setengah ($2/$10 vs $4/$20). Setelah itu, harga daftar identik, dan Google belum mengatakan kapan periode perkenalan berakhir.
Model mana yang memiliki batas output terbesar? Argon, dengan batas 1 juta token yang dinyatakan, meskipun Vals AI mencantumkan 262K untuk konfigurasi yang diujinya. Yang lain membatasi output sinkron pada 128K. Panduan token output 1 juta kami mencakup apa artinya itu bagi klien Anda.
Bisakah saya menggunakan Gemini 4 Argon hari ini? Hanya melalui Program Fairwind Google, untuk sekelompok mitra pertahanan siber yang telah diverifikasi. Pelanggan API berbayar dan pelanggan Google AI Ultra akan menyusul, tanpa tanggal yang ditentukan.
Pilih berdasarkan beban kerja, lalu uji
Argon terlihat terkuat pada pekerjaan pengetahuan, konteks panjang, dan baris multimodal; Astra pada FrontierSWE, Terminal-Bench Science, dan OSWorld; Opus 5.5 pada pekerjaan terminal dan rekayasa ML, dengan harga yang akan dikenakan Argon setelah perkenalannya. Bangun di atas dua model yang bisa Anda beli sekarang, simpan model Gemini dalam variabel, dan jalankan ulang skenario Anda pada hari Argon dibuka. Untuk menyiapkan perbandingan tiga permintaan dalam satu proyek, unduh Apidog.
