Gemini 4 Argon memimpin 13 dari 19 baris dalam tabel peluncuran Google secara keseluruhan, seri di 1 (CWE-bench v1, dengan GPT-6 Astra), dan tertinggal di 5: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1, dan OSWorld-2.0. Masalahnya adalah akses. Argon saat ini hanya tersedia untuk pembela Program Fairwind, jadi belum ada orang di luar daftar mitra Google dan beberapa organisasi benchmark yang dapat mengulang angka-angka ini.
Di bawah: tabel lengkap dengan siapa yang mengukur setiap baris, lima kekalahan, cetakan kecil, skor siber, papan skor pihak ketiga, dan cara membangun evaluasi Anda sendiri di Apidog sebelum akses dibuka. Untuk gambaran umum model, mulailah dengan apa itu Gemini 4 Argon. Untuk keputusan pembelian, lihat Argon vs GPT-6 Astra vs Claude Opus 5.5.
Tabel lengkap, dengan siapa yang mengukur setiap baris
Ini adalah hasil yang dilaporkan Google dari pos peluncuran dan PDF metodologi evaluasi, yang berjudul "hasil per Oktober 2026." Google menghitung 10 dari 19 skor Argon sendiri; 9 lainnya berasal dari papan peringkat publik. Angka-angka pesaing berasal dari papan peringkat tersebut, hasil uji coba Google sendiri, atau kartu sistem dan postingan blog vendor, dan *harness* berbeda per baris. Teks tebal menandai pemimpin baris.
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | Siapa yang mengukurnya |
|---|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% | Vals AI |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | Papan peringkat Zapier (set pribadi) |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Vals AI |
| Harvey Legal Agent | 19.6% | 5.4% | 6.7% | 3.8% | Vals AI |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% | Dihitung sendiri oleh Argon; papan peringkat Astra; kartu sistem Anthropic |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | Papan peringkat Proximal |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | Vals AI |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | Dihitung sendiri oleh Argon; papan peringkat pesaing |
| PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% | Dihitung sendiri untuk semua model |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | Dihitung sendiri oleh Argon; papan peringkat pesaing |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | Dihitung sendiri untuk semua model |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | Papan peringkat Surge |
| GraphWalks up to 128K | 99.7% | 98.7% | 91.4% | 90.6% | Dihitung sendiri untuk semua model |
| GraphWalks 256K to 1M | 84.2% | 71.8% | 65.0% | 66.8% | Dihitung sendiri untuk semua model |
| Agent’s Last Exam | 39.5% | 34.2% | t/l | 38.2% | Dihitung sendiri oleh Argon; papan peringkat pesaing |
| OSWorld-2.0 (offline) | 69.2% | 72.6% | t/l | t/l | Dihitung sendiri oleh Argon; Astra dari postingan blog OpenAI |
| Chartography | 71.6% | 71.0% | 46.2% | 66.3% | Papan peringkat Surge |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | Dihitung sendiri untuk semua model |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% | Papan peringkat publik |
t/l = tidak dilaporkan. Grok 4.7, yang tidak ada dalam tabel Google, juga mendapat skor 68% di papan peringkat CWE-bench, sehingga hasil seri tersebut adalah tiga arah.
Diurutkan berdasarkan sumber, 9 baris berasal dari papan peringkat publik untuk setiap model (Vals AI, Zapier, Proximal, Surge, dan CWE-bench). Argon memimpin 7 dari 9 tersebut dan seri di 1. Google menjalankan 5 baris sendiri untuk keempat model, dan Argon memimpin 4. 5 baris lainnya memasangkan skor Argon yang dijalankan Google dengan angka pesaing dari tempat lain, dan di situlah Argon paling banyak kalah: 3 dari 5 kekalahannya ada di baris campuran tersebut. Jika penghitungan sendiri menguntungkan Argon, Anda akan mengharapkan yang sebaliknya.
Di mana Argon tertinggal, dan mengapa itu penting untuk pengkodean agen
- FrontierSWE v2: 55.0% berbanding 65.5% milik Astra. Argon berada di posisi terakhir dari empat, di belakang Fable 5.1 (56.3%) dan Opus 5.5 (62.3%), pada papan peringkat yang menilai setiap model.
- Terminal-bench 4.0: 57.4% berbanding 66.4% milik Opus 5.5. Kembali di posisi terakhir, meskipun Astra dan Fable 5.1 hanya selisih satu poin.
- PostTrainBench: 45.3% berbanding 49.3% milik Opus 5.5. Posisi kedua, pada baris yang dijalankan Google untuk semua model.
- Terminal-Bench Science 0.1: 57.6% berbanding 68.1% milik Astra. Posisi ketiga, hanya di depan Fable 5.1. Google menjalankan upaya Argon dengan batas waktu verifikasi 6x.
- OSWorld-2.0 (subset offline): 69.2% berbanding 72.6% milik Astra. Anthropic hanya melaporkan skor gabungan online dan offline, sehingga tidak ada model Claude yang muncul.
Pengkodean agen terbagi 2 banding 2. Argon memenangkan DeepSWE v1.1 dan Vibe Code Bench, kemudian menempati posisi terakhir di FrontierSWE v2 dan Terminal-bench 4.0. Kemenangan DeepSWE mencampur *harness*: Argon berjalan pada *harness* agen *mini-swe*, angka Astra berasal dari papan peringkat publik, dan angka Claude berasal dari kartu sistem. Vibe Code Bench lebih bersih, karena Vals AI menilai keempatnya, tetapi selisihnya adalah 1.6 poin.
Jika beban kerja Anda adalah agen yang banyak menggunakan terminal atau tugas repositori yang panjang, pertimbangkan dua baris posisi terakhir tersebut di atas jumlah utama. Astra memegang keunggulan FrontierSWE; hands-on GPT-6 Astra kami menunjukkan bagaimana model tersebut digunakan saat ini. Untuk sisi Anthropic, rincian benchmark Claude Fable 5.1 kami mencakup angka peluncuran Fable sendiri.
Bloomberg melaporkan bahwa karyawan Google anonim yang memiliki akses mengatakan Argon kurang memuaskan dalam beberapa pekerjaan pengkodean dan desain *front-end* relatif terhadap skor benchmark-nya. Google menyatakan karakterisasi tersebut tidak akurat.
Peringatan metodologi yang mengubah cara Anda membaca tabel
- Upaya maksimal di kedua sisi. Argon dijalankan “dengan API Gemini dengan pengaturan pemikiran tertinggi.” Untuk Astra, Fable 5.1, dan Opus 5.5, Google secara *default* menggunakan “pengaturan pemikiran/penalaran maksimum yang tersedia.” Ini membandingkan batas atas, bukan perilaku *default* atau biaya.
- Frame LVBench. Google menjalankan LVBench sendiri untuk keempat model, tanpa alat. Gemini mengambil sampel video pada 1 FPS. Astra mendapatkan 800 *frame*, Fable 5.1 mendapatkan 300 dan Opus 5.5 mendapatkan 600, “karena keterbatasan API.” Model-model tersebut tidak melihat input yang identik.
- OSWorld terbaik dari tiga. Skor Argon adalah “maksimal dari 3 *run* dengan satu percobaan per *run*,” hasil terbaik daripada rata-rata.
- Jendela Ujian Terakhir Agen. Argon berjalan pada *harness* ALE-Claw dengan jendela 5 jam.
- Filter keamanan aktif. Ujian Terakhir Agen dan OSWorld berjalan dengan filter keamanan diaktifkan, dan respons yang ditandai kembali sebagai *string* kosong. Jika ada, itu justru merugikan Argon.
Baris siber dari halaman siber DeepMind
Halaman siber DeepMind menambahkan empat skor di luar tabel peluncuran:
| Evaluasi siber | Gemini 4 Argon | Perbandingan |
|---|---|---|
| Penemuan kerentanan dunia nyata | 85.8% | Gemini 3.8 Flash Cyber 71.0% |
| Benchmark Uji Penetrasi Wiz | 70.9% | Gemini 3.8 Flash Cyber 58.2% |
| Keberhasilan serangan Gray Swan IPI (k=15, lebih rendah lebih baik) | 0.7% | Terendah di grafik; Kimi K3 tertinggi di 52.7% |
| CWE-bench v1 | 68% | Seri tiga arah dengan Grok 4.7 dan GPT-6 Astra; Opus 5.5 di 67% |
Evaluasi kerentanan menggunakan *harness* internal Antigravity “yang tidak terspesialisasi siber,” dengan akses sumber. Uji Wiz memberikan model “akses hanya ke situs web yang berjalan dan perilaku publiknya, tanpa kode sumber aplikasi.” Kedua perbandingan utama adalah terhadap model siber Google sebelumnya, bukan pesaing. Penjelasan pertahanan siber Argon kami mencakup arti semua ini untuk API yang Anda jalankan.
Papan skor pihak ketiga
Organisasi-organisasi ini memposting skor dalam beberapa menit setelah peluncuran, sehingga mereka memiliki akses pra-rilis.
- Artificial Analysis mencantumkan Gemini 4 Argon (Tinggi) pada Indeks Kecerdasan 53, #8 dari 223. Peringkat tersebut menghitung setiap pengaturan penalaran secara terpisah. Berdasarkan model yang berbeda, Argon seri dengan Fable 5.1 dan GPT-6 Astra dan berada di belakang Opus 5.5 (58 pada maks) dan Sonnet 5.5 (56 pada maks). AA melaporkan tingkat halusinasi 15% pada AA-Omniscience (Astra pada maks, 51%), dengan akurasi 50% berbanding 63%. Menjalankan indeks tersebut berbiaya $1.99 per tugas, sekitar 62K *output token* per tugas berbanding sekitar 27K untuk Astra pada maks. Artificial Analysis tidak menunjukkan data kecepatan atau latensi.
- Vals AI menempatkan Argon di 68.90% pada Indeks Vals, #1 dari 41 dan model Gemini pertama yang memuncaki, dengan biaya $15.68 per pengujian. Vals AI mencantumkan output maksimal 262K untuk konfigurasi yang diujinya, di bawah 1 juta yang disebutkan Google.
- Arena menempatkan Argon #1 pada Teks di 1525, ditandai Pendahuluan dari 4,942 suara, dan #8 pada WebDev.
Mengapa media mempublikasikan 12, 13, dan 14 kemenangan
Media telah mencetak tiga jumlah kemenangan yang berbeda. Berikut adalah penghitungan ulang dari 19 baris Google:
| Dihitung terhadap | Argon menang | Seri | Argon kalah | Tidak dilaporkan |
|---|---|---|---|---|
| Terbaik dari ketiga pesaing | 13 | 1 | 5 | 0 |
| Hanya GPT-6 Astra | 14 | 1 | 4 | 0 |
| Hanya Claude Opus 5.5 | 14 | 0 | 4 | 1 |
| Hanya Claude Fable 5.1 | 15 | 0 | 2 | 2 |
Angka 13 benar terhadap seluruh bidang. Angka 14 benar secara *head to head* melawan Astra atau Opus 5.5. Angka 12 tidak cocok dengan kerangka kerja apa pun dari 19 baris penuh ini, jadi periksa baris mana yang dihitung oleh sumber tersebut. Margin juga bervariasi: Harvey Legal Agent (19.6% berbanding 6.7%) memiliki selisih lebar; Chartography adalah 0.6 poin.
Cara menjalankan evaluasi Anda sendiri di hari akses dibuka
*Benchmark* menjelaskan *harness* Google; *prompt* Anda menjelaskan produk Anda. Buat evaluasi hari ini pada model yang dapat Anda panggil, lalu arahkan ke Argon dengan satu perubahan.
- Pilih *prompt* nyata yang sesuai dengan baris yang Anda pedulikan: perbaikan repositori, tugas terminal, pertanyaan dokumen panjang.
- Di Apidog, buat lingkungan dengan
GEMINI_API_KEYdanGEMINI_MODELdiatur kegemini-3.8-flash. Google belum mempublikasikan ID model Argon, jadi variabel inilah satu-satunya nilai yang akan Anda ubah. - Simpan setiap *prompt* sebagai permintaan yang membaca model dari
{{GEMINI_MODEL}}, dikelompokkan ke dalam skenario pengujian. - Tambahkan pernyataan pada output (status, bidang yang diperlukan, konten yang diharapkan) dan pada
usageMetadata, termasuk batas atasthoughtsTokenCountyang disesuaikan dengan batas biaya Anda. - Jalankan skenario pada 3.8 Flash sekarang dan simpan laporannya sebagai dasar Anda.
Pada hari ID Argon dikirimkan, tukar variabel dan jalankan kembali. Google mengatakan “semua model baru” akan diluncurkan di Interactions API, jadi simpan juga versi Interaksi dari setiap permintaan. Perbandingan Argon vs Gemini 3.8 Flash kami mencakup apa yang diharapkan pada harga dan batasan.
FAQ
- Apakah *benchmark* Gemini 4 Argon diverifikasi secara independen? Sebagian. Sembilan dari 19 baris berasal dari papan peringkat publik untuk setiap model, dan Artificial Analysis, Vals AI, serta Arena memposting hasilnya sendiri. Sisanya dijalankan Google untuk Argon.
- Berapa skor DeepSWE Gemini 4 Argon? 77.9% pada DeepSWE v1.1, mengungguli Opus 5.5 (74.2%) dan Astra (74.1%). Pengujian Argon menggunakan *harness* agen *mini-swe*, sementara angka-angka pesaing berasal dari papan peringkat dan kartu sistem.
- Apakah Argon mengalahkan GPT-6 Astra pada *benchmark*? *Head to head* dalam tabel Google, Argon memenangkan 14 baris, seri 1, dan kalah 4. Pada Artificial Analysis mereka seri di 53.
- Bisakah saya mengulang *benchmark* ini sendiri? Belum. Argon terbatas untuk mitra Fairwind, dan Google belum memberikan tanggal rilis publik; pelacak tanggal rilis Argon kami mengikuti peluncurannya.
Langkah selanjutnya
Buat skenario sekarang, jalankan pada 3.8 Flash, dan simpan laporannya. Saat Argon dibuka, Anda akan memiliki angka Anda sendiri beberapa menit setelah pertukaran. Unduh Apidog untuk mengaturnya.
