Benchmark Gemini 4 Argon: 19 Hasil Lengkap, Bagaimana Google Menjalankannya, dan 5 Kekalahannya

Tolok ukur Gemini 4 Argon: semua 19 baris dengan siapa yang mengukur masing-masing, 5 yang kalah, peringatan metodologi Google, dan skor AA, Vals, serta Arena.

INEZA Felin-Michel

INEZA Felin-Michel

2 October 2026

Benchmark Gemini 4 Argon: 19 Hasil Lengkap, Bagaimana Google Menjalankannya, dan 5 Kekalahannya

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Gemini 4 Argon memimpin 13 dari 19 baris dalam tabel peluncuran Google secara keseluruhan, seri di 1 (CWE-bench v1, dengan GPT-6 Astra), dan tertinggal di 5: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1, dan OSWorld-2.0. Masalahnya adalah akses. Argon saat ini hanya tersedia untuk pembela Program Fairwind, jadi belum ada orang di luar daftar mitra Google dan beberapa organisasi benchmark yang dapat mengulang angka-angka ini.

Di bawah: tabel lengkap dengan siapa yang mengukur setiap baris, lima kekalahan, cetakan kecil, skor siber, papan skor pihak ketiga, dan cara membangun evaluasi Anda sendiri di Apidog sebelum akses dibuka. Untuk gambaran umum model, mulailah dengan apa itu Gemini 4 Argon. Untuk keputusan pembelian, lihat Argon vs GPT-6 Astra vs Claude Opus 5.5.

Tabel lengkap, dengan siapa yang mengukur setiap baris

Ini adalah hasil yang dilaporkan Google dari pos peluncuran dan PDF metodologi evaluasi, yang berjudul "hasil per Oktober 2026." Google menghitung 10 dari 19 skor Argon sendiri; 9 lainnya berasal dari papan peringkat publik. Angka-angka pesaing berasal dari papan peringkat tersebut, hasil uji coba Google sendiri, atau kartu sistem dan postingan blog vendor, dan *harness* berbeda per baris. Teks tebal menandai pemimpin baris.

Benchmark Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 Siapa yang mengukurnya
Vals Index 68.9% 63.1% 65.8% 67.0% Vals AI
AutomationBench 51.3% 41.4% 31.4% 42.5% Papan peringkat Zapier (set pribadi)
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6% Vals AI
Harvey Legal Agent 19.6% 5.4% 6.7% 3.8% Vals AI
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2% Dihitung sendiri oleh Argon; papan peringkat Astra; kartu sistem Anthropic
FrontierSWE v2 55.0% 65.5% 56.3% 62.3% Papan peringkat Proximal
Vibe Code Bench 91.9% 89.6% 90.3% 90.3% Vals AI
Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4% Dihitung sendiri oleh Argon; papan peringkat pesaing
PostTrainBench 45.3% 44.3% 40.2% 49.3% Dihitung sendiri untuk semua model
Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3% Dihitung sendiri oleh Argon; papan peringkat pesaing
LABBench 2 88.8% 85.4% 68.6% 73.1% Dihitung sendiri untuk semua model
RiemannBench 76.0% 72.0% 65.6% 69.6% Papan peringkat Surge
GraphWalks up to 128K 99.7% 98.7% 91.4% 90.6% Dihitung sendiri untuk semua model
GraphWalks 256K to 1M 84.2% 71.8% 65.0% 66.8% Dihitung sendiri untuk semua model
Agent’s Last Exam 39.5% 34.2% t/l 38.2% Dihitung sendiri oleh Argon; papan peringkat pesaing
OSWorld-2.0 (offline) 69.2% 72.6% t/l t/l Dihitung sendiri oleh Argon; Astra dari postingan blog OpenAI
Chartography 71.6% 71.0% 46.2% 66.3% Papan peringkat Surge
LVBench 91.7% 87.5% 79.7% 83.7% Dihitung sendiri untuk semua model
CWE-bench v1 68.0% 68.0% 58.0% 67.0% Papan peringkat publik

t/l = tidak dilaporkan. Grok 4.7, yang tidak ada dalam tabel Google, juga mendapat skor 68% di papan peringkat CWE-bench, sehingga hasil seri tersebut adalah tiga arah.

Diurutkan berdasarkan sumber, 9 baris berasal dari papan peringkat publik untuk setiap model (Vals AI, Zapier, Proximal, Surge, dan CWE-bench). Argon memimpin 7 dari 9 tersebut dan seri di 1. Google menjalankan 5 baris sendiri untuk keempat model, dan Argon memimpin 4. 5 baris lainnya memasangkan skor Argon yang dijalankan Google dengan angka pesaing dari tempat lain, dan di situlah Argon paling banyak kalah: 3 dari 5 kekalahannya ada di baris campuran tersebut. Jika penghitungan sendiri menguntungkan Argon, Anda akan mengharapkan yang sebaliknya.

Di mana Argon tertinggal, dan mengapa itu penting untuk pengkodean agen

Pengkodean agen terbagi 2 banding 2. Argon memenangkan DeepSWE v1.1 dan Vibe Code Bench, kemudian menempati posisi terakhir di FrontierSWE v2 dan Terminal-bench 4.0. Kemenangan DeepSWE mencampur *harness*: Argon berjalan pada *harness* agen *mini-swe*, angka Astra berasal dari papan peringkat publik, dan angka Claude berasal dari kartu sistem. Vibe Code Bench lebih bersih, karena Vals AI menilai keempatnya, tetapi selisihnya adalah 1.6 poin.

Jika beban kerja Anda adalah agen yang banyak menggunakan terminal atau tugas repositori yang panjang, pertimbangkan dua baris posisi terakhir tersebut di atas jumlah utama. Astra memegang keunggulan FrontierSWE; hands-on GPT-6 Astra kami menunjukkan bagaimana model tersebut digunakan saat ini. Untuk sisi Anthropic, rincian benchmark Claude Fable 5.1 kami mencakup angka peluncuran Fable sendiri.

Bloomberg melaporkan bahwa karyawan Google anonim yang memiliki akses mengatakan Argon kurang memuaskan dalam beberapa pekerjaan pengkodean dan desain *front-end* relatif terhadap skor benchmark-nya. Google menyatakan karakterisasi tersebut tidak akurat.

Peringatan metodologi yang mengubah cara Anda membaca tabel

Baris siber dari halaman siber DeepMind

Halaman siber DeepMind menambahkan empat skor di luar tabel peluncuran:

Evaluasi siber Gemini 4 Argon Perbandingan
Penemuan kerentanan dunia nyata 85.8% Gemini 3.8 Flash Cyber 71.0%
Benchmark Uji Penetrasi Wiz 70.9% Gemini 3.8 Flash Cyber 58.2%
Keberhasilan serangan Gray Swan IPI (k=15, lebih rendah lebih baik) 0.7% Terendah di grafik; Kimi K3 tertinggi di 52.7%
CWE-bench v1 68% Seri tiga arah dengan Grok 4.7 dan GPT-6 Astra; Opus 5.5 di 67%

Evaluasi kerentanan menggunakan *harness* internal Antigravity “yang tidak terspesialisasi siber,” dengan akses sumber. Uji Wiz memberikan model “akses hanya ke situs web yang berjalan dan perilaku publiknya, tanpa kode sumber aplikasi.” Kedua perbandingan utama adalah terhadap model siber Google sebelumnya, bukan pesaing. Penjelasan pertahanan siber Argon kami mencakup arti semua ini untuk API yang Anda jalankan.

Papan skor pihak ketiga

Organisasi-organisasi ini memposting skor dalam beberapa menit setelah peluncuran, sehingga mereka memiliki akses pra-rilis.

Mengapa media mempublikasikan 12, 13, dan 14 kemenangan

Media telah mencetak tiga jumlah kemenangan yang berbeda. Berikut adalah penghitungan ulang dari 19 baris Google:

Dihitung terhadap Argon menang Seri Argon kalah Tidak dilaporkan
Terbaik dari ketiga pesaing 13 1 5 0
Hanya GPT-6 Astra 14 1 4 0
Hanya Claude Opus 5.5 14 0 4 1
Hanya Claude Fable 5.1 15 0 2 2

Angka 13 benar terhadap seluruh bidang. Angka 14 benar secara *head to head* melawan Astra atau Opus 5.5. Angka 12 tidak cocok dengan kerangka kerja apa pun dari 19 baris penuh ini, jadi periksa baris mana yang dihitung oleh sumber tersebut. Margin juga bervariasi: Harvey Legal Agent (19.6% berbanding 6.7%) memiliki selisih lebar; Chartography adalah 0.6 poin.

Cara menjalankan evaluasi Anda sendiri di hari akses dibuka

*Benchmark* menjelaskan *harness* Google; *prompt* Anda menjelaskan produk Anda. Buat evaluasi hari ini pada model yang dapat Anda panggil, lalu arahkan ke Argon dengan satu perubahan.

  1. Pilih *prompt* nyata yang sesuai dengan baris yang Anda pedulikan: perbaikan repositori, tugas terminal, pertanyaan dokumen panjang.
  2. Di Apidog, buat lingkungan dengan GEMINI_API_KEY dan GEMINI_MODEL diatur ke gemini-3.8-flash. Google belum mempublikasikan ID model Argon, jadi variabel inilah satu-satunya nilai yang akan Anda ubah.
  3. Simpan setiap *prompt* sebagai permintaan yang membaca model dari {{GEMINI_MODEL}}, dikelompokkan ke dalam skenario pengujian.
  4. Tambahkan pernyataan pada output (status, bidang yang diperlukan, konten yang diharapkan) dan pada usageMetadata, termasuk batas atas thoughtsTokenCount yang disesuaikan dengan batas biaya Anda.
  5. Jalankan skenario pada 3.8 Flash sekarang dan simpan laporannya sebagai dasar Anda.

Pada hari ID Argon dikirimkan, tukar variabel dan jalankan kembali. Google mengatakan “semua model baru” akan diluncurkan di Interactions API, jadi simpan juga versi Interaksi dari setiap permintaan. Perbandingan Argon vs Gemini 3.8 Flash kami mencakup apa yang diharapkan pada harga dan batasan.

FAQ

Langkah selanjutnya

Buat skenario sekarang, jalankan pada 3.8 Flash, dan simpan laporannya. Saat Argon dibuka, Anda akan memiliki angka Anda sendiri beberapa menit setelah pertukaran. Unduh Apidog untuk mengaturnya.

button

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.