Mistral Kembali: Le Chonk Mengalahkan GPT-6 Astra dan Claude

Mistral Large 4 meraih 82% dalam tes siber di mana GPT-6 Astra dan Claude Opus 5.5 mencetak hampir nol. Inilah alasannya, ditambah spesifikasi, harga $0,68, dan di mana ia kalah.

Ashley Innocent

Ashley Innocent

6 October 2026

Mistral Kembali: Le Chonk Mengalahkan GPT-6 Astra dan Claude

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Mistral sudah lama tidak terdengar di segmen teratas. Mistral Large 3 diluncurkan pada Desember 2025, dan sejak saat itu, perbincangan tentang model *open-weight* terdepan adalah tentang Kimi, DeepSeek, GLM, dan Qwen. Pada 6 Oktober 2026, Mistral menjawab dengan Mistral Large 4, model dengan 1 triliun parameter yang disebut timnya sebagai "Le Chonk."

Angka utama adalah patokan siber di mana Large 4 mencetak 82% dan Claude Opus 5.5 serta GPT-6 Astra mencetak mendekati nol. Itu benar, ada di halaman peluncuran Mistral, dan memerlukan satu kalimat konteks sebelum Anda membagikannya. Artikel ini memberi Anda konteks itu, spesifikasi, harga sebenarnya, dan di mana Large 4 masih kalah.

TL;DR

Mengapa "Mistral kembali" itu adil

Sepanjang tahun 2026, sebagian besar model *open-weight* terkuat berasal dari Tiongkok. Mistral terus meluncurkan produk, dengan Medium 3.5, Devstral 2, dan Small 4, tetapi tidak ada yang dapat bersaing dengan model tertutup terdepan di wilayahnya sendiri.

Large 4 mengubah persaingan. Mistral mengklaim bahwa model ini "secara signifikan mengungguli model *open-weight* mana pun yang dikembangkan di AS atau Eropa," dan mendukung klaim tersebut dengan cerita pelatihan yang dibangun untuk kalangan kedaulatan UE. Model ini dilatih dari awal pada 3.800 GPU NVIDIA Grace Blackwell di pusat data Eropa milik Mistral, mencakup lebih dari 160 bahasa termasuk setiap bahasa resmi UE, dan hadir beberapa minggu setelah pendanaan Seri D €3 miliar yang disebut Mistral sebagai putaran ekuitas terbesar yang pernah dikumpulkan oleh perusahaan teknologi Eropa.

Waktu juga penting. Large 4 tiba tepat setelah Reflection meluncurkan model Beam *open-weight* miliknya, sehingga persaingan model terbuka AS-vs-Tiongkok kini memiliki peserta serius ketiga.

Berita utama siber, dan penangkapnya

Berikut adalah hasil yang semua orang sedang tangkap layar. Artificial Analysis Cyber Index menyertakan tes yang meminta model untuk mereproduksi kerentanan nyata dalam perangkat lunak *open-source* dan kemudian menambalnya. Mistral mengatakan Large 4 mencetak 82%, yang tertinggi dari model mana pun.

Kemudian penangkapnya, dengan kata-kata Mistral sendiri: "Beberapa model tertutup terkemuka, termasuk Claude Opus 5.5 dan GPT-6 Astra, mencetak mendekati nol pada tes yang sama karena mereka menolak untuk melakukan tugas tersebut."

Jadi bacalah seperti ini:

Klaim Apa artinya sebenarnya
“Large 4 mengalahkan Astra dan Opus 5.5 dalam siber” Pada satu tes ini, model tertutup menolak untuk menjawab. Large 4 menjawab dan biasanya berhasil.
“Large 4 adalah model peretas terbaik” Belum ditetapkan. Penolakan adalah pilihan kebijakan, bukan batas kemampuan.
“Large 4 tidak aman” Juga belum ditetapkan. Mistral melaporkan tingkat penolakan rata-ratanya pada *prompt* siber dari JailbreakBench, StrongREJECT, dan AgentHarm lebih tinggi daripada model *open-weight* lainnya.

Ada kemampuan nyata di balik berita utama ini. Large 4 juga menyelesaikan 93% dari Cybench, serangkaian 40 latihan *capture-the-flag*, yang disebut Mistral sebagai salah satu skor tertinggi yang dilaporkan untuk model *open-weight*. Pada B3 Agent Security Benchmark, model ini berhasil menahan 93,3% serangan.

Bagi tim keamanan, kombinasi ini adalah cerita sebenarnya: model yang dapat Anda *self-host* yang akan membantu mereproduksi dan menambal CVE di kode Anda sendiri, sambil tetap menolak sebagian besar permintaan yang jelas-jelas berbahaya. Bagi tim API, ini adalah alat yang berguna untuk dimiliki di perangkat keras Anda sendiri daripada di balik filter kebijakan orang lain.

Di mana Large 4 mengalahkan GPT-6 Astra di luar siber

Hasil siber adalah yang paling mencolok. Dua kemenangan lain melawan Astra lebih sunyi dan lebih berarti, karena kedua model benar-benar mencoba tugas tersebut:

Benchmark Mistral Large 4 GPT-6 Astra Catatan
Dense 200 (*visual grounding*) 42% 41% Keunggulan satu poin. Nyata, tetapi sempit.
Finance Agent v2 (vals.ai) Unggul Tertinggal Mistral melaporkan peringkat, bukan skor.
Harvey Legal Agent Benchmark Model terbuka terbaik Terdaftar Tidak ada angka perbandingan langsung yang dipublikasikan.

Dibandingkan dengan model terbuka lainnya, selisihnya lebih lebar:

Benchmark Mistral Large 4 Mengalahkan siapa
AutomationBench (657 alur kerja) 59,9% Kimi K3, DeepSeek V4 Pro
AA-Briefcase (*knowledge work*) 1,393 Elo DeepSeek V4 Pro
DeepSWE v1.1 (*coding*) 61,7% Memimpin model *open-weight*
SWE-Atlas-QnA 59,4%
Terminal-Bench 4.0 28,3%

Semua ini adalah angka model pratinjau yang dilaporkan Mistral. Belum ada lab independen yang menjalankannya kembali, dan Euronews melaporkan bahwa *reinforcement learning* masih dalam tahap penyelesaian saat peluncuran. Perlakukan ini sebagai sinyal kuat, bukan sebagai putusan akhir.

Di mana ia masih kalah

Mistral menerbitkan satu hasil di mana model tertutup jelas-jelas menang. Dalam evaluasi manusia terhadap kualitas coding yang dilakukan oleh Surge AI di lima model, Large 4 Preview menempati peringkat kedua:

Model Skor coding manusia (dari 5)
Claude Opus 5 4.22
Mistral Large 4 Preview 3.74
GLM-5.3 3.60
Kimi K3 3.59
GLM-5.2 3.40

Itu adalah kemenangan telak atas model terbuka Tiongkok terbaik, dan selisih setengah poin di belakang Claude. Frasa Mistral sendiri adalah bahwa Large 4 "memperkecil jarak" dengan model terdepan dalam coding, yang merupakan pembacaan yang jujur.

Juga tidak ada: tidak ada perbandingan dengan Claude Fable 5.1 atau GPT-6 Sol di mana pun dalam materi peluncuran. Jika seseorang memberi tahu Anda bahwa Large 4 mengalahkan Fable, mintalah patokannya.

Sekilas Spesifikasi

Spesifikasi Mistral Large 4
ID model API mistral-large-4 (alias mistral-large-4-0)
Versi 26.10, pratinjau publik
Arsitektur Mixture-of-experts, instruksi hibrida + penalaran
Parameter Total 1.05T, aktif 49B, *vision encoder* 1.6B
Jendela konteks 1M token
Input Teks, gambar
Penalaran Parameter reasoning_effort ("high" atau "none")
Alat Panggilan fungsi, output terstruktur, alat agen bawaan
Endpoint /v1/chat/completions, /v1/conversations, /v1/agents, /v1/batch
Bobot Terbuka, pada akhir Oktober 2026; lisensi belum dipublikasikan

Harga: model kelas terdepan termurah yang bisa Anda gunakan hari ini

Ini adalah bagian yang seharusnya membuat tim API memperhatikan. Halaman harga Mistral mencantumkan Large 4 dengan harga setengah dari harga daftarnya selama pratinjau:

Model Input / 1M Output / 1M Bobot terbuka
Mistral Large 4 (harga pratinjau) $0.68 $2.09 Ya, akhir Oktober
Mistral Large 4 (harga daftar) $1.36 $4.18 Ya, akhir Oktober
Claude Opus 5.5 $4.00 $20.00 Tidak
GPT-6 Astra $10.00 $50.00 Tidak

Pada harga pratinjau, output Large 4 harganya sekitar seperdua puluh empat dari Astra. Bahkan pada harga daftar, harganya sekitar 12x lebih murah untuk output. Input yang di-*cache* turun menjadi $0.07 per juta, yang penting untuk agen yang mengirim ulang *system prompt* dan definisi alat yang sama di setiap giliran.

Mistral belum mengatakan kapan diskon pratinjau berakhir, jadi anggarkan berdasarkan harga daftar.

Haruskah Anda beralih?

Coba sekarang jika:

Tunggu jika:

Cara menguji Large 4 terhadap API Anda sendiri di Apidog

Patokan memberi tahu Anda bagaimana kinerja model pada tugas orang lain. Cara tercepat untuk memutuskan adalah dengan menjalankan Large 4 pada *prompt* Anda sendiri dan membandingkannya dengan model yang Anda bayar saat ini. Apidog menanganinya tanpa satu baris kode bantu pun:

  1. Simpan permintaan sekali. Buat POST https://api.mistral.ai/v1/chat/completions, simpan kunci Anda sebagai variabel lingkungan, dan atur Authorization: Bearer {{MISTRAL_API_KEY}}.
  2. Gandakan untuk setiap model. Duplikat permintaan, ubah hanya bidang model (mistral-large-4 vs. model Anda saat ini), dan kirim keduanya. Apidog menampilkan respons, status, latensi, dan ukuran secara berdampingan, dan blok usage memberi Anda jumlah token untuk perbandingan biaya.
  3. Tambahkan asersi. Periksa status 200, jawaban yang tidak kosong, dan kecocokan Skema JSON jika Anda meminta output terstruktur. Itu mengubah eksperimen satu kali menjadi tes regresi.
  4. Jalankan kembali pada setiap pembaruan model. Kelompokkan permintaan ke dalam skenario pengujian dan jalankan kembali saat Mistral memperbarui pratinjau atau mengirimkan bobot. Anda akan melihat apakah kualitasnya berubah sebelum pengguna Anda menyadarinya.

Dua kekuatan Large 4 cocok secara alami untuk pekerjaan API. Hasil keamanannya menjadikannya peninjau kedua yang baik untuk pengujian keamanan API, misalnya saat Anda mereproduksi *auth bypass* di API pementasan Anda sendiri. Panggilan fungsi dan output terstrukturnya memungkinkan Anda mengubah spesifikasi OpenAPI yang dirancang di Apidog menjadi definisi alat yang dapat dipanggil agen.

Untuk panduan kode lengkap, termasuk kunci, potongan penalaran, gambar, panggilan fungsi, dan perhitungan biaya, lihat panduan API Mistral Large 4 kami. Datang dari model Mistral yang lebih lama? Dasar-dasar API Mistral AI dan panduan API Mistral Medium 3.5 masih berlaku: URL dasar yang sama, otentikasi yang sama, ID model baru.

FAQ

Apakah Mistral Large 4 adalah *open source*? Ini adalah *open-weight*. Mistral mengatakan bobot akan dikirimkan pada akhir Oktober 2026. Lisensinya belum dipublikasikan, jadi jangan berasumsi itu cocok dengan Apache 2.0 milik Large 3.

Apakah Mistral Large 4 benar-benar mengalahkan GPT-6 Astra? Pada *visual grounding* (42% vs 41%) dan Finance Agent v2, ya, menurut angka Mistral. Pada tes kerentanan siber, Astra mencetak mendekati nol karena menolak, jadi itu bukan kemenangan *apple-to-apple*.

Apakah ia mengalahkan Claude? Tidak dalam hal coding. Claude Opus 5 memimpin evaluasi coding manusia 4.22 berbanding 3.74. Claude Opus 5.5 juga menolak tugas reproduksi siber, itulah sebabnya ia mencetak mendekati nol di sana.

Apa arti "Le Chonk"? Itu adalah julukan tidak resmi Mistral untuk model tersebut, lelucon tentang ukurannya. Nama resminya adalah Mistral Large 4, atau ML4.

Bisakah saya menggunakannya secara gratis? Paket gratis Mistral mencakup $10 per bulan dalam kredit API dan akses ke model terbarunya di Le Chat dan Vibe. Dengan harga pratinjau, $10 dapat membeli sekitar 4,8 juta token output pada Large 4.

Intinya

Mistral kembali dalam percakapan model terdepan. Large 4 adalah model *open-weight* terkuat dari luar Tiongkok berdasarkan angka Mistral, harganya hanya sebagian kecil dari Astra atau Opus 5.5, dan akan berjalan di perangkat keras Anda sendiri dalam beberapa minggu. Pernyataan "mengalahkan Astra dan Claude dalam siber" itu nyata tetapi berasal dari penolakan, dan penilaian coding yang jujur adalah "kedua setelah Claude". Ujilah pada API Anda sendiri di Apidog sekarang selagi harga pratinjau masih berlaku, dan tunda keputusan produksi Anda sampai patokan independen tiba setelah 27 Oktober.

tombol

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.