Apa Itu GLM-5.3-Flash? Model AI Multimoda Natif Bobot Terbuka Pertama Z.ai

GLM-5.3-Flash dari Z.ai adalah model MIT 320B-A18B dengan input gambar asli dan konteks 1M. Spesifikasi, benchmark, dan mengapa Flash berarti murah, bukan cepat.

INEZA Felin-Michel

INEZA Felin-Michel

27 August 2026

Apa Itu GLM-5.3-Flash? Model AI Multimoda Natif Bobot Terbuka Pertama Z.ai

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Z.ai merilis GLM-5.3-Flash pada 26 Agustus 2026. Ini adalah model mixture-of-experts berparameter 320 miliar dengan 18 miliar parameter aktif, dilisensikan di bawah lisensi MIT, dan merupakan model pertama dalam seri GLM-5 yang menangani gambar secara native alih-alih melalui adapter visi terpasang.

Ini juga merupakan model yang banyak pengembang telah gunakan selama seminggu tanpa menyadarinya. Lebih lanjut tentang itu di bawah.

Jika Anda datang ke sini mengharapkan "Flash" berarti "cepat," postingan ini akan tidak setuju dengan Anda. Konvensi penamaan tersebut berasal dari Google, di mana model Flash benar-benar merupakan tingkat latensi rendah. Di sini, artinya berbeda, dan memahami perbedaan tersebut dengan benar mengubah apakah model ini sesuai dengan beban kerja Anda.

TL;DR

Spesifikasi

Properti Nilai
Parameter total 320B
Parameter aktif 18B
Arsitektur Mixture of experts, perhatian hibrida linear dan sparse
Lisensi MIT
Jendela konteks 1.048.576 token
Modalitas masukan Teks, gambar, video, file
Keluaran Teks
Mode penalaran rendah, tinggi, maks (standar maks)
ID model API glm-5.3-flash
Hugging Face zai-org/GLM-5.3-Flash

Satu angka yang perlu diperhatikan dengan cermat: token keluaran maksimum. OpenRouter mencantumkan 131.072 dan kartu model Hugging Face menunjukkan 163.840. Sumber-sumber tersebut tidak konsisten dan Z.ai belum mempublikasikan angka yang menyelesaikannya. Jika aplikasi Anda bergantung pada generasi tunggal yang sangat panjang, periksa batasnya dengan penyedia Anda yang sebenarnya sebelum Anda membangunnya.

Multimodality native adalah berita sebenarnya

Setiap kapabilitas visi sebelumnya dalam lini GLM tiba sebagai model terpisah atau jalur terpisah. Z.ai mengirimkan GLM-5V-Turbo dan GLM-4.6V sebagai model visi yang berbeda. Jika Anda ingin model GLM melihat tangkapan layar, Anda memanggil endpoint yang berbeda dari yang digunakan lalu lintas teks Anda.

GLM-5.3-Flash menyatukan itu. Gambar, video, dan file adalah blok konten dalam permintaan penyelesaian obrolan yang sama yang membawa teks Anda. Ada satu ID model, satu baris penagihan, dan satu jendela konteks yang menampung gambar Anda dan sejuta token teks di sekitarnya secara bersamaan.

Bagian terakhir itu yang menarik. Jendela konteks 1 juta token yang juga menerima gambar berarti Anda dapat menempatkan dokumen spesifikasi panjang dan tangkapan layar hasil rendering dalam prompt yang sama dan meminta model untuk menyelaraskannya. Framing Z.ai sendiri bersandar pada ini: ia menggambarkan model mengamati "antarmuka, hasil rendering, dan umpan balik interaksi," yang merupakan kasus penggunaan agen koding, bukan penulisan keterangan foto.

Jika Anda bekerja dengan model visi secara lebih luas, panduan kami untuk API GLM-5V-Turbo mencakup pendekatan visi khusus yang lebih lama, dan GLM-OCR untuk pemahaman dokumen mencakup kasus spesialis.

Arsitektur, singkatnya

Z.ai membangun GLM-5.3-Flash di atas model dasar baru daripada melatih ulang GLM-5.2. Dua pilihan desain penting untuk bagaimana ia berperilaku:

Perhatian Hibrida. Model ini memadukan perhatian linear dengan perhatian sparse. Perhatian linear menangani dependensi lokal dengan murah; perhatian sparse menjangkau token yang relevan secara global. Hasil yang dinyatakan adalah komputasi perhatian sekitar tiga kali lebih sedikit dari GLM-5.3 dan cache KV sekitar 4,4 kali lebih kecil.

Manifold-Constrained Hyper-Connections. Istilah Z.ai untuk pekerjaan efisiensi penskalaan dalam rilis ini. Belum ada detail publik yang cukup untuk mengevaluasinya secara independen, jadi anggap ini sebagai fitur arsitektur yang dijelaskan vendor daripada keuntungan yang terbukti.

Pengurangan cache KV adalah bagian dengan konsekuensi praktis yang jelas. Cache KV adalah yang membuat inferensi konteks panjang mahal dalam memori, dan menyusutkannya sebesar 4,4x adalah sebagian besar alasan mengapa model ini dapat disajikan dengan sepersepuluh harga GLM-5.2 sambil mempertahankan jendela 1 juta.

Pelatihan menggunakan korpus yang Z.ai gambarkan sebagai sekitar 30 triliun token multimodal.

Tentang namanya

Artificial Analysis mengukur GLM-5.3-Flash pada 48,7 token keluaran per detik. Sebagai konteks, itu berada di ujung bawah untuk model bobot terbuka dengan ukuran sebanding. GLM-5.3, saudaranya yang lebih besar, berjalan sekitar 86 token per detik pada pengukuran yang sama.

Jadi model Flash kira-kira setengah kecepatan model non-Flash.

Yang dimenangkannya adalah waktu ke token pertama, yaitu 1,52 detik dibandingkan dengan median bobot terbuka 2,14 detik. Jika beban kerja Anda adalah banyak giliran interaktif singkat, responsivitas itu nyata. Jika beban kerja Anda adalah menghasilkan dokumen panjang, Anda akan menunggu lebih lama daripada di GLM-5.3.

Efisiensi yang diberikan model ini adalah dalam biaya dan memori, bukan kecepatan generasi waktu-nyata (wall-clock). Cache KV yang lebih kecil dan komputasi perhatian yang lebih rendah menghasilkan harga per token yang lebih murah dan jejak penyajian yang lebih kecil. Ini tidak berarti streaming yang lebih cepat.

Ini penting karena sebagian besar liputan yang diterbitkan beberapa hari setelah peluncuran mengulang narasi vendor tanpa memeriksa angka throughput, yang telah publik sepanjang waktu. Pilih model ini karena harganya tidak mahal dan menangani gambar, bukan karena Anda mengharapkannya untuk streaming dengan cepat.

Benchmark

Angka-angka yang diterbitkan saat peluncuran oleh Z.ai, jadi bacalah sebagai klaim vendor sampai pihak ketiga mereproduksinya:

Angka independen adalah dari Artificial Analysis, yang menempatkan GLM-5.3-Flash pada 57 di Intelligence Index v4.1.1 miliknya. GLM-5.3 mencetak 60. Median untuk model bobot terbuka dengan ukuran serupa adalah 27, jadi 57 adalah hasil yang kuat untuk kelasnya meskipun berada di bawah saudaranya yang lebih besar.

Z.ai menggambarkan model ini mendekati Claude Opus 4.8 dalam pekerjaan koding dan agen. Itu adalah karakterisasi vendor dari evaluasi internalnya sendiri, bukan hasil terukur pihak ketiga, dan selisih tiga poin dalam Intelligence Index dengan GLM-5.3 miliknya sendiri menunjukkan bahwa diperlukan sedikit kehati-hatian.

Untuk bagaimana cerita benchmark GLM berkembang selama rilis sebelumnya, analisis benchmark GLM-5.2 kami menjelaskan apa sebenarnya yang diukur oleh setiap evaluasi ini.

Minggu Ox Alpha

Pada 20 Agustus, sebuah model anonim bernama ox-alpha muncul di platform inferensi pihak ketiga dengan jendela konteks 1 juta token dan harga nol. Ini menjadi salah satu model yang paling banyak digunakan di platform tersebut dalam beberapa hari. Komunitas mengidentifikasinya sebagai Zhipu dalam waktu sekitar 48 jam berdasarkan karakteristik keluarannya.

Pada 26 Agustus, Z.ai mengonfirmasinya: Ox Alpha adalah GLM-5.3-Flash, dan minggu gratis itu adalah uji beban yang disengaja.

Z.ai juga mengatakan bahwa selama minggu itu, semua lalu lintas dilayani di akselerator domestik Tiongkok menggunakan tumpukan berbasis SGLang, dan mengklaim biaya penyajian per token sebanding dengan perangkat keras NVIDIA mainstream. Itu adalah klaim vendor tentang infrastruktur mereka sendiri tanpa verifikasi independen yang tersedia, jadi pertimbangkanlah dengan bijak.

Kami telah menuliskan pola ini sebelumnya ketika Pony Alpha ternyata adalah model DeepSeek atau GLM. Peluncuran rahasia pada router pihak ketiga menjadi langkah pra-rilis standar, dan pelajaran yang berguna adalah bahwa model anonim yang sangat mampu dengan jendela konteks yang mencurigakan hampir selalu merupakan produk unggulan yang belum dirilis yang mengumpulkan data evaluasi.

Cara menggunakannya

Haruskah Anda menggunakannya?

Gunakan GLM-5.3-Flash jika Anda membutuhkan pemahaman gambar atau video dalam panggilan yang sama dengan teks Anda, jika biaya per token Anda adalah batasan yang Anda optimalkan, atau jika Anda ingin bobot terbuka yang dapat Anda host sendiri di bawah lisensi permisif.

Gunakan GLM-5.3 sebagai gantinya jika Anda membutuhkan beberapa poin terakhir kualitas penalaran, atau jika throughput generasi lebih penting bagi Anda daripada harga. Perbandingan berdampingan kami dari keduanya membahas keputusan secara rinci, dan apa itu GLM-5.3 membahas model dasar dengan sendirinya.

Apa pun yang Anda pilih, pergantian adalah perubahan ID model satu baris pada endpoint yang kompatibel dengan OpenAI, yang membuatnya mudah untuk menguji keduanya terhadap beban kerja Anda sendiri daripada memercayai tabel benchmark siapa pun. Itu adalah cara yang tepat untuk menyelesaikannya.

Menguji pertukaran model dengan benar berarti mengirim permintaan nyata dan memeriksa respons nyata, termasuk yang multimodal yang canggung untuk dibuat secara manual di curl. Apidog memungkinkan Anda menyimpan panggilan tersebut sebagai koleksi yang dapat digunakan kembali dengan penegasan terlampir, sehingga ketika Anda beralih dari GLM-5.3 ke Flash, Anda dapat mengonfirmasi bahwa bentuk respons tidak berubah alih-alih baru mengetahuinya di produksi.

FAQ

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.