Z.ai merilis GLM-5.3-Flash pada 26 Agustus 2026. Ini adalah model mixture-of-experts berparameter 320 miliar dengan 18 miliar parameter aktif, dilisensikan di bawah lisensi MIT, dan merupakan model pertama dalam seri GLM-5 yang menangani gambar secara native alih-alih melalui adapter visi terpasang.
Ini juga merupakan model yang banyak pengembang telah gunakan selama seminggu tanpa menyadarinya. Lebih lanjut tentang itu di bawah.
Jika Anda datang ke sini mengharapkan "Flash" berarti "cepat," postingan ini akan tidak setuju dengan Anda. Konvensi penamaan tersebut berasal dari Google, di mana model Flash benar-benar merupakan tingkat latensi rendah. Di sini, artinya berbeda, dan memahami perbedaan tersebut dengan benar mengubah apakah model ini sesuai dengan beban kerja Anda.
TL;DR
- Apa itu: sebuah model mixture-of-experts 320B-A18B (MIT) dengan bobot terbuka dari Z.ai, dirilis 26 Agustus 2026.
- Perubahan utama: multimodality native. Masukan gambar, video, dan file langsung masuk ke model. GLM-5.3 mengarahkan visi melalui adapter terpisah, dan GLM-5.2 hanya berbasis teks.
- Kontekstual: 1.048.576 token, jendela 1 juta yang sama dengan GLM-5.3.
- Poin jual utama: biaya. Z.ai menempatkannya sekitar sepersepuluh harga GLM-5.2, dengan tarif daftar $0,15 per juta token masukan dan $0,50 per juta token keluaran.
- Peringatan jujur: ini tidak cepat. Artificial Analysis mengukur 48,7 token keluaran per detik, yang lambat untuk kelas ukurannya. Waktu ke token pertama benar-benar bagus pada 1,52 detik.
- Di mana mendapatkannya: API Z.ai sebagai
glm-5.3-flash, ditambah OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, dan beberapa penyedia lainnya. Bobotnya ada di Hugging Face.
Spesifikasi
| Properti | Nilai |
|---|---|
| Parameter total | 320B |
| Parameter aktif | 18B |
| Arsitektur | Mixture of experts, perhatian hibrida linear dan sparse |
| Lisensi | MIT |
| Jendela konteks | 1.048.576 token |
| Modalitas masukan | Teks, gambar, video, file |
| Keluaran | Teks |
| Mode penalaran | rendah, tinggi, maks (standar maks) |
| ID model API | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
Satu angka yang perlu diperhatikan dengan cermat: token keluaran maksimum. OpenRouter mencantumkan 131.072 dan kartu model Hugging Face menunjukkan 163.840. Sumber-sumber tersebut tidak konsisten dan Z.ai belum mempublikasikan angka yang menyelesaikannya. Jika aplikasi Anda bergantung pada generasi tunggal yang sangat panjang, periksa batasnya dengan penyedia Anda yang sebenarnya sebelum Anda membangunnya.
Multimodality native adalah berita sebenarnya
Setiap kapabilitas visi sebelumnya dalam lini GLM tiba sebagai model terpisah atau jalur terpisah. Z.ai mengirimkan GLM-5V-Turbo dan GLM-4.6V sebagai model visi yang berbeda. Jika Anda ingin model GLM melihat tangkapan layar, Anda memanggil endpoint yang berbeda dari yang digunakan lalu lintas teks Anda.
GLM-5.3-Flash menyatukan itu. Gambar, video, dan file adalah blok konten dalam permintaan penyelesaian obrolan yang sama yang membawa teks Anda. Ada satu ID model, satu baris penagihan, dan satu jendela konteks yang menampung gambar Anda dan sejuta token teks di sekitarnya secara bersamaan.
Bagian terakhir itu yang menarik. Jendela konteks 1 juta token yang juga menerima gambar berarti Anda dapat menempatkan dokumen spesifikasi panjang dan tangkapan layar hasil rendering dalam prompt yang sama dan meminta model untuk menyelaraskannya. Framing Z.ai sendiri bersandar pada ini: ia menggambarkan model mengamati "antarmuka, hasil rendering, dan umpan balik interaksi," yang merupakan kasus penggunaan agen koding, bukan penulisan keterangan foto.
Jika Anda bekerja dengan model visi secara lebih luas, panduan kami untuk API GLM-5V-Turbo mencakup pendekatan visi khusus yang lebih lama, dan GLM-OCR untuk pemahaman dokumen mencakup kasus spesialis.
Arsitektur, singkatnya
Z.ai membangun GLM-5.3-Flash di atas model dasar baru daripada melatih ulang GLM-5.2. Dua pilihan desain penting untuk bagaimana ia berperilaku:

Perhatian Hibrida. Model ini memadukan perhatian linear dengan perhatian sparse. Perhatian linear menangani dependensi lokal dengan murah; perhatian sparse menjangkau token yang relevan secara global. Hasil yang dinyatakan adalah komputasi perhatian sekitar tiga kali lebih sedikit dari GLM-5.3 dan cache KV sekitar 4,4 kali lebih kecil.
Manifold-Constrained Hyper-Connections. Istilah Z.ai untuk pekerjaan efisiensi penskalaan dalam rilis ini. Belum ada detail publik yang cukup untuk mengevaluasinya secara independen, jadi anggap ini sebagai fitur arsitektur yang dijelaskan vendor daripada keuntungan yang terbukti.
Pengurangan cache KV adalah bagian dengan konsekuensi praktis yang jelas. Cache KV adalah yang membuat inferensi konteks panjang mahal dalam memori, dan menyusutkannya sebesar 4,4x adalah sebagian besar alasan mengapa model ini dapat disajikan dengan sepersepuluh harga GLM-5.2 sambil mempertahankan jendela 1 juta.
Pelatihan menggunakan korpus yang Z.ai gambarkan sebagai sekitar 30 triliun token multimodal.
Tentang namanya
Artificial Analysis mengukur GLM-5.3-Flash pada 48,7 token keluaran per detik. Sebagai konteks, itu berada di ujung bawah untuk model bobot terbuka dengan ukuran sebanding. GLM-5.3, saudaranya yang lebih besar, berjalan sekitar 86 token per detik pada pengukuran yang sama.
Jadi model Flash kira-kira setengah kecepatan model non-Flash.
Yang dimenangkannya adalah waktu ke token pertama, yaitu 1,52 detik dibandingkan dengan median bobot terbuka 2,14 detik. Jika beban kerja Anda adalah banyak giliran interaktif singkat, responsivitas itu nyata. Jika beban kerja Anda adalah menghasilkan dokumen panjang, Anda akan menunggu lebih lama daripada di GLM-5.3.
Efisiensi yang diberikan model ini adalah dalam biaya dan memori, bukan kecepatan generasi waktu-nyata (wall-clock). Cache KV yang lebih kecil dan komputasi perhatian yang lebih rendah menghasilkan harga per token yang lebih murah dan jejak penyajian yang lebih kecil. Ini tidak berarti streaming yang lebih cepat.
Ini penting karena sebagian besar liputan yang diterbitkan beberapa hari setelah peluncuran mengulang narasi vendor tanpa memeriksa angka throughput, yang telah publik sepanjang waktu. Pilih model ini karena harganya tidak mahal dan menangani gambar, bukan karena Anda mengharapkannya untuk streaming dengan cepat.
Benchmark
Angka-angka yang diterbitkan saat peluncuran oleh Z.ai, jadi bacalah sebagai klaim vendor sampai pihak ketiga mereproduksinya:

Angka independen adalah dari Artificial Analysis, yang menempatkan GLM-5.3-Flash pada 57 di Intelligence Index v4.1.1 miliknya. GLM-5.3 mencetak 60. Median untuk model bobot terbuka dengan ukuran serupa adalah 27, jadi 57 adalah hasil yang kuat untuk kelasnya meskipun berada di bawah saudaranya yang lebih besar.
Z.ai menggambarkan model ini mendekati Claude Opus 4.8 dalam pekerjaan koding dan agen. Itu adalah karakterisasi vendor dari evaluasi internalnya sendiri, bukan hasil terukur pihak ketiga, dan selisih tiga poin dalam Intelligence Index dengan GLM-5.3 miliknya sendiri menunjukkan bahwa diperlukan sedikit kehati-hatian.
Untuk bagaimana cerita benchmark GLM berkembang selama rilis sebelumnya, analisis benchmark GLM-5.2 kami menjelaskan apa sebenarnya yang diukur oleh setiap evaluasi ini.
Minggu Ox Alpha
Pada 20 Agustus, sebuah model anonim bernama ox-alpha muncul di platform inferensi pihak ketiga dengan jendela konteks 1 juta token dan harga nol. Ini menjadi salah satu model yang paling banyak digunakan di platform tersebut dalam beberapa hari. Komunitas mengidentifikasinya sebagai Zhipu dalam waktu sekitar 48 jam berdasarkan karakteristik keluarannya.

Pada 26 Agustus, Z.ai mengonfirmasinya: Ox Alpha adalah GLM-5.3-Flash, dan minggu gratis itu adalah uji beban yang disengaja.
Z.ai juga mengatakan bahwa selama minggu itu, semua lalu lintas dilayani di akselerator domestik Tiongkok menggunakan tumpukan berbasis SGLang, dan mengklaim biaya penyajian per token sebanding dengan perangkat keras NVIDIA mainstream. Itu adalah klaim vendor tentang infrastruktur mereka sendiri tanpa verifikasi independen yang tersedia, jadi pertimbangkanlah dengan bijak.
Kami telah menuliskan pola ini sebelumnya ketika Pony Alpha ternyata adalah model DeepSeek atau GLM. Peluncuran rahasia pada router pihak ketiga menjadi langkah pra-rilis standar, dan pelajaran yang berguna adalah bahwa model anonim yang sangat mampu dengan jendela konteks yang mencurigakan hampir selalu merupakan produk unggulan yang belum dirilis yang mengumpulkan data evaluasi.
Cara menggunakannya
- API yang Dihosting. Endpoint Z.ai kompatibel dengan OpenAI. Arahkan klien Anda yang sudah ada ke
https://api.z.ai/api/paas/v4/dan atur model keglm-5.3-flash. Panduan API GLM-5.3-Flash kami membahas autentikasi, payload masukan gambar, dan parameter upaya penalaran. - Penyedia pihak ketiga. OpenRouter membawanya sebagai
z-ai/glm-5.3-flash. Tersedia juga di Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten, dan io.net. Harga bervariasi antar reseller, terkadang secara signifikan. - Agen koding. Flash termasuk dalam GLM Coding Plan dan dilaporkan memiliki tiga kali kuota yang dapat digunakan dari GLM-5.3, yang merupakan alasan praktis mengapa pelanggan akan beralih. Dokumentasi Z.ai juga mencatat bahwa panggilan di luar jam sibuk mengonsumsi setengah dari poin standar.
- Dihosting sendiri. Bobotnya dilisensikan MIT dan tersedia di Hugging Face. vLLM, SGLang, TokenSpeed, dan KTransformers semuanya mendukungnya, dan kuantisasi GGUF tersedia untuk rig yang lebih kecil.
Haruskah Anda menggunakannya?
Gunakan GLM-5.3-Flash jika Anda membutuhkan pemahaman gambar atau video dalam panggilan yang sama dengan teks Anda, jika biaya per token Anda adalah batasan yang Anda optimalkan, atau jika Anda ingin bobot terbuka yang dapat Anda host sendiri di bawah lisensi permisif.
Gunakan GLM-5.3 sebagai gantinya jika Anda membutuhkan beberapa poin terakhir kualitas penalaran, atau jika throughput generasi lebih penting bagi Anda daripada harga. Perbandingan berdampingan kami dari keduanya membahas keputusan secara rinci, dan apa itu GLM-5.3 membahas model dasar dengan sendirinya.
Apa pun yang Anda pilih, pergantian adalah perubahan ID model satu baris pada endpoint yang kompatibel dengan OpenAI, yang membuatnya mudah untuk menguji keduanya terhadap beban kerja Anda sendiri daripada memercayai tabel benchmark siapa pun. Itu adalah cara yang tepat untuk menyelesaikannya.
Menguji pertukaran model dengan benar berarti mengirim permintaan nyata dan memeriksa respons nyata, termasuk yang multimodal yang canggung untuk dibuat secara manual di curl. Apidog memungkinkan Anda menyimpan panggilan tersebut sebagai koleksi yang dapat digunakan kembali dengan penegasan terlampir, sehingga ketika Anda beralih dari GLM-5.3 ke Flash, Anda dapat mengonfirmasi bahwa bentuk respons tidak berubah alih-alih baru mengetahuinya di produksi.
FAQ
- Apakah GLM-5.3-Flash gratis? Tidak lagi. Minggu gratis Ox Alpha berakhir ketika model tersebut diumumkan secara resmi. Ada diskon peluncuran 50% yang berlaku hingga 9 September 2026, setelah itu harga daftar berlaku.
- Apakah lebih cepat dari GLM-5.3? Tidak. Ini menghasilkan sekitar 49 token per detik dibandingkan dengan 86 token GLM-5.3. Namun, ia mulai merespons lebih cepat, yaitu 1,52 detik hingga token pertama.
- Bisakah ia benar-benar menangani satu juta token konteks? Jendela yang dikonfigurasi adalah 1.048.576 token, dikonfirmasi dalam konfigurasi model dan oleh Artificial Analysis. Perhatikan bahwa OpenRouter mencantumkan angka yang lebih besar yaitu 1.310.720; perlakukan itu sebagai daftar dari sisi penyedia daripada spesifikasi model.
- Apakah ia menerima video? Dokumentasi Z.ai mencantumkan masukan teks, gambar, video, dan file. Dukungan video lebih baru dan kurang banyak digunakan dibandingkan masukan gambar, jadi validasikanlah dengan media Anda sendiri sebelum bergantung padanya.
- Di bawah lisensi apa bobotnya? MIT, dengan bobot yang diterbitkan di
zai-org/GLM-5.3-Flashdi Hugging Face.
