GLM-5.3-Flash adalah model 320 miliar parameter yang dirilis di bawah lisensi MIT. Kedua fakta ini saling bertentangan: lisensi mengatakan jalankan sesuka Anda, dan jumlah parameter mengatakan Anda akan membutuhkan perangkat keras yang serius untuk melakukannya.
Bagian yang menarik adalah bahwa 18 miliar dari 320 miliar parameter tersebut aktif per token, dan versi terkuantisasi tersedia. Kombinasi ini menempatkan model ini dalam jangkauan pengaturan yang jauh lebih kecil daripada node 8x H200 yang diasumsikan sebagian besar panduan.
Posting ini menjelaskan tingkatan perangkat keras secara jujur, dari node produksi presisi penuh hingga versi terkuantisasi di workstation, dan membahas kapan menjalankannya sendiri benar-benar masuk akal.
Apa yang sebenarnya Anda muat
| Properti | Nilai |
|---|---|
| Total parameter | 320B |
| Aktif per token | 18B |
| Arsitektur | MoE, perhatian hibrida linear dan sparse |
| Konteks | 1.048.576 token |
| Lisensi | MIT |
| Bobot | zai-org/GLM-5.3-Flash |
| Kuantisasi GGUF | unsloth/GLM-5.3-Flash-GGUF |
Desain mixture-of-experts inilah yang memungkinkan hal ini. Semua 320B parameter harus berada di memori, tetapi hanya 18B yang berpartisipasi dalam setiap token yang diberikan, sehingga permintaan komputasi jauh di bawah apa yang disarankan oleh total. Memori adalah kendala utama Anda, bukan FLOPs.
Z.ai juga melaporkan cache KV yang kira-kira 4,4 kali lebih kecil dari GLM-5.3, yang sangat penting untuk pekerjaan konteks panjang. Cache KV adalah yang mengonsumsi memori saat konteks Anda terisi, dan pada jendela 1M-token, itulah yang biasanya akan menghambat Anda.
Tier 1: Presisi penuh pada node produksi
Untuk melayani dengan kualitas penuh dan konkurensi (kemampuan menangani banyak permintaan secara bersamaan) yang nyata, konfigurasi referensi adalah node 8x H200 (masing-masing 141GB, total sekitar 1.128GB). Node 8x H20 juga berfungsi dengan baik.
Angka kasar: bobotnya saja membutuhkan sekitar 700 hingga 800GB tergantung pada presisi, dan Anda membutuhkan ruang tambahan untuk cache KV dan overhead runtime. Kapasitas cloud sewaan untuk node seperti ini berkisar antara $24 hingga $48 per hari.
vLLM
vLLM adalah default umum dan memiliki dukungan ekosistem terluas. Ukuran paralel tensor harus merupakan pangkat dua:
vllm serve zai-org/GLM-5.3-Flash \
--tensor-parallel-size 8 \
--max-model-len 1048576 \
--trust-remote-code
Mulai dengan `--max-model-len` yang lebih kecil saat Anda memvalidasi pengaturan. Meminta jendela jutaan token penuh secara langsung berarti mengalokasikan cache KV untuk itu, dan kegagalan di sana terlihat seperti kesalahan kehabisan memori daripada masalah konfigurasi.
SGLang
SGLang memiliki dukungan sejak hari pertama untuk model ini, dengan resep yang dipublikasikan untuk H100, H200, B200, B300, GB200, dan GB300, termasuk penyajian multimodal. Z.ai menggunakan stack berbasis SGLang untuk penyajian pra-peluncurannya sendiri.
python -m sglang.launch_server \
--model-path zai-org/GLM-5.3-Flash \
--tp 8 \
--context-length 1048576
SGLang cenderung unggul dalam output terstruktur dan beban kerja agen dengan konkurensi tinggi. Jika Anda melayani agen pengkodean daripada antarmuka obrolan, ada baiknya untuk membandingkannya dengan vLLM daripada menggunakan default.
Kedua stack membutuhkan parser panggilan alat yang dikonfigurasi agar fungsi panggilan berfungsi dengan baik. Periksa flag saat ini di dokumentasi setiap proyek, karena nama parser berubah antar rilis.
Tier 2: Terkuantisasi pada perangkat keras yang lebih kecil
Ini adalah tingkatan yang sering dilewati oleh sebagian besar ulasan, dan ini adalah yang penting bagi siapa pun yang tidak memiliki pusat data.
Versi GGUF terkuantisasi dipublikasikan di unsloth/GLM-5.3-Flash-GGUF, turun ke format 1-bit dan 2-bit yang agresif seperti IQ1_S dan IQ2_XXS. Kuantisasi 2-bit dari model 320B membawa bobot ke dalam jangkauan yang dapat ditampung oleh workstation dengan memori tinggi atau rig konsumen multi-GPU, terutama dengan offload CPU.
Dua catatan penting yang jujur:
Kuantisasi agresif mengurangi kualitas. IQ1_S sangat jauh dari presisi penuh. Pada MoE 320B, penurunan kualitas seringkali lebih lembut daripada perlakuan yang sama yang diterapkan pada model dense, karena ada lebih banyak redudansi yang bisa hilang, tetapi "berjalan" dan "berjalan dengan baik" adalah klaim yang berbeda. Ujilah pada tugas Anda sendiri sebelum menyimpulkan apa pun.
Dokumentasi Unsloth untuk model ini ditandai sebagai dalam pengembangan. Ketersediaan kuantisasi dan pengaturan yang direkomendasikan masih berubah-ubah. Periksa apa yang benar-benar dipublikasikan sebelum merencanakan pembuatan berdasarkan format tertentu.
Untuk pengaturan yang membebani CPU dan hibrida, KTransformers dirancang khusus untuk kasus ini, menyimpan ahli MoE di RAM sistem dan hanya memindahkan apa yang dibutuhkan ke GPU. Pada model MoE dengan 18B parameter aktif, arsitektur itu sangat cocok secara tidak biasa. TokenSpeed juga terdaftar di antara runtime yang didukung.
Panduan kami untuk menjalankan GLM-4.7-Flash secara lokal mencakup versi model yang lebih kecil dari alur kerja ini, dan menjalankan GLM-5 secara lokal secara gratis mencakup pengaturan GLM lokal secara umum.
Menghitung anggaran memori Anda
Dua angka menentukan apakah sebuah konfigurasi cocok.
Bobot. Dengan sekitar 2 byte per parameter dalam BF16, 320B parameter adalah sekitar 640GB sebelum overhead. FP8 kira-kira memotongnya menjadi setengah. Kuantisasi 4-bit membawanya mendekati 160GB, dan format 2-bit agresif turun lebih rendah lagi dengan biaya kualitas yang nyata.
Cache KV. Ini berskala dengan panjang konteks dan konkurensi, dan inilah yang mengejutkan orang. Konfigurasi yang berhasil dimuat dengan baik pada konteks 8K dapat gagal pada 128K karena cache bertambah, bukan bobotnya. Pengurangan 4,4x yang dilaporkan Z.ai dibandingkan GLM-5.3 sangat membantu di sini, tetapi skala masih linear dalam token.
Implikasi praktisnya adalah mengukur berdasarkan panjang konteks Anda yang sebenarnya, bukan maksimum yang diiklankan model. Sangat sedikit aplikasi yang membutuhkan jendela jutaan token penuh, dan menyediakan untuk jendela yang tidak pernah Anda gunakan adalah cara paling umum untuk membuat model ini terlihat tidak terjangkau.
Jika Anda mengikuti kisah bobot terbuka sebelumnya untuk keluarga ini, posting self-hosting GLM-5.3 kami ditulis sebelum rilis. Bobotnya kini telah tersedia untuk Flash di bawah MIT, jadi panduan di sini menggantikannya.
Fine-tuning
Lisensi MIT mengizinkan fine-tuning dan redistribusi, yang tidak biasa pada tingkat kemampuan ini dan merupakan alasan terkuat untuk menyimpan bobotnya sendiri.
Bersikaplah realistis tentang biayanya. Fine-tuning penuh model 320B berada di luar jangkauan sebagian besar tim. Metode efisien parameter seperti LoRA adalah jalur yang praktis, dan pada model mixture-of-experts ada pertanyaan desain tambahan apakah Anda mengadaptasi router, pakar, atau lapisan perhatian. Itu adalah bidang aktif dengan panduan yang kurang baku dibandingkan model dense.
Jika tujuan Anda adalah adaptasi domain daripada kemampuan baru, uji prompting dan retrieval terhadap model dasar terlebih dahulu. Pada model dengan jendela konteks 1 juta token, menempatkan pengetahuan domain Anda dalam prompt seringkali lebih murah dan lebih baik daripada melatihnya.
Pengaturan Pengambilan Sampel
Z.ai mempublikasikan rekomendasi yang berbeda berdasarkan tugas:
| Kasus penggunaan | temperature | top_p |
|---|---|---|
| Umum | 1.0 | 0.95 |
| Pengkodean | 0.95 | 1.0 |
Model ini juga mendukung tiga mode penalaran melalui reasoning_effort, dengan nilai low, high, dan max. Maksimal adalah default. Pada perangkat keras lokal ini lebih penting daripada di API, karena token penalaran adalah generasi yang Anda bayar dalam waktu nyata daripada dolar. Jika rig Anda menghasilkan secara lambat, low adalah perbedaan antara dapat digunakan dan tidak.
Apakah self-hosting masuk akal secara finansial?
Biasanya tidak, dan harga API adalah alasannya.
Dengan harga daftar, GLM-5.3-Flash berharga $0.15 per juta token input. Node 8x H200 sewaan dengan harga sekitar $1.000 per bulan memberi Anda sekitar 6,7 miliar token input penggunaan API. Mempertahankan volume di atas itu, secara terus-menerus, adalah operasi besar.
Node juga berharga sama apakah itu jenuh atau menganggur, sementara API hanya menagih apa yang Anda gunakan. Kecuali pemanfaatan Anda benar-benar tinggi sepanjang waktu, biaya tetap akan merugikan.
Jadi alasan untuk self-hosting bukanlah biaya:
- Kedaulatan dan privasi data. Tidak ada yang meninggalkan infrastruktur Anda.
- Tidak ada batasan tarif. Kapasitas Anda adalah kapasitas Anda.
- Jaminan ketersediaan. Tidak ada ketergantungan pada waktu aktif atau keputusan harga vendor.
- Lisensi MIT. Anda dapat memodifikasi, fine-tune, dan mendistribusikan ulang. Itu tidak biasa untuk model pada tingkat kemampuan ini dan merupakan argumen terkuat dalam daftar ini.
- Perangkat keras yang sudah Anda miliki. Jika GPU telah dibeli dan menganggur, biaya marjinalnya adalah listrik, dan seluruh perhitungan menjadi terbalik.
Analisis harga kami membahas sisi API dari perbandingan ini secara lebih rinci.
Memverifikasi deployment Anda
Baik vLLM maupun SGLang mengekspos endpoint yang kompatibel dengan OpenAI, sehingga bentuk permintaan yang sama berfungsi terhadap server lokal Anda dan terhadap Z.ai:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"messages": [{"role": "user", "content": "reply with OK"}]
}'
Penting untuk menguji lebih dari sekadar pemeriksaan cepat: perilaku konteks panjang pada panjang yang sebenarnya Anda butuhkan, input gambar jika Anda menyajikan multimodal, panggilan alat dengan skema Anda yang sebenarnya, dan throughput di bawah konkurensi daripada latensi permintaan tunggal.
Di sinilah koleksi pengujian yang tersimpan menunjukkan nilainya. Arahkan Apidog ke server lokal Anda dan endpoint Z.ai dengan URL dasar sebagai variabel lingkungan, jalankan rangkaian yang sama terhadap masing-masing, dan bandingkan. Anda akan segera mengetahui apakah versi terkuantisasi Anda masih menangani skema alat yang bergantung pada aplikasi Anda, yang merupakan mode kegagalan yang ditemukan orang di produksi.
Pertanyaan Umum (FAQ)
Apa perangkat keras minimum? Untuk presisi penuh, node kelas 8x H200. Untuk versi GGUF terkuantisasi, jauh lebih sedikit, meskipun kualitas menurun dengan tingkat kuantisasi.
Apakah saya membutuhkan semua 320B parameter dalam memori? Ya. Hanya 18B yang aktif per token, tetapi seluruh set harus berada di memori. Memori adalah kendala; komputasi bukan.
Mana yang lebih baik, vLLM atau SGLang? SGLang memiliki dukungan sejak hari pertama dengan resep multimodal yang dipublikasikan dan seringkali unggul dalam konkurensi dan output terstruktur. vLLM memiliki dukungan ekosistem yang lebih luas. Uji kinerja keduanya pada beban kerja Anda.
Bisakah saya menjalankannya di satu GPU? Tidak pada presisi penuh. Dengan kuantisasi agresif dan offload CPU melalui KTransformers, sistem GPU tunggal dengan memori tinggi ditambah banyak RAM sistem adalah hal yang mungkin. Harapkan generasi yang lambat.
Apakah lisensinya benar-benar MIT? Ya. Bobotnya dipublikasikan dengan lisensi MIT, yang mengizinkan penggunaan komersial, modifikasi, dan redistribusi.
