Cara Menjalankan GLM-5.3-Flash Secara Lokal

Host sendiri GLM-5.3-Flash: 8x H200 dengan vLLM atau SGLang, versi GGUF terkuantisasi untuk rig yang lebih kecil, perhitungan memori, dan apakah hosting sendiri mengalahkan API.

Ashley Goolam

Ashley Goolam

27 August 2026

Cara Menjalankan GLM-5.3-Flash Secara Lokal

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

GLM-5.3-Flash adalah model 320 miliar parameter yang dirilis di bawah lisensi MIT. Kedua fakta ini saling bertentangan: lisensi mengatakan jalankan sesuka Anda, dan jumlah parameter mengatakan Anda akan membutuhkan perangkat keras yang serius untuk melakukannya.

Bagian yang menarik adalah bahwa 18 miliar dari 320 miliar parameter tersebut aktif per token, dan versi terkuantisasi tersedia. Kombinasi ini menempatkan model ini dalam jangkauan pengaturan yang jauh lebih kecil daripada node 8x H200 yang diasumsikan sebagian besar panduan.

Posting ini menjelaskan tingkatan perangkat keras secara jujur, dari node produksi presisi penuh hingga versi terkuantisasi di workstation, dan membahas kapan menjalankannya sendiri benar-benar masuk akal.

Apa yang sebenarnya Anda muat

Properti Nilai
Total parameter 320B
Aktif per token 18B
Arsitektur MoE, perhatian hibrida linear dan sparse
Konteks 1.048.576 token
Lisensi MIT
Bobot zai-org/GLM-5.3-Flash
Kuantisasi GGUF unsloth/GLM-5.3-Flash-GGUF

Desain mixture-of-experts inilah yang memungkinkan hal ini. Semua 320B parameter harus berada di memori, tetapi hanya 18B yang berpartisipasi dalam setiap token yang diberikan, sehingga permintaan komputasi jauh di bawah apa yang disarankan oleh total. Memori adalah kendala utama Anda, bukan FLOPs.

Z.ai juga melaporkan cache KV yang kira-kira 4,4 kali lebih kecil dari GLM-5.3, yang sangat penting untuk pekerjaan konteks panjang. Cache KV adalah yang mengonsumsi memori saat konteks Anda terisi, dan pada jendela 1M-token, itulah yang biasanya akan menghambat Anda.

Tier 1: Presisi penuh pada node produksi

Untuk melayani dengan kualitas penuh dan konkurensi (kemampuan menangani banyak permintaan secara bersamaan) yang nyata, konfigurasi referensi adalah node 8x H200 (masing-masing 141GB, total sekitar 1.128GB). Node 8x H20 juga berfungsi dengan baik.

Angka kasar: bobotnya saja membutuhkan sekitar 700 hingga 800GB tergantung pada presisi, dan Anda membutuhkan ruang tambahan untuk cache KV dan overhead runtime. Kapasitas cloud sewaan untuk node seperti ini berkisar antara $24 hingga $48 per hari.

vLLM

vLLM adalah default umum dan memiliki dukungan ekosistem terluas. Ukuran paralel tensor harus merupakan pangkat dua:

vllm serve zai-org/GLM-5.3-Flash \
  --tensor-parallel-size 8 \
  --max-model-len 1048576 \
  --trust-remote-code

Mulai dengan `--max-model-len` yang lebih kecil saat Anda memvalidasi pengaturan. Meminta jendela jutaan token penuh secara langsung berarti mengalokasikan cache KV untuk itu, dan kegagalan di sana terlihat seperti kesalahan kehabisan memori daripada masalah konfigurasi.

SGLang

SGLang memiliki dukungan sejak hari pertama untuk model ini, dengan resep yang dipublikasikan untuk H100, H200, B200, B300, GB200, dan GB300, termasuk penyajian multimodal. Z.ai menggunakan stack berbasis SGLang untuk penyajian pra-peluncurannya sendiri.

python -m sglang.launch_server \
  --model-path zai-org/GLM-5.3-Flash \
  --tp 8 \
  --context-length 1048576

SGLang cenderung unggul dalam output terstruktur dan beban kerja agen dengan konkurensi tinggi. Jika Anda melayani agen pengkodean daripada antarmuka obrolan, ada baiknya untuk membandingkannya dengan vLLM daripada menggunakan default.

Kedua stack membutuhkan parser panggilan alat yang dikonfigurasi agar fungsi panggilan berfungsi dengan baik. Periksa flag saat ini di dokumentasi setiap proyek, karena nama parser berubah antar rilis.

Tier 2: Terkuantisasi pada perangkat keras yang lebih kecil

Ini adalah tingkatan yang sering dilewati oleh sebagian besar ulasan, dan ini adalah yang penting bagi siapa pun yang tidak memiliki pusat data.

Versi GGUF terkuantisasi dipublikasikan di unsloth/GLM-5.3-Flash-GGUF, turun ke format 1-bit dan 2-bit yang agresif seperti IQ1_S dan IQ2_XXS. Kuantisasi 2-bit dari model 320B membawa bobot ke dalam jangkauan yang dapat ditampung oleh workstation dengan memori tinggi atau rig konsumen multi-GPU, terutama dengan offload CPU.

Dua catatan penting yang jujur:

Kuantisasi agresif mengurangi kualitas. IQ1_S sangat jauh dari presisi penuh. Pada MoE 320B, penurunan kualitas seringkali lebih lembut daripada perlakuan yang sama yang diterapkan pada model dense, karena ada lebih banyak redudansi yang bisa hilang, tetapi "berjalan" dan "berjalan dengan baik" adalah klaim yang berbeda. Ujilah pada tugas Anda sendiri sebelum menyimpulkan apa pun.

Dokumentasi Unsloth untuk model ini ditandai sebagai dalam pengembangan. Ketersediaan kuantisasi dan pengaturan yang direkomendasikan masih berubah-ubah. Periksa apa yang benar-benar dipublikasikan sebelum merencanakan pembuatan berdasarkan format tertentu.

Untuk pengaturan yang membebani CPU dan hibrida, KTransformers dirancang khusus untuk kasus ini, menyimpan ahli MoE di RAM sistem dan hanya memindahkan apa yang dibutuhkan ke GPU. Pada model MoE dengan 18B parameter aktif, arsitektur itu sangat cocok secara tidak biasa. TokenSpeed juga terdaftar di antara runtime yang didukung.

Panduan kami untuk menjalankan GLM-4.7-Flash secara lokal mencakup versi model yang lebih kecil dari alur kerja ini, dan menjalankan GLM-5 secara lokal secara gratis mencakup pengaturan GLM lokal secara umum.

Menghitung anggaran memori Anda

Dua angka menentukan apakah sebuah konfigurasi cocok.

Bobot. Dengan sekitar 2 byte per parameter dalam BF16, 320B parameter adalah sekitar 640GB sebelum overhead. FP8 kira-kira memotongnya menjadi setengah. Kuantisasi 4-bit membawanya mendekati 160GB, dan format 2-bit agresif turun lebih rendah lagi dengan biaya kualitas yang nyata.

Cache KV. Ini berskala dengan panjang konteks dan konkurensi, dan inilah yang mengejutkan orang. Konfigurasi yang berhasil dimuat dengan baik pada konteks 8K dapat gagal pada 128K karena cache bertambah, bukan bobotnya. Pengurangan 4,4x yang dilaporkan Z.ai dibandingkan GLM-5.3 sangat membantu di sini, tetapi skala masih linear dalam token.

Implikasi praktisnya adalah mengukur berdasarkan panjang konteks Anda yang sebenarnya, bukan maksimum yang diiklankan model. Sangat sedikit aplikasi yang membutuhkan jendela jutaan token penuh, dan menyediakan untuk jendela yang tidak pernah Anda gunakan adalah cara paling umum untuk membuat model ini terlihat tidak terjangkau.

Jika Anda mengikuti kisah bobot terbuka sebelumnya untuk keluarga ini, posting self-hosting GLM-5.3 kami ditulis sebelum rilis. Bobotnya kini telah tersedia untuk Flash di bawah MIT, jadi panduan di sini menggantikannya.

Fine-tuning

Lisensi MIT mengizinkan fine-tuning dan redistribusi, yang tidak biasa pada tingkat kemampuan ini dan merupakan alasan terkuat untuk menyimpan bobotnya sendiri.

Bersikaplah realistis tentang biayanya. Fine-tuning penuh model 320B berada di luar jangkauan sebagian besar tim. Metode efisien parameter seperti LoRA adalah jalur yang praktis, dan pada model mixture-of-experts ada pertanyaan desain tambahan apakah Anda mengadaptasi router, pakar, atau lapisan perhatian. Itu adalah bidang aktif dengan panduan yang kurang baku dibandingkan model dense.

Jika tujuan Anda adalah adaptasi domain daripada kemampuan baru, uji prompting dan retrieval terhadap model dasar terlebih dahulu. Pada model dengan jendela konteks 1 juta token, menempatkan pengetahuan domain Anda dalam prompt seringkali lebih murah dan lebih baik daripada melatihnya.

Pengaturan Pengambilan Sampel

Z.ai mempublikasikan rekomendasi yang berbeda berdasarkan tugas:

Kasus penggunaan temperature top_p
Umum 1.0 0.95
Pengkodean 0.95 1.0

Model ini juga mendukung tiga mode penalaran melalui reasoning_effort, dengan nilai low, high, dan max. Maksimal adalah default. Pada perangkat keras lokal ini lebih penting daripada di API, karena token penalaran adalah generasi yang Anda bayar dalam waktu nyata daripada dolar. Jika rig Anda menghasilkan secara lambat, low adalah perbedaan antara dapat digunakan dan tidak.

Apakah self-hosting masuk akal secara finansial?

Biasanya tidak, dan harga API adalah alasannya.

Dengan harga daftar, GLM-5.3-Flash berharga $0.15 per juta token input. Node 8x H200 sewaan dengan harga sekitar $1.000 per bulan memberi Anda sekitar 6,7 miliar token input penggunaan API. Mempertahankan volume di atas itu, secara terus-menerus, adalah operasi besar.

Node juga berharga sama apakah itu jenuh atau menganggur, sementara API hanya menagih apa yang Anda gunakan. Kecuali pemanfaatan Anda benar-benar tinggi sepanjang waktu, biaya tetap akan merugikan.

Jadi alasan untuk self-hosting bukanlah biaya:

Analisis harga kami membahas sisi API dari perbandingan ini secara lebih rinci.

Memverifikasi deployment Anda

Baik vLLM maupun SGLang mengekspos endpoint yang kompatibel dengan OpenAI, sehingga bentuk permintaan yang sama berfungsi terhadap server lokal Anda dan terhadap Z.ai:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "messages": [{"role": "user", "content": "reply with OK"}]
  }'

Penting untuk menguji lebih dari sekadar pemeriksaan cepat: perilaku konteks panjang pada panjang yang sebenarnya Anda butuhkan, input gambar jika Anda menyajikan multimodal, panggilan alat dengan skema Anda yang sebenarnya, dan throughput di bawah konkurensi daripada latensi permintaan tunggal.

Di sinilah koleksi pengujian yang tersimpan menunjukkan nilainya. Arahkan Apidog ke server lokal Anda dan endpoint Z.ai dengan URL dasar sebagai variabel lingkungan, jalankan rangkaian yang sama terhadap masing-masing, dan bandingkan. Anda akan segera mengetahui apakah versi terkuantisasi Anda masih menangani skema alat yang bergantung pada aplikasi Anda, yang merupakan mode kegagalan yang ditemukan orang di produksi.

Pertanyaan Umum (FAQ)

Apa perangkat keras minimum? Untuk presisi penuh, node kelas 8x H200. Untuk versi GGUF terkuantisasi, jauh lebih sedikit, meskipun kualitas menurun dengan tingkat kuantisasi.

Apakah saya membutuhkan semua 320B parameter dalam memori? Ya. Hanya 18B yang aktif per token, tetapi seluruh set harus berada di memori. Memori adalah kendala; komputasi bukan.

Mana yang lebih baik, vLLM atau SGLang? SGLang memiliki dukungan sejak hari pertama dengan resep multimodal yang dipublikasikan dan seringkali unggul dalam konkurensi dan output terstruktur. vLLM memiliki dukungan ekosistem yang lebih luas. Uji kinerja keduanya pada beban kerja Anda.

Bisakah saya menjalankannya di satu GPU? Tidak pada presisi penuh. Dengan kuantisasi agresif dan offload CPU melalui KTransformers, sistem GPU tunggal dengan memori tinggi ditambah banyak RAM sistem adalah hal yang mungkin. Harapkan generasi yang lambat.

Apakah lisensinya benar-benar MIT? Ya. Bobotnya dipublikasikan dengan lisensi MIT, yang mengizinkan penggunaan komersial, modifikasi, dan redistribusi.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.