Self-Hosting GLM-5.3: Bersiap untuk Rilis Bobot Terbuka

Bobot terbuka GLM-5.3 akan tersedia sekitar 28 Agustus. Panduan persiapan: penentuan ukuran perangkat keras untuk MoE 744B, pengaturan vLLM dan SGLang, serta baseline regresi host-vs-lokal di Apidog.

Ashley Innocent

Ashley Innocent

16 August 2026

Self-Hosting GLM-5.3: Bersiap untuk Rilis Bobot Terbuka

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Zhipu AI merilis GLM-5.3 pada tanggal 14 Agustus 2026, dan di dalam liputan peluncurannya terdapat kalimat yang paling penting bagi tim infrastruktur: bobot terbuka akan tersedia sekitar dua minggu kemudian, sekitar tanggal 28 Agustus, di organisasi Hugging Face milik Zhipu. Jeda waktu tersebut adalah sebuah anugerah. Ini memberi Anda waktu untuk menentukan ukuran perangkat keras, memilih tumpukan penyajian, dan mendapatkan baseline regresi terhadap API yang di-host sebelum satu pun shard safetensors dipublikasikan.

Model ini layak untuk pekerjaan persiapan tersebut. Evaluasi internal Zhipu menunjukkan kemampuan coding 50% lebih unggul dari GLM-5.2, Terminal-Bench 3.0 melonjak dari 4.6 menjadi 28.3, dan perusahaan tersebut menggambarkan kinerja agen sebagai "mendekati Claude Fable 5," menurut laporan peluncuran. Kisah benchmark lengkap, termasuk di mana ia masih tertinggal dari model-model terdepan, ada di penjelasan GLM-5.3 kami. Artikel ini tetap pada satu pertanyaan: apa yang harus disiapkan pada hari peluncuran agar Anda dapat menyajikan GLM-5.3 sendiri?

Sebagai klarifikasi: bobot model tidak dapat diunduh hari ini. Semua yang disebutkan di bawah ini menargetkan periode rilis, dan apa pun yang belum dikonfirmasi Zhipu ditandai sebagai ekspektasi, bukan fakta. Yang dapat Anda lakukan sekarang adalah membangun baseline, dan itu dapat dilakukan melalui Apidog: ambil snapshot respons API yang di-host minggu ini, lalu putar ulang koleksi yang sama terhadap endpoint lokal Anda nanti.

tombol

TL;DR

Apa yang dirilis Zhipu, dan kapan

Zhipu (dengan merek Z.ai secara internasional) menyandingkan peluncuran API GLM-5.3 dengan janji bobot terbuka dua minggu: model tersebut akan diunggah ke Hugging Face sekitar 28 Agustus 2026. Penundaan ini bukan tanpa alasan. Zhipu mengatakan bahwa mereka membangun sistem tinjauan risiko terlengkapnya hingga saat ini untuk rilis ini, yang patut diperhatikan mengingat model tersebut mencapai 84.5% di CyberGym, sedikit di atas Claude Mythos 5 dan GPT-5.6 Sol. Seeking Alpha membingkai rilis ini sebagai upaya Zhipu untuk mempertahankan kepemimpinan model terbuka yang telah mereka tukar dengan DeepSeek sepanjang tahun.

Dua detail dari rilis ini penting bagi mereka yang melakukan self-hosting:

  1. Model dasarnya tidak berubah. GLM-5.3 adalah basis GLM-5 dengan pelatihan pasca-skala. Arsitektur yang dibutuhkan tumpukan penyajian Anda adalah arsitektur yang sama yang sudah dijalankan vLLM dan SGLang untuk GLM-5 dan GLM-5.2. Tidak ada varian atensi baru, tidak ada kejutan tokenizer yang diharapkan.
  2. Pola rilis telah ditetapkan. Organisasi Hugging Face Zhipu menghosting GLM-5, GLM-5.1, dan GLM-5.2, masing-masing dengan repositori FP8 pendamping. GLM-5.2 saja menunjukkan 2.69 juta unduhan. Harapkan bentuk yang sama untuk 5.3: rilis safetensors BF16 ditambah varian FP8 resmi.

Ketentuan lisensi untuk 5.3 tidak dikonfirmasi dalam liputan peluncuran. Periksa kartu model saat repositori muncul sebelum menggunakannya dalam produk komersial.

Apa arti 744B total, 40B aktif untuk perangkat keras Anda

Keluarga GLM-5 adalah desain Mixture of Experts: total 744B parameter, sekitar 40B aktif per forward pass, konteks 200K, menurut dokumen Z.ai (repositori Hugging Face mencantumkan total yang sedikit lebih tinggi yang mencakup embeddings). Itu adalah spesifikasi keluarga, bukan klaim khusus 5.3, tetapi karena model dasar tidak berubah, itu adalah angka perencanaan yang tepat.

Pembagian MoE menciptakan asimetri memori-versus-komputasi:

Tingkatan praktis, tanpa berpura-pura untuk jumlah GPU yang tepat:

Presisi Jejak bobot (perhitungan) Tempat yang realistis
BF16 ~1.5 TB Kluster multi-node atau konfigurasi GPU server tunggal terbesar
FP8 (resmi) ~745 GB Server multi-GPU kelas atas, satu node
Kuantisasi komunitas kelas INT4 Kisaran ~370-400 GB Rig multi-GPU yang lebih kecil; tunggu laporan kualitas

Jika anggaran Anda adalah satu GPU konsumen, bobot penuh GLM-5.3 bukanlah target Anda, dan itu tidak masalah. Sewa jam GPU untuk evaluasi, tunggu kuantisasi komunitas yang agresif, atau simpan model berat di API yang di-host sambil menjalankan model terbuka yang lebih kecil secara lokal. Panduan kami untuk LLM lokal terbaik di tahun 2026 mencakup apa yang sesuai dengan anggaran GPU tunggal dan workstation saat ini.

Perlakukan jendela konteks 200K sebagai keputusan memori juga: cache KV tumbuh dengan konteks dan ukuran batch, jadi batasi konteks yang disajikan per tingkatan deployment sebelum hari peluncuran daripada mengandalkan batas maksimum model.

Pilih tumpukan penyajian Anda sebelum bobot tersedia

Tiga keluarga perangkat lunak penyajian penting di sini, dan tidak semuanya akan siap pada waktu yang bersamaan.

vLLM adalah jawaban default pada skala ini: dukungan keluarga GLM-5 sejak rilis aslinya, perutean MoE, paralelisme tensor dan expert di seluruh GPU dan node, serta server asli yang kompatibel dengan OpenAI. Perintah peluncuran akan terlihat seperti ini setelah repositori ada:

vllm serve zai-org/GLM-5.3-FP8 \
  --tensor-parallel-size 8 \
  --max-model-len 65536 \
  --served-model-name glm-5.3

Perlakukan tanda (flag) sebagai templat: nama repositori mengikuti pola penamaan Zhipu, dan pengaturan paralelisme bergantung pada jumlah GPU dan memori Anda.

SGLang adalah alternatif utama, dengan kinerja MoE yang kuat dan radix-tree prefix caching yang bermanfaat untuk beban kerja agen yang mengirim ulang prompt bersama yang panjang. Ia juga menyajikan endpoint yang kompatibel dengan OpenAI, sehingga beralih di antara keduanya nanti tidak akan mengubah kode klien.

Keluarga llama.cpp (llama.cpp, Ollama, LM Studio) membutuhkan konversi GGUF, yang berasal dari komunitas berhari-hari atau berminggu-minggu setelah safetensors diluncurkan. Jalur ini pada akhirnya membawa model ke perangkat keras yang lebih kecil, pada tingkat kualitas yang harus Anda verifikasi terhadap baseline Anda sendiri daripada menerima begitu saja.

Instal dan uji coba tumpukan Anda minggu ini menggunakan bobot publik GLM-5.2 jika Anda memiliki perangkat keras, atau model MoE yang lebih kecil jika tidak. Memecahkan masalah driver CUDA pada 28 Agustus adalah mode kegagalan yang dapat dihindari.

Gunakan API yang di-host hari ini sebagai baseline Anda

Ini adalah langkah persiapan yang dilewatkan oleh sebagian besar tim: sebelum Anda melakukan self-host model, catat apa yang dihasilkan oleh implementasi referensi. API yang di-host Zhipu adalah referensi tersebut, dan itu sudah aktif sekarang. Ketika deployment lokal Anda memberikan jawaban yang berbeda, baseline yang tersimpan akan memberi tahu Anda apakah perbedaan tersebut berasal dari pilihan kuantisasi Anda, bug tumpukan penyajian, atau variansi sampling normal.

API yang di-host kompatibel dengan OpenAI: https://api.z.ai/api/paas/v4/chat/completions secara internasional, https://open.bigmodel.cn/api/paas/v4/chat/completions untuk daratan Tiongkok, Authorization: Bearer <key> autentikasi. Dokumen Z.ai mencantumkan glm-5 hari ini; glm-5.3 mengikuti konvensi keluarga, jadi konfirmasikan string yang tepat dalam dokumen resmi. Pengaturan lengkap untuk kedua wilayah ada di panduan cepat API GLM-5.3 kami.

Ambil baseline pada suhu 0 dengan prompt tetap:

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $GLM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "temperature": 0,
    "messages": [
      {"role": "user", "content": "Write a Python function that parses RFC 3339 timestamps and returns UTC datetimes. Include error handling for invalid input."}
    ]
  }' > baseline-rfc3339.json

Bangun 20 hingga 50 dari ini yang mencakup beban kerja nyata Anda: tugas pembuatan kode, pola panggilan alat agen, ringkasan konteks panjang. Suhu 0 tidak akan membuat output sepenuhnya dapat direproduksi, tetapi itu cukup mempersempit variansi sehingga penurunan kualitas yang diinduksi kuantisasi akan menonjol.

Bangun alat regresi di Apidog

Skrip cURL mentah berfungsi sampai Anda memiliki dua endpoint, tiga tingkat kuantisasi, dan seorang rekan tim bertanya konfigurasi mana yang berhasil. Alat yang terstruktur akan berskala lebih baik, dan ini adalah masalah regresi API standar, disiplin yang sama yang tercakup dalam panduan pengujian API kami untuk insinyur QA.

Pengaturan di Apidog:

  1. Satu koleksi, setiap prompt baseline. Buat permintaan per kasus baseline terhadap jalur penyelesaian obrolan. Skema yang kompatibel dengan OpenAI berarti Anda dapat mengimpor spesifikasi gaya OpenAI dan mendapatkan validasi bentuk permintaan secara gratis.
  2. Dua lingkungan: hosted dan local. hosted mengatur URL dasar ke https://api.z.ai/api/paas/v4 dengan GLM_API_KEY Anda; local menunjuk ke http://localhost:8000/v1 (default vLLM) dengan kunci placeholder. Setiap permintaan mereferensikan {{base_url}}, jadi beralih target hanya dengan satu pilihan dropdown.
  3. Penegasan pada bentuk terlebih dahulu, konten kedua. Tegaskan HTTP 200, choices[0].message.content yang tidak kosong, dan blok usage yang masuk akal. Untuk baseline kode, tambahkan pemeriksaan konten yang bertahan dari perbedaan kata: respons berisi def , menyebutkan datetime, menyertakan pola try.
  4. Simpan respons yang di-host sebagai contoh. Ini menjadi fixture referensi Anda. Pada hari peluncuran Anda menjalankan kembali koleksi terhadap local dan membandingkan.
  5. Jalankan dari CLI. Runner Apidog mengeksekusi koleksi tanpa kepala, sehingga perbandingan menjadi langkah yang dapat diskrip yang Anda jalankan kembali per tingkat kuantisasi, tumpukan penyajian, atau perubahan konfigurasi.

Output yang Anda inginkan pada 28 Agustus adalah jawaban satu perintah untuk "apakah deployment saya berperilaku seperti model yang di-host," dengan lulus/gagal per prompt alih-alih berdasarkan perasaan.

Kode klien Anda tidak berubah

Manfaat dari konvensi yang kompatibel dengan OpenAI: aplikasi yang ditulis terhadap API yang di-host berpindah ke endpoint self-hosted Anda dengan perubahan konfigurasi, bukan penulisan ulang. Satu variabel lingkungan mengontrol target:

import os
from openai import OpenAI

# Hosted:  GLM_BASE_URL=https://api.z.ai/api/paas/v4
# Local:   GLM_BASE_URL=http://localhost:8000/v1
client = OpenAI(
    base_url=os.environ["GLM_BASE_URL"],
    api_key=os.environ.get("GLM_API_KEY", "local-serving"),
)

response = client.chat.completions.create(
    model="glm-5.3",
    temperature=0,
    messages=[
        {"role": "user", "content": "Refactor this function to remove the nested loops: ..."},
    ],
)
print(response.choices[0].message.content)

vLLM dan SGLang menerima nama model apa pun yang Anda daftarkan saat waktu penyajian, jadi --served-model-name glm-5.3 menjaga string model tetap identik dengan ID yang di-host. Streaming, panggilan alat, dan mode JSON berjalan di permukaan yang sama, tetapi uji regresi panggilan alat secara khusus: di sinilah tumpukan lokal paling sering menyimpang dari perilaku yang di-host.

Pembingkaian biaya: API yang di-host versus GPU Anda sendiri

Zhipu belum mempublikasikan harga API khusus 5.3 pada saat peluncuran; periksa halaman harga resmi untuk angka saat ini sebelum memodelkan biaya. Jadi perbandingan di sini bersifat struktural, bukan per-token.

Melakukan self-hosting MoE kelas 744B berarti membayar kapasitas GPU terlepas dari apakah token mengalir atau tidak. Itu masuk akal dalam tiga situasi: pemanfaatan berkelanjutan yang cukup tinggi sehingga biaya per-token akan melebihi biaya perangkat keras yang diamortisasi atau biaya sewa, tata kelola data yang menjaga prompt tetap berada di dalam jaringan Anda, dan kontrol latensi atau ketersediaan yang tidak dapat dijamin oleh API bersama. Di bawah itu, yang di-host menang dalam harga, dan menyewa jam GPU untuk evaluasi lebih baik daripada membeli perangkat keras untuk model yang belum divalidasi.

Ada juga argumen lindung nilai. Harga penyedia dapat berubah; kenaikan DeepSeek tahun 2026 mengejutkan tim yang membangun unit ekonomi berdasarkan tarif peluncuran, seperti yang kami bahas dalam analisis kenaikan harga API DeepSeek kami. Bobot terbuka membatasi kerugian itu: jika harga yang di-host bergeser, jalur self-hosted Anda sudah terbukti.

Daftar periksa hari peluncuran

Semua hal di atas diringkas menjadi daftar ini. Item 1 hingga 6 dapat dilakukan hari ini.

  1. Konfirmasikan tingkat presisi target Anda (BF16, FP8, atau menunggu kuantisasi) terhadap perangkat keras yang dapat Anda akses, menggunakan rentang aritmatika di atas.
  2. Instal vLLM atau SGLang dan uji coba dengan bobot publik GLM-5.2 atau model MoE lainnya.
  3. Buat kunci API Z.ai dan konfirmasikan ID model 5.3 yang tepat terhadap dokumen langsung.
  4. Ambil 20 hingga 50 respons baseline suhu-0 dari API yang di-host.
  5. Bangun koleksi Apidog dengan lingkungan hosted dan local serta penegasan bentuk.
  6. Tentukan panjang konteks maksimum yang disajikan per tingkatan deployment Anda.
  7. Saat rilis: perhatikan huggingface.co/zai-org untuk repositori GLM-5.3 dan GLM-5.3-FP8, dan baca lisensi kartu model sebelum menyebarkan secara komersial.
  8. Unduh bobot, luncurkan server, arahkan lingkungan local ke sana, dan jalankan koleksi.
  9. Bandingkan fixture lokal dengan yang di-host. Selidiki kegagalan tingkat konten sebelum menskalakan lalu lintas.
  10. Baru setelah itu mulai menyetel: tingkat kuantisasi, tata letak paralelisme, prefix caching, batas konteks.

FAQ

Bisakah saya mengunduh bobot GLM-5.3 sekarang?

Tidak. Per 14 Agustus 2026, hanya API yang di-host yang aktif. Zhipu mengatakan bobot terbuka akan tiba sekitar dua minggu setelah rilis, sekitar 28 Agustus. Tujuan yang diharapkan adalah halaman Hugging Face zai-org, tempat GLM-5, 5.1, dan 5.2 sudah tersedia.

Apakah GLM-5.3 akan berjalan di satu GPU konsumen?

Tidak pada bobot penuh. Total parameter keluarga sebesar 744B kira-kira 744 GB pada FP8 sebelum cache KV, jauh melampaui satu kartu pun, dan bahkan kuantisasi kelas INT4 berada di wilayah multi-GPU. Untuk anggaran satu GPU, jalankan model terbuka yang lebih kecil secara lokal dan simpan GLM-5.3 di API yang di-host; rangkuman LLM lokal kami mencantumkan apa yang sesuai.

Kerangka kerja penyajian mana yang harus saya gunakan untuk GLM-5.3?

vLLM adalah pilihan default teraman: dukungan keluarga GLM-5 yang terbukti, paralelisme yang sadar MoE, dan server yang kompatibel dengan OpenAI. SGLang adalah alternatif yang kuat ketika beban kerja Anda mengirim ulang prefix bersama yang panjang, seperti yang dilakukan loop agen. Jalur llama.cpp dan Ollama terbuka nanti, setelah konversi GGUF komunitas muncul.

Apakah kode OpenAI SDK saya yang sudah ada akan berfungsi melawan GLM-5.3 yang di-self-host?

Ya, itulah inti dari konvensi yang kompatibel dengan OpenAI di kedua sisi. Arahkan base_url SDK ke server vLLM atau SGLang Anda alih-alih https://api.z.ai/api/paas/v4 dan pertahankan bentuk permintaan yang sama. Uji panggilan alat dan streaming secara khusus; itulah sisi-sisi di mana tumpukan lokal kadang-kadang berbeda.

Mengapa harus repot dengan API yang di-host jika saya berencana untuk melakukan self-host?

Karena itu adalah implementasi referensi Anda. Tanpa baseline yang di-host, Anda tidak dapat mengetahui apakah output lokal yang aneh berarti kuantisasi Anda terlalu agresif atau model memang berperilaku seperti itu di mana-mana. Ambil baseline sekarang melalui endpoint yang di-host, menggunakan pengaturan di panduan cepat API GLM-5.3 kami, dan hari peluncuran menjadi latihan perbandingan alih-alih tebak-tebakan.

Di mana GLM-5.3 cocok dalam tumpukan Anda

GLM-5.3 adalah pengumuman coding bobot terbuka terkuat tahun ini sejauh ini: yang pertama di antara model terbuka di Terminal-Bench 3.0 dan Agents’ Last Exam, skor CyberGym di atas dua model terdepan, dan bobot yang tiba sesuai jadwal publik. Tim yang mendapatkan nilai di minggu pertama bukanlah tim dengan anggaran GPU terbesar. Mereka adalah tim yang menghabiskan jendela dua minggu untuk pekerjaan yang tidak glamor: tumpukan terinstal, tingkat presisi dipilih, baseline diambil, alat siap.

Mulailah dengan daftar periksa di atas. Ambil baseline yang di-host Anda minggu ini, dan unduh Apidog untuk menyimpannya: satu koleksi, lingkungan hosted dan local, dan penegasan yang mengubah "apakah deployment saya berfungsi" menjadi laporan lulus/gagal yang dapat Anda jalankan kembali setiap kali Anda mengubah tingkat kuantisasi atau tanda penyajian.

tombol

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.