GLM-5.2 adalah salah satu model `open-weights` paling mumpuni yang dapat Anda jalankan saat ini, dan lisensi MIT terbuka berarti "gratis" benar-benar tersedia. Kendalanya adalah "gratis" dan "mudah" bukanlah hal yang sama untuk model `mixture-of-experts` berukuran ~753B. Panduan ini menjelaskan rute yang sebenarnya, dari `self-hosting` yang benar-benar gratis hingga kredit percobaan yang hampir gratis dan harga berbayar termurah, dengan catatan jujur tentang `hardware` dan batasannya.
Jika Anda menginginkan versi singkatnya: jika Anda memiliki `hardware` (atau GPU sewaan yang murah), `self-host` `open weights` tersebut. Jika tidak, manfaatkan kredit percobaan z.ai atau tingkat GLM Coding Plan termurah. Tidak ada jalur OpenRouter gratis untuk glm-5.2, jadi jangan mencarinya.
Pohon keputusan cepat
Pilih baris Anda dan lewati ke bagian tersebut.
| Situasi Anda | Rute Terbaik | Biaya Nyata |
|---|---|---|
| Anda memiliki `GPU box` yang kuat (atau bisa menyewa) | `Self-host open weights` (Ollama / vLLM) | $0 untuk `weights`; listrik atau sewa GPU |
| Anda ingin tanpa `setup` dan tanpa kartu | Kredit `free-trial` z.ai / tingkat `rate-limited` | Gratis sampai kredit habis (verifikasi penawaran saat ini) |
| Anda ingin jalur berbayar yang paling murah dan andal | GLM Coding Plan Lite, atau harga API `cached-input` | ~$3-6/bulan (verifikasi) atau beberapa sen per panggilan |
| Anda ingin `pay-as-you-go` tanpa komitmen | API OpenRouter | $1.40 / 1M `input`, $4.40 / 1M `output` |
Aturan praktisnya: benar-benar gratis berarti `self-host`. Hampir gratis berarti kredit percobaan atau paket Lite.

Rute 1: `Self-host` `open weights` MIT (benar-benar gratis)
GLM-5.2 dikirimkan di bawah lisensi MIT tanpa batasan regional, jadi Anda dapat mengunduh `weights` dan menjalankannya di `hardware` Anda sendiri tanpa membayar siapa pun. `Weights` tersedia di Hugging Face di zai-org/GLM-5.2.
Bagian jujurnya: ini adalah model MoE berparameter ~753B dalam BF16. Meskipun hanya sebagian kecil dari parameter tersebut yang aktif per token, seluruh `weight set` masih harus berada di memori. Dalam BF16, itu lebih dari satu terabyte `raw weights`. Anda tidak dapat menjalankan ini di laptop. Kebanyakan orang yang `self-host` melakukan salah satu dari dua hal:
- Menjalankan **`quantized build`** (4-bit atau serupa) untuk mengecilkan jejak memori, menerima sedikit kompromi kualitas.
- **Menyewa instance multi-GPU** per jam dari penyedia `cloud` dan mematikannya setelah selesai.
Jadi "gratis" di sini berarti bebas biaya lisensi. Anda tetap membayar `hardware`, listrik, atau sewa GPU. Bagi kebanyakan individu, `quantized build` pada `workstation` VRAM tinggi atau sesi sewa singkat adalah jalur yang realistis.
Jalankan GLM-5.2 dengan Ollama
Ollama adalah `local runner` yang paling ramah. GLM-5.2 tersedia di Ollama library, alurnya dua perintah:
# Pull the model (expect a very large download)
ollama pull glm-5.2:cloud

Ollama secara `default` menggunakan varian kuantisasi, yang membuat model sebesar ini bahkan dapat dipikirkan pada `hardware` konsumen. Anda juga dapat mengaksesnya melalui `endpoint` Ollama yang kompatibel dengan OpenAI lokal:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Write a Python function to parse an RFC 3339 timestamp."}]
}'
Perhatikan RAM dan VRAM Anda. Jika model melimpah ke disk, generasi melambat hingga merangkak. `Quantized build` ditambah memori terpadu yang cukup atau `split multi-GPU` adalah perbedaan antara dapat digunakan dan tidak dapat digunakan.
Jika Anda menginginkan panduan lokal langkah demi langkah, polanya hampir sama persis dengan generasi sebelumnya. Lihat menjalankan GLM-5 secara lokal secara gratis dan GLM-5 secara gratis dengan Ollama untuk `setup` lengkap, pilihan kuantisasi, dan pemecahan masalah. Ganti tag model menjadi glm-5.2 dan alurnya sama.
Jalankan GLM-5.2 dengan vLLM
Untuk `throughput` dan melayani banyak permintaan, vLLM adalah opsi tingkat produksi. Ini menangani paralelisasi tensor di seluruh GPU, begitulah cara Anda benar-benar memuat MoE 753B.
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model zai-org/GLM-5.2 \
--tensor-parallel-size 8 \
--max-model-len 131072
--tensor-parallel-size 8 itu mengasumsikan delapan GPU. Jumlah pastinya tergantung pada kartu Anda dan apakah Anda memuat `checkpoint` terkuantisasi. vLLM mengekspos `server` yang kompatibel dengan OpenAI, jadi klien apa pun yang berbicara format `chat-completions` berfungsi tanpa perubahan. Konteks 1M-token (1.048.576 token) adalah kemampuan utama, tetapi menyimpan `KV cache` sejuta token membutuhkan banyak memori, jadi atur --max-model-len sesuai kebutuhan Anda.
Rute 2: Kredit uji coba gratis z.ai dan tingkat terbatas laju
Jika `self-hosting` tidak dapat dijangkau, jalur termurah berikutnya adalah platform z.ai sendiri. Akun baru biasanya mendapatkan **kredit uji coba gratis** dan biasanya ada **tingkat gratis yang dibatasi laju** untuk eksperimen ringan (per Juni 2026, verifikasi penawaran saat ini di z.ai karena ketentuan uji coba sering berubah).
Ini adalah cara tercepat untuk mencoba model nyata tanpa `setup`. Anda membuat akun, mengambil kunci API, dan memanggil `endpoint` yang kompatibel dengan OpenAI:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Explain IndexShare sparse attention in two sentences."}],
"thinking": {"type": "enabled"},
"reasoning_effort": "max"
}'
Beberapa spesifikasi GLM-5.2 yang perlu diketahui saat Anda menggunakan kredit tersebut:
thinkingmengaktifkan atau menonaktifkan penalaran. Untuk `coding`, z.ai merekomendasikan level upaya `thinking` **Maksimum** melaluireasoning_effort: "max". Ada dua level upaya, High dan Max.- Panjang `output` didokumentasikan hingga 128K per dokumen z.ai, tetapi perlakukan itu sebagai angka yang perlu diverifikasi secara langsung daripada jaminan pasti, karena sumber sekunder tidak selalu mencantumkannya.
Kredit uji coba akan habis. Setelah itu, Anda beralih ke paket berbayar atau kembali ke `self-hosting`. Detail parameter lengkap ada di panduan z.ai GLM-5.2.
Rute 3: Harga berbayar termurah (mendekati gratis)
Ketika kredit gratis habis, dua jalur menjaga biaya Anda mendekati nol.
GLM Coding Plan Lite
Jika penggunaan utama Anda adalah `coding`, GLM Coding Plan adalah pilihan yang bernilai. Tingkat **Lite** awal harganya sekitar **$12/bulan** (per Juni 2026, verifikasi harga saat ini di z.ai karena tingkat yang dipublikasikan berbeda antar sumber). Dengan itu, Anda mendapatkan akses `coding` dengan tarif bulanan tetap daripada token yang diukur, yang membuat penggunaan harian yang berat dapat diprediksi.

The Coding Plan juga membuka jalur yang kompatibel dengan Anthropic, sehingga Anda dapat mengarahkan Claude Code, Cline, atau Cursor ke GLM-5.2. URL dasar `coding` adalah https://api.z.ai/api/coding/paas/v4 (beberapa sumber menunjukkan open.z.ai/api/paas/v4, jadi verifikasi secara langsung). Lingkungan Claude Code yang berfungsi terlihat seperti ini:
export ANTHROPIC_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export ANTHROPIC_API_KEY="your-glm-coding-plan-key"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.2[1m]"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.2[1m]"
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000
export API_TIMEOUT_MS=3000000
Sufiks [1m] memilih varian 1M-konteks. Atur API_TIMEOUT_MS tinggi, atau Claude Code akan menghentikan panggilan `large-context` yang panjang sebelum selesai. Untuk panduan `agent-tooling` yang lebih mendalam, lihat GLM-5.2 dengan Claude Code, Cline, dan Cursor dan panduan generasi sebelumnya GLM-5.1 dengan Claude Code.
Harga `cached-input` dan `pay-as-you-go`
Untuk akses API tanpa langganan, API umum standar dikenakan biaya **$1.40 per 1M `input tokens` dan $4.40 per 1M `output tokens`**, yang dikonfirmasi oleh OpenRouter. Harga yang sama berlaku apakah Anda memanggil z.ai secara langsung atau melalui OpenRouter sebagai `pay-as-you-go`.
Trik yang hampir gratis di sini adalah **`cached input`**. Dilaporkan sekitar $0.26 per 1M token (menurut VentureBeat, atribusikan sesuai), `cached input` mengurangi biaya konteks berulang, seperti `system prompt` yang panjang atau `codebase` tetap yang Anda `query` berulang kali. Jika beban kerja Anda menggunakan kembali `prefix` yang sama, Anda membayar harga penuh sekali dan sebagian kecil setelahnya. Untuk `coding` jangka panjang, VentureBeat mencatat GLM-5.2 "mengalahkan GPT-5.5 pada `coding` jangka panjang dengan biaya sekitar seperenam," yang merupakan argumen ekonomi dalam satu kalimat.
Sekali lagi, dengan jelas: **tidak ada tingkat OpenRouter gratis untuk glm-5.2**. OpenRouter murah, bukan gratis. Jika panduan mengklaim sebaliknya, itu salah.
Gratis vs. hampir gratis: perbandingan jujur
| Rute | Biaya Awal | Biaya Berkelanjutan | Usaha `Setup` | Terbaik untuk |
|---|---|---|---|---|
| `Self-host` (Ollama/vLLM) | `Hardware` atau sewa | Listrik / Jam GPU | Tinggi | Privasi, tanpa pengukuran, kontrol penuh |
| Kredit percobaan z.ai | Tidak ada | Gratis hingga kredit habis | Rendah | Percobaan pertama, tes cepat |
| GLM Coding Plan Lite | ~$3-6/bulan (verifikasi) | Bulanan tetap | Rendah | `Coding` harian di Claude Code/Cline/Cursor |
| API + `cached input` | Tidak ada | $1.40/$4.40 per 1M; ~$0.26 `cached` | Rendah | Aplikasi, beban kerja konteks berulang |
Pola yang berguna: validasi ide Anda dengan kredit uji coba, lalu putuskan. Jika Anda akan menjalankannya setiap hari dan itu adalah `coding`, ambil paket Lite. Jika Anda membutuhkan privasi atau ingin sepenuhnya menghindari penagihan per-token, berinvestasi dalam `self-hosting`. Jika Anda membangun produk dengan konteks yang dapat digunakan kembali, API dengan `caching` adalah harga paling murah dan andal.
Uji `endpoint` GLM-5.2 gratis Anda dengan Apidog
Bagaimana pun cara Anda menjalankan GLM-5.2, gratis atau berbayar, Anda pasti ingin mengonfirmasi bahwa `endpoint` tersebut benar-benar berfungsi sebelum menghubungkannya ke aplikasi Anda. Baik itu `server` Ollama lokal, instance vLLM, atau API `cloud` z.ai, responsnya adalah `payload chat-completions` `streaming` yang perlu Anda periksa.

Apidog adalah platform API `all-in-one` untuk tujuan ini. Anda dapat mengirim permintaan ke `endpoint` GLM-5.2 Anda, melihat `Server-Sent Events` yang di-`stream` `render` secara `real time`, menyimpan permintaan sebagai `case` yang dapat digunakan kembali, dan `mock` respons sehingga `frontend` Anda dapat membangun berdasarkan itu sebelum model bahkan `live`. Arahkan ke http://localhost:11434 untuk Ollama atau ke URL dasar z.ai untuk `cloud`, atur `header Authorization` Anda, dan Anda memiliki `test harness` yang berulang dalam satu menit. Unduh Apidog dan simpan di samping rute gratis mana pun yang Anda pilih.
FAQ
Apakah GLM-5.2 benar-benar gratis untuk digunakan? `Weights` gratis di bawah lisensi MIT, jadi `self-hosting` tidak dikenakan biaya lisensi. Anda tetap membayar `hardware` atau sewa GPU. API yang di-`host` berbayar, meskipun z.ai biasanya menawarkan kredit uji coba dan tingkat terbatas laju untuk memulai (verifikasi penawaran saat ini).
Bisakah saya menjalankan GLM-5.2 secara gratis dengan Ollama di laptop biasa? Realistisnya, tidak. Ini adalah model MoE ~753B, dan bahkan `quantized build` membutuhkan memori yang serius. Ollama membuat perintah mudah, tetapi batasan `hardware` tinggi. `Workstation` VRAM tinggi, Mac dengan memori terpadu besar, atau GPU sewaan adalah yang Anda butuhkan. Lihat `local deep-dive` untuk ukuran.
Apakah ada tingkat OpenRouter gratis untuk GLM-5.2? Tidak. OpenRouter menawarkan GLM-5.2 sebagai `pay-as-you-go` dengan $1.40 `input` dan $4.40 `output` per 1M token. Ini murah, bukan gratis. Jangan percaya sumber mana pun yang mengklaim jalur OpenRouter gratis.
Apa cara berbayar termurah untuk menggunakan GLM-5.2 untuk `coding`? Tingkat GLM Coding Plan Lite, sekitar $3-6/bulan per Juni 2026 (verifikasi di z.ai). Ini memberikan akses `coding` tarif tetap dan membuka `endpoint` yang kompatibel dengan Anthropic untuk Claude Code, Cline, dan Cursor.
Bagaimana perbandingan GLM-5.2 dengan GPT-5.5 dalam hal biaya? Menurut VentureBeat, GLM-5.2 mengalahkan GPT-5.5 pada beberapa `benchmark coding` jangka panjang dengan biaya sekitar seperenam. Untuk angka lengkapnya, lihat rincian `benchmark` GLM-5.2 dan perbandingan `head-to-head`.
Ke mana selanjutnya
Rute termurah sepenuhnya tergantung pada `hardware` Anda dan seberapa sering Anda akan menjalankannya. `Self-hosting` menang dalam privasi dan tanpa pengukuran jika Anda dapat melewati batasan memori. Kredit percobaan dan paket Lite menang dalam kenyamanan. API dengan `cached input` menang untuk aplikasi yang menggunakan kembali konteks.
Jika Anda masih memutuskan apakah GLM-5.2 adalah model yang tepat, mulailah dengan apa itu GLM-5.2 dan bagaimana perbandingannya dengan GLM-5.1. Ketika Anda siap untuk membangun berdasarkan itu, panduan API GLM-5.2 dan rincian harga mencakup sisanya, dan Apidog menangani pengujian di antaranya.
