GLM-5.2 adalah salah satu dari sedikit model kelas perintis yang benar-benar dapat Anda jalankan di perangkat keras Anda sendiri. Model ini didistribusikan sebagai 'open weights' di bawah lisensi MIT, tanpa batasan regional, jadi “menggunakannya tanpa batasan” bukanlah sebuah trik. Ini adalah jalur yang didukung. Kuncinya adalah mengetahui batasan mana yang sebenarnya Anda hadapi, karena solusinya berbeda untuk setiap batasan.
Singkatnya
- GLM-5.2 (Z.ai / Zhipu AI) adalah 'open weights', sekitar 753B parameter (MoE), berlisensi MIT, konteks 1M token, tanpa kunci regional.
- Sebagian besar “pembatasan” berasal dari UI obrolan konsumen atau 'instruct tuning' model, bukan dari batas lisensi yang ketat.
- Akses API mentah memberi Anda kontrol 'system-prompt' dan memungkinkan Anda mematikan fitur 'thinking'. 'Self-hosting' memberi Anda kendali penuh atas tumpukan (stack).
- Build 'abliterated' komunitas menghilangkan penolakan bawaan, pola yang sama digunakan untuk DeepSeek R1 dan QwQ. Ketersediaan untuk 5.2 berubah dari minggu ke minggu, jadi verifikasi di Hugging Face.
- Anda tetap bertanggung jawab atas moderasi dan hukum setelah Anda melakukan 'self-host'. Lebih sedikit 'guardrails' berarti lebih banyak tanggung jawab, bukan lebih sedikit.
Pertama, ketahui batasan mana yang Anda hadapi
“Batasan” adalah kata yang longgar. Untuk GLM-5.2 biasanya berarti salah satu dari empat hal berbeda, dan masing-masing memiliki solusinya sendiri.
- Penolakan dari 'instruct tuning'. Model obrolan yang dirilis selaras untuk menolak beberapa permintaan. Perilaku ini ada di 'weights'.
- Filter produk di aplikasi obrolan. UI web konsumen dapat menambahkan lapisan moderasi sendiri di atas model. API seringkali berperilaku berbeda dari aplikasi.
- Batasan paket dan tarif. Tingkat gratis dan tingkat Paket Pengkodean membatasi permintaan, konteks, atau keluaran. Itu adalah kuota, bukan aturan konten.
- Overhead 'thinking' dan 'safety routing'. Penalaran yang diperpanjang dan 'safety routing' menambah latensi dan dapat mengubah nada.
Wilayah sengaja tidak ada dalam daftar ini. 'Weights' GLM-5.2 dilisensikan MIT tanpa batasan regional, sehingga akses tidak dibatasi oleh negara seperti beberapa model 'hosted-only' lainnya.
Pengungkit 1: Gunakan API mentah, bukan aplikasi obrolan
Perubahan tercepat dengan hasil terbesar adalah berhenti menggunakan jendela obrolan konsumen dan langsung memanggil API. Titik akhir (endpoint) ini kompatibel dengan OpenAI, sehingga Anda mempertahankan 'system prompt' Anda sendiri, mengatur 'temperature' Anda sendiri, dan dapat menonaktifkan fase 'thinking'.
- Base URL:
https://api.z.ai/api/paas/v4/ - Endpoint:
POST /chat/completions - Model id:
glm-5.2
Panggilan curl minimal dengan fitur 'thinking' dinonaktifkan:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"thinking": { "type": "disabled" },
"temperature": 0.7,
"messages": [
{ "role": "system", "content": "You are a direct, unfiltered technical assistant. Answer concisely." },
{ "role": "user", "content": "Explain how abliteration changes a model." }
]
}'
Panggilan yang sama dengan OpenAI Python SDK, hanya diarahkan ulang ke z.ai:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_ZAI_KEY",
base_url="https://api.z.ai/api/paas/v4/",
)
resp = client.chat.completions.create(
model="glm-5.2",
temperature=0.7,
extra_body={"thinking": {"type": "disabled"}},
messages=[
{"role": "system", "content": "You are a direct, unfiltered technical assistant."},
{"role": "user", "content": "Explain how abliteration changes a model."},
],
)
print(resp.choices[0].message.content)
Dua hal penting di sini. 'System prompt' Anda adalah milik Anda, jadi Anda mengarahkan nada dan cakupan secara langsung alih-alih mewarisi pengaturan default aplikasi. Dan thinking: {"type": "disabled"} melewati tahap penalaran ketika Anda menginginkan keluaran mentah dan cepat. Untuk set parameter lengkap, lihat panduan API GLM-5.2.
Harga dapat berubah, jadi verifikasi secara langsung sebelum Anda menganggarkan: pada saat penulisan ini, sumber sekunder mencantumkan sekitar $1.40 per 1 juta token input dan $4.40 per 1 juta token output. Konfirmasi angka-angka saat ini pada rincian harga GLM-5.2, dan jika biaya adalah batasan sebenarnya, baca cara menggunakan GLM-5.2 secara gratis.
Pengungkit 2: 'Self-host' 'open weights'
Ini adalah jawaban “tanpa batasan” yang sebenarnya. Karena 'weights' dilisensikan MIT, Anda dapat mengunduh dan menyajikan GLM-5.2 sendiri. Ketika model berjalan di mesin Anda, tidak ada filter UI vendor dan tidak ada batasan tarif eksternal. Anda yang mengatur 'system prompt', Anda yang mengatur kebijakan.
Jalur termudah adalah Ollama:
ollama run glm-5.2
Pemeriksaan realitas perangkat keras: GLM-5.2 adalah model MoE dengan sekitar 753B parameter, jadi 'weights' penuh memerlukan VRAM yang serius. Bagi kebanyakan orang itu berarti 'build' yang terkuantisasi, 'box' multi-GPU sewaan, atau varian GLM yang lebih kecil. Jika perangkat keras Anda sederhana, GLM-4.7-Flash berjalan secara lokal dengan jauh lebih sedikit dan merupakan pengganti yang baik saat Anda membangun 'pipeline'. Panduan umum menjalankan GLM secara lokal dan panduan pengaturan Ollama mencakup sisanya.
Setelah berjalan secara lokal, Ollama mengekspos titik akhir (endpoint) yang kompatibel dengan OpenAI sendiri di http://localhost:11434/v1, sehingga kode yang sama dari Pengungkit 1 bekerja hanya dengan mengubah URL dasar.
Pengungkit 3: Build 'abliterated' (tanpa sensor) komunitas
'Instruct tuning' adalah tempat penolakan berada. Komunitas open-source menghilangkan perilaku tersebut melalui proses yang disebut 'abliteration', yang menekan arah internal yang memicu penolakan tanpa 'retrain' penuh. Teknik yang sama mendukung 'build' tanpa sensor dari model terbuka lainnya, termasuk QwQ dan DeepSeek R1.
Karena 'weights' GLM-5.2 bersifat terbuka dan berlisensi MIT, teknik itu juga berlaku di sini. 'Build abliterated' GLM-5.2 yang sudah jadi belum tentu tersedia, dan ketersediaan sering berubah, jadi cari di Hugging Face untuk yang terkini daripada berasumsi itu ada. Jika 'build' 5.2 belum tersedia, alur kerjanya identik dengan panduan QwQ dan DeepSeek R1: tarik 'abliterated weights', muat di Ollama atau vLLM, dan sajikan.
Ini adalah cara terlengkap untuk menghilangkan penolakan bawaan, dan juga yang paling menempatkan tanggung jawab pada Anda. Baca bagian tanggung jawab sebelum Anda menerapkannya.
Pengungkit 4: Pilih penyedia yang memungkinkan Anda menetapkan kebijakan
Jika Anda tidak ingin menjalankan 'box' Anda sendiri, penyedia 'routing' adalah jalan tengah. GLM-5.2 terdaftar di OpenRouter sebagai z-ai/glm-5.2 dan di pustaka Ollama. Sebuah 'router' memungkinkan Anda menerapkan pengaturan moderasi Anda sendiri dan menukar host yang mendasarinya tanpa menulis ulang aplikasi Anda, yang mengesampingkan filter UI konsumen sambil tetap mempertahankan 'endpoint' yang dikelola.
Bagian ini menyertai rangkuman yang lebih luas tentang LLM tanpa batasan jika Anda ingin membandingkan GLM-5.2 dengan opsi terbuka lainnya sebelum Anda berkomitmen.
Uji setiap pengaturan di Apidog sebelum Anda meluncurkan
Pengungkit mana pun yang Anda pilih, Anda akan berakhir dengan titik akhir (endpoint) yang kompatibel dengan OpenAI. Konfirmasi bahwa itu berperilaku sesuai harapan Anda sebelum menghubungkannya ke produk. Apidog adalah cara yang bersih untuk melakukan itu karena Anda dapat memeriksa respons 'streaming' mentah, bukan hanya teks akhir.

- Buat permintaan baru di Apidog yang mengarah ke titik akhir (endpoint) Anda (
https://api.z.ai/api/paas/v4/chat/completionsuntuk API yang di-host, atauhttp://localhost:11434/v1/chat/completionsuntuk 'build' lokal). - Tambahkan 'header'
Authorization: Bearer <key>untuk API yang di-host. Ollama lokal tidak memerlukan kunci. - Kirim 'body'
chat/completionsdenganmodel: glm-5.2, pesansystemAnda, danstream: true. - Tonton 'stream' SSE. Anda dapat melihat 'deltas thinking' dan 'deltas content' secara terpisah, ditambah objek
usagedengan jumlah token. - Alihkan 'thinking' hidup dan mati dan bandingkan kedua respons secara berdampingan.
Ini adalah cara Anda memverifikasi bahwa 'system prompt' Anda benar-benar berfungsi dan bahwa model merespons seperti yang dijanjikan oleh pengaturan pilihan Anda, alih-alih baru mengetahuinya saat produksi.
Sepatah kata tentang tanggung jawab
Menghapus filter produk dan menjalankan 'weights' tanpa sensor adalah sah. Ini umum untuk penelitian, 'red-teaming', dan membangun moderasi Anda sendiri daripada mewarisi dari orang lain. Tetapi begitu Anda melakukan 'self-host', moderasi adalah milik Anda, begitu juga paparan hukumnya. Lebih sedikit 'guardrails' berarti Anda memiliki hasilnya. Ingatlah tiga hal ini:
- Anda tetap terikat oleh hukum dan oleh ketentuan platform apa pun yang Anda gunakan.
- Jika Anda menyajikannya kepada orang lain, tambahkan lapisan moderasi yang sesuai untuk pengguna Anda.
- “Tanpa batasan” adalah tentang kontrol dan memotong penolakan 'false-positive', bukan lisensi untuk menghasilkan konten berbahaya atau ilegal.
FAQ
Apakah GLM-5.2 benar-benar 'open source'?
'Weights' dirilis di bawah lisensi MIT, salah satu lisensi paling permisif yang tersedia. Anda dapat menjalankan, memodifikasi, dan melakukan 'self-host', termasuk untuk penggunaan komersial, tunduk pada ketentuan lisensi. Untuk identitas lengkap dan rincian spesifikasi, lihat apa itu GLM-5.2.
Apakah API GLM-5.2 menyensor respons?
Model 'instruct' membawa penyelarasan dari 'tuning'-nya, sehingga dapat menolak beberapa 'prompt'. API memberi Anda kontrol 'system-prompt' dan memungkinkan Anda menonaktifkan 'thinking', yang menangani sebagian besar masalah nada dan penolakan berlebihan. Untuk sepenuhnya menghilangkan penolakan bawaan, lakukan 'self-host' 'build abliterated'.
Bisakah saya menjalankan GLM-5.2 di laptop?
Tidak untuk model 753B penuh. Gunakan 'build' yang terkuantisasi, 'box' GPU sewaan, atau varian GLM yang lebih kecil seperti GLM-4.7-Flash untuk pengujian lokal, lalu arahkan kode yang sama ke model yang lebih besar saat Anda membutuhkannya.
Apakah GLM-5.2 terkunci wilayah?
Tidak. 'Weights' dilisensikan MIT tanpa batasan regional. Ketersediaan API yang di-host dapat berbeda per penyedia, tetapi 'self-hosting' terbuka untuk siapa saja.
