Zhipu AI, laboratorium Tiongkok yang beroperasi secara internasional sebagai Z.ai, merilis GLM-5.3 pada 14 Agustus 2026, dan angka-angka terkait kemampuan pengkodean menjadi sorotan utama. Evaluasi internal menunjukkan peningkatan 50% dalam kemampuan pengkodean dibandingkan GLM-5.2, skor Terminal-Bench 3.0 melonjak dari 4.6 menjadi 28.3, dan Zhipu menggambarkan kemampuan pengkodean dan agen model ini sebagai "mendekati Claude Fable 5", menurut laporan peluncuran dari BigGo. Bobot terbuka akan menyusul dalam waktu sekitar dua minggu. Untuk rincian kemampuan lengkap dan tabel benchmark, baca apa itu GLM-5.3; artikel ini adalah panduan API cepat secara langsung.
Berikut yang akan Anda lakukan: mendapatkan kunci API, melakukan panggilan pertama di cURL, memindahkannya ke Python dan Node.js melalui OpenAI SDK, melakukan streaming token, menyesuaikan parameter yang penting, dan menghubungkan seluruh siklus ke Apidog sehingga Anda dapat mengunci bentuk permintaan sebelum menulis kode aplikasi. Kabar baiknya: API Z.ai kompatibel dengan OpenAI. Jika Anda pernah memanggil endpoint bergaya OpenAI sebelumnya, Anda sudah tahu sebagian besar hal ini.
Satu peringatan sebelum masuk ke kode. GLM-5.3 diluncurkan hari ini, dan dokumentasi Zhipu bergerak cepat pada hari-hari peluncuran. Semua yang tertera di bawah ini yang berasal langsung dari dokumentasi resmi saat saya periksa disajikan sebagai terverifikasi; apa pun yang belum diperbarui di dokumentasi ditandai sebagai konvensi keluarga GLM-5, dengan tautan sehingga Anda dapat mengkonfirmasi status terkini sendiri.
Intisari
- GLM-5.3 dirilis pada 14 Agustus 2026. Evaluasi internal Zhipu melaporkan peningkatan kemampuan pengkodean sebesar 50% dibandingkan GLM-5.2 dan lonjakan Terminal-Bench 3.0 dari 4.6 menjadi 28.3. Ini menempati peringkat pertama di antara model open-source pada Terminal-Bench 3.0 dan Agents’ Last Exam.
- API ini kompatibel dengan OpenAI. Endpoint internasional:
POST https://api.z.ai/api/paas/v4/chat/completionsdengan headerAuthorization: Bearer $GLM_API_KEY. Tiongkok Daratan:https://open.bigmodel.cn/api/paas/v4/chat/completions. - Pada saat penulisan, halaman dokumentasi GLM-5 mencantumkan
glm-5sebagai ID model. Halaman harga Zhipu mencantumkanglm-5.2danglm-5.1sebagai model terpisah, jadi diharapkanglm-5.3akan mengikuti konvensi yang sama. Konfirmasikan sebelum melakukan hardcoding. - Zhipu belum mempublikasikan harga API khusus 5.3 saat peluncuran. Sebagai perbandingan, halaman harga resmi mencantumkan GLM-5.2 seharga $1.40 per 1M token masukan dan $4.40 per 1M token keluaran, dan GLM-5 seharga $1.00 dan $3.20.
- Bobot terbuka akan tersedia di Hugging Face sekitar 28 Agustus 2026. Kuota GLM Coding Plan diatur ulang untuk semua pengguna pada 14 Agustus.
- Uji di Apidog terlebih dahulu: satu lingkungan per endpoint regional, ID model di balik variabel, dan respons yang disimpan sebagai fixture sehingga iterasi prompt tidak membebani token.
Mengapa GLM-5.3 Penting
Model dasarnya tidak berubah. Setiap peningkatan dalam rilis ini berasal dari pelatihan pasca-skala di atas GLM-5, yang membuat lompatan ini tidak biasa. Terminal-Bench 3.0 naik dari 4.6 menjadi 28.3, peningkatan 6.2x yang membawa GLM dari tidak relevan menjadi yang pertama di antara model sumber terbuka pada benchmark tersebut dan pada Agents’ Last Exam. SWE-Marathon kira-kira berlipat ganda dibandingkan GLM-5.2. Di sisi keamanan, CyberGym mencapai 84.5%, sedikit di atas Claude Mythos 5 dan GPT-5.6 Sol, sementara ExploitBench mencapai 54.4%, masih tertinggal dari model-model terdepan. Catatan sumber: klaim peningkatan pengkodean 50% dan beberapa skor ini berasal dari evaluasi Zhipu sendiri, jadi perlakukan sebagai laporan vendor sampai pihak ketiga mereproduksinya.

Arsitektur di baliknya adalah dasar keluarga GLM-5: desain Mixture of Experts dengan total 744B parameter, sekitar 40B aktif per forward pass, dan jendela konteks 200K token, menurut dokumentasi Z.ai. Itu adalah spesifikasi keluarga, bukan klaim khusus 5.3.
Dua alasan lagi mengapa rilis ini penting bagi pengguna API. Pertama, Zhipu mengatakan akan merilis bobot terbuka GLM-5.3 sekitar dua minggu setelah peluncuran, sekitar 28 Agustus, bersama dengan apa yang disebutnya sistem tinjauan risiko terlengkap hingga saat ini, menurut liputan peluncuran Pandaily. Jika self-hosting ada di rencana Anda, API yang Anda siapkan hari ini berfungsi ganda sebagai baseline regresi Anda; panduan persiapan self-hosting GLM-5.3 kami membahas hal tersebut secara rinci. Kedua, Seeking Alpha menyebut Zhipu sebagai "penantang OpenAI dari Tiongkok", dan rilis bobot terbuka pada tingkat kemampuan ini cenderung menggerakkan harga di seluruh pasar.
Dapatkan kunci API
Ada dua platform, dibagi berdasarkan wilayah, dan pembagian ini berlaku untuk semua hal lain dalam panduan ini.
Z.ai (internasional). Daftar di z.ai, buka konsol API, dan buat kunci. Dokumentasi tersedia di docs.z.ai. Ini adalah jalur bagi siapa pun di luar Tiongkok daratan, dan ini adalah endpoint default untuk sisa artikel ini.
Bigmodel.cn (Tiongkok daratan). Platform domestik Zhipu adalah open.bigmodel.cn. Bentuk API yang sama, skema autentikasi yang sama, host yang berbeda, dan penagihan terpisah. Jika lalu lintas Anda berasal dari Tiongkok daratan, gunakan yang ini; latensi dan kepatuhan sama-sama mengarah ke sana.
Platform mana pun yang Anda pilih, ekspor kuncinya sekali dan jangan masukkan ke dalam kode Anda:
export GLM_API_KEY="your-key-from-the-console"
Jika Anda menggunakan GLM Coding Plan daripada penagihan API bayar-sesuai-pakai, perhatikan bahwa kuota telah diatur ulang untuk semua pengguna pada 14 Agustus, jadi Anda memulai era 5.3 dengan alokasi yang bersih.
Endpoint dan autentikasi
Endpoint penyelesaian obrolan, diverifikasi dengan dokumentasi GLM-5 pada saat penulisan:
POST https://api.z.ai/api/paas/v4/chat/completions
Tiongkok daratan mengganti host:
POST https://open.bigmodel.cn/api/paas/v4/chat/completions
Autentikasi adalah satu header: Authorization: Bearer $GLM_API_KEY. Tanpa penandatanganan, tanpa jabat tangan sesi.
Kompatibel dengan OpenAI berarti persis seperti yang Anda harapkan. Body permintaan adalah bentuk array model ditambah messages, respons kembali dengan choices, message, finish_reason, dan usage, dan OpenAI SDK resmi berfungsi tanpa modifikasi setelah Anda mengarahkan base_url ke Z.ai. Kode apa pun yang Anda tulis terhadap penyedia yang kompatibel dengan OpenAI lainnya dapat dipindahkan dengan pertukaran host dan model; polanya sama dengan yang kami bahas untuk API DeepSeek V4 Pro.
Satu catatan jujur tentang ID model. Ketika saya mengambil dokumentasi pada hari peluncuran, halaman GLM-5 mencantumkan glm-5 sebagai string model dan belum diperbarui untuk 5.3. Halaman harga Zhipu mencantumkan glm-5.2 dan glm-5.1 sebagai model yang berbeda, jadi konvensi keluarga mengatakan ID baru adalah glm-5.3. Contoh di bawah ini menggunakannya, tetapi periksa dokumentasi sebelum Anda menetapkannya dalam produksi. Jika glm-5.3 mengalami error 404 di wilayah Anda, kembali ke glm-5 dan Anda masih berada di keluarga yang sama.
Permintaan pertama Anda di cURL
curl "https://api.z.ai/api/paas/v4/chat/completions" \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "system",
"content": "Anda adalah peninjau kode. Tandai masalah sebagai pemblokir atau tidak pemblokir."
},
{
"role": "user",
"content": "Tinjau skrip shell ini untuk keamanan:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
}
],
"temperature": 0.3,
"max_tokens": 1024
}'
Responsnya adalah bentuk standar OpenAI: array choices di mana choices[0].message.content menyimpan jawaban, dan blok usage dengan prompt_tokens dan completion_tokens. Mengingat skor Terminal-Bench tersebut, prompt tinjauan shell dan yang berdekatan dengan terminal seperti ini persis di mana 5.3 seharusnya paling banyak meningkat, jadi ini adalah smoke test yang sesuai.
Dokumentasi juga mencatat parameter thinking yang mengaktifkan mode penalaran model:
"thinking": { "type": "enabled" }
Aktifkan untuk tugas pengkodean dan agen multi-langkah; lewati untuk panggilan ekstraksi singkat di mana token penalaran adalah pengeluaran yang terbuang.
Panduan cepat Python
Tidak ada SDK baru yang perlu dipelajari. Instal paket OpenAI dan ubah base URL:
pip install --upgrade openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GLM_API_KEY"],
base_url="https://api.z.ai/api/paas/v4",
)
response = client.chat.completions.create(
model="glm-5.3",
messages=[
{
"role": "system",
"content": "Anda adalah peninjau kode. Tandai masalah sebagai pemblokir atau tidak pemblokir.",
},
{
"role": "user",
"content": (
"Tinjau rute Flask ini untuk masalah keamanan:\n\n"
"@app.route('/user/<id>')\n"
"def get_user(id):\n"
" return db.execute(f'SELECT * FROM users WHERE id = {id}')"
),
},
],
temperature=0.3,
max_tokens=2048,
)
print(response.choices[0].message.content)
print("token masukan:", response.usage.prompt_tokens)
print("token keluaran:", response.usage.completion_tokens)
Catat blok usage tersebut sejak hari pertama. Tanpa harga khusus 5.3 yang dipublikasikan saat peluncuran, jumlah token Anda adalah satu-satunya cara untuk memproyeksikan berapa tagihan Anda setelah angka resmi muncul.
Panduan cepat Node.js
Langkah yang sama dengan paket npm openai:
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.GLM_API_KEY,
baseURL: "https://api.z.ai/api/paas/v4",
});
const response = await client.chat.completions.create({
model: "glm-5.3",
messages: [
{
role: "system",
content: "Anda adalah agen otomatisasi terminal. Kembalikan setiap langkah sebagai perintah shell dengan penjelasan satu baris.",
},
{
role: "user",
content: "Layanan Node pada port 3000 berhenti merespons setelah deployment. Beri saya urutan diagnostik.",
},
],
temperature: 0.3,
max_tokens: 2048,
});
console.log(response.choices[0].message.content);Jika codebase Anda sudah berkomunikasi dengan OpenAI, Anda tidak memerlukan klien paralel. Inisialisasi instance OpenAI kedua dengan baseURL Z.ai dan rutekan permintaan per tugas. Ini membuat perbandingan A/B antara GLM-5.3 dan model yang sudah ada menjadi keputusan routing, bukan penulisan ulang.
Streaming
Dokumentasi mengonfirmasi dukungan streaming melalui flag stream standar. Di Python:
stream = client.chat.completions.create(
model="glm-5.3",
messages=[
{"role": "user", "content": "Jelaskan masalah kueri N+1 dengan contoh ORM yang konkret."}
],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
Melalui HTTP mentah, atur "stream": true di body dan parse event yang dikirim server; setiap baris data: membawa delta dalam format chunk OpenAI. Dua catatan praktis. Penggunaan token tiba pada atau setelah chunk terakhir, jadi perhitungan hanya akurat setelah stream ditutup. Dan jika Anda mengaktifkan thinking, harapkan jeda yang lebih lama sebelum token pertama terlihat pada prompt yang sulit; model menghabiskan token untuk penalaran sebelum menjawab, yang merupakan kompromi yang Anda pilih.
Parameter yang penting
| Parameter | Tipe | Fungsi |
|---|---|---|
max_tokens |
integer | Batas keras pada panjang keluaran. Pengungkit biaya utama Anda. |
temperature |
number | Gunakan 0.2 hingga 0.4 untuk kode dan ekstraksi, 0.7+ untuk penulisan bebas. |
thinking |
object | {"type": "enabled"} mengaktifkan mode penalaran untuk tugas multi-langkah. |
stream |
boolean | Event yang dikirim server alih-alih satu body respons. |
messages |
array | Peran standar OpenAI: system, user, assistant. |
Mengenai biaya: Zhipu belum mempublikasikan harga API khusus 5.3 saat peluncuran, jadi abaikan angka per-token yang Anda lihat di halaman reseller. Halaman harga resmi adalah sumber kebenaran; pada saat penulisan, tercatat GLM-5.2 seharga $1.40 input dan $4.40 output per 1M token, dan GLM-5 seharga $1.00 dan $3.20, yang menjadi patokan perkiraan harga 5.3. Input yang di-cache pada model GLM berbayar mendapatkan diskon 80 hingga 85%, jadi strukturnya prompt sistem yang berulang untuk memanfaatkan cache. Jika penyedia pernah mengejutkan Anda dengan perubahan harga, Anda tahu mengapa disiplin ini penting; analisis pasca-kenaikan harga DeepSeek kami mencakup pola-pola kontrol biaya yang dapat diterapkan secara langsung.
Uji GLM-5.3 di Apidog sebelum Anda menulis kode aplikasi
Iterasi prompt di dalam skrip adalah siklus yang lambat: edit, jalankan ulang, gulir, ulangi, dan setiap siklus membebani token. Karena API Z.ai kompatibel dengan OpenAI, klien API dapat menyerap seluruh fase eksplorasi.
- Buat proyek dan tambahkan permintaan penyelesaian obrolan. Impor spesifikasi apa pun yang kompatibel dengan OpenAI atau definisikan endpoint
POST /chat/completionssecara manual; body-nya adalah bentukmodelplusmessagesyang sudah dikenal. - Buat dua lingkungan:
zai-internationaldanbigmodel-mainland. Atur base URL di masing-masing (https://api.z.ai/api/paas/v4danhttps://open.bigmodel.cn/api/paas/v4) dan kaitkanAuthorization: Bearer {{GLM_API_KEY}}pada tingkat lingkungan. Beralih wilayah menjadi klik dropdown, dan kunci tidak pernah mendarat di permintaan yang disimpan. - Tempatkan ID model di balik variabel yang disetel ke
glm-5.3. Pada minggu peluncuran ini lebih penting dari biasanya: jika ID bergeser saat dokumentasi diselesaikan, atau Anda ingin melakukan A/B testing terhadapglm-5.2, Anda cukup mengubah satu variabel alih-alih mengedit setiap permintaan yang disimpan. - Uji tombol
thinkingsecara berdampingan. Duplikat permintaan, aktifkan penalaran pada satu salinan, dan bandingkan latensi, kualitas output, sertausagepada prompt yang sama. Ini adalah cara tercepat untuk memutuskan beban kerja mana yang layak mendapatkan token penalaran. - Pukul endpoint streaming. Chunk SSE dirender secara langsung, sehingga Anda melihat waktu-ke-token-pertama seperti yang akan dilihat pengguna Anda.
- Simpan respons yang baik sebagai contoh. Eksekusi selanjutnya akan memanggil fixture alih-alih API langsung, yang merupakan penghemat token terbesar selama pengembangan.
Dari sana, gabungkan permintaan yang disimpan ke dalam skenario pengujian dengan asersi pada finish_reason, skema respons, dan jumlah token, dan Anda telah mengubah smoke test menjadi suite regresi. Alur kerja yang sama, digeneralisasi untuk API apa pun, ada dalam panduan pengujian API kami untuk insinyur QA.
Penanganan error dan batas laju
Harapkan error bergaya OpenAI standar: objek error dengan message, type, dan code. Pelaku biasa adalah 401 untuk kunci yang hilang atau dicabut, 400 untuk body yang salah format atau ID model yang tidak dikenal, 429 untuk batas laju, dan 5xx untuk kesalahan server sementara.
- Bungkus setiap panggilan dalam helper retry dengan exponential backoff ber-jitter pada 429 dan 5xx. Peluncuran model baru memusatkan lalu lintas, dan kapasitas hari pertama adalah saat Anda akan bertemu 429.
- Jangan mengarang angka batas laju. Zhipu mempublikasikan detail konkurensi dan tingkatan di dokumentasi resmi; baca nilai langsung di sana daripada mempercayai postingan blog, termasuk yang ini, agar tetap terkini.
- Sematkan ID model di balik konfigurasi. Jika perubahan perilaku 5.3 merusak prompt, kembali ke
glm-5.2seharusnya menjadi perubahan konfigurasi, bukan deployment. Alur kerja debugging yang kami bangun untuk API Grok berlaku tidak berubah di sini, karena keduanya berbicara dialek OpenAI.
FAQ
Apa ID model untuk API GLM-5.3?
Harapkan glm-5.3, mengikuti konvensi keluarga yang memberi kita glm-5.2 dan glm-5.1 di halaman harga Zhipu. Pada saat penulisan, dokumentasi masih mencantumkan glm-5 di halaman model, jadi konfirmasikan di docs.z.ai sebelum menetapkannya, dan simpan ID dalam konfigurasi agar koreksi mudah dilakukan.
Apakah API GLM-5.3 berfungsi dengan OpenAI SDK?
Ya. API ini kompatibel dengan OpenAI, jadi paket openai resmi untuk Python dan Node.js berfungsi setelah Anda menyetel base_url ke https://api.z.ai/api/paas/v4 (atau yang setara bigmodel.cn) dan memberikan kunci Z.ai Anda. Bentuk permintaan dan respons sesuai dengan standar penyelesaian obrolan, termasuk streaming.
Berapa biaya API GLM-5.3?
Zhipu belum mempublikasikan harga khusus 5.3 saat diluncurkan pada 14 Agustus 2026. Halaman harga resmi mencantumkan GLM-5.2 seharga $1.40 per 1M token masukan dan $4.40 per 1M token keluaran, yang merupakan titik referensi terbaik Anda hingga baris 5.3 muncul. Abaikan tebakan harga dari reseller.
Bagaimana perbandingan GLM-5.3 dengan Claude dan GPT?
Evaluasi Zhipu sendiri menempatkan kemampuan pengkodean dan agen "mendekati Claude Fable 5", dengan CyberGym di 84.5% sedikit di atas Claude Mythos 5 dan GPT-5.6 Sol, tetapi ExploitBench di 54.4% masih tertinggal. Perlakukan angka vendor sebagai klaim sampai direproduksi secara independen; untuk perbandingan model-model terdepan satu sama lain, lihat perbandingan Grok 4.6 vs GPT-5.6 vs Claude Fable 5 kami.
Bisakah saya menjalankan GLM-5.3 secara lokal alih-alih menggunakan API?
Belum. Zhipu mengatakan bobot terbuka akan tiba sekitar dua minggu setelah rilis, sekitar 28 Agustus 2026, di organisasi Hugging Face-nya. Desain MoE 744B-parameter berarti penyediaan lokal adalah pekerjaan kelas server, bukan pekerjaan laptop; gunakan API yang di-host sekarang dan bangun baseline yang akan Anda bandingkan dengan deployment self-hosted.
Di mana GLM-5.3 sesuai dalam tumpukan Anda
GLM-5.3 layak dievaluasi selama satu sore jika Anda menjalankan siklus agen atau beban kerja pengkodean, dan antarmuka yang kompatibel dengan OpenAI membuat evaluasi itu murah. Lonjakan Terminal-Bench dan SWE-Marathon dilaporkan oleh vendor, tetapi peningkatan 6.2x cukup besar untuk Anda periksa sendiri, dan tenggat waktu dua minggu untuk bobot terbuka berarti permintaan yang Anda simpan hari ini akan menjadi baseline regresi untuk deployment self-hosted di kemudian hari.
Urutan yang masuk akal: dapatkan kunci, jalankan panggilan cURL, dan pindahkan permintaan ke klien API sebelum menyentuh kode aplikasi. Unduh Apidog untuk menyiapkan dua lingkungan regional, tempatkan ID model di balik variabel, dan bandingkan thinking dalam mode aktif dan nonaktif di seluruh prompt nyata Anda. Setelah respons terlihat benar, port Python atau Node adalah base URL dan variabel lingkungan, karena format wire tidak pernah menjadi bagian yang sulit.
