Cara GLM-5.3-Flash Bebas Sensor Tidak Lagi Menolak Pekerjaan Legal

GLM-5.3-Flash tanpa sensor menurunkan penolakan berlebih yang jinak dari 2,4% menjadi 0,4%. Apa yang Anda peroleh, apa yang ditunjukkan oleh evaluasi, dan mengapa penolakan berhenti pada 11%.

Medy Evrard

1 September 2026

Cara GLM-5.3-Flash Bebas Sensor Tidak Lagi Menolak Pekerjaan Legal

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

TL;DR: OrcaRouter menerbitkan bobot yang di-"abliterate" untuk GLM-5.3-Flash, sebuah model mixture-of-experts 320B parameter dengan 18B aktif, dalam dua rilis: native block-FP8 pada 29 Agustus 2026, dan build NVFP4 untuk GPU NVIDIA pada 31 Agustus. Konversi GGUF dan MLX juga sudah tersedia. Tingkat penolakan yang dilaporkan vendor turun drastis, misalnya MaliciousInstruct dari 96% menjadi 11%, namun tidak sampai nol. Klaim yang paling menarik sama sekali bukan tentang penghapusan sensor: OrcaRouter mengatakan bahwa sebagian penyelarasan GLM-5.3-Flash tidak dimediasi oleh satu arah penolakan linear, yang akan membuat pelatihan keamanan Z.ai secara struktural lebih dalam daripada model-model yang biasa ditargetkan oleh teknik ini.

Ablitration telah menjadi rutinitas. Seseorang mengambil model dengan bobot terbuka, mengidentifikasi arah internal yang terkait dengan penolakan, menghapusnya, dan mengunggah hasilnya. Sebagian besar rilis ini biasa-biasa saja, dan sebagian besar liputannya bernada terengah-engah atau mencela.

Yang satu ini patut dibaca dengan cermat, dengan alasan yang tidak ada hubungannya dengan apa yang akan dikatakan model tersebut. Catatan rilisnya berisi hasil negatif tentang bagaimana penyelarasan direpresentasikan di dalam model bobot terbuka perintis, dan hasil negatif dalam interpretasi lebih jarang dan lebih berguna daripada checkpoint tanpa sensor lainnya.

Apa yang Sebenarnya Dirilis

Dua pengumuman, berselang dua hari, ditambah peluncuran format yang lebih tenang sejak itu.

OrcaRouter merilis bobot tanpa sensor untuk GLM-5.3-Flash pada presisi block-FP8 asli, yang berarti tidak ada langkah requantisasi antara model dasar dan model yang dimodifikasi. 320B parameter dengan 18B aktif, sesuai dengan arsitektur model dasar, yang telah kami bahas dalam apa itu GLM-5.3-Flash dan bagaimana perbandingannya dengan GLM-5.3. Postingan tersebut sejak itu telah melampaui 2 juta tampilan.

31 Agustus 2026: NVFP4. Build kedua yang menargetkan format floating point 4-bit NVIDIA, ditawarkan dengan jejak yang lebih kecil dan inferensi yang lebih cepat. Sekitar 75.000 tampilan, yang menunjukkan bahwa penurunan format ini menarik bagi audiens yang jauh lebih kecil daripada aslinya.

Sejak itu: GGUF dan MLX. Kedua pengumuman tersebut menyatakan format kuantisasi lainnya akan segera hadir. Memeriksa organisasi Hugging Face pada 1 September 2026, GLM-5.3-Flash-Uncensored-GGUF dan GLM-5.3-Flash-Uncensored-MLX keduanya sudah ada, sehingga jalur llama.cpp dan Apple Silicon telah tiba. Unduhan pada keduanya masih nol saat kami melihatnya, dan build NVFP4 berada di angka 5, berbanding 1.541 untuk FP8 asli. Perhatian masih tertuju pada pengumuman, belum pada artefak.

Perlu dicatat sebagai konteks: ini adalah lini produk, bukan satu kali. Organisasi yang sama menghosting build Qwen3.8-27B yang sudah di-"abliterate", yang telah menarik lebih dari 300.000 unduhan hanya untuk build FP8-nya, Qwen3.8-Flash-Next, dan Gemma-4-26B. Rilis GLM adalah entri terbaru dalam katalog yang sudah ada.

Bobotnya memiliki lisensi MIT dan mencantumkan zai-org/GLM-5.3-Flash sebagai model dasar. Kartu modelnya menandainya sebagai telah di-"abliterate", vision-language, MoE, dan mampu melakukan panggilan fungsi, sehingga kemampuan multimodal dan penggunaan alat dari model dasar ikut serta.

Apa Arti “tanpa LoRA, tanpa jailbreak prompt”

Frase dalam pengumuman ini memiliki makna penting, dan perlu diuraikan karena membedakannya dari dua hal yang kebanyakan orang bayangkan.

Prompt jailbreak memanipulasi model pada waktu inferensi. Pelatihan keamanan tetap utuh; Anda berbicara di sekitarnya. Ini rapuh, sering ditambal, dan membebani Anda dengan konteks pada setiap permintaan.

Adaptor LoRA adalah sekumpulan kecil bobot tambahan yang dilapiskan pada waktu muat. Model dasar tidak berubah dan adaptor dapat dilepas. Ini adalah modifikasi yang Anda lampirkan.

Ablitration mengidentifikasi arah aktivasi internal yang sesuai dengan perilaku penolakan dan menghapusnya dari bobot itu sendiri. Tidak ada yang perlu dilampirkan dan tidak ada yang perlu dilepaskan. Perilaku penolakan hilang dari artefak, tidak ditekan saat runtime.

Perbedaan itu penting secara praktis. Anda tidak dapat mengaudit model yang telah di-"abliterate" dengan memeriksa adaptor atau memindai prompt, karena perubahannya ada pada bobotnya. Jika Anda menjalankan model terbuka di lingkungan mana pun yang mementingkan asal-usul, memeriksa silsilah model dasar terhadap checkpoint aktual kini menjadi pertanyaan rantai pasok yang nyata. Pandangan umum kami tentang membatasi apa yang boleh dilakukan model ada di AI agent guardrails.

Angka Penolakan

Ini adalah angka yang dilaporkan sendiri oleh OrcaRouter, sebelum dan sesudah, dan tidak ada replikasi independen yang ada pada saat penulisan. Perlakukan ini sebagai laporan vendor.

Benchmark Penolakan Dasar Setelah Ablitration
MaliciousInstruct 96% 11%
JailbreakBench 93% 12%
AdvBench 97% 15%
HarmBench 93% 18%
XSTest kelebihan penolakan benign 2.4% 0.4%

Baca baris terakhir berbeda dari empat baris pertama. XSTest mengukur kelebihan penolakan (over-refusal), artinya model menolak permintaan tidak berbahaya yang secara dangkal cocok dengan pola yang berisiko. Ini adalah mode kegagalan yang sebenarnya dihadapi pengembang dalam produksi: sebuah model menolak membantu men-debug alur login karena kata “kata sandi” muncul, atau menolak menulis pemindai jaringan untuk infrastruktur Anda sendiri. Turun dari 2,4% menjadi 0,4% adalah baris dengan nilai sehari-hari yang sah, dan itu adalah yang hampir tidak pernah dikutip orang.

Empat baris pertama adalah yang membuat ini menjadi artefak penelitian daripada alat produktivitas, dan itulah mengapa lisensi dan hukum setempat Anda lebih penting dari biasanya di sini.

Apa yang Sebenarnya Anda Dapatkan

Sebagian besar liputan tentang model yang di-"abliterate" memperdebatkan apakah model tersebut harus ada dan tidak pernah sampai pada alasan mengapa seorang insinyur akan menggunakannya. Ada empat keuntungan nyata, dan itu bukan yang disarankan oleh angka-angka utama.

Sekarang batasan jujur dari semua itu. Tidak satu pun dari keuntungan ini adalah peningkatan kapabilitas. Ablitration adalah pengeditan perilaku, pekerjaan yang diterbitkan tentang teknik ini umumnya menemukan beberapa biaya kualitas, dan tidak ada pengumuman yang melaporkan apakah kinerja penalaran, pengkodean, atau visi berubah. Anda menukar pengurangan penolakan yang terukur dengan risiko degradasi yang tidak terukur. Dan setiap keputusan penyaringan yang dibuat model dasar sekarang menjadi keputusan Anda, yang merupakan biaya staf dan pemantauan nyata daripada penghematan.

Bagian yang Sebenarnya Menarik

Terkubur di akhir pengumuman adalah temuan yang layak dibaca.

Penolakan tidak secara seragam menjadi nol. Di empat tolok ukur bahaya, angka tersebut berada antara 11% dan 18%, bukan 0% hingga 2%. Interpretasi yang dinyatakan OrcaRouter adalah bahwa sebagian penyelarasan GLM-5.3-Flash tidak dimediasi oleh satu arah penolakan linear, dan bahwa Z.ai mungkin telah membangun mekanisme penolakan yang jauh lebih dalam daripada yang biasa ditemui oleh teknik ini.

Itu adalah klaim tentang internal model, dan jika itu terbukti, itu lebih signifikan daripada rilis itu sendiri.

Model mental standar untuk ablitration adalah bahwa penolakan sebagian besar adalah satu arah dalam ruang aktivasi. Temukan, hapus, dan perilakunya runtuh. Ini telah bekerja cukup baik di banyak model sehingga orang menganggapnya sebagai sesuatu yang sudah mapan. Model di mana prosedur tersebut membawa Anda dari 96% menjadi 11% tetapi terhenti di sana adalah bukti bahwa model mentalnya tidak lengkap, setidaknya untuk model ini, dan bahwa beberapa penyelarasan bertahan dalam bentuk yang tidak dapat dicapai oleh teknik tersebut.

Dua peringatan jujur. Pertama, ini adalah interpretasi satu lab terhadap hasilnya sendiri, dan penjelasan alternatifnya hanyalah bahwa implementasi mereka menyisakan kinerja yang belum optimal. Kedua, tingkat penolakan sisa 11% hingga 18% bukanlah properti keamanan yang harus diandalkan siapa pun. Model yang menolak 15% permintaan berbahaya bukanlah model yang aman; itu adalah model yang tidak dapat diandalkan.

Namun, "teknik kami mencapai batas dan kami pikir alasannya adalah arsitektural" adalah jenis hal yang biasanya dihilangkan oleh laboratorium dari postingan peluncuran. OrcaRouter membingkai rilis ini sebagai artefak untuk mempelajari bagaimana penyelarasan direpresentasikan, daripada murni sebagai peningkatan kapabilitas, adalah versi yang lebih baik tentang bagaimana pekerjaan ini dipublikasikan.

Klaim yang Layak Diperiksa

Dua hal dalam utas sekitarnya patut disikapi dengan skeptisisme, dan menandainya bukanlah kritik terhadap rilis ini.

Menjalankannya, dan Realitas Perangkat Keras

320B parameter bukanlah model laptop, bahkan dengan 18B aktif. Format yang tersedia saat ini membentuk siapa yang secara realistis dapat menjalankannya:

Jika Anda melakukan hosting sendiri daripada memanggil endpoint yang dihosting, panduan kami untuk model dasar berlaku secara langsung: menjalankan GLM-5.3-Flash secara lokal dan self-hosting bobot terbuka GLM-5.3. Untuk konteks yang lebih luas tentang kategori ini, kami menjaga survei LLM tanpa sensor dan melihat LLM tanpa batasan, dan rilis DeepSeek R1 yang di-"abliterate" adalah perbandingan sebelumnya yang paling dekat.

Mengevaluasi Ini Adalah Masalah Pengujian API

Berikut adalah bagian praktisnya, dan itu adalah bagian yang sebagian besar liputan lewati sepenuhnya.

Jika Anda melakukan pekerjaan yang sah dengan model seperti ini, artinya penelitian keamanan, latihan tim merah dan biru, atau evaluasi defensif tentang apa yang ditangkap oleh filter Anda sendiri, maka pekerjaan sebenarnya adalah menjalankan serangkaian permintaan yang besar dan dapat diulang terhadap sebuah endpoint dan menegaskan apa yang kembali. Itulah pengujian API. Ini bukanlah disiplin ilmu baru hanya karena badan responsnya berisi output model.

Inilah tepatnya fungsi platform API. Di Apidog Anda mendefinisikan endpoint sekali, menyimpan suite prompt sebagai koleksi tersimpan, menegaskan pada bidang respons, menukar URL dasar antara penyedia atau kuantisasi melalui variabel lingkungan, dan menjalankan semuanya di CI sehingga angka-angka dapat direproduksi daripada bersifat anekdot. Kami membahas mekanismenya terhadap model yang tidak dimodifikasi dalam menguji API GLM-5.3-Flash dengan Apidog, dan pengaturan yang sama mengarah ke endpoint yang kompatibel dengan OpenAI mana pun.

Prinsip umum ini berlaku jauh melampaui model ini: begitu perilaku model menjadi sesuatu yang harus Anda ukur dan pertahankan, Anda memerlukan disiplin yang sama seperti yang akan Anda terapkan pada kontrak API lainnya. Unduh Apidog jika evaluasi Anda saat ini berada dalam notebook yang tidak dapat dijalankan ulang oleh orang lain. Terkait: keandalan agen AI produksi.

Pekerjaan Tim Merah Membutuhkan Jejak Audit, Bukan Terminal

Masalah praktis kedua adalah organisasi, dan untuk kategori pekerjaan ini, itu tidak opsional.

Menjalankan benchmark prompt berbahaya terhadap model yang telah di-"abliterate" adalah jenis aktivitas yang harus disetujui sebelum terjadi dan dapat diatribusikan setelahnya. Siapa yang menjalankannya. Terhadap checkpoint mana. Dengan persetujuan siapa. Di bawah lingkup apa. Jika catatan itu hanya ada dalam riwayat shell satu peneliti, Anda tidak memiliki program penelitian, Anda memiliki liabilitas.

Model tanpa sensor adalah alat penelitian. Alat penelitian yang digunakan tanpa catatan adalah bagaimana organisasi akhirnya tidak dapat menjelaskan apa yang terjadi.

Realitas Hukum dan Keamanan

Singkat dan layak untuk dinyatakan dengan jelas.

Lisensi MIT pada bobot mengatur bobot. Ini tidak memberi Anda izin untuk melakukan hal-hal ilegal dengan output, dan ini tidak mengalihkan liabilitas dari Anda. Hukum setempat, kebijakan perusahaan Anda, dan setiap ketentuan platform yang Anda operasikan semuanya tetap berlaku, dan tidak satu pun dari mereka peduli bahwa model tersebut tidak menolak.

Penggunaan yang wajar adalah yang disebutkan dalam rilis: penelitian keamanan, pekerjaan interpretasi, latihan tim merah dan biru, dan studi mekanisme penolakan. Peningkatan kelebihan penolakan XSTest juga merupakan argumen sehari-hari yang sah, untuk tim yang masalah sebenarnya adalah model yang tidak akan membantu dalam rekayasa keamanan biasa.

Jika Anda men-deploy model apa pun ke pengguna akhir, checkpoint tanpa sensor mengalihkan seluruh beban penyaringan ke stack Anda sendiri. Itu adalah keputusan desain dengan implikasi staffing dan pemantauan, bukan bendera konfigurasi.

FAQ

Penutup

Dua rilis format dalam tiga hari, 2 juta tampilan pada yang pertama, dan katalog model yang telah di-"abliterate" di baliknya. Penghapusan sensor itu sendiri sudah menjadi rutinitas pada titik ini.

Bagian yang layak disimpan adalah hasil negatifnya. Sebuah teknik yang secara andal meruntuhkan penolakan di sebagian besar model terbuka membuat GLM-5.3-Flash dari 96% turun menjadi 11% dan berhenti, dan laboratorium yang melakukannya mengatakannya secara terbuka daripada membulatkannya ke atas. Jika itu bertahan di bawah replikasi independen, itu mengatakan sesuatu yang nyata tentang bagaimana Z.ai melatih model ini, dan itu adalah kontribusi yang lebih baik daripada checkpointnya.

Jika Anda akan mengerjakannya, lakukan bagian yang membosankan dengan benar. Ukur perilaku dengan suite permintaan yang dapat diulang yang dapat Anda arahkan ke endpoint mana pun dan dijalankan kembali bulan depan, itulah gunanya Apidog. Simpan catatan siapa yang menjalankan apa terhadap bobot mana dan siapa yang menyetujuinya, itulah gunanya Sharkly.

button

Model tanpa sensor tidak menghilangkan kewajiban untuk mengetahui apa yang Anda jalankan. Justru meningkatkannya.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.