Dunia model lokal tanpa sensor berubah pada 14 Agustus 2026. Hari itu, Alibaba mendorong bobot terbuka untuk Qwen 3.8-27B ke Hugging Face, dan dalam hitungan jam komunitas telah menghasilkan versi yang diabliterasi dan dikuantisasi hingga ukuran yang dapat ditampung oleh satu RTX 5090 atau MacBook 24GB. Untuk pertama kalinya, model terkuat yang dapat Anda jalankan tanpa penolakan juga hampir setara dengan model terbuka terkuat, titik.
Hal itu membuat sebagian besar daftar "LLM tanpa sensor terbaik" menjadi usang. Peringkat yang masih beredar pada tahun 2026 merekomendasikan Llama 2 finetunes dan Vicuna, model yang tiga generasi di belakang apa yang bisa Anda dapatkan dari Hugging Face hari ini. Daftar ini dimulai dari awal: tujuh model, semuanya terverifikasi dapat diunduh sekarang, dikelompokkan berdasarkan VRAM yang Anda miliki, bukan berdasarkan trivia benchmark.
Satu definisi sebelum peringkat, karena istilah-istilahnya seringkali kabur di mana-mana. LLM tanpa sensor adalah model yang perilaku penolakannya telah dihilangkan atau tidak pernah dilatih. Ia tidak akan menolak sebuah prompt berdasarkan alasan kebijakan. Itu juga berarti ia tidak memiliki batasan sama sekali: Anda adalah lapisan keamanannya, dan hasilnya adalah tanggung jawab Anda. Setiap model di bawah ini adalah alat penelitian dan hosting mandiri, bukan asisten yang di-host.
Bagaimana "tanpa sensor" terjadi: tiga metode berbeda
Mengetahui metode mana yang menghasilkan suatu model akan memberi tahu Anda bagaimana model itu akan berperilaku.
Abliterasi. Para peneliti mengidentifikasi arah aktivasi internal yang bertanggung jawab atas penolakan dan menghilangkannya secara bedah dari bobot. Tidak ada pelatihan ulang yang terlibat. Model mempertahankan kecerdasan dasarnya hampir utuh tetapi berhenti menolak permintaan. Pengembang komunitas seperti huihui-ai dan orcarouter menerbitkan versi abliterasi dari model terbuka utama dalam beberapa hari setelah rilis.
Finetuning tanpa penolakan. Pendekatan Dolphin: melatih ulang model dasar pada dataset yang dikurasi dengan penolakan yang dihilangkan. Ini mengubah kepribadian model lebih dari yang dilakukan abliterasi, dan kualitasnya bergantung pada dataset finetune.
Penyelarasan netral. Nous Research melatih model Hermes untuk mengikuti prompt sistem Anda alih-alih kode etik vendor. Model ini tidak dilobotomisasi; ia dapat diarahkan. Anda mendefinisikan aturan per deployment.
Ketiganya menghasilkan model yang menjawab ketika asisten komersial menolak. Mereka berbeda dalam seberapa banyak kemampuan dasar yang bertahan dan seberapa banyak kontrol yang Anda pertahankan.
Bagaimana daftar ini diperingkat
Tiga kriteria, secara berurutan:
- Kekuatan model dasar. Sebuah versi tanpa sensor mewarisi batas kemampuannya dari basisnya. Basis tahun 2026 mengungguli basis tahun 2024 pada ukuran yang sama.
- Berjalan pada perangkat keras yang dimiliki orang. Setiap entri mencantumkan ukuran kuantisasi dan VRAM minimum atau memori terpadu yang dapat menampungnya. Kategori: 12 hingga 16GB, 16 hingga 24GB, dan kelas workstation.
- Ketersediaan terverifikasi. Setiap model terhubung ke repositori Hugging Face yang aktif atau halaman resmi. Tidak ada tautan mati, tidak ada "segera hadir."
Perbandingan singkat sebelum detailnya:
| # | Model | Metode | Muat di | Terbaik untuk |
|---|---|---|---|---|
| 1 | Qwen 3.8-27B Tanpa Sensor | Abliterasi | 16 hingga 24GB | Terbaik secara keseluruhan: coding, agen, visi |
| 2 | Dolphin 3.0 Mistral 24B | Finetune tanpa penolakan | 16 hingga 24GB | Obrolan umum, panggilan fungsi, varian penalaran R1 |
| 3 | Hermes 4 (14B / 36B / 70B) | Penyelarasan netral | 12GB ke atas | Perilaku yang dapat diarahkan yang Anda definisikan per prompt sistem |
| 4 | Huihui Qwen 3.6-27B abliterasi | Abliterasi | 16 hingga 24GB | Klasik terbukti, ekosistem kuantisasi besar |
| 5 | Gemma 4 26B-A4B tanpa sensor | Abliterasi | 12 hingga 16GB | Kecepatan pada perangkat keras sederhana (MoE, ~4B aktif) |
| 6 | Mistral Small 3.2 abliterasi | Abliterasi | 12 hingga 16GB | Fiksi, roleplay, penulisan kreatif |
| 7 | Huihui GLM-5.1 abliterasi | Abliterasi | 256GB+ | Model abliterasi terbuka terbesar yang ada |
1. Qwen 3.8-27B Tanpa Sensor: yang terbaik secara keseluruhan
Model dasar adalah inti ceritanya di sini. Qwen 3.8-27B adalah saudara dense berbobot terbuka dari Qwen 3.8-Max, yang dirilis pada 14 Agustus 2026 di Hugging Face dan ModelScope. Ia memahami gambar dan video secara natif, menargetkan beban kerja coding dan agen, serta memposting angka benchmark publik yang mendekati model frontier tertutup. Tidak ada yang lain di daftar ini yang memiliki basis sekini ini.
Komunitas bergerak cepat. orcarouter/Qwen3.8-27B-Uncensored-GGUF adalah versi GGUF yang diabliterasi, dengan kuantisasi yang dipetakan ke perangkat keras nyata:
- Q4_K_M, 16.8GB: pilihan untuk GPU 24GB (RTX 3090/4090/5090) atau Mac 32GB
- IQ4_XS, 15.3GB: muat di GPU 16GB
- Q3_K_M, 13.5GB: ketika Anda menginginkan ruang kepala konteks daripada presisi
Versi FP8 tersedia untuk vLLM jika Anda menjalankannya di kartu workstation, dan varian yang lebih agresif (0xKitkat/Qwen3.8-27B-Uncensored-Aggressive) mengorbankan lebih banyak perilaku yang terkait penolakan dengan biaya kemampuan tertentu. Pada desktop RTX 5090, harapkan sekitar 45 token per detik pada Q4; para pemilik telah menjalankannya dalam pengaturan harian dalam waktu satu jam setelah bobot dirilis.
Satu hal yang perlu diperhatikan dalam pengaturan: arsitektur qwen35 dan dukungan MTP mendarat di llama.cpp pada Mei 2026. Perbarui ke versi dari 2026-05 atau yang lebih baru, atau GGUF tidak akan memuat. Aturan yang sama berlaku melalui Ollama dan LM Studio, yang membundel llama.cpp di bawahnya.
Terbaik untuk: siapa pun dengan VRAM 16GB+ yang menginginkan model lokal terkuat, baik yang sensor maupun tidak. Fakta bahwa ia tanpa sensor adalah bonus di atas basis yang dekat dengan frontier.
2. Dolphin 3.0 Mistral 24B: veteran finetune, masih tajam
Seri Dolphin dari Eric Hartford adalah proyek tanpa sensor yang berjalan paling lama, dan Dolphin3.0-Mistral-24B adalah andalannya saat ini. Berbeda dengan entri yang diabliterasi, Dolphin adalah finetune penuh tanpa penolakan: dilatih ulang pada dataset yang dikurasi, disetel untuk mengikuti instruksi, coding, matematika, dan panggilan fungsi.
Dua hal yang membuatnya tetap ada dalam daftar pada tahun 2026. Pertama, varian R1 menambahkan penalaran, dilatih selama tiga epoch pada 800 ribu jejak penalaran dari dataset Dolphin-R1, sehingga Anda mendapatkan perilaku rantai-pemikiran tanpa filter vendor yang memutuskan pikiran mana yang diizinkan. Kedua, ekosistemnya: Dolphin memiliki dukungan Ollama kelas satu, kuantisasi GGUF yang matang di setiap ukuran, dan pola prompt komunitas selama bertahun-tahun.
Pada 24B dense, kuantisasi Q4 berukuran sekitar 14 hingga 15GB, nyaman pada kartu 24GB dan dapat bekerja pada 16GB dengan kuantisasi yang lebih kecil.
Terbaik untuk: obrolan lokal tujuan umum dan pekerjaan agen ketika Anda lebih memilih model yang sengaja dilatih ulang daripada yang diedit secara bedah, dan untuk versi R1 jika Anda menginginkan penalaran tanpa sensor.
3. Hermes 4: tanpa sensor berdasarkan filosofi, bukan bedah
Hermes 4 dari Nous Research berpendapat bahwa penyelarasan adalah milik operator. Model-model dilatih untuk mengikuti prompt sistem Anda daripada kode etik perusahaan. Nous menyebutnya penyelarasan netral, dan Hermes 4 memuncaki RefusalBench di antara model terbuka dan tertutup karena mematuhi niat pengguna tanpa penolakan menyeluruh.
Keluarga ini mencakup 14B, 36B (termasuk versi 4.3-36B yang lebih baru), 70B, dan 405B untuk orang dengan rak server. Semuanya adalah penalaran hibrida: sertakan tag penalaran dan model akan berpikir lebih lama untuk masalah sulit, hilangkan itu dan Anda akan mendapatkan jawaban langsung yang cepat.
Perbedaan praktis dari model abliterasi itu penting. Model abliterasi tidak dapat menolak apa pun, selamanya. Hermes akan mengikuti kebijakan apa pun yang Anda tuliskan ke dalam prompt sistem, termasuk kebijakan dengan batasan yang Anda pilih. Bagi banyak self-hoster, itu adalah properti yang lebih berguna: tanpa sensor secara default, dapat diatur sesuai permintaan.
Terbaik untuk: operator yang ingin mendefinisikan perilaku model sendiri. 14B cocok untuk kartu 12GB pada Q4; 36B membutuhkan 24GB.
4. Huihui Qwen 3.6-27B abliterasi: kuda pekerja yang terbukti
Sebelum Qwen 3.8 dirilis, abliterasi Qwen 3.6 dari huihui-ai adalah rekomendasi default untuk penggunaan lokal tanpa sensor, dan tetap menjadi pilihan aman. Qwen 3.6 (April 2026) terbukti menjadi basis yang sangat bersih untuk abliterasi: arah penolakan hilang dengan kehilangan kemampuan minimal, itulah sebabnya versi 27B muncul di puncak peringkat komunitas sepanjang tahun.
Ekosistemnya adalah daya tariknya. Huihui menerbitkan sebaran kuantisasi penuh di Hugging Face dan juga di Ollama, jadi ollama run membuat Anda memulai dalam satu perintah. Ada varian 14B yang mampu vision untuk kartu yang lebih kecil, dan finetune kepribadian Samantha yang ditumpuk di atas abliterasi jika Anda menginginkan default percakapan yang lebih hangat.
Pilih ini daripada entri #1 jika Anda menghargai versi yang teruji dengan validasi komunitas selama berbulan-bulan daripada basis terbaru, atau jika persyaratan llama.cpp Qwen 3.8 menghalangi toolchain Anda saat ini.
Terbaik untuk: driver harian yang stabil dan tervalidasi secara luas pada VRAM 16 hingga 24GB.
5. Gemma 4 26B-A4B tanpa sensor: kecepatan pada perangkat keras sederhana
Sebagian besar model dalam daftar ini adalah dense, jadi setiap token membayar untuk setiap parameter. Gemma 4 26B-A4B adalah versi mixture-of-experts: total 26B parameter, sekitar 4B aktif per token. Versi abliterasi memberi Anda output tanpa sensor dengan throughput yang tidak dapat dicapai oleh 27B dense pada kartu yang sama.
Itu menjadikannya pemenang kategori untuk pengaturan 12 hingga 16GB. Di mana 27B dense pada Q3 terasa terkompromi pada GPU 16GB, arsitektur A4B menjaga kualitas tetap tinggi sambil menghasilkan berkali-kali lebih cepat. Pada Apple Silicon dengan memori terpadu 16GB, itu adalah perbedaan antara dapat digunakan dan menyakitkan.
Komprominya adalah kedalaman pada tugas penalaran yang sulit, di mana entri dense #1 dan #2 unggul. Untuk ringkasan, penyusunan, ekstraksi, dan obrolan, Anda jarang akan menyadarinya.
Terbaik untuk: perangkat keras kelas laptop, Mac 16GB, dan siapa pun yang menghargai token per detik daripada kedalaman penalaran maksimum.
6. Mistral Small 3.2 abliterasi: pilihan penulis
Tanyakan kepada komunitas roleplay dan fiksi model tanpa sensor mana yang mereka jalankan dan jawabannya pada tahun 2026 secara konsisten adalah abliterasi Mistral Small 3.2. Model dasar Mistral memiliki kualitas prosa yang khas: tidak terlalu suka daftar, lebih baik dalam mempertahankan gaya bahasa di seluruh konteks yang panjang, lebih kecil kemungkinannya untuk mengeluarkan nada seperti asisten yang bocor melalui finetune Qwen dan Llama.
Abliterasi lebih penting untuk penulisan kreatif daripada untuk kode. Model komersial menolak atau menyensor sebagian besar fiksi yang sah: penjahat, kekerasan, narator abu-abu moral. Mistral Small yang diabliterasi akan menulis adegan yang Anda minta dan mempertahankan gaya bahasa yang Anda tetapkan.
Pada kira-kira 24B dense, kuantisasi berukuran seperti Dolphin: Q4 sekitar 14GB, berfungsi baik pada kartu 16GB ke atas.
Terbaik untuk: fiksi, roleplay, dan pekerjaan menulis apa pun di mana penyensoran yang terkait penolakan merusak kualitas output.
7. Huihui GLM-5.1 abliterasi: batas tertinggi
Model abliterasi terbuka terbesar yang tersedia: Huihui-GLM-5.1-abliterated-GGUF, MoE berparameter 754B yang dikirimkan sebagai file 236GB bahkan pada kuantisasi IQ2_M. Ini bukan model konsumen. Ia membutuhkan Mac Studio 256GB+, rig multi-GPU, atau server dengan RAM serius untuk offload CPU.
Ia mendapatkan tempatnya karena menjawab pertanyaan yang tidak bisa dijawab oleh enam lainnya: sejauh mana AI lokal tanpa sensor dapat diskalakan? Jawabannya sekarang adalah "ke model yang bersaing dengan sistem frontier yang di-host," yang tidak benar setahun yang lalu. Jika Anda memiliki perangkat kerasnya, tidak ada yang di-host sendiri dan tidak terbatas yang mendekatinya.
Terbaik untuk: pemilik Mac Studio, penggemar homelab dengan anggaran workstation, dan kelompok penelitian yang membutuhkan kemampuan kelas frontier dengan kebijakan eksternal nol.
Menjalankan salah satu dari ini: sajikan, lalu perlakukan seperti API
Setiap model di atas di-deploy dengan cara yang sama: llama.cpp, Ollama, atau LM Studio untuk versi GGUF, vLLM untuk FP8. Semuanya mengekspos endpoint yang kompatibel dengan OpenAI di localhost, yang berarti model lokal Anda adalah API begitu ia dimuat:
ollama run huihui_ai/qwen3.6-abliterated:27b
# Endpoint yang kompatibel dengan OpenAI sekarang aktif di http://localhost:11434/v1
Endpoint itu layak mendapatkan perlakuan yang sama dengan API apa pun yang Anda kembangkan. Arahkan Apidog ke http://localhost:11434/v1/chat/completions dan Anda dapat menyimpan payload prompt sebagai permintaan yang dapat digunakan kembali, membedakan respons di seluruh kuantisasi model yang sama, menegaskan struktur respons sebelum menghubungkan endpoint ke aplikasi, dan membuat respons tiruan model sehingga tes integrasi Anda berhenti menghabiskan waktu GPU. Alur kerja ini identik dengan yang ada di panduan lokal Kimi K3 kami: tarik bobot, sajikan, lalu debug endpoint seperti layanan produksi. Unduh Apidog dan seluruh loop berjalan offline, yang sesuai dengan alasan Anda menggunakan lokal sejak awal.
Model tanpa sensor membuat pengujian tingkat endpoint lebih penting, bukan kurang. Tanpa lapisan penolakan dalam model, aplikasi Anda membutuhkan pemeriksaan input dan outputnya sendiri, dan itulah yang secara otomatis dilakukan oleh klien API melalui penegasan permintaan dan respons.
FAQ
Apakah legal untuk mengunduh dan menjalankan model-model ini? Mengunduh model bobot terbuka dan turunan abliterasi dari Hugging Face adalah legal di sebagian besar yurisdiksi. Setiap repo memiliki lisensi (Apache 2.0, persyaratan Gemma, atau sejenisnya) yang mengatur penggunaan kembali komersial. Apa yang Anda hasilkan dan bagaimana Anda menggunakannya tetap menjadi tanggung jawab Anda, sama seperti alat apa pun.
Apakah model abliterasi menjadi lebih bodoh? Sedikit, dan bervariasi per versi. Abliterasi menghilangkan arah dalam ruang aktivasi, dan penghilangan yang agresif dapat merusak kemampuan yang berdekatan. Versi yang dibuat dengan baik seperti yang tercantum di sini mengukur kehilangan pada beberapa poin benchmark. Finetune tanpa penolakan seperti Dolphin menghindari "operasi" tetapi mengubah kepribadian model. Analisis benchmark Qwen 3.8 kami mencakup skor dasar yang tidak dimodifikasi, yang merupakan batas kemampuan Anda.
Berapa perangkat keras minimum untuk memulai? GPU 12GB atau Mac Apple Silicon 16GB dapat menjalankan Hermes 4 14B atau versi Gemma 4 A4B dengan kecepatan yang dapat digunakan. Titik manis pada tahun 2026 adalah VRAM 24GB atau memori terpadu 32GB, yang membuka kelas 24B hingga 27B di mana entri #1, #2, dan #4 berada. Anda juga dapat menggunakan Qwen 3.8 secara gratis melalui saluran yang di-host terlebih dahulu untuk mengukur apakah model dasar cocok untuk pekerjaan Anda sebelum mengunduh bobot 17GB.
Mengapa tidak salah satu model dari daftar lama, seperti WizardLM atau Vicuna? Usia model dasar. Finetune 13B era 2023 kalah dari 27B tahun 2026 di setiap sumbu: penalaran, panjang konteks, coding, output multibahasa. Versi tanpa sensor mewarisi batas kemampuan basisnya, jadi peringkat di atas dimulai dari basis saat ini dan menurun hanya jika perangkat keras menuntutnya.
Kesimpulannya
Qwen 3.8-27B Tanpa Sensor adalah jawaban default pada tahun 2026: basis terbaru, dukungan multimodal nyata, dan kuantisasi yang sesuai dengan kartu yang dimiliki orang. Dolphin 3.0 adalah alternatif finetune dengan ekosistem terdalam, dan Hermes 4 adalah pilihan operator yang berpikir, tanpa sensor berdasarkan filosofi dan dapat diatur oleh prompt sistem. Di bawah 16GB, ambil versi Gemma 4 A4B untuk kecepatan atau Mistral Small 3.2 abliterasi untuk prosa. Dan apa pun yang Anda sajikan, ingatlah bahwa ia berjalan sebagai API tanpa pengamanan di localhost: uji dengan Apidog seperti Anda menguji endpoint mana pun yang Anda rencanakan untuk dipercaya.
