2026'da Yerelde Çalıştırabileceğiniz En İyi 7 Sansürsüz Büyük Dil Modeli

2026'da yerel olarak çalıştırabileceğiniz, VRAM'e göre sıralanmış en iyi 7 sansürsüz BDD: Qwen 3.8-27B Sansürsüz, Dolphin 3.0, Hermes 4, Gemma 4 A4B ve daha fazlası, nicelik boyutları ve kurulum notlarıyla birlikte.

Ashley Innocent

Ashley Innocent

19 August 2026

2026'da Yerelde Çalıştırabileceğiniz En İyi 7 Sansürsüz Büyük Dil Modeli

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Yerel sansürsüz model sahnesi 14 Ağustos 2026'da değişti. O gün, Alibaba Qwen 3.8-27B için açık ağırlıkları Hugging Face'e yükledi ve saatler içinde topluluk, tek bir RTX 5090 veya 24GB MacBook'un taşıyabileceği boyutlara kadar nicelenmiş (quantized) abliterasyonlu sürümler oluşturdu. İlk kez, ret yanıtları almadan çalıştırabileceğiniz en güçlü model, aynı zamanda en güçlü açık modele de en yakın olanıydı, nokta.

Bu durum, çoğu "en iyi sansürsüz LLM" listesini demode hale getiriyor. 2026'da hala dolaşımda olan sıralamalar, bugün Hugging Face'den alabileceğiniz modellerden üç nesil geride olan Llama 2 ince ayarlarını (finetune) ve Vicuna'yı öneriyor. Bu liste sıfırdan başlıyor: yedi modelin tamamı şu anda indirilebilir olduğu doğrulanmış ve kıyaslama önemsizliği yerine sahip olduğunuz VRAM'e göre kategorize edilmiştir.

Sıralamaya geçmeden önce bir tanım, çünkü terimler her yerde bulanıklaşıyor. Sansürsüz bir LLM, ret davranışı kaldırılmış veya hiç eğitilmemiş bir modeldir. İlke gerekçesiyle bir istemi reddetmeyecektir. Bu aynı zamanda hiçbir koruyucu bariyer taşımadığı anlamına gelir: güvenlik katmanı sizsiniz ve çıktılar sizin sorumluluğunuzdadır. Aşağıdaki her model, barındırılan bir asistan değil, bir araştırma ve kendi kendine barındırma aracıdır.

“Sansürsüz” nasıl oluşur: üç farklı yöntem

Bir modeli hangi yöntemin ürettiğini bilmek, o modelin nasıl davranacağını size söyler.

Abliterasyon. Araştırmacılar, ret yanıtlarından sorumlu dahili aktivasyon yönünü belirler ve bunu ağırlıklardan cerrahi olarak çıkarır. Yeniden eğitim söz konusu değildir. Model, temel zekasını neredeyse sağlam tutar ancak istekleri reddetmeyi bırakır. huihui-ai ve orcarouter gibi topluluk geliştiricileri, büyük açık modellerin abliterasyonlu versiyonlarını yayınlandıktan birkaç gün içinde yayımlar.

Ret içermeyen ince ayar (finetuning). Dolphin yaklaşımı: ret yanıtları çıkarılmış küratörlü bir veri kümesi üzerinde temel modeli yeniden eğitmek. Bu, modelin kişiliğini abliterasyondan daha fazla değiştirir ve kalite, ince ayar veri kümesine bağlıdır.

Nötr hizalama. Nous Research, Hermes modellerini bir satıcı etik kodu yerine sistem isteminizi takip edecek şekilde eğitir. Model lobotomize edilmez; yönlendirilebilir özelliktedir. Kuralları dağıtım başına siz belirlersiniz.

Her üçü de ticari asistanların reddettiği durumlarda yanıt veren bir model üretir. Temel yeteneğin ne kadarının kaldığı ve ne kadar kontrolü elinizde tuttuğunuz konusunda farklılık gösterirler.

Bu liste nasıl sıralandı

Sırasıyla üç kriter:

  1. Temel model gücü. Sansürsüz bir sürüm, temelinin tavanını miras alır. 2026 tabanı, aynı boyuttaki 2024 tabanını yener.
  2. Kişilerin sahip olduğu donanımda çalışır. Her girişte nicel boyut (quant size) ve onu barındırabilecek minimum VRAM veya birleşik bellek listelenir. Kategoriler: 12 ila 16GB, 16 ila 24GB ve iş istasyonu sınıfı.
  3. Doğrulanmış erişilebilirlik. Her model canlı bir Hugging Face deposuna veya resmi sayfasına bağlanır. Ölü bağlantı yok, "çok yakında" yok.

Detaylara geçmeden önce hızlı karşılaştırma:

# Model Yöntem Sığdığı yer En iyi kullanım alanı
1 Qwen 3.8-27B Sansürsüz Abliterasyon 16 ila 24GB Genel olarak en iyisi: kodlama, ajanlar, görsel
2 Dolphin 3.0 Mistral 24B Ret içermeyen ince ayar 16 ila 24GB Genel sohbet, fonksiyon çağırma, R1 muhakeme varyantı
3 Hermes 4 (14B / 36B / 70B) Nötr hizalama 12GB ve üzeri Sistem istemi başına tanımladığınız yönlendirilebilir davranış
4 Huihui Qwen 3.6-27B abliterasyonlu Abliterasyon 16 ila 24GB Kanıtlanmış klasik, devasa quant ekosistemi
5 Gemma 4 26B-A4B sansürsüz Abliterasyon 12 ila 16GB Mütevazı donanımda hız (MoE, ~4B aktif)
6 Mistral Small 3.2 abliterasyonlu Abliterasyon 12 ila 16GB Kurgu, rol yapma, yaratıcı yazım
7 Huihui GLM-5.1 abliterasyonlu Abliterasyon 256GB+ Mevcut en büyük açık abliterasyonlu model

1. Qwen 3.8-27B Sansürsüz: yeni genel olarak en iyisi

Buradaki asıl hikaye temel modeldir. Qwen 3.8-27B, 14 Ağustos 2026'da Hugging Face ve ModelScope'da yayınlanan Qwen 3.8-Max'in açık ağırlıklı yoğun kardeşidir. Görüntüleri ve videoları doğal olarak anlar, kodlama ve ajan iş yüklerini hedefler ve kapalı sınır modellerini zorlayan halka açık kıyaslama sayıları yayınlar. Bu listedeki başka hiçbir model bu kadar güncel bir tabana sahip değildir.

Topluluk hızla hareket etti. orcarouter/Qwen3.8-27B-Uncensored-GGUF, nicel değerleri (quants) gerçek donanıma eşlenmiş abliterasyonlu GGUF sürümüdür:

Bir iş istasyonu kartında hizmet veriyorsanız vLLM için bir FP8 sürümü mevcuttur ve daha agresif bir varyant (0xKitkat/Qwen3.8-27B-Uncensored-Aggressive), bazı yetenek maliyetleri karşılığında ret yanıtına yakın davranışları ortadan kaldırır. Bir masaüstü RTX 5090'da, Q4'te saniyede yaklaşık 45 jeton bekleyin; ağırlıkların yüklenmesinden bir saat sonra sahipleri onu günlük kurulumlarda çalışır duruma getirmişti.

Kurulumda dikkat edilmesi gereken bir nokta: qwen35 mimarisi ve MTP desteği llama.cpp'ye Mayıs 2026'da eklendi. 2026-05 veya daha yeni bir sürüme güncelleyin, aksi takdirde GGUF yüklenmeyecektir. Aynı kural, altında llama.cpp'yi barındıran Ollama ve LM Studio için de geçerlidir.

En iyi kullanım alanı: 16GB+ VRAM'e sahip, sansürlü veya sansürsüz en güçlü yerel modeli isteyen herkes. Sansürsüz olması, sınır yakınındaki bir temelin üzerine eklenmiş bir bonustur.

2. Dolphin 3.0 Mistral 24B: ince ayar gazisi, hala keskin

Eric Hartford'un Dolphin serisi, en uzun soluklu sansürsüz projedir ve Dolphin3.0-Mistral-24B şu anki amiral gemisidir. Abliterasyonlu modellerin aksine, Dolphin tam bir ret içermeyen ince ayar modelidir: küratörlü bir veri kümesi üzerinde yeniden eğitilmiş, talimat takibi, kodlama, matematik ve fonksiyon çağırma için ayarlanmıştır.

2026'da bu listede kalmasını sağlayan iki şey var. Birincisi, R1 varyantı muhakeme yeteneği ekler; Dolphin-R1 veri kümesinden 800 bin muhakeme izi üzerinde üç dönem boyunca eğitildiğinden, hangi düşüncelere izin verildiğine karar veren bir satıcı filtresi olmadan düşünce zinciri davranışı elde edersiniz. İkincisi, ekosistem: Dolphin birinci sınıf Ollama desteğine, her boyutta olgun GGUF niceleyicilerine ve yılların topluluk istemi modellerine sahiptir.

24B yoğunlukta, Q4 niceleyicileri yaklaşık 14 ila 15GB yer kaplar, 24GB'lık bir kartta rahatça çalışır ve daha küçük bir niceleyici ile 16GB'da iş görebilir.

En iyi kullanım alanı: kasıtlı olarak yeniden eğitilmiş bir modeli cerrahi olarak düzenlenmiş bir modele tercih ettiğinizde genel amaçlı yerel sohbet ve ajan çalışması için, ve sansürsüz muhakeme istiyorsanız R1 sürümü için.

3. Hermes 4: cerrahi ile değil, felsefe ile sansürsüz

Nous Research'ten Hermes 4, hizalamanın operatöre ait olduğu pozisyonunu alır. Modeller, bir şirket etik kodu yerine sistem isteminizi takip edecek şekilde eğitilir. Nous buna nötr hizalama der ve Hermes 4, genel ret yanıtları olmaksızın kullanıcı amacına uyma konusunda açık ve kapalı modeller arasında RefusalBench'te zirvede yer alır.

Aile 14B, 36B (daha yeni 4.3-36B sürümü dahil), 70B ve sunucu raflarına sahip kişiler için 405B boyutlarını kapsar. Hepsi hibrit muhakemecidir: muhakeme etiketini eklerseniz model zor sorunlar üzerinde daha uzun düşünür, çıkarırsanız hızlı doğrudan yanıtlar alırsınız.

Abliterasyonlu modellerden pratik fark önemlidir. Abliterasyonlu bir model hiçbir şeyi reddedemez, asla. Hermes, seçtiğiniz sınırlamaları içeren bir politika da dahil olmak üzere, sistem istemine yazdığınız her politikayı takip edecektir. Kendi kendine barındırma yapan birçok kişi için bu daha kullanışlı bir özelliktir: varsayılan olarak sansürsüzdür, isteğe bağlı olarak yönetilebilir.

En iyi kullanım alanı: model davranışını kendileri tanımlamak isteyen operatörler. 14B, Q4'te 12GB'lık bir karta sığar; 36B ise 24GB ister.

4. Huihui Qwen 3.6-27B abliterasyonlu: kanıtlanmış iş atı

Qwen 3.8 gelmeden önce, huihui-ai'nin Qwen 3.6 abliterasyonları yerel sansürsüz kullanım için varsayılan öneriydi ve hala güvenli seçenek olarak kalıyorlar. Qwen 3.6 (Nisan 2026), abliterasyon için alışılmadık derecede temiz bir temel olduğunu kanıtladı: ret yönü minimum yetenek kaybıyla kaldırılır, bu yüzden 27B sürümü tüm yıl boyunca topluluk sıralamalarının zirvesinde yer alıyor.

Ekosistem çekicidir. Huihui, tüm nicel dağılımı (quant spread) Hugging Face'te yayınlar ve Ollama'ya yansıtır, böylece ollama run tek bir komutla başlamanızı sağlar. Daha küçük kartlar için 14B görsel yetenekli bir varyant ve daha sıcak bir konuşma varsayılı istiyorsanız abliterasyon üzerine yerleştirilmiş bir Samantha kişilik ince ayarı mevcuttur.

En yeni taban yerine aylarca topluluk tarafından doğrulanmış, savaşta kanıtlanmış bir yapıyı değerli buluyorsanız veya Qwen 3.8 llama.cpp gereksinimi mevcut araç zincirinizi engelliyorsa, #1 numaralı giriş yerine bunu seçin.

En iyi kullanım alanı: 16 ila 24GB VRAM'e sahip istikrarlı, geniş çapta doğrulanmış günlük sürücü için.

5. Gemma 4 26B-A4B sansürsüz: mütevazı donanımda hız

Bu listedeki çoğu model yoğundur, bu nedenle her jeton her parametre için ödeme yapar. Gemma 4 26B-A4B, uzmanlar karışımı (mixture-of-experts) bir yapıdır: toplam 26B parametre, jeton başına yaklaşık 4B aktif. Abliterasyonlu sürüm, aynı kartta yoğun bir 27B'nin ulaşamayacağı bir verimlilikle sansürsüz çıktı verir.

Bu onu 12 ila 16GB kurulumları için kategori birincisi yapar. Q3'teki yoğun bir 27B, 16GB bir GPU'da yetersiz hissettirirken, A4B mimarisi kaliteyi korurken çok daha hızlı üretim yapar. 16GB birleşik belleğe sahip Apple Silicon'da, bu kullanılabilir ve acı verici arasındaki farktır.

Dezavantajı, #1 ve #2 yoğun modellerinin öne geçtiği zor muhakeme görevlerindeki derinliktir. Özetleme, taslak oluşturma, veri çıkarma ve sohbet için nadiren fark edersiniz.

En iyi kullanım alanı: dizüstü bilgisayar sınıfı donanım, 16GB Mac'ler ve maksimum muhakeme derinliği yerine saniyedeki jeton sayısına değer veren herkes.

6. Mistral Small 3.2 abliterasyonlu: yazarın tercihi

Rol yapma ve kurgu topluluklarına hangi sansürsüz modeli kullandıklarını sorun, 2026'daki yanıt sürekli olarak Mistral Small 3.2 abliterasyonu olacaktır. Mistral'in temel modelleri belirgin bir düzyazı kalitesine sahiptir: daha az liste düşkünü, uzun bağlam boyunca bir sesi daha iyi korur, Qwen ve Llama ince ayarlarından sızan asistan-beyinli tona daha az yatkındır.

Abliterasyon, kod için olduğundan çok yaratıcı yazım için daha önemlidir. Ticari modeller, meşru kurgunun büyük bir kısmını reddeder veya sansürler: kötü karakterler, şiddet, ahlaki olarak gri anlatıcılar. Abliterasyonlu bir Mistral Small, istediğiniz sahneyi yazar ve belirlediğiniz tonu korur.

Yaklaşık 24B yoğunlukta, niceleyiciler Dolphin'inkiler gibi yerleşir: Q4 yaklaşık 14GB, 16GB kartlarda ve üzeri memnuniyetle çalışır.

En iyi kullanım alanı: kurgu, rol yapma ve ret yanıtına yakın sansürlemenin çıktı kalitesini bozduğu her türlü yazma işi için.

7. Huihui GLM-5.1 abliterasyonlu: tavan

Mevcut en büyük açık abliterasyonlu model: IQ2_M nicellemesinde bile 236GB dosya olarak gönderilen 754B parametreli bir MoE olan Huihui-GLM-5.1-abliterated-GGUF. Bu bir tüketici modeli değildir. 256GB+ Mac Studio, çoklu GPU sistemi veya CPU offload için ciddi RAM'e sahip bir sunucu ister.

Yerini hak ediyor çünkü diğer altı modelin cevaplayamadığı bir soruyu yanıtlıyor: sansürsüz yerel yapay zeka ne kadar ölçeklenebilir? Cevap artık "barındırılan sınır sistemleriyle rekabet eden bir modele kadar" şeklindedir, bu bir yıl önce doğru değildi. Eğer donanıma sahipseniz, kendi kendine barındırılan ve kısıtlanmamış hiçbir şey buna yaklaşamaz.

En iyi kullanım alanı: Mac Studio sahipleri, iş istasyonu bütçesi olan ev laboratuvarı meraklıları ve sıfır dış politika ile sınır sınıfı yeteneklere ihtiyaç duyan araştırma grupları.

Bunlardan herhangi birini çalıştırmak: sunucuda barındırın, sonra bir API gibi davranın

Yukarıdaki her model aynı şekilde dağıtılır: GGUF sürümleri için llama.cpp, Ollama veya LM Studio, FP8 için vLLM. Hepsi localhost üzerinde OpenAI uyumlu bir uç nokta (endpoint) sunar, bu da yerel modelinizin yüklendiği anda bir API olduğu anlamına gelir:

ollama run huihui_ai/qwen3.6-abliterated:27b
# OpenAI-uyumlu uç nokta şimdi http://localhost:11434/v1 adresinde canlı

Bu uç nokta, karşı oluşturduğunuz herhangi bir API ile aynı muameleyi hak eder. Apidog'u http://localhost:11434/v1/chat/completions adresine yönlendirin ve istem yüklerini yeniden kullanılabilir istekler olarak kaydedebilir, aynı modelin nicel değerleri (quants) arasındaki yanıtları karşılaştırabilir, uç noktayı bir uygulamaya bağlamadan önce yanıt yapısı üzerinde iddialar (assert) oluşturabilir ve entegrasyon testlerinizin GPU süresi harcamasını durdurmak için modelin yanıtlarını taklit edebilirsiniz. İş akışı, Kimi K3 yerel rehberimizdeki ile aynıdır: ağırlıkları çekin, sunucuda barındırın, ardından uç noktayı bir üretim hizmeti gibi hata ayıklayın. Apidog'u indirin ve tüm döngü çevrimdışı çalışır, bu da ilk etapta yerel olmanızın nedenine uyar.

Sansürsüz modeller, uç nokta düzeyinde test yapmayı daha da önemli hale getirir, daha az değil. Modelde ret katmanı olmadığı için uygulamanızın kendi girdi ve çıktı kontrollerine ihtiyacı vardır ve bunlar da bir API istemcisinin otomatikleştirdiği istek ve yanıt iddialarıdır.

SSS

Bu modelleri indirip çalıştırmak yasal mı? Hugging Face'den açık ağırlıklı modelleri ve abliterasyonlu türevleri indirmek çoğu yargı bölgesinde yasaldır. Her depo, ticari yeniden kullanımı düzenleyen bir lisans (Apache 2.0, Gemma koşulları veya benzeri) taşır. Ürettiğiniz ve onu nasıl kullandığınız, herhangi bir araçta olduğu gibi, sizin sorumluluğunuzdadır.

Abliterasyonlu modeller aptallaşır mı? Biraz, ve bu yapıya göre değişir. Abliterasyon, aktivasyon alanında bir yönü kaldırır ve agresif kaldırma bitişik yetenekleri zedeleyebilir. Burada listelenen iyi yapılmış sürümler, kaybı birkaç kıyaslama puanında ölçer. Dolphin gibi ret içermeyen ince ayarlar ameliyatı atlatır ancak bunun yerine model kişiliğini değiştirir. Qwen 3.8 kıyaslama analizimiz, değiştirilmemiş temel modelin puanlarını kapsar ki bu her durumda sizin tavanınızdır.

Başlamak için minimum donanım nedir? 12GB bir GPU veya 16GB Apple Silicon Mac, Hermes 4 14B veya Gemma 4 A4B sürümünü kullanılabilir hızlarda çalıştırır. 2026'daki ideal nokta 24GB VRAM veya 32GB birleşik bellektir, bu da #1, #2 ve #4 numaralı modellerin bulunduğu 24B ila 27B sınıfını açar. Ayrıca, 17GB ağırlığı indirmeden önce temel modelin işinize uygun olup olmadığını ölçmek için Qwen 3.8'i barındırılan kanallar aracılığıyla ücretsiz kullanabilirsiniz.

Neden WizardLM veya Vicuna gibi eski listelerdeki modellerden biri değil? Temel modelin yaşı. 2023 dönemine ait 13B'lik bir ince ayar modeli, her eksende (muhakeme, bağlam uzunluğu, kodlama, çok dilli çıktı) 2026'nın 27B'sine yenilir. Sansürsüz sürümler, temel modellerinin tavanını miras alır, bu nedenle yukarıdaki sıralama mevcut temellerden başlar ve yalnızca donanım gerektirdiğinde aşağı doğru ilerler.

Özet

Qwen 3.8-27B Sansürsüz, 2026'da varsayılan yanıttır: en yeni temel, gerçek çok modlu destek ve kişilerin sahip olduğu kartlara uyan niceleyiciler. Dolphin 3.0, en derin ekosisteme sahip ince ayar alternatifidir ve Hermes 4, felsefe ile sansürsüz ve sistem istemiyle yönetilebilir düşünen operatörün tercihidir. 16GB'ın altında, hız için Gemma 4 A4B sürümünü veya düzyazı için Mistral Small 3.2 abliterasyonlusunu tercih edin. Ve hangisini sunarsanız sunun, localhost üzerinde korumasız bir API olarak başladığını unutmayın: güvenmeyi planladığınız herhangi bir uç nokta gibi Apidog ile test edin.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin