Die lokale, unzensierte Modelllandschaft änderte sich am 14. August 2026. An diesem Tag veröffentlichte Alibaba die offenen Gewichte für Qwen 3.8-27B auf Hugging Face, und innerhalb weniger Stunden hatte die Community abliterierte Builds quantisiert, die auf eine einzelne RTX 5090 oder ein 24-GB-MacBook passen. Zum ersten Mal ist das stärkste Modell, das man ohne Ablehnungen ausführen kann, auch fast das stärkste offene Modell überhaupt.
Das macht die meisten Listen der „besten unzensierten LLMs“ obsolet. Ranglisten, die 2026 immer noch kursieren, empfehlen Llama 2 Finetunes und Vicuna, Modelle, die drei Generationen hinter dem liegen, was man heute von Hugging Face herunterladen kann. Diese Liste beginnt von Grund auf neu: sieben Modelle, alle jetzt nachweislich herunterladbar, nach dem verfügbaren VRAM statt nach Benchmark-Trivia kategorisiert.
Eine Definition vor der Rangliste, da die Begriffe überall verschwommen sind. Ein unzensiertes LLM ist ein Modell, dessen Ablehnungsverhalten entfernt oder nie antrainiert wurde. Es wird eine Anfrage nicht aus politischen Gründen ablehnen. Das bedeutet auch, dass es keinerlei Schutzschranken gibt: Sie sind die Sicherheitsebene, und die Ausgaben liegen in Ihrer Verantwortung. Jedes der unten aufgeführten Modelle ist ein Forschungs- und Self-Hosting-Tool, kein gehosteter Assistent.
Wie „unzensiert“ entsteht: drei verschiedene Methoden
Zu wissen, welche Methode ein Modell hervorgebracht hat, sagt Ihnen, wie es sich verhalten wird.
Abliterierung. Forscher identifizieren die interne Aktivierungsrichtung, die für Ablehnungen verantwortlich ist, und entfernen sie chirurgisch aus den Gewichten. Kein erneutes Training erforderlich. Das Modell behält seine grundlegende Intelligenz weitgehend intakt, lehnt aber keine Anfragen mehr ab. Community-Entwickler wie huihui-ai und orcarouter veröffentlichen abliterierte Versionen großer offener Modelle innerhalb weniger Tage nach deren Veröffentlichung.
Ablehnungsfreies Finetuning. Der Dolphin-Ansatz: das Basismmodell auf einem kuratierten Datensatz neu trainieren, bei dem Ablehnungen entfernt wurden. Dies verändert die Persönlichkeit des Modells stärker als die Abliterierung, und die Qualität hängt vom Finetune-Datensatz ab.
Neutrale Ausrichtung. Nous Research trainiert Hermes-Modelle darauf, Ihrem System-Prompt zu folgen, anstatt einem Ethikkodex eines Anbieters. Das Modell ist nicht lobotomiert; es ist steuerbar. Sie definieren die Regeln pro Bereitstellung.
Alle drei erzeugen ein Modell, das antwortet, wo kommerzielle Assistenten ablehnen. Sie unterscheiden sich darin, wie viel Grundfunktionalität erhalten bleibt und wie viel Kontrolle Sie behalten.
Wie diese Liste bewertet wird
Drei Kriterien, der Reihe nach:
- Stärke des Basismmodells. Ein unzensierter Build erbt die Obergrenze seiner Basis. Eine 2026er Basis übertrifft eine 2024er Basis bei gleicher Größe.
- Läuft auf Hardware, die Leute besitzen. Jeder Eintrag listet die Quantisierungsgröße und den minimalen VRAM oder den vereinheitlichten Speicher auf, der ihn aufnehmen kann. Kategorien: 12 bis 16 GB, 16 bis 24 GB und Workstation-Klasse.
- Verfügbarkeit geprüft. Jedes Modell verlinkt zu einem aktiven Hugging Face Repo oder einer offiziellen Seite. Keine toten Links, kein „demnächst erhältlich“.
Schneller Vergleich vor den Details:
| # | Modell | Methode | Passt in | Am besten für |
|---|---|---|---|---|
| 1 | Qwen 3.8-27B Unzensiert | Abliterierung | 16 bis 24GB | Insgesamt am besten: Kodierung, Agenten, Vision |
| 2 | Dolphin 3.0 Mistral 24B | Ablehnungsfreies Finetuning | 16 bis 24GB | Allgemeiner Chat, Funktionsaufrufe, R1 Argumentationsvariante |
| 3 | Hermes 4 (14B / 36B / 70B) | Neutrale Ausrichtung | 12GB und mehr | Steuerbares Verhalten, das Sie pro System-Prompt definieren |
| 4 | Huihui Qwen 3.6-27B abliteriert | Abliterierung | 16 bis 24GB | Bewährter Klassiker, riesiges Quant-Ökosystem |
| 5 | Gemma 4 26B-A4B unzensiert | Abliterierung | 12 bis 16GB | Geschwindigkeit auf bescheidener Hardware (MoE, ~4 Mrd. aktiv) |
| 6 | Mistral Small 3.2 abliteriert | Abliterierung | 12 bis 16GB | Fiktion, Rollenspiele, kreatives Schreiben |
| 7 | Huihui GLM-5.1 abliteriert | Abliterierung | 256GB+ | Das größte offene abliterierte Modell |
1. Qwen 3.8-27B Unzensiert: der neue Spitzenreiter
Das Basismmodell ist hier die eigentliche Geschichte. Qwen 3.8-27B ist der dichte Open-Weight-Ableger von Qwen 3.8-Max, veröffentlicht am 14. August 2026 auf Hugging Face und ModelScope. Es versteht Bilder und Videos nativ, ist auf Kodierungs- und Agenten-Workloads ausgelegt und erzielt öffentliche Benchmark-Ergebnisse, die den geschlossenen Frontier-Modellen nahekommen. Nichts anderes auf dieser Liste hat eine derart aktuelle Basis.
Die Community war schnell. orcarouter/Qwen3.8-27B-Uncensored-GGUF ist der abliterierte GGUF-Build, dessen Quants auf echte Hardware abgebildet sind:
- Q4_K_M, 16.8GB: die Wahl für eine 24-GB-GPU (RTX 3090/4090/5090) oder einen 32-GB-Mac
- IQ4_XS, 15.3GB: passt knapp auf eine 16-GB-GPU
- Q3_K_M, 13.5GB: wenn Sie Kontext-Spielraum über Präzision bevorzugen
Ein FP8-Build existiert für vLLM, wenn Sie auf einer Workstation-Karte hosten, und eine aggressivere Variante (0xKitkat/Qwen3.8-27B-Uncensored-Aggressive) tauscht mehr ablehnungsähnliches Verhalten gegen einen gewissen Leistungsverlust ein. Auf einer Desktop-RTX 5090 können Sie mit etwa 45 Token pro Sekunde bei Q4 rechnen; Besitzer hatten es innerhalb einer Stunde nach Veröffentlichung der Gewichte in täglichen Setups am Laufen.
Ein Einrichtungs-Stolperstein: Die qwen35-Architektur und MTP-Unterstützung wurden im Mai 2026 in llama.cpp integriert. Aktualisieren Sie auf einen Build von 2026-05 oder neuer, sonst wird der GGUF nicht geladen. Dieselbe Regel gilt für Ollama und LM Studio, die llama.cpp unter der Haube bündeln.
Am besten für: jeden mit 16GB+ VRAM, der das stärkste lokale Modell wünscht, zensiert oder nicht. Die Tatsache, dass es unzensiert ist, ist ein Bonus zusätzlich zu einer Frontier-nahen Basis.
2. Dolphin 3.0 Mistral 24B: der Finetune-Veteran, immer noch scharf
Eric Hartfords Dolphin-Serie ist das am längsten laufende unzensierte Projekt, und Dolphin3.0-Mistral-24B ist ihr aktuelles Flaggschiff. Im Gegensatz zu den abliterierten Einträgen ist Dolphin ein vollständiges ablehnungsfreies Finetune: neu trainiert auf einem kuratierten Datensatz, abgestimmt auf Anweisungsbefolgung, Kodierung, Mathematik und Funktionsaufrufe.
Zwei Dinge halten es 2026 auf der Liste. Erstens fügt die R1-Variante Argumentation hinzu, trainiert über drei Epochen mit 800.000 Argumentationsspuren aus dem Dolphin-R1-Datensatz, sodass Sie Ketten-von-Gedanken-Verhalten erhalten, ohne dass ein Anbieterfilter entscheidet, welche Gedanken erlaubt sind. Zweitens das Ökosystem: Dolphin verfügt über erstklassige Ollama-Unterstützung, ausgereifte GGUF-Quants in jeder Größe und jahrelange Community-Prompt-Muster.
Bei 24B Dichte liegen Q4-Quants bei etwa 14 bis 15 GB, bequem auf einer 24-GB-Karte und brauchbar auf 16 GB mit einem kleineren Quant.
Am besten für: allgemeine lokale Chats und Agentenarbeit, wenn Sie ein bewusst neu trainiertes Modell einem chirurgisch bearbeiteten vorziehen, und für den R1-Build, wenn Sie unzensierte Argumentation wünschen.
3. Hermes 4: unzensiert durch Philosophie, nicht durch Chirurgie
Hermes 4 von Nous Research vertritt die Position, dass die Ausrichtung dem Betreiber obliegt. Die Modelle werden trainiert, Ihrem System-Prompt zu folgen, anstatt einem Ethikkodex eines Unternehmens. Nous nennt dies neutrale Ausrichtung, und Hermes 4 führt RefusalBench unter offenen und geschlossenen Modellen an, weil es die Benutzerabsicht ohne pauschale Ablehnungen erfüllt.
Die Familie umfasst 14B, 36B (einschließlich des neueren 4.3-36B-Builds), 70B und einen 405B für Leute mit Server-Racks. Alle sind hybride Argumentationsmodelle: Fügen Sie das `reasoning`-Tag hinzu, und das Modell denkt länger über schwierige Probleme nach; lassen Sie es weg, und Sie erhalten schnelle, direkte Antworten.
Der praktische Unterschied zu abliterierten Modellen ist wichtig. Ein abliteriertes Modell kann niemals etwas ablehnen. Hermes folgt jeder Richtlinie, die Sie in den System-Prompt schreiben, einschließlich einer mit von Ihnen gewählten Einschränkungen. Für viele Self-Hosters ist dies die nützlichere Eigenschaft: standardmäßig unzensiert, bei Bedarf steuerbar.
Am besten für: Betreiber, die das Modellverhalten selbst definieren möchten. Der 14B passt mit Q4 auf eine 12-GB-Karte; der 36B benötigt 24GB.
4. Huihui Qwen 3.6-27B abliteriert: das bewährte Arbeitspferd
Bevor Qwen 3.8 auf den Markt kam, waren huihui-ais Qwen 3.6 Abliterierungen die Standardempfehlung für die lokale unzensierte Nutzung, und sie bleiben die sichere Wahl. Qwen 3.6 (April 2026) erwies sich als ungewöhnlich saubere Basis für die Abliterierung: Die Ablehnungsrichtung lässt sich mit minimalem Fähigkeitsverlust entfernen, weshalb der 27B-Build das ganze Jahr über an der Spitze der Community-Rankings stand.
Das Ökosystem ist der Reiz. Huihui veröffentlicht die gesamte Quantisierungsbreite auf Hugging Face und spiegelt sie auf Ollama, sodass Sie mit ollama run mit einem Befehl starten können. Es gibt eine 14B-Variante mit Sehfunktion für kleinere Karten und ein Samantha-Persönlichkeits-Finetune, das auf der Abliterierung aufbaut, wenn Sie einen wärmeren Gesprächsstandard wünschen.
Wählen Sie dies gegenüber Eintrag Nr. 1, wenn Sie einen kampferprobten Build mit monatelanger Community-Validierung gegenüber der neuesten Basis schätzen, oder wenn die Qwen 3.8 llama.cpp-Anforderung Ihre aktuelle Toolchain blockiert.
Am besten für: einen stabilen, weit verbreiteten Daily Driver mit 16 bis 24GB VRAM.
5. Gemma 4 26B-A4B unzensiert: Geschwindigkeit auf bescheidener Hardware
Die meisten Modelle auf dieser Liste sind dicht, sodass jedes Token für jeden Parameter bezahlt. Gemma 4 26B-A4B ist ein Mixture-of-Experts-Build: insgesamt 26 Mrd. Parameter, davon etwa 4 Mrd. aktiv pro Token. Die abliterierte Version liefert Ihnen unzensierte Ausgaben mit einem Durchsatz, den ein dichtes 27B-Modell auf derselben Karte nicht erreichen kann.
Das macht es zum Gewinner in der Kategorie für 12- bis 16-GB-Setups. Wo ein dichtes 27B bei Q3 auf einer 16-GB-GPU Kompromisse eingeht, hält die A4B-Architektur die Qualität hoch und generiert um ein Vielfaches schneller. Auf Apple Silicon mit 16 GB vereinheitlichtem Speicher ist dies der Unterschied zwischen brauchbar und schmerzhaft.
Der Kompromiss ist die Tiefe bei schwierigen Denkaufgaben, wo dichte Einträge Nr. 1 und Nr. 2 die Nase vorn haben. Für Zusammenfassungen, Entwürfe, Extraktionen und Chats werden Sie es selten bemerken.
Am besten für: Laptop-Hardware, 16-GB-Macs und alle, die Token pro Sekunde über maximale Denktiefe stellen.
6. Mistral Small 3.2 abliteriert: die Wahl des Autors
Fragen Sie die Rollenspiel- und Fiktions-Communities, welches unzensierte Modell sie verwenden, und die Antwort im Jahr 2026 ist durchweg die Mistral Small 3.2 Abliterierung. Mistrals Basismmodelle haben eine ausgeprägte Prosa-Qualität: weniger listenlastig, besser darin, eine Stimme über lange Kontexte hinweg beizubehalten, weniger anfällig für den assistentenhaften Ton, der durch Qwen- und Llama-Finetunes sickert.
Abliterierung ist für kreatives Schreiben wichtiger als für Code. Kommerzielle Modelle lehnen einen großen Teil legitimer Fiktion ab oder zensieren sie: Schurken, Gewalt, moralisch ambivalente Erzähler. Ein abliteriertes Mistral Small schreibt die von Ihnen gewünschte Szene und behält das von Ihnen festgelegte Register bei.
Bei ungefähr 24B dicht landen Quants wie bei Dolphin: Q4 um 14GB, problemlos auf 16GB-Karten und höher.
Am besten für: Fiktion, Rollenspiele und jede Schreibarbeit, bei der ablehnungsähnliche Zensur die Ausgabequalität beeinträchtigt.
7. Huihui GLM-5.1 abliteriert: die Obergrenze
Das größte verfügbare offene abliterierte Modell: Huihui-GLM-5.1-abliterated-GGUF, ein MoE mit 754 Mrd. Parametern, das selbst bei IQ2_M-Quantisierung als 236-GB-Datei ausgeliefert wird. Dies ist kein Verbrauchermodell. Es benötigt ein Mac Studio mit 256GB+, ein Multi-GPU-Rig oder einen Server mit viel RAM für CPU-Offload.
Es verdient seinen Platz, weil es eine Frage beantwortet, die die anderen sechs nicht beantworten können: Wie weit skaliert unzensierte lokale KI? Die Antwort lautet jetzt „bis zu einem Modell, das mit gehosteten Frontier-Systemen konkurriert“, was vor einem Jahr noch nicht der Fall war. Wenn Sie die Hardware haben, kommt nichts Selbstgehostetes und uneingeschränktes dem nahe.
Am besten für: Mac Studio-Besitzer, Homelab-Enthusiasten mit Workstation-Budgets und Forschungsgruppen, die Frontier-Klasse-Fähigkeiten ohne externe Richtlinien benötigen.
Jedes davon ausführen: als Dienst bereitstellen und dann wie eine API behandeln
Jedes der oben genannten Modelle wird auf die gleiche Weise bereitgestellt: llama.cpp, Ollama oder LM Studio für GGUF-Builds, vLLM für FP8. Alle stellen einen OpenAI-kompatiblen Endpunkt auf localhost bereit, was bedeutet, dass Ihr lokales Modell in dem Moment, in dem es geladen wird, eine API ist:
ollama run huihui_ai/qwen3.6-abliterated:27b
# OpenAI-compatible endpoint now live at http://localhost:11434/v1
Dieser Endpunkt verdient die gleiche Behandlung wie jede API, gegen die Sie entwickeln. Richten Sie Apidog auf http://localhost:11434/v1/chat/completions, und Sie können Prompt-Payloads als wiederverwendbare Anfragen speichern, Antworten über verschiedene Quants desselben Modells hinweg vergleichen, die Antwortstruktur überprüfen, bevor Sie den Endpunkt in eine App integrieren, und die Antworten des Modells mocken, damit Ihre Integrationstests keine GPU-Zeit mehr verbrauchen. Der Workflow ist identisch mit dem in unserem lokalen Kimi K3-Leitfaden: Gewichte herunterladen, bereitstellen, dann den Endpunkt wie einen Produktionsdienst debuggen. Laden Sie Apidog herunter, und die gesamte Schleife läuft offline ab, was genau dem Grund entspricht, warum Sie überhaupt lokal gearbeitet haben.
Unzensierte Modelle machen Endpunkt-Tests wichtiger, nicht weniger. Ohne Ablehnungsschicht im Modell benötigt Ihre Anwendung eigene Eingabe- und Ausgabeprüfungen, und genau diese Anforderungs- und Antwortprüfungen automatisiert ein API-Client.
FAQ
Ist es legal, diese Modelle herunterzuladen und auszuführen? Das Herunterladen von Open-Weight-Modellen und abliterierten Derivaten von Hugging Face ist in den meisten Jurisdiktionen legal. Jedes Repository enthält eine Lizenz (Apache 2.0, Gemma-Bedingungen oder ähnliches), die die kommerzielle Wiederverwendung regelt. Was Sie generieren und wie Sie es verwenden, bleibt Ihre Verantwortung, genau wie bei jedem anderen Werkzeug.
Werden abliterierte Modelle dümmer? Geringfügig, und es variiert je nach Build. Abliterierung entfernt eine Richtung im Aktivierungsraum, und aggressive Entfernung kann benachbarte Fähigkeiten beeinträchtigen. Gut gemachte Builds, wie die hier gelisteten, beziffern den Verlust auf wenige Benchmark-Punkte. Ablehnungsfreie Finetunes wie Dolphin umgehen den chirurgischen Eingriff, ändern aber stattdessen die Modellpersönlichkeit. Unsere Qwen 3.8 Benchmarks-Aufschlüsselung zeigt, was die unmodifizierte Basis erreicht, was in jedem Fall Ihre Obergrenze ist.
Was ist die Mindest-Hardware, um zu starten? Eine 12-GB-GPU oder ein 16-GB-Apple-Silicon-Mac führt Hermes 4 14B oder den Gemma 4 A4B-Build mit brauchbaren Geschwindigkeiten aus. Der Sweet Spot im Jahr 2026 sind 24GB VRAM oder 32GB vereinheitlichter Speicher, was die 24B- bis 27B-Klasse freischaltet, in der sich die Einträge Nr. 1, Nr. 2 und Nr. 4 befinden. Sie können auch Qwen 3.8 kostenlos nutzen über gehostete Kanäle, um zunächst zu prüfen, ob das Basismmodell zu Ihrer Arbeit passt, bevor Sie 17GB Gewichte herunterladen.
Warum nicht eines der Modelle aus älteren Listen, wie WizardLM oder Vicuna? Alter des Basismmodells. Ein 13B-Finetune aus dem Jahr 2023 verliert gegenüber einem 27B-Modell von 2026 in jeder Hinsicht: Argumentation, Kontextlänge, Kodierung, mehrsprachige Ausgabe. Unzensierte Builds erben die Obergrenze ihrer Basis, daher beginnt die obige Rangliste mit aktuellen Basen und arbeitet sich nur dort nach unten, wo die Hardware es erfordert.
Fazit
Qwen 3.8-27B Unzensiert ist 2026 die Standardantwort: die neueste Basis, echte multimodale Unterstützung und Quants, die auf die Karten der Nutzer passen. Dolphin 3.0 ist die Finetune-Alternative mit dem umfangreichsten Ökosystem, und Hermes 4 ist die Wahl des denkenden Betreibers, unzensiert durch Philosophie und steuerbar durch System-Prompts. Unter 16GB wählen Sie den Gemma 4 A4B-Build für Geschwindigkeit oder Mistral Small 3.2 abliteriert für Prosa. Und egal, welches Sie bereitstellen, denken Sie daran, dass es als ungeschützte API auf localhost startet: Testen Sie es mit Apidog, wie Sie es mit jedem Endpunkt tun würden, dem Sie vertrauen möchten.
