Le paysage des modèles locaux non censurés a changé le 14 août 2026. Ce jour-là, Alibaba a publié les poids ouverts de Qwen 3.8-27B sur Hugging Face, et en quelques heures, la communauté avait créé des versions ablatées et quantifiées à des tailles qu'une seule RTX 5090 ou un MacBook de 24 Go peut contenir. Pour la première fois, le modèle le plus puissant que l'on puisse exécuter sans refus est aussi proche du modèle ouvert le plus puissant, point final.
Cela rend la plupart des listes des « meilleurs LLM non censurés » obsolètes. Les classements circulant encore en 2026 recommandent les finetunes de Llama 2 et Vicuna, des modèles trois générations derrière ce que vous pouvez télécharger de Hugging Face aujourd'hui. Cette liste repart de zéro : sept modèles, tous vérifiés comme étant téléchargeables dès maintenant, regroupés en fonction de la VRAM que vous possédez plutôt que par des anecdotes de benchmark.
Une définition avant le classement, car les termes sont flous partout. Un LLM non censuré est un modèle dont le comportement de refus a été supprimé ou n'a jamais été entraîné. Il ne refusera pas une requête pour des raisons politiques. Cela signifie également qu'il n'a aucune barrière de sécurité : vous êtes la couche de sécurité, et les sorties sont votre responsabilité. Chaque modèle ci-dessous est un outil de recherche et d'auto-hébergement, pas un assistant hébergé.
Comment la « non-censure » se produit : trois méthodes différentes
Savoir quelle méthode a produit un modèle vous indique comment il se comportera.
Ablation. Les chercheurs identifient la direction d'activation interne responsable des refus et la suppriment chirurgicalement des poids. Aucun réentraînement n'est impliqué. Le modèle conserve son intelligence de base presque intacte mais cesse de refuser les requêtes. Des contributeurs de la communauté comme huihui-ai et orcarouter publient des versions ablatées des principaux modèles ouverts quelques jours après leur sortie.
Finetuning sans refus. L'approche Dolphin : réentraîner le modèle de base sur un jeu de données sélectionné dont les refus ont été retirés. Cela modifie la personnalité du modèle plus que l'ablation, et la qualité dépend du jeu de données de finetuning.
Alignement neutre. Nous Research entraîne les modèles Hermes à suivre votre prompt système au lieu d'un code d'éthique de fournisseur. Le modèle n'est pas lobotomisé ; il est orientable. Vous définissez les règles par déploiement.
Les trois produisent un modèle qui répond là où les assistants commerciaux refusent. Ils diffèrent par la quantité de capacité de base qui survit et par la quantité de contrôle que vous conservez.
Comment cette liste est classée
Trois critères, par ordre :
- Force du modèle de base. Une version non censurée hérite du plafond de sa base. Une base de 2026 bat une base de 2024 à taille égale.
- Fonctionne sur le matériel que les gens possèdent. Chaque entrée indique la taille de quantification et la VRAM ou mémoire unifiée minimale qui la contient. Catégories : 12 à 16 Go, 16 à 24 Go et classe station de travail.
- Disponibilité vérifiée. Chaque modèle renvoie à un dépôt Hugging Face actif ou à une page officielle. Pas de liens morts, pas de « bientôt disponible ».
Comparaison rapide avant les détails :
| # | Modèle | Méthode | Compatible avec | Idéal pour |
|---|---|---|---|---|
| 1 | Qwen 3.8-27B Non censuré | Ablation | 16 à 24 Go | Meilleur général : codage, agents, vision |
| 2 | Dolphin 3.0 Mistral 24B | Finetuning sans refus | 16 à 24 Go | Chat général, appel de fonctions, variante R1 de raisonnement |
| 3 | Hermes 4 (14B / 36B / 70B) | Alignement neutre | 12 Go et plus | Comportement orientable que vous définissez par prompt système |
| 4 | Huihui Qwen 3.6-27B ablaté | Ablation | 16 à 24 Go | Classique éprouvé, vaste écosystème de quantifications |
| 5 | Gemma 4 26B-A4B non censuré | Ablation | 12 à 16 Go | Vitesse sur du matériel modeste (MoE, ~4B actifs) |
| 6 | Mistral Small 3.2 ablaté | Ablation | 12 à 16 Go | Fiction, jeu de rôle, écriture créative |
| 7 | Huihui GLM-5.1 ablaté | Ablation | 256 Go+ | Le plus grand modèle ouvert ablaté existant |
1. Qwen 3.8-27B Non censuré : le nouveau meilleur choix global
Le modèle de base est l'élément clé ici. Qwen 3.8-27B est le frère dense à poids ouverts de Qwen 3.8-Max, sorti le 14 août 2026 sur Hugging Face et ModelScope. Il comprend nativement les images et la vidéo, cible les charges de travail de codage et d'agents, et affiche des chiffres de benchmark publics qui rivalisent avec les modèles de pointe fermés. Aucun autre modèle de cette liste n'a une base aussi récente.
La communauté a agi rapidement. orcarouter/Qwen3.8-27B-Uncensored-GGUF est la version GGUF ablatée, avec des quantifications mappées au matériel réel :
- Q4_K_M, 16,8 Go : le choix pour un GPU de 24 Go (RTX 3090/4090/5090) ou un Mac de 32 Go
- IQ4_XS, 15,3 Go : tient de justesse sur un GPU de 16 Go
- Q3_K_M, 13,5 Go : lorsque vous privilégiez l'espace de contexte à la précision
Une version FP8 existe pour vLLM si vous servez sur une carte de station de travail, et une variante plus agressive (0xKitkat/Qwen3.8-27B-Uncensored-Aggressive) supprime davantage de comportements proches du refus au prix d'une certaine capacité. Sur un RTX 5090 de bureau, attendez-vous à environ 45 jetons par seconde en Q4 ; les propriétaires l'avaient en fonctionnement dans leurs configurations quotidiennes moins d'une heure après la publication des poids.
Un piège de configuration : l'architecture qwen35 et le support MTP ont été intégrés à llama.cpp en mai 2026. Mettez à jour vers une version de 2026-05 ou plus récente, sinon le GGUF ne se chargera pas. La même règle s'applique via Ollama et LM Studio, qui intègrent llama.cpp en dessous.
Idéal pour : toute personne disposant de 16 Go de VRAM ou plus qui souhaite le modèle local le plus puissant, censuré ou non. Le fait qu'il soit non censuré est un bonus en plus d'une base proche des frontières de la technologie.
2. Dolphin 3.0 Mistral 24B : le vétéran du finetuning, toujours performant
La série Dolphin d'Eric Hartford est le projet non censuré le plus ancien, et Dolphin3.0-Mistral-24B est son fleuron actuel. Contrairement aux versions ablatées, Dolphin est un finetuning complet sans refus : réentraîné sur un jeu de données sélectionné, optimisé pour suivre les instructions, le codage, les mathématiques et l'appel de fonctions.
Deux choses le maintiennent sur la liste en 2026. Premièrement, la variante R1 ajoute du raisonnement, entraînée pendant trois époques sur 800 000 traces de raisonnement du jeu de données Dolphin-R1, vous obtenez ainsi un comportement de chaîne de pensée sans qu'un filtre de fournisseur ne décide quelles pensées sont autorisées. Deuxièmement, l'écosystème : Dolphin bénéficie d'un support Ollama de premier ordre, de quantifications GGUF matures de toutes tailles, et d'années de modèles de prompts communautaires.
À 24B dense, les quantifications Q4 se situent autour de 14 à 15 Go, confortables sur une carte de 24 Go et utilisables sur 16 Go avec une quantification plus petite.
Idéal pour : le chat local polyvalent et le travail d'agent lorsque vous préférez un modèle délibérément réentraîné à un modèle chirurgicalement édité, et pour la version R1 si vous voulez un raisonnement non censuré.
3. Hermes 4 : non censuré par philosophie, pas par chirurgie
Hermes 4 de Nous Research adopte la position selon laquelle l'alignement appartient à l'opérateur. Les modèles sont entraînés à suivre votre prompt système plutôt qu'un code d'éthique d'entreprise. Nous appelle cela un alignement neutre, et Hermes 4 est en tête de RefusalBench parmi les modèles ouverts et fermés pour sa conformité à l'intention de l'utilisateur sans refus catégoriques.
La famille comprend des modèles 14B, 36B (y compris la nouvelle version 4.3-36B), 70B et un 405B pour les personnes disposant de baies de serveurs. Tous sont des raisonneurs hybrides : incluez le tag 'reasoning' et le modèle réfléchit plus longtemps aux problèmes difficiles, omettez-le et vous obtenez des réponses directes rapides.
La différence pratique avec les modèles ablatés est importante. Un modèle ablaté ne peut jamais rien refuser. Hermes suivra toute politique que vous écrirez dans le prompt système, y compris une avec les limites que vous choisissez. Pour beaucoup d'auto-hébergeurs, c'est la propriété la plus utile : non censuré par défaut, gouvernable à la demande.
Idéal pour : les opérateurs qui veulent définir eux-mêmes le comportement du modèle. Le 14B tient sur une carte de 12 Go en Q4 ; le 36B nécessite 24 Go.
4. Huihui Qwen 3.6-27B ablaté : le cheval de bataille éprouvé
Avant l'arrivée de Qwen 3.8, les ablations de Qwen 3.6 par huihui-ai étaient la recommandation par défaut pour une utilisation locale non censurée, et elles restent le choix sûr. Qwen 3.6 (avril 2026) s'est avéré une base exceptionnellement propre pour l'ablation : la direction de refus se supprime avec une perte de capacité minimale, c'est pourquoi la version 27B apparaît en tête des classements communautaires toute l'année.
L'écosystème est l'attrait. Huihui publie la gamme complète des quantifications sur Hugging Face et la met en miroir sur Ollama, de sorte que ollama run vous permet de démarrer en une seule commande. Il existe une variante 14B compatible vision pour les cartes plus petites, et un finetuning de personnalité Samantha superposé à l'ablation si vous voulez un défaut conversationnel plus chaleureux.
Choisissez celui-ci plutôt que l'entrée n°1 si vous préférez une version éprouvée et validée par la communauté depuis des mois à la base la plus récente, ou si l'exigence llama.cpp de Qwen 3.8 bloque votre chaîne d'outils actuelle.
Idéal pour : un pilote quotidien stable et largement validé sur 16 à 24 Go de VRAM.
5. Gemma 4 26B-A4B non censuré : vitesse sur du matériel modeste
La plupart des modèles de cette liste sont denses, donc chaque jeton sollicite chaque paramètre. Gemma 4 26B-A4B est une architecture de type 'mixture-of-experts' (MoE) : 26B de paramètres totaux, environ 4B actifs par jeton. La version ablatée vous donne une sortie non censurée avec un débit qu'un modèle dense de 27B ne peut pas atteindre sur la même carte.
Cela en fait le vainqueur de sa catégorie pour les configurations de 12 à 16 Go. Là où un 27B dense en Q3 semble compromis sur un GPU de 16 Go, l'architecture A4B maintient la qualité tout en générant des sorties plusieurs fois plus rapidement.
Sur Apple Silicon avec 16 Go de mémoire unifiée, c'est la différence entre utilisable et pénible.
Le compromis est la profondeur sur les tâches de raisonnement difficiles, où les entrées denses n°1 et n°2 prennent l'avantage. Pour la synthèse, la rédaction, l'extraction et le chat, vous remarquerez rarement la différence.
Idéal pour : le matériel de classe portable, les Mac de 16 Go et quiconque privilégie les jetons par seconde à la profondeur maximale de raisonnement.
6. Mistral Small 3.2 ablaté : le choix de l'écrivain
Demandez aux communautés de jeu de rôle et de fiction quel modèle non censuré elles utilisent, et la réponse en 2026 est invariablement l'ablation de Mistral Small 3.2. Les modèles de base de Mistral ont une qualité de prose distincte : moins enclins aux listes, meilleurs pour maintenir une voix sur de longs contextes, moins sujets au ton « d'assistant » qui transparaît dans les finetunes de Qwen et Llama.
L'ablation est plus importante pour l'écriture créative que pour le code. Les modèles commerciaux refusent ou aseptisent une grande partie de la fiction légitime : les méchants, la violence, les narrateurs moralement ambigus. Un Mistral Small ablaté écrit la scène que vous avez demandée et conserve le registre que vous avez défini.
À environ 24B dense, les quantifications se situent comme celles de Dolphin : Q4 autour de 14 Go, satisfaisant sur les cartes de 16 Go et plus.
Idéal pour : la fiction, le jeu de rôle et tout travail d'écriture où la censure ou l'aseptisation liée aux refus altère la qualité de la sortie.
7. Huihui GLM-5.1 ablaté : le plafond
Le plus grand modèle ouvert ablaté disponible : Huihui-GLM-5.1-abliterated-GGUF, un MoE de 754 milliards de paramètres qui pèse 236 Go même avec une quantification IQ2_M. Ce n'est pas un modèle grand public. Il nécessite un Mac Studio de 256 Go et plus, une configuration multi-GPU, ou un serveur avec une RAM importante pour le déchargement CPU.
Il gagne sa place car il répond à une question que les six autres ne peuvent pas : jusqu'où l'IA locale non censurée peut-elle évoluer ? La réponse est maintenant « jusqu'à un modèle qui rivalise avec les systèmes de pointe hébergés », ce qui n'était pas vrai il y a un an. Si vous avez le matériel, rien d'auto-hébergé et sans restriction ne s'en approche.
Idéal pour : les propriétaires de Mac Studio, les passionnés de homelab avec des budgets de station de travail, et les groupes de recherche qui ont besoin de capacités de pointe sans aucune politique externe.
Exécuter l'un de ces modèles : servez-le, puis traitez-le comme une API
Chaque modèle ci-dessus se déploie de la même manière : llama.cpp, Ollama ou LM Studio pour les versions GGUF, vLLM pour FP8. Tous exposent un endpoint compatible OpenAI sur localhost, ce qui signifie que votre modèle local est une API dès qu'il se charge :
ollama run huihui_ai/qwen3.6-abliterated:27b
# Endpoint compatible OpenAI maintenant disponible à http://localhost:11434/v1
Cet endpoint mérite le même traitement que toute API avec laquelle vous développez. Dirigez Apidog vers http://localhost:11434/v1/chat/completions et vous pourrez enregistrer les charges utiles de prompts comme requêtes réutilisables, comparer les réponses entre différentes quantifications du même modèle, vérifier la structure des réponses avant de connecter l'endpoint à une application, et simuler les réponses du modèle pour que vos tests d'intégration ne consomment plus de temps GPU. Le flux de travail est identique à celui de notre guide local Kimi K3 : téléchargez les poids, servez, puis déboguez l'endpoint comme un service de production. Téléchargez Apidog et tout le processus s'exécute hors ligne, ce qui correspond à la raison pour laquelle vous avez opté pour le local en premier lieu.
Les modèles non censurés rendent les tests au niveau de l'endpoint plus importants, pas moins. Sans couche de refus dans le modèle, votre application a besoin de ses propres vérifications d'entrée et de sortie, et ce sont précisément les assertions de requête et de réponse qu'un client API automatise.
FAQ
Est-il légal de télécharger et d'exécuter ces modèles ? Le téléchargement de modèles à poids ouverts et de dérivés ablatés depuis Hugging Face est légal dans la plupart des juridictions. Chaque dépôt est accompagné d'une licence (Apache 2.0, termes Gemma, ou similaire) qui régit la réutilisation commerciale. Ce que vous générez et comment vous l'utilisez reste votre responsabilité, tout comme n'importe quel outil.
Les modèles ablatés deviennent-ils moins performants ? Légèrement, et cela varie selon la version. L'ablation supprime une direction dans l'espace d'activation, et une suppression agressive peut affecter des capacités adjacentes. Les versions bien conçues, comme celles listées ici, mesurent la perte à quelques points de benchmark. Les finetunes sans refus comme Dolphin évitent l'opération chirurgicale mais changent la personnalité du modèle à la place. Notre analyse des benchmarks de Qwen 3.8 couvre les scores de la base non modifiée, qui est votre plafond de toute façon.
Quel est le matériel minimum pour commencer ? Un GPU de 12 Go ou un Mac Apple Silicon de 16 Go exécute Hermes 4 14B ou la version Gemma 4 A4B à des vitesses utilisables. Le point idéal en 2026 est de 24 Go de VRAM ou 32 Go de mémoire unifiée, ce qui débloque la classe 24B à 27B où se trouvent les entrées n°1, n°2 et n°4. Vous pouvez également utiliser Qwen 3.8 gratuitement via des canaux hébergés pour évaluer si le modèle de base correspond à votre travail avant de télécharger 17 Go de poids.
Pourquoi pas l'un des modèles des anciennes listes, comme WizardLM ou Vicuna ? L'âge du modèle de base. Un finetune 13B de l'ère 2023 perd face à un 27B de 2026 sur tous les axes : raisonnement, longueur de contexte, codage, sortie multilingue. Les versions non censurées héritent du plafond de leur base, donc le classement ci-dessus part des bases actuelles et ne descend que lorsque le matériel l'exige.
Le bilan
Qwen 3.8-27B Non censuré est la réponse par défaut en 2026 : la base la plus récente, un véritable support multimodal et des quantifications qui tiennent sur les cartes que les gens possèdent. Dolphin 3.0 est l'alternative de finetuning avec l'écosystème le plus riche, et Hermes 4 est le choix de l'opérateur réfléchi, non censuré par philosophie et gouvernable par prompt système. En dessous de 16 Go, optez pour la version Gemma 4 A4B pour la vitesse ou Mistral Small 3.2 ablaté pour la prose. Et quel que soit celui que vous servez, rappelez-vous qu'il démarre comme une API non gardée sur localhost : testez-le avec Apidog comme vous le feriez pour n'importe quel endpoint auquel vous comptez faire confiance.
