La escena local de modelos sin censura cambió el 14 de agosto de 2026. Ese día, Alibaba publicó los pesos abiertos para Qwen 3.8-27B en Hugging Face, y en cuestión de horas la comunidad había creado versiones ablación cuantificadas a tamaños que podía albergar una sola RTX 5090 o un MacBook de 24 GB. Por primera vez, el modelo más potente que puedes ejecutar sin negativas también está cerca del modelo abierto más potente, y punto.
Esto hace que la mayoría de las listas de los "mejores LLM sin censura" queden obsoletas. Las clasificaciones que aún circulan en 2026 recomiendan los finetunes de Llama 2 y Vicuna, modelos tres generaciones por detrás de lo que puedes obtener de Hugging Face hoy. Esta lista comienza desde cero: siete modelos, todos verificados y descargables ahora mismo, agrupados por la VRAM que posees en lugar de por datos triviales de benchmarks.
Una definición antes de la clasificación, porque los términos se desdibujan en todas partes. Un LLM sin censura es un modelo cuyo comportamiento de rechazo ha sido eliminado o nunca fue entrenado. No rechazará una solicitud por motivos de política. Eso también significa que no tiene ninguna medida de seguridad: tú eres la capa de seguridad y las salidas son tu responsabilidad. Cada modelo a continuación es una herramienta de investigación y auto-alojamiento, no un asistente alojado.
Cómo se produce lo “sin censura”: tres métodos diferentes
Saber qué método produjo un modelo te dice cómo se comportará.
Ablación. Los investigadores identifican la dirección de activación interna responsable de las negativas y la eliminan quirúrgicamente de los pesos. No se requiere reentrenamiento. El modelo mantiene su inteligencia base casi intacta, pero deja de rechazar solicitudes. Desarrolladores de la comunidad como huihui-ai y orcarouter publican versiones de ablación de los principales modelos abiertos a los pocos días de su lanzamiento.
Ajuste fino sin rechazo. El enfoque Dolphin: reentrenar el modelo base en un conjunto de datos curado al que se le han eliminado los rechazos. Esto cambia la personalidad del modelo más que la ablación, y la calidad depende del conjunto de datos de ajuste fino.
Alineación neutral. Nous Research entrena los modelos Hermes para que sigan tu prompt del sistema en lugar de un código ético del proveedor. El modelo no está lobotomizado; es dirigible. Tú defines las reglas por cada implementación.
Los tres producen un modelo que responde donde los asistentes comerciales se niegan. Difieren en cuánta capacidad base sobrevive y cuánto control conservas.
Cómo se clasifica esta lista
Tres criterios, en orden:
- Fuerza del modelo base. Una compilación sin censura hereda el límite de su base. Una base de 2026 supera a una base de 2024 del mismo tamaño.
- Funciona en hardware que la gente posee. Cada entrada lista el tamaño de cuantificación y la VRAM o memoria unificada mínima que lo soporta. Categorías: 12 a 16 GB, 16 a 24 GB y clase de estación de trabajo.
- Disponibilidad verificada. Cada modelo enlaza a un repositorio activo de Hugging Face o a una página oficial. Sin enlaces muertos, sin "próximamente".
Comparación rápida antes de los detalles:
| # | Modelo | Método | Cabe en | Mejor para |
|---|---|---|---|---|
| 1 | Qwen 3.8-27B Sin Censura | Ablación | 16 a 24 GB | Mejor en general: codificación, agentes, visión |
| 2 | Dolphin 3.0 Mistral 24B | Ajuste fino sin rechazo | 16 a 24 GB | Chat general, llamada a funciones, variante R1 de razonamiento |
| 3 | Hermes 4 (14B / 36B / 70B) | Alineación neutral | 12 GB o más | Comportamiento dirigible que defines por prompt del sistema |
| 4 | Huihui Qwen 3.6-27B ablación | Ablación | 16 a 24 GB | Clásico probado, enorme ecosistema de cuantificación |
| 5 | Gemma 4 26B-A4B sin censura | Ablación | 12 a 16 GB | Velocidad en hardware modesto (MoE, ~4B activos) |
| 6 | Mistral Small 3.2 ablación | Ablación | 12 a 16 GB | Ficción, juegos de rol, escritura creativa |
| 7 | Huihui GLM-5.1 ablación | Ablación | 256 GB+ | El modelo de ablación abierto más grande que existe |
1. Qwen 3.8-27B Sin Censura: el nuevo mejor en general
El modelo base es la clave aquí. Qwen 3.8-27B es el hermano denso de código abierto de Qwen 3.8-Max, lanzado el 14 de agosto de 2026 en Hugging Face y ModelScope. Entiende imágenes y video de forma nativa, se enfoca en cargas de trabajo de codificación y agentes, y publica números de benchmarks públicos que compiten con los modelos de frontera cerrados. Ningún otro modelo en esta lista tiene una base tan actual.
La comunidad se movió rápido. orcarouter/Qwen3.8-27B-Uncensored-GGUF es la compilación GGUF ablación, con cuantificaciones mapeadas a hardware real:
- Q4_K_M, 16.8GB: la elección para una GPU de 24 GB (RTX 3090/4090/5090) o un Mac de 32 GB
- IQ4_XS, 15.3GB: cabe en una GPU de 16 GB
- Q3_K_M, 13.5GB: cuando quieres más espacio de contexto que precisión
Existe una compilación FP8 para vLLM si lo sirves en una tarjeta de estación de trabajo, y una variante más agresiva (0xKitkat/Qwen3.8-27B-Uncensored-Aggressive) elimina más comportamiento adyacente al rechazo a un costo de capacidad. En una RTX 5090 de escritorio, espera alrededor de 45 tokens por segundo en Q4; los propietarios lo tenían funcionando en configuraciones diarias dentro de una hora de la publicación de los pesos.
Un detalle de configuración: la arquitectura qwen35 y el soporte MTP llegaron a llama.cpp en mayo de 2026. Actualiza a una compilación de 2026-05 o posterior, o el GGUF no se cargará. La misma regla se aplica a través de Ollama y LM Studio, que incluyen llama.cpp por debajo.
Mejor para: cualquiera con 16 GB+ de VRAM que quiera el modelo local más potente, censurado o no. El hecho de que sea sin censura es un extra además de una base cercana a la frontera.
2. Dolphin 3.0 Mistral 24B: el veterano del ajuste fino, aún en forma
La serie Dolphin de Eric Hartford es el proyecto sin censura de más larga duración, y Dolphin3.0-Mistral-24B es su buque insignia actual. A diferencia de las entradas de ablación, Dolphin es un ajuste fino completo sin rechazos: reentrenado en un conjunto de datos curado, ajustado para seguir instrucciones, codificación, matemáticas y llamadas a funciones.
Dos cosas lo mantienen en la lista en 2026. Primero, la variante R1 añade razonamiento, entrenada durante tres épocas en 800k trazas de razonamiento del conjunto de datos Dolphin-R1, lo que te permite obtener un comportamiento de cadena de pensamiento sin que un filtro de proveedor decida qué pensamientos están permitidos. Segundo, el ecosistema: Dolphin tiene soporte de primera clase para Ollama, cuantificaciones GGUF maduras de todos los tamaños, y años de patrones de prompt de la comunidad.
Con un modelo denso de 24B, las cuantificaciones Q4 rondan los 14 a 15 GB, cómodas en una tarjeta de 24 GB y funcionales en 16 GB con una cuantificación más pequeña.
Mejor para: chat local de propósito general y trabajo de agente cuando prefieres un modelo reentrenado deliberadamente en lugar de uno editado quirúrgicamente, y para la compilación R1 si quieres un razonamiento sin censura.
3. Hermes 4: sin censura por filosofía, no por cirugía
Hermes 4 de Nous Research adopta la postura de que la alineación pertenece al operador. Los modelos están entrenados para seguir tu prompt del sistema en lugar de un código ético de la empresa. Nous lo llama alineación neutral, y Hermes 4 encabeza RefusalBench entre los modelos abiertos y cerrados por cumplir con la intención del usuario sin negativas generalizadas.
La familia abarca 14B, 36B (incluyendo la compilación más reciente 4.3-36B), 70B, y un 405B para personas con racks de servidores. Todos son razonadores híbridos: incluye la etiqueta de razonamiento y el modelo piensa más tiempo en problemas difíciles, omítela y obtendrás respuestas directas rápidas.
La diferencia práctica con los modelos ablación es importante. Un modelo ablación no puede negarse a nada, nunca. Hermes seguirá cualquier política que escribas en el prompt del sistema, incluyendo una con los límites que elijas. Para muchos auto-anfitriones, esa es la propiedad más útil: sin censura por defecto, gobernable bajo demanda.
Mejor para: operadores que desean definir el comportamiento del modelo por sí mismos. El 14B cabe en una tarjeta de 12 GB en Q4; el 36B requiere 24 GB.
4. Huihui Qwen 3.6-27B ablación: el caballo de batalla probado
Antes de que llegara Qwen 3.8, las ablaciones de Qwen 3.6 de huihui-ai eran la recomendación predeterminada para el uso local sin censura, y siguen siendo la elección segura. Qwen 3.6 (abril de 2026) demostró ser una base inusualmente limpia para la ablación: la dirección de rechazo se elimina con una pérdida mínima de capacidad, por lo que la compilación de 27B aparece en la parte superior de las clasificaciones de la comunidad durante todo el año.
El ecosistema es el atractivo. Huihui publica la gama completa de cuantificaciones en Hugging Face y las replica en Ollama, por lo que ollama run te pone en marcha con un solo comando. Existe una variante de 14B con capacidad de visión para tarjetas más pequeñas, y un ajuste fino de personalidad de Samantha apilado sobre la ablación si quieres una conversación predeterminada más cálida.
Elige este sobre la entrada #1 si valoras una compilación probada en batalla con meses de validación comunitaria sobre la base más reciente, o si el requisito de llama.cpp de Qwen 3.8 bloquea tu cadena de herramientas actual.
Mejor para: un controlador diario estable y ampliamente validado en 16 a 24 GB de VRAM.
5. Gemma 4 26B-A4B sin censura: velocidad en hardware modesto
La mayoría de los modelos de esta lista son densos, por lo que cada token paga por cada parámetro. Gemma 4 26B-A4B es una compilación de mezcla de expertos: 26B parámetros totales, alrededor de 4B activos por token. La versión ablación te ofrece una salida sin censura con un rendimiento que un modelo denso de 27B no puede igualar en la misma tarjeta.
Eso lo convierte en el ganador de su categoría para configuraciones de 12 a 16 GB. Donde un modelo denso de 27B en Q3 se siente comprometido en una GPU de 16 GB, la arquitectura A4B mantiene la calidad alta mientras genera múltiples veces más rápido. En Apple Silicon con 16 GB de memoria unificada, es la diferencia entre utilizable y doloroso.
La contrapartida es la profundidad en tareas de razonamiento difíciles, donde las entradas densas #1 y #2 toman la delantera. Para resúmenes, borradores, extracción y chat, rara vez lo notarás.
Mejor para: hardware de clase portátil, Macs de 16 GB y cualquiera que valore los tokens por segundo por encima de la máxima profundidad de razonamiento.
6. Mistral Small 3.2 ablación: la elección del escritor
Pregunta a las comunidades de juegos de rol y ficción qué modelo sin censura utilizan y la respuesta en 2026 es consistentemente la ablación de Mistral Small 3.2. Los modelos base de Mistral tienen una calidad de prosa distintiva: menos propensos a listas, mejores para mantener una voz a lo largo de un contexto largo, menos propensos al tono "asistente" que se filtra a través de los ajustes finos de Qwen y Llama.
La ablación importa más para la escritura creativa que para el código. Los modelos comerciales rechazan o sanitizan una gran parte de la ficción legítima: villanos, violencia, narradores moralmente ambiguos. Un Mistral Small ablación escribe la escena que pediste y mantiene el registro que estableciste.
Con aproximadamente 24B densos, las cuantificaciones son como las de Dolphin: Q4 alrededor de 14GB, ideal para tarjetas de 16GB o superiores.
Mejor para: ficción, juegos de rol y cualquier trabajo de escritura donde la sanitización adyacente al rechazo arruina la calidad de la salida.
7. Huihui GLM-5.1 ablación: el techo
El modelo ablación abierto más grande disponible: Huihui-GLM-5.1-abliterated-GGUF, un MoE de 754 mil millones de parámetros que se distribuye como un archivo de 236 GB incluso con cuantificación IQ2_M. Este no es un modelo de consumidor. Requiere un Mac Studio de 256 GB+, una configuración multi-GPU o un servidor con mucha RAM para descarga de CPU.
Se gana su lugar porque responde a una pregunta que los otros seis no pueden: ¿hasta dónde escala la IA local sin censura? La respuesta ahora es "hasta un modelo que compite con los sistemas de frontera alojados", lo que no era cierto hace un año. Si tienes el hardware, nada auto-alojado y sin restricciones se le acerca.
Mejor para: propietarios de Mac Studio, entusiastas de homelabs con presupuestos de estaciones de trabajo y grupos de investigación que necesitan capacidades de clase fronteriza sin ninguna política externa.
Ejecutando cualquiera de estos: sírvelo, luego trátalo como una API
Todos los modelos anteriores se implementan de la misma manera: llama.cpp, Ollama o LM Studio para compilaciones GGUF, vLLM para FP8. Todos exponen un endpoint compatible con OpenAI en localhost, lo que significa que tu modelo local es una API en el momento en que se carga:
ollama run huihui_ai/qwen3.6-abliterated:27b
# OpenAI-compatible endpoint now live at http://localhost:11434/v1
Ese endpoint merece el mismo tratamiento que cualquier API contra la que construyas. Apunta Apidog a http://localhost:11434/v1/chat/completions y podrás guardar cargas de prompt como solicitudes reutilizables, diferenciar respuestas entre cuantificaciones del mismo modelo, afirmar la estructura de la respuesta antes de conectar el endpoint a una aplicación, y simular las respuestas del modelo para que tus pruebas de integración dejen de consumir tiempo de GPU. El flujo de trabajo es idéntico al de nuestra guía local de Kimi K3: descarga los pesos, sírvelo, luego depura el endpoint como un servicio de producción. Descarga Apidog y todo el ciclo se ejecuta sin conexión, lo que se ajusta a la razón por la que optaste por lo local en primer lugar.
Los modelos sin censura hacen que las pruebas a nivel de endpoint sean más importantes, no menos. Sin una capa de rechazo en el modelo, tu aplicación necesita sus propias comprobaciones de entrada y salida, y esas son exactamente las aserciones de solicitud y respuesta que un cliente API automatiza.
Preguntas Frecuentes
¿Es legal descargar y ejecutar estos modelos? Descargar modelos de pesos abiertos y derivados ablación de Hugging Face es legal en la mayoría de las jurisdicciones. Cada repositorio tiene una licencia (Apache 2.0, términos de Gemma, o similar) que rige el reuso comercial. Lo que generes y cómo lo uses sigue siendo tu responsabilidad, al igual que con cualquier herramienta.
¿Se vuelven más tontos los modelos ablación? Ligeramente, y varía según la compilación. La ablación elimina una dirección en el espacio de activación, y una eliminación agresiva puede afectar capacidades adyacentes. Las compilaciones bien hechas, como las que se enumeran aquí, miden la pérdida en unos pocos puntos de benchmark. Los ajustes finos sin rechazo como Dolphin evitan la cirugía, pero cambian la personalidad del modelo en su lugar. Nuestro desglose de benchmarks de Qwen 3.8 cubre las puntuaciones de la base sin modificar, que es tu límite de todos modos.
¿Cuál es el hardware mínimo para empezar? Una GPU de 12 GB o un Mac Apple Silicon de 16 GB ejecuta Hermes 4 14B o la compilación Gemma 4 A4B a velocidades utilizables. El punto óptimo en 2026 es 24 GB de VRAM o 32 GB de memoria unificada, lo que desbloquea la clase de 24B a 27B donde residen las entradas #1, #2 y #4. También puedes usar Qwen 3.8 gratis a través de canales alojados primero para evaluar si el modelo base se ajusta a tu trabajo antes de descargar 17 GB de pesos.
¿Por qué no uno de los modelos de listas antiguas, como WizardLM o Vicuna? La edad del modelo base. Un ajuste fino de 13B de la era 2023 pierde frente a un 27B de 2026 en todos los ejes: razonamiento, longitud de contexto, codificación, salida multilingüe. Las compilaciones sin censura heredan el techo de su base, por lo que la clasificación anterior comienza desde las bases actuales y solo desciende donde el hardware lo exige.
Conclusión
Qwen 3.8-27B Sin Censura es la respuesta predeterminada en 2026: la base más nueva, soporte multimodal real y cuantificaciones que se ajustan a las tarjetas que la gente posee. Dolphin 3.0 es la alternativa de ajuste fino con el ecosistema más profundo, y Hermes 4 es la elección del operador reflexivo, sin censura por filosofía y gobernable por el prompt del sistema. Por debajo de 16 GB, elige la compilación Gemma 4 A4B para velocidad o Mistral Small 3.2 ablación para prosa. Y sea cual sea el que sirvas, recuerda que se inicia como una API sin protección en localhost: pruébalo con Apidog como harías con cualquier endpoint en el que planees confiar.
