Os 7 Melhores LLMs Sem Censura Para Rodar Localmente em 2026

Os 7 melhores LLMs sem censura que você pode executar localmente em 2026, classificados por VRAM: Qwen 3.8-27B Sem Censura, Dolphin 3.0, Hermes 4, Gemma 4 A4B e mais, com tamanhos de quantização e notas de configuração.

Ashley Innocent

Ashley Innocent

19 agosto 2026

Os 7 Melhores LLMs Sem Censura Para Rodar Localmente em 2026

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

O cenário local de modelos não censurados mudou em 14 de agosto de 2026. Nesse dia, a Alibaba disponibilizou os pesos abertos para Qwen 3.8-27B no Hugging Face, e em poucas horas a comunidade já havia criado versões quantizadas para tamanhos que uma única RTX 5090 ou um MacBook de 24 GB podem suportar. Pela primeira vez, o modelo mais forte que você pode executar sem recusas está também perto do modelo aberto mais forte, ponto.

Isso torna a maioria das listas de "melhores LLMs não censurados" obsoletas. Rankings que ainda circulam em 2026 recomendam finetunes de Llama 2 e Vicuna, modelos três gerações atrás do que você pode baixar do Hugging Face hoje. Esta lista começa do zero: sete modelos, todos com download verificado agora, categorizados pela VRAM que você possui, e não por trivialidades de benchmark.

Uma definição antes do ranking, porque os termos se confundem em todo lugar. Um LLM não censurado é um modelo cujo comportamento de recusa foi removido ou nunca foi treinado. Ele não recusará um prompt por motivos de política. Isso também significa que ele não possui nenhuma barreira de segurança: você é a camada de segurança, e as saídas são sua responsabilidade. Cada modelo abaixo é uma ferramenta de pesquisa e auto-hospedagem, não um assistente hospedado.

Como o "não censurado" acontece: três métodos diferentes

Saber qual método produziu um modelo diz como ele se comportará.

Abliterção. Pesquisadores identificam a direção de ativação interna responsável pelas recusas e a removem cirurgicamente dos pesos. Nenhum retreinamento envolvido. O modelo mantém sua inteligência base quase intacta, mas para de recusar solicitações. Construtores da comunidade como huihui-ai e orcarouter publicam versões abliteradas de grandes modelos abertos dias após o lançamento.

Finetuning sem recusas. A abordagem Dolphin: retreinar o modelo base em um conjunto de dados curado com recusas removidas. Isso muda a personalidade do modelo mais do que a abliterção, e a qualidade depende do conjunto de dados de finetune.

Alinhamento neutro. A Nous Research treina modelos Hermes para seguir o seu prompt de sistema em vez de um código de ética do fornecedor. O modelo não é lobotomizado; ele é direcionável. Você define as regras por implantação.

Todos os três produzem um modelo que responde onde assistentes comerciais recusam. Eles diferem em quanta capacidade base sobrevive e quanto controle você mantém.

Como esta lista é classificada

Três critérios, em ordem:

  1. Força do modelo base. Uma construção não censurada herda o teto de sua base. Uma base de 2026 supera uma base de 2024 no mesmo tamanho.
  2. Executa em hardware que as pessoas possuem. Cada entrada lista o tamanho quantizado e a VRAM mínima ou memória unificada que o suporta. Categorias: 12 a 16 GB, 16 a 24 GB e classe de workstation.
  3. Disponibilidade verificada. Cada modelo tem links para um repositório Hugging Face ativo ou página oficial. Sem links quebrados, sem "em breve".

Comparação rápida antes dos detalhes:

# Modelo Método Cabe em Melhor para
1 Qwen 3.8-27B Não Censurado Abliterção 16 a 24GB Melhor geral: codificação, agentes, visão
2 Dolphin 3.0 Mistral 24B Finetune sem recusa 16 a 24GB Chat geral, chamada de função, variante de raciocínio R1
3 Hermes 4 (14B / 36B / 70B) Alinhamento neutro 12GB e acima Comportamento direcionável que você define por prompt de sistema
4 Huihui Qwen 3.6-27B abliterado Abliterção 16 a 24GB Clássico comprovado, enorme ecossistema quantizado
5 Gemma 4 26B-A4B não censurado Abliterção 12 a 16GB Velocidade em hardware modesto (MoE, ~4B ativo)
6 Mistral Small 3.2 abliterado Abliterção 12 a 16GB Ficção, RPG, escrita criativa
7 Huihui GLM-5.1 abliterado Abliterção 256GB+ O maior modelo aberto abliterado existente

1. Qwen 3.8-27B Não Censurado: o novo melhor geral

O modelo base é a história aqui. Qwen 3.8-27B é o irmão denso de peso aberto do Qwen 3.8-Max, lançado em 14 de agosto de 2026 no Hugging Face e ModelScope. Ele entende imagens e vídeo nativamente, é direcionado a cargas de trabalho de codificação e agente, e apresenta números de benchmark públicos que se aproximam dos modelos de ponta fechados. Nenhum outro modelo nesta lista tem uma base tão atual.

A comunidade agiu rapidamente. orcarouter/Qwen3.8-27B-Uncensored-GGUF é a construção GGUF abliterada, com quants mapeados para hardware real:

Existe uma construção FP8 para vLLM se você servir em uma placa de workstation, e uma variante mais agressiva (0xKitkat/Qwen3.8-27B-Uncensored-Aggressive) troca mais comportamentos adjacentes à recusa por algum custo de capacidade. Em uma RTX 5090 de desktop, espere cerca de 45 tokens por segundo em Q4; os proprietários já o estavam rodando em configurações diárias dentro de uma hora após o lançamento dos pesos.

Uma ressalva na configuração: a arquitetura qwen35 e o suporte MTP chegaram ao llama.cpp em maio de 2026. Atualize para uma construção de 2026-05 ou mais recente, ou o GGUF não carregará. A mesma regra se aplica ao Ollama e LM Studio, que incluem llama.cpp por baixo.

Melhor para: qualquer pessoa com 16GB+ de VRAM que queira o modelo local mais forte, censurado ou não. O fato de ser não censurado é um bônus além de uma base próxima à fronteira.

2. Dolphin 3.0 Mistral 24B: o veterano de finetune, ainda afiado

A série Dolphin de Eric Hartford é o projeto não censurado de mais longa duração, e Dolphin3.0-Mistral-24B é seu carro-chefe atual. Ao contrário das entradas abliteradas, Dolphin é um finetune completo sem recusas: retreinado em um conjunto de dados curado, ajustado para seguir instruções, codificação, matemática e chamada de funções.

Duas coisas o mantêm na lista em 2026. Primeiro, a variante R1 adiciona raciocínio, treinada por três épocas em 800k rastreamentos de raciocínio do conjunto de dados Dolphin-R1, então você obtém comportamento de cadeia de pensamento sem um filtro de fornecedor decidindo quais pensamentos são permitidos. Segundo, o ecossistema: Dolphin tem suporte Ollama de primeira classe, quants GGUF maduros em todos os tamanhos e anos de padrões de prompt da comunidade.

Com 24B denso, os quants Q4 ficam em torno de 14 a 15GB, confortável em uma placa de 24GB e viável em 16GB com um quant menor.

Melhor para: chat local de propósito geral e trabalho de agente quando você prefere um modelo deliberadamente retreinado em vez de um cirurgicamente editado, e para a construção R1 se você quiser raciocínio não censurado.

3. Hermes 4: não censurado por filosofia, não por cirurgia

Hermes 4 da Nous Research defende a posição de que o alinhamento pertence ao operador. Os modelos são treinados para seguir o seu prompt de sistema em vez de um código de ética da empresa. A Nous chama isso de alinhamento neutro, e Hermes 4 lidera o RefusalBench entre modelos abertos e fechados por cumprir a intenção do usuário sem recusas gerais.

A diferença prática em relação aos modelos abliterados importa. Um modelo abliterado não pode recusar nada, nunca. Hermes seguirá qualquer política que você escrever no prompt do sistema, incluindo uma com limites que você escolher. Para muitos auto-hospedeiros, essa é a propriedade mais útil: não censurado por padrão, governável sob demanda.

Melhor para: operadores que desejam definir o comportamento do modelo por si mesmos. O 14B cabe em uma placa de 12GB em Q4; o 36B requer 24GB.

4. Huihui Qwen 3.6-27B abliterado: o cavalo de batalha comprovado

Antes do lançamento do Qwen 3.8, as abliterções do Qwen 3.6 da huihui-ai eram a recomendação padrão para uso local não censurado, e continuam sendo a escolha segura. O Qwen 3.6 (abril de 2026) provou ser uma base incomumente limpa para abliterção: a direção de recusa é removida com perda mínima de capacidade, e é por isso que a construção de 27B aparece no topo dos rankings da comunidade durante todo o ano.

O ecossistema é o atrativo. Huihui publica a gama completa de quants no Hugging Face e espelha para Ollama, então ollama run permite que você comece com um único comando. Existe uma variante de 14B com capacidade de visão para placas menores, e um finetune de personalidade Samantha empilhado na abliterção, se você quiser um padrão de conversação mais acolhedor.

Escolha este em vez da entrada #1 se você valoriza uma construção comprovada em batalha com meses de validação da comunidade em vez da base mais recente, ou se o requisito do llama.cpp para o Qwen 3.8 bloquear sua cadeia de ferramentas atual.

Melhor para: um driver diário estável e amplamente validado em 16 a 24 GB de VRAM.

5. Gemma 4 26B-A4B não censurado: velocidade em hardware modesto

A maioria dos modelos desta lista é densa, então cada token paga por cada parâmetro. Gemma 4 26B-A4B é uma construção mixture-of-experts: 26B de parâmetros totais, cerca de 4B ativos por token. A versão abliterada oferece saída não censurada a um throughput que um 27B denso não consegue alcançar na mesma placa.

Isso o torna o vencedor na categoria para configurações de 12 a 16 GB. Onde um 27B denso em Q3 parece comprometido em uma GPU de 16 GB, a arquitetura A4B mantém a qualidade alta enquanto gera múltiplos mais rapidamente. Em Apple Silicon com 16 GB de memória unificada, é a diferença entre utilizável e doloroso.

A desvantagem é a profundidade em tarefas de raciocínio difíceis, onde as entradas densas #1 e #2 se destacam. Para sumarização, rascunho, extração e chat, você raramente notará.

Melhor para: hardware de classe laptop, Macs de 16 GB e qualquer pessoa que valorize tokens por segundo em vez da profundidade máxima de raciocínio.

6. Mistral Small 3.2 abliterado: a escolha do escritor

Pergunte às comunidades de RPG e ficção qual modelo não censurado eles usam e a resposta em 2026 é consistentemente a abliterção do Mistral Small 3.2. Os modelos base da Mistral possuem uma qualidade de prosa distinta: menos inclinados a listas, melhores em manter uma voz em contextos longos, menos propensos ao tom de "assistente" que permeia os finetunes de Qwen e Llama.

A abliterção é mais importante para a escrita criativa do que para o código. Modelos comerciais recusam ou sanitizam uma grande parte da ficção legítima: vilões, violência, narradores moralmente ambíguos. Um Mistral Small abliterado escreve a cena que você pediu e mantém o registro que você definiu.

Com aproximadamente 24B denso, os quants se assemelham aos do Dolphin: Q4 em torno de 14GB, funcionando bem em placas de 16GB ou superiores.

Melhor para: ficção, RPG e qualquer trabalho de escrita onde a sanitização adjacente à recusa estraga a qualidade da saída.

7. Huihui GLM-5.1 abliterado: o teto

O maior modelo aberto abliterado disponível: Huihui-GLM-5.1-abliterated-GGUF, um MoE de 754 bilhões de parâmetros que é enviado como um arquivo de 236 GB mesmo na quantização IQ2_M. Este não é um modelo de consumo. Ele requer um Mac Studio de 256 GB+, um equipamento multi-GPU ou um servidor com RAM séria para descarregamento da CPU.

Ele ganha sua vaga porque responde a uma pergunta que os outros seis não podem: até onde a IA local não censurada pode escalar? A resposta agora é "para um modelo que compete com sistemas de fronteira hospedados", o que não era verdade há um ano. Se você tem o hardware, nada auto-hospedado e irrestrito chega perto.

Melhor para: proprietários de Mac Studio, entusiastas de homelab com orçamentos de workstation e grupos de pesquisa que precisam de capacidade de classe de fronteira com política externa zero.

Executando qualquer um desses: sirva-o e trate-o como uma API

Cada modelo acima é implantado da mesma forma: llama.cpp, Ollama ou LM Studio para construções GGUF, vLLM para FP8. Todos eles expõem um endpoint compatível com OpenAI no localhost, o que significa que seu modelo local é uma API no momento em que carrega:

ollama run huihui_ai/qwen3.6-abliterated:27b
# Endpoint compatível com OpenAI agora ativo em http://localhost:11434/v1

Esse endpoint merece o mesmo tratamento que qualquer API que você constrói. Aponte o Apidog para http://localhost:11434/v1/chat/completions e você poderá salvar payloads de prompt como solicitações reutilizáveis, comparar respostas entre quants do mesmo modelo, fazer asserções sobre a estrutura da resposta antes de conectar o endpoint a um aplicativo e simular as respostas do modelo para que seus testes de integração parem de consumir tempo de GPU. O fluxo de trabalho é idêntico ao do nosso guia local Kimi K3: baixe os pesos, sirva, e então depure o endpoint como um serviço de produção. Baixe o Apidog e todo o ciclo roda offline, o que se encaixa no motivo pelo qual você optou por um modelo local em primeiro lugar.

Modelos não censurados tornam os testes de nível de endpoint mais importantes, não menos. Sem uma camada de recusa no modelo, seu aplicativo precisa de suas próprias verificações de entrada e saída, e essas são exatamente as asserções de solicitação e resposta que um cliente de API automatiza.

FAQ

É legal baixar e rodar esses modelos? Baixar modelos de peso aberto e derivados abliterados do Hugging Face é legal na maioria das jurisdições. Cada repositório possui uma licença (Apache 2.0, termos Gemma, ou similar) que rege o reuso comercial. O que você gera e como você usa continua sendo sua responsabilidade, assim como qualquer ferramenta.

Modelos abliterados ficam mais burros? Ligeiramente, e isso varia de acordo com a construção. A abliterção remove uma direção no espaço de ativação, e a remoção agressiva pode afetar capacidades adjacentes. Construções bem-feitas, como as listadas aqui, medem a perda em alguns pontos de benchmark. Finetunes sem recusa, como o Dolphin, evitam a cirurgia, mas mudam a personalidade do modelo. Nossa análise dos benchmarks do Qwen 3.8 cobre o que a base não modificada pontua, que é o seu teto de qualquer forma.

Qual é o hardware mínimo para começar? Uma GPU de 12 GB ou um Mac Apple Silicon de 16 GB executa o Hermes 4 14B ou a construção Gemma 4 A4B em velocidades utilizáveis. O ponto ideal em 2026 é 24 GB de VRAM ou 32 GB de memória unificada, o que desbloqueia a classe de 24B a 27B onde vivem as entradas #1, #2 e #4. Você também pode usar o Qwen 3.8 gratuitamente através de canais hospedados primeiro para avaliar se o modelo base se adapta ao seu trabalho antes de baixar 17 GB de pesos.

Por que não um dos modelos de listas antigas, como WizardLM ou Vicuna? Idade do modelo base. Um finetune de 13B da era de 2023 perde para um 27B de 2026 em todos os eixos: raciocínio, comprimento do contexto, codificação, saída multilíngue. Construções não censuradas herdam o teto de sua base, então o ranking acima começa com bases atuais e desce apenas onde o hardware exige.

O resultado final

Qwen 3.8-27B Não Censurado é a resposta padrão em 2026: a base mais nova, suporte multimodal real e quants que cabem nas placas que as pessoas possuem. Dolphin 3.0 é a alternativa de finetune com o ecossistema mais profundo, e Hermes 4 é a escolha do operador pensante, não censurado por filosofia e governável por prompt de sistema. Abaixo de 16GB, escolha a construção Gemma 4 A4B para velocidade ou Mistral Small 3.2 abliterado para prosa. E qualquer que seja o modelo que você sirva, lembre-se que ele inicializa como uma API desprotegida no localhost: teste-o com Apidog como faria com qualquer endpoint em que você planeja confiar.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs