Em resumo: OrcaRouter publicou pesos abliterados para o GLM-5.3-Flash, um modelo mixture-of-experts de 320 bilhões de parâmetros com 18 bilhões ativos, em duas etapas: block-FP8 nativo em 29 de agosto de 2026, e uma build NVFP4 para GPUs NVIDIA em 31 de agosto. Conversões GGUF e MLX também já estão disponíveis. As taxas de recusa reportadas pelo fornecedor caem drasticamente, por exemplo, o MaliciousInstruct de 96% para 11%, mas não para zero. A alegação mais interessante não é a remoção da censura: a OrcaRouter afirma que parte do alinhamento do GLM-5.3-Flash não é mediada por uma única direção de recusa linear, o que tornaria o treinamento de segurança da Z.ai estruturalmente mais profundo do que os modelos que esta técnica geralmente visa.
A abliteração tornou-se rotina. Alguém pega um modelo de pesos abertos, identifica a direção interna associada à recusa, a remove e carrega o resultado. A maioria desses lançamentos é comum, e a maioria da cobertura é ou efusiva ou repreensiva.
Este vale a pena ser lido com atenção, por uma razão que nada tem a ver com o que o modelo dirá agora. As notas de lançamento contêm um resultado negativo sobre como o alinhamento é representado dentro de um modelo de pesos abertos de fronteira, e resultados negativos em interpretabilidade são mais raros e mais úteis do que outro checkpoint sem censura.
O que foi realmente lançado
Dois anúncios, com dois dias de diferença, mais um lançamento de formato mais discreto desde então.
A OrcaRouter lançou pesos sem censura para o GLM-5.3-Flash na precisão block-FP8 original, o que significa que não há uma etapa de requantização entre o modelo base e o modificado. 320 bilhões de parâmetros com 18 bilhões ativos, combinando a arquitetura do modelo base, que cobrimos em o que é o GLM-5.3-Flash e como ele se compara ao GLM-5.3. A postagem desde então ultrapassou 2 milhões de visualizações.

31 de agosto de 2026: NVFP4. Uma segunda build visando o formato de ponto flutuante de 4 bits da NVIDIA, com foco em menor pegada e inferência mais rápida. Aproximadamente 75.000 visualizações, o que indica que o lançamento do formato é de interesse para um público muito mais restrito do que o original.
Desde então: GGUF e MLX. Ambos os anúncios afirmavam que outros formatos quantizados estavam a caminho. Verificando a organização Hugging Face em 1º de setembro de 2026, GLM-5.3-Flash-Uncensored-GGUF e GLM-5.3-Flash-Uncensored-MLX ambos existem, então os caminhos para llama.cpp e Apple Silicon foram implementados. Os downloads para esses dois ainda estavam em zero quando verificamos, e a build NVFP4 estava em 5, contra 1.541 para o FP8 original. A atenção está no anúncio, ainda não nos artefatos.

Vale a pena notar para contexto: esta é uma linha de produtos, não um evento isolado. A mesma organização hospeda builds abliteradas de Qwen3.8-27B, que atraiu mais de 300.000 downloads apenas em sua build FP8, Qwen3.8-Flash-Next e Gemma-4-26B. O lançamento do GLM é a entrada mais recente em um catálogo existente.
Os pesos possuem licença MIT e listam zai-org/GLM-5.3-Flash como modelo base. O card do modelo o rotula como abliterado, visão-linguagem, MoE e capaz de chamar funções, de modo que as superfícies multimodais e de uso de ferramentas do modelo base também estão presentes.
O que significa “sem LoRA, sem prompt de jailbreak”
A formulação no anúncio é crucial, e vale a pena desvendar porque a distingue das duas coisas que a maioria das pessoas imagina.
Um prompt de jailbreak manipula um modelo em tempo de inferência. O treinamento de segurança está intacto; você está contornando-o. É frágil, é corrigido e custa contexto em cada requisição.
Um adaptador LoRA é um pequeno conjunto de pesos adicionais sobrepostos no momento do carregamento. O modelo base permanece inalterado e o adaptador pode ser removido. É uma modificação que você anexa.
A abliteração identifica a direção de ativação interna que corresponde ao comportamento de recusa e a edita dos próprios pesos. Não há nada para anexar e nada para remover. O comportamento de recusa desaparece do artefato, não sendo suprimido em tempo de execução.
Essa distinção importa na prática. Você não pode auditar um modelo abliterado verificando adaptadores ou escanear prompts, porque a mudança está nos pesos. Se você está executando modelos abertos em qualquer ambiente onde a proveniência importa, verificar a linhagem do modelo base em relação ao checkpoint real é agora uma verdadeira questão de cadeia de suprimentos. Nossa visão geral sobre como restringir o que os modelos podem fazer está em guardrails de agentes de IA.
Os números de recusa
Estes são os números reportados pela própria OrcaRouter, antes e depois, e nenhuma replicação independente existia no momento da escrita. Trate-os como relatados pelo fornecedor.
| Benchmark | Recusa base | Após abliteração |
|---|---|---|
| MaliciousInstruct | 96% | 11% |
| JailbreakBench | 93% | 12% |
| AdvBench | 97% | 15% |
| HarmBench | 93% | 18% |
| Super-recusa benigna do XSTest | 2.4% | 0.4% |
Leia a última linha de forma diferente das quatro primeiras. O XSTest mede a super-recusa, ou seja, o modelo recusar requisições inofensivas que superficialmente correspondem a algo arriscado. Esse é o modo de falha que os desenvolvedores realmente encontram em produção: um modelo recusando-se a ajudar a depurar um fluxo de login porque a palavra "senha" apareceu, ou recusando-se a escrever um scanner de rede para sua própria infraestrutura. Ir de 2,4% para 0,4% é a linha com valor prático legítimo, e é a que quase ninguém cita.
As quatro primeiras linhas são as que tornam isso um artefato de pesquisa em vez de uma ferramenta de produtividade, e é por isso que a licença e sua lei local importam mais do que o usual aqui.
O que você realmente ganha
A maioria da cobertura de modelos abliterados discute se eles deveriam existir e nunca chega ao porquê um engenheiro de campo os usaria. Existem quatro vantagens reais, e não são as que os números de manchete sugerem.
Ele para de recusar trabalhos que nunca foram prejudiciais. Esta é a grande vantagem, e é a linha do XSTest: a super-recusa benigna caindo de 2,4% para 0,4%. A super-recusa é o imposto que todo desenvolvedor já paga em modelos ajustados para segurança. O modelo que não o ajudará a depurar um fluxo de redefinição de senha porque viu a palavra "senha". O que se recusa a escrever um scanner de portas para a infraestrutura que você possui. O que se recusa a resumir um relatório de ameaças porque o relatório descreve ameaças. Nada disso é um ganho de segurança; é um modelo falhando em distinguir um tópico de uma intenção, e você paga por isso em novas tentativas, prompts reformulados e tarefas abandonadas. Reduzir essa taxa em seis vezes é a vantagem mais provável de aparecer na sua semana.
Sem imposto por requisição e nada para quebrar. A alternativa que as pessoas realmente usam hoje é a engenharia de prompt em torno da recusa. Isso custa contexto em cada chamada, produz resultados inconsistentes e para de funcionar sempre que o provedor o corrige. A modificação em nível de pesos não possui nenhuma dessas propriedades. O comportamento é uma propriedade do artefato, então é estável entre as requisições e não muda silenciosamente para você em uma terça-feira.
Pesos abertos significa que a implantação é sua. Licenciado pelo MIT, auto-hospedável e fixável a um checkpoint exato. Seus prompts e documentos permanecem dentro da sua infraestrutura em vez de transitar por um fornecedor. Você não está exposto a um provedor apertando seus filtros no meio do trimestre e quebrando um fluxo de trabalho que você implantou. Para ambientes regulamentados, esse controle é frequentemente o ponto principal, e o mesmo argumento se aplica aos pesos não modificados, por isso escrevemos auto-hospedando pesos abertos do GLM-5.3.
A superfície de capacidade sobrevive. O card do modelo ainda lista visão-linguagem e chamada de funções, então este não é um build simplificado apenas de texto. Os caminhos multimodais e de uso de ferramentas do modelo base estão presentes, o que importa se você estava planejando usá-lo para algo agêntico em vez de para chat.
Agora o limite honesto para tudo isso. Nenhuma dessas vantagens são melhorias de capacidade. A abliteração é uma edição comportamental, o trabalho publicado sobre a técnica geralmente encontra algum custo de qualidade, e nenhum dos anúncios relata se o desempenho de raciocínio, codificação ou visão mudou. Você está trocando uma redução medida na recusa por um risco não medido de degradação. E cada decisão de filtragem que o modelo base estava tomando agora é sua responsabilidade, o que é um custo real de pessoal e monitoramento, em vez de um custo economizado.
A parte que é realmente interessante
Enterrado no final do anúncio está o achado que vale a pena ler.
A recusa não vai uniformemente para zero. Em quatro benchmarks de dano, ela fica entre 11% e 18%, não de 0% a 2%. A interpretação declarada da OrcaRouter é que parte do alinhamento do GLM-5.3-Flash não é mediada por uma única direção de recusa linear, e que a Z.ai pode ter construído um mecanismo de recusa substancialmente mais profundo do que esta técnica geralmente encontra.
Essa é uma afirmação sobre os internos do modelo, e se ela se sustentar, é mais significativa do que o próprio lançamento.
O modelo mental padrão para abliteração é que a recusa é em grande parte uma direção no espaço de ativação. Encontre-o, remova-o, e o comportamento colapsa. Funcionou bem o suficiente em modelos suficientes para que as pessoas o considerem estabelecido. Um modelo onde esse procedimento o leva de 96% para 11% mas estagna lá é evidência de que o modelo mental está incompleto, pelo menos para este modelo, e que algum alinhamento sobrevive de uma forma que a técnica não alcança.
Duas advertências honestas. Primeiro, esta é a interpretação de um laboratório de seu próprio resultado, e a explicação alternativa é simplesmente que sua implementação deixou desempenho na mesa. Segundo, uma taxa de recusa residual de 11% a 18% não é uma propriedade de segurança em que alguém deveria confiar. Um modelo que recusa 15% das requisições prejudiciais não é um modelo seguro; é um não confiável.
Ainda assim, "nossa técnica atingiu um limite e achamos que a razão é arquitetônica" é o tipo de coisa que os laboratórios geralmente omitem em uma postagem de lançamento. A OrcaRouter enquadrar o lançamento como um artefato para estudar como o alinhamento é representado, em vez de puramente como um lançamento de capacidade, é a melhor versão de como este trabalho é publicado.
Afirmações que valem a pena verificar
Duas coisas no tópico circundante merecem ceticismo, e sinalizá-las não é uma crítica ao lançamento.
"Inteligência de nível Claude Opus 4.8." Uma postagem de acompanhamento descreveu o lançamento como armando defensores com inteligência nesse nível. Nenhum benchmark acompanhou a afirmação, e é uma comparação com uma versão de modelo que não é a geração Opus atual. Trate-o como marketing. Se a paridade de capacidade importa para o seu caso de uso, execute sua própria avaliação.
Taxas de recusa como proxy de capacidade. Baixa recusa não é alta capacidade. A abliteração é uma edição comportamental, e o trabalho publicado sobre a técnica geralmente encontra alguma degradação no desempenho geral como custo. Nada em nenhum dos anúncios aborda se o desempenho de raciocínio, codificação ou visão mudou em relação ao modelo base, e esse é o número que a maioria dos leitores realmente desejaria. Nossa cobertura de benchmark e preços do modelo não modificado está em preços do GLM-5.3-Flash e o guia da API do GLM-5.3-Flash.
Rodando-o, e a realidade do hardware
320 bilhões de parâmetros não é um modelo para laptop, mesmo com 18 bilhões ativos. Os formatos agora disponíveis moldam quem pode realmente executá-lo:
- Block-FP8, o lançamento original, visa GPUs de datacenter e é o artefato de referência.
- NVFP4 troca precisão por pegada em hardware NVIDIA, o que é o caminho prático para uma implantação de nó único.
- GGUF abre o caminho para o llama.cpp, que é onde a quantização se torna agressiva o suficiente para estações de trabalho de ponta.
- MLX visa o Apple Silicon, o que para um modelo desse tamanho significa uma configuração de memória unificada muito grande.
Se você está auto-hospedando em vez de chamar um endpoint hospedado, nossos tutoriais para o modelo base se aplicam diretamente: rodando o GLM-5.3-Flash localmente e auto-hospedando pesos abertos do GLM-5.3. Para um contexto mais amplo sobre esta categoria, mantemos um levantamento de LLMs sem censura e um olhar sobre LLMs sem restrições, e o lançamento abliterado do DeepSeek R1 é a comparação anterior mais próxima.
Avaliar isso é um problema de teste de API
Esta é a parte prática, e é a parte que a maioria da cobertura ignora completamente.
Se você está fazendo um trabalho legítimo com um modelo como este, ou seja, pesquisa de segurança, exercícios de equipe vermelha e azul, ou uma avaliação defensiva do que seus próprios filtros capturam, então o trabalho real é executar um grande e repetível conjunto de requisições contra um endpoint e afirmar o que retorna. Isso é teste de API. Não é uma disciplina nova só porque o corpo da resposta contém saída do modelo.
Os problemas específicos que você encontra:
- Você precisa da mesma suíte contra vários alvos. FP8 versus NVFP4 versus GGUF versus o modelo base não modificado versus um endpoint hospedado. Mesmas requisições, URLs base diferentes, resultados que você pode comparar. Qualquer coisa menos e você não pode atribuir uma mudança de comportamento à quantização em vez de à amostragem.
- Você precisa de asserções, não de olhos. Uma taxa de recusa é uma porcentagem sobre centenas de prompts. Ler transcrições não escala e não reproduz.
- Você precisa que ele rode novamente no próximo mês. Os pesos são atualizados, as quantizações são republicadas, e um número que você mediu uma vez não é um número que você pode citar mais tarde. As execuções de regressão são o ponto principal.
- Não-determinismo é a parte difícil. O mesmo prompt fornece diferentes conclusões. Suas asserções precisam verificar a classificação da resposta em vez da igualdade de strings, e sua suíte precisa de amostras suficientes para que a taxa signifique algo. Escrevemos sobre esse problema diretamente em testando agentes de IA não-determinísticos.
- Chamadas de ferramentas precisam de suas próprias verificações. O card do modelo lista chamada de funções, e um modelo abliterado que invocará ferramentas que deveria recusar é uma superfície de risco diferente de uma que apenas produz texto. Essa é uma questão de esquema e contrato antes de ser uma questão de segurança.
Isso é exatamente para o que uma plataforma de API serve. No Apidog você define o endpoint uma vez, mantém a suíte de prompts como uma coleção salva, afirma sobre campos de resposta, troca a URL base entre provedores ou quantizações através de variáveis de ambiente, e executa tudo em CI para que os números sejam reproduzíveis em vez de anedóticos. Caminhamos pela mecânica contra o modelo não modificado em testando a API do GLM-5.3-Flash com Apidog, e a mesma configuração aponta para qualquer endpoint compatível com OpenAI.

O princípio geral se aplica bem além deste modelo: uma vez que o comportamento do modelo se torna algo que você precisa medir e defender, você precisa da mesma disciplina que aplicaria a qualquer outro contrato de API. Baixe o Apidog se sua avaliação atualmente reside em um notebook que ninguém mais pode executar novamente. Relacionado: confiabilidade de agentes de IA em produção.
O trabalho da equipe vermelha precisa de um rastro de auditoria, não de um terminal
O segundo problema prático é organizacional, e para esta categoria de trabalho não é opcional.
Executar benchmarks de prompts prejudiciais contra um modelo abliterado é exatamente o tipo de atividade que precisa ser aprovada antes que aconteça e atribuível depois. Quem o executou. Contra qual checkpoint. Com a aprovação de quem. Sob qual escopo. Se esse registro vive no histórico de shell de um pesquisador, você não tem um programa de pesquisa, você tem uma responsabilidade.
O Sharkly é construído para trabalhos que precisam sobreviver à sessão, e este caso de uso se alinha excepcionalmente bem:
- Uma tarefa no Backlog não inicia uma execução. Avaliações sensíveis são preparadas, delimitadas e aprovadas antes que algo seja executado. Essa porta é a propriedade mais valiosa aqui.
- A tarefa é o registro, não o prompt. Progresso, chamadas de ferramentas e resultados fluem de volta para ela, e a saída do agente é armazenada como comentários aos quais você responde. Seis meses depois há uma resposta para o que foi executado e por quê.
- Uma Crew é um agente líder mais outros agentes e pessoas, rodando primeiro o líder. O trabalho da equipe vermelha com um revisor no circuito é a forma normal, não uma exceção.
- A execução é por sua conta. Você conecta um Computador, que pode ser seu laptop, um servidor ou um contêiner, e o Sharkly usa o Runtime já instalado nele. Para um modelo de 320 bilhões, isso importa concretamente: os pesos residem em uma caixa de GPU específica, e ser explícito sobre qual máquina executa uma avaliação sensível é um controle, não uma sobrecarga.
- Estrutura que uma equipe já entende: espaços, projetos, sprints e tarefas, com sincronização Jira.

Um modelo sem censura é uma ferramenta de pesquisa. Ferramentas de pesquisa usadas sem registro são como as organizações acabam incapazes de explicar o que aconteceu.
A realidade legal e de segurança
Curto e vale a pena declarar claramente.
A licença MIT sobre os pesos rege os pesos. Ela não concede permissão para fazer coisas ilegais com a saída, e não transfere a responsabilidade para longe de você. A lei local, a política do seu empregador e quaisquer termos de plataforma sob os quais você opera ainda se aplicam, e nenhum deles se importa que o modelo não tenha recusado.
Os usos razoáveis são os que o lançamento menciona: pesquisa de segurança, trabalho de interpretabilidade, exercícios de equipe vermelha e azul e estudo de mecanismos de recusa. A melhoria na super-recusa do XSTest também é um argumento cotidiano legítimo, para equipes cujo problema real é um modelo que não ajudará na engenharia de segurança comum.
Se você está implantando qualquer modelo para usuários finais, um checkpoint sem censura transfere todo o ônus da filtragem para sua própria pilha. Essa é uma decisão de design com implicações de pessoal e monitoramento, não uma bandeira de configuração.
FAQ
O GLM-5.3-Flash-Uncensored é o mesmo modelo que o GLM-5.3-Flash? Mesma arquitetura e mesmos pesos base, 320 bilhões de parâmetros com 18 bilhões ativos, com o comportamento de recusa editado. A cobertura do modelo base está em o que é o GLM-5.3-Flash.
Os números de avaliação são verificados independentemente? Não. Cada número no anúncio é um resultado reportado pela própria OrcaRouter, e nenhuma replicação de terceiros existia quando escrevemos isso. Os benchmarks mencionados são reais e públicos, então a replicação é possível se você tiver o hardware.
Qual formato devo usar? FP8 é o artefato de referência e aquele contra o qual as avaliações foram executadas. NVFP4 é o caminho prático de nó único para NVIDIA. GGUF e MLX existem agora e são a rota para configurações de workstation e Apple Silicon. Espere que o comportamento mude com a quantização, o que é precisamente por que você deseja uma suíte de testes repetível em vez de uma 'vibe check'.
A abliteração prejudica o desempenho geral? O trabalho publicado sobre a técnica geralmente encontra alguma degradação, e nenhum dos anúncios aborda isso para este modelo. Se a capacidade importa para você, compare-o você mesmo com o modelo base em vez de assumir paridade.
Por que a recusa parou em 11 a 18 por cento em vez de zero? Essa é a questão em aberto e a coisa mais interessante no lançamento. A visão declarada da OrcaRouter é que parte do alinhamento não é carregado por uma única direção de recusa linear. A explicação concorrente é uma implementação incompleta. De qualquer forma, não trate a taxa residual como um recurso de segurança.
Posso usar isso comercialmente? Os pesos têm licença MIT, que é permissiva. Essa é uma resposta de licenciamento, não uma resposta legal ou de política para sua implantação específica. Consulte sua equipe jurídica, especialmente se a saída atingir os usuários finais.
Concluindo
Dois lançamentos de formato em três dias, 2 milhões de visualizações no primeiro, e um catálogo de modelos abliterados por trás deles. A remoção da censura em si é rotineira neste ponto.
A parte que vale a pena guardar é o resultado negativo. Uma técnica que colapsa confiavelmente a recusa na maioria dos modelos abertos levou o GLM-5.3-Flash de 96% para 11% e parou, e o laboratório que o fez disse publicamente em vez de arredondar. Se isso se sustentar sob replicação independente, diz algo real sobre como a Z.ai treinou este modelo, e é uma contribuição melhor do que o checkpoint.
Se você for trabalhar com ele, faça as partes chatas corretamente. Meça o comportamento com uma suíte de requisições repetível que você pode apontar para qualquer endpoint e executar novamente no próximo mês, que é para o que o Apidog serve. Mantenha um registro de quem executou o quê contra quais pesos e quem o aprovou, que é para o que o Sharkly serve.
Um modelo sem censura não remove a obrigação de saber o que você executou. Ele a eleva.
