Cómo GLM-5.3-Flash sin censura deja de rechazar trabajo legítimo

GLM-5.3-Flash sin censura reduce el exceso de rechazo benigno de 2.4% a 0.4%. Lo que ganas, lo que muestran las evaluaciones y por qué el rechazo se detiene en el 11%.

Medy Evrard

1 September 2026

Cómo GLM-5.3-Flash sin censura deja de rechazar trabajo legítimo

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

En resumen: OrcaRouter publicó pesos "abliterados" para GLM-5.3-Flash, un modelo de mezcla de expertos con 320 mil millones de parámetros y 18 mil millones activos, en dos lanzamientos: FP8 de bloque nativo el 29 de agosto de 2026, y una compilación NVFP4 para GPUs NVIDIA el 31 de agosto. Las conversiones GGUF y MLX también están disponibles ahora. Las tasas de rechazo reportadas por el proveedor caen drásticamente, por ejemplo, MaliciousInstruct del 96% al 11%, pero no a cero. La afirmación más interesante no es la des-censura en absoluto: OrcaRouter dice que parte de la alineación de GLM-5.3-Flash no está mediada por una única dirección de rechazo lineal, lo que haría que la capacitación de seguridad de Z.ai sea estructuralmente más profunda que los modelos a los que esta técnica suele apuntar.

La abliteración se ha vuelto rutinaria. Alguien toma un modelo de pesos abiertos, identifica la dirección interna asociada con el rechazo, la elimina y sube el resultado. La mayoría de estos lanzamientos son poco notables, y la mayor parte de la cobertura es entusiasta o crítica.

Este vale la pena leerlo con atención, por una razón que no tiene nada que ver con lo que dirá el modelo ahora. Las notas de lanzamiento contienen un resultado negativo sobre cómo se representa la alineación dentro de un modelo de pesos abiertos de frontera, y los resultados negativos en interpretabilidad son más raros y útiles que otro punto de control sin censura.

Lo que realmente fue lanzado

Dos anuncios, con dos días de diferencia, más un lanzamiento de formato más discreto desde entonces.

OrcaRouter lanzó pesos sin censura para GLM-5.3-Flash con la precisión original de bloque FP8, lo que significa que no hay un paso de recuantificación entre el modelo base y el modificado. 320 mil millones de parámetros con 18 mil millones activos, coincidiendo con la arquitectura del modelo base, que cubrimos en qué es GLM-5.3-Flash y cómo se compara con GLM-5.3. La publicación ha superado desde entonces los 2 millones de visitas.

31 de agosto de 2026: NVFP4. Una segunda compilación dirigida al formato de punto flotante de 4 bits de NVIDIA, presentada por su menor tamaño y una inferencia más rápida. Aproximadamente 75.000 visitas, lo que indica que la reducción de formato interesa a una audiencia mucho más limitada que el original.

Desde entonces: GGUF y MLX. Ambos anuncios mencionaron que vendrían otros formatos cuantificados. Al revisar la organización Hugging Face el 1 de septiembre de 2026, GLM-5.3-Flash-Uncensored-GGUF y GLM-5.3-Flash-Uncensored-MLX ya existen, por lo que las rutas de llama.cpp y Apple Silicon han llegado. Las descargas de estos dos seguían en cero cuando los consultamos, y la compilación NVFP4 tenía 5 descargas, frente a las 1.541 del FP8 original. La atención está en el anuncio, no todavía en los artefactos.

Cabe destacar para el contexto: esta es una línea de productos, no algo puntual. La misma organización aloja compilaciones abliteradas de Qwen3.8-27B, que ha acumulado más de 300.000 descargas solo en su compilación FP8, Qwen3.8-Flash-Next y Gemma-4-26B. El lanzamiento de GLM es la entrada más reciente en un catálogo existente.

Los pesos tienen una licencia MIT y listan zai-org/GLM-5.3-Flash como el modelo base. La tarjeta del modelo lo etiqueta como abliterado, visión-lenguaje, MoE y capaz de llamar funciones, por lo que las capacidades multimodales y de uso de herramientas del modelo base se mantienen.

Qué significa "sin LoRA, sin 'jailbreak prompt'"

La fraseología en el anuncio es realmente importante y merece la pena desglosarla porque la distingue de las dos cosas que la mayoría de la gente imagina.

Un 'jailbreak prompt' manipula un modelo en tiempo de inferencia. La formación de seguridad está intacta; lo estás rodeando. Es frágil, se parchea y te cuesta contexto en cada solicitud.

Un adaptador LoRA es un pequeño conjunto de pesos adicionales que se superponen en el momento de la carga. El modelo base no cambia y el adaptador puede eliminarse. Es una modificación que adjuntas.

La abliteración identifica la dirección de activación interna que corresponde al comportamiento de rechazo y la elimina de los propios pesos. No hay nada que adjuntar ni nada que quitar. El comportamiento de rechazo ha desaparecido del artefacto, no se suprime en tiempo de ejecución.

Esa distinción importa en la práctica. No se puede auditar un modelo abliterado buscando adaptadores o escaneando prompts, porque el cambio está en los pesos. Si estás ejecutando modelos abiertos en cualquier entorno donde la procedencia importa, verificar el linaje del modelo base contra el punto de control real es ahora una verdadera cuestión de la cadena de suministro. Nuestra visión general sobre cómo restringir lo que los modelos pueden hacer se encuentra en las 'guardrails' de los agentes de IA.

Las cifras de rechazo

Estas son las cifras reportadas por el propio OrcaRouter, antes y después, y no existía replicación independiente en el momento de la redacción. Trátalas como datos reportados por el proveedor.

Evaluación Rechazo base Después de la abliteración
MaliciousInstruct 96% 11%
JailbreakBench 93% 12%
AdvBench 97% 15%
HarmBench 93% 18%
Exceso de rechazo benigno de XSTest 2.4% 0.4%

Lee la última fila de manera diferente a las cuatro primeras. XSTest mide el exceso de rechazo, lo que significa que el modelo declina solicitudes inofensivas que superficialmente coinciden con algo arriesgado. Ese es el modo de fallo que los desarrolladores realmente encuentran en producción: un modelo que se niega a ayudar a depurar un flujo de inicio de sesión porque apareció la palabra "contraseña", o que se niega a escribir un escáner de red para tu propia infraestructura. Pasar del 2.4% al 0.4% es la fila con valor legítimo diario, y es la que casi nadie cita.

Las cuatro primeras filas son las que hacen de esto un artefacto de investigación en lugar de una herramienta de productividad, y son la razón por la que la licencia y tu ley local importan más de lo habitual aquí.

Lo que realmente ganas

La mayoría de la cobertura sobre modelos abliterados discute si deberían existir y nunca llega a por qué un ingeniero en activo recurriría a uno. Hay cuatro ventajas reales, y no son las que sugieren los titulares.

Deja de rechazar trabajo que nunca fue dañino. Esta es la grande, y es la fila de XSTest: el exceso de rechazo benigno que cae del 2.4% al 0.4%. El exceso de rechazo es el impuesto que todo desarrollador ya paga en modelos sintonizados para la seguridad. El modelo que no te ayudará a depurar un flujo de restablecimiento de contraseña porque vio la palabra "contraseña". El que se niega a escribir un escáner de puertos para la infraestructura que posees. El que se niega a resumir un informe de amenazas porque el informe describe amenazas. Nada de eso es una victoria de seguridad; es un modelo que no distingue un tema de una intención, y lo pagas en reintentos, prompts reformulados y tareas abandonadas. Reducir esa tasa seis veces es la ventaja más probable de aparecer en tu semana.

Sin impuesto por solicitud y nada que romper. La alternativa que la gente usa hoy en día es la ingeniería de prompts para sortear el rechazo. Eso cuesta contexto en cada llamada, produce resultados inconsistentes y deja de funcionar cada vez que el proveedor lo parchea. La modificación a nivel de pesos no tiene ninguna de esas propiedades. El comportamiento es una propiedad del artefacto, por lo que es estable en todas las solicitudes y no cambia silenciosamente sin que te des cuenta un martes cualquiera.

Pesos abiertos significa que el despliegue es tuyo. Con licencia MIT, autoalojable y fijable a un punto de control exacto. Tus prompts y documentos permanecen dentro de tu infraestructura en lugar de transitar por un proveedor. No estás expuesto a que un proveedor endurezca sus filtros a mitad de trimestre y rompa un flujo de trabajo que lanzaste. Para entornos regulados, ese control es a menudo el objetivo, y el mismo argumento se aplica a los pesos sin modificar, por lo que escribimos sobre el autoalojamiento de los pesos abiertos de GLM-5.3.

La superficie de capacidad sobrevive. La tarjeta del modelo todavía lista visión-lenguaje y llamada a funciones, por lo que esta no es una compilación reducida solo de texto. Las rutas multimodales y de uso de herramientas del modelo base se mantienen, lo que importa si planeabas usarlo para algo agencial en lugar de para chatear.

Ahora, la limitación honesta de todo esto. Ninguna de estas ventajas son mejoras de capacidad. La abliteración es una edición de comportamiento, el trabajo publicado sobre la técnica generalmente encuentra algún costo en la calidad, y ninguno de los anuncios informa si el rendimiento en razonamiento, codificación o visión se modificó. Estás intercambiando una reducción medida en el rechazo por un riesgo no medido de degradación. Y cada decisión de filtrado que el modelo base estaba tomando ahora es tuya, lo que representa un costo real de personal y monitoreo en lugar de un ahorro.

La parte que es realmente interesante

Enterrado al final del anuncio se encuentra el hallazgo que vale la pena leer.

El rechazo no llega uniformemente a cero. En cuatro evaluaciones de daño, se sitúa entre el 11% y el 18%, no entre el 0% y el 2%. La interpretación declarada de OrcaRouter es que parte de la alineación de GLM-5.3-Flash no está mediada por una única dirección de rechazo lineal, y que Z.ai podría haber construido un mecanismo de rechazo sustancialmente más profundo de lo que esta técnica suele encontrar.

Esa es una afirmación sobre los internos del modelo, y si se mantiene, es más significativa que el propio lanzamiento.

El modelo mental estándar para la abliteración es que el rechazo es en gran medida una dirección en el espacio de activación. Encuéntrala, elimínala y el comportamiento colapsa. Ha funcionado lo suficientemente bien en suficientes modelos como para que la gente lo considere establecido. Un modelo donde ese procedimiento te lleva del 96% al 11% pero se estanca ahí es evidencia de que el modelo mental está incompleto, al menos para este modelo, y que algo de alineación sobrevive en una forma a la que la técnica no llega.

Dos advertencias honestas. Primero, esta es la interpretación de un laboratorio de su propio resultado, y la explicación alternativa es simplemente que su implementación dejó rendimiento sin aprovechar. Segundo, una tasa de rechazo residual del 11% al 18% no es una propiedad de seguridad en la que nadie debería confiar. Un modelo que declina el 15% de las solicitudes dañinas no es un modelo seguro; es uno poco fiable.

Aun así, 'nuestra técnica tocó fondo y creemos que la razón es arquitectónica' es el tipo de cosa que los laboratorios suelen omitir en una publicación de lanzamiento. Que OrcaRouter enmarque el lanzamiento como un artefacto para estudiar cómo se representa la alineación, en lugar de puramente como una mejora de capacidad, es la mejor versión de cómo se publica este trabajo.

Afirmaciones que vale la pena verificar

Dos cosas en el hilo circundante merecen escepticismo, y señalarlas no es una crítica al lanzamiento.

"Inteligencia a nivel de Claude Opus 4.8." Una publicación de seguimiento describió el lanzamiento como armar a los defensores con inteligencia de ese nivel. Ningún benchmark acompañó la afirmación, y es una comparación con una versión del modelo que no es la generación actual de Opus. Trátalo como marketing. Si la paridad de capacidad importa para tu caso de uso, realiza tu propia evaluación.

Tasas de rechazo como proxy de capacidad. Un bajo rechazo no significa una alta capacidad. La abliteración es una edición de comportamiento, y el trabajo publicado sobre la técnica generalmente encuentra cierta degradación en el rendimiento general como costo. Ninguno de los anuncios aborda si el rendimiento en razonamiento, codificación o visión se modificó en relación con el modelo base, y ese es el número que la mayoría de los lectores realmente querrían. Nuestra cobertura de benchmarks y precios del modelo sin modificar se encuentra en los precios de GLM-5.3-Flash y la guía de la API de GLM-5.3-Flash.

Ejecución y la realidad del hardware

320 mil millones de parámetros no es un modelo para laptop, incluso con 18 mil millones activos. Los formatos ahora disponibles determinan quién puede ejecutarlo de manera realista:

Si estás autoalojando en lugar de llamar a un endpoint alojado, nuestros tutoriales para el modelo base se aplican directamente: ejecutar GLM-5.3-Flash localmente y autoalojar los pesos abiertos de GLM-5.3. Para un contexto más amplio sobre esta categoría, mantenemos una encuesta de LLMs sin censura y un vistazo a LLMs sin restricciones, y el lanzamiento abliterado de DeepSeek R1 es la comparación previa más cercana.

Evaluar esto es un problema de pruebas de API

Aquí está la parte práctica, y es la parte que la mayoría de la cobertura omite por completo.

Si estás realizando un trabajo legítimo con un modelo como este, es decir, investigación de seguridad, ejercicios de equipos rojos y azules, o una evaluación defensiva de lo que capturan tus propios filtros, entonces el trabajo real es ejecutar un conjunto grande y repetible de solicitudes contra un endpoint y afirmar lo que se recibe. Eso es pruebas de API. No es una disciplina novedosa solo porque el cuerpo de la respuesta contenga la salida del modelo.

Los problemas específicos que encontrarás:

Para esto es exactamente una plataforma de API. En Apidog, defines el endpoint una vez, mantienes la suite de prompts como una colección guardada, realizas aserciones sobre los campos de respuesta, intercambias la URL base entre proveedores o cuantificaciones a través de variables de entorno, y ejecutas todo en CI para que los números sean reproducibles en lugar de anecdóticos. Recorrimos la mecánica contra el modelo sin modificar en probar la API de GLM-5.3-Flash con Apidog, y la misma configuración apunta a cualquier endpoint compatible con OpenAI.

El principio general se aplica mucho más allá de este modelo: una vez que el comportamiento del modelo se convierte en algo que tienes que medir y defender, necesitas la misma disciplina que aplicarías a cualquier otro contrato de API. Descarga Apidog si tu evaluación actualmente reside en un cuaderno que nadie más puede volver a ejecutar. Relacionado: fiabilidad de agentes de IA en producción.

El trabajo del equipo rojo necesita una pista de auditoría, no una terminal

El segundo problema práctico es organizacional, y para esta categoría de trabajo no es opcional.

Ejecutar benchmarks de prompts dañinos contra un modelo abliterado es exactamente el tipo de actividad que necesita ser aprobada antes de que ocurra y ser atribuible después. Quién lo ejecutó. Contra qué punto de control. Con la aprobación de quién. Bajo qué alcance. Si ese registro vive en el historial de shell de un investigador, no tienes un programa de investigación, tienes una responsabilidad.

Sharkly está construido para un trabajo que necesita sobrevivir a la sesión, y este caso de uso encaja inusualmente bien:

Un modelo sin censura es una herramienta de investigación. Las herramientas de investigación utilizadas sin un registro son la forma en que las organizaciones terminan sin poder explicar lo que sucedió.

Breve y vale la pena decirlo claramente.

La licencia MIT sobre los pesos rige los pesos. No te otorga permiso para hacer cosas ilegales con la salida, y no te transfiere la responsabilidad. La ley local, la política de tu empleador y los términos de cualquier plataforma bajo la que operes aún se aplican, y a ninguno de ellos le importa que el modelo no se haya negado.

Los usos razonables son los que el lanzamiento menciona: investigación de seguridad, trabajo de interpretabilidad, ejercicios de equipos rojos y azules, y estudio del mecanismo de rechazo. La mejora en el exceso de rechazo de XSTest también es un argumento legítimo para el día a día, para equipos cuyo problema real es un modelo que no ayuda con la ingeniería de seguridad ordinaria.

Si estás desplegando cualquier modelo a usuarios finales, un punto de control sin censura traslada toda la carga de filtrado a tu propia pila. Esa es una decisión de diseño con implicaciones de personal y monitoreo, no una bandera de configuración.

Preguntas Frecuentes

¿Es GLM-5.3-Flash-Uncensored el mismo modelo que GLM-5.3-Flash? Misma arquitectura y mismos pesos base, 320 mil millones de parámetros con 18 mil millones activos, con el comportamiento de rechazo editado. La cobertura del modelo base se encuentra en qué es GLM-5.3-Flash.

¿Están verificadas de forma independiente las cifras de evaluación? No. Cada cifra en el anuncio es un resultado reportado por el propio OrcaRouter, y no existía replicación de terceros cuando escribimos esto. Los benchmarks mencionados son reales y públicos, por lo que la replicación es posible si tienes el hardware.

¿Qué formato debo usar? FP8 es el artefacto de referencia y el utilizado para las evaluaciones. NVFP4 es la ruta práctica para un nodo único NVIDIA. GGUF y MLX existen ahora y son la ruta para estaciones de trabajo y configuraciones de Apple Silicon. Espera que el comportamiento cambie con la cuantificación, razón por la cual deseas una suite de pruebas repetible en lugar de una "prueba de sensaciones".

¿La abliteración perjudica el rendimiento general? El trabajo publicado sobre la técnica generalmente encuentra cierta degradación, y ninguno de los anuncios lo aborda para este modelo. Si la capacidad te importa, compáralo tú mismo con el modelo base en lugar de asumir la paridad.

¿Por qué el rechazo se detuvo entre el 11 y el 18 por ciento en lugar de cero? Esa es la pregunta abierta y lo más interesante del lanzamiento. La opinión declarada de OrcaRouter es que parte de la alineación no es transportada por una única dirección de rechazo lineal. La explicación contrapuesta es una implementación incompleta. De cualquier manera, no trates la tasa residual como una característica de seguridad.

¿Puedo usar esto comercialmente? Los pesos tienen licencia MIT, lo cual es permisivo. Esa es una respuesta de licencia, no una respuesta legal o de política para tu despliegue específico. Consulta a tu equipo legal, especialmente si la salida llega a usuarios finales.

Para finalizar

Dos lanzamientos de formato en tres días, 2 millones de visitas en el primero y un catálogo de modelos abliterados detrás de ellos. La des-censura en sí misma es rutinaria a estas alturas.

La parte que vale la pena conservar es el resultado negativo. Una técnica que colapsa de manera fiable el rechazo en la mayoría de los modelos abiertos llevó a GLM-5.3-Flash del 96% al 11% y se detuvo, y el laboratorio que lo hizo lo dijo públicamente en lugar de redondear al alza. Si eso se mantiene bajo replicación independiente, dice algo real sobre cómo Z.ai entrenó este modelo, y es una mejor contribución que el punto de control.

Si vas a trabajar con ello, haz las partes aburridas correctamente. Mide el comportamiento con una suite de solicitudes repetible que puedas apuntar a cualquier endpoint y volver a ejecutar el próximo mes, que es para lo que sirve Apidog. Mantén un registro de quién ejecutó qué contra qué pesos y quién lo aprobó, que es para lo que sirve Sharkly.

button

Un modelo sin censura no elimina la obligación de saber qué ejecutaste. La eleva.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs