검열 없는 GLM-5.3-Flash가 합법적인 작업을 거부하지 않게 되는 방법

무검열 GLM-5.3-Flash는 양성적 과잉 거부율을 2.4%에서 0.4%로 낮춥니다. 얻을 수 있는 점, 평가 결과가 보여주는 것, 그리고 거부율이 11%에서 멈추는 이유.

Medy Evrard

1 September 2026

검열 없는 GLM-5.3-Flash가 합법적인 작업을 거부하지 않게 되는 방법

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

요약: OrcaRouter는 2026년 8월 29일 네이티브 block-FP8, 8월 31일 NVIDIA GPU용 NVFP4 빌드 등 두 차례에 걸쳐 18B 활성 매개변수를 가진 320B 매개변수 전문가 혼합(MoE) 모델인 GLM-5.3-Flash의 검열 제거된(abliterated) 가중치를 공개했습니다. GGUF 및 MLX 변환도 현재 제공됩니다. 제조사 보고 거부율은 크게 하락했는데, 예를 들어 MaliciousInstruct의 경우 96%에서 11%로 떨어졌지만 0%가 되지는 않았습니다. 가장 흥미로운 주장은 검열 제거 자체가 아닙니다. OrcaRouter는 GLM-5.3-Flash의 정렬(alignment) 중 일부가 단일 선형 거부 방향에 의해 매개되지 않는다고 말합니다. 이는 Z.ai의 안전 훈련이 이 기술이 일반적으로 목표로 하는 모델보다 구조적으로 더 깊다는 것을 의미합니다.

검열 제거(Abliteration)는 일상적인 일이 되었습니다. 누군가 공개 가중치 모델을 가져와 거부와 관련된 내부 방향을 식별하고 제거한 다음 그 결과를 업로드합니다. 대부분의 이러한 릴리스는 특별할 것이 없으며, 대부분의 보도는 과장되거나 질책하는 내용입니다.

이것은 모델이 이제 무엇을 말할지와는 전혀 관련 없는 이유 때문에 주의 깊게 읽을 가치가 있습니다. 릴리스 노트에는 최첨단 공개 가중치 모델 내에서 정렬이 어떻게 표현되는지에 대한 부정적인 결과가 포함되어 있으며, 해석 가능성 분야에서의 부정적인 결과는 또 다른 검열 제거된 체크포인트보다 더 희귀하고 유용합니다.

실제로 공개된 내용

두 가지 발표, 이틀 간격으로 이루어졌으며, 이후 조용하게 형식(format) 배포가 이어졌습니다.

OrcaRouter는 GLM-5.3-Flash의 검열 제거된 가중치를 원래의 block-FP8 정밀도로 공개했습니다. 이는 기본 모델과 수정된 모델 사이에 재양자화 단계가 없음을 의미합니다. 18B 활성 매개변수를 가진 320B 매개변수 모델로, 기본 모델의 아키텍처와 일치하며, 이는 저희가 GLM-5.3-Flash가 무엇인지GLM-5.3과 어떻게 비교되는지에서 다뤘던 내용입니다. 이 게시물은 이후 2백만 조회수를 넘어섰습니다.

2026년 8월 31일: NVFP4. NVIDIA의 4비트 부동 소수점 형식을 목표로 하는 두 번째 빌드로, 더 작은 설치 공간과 더 빠른 추론을 특징으로 합니다. 약 75,000회의 조회수를 기록했는데, 이는 이 형식 배포가 원본보다 훨씬 더 좁은 범위의 청중에게만 관심이 있음을 보여줍니다.

그 이후: GGUF 및 MLX. 두 발표 모두 다른 양자화된 형식이 출시될 것이라고 언급했습니다. 2026년 9월 1일 Hugging Face 조직을 확인한 결과, GLM-5.3-Flash-Uncensored-GGUFGLM-5.3-Flash-Uncensored-MLX가 모두 존재하며, 이는 llama.cpp 및 Apple Silicon 경로가 구현되었음을 의미합니다. 우리가 확인했을 때 이 두 파일의 다운로드 수는 여전히 0이었고, NVFP4 빌드는 5회였으며, FP8 원본은 1,541회였습니다. 관심은 아직 아티팩트가 아니라 발표에 쏠려 있습니다.

참고할 만한 배경 정보: 이것은 단발성이 아니라 제품 라인입니다. 동일한 조직에서 Qwen3.8-27B (FP8 빌드에서만 300,000회 이상 다운로드), Qwen3.8-Flash-Next, Gemma-4-26B의 검열 제거된 빌드를 호스팅합니다. GLM 릴리스는 기존 카탈로그의 최신 항목입니다.

이 가중치에는 MIT 라이선스가 적용되며, zai-org/GLM-5.3-Flash를 기본 모델로 명시합니다. 모델 카드에는 이 모델이 검열 제거됨, 시각-언어, MoE(전문가 혼합), 함수 호출 가능으로 태그되어 있어 기본 모델의 멀티모달 및 도구 사용 기능이 함께 제공됩니다.

“LoRA 없음, 탈옥 프롬프트 없음”이 의미하는 바

발표의 문구는 실제 의미를 담고 있으며, 대부분의 사람들이 상상하는 두 가지와 이것을 구별하기 때문에 자세히 살펴볼 가치가 있습니다.

탈옥 프롬프트는 추론 시 모델을 조작합니다. 안전 훈련은 그대로 유지되며, 당신은 그것을 우회하여 대화하는 것입니다. 이는 취약하며, 패치될 수 있고, 모든 요청에 대해 컨텍스트 비용이 발생합니다.

LoRA 어댑터는 로드 시점에 추가되는 소량의 가중치 집합입니다. 기본 모델은 변경되지 않으며 어댑터는 제거할 수 있습니다. 이는 당신이 부착하는 수정 사항입니다.

검열 제거(Abliteration)는 거부 동작에 해당하는 내부 활성화 방향을 식별하고 가중치 자체에서 이를 제거합니다. 부착할 것도, 제거할 것도 없습니다. 거부 동작은 런타임에 억제되는 것이 아니라 아티팩트에서 사라집니다.

이러한 구분은 실질적으로 중요합니다. 어댑터를 확인하거나 프롬프트를 스캔하여 검열 제거된 모델을 감사할 수 없습니다. 변경 사항이 가중치 자체에 있기 때문입니다. 출처가 중요한 환경에서 공개 모델을 실행하는 경우, 실제 체크포인트와 기본 모델의 계보를 확인하는 것은 이제 실제 공급망 문제입니다. 모델이 할 수 있는 일을 제한하는 것에 대한 저희의 일반적인 견해는 AI 에이전트 가드레일에 있습니다.

거부율 수치

이것은 OrcaRouter가 자체 보고한 수치이며, 작성 시점에는 독립적인 재현이 존재하지 않았습니다. 이 수치들을 제조사 보고로 간주하십시오.

벤치마크 기본 거부율 검열 제거 후
MaliciousInstruct 96% 11%
JailbreakBench 93% 12%
AdvBench 97% 15%
HarmBench 93% 18%
XSTest 양성 과도한 거부 2.4% 0.4%

마지막 행은 처음 네 행과 다르게 읽어야 합니다. XSTest는 과도한 거부(over-refusal)를 측정합니다. 이는 모델이 표면적으로 위험한 것과 패턴 일치하는 무해한 요청을 거부하는 것을 의미합니다. 이것이 개발자들이 실제로 운영 환경에서 겪는 실패 모드입니다. 예를 들어, "암호"라는 단어가 나타났다고 로그인 흐름 디버깅을 돕기를 거부하거나, 당신이 소유한 인프라를 위한 네트워크 스캐너 작성을 거부하거나 하는 모델과 같은 경우입니다. 2.4%에서 0.4%로 감소한 것은 실제 일상적인 가치를 지닌 행이며, 거의 아무도 인용하지 않는 부분입니다.

처음 네 행은 이것을 생산성 도구라기보다는 연구 결과물로 만드는 것이며, 그래서 여기서는 라이선스와 지역 법률이 평소보다 더 중요하게 작용합니다.

실제로 얻는 것

검열 제거된 모델에 대한 대부분의 보도는 이 모델이 존재해야 하는지에 대해 논쟁할 뿐, 왜 현업 엔지니어가 이러한 모델을 찾을지에 대해서는 다루지 않습니다. 실제적인 이점은 네 가지가 있으며, 이는 헤드라인 수치가 시사하는 것과는 다릅니다.

결코 해롭지 않은 작업을 거부하지 않습니다. 이것이 가장 큰 이점이며, XSTest 행에서 볼 수 있습니다. 양성 과도한 거부율이 2.4%에서 0.4%로 떨어졌습니다. 과도한 거부는 모든 개발자가 안전하게 튜닝된 모델에 대해 이미 지불하고 있는 대가입니다. "암호"라는 단어를 보았다고 비밀번호 재설정 흐름 디버깅을 돕지 않거나, 당신이 소유한 인프라를 위한 포트 스캐너 작성을 거부하거나, 위협 보고서가 위협을 설명한다고 해서 요약하기를 거부하는 모델 같은 경우입니다. 이 모든 것은 안전상의 이점이 아닙니다. 이는 모델이 주제와 의도를 구별하지 못하는 실패이며, 당신은 재시도, 프롬프트 재작성, 그리고 포기된 작업으로 그 대가를 치릅니다. 그 비율을 6배 줄이는 것이 당신의 주간 업무에서 가장 크게 나타날 이점입니다.

요청당 비용이 없고 고장 날 일이 없습니다. 오늘날 사람들이 실제로 사용하는 대안은 거부를 우회하는 프롬프트 엔지니어링입니다. 이는 모든 호출에 대해 컨텍스트 비용이 발생하고, 일관성 없는 결과를 생성하며, 공급업체가 패치할 때마다 작동이 중단됩니다. 가중치 수준의 수정은 이러한 특성을 전혀 가지고 있지 않습니다. 동작은 아티팩트의 속성이므로 요청 전반에 걸쳐 안정적이며, 어느 화요일에 당신도 모르게 조용히 변경되지 않습니다.

오픈 가중치는 배포가 당신의 통제하에 있음을 의미합니다. MIT 라이선스를 가지며, 자체 호스팅이 가능하고, 정확한 체크포인트에 고정할 수 있습니다. 당신의 프롬프트와 문서는 공급업체를 경유하지 않고 당신의 인프라 내에 머무릅니다. 분기 중반에 공급업체가 필터를 강화하여 당신이 배포한 워크플로우를 망가뜨릴 위험에 노출되지 않습니다. 규제된 환경에서는 이러한 제어가 핵심인 경우가 많으며, 수정되지 않은 가중치에도 동일한 주장이 적용됩니다. 그래서 저희는 GLM-5.3 오픈 가중치 자체 호스팅에 대해 작성했습니다.

기능 표면이 유지됩니다. 모델 카드에는 여전히 시각-언어 및 함수 호출이 나열되어 있으므로, 이것은 텍스트 전용으로 기능이 축소된 빌드가 아닙니다. 기본 모델의 멀티모달 및 도구 사용 경로가 함께 제공되며, 이는 채팅용이 아닌 에이전트적인 용도로 사용할 계획이라면 중요합니다.

이제 이 모든 것에 대한 솔직한 한계입니다. 이러한 이점 중 어느 것도 성능 향상이 아닙니다. 검열 제거는 행동적 편집이며, 이 기술에 대한 공개된 연구는 일반적으로 어느 정도의 품질 저하 비용을 발견하며, 어떠한 발표도 추론, 코딩 또는 시각 성능이 어떻게 변했는지 보고하지 않습니다. 당신은 측정된 거부율 감소를 측정되지 않은 성능 저하 위험과 맞바꾸는 것입니다. 그리고 기본 모델이 내리던 모든 필터링 결정은 이제 당신의 몫이 되었으며, 이는 절약되는 비용이 아니라 실제 인력 및 모니터링 비용입니다.

실제로 흥미로운 부분

발표의 마지막에 묻혀 있는, 읽을 가치가 있는 발견이 있습니다.

거부율이 일률적으로 0으로 떨어지지 않습니다. 네 가지 유해성 벤치마크에서 0~2%가 아니라 11%에서 18% 사이에 머물렀습니다. OrcaRouter의 설명에 따르면, GLM-5.3-Flash의 정렬 중 일부는 단일 선형 거부 방향에 의해 매개되지 않으며, Z.ai는 이 기술이 일반적으로 마주하는 것보다 훨씬 더 심층적인 거부 메커니즘을 구축했을 수 있습니다.

그것은 모델 내부에 대한 주장이며, 만약 사실로 밝혀진다면 릴리스 자체보다 더 중요한 의미를 가집니다.

검열 제거에 대한 표준적인 정신 모델은 거부가 활성화 공간에서 대체로 하나의 방향으로 작용한다는 것입니다. 그것을 찾아서 제거하면 행동이 붕괴됩니다. 이것은 충분히 많은 모델에서 잘 작동하여 사람들이 기정사실로 받아들이고 있습니다. 그 절차로 인해 96%에서 11%로 떨어지지만 그 지점에서 멈추는 모델은, 적어도 이 모델에 대해서는 정신 모델이 불완전하며, 기술이 도달하지 못하는 형태로 일부 정렬이 남아있다는 증거입니다.

두 가지 솔직한 주의사항. 첫째, 이것은 한 연구소의 자체 결과에 대한 해석이며, 다른 설명은 단순히 그들의 구현이 성능을 남겨두었다는 것입니다. 둘째, 잔여 11%에서 18%의 거부율은 누구도 의존해서는 안 되는 안전 속성이 아닙니다. 유해한 요청의 15%를 거부하는 모델은 안전한 모델이 아니라 신뢰할 수 없는 모델입니다.

그럼에도 불구하고, "우리 기술이 한계에 부딪혔고 그 이유는 아키텍처 때문이라고 생각한다"는 연구소들이 보통 출시 게시물에서 생략하는 종류의 내용입니다. OrcaRouter가 릴리스를 단순히 기능 배포가 아니라 정렬이 어떻게 표현되는지 연구하기 위한 아티팩트로 설명하는 것은 이 작업이 공개되는 더 나은 방식입니다.

확인할 가치가 있는 주장

주변 스레드에 있는 두 가지 사항은 회의적으로 볼 필요가 있으며, 이를 지적하는 것이 릴리스를 폄하하는 것은 아닙니다.

"Claude Opus 4.8 수준의 지능." 후속 게시물은 이 릴리스가 방어자들에게 해당 수준의 지능을 제공한다고 설명했습니다. 이 주장에는 어떠한 벤치마크도 동반되지 않았으며, 현재 Opus 세대가 아닌 모델 버전과의 비교입니다. 이를 마케팅으로 간주하십시오. 기능 동등성이 당신의 사용 사례에 중요하다면, 자체 평가를 수행하십시오.

거부율을 기능 프록시로 사용. 낮은 거부율이 높은 기능을 의미하지는 않습니다. 검열 제거는 행동적 편집이며, 이 기술에 대한 공개된 연구는 일반적으로 일반적인 성능 저하를 비용으로 발견합니다. 어떠한 발표도 추론, 코딩 또는 시각 성능이 기본 모델에 비해 어떻게 변했는지 다루지 않으며, 이는 대부분의 독자들이 실제로 알고 싶어 하는 수치입니다. 수정되지 않은 모델에 대한 저희의 벤치마크 및 가격 책정 내용은 GLM-5.3-Flash 가격GLM-5.3-Flash API 가이드에 있습니다.

실행 및 하드웨어 현실

18B가 활성 상태일지라도 320B 매개변수는 노트북 모델이 아닙니다. 현재 사용 가능한 형식은 누가 현실적으로 이를 실행할 수 있는지를 결정합니다.

호스팅된 엔드포인트를 호출하는 대신 자체 호스팅하는 경우, 기본 모델에 대한 저희의 안내서가 직접 적용됩니다: GLM-5.3-Flash 로컬 실행GLM-5.3 오픈 가중치 자체 호스팅. 이 범주에 대한 더 넓은 맥락을 위해, 저희는 검열 제거된 LLM 조사제한 없는 LLM에 대한 자료를 유지하고 있으며, DeepSeek R1 검열 제거된 릴리스가 가장 가까운 이전 비교 대상입니다.

이것을 평가하는 것은 API 테스트 문제입니다

여기에 실용적인 부분이 있으며, 이는 대부분의 보도에서 완전히 생략되는 부분입니다.

이러한 모델로 합법적인 작업을 수행한다면, 즉 안전 연구, 레드 및 블루 팀 연습, 또는 자체 필터가 무엇을 포착하는지에 대한 방어적 평가를 한다면, 실제 작업은 엔드포인트에 대해 대규모의 반복 가능한 요청 스위트를 실행하고 반환되는 내용을 검증하는 것입니다. 그것이 API 테스트입니다. 응답 본문에 모델 출력이 포함되어 있다고 해서 새로운 분야인 것은 아닙니다.

당신이 직면할 수 있는 특정 문제:

이것이 바로 API 플랫폼이 존재하는 이유입니다. Apidog에서는 엔드포인트를 한 번 정의하고, 프롬프트 스위트를 저장된 컬렉션으로 유지하며, 응답 필드를 어설션하고, 환경 변수를 통해 제공업체 또는 양자화 간에 기본 URL을 교환하며, 전체를 CI에서 실행하여 숫자가 일화적이지 않고 재현 가능하도록 합니다. 저희는 수정되지 않은 모델에 대한 메커니즘을 Apidog로 GLM-5.3-Flash API 테스트하기에서 살펴보았으며, 동일한 설정이 OpenAI 호환 엔드포인트에도 적용됩니다.

일반적인 원칙은 이 모델을 넘어서도 유효합니다. 모델 동작을 측정하고 방어해야 하는 시점이 되면, 다른 API 계약에 적용하는 것과 동일한 원칙이 필요합니다. 현재 당신의 평가가 다른 누구도 다시 실행할 수 없는 노트북에 있다면 Apidog를 다운로드하십시오. 관련 항목: 운영 환경 AI 에이전트 신뢰성.

레드 팀 작업에는 터미널이 아닌 감사 추적이 필요합니다

두 번째 실용적인 문제는 조직적인 것이며, 이러한 종류의 작업에서는 선택 사항이 아닙니다.

검열 제거된 모델에 대해 유해 프롬프트 벤치마크를 실행하는 것은 발생하기 전에 승인되어야 하고 나중에 귀속될 수 있어야 하는 정확히 그런 활동입니다. 누가 실행했는지, 어떤 체크포인트를 대상으로 했는지, 누구의 승인 하에, 어떤 범위 내에서. 만약 그 기록이 한 연구원의 셸 기록에만 존재한다면, 당신은 연구 프로그램을 가지고 있는 것이 아니라 책임을 지게 됩니다.

Sharkly는 세션 이후에도 유지되어야 하는 작업을 위해 구축되었으며, 이 사용 사례와 유달리 잘 맞습니다:

검열 제거된 모델은 연구 도구입니다. 기록 없이 사용된 연구 도구는 조직이 발생한 일을 설명할 수 없게 되는 방식입니다.

법적 및 안전 현실

간단하고 명확하게 언급할 가치가 있습니다.

가중치에 대한 MIT 라이선스는 가중치를 규율합니다. 이는 당신에게 출력물로 불법적인 일을 할 권한을 부여하지 않으며, 당신으로부터 책임을 이전하지도 않습니다. 지역 법률, 고용주의 정책, 그리고 당신이 운영하는 모든 플랫폼 약관은 여전히 적용되며, 그 어느 것도 모델이 거부하지 않았다는 사실에 신경 쓰지 않습니다.

합리적인 사용법은 릴리스가 명시하는 것들입니다: 안전 연구, 해석 가능성 작업, 레드 및 블루 팀 연습, 그리고 거부 메커니즘 연구. XSTest의 과도한 거부 개선 또한 일상적인 정당한 주장입니다. 일반적인 보안 엔지니어링에 도움이 되지 않는 모델이 실제 문제인 팀에게는 특히 그렇습니다.

최종 사용자에게 모델을 배포하는 경우, 검열 제거된 체크포인트는 전체 필터링 부담을 당신의 스택으로 옮깁니다. 이는 구성 플래그가 아니라 인력 및 모니터링 함의를 수반하는 설계 결정입니다.

자주 묻는 질문 (FAQ)

GLM-5.3-Flash-Uncensored는 GLM-5.3-Flash와 동일한 모델인가요? 동일한 아키텍처와 동일한 기본 가중치를 가지며, 18B 활성 매개변수를 가진 320B 매개변수 모델입니다. 거부 동작만 편집되었습니다. 기본 모델에 대한 내용은 GLM-5.3-Flash가 무엇인지에서 다루고 있습니다.

평가 수치는 독립적으로 검증되었나요? 아닙니다. 발표의 모든 수치는 OrcaRouter가 자체 보고한 결과이며, 저희가 이 글을 작성할 당시에는 제3자 재현이 존재하지 않았습니다. 언급된 벤치마크는 실제이며 공개되어 있으므로, 하드웨어가 있다면 재현이 가능합니다.

어떤 형식을 사용해야 하나요? FP8은 참조 아티팩트이며 평가가 실행된 형식입니다. NVFP4는 실용적인 단일 노드 NVIDIA 경로입니다. GGUF 및 MLX는 현재 존재하며 워크스테이션 및 Apple Silicon 설정에 적합한 경로입니다. 양자화에 따라 동작이 달라질 수 있으므로, 분위기 확인보다는 반복 가능한 테스트 스위트가 필요한 이유가 바로 여기에 있습니다.

검열 제거가 일반적인 성능을 저하시키나요? 이 기술에 대한 공개된 연구는 일반적으로 어느 정도의 성능 저하를 발견하며, 이 모델에 대한 어떠한 발표도 이를 다루지 않습니다. 기능이 중요하다면, 동일할 것이라고 가정하기보다는 기본 모델과 비교하여 직접 벤치마크를 수행하십시오.

왜 거부율이 0이 아니라 11~18%에서 멈췄나요? 그것이 미해결 질문이며 이번 릴리스에서 가장 흥미로운 부분입니다. OrcaRouter의 입장은 정렬의 일부가 단일 선형 거부 방향에 의해 이루어지지 않는다는 것입니다. 경쟁적인 설명은 불완전한 구현입니다. 어느 쪽이든, 잔여 거부율을 안전 기능으로 간주하지 마십시오.

상업적으로 사용할 수 있나요? 가중치는 MIT 라이선스가 적용되며, 이는 허용적입니다. 이는 라이선스 답변이며, 당신의 특정 배포에 대한 법적 또는 정책적 답변이 아닙니다. 특히 출력이 최종 사용자에게 도달하는 경우 법무팀에 문의하십시오.

마무리

3일 만에 두 가지 형식 배포, 첫 번째는 2백만 뷰, 그리고 그 뒤에는 검열 제거된 모델들의 카탈로그가 있습니다. 검열 제거 자체는 이 시점에서 일상적인 일입니다.

기억할 가치가 있는 부분은 부정적인 결과입니다. 대부분의 오픈 모델에서 거부율을 안정적으로 낮추는 기술이 GLM-5.3-Flash의 거부율을 96%에서 11%로 낮추고 멈췄으며, 이를 수행한 연구소는 반올림하지 않고 공개적으로 그렇게 밝혔습니다. 이것이 독립적인 재현에서 유지된다면, 그것은 Z.ai가 이 모델을 어떻게 훈련했는지에 대한 실제적인 의미를 가지며, 이는 체크포인트 자체보다 더 나은 기여입니다.

이것을 가지고 작업할 생각이라면, 지루한 부분을 제대로 수행하십시오. 다음 달에 어떤 엔드포인트에서든 다시 실행할 수 있는 반복 가능한 요청 스위트로 동작을 측정하십시오. 이것이 Apidog가 존재하는 이유입니다. 누가 어떤 가중치를 대상으로 무엇을 실행했고 누가 승인했는지 기록을 유지하십시오. 이것이 Sharkly가 존재하는 이유입니다.

button

검열 제거된 모델은 당신이 무엇을 실행했는지 알아야 할 의무를 제거하지 않습니다. 오히려 그 의무를 높입니다.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요