GLM-5.2 무제한 사용법

GLM-5.2는 MIT 라이선스 오픈 웨이트이므로, 제한 없이 사용하는 것이 지원되는 경로입니다: 원시 API 제어, 자체 호스팅, 검열 없는 빌드, 그리고 Apidog에서 각각을 테스트하는 방법.

Ashley Innocent

Ashley Innocent

7 July 2026

GLM-5.2 무제한 사용법

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

GLM-5.2는 직접 하드웨어에서 실행할 수 있는 몇 안 되는 최첨단 모델 중 하나입니다. MIT 라이선스 하에 지역 제한 없이 공개 가중치(open weights)로 제공되므로, "제한 없이 사용하는 것"은 꼼수가 아닙니다. 이는 지원되는 경로입니다. 중요한 것은 어떤 제한에 부딪히고 있는지 아는 것인데, 각 제한마다 해결책이 다르기 때문입니다.

버튼

TL;DR (핵심 요약)

먼저, 어떤 제한에 부딪히고 있는지 파악하십시오

“제한”은 모호한 단어입니다. GLM-5.2의 경우 일반적으로 네 가지 다른 의미 중 하나를 뜻하며, 각 의미마다 고유한 해결책이 있습니다.

  1. 지시 튜닝(instruct tuning)으로 인한 거부. 출시된 채팅 모델은 일부 요청을 거부하도록 정렬되어 있습니다. 이 동작은 가중치(weights)에 내재되어 있습니다.
  2. 채팅 앱의 제품 필터. 소비자용 웹 UI는 모델 위에 자체 중재 계층을 추가할 수 있습니다. API는 앱과 다르게 작동하는 경우가 많습니다.
  3. 플랜 및 속도 제한. 무료 티어 및 코딩 플랜 티어는 요청, 컨텍스트 또는 출력을 제한합니다. 이는 할당량이지 콘텐츠 규칙이 아닙니다.
  4. 사고(thinking) 과정 및 안전 라우팅 오버헤드. 확장된 추론 및 안전 라우팅은 지연 시간을 추가하고 어조를 바꿀 수 있습니다.

지역은 이 목록에 의도적으로 포함되지 않았습니다. GLM-5.2 가중치는 지역 제한 없는 MIT 라이선스를 따르므로, 일부 호스팅 전용 모델처럼 국가에 따라 접근이 제한되지 않습니다.

레버 1: 채팅 앱이 아닌 원시 API 사용

가장 큰 효과를 볼 수 있는 가장 빠른 변화는 소비자용 채팅 창 사용을 중단하고 API를 직접 호출하는 것입니다. 이 엔드포인트는 OpenAI 호환이므로, 자신만의 시스템 프롬프트를 유지하고, 온도(temperature)를 설정하며, 사고(thinking) 단계를 비활성화할 수 있습니다.

사고(thinking) 과정을 비활성화한 최소한의 curl 호출:

curl https://api.z.ai/api/paas/v4/chat/completions \
 -H "Authorization: Bearer $ZAI_API_KEY" \
 -H "Content-Type: application/json" \
 -d '{
 "model": "glm-5.2",
 "thinking": { "type": "disabled" },
 "temperature": 0.7,
 "messages": [
 { "role": "system", "content": "You are a direct, unfiltered technical assistant. Answer concisely." },
 { "role": "user", "content": "Explain how abliteration changes a model." }
 ]
 }'

OpenAI Python SDK를 사용하여 z.ai를 가리키도록 재설정한 동일한 호출:

from openai import OpenAI

client = OpenAI(
 api_key="YOUR_ZAI_KEY",
 base_url="https://api.z.ai/api/paas/v4/",
)

resp = client.chat.completions.create(
 model="glm-5.2",
 temperature=0.7,
 extra_body={"thinking": {"type": "disabled"}},
 messages=[
 {"role": "system", "content": "You are a direct, unfiltered technical assistant."},
 {"role": "user", "content": "Explain how abliteration changes a model."},
 ],
)
print(resp.choices[0].message.content)

여기서 두 가지가 중요합니다. 시스템 프롬프트는 당신의 것이므로, 앱 기본값을 상속하는 대신 어조와 범위를 직접 조종할 수 있습니다. 그리고 `thinking: {"type": "disabled"}`는 원시적이고 빠른 출력을 원할 때 추론 과정을 건너뜁니다. 전체 파라미터 설정은 GLM-5.2 API 가이드를 참조하십시오.

가격은 변동될 수 있으므로, 예산을 책정하기 전에 실시간으로 확인하십시오. 이 글을 쓰는 시점에서 보조 자료들은 100만 입력 토큰당 약 $1.40, 100만 출력 토큰당 약 $4.40로 나열합니다. GLM-5.2 가격 분석에서 현재 수치를 확인하고, 비용이 실제 제약이라면 GLM-5.2를 무료로 사용하는 방법을 읽어보십시오.

레버 2: 공개 가중치를 자체 호스팅

이것이 진정한 "제한 없음" 해답입니다. 가중치(weights)가 MIT 라이선스를 따르므로, GLM-5.2를 직접 다운로드하여 서비스할 수 있습니다. 모델이 당신의 컴퓨터에서 실행될 때, 공급업체 UI 필터도 없고 외부 속도 제한도 없습니다. 시스템 프롬프트와 정책을 직접 설정합니다.

가장 간단한 방법은 Ollama입니다:

ollama run glm-5.2

하드웨어 현실 점검: GLM-5.2는 약 753B 파라미터의 MoE 모델이므로, 전체 가중치에는 상당한 VRAM이 필요합니다. 대부분의 사람들에게 이는 양자화된 빌드(quantized build), 임대한 멀티 GPU 상자(multi-GPU box) 또는 더 작은 GLM 변형을 의미합니다. 하드웨어가 보통 수준이라면, GLM-4.7-Flash는 훨씬 적은 자원으로 로컬에서 실행되며 파이프라인을 구축하는 동안 훌륭한 대체품이 됩니다. 일반적인 GLM 로컬 실행 가이드Ollama 설정 가이드에서 나머지를 다룹니다.

로컬에서 서비스되면, Ollama는 `http://localhost:11434/v1`에 자체 OpenAI 호환 엔드포인트를 노출하므로, 기본 URL만 변경하면 레버 1의 동일한 코드가 작동합니다.

레버 3: 커뮤니티의 검열 없는 (제거된) 빌드

지시 튜닝(instruct tuning)에 거부 기능이 내재되어 있습니다. 오픈 소스 커뮤니티는 완전한 재훈련 없이 거부를 유발하는 내부 지시를 억제하는 제거(abliteration)라는 과정을 통해 그 동작을 제거합니다. 동일한 기술이 QwQDeepSeek R1을 포함한 다른 공개 모델의 검열 없는 빌드를 가능하게 합니다.

GLM-5.2 가중치가 공개되어 있고 MIT 라이선스를 따르므로, 이 기술은 여기에도 적용됩니다. 미리 만들어진 GLM-5.2 제거된(abliterated) 빌드가 아직 제공될 것이 보장되지 않으며, 가용성은 자주 변동되므로, 존재한다고 가정하기보다 Hugging Face에서 현재 버전을 검색하십시오. 5.2 빌드가 없다면, 작업 흐름은 QwQ 및 DeepSeek R1 가이드와 동일합니다: 제거된 가중치를 가져와 Ollama 또는 vLLM에 로드하여 서비스합니다.

이것은 내장된 거부 기능을 제거하는 가장 완전한 방법이며, 또한 가장 많은 책임을 사용자에게 부과하는 방법이기도 합니다. 배포하기 전에 책임 섹션을 읽어보십시오.

레버 4: 정책을 설정할 수 있는 공급자 선택

자체 서버를 운영하고 싶지 않다면, 라우팅 제공업체가 중간 지점입니다. GLM-5.2는 OpenRouter에 `z-ai/glm-5.2`로 등재되어 있으며 Ollama 라이브러리에도 있습니다. 라우터를 사용하면 앱을 다시 작성할 필요 없이 자신만의 중재 설정을 적용하고 기본 호스트를 바꿀 수 있어, 관리형 엔드포인트를 유지하면서 소비자 UI 필터를 우회할 수 있습니다.

결정하기 전에 GLM-5.2를 다른 공개 옵션과 비교하고 싶다면, 이 내용은 제한 없는 LLM의 더 넓은 요약과 함께 있습니다.

배포하기 전에 Apidog에서 모든 설정을 테스트하십시오

어떤 레버를 선택하든, OpenAI 호환 엔드포인트를 얻게 됩니다. 제품에 연결하기 전에 예상대로 작동하는지 확인하십시오. Apidog은 최종 텍스트뿐만 아니라 원시 스트리밍 응답을 검사할 수 있기 때문에 이를 수행하는 깔끔한 방법입니다.

  1. 엔드포인트를 가리키는 Apidog에서 새 요청을 생성하십시오 (호스팅된 API의 경우 `https://api.z.ai/api/paas/v4/chat/completions`, 로컬 빌드의 경우 `http://localhost:11434/v1/chat/completions`).
  2. 호스팅된 API의 경우 `Authorization: Bearer` 헤더를 추가하십시오. 로컬 Ollama는 키가 필요 없습니다.
  3. `model: glm-5.2`, 시스템 메시지, `stream: true`가 포함된 `chat/completions` 본문을 전송하십시오.
  4. SSE 스트림을 확인하십시오. 사고 변화(thinking deltas)와 콘텐츠 변화(content deltas)를 별도로 볼 수 있으며, 토큰 수가 포함된 `usage` 객체도 볼 수 있습니다.
  5. `thinking`을 켜고 끄면서 두 응답을 나란히 비교하십시오.

이는 운영 환경에서 나중에 알게 되는 대신, 시스템 프롬프트가 실제로 적용되었는지, 그리고 모델이 선택한 설정이 약속하는 방식으로 응답하는지 확인하는 방법입니다.

책임에 대한 한마디

제품 필터를 제거하고 검열 없는 가중치를 실행하는 것은 합법적입니다. 이는 연구, 레드 팀 작업, 그리고 다른 사람의 중재를 상속하는 대신 자신만의 중재를 구축하는 데 일반적입니다. 하지만 일단 자체 호스팅을 시작하면, 중재와 법적 노출은 전적으로 당신의 책임입니다. 안전 장치가 적다는 것은 결과에 대한 책임이 전적으로 당신에게 있다는 의미입니다. 세 가지를 명심하십시오:

자주 묻는 질문

GLM-5.2는 정말 오픈 소스인가요?

가중치(weights)는 사용 가능한 가장 관대한 라이선스 중 하나인 MIT 라이선스 하에 출시됩니다. 라이선스 약관에 따라 상업적 용도를 포함하여 실행, 수정 및 자체 호스팅할 수 있습니다. 전체 정체성 및 사양 분석에 대해서는 GLM-5.2란 무엇인가를 참조하십시오.

GLM-5.2 API는 응답을 검열하나요?

지시 모델은 튜닝을 통해 정렬되어 있으므로 일부 프롬프트를 거부할 수 있습니다. API는 시스템 프롬프트 제어 기능을 제공하고 사고(thinking) 과정을 비활성화할 수 있도록 하여, 대부분의 어조 및 과도한 거부 문제를 처리합니다. 내장된 거부 기능을 완전히 제거하려면 제거된(abliterated) 빌드를 자체 호스팅하십시오.

노트북에서 GLM-5.2를 실행할 수 있나요?

전체 753B 모델은 아닙니다. 로컬 테스트를 위해 양자화된 빌드(quantized build), 임대한 GPU 상자, 또는 GLM-4.7-Flash와 같은 더 작은 GLM 변형을 사용하고, 필요할 때 동일한 코드를 더 큰 모델로 지정하십시오.

GLM-5.2는 지역 잠금되어 있나요?

아닙니다. 가중치(weights)는 지역 제한 없는 MIT 라이선스를 따릅니다. 호스팅된 API 가용성은 공급업체마다 다를 수 있지만, 자체 호스팅은 누구에게나 열려 있습니다.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요