국제적으로 Z.ai로 활동하는 중국 연구소인 Zhipu AI는 2026년 8월 14일 GLM-5.3을 출시했으며, 코딩 성능 수치가 그 핵심입니다. 내부 평가에 따르면 GLM-5.2 대비 코딩 기능이 50% 향상되었고, Terminal-Bench 3.0 점수는 4.6에서 28.3으로 급증했습니다. BigGo의 출시 보고서에 따르면 Zhipu는 이 모델의 코딩 및 에이전트 기능을 “Claude Fable 5에 근접한다”고 설명합니다. 오픈 웨이트는 약 2주 후에 공개될 예정입니다. 전체 기능 분석 및 벤치마크 표는 GLM-5.3이란 무엇인가를 참조하십시오. 이 문서는 실용적인 API 빠른 시작 가이드입니다.
여기서 다룰 내용은 다음과 같습니다. API 키를 받고, cURL로 첫 호출을 하고, OpenAI SDK를 통해 Python 및 Node.js로 포팅하며, 토큰을 스트리밍하고, 중요한 매개변수를 조정하며, 애플리케이션 코드를 작성하기 전에 요청 형태를 고정할 수 있도록 전체 루프를 Apidog에 연결하는 것입니다. 미리 말씀드리자면 좋은 소식은 Z.ai의 API는 OpenAI와 호환된다는 점입니다. 이전에 OpenAI 스타일 엔드포인트를 호출해 본 적이 있다면, 대부분의 내용을 이미 알고 계실 것입니다.
코드를 시작하기 전에 한 가지 주의사항이 있습니다. GLM-5.3이 오늘 출시되었고, 출시일에는 Zhipu의 문서가 빠르게 변경됩니다. 제가 확인했을 때 공식 문서에서 직접 가져온 모든 내용은 검증된 것으로 제시됩니다. 아직 문서에 반영되지 않은 내용은 GLM-5 제품군의 관례로 표시되며, 현재 상태를 직접 확인할 수 있는 링크가 제공됩니다.
요약 (TL;DR)
- GLM-5.3이 2026년 8월 14일에 출시되었습니다. Zhipu의 내부 평가에 따르면 GLM-5.2 대비 코딩 성능이 50% 향상되었으며, Terminal-Bench 3.0 점수가 4.6에서 28.3으로 급증했습니다. Terminal-Bench 3.0 및 Agents’ Last Exam에서 오픈소스 모델 중 1위를 차지했습니다.
- API는 OpenAI와 호환됩니다. 국제 엔드포인트: `Authorization: Bearer $GLM_API_KEY` 헤더와 함께 `POST https://api.z.ai/api/paas/v4/chat/completions`. 중국 본토: `https://open.bigmodel.cn/api/paas/v4/chat/completions`.
- 이 문서 작성 시점에 GLM-5 문서 페이지에는 모델 ID로 `glm-5`가 기재되어 있었습니다. Zhipu의 가격 책정 페이지에는 `glm-5.2`와 `glm-5.1`이 별도의 모델로 표시되어 있으므로, `glm-5.3`도 동일한 점 표기 규칙을 따를 것으로 예상됩니다. 하드코딩하기 전에 확인하십시오.
- Zhipu는 출시 당시 5.3 특정 API 가격을 공개하지 않았습니다. 참고로, 공식 가격 페이지에는 GLM-5.2가 100만 입력 토큰당 $1.40, 100만 출력 토큰당 $4.40으로, GLM-5는 $1.00 및 $3.20으로 기재되어 있었습니다.
- 오픈 웨이트는 2026년 8월 28일경 Hugging Face에 공개됩니다. GLM 코딩 플랜 할당량은 8월 14일 모든 사용자에게 재설정되었습니다.
- Apidog에서 먼저 테스트하십시오. 지역 엔드포인트별로 하나의 환경을 설정하고, 모델 ID를 변수 뒤에 두며, 프롬프트 반복으로 토큰 요금이 발생하지 않도록 저장된 응답을 픽스처로 사용하십시오.
GLM-5.3이 중요한 이유
기본 모델은 변경되지 않았습니다. 이번 릴리스의 모든 향상은 GLM-5에 대한 확장된 후처리 학습에서 비롯되었으며, 이는 성능 향상의 폭을 이례적으로 만듭니다. Terminal-Bench 3.0은 4.6에서 28.3으로 상승했는데, 이는 GLM을 해당 벤치마크와 Agents’ Last Exam에서 무관심한 수준에서 오픈소스 모델 중 1위로 끌어올린 6.2배의 발전입니다. SWE-Marathon은 GLM-5.2 대비 약 두 배 증가했습니다. 보안 측면에서는 CyberGym이 84.5%를 기록하여 Claude Mythos 5와 GPT-5.6 Sol보다 약간 높았지만, ExploitBench는 54.4%로 아직 최첨단 모델에 뒤처져 있습니다. 출처에 유의하십시오. 50% 코딩 성능 향상 주장과 이 점수 중 일부는 Zhipu 자체 평가에서 나온 것이므로, 제3자가 이를 재현하기 전까지는 공급업체의 보고서로 간주하십시오.

기반 아키텍처는 GLM-5 제품군의 기준선입니다. Z.ai의 문서에 따르면, 총 7440억 개의 매개변수를 가진 MoE(Mixture of Experts) 설계이며, 각 순방향 통과에 약 400억 개가 활성화되고, 20만 토큰의 컨텍스트 창을 가집니다. 이는 제품군 사양이며, 5.3 특정 주장은 아닙니다.
API 사용자에게 이번 릴리스가 중요한 두 가지 이유가 더 있습니다. 첫째, Pandaily의 출시 보도에 따르면 Zhipu는 GLM-5.3의 오픈 웨이트를 출시 약 2주 후인 8월 28일경, 자사의 가장 광범위한 위험 검토 시스템과 함께 공개할 것이라고 밝혔습니다. 자체 호스팅이 로드맵에 있다면, 오늘 설정하는 API는 회귀 기준선으로도 활용될 수 있습니다. GLM-5.3 자체 호스팅 준비 가이드에서 이 전략을 자세히 다룹니다. 둘째, Seeking Alpha는 Zhipu를 "중국 OpenAI 경쟁자"로 평가하며, 이 정도 수준의 기능으로 오픈 웨이트가 출시되면 전체 시장 가격에 영향을 미치는 경향이 있습니다.
API 키 받기
지역별로 두 가지 플랫폼이 있으며, 이 구분은 이 가이드의 나머지 모든 내용에 적용됩니다.
Z.ai (국제). z.ai에서 가입하고, API 콘솔을 열고, 키를 생성하십시오. 문서는 docs.z.ai에 있습니다. 이는 중국 본토 외부에 있는 모든 사용자를 위한 경로이며, 이 문서의 나머지 부분이 기본으로 사용하는 엔드포인트입니다.
Bigmodel.cn (중국 본토). Zhipu의 국내 플랫폼은 open.bigmodel.cn입니다. 동일한 API 형태, 동일한 인증 방식, 다른 호스트 및 별도의 요금 청구 방식입니다. 트래픽이 중국 본토에서 발생한다면 이 플랫폼을 사용하십시오. 지연 시간과 규정 준수 모두 이쪽을 가리킵니다.
어떤 플랫폼을 선택하든, 키를 한 번 내보내고 코드에서 제외하십시오:
export GLM_API_KEY="your-key-from-the-console"
종량제 API 요금이 아닌 GLM 코딩 플랜을 사용하고 있다면, 8월 14일에 모든 사용자의 할당량이 재설정되었으므로 5.3 시대를 새로운 허용량으로 시작한다는 점을 참고하십시오.
엔드포인트 및 인증
이 문서 작성 시점에 GLM-5 문서와 비교하여 확인된 채팅 완성 엔드포인트:
POST https://api.z.ai/api/paas/v4/chat/completions
중국 본토는 호스트를 바꿉니다:
POST https://open.bigmodel.cn/api/paas/v4/chat/completions
인증은 하나의 헤더입니다: `Authorization: Bearer $GLM_API_KEY`. 서명이나 세션 핸드셰이크는 없습니다.
OpenAI 호환은 정확히 여러분이 바라는 의미를 가집니다. 요청 본문은 `model`과 `messages` 배열 형태이며, 응답은 `choices`, `message`, `finish_reason`, `usage`와 함께 반환됩니다. 공식 OpenAI SDK는 `base_url`을 Z.ai로 지정하면 수정 없이 작동합니다. 다른 OpenAI 호환 제공업체를 대상으로 작성한 모든 코드는 호스트와 모델을 교체하면 포팅됩니다. 이 패턴은 DeepSeek V4 Pro의 API를 위해 다루었던 것과 동일합니다.
모델 ID에 대한 솔직한 주의사항입니다. 제가 출시 당일에 문서를 가져왔을 때, GLM-5 페이지에는 모델 문자열로 `glm-5`가 기재되어 있었고 5.3에 대한 업데이트는 아직 이루어지지 않았습니다. Zhipu의 가격 책정 페이지는 `glm-5.2`와 `glm-5.1`을 별개의 모델로 청구하고 있으므로, 제품군 관례에 따르면 새로운 ID는 `glm-5.3`입니다. 아래 예시에서는 이를 사용하지만, 프로덕션에서 고정하기 전에 문서를 확인하십시오. 만약 여러분의 지역에서 `glm-5.3`이 404 오류를 반환한다면, `glm-5`로 대체해도 동일한 제품군에 속합니다.
cURL로 첫 요청 보내기
완전한 작동 호출:
curl "https://api.z.ai/api/paas/v4/chat/completions" \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "system",
"content": "You are a code reviewer. Flag issues as blocking or non-blocking."
},
{
"role": "user",
"content": "Review this shell script for safety:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
}
],
"temperature": 0.3,
"max_tokens": 1024
}'
응답은 표준 OpenAI 형태입니다. `choices[0].message.content`에 답변이 담긴 `choices` 배열과 `prompt_tokens` 및 `completion_tokens`를 포함하는 `usage` 블록이 있습니다. Terminal-Bench 점수를 고려할 때, 이와 같은 셸 및 터미널 관련 검토 프롬프트는 5.3이 가장 많이 개선되었을 것으로 예상되는 부분이므로 적절한 스모크 테스트입니다.
문서에는 모델의 추론 모드를 전환하는 `thinking` 매개변수도 설명되어 있습니다:
"thinking": { "type": "enabled" }
다단계 코딩 및 에이전트 작업에는 이 기능을 활성화하십시오. 추론 토큰이 낭비되는 짧은 추출 호출에는 건너뛰십시오.
Python 빠른 시작
새로운 SDK를 배울 필요가 없습니다. OpenAI 패키지를 설치하고 기본 URL을 변경하십시오:
pip install --upgrade openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GLM_API_KEY"],
base_url="https://api.z.ai/api/paas/v4",
)
response = client.chat.completions.create(
model="glm-5.3",
messages=[
{
"role": "system",
"content": "You are a code reviewer. Flag issues as blocking or non-blocking.",
},
{
"role": "user",
"content": (
"Review this Flask route for security issues:\n\n"
"@app.route('/user/<id>')\n"
"def get_user(id):\n"
" return db.execute(f'SELECT * FROM users WHERE id = {id}')"
),
},
],
temperature=0.3,
max_tokens=2048,
)
print(response.choices[0].message.content)
print("input tokens:", response.usage.prompt_tokens)
print("output tokens:", response.usage.completion_tokens)
첫날부터 `usage` 블록을 로깅하십시오. 출시 시점에 5.3 특정 가격이 공개되지 않았으므로, 공식 수치가 발표된 후 요금이 어떻게 될지 예측할 수 있는 유일한 방법은 토큰 사용량입니다.
Node.js 빠른 시작
`openai` npm 패키지로 동일하게 작업합니다:
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.GLM_API_KEY,
baseURL: "https://api.z.ai/api/paas/v4",
});
const response = await client.chat.completions.create({
model: "glm-5.3",
messages: [
{
role: "system",
content: "You are a terminal automation agent. Return each step as a shell command with a one-line rationale.",
},
{
role: "user",
content: "A Node service on port 3000 stopped responding after a deploy. Give me a diagnosis sequence.",
},
],
temperature: 0.3,
max_tokens: 2048,
});
console.log(response.choices[0].message.content);
코드베이스가 이미 OpenAI와 통신하고 있다면, 병렬 클라이언트가 필요하지 않습니다. Z.ai `baseURL`로 두 번째 `OpenAI` 인스턴스를 인스턴스화하고 작업별로 요청을 라우팅하십시오. 이렇게 하면 GLM-5.3과 기존 모델 간의 A/B 비교가 코드 재작성이 아닌 라우팅 결정이 됩니다.
스트리밍
문서는 표준 `stream` 플래그를 통한 스트리밍 지원을 확인합니다. Python에서:
stream = client.chat.completions.create(
model="glm-5.3",
messages=[
{"role": "user", "content": "Explain the N+1 query problem with a concrete ORM example."}
],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
원시 HTTP에서는 본문에 `\"stream\": true`를 설정하고 서버 전송 이벤트를 파싱합니다. 각 `data:` 줄은 OpenAI의 청크 형식으로 델타를 전달합니다. 두 가지 실용적인 참고 사항이 있습니다. 토큰 사용량은 최종 청크와 함께 또는 그 이후에 도착하므로, 스트림이 닫힌 후에만 정확한 계산이 가능합니다. 그리고 `thinking`을 활성화하면 어려운 프롬프트에서 첫 번째 토큰이 보이기까지 더 긴 일시 중지 시간이 예상됩니다. 모델이 답변하기 전에 추론에 토큰을 사용하기 때문이며, 이는 여러분이 감수한 절충안입니다.
중요한 매개변수
| 매개변수 | 유형 | 설명 |
|---|---|---|
max_tokens |
정수 | 출력 길이의 하드캡. 주요 비용 제어 수단입니다. |
temperature |
숫자 | 코드 및 추출에는 0.2~0.4, 개방형 작성에는 0.7+를 사용하십시오. |
thinking |
객체 | {"type": "enabled"}는 다단계 작업에 대한 추론 모드를 켭니다. |
stream |
불리언 | 단일 응답 본문 대신 서버 전송 이벤트. |
messages |
배열 | 표준 OpenAI 역할: system, user, assistant. |
비용 관련: Zhipu는 출시 당시 5.3 특정 API 가격을 공개하지 않았으므로, 리셀러 페이지에서 볼 수 있는 토큰당 가격은 믿지 마십시오. 공식 가격 페이지가 진실의 원천입니다. 이 글을 쓰는 시점에 GLM-5.2는 100만 토큰당 입력 $1.40, 출력 $4.40으로, GLM-5는 $1.00 및 $3.20으로 기재되어 있었으며, 이는 5.3의 가격이 합리적으로 책정될 범위입니다. 유료 GLM 모델의 캐시된 입력은 80~85% 할인되므로, 반복되는 시스템 프롬프트를 캐시에 적중하도록 구조화하십시오. 공급업체가 가격 변경으로 여러분을 놀라게 한 적이 있다면, 이 원칙이 왜 중요한지 아실 겁니다. DeepSeek 가격 인상 사후 분석은 직접 적용되는 비용 관리 패턴을 다룹니다.
애플리케이션 코드 작성 전에 Apidog에서 GLM-5.3 테스트하기
스크립트 내에서 프롬프트를 반복하는 것은 느린 루프입니다. 편집, 재실행, 스크롤, 반복을 거치며 매 주기마다 토큰 요금이 발생합니다. Z.ai의 API는 OpenAI와 호환되므로, API 클라이언트가 전체 탐색 단계를 흡수할 수 있습니다.
Apidog에서의 설정:
- 프로젝트를 생성하고 채팅 완성 요청을 추가합니다. OpenAI 호환 사양을 가져오거나 단일 `POST /chat/completions` 엔드포인트를 수동으로 정의하십시오. 본문은 익숙한 `model`과 `messages` 형태입니다.
- `zai-international`과 `bigmodel-mainland` 두 가지 환경을 생성합니다. 각 환경에 기본 URL을 설정하고(`https://api.z.ai/api/paas/v4` 및 `https://open.bigmodel.cn/api/paas/v4`) 환경 수준에서 `Authorization: Bearer {{GLM_API_KEY}}`를 바인딩합니다. 지역 전환은 드롭다운 클릭으로 가능하며, 키는 저장된 요청에 절대 들어가지 않습니다.
- 모델 ID를 `glm-5.3`으로 설정된 변수 뒤에 둡니다. 출시 주간에는 이것이 평소보다 더 중요합니다. 문서가 확정됨에 따라 ID가 변경되거나, `glm-5.2`와 A/B 테스트를 하고 싶다면 모든 저장된 요청을 편집하는 대신 변수 하나만 변경하면 됩니다.
- `thinking` 토글을 나란히 테스트합니다. 요청을 복제하고, 한 복사본에서 추론을 활성화한 다음, 동일한 프롬프트에서 지연 시간, 출력 품질 및 `usage`를 비교합니다. 이것이 여러분의 워크로드 중 어떤 것이 추론 토큰을 받을 가치가 있는지 결정하는 가장 빠른 방법입니다.
- 스트리밍 엔드포인트를 호출합니다. SSE 청크는 실시간으로 렌더링되므로, 사용자가 보게 될 첫 토큰 응답 시간을 확인할 수 있습니다.
- 좋은 응답을 예시로 저장합니다. 나중에 실행할 때는 라이브 API 대신 픽스처를 사용하게 되는데, 이는 개발 중 가장 큰 토큰 절약 방법입니다.
여기서부터 저장된 요청들을 `finish_reason`, 응답 스키마, 토큰 수에 대한 어설션을 포함하는 테스트 시나리오로 연결하면, 스모크 테스트를 회귀 테스트 스위트로 전환한 것입니다. 어떤 API에도 일반화된 동일한 워크플로는 QA 엔지니어를 위한 API 테스팅 가이드에 있습니다.
오류 처리 및 속도 제한
표준 OpenAI 스타일 오류를 예상하십시오. `message`, `type`, `code`를 포함하는 `error` 객체입니다. 일반적인 예상 오류는 누락되거나 취소된 키에 대한 401, 잘못된 형식의 본문 또는 알 수 없는 모델 ID에 대한 400, 속도 제한에 대한 429, 일시적인 서버 오류에 대한 5xx입니다.
출시 당일 API를 위한 세 가지 습관:
- 429 및 5xx 오류 발생 시 지터링된 지수 백오프를 사용하여 모든 호출을 재시도 헬퍼로 감싸십시오. 새 모델 출시는 트래픽을 집중시키고, 출시 첫날 용량에서 429 오류를 만나게 될 것입니다.
- 속도 제한 수치를 임의로 만들지 마십시오. Zhipu는 공식 문서에 동시성 및 티어 세부 정보를 게시합니다. 현재 정보를 유지하려면 이 블로그 게시물을 포함하여 블로그 게시물을 신뢰하는 대신 그곳에서 실시간 값을 읽으십시오.
- 모델 ID를 구성 뒤에 고정하십시오. 5.3의 동작 변경으로 프롬프트가 손상되면, `glm-5.2`로 롤백하는 것은 배포가 아닌 구성 변경이어야 합니다. 두 API 모두 OpenAI 방언을 사용하므로 Grok의 API를 위해 구축한 디버깅 워크플로는 여기서 변경 없이 적용됩니다.
자주 묻는 질문 (FAQ)
GLM-5.3 API의 모델 ID는 무엇인가요?
Zhipu의 가격 페이지에 `glm-5.2`와 `glm-5.1`을 제공하는 제품군 관례에 따라 `glm-5.3`을 예상하십시오. 이 글을 쓰는 시점에 문서에는 모델 페이지에 여전히 `glm-5`가 기재되어 있었으므로, 고정하기 전에 docs.z.ai에서 확인하고, 수정 비용이 적게 들도록 ID를 구성 파일에 보관하십시오.
GLM-5.3 API가 OpenAI SDK와 호환되나요?
네, 그렇습니다. API는 OpenAI와 호환되므로, `base_url`을 `https://api.z.ai/api/paas/v4` (또는 bigmodel.cn 해당 주소)로 설정하고 Z.ai 키를 전달하면 Python 및 Node.js용 공식 `openai` 패키지가 작동합니다. 요청 및 응답 형태는 스트리밍을 포함하여 채팅 완성 표준과 일치합니다.
GLM-5.3 API 비용은 얼마인가요?
Zhipu는 2026년 8월 14일 출시 당시 5.3 특정 가격을 공개하지 않았습니다. 공식 가격 페이지에는 GLM-5.2가 100만 입력 토큰당 $1.40, 100만 출력 토큰당 $4.40으로 기재되어 있으며, 이는 5.3 가격 항목이 나타날 때까지 가장 좋은 참조점입니다. 리셀러의 가격 추측은 무시하십시오.
GLM-5.3은 Claude 및 GPT와 어떻게 비교되나요?
Zhipu 자체 평가에 따르면 코딩 및 에이전트 기능은 “Claude Fable 5에 근접”하며, CyberGym은 84.5%로 Claude Mythos 5 및 GPT-5.6 Sol보다 약간 높지만, ExploitBench는 54.4%로 아직 최첨단 모델에 뒤처져 있습니다. 공급업체의 수치는 독립적으로 재현될 때까지 주장으로 간주하십시오. 최첨단 모델들을 서로 비교하는 방법은 Grok 4.6 vs GPT-5.6 vs Claude Fable 5 비교를 참조하십시오.
GLM-5.3을 API 대신 로컬에서 실행할 수 있나요?
아직은 아닙니다. Zhipu는 출시 후 약 2주 뒤인 2026년 8월 28일경, Hugging Face 조직에 오픈 웨이트가 공개될 것이라고 밝혔습니다. 7440억 매개변수의 MoE 설계는 로컬 서비스가 노트북 작업이 아닌 서버급 작업임을 의미합니다. 지금은 호스팅된 API를 사용하고, 자체 호스팅 배포와 비교할 기준선을 구축하십시오.
GLM-5.3이 스택에 들어맞는 곳
에이전트 루프나 코딩 워크로드를 실행한다면 GLM-5.3은 오후 시간을 들여 평가할 가치가 있으며, OpenAI 호환 인터페이스 덕분에 그 시간은 저렴하게 느껴질 것입니다. Terminal-Bench와 SWE-Marathon의 향상은 공급업체 보고서에 기반하지만, 6.2배라는 수치는 직접 확인할 만큼 충분히 크며, 오픈 웨이트까지의 2주라는 시간은 오늘 저장하는 요청이 나중에 자체 호스팅 배포를 위한 회귀 기준선이 된다는 것을 의미합니다.
합리적인 순서: 키를 받고, cURL 호출을 실행한 다음, 애플리케이션 코드를 만지기 전에 요청을 API 클라이언트로 옮기십시오. Apidog를 다운로드하여 두 지역 환경을 설정하고, 모델 ID를 변수 뒤에 두고, 실제 프롬프트에서 `thinking` 모드를 켜고 끄며 비교하십시오. 응답이 올바르게 보이면, 와이어 포맷이 어려운 부분이 아니었기 때문에 Python 또는 Node 포트는 기본 URL과 환경 변수만 있으면 됩니다.
