Z.ai는 2026년 8월 26일 GLM-5.3-Flash를 출시했습니다. 이 모델은 3200억 개의 매개변수를 가진 혼합 전문가(mixture-of-experts) 모델로, 180억 개의 활성 매개변수를 가지며, MIT 라이선스 하에 배포됩니다. 또한 볼트온(bolted-on) 비전 어댑터를 통해서가 아닌, 이미지를 기본적으로 처리하는 GLM-5 시리즈의 첫 번째 모델입니다.
이 모델은 또한 많은 개발자들이 일주일 동안 모르는 채로 사용해왔던 모델이기도 합니다. 자세한 내용은 아래에서 다룹니다.
만약 "Flash"가 "빠르다"는 의미라고 기대하고 오셨다면, 이 게시물은 그 생각에 동의하지 않을 것입니다. 이러한 명명 규칙은 Google에서 유래했으며, Google의 Flash 모델은 실제로 저지연 계층입니다. 여기서는 다른 의미를 가지며, 이 구별을 정확히 이해하는 것이 이 모델이 귀하의 작업 부하에 적합한지 여부를 결정합니다.
TL;DR (요약)
- 무엇인가요: Z.ai에서 2026년 8월 26일 출시한 오픈 가중치(MIT) 320B-A18B 혼합 전문가 모델.
- 주요 변경 사항: 네이티브 멀티모달리티(native multimodality). 이미지, 비디오, 파일 입력이 모델에 직접 들어갑니다. GLM-5.3은 별도의 어댑터를 통해 비전을 라우팅하며, GLM-5.2는 텍스트 전용이었습니다.
- 컨텍스트: 1,048,576 토큰, GLM-5.3과 동일한 1M 윈도우.
- 진정한 강점: 비용. Z.ai는 GLM-5.2 가격의 약 10분의 1 수준이라고 밝히며, 백만 입력 토큰당 0.15달러, 백만 출력 토큰당 0.50달러의 정가로 책정했습니다.
- 솔직한 주의사항: 빠르지 않습니다. Artificial Analysis는 초당 48.7 출력 토큰으로 측정했으며, 이는 해당 크기 등급에서는 느린 편입니다. 첫 토큰 응답 시간은 1.52초로 진정으로 좋습니다.
- 어디서 구할 수 있나요: Z.ai API에서
glm-5.3-flash로 제공되며, OpenRouter, Cloudflare Workers AI, Vercel AI Gateway 및 여러 다른 제공업체에서도 이용 가능합니다. 가중치는 Hugging Face에 있습니다.
사양
| 속성 | 값 |
|---|---|
| 총 매개변수 | 320B |
| 활성 매개변수 | 18B |
| 아키텍처 | 혼합 전문가, 하이브리드 선형 및 희소 어텐션 |
| 라이선스 | MIT |
| 컨텍스트 윈도우 | 1,048,576 토큰 |
| 입력 모달리티 | 텍스트, 이미지, 비디오, 파일 |
| 출력 | 텍스트 |
| 추론 모드 | low, high, max (기본값 max) |
| API 모델 ID | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
주의해서 다뤄야 할 한 가지 수치는 최대 출력 토큰입니다. OpenRouter는 131,072를, Hugging Face 모델 카드는 163,840을 나열합니다. 이 두 출처는 서로 다르며, Z.ai는 이를 확정할 수치를 발표하지 않았습니다. 애플리케이션이 매우 긴 단일 생성에 의존한다면, 이를 기반으로 구축하기 전에 실제 제공업체에 제한 사항을 확인하십시오.
네이티브 멀티모달리티가 진정한 뉴스입니다
GLM 계열의 이전 모든 비전 기능은 별도의 모델 또는 별도의 경로로 제공되었습니다. Z.ai는 GLM-5V-Turbo와 GLM-4.6V를 별개의 비전 모델로 출시했습니다. GLM 모델이 스크린샷을 보게 하려면, 텍스트 트래픽이 사용하는 엔드포인트와는 다른 엔드포인트를 호출해야 했습니다.
GLM-5.3-Flash는 이를 통합합니다. 이미지, 비디오, 파일은 텍스트를 포함하는 동일한 채팅 완성 요청에서 콘텐츠 블록으로 사용됩니다. 하나의 모델 ID, 하나의 청구 라인, 그리고 이미지와 백만 토큰의 주변 텍스트를 동시에 담는 하나의 컨텍스트 윈도우가 있습니다.
마지막 부분이 흥미로운 점입니다. 이미지를 받을 수 있는 1M 토큰 컨텍스트 윈도우는 긴 사양 문서와 렌더링된 결과의 스크린샷을 동일한 프롬프트에 넣고 모델에게 이를 조화시키도록 요청할 수 있다는 의미입니다. Z.ai의 자체 설명도 이를 강조합니다: 모델이 "인터페이스, 렌더링 결과, 상호 작용 피드백"을 관찰한다고 설명하며, 이는 사진 캡션 생성 사례가 아닌 코딩 에이전트 사용 사례입니다.
비전 모델과 더 광범위하게 작업하고 있다면, GLM-5V-Turbo API 가이드는 이전의 전용 비전 접근 방식을 다루며, 문서 이해를 위한 GLM-OCR은 특수 사례를 다룹니다.
아키텍처, 간략히
Z.ai는 GLM-5.2를 사후 훈련하는 대신 새로운 기본 모델 위에 GLM-5.3-Flash를 구축했습니다. 모델의 동작 방식에 중요한 두 가지 설계 선택 사항은 다음과 같습니다.

하이브리드 어텐션. 이 모델은 선형 어텐션과 희소 어텐션을 혼합합니다. 선형 어텐션은 지역적 종속성을 저렴하게 처리하고, 희소 어텐션은 전역적으로 관련 있는 토큰을 찾습니다. 결과적으로 GLM-5.3보다 어텐션 계산량이 약 3배 적고, KV 캐시는 약 4.4배 작다고 명시되어 있습니다.
다양체 제약 하이퍼-연결 (Manifold-Constrained Hyper-Connections). 이번 릴리스에서 Z.ai가 스케일링 효율성 작업에 사용한 용어입니다. 아직 독립적으로 평가할 수 있을 만큼 충분한 공개 세부 정보가 없으므로, 입증된 장점이라기보다는 공급업체가 설명하는 아키텍처 기능으로 간주해야 합니다.
KV 캐시 감소는 명백한 실용적 결과를 가져오는 부분입니다. KV 캐시는 긴 컨텍스트 추론을 메모리 측면에서 비싸게 만드는 요인이며, 이를 4.4배 줄인 것이 이 모델이 1M 윈도우를 유지하면서도 GLM-5.2 가격의 10분의 1로 제공될 수 있는 대부분의 이유입니다.
훈련에는 Z.ai가 약 30조 개의 멀티모달 토큰이라고 설명하는 코퍼스가 사용되었습니다.
이름에 대하여
Artificial Analysis는 GLM-5.3-Flash를 초당 48.7 출력 토큰으로 측정했습니다. 이는 비슷한 크기의 오픈 가중치 모델 중 낮은 편에 속합니다. 더 큰 형제 모델인 GLM-5.3은 동일한 측정에서 초당 약 86토큰으로 실행됩니다.
따라서 Flash 모델은 비(非) Flash 모델 속도의 대략 절반입니다.
이 모델이 우위를 점하는 부분은 첫 토큰 응답 시간으로, 오픈 가중치 모델의 중앙값 2.14초에 비해 1.52초를 기록합니다. 만약 짧은 상호 작용이 많은 작업이라면, 이러한 반응성은 실제 이점이 됩니다. 하지만 긴 문서를 생성하는 작업이라면 GLM-5.3보다 더 오래 기다려야 할 것입니다.
이 모델이 제공하는 효율성은 실제 생성 속도가 아닌 **비용과 메모리**에 있습니다. 더 작은 KV 캐시와 낮은 어텐션 계산량은 더 저렴한 토큰당 가격과 더 작은 서비스 공간으로 이어집니다. 이는 더 빠른 스트리밍으로 이어지지 않습니다.
출시 후 며칠 동안 발표된 대부분의 보도는 처리량 수치를 확인하지 않고 공급업체의 주장을 반복했기 때문에 이는 중요합니다. 처리량 수치는 항상 공개되어 있었습니다. 이 모델은 저렴하고 이미지를 처리할 수 있기 때문에 선택하십시오. 빨리 스트리밍될 것이라고 기대해서는 안 됩니다.
벤치마크
Z.ai가 출시 시점에 발표한 수치이므로, 제3자가 재현할 때까지는 공급업체의 주장으로 간주하십시오.

독립적인 수치는 Artificial Analysis에서 제공하며, GLM-5.3-Flash는 **Intelligence Index v4.1.1에서 57점**을 기록했습니다. GLM-5.3은 60점을 받았습니다. 비슷한 크기의 오픈 가중치 모델의 중앙값은 27점이므로, 57점은 더 큰 형제 모델보다는 낮지만 해당 클래스에서는 강력한 결과입니다.
Z.ai는 이 모델이 코딩 및 에이전트 작업에서 Claude Opus 4.8에 근접한다고 설명합니다. 이는 공급업체의 자체 내부 평가에 대한 특징화이며, 측정된 제3자 결과가 아니며, 자체 GLM-5.3과의 3점 Intelligence Index 격차는 어느 정도 신중함이 필요하다는 것을 시사합니다.
이전 릴리스에서 GLM 벤치마크 스토리가 어떻게 발전했는지에 대해서는 GLM-5.2 벤치마크 분석에서 각 평가가 실제로 무엇을 측정하는지 설명합니다.
Ox Alpha 주간
8월 20일, ox-alpha라는 익명의 모델이 1M 토큰 컨텍스트 윈도우와 무료 가격으로 제3자 추론 플랫폼에 등장했습니다. 이 모델은 며칠 내에 해당 플랫폼에서 가장 많이 사용되는 모델 중 하나가 되었습니다. 커뮤니티는 출력 특성을 기반으로 약 48시간 이내에 Zhipu의 모델임을 알아냈습니다.

8월 26일, Z.ai는 이를 확인했습니다: Ox Alpha는 GLM-5.3-Flash였으며, 무료 주간은 의도적인 부하 테스트였습니다.
Z.ai는 또한 그 주 동안 모든 트래픽이 SGLang 기반 스택을 사용하는 중국 국내 가속기에서 제공되었으며, 토큰당 서비스 비용이 주류 NVIDIA 하드웨어와 비슷하다고 주장합니다. 이는 자체 인프라에 대한 공급업체의 주장이며 독립적인 검증이 없으므로, 이를 적절히 고려해야 합니다.
우리는 Pony Alpha가 DeepSeek 또는 GLM 모델로 밝혀졌을 때 이 패턴에 대해 이전에 글을 썼습니다. 제3자 라우터에서의 스텔스 출시는 표준적인 사전 출시 단계가 되고 있으며, 유용한 교훈은 의심스러울 정도로 둥근 컨텍스트 윈도우를 가진 비정상적으로 유능한 익명 모델은 거의 항상 누군가의 미공개 플래그십 모델이 평가 데이터를 수집하는 중이라는 것입니다.
실제로 사용하는 방법
- 호스팅 API. Z.ai 엔드포인트는 OpenAI와 호환됩니다. 기존 클라이언트를
https://api.z.ai/api/paas/v4/로 지정하고 모델을glm-5.3-flash로 설정하십시오. GLM-5.3-Flash API 가이드는 인증, 이미지 입력 페이로드 및 추론 노력(reasoning-effort) 매개변수에 대해 설명합니다. - 제3자 제공업체. OpenRouter는
z-ai/glm-5.3-flash로 제공합니다. 또한 Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten, io.net에서도 사용할 수 있습니다. 가격은 리셀러마다 다르며, 때로는 상당한 차이가 있습니다. - 코딩 에이전트. Flash는 GLM 코딩 플랜에 포함되어 있으며, GLM-5.3의 세 배에 달하는 사용 가능한 할당량을 제공한다고 알려져 있습니다. 이는 구독자가 전환할 실질적인 이유입니다. Z.ai 문서에는 또한 비수기 호출은 표준 포인트의 절반을 소비한다고 명시되어 있습니다.
- 자체 호스팅. 가중치는 MIT 라이선스이며 Hugging Face에 있습니다. vLLM, SGLang, TokenSpeed 및 KTransformers는 모두 이를 지원하며, 더 작은 장비를 위한 GGUF 양자화도 존재합니다.
사용해야 할까요?
텍스트와 동일한 호출에서 이미지 또는 비디오 이해가 필요한 경우, 토큰당 비용이 최적화하려는 제약 조건인 경우, 또는 허용적인 라이선스 하에 자체 호스팅할 수 있는 오픈 가중치를 원하는 경우 GLM-5.3-Flash를 사용하십시오.
추론 품질에서 마지막 몇 점의 개선이 필요하거나, 가격보다 생성 처리량이 더 중요한 경우 GLM-5.3을 선택하십시오. 두 모델의 비교는 결정 과정을 자세히 설명하며, GLM-5.3이란 무엇인가는 기본 모델을 자체적으로 다룹니다.
어떤 것을 선택하든, OpenAI 호환 엔드포인트에서 모델 ID를 한 줄만 변경하면 되므로, 다른 사람의 벤치마크 테이블을 신뢰하기보다는 자신의 작업 부하에 대해 두 모델을 쉽게 테스트할 수 있습니다. 그것이 문제를 해결하는 올바른 방법입니다.
모델 스왑을 제대로 테스트하려면 실제 요청을 보내고 실제 응답을 확인해야 합니다. 여기에는 curl에서 수동으로 만들기 어려운 멀티모달 응답도 포함됩니다. Apidog를 사용하면 이러한 호출을 어설션이 첨부된 재사용 가능한 컬렉션으로 저장할 수 있으므로, GLM-5.3에서 Flash로 전환할 때 프로덕션에서 문제를 발견하는 대신 응답 형식이 변경되지 않았음을 확인할 수 있습니다.
자주 묻는 질문 (FAQ)
- GLM-5.3-Flash는 무료인가요? 더 이상 아닙니다. 무료 Ox Alpha 주간은 모델이 공식 발표되면서 종료되었습니다. 2026년 9월 9일까지 50% 출시 할인이 적용되며, 그 이후에는 정가가 적용됩니다.
- GLM-5.3보다 빠른가요? 아니요. GLM-5.3이 초당 86토큰을 생성하는 것에 비해 이 모델은 초당 약 49토큰을 생성합니다. 첫 토큰 응답 시간은 1.52초로 더 빠릅니다.
- 정말 백만 토큰의 컨텍스트를 처리할 수 있나요? 구성된 윈도우는 1,048,576 토큰이며, 모델 구성 및 Artificial Analysis에 의해 확인되었습니다. OpenRouter가 1,310,720이라는 더 큰 수치를 나열하지만, 이는 모델 사양이라기보다는 제공업체 측의 정보로 간주해야 합니다.
- 비디오를 받을 수 있나요? Z.ai의 문서에는 텍스트, 이미지, 비디오, 파일 입력이 명시되어 있습니다. 비디오 지원은 이미지 입력보다 최신이고 덜 광범위하게 사용되므로, 이에 의존하기 전에 자신의 미디어로 유효성을 검사하십시오.
- 가중치는 어떤 라이선스인가요? MIT 라이선스이며, 가중치는 Hugging Face의
zai-org/GLM-5.3-Flash에 게시되어 있습니다.
