GLM-5.3-Flash란? Z.ai의 첫 네이티브 멀티모달 오픈 웨이트 모델

Z.ai의 GLM-5.3-Flash는 기본 이미지 입력과 1M 컨텍스트를 지원하는 320B-A18B MIT 모델입니다. 사양, 벤치마크, 그리고 Flash가 빠름이 아닌 저렴함을 의미하는 이유.

INEZA Felin-Michel

INEZA Felin-Michel

27 August 2026

GLM-5.3-Flash란? Z.ai의 첫 네이티브 멀티모달 오픈 웨이트 모델

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

Z.ai는 2026년 8월 26일 GLM-5.3-Flash를 출시했습니다. 이 모델은 3200억 개의 매개변수를 가진 혼합 전문가(mixture-of-experts) 모델로, 180억 개의 활성 매개변수를 가지며, MIT 라이선스 하에 배포됩니다. 또한 볼트온(bolted-on) 비전 어댑터를 통해서가 아닌, 이미지를 기본적으로 처리하는 GLM-5 시리즈의 첫 번째 모델입니다.

이 모델은 또한 많은 개발자들이 일주일 동안 모르는 채로 사용해왔던 모델이기도 합니다. 자세한 내용은 아래에서 다룹니다.

만약 "Flash"가 "빠르다"는 의미라고 기대하고 오셨다면, 이 게시물은 그 생각에 동의하지 않을 것입니다. 이러한 명명 규칙은 Google에서 유래했으며, Google의 Flash 모델은 실제로 저지연 계층입니다. 여기서는 다른 의미를 가지며, 이 구별을 정확히 이해하는 것이 이 모델이 귀하의 작업 부하에 적합한지 여부를 결정합니다.

TL;DR (요약)

사양

속성
총 매개변수 320B
활성 매개변수 18B
아키텍처 혼합 전문가, 하이브리드 선형 및 희소 어텐션
라이선스 MIT
컨텍스트 윈도우 1,048,576 토큰
입력 모달리티 텍스트, 이미지, 비디오, 파일
출력 텍스트
추론 모드 low, high, max (기본값 max)
API 모델 ID glm-5.3-flash
Hugging Face zai-org/GLM-5.3-Flash

주의해서 다뤄야 할 한 가지 수치는 최대 출력 토큰입니다. OpenRouter는 131,072를, Hugging Face 모델 카드는 163,840을 나열합니다. 이 두 출처는 서로 다르며, Z.ai는 이를 확정할 수치를 발표하지 않았습니다. 애플리케이션이 매우 긴 단일 생성에 의존한다면, 이를 기반으로 구축하기 전에 실제 제공업체에 제한 사항을 확인하십시오.

네이티브 멀티모달리티가 진정한 뉴스입니다

GLM 계열의 이전 모든 비전 기능은 별도의 모델 또는 별도의 경로로 제공되었습니다. Z.ai는 GLM-5V-Turbo와 GLM-4.6V를 별개의 비전 모델로 출시했습니다. GLM 모델이 스크린샷을 보게 하려면, 텍스트 트래픽이 사용하는 엔드포인트와는 다른 엔드포인트를 호출해야 했습니다.

GLM-5.3-Flash는 이를 통합합니다. 이미지, 비디오, 파일은 텍스트를 포함하는 동일한 채팅 완성 요청에서 콘텐츠 블록으로 사용됩니다. 하나의 모델 ID, 하나의 청구 라인, 그리고 이미지와 백만 토큰의 주변 텍스트를 동시에 담는 하나의 컨텍스트 윈도우가 있습니다.

마지막 부분이 흥미로운 점입니다. 이미지를 받을 수 있는 1M 토큰 컨텍스트 윈도우는 긴 사양 문서와 렌더링된 결과의 스크린샷을 동일한 프롬프트에 넣고 모델에게 이를 조화시키도록 요청할 수 있다는 의미입니다. Z.ai의 자체 설명도 이를 강조합니다: 모델이 "인터페이스, 렌더링 결과, 상호 작용 피드백"을 관찰한다고 설명하며, 이는 사진 캡션 생성 사례가 아닌 코딩 에이전트 사용 사례입니다.

비전 모델과 더 광범위하게 작업하고 있다면, GLM-5V-Turbo API 가이드는 이전의 전용 비전 접근 방식을 다루며, 문서 이해를 위한 GLM-OCR은 특수 사례를 다룹니다.

아키텍처, 간략히

Z.ai는 GLM-5.2를 사후 훈련하는 대신 새로운 기본 모델 위에 GLM-5.3-Flash를 구축했습니다. 모델의 동작 방식에 중요한 두 가지 설계 선택 사항은 다음과 같습니다.

하이브리드 어텐션. 이 모델은 선형 어텐션과 희소 어텐션을 혼합합니다. 선형 어텐션은 지역적 종속성을 저렴하게 처리하고, 희소 어텐션은 전역적으로 관련 있는 토큰을 찾습니다. 결과적으로 GLM-5.3보다 어텐션 계산량이 약 3배 적고, KV 캐시는 약 4.4배 작다고 명시되어 있습니다.

다양체 제약 하이퍼-연결 (Manifold-Constrained Hyper-Connections). 이번 릴리스에서 Z.ai가 스케일링 효율성 작업에 사용한 용어입니다. 아직 독립적으로 평가할 수 있을 만큼 충분한 공개 세부 정보가 없으므로, 입증된 장점이라기보다는 공급업체가 설명하는 아키텍처 기능으로 간주해야 합니다.

KV 캐시 감소는 명백한 실용적 결과를 가져오는 부분입니다. KV 캐시는 긴 컨텍스트 추론을 메모리 측면에서 비싸게 만드는 요인이며, 이를 4.4배 줄인 것이 이 모델이 1M 윈도우를 유지하면서도 GLM-5.2 가격의 10분의 1로 제공될 수 있는 대부분의 이유입니다.

훈련에는 Z.ai가 약 30조 개의 멀티모달 토큰이라고 설명하는 코퍼스가 사용되었습니다.

이름에 대하여

Artificial Analysis는 GLM-5.3-Flash를 초당 48.7 출력 토큰으로 측정했습니다. 이는 비슷한 크기의 오픈 가중치 모델 중 낮은 편에 속합니다. 더 큰 형제 모델인 GLM-5.3은 동일한 측정에서 초당 약 86토큰으로 실행됩니다.

따라서 Flash 모델은 비(非) Flash 모델 속도의 대략 절반입니다.

이 모델이 우위를 점하는 부분은 첫 토큰 응답 시간으로, 오픈 가중치 모델의 중앙값 2.14초에 비해 1.52초를 기록합니다. 만약 짧은 상호 작용이 많은 작업이라면, 이러한 반응성은 실제 이점이 됩니다. 하지만 긴 문서를 생성하는 작업이라면 GLM-5.3보다 더 오래 기다려야 할 것입니다.

이 모델이 제공하는 효율성은 실제 생성 속도가 아닌 **비용과 메모리**에 있습니다. 더 작은 KV 캐시와 낮은 어텐션 계산량은 더 저렴한 토큰당 가격과 더 작은 서비스 공간으로 이어집니다. 이는 더 빠른 스트리밍으로 이어지지 않습니다.

출시 후 며칠 동안 발표된 대부분의 보도는 처리량 수치를 확인하지 않고 공급업체의 주장을 반복했기 때문에 이는 중요합니다. 처리량 수치는 항상 공개되어 있었습니다. 이 모델은 저렴하고 이미지를 처리할 수 있기 때문에 선택하십시오. 빨리 스트리밍될 것이라고 기대해서는 안 됩니다.

벤치마크

Z.ai가 출시 시점에 발표한 수치이므로, 제3자가 재현할 때까지는 공급업체의 주장으로 간주하십시오.

독립적인 수치는 Artificial Analysis에서 제공하며, GLM-5.3-Flash는 **Intelligence Index v4.1.1에서 57점**을 기록했습니다. GLM-5.3은 60점을 받았습니다. 비슷한 크기의 오픈 가중치 모델의 중앙값은 27점이므로, 57점은 더 큰 형제 모델보다는 낮지만 해당 클래스에서는 강력한 결과입니다.

Z.ai는 이 모델이 코딩 및 에이전트 작업에서 Claude Opus 4.8에 근접한다고 설명합니다. 이는 공급업체의 자체 내부 평가에 대한 특징화이며, 측정된 제3자 결과가 아니며, 자체 GLM-5.3과의 3점 Intelligence Index 격차는 어느 정도 신중함이 필요하다는 것을 시사합니다.

이전 릴리스에서 GLM 벤치마크 스토리가 어떻게 발전했는지에 대해서는 GLM-5.2 벤치마크 분석에서 각 평가가 실제로 무엇을 측정하는지 설명합니다.

Ox Alpha 주간

8월 20일, ox-alpha라는 익명의 모델이 1M 토큰 컨텍스트 윈도우와 무료 가격으로 제3자 추론 플랫폼에 등장했습니다. 이 모델은 며칠 내에 해당 플랫폼에서 가장 많이 사용되는 모델 중 하나가 되었습니다. 커뮤니티는 출력 특성을 기반으로 약 48시간 이내에 Zhipu의 모델임을 알아냈습니다.

8월 26일, Z.ai는 이를 확인했습니다: Ox Alpha는 GLM-5.3-Flash였으며, 무료 주간은 의도적인 부하 테스트였습니다.

Z.ai는 또한 그 주 동안 모든 트래픽이 SGLang 기반 스택을 사용하는 중국 국내 가속기에서 제공되었으며, 토큰당 서비스 비용이 주류 NVIDIA 하드웨어와 비슷하다고 주장합니다. 이는 자체 인프라에 대한 공급업체의 주장이며 독립적인 검증이 없으므로, 이를 적절히 고려해야 합니다.

우리는 Pony Alpha가 DeepSeek 또는 GLM 모델로 밝혀졌을 때 이 패턴에 대해 이전에 글을 썼습니다. 제3자 라우터에서의 스텔스 출시는 표준적인 사전 출시 단계가 되고 있으며, 유용한 교훈은 의심스러울 정도로 둥근 컨텍스트 윈도우를 가진 비정상적으로 유능한 익명 모델은 거의 항상 누군가의 미공개 플래그십 모델이 평가 데이터를 수집하는 중이라는 것입니다.

실제로 사용하는 방법

사용해야 할까요?

텍스트와 동일한 호출에서 이미지 또는 비디오 이해가 필요한 경우, 토큰당 비용이 최적화하려는 제약 조건인 경우, 또는 허용적인 라이선스 하에 자체 호스팅할 수 있는 오픈 가중치를 원하는 경우 GLM-5.3-Flash를 사용하십시오.

추론 품질에서 마지막 몇 점의 개선이 필요하거나, 가격보다 생성 처리량이 더 중요한 경우 GLM-5.3을 선택하십시오. 두 모델의 비교는 결정 과정을 자세히 설명하며, GLM-5.3이란 무엇인가는 기본 모델을 자체적으로 다룹니다.

어떤 것을 선택하든, OpenAI 호환 엔드포인트에서 모델 ID를 한 줄만 변경하면 되므로, 다른 사람의 벤치마크 테이블을 신뢰하기보다는 자신의 작업 부하에 대해 두 모델을 쉽게 테스트할 수 있습니다. 그것이 문제를 해결하는 올바른 방법입니다.

모델 스왑을 제대로 테스트하려면 실제 요청을 보내고 실제 응답을 확인해야 합니다. 여기에는 curl에서 수동으로 만들기 어려운 멀티모달 응답도 포함됩니다. Apidog를 사용하면 이러한 호출을 어설션이 첨부된 재사용 가능한 컬렉션으로 저장할 수 있으므로, GLM-5.3에서 Flash로 전환할 때 프로덕션에서 문제를 발견하는 대신 응답 형식이 변경되지 않았음을 확인할 수 있습니다.

자주 묻는 질문 (FAQ)

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요