GLM-5.3-Flash는 현재 반값입니다. 이 할인은 2026년 9월 9일에 종료되며, 그 시점부터 현재 요율로 책정된 모든 비용 예측은 두 배가 됩니다.
이 게시물은 모델의 현재 비용, 할인 종료 후 비용, 대안과의 비교, 그리고 이러한 차이가 워크로드에 실제로 중요한지 여부를 파악하는 방법을 다룹니다. 모든 수치는 2026년 8월 27일에 확인되었으며, 가격 페이지는 변경될 수 있으므로 예산을 확정하기 전에 공급업체와 다시 확인하십시오.
요금표
| 출시 가격 (2026년 9월 9일까지) | 정상 가격 (그 이후) | |
|---|---|---|
| 입력 (Input) | $0.075 / 100만 토큰 | $0.15 / 100만 토큰 |
| 출력 (Output) | $0.25 / 100만 토큰 | $0.50 / 100만 토큰 |
| 캐시된 입력 (Cached input) | $0.015 / 100만 토큰 | $0.03 / 100만 토큰 |
Artificial Analysis는 캐시-히트 대 입력 대 출력 비율이 7:2:1일 때, 100만 토큰당 $0.10의 혼합 수치를 발표했습니다. 이는 비교 쇼핑에 유용한 단일 숫자이지만, 실제 요금은 사용자 자신의 비율에 따라 결정됩니다.
실제 비용
100만 토큰당 추상적인 요율은 이해하기 어렵습니다. 따라서 9월 9일 이후 계획에 중요한 정상 가격으로 세 가지 구체적인 워크로드를 제시합니다.
지원 분류기. 한 달에 100,000건의 티켓, 각 티켓당 대략 800개의 입력 토큰과 100개의 출력 토큰. 이는 8천만 개의 입력과 1천만 개의 출력 토큰에 해당합니다: 입력 $12.00 + 출력 $5.00, 총 월 $17. reasoning_effort를 low로 설정하면 출력 측면이 더 줄어듭니다.
코딩 어시스턴트. 하루에 500 세션, 각 세션당 대략 15,000개의 입력 토큰 (대부분 반복되는 파일 컨텍스트)과 2,000개의 출력 토큰. 월별로 이는 2억 2천 5백만 개의 입력과 3천만 개의 출력에 해당합니다. 캐싱 없이: $33.75 + $15.00, 총 $48.75. 입력의 70%가 캐시를 적중하는 경우: 입력은 대략 $14.85로 줄어들어 총 약 $30가 됩니다.
이미지가 포함된 문서 파이프라인. 한 달에 10,000개의 문서, 이미지 콘텐츠를 포함하여 각 문서당 대략 40,000개의 토큰과 1,500개의 출력 토큰. 이는 4억 개의 입력과 1,500만 개의 출력에 해당합니다: $60.00 + $7.50, 즉 비전이 필요한 작업에 대해 월 $67.50입니다.
이들 중 어느 것도 큰 숫자가 아닙니다. 이것이 이 모델의 핵심입니다.
캐시된 입력이 가장 큰 레버입니다
새로운 입력에 대해 100만 토큰당 $0.15인 반면, 캐시된 토큰은 100만 토큰당 $0.03으로 캐시되지 않은 토큰의 1/5 가격입니다. 안정적인 접두사, 시스템 프롬프트, 반복적으로 질문되는 문서, 컨텍스트 내 코드베이스가 있는 모든 워크로드는 접두사가 호출 전체에서 동일하게 유지되도록 구성해야 합니다.
캐시 적중률을 조용히 파괴하는 실수는 프롬프트 앞부분에 변수 요소를 배치하는 것입니다. 시스템 프롬프트의 타임스탬프, 요청 ID 또는 사용자 이름은 그 뒤의 모든 것을 무효화합니다. 안정적인 내용은 먼저, 변하는 내용은 마지막에 배치하십시오.
Z.ai는 또한 캐시된 입력 스토리지를 제한된 기간 동안 무료로 제공한다고 명시했습니다. 이를 프로모션으로 간주하고, 이에 의존하는 아키텍처를 구축하기 전에 현재 약관을 확인하십시오.
두 번째 레버는 추론 노력(reasoning effort)입니다
이 모델에서 reasoning_effort는 기본적으로 max입니다. 이는 가장 비싼 설정이며, 이 매개변수를 전혀 건드리지 않으면 얻게 되는 것입니다.
세 가지 모드는 low, high, max입니다. 추론 토큰은 출력으로 청구되므로, 숙고가 필요 없는 작업은 아무도 읽지 않는 생각에 대해 출력 요율을 지불하게 됩니다. 분류, 추출, 라우팅 및 서식 지정의 경우 low는 출력 측면을 상당히 줄일 수 있습니다.
설정은 저희 API 가이드에 설명되어 있습니다. 이는 한 줄 변경이며, 위의 계산보다 청구서가 더 높게 나온다면 가장 먼저 시도해야 할 사항입니다.
비교
자체 형제 모델과 정상 가격으로 비교하면:
| 모델 | 100만 토큰당 혼합 |
|---|---|
| GLM-5.3-Flash | $0.10 |
| GLM-5.3 | $0.90 |
Artificial Analysis 지능 지수에서 57점 대 60점으로 3점 차이에 대해 거의 9배의 격차가 있습니다. 저희의 전체 비교는 이러한 트레이드오프가 언제 잘못되는지 다루며, 간단히 말하면: 사람이 기다리는 동안 긴 응답을 스트리밍할 때입니다. GLM-5.3은 거의 두 배 빠르게 생성하기 때문입니다.
GLM-5.2와 비교하면, Z.ai의 주장은 대략 가격의 10분의 1이며, 작업당 비용은 $0.045입니다. 마이그레이션 예산을 책정하고 있다면 저희의 GLM-5.2 가격 분석에 이전 요금표가 있습니다.
다른 공급업체의 저렴한 멀티모달 계층과 비교하면, GLM-5.3-Flash는 가격 경쟁력이 있으며 MIT 라이선스라는 점에서 특이합니다. 이는 셀프 호스팅 옵션이 열려 있음을 의미합니다. 저희의 Gemini 3.7 Flash 가격 게시물은 Google 측의 가장 유사한 비교를 다룹니다.
리셀러 가격은 다를 수 있으며, 때로는 크게 다릅니다
이 모델은 Z.ai를 통해 직접 제공되며 OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten, io.net을 통해서도 제공됩니다.
이들이 모두 동일한 요금을 부과하는 것은 아닙니다. 예를 들어, AIHubMix는 입력에 $0.113, 출력에 $0.394 정도의 요율을 명시했는데, 이는 Z.ai의 프로모션 가격과 정상 가격의 중간입니다. 일부 공급업체는 출시 할인을 적용하지만 일부는 그렇지 않습니다.
어그리게이터를 통해 라우팅하는 경우, Z.ai를 그대로 반영한다고 가정하지 말고 현재 요율을 확인하십시오. 통합 게이트웨이의 편리함은 때때로 마진을 포함하며, 이러한 절대 가격 수준에서는 백분율 마크업을 간과하기 쉽고 용인하기 쉽습니다.
셀프 호스팅이 유리해지는 시점
가중치는 MIT 라이선스이므로 직접 실행하는 것이 실질적인 옵션이며, API 가격이 이렇게 낮아지면서 셀프 호스팅의 손익분기점 계산이 더 어려워졌습니다.
대략적인 틀: 풀-정밀도 서비스는 8x H200급 노드를 필요로 하며, 이는 클라우드 임대 용량에서 하루 $24에서 $48 정도입니다. 노드가 바쁘든 유휴 상태이든 발생하는 고정 비용으로 월 $1,000라고 가정합시다.
정상 API 가격으로 $1,000는 대략 67억 개의 입력 토큰을 구매할 수 있습니다. 노드의 고정 비용이 이를 능가하려면 엄청나고 지속적인 볼륨을 실행해야 합니다. 대부분의 팀에게 솔직한 답변은 GLM-5.3-Flash의 셀프 호스팅이 비용보다는 제어, 데이터 상주 또는 라이선싱에 관한 것이라는 것입니다.
예외는 양자화된 계층입니다. GGUF 양자화가 존재하며, 이미 소유한 하드웨어에서 양자화된 모델을 실행하면 한계 비용이 전기 요금이 되므로 계산이 완전히 바뀝니다. 저희 로컬 실행 가이드는 각 하드웨어 계층이 실제로 무엇을 할 수 있는지 다룹니다.
코딩 플랜 대안
API 호출을 하는 애플리케이션이 아니라 Claude Code 또는 Cline에서 작업하는 개발자의 사용 방식이라면, 토큰당 가격 책정은 완전히 잘못된 모델일 수 있습니다. GLM 코딩 플랜은 월 $18 정도부터 시작하며 GLM-5.3-Flash를 포함하고, GLM-5.3의 세 배에 달하는 사용 가능한 할당량을 제공한다고 합니다. Z.ai 문서에는 비수기 호출이 표준 포인트의 절반을 소비한다고도 언급되어 있습니다.
매일 코딩하는 단일 개발자에게는 정액 플랜이 일반적으로 종량제 API 접근보다 저렴하고 항상 더 예측 가능합니다. 저희의 하네스 설정 가이드는 연결 방법을 다루고, 저희의 코딩 플랜 비교는 GLM 플랜을 대안들과 비교합니다.
출력 측면을 주의 깊게 살펴보세요
입력 가격은 볼륨이 커서 주목을 받습니다. 그러나 예산이 실제로 깨지는 곳은 두 가지 이유로 출력입니다.
출력은 토큰당 $0.15인 입력 비용보다 세 배 이상 비싼 $0.50입니다. 그리고 추론 토큰은 출력으로 청구됩니다. max 추론 노력을 설정한 모델은 최종 답변에 나타나는 것보다 몇 배 더 많은 토큰을 생성할 수 있으며, 이 모든 것은 출력 요율로 청구됩니다.
이러한 조합은 평범한 프롬프트와 수다스러운 모델을 가진 애플리케이션이, 서류상으로는 입력 위주로 보여도 결국 출력이 지배적인 상황에 처할 수 있음을 의미합니다. 혼합된 100만 토큰당 $0.10 수치는 많은 실제 워크로드와 일치하지 않는 7:2:1 비율을 가정합니다.
해결책은 추정보다는 측정입니다. 모든 완료 응답은 해당 호출의 토큰 수를 포함하는 usage 객체를 가집니다. 이를 기록하고 집계하여 실제 비율을 예산에 책정한 가정과 비교하십시오. 출력이 전체 토큰의 약 15% 이상으로 실행된다면, reasoning_effort가 첫 번째로 살펴볼 곳이고 프롬프트 길이가 두 번째입니다.
9월 9일 이전에 해야 할 일
할인이 진행되는 동안 해볼 가치가 있는 세 가지:
- 실제 토큰 혼합을 측정하십시오. 혼합 요율은 7:2:1을 가정합니다. 사용자 워크로드가 출력이 많은 경우, 실효 비용은 혼합된 $0.10 수치보다 $0.50 출력 요율에 더 가깝습니다.
- 캐시 적중률을 확인하십시오. 캐시된 입력과 새 입력 사이에 5배의 가격 차이가 있으므로, 여기가 비용 절감의 핵심입니다.
- 정상 가격으로 비용 모델을 다시 실행하십시오. 9월 10일에는 모든 것이 두 배가 됩니다. 프로모션 요율로만 워크로드가 수익성이 있다면, 2주 후가 아니라 지금 해결해야 할 문제가 있는 것입니다.
실제 토큰 사용량을 추적하는 것은 실제 응답을 캡처하는 것을 의미합니다. 각 완료의 usage 객체에는 필요한 입력, 출력 및 캐시된 토큰 수가 포함되어 있습니다. 모델 ID를 환경 변수로 설정하여 Apidog에 대표적인 호출을 저장된 컬렉션으로 실행하면 요청당 이러한 숫자를 얻을 수 있으며, GLM-5.3에 대해 동일한 스위트를 다시 실행하여 마케팅이 아닌 실제 비용을 비교할 수 있습니다.
자주 묻는 질문 (FAQ)
GLM-5.3-Flash는 무료인가요? 아닙니다. 출시 전 "ox-alpha"라는 익명으로 약 일주일 동안 무료였지만, 발표와 함께 종료되었습니다. 현재 50% 할인은 무료와 다릅니다.
할인은 정확히 언제 종료되나요? 2026년 9월 9일. 그 시점부터 정상 가격이 적용됩니다.
다른 사이트에서 다른 가격을 인용하는 이유는 무엇인가요? 일부는 프로모션 요율을, 일부는 정상 요율을 인용하며, 리셀러는 자체 마진을 설정합니다. 항상 실제로 호출하는 공급업체를 확인하십시오.
이미지 입력에 추가 비용이 드나요? 이미지는 컨텍스트 토큰을 소비하며 입력으로 청구됩니다. 별도의 이미지 할증료는 없지만, 고해상도 이미지는 상당한 수의 토큰을 소비합니다.
셀프 호스팅이 더 저렴한가요? 매우 많은 양을 지속적으로 사용하거나, 양자화된 빌드를 사용하여 이미 소유한 하드웨어에서만 그렇습니다. 100만 입력 토큰당 $0.15라는 가격에서는 8x H200 노드를 임대하는 것이 비용만으로는 정당화하기 어렵습니다.
