GLM-5.3-Flash hiện đang được giảm giá một nửa. Ưu đãi này kết thúc vào ngày 9 tháng 9 năm 2026, và khi đó, mọi dự báo chi phí dựa trên mức giá hiện tại sẽ tăng gấp đôi.
Bài đăng này đề cập đến chi phí hiện tại của mô hình, chi phí sau khi ưu đãi kết thúc, cách so sánh với các lựa chọn thay thế, và cách tính toán xem sự khác biệt đó có thực sự quan trọng đối với khối lượng công việc của bạn hay không. Tất cả các số liệu đã được xác minh vào ngày 27 tháng 8 năm 2026, và các trang giá có thể thay đổi, vì vậy hãy xác nhận với nhà cung cấp của bạn trước khi cam kết ngân sách.
Biểu giá
| Giá ra mắt (đến hết 9 tháng 9, 2026) | Giá niêm yết (sau đó) | |
|---|---|---|
| Đầu vào | $0.075 / 1M tokens | $0.15 / 1M tokens |
| Đầu ra | $0.25 / 1M tokens | $0.50 / 1M tokens |
| Đầu vào được lưu trữ (cache) | $0.015 / 1M tokens | $0.03 / 1M tokens |
Artificial Analysis công bố một con số trung bình là 0,10 đô la cho mỗi triệu token, sử dụng tỷ lệ truy cập cache-input-output là 7:2:1. Đó là một con số đơn lẻ hữu ích để so sánh giá cả, mặc dù tỷ lệ của riêng bạn mới là yếu tố quyết định hóa đơn của bạn.
Chi phí thực tế
Các mức giá trừu tượng trên mỗi triệu token rất khó để hình dung, vì vậy đây là ba khối lượng công việc cụ thể với giá niêm yết, là con số quan trọng để lập kế hoạch sau ngày 9 tháng 9.
Bộ phân loại hỗ trợ. 100.000 yêu cầu mỗi tháng, khoảng 800 token đầu vào và 100 token đầu ra cho mỗi yêu cầu. Tức là 80 triệu token đầu vào và 10 triệu token đầu ra: 12,00 đô la đầu vào cộng 5,00 đô la đầu ra, tổng cộng 17 đô la mỗi tháng. Đặt reasoning_effort thành low và phía đầu ra sẽ giảm thêm.
Trợ lý lập trình. 500 phiên mỗi ngày, khoảng 15.000 token đầu vào (phần lớn là ngữ cảnh tệp lặp lại) và 2.000 token đầu ra cho mỗi phiên. Hàng tháng là 225 triệu token đầu vào và 30 triệu token đầu ra. Không có lưu trữ cache: 33,75 đô la cộng 15,00 đô la, tổng cộng 48,75 đô la. Với 70% đầu vào được lưu trữ cache: đầu vào giảm xuống khoảng 14,85 đô la, đưa tổng chi phí xuống khoảng 30 đô la.
Hệ thống xử lý tài liệu với hình ảnh. 10.000 tài liệu mỗi tháng, khoảng 40.000 token mỗi tài liệu bao gồm nội dung hình ảnh và 1.500 token đầu ra. Tức là 400 triệu token đầu vào và 15 triệu token đầu ra: 60,00 đô la cộng 7,50 đô la, hoặc 67,50 đô la mỗi tháng cho công việc yêu cầu xử lý hình ảnh.
Không có con số nào trong số này là lớn. Đó chính là mục đích của mô hình này.
Đầu vào được lưu trữ (cache) là đòn bẩy lớn nhất
Với giá 0,03 đô la cho mỗi triệu token so với 0,15 đô la cho đầu vào mới, token được lưu trữ cache có chi phí bằng một phần năm so với token không được lưu trữ. Mọi khối lượng công việc có tiền tố ổn định, lời nhắc hệ thống, tài liệu được hỏi đi hỏi lại, hoặc cơ sở mã trong ngữ cảnh, nên được cấu trúc sao cho tiền tố đó giữ nguyên trong các lần gọi.
Sai lầm âm thầm phá hủy tỷ lệ truy cập cache là đặt bất kỳ thứ gì có thể thay đổi gần đầu lời nhắc. Một dấu thời gian, ID yêu cầu hoặc tên người dùng trong lời nhắc hệ thống sẽ làm mất hiệu lực mọi thứ sau đó. Hãy đặt nội dung ổn định lên trước và nội dung thay đổi xuống cuối.
Z.ai cũng đã niêm yết bộ nhớ đầu vào được lưu trữ cache là miễn phí trong một khoảng thời gian giới hạn. Hãy coi đây là một chương trình khuyến mãi và xác minh các điều khoản hiện tại thay vì xây dựng một kiến trúc phụ thuộc vào điều đó.
Đòn bẩy thứ hai là nỗ lực suy luận
reasoning_effort mặc định là max trên mô hình này. Đó là cài đặt tốn kém nhất, và là những gì bạn nhận được nếu bạn không bao giờ chạm vào tham số này.
Ba chế độ là low, high và max. Token suy luận được tính phí như đầu ra, vì vậy một tác vụ không cần cân nhắc kỹ lưỡng đang phải trả chi phí đầu ra cho việc suy nghĩ mà không ai đọc. Đối với phân loại, trích xuất, định tuyến và định dạng, chế độ low có thể cắt giảm đáng kể chi phí đầu ra.
Việc thiết lập được đề cập trong hướng dẫn API của chúng tôi. Đây là một thay đổi chỉ cần một dòng code và là điều đầu tiên bạn nên thử nếu hóa đơn của bạn có vẻ cao hơn so với tính toán trên.
So sánh
So với mô hình "anh em" của nó, với giá niêm yết:
| Mô hình | Trung bình trên 1 triệu |
|---|---|
| GLM-5.3-Flash | $0.10 |
| GLM-5.3 | $0.90 |
Khoảng cách gấp chín lần cho sự khác biệt ba điểm trên Chỉ số Trí tuệ của Artificial Analysis, 57 so với 60. Bài so sánh đầy đủ của chúng tôi đề cập đến khi nào sự đánh đổi đó là sai, và câu trả lời ngắn gọn là: khi bạn truyền các phản hồi dài đến một người đang chờ đợi, bởi vì GLM-5.3 tạo ra gần nhanh gấp đôi.
So với GLM-5.2, tuyên bố của Z.ai là chi phí chỉ bằng khoảng một phần mười, cùng với con số chi phí cho mỗi tác vụ là 0,045 đô la. Phân tích giá GLM-5.2 của chúng tôi có biểu giá cũ nếu bạn đang lập ngân sách cho một cuộc di chuyển.
So với các cấp độ đa phương thức giá rẻ từ các nhà cung cấp khác, GLM-5.3-Flash cạnh tranh về giá và độc đáo ở chỗ được cấp phép MIT, điều này có nghĩa là tùy chọn tự host vẫn khả thi. Bài viết về giá Gemini 3.7 Flash của chúng tôi đề cập đến so sánh gần nhất từ phía Google.
Giá của các nhà phân phối khác nhau, đôi khi rất nhiều
Mô hình này có sẵn trực tiếp thông qua Z.ai cùng với OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten và io.net.
Tất cả các nhà cung cấp này không tính phí giống nhau. Ví dụ, AIHubMix đã niêm yết mức giá khoảng 0,113 đô la cho đầu vào và 0,394 đô la cho đầu ra, nằm giữa giá khuyến mãi và giá niêm yết của Z.ai. Một số nhà cung cấp áp dụng chương trình giảm giá ra mắt và một số thì không.
Nếu bạn đang định tuyến qua một trình tổng hợp (aggregator), hãy kiểm tra mức giá hiện tại của nó thay vì cho rằng nó phản ánh giá của Z.ai. Sự tiện lợi của một cổng thống nhất đôi khi đi kèm với một khoản biên lợi nhuận, và ở các mức giá tuyệt đối này, một tỷ lệ tăng giá rất dễ bị bỏ qua và dễ chấp nhận.
Khi tự host bắt đầu có lợi
Các trọng số (weights) được cấp phép MIT, vì vậy việc tự chạy mô hình là một lựa chọn thực tế, và tính toán điểm hòa vốn cho việc tự host trở nên khó khăn hơn khi giá API giảm xuống thấp như thế này.
Một ước tính sơ bộ: việc phục vụ đầy đủ độ chính xác (full-precision serving) yêu cầu một node lớp H200 có 8 GPU, chi phí khoảng 24 đến 48 đô la mỗi ngày trên dung lượng đám mây thuê. Hãy coi đó là 1.000 đô la mỗi tháng như một chi phí cố định phát sinh bất kể node bận hay rảnh.
Với giá API niêm yết, 1.000 đô la có thể mua khoảng 6,7 tỷ token đầu vào. Bạn cần phải chạy khối lượng rất lớn và liên tục trước khi chi phí cố định của một node có thể vượt qua con số đó. Đối với hầu hết các nhóm, câu trả lời chân thật là tự host GLM-5.3-Flash là về quyền kiểm soát, lưu trú dữ liệu hoặc cấp phép hơn là về chi phí.
Ngoại lệ là cấp độ lượng tử hóa (quantized tier). Các phiên bản lượng tử hóa GGUF tồn tại, và việc chạy một mô hình lượng tử hóa trên phần cứng bạn đã sở hữu sẽ thay đổi hoàn toàn cách tính toán vì chi phí biên chỉ là tiền điện. Hướng dẫn chạy cục bộ của chúng tôi đề cập đến những gì mỗi cấp phần cứng có thể thực hiện.
Giải pháp thay thế: gói lập trình
Nếu việc sử dụng của bạn là một nhà phát triển làm việc trong Claude Code hoặc Cline thay vì một ứng dụng thực hiện các cuộc gọi API, thì định giá theo token có thể là một mô hình hoàn toàn sai. Gói lập trình GLM (GLM Coding Plan) bắt đầu khoảng 18 đô la mỗi tháng, bao gồm GLM-5.3-Flash, và được cho là cấp lượng hạn mức sử dụng gấp ba lần so với GLM-5.3. Tài liệu của Z.ai cũng đề cập đến các cuộc gọi ngoài giờ cao điểm tiêu thụ một nửa số điểm tiêu chuẩn.
Đối với một nhà phát triển duy nhất lập trình hàng ngày, một gói cố định thường rẻ hơn và luôn dễ dự đoán hơn so với truy cập API theo mét. Hướng dẫn thiết lập harness của chúng tôi đề cập đến cách kết nối, và bài so sánh các gói lập trình của chúng tôi đặt gói GLM cạnh tranh với các lựa chọn thay thế.
Theo dõi phía đầu ra
Giá đầu vào thu hút sự chú ý vì số lượng lớn hơn. Đầu ra là nơi ngân sách thực sự bị vượt quá, vì hai lý do.
Đầu ra có chi phí cao hơn ba lần so với chi phí đầu vào cho mỗi token, với 0,50 đô la so với 0,15 đô la. Và các token suy luận được tính phí như đầu ra. Một mô hình được đặt ở chế độ nỗ lực suy luận max có thể tạo ra số lượng token gấp nhiều lần so với số token xuất hiện trong câu trả lời cuối cùng, tất cả đều được tính theo tỷ lệ đầu ra.
Sự kết hợp đó có nghĩa là một ứng dụng với lời nhắc khiêm tốn và một mô hình "nhiều lời" có thể kết thúc với chi phí đầu ra chiếm ưu thế mặc dù trên giấy tờ nó có vẻ nặng về đầu vào. Con số trung bình 0,10 đô la cho mỗi triệu giả định tỷ lệ 7:2:1 mà nhiều khối lượng công việc thực tế không khớp.
Giải pháp là đo lường thay vì ước tính. Mỗi phản hồi hoàn thành mang theo một đối tượng usage với số lượng token cho cuộc gọi đó. Hãy ghi nhật ký, tổng hợp nó và so sánh tỷ lệ thực tế với giả định bạn đã lên ngân sách. Nếu đầu ra đang chạy trên khoảng 15% tổng số token của bạn, thì reasoning_effort là nơi đầu tiên cần xem xét và độ dài lời nhắc là thứ hai.
Những việc cần làm trước ngày 9 tháng 9
Ba điều đáng làm trong khi ưu đãi giảm giá vẫn còn:
- Đo lường hỗn hợp token thực tế của bạn. Tỷ lệ trung bình giả định là 7:2:1. Nếu của bạn nặng về đầu ra, chi phí hiệu quả của bạn sẽ gần với mức giá đầu ra 0,50 đô la hơn là con số trung bình 0,10 đô la.
- Kiểm tra tỷ lệ truy cập cache của bạn. Với sự khác biệt giá gấp 5 lần giữa đầu vào được lưu trữ và đầu vào mới, đây là nơi có thể tiết kiệm chi phí.
- Chạy lại mô hình chi phí của bạn với giá niêm yết. Mọi thứ sẽ tăng gấp đôi vào ngày 10 tháng 9. Nếu khối lượng công việc chỉ có lợi nhuận ở mức giá khuyến mãi, bạn có một vấn đề cần giải quyết ngay bây giờ thay vì trong hai tuần nữa.
Theo dõi việc sử dụng token thực tế có nghĩa là thu thập các phản hồi thực tế, vì đối tượng usage trên mỗi lần hoàn thành mang theo số lượng token đầu vào, đầu ra và token được lưu trữ cache mà bạn cần. Chạy các lệnh gọi đại diện của bạn dưới dạng bộ sưu tập đã lưu trong Apidog, với ID mô hình là biến môi trường, sẽ cung cấp cho bạn các con số đó cho mỗi yêu cầu và cho phép bạn chạy lại cùng một bộ kiểm thử với GLM-5.3 để so sánh các hóa đơn thực tế thay vì thông tin quảng cáo.
button
Câu hỏi thường gặp
GLM-5.3-Flash có miễn phí không? Không. Nó đã miễn phí khoảng một tuần khi chạy ẩn danh dưới tên "ox-alpha" trước khi ra mắt, nhưng điều đó đã kết thúc khi có thông báo. Mức giảm giá 50% hiện tại không giống với miễn phí.
Chính xác thì khi nào chương trình giảm giá kết thúc? Ngày 9 tháng 9 năm 2026. Giá niêm yết sẽ được áp dụng từ thời điểm đó.
Tại sao các trang web khác nhau lại niêm yết giá khác nhau? Một số niêm yết giá khuyến mãi, một số niêm yết giá niêm yết, và các nhà phân phối đặt biên lợi nhuận của riêng họ. Luôn kiểm tra nhà cung cấp mà bạn thực sự gọi.
Đầu vào hình ảnh có tốn thêm chi phí không? Hình ảnh tiêu thụ token ngữ cảnh và được tính phí như đầu vào. Không có phụ phí hình ảnh riêng biệt, nhưng một hình ảnh độ phân giải cao sẽ tiêu thụ một số lượng token đáng kể.
Tự host có rẻ hơn không? Chỉ khi khối lượng sử dụng rất lớn và liên tục, hoặc trên phần cứng bạn đã sở hữu bằng cách sử dụng phiên bản lượng tử hóa. Với giá 0,15 đô la cho mỗi triệu token đầu vào, việc thuê một node H200 có 8 GPU rất khó để biện minh chỉ dựa trên chi phí.
