Z.ai đã phát hành GLM-5.3-Flash vào ngày 26 tháng 8 năm 2026. Đây là một mô hình mixture-of-experts (hỗn hợp chuyên gia) với 320 tỷ tham số, trong đó có 18 tỷ tham số hoạt động, nó được phát hành theo giấy phép MIT, và đây là mô hình đầu tiên trong dòng GLM-5 xử lý hình ảnh một cách tự nhiên thay vì thông qua một bộ chuyển đổi thị giác gắn thêm.
Đây cũng là mô hình mà nhiều nhà phát triển đã sử dụng trong một tuần mà không hề hay biết. Thông tin chi tiết hơn sẽ có ở dưới đây.
Nếu bạn đến đây mong đợi "Flash" có nghĩa là "nhanh", bài viết này sẽ phản bác lại điều đó. Quy ước đặt tên đó xuất phát từ Google, nơi các mô hình Flash thực sự là cấp độ có độ trễ thấp. Ở đây, nó có nghĩa khác, và việc hiểu đúng sự khác biệt đó sẽ thay đổi việc mô hình này có phù hợp với khối lượng công việc của bạn hay không.
TÓM TẮT
- Là gì: một mô hình mixture-of-experts (hỗn hợp chuyên gia) 320B-A18B với trọng số mở (MIT) từ Z.ai, ra mắt vào ngày 26 tháng 8 năm 2026.
- Thay đổi nổi bật: đa phương thức tự nhiên. Đầu vào hình ảnh, video và tệp đi thẳng vào mô hình. GLM-5.3 xử lý thị giác thông qua các bộ chuyển đổi riêng biệt, và GLM-5.2 chỉ xử lý văn bản.
- Ngữ cảnh: 1.048.576 token, cùng cửa sổ 1M như GLM-5.3.
- Điểm bán hàng thực sự: chi phí. Z.ai định giá nó xấp xỉ một phần mười giá của GLM-5.2, với mức giá niêm yết 0,15 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra.
- Lưu ý trung thực: nó không nhanh. Artificial Analysis đo được 48,7 token đầu ra mỗi giây, tốc độ này chậm đối với loại kích thước của nó. Thời gian tạo token đầu tiên thực sự tốt, đạt 1,52 giây.
- Nơi để tải: API của Z.ai với tên
glm-5.3-flash, cùng với OpenRouter, Cloudflare Workers AI, Vercel AI Gateway và một số nhà cung cấp khác. Trọng số có sẵn trên Hugging Face.
Thông số kỹ thuật
| Thuộc tính | Giá trị |
|---|---|
| Tổng tham số | 320B |
| Tham số hoạt động | 18B |
| Kiến trúc | Mixture of experts (hỗn hợp chuyên gia), chú ý tuyến tính và thưa lai |
| Giấy phép | MIT |
| Cửa sổ ngữ cảnh | 1.048.576 token |
| Các phương thức đầu vào | Văn bản, hình ảnh, video, tệp |
| Đầu ra | Văn bản |
| Chế độ suy luận | thấp, cao, tối đa (mặc định tối đa) |
| ID mô hình API | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
Một con số cần xem xét kỹ: số lượng token đầu ra tối đa. OpenRouter liệt kê 131.072 và thẻ mô hình của Hugging Face chỉ ra 163.840. Các nguồn này không thống nhất và Z.ai chưa công bố con số nào để giải quyết sự khác biệt này. Nếu ứng dụng của bạn phụ thuộc vào các thế hệ đơn lẻ rất dài, hãy kiểm tra giới hạn với nhà cung cấp thực tế của bạn trước khi xây dựng dựa trên nó.
Đa phương thức tự nhiên là tin tức thực sự
Mọi khả năng thị giác trước đây trong dòng GLM đều xuất hiện dưới dạng một mô hình riêng biệt hoặc một con đường riêng biệt. Z.ai đã phát hành GLM-5V-Turbo và GLM-4.6V dưới dạng các mô hình thị giác riêng biệt. Nếu bạn muốn một mô hình GLM xem một ảnh chụp màn hình, bạn sẽ gọi một điểm cuối khác với điểm cuối mà lưu lượng văn bản của bạn sử dụng.
GLM-5.3-Flash đã loại bỏ điều đó. Hình ảnh, video và tệp là các khối nội dung trong cùng một yêu cầu hoàn thành trò chuyện mang văn bản của bạn. Có một ID mô hình, một dòng thanh toán và một cửa sổ ngữ cảnh chứa hình ảnh và hàng triệu token văn bản xung quanh của bạn cùng một lúc.
Phần cuối cùng đó là điều thú vị. Một cửa sổ ngữ cảnh 1M token cũng chấp nhận hình ảnh có nghĩa là bạn có thể đưa một tài liệu đặc tả dài và một ảnh chụp màn hình của kết quả đã hiển thị vào cùng một lời nhắc và yêu cầu mô hình đối chiếu chúng. Cách diễn đạt của riêng Z.ai nhấn mạnh điều này: nó mô tả mô hình quan sát "giao diện, kết quả hiển thị và phản hồi tương tác", đây là một trường hợp sử dụng cho tác nhân lập trình, chứ không phải chú thích ảnh.
Nếu bạn đang làm việc với các mô hình thị giác rộng hơn, hướng dẫn của chúng tôi về API của GLM-5V-Turbo bao gồm phương pháp thị giác chuyên dụng cũ hơn, và GLM-OCR cho việc hiểu tài liệu bao gồm trường hợp chuyên biệt.
Kiến trúc, tóm tắt
Z.ai đã xây dựng GLM-5.3-Flash trên một mô hình cơ sở mới thay vì hậu huấn luyện GLM-5.2. Hai lựa chọn thiết kế quan trọng đối với cách nó hoạt động:

Chú ý lai (Hybrid attention). Mô hình này kết hợp chú ý tuyến tính (linear attention) với chú ý thưa (sparse attention). Chú ý tuyến tính xử lý các phụ thuộc cục bộ một cách hiệu quả về chi phí; chú ý thưa tập trung vào các token có liên quan toàn cục. Kết quả được công bố là tính toán chú ý ít hơn khoảng ba lần so với GLM-5.3 và bộ nhớ đệm KV nhỏ hơn khoảng 4,4 lần.
Siêu kết nối ràng buộc đa tạp (Manifold-Constrained Hyper-Connections). Thuật ngữ của Z.ai cho công việc tối ưu hiệu quả mở rộng trong bản phát hành này. Hiện chưa có đủ thông tin chi tiết công khai để đánh giá độc lập, vì vậy hãy coi đây là một tính năng kiến trúc do nhà cung cấp mô tả chứ không phải là một lợi thế đã được chứng minh.
Việc giảm bộ nhớ đệm KV là phần có những hậu quả thực tế rõ ràng. Bộ nhớ đệm KV là thứ khiến suy luận ngữ cảnh dài tốn kém về bộ nhớ, và việc thu nhỏ nó đi 4,4 lần là lý do chính khiến mô hình này có thể được cung cấp với giá bằng một phần mười của GLM-5.2 trong khi vẫn duy trì cửa sổ 1M.
Quá trình huấn luyện đã sử dụng một kho ngữ liệu mà Z.ai mô tả là khoảng 30 nghìn tỷ token đa phương thức.
Về tên gọi
Artificial Analysis đo lường GLM-5.3-Flash đạt 48,7 token đầu ra mỗi giây. Để dễ hình dung, tốc độ này nằm ở mức thấp hơn so với các mô hình mã nguồn mở có kích thước tương đương. GLM-5.3, phiên bản lớn hơn, chạy ở tốc độ khoảng 86 token mỗi giây trên cùng phép đo.
Vì vậy, mô hình Flash có tốc độ xấp xỉ bằng một nửa so với mô hình không phải Flash.
Điểm cộng của nó là thời gian tạo token đầu tiên, ở mức 1,52 giây so với mức trung bình của các mô hình mã nguồn mở là 2,14 giây. Nếu khối lượng công việc của bạn là nhiều lượt tương tác ngắn, thì khả năng phản hồi đó là hữu ích. Nếu khối lượng công việc của bạn là tạo các tài liệu dài, bạn sẽ phải đợi lâu hơn so với GLM-5.3.
Hiệu quả mà mô hình này mang lại nằm ở chi phí và bộ nhớ, chứ không phải tốc độ tạo ra theo thời gian thực. Bộ nhớ đệm KV nhỏ hơn và chi phí tính toán chú ý thấp hơn giúp giảm giá mỗi token và giảm dấu chân phục vụ. Chúng không có nghĩa là truyền phát nhanh hơn.
Điều này quan trọng vì hầu hết các bài viết được xuất bản trong những ngày sau khi ra mắt đều lặp lại cách diễn giải của nhà cung cấp mà không kiểm tra số liệu thông lượng, vốn đã được công khai suốt thời gian đó. Hãy chọn mô hình này vì nó không đắt và xử lý được hình ảnh, chứ không phải vì bạn mong đợi nó truyền phát nhanh.
Điểm chuẩn
Các con số do Z.ai công bố khi ra mắt, vì vậy hãy xem chúng như tuyên bố của nhà cung cấp cho đến khi các bên thứ ba tái tạo được chúng:

Con số độc lập là từ Artificial Analysis, xếp GLM-5.3-Flash ở mức 57 trên Chỉ số thông minh v4.1.1. GLM-5.3 đạt 60 điểm. Điểm trung bình của các mô hình mã nguồn mở có kích thước tương tự là 27, vì vậy 57 là một kết quả mạnh mẽ cho phân khúc này mặc dù nó thấp hơn phiên bản lớn hơn của nó.
Z.ai định vị mô hình này gần với Claude Opus 4.8 về công việc lập trình và tác nhân. Đó là đặc điểm hóa của nhà cung cấp dựa trên các đánh giá nội bộ của họ, không phải là kết quả đo lường của bên thứ ba, và khoảng cách ba điểm trong Chỉ số thông minh so với GLM-5.3 của chính họ cho thấy cần có sự thận trọng.
Để biết câu chuyện điểm chuẩn GLM đã phát triển như thế nào qua các bản phát hành trước, phân tích điểm chuẩn GLM-5.2 của chúng tôi giải thích từng đánh giá này thực sự đo lường điều gì.
Tuần lễ Ox Alpha
Vào ngày 20 tháng 8, một mô hình ẩn danh có tên ox-alpha xuất hiện trên các nền tảng suy luận của bên thứ ba với cửa sổ ngữ cảnh 1M token và giá bằng không. Nó đã trở thành một trong những mô hình được sử dụng nhiều nhất trên các nền tảng đó trong vài ngày. Cộng đồng đã xác định nó là của Zhipu trong khoảng 48 giờ dựa trên các đặc điểm đầu ra.

Vào ngày 26 tháng 8, Z.ai đã xác nhận: Ox Alpha chính là GLM-5.3-Flash, và tuần lễ miễn phí đó là một thử nghiệm tải có chủ đích.
Z.ai cũng cho biết rằng trong tuần đó, tất cả lưu lượng truy cập đều được phục vụ trên các bộ tăng tốc trong nước của Trung Quốc sử dụng ngăn xếp dựa trên SGLang, và tuyên bố chi phí phục vụ mỗi token có thể so sánh với phần cứng NVIDIA thông thường. Đó là một tuyên bố của nhà cung cấp về cơ sở hạ tầng của chính họ mà không có xác minh độc lập, vì vậy hãy cân nhắc điều đó một cách hợp lý.
Chúng tôi đã viết về mẫu hình này trước đây khi Pony Alpha hóa ra là một mô hình DeepSeek hoặc GLM. Các lần ra mắt ẩn danh trên các bộ định tuyến bên thứ ba đang trở thành một bước tiêu chuẩn trước khi phát hành, và bài học hữu ích là một mô hình ẩn danh có khả năng đặc biệt với cửa sổ ngữ cảnh "tròn trịa" đáng ngờ gần như luôn là sản phẩm chủ lực chưa được phát hành của ai đó đang thu thập dữ liệu đánh giá.
Cách sử dụng thực tế
- API được lưu trữ. Điểm cuối của Z.ai tương thích với OpenAI. Trỏ máy khách hiện có của bạn tới
https://api.z.ai/api/paas/v4/và đặt mô hình làglm-5.3-flash. Hướng dẫn API GLM-5.3-Flash của chúng tôi sẽ hướng dẫn bạn về xác thực, tải trọng đầu vào hình ảnh và tham số nỗ lực suy luận. - Các nhà cung cấp bên thứ ba. OpenRouter cung cấp nó dưới tên
z-ai/glm-5.3-flash. Nó cũng có mặt trên Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten và io.net. Giá cả khác nhau giữa các nhà phân phối, đôi khi rất đáng kể. - Các tác nhân lập trình (Coding agents). Flash được bao gồm trong Gói Lập trình GLM và được báo cáo là có hạn mức sử dụng gấp ba lần so với GLM-5.3, đây là lý do thực tế mà người đăng ký sẽ chuyển đổi. Tài liệu của Z.ai cũng lưu ý rằng các cuộc gọi ngoài giờ cao điểm tiêu thụ một nửa số điểm tiêu chuẩn.
- Tự lưu trữ. Các trọng số được cấp phép MIT và có trên Hugging Face. vLLM, SGLang, TokenSpeed và KTransformers đều hỗ trợ nó, và các lượng tử hóa GGUF tồn tại cho các hệ thống nhỏ hơn.
Bạn có nên sử dụng nó không?
Hãy sử dụng GLM-5.3-Flash nếu bạn cần hiểu hình ảnh hoặc video trong cùng một lệnh gọi với văn bản của bạn, nếu chi phí mỗi token là ràng buộc bạn đang tối ưu hóa, hoặc nếu bạn muốn các trọng số mở mà bạn có thể tự lưu trữ theo giấy phép tự do.
Thay vào đó, hãy chọn GLM-5.3 nếu bạn cần thêm một vài điểm về chất lượng suy luận, hoặc nếu thông lượng tạo ra quan trọng hơn giá cả đối với bạn. So sánh song song giữa hai mô hình của chúng tôi sẽ phân tích chi tiết quyết định này, và GLM-5.3 là gì sẽ đề cập đến mô hình cơ sở theo các điều kiện riêng của nó.
Dù bạn chọn cái nào, việc chuyển đổi chỉ là thay đổi một dòng ID mô hình trên một điểm cuối tương thích OpenAI, điều này giúp dễ dàng kiểm tra cả hai với khối lượng công việc của riêng bạn thay vì tin tưởng vào bảng điểm chuẩn của bất kỳ ai. Đó là cách đúng đắn để giải quyết vấn đề.
Việc kiểm tra một sự thay đổi mô hình đúng cách có nghĩa là gửi các yêu cầu thực và kiểm tra các phản hồi thực, bao gồm cả những phản hồi đa phương thức khó tạo thủ công bằng curl. Apidog cho phép bạn lưu các lệnh gọi đó dưới dạng một bộ sưu tập có thể tái sử dụng kèm theo các xác nhận, vì vậy khi bạn chuyển từ GLM-5.3 sang Flash, bạn có thể xác nhận rằng cấu trúc phản hồi không thay đổi thay vì phát hiện ra trong môi trường sản xuất.
CÂU HỎI THƯỜNG GẶP
- GLM-5.3-Flash có miễn phí không? Không còn nữa. Tuần lễ Ox Alpha miễn phí đã kết thúc khi mô hình được công bố chính thức. Có một chương trình giảm giá ra mắt 50% kéo dài đến hết ngày 9 tháng 9 năm 2026, sau đó giá niêm yết sẽ được áp dụng.
- Nó có nhanh hơn GLM-5.3 không? Không. Nó tạo ra khoảng 49 token mỗi giây so với 86 của GLM-5.3. Tuy nhiên, nó bắt đầu phản hồi nhanh hơn, ở mức 1,52 giây cho token đầu tiên.
- Nó có thực sự xử lý được một triệu token ngữ cảnh không? Cửa sổ được cấu hình là 1.048.576 token, được xác nhận trong cấu hình mô hình và bởi Artificial Analysis. Lưu ý rằng OpenRouter liệt kê một con số lớn hơn là 1.310.720; hãy coi đó là một danh sách từ phía nhà cung cấp chứ không phải là thông số kỹ thuật của mô hình.
- Nó có chấp nhận video không? Tài liệu của Z.ai liệt kê đầu vào văn bản, hình ảnh, video và tệp. Hỗ trợ video mới hơn và ít được sử dụng rộng rãi hơn đầu vào hình ảnh, vì vậy hãy xác thực nó với phương tiện của riêng bạn trước khi phụ thuộc vào nó.
- Các trọng số được cấp phép theo giấy phép nào? MIT, với các trọng số được công bố tại
zai-org/GLM-5.3-Flashtrên Hugging Face.
