GLM-5.2 là mô hình chủ lực mới nhất từ Z.ai (phòng thí nghiệm AI Zhipu), và nó ra mắt với một tuyên bố rõ ràng: trọng số mở, ưu tiên lập trình và cạnh tranh với các mô hình tiên tiến đóng lớn nhất. Nếu bạn đã nghe tên này và muốn có câu trả lời thẳng thắn cho câu hỏi “GLM-5.2 là gì,” đây là hướng dẫn chính thức. Chúng ta sẽ tìm hiểu ai tạo ra nó, thực chất bên trong nó là gì, cách tiếp cận nó và những hạn chế chân thực của nó.
nút
TÓM TẮT
- Nó là gì: GLM-5.2 là một mô hình ngôn ngữ lớn (LLM) với trọng số mở từ Z.ai, được xây dựng cho lập trình, suy luận và sử dụng công cụ tự động.
- Kích thước: Khoảng 753 tỷ tham số trong thiết kế Mô hình hỗn hợp chuyên gia (MoE), BF16, với một thủ thuật chú ý thưa mới "IndexShare" để giảm chi phí cho ngữ cảnh dài.
- Ngữ cảnh: 1 triệu token (1.048.576). Đầu ra tối đa được liệt kê là lên tới 128K theo tài liệu của z.ai (xác minh trực tiếp, vì không phải máy chủ nào cũng liệt kê giới hạn giống nhau).
- Giấy phép: MIT, trọng số mở. Bạn có thể tải xuống, tự lưu trữ, tinh chỉnh và phân phối thương mại.
- Điểm chuẩn nổi bật: Terminal-Bench 2.1 đã tăng từ 62.0 của GLM-5.1 lên 81.0, theo kết quả được Z.ai công bố. SWE-bench Pro đạt 62.1.
- Truy cập: API của Z.ai, Claude Code thông qua Gói lập trình GLM, OpenRouter và Ollama.
- Lưu ý: Nó là đầu vào văn bản, đầu ra văn bản. Không có biến thể thị giác được xác nhận. Đừng mong đợi đầu vào hình ảnh.
Ai tạo ra GLM-5.2 và nó là gì
GLM-5.2 đến từ Z.ai, phòng thí nghiệm còn được biết đến với tên Zhipu AI. Đây là phiên bản mới nhất trong dòng GLM (“Mô hình Ngôn ngữ Tổng quát”), sau bản phát hành GLM-5.1. Định vị rất rõ ràng: đây là một mô hình chủ lực về lập trình công bố trọng số của nó một cách công khai thay vì ẩn sau bức tường chỉ có API.

Lập trường trọng số mở đó là toàn bộ câu chuyện ở đây. Hầu hết các mô hình cạnh tranh với GPT-5.5 hoặc Claude Opus 4.8 đều là mô hình đóng. GLM-5.2 đặt khả năng tương đương vào một tệp bạn có thể tải xuống. Nếu bạn đã đọc tổng quan về GLM-5.1 của chúng tôi, hãy coi 5.2 là cùng một dòng sản phẩm với trọng tâm sắc bén hơn về lập trình và tác nhân.
GLM-5.2 là một mô hình đa năng với thiên hướng về lập trình. Nó xử lý suy luận, toán học và văn bản đa ngôn ngữ (tiếng Anh và tiếng Trung là hàng đầu), nhưng Z.ai đã tinh chỉnh mạnh mẽ nhất nó cho kỹ thuật phần mềm và công việc tác nhân đa bước, dựa trên công cụ.
Danh tính: cách tìm GLM-5.2 trên các nền tảng
Một điều khiến mọi người bối rối với các mô hình mở là cách đặt tên. Cùng một mô hình mang các định danh khác nhau tùy thuộc vào nơi bạn tải nó. Dưới đây là bản đồ.
| Nền tảng | Định danh |
|---|---|
| Hugging Face | zai-org/GLM-5.2 |
| API của Z.ai | glm-5.2 |
| Ollama | glm-5.2 |
| OpenRouter | z-ai/glm-5.2 |
Các trọng số được cấp phép MIT không có giới hạn khu vực, vì vậy kho lưu trữ Hugging Face có thể tải xuống thực sự chứ không bị giới hạn. Bạn có thể xác nhận thẻ và tệp tại trang GLM-5.2 trên Hugging Face.
Kiến trúc một cách đơn giản: MoE 753B + IndexShare
GLM-5.2 là mô hình hỗn hợp chuyên gia (Mixture-of-Experts) với tổng cộng khoảng 753 tỷ tham số, được phục vụ trong BF16. MoE có nghĩa là mô hình được chia thành nhiều mạng con "chuyên gia", và chỉ một phần trong số đó được kích hoạt cho bất kỳ token nào. Bạn có được năng lực kiến thức của một mô hình lớn mà không phải trả toàn bộ chi phí tính toán cho mỗi lần chuyển tiếp. Đó là cách một mô hình 753B vẫn có thể sử dụng được.

Phần mới hơn là chú ý thưa (sparse attention). GLM-5.2 giới thiệu một phương pháp mà Z.ai gọi là IndexShare. Chú ý thông thường nhanh chóng trở nên đắt đỏ khi ngữ cảnh của bạn mở rộng, vì mỗi token chú ý đến mọi token khác. IndexShare tái sử dụng một "indexer" duy nhất trên mỗi nhóm 4 lớp chú ý thưa, thay vì tính toán một cái mới cho mỗi lớp. Trong thực tế, điều đó giảm chi phí chú ý ở ngữ cảnh dài, đây chính xác là điều bạn muốn khi cửa sổ của bạn rộng một triệu token.
Bạn không cần phải hiểu toán học để hưởng lợi từ nó. Điểm mấu chốt: GLM-5.2 được thiết kế sao cho việc cung cấp một cơ sở mã lớn hoặc một tài liệu dài không làm tăng độ trễ và chi phí như một mô hình dày đặc.
Cửa sổ ngữ cảnh 1 triệu token
GLM-5.2 hỗ trợ cửa sổ ngữ cảnh 1 triệu token (chính xác là 1.048.576 token). Điều đó đủ để đưa toàn bộ một kho lưu trữ cỡ trung bình, một đặc tả dài hoặc một chồng tài liệu liên quan vào một lời nhắc duy nhất và yêu cầu mô hình suy luận trên tất cả các thông tin đó.
Đầu ra tối đa là nơi bạn nên cẩn thận. Tài liệu của z.ai liệt kê đầu ra lên đến 128K token, nhưng không phải mọi máy chủ đều công bố cùng một con số, và OpenRouter hoàn toàn không liệt kê nó. Vì vậy, hãy xem 128K là giới hạn được ghi nhận để xác minh trực tiếp chứ không phải là một đảm bảo trên mọi điểm cuối. Nếu quy trình làm việc của bạn phụ thuộc vào việc tạo ra các phản hồi rất dài, hãy kiểm tra giới hạn trên nhà cung cấp cụ thể mà bạn đang sử dụng.
Để hiểu rõ hơn về cách thế hệ này đã nâng tầm, so sánh GLM-5.2 với GLM-5.1 của chúng tôi phân tích những gì đã thay đổi qua từng bản phát hành.
Nỗ lực suy nghĩ: Cao, Tối đa và Tắt
GLM-5.2 là một mô hình có khả năng suy luận với hành vi "suy nghĩ" có thể kiểm soát. Bạn có hai cấp độ nỗ lực suy nghĩ:
- Cao, suy luận mạnh mẽ với chi phí tính toán nhẹ hơn.
- Tối đa, suy luận sâu sắc nhất. Z.ai khuyến nghị Max đặc biệt cho các tác vụ lập trình.
Bạn cũng có thể tắt hoàn toàn suy nghĩ. Đối với các tra cứu nhanh, định dạng hoặc chuyển đổi đơn giản, bạn không muốn mô hình đốt token vào một chuỗi suy nghĩ nội bộ. Tắt suy nghĩ giúp các cuộc gọi đó nhanh và rẻ.
Trong API, điều này ánh xạ tới tham số thinking ({"type": "enabled"} hoặc {"type": "disabled"}) và giá trị reasoning_effort như "max". Chúng tôi đi sâu hơn vào cấu trúc yêu cầu trong hướng dẫn API GLM-5.2, nhưng mô hình tư duy rất đơn giản: tăng cường suy luận cho công việc kỹ thuật khó, tắt nó đi cho các cuộc gọi tầm thường.
Giấy phép MIT và trọng số mở: những gì bạn thực sự nhận được
"Trọng số mở" được sử dụng khá tùy tiện, vì vậy đây là những gì giấy phép MIT của GLM-5.2 cho phép một cách cụ thể:
- Tự lưu trữ. Chạy nó trên phần cứng của riêng bạn hoặc GPU thuê. Không có gì rời khỏi mạng của bạn.
- Tinh chỉnh. Điều chỉnh nó theo lĩnh vực của bạn, quy ước cơ sở mã của bạn hoặc một tác vụ chuyên biệt.
- Sử dụng thương mại. MIT rất linh hoạt. Bạn có thể xây dựng sản phẩm trên đó mà không bị ràng buộc bởi giấy phép hạn chế.
- Không có khóa khu vực. Các trọng số không bị giới hạn bởi kiểm tra khu vực.
Đối với các nhóm có hạn chế về cư trú dữ liệu hoặc tuân thủ, điều này quan trọng hơn một hoặc hai điểm chuẩn. Bạn có thể giữ lời nhắc và mã trong nội bộ. Nếu bạn muốn thử đường dẫn hoàn toàn cục bộ, hãy xem chạy GLM-5 cục bộ miễn phí và GLM-5 miễn phí với Ollama để biết các mẫu, áp dụng cho 5.2.
Ưu tiên lập trình và tác nhân: các điểm chuẩn
Z.ai đã xây dựng GLM-5.2 để thực hiện công việc phần mềm thực sự, chứ không chỉ nói chuyện về nó. Câu chuyện điểm chuẩn tập trung vào lập trình và sử dụng công cụ tác nhân. Các con số dưới đây là kết quả được Z.ai công bố, vì vậy hãy đọc chúng như các phép đo của phòng thí nghiệm chứ không phải điểm số của bên thứ ba độc lập.
| Điểm chuẩn | GLM-5.2 | So sánh đáng chú ý |
|---|---|---|
| Terminal-Bench 2.1 | 81.0 | GLM-5.1 đạt 62.0 |
| SWE-bench Pro | 62.1 | GPT-5.5 58.6, GLM-5.1 58.4 |
| MCP-Atlas | 77.0 | GPT-5.5 75.3, Claude Opus 4.8 77.8 |
| Kỳ thi Cuối cùng của Nhân loại (có công cụ) | 54.7 | GPT-5.5 52.2 |
| AIME 2026 | 99.2 | n/a |
| GPQA-Diamond | 91.2 | n/a |
Chỉ số nổi bật là Terminal-Bench. Tăng từ 62.0 lên 81.0 trong một thế hệ là một bước nhảy vọt lớn trên một điểm chuẩn đo lường liệu một mô hình có thể thực sự vận hành một terminal để hoàn thành nhiệm vụ hay không. SWE-bench Pro ở mức 62.1, vượt qua GPT-5.5 với 58.6, là tiêu đề khác: nó chỉ ra khả năng giải quyết vấn đề cấp độ kho lưu trữ thực sự, không phải các đoạn mã nhỏ.
Z.ai cũng báo cáo GLM-5.2 là mô hình mã nguồn mở cao nhất trên FrontierSWE, PostTrainBench và SWE-Marathon, và định vị nó cạnh tranh với GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro và DeepSeek-V4-Pro. VentureBeat đã thẳng thừng chỉ ra khía cạnh chi phí, viết rằng GLM-5.2 “vượt trội GPT-5.5 trong lập trình dài hạn với chi phí chỉ khoảng 1/6” (câu này là cách diễn đạt của VentureBeat, trong bài viết về GLM-5.2, không phải là đo lường của Apidog).
Để biết phân tích đầy đủ và những lưu ý so sánh trực tiếp, hãy xem phân tích chuyên sâu về điểm chuẩn GLM-5.2 của chúng tôi và bài so sánh trực tiếp GLM-5.2 với GPT-5.5, Claude Opus và Gemini.
Cách truy cập GLM-5.2 trong nháy mắt
Bạn có bốn con đường thực tế, tùy thuộc vào việc bạn muốn một API được lưu trữ, một thiết lập lập trình tác nhân, một bộ định tuyến hay một cài đặt cục bộ.
| Đường dẫn truy cập | Tốt nhất cho | Ghi chú nhanh |
|---|---|---|
| API của Z.ai | Cuộc gọi trực tiếp, được lưu trữ | Tương thích OpenAI, điểm cuối tại https://api.z.ai/api/paas/v4/ |
| Claude Code (Gói lập trình GLM) | Lập trình tác nhân trong terminal của bạn | URL cơ sở tương thích Anthropic, chọn biến thể [1m] |
| OpenRouter | Một khóa, nhiều mô hình | ID mô hình z-ai/glm-5.2 |
| Ollama | Cục bộ / ngoại tuyến | Kéo glm-5.2 từ thư viện |
API của Z.ai. API chung tương thích OpenAI. Bạn truy cập https://api.z.ai/api/paas/v4/chat/completions với một khóa Bearer, và chuyển các tham số thông thường cộng với thinking, reasoning_effort, temperature và stream. Gọi hàm và công cụ được hỗ trợ.
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Refactor this function for readability."}],
"thinking": {"type": "enabled"},
"reasoning_effort": "max",
"stream": true
}'
Claude Code thông qua Gói lập trình GLM. Z.ai công bố một điểm cuối lập trình tương thích Anthropic, vì vậy bạn có thể trỏ Claude Code vào GLM-5.2. URL cơ sở lập trình là https://api.z.ai/api/coding/paas/v4 (một số nguồn hiển thị open.z.ai/api/paas/v4, vì vậy hãy xác minh trực tiếp), và bạn thiết lập môi trường Claude Code của mình để định tuyến qua nó.
export ANTHROPIC_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export ANTHROPIC_API_KEY="your-glm-coding-plan-key"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.2[1m]"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.2[1m]"
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000
export API_TIMEOUT_MS=3000000
Hậu tố [1m] chọn biến thể ngữ cảnh 1M. Dòng API_TIMEOUT_MS không phải là phần đệm tùy chọn: các cuộc gọi ngữ cảnh dài, lớn có thể vượt quá thời gian chờ mặc định của Claude Code, vì vậy việc tăng nó giúp công cụ không kết thúc yêu cầu giữa chừng. Chúng tôi hướng dẫn thiết lập này, cộng với Cline và Cursor, trong hướng dẫn GLM-5.2 trong Claude Code, Cline và Cursor. Nếu bạn đã sử dụng thế hệ trước theo cách đó, bài viết GLM-5.1 với Claude Code của chúng tôi cũng bao gồm quy trình tương tự.
OpenRouter. Nếu bạn đã định tuyến qua OpenRouter, GLM-5.2 có sẵn dưới dạng z-ai/glm-5.2. Kiểm tra danh sách trực tiếp tại openrouter.ai/z-ai/glm-5.2. Lưu ý không có làn OpenRouter miễn phí cho mô hình này, vì vậy đừng lên kế hoạch dựa vào nó.
Ollama. Để sử dụng cục bộ, kéo nó từ thư viện Ollama. Đây là tuyến đường cho công việc ngoại tuyến hoặc kiểm soát dữ liệu nghiêm ngặt, với đánh đổi rõ ràng là bạn cần bộ nhớ GPU thực để phục vụ một MoE 753B một cách thoải mái.
Để biết tổng hợp các tùy chọn thực sự không mất phí, hãy xem cách sử dụng GLM-5.2 miễn phí.
Giá cả, tóm tắt
Trên API được lưu trữ, OpenRouter xác nhận giá ở mức $1,40 cho mỗi 1 triệu token đầu vào và $4,40 cho mỗi 1 triệu token đầu ra. VentureBeat trích dẫn đầu vào được lưu trữ khoảng $0,26 cho mỗi 1 triệu. Gói lập trình GLM có các gói đăng ký theo cấp (Lite, Pro, Max và Team), nhưng số liệu hàng tháng chính xác khác nhau giữa các nguồn thứ cấp, vì vậy hãy xác nhận giá hiện tại tại z.ai trước khi bạn cam kết (tính đến tháng 6 năm 2026). Phân tích giá GLM-5.2 của chúng tôi duy trì một bảng kê liên tục.
Apidog phù hợp ở đâu
Nếu bạn đang xây dựng dựa trên API GLM-5.2, hoặc tích hợp nó vào một tác nhân gọi các dịch vụ của riêng bạn, bạn vẫn cần thiết kế, kiểm thử và ghi lại các điểm cuối đó. Đó là nơi Apidog giúp đỡ. Bạn có thể mô phỏng các điểm cuối được hỗ trợ bởi LLM trước khi tích hợp thực sự sẵn sàng, gỡ lỗi cấu trúc yêu cầu và phản hồi (bao gồm tải trọng luồng và gọi công cụ), và giữ tài liệu API của bạn đồng bộ khi hợp đồng thay đổi. Đây là một nền tảng API tất cả trong một, vì vậy thiết kế, gỡ lỗi, kiểm thử, mô phỏng và tài liệu đều nằm ở một nơi thay vì bốn. Khi bạn sẵn sàng dùng thử, tải xuống Apidog và hướng nó đến tích hợp GLM-5.2 của bạn.
GLM-5.2 so sánh như thế nào với phần còn lại của dòng sản phẩm và lĩnh vực
GLM-5.2 là đỉnh cao về lập trình và tác nhân của dòng GLM hiện tại. Nếu bạn đang cân nhắc nó với các bản phát hành trước đó hoặc các phòng thí nghiệm đối thủ, đây là những bài đọc hữu ích tiếp theo:
- GLM-5.1 so với Claude, GPT, Gemini và DeepSeek để biết vị thế của thế hệ trước.
- GLM-5 so với DeepSeek so với GPT-5 về tốc độ và chi phí cho khía cạnh hiệu quả.
- Claude Opus 4.8 so với GPT-5.5 so với Gemini 3.5 cho ranh giới mô hình đóng mà nó đang theo đuổi.
- Bài đăng blog chính thức của Z.ai về GLM-5.2 và tài liệu để biết thông số kỹ thuật nguồn đáng tin cậy.
Câu hỏi thường gặp
GLM-5.2 là gì trong một câu? Nó là LLM chủ lực với trọng số mở của Z.ai, một mô hình MoE khoảng 753 tỷ tham số được tinh chỉnh cho lập trình, suy luận và sử dụng công cụ tác nhân, với cửa sổ ngữ cảnh 1 triệu token và giấy phép MIT.
GLM-5.2 có thực sự miễn phí không? Các trọng số được tải xuống và tự lưu trữ miễn phí theo giấy phép MIT. API được lưu trữ của Z.ai và Gói lập trình GLM là có phí. Không có cấp OpenRouter miễn phí cho nó, vì vậy "miễn phí" ở đây có nghĩa là trọng số mở, chứ không phải là một điểm cuối được lưu trữ miễn phí.
GLM-5.2 có thể nhìn thấy hình ảnh không? Không. Nó là đầu vào văn bản, đầu ra văn bản theo tài liệu API, không có biến thể thị giác được xác nhận. Sử dụng một mô hình thị giác riêng nếu bạn cần đầu vào hình ảnh.
GLM-5.2 khác gì so với GLM-5.1? Bước nhảy vọt đáng kể nhất là lập trình tác nhân. Terminal-Bench 2.1 đã tăng từ 62.0 lên 81.0 theo kết quả của Z.ai, cộng với những cải tiến về SWE-bench Pro và chú ý thưa IndexShare mới. Xem so sánh GLM-5.2 với GLM-5.1 để biết sự khác biệt đầy đủ.
Nó hỗ trợ độ dài ngữ cảnh và độ dài đầu ra bao nhiêu? Ngữ cảnh là 1 triệu token. Đầu ra được ghi nhận lên đến 128K theo z.ai, nhưng không phải máy chủ nào cũng liệt kê giới hạn giống nhau, vì vậy hãy xác minh trên nhà cung cấp của bạn.
Phiên bản ngắn
GLM-5.2 là điều xảy ra khi một phòng thí nghiệm trọng số mở quyết định cạnh tranh trực tiếp với ranh giới đóng trong lĩnh vực lập trình. Bạn có được một mô hình MoE 753B với cửa sổ một triệu token, nỗ lực suy luận có thể kiểm soát, giấy phép MIT cho phép bạn tự lưu trữ và phân phối, và kết quả điểm chuẩn đặt nó vào cuộc trò chuyện với GPT-5.5 và Claude Opus 4.8, ít nhất là theo số liệu của Z.ai. Những lưu ý là có thật (chỉ văn bản, giới hạn đầu ra cần xác minh, tuyên bố điểm chuẩn từ nhà cung cấp), nhưng đề xuất cốt lõi vẫn đúng: đây là một mô hình lập trình nghiêm túc mà bạn thực sự có thể sở hữu. Bắt đầu với hướng dẫn API GLM-5.2 khi bạn sẵn sàng xây dựng.
nút
