Bạn đã đang chạy GLM-5.1 trong sản xuất. Các vòng lặp agent của bạn hoạt động, trợ lý lập trình của bạn gửi các bản vá lỗi (diffs), và các hóa đơn có thể dự đoán được. Sau đó Z.ai phát hành GLM-5.2, và câu hỏi xuất hiện trên bàn làm việc của bạn: bạn có thay đổi một dòng trong cấu hình của mình và đổi ID mô hình, hay bạn giữ nguyên?
Đây là một quyết định GLM-5.2 so với GLM-5.1, không phải một hướng dẫn. Vì vậy, bài viết này bỏ qua phần giải thích từ đầu (nếu bạn cần, tổng quan về GLM-5.1 và hướng dẫn API GLM-5.1 là những điểm khởi đầu phù hợp) và đi thẳng vào sự khác biệt: điều gì thực sự đã thay đổi, chi phí để bạn chuyển đổi là bao nhiêu, và một kết luận rõ ràng “nâng cấp nếu / giữ nguyên nếu” ở cuối.
Tóm tắt ngay từ đầu: bản nâng cấp GLM-5.2 chủ yếu tập trung vào lập trình tự động (agentic) và theo hướng dài hạn, cấp độ giá dường như không thay đổi, và việc chuyển đổi chỉ là thay đổi một dòng ID mô hình. Đối với hầu hết các tác vụ đòi hỏi nhiều mã hóa và sử dụng công cụ, sự kết hợp này làm cho nó trở thành một lựa chọn dễ dàng. Sự tinh tế nằm ở các chi tiết dưới đây.
Phiên bản 30 giây
| GLM-5.1 | GLM-5.2 | |
|---|---|---|
| API model id | glm-5.1 |
glm-5.2 |
| Context window | lên đến 1M token | 1M token (1.048.576) |
| Terminal-Bench 2.1 | 62.0 | 81.0 |
| SWE-bench Pro | 58.4 | 62.1 |
| MCP-Atlas | (thế hệ trước) | 77.0 |
| Attention | dense/standard | IndexShare sparse attention |
| Thinking effort | thinking on/off | thêm các cấp độ High và Max |
| API price tier | (cùng cấp độ) | $1.40 vào / $4.40 ra mỗi 1M (xác minh trực tiếp) |
Điểm nổi bật của toàn bộ bước nhảy từ GLM-5.1 lên GLM-5.2 là Terminal-Bench. Mọi thứ khác chỉ là tăng thêm; Terminal-Bench thì không.
Điều gì thực sự đã thay đổi trong GLM-5.2
Lập trình tự động và lập trình terminal có một bước nhảy vọt thực sự
Kết quả được công bố của Z.ai cho thấy GLM-5.2 đạt 81.0 trên Terminal-Bench 2.1, tăng từ 62.0 của GLM-5.1. Đây là loại khoảng cách mà bạn thường không thấy trong một phiên bản nhỏ. Terminal-Bench đo lường khả năng một mô hình có thể điều khiển một shell thực sự để hoàn thành công việc: đọc đầu ra, phục hồi từ lỗi, chuỗi lệnh, hoàn thành tác vụ. Nếu trường hợp sử dụng của bạn là một agent sống trong một terminal hoặc chạy các chuỗi công cụ nhiều bước, đây là cải tiến GLM-5.2 quan trọng nhất.

Các chỉ số lập trình khác cũng thay đổi, chỉ là ít đáng kể hơn:
- SWE-bench Pro: 58.4 lên 62.1 (Z.ai cũng báo cáo GLM-5.2 vượt GPT-5.5 ở mức 58.6 tại đây)
- MCP-Atlas: 77.0, cùng mức với GPT-5.5 (75.3) và Claude Opus 4.8 (77.8)
- Humanity’s Last Exam với công cụ: 54.7 (GPT-5.5 52.2, theo Z.ai)
- AIME 2026: 99.2, GPQA-Diamond: 91.2
Z.ai cũng liệt kê GLM-5.2 là mô hình mã nguồn mở cao nhất trên FrontierSWE, PostTrainBench và SWE-Marathon. Hãy xem các điểm chuẩn khi ra mắt là kết quả được công bố của Z.ai cho đến khi các bên thứ ba tái tạo chúng, nhưng hướng đi đã rõ ràng: những cải tiến lớn hơn nằm ở các tác vụ tự động, dài hạn, sử dụng công cụ hơn là Q&A một lần. Để so sánh rộng hơn, phân tích GLM-5.1 so với Claude/GPT/Gemini/DeepSeek là một cơ sở hữu ích cho vị trí của 5.1.
IndexShare: cơ chế attention thưa thớt mới
Thay đổi kiến trúc trong GLM-5.2 là một lược đồ attention thưa thớt mà Z.ai gọi là IndexShare. Thay vì tính toán lại một chỉ mục attention ở mỗi lớp, nó tái sử dụng một bộ lập chỉ mục trên mỗi nhóm bốn lớp attention thưa thớt. Hiệu quả thực tế là chi phí attention thấp hơn ở ngữ cảnh dài, vốn là phần tốn kém khi bạn cấp cho một mô hình hàng trăm nghìn token.

Bản thân mô hình vẫn là một thiết kế hỗn hợp chuyên gia lớn (khoảng 753B tham số, BF16) với cửa sổ ngữ cảnh 1M token tương tự (1.048.576 token). IndexShare không thay đổi con số ngữ cảnh tiêu đề; nó thay đổi cách mô hình có thể xử lý ngữ cảnh đó một cách rẻ tiền. Nếu lời nhắc của bạn ngắn, bạn sẽ hầu như không nhận thấy. Nếu bạn đưa toàn bộ kho lưu trữ hoặc các bản ghi dài vào ngữ cảnh, đây là lý do đằng sau việc nâng cấp có thể cảm thấy nhanh hơn mà không tốn thêm chi phí.
Các cấp độ nỗ lực suy nghĩ: High và Max
GLM-5.1 cho phép bạn bật hoặc tắt suy nghĩ. GLM-5.2 bổ sung nỗ lực suy nghĩ theo cấp độ: High và Max. Z.ai khuyến nghị Max cho việc lập trình. Bạn vẫn có thể tắt hoàn toàn suy nghĩ cho các cuộc gọi nhạy cảm với độ trễ, độ phức tạp thấp.

Trong API, điều này được ánh xạ tới hai nút bạn đặt cùng nhau:
{
"model": "glm-5.2",
"thinking": { "type": "enabled" },
"reasoning_effort": "max",
"temperature": 0.6,
"stream": true,
"messages": [
{ "role": "user", "content": "Refactor this module and explain the diff." }
]
}
Đây là thay đổi ảnh hưởng đến hành vi nhiều nhất cho việc sử dụng hàng ngày. Cùng một lời nhắc với reasoning_effort: "max" sẽ suy nghĩ lâu hơn và thường trả về mã mạnh hơn, với chi phí là nhiều token đầu ra hơn và độ trễ cao hơn. Vì vậy, một phần của việc nâng cấp GLM-5.2 không phải là mô hình trở nên thông minh hơn miễn phí; mà là bạn có một công tắc để sử dụng khả năng suy luận khi nó có ích và bỏ qua khi không cần.
Điều gì giữ nguyên
Đây là phần làm cho quyết định trở nên dễ dàng, vì vậy nó xứng đáng có một phần riêng.
- Giao diện API không thay đổi. Vẫn tương thích với OpenAI, cùng hình dạng endpoint tại
https://api.z.ai/api/paas/v4/chat/completions(URL cơ sởhttps://api.z.ai/api/paas/v4/), cùng xác thực Bearer-key, cùng gọi hàm/công cụ và truyền phát. Hướng dẫn API GLM-5.1 bạn đã viết vẫn áp dụng. - Cửa sổ ngữ cảnh vẫn là 1M token. Không cần kiến trúc lại chiến lược phân đoạn của bạn.
- Cấp phép và quyền truy cập giống nhau. Trọng số mở, giấy phép MIT, không có hạn chế khu vực, có sẵn trên Hugging Face, OpenRouter (
z-ai/glm-5.2), và Ollama (glm-5.2). - Vẫn là văn bản đầu vào, văn bản đầu ra. Không có phiên bản thị giác được xác nhận. Đừng lên kế hoạch cho một “GLM-5.2V”; nó chưa được công bố.
- Cấp độ giá dường như không thay đổi. Đây là điều quan trọng nhất đối với kinh tế nâng cấp, sẽ được đề cập tiếp theo.
Kinh tế nâng cấp
Đây là lý do tại sao câu hỏi “tôi có nên nâng cấp GLM-5.2 không” có câu trả lời thân thiện hơn so với hầu hết các bản cập nhật phiên bản: mức phạt chi phí dường như gần như bằng không.
OpenRouter liệt kê GLM-5.2 ở mức 1.40 đô la cho mỗi 1 triệu token đầu vào và 4.40 đô la cho mỗi 1 triệu token đầu ra. VentureBeat báo cáo đầu vào được lưu trữ khoảng 0.26 đô la cho mỗi 1 triệu (gán con số này cho VentureBeat). Các mức giá đầu vào/đầu ra này nằm trong cùng cấp độ mà người dùng GLM-5.1 đã trả, vì vậy việc chuyển lên không có nghĩa là chuyển lên một bậc giá cao hơn. Xác nhận các con số trực tiếp tại nguồn trước khi bạn cam kết ngân sách; các trang giá có thể thay đổi. Phân tích giá đầy đủ nằm trong bài viết về giá GLM-5.2.
Cách trình bày của VentureBeat là điều đáng trích dẫn cho một bên liên quan có tư duy tài chính: họ mô tả GLM-5.2 đánh bại GPT-5.5 trên các điểm chuẩn lập trình dài hạn với chi phí thấp hơn khoảng một phần sáu. Đó là đặc điểm của họ, không phải phép đo của Apidog, nhưng nó nắm bắt được đề xuất giá trị: lập trình agentic cận biên với giá của mã nguồn mở.
Một vài lưu ý về chi phí để bạn có cái nhìn rõ ràng:
- Chế độ suy nghĩ Max tốn token đầu ra. Nếu bạn chuyển đổi mọi cuộc gọi sang
reasoning_effort: "max", hóa đơn token đầu ra của bạn sẽ tăng lên mặc dù tỷ lệ mỗi token không đổi. Dành Max cho các cuộc gọi có lợi (tái cấu trúc khó khăn, thay đổi nhiều tệp) và giữ các cuộc gọi thông thường ở mức High hoặc thinking-off. - Các cấp độ GLM Coding Plan tách biệt với giá API mỗi token, và giá cấp độ được công bố (Lite, Pro, Max, Team) đến từ các nguồn thứ cấp không hoàn toàn thống nhất. Xác minh giá gói hiện tại tại z.ai trước khi bạn xây dựng ngân sách dựa trên đó. Tính đến tháng 6 năm 2026, đừng giả định rằng có một đường miễn phí OpenRouter tồn tại cho
glm-5.2; không có cấp độ miễn phí được xác nhận.
Để có một cái nhìn tổng thể hơn về chi phí và tốc độ giữa các nhà cung cấp, so sánh tốc độ và chi phí của GLM-5 so với DeepSeek so với GPT-5 cung cấp ngữ cảnh hữu ích.
Cách thực hiện việc chuyển đổi
Đối với các cuộc gọi API trực tiếp, thay đổi là ID mô hình. Chỉ vậy thôi.
- "model": "glm-5.1",
+ "model": "glm-5.2",
Nếu bạn muốn suy luận theo cấp độ, hãy thêm hai nút thinking được hiển thị trước đó. Mọi thứ khác (xác thực, endpoint, định dạng tin nhắn) vẫn giữ nguyên.
Đối với Claude Code và các client lập trình tương thích với Anthropic khác, GLM-5.2 định tuyến qua endpoint lập trình của Z.ai. Tính đến tháng 6 năm 2026, URL cơ sở lập trình là https://api.z.ai/api/coding/paas/v4 (một số nguồn hiển thị đường dẫn open.z.ai; xác minh URL trực tiếp trước khi bạn kết nối). Một khối môi trường Claude Code điển hình:
export ANTHROPIC_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export ANTHROPIC_API_KEY="your-glm-coding-plan-key"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.2[1m]"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.2[1m]"
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000
export API_TIMEOUT_MS=3000000
Hai điều cần biết ở đây. Hậu tố [1m] chọn biến thể ngữ cảnh 1M. Và API_TIMEOUT_MS quan trọng hơn vẻ ngoài của nó: các cuộc gọi ngữ cảnh lớn dài sẽ bị hủy bởi thời gian chờ mặc định, vì vậy hãy tăng nó lên. Hướng dẫn chi tiết từ đầu đến cuối cho các client editor và CLI có trong hướng dẫn GLM-5.2 với Claude Code, Cline và Cursor, và tương đương GLM-5.1 là thiết lập GLM-5.1 + Claude Code nếu bạn đang so sánh hai cấu hình cạnh nhau.
Thử nghiệm việc chuyển đổi trước khi bạn tin tưởng nó
Thay đổi ID mô hình chỉ là một dòng, nhưng thay đổi hành vi là có thật, vì vậy hãy xác minh nó như một thay đổi API hơn là một điều chỉnh cấu hình. Gửi cùng một bộ lời nhắc tới glm-5.1 và glm-5.2, so sánh các phản hồi, và kiểm tra độ trễ và mức sử dụng token. Một client API như Apidog làm điều này trở nên cụ thể: lưu một bộ sưu tập yêu cầu, hoán đổi trường mô hình, chạy cả hai, và so sánh trạng thái, đầu ra và thời gian ở một nơi. Vì API của Z.ai tương thích với OpenAI, bạn chỉ cần trỏ Apidog vào cùng một endpoint, thay đổi một trường và chạy lại. Nếu bạn chưa có, bạn có thể tải Apidog và thiết lập một môi trường thử nghiệm song song trong vài phút. Kiểm tra năm phút đó là sự khác biệt giữa “các điểm chuẩn nói rằng nó tốt hơn” và “nó tốt hơn trên các lời nhắc thực tế của tôi.”

Vậy, nâng cấp GLM-5.2 có đáng giá không?
Đây là phán quyết, được trình bày dưới dạng một quyết định hơn là một đánh giá.
Nâng cấp lên GLM-5.2 nếu:
- Tải công việc của bạn là tự động, điều khiển bằng terminal, hoặc sử dụng công cụ nhiều bước. Bước nhảy Terminal-Bench từ 62.0 lên 81.0 là lý do mạnh mẽ nhất để chuyển đổi, và nó đúng vào điểm yếu nhất của 5.1.
- Bạn thực hiện công việc lập trình thực sự (tái cấu trúc, thay đổi nhiều tệp, các tác vụ kiểu SWE-bench). Các lợi ích của SWE-bench Pro và MCP-Atlas sẽ tăng lên theo thời gian làm việc.
- Bạn chạy các lời nhắc ngữ cảnh dài. IndexShare làm cho các cuộc gọi ngữ cảnh lớn rẻ hơn để xử lý, và cấp độ giá dường như không thay đổi, vì vậy có ít rủi ro.
- Bạn muốn một công tắc suy luận. High và Max cho phép bạn dành suy nghĩ khi nó có ích và bỏ qua khi không cần.
Giữ nguyên GLM-5.1 nếu:
- Bạn đang chạy các lời nhắc ngắn, đơn giản, nhạy cảm với độ trễ mà các sức mạnh mới không áp dụng và 5.1 đã đáp ứng tiêu chuẩn của bạn. Trong trường hợp đó, việc nâng cấp là có thật nhưng vô hình; hãy giữ thiết lập GLM-5.1 mà bạn tin tưởng.
- Bạn đang trong giai đoạn phát hành và bị đóng băng. Thay đổi ID mô hình chỉ một dòng có rủi ro thấp, nhưng không thay đổi nào tốt hơn thay đổi rủi ro thấp trong thời gian đóng băng. Hãy lên lịch cho cửa sổ tiếp theo.
- Bạn tự host và chưa thể kéo hoặc phục vụ trọng số 753B với độ chính xác và thông lượng bạn cần. Các điểm chuẩn không giúp ích nếu bạn không thể chạy mô hình.
Đối với hầu hết các nhóm đọc so sánh GLM-5.2 so với GLM-5.1 vì họ đã sử dụng 5.1, câu trả lời thành thật là: nâng cấp, nhưng hãy kiểm tra trước. Việc chuyển đổi rẻ, lợi ích về tự động hóa rất đáng kể, và cấp độ giá không phạt bạn vì việc chuyển đổi. Chi phí thực sự duy nhất là một giờ bạn dành để xác thực nó trên các lời nhắc của riêng mình, và giờ đó đáng để bỏ ra.
