GLM-5.2 là gì?

GLM-5.2 là gì? Mô hình chủ lực mã hóa MoE 753B mã nguồn mở của Z.ai: ngữ cảnh 1M, giấy phép MIT, điểm chuẩn và cách truy cập qua API, Claude Code, và Ollama.

Ashley Innocent

Ashley Innocent

17 tháng 6 2026

GLM-5.2 là gì?

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

GLM-5.2 là mô hình chủ lực mới nhất từ Z.ai (phòng thí nghiệm AI Zhipu), và nó ra mắt với một tuyên bố rõ ràng: trọng số mở, ưu tiên lập trình và cạnh tranh với các mô hình tiên tiến đóng lớn nhất. Nếu bạn đã nghe tên này và muốn có câu trả lời thẳng thắn cho câu hỏi “GLM-5.2 là gì,” đây là hướng dẫn chính thức. Chúng ta sẽ tìm hiểu ai tạo ra nó, thực chất bên trong nó là gì, cách tiếp cận nó và những hạn chế chân thực của nó.

nút

TÓM TẮT

Ai tạo ra GLM-5.2 và nó là gì

GLM-5.2 đến từ Z.ai, phòng thí nghiệm còn được biết đến với tên Zhipu AI. Đây là phiên bản mới nhất trong dòng GLM (“Mô hình Ngôn ngữ Tổng quát”), sau bản phát hành GLM-5.1. Định vị rất rõ ràng: đây là một mô hình chủ lực về lập trình công bố trọng số của nó một cách công khai thay vì ẩn sau bức tường chỉ có API.

GLM-5.2

Lập trường trọng số mở đó là toàn bộ câu chuyện ở đây. Hầu hết các mô hình cạnh tranh với GPT-5.5 hoặc Claude Opus 4.8 đều là mô hình đóng. GLM-5.2 đặt khả năng tương đương vào một tệp bạn có thể tải xuống. Nếu bạn đã đọc tổng quan về GLM-5.1 của chúng tôi, hãy coi 5.2 là cùng một dòng sản phẩm với trọng tâm sắc bén hơn về lập trình và tác nhân.

GLM-5.2 là một mô hình đa năng với thiên hướng về lập trình. Nó xử lý suy luận, toán học và văn bản đa ngôn ngữ (tiếng Anh và tiếng Trung là hàng đầu), nhưng Z.ai đã tinh chỉnh mạnh mẽ nhất nó cho kỹ thuật phần mềm và công việc tác nhân đa bước, dựa trên công cụ.

Danh tính: cách tìm GLM-5.2 trên các nền tảng

Một điều khiến mọi người bối rối với các mô hình mở là cách đặt tên. Cùng một mô hình mang các định danh khác nhau tùy thuộc vào nơi bạn tải nó. Dưới đây là bản đồ.

Nền tảng Định danh
Hugging Face zai-org/GLM-5.2
API của Z.ai glm-5.2
Ollama glm-5.2
OpenRouter z-ai/glm-5.2

Các trọng số được cấp phép MIT không có giới hạn khu vực, vì vậy kho lưu trữ Hugging Face có thể tải xuống thực sự chứ không bị giới hạn. Bạn có thể xác nhận thẻ và tệp tại trang GLM-5.2 trên Hugging Face.

Kiến trúc một cách đơn giản: MoE 753B + IndexShare

GLM-5.2 là mô hình hỗn hợp chuyên gia (Mixture-of-Experts) với tổng cộng khoảng 753 tỷ tham số, được phục vụ trong BF16. MoE có nghĩa là mô hình được chia thành nhiều mạng con "chuyên gia", và chỉ một phần trong số đó được kích hoạt cho bất kỳ token nào. Bạn có được năng lực kiến thức của một mô hình lớn mà không phải trả toàn bộ chi phí tính toán cho mỗi lần chuyển tiếp. Đó là cách một mô hình 753B vẫn có thể sử dụng được.

Kiến trúc GLM-5.2 với IndexShare

Phần mới hơn là chú ý thưa (sparse attention). GLM-5.2 giới thiệu một phương pháp mà Z.ai gọi là IndexShare. Chú ý thông thường nhanh chóng trở nên đắt đỏ khi ngữ cảnh của bạn mở rộng, vì mỗi token chú ý đến mọi token khác. IndexShare tái sử dụng một "indexer" duy nhất trên mỗi nhóm 4 lớp chú ý thưa, thay vì tính toán một cái mới cho mỗi lớp. Trong thực tế, điều đó giảm chi phí chú ý ở ngữ cảnh dài, đây chính xác là điều bạn muốn khi cửa sổ của bạn rộng một triệu token.

Bạn không cần phải hiểu toán học để hưởng lợi từ nó. Điểm mấu chốt: GLM-5.2 được thiết kế sao cho việc cung cấp một cơ sở mã lớn hoặc một tài liệu dài không làm tăng độ trễ và chi phí như một mô hình dày đặc.

Cửa sổ ngữ cảnh 1 triệu token

GLM-5.2 hỗ trợ cửa sổ ngữ cảnh 1 triệu token (chính xác là 1.048.576 token). Điều đó đủ để đưa toàn bộ một kho lưu trữ cỡ trung bình, một đặc tả dài hoặc một chồng tài liệu liên quan vào một lời nhắc duy nhất và yêu cầu mô hình suy luận trên tất cả các thông tin đó.

Đầu ra tối đa là nơi bạn nên cẩn thận. Tài liệu của z.ai liệt kê đầu ra lên đến 128K token, nhưng không phải mọi máy chủ đều công bố cùng một con số, và OpenRouter hoàn toàn không liệt kê nó. Vì vậy, hãy xem 128K là giới hạn được ghi nhận để xác minh trực tiếp chứ không phải là một đảm bảo trên mọi điểm cuối. Nếu quy trình làm việc của bạn phụ thuộc vào việc tạo ra các phản hồi rất dài, hãy kiểm tra giới hạn trên nhà cung cấp cụ thể mà bạn đang sử dụng.

Để hiểu rõ hơn về cách thế hệ này đã nâng tầm, so sánh GLM-5.2 với GLM-5.1 của chúng tôi phân tích những gì đã thay đổi qua từng bản phát hành.

Nỗ lực suy nghĩ: Cao, Tối đa và Tắt

GLM-5.2 là một mô hình có khả năng suy luận với hành vi "suy nghĩ" có thể kiểm soát. Bạn có hai cấp độ nỗ lực suy nghĩ:

Bạn cũng có thể tắt hoàn toàn suy nghĩ. Đối với các tra cứu nhanh, định dạng hoặc chuyển đổi đơn giản, bạn không muốn mô hình đốt token vào một chuỗi suy nghĩ nội bộ. Tắt suy nghĩ giúp các cuộc gọi đó nhanh và rẻ.

Trong API, điều này ánh xạ tới tham số thinking ({"type": "enabled"} hoặc {"type": "disabled"}) và giá trị reasoning_effort như "max". Chúng tôi đi sâu hơn vào cấu trúc yêu cầu trong hướng dẫn API GLM-5.2, nhưng mô hình tư duy rất đơn giản: tăng cường suy luận cho công việc kỹ thuật khó, tắt nó đi cho các cuộc gọi tầm thường.

Giấy phép MIT và trọng số mở: những gì bạn thực sự nhận được

"Trọng số mở" được sử dụng khá tùy tiện, vì vậy đây là những gì giấy phép MIT của GLM-5.2 cho phép một cách cụ thể:

Đối với các nhóm có hạn chế về cư trú dữ liệu hoặc tuân thủ, điều này quan trọng hơn một hoặc hai điểm chuẩn. Bạn có thể giữ lời nhắc và mã trong nội bộ. Nếu bạn muốn thử đường dẫn hoàn toàn cục bộ, hãy xem chạy GLM-5 cục bộ miễn phíGLM-5 miễn phí với Ollama để biết các mẫu, áp dụng cho 5.2.

Ưu tiên lập trình và tác nhân: các điểm chuẩn

Z.ai đã xây dựng GLM-5.2 để thực hiện công việc phần mềm thực sự, chứ không chỉ nói chuyện về nó. Câu chuyện điểm chuẩn tập trung vào lập trình và sử dụng công cụ tác nhân. Các con số dưới đây là kết quả được Z.ai công bố, vì vậy hãy đọc chúng như các phép đo của phòng thí nghiệm chứ không phải điểm số của bên thứ ba độc lập.

Điểm chuẩn GLM-5.2 So sánh đáng chú ý
Terminal-Bench 2.1 81.0 GLM-5.1 đạt 62.0
SWE-bench Pro 62.1 GPT-5.5 58.6, GLM-5.1 58.4
MCP-Atlas 77.0 GPT-5.5 75.3, Claude Opus 4.8 77.8
Kỳ thi Cuối cùng của Nhân loại (có công cụ) 54.7 GPT-5.5 52.2
AIME 2026 99.2 n/a
GPQA-Diamond 91.2 n/a

Chỉ số nổi bật là Terminal-Bench. Tăng từ 62.0 lên 81.0 trong một thế hệ là một bước nhảy vọt lớn trên một điểm chuẩn đo lường liệu một mô hình có thể thực sự vận hành một terminal để hoàn thành nhiệm vụ hay không. SWE-bench Pro ở mức 62.1, vượt qua GPT-5.5 với 58.6, là tiêu đề khác: nó chỉ ra khả năng giải quyết vấn đề cấp độ kho lưu trữ thực sự, không phải các đoạn mã nhỏ.

Z.ai cũng báo cáo GLM-5.2 là mô hình mã nguồn mở cao nhất trên FrontierSWE, PostTrainBench và SWE-Marathon, và định vị nó cạnh tranh với GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro và DeepSeek-V4-Pro. VentureBeat đã thẳng thừng chỉ ra khía cạnh chi phí, viết rằng GLM-5.2 “vượt trội GPT-5.5 trong lập trình dài hạn với chi phí chỉ khoảng 1/6” (câu này là cách diễn đạt của VentureBeat, trong bài viết về GLM-5.2, không phải là đo lường của Apidog).

Để biết phân tích đầy đủ và những lưu ý so sánh trực tiếp, hãy xem phân tích chuyên sâu về điểm chuẩn GLM-5.2 của chúng tôi và bài so sánh trực tiếp GLM-5.2 với GPT-5.5, Claude Opus và Gemini.

Cách truy cập GLM-5.2 trong nháy mắt

Bạn có bốn con đường thực tế, tùy thuộc vào việc bạn muốn một API được lưu trữ, một thiết lập lập trình tác nhân, một bộ định tuyến hay một cài đặt cục bộ.

Đường dẫn truy cập Tốt nhất cho Ghi chú nhanh
API của Z.ai Cuộc gọi trực tiếp, được lưu trữ Tương thích OpenAI, điểm cuối tại https://api.z.ai/api/paas/v4/
Claude Code (Gói lập trình GLM) Lập trình tác nhân trong terminal của bạn URL cơ sở tương thích Anthropic, chọn biến thể [1m]
OpenRouter Một khóa, nhiều mô hình ID mô hình z-ai/glm-5.2
Ollama Cục bộ / ngoại tuyến Kéo glm-5.2 từ thư viện

API của Z.ai. API chung tương thích OpenAI. Bạn truy cập https://api.z.ai/api/paas/v4/chat/completions với một khóa Bearer, và chuyển các tham số thông thường cộng với thinking, reasoning_effort, temperaturestream. Gọi hàm và công cụ được hỗ trợ.

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $ZAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [{"role": "user", "content": "Refactor this function for readability."}],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "max",
    "stream": true
  }'

Claude Code thông qua Gói lập trình GLM. Z.ai công bố một điểm cuối lập trình tương thích Anthropic, vì vậy bạn có thể trỏ Claude Code vào GLM-5.2. URL cơ sở lập trình là https://api.z.ai/api/coding/paas/v4 (một số nguồn hiển thị open.z.ai/api/paas/v4, vì vậy hãy xác minh trực tiếp), và bạn thiết lập môi trường Claude Code của mình để định tuyến qua nó.

export ANTHROPIC_BASE_URL="https://api.z.ai/api/coding/paas/v4"
export ANTHROPIC_API_KEY="your-glm-coding-plan-key"
export ANTHROPIC_DEFAULT_SONNET_MODEL="glm-5.2[1m]"
export ANTHROPIC_DEFAULT_OPUS_MODEL="glm-5.2[1m]"
export CLAUDE_CODE_AUTO_COMPACT_WINDOW=1000000
export API_TIMEOUT_MS=3000000

Hậu tố [1m] chọn biến thể ngữ cảnh 1M. Dòng API_TIMEOUT_MS không phải là phần đệm tùy chọn: các cuộc gọi ngữ cảnh dài, lớn có thể vượt quá thời gian chờ mặc định của Claude Code, vì vậy việc tăng nó giúp công cụ không kết thúc yêu cầu giữa chừng. Chúng tôi hướng dẫn thiết lập này, cộng với Cline và Cursor, trong hướng dẫn GLM-5.2 trong Claude Code, Cline và Cursor. Nếu bạn đã sử dụng thế hệ trước theo cách đó, bài viết GLM-5.1 với Claude Code của chúng tôi cũng bao gồm quy trình tương tự.

OpenRouter. Nếu bạn đã định tuyến qua OpenRouter, GLM-5.2 có sẵn dưới dạng z-ai/glm-5.2. Kiểm tra danh sách trực tiếp tại openrouter.ai/z-ai/glm-5.2. Lưu ý không có làn OpenRouter miễn phí cho mô hình này, vì vậy đừng lên kế hoạch dựa vào nó.

Ollama. Để sử dụng cục bộ, kéo nó từ thư viện Ollama. Đây là tuyến đường cho công việc ngoại tuyến hoặc kiểm soát dữ liệu nghiêm ngặt, với đánh đổi rõ ràng là bạn cần bộ nhớ GPU thực để phục vụ một MoE 753B một cách thoải mái.

Để biết tổng hợp các tùy chọn thực sự không mất phí, hãy xem cách sử dụng GLM-5.2 miễn phí.

Giá cả, tóm tắt

Trên API được lưu trữ, OpenRouter xác nhận giá ở mức $1,40 cho mỗi 1 triệu token đầu vào$4,40 cho mỗi 1 triệu token đầu ra. VentureBeat trích dẫn đầu vào được lưu trữ khoảng $0,26 cho mỗi 1 triệu. Gói lập trình GLM có các gói đăng ký theo cấp (Lite, Pro, Max và Team), nhưng số liệu hàng tháng chính xác khác nhau giữa các nguồn thứ cấp, vì vậy hãy xác nhận giá hiện tại tại z.ai trước khi bạn cam kết (tính đến tháng 6 năm 2026). Phân tích giá GLM-5.2 của chúng tôi duy trì một bảng kê liên tục.

Apidog phù hợp ở đâu

Nếu bạn đang xây dựng dựa trên API GLM-5.2, hoặc tích hợp nó vào một tác nhân gọi các dịch vụ của riêng bạn, bạn vẫn cần thiết kế, kiểm thử và ghi lại các điểm cuối đó. Đó là nơi Apidog giúp đỡ. Bạn có thể mô phỏng các điểm cuối được hỗ trợ bởi LLM trước khi tích hợp thực sự sẵn sàng, gỡ lỗi cấu trúc yêu cầu và phản hồi (bao gồm tải trọng luồng và gọi công cụ), và giữ tài liệu API của bạn đồng bộ khi hợp đồng thay đổi. Đây là một nền tảng API tất cả trong một, vì vậy thiết kế, gỡ lỗi, kiểm thử, mô phỏng và tài liệu đều nằm ở một nơi thay vì bốn. Khi bạn sẵn sàng dùng thử, tải xuống Apidog và hướng nó đến tích hợp GLM-5.2 của bạn.

GLM-5.2 so sánh như thế nào với phần còn lại của dòng sản phẩm và lĩnh vực

GLM-5.2 là đỉnh cao về lập trình và tác nhân của dòng GLM hiện tại. Nếu bạn đang cân nhắc nó với các bản phát hành trước đó hoặc các phòng thí nghiệm đối thủ, đây là những bài đọc hữu ích tiếp theo:

Câu hỏi thường gặp

GLM-5.2 là gì trong một câu? Nó là LLM chủ lực với trọng số mở của Z.ai, một mô hình MoE khoảng 753 tỷ tham số được tinh chỉnh cho lập trình, suy luận và sử dụng công cụ tác nhân, với cửa sổ ngữ cảnh 1 triệu token và giấy phép MIT.

GLM-5.2 có thực sự miễn phí không? Các trọng số được tải xuống và tự lưu trữ miễn phí theo giấy phép MIT. API được lưu trữ của Z.ai và Gói lập trình GLM là có phí. Không có cấp OpenRouter miễn phí cho nó, vì vậy "miễn phí" ở đây có nghĩa là trọng số mở, chứ không phải là một điểm cuối được lưu trữ miễn phí.

GLM-5.2 có thể nhìn thấy hình ảnh không? Không. Nó là đầu vào văn bản, đầu ra văn bản theo tài liệu API, không có biến thể thị giác được xác nhận. Sử dụng một mô hình thị giác riêng nếu bạn cần đầu vào hình ảnh.

GLM-5.2 khác gì so với GLM-5.1? Bước nhảy vọt đáng kể nhất là lập trình tác nhân. Terminal-Bench 2.1 đã tăng từ 62.0 lên 81.0 theo kết quả của Z.ai, cộng với những cải tiến về SWE-bench Pro và chú ý thưa IndexShare mới. Xem so sánh GLM-5.2 với GLM-5.1 để biết sự khác biệt đầy đủ.

Nó hỗ trợ độ dài ngữ cảnh và độ dài đầu ra bao nhiêu? Ngữ cảnh là 1 triệu token. Đầu ra được ghi nhận lên đến 128K theo z.ai, nhưng không phải máy chủ nào cũng liệt kê giới hạn giống nhau, vì vậy hãy xác minh trên nhà cung cấp của bạn.

Phiên bản ngắn

GLM-5.2 là điều xảy ra khi một phòng thí nghiệm trọng số mở quyết định cạnh tranh trực tiếp với ranh giới đóng trong lĩnh vực lập trình. Bạn có được một mô hình MoE 753B với cửa sổ một triệu token, nỗ lực suy luận có thể kiểm soát, giấy phép MIT cho phép bạn tự lưu trữ và phân phối, và kết quả điểm chuẩn đặt nó vào cuộc trò chuyện với GPT-5.5 và Claude Opus 4.8, ít nhất là theo số liệu của Z.ai. Những lưu ý là có thật (chỉ văn bản, giới hạn đầu ra cần xác minh, tuyên bố điểm chuẩn từ nhà cung cấp), nhưng đề xuất cốt lõi vẫn đúng: đây là một mô hình lập trình nghiêm túc mà bạn thực sự có thể sở hữu. Bắt đầu với hướng dẫn API GLM-5.2 khi bạn sẵn sàng xây dựng.

nút

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API