GLM-5.2 là một trong số ít mô hình tiên tiến mà bạn thực sự có thể chạy trên phần cứng của riêng mình. Nó được phát hành dưới dạng mã nguồn mở theo giấy phép MIT, không có hạn chế về khu vực, vì vậy "sử dụng không giới hạn" không phải là một thủ thuật. Đó là một con đường được hỗ trợ. Vấn đề là bạn phải biết mình đang gặp phải hạn chế nào, vì cách khắc phục sẽ khác nhau cho mỗi loại.
TL;DR (Tóm tắt)
- GLM-5.2 (Z.ai / Zhipu AI) là mã nguồn mở, khoảng 753B tham số (MoE), được cấp phép MIT, ngữ cảnh 1M token, không khóa khu vực.
- Hầu hết các "hạn chế" đến từ giao diện người dùng trò chuyện tiêu dùng hoặc việc tinh chỉnh hướng dẫn của mô hình, chứ không phải từ giới hạn giấy phép cứng nhắc.
- Truy cập API thô cho phép bạn kiểm soát lời nhắc hệ thống và tắt tính năng "suy nghĩ". Tự lưu trữ (self-hosting) cho phép bạn kiểm soát hoàn toàn ngăn xếp.
- Các bản dựng cộng đồng đã loại bỏ các phản hồi từ chối được tích hợp sẵn, cùng một mẫu được sử dụng cho DeepSeek R1 và QwQ. Khả dụng cho 5.2 thay đổi hàng tuần, vì vậy hãy kiểm tra trên Hugging Face.
- Bạn vẫn chịu trách nhiệm kiểm duyệt và pháp lý khi tự lưu trữ. Ít rào cản hơn có nghĩa là nhiều trách nhiệm hơn, không phải ít hơn.
Đầu tiên, hãy biết bạn đang gặp phải hạn chế nào
"Hạn chế" là một từ lỏng lẻo. Đối với GLM-5.2, nó thường có nghĩa là một trong bốn điều khác nhau, và mỗi điều có cách khắc phục riêng.
- Từ chối từ việc tinh chỉnh hướng dẫn. Mô hình trò chuyện được phát hành được căn chỉnh để từ chối một số yêu cầu. Hành vi này nằm trong trọng số.
- Bộ lọc sản phẩm trong ứng dụng trò chuyện. Giao diện người dùng web tiêu dùng có thể thêm lớp kiểm duyệt riêng lên trên mô hình. API thường hoạt động khác so với ứng dụng.
- Giới hạn gói và tỷ lệ. Các gói miễn phí và gói Mã hóa giới hạn yêu cầu, ngữ cảnh hoặc đầu ra. Đó là hạn mức, không phải quy tắc nội dung.
- Chi phí tính toán và định tuyến an toàn. Suy luận mở rộng và định tuyến an toàn làm tăng độ trễ và có thể thay đổi giọng điệu.
Khu vực cố tình không có trong danh sách này. Trọng số GLM-5.2 được cấp phép MIT không có hạn chế khu vực, vì vậy quyền truy cập không bị giới hạn bởi quốc gia như một số mô hình chỉ được lưu trữ.
Đòn bẩy 1: Sử dụng API thô, không phải ứng dụng trò chuyện
Thay đổi nhanh nhất với lợi ích lớn nhất là ngừng sử dụng cửa sổ trò chuyện tiêu dùng và gọi trực tiếp API. Điểm cuối tương thích với OpenAI, vì vậy bạn giữ lời nhắc hệ thống của riêng mình, đặt nhiệt độ của riêng mình và có thể tắt giai đoạn suy nghĩ.
- URL cơ sở:
https://api.z.ai/api/paas/v4/ - Điểm cuối:
POST /chat/completions - ID mô hình:
glm-5.2
Một lệnh curl tối thiểu với tính năng suy nghĩ bị tắt:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"thinking": { "type": "disabled" },
"temperature": 0.7,
"messages": [
{ "role": "system", "content": "You are a direct, unfiltered technical assistant. Answer concisely." },
{ "role": "user", "content": "Explain how abliteration changes a model." }
]
}'
Cùng một lệnh gọi với OpenAI Python SDK, chỉ cần trỏ lại vào z.ai:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_ZAI_KEY",
base_url="https://api.z.ai/api/paas/v4/",
)
resp = client.chat.completions.create(
model="glm-5.2",
temperature=0.7,
extra_body={"thinking": {"type": "disabled"}},
messages=[
{"role": "system", "content": "You are a direct, unfiltered technical assistant."},
{"role": "user", "content": "Explain how abliteration changes a model."},
],
)
print(resp.choices[0].message.content)
Hai điều quan trọng ở đây. Lời nhắc hệ thống của bạn là của riêng bạn, vì vậy bạn điều khiển giọng điệu và phạm vi trực tiếp thay vì kế thừa các cài đặt mặc định của ứng dụng. Và thinking: {"type": "disabled"} bỏ qua giai đoạn suy luận khi bạn muốn đầu ra thô, nhanh chóng. Để biết đầy đủ các tham số, hãy xem hướng dẫn API GLM-5.2.
Giá cả thay đổi, vì vậy hãy kiểm tra trực tiếp trước khi bạn lập ngân sách: tại thời điểm viết bài này, các nguồn thứ cấp liệt kê khoảng 1,40 đô la cho 1 triệu token đầu vào và 4,40 đô la cho 1 triệu token đầu ra. Xác nhận các con số hiện tại trên bảng giá GLM-5.2, và nếu chi phí là giới hạn thực sự, hãy đọc cách sử dụng GLM-5.2 miễn phí.
Đòn bẩy 2: Tự lưu trữ các trọng số mở
Đây là câu trả lời "không hạn chế" thực sự. Vì các trọng số được cấp phép MIT, bạn có thể tự tải xuống và phục vụ GLM-5.2. Khi mô hình chạy trên máy của bạn, không có bộ lọc giao diện người dùng của nhà cung cấp và không có giới hạn tốc độ bên ngoài. Bạn đặt lời nhắc hệ thống, bạn đặt chính sách.
Cách đơn giản nhất là Ollama:
ollama run glm-5.2
Kiểm tra thực tế phần cứng: GLM-5.2 là một mô hình MoE khoảng 753B tham số, vì vậy các trọng số đầy đủ cần VRAM nghiêm túc. Đối với hầu hết mọi người, điều đó có nghĩa là một bản dựng đã được lượng tử hóa, một máy đa GPU thuê, hoặc một biến thể GLM nhỏ hơn. Nếu phần cứng của bạn khiêm tốn, GLM-4.7-Flash chạy cục bộ với ít tài nguyên hơn nhiều và là một sự thay thế tốt trong khi bạn xây dựng đường ống. Hướng dẫn chạy GLM cục bộ chung và hướng dẫn thiết lập Ollama bao gồm phần còn lại.
Khi nó đang phục vụ cục bộ, Ollama cung cấp điểm cuối tương thích OpenAI của riêng nó tại http://localhost:11434/v1, vì vậy cùng một mã từ Đòn bẩy 1 hoạt động chỉ với URL cơ sở được thay đổi.
Đòn bẩy 3: Các bản dựng cộng đồng không bị kiểm duyệt (đã được loại bỏ)
Tinh chỉnh hướng dẫn là nơi các lời từ chối tồn tại. Cộng đồng mã nguồn mở loại bỏ hành vi đó thông qua một quá trình gọi là "abliteration" (loại bỏ), ngăn chặn hướng dẫn nội bộ gây ra lời từ chối mà không cần huấn luyện lại hoàn toàn. Kỹ thuật tương tự cũng cung cấp năng lượng cho các bản dựng không kiểm duyệt của các mô hình mở khác, bao gồm QwQ và DeepSeek R1.
Vì trọng số GLM-5.2 là mã nguồn mở và được cấp phép MIT, kỹ thuật đó cũng áp dụng ở đây. Một bản dựng GLM-5.2 đã được loại bỏ sẵn có không được đảm bảo có sẵn, và tính khả dụng thường xuyên thay đổi, vì vậy hãy tìm kiếm trên Hugging Face để có một bản hiện tại thay vì giả định nó tồn tại. Nếu bản dựng 5.2 không có, quy trình làm việc giống hệt với các hướng dẫn của QwQ và DeepSeek R1: tải trọng số đã được loại bỏ, tải chúng vào Ollama hoặc vLLM và phục vụ.
Đây là cách hoàn chỉnh nhất để loại bỏ các lời từ chối được tích hợp sẵn, và nó cũng là cách đặt nhiều trách nhiệm nhất lên bạn. Đọc phần trách nhiệm trước khi bạn triển khai.
Đòn bẩy 4: Chọn nhà cung cấp cho phép bạn đặt chính sách
Nếu bạn không muốn tự chạy máy chủ của mình, nhà cung cấp định tuyến là giải pháp trung gian. GLM-5.2 được liệt kê trên OpenRouter dưới dạng z-ai/glm-5.2 và trong thư viện Ollama. Bộ định tuyến cho phép bạn áp dụng cài đặt kiểm duyệt của riêng mình và hoán đổi máy chủ cơ bản mà không cần viết lại ứng dụng của bạn, điều này giúp bỏ qua bộ lọc giao diện người dùng tiêu dùng trong khi vẫn giữ một điểm cuối được quản lý.
Bài viết này nằm cùng với tổng hợp rộng hơn về LLM không hạn chế nếu bạn muốn so sánh GLM-5.2 với các tùy chọn mở khác trước khi cam kết.
Thử nghiệm mọi thiết lập trong Apidog trước khi triển khai
Dù bạn chọn đòn bẩy nào, bạn sẽ có được một điểm cuối tương thích với OpenAI. Xác nhận nó hoạt động theo cách bạn mong đợi trước khi kết nối nó vào một sản phẩm. Apidog là một cách rõ ràng để làm điều đó vì bạn có thể kiểm tra phản hồi luồng thô, không chỉ văn bản cuối cùng.

- Tạo một yêu cầu mới trong Apidog trỏ đến điểm cuối của bạn (
https://api.z.ai/api/paas/v4/chat/completionscho API được lưu trữ, hoặchttp://localhost:11434/v1/chat/completionscho bản dựng cục bộ). - Thêm tiêu đề
Authorization: Bearer <key>cho API được lưu trữ. Ollama cục bộ không cần khóa. - Gửi một nội dung
chat/completionsvớimodel: glm-5.2, thông báosystemcủa bạn vàstream: true. - Theo dõi luồng SSE. Bạn có thể thấy các thay đổi "thinking" và "content" riêng biệt, cộng với đối tượng
usagevới số lượng token. - Bật và tắt
thinkingvà so sánh hai phản hồi song song.
Đây là cách bạn xác minh rằng lời nhắc hệ thống của bạn thực sự có hiệu lực và mô hình phản hồi theo cách mà thiết lập bạn đã chọn hứa hẹn, thay vì phát hiện ra trong quá trình sản xuất.
Một lời về trách nhiệm
Việc loại bỏ các bộ lọc sản phẩm và chạy trọng số không kiểm duyệt là hợp pháp. Điều này phổ biến cho nghiên cứu, red-teaming và xây dựng khả năng kiểm duyệt của riêng bạn thay vì kế thừa của người khác. Nhưng một khi bạn tự lưu trữ, việc kiểm duyệt là của bạn, và trách nhiệm pháp lý cũng vậy. Ít rào cản hơn có nghĩa là bạn chịu trách nhiệm về kết quả. Hãy ghi nhớ ba điều sau:
- Bạn vẫn bị ràng buộc bởi luật pháp và bởi các điều khoản của bất kỳ nền tảng nào bạn triển khai.
- Nếu bạn phục vụ điều này cho người khác, hãy thêm một lớp kiểm duyệt phù hợp với người dùng của bạn.
- "Không hạn chế" là về kiểm soát và cắt giảm các lời từ chối sai tích cực, không phải là giấy phép để tạo ra nội dung có hại hoặc bất hợp pháp.
FAQ
GLM-5.2 có thực sự là mã nguồn mở không?
Trọng số được phát hành theo giấy phép MIT, một trong những giấy phép tự do nhất hiện có. Bạn có thể chạy, sửa đổi và tự lưu trữ chúng, bao gồm cả cho mục đích thương mại, tuân theo các điều khoản giấy phép. Để biết đầy đủ thông tin nhận dạng và thông số kỹ thuật, hãy xem GLM-5.2 là gì.
API GLM-5.2 có kiểm duyệt phản hồi không?
Mô hình hướng dẫn mang tính căn chỉnh từ việc tinh chỉnh của nó, vì vậy nó có thể từ chối một số lời nhắc. API cung cấp cho bạn quyền kiểm soát lời nhắc hệ thống và cho phép bạn tắt tính năng suy nghĩ, điều này xử lý hầu hết các vấn đề về giọng điệu và từ chối quá mức. Để loại bỏ hoàn toàn các lời từ chối được tích hợp sẵn, hãy tự lưu trữ một bản dựng đã được loại bỏ.
Tôi có thể chạy GLM-5.2 trên máy tính xách tay không?
Không phải mô hình 753B đầy đủ. Hãy sử dụng bản dựng đã được lượng tử hóa, một máy GPU thuê, hoặc một biến thể GLM nhỏ hơn như GLM-4.7-Flash để thử nghiệm cục bộ, sau đó trỏ cùng một mã vào mô hình lớn hơn khi bạn cần.
GLM-5.2 có bị khóa khu vực không?
Không. Trọng số được cấp phép MIT không có hạn chế khu vực. Tính khả dụng của API được lưu trữ có thể khác nhau tùy theo nhà cung cấp, nhưng việc tự lưu trữ là mở cho bất kỳ ai.
