Cách sử dụng GLM-5.2 không giới hạn

GLM-5.2 là trọng số mã nguồn mở được cấp phép MIT, vì vậy việc sử dụng nó không giới hạn là một phương thức được hỗ trợ: kiểm soát API trực tiếp, tự lưu trữ, các bản dựng không bị kiểm duyệt và cách kiểm thử từng cái trong Apidog.

Ashley Innocent

Ashley Innocent

7 tháng 7 2026

Cách sử dụng GLM-5.2 không giới hạn

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

GLM-5.2 là một trong số ít mô hình tiên tiến mà bạn thực sự có thể chạy trên phần cứng của riêng mình. Nó được phát hành dưới dạng mã nguồn mở theo giấy phép MIT, không có hạn chế về khu vực, vì vậy "sử dụng không giới hạn" không phải là một thủ thuật. Đó là một con đường được hỗ trợ. Vấn đề là bạn phải biết mình đang gặp phải hạn chế nào, vì cách khắc phục sẽ khác nhau cho mỗi loại.

button

TL;DR (Tóm tắt)

Đầu tiên, hãy biết bạn đang gặp phải hạn chế nào

"Hạn chế" là một từ lỏng lẻo. Đối với GLM-5.2, nó thường có nghĩa là một trong bốn điều khác nhau, và mỗi điều có cách khắc phục riêng.

  1. Từ chối từ việc tinh chỉnh hướng dẫn. Mô hình trò chuyện được phát hành được căn chỉnh để từ chối một số yêu cầu. Hành vi này nằm trong trọng số.
  2. Bộ lọc sản phẩm trong ứng dụng trò chuyện. Giao diện người dùng web tiêu dùng có thể thêm lớp kiểm duyệt riêng lên trên mô hình. API thường hoạt động khác so với ứng dụng.
  3. Giới hạn gói và tỷ lệ. Các gói miễn phí và gói Mã hóa giới hạn yêu cầu, ngữ cảnh hoặc đầu ra. Đó là hạn mức, không phải quy tắc nội dung.
  4. Chi phí tính toán và định tuyến an toàn. Suy luận mở rộng và định tuyến an toàn làm tăng độ trễ và có thể thay đổi giọng điệu.

Khu vực cố tình không có trong danh sách này. Trọng số GLM-5.2 được cấp phép MIT không có hạn chế khu vực, vì vậy quyền truy cập không bị giới hạn bởi quốc gia như một số mô hình chỉ được lưu trữ.

Đòn bẩy 1: Sử dụng API thô, không phải ứng dụng trò chuyện

Thay đổi nhanh nhất với lợi ích lớn nhất là ngừng sử dụng cửa sổ trò chuyện tiêu dùng và gọi trực tiếp API. Điểm cuối tương thích với OpenAI, vì vậy bạn giữ lời nhắc hệ thống của riêng mình, đặt nhiệt độ của riêng mình và có thể tắt giai đoạn suy nghĩ.

Một lệnh curl tối thiểu với tính năng suy nghĩ bị tắt:

curl https://api.z.ai/api/paas/v4/chat/completions \
 -H "Authorization: Bearer $ZAI_API_KEY" \
 -H "Content-Type: application/json" \
 -d '{
 "model": "glm-5.2",
 "thinking": { "type": "disabled" },
 "temperature": 0.7,
 "messages": [
 { "role": "system", "content": "You are a direct, unfiltered technical assistant. Answer concisely." },
 { "role": "user", "content": "Explain how abliteration changes a model." }
 ]
 }'

Cùng một lệnh gọi với OpenAI Python SDK, chỉ cần trỏ lại vào z.ai:

from openai import OpenAI

client = OpenAI(
 api_key="YOUR_ZAI_KEY",
 base_url="https://api.z.ai/api/paas/v4/",
)

resp = client.chat.completions.create(
 model="glm-5.2",
 temperature=0.7,
 extra_body={"thinking": {"type": "disabled"}},
 messages=[
 {"role": "system", "content": "You are a direct, unfiltered technical assistant."},
 {"role": "user", "content": "Explain how abliteration changes a model."},
 ],
)
print(resp.choices[0].message.content)

Hai điều quan trọng ở đây. Lời nhắc hệ thống của bạn là của riêng bạn, vì vậy bạn điều khiển giọng điệu và phạm vi trực tiếp thay vì kế thừa các cài đặt mặc định của ứng dụng. Và thinking: {"type": "disabled"} bỏ qua giai đoạn suy luận khi bạn muốn đầu ra thô, nhanh chóng. Để biết đầy đủ các tham số, hãy xem hướng dẫn API GLM-5.2.

Giá cả thay đổi, vì vậy hãy kiểm tra trực tiếp trước khi bạn lập ngân sách: tại thời điểm viết bài này, các nguồn thứ cấp liệt kê khoảng 1,40 đô la cho 1 triệu token đầu vào và 4,40 đô la cho 1 triệu token đầu ra. Xác nhận các con số hiện tại trên bảng giá GLM-5.2, và nếu chi phí là giới hạn thực sự, hãy đọc cách sử dụng GLM-5.2 miễn phí.

Đòn bẩy 2: Tự lưu trữ các trọng số mở

Đây là câu trả lời "không hạn chế" thực sự. Vì các trọng số được cấp phép MIT, bạn có thể tự tải xuống và phục vụ GLM-5.2. Khi mô hình chạy trên máy của bạn, không có bộ lọc giao diện người dùng của nhà cung cấp và không có giới hạn tốc độ bên ngoài. Bạn đặt lời nhắc hệ thống, bạn đặt chính sách.

Cách đơn giản nhất là Ollama:

ollama run glm-5.2

Kiểm tra thực tế phần cứng: GLM-5.2 là một mô hình MoE khoảng 753B tham số, vì vậy các trọng số đầy đủ cần VRAM nghiêm túc. Đối với hầu hết mọi người, điều đó có nghĩa là một bản dựng đã được lượng tử hóa, một máy đa GPU thuê, hoặc một biến thể GLM nhỏ hơn. Nếu phần cứng của bạn khiêm tốn, GLM-4.7-Flash chạy cục bộ với ít tài nguyên hơn nhiều và là một sự thay thế tốt trong khi bạn xây dựng đường ống. Hướng dẫn chạy GLM cục bộ chung và hướng dẫn thiết lập Ollama bao gồm phần còn lại.

Khi nó đang phục vụ cục bộ, Ollama cung cấp điểm cuối tương thích OpenAI của riêng nó tại http://localhost:11434/v1, vì vậy cùng một mã từ Đòn bẩy 1 hoạt động chỉ với URL cơ sở được thay đổi.

Đòn bẩy 3: Các bản dựng cộng đồng không bị kiểm duyệt (đã được loại bỏ)

Tinh chỉnh hướng dẫn là nơi các lời từ chối tồn tại. Cộng đồng mã nguồn mở loại bỏ hành vi đó thông qua một quá trình gọi là "abliteration" (loại bỏ), ngăn chặn hướng dẫn nội bộ gây ra lời từ chối mà không cần huấn luyện lại hoàn toàn. Kỹ thuật tương tự cũng cung cấp năng lượng cho các bản dựng không kiểm duyệt của các mô hình mở khác, bao gồm QwQDeepSeek R1.

Vì trọng số GLM-5.2 là mã nguồn mở và được cấp phép MIT, kỹ thuật đó cũng áp dụng ở đây. Một bản dựng GLM-5.2 đã được loại bỏ sẵn có không được đảm bảo có sẵn, và tính khả dụng thường xuyên thay đổi, vì vậy hãy tìm kiếm trên Hugging Face để có một bản hiện tại thay vì giả định nó tồn tại. Nếu bản dựng 5.2 không có, quy trình làm việc giống hệt với các hướng dẫn của QwQ và DeepSeek R1: tải trọng số đã được loại bỏ, tải chúng vào Ollama hoặc vLLM và phục vụ.

Đây là cách hoàn chỉnh nhất để loại bỏ các lời từ chối được tích hợp sẵn, và nó cũng là cách đặt nhiều trách nhiệm nhất lên bạn. Đọc phần trách nhiệm trước khi bạn triển khai.

Đòn bẩy 4: Chọn nhà cung cấp cho phép bạn đặt chính sách

Nếu bạn không muốn tự chạy máy chủ của mình, nhà cung cấp định tuyến là giải pháp trung gian. GLM-5.2 được liệt kê trên OpenRouter dưới dạng z-ai/glm-5.2 và trong thư viện Ollama. Bộ định tuyến cho phép bạn áp dụng cài đặt kiểm duyệt của riêng mình và hoán đổi máy chủ cơ bản mà không cần viết lại ứng dụng của bạn, điều này giúp bỏ qua bộ lọc giao diện người dùng tiêu dùng trong khi vẫn giữ một điểm cuối được quản lý.

Bài viết này nằm cùng với tổng hợp rộng hơn về LLM không hạn chế nếu bạn muốn so sánh GLM-5.2 với các tùy chọn mở khác trước khi cam kết.

Thử nghiệm mọi thiết lập trong Apidog trước khi triển khai

Dù bạn chọn đòn bẩy nào, bạn sẽ có được một điểm cuối tương thích với OpenAI. Xác nhận nó hoạt động theo cách bạn mong đợi trước khi kết nối nó vào một sản phẩm. Apidog là một cách rõ ràng để làm điều đó vì bạn có thể kiểm tra phản hồi luồng thô, không chỉ văn bản cuối cùng.

  1. Tạo một yêu cầu mới trong Apidog trỏ đến điểm cuối của bạn (https://api.z.ai/api/paas/v4/chat/completions cho API được lưu trữ, hoặc http://localhost:11434/v1/chat/completions cho bản dựng cục bộ).
  2. Thêm tiêu đề Authorization: Bearer <key> cho API được lưu trữ. Ollama cục bộ không cần khóa.
  3. Gửi một nội dung chat/completions với model: glm-5.2, thông báo system của bạn và stream: true.
  4. Theo dõi luồng SSE. Bạn có thể thấy các thay đổi "thinking" và "content" riêng biệt, cộng với đối tượng usage với số lượng token.
  5. Bật và tắt thinking và so sánh hai phản hồi song song.

Đây là cách bạn xác minh rằng lời nhắc hệ thống của bạn thực sự có hiệu lực và mô hình phản hồi theo cách mà thiết lập bạn đã chọn hứa hẹn, thay vì phát hiện ra trong quá trình sản xuất.

Một lời về trách nhiệm

Việc loại bỏ các bộ lọc sản phẩm và chạy trọng số không kiểm duyệt là hợp pháp. Điều này phổ biến cho nghiên cứu, red-teaming và xây dựng khả năng kiểm duyệt của riêng bạn thay vì kế thừa của người khác. Nhưng một khi bạn tự lưu trữ, việc kiểm duyệt là của bạn, và trách nhiệm pháp lý cũng vậy. Ít rào cản hơn có nghĩa là bạn chịu trách nhiệm về kết quả. Hãy ghi nhớ ba điều sau:

FAQ

GLM-5.2 có thực sự là mã nguồn mở không?

Trọng số được phát hành theo giấy phép MIT, một trong những giấy phép tự do nhất hiện có. Bạn có thể chạy, sửa đổi và tự lưu trữ chúng, bao gồm cả cho mục đích thương mại, tuân theo các điều khoản giấy phép. Để biết đầy đủ thông tin nhận dạng và thông số kỹ thuật, hãy xem GLM-5.2 là gì.

API GLM-5.2 có kiểm duyệt phản hồi không?

Mô hình hướng dẫn mang tính căn chỉnh từ việc tinh chỉnh của nó, vì vậy nó có thể từ chối một số lời nhắc. API cung cấp cho bạn quyền kiểm soát lời nhắc hệ thống và cho phép bạn tắt tính năng suy nghĩ, điều này xử lý hầu hết các vấn đề về giọng điệu và từ chối quá mức. Để loại bỏ hoàn toàn các lời từ chối được tích hợp sẵn, hãy tự lưu trữ một bản dựng đã được loại bỏ.

Tôi có thể chạy GLM-5.2 trên máy tính xách tay không?

Không phải mô hình 753B đầy đủ. Hãy sử dụng bản dựng đã được lượng tử hóa, một máy GPU thuê, hoặc một biến thể GLM nhỏ hơn như GLM-4.7-Flash để thử nghiệm cục bộ, sau đó trỏ cùng một mã vào mô hình lớn hơn khi bạn cần.

GLM-5.2 có bị khóa khu vực không?

Không. Trọng số được cấp phép MIT không có hạn chế khu vực. Tính khả dụng của API được lưu trữ có thể khác nhau tùy theo nhà cung cấp, nhưng việc tự lưu trữ là mở cho bất kỳ ai.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API