Cách sử dụng API GLM-5.3

Hướng dẫn nhanh API GLM-5.3: lấy khóa Z.ai hoặc bigmodel.cn, gọi điểm cuối tương thích OpenAI bằng cURL, Python và Node.js, truyền trực tuyến token và kiểm tra trong Apidog.

Ashley Innocent

Ashley Innocent

16 tháng 8 2026

Cách sử dụng API GLM-5.3

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Zhipu AI, phòng thí nghiệm Trung Quốc hoạt động quốc tế dưới tên Z.ai, đã phát hành GLM-5.3 vào ngày 14 tháng 8 năm 2026, và những con số về khả năng lập trình đã nói lên tất cả. Các đánh giá nội bộ cho thấy khả năng lập trình được cải thiện 50% so với GLM-5.2, điểm Terminal-Bench 3.0 tăng từ 4.6 lên 28.3, và Zhipu mô tả khả năng lập trình và tác nhân của mô hình là “tiệm cận Claude Fable 5”, theo báo cáo ra mắt từ BigGo. Các trọng số mở sẽ được công bố trong khoảng hai tuần nữa. Để biết chi tiết đầy đủ về khả năng và bảng điểm chuẩn, hãy đọc GLM-5.3 là gì; bài viết này là hướng dẫn khởi động nhanh API thực hành.

Bạn sẽ làm gì: lấy khóa API, thực hiện cuộc gọi đầu tiên bằng cURL, chuyển nó sang Python và Node.js thông qua OpenAI SDK, truyền dữ liệu (stream tokens), tinh chỉnh các tham số quan trọng và tích hợp toàn bộ vòng lặp vào Apidog để bạn có thể khóa định dạng yêu cầu trước khi viết mã ứng dụng. Tin tốt ngay từ đầu: API của Z.ai tương thích với OpenAI. Nếu bạn đã từng gọi bất kỳ điểm cuối nào theo kiểu OpenAI trước đây, bạn đã biết hầu hết những điều này.

Một lưu ý trước khi đi vào mã. GLM-5.3 đã được phát hành hôm nay, và tài liệu của Zhipu thường được cập nhật nhanh chóng vào những ngày ra mắt. Mọi thông tin bên dưới được lấy trực tiếp từ tài liệu chính thức tại thời điểm tôi kiểm tra đều được trình bày là đã xác minh; bất kỳ điều gì mà tài liệu chưa kịp cập nhật đều được đánh dấu theo quy ước của dòng GLM-5, kèm theo liên kết để bạn có thể tự mình xác nhận trạng thái hiện tại.

TL;DR (Tóm tắt)

Tại sao GLM-5.3 quan trọng

Mô hình cơ sở không thay đổi. Mọi cải tiến trong bản phát hành này đều đến từ việc đào tạo sau mở rộng (scaled post-training) dựa trên GLM-5, điều này khiến mức độ tăng trưởng trở nên bất thường. Terminal-Bench 3.0 tăng từ 4.6 lên 28.3, một bước nhảy vọt gấp 6.2 lần đã đưa GLM từ không đáng kể lên vị trí đầu tiên trong số các mô hình mã nguồn mở trên điểm chuẩn đó và trên Agents’ Last Exam. SWE-Marathon gần như tăng gấp đôi so với GLM-5.2. Về mặt bảo mật, CyberGym đạt 84.5%, hơi cao hơn Claude Mythos 5 và GPT-5.6 Sol, trong khi ExploitBench đạt 54.4%, vẫn còn kém các mô hình tiên tiến. Lưu ý về nguồn: tuyên bố về khả năng lập trình 50% và một số điểm số này đến từ các đánh giá của chính Zhipu, vì vậy hãy coi chúng là báo cáo của nhà cung cấp cho đến khi các bên thứ ba tái tạo được chúng.

Kiến trúc bên dưới là cơ sở của dòng GLM-5: một thiết kế Mixture of Experts (MoE) với tổng cộng 744 tỷ tham số, khoảng 40 tỷ tham số hoạt động trên mỗi lần chuyển tiếp (forward pass), và cửa sổ ngữ cảnh 200K token, theo tài liệu của Z.ai. Đó là các thông số kỹ thuật của dòng, không phải là tuyên bố cụ thể cho 5.3.

Hai lý do nữa khiến bản phát hành này quan trọng đối với người dùng API. Thứ nhất, Zhipu cho biết họ sẽ phát hành trọng số mở của GLM-5.3 khoảng hai tuần sau khi ra mắt, vào khoảng ngày 28 tháng 8, cùng với hệ thống đánh giá rủi ro toàn diện nhất từ trước đến nay của họ, theo tin tức ra mắt của Pandaily. Nếu tự host (self-hosting) có trong lộ trình của bạn, API bạn thiết lập hôm nay sẽ là cơ sở kiểm định hồi quy (regression baseline) của bạn; hướng dẫn chuẩn bị tự host GLM-5.3 của chúng tôi đề cập chi tiết về việc này. Thứ hai, Seeking Alpha coi Zhipu là “đối thủ của OpenAI Trung Quốc”, và các bản phát hành trọng số mở ở cấp độ khả năng này thường có xu hướng làm thay đổi giá trên toàn thị trường.

Lấy khóa API

Có hai nền tảng, được phân chia theo khu vực, và sự phân chia này áp dụng cho mọi thứ khác trong hướng dẫn này.

Z.ai (quốc tế). Đăng ký tại z.ai, mở bảng điều khiển API và tạo khóa. Tài liệu có tại docs.z.ai. Đây là lộ trình dành cho bất kỳ ai bên ngoài Trung Quốc đại lục, và nó là điểm cuối mà phần còn lại của bài viết này mặc định sử dụng.

Bigmodel.cn (Trung Quốc đại lục). Nền tảng nội địa của Zhipu là open.bigmodel.cn. Cùng cấu trúc API, cùng sơ đồ xác thực, nhưng máy chủ khác và thanh toán riêng biệt. Nếu lưu lượng truy cập của bạn bắt nguồn từ Trung Quốc đại lục, hãy sử dụng nền tảng này; cả độ trễ và sự tuân thủ đều hướng về đó.

Dù bạn chọn nền tảng nào, hãy xuất khóa một lần và giữ nó tách biệt khỏi mã của bạn:

export GLM_API_KEY="your-key-from-the-console"

Nếu bạn đang sử dụng Gói lập trình GLM (GLM Coding Plan) thay vì thanh toán API theo mức sử dụng, hãy lưu ý rằng hạn mức đã được đặt lại cho tất cả người dùng vào ngày 14 tháng 8, vì vậy bạn sẽ bắt đầu kỷ nguyên 5.3 với một hạn mức sạch.

Điểm cuối và xác thực

Điểm cuối hoàn thành đoạn hội thoại (chat completions endpoint), đã được xác minh theo tài liệu GLM-5 tại thời điểm viết bài:

POST https://api.z.ai/api/paas/v4/chat/completions

Trung Quốc Đại lục đổi máy chủ:

POST https://open.bigmodel.cn/api/paas/v4/chat/completions

Xác thực là một tiêu đề: Authorization: Bearer $GLM_API_KEY. Không cần ký, không cần bắt tay phiên.

Tương thích OpenAI có nghĩa chính xác là điều bạn mong muốn. Phần thân yêu cầu (request body) có dạng mảng modelmessages, phản hồi trả về với choices, message, finish_reasonusage, và các SDK OpenAI chính thức hoạt động không cần sửa đổi một khi bạn trỏ base_url đến Z.ai. Bất kỳ mã nào bạn đã viết cho một nhà cung cấp tương thích OpenAI khác đều có thể chuyển sang chỉ bằng cách thay đổi máy chủ và mô hình; mô hình này giống hệt như chúng ta đã làm với API của DeepSeek V4 Pro.

Một lưu ý nhỏ về ID mô hình. Khi tôi truy cập tài liệu vào ngày ra mắt, trang GLM-5 vẫn liệt kê glm-5 là chuỗi mô hình và chưa được cập nhật cho phiên bản 5.3. Trang giá của Zhipu tính phí glm-5.2glm-5.1 là các mô hình riêng biệt, vì vậy theo quy ước của dòng, ID mới là glm-5.3. Các ví dụ dưới đây sử dụng nó, nhưng hãy kiểm tra tài liệu trước khi bạn sử dụng cố định trong sản xuất. Nếu glm-5.3 trả về lỗi 404 trong khu vực của bạn, hãy quay lại sử dụng glm-5 và bạn vẫn đang dùng cùng một dòng mô hình.

Yêu cầu đầu tiên của bạn bằng cURL

Một cuộc gọi hoàn chỉnh và hoạt động:

curl "https://api.z.ai/api/paas/v4/chat/completions" \
  -H "Authorization: Bearer $GLM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      {
        "role": "system",
        "content": "You are a code reviewer. Flag issues as blocking or non-blocking."
      },
      {
        "role": "user",
        "content": "Review this shell script for safety:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
      }
    ],
    "temperature": 0.3,
    "max_tokens": 1024
  }'

Phản hồi có dạng chuẩn OpenAI: một mảng choices trong đó choices[0].message.content chứa câu trả lời, và một khối usage với prompt_tokenscompletion_tokens. Với điểm Terminal-Bench đó, các lời nhắc đánh giá script shell và terminal tương tự như thế này chính là nơi 5.3 được cho là đã cải thiện nhiều nhất, vì vậy đây là một thử nghiệm nhanh (smoke test) phù hợp.

Tài liệu cũng ghi lại một tham số thinking để bật/tắt chế độ suy luận của mô hình:

"thinking": { "type": "enabled" }

Bật nó cho các tác vụ lập trình và tác nhân nhiều bước; bỏ qua nó đối với các cuộc gọi trích xuất ngắn, nơi các token suy luận bị lãng phí.

Khởi động nhanh Python

Không cần học SDK mới. Cài đặt gói OpenAI và thay đổi URL cơ sở:

pip install --upgrade openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GLM_API_KEY"],
    base_url="https://api.z.ai/api/paas/v4",
)

response = client.chat.completions.create(
    model="glm-5.3",
    messages=[
        {
            "role": "system",
            "content": "You are a code reviewer. Flag issues as blocking or non-blocking.",
        },
        {
            "role": "user",
            "content": (
                "Review this Flask route for security issues:\n\n"
                "@app.route('/user/<id>')\n"
                "def get_user(id):\n"
                "    return db.execute(f'SELECT * FROM users WHERE id = {id}')"
            ),
        },
    ],
    temperature=0.3,
    max_tokens=2048,
)

print(response.choices[0].message.content)
print("input tokens:", response.usage.prompt_tokens)
print("output tokens:", response.usage.completion_tokens)

Hãy ghi lại khối usage đó ngay từ đầu. Vì không có giá cụ thể cho 5.3 được công bố khi ra mắt, số lượng token của bạn là cách duy nhất để dự đoán hóa đơn của bạn sẽ là bao nhiêu khi các con số chính thức xuất hiện.

Khởi động nhanh Node.js

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.GLM_API_KEY,
  baseURL: "https://api.z.ai/api/paas/v4",
});

const response = await client.chat.completions.create({
  model: "glm-5.3",
  messages: [
    {
      role: "system",
      content: "You are a terminal automation agent. Return each step as a shell command with a one-line rationale.",
    },
    {
      role: "user",
      content: "A Node service on port 3000 stopped responding after a deploy. Give me a diagnosis sequence.",
    },
  ],
  temperature: 0.3,
  max_tokens: 2048,
});

console.log(response.choices[0].message.content);

Nếu codebase của bạn đã kết nối với OpenAI, bạn không cần một client song song. Khởi tạo một phiên bản OpenAI thứ hai với baseURL của Z.ai và định tuyến các yêu cầu theo từng tác vụ. Điều này giúp việc so sánh A/B giữa GLM-5.3 và mô hình hiện tại của bạn trở thành một quyết định định tuyến thay vì phải viết lại mã.

Streaming (Truyền dữ liệu)

Tài liệu xác nhận hỗ trợ streaming thông qua cờ stream tiêu chuẩn. Trong Python:

stream = client.chat.completions.create(
    model="glm-5.3",
    messages=[
        {"role": "user", "content": "Explain the N+1 query problem with a concrete ORM example."}
    ],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)

Qua HTTP thuần túy, hãy đặt "stream": true trong phần thân và phân tích cú pháp các sự kiện do máy chủ gửi (server-sent events); mỗi dòng data: mang một delta theo định dạng chunk của OpenAI. Hai lưu ý thực tế. Việc sử dụng token sẽ đến vào hoặc sau chunk cuối cùng, vì vậy việc tính toán chỉ chính xác khi luồng kết thúc. Và nếu bạn bật thinking, hãy mong đợi một khoảng dừng lâu hơn trước khi token đầu tiên hiển thị trên các lời nhắc khó; mô hình đang tiêu tốn token để suy luận trước khi trả lời, đó là sự đánh đổi mà bạn đã chấp nhận.

Các tham số quan trọng

Tham số Kiểu Chức năng
max_tokens số nguyên Giới hạn cứng về độ dài đầu ra. Đòn bẩy chi phí chính của bạn.
temperature số Sử dụng 0.2 đến 0.4 cho mã và trích xuất, 0.7+ cho viết sáng tạo.
thinking đối tượng {"type": "enabled"} bật chế độ suy luận cho các tác vụ nhiều bước.
stream boolean Các sự kiện do máy chủ gửi (Server-sent events) thay vì một phản hồi duy nhất.
messages mảng Các vai trò chuẩn của OpenAI: system, user, assistant.

Về chi phí: Zhipu chưa công bố giá API cụ thể cho 5.3 tại thời điểm ra mắt, vì vậy đừng tin vào bất kỳ con số chi phí trên mỗi token nào bạn thấy trên các trang của đại lý. Trang giá chính thức là nguồn thông tin đáng tin cậy; tại thời điểm viết bài này, nó liệt kê GLM-5.2 với 1.40 đô la đầu vào và 4.40 đô la đầu ra cho mỗi 1 triệu token, và GLM-5 với 1.00 đô la và 3.20 đô la, đây là phạm vi hợp lý cho 5.3. Đầu vào được lưu trong bộ nhớ cache trên các mô hình GLM trả phí được giảm giá 80 đến 85%, vì vậy hãy cấu trúc các lời nhắc hệ thống lặp lại để tận dụng bộ nhớ cache. Nếu một nhà cung cấp từng làm bạn bất ngờ với sự thay đổi giá, bạn sẽ hiểu tại sao sự kỷ luật này lại quan trọng; bài phân tích sau sự cố tăng giá của DeepSeek của chúng tôi bao gồm các mẫu kiểm soát chi phí có thể áp dụng trực tiếp.

Kiểm tra GLM-5.3 trong Apidog trước khi viết mã ứng dụng

Việc lặp lại lời nhắc bên trong một script là một vòng lặp chậm: chỉnh sửa, chạy lại, cuộn, lặp lại, và mỗi chu kỳ đều tính phí token. Vì API của Z.ai tương thích với OpenAI, một client API có thể đảm nhận toàn bộ giai đoạn thăm dò.

  1. Tạo một dự án và thêm yêu cầu hoàn thành đoạn hội thoại (chat completions). Nhập bất kỳ thông số kỹ thuật nào tương thích với OpenAI hoặc tự định nghĩa điểm cuối POST /chat/completions; phần thân có dạng quen thuộc là model cộng với messages.
  2. Tạo hai môi trường: zai-internationalbigmodel-mainland. Đặt URL cơ sở trong mỗi môi trường (https://api.z.ai/api/paas/v4https://open.bigmodel.cn/api/paas/v4) và gắn Authorization: Bearer {{GLM_API_KEY}} ở cấp độ môi trường. Việc chuyển đổi khu vực chỉ cần một cú nhấp chuột chọn từ danh sách thả xuống, và khóa sẽ không bao giờ nằm trong yêu cầu đã lưu.
  3. Đặt ID mô hình đằng sau một biến được đặt thành glm-5.3. Trong tuần ra mắt, điều này quan trọng hơn bình thường: nếu ID thay đổi khi tài liệu ổn định, hoặc bạn muốn so sánh A/B với glm-5.2, bạn chỉ cần thay đổi một biến thay vì chỉnh sửa mọi yêu cầu đã lưu.
  4. Kiểm tra nút bật/tắt thinking song song. Nhân đôi yêu cầu, bật suy luận trên một bản sao và so sánh độ trễ, chất lượng đầu ra và usage trên cùng một lời nhắc. Đây là cách nhanh nhất để quyết định khối lượng công việc nào của bạn xứng đáng nhận được các token suy luận.
  5. Truy cập điểm cuối streaming. Các chunk SSE hiển thị trực tiếp, vì vậy bạn sẽ thấy thời gian đến token đầu tiên giống như cách người dùng của bạn sẽ thấy.
  6. Lưu các phản hồi tốt làm ví dụ. Các lần chạy sau đó sẽ truy cập vào fixture thay vì API trực tiếp, đây là cách tiết kiệm token lớn nhất trong quá trình phát triển.

Từ đó, kết nối các yêu cầu đã lưu thành các kịch bản kiểm thử với các khẳng định (assertions) về finish_reason, schema phản hồi và số lượng token, và bạn đã biến các thử nghiệm nhanh (smoke tests) thành một bộ kiểm thử hồi quy (regression suite). Quy trình làm việc tương tự, được khái quát hóa cho bất kỳ API nào, có trong hướng dẫn kiểm thử API dành cho kỹ sư QA của chúng tôi.

Xử lý lỗi và giới hạn tần suất

Hãy mong đợi các lỗi theo phong cách OpenAI tiêu chuẩn: một đối tượng error với message, typecode. Các lỗi thường gặp là 401 cho khóa bị thiếu hoặc đã bị thu hồi, 400 cho phần thân bị định dạng sai hoặc ID mô hình không xác định, 429 cho giới hạn tần suất (rate limits), và 5xx cho các lỗi máy chủ tạm thời.

Câu hỏi thường gặp

ID mô hình cho API GLM-5.3 là gì?

Hãy mong đợi glm-5.3, theo quy ước của dòng mô hình đã cho chúng ta glm-5.2glm-5.1 trên trang giá của Zhipu. Tại thời điểm viết bài, tài liệu vẫn liệt kê glm-5 trên trang mô hình, vì vậy hãy xác nhận tại docs.z.ai trước khi cố định nó, và giữ ID trong cấu hình để việc điều chỉnh sau này dễ dàng.

API GLM-5.3 có hoạt động với OpenAI SDK không?

Có. API tương thích với OpenAI, vì vậy các gói openai chính thức cho Python và Node.js hoạt động ngay khi bạn đặt base_url thành https://api.z.ai/api/paas/v4 (hoặc tương đương trên bigmodel.cn) và truyền khóa Z.ai của bạn. Cấu trúc yêu cầu và phản hồi phù hợp với tiêu chuẩn hoàn thành đoạn hội thoại (chat completions), bao gồm cả streaming.

API GLM-5.3 có giá bao nhiêu?

Zhipu chưa công bố giá cụ thể cho 5.3 khi ra mắt vào ngày 14 tháng 8 năm 2026. Trang giá chính thức liệt kê GLM-5.2 với 1.40 đô la cho 1 triệu token đầu vào và 4.40 đô la cho 1 triệu token đầu ra, đây là điểm tham chiếu tốt nhất của bạn cho đến khi thông tin về 5.3 xuất hiện. Bỏ qua các dự đoán giá của đại lý.

GLM-5.3 so với Claude và GPT như thế nào?

Các đánh giá của chính Zhipu cho thấy khả năng lập trình và tác nhân “tiệm cận Claude Fable 5”, với CyberGym đạt 84.5% hơi cao hơn Claude Mythos 5 và GPT-5.6 Sol, nhưng ExploitBench đạt 54.4% vẫn còn kém các mô hình tiên tiến. Hãy coi các con số của nhà cung cấp là tuyên bố cho đến khi được tái tạo độc lập; để biết cách chúng tôi so sánh các mô hình tiên tiến với nhau, hãy xem bài so sánh Grok 4.6 vs GPT-5.6 vs Claude Fable 5 của chúng tôi.

Tôi có thể chạy GLM-5.3 cục bộ thay vì sử dụng API không?

Chưa được. Zhipu cho biết trọng số mở sẽ được phát hành khoảng hai tuần sau khi ra mắt, vào khoảng ngày 28 tháng 8 năm 2026, trên tổ chức Hugging Face của họ. Thiết kế MoE 744 tỷ tham số có nghĩa là việc chạy cục bộ đòi hỏi máy chủ cấp doanh nghiệp, không phải máy tính xách tay; hãy sử dụng API được host ngay bây giờ và xây dựng đường cơ sở mà bạn sẽ so sánh với một triển khai tự host sau này.

GLM-5.3 phù hợp ở đâu trong stack của bạn

GLM-5.3 đáng để dành một buổi chiều để đánh giá nếu bạn chạy các vòng lặp tác nhân (agent loops) hoặc khối lượng công việc lập trình, và giao diện tương thích OpenAI giúp việc đánh giá đó trở nên dễ dàng. Các bước nhảy vọt của Terminal-Bench và SWE-Marathon là do nhà cung cấp báo cáo, nhưng một bước nhảy gấp 6.2 lần là đủ lớn để bạn tự kiểm tra, và thời gian hai tuần trước khi trọng số mở được phát hành có nghĩa là các yêu cầu bạn lưu hôm nay sẽ trở thành cơ sở kiểm định hồi quy (regression baseline) cho một triển khai tự host sau này.

Trình tự hợp lý: lấy khóa, chạy lệnh cURL và chuyển yêu cầu vào một client API trước khi chạm vào mã ứng dụng. Tải Apidog để thiết lập hai môi trường khu vực, đặt ID mô hình đằng sau một biến và so sánh trạng thái bật/tắt của thinking trên các lời nhắc thực tế của bạn. Khi các phản hồi trông ổn, việc chuyển đổi sang Python hoặc Node chỉ là vấn đề về URL cơ sở và một biến môi trường, vì định dạng truyền dữ liệu chưa bao giờ là phần khó khăn.

button

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API