Zhipu AI đã phát hành GLM-5.3 vào ngày 14 tháng 8 năm 2026, và ẩn trong thông tin ra mắt là dòng quan trọng nhất đối với các nhóm hạ tầng: các trọng số mở sẽ có sẵn khoảng hai tuần sau đó, vào khoảng ngày 28 tháng 8, trên tổ chức Hugging Face của Zhipu. Khoảng thời gian này là một món quà. Nó cho bạn thời gian để ước tính phần cứng, chọn một ngăn xếp phục vụ, và ghi lại đường cơ sở hồi quy so với API được lưu trữ trước khi bất kỳ phân mảnh safetensors nào được công bố.
Mô hình xứng đáng với công sức chuẩn bị. Các đánh giá nội bộ của Zhipu cho thấy khả năng mã hóa vượt trội 50% so với GLM-5.2, Terminal-Bench 3.0 đã tăng từ 4.6 lên 28.3, và công ty mô tả hiệu suất tác nhân "tiệm cận Claude Fable 5," theo báo cáo ra mắt. Câu chuyện đầy đủ về điểm chuẩn, bao gồm cả những điểm mà nó vẫn còn thua kém các mô hình tiên tiến, có trong giải thích về GLM-5.3 của chúng tôi. Bài viết này tập trung vào một câu hỏi: những gì cần chuẩn bị vào ngày phát hành để bạn có thể tự phục vụ GLM-5.3?
Để làm rõ: các trọng số chưa thể tải xuống hôm nay. Mọi thông tin dưới đây đều nhắm đến thời gian phát hành, và bất cứ điều gì Zhipu chưa xác nhận đều được gắn cờ là một kỳ vọng, không phải sự thật. Điều bạn có thể làm ngay bây giờ là xây dựng một đường cơ sở, và điều đó được thực hiện thông qua Apidog: chụp nhanh các phản hồi API được lưu trữ trong tuần này, sau đó phát lại cùng bộ sưu tập đó so với điểm cuối cục bộ của bạn sau này.
Tóm tắt
- GLM-5.3 đã được phát hành vào ngày 14 tháng 8 năm 2026. Zhipu cho biết các trọng số mở sẽ có sẵn khoảng hai tuần sau đó, vào khoảng ngày 28 tháng 8, sau quá trình đánh giá rủi ro kỹ lưỡng nhất từ trước đến nay. Địa điểm dự kiến: huggingface.co/zai-org.
- Kiến trúc dòng GLM-5 (theo tài liệu của Z.ai): Mixture of Experts (Hỗn hợp các chuyên gia), tổng cộng 744 tỷ tham số, khoảng 40 tỷ tham số hoạt động mỗi lượt, ngữ cảnh 200K. Mô hình cơ sở không thay đổi trong phiên bản 5.3; tất cả các cải tiến đều đến từ quá trình hậu huấn luyện mở rộng.
- Tính toán trên 744 tỷ tham số: riêng các trọng số đã chiếm gần 1.5 TB ở BF16, khoảng một nửa ở FP8, trước bộ nhớ đệm KV. Tự lưu trữ với độ chính xác đầy đủ yêu cầu máy chủ đa GPU.
- Mỗi bản phát hành GLM-5 trước đây đều được đưa lên Hugging Face dưới dạng các kho BF16 và FP8 đi kèm, vì vậy hãy mong đợi
GLM-5.3vàGLM-5.3-FP8ngay trong ngày đầu tiên, với các lượng tử hóa GGUF của cộng đồng sẽ chậm hơn vài ngày đến vài tuần. - vLLM và SGLang là những ngăn xếp phục vụ khả thi ngay trong ngày đầu tiên. Cả hai đều cung cấp các điểm cuối tương thích OpenAI, vì vậy mã máy khách được viết cho API được lưu trữ của Z.ai sẽ chuyển đổi chỉ với việc thay đổi
base_url. - Hãy xây dựng đường cơ sở hồi quy giữa lưu trữ và cục bộ ngay bây giờ trong Apidog: một bộ sưu tập, hai môi trường, các xác nhận về hình dạng và nội dung.
Zhipu sẽ phát hành gì và khi nào
Zhipu (thương hiệu Z.ai trên trường quốc tế) đã kết hợp việc ra mắt API GLM-5.3 với lời hứa về trọng số mở trong hai tuần: mô hình sẽ được đưa lên Hugging Face vào khoảng ngày 28 tháng 8 năm 2026. Sự chậm trễ này không phải ngẫu nhiên. Zhipu cho biết họ đã xây dựng hệ thống đánh giá rủi ro toàn diện nhất từ trước đến nay cho bản phát hành này, đáng chú ý khi mô hình đạt 84.5% trên CyberGym, cao hơn một chút so với Claude Mythos 5 và GPT-5.6 Sol. Seeking Alpha coi bản phát hành này là nỗ lực của Zhipu nhằm giữ vững vị trí dẫn đầu về mô hình mở mà họ đã cạnh tranh với DeepSeek suốt cả năm.
Hai chi tiết từ bản phát hành quan trọng đối với những người tự lưu trữ:
- Mô hình cơ sở không thay đổi. GLM-5.3 là mô hình cơ sở GLM-5 với quá trình hậu huấn luyện mở rộng. Kiến trúc mà ngăn xếp phục vụ của bạn cần là kiến trúc mà vLLM và SGLang đã chạy cho GLM-5 và GLM-5.2. Không có biến thể attention mới, không có bất ngờ về tokenizer nào được mong đợi.
- Mẫu phát hành đã được thiết lập. Tổ chức Hugging Face của Zhipu lưu trữ GLM-5, GLM-5.1 và GLM-5.2, mỗi mô hình đều có một kho FP8 đi kèm. Chỉ riêng GLM-5.2 đã có 2.69 triệu lượt tải xuống. Hãy mong đợi cùng một hình thức cho 5.3: một bản phát hành safetensors BF16 cộng với một biến thể FP8 chính thức.
Các điều khoản cấp phép cho 5.3 chưa được xác nhận trong thông tin ra mắt. Hãy kiểm tra thẻ mô hình khi kho xuất hiện trước khi tích hợp nó vào một sản phẩm thương mại.
744 tỷ tham số tổng cộng, 40 tỷ tham số hoạt động có ý nghĩa gì đối với phần cứng của bạn
Dòng GLM-5 là thiết kế Mixture of Experts (Hỗn hợp các chuyên gia): tổng cộng 744 tỷ tham số, khoảng 40 tỷ tham số hoạt động mỗi lượt chuyển tiếp, ngữ cảnh 200K, theo tài liệu của Z.ai (các kho Hugging Face liệt kê tổng số cao hơn một chút bao gồm cả embeddings). Đây là các thông số kỹ thuật của dòng, không phải tuyên bố cụ thể cho 5.3, nhưng vì mô hình cơ sở không thay đổi nên đây là những con số lập kế hoạch chính xác.
Việc chia tách MoE tạo ra sự bất đối xứng giữa bộ nhớ và tính toán:
- Tính toán hoạt động như một mô hình dense 40B. Mỗi token, chỉ các chuyên gia được định tuyến mới hoạt động, vì vậy thông lượng trên mỗi GPU, một khi mô hình vừa vặn, sẽ tốt hơn nhiều so với những gì một mô hình dense 744B gợi ý.
- Bộ nhớ hoạt động như một mô hình 744B. Mọi chuyên gia phải tồn tại ở một nơi có thể truy cập được. Với 2 byte trên mỗi tham số (BF16), 744 tỷ tham số chiếm khoảng 1.5 TB trọng số; với 1 byte (FP8), khoảng 744 GB. Đây là phép tính dựa trên con số được công bố, không phải cấu hình đã thử nghiệm, và nó không bao gồm bộ nhớ đệm KV.
Các cấp độ thực tế, không đòi hỏi số lượng GPU chính xác:
| Độ chính xác | Kích thước trọng số (tính toán) | Môi trường phù hợp |
|---|---|---|
| BF16 | ~1.5 TB | Cụm đa nút hoặc các cấu hình GPU máy chủ đơn lớn nhất |
| FP8 (chính thức) | ~745 GB | Máy chủ đa GPU cao cấp, một nút |
| Các lượng tử hóa cộng đồng lớp INT4 | Khoảng ~370-400 GB | Các dàn máy đa GPU nhỏ hơn; chờ báo cáo chất lượng |
Nếu ngân sách của bạn chỉ là một GPU tiêu dùng, trọng số đầy đủ của GLM-5.3 không phải là mục tiêu của bạn, và điều đó không sao cả. Hãy thuê giờ GPU để đánh giá, chờ các lượng tử hóa cộng đồng tích cực hơn, hoặc giữ mô hình nặng trên API được lưu trữ trong khi chạy các mô hình mở nhỏ hơn cục bộ. Hướng dẫn về các LLM cục bộ tốt nhất năm 2026 của chúng tôi bao gồm những gì phù hợp với ngân sách một GPU và máy trạm ngày nay.
Hãy coi cửa sổ ngữ cảnh 200K cũng là một quyết định về bộ nhớ: bộ nhớ đệm KV tăng theo ngữ cảnh và kích thước batch, vì vậy hãy giới hạn ngữ cảnh được phục vụ cho mỗi cấp độ triển khai trước ngày phát hành thay vì mặc định theo giới hạn tối đa của mô hình.
Chọn ngăn xếp phục vụ của bạn trước khi trọng số được phát hành
Ba loại phần mềm phục vụ quan trọng ở đây, và không phải tất cả đều sẽ sẵn sàng cùng một lúc.
vLLM là câu trả lời mặc định ở quy mô này: hỗ trợ dòng GLM-5 từ bản phát hành gốc, định tuyến MoE, song song hóa tensor và expert trên các GPU và nút, và một máy chủ tương thích OpenAI gốc. Lệnh khởi chạy sẽ trông như thế này khi kho đã tồn tại:
vllm serve zai-org/GLM-5.3-FP8 \
--tensor-parallel-size 8 \
--max-model-len 65536 \
--served-model-name glm-5.3
Hãy coi các cờ là một mẫu: tên kho tuân theo quy tắc đặt tên của Zhipu, và cài đặt song song hóa phụ thuộc vào số lượng GPU và bộ nhớ của bạn.
SGLang là giải pháp thay thế chính, với hiệu suất MoE mạnh mẽ và bộ nhớ đệm tiền tố cây radix mang lại lợi ích cho các tác vụ tác nhân gửi lại các lời nhắc chia sẻ dài. Nó cũng cung cấp một điểm cuối tương thích OpenAI, vì vậy việc chuyển đổi giữa hai giải pháp sau này không ảnh hưởng đến mã máy khách.
Dòng llama.cpp (llama.cpp, Ollama, LM Studio) cần chuyển đổi GGUF, vốn đến từ cộng đồng vài ngày hoặc vài tuần sau khi safetensors được phát hành. Con đường này cuối cùng sẽ đưa mô hình đến phần cứng nhỏ hơn, với mức chất lượng mà bạn nên tự xác minh so với đường cơ sở của mình thay vì chấp nhận một cách tin tưởng.
Hãy cài đặt và chạy thử ngăn xếp của bạn trong tuần này bằng cách sử dụng trọng số công khai của GLM-5.2 nếu bạn có phần cứng, hoặc bất kỳ mô hình MoE nhỏ hơn nào nếu không. Gỡ lỗi driver CUDA vào ngày 28 tháng 8 là một chế độ lỗi có thể tránh được.
Sử dụng API được lưu trữ hôm nay làm đường cơ sở của bạn
Đây là bước chuẩn bị mà hầu hết các nhóm bỏ qua: trước khi bạn tự lưu trữ một mô hình, hãy ghi lại những gì triển khai tham chiếu tạo ra. API được lưu trữ của Zhipu là tham chiếu đó, và nó đang hoạt động. Khi triển khai cục bộ của bạn trả lời khác, một đường cơ sở đã lưu sẽ cho bạn biết liệu khoảng cách đó đến từ lựa chọn lượng tử hóa của bạn, lỗi ngăn xếp phục vụ, hay sự biến động lấy mẫu bình thường.
API được lưu trữ tương thích OpenAI: https://api.z.ai/api/paas/v4/chat/completions trên quốc tế, https://open.bigmodel.cn/api/paas/v4/chat/completions cho Trung Quốc đại lục, xác thực Authorization: Bearer <key>. Tài liệu của Z.ai liệt kê glm-5 hôm nay; glm-5.3 tuân theo quy ước của dòng, vì vậy hãy xác nhận chuỗi chính xác trong tài liệu chính thức. Thiết lập đầy đủ cho cả hai khu vực có trong hướng dẫn bắt đầu nhanh API GLM-5.3 của chúng tôi.
Ghi lại các đường cơ sở ở nhiệt độ 0 với các lời nhắc cố định:
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"temperature": 0,
"messages": [
{"role": "user", "content": "Write a Python function that parses RFC 3339 timestamps and returns UTC datetimes. Include error handling for invalid input."}
]
}' > baseline-rfc3339.json
Hãy xây dựng 20 đến 50 trường hợp này bao gồm các khối lượng công việc thực tế của bạn: các tác vụ tạo mã, các mẫu gọi công cụ của tác nhân, tóm tắt ngữ cảnh dài. Nhiệt độ 0 sẽ không làm cho đầu ra hoàn toàn có thể tái tạo, nhưng nó làm giảm sự biến động đủ để một sự sụt giảm chất lượng do lượng tử hóa trở nên rõ ràng.
Xây dựng bộ kiểm tra hồi quy trong Apidog
Các tập lệnh cURL thô hoạt động cho đến khi bạn có hai điểm cuối, ba cấp độ lượng tử hóa và một đồng đội hỏi cấu hình nào đã qua. Một bộ kiểm tra có cấu trúc sẽ mở rộng tốt hơn, và đây là một vấn đề hồi quy API tiêu chuẩn, cùng một nguyên tắc được đề cập trong hướng dẫn kiểm thử API cho kỹ sư QA của chúng tôi.
Thiết lập trong Apidog:
- Một bộ sưu tập, mọi lời nhắc cơ sở. Tạo một yêu cầu cho mỗi trường hợp cơ sở đối với đường dẫn hoàn thành cuộc trò chuyện. Schema tương thích OpenAI có nghĩa là bạn có thể nhập một spec kiểu OpenAI và được xác thực hình dạng yêu cầu miễn phí.
- Hai môi trường:
hostedvàlocal.hostedđặt URL cơ sở thànhhttps://api.z.ai/api/paas/v4vớiGLM_API_KEYcủa bạn;localtrỏ đếnhttp://localhost:8000/v1(mặc định của vLLM) với một khóa giữ chỗ. Mọi yêu cầu đều tham chiếu{{base_url}}, vì vậy việc chuyển đổi mục tiêu chỉ cần một menu thả xuống. - Xác nhận hình dạng trước, nội dung sau. Xác nhận HTTP 200,
choices[0].message.contentkhông rỗng, và một khốiusagehợp lý. Đối với các đường cơ sở mã, hãy thêm các kiểm tra nội dung mà vẫn đúng khi có sự thay đổi về từ ngữ: phản hồi chứadef, đề cập đếndatetime, bao gồm một mẫutry. - Lưu các phản hồi được lưu trữ làm ví dụ. Chúng sẽ trở thành các thiết bị tham chiếu của bạn. Vào ngày phát hành, bạn chạy lại bộ sưu tập so với
localvà so sánh khác biệt. - Chạy từ CLI. Trình chạy của Apidog thực thi bộ sưu tập mà không cần giao diện, vì vậy việc so sánh trở thành một bước có thể tạo tập lệnh mà bạn chạy lại theo từng cấp độ lượng tử hóa, ngăn xếp phục vụ, hoặc thay đổi cấu hình.
Đầu ra bạn muốn vào ngày 28 tháng 8 là một câu trả lời bằng một lệnh cho câu hỏi “triển khai của tôi có hoạt động giống như mô hình được lưu trữ không,” với kết quả pass/fail cho từng lời nhắc thay vì cảm nhận.
Mã máy khách của bạn không thay đổi
Lợi ích của quy ước tương thích OpenAI: các ứng dụng được viết cho API được lưu trữ sẽ chuyển sang điểm cuối tự lưu trữ của bạn chỉ bằng một thay đổi cấu hình, không cần viết lại. Một biến môi trường kiểm soát mục tiêu:
import os
from openai import OpenAI
# Lưu trữ: GLM_BASE_URL=https://api.z.ai/api/paas/v4
# Cục bộ: GLM_BASE_URL=http://localhost:8000/v1
client = OpenAI(
base_url=os.environ["GLM_BASE_URL"],
api_key=os.environ.get("GLM_API_KEY", "local-serving"),
)
response = client.chat.completions.create(
model="glm-5.3",
temperature=0,
messages=[
{"role": "user", "content": "Refactor this function to remove the nested loops: ..."},
],
)
print(response.choices[0].message.content)
vLLM và SGLang chấp nhận bất kỳ tên mô hình nào bạn đã đăng ký tại thời điểm phục vụ, vì vậy --served-model-name glm-5.3 giữ cho chuỗi mô hình cũng giống hệt với ID được lưu trữ. Streaming, gọi công cụ và chế độ JSON đều hoạt động trên cùng một bề mặt, nhưng hãy kiểm thử hồi quy việc gọi công cụ một cách cụ thể: đó là nơi các ngăn xếp cục bộ thường xuyên khác biệt so với hành vi được lưu trữ.
Khung chi phí: API được lưu trữ so với GPU của riêng bạn
Zhipu chưa công bố giá API cụ thể cho 5.3 tại thời điểm ra mắt; hãy kiểm tra trang giá chính thức để biết các con số hiện tại trước khi mô hình hóa chi phí. Vì vậy, sự so sánh ở đây mang tính cấu trúc, không phải trên mỗi token.
Tự lưu trữ một mô hình MoE lớp 744 tỷ tham số có nghĩa là phải trả tiền cho dung lượng GPU bất kể có token nào được sử dụng hay không. Điều này có ý nghĩa trong ba tình huống: mức sử dụng liên tục đủ cao để phí trên mỗi token vượt quá chi phí phần cứng hoặc thuê được khấu hao, quản trị dữ liệu giữ lời nhắc bên trong mạng của bạn, và kiểm soát độ trễ hoặc khả dụng mà một API chia sẻ không thể đảm bảo. Dưới những trường hợp đó, giải pháp lưu trữ trên đám mây thắng về giá, và thuê giờ GPU để đánh giá tốt hơn là mua phần cứng cho một mô hình chưa được xác thực.
Cũng có một lập luận phòng ngừa rủi ro. Giá của nhà cung cấp có thể thay đổi; việc tăng giá của DeepSeek vào năm 2026 đã khiến các nhóm xây dựng kinh tế đơn vị dựa trên mức giá ban đầu gặp khó khăn, như chúng tôi đã đề cập trong phân tích tăng giá API của DeepSeek. Trọng số mở giới hạn nhược điểm đó: nếu giá được lưu trữ thay đổi, con đường tự lưu trữ của bạn đã được chứng minh.
Danh sách kiểm tra ngày phát hành
Tất cả những điều trên được tóm gọn trong danh sách này. Các mục từ 1 đến 6 có thể thực hiện được ngay hôm nay.
- Xác nhận cấp độ chính xác mục tiêu của bạn (BF16, FP8, hoặc chờ lượng tử hóa) so với phần cứng bạn có thể truy cập, sử dụng các dải tính toán ở trên.
- Cài đặt vLLM hoặc SGLang và chạy thử với trọng số công khai của GLM-5.2 hoặc một mô hình MoE khác.
- Tạo khóa API Z.ai và xác nhận ID mô hình 5.3 chính xác so với tài liệu trực tuyến.
- Ghi lại 20 đến 50 phản hồi đường cơ sở nhiệt độ 0 từ API được lưu trữ.
- Xây dựng bộ sưu tập Apidog với môi trường
hostedvàlocalcùng các xác nhận hình dạng. - Quyết định độ dài ngữ cảnh được phục vụ tối đa của bạn cho mỗi cấp độ triển khai.
- Vào ngày phát hành: theo dõi huggingface.co/zai-org để tìm các kho
GLM-5.3vàGLM-5.3-FP8, và đọc giấy phép thẻ mô hình trước khi triển khai thương mại. - Tải xuống trọng số, khởi động máy chủ, trỏ môi trường
localđến đó và chạy bộ sưu tập. - So sánh khác biệt giữa các dữ liệu cục bộ và dữ liệu được lưu trữ. Điều tra các lỗi cấp độ nội dung trước khi mở rộng lưu lượng truy cập.
- Chỉ sau đó mới bắt đầu tinh chỉnh: mức độ lượng tử hóa, bố cục song song, bộ nhớ đệm tiền tố, giới hạn ngữ cảnh.
Câu hỏi thường gặp
Tôi có thể tải xuống trọng số GLM-5.3 ngay bây giờ không?
Không. Tính đến ngày 14 tháng 8 năm 2026, chỉ API được lưu trữ đang hoạt động. Zhipu cho biết các trọng số mở sẽ có sẵn khoảng hai tuần sau khi phát hành, vào khoảng ngày 28 tháng 8. Địa điểm dự kiến là trang Hugging Face zai-org, nơi GLM-5, 5.1 và 5.2 đã có sẵn.
GLM-5.3 có chạy được trên một GPU tiêu dùng duy nhất không?
Không, không phải với trọng số đầy đủ. Tổng cộng 744 tỷ tham số của dòng mô hình này chiếm khoảng 744 GB ở FP8 trước bộ nhớ đệm KV, vượt xa bất kỳ card đơn nào, và ngay cả các lượng tử hóa lớp INT4 cũng thuộc về lãnh thổ của nhiều GPU. Đối với ngân sách một GPU, hãy chạy các mô hình mở nhỏ hơn cục bộ và giữ GLM-5.3 trên API được lưu trữ; tổng hợp LLM cục bộ của chúng tôi liệt kê những gì phù hợp.
Tôi nên sử dụng framework phục vụ nào cho GLM-5.3?
vLLM là lựa chọn mặc định an toàn nhất: hỗ trợ dòng GLM-5 đã được chứng minh, song song hóa nhận biết MoE, và một máy chủ tương thích OpenAI. SGLang là một giải pháp thay thế mạnh mẽ khi khối lượng công việc của bạn gửi lại các tiền tố chia sẻ dài, như các vòng lặp tác nhân thực hiện. Con đường llama.cpp và Ollama sẽ mở sau, một khi các chuyển đổi GGUF của cộng đồng xuất hiện.
Mã SDK OpenAI hiện có của tôi có hoạt động với GLM-5.3 tự lưu trữ không?
Có, đó là ý nghĩa của quy ước tương thích OpenAI ở cả hai phía. Trỏ base_url của SDK đến máy chủ vLLM hoặc SGLang của bạn thay vì https://api.z.ai/api/paas/v4 và giữ nguyên hình dạng yêu cầu. Hãy kiểm tra cụ thể việc gọi công cụ và streaming; đó là những điểm mà các ngăn xếp cục bộ đôi khi khác biệt.
Tại sao phải quan tâm đến API được lưu trữ nếu tôi có kế hoạch tự lưu trữ?
Bởi vì đó là triển khai tham chiếu của bạn. Nếu không có các đường cơ sở được lưu trữ, bạn không thể biết liệu một đầu ra cục bộ kỳ lạ có nghĩa là lượng tử hóa của bạn quá mạnh hay mô hình hoạt động theo cách đó ở mọi nơi. Hãy ghi lại các đường cơ sở ngay bây giờ thông qua điểm cuối được lưu trữ, sử dụng thiết lập trong hướng dẫn bắt đầu nhanh API GLM-5.3 của chúng tôi, và ngày phát hành sẽ trở thành một bài tập so sánh khác biệt thay vì phỏng đoán.
GLM-5.3 phù hợp ở đâu trong ngăn xếp của bạn
GLM-5.3 là thông báo về mã nguồn mở mạnh mẽ nhất trong năm cho đến nay: đứng đầu trong số các mô hình mở trên Terminal-Bench 3.0 và Agents’ Last Exam, đạt điểm CyberGym cao hơn hai mô hình tiên tiến, và trọng số sẽ được công bố theo lịch trình công khai. Các nhóm có được giá trị trong tuần đầu tiên sẽ không phải là những nhóm có ngân sách GPU lớn nhất. Họ sẽ là những người đã dành hai tuần để thực hiện công việc ít hào nhoáng hơn: cài đặt ngăn xếp, chọn cấp độ chính xác, ghi lại các đường cơ sở, chuẩn bị bộ kiểm tra.
Hãy bắt đầu với danh sách kiểm tra ở trên. Ghi lại các đường cơ sở được lưu trữ của bạn trong tuần này, và tải xuống Apidog để lưu giữ chúng: một bộ sưu tập, một môi trường hosted và local, cùng các xác nhận biến câu hỏi “triển khai của tôi có hoạt động không” thành một báo cáo pass/fail mà bạn có thể chạy lại mỗi khi thay đổi cấp độ lượng tử hóa hoặc cờ phục vụ.
