Qwen 3.8 trong Lập trình: 16 ngày chạy tự động và Liên kết mã Claude

Qwen 3.8-Max cho lập trình: Chạy tự động 16 ngày của Alibaba, kết quả đánh giá hiệu năng, và cấu hình chính thức cho Claude Code, Codex, Qoder, Qwen Code, và OpenClaw.

Ashley Innocent

Ashley Innocent

3 tháng 8 2026

Qwen 3.8 trong Lập trình: 16 ngày chạy tự động và Liên kết mã Claude

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Hầu hết các buổi ra mắt mô hình đều giới thiệu khả năng viết mã theo cùng một cách: đây là điểm HumanEval của chúng tôi, đây là một đoạn mã của mô hình viết thuật toán tìm kiếm nhị phân. Alibaba đã đi một con đường khác với Qwen 3.8-Max. Tuyên bố không phải là “nó viết các hàm tốt.” Tuyên bố là nó có thể tự mình điều hành một dự án phần mềm trong nhiều tuần: mở các vấn đề (issues), hợp nhất các yêu cầu kéo (pull requests) và triển khai các tính năng mà không cần con người can thiệp.

Đó là một tuyên bố táo bạo và nó xứng đáng được xem xét kỹ lưỡng. Bài viết này sẽ xem xét ba minh chứng về khả năng viết mã mà Alibaba đã công bố khi ra mắt (tất cả đều là bản demo của nhà cung cấp, một bản có kho lưu trữ công khai để bạn có thể kiểm tra), các con số hiệu năng viết mã đằng sau chúng, và sau đó là phần bạn có thể thực hiện ngay hôm nay: cách thực sự viết mã với qwen3.8-max trong Claude Code, Codex, Qoder, Qwen Code và OpenClaw, cũng như cách kiểm tra đầu ra API mà mã được tạo của bạn tạo ra.

Nếu bạn mới tìm hiểu về mô hình này, hãy bắt đầu với tổng quan về Qwen 3.8 là gì: tổng cộng 2.4 nghìn tỷ tham số, 95 tỷ tham số hoạt động, cửa sổ ngữ cảnh 1M token và các trọng số mở (open weights) được hứa hẹn sẽ phát hành vào tuần sau khi ra mắt. Ở đây chúng ta sẽ tập trung vào câu chuyện viết mã. Mọi điều dưới đây phản ánh tình hình tính đến ngày 3 tháng 8 năm 2026.

nút

Alibaba thực sự tuyên bố điều gì

Bối cảnh trong bài đăng chính thức về Qwen 3.8 là quyền tự chủ đối với các đoạn mã. Alibaba định vị Qwen 3.8-Max là một mô hình có thể ghi nhớ một nhiệm vụ kỹ thuật dài hạn: lên kế hoạch công việc, thực hiện trong nhiều ngày, tự phục hồi sau những sai lầm và cung cấp một sản phẩm có thể xem xét được vào cuối cùng.

Ba điều sau đây làm cho tuyên bố này thú vị hơn so với các chiến dịch tiếp thị ra mắt thông thường:

  1. Các bản demo rất dài. Mười sáu ngày là một chế độ khác biệt so với một bài kiểm tra hiệu năng tác nhân (agent benchmark) 20 phút. Khả năng phục hồi lỗi, quản lý ngữ cảnh và sự sai lệch có ý nghĩa quan trọng hơn nhiều ở quy mô đó.
  2. Một bản demo là công khai. Bạn có thể duyệt kho lưu trữ (repo), đọc các cam kết (commits) và tự mình đánh giá chất lượng mã. Hầu hết các buổi giới thiệu của nhà cung cấp không cung cấp điều đó.
  3. Hệ thống thử nghiệm (harness) là của đối thủ cạnh tranh. Alibaba đã chạy hầu hết các bài kiểm tra hiệu năng viết mã của mình bằng hệ thống thử nghiệm Claude Code và công bố một cấu hình chính thức để bạn có thể làm tương tự. Chi tiết hơn ở phần dưới.

Lưu ý tiêu chuẩn, và nó áp dụng cho toàn bộ bài viết này: mọi con số ở đây đều đến từ tài liệu ra mắt của Alibaba. Chưa có xác minh độc lập nào tồn tại tính đến đầu tháng 8 năm 2026. Hãy coi các bản trình diễn (showcase) là bản demo, không phải là các cuộc kiểm toán.

Ba minh chứng về khả năng viết mã

oh-my-cli: 16 ngày phát triển tự động

Bản demo nổi bật. Alibaba đã cho Qwen 3.8-Max tự do phát triển một công cụ dòng lệnh và để nó chạy tự động. Tính đến ngày 30 tháng 7, quá trình này đã diễn ra trong 16 ngày và tạo ra 265 cam kết (commits), 127 yêu cầu kéo (pull requests) và 151 vấn đề (issues), tất cả đều do chính mô hình tự mở, xử lý và đóng.

Kho lưu trữ (repo) được công khai tại qwen-code-dev-bot/oh-my-cli, đây là phần hữu ích nhất của toàn bộ bản trình diễn. Bạn không cần phải tin vào số lượng cam kết (commit count). Bạn có thể đọc mô tả các PR, kiểm tra xem các vấn đề (issues) là lỗi thực sự hay chỉ là công việc bận rộn, và xem mã có hoạt động tốt không. Mười sáu ngày đầu ra từ một mô hình không có sự xem xét của con người là một hiện vật thực sự hiếm có, bất kể bạn kết luận điều gì về chất lượng.

Những điều cần tìm khi bạn kiểm tra nó: liệu các PR có thực sự sửa các vấn đề mà chúng tham chiếu, liệu mô hình có tạo ra công việc giả để đóng hay không, và cách nó xử lý các lỗi hồi quy của chính nó. Những mẫu hình đó cho bạn biết nhiều hơn về độ tin cậy dài hạn so với bất kỳ điểm hiệu năng đơn lẻ nào.

Chạy tái tạo bài báo: mã nghiên cứu, không phải mã ứng dụng

Bản demo thứ hai nhắm vào một loại mã hóa khó hơn: tái tạo một bài báo nghiên cứu học máy từ đầu. Theo số liệu của Alibaba, quá trình này mất khoảng 125 giờ, tạo ra khoảng 7.600 dòng mã và thực hiện 33 vòng huấn luyện GPU trong suốt quá trình.

Kết quả: mô hình đã tái tạo 6 trong số các phát hiện của bài báo, sau đó tiến thêm một bước và vượt qua kết quả được báo cáo của bài báo 2.7 điểm trên AIME24. Tái tạo nghiên cứu là một công việc nổi tiếng là không khoan nhượng. Môi trường có thể bị hỏng, siêu tham số (hyperparameters) ẩn trong chú thích, và một lỗi nhỏ không báo trước có thể làm mất hiệu lực một quá trình huấn luyện mà bạn chỉ phát hiện ra sau nhiều giờ. Một mô hình có thể vượt qua 33 vòng huấn luyện và đưa ra các con số phù hợp đang làm được điều gì đó vượt xa khả năng tự động hoàn thành mã.

Bản demo này đi kèm với hàng hiệu năng mạnh nhất của Qwen 3.8-Max, PaperBench, sẽ được đề cập dưới đây.

Cuộc thi Tianchi: 24 giờ đối đầu với các đội người

Minh chứng thứ ba đã đưa mô hình tham gia một cuộc thi khoa học dữ liệu trực tiếp trên nền tảng Tianchi của Alibaba với giới hạn 24 giờ. Mô hình đã thực hiện 45 lượt gửi trong khoảng thời gian đó, lặp lại phương pháp của mình mỗi lần, và kết thúc với độ chính xác cuối cùng là 0.853. Điều này đã giúp nó vượt qua 458 trong số 526 đội người đang cạnh tranh.

Đáng chú ý về kết quả này: mô hình đã không giành chiến thắng. Nó đã đánh bại 87% các đối thủ, điều này vừa ấn tượng vừa trung thực. Nó cũng cho thấy một khả năng mà hai bản demo kia không có: lặp lại nhanh chóng dưới áp lực thời hạn, nơi điểm số của mỗi lượt gửi nuôi dưỡng cho lần thử tiếp theo.

Một lưu ý bổ sung áp dụng mạnh mẽ ở đây: Tianchi là nền tảng riêng của Alibaba. Bản demo là thật, nhưng nhà cung cấp đã kiểm soát địa điểm.

Các điểm hiệu năng viết mã đằng sau các bản demo

Alibaba đã công bố một bảng hiệu năng đầy đủ khi ra mắt. Dưới đây là các hàng liên quan đến viết mã, với những phần trung thực được giữ lại. Tất cả các con số đều là kết quả thử nghiệm của chính Alibaba.

Bài kiểm tra hiệu năng Qwen 3.8-Max Đối thủ tốt nhất (theo bảng của Alibaba)
Terminal Bench 2.1 86.6 88.8 (GPT-5.6 Sol)
SWE-bench Pro 67.7 80.0 (Fable 5)
PaperBench 93.0 90.5 (GPT-5.6 Sol)

Ba điểm chính:

Giờ là phần chi tiết nhỏ mà hầu hết các báo cáo sẽ bỏ qua: Alibaba đã chạy hầu hết các bài kiểm tra hiệu năng viết mã này trên hệ thống thử nghiệm Claude Code, bao gồm cả các lần chạy cho các mô hình đối thủ, và chú thích của bảng cho biết kết quả của Fable 5 có thể liên quan đến các cơ chế dự phòng (fallbacks). Việc lựa chọn hệ thống thử nghiệm ảnh hưởng đáng kể đến điểm hiệu năng tác nhân (agentic benchmark), vì vậy một bảng do nhà cung cấp chạy trên một hệ thống thử nghiệm cụ thể chỉ là một điểm dữ liệu, không phải là một phán quyết cuối cùng.

Tuy nhiên, chi tiết về Claude Code lại có hai mặt. Nó có nghĩa là Alibaba đã tối ưu hóa cho hệ thống thử nghiệm mà bạn có thể đã đang sử dụng, và họ đã công bố cấu hình để chứng minh điều đó.

Cách thực sự viết mã với Qwen 3.8 ngay hôm nay

Đây là phần thực tế. Qwen 3.8-Max đã có sẵn (GA) trên Alibaba Cloud Model Studio, và Alibaba đã công bố cấu hình chính thức cho năm công cụ viết mã khi ra mắt. Bạn cần một khóa API DashScope (từ home.qwencloud.com) cho tất cả chúng. Giá là 2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra, không thay đổi trên toàn bộ ngữ cảnh 1M, theo trang giá chính thức của Model Studio.

Claude Code

Mô hình đi kèm với một điểm cuối API tương thích với Anthropic, vì vậy để trỏ Claude Code đến nó cần ba biến môi trường:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max

Khởi động Claude Code như bình thường và nó sẽ định tuyến mọi yêu cầu tới Qwen 3.8-Max thay vì Claude. Với việc Alibaba đã chạy các bài kiểm tra hiệu năng viết mã của mình trên hệ thống thử nghiệm chính xác này, đây là cấu hình có sự khác biệt ít nhất giữa những gì đã được đo lường và những gì bạn sẽ trải nghiệm.

Codex

Codex cần một mục nhà cung cấp (provider entry) trong cấu hình của nó. Sơ đồ từ tài liệu chính thức:

model = "qwen3.8-max"
model_provider = "qwencloud"

[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000

Điều này sử dụng điểm cuối tương thích với OpenAI thay vì điểm cuối Anthropic. Cùng một mô hình, cùng một khóa, hình dạng giao thức khác nhau.

Qoder, Qwen Code và OpenClaw

Ba cái còn lại có thể tóm tắt nhanh hơn:

Tất cả năm cấu hình đều có trong bài đăng ra mắt, vì vậy hãy lấy phiên bản hiện tại chính xác ở đó thay vì dựa vào một ảnh chụp blog.

Thiết lập mức độ nỗ lực suy luận một cách có chủ đích

Qwen 3.8-Max hỗ trợ tham số reasoning_effort với ba cấp độ: xhigh (mặc định), mediumlow. Đối với việc viết mã, cài đặt này quan trọng hơn hầu hết các tùy chỉnh khác:

Hãy nhớ rằng các token suy luận được tính phí như token đầu ra với giá 6 đô la cho mỗi triệu, và xhigh là mặc định. Một phiên làm việc tác nhân (agentic session) dài với nỗ lực tối đa sẽ tốn rất nhiều tiền; một chỉnh sửa cơ học ở chế độ xhigh sẽ tốn tiền mà không mang lại lợi ích.

Nếu Qwen 3.8-Max vượt quá nhu cầu của nhiệm vụ của bạn, dòng Qwen3 Coder trước đó vẫn tồn tại cho công việc viết mã chuyên dụng, và Qwen3 Coder Flash bao gồm phân khúc nhanh và rẻ. Đối với các mô hình mã nguồn mở mạnh mẽ khác trong lĩnh vực này, hãy xem cách Kimi K3 xử lý công việc viết mã.

Kiểm tra những gì mô hình xây dựng: bước Apidog

Đây là khoảng trống trong mọi bản demo viết mã tự động, bao gồm cả của Alibaba: mô hình viết mã gọi API, và không ai nói về việc xác minh các cuộc gọi đó. Một tác nhân có thể tạo ra 7.600 dòng mã biên dịch sạch sẽ nhưng vẫn gọi sai điểm cuối (endpoint), xử lý sai mã 429, hoặc gửi một phần thân yêu cầu (request body) không vượt qua được xác thực trong môi trường sản xuất.

Hai thói quen sau đây sẽ thu hẹp khoảng cách đó.

Kiểm tra các điểm cuối mà mã được tạo của bạn gọi. Khi Qwen 3.8-Max tạo cấu trúc dịch vụ hoặc viết một máy khách API, hãy nhập thông số kỹ thuật liên quan vào Apidog và kiểm tra trực tiếp các điểm cuối: luồng xác thực, phản hồi lỗi, các gói dữ liệu trường hợp đặc biệt (edge-case payloads). Việc tìm ra một giả định sai trong một lần chạy thử nghiệm rẻ hơn nhiều so với việc phát hiện trong một vết gọi ngăn xếp (stack trace) sau hai ngày làm việc tự động. Nếu bạn đang đánh giá API của mô hình trước khi cam kết sử dụng, hướng dẫn API Qwen 3.8 bao gồm chi tiết việc thiết lập giao thức kép OpenAI và Anthropic, và Apidog là một nơi tiện lợi để kiểm tra cả hai dạng giao thức song song, bao gồm các phản hồi truyền trực tuyến (streaming responses) và các sai khác suy luận (reasoning deltas).

Giả lập API để các tác nhân không ảnh hưởng đến môi trường sản xuất. Điều này càng quan trọng hơn khi các lần chạy của bạn kéo dài. Một phiên làm việc tự động 16 ngày thực hiện các cuộc gọi trực tiếp đến cơ sở hạ tầng sản xuất là một ý tưởng thực sự tồi tệ: giới hạn tỷ lệ (rate limits), thay đổi dữ liệu, các hóa đơn bất ngờ. Máy chủ giả lập (mock servers) trong Apidog cung cấp cho tác nhân các phản hồi thực tế mà không chạm vào các hệ thống thực. Trỏ mã được tạo đến URL giả lập trong quá trình chạy, thay thế bằng URL cơ sở thực khi con người đã xem xét đầu ra. Tải Apidog miễn phí để thiết lập một giả lập trong vài phút; đây là bảo hiểm rẻ nhất mà một lần chạy tác nhân không giám sát có thể có.

Mô hình này tổng quát hóa: bạn càng trao nhiều quyền tự chủ cho một mô hình viết mã, lớp API càng trở thành bề mặt kiểm soát của bạn. Bạn không thể xem xét mọi cam kết (commit) trong thời gian thực, nhưng bạn có thể kiểm soát những gì mã được phép giao tiếp.

Câu hỏi thường gặp

Qwen 3.8 có tốt cho việc viết mã không?

Theo số liệu của Alibaba, nó mạnh về mã hóa tác nhân (agentic) và mã hóa kiểu nghiên cứu (Terminal Bench 2.1 đạt 86.6, PaperBench đạt 93.0) và ở mức trung bình trong việc sửa lỗi quy mô kho lưu trữ (SWE-bench Pro đạt 67.7 so với 80.0 của Fable 5). Tất cả các con số đều do nhà cung cấp chạy và chưa có xác minh độc lập. Đánh giá trung thực: xuất sắc cho công việc tự động dài hạn, không phải là người dẫn đầu trong việc sửa lỗi cổ điển.

Tôi có thể sử dụng Qwen 3.8 trong Claude Code không?

Có, chính thức. Đặt ANTHROPIC_BASE_URL thành https://dashscope-intl.aliyuncs.com/apps/anthropic, ANTHROPIC_AUTH_TOKEN thành khóa DashScope của bạn, và ANTHROPIC_MODEL thành qwen3.8-max. Alibaba đã tự công bố cấu hình này và chạy hầu hết các bài kiểm tra hiệu năng viết mã của mình trên hệ thống thử nghiệm Claude Code.

Chi phí viết mã với Qwen 3.8 là bao nhiêu?

2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra, không thay đổi trên toàn bộ ngữ cảnh 1M. Các token suy luận được tính phí như token đầu ra, và nỗ lực suy luận xhigh mặc định tạo ra rất nhiều token này, vì vậy hãy lập ngân sách cao hơn giá niêm yết cho các phiên làm việc tác nhân (agentic sessions). Chi tiết tính toán chi phí đầy đủ và so sánh có trong phân tích hiệu năng Qwen 3.8 và các thông tin về giá liên kết ở đó.

Liệu quá trình oh-my-cli kéo dài 16 ngày có thực sự tự động không?

Đó là tuyên bố của Alibaba, và không giống như hầu hết các bản demo của nhà cung cấp, bạn có thể kiểm tra sản phẩm: kho lưu trữ (repo) được công khai tại qwen-code-dev-bot/oh-my-cli với 265 cam kết (commits), 127 PR và 151 vấn đề (issues) tính đến ngày 30 tháng 7 năm 2026. Liệu chất lượng mã có biện minh cho việc định hình hay không là một đánh giá mà bạn có thể tự đưa ra bằng cách đọc nó, và đó chính xác là điều làm cho bản trình diễn này đáng tin cậy hơn một ảnh chụp màn hình.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API