Alibaba đã phát hành Qwen 3.8-Max vào đầu tháng 8 năm 2026, và nếu bạn đã chạy qwen3.7-max trong môi trường sản xuất, bạn sẽ phải đưa ra một quyết định quan trọng. Mô hình mới này đạt được những cải tiến lớn về hiệu suất tác nhân (agentic) và nghiên cứu, bổ sung khả năng nhập liệu hình ảnh, ra mắt với giá niêm yết thấp hơn, và đi kèm với một lời hứa mà Alibaba chưa bao giờ đưa ra cho phiên bản tiền nhiệm: mã nguồn mở (open weights).
Nhưng quyết định này không đơn giản chỉ là "mô hình mới thắng". Qwen 3.7-Max hiện đang có chương trình giảm giá 50% trong thời gian giới hạn, khiến nó rẻ hơn 3.8-Max về mặt tuyệt đối. Một số khác biệt về điểm chuẩn rất đáng kể. Một số khác thì gần như bằng không. Bài viết này sẽ đi sâu vào mọi thay đổi quan trọng, để bạn có thể quyết định liệu có nên chuyển đổi ngay bây giờ, chờ đợi, hoặc thậm chí chuyển xuống một cấp thấp hơn.
Nếu bạn muốn có cái nhìn toàn diện về mô hình mới trước tiên, hãy bắt đầu với bài giải thích Qwen 3.8-Max của chúng tôi. Để có thông tin cơ bản về mẫu flagship sắp bị thay thế, hãy xem những gì Qwen 3.7 đã mang lại.
Một lưu ý về phương pháp luận trước khi đi vào các con số. Mọi số liệu điểm chuẩn dưới đây đều lấy từ bảng của chính Alibaba trong bài đăng phát hành Qwen 3.8 chính thức. Điều này thực sự hữu ích ở đây: cả hai mô hình đều được đánh giá trong cùng một lần chạy của nhà cung cấp, vì vậy các khác biệt về điểm số có tính nhất quán nội bộ, ngay cả khi quá trình xác minh độc lập vẫn đang chờ xử lý. Hầu hết các hàng về lập trình đều được chạy trên bộ công cụ Claude Code, và một số điểm chuẩn là của Qwen tự xây dựng.
Phiên bản ngắn gọn
| Thay đổi gì | Qwen 3.7-Max | Qwen 3.8-Max |
|---|---|---|
| Terminal Bench 2.1 | 74.5 | 86.6 |
| SWE-bench Pro | 60.6 | 67.7 |
| PaperBench | 64.8 | 93.0 |
| IFBench | 79.1 | 82.8 |
| GPQA Diamond | 92.4 | 92.6 |
| HLE | 41.4 | 43.6 |
| Giá niêm yết (mỗi 1 triệu token) | $2.5 vào / $7.5 ra | $2 vào / $6 ra |
| Giá hiện tại (khuyến mãi) | $1.25 vào / $3.75 ra | $2 vào / $6 ra |
| Đầu vào hình ảnh | Không | Có |
| Kiến trúc công bố | Không công bố | Tổng 2.4T, 95B MoE hoạt động |
| Mã nguồn mở | Chưa bao giờ phát hành | Hứa hẹn "tuần tới" (~10/8) |
| Cửa sổ ngữ cảnh | 1 triệu token | 1 triệu token |
Bây giờ là chi tiết.
Điểm chuẩn khác biệt: nơi sự nhảy vọt là có thật
Các cải tiến nổi bật tập trung vào công việc tác nhân (agentic work): các tác vụ dài hạn mà mô hình lập kế hoạch, thực thi và tự sửa lỗi.

Terminal Bench 2.1: 74.5 lên 86.6. Đây là một bước nhảy vọt 12 điểm trên các tác vụ tác nhân điều khiển terminal, và nó đưa Qwen từ vị trí rõ ràng là kém hơn lên mức cạnh tranh thực sự. Trong cùng một bảng, Alibaba chấm Claude Opus 4.8 và Fable 5 ở mức 84.6 mỗi loại, điều này đặt 3.8-Max vượt lên trên cả hai ở hàng này. GPT-5.6 Sol vẫn dẫn đầu ở mức 88.8.
SWE-bench Pro: 60.6 lên 67.7. Tăng 7 điểm trong các tác vụ kỹ thuật phần mềm thực tế. Có ý nghĩa, nhưng hãy trung thực: Fable 5 đạt 80.0 trong cùng bảng, vì vậy đây là sự bắt kịp, không phải vượt qua. Nếu hiệu suất SWE-bench Pro là tiêu chí mua hàng chính của bạn, thì ranh giới vẫn nằm ở nơi khác.
PaperBench: 64.8 lên 93.0. Điểm khác biệt lớn nhất trong bảng, một bước nhảy vọt 28 điểm trong việc tái tạo các bài báo nghiên cứu AI. Đây cũng là điểm cao nhất của 3.8-Max, vượt qua mọi đối thủ trong so sánh của Alibaba. Nếu công việc của bạn liên quan đến tái tạo nghiên cứu, tài liệu kỹ thuật dài, hoặc suy luận khoa học nhiều bước, thì con số này đáng để bạn chú ý.
IFBench: 79.1 lên 82.8. Khả năng tuân thủ hướng dẫn cải thiện gần 4 điểm. Đáng chú ý, 3.7-Max đã mạnh ở đây (79.1 đã đánh bại Opus 4.8 và Fable 5 trong cùng một lần chạy), vì vậy điều này mở rộng một vị trí dẫn đầu hiện có thay vì khắc phục một điểm yếu.
GPQA Diamond: 92.4 lên 92.6. Gần như không thay đổi. Khoa học QA cấp sau đại học đã gần đạt đến độ bão hòa đối với 3.7-Max, và mô hình mới không thay đổi điều đó. Nếu công việc của bạn giống GPQA, thì việc nâng cấp không mang lại gì về chất lượng.
HLE: 41.4 lên 43.6. Humanity's Last Exam cải thiện 2 điểm nhưng vẫn kém xa so với các mô hình hàng đầu: Fable 5 đạt 53.3 và GPT-5.6 Sol đạt 47.2 trong cùng bảng. Qwen 3.8-Max thu hẹp khoảng cách ở nhiều nơi. Đây không phải là một trong số đó.
Mô hình: những cải tiến lớn về điểm chuẩn tác nhân và nghiên cứu, những cải tiến nhỏ về tuân thủ hướng dẫn, không có sự thay đổi trên các điểm chuẩn kiến thức đã bão hòa, và một khoảng cách dai dẳng trên các đánh giá lý luận khó nhất. Để có cái nhìn sâu hơn về toàn bộ bảng, bao gồm các chi tiết nhỏ về bộ công cụ và điểm chuẩn nội bộ, hãy xem phân tích điểm chuẩn Qwen 3.8 của chúng tôi.
Kiến trúc: Alibaba cuối cùng cũng công bố số liệu
Qwen 3.8-Max là một mô hình mixture-of-experts với tổng số 2.4 nghìn tỷ tham số, với 95 tỷ tham số hoạt động trên mỗi lần chuyển tiếp, được xây dựng trên nền tảng kiến trúc Qwen 3.5. Tỷ lệ kích hoạt này xấp xỉ 4%, điều này quan trọng đối với chi phí phục vụ: bạn trả tiền tính toán cho 95 tỷ, chứ không phải 2.4 nghìn tỷ.
Sự khác biệt với 3.7-Max nằm ở chính sự công bố. Alibaba chưa bao giờ công bố các số liệu quy mô tương đương cho Qwen 3.7-Max. Số lượng tham số, tỷ lệ kích hoạt, cấu hình chuyên gia: tất cả đều không được tiết lộ. Với 3.8-Max, tài liệu mô hình của Model Studio và bài đăng phát hành đã trình bày rõ kiến trúc, điều này giúp việc lập kế hoạch năng lực và mô hình hóa chi phí ít mang tính phỏng đoán hơn nhiều.
Để làm rõ trong cuộc đua mã nguồn mở: Kimi K3 chạy tổng cộng 2.8T với 104B hoạt động. Qwen 3.8-Max nhỏ hơn trên cả hai trục.
Đa phương thức: khả năng mà 3.7-Max chưa bao giờ có
Qwen 3.7-Max là một mô hình văn bản. Qwen 3.8-Max chấp nhận đầu vào hình ảnh một cách tự nhiên, và Alibaba đã công bố một bảng điểm chuẩn đa phương thức riêng biệt, trong đó nó dẫn đầu hầu hết các hàng so với Gemini 3.1 Pro và GPT-5.6 Sol.
Các điểm số nổi bật từ bảng đa phương thức của Alibaba: MathVision ở 95.2, LogicVista ở 91.9, và OSWorld-Verified ở 86.1 cho các tác vụ sử dụng máy tính. Không có cột 3.7-Max trong bảng đó để so sánh, bởi vì điều đó không thể xảy ra: mô hình cũ không chấp nhận hình ảnh.
Trong thực tế, điều này có nghĩa là các tác vụ mà trước đây bạn phải chuyển sang một mô hình thị giác riêng biệt (hiểu ảnh chụp màn hình, hình ảnh tài liệu, tự động hóa giao diện người dùng, trích xuất biểu đồ) giờ đây có thể chạy trên cùng một ID mô hình với lưu lượng văn bản của bạn. Bài đăng phát hành cũng trình bày khả năng hiểu tài liệu dài và video, mặc dù đây là các khả năng được minh họa trên blog chứ không phải là các loại đầu vào API riêng biệt, vì vậy hãy xác minh với tài liệu API cho trường hợp cụ thể của bạn.
Giá cả: mô hình mới rẻ hơn, ngoại trừ hiện tại
Đây là nơi mà việc tính toán nâng cấp trở nên thú vị.
Qwen 3.8-Max ra mắt với giá $2 đầu vào / $6 đầu ra cho mỗi 1 triệu token, một mức giá cố định duy nhất trên toàn bộ ngữ cảnh 1 triệu. Qwen 3.7-Max được niêm yết với giá $2.5 / $7.5. Vì vậy, mô hình mới, có khả năng hơn, có giá thấp hơn 20% so với giá niêm yết của phiên bản tiền nhiệm. Điều này gần như không bao giờ xảy ra trong việc thay đổi thế hệ flagship.
Nhưng có một điều đáng chú ý: Alibaba hiện đang chạy chương trình khuyến mãi 50% có giới hạn thời gian cho 3.7-Max, đưa mức giá hiệu quả của nó xuống còn $1.25 / $3.75. Với giá hiện tại, mô hình cũ có giá thấp hơn 38% so với mô hình mới. Tất cả các mức giá đều có trên trang giá chính thức của Model Studio.
Hai điều cần lưu ý:
- Chương trình khuyến mãi có thể kết thúc. Alibaba dán nhãn là có giới hạn thời gian và chưa công bố ngày kết thúc. Nếu bạn xây dựng kiến trúc dựa trên mức giá $1.25 / $3.75, giả định ngân sách của bạn có một ngày hết hạn mà bạn không thể nhìn thấy. Với giá niêm yết, 3.8-Max là mô hình rẻ hơn.
- Số token suy nghĩ làm tăng hóa đơn thực tế. Qwen 3.8-Max mặc định sử dụng
reasoning_effort: xhigh, và số token suy nghĩ được tính phí như đầu ra. Chi phí hiệu quả của bạn cho mỗi yêu cầu có thể cao hơn nhiều so với mức giá niêm yết. Hướng dẫn định giá Qwen 3.8 của chúng tôi sẽ giải thích chi phí lưu trữ và chi phí trên mỗi tác vụ.
Và nếu cả hai mô hình Max đều không phù hợp với ngân sách của bạn, qwen3.7-plus với giá $0.4 / $1.6 (hiện đang được giảm giá 20%) vẫn là phân khúc giá trị. So sánh Plus và Max sẽ giúp bạn biết khi nào Plus là đủ.
Mã nguồn mở: lần đầu tiên cho dòng Max
Chưa có mô hình Qwen-Max nào từng phát hành mã nguồn mở. Qwen 3.7-Max không có, và Alibaba chưa bao giờ gợi ý rằng nó sẽ có. Qwen 3.8-Max phá vỡ quy tắc đó: bài đăng phát hành hứa hẹn các trọng số (weights) trên Hugging Face và ModelScope "tuần tới", tức là khoảng ngày 10 tháng 8.
Tính đến thời điểm viết bài này (ngày 3 tháng 8 năm 2026), các trọng số chưa thể tải xuống được. Hãy xem lời hứa là một lời hứa. Tiền lệ là rất đáng khích lệ: các trọng số của Kimi K3 đã đến sau 11 ngày ra mắt, và Alibaba có một lịch sử dài về mã nguồn mở với các mô hình Qwen nhỏ hơn. Nhưng việc tải xuống một mô hình 2.4T tham số là một dự án tự lưu trữ đa nút ngay cả khi đã được lượng tử hóa, vì vậy đối với hầu hết các nhóm, tác động thực tế sẽ là quyền truy cập được lưu trữ bởi bên thứ ba và áp lực về giá cả, chứ không phải một mô hình chạy trên máy chủ của bạn.
Nếu mã nguồn mở quan trọng đối với câu chuyện mua sắm hoặc tuân thủ của bạn, thì điều đó có thể tự giải quyết câu hỏi 3.7 so với 3.8. Một mô hình sẽ (có thể) có chúng. Mô hình còn lại thì không bao giờ.
Những gì không thay đổi
Đáng để nói rõ, bởi vì các bài viết nâng cấp có xu hướng cường điệu hóa:
- Cửa sổ ngữ cảnh: 1 triệu token cho cả hai. Không có sự mở rộng. Nếu bạn chọn 3.7-Max vì ngữ cảnh dài, 3.8-Max vẫn giữ nguyên giới hạn 1 triệu token với giá cố định trên toàn bộ cửa sổ.
- Đường dẫn truy cập: giống nhau. Cả hai mô hình đều được phục vụ thông qua Alibaba Cloud Model Studio với các điểm cuối tương thích OpenAI. Việc chuyển đổi chỉ là thay đổi ID mô hình (từ
qwen3.7-maxsangqwen3.8-max), chứ không phải một dự án di chuyển. 3.8-Max bổ sung thêm một bề mặt API tương thích Anthropic, đáng để thử nghiệm trong một client như Apidog nếu công cụ của bạn hỗ trợ giao thức đó. - Kiểm soát suy luận: hiện đã chính thức.
reasoning_effortlà một tham số được tài liệu hóa, hỗ trợ trên 3.8-Max với ba mức độ (mặc định xhigh, medium, low), cùng vớienable_thinkingvàpreserve_thinking. Nếu bạn đã tinh chỉnh các lời nhắc dựa trên hành vi suy luận ngầm định trên 3.7-Max, giờ đây bạn có một công cụ điều chỉnh rõ ràng thay thế.
Bạn có nên nâng cấp không? Ba con đường trung thực
Nâng cấp ngay nếu công việc của bạn mang tính tác nhân (agentic) hoặc nặng về nghiên cứu. Sự khác biệt của Terminal Bench (74.5 lên 86.6) và PaperBench (64.8 lên 93.0) là loại bước nhảy vọt mà bạn có thể cảm nhận được trong sản xuất, và bạn còn nhận được đầu vào hình ảnh cùng với giá niêm yết thấp hơn như một phần thưởng. Nếu bạn đang xây dựng các tác nhân vận hành terminal, tái tạo công việc kỹ thuật hoặc xử lý ảnh chụp màn hình, trường hợp này là rõ ràng.
Tiếp tục sử dụng khuyến mãi 3.7-Max nếu công việc của bạn nằm trong các vùng không có sự thay đổi lớn. Các tác vụ kiến thức kiểu GPQA chỉ thay đổi 0.2 điểm. Nếu lưu lượng truy cập của bạn là hỏi đáp, tóm tắt hoặc trò chuyện chung, và 3.7-Max đã đáp ứng yêu cầu chất lượng của bạn, thì $1.25 / $3.75 là mức giá mỗi token tốt nhất mà bất kỳ mô hình Max nào từng cung cấp. Đặt lời nhắc trên lịch để kiểm tra lại trạng thái khuyến mãi hàng tháng, và biết rằng giá dự phòng của bạn là 3.8-Max với $2 / $6, chứ không phải 3.7-Max với giá niêm yết.
Chuyển xuống qwen3.7-plus nếu bạn quan tâm đến giá cả và các tác vụ của bạn là thông thường. Với giá $0.4 / $1.6, nó rẻ hơn 5 lần so với 3.8-Max về đầu vào, và đối với phân loại, trích xuất và tạo theo mẫu, khả năng của dòng Max thường là lãng phí.
Kiểm tra việc chuyển đổi trước khi cam kết
Điểm chuẩn của nhà cung cấp, ngay cả khi nhất quán nội bộ, không thể dự đoán cách mô hình hoạt động với các lời nhắc của bạn. Cách rẻ tiền để giải quyết vấn đề này là so sánh song song trên khối lượng công việc thực tế của bạn.
Trong Apidog, bạn có thể thiết lập điều này trong vài phút: trỏ một bộ sưu tập đến điểm cuối tương thích OpenAI của Model Studio, sau đó tạo hai môi trường chỉ khác nhau ở biến ID mô hình, một được đặt thành qwen3.7-max và một thành qwen3.8-max. Chạy cùng một tập hợp yêu cầu đối với cả hai, chuyển đổi môi trường chỉ bằng một cú nhấp chuột và so sánh đầu ra, độ trễ và mức sử dụng token từ trình xem phản hồi. Vì cả hai mô hình đều chia sẻ cùng một bề mặt API, một bộ sưu tập duy nhất bao gồm cả hai, và bạn có thể lưu các lời nhắc sản xuất đại diện dưới dạng kịch bản thử nghiệm và chạy lại chúng bất cứ khi nào Alibaba phát hành bản cập nhật hoặc giá khuyến mãi thay đổi.
Điều đó biến câu hỏi "chúng ta có nên nâng cấp không?" từ một cuộc tranh luận về điểm chuẩn thành một buổi chiều thu thập bằng chứng. Tải xuống Apidog miễn phí và chạy so sánh với lưu lượng truy cập của riêng bạn trước khi bạn thay đổi cấu hình sản xuất.
Câu hỏi thường gặp
Qwen 3.8-Max có rẻ hơn Qwen 3.7-Max không?
Ở giá niêm yết, có: $2 / $6 so với $2.5 / $7.5 cho mỗi 1 triệu token. Với giá thực tế hiện nay, không: chương trình khuyến mãi 50% có thời hạn của 3.7-Max đưa nó xuống còn $1.25 / $3.75, thấp hơn 3.8-Max 38%. Chương trình khuyến mãi không có ngày kết thúc được công bố. Chi tiết chi phí đầy đủ có trong hướng dẫn định giá Qwen 3.8 của chúng tôi.
Tôi có cần thay đổi mã nguồn để chuyển từ qwen3.7-max sang qwen3.8-max không?
Đối với việc sử dụng cơ bản, không. Cả hai mô hình đều phục vụ thông qua cùng các điểm cuối Model Studio tương thích OpenAI, vì vậy việc chuyển đổi chỉ là thay đổi ID mô hình. Bạn có thể muốn đặt reasoning_effort một cách rõ ràng, vì 3.8-Max mặc định là xhigh và các token suy nghĩ được tính phí như đầu ra. Nếu bạn gửi hình ảnh, đó là một khả năng chỉ có trên 3.8-Max và yêu cầu định dạng tin nhắn đầu vào hình ảnh tiêu chuẩn.
Qwen 3.7-Max có mã nguồn mở không?
Không, và sẽ không bao giờ có dựa trên lịch sử của Alibaba với dòng sản phẩm này. Qwen 3.8-Max là mô hình thuộc dòng Max đầu tiên được hứa hẹn có mã nguồn mở, dự kiến sẽ có trên Hugging Face và ModelScope khoảng ngày 10 tháng 8 năm 2026. Tính đến ngày 3 tháng 8, chúng vẫn chưa thể tải xuống được.
Qwen 3.8-Max có tốt hơn Claude hay GPT hiện tại không?
Tùy thuộc vào hàng điểm chuẩn, và hãy nhớ rằng đây là các con số của chính Alibaba. Trong bảng của họ, 3.8-Max đánh bại Opus 4.8 và Fable 5 trên Terminal Bench 2.1 và dẫn đầu tất cả trên PaperBench và IFBench. Nó kém xa Fable 5 trên SWE-bench Pro (67.7 so với 80.0) và tất cả các mô hình hàng đầu trên HLE. Chưa có số liệu điểm chuẩn độc lập nào tồn tại, vì vậy hãy giữ lại phán quyết cuối cùng cho đến khi các đánh giá từ bên thứ ba được công bố.
