Trong hai tuần, câu chuyện về Qwen 3.8 có một lỗ hổng. Các bản xem trước báo chí vào tháng 7 hứa hẹn một mô hình đẳng cấp tiên phong nhưng không cung cấp điểm số nào, vì vậy mọi bài viết ban đầu đều dựa trên cảm tính. Điều đó đã thay đổi vào ngày 3 tháng 8 năm 2026. Bài đăng ra mắt chính thức của Alibaba cho Qwen 3.8-Max bao gồm một bảng điểm chuẩn đầy đủ so với Claude Opus 4.8, Fable 5, GPT-5.6 Sol và phiên bản tiền nhiệm của nó là Qwen3.7-Max, cộng thêm một bảng đa phương thức riêng biệt so với Gemini 3.1 Pro và GPT-5.6 Sol.
Bảng đó đáng để đọc kỹ. Nó chứa những chiến thắng thực sự, những thất bại trung thực và những chi tiết nhỏ mà hầu hết các báo cáo sẽ bỏ qua hoàn toàn. Bài đăng này sẽ đi qua cả ba điều đó, sau đó cung cấp cho bạn một cách thực tế để ngừng tin tưởng vào các bảng của nhà cung cấp hoàn toàn: tự chạy đánh giá của riêng bạn đối với API. Nếu bạn muốn có thông tin đầy đủ về mô hình trước (tham số, giá cả, quyền truy cập), hãy bắt đầu với bài giải thích về Qwen 3.8-Max của chúng tôi rồi quay lại đây.
Một lưu ý trước khi đi vào các con số. Mọi điểm số dưới đây đều đến từ bảng do Alibaba công bố, với dữ liệu bảng xếp hạng được chú thích ngày 3 tháng 8 năm 2026. Không có đánh giá độc lập nào tồn tại vào thời điểm viết bài này. Hãy ghi nhớ điều đó cho mỗi hàng tiếp theo.
Bảng, tổng quan nhanh
Dưới đây là các hàng mô hình văn bản nổi bật theo như Alibaba đã công bố. Cao hơn là tốt hơn trên tất cả các tiêu chí này.
| Điểm chuẩn | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 | 60.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 | 64.8 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 | 92.4 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 | 79.1 |
| HLE (Humanity’s Last Exam) | 43.6 | 45.7 | 53.3 | 47.2 | 41.4 |
Nguồn: Bảng do nhà cung cấp Alibaba thực hiện. Chúng ta sẽ tìm hiểu "vendor-run" có nghĩa là gì trong thực tế ở phần dưới, bởi vì nó quan trọng hơn ở đây.

Qwen 3.8-Max chiến thắng ở đâu
PaperBench: hàng flagship tốt nhất của nó
PaperBench, một bài kiểm tra khả năng của mô hình trong việc tái tạo kết quả nghiên cứu khoa học, là điểm mạnh nhất của Qwen 3.8-Max so với các mô hình tiên phong khác: 93.0, dẫn trước GPT-5.6 Sol (90.5), Fable 5 (88.8) và Opus 4.8 (80.3). Đây cũng là một bước nhảy vọt đáng kinh ngạc so với Qwen3.7-Max (64.8). Một bước nhảy vọt 28 điểm giữa các thế hệ trên bất kỳ điểm chuẩn nào cũng đáng được xem xét kỹ lưỡng, nhưng nếu nó được xác nhận qua thử nghiệm độc lập, điều đó thực sự nói lên điều gì đó về khả năng nghiên cứu dài hạn của mô hình.
IFBench: tuân thủ hướng dẫn với biên độ rộng
Trên IFBench, Qwen 3.8-Max đạt 82.8. Đối thủ không phải Qwen gần nhất trong bảng là GPT-5.6 Sol với 72.7, Fable 5 với 63.5 và Opus 4.8 với 62.2. Đây là một khoảng cách từ 10 đến 20 điểm, điều khá bất thường trên một điểm chuẩn có tính cạnh tranh cao như vậy. Điều thú vị là Qwen3.7-Max đã dẫn đầu hàng này với 79.1, vì vậy việc tuân thủ hướng dẫn có vẻ là một điểm mạnh bền vững của Qwen hơn là một điểm đột phá nhất thời.
Terminal Bench 2.1: vượt qua Claude một chút
Trong lần chạy Terminal Bench 2.1 của Alibaba, Qwen 3.8-Max đạt 86.6 so với 84.6 của cả Opus 4.8 và Fable 5. GPT-5.6 Sol vẫn dẫn đầu hàng này với 88.8, vì vậy đây là vị trí thứ hai, không phải là một chiến thắng áp đảo. Nhưng việc đánh bại cả hai flagship của Anthropic trên một điểm chuẩn agentic terminal chính xác là loại kết quả mà Alibaba mong muốn từ lần ra mắt này, và biên độ hai điểm so với Claude là con số bạn sẽ thấy được trích dẫn ở khắp mọi nơi.
Chiến thắng đa phương thức
Bảng đa phương thức riêng biệt là nơi Qwen 3.8-Max trông mạnh nhất tổng thể. Alibaba báo cáo MathVision ở mức 95.2, LogicVista ở mức 91.9 và OSWorld-Verified ở mức 86.1, và mô hình này dẫn đầu hầu hết các hàng OCR trong bảng. Cả Opus 4.8 và Fable 5 đều không cạnh tranh trực tiếp ở đây (chúng tập trung vào văn bản trong so sánh này), đó là một phần lý do tại sao bảng đa phương thức được coi là một chiến thắng áp đảo. So với Gemini 3.1 Pro và GPT-5.6 Sol, các hàng lý luận hình ảnh và trí thông minh tài liệu là điểm khác biệt rõ ràng nhất của mô hình.
Nếu bạn so sánh nó với bản phát hành trọng lượng mở lớn khác của mùa hè, khoảng cách đa phương thức cũng là sự tương phản sắc nét nhất: Kimi K3 chỉ tập trung vào văn bản. So sánh Qwen 3.8 và Kimi K3 của chúng tôi bao gồm toàn bộ trận đấu đó.
Những điểm thất bại, được giữ trung thực
Alibaba đã giữ nguyên những điểm thua trong bảng, điều này đáng được ghi nhận. Ba điểm nổi bật:
HLE: 43.6, kém xa Fable 5. Trên Humanity’s Last Exam, điểm chuẩn kiến thức rộng lớn, Qwen 3.8-Max đạt 43.6. Fable 5 đạt 53.3, GPT-5.6 Sol đạt 47.2 và Opus 4.8 đạt 45.7. Đây là vị trí cuối cùng trong số bốn flagship, kém người dẫn đầu gần 10 điểm. Nó đánh bại Qwen3.7-Max (41.4), nhưng chỉ vừa đủ. HLE chống lại việc tinh chỉnh cụ thể cho điểm chuẩn tốt hơn hầu hết các đánh giá khác, điều này làm cho hàng này đáng được xem xét kỹ lưỡng.
SWE-bench Pro: 67.7 so với 80.0 của Fable 5. Trên điểm chuẩn kỹ thuật phần mềm khó hơn, Qwen 3.8-Max nằm ở giữa bảng: đứng trước GPT-5.6 Sol (64.6), ngay sau Opus 4.8 (69.2) và kém Fable 5 tới 12 điểm. Sự cải tiến thế hệ so với Qwen3.7-Max (60.6) là có thật, nhưng "đánh bại Claude trên Terminal Bench" và "kém Fable 5 nặng nề trên SWE-bench Pro" đều đúng cùng một lúc, và tuyên bố thứ hai sẽ xuất hiện ít tiêu đề hơn nhiều.
DeepSWE và các hàng agentic khó hơn. DeepSWE là một hàng khác mà Qwen 3.8-Max kém các mô hình tiên phong trong bảng của chính Alibaba. Mô hình này nhất quán trên toàn bộ phần mã hóa: cạnh tranh trong các tác vụ agentic dựa trên terminal, nhưng lại kém hơn trong các đánh giá kỹ thuật phần mềm sâu nhất.
Tóm tắt trung thực: Qwen 3.8-Max đánh bại Opus 4.8 trên một số hàng agentic, kém Fable 5 trong hầu hết các công việc mã hóa cốt lõi, và thắng lớn về trí thông minh đa phương thức và tài liệu. Đây là một kết quả thực sự mạnh mẽ cho một mô hình có giá 2 đô la đầu vào và 6 đô la đầu ra cho mỗi triệu token (xem trang giá chính thức), nhưng nó không phải là một chiến thắng tiên phong toàn diện như một cái nhìn lướt qua về tin tức ra mắt có thể gợi ý.
Những chi tiết nhỏ mà hầu hết các báo cáo sẽ bỏ qua
Đây là phần biện minh cho việc đọc một bài viết về điểm chuẩn thay vì chỉ đọc tiêu đề. Bốn chi tiết từ chính ấn phẩm của Alibaba thay đổi cách bạn nên đọc bảng.
1. Mọi con số đều do nhà cung cấp tự chạy. Alibaba đã tự đánh giá mô hình của mình và các mô hình của đối thủ. Đây là thực hành tiêu chuẩn cho các bảng ra mắt, và cũng là lý do tiêu chuẩn khiến các bảng ra mắt sau này được điều chỉnh. Các nhà cung cấp chọn phiên bản điểm chuẩn, chiến lược nhắc, cài đặt lấy mẫu và chính sách thử lại. Không có điều nào là gian lận. Tất cả đều là một sự thiên vị nhẹ.
2. Hầu hết các hàng mã hóa được chạy trên bộ công cụ Claude Code. Đây là chi tiết thực sự thú vị. Alibaba đã chạy hầu hết các điểm chuẩn mã hóa của mình với Claude Code, bộ công cụ agent riêng của Anthropic, được trỏ đến Qwen 3.8-Max thông qua API tương thích Anthropic của nó. Một mặt, đó là một động thái công bằng: nó đánh giá mọi mô hình trong cùng một công cụ được sử dụng rộng rãi. Mặt khác, điều đó có nghĩa là "điểm mã hóa của Qwen" thực sự là điểm "Qwen bên trong bộ công cụ của Anthropic", và lựa chọn bộ công cụ có thể làm thay đổi kết quả agentic vài điểm. Nó cũng cho bạn biết điều gì đó về nơi Alibaba mong đợi mô hình này sẽ chạy trong thực tế.
3. Một số điểm chuẩn là do Qwen tự phát triển. QwenSWEBench, QwenQoderBench, CoWorkBench và RecreationBench đều được xây dựng bởi nhóm Qwen. Các điểm chuẩn nội bộ không phải là vô giá trị; chúng thường thăm dò các khả năng mà các đánh giá công khai bỏ lỡ. Nhưng điểm số mạnh của một mô hình trên điểm chuẩn của chính nhà sản xuất là một loại bằng chứng khác với điểm số mạnh trên SWE-bench Pro, và bảng trình bày cả hai cạnh nhau mà không có sự phân biệt trực quan. Khi bạn trích dẫn một con số từ bảng này, hãy kiểm tra xem nó thuộc loại nào trước.
4. Chú thích về Fable 5. Bảng của chính Alibaba có một chú thích ghi "Kết quả của Fable5 có thể liên quan đến các lần dự phòng." Đây là một lời thừa nhận ngầm rằng ít nhất một trong các con số của đối thủ có thể không phản ánh mô hình chạy sạch sẽ. Bất kể nguyên nhân kỹ thuật là gì, điều đó có nghĩa là cột Fable 5, mô hình mà Qwen 3.8-Max thường bị tụt lại phía sau nhất, có một dấu hoa thị từ những người đã công bố nó.
Không có điều nào trong số này là độc nhất của Alibaba. Anthropic, OpenAI và Google đều công bố các bảng tự chạy với các lựa chọn phương pháp luận riêng của họ. Chúng tôi đã đánh dấu cùng một mô hình trong phân tích điểm chuẩn Kimi K3 của chúng tôi, và nó cũng áp dụng ở đó. Điểm mấu chốt không phải là Alibaba đã gian lận. Điểm mấu chốt là một bảng của nhà cung cấp là một tuyên bố, không phải là một phép đo.
Những điều cần xem xét, và cách đọc bảng tiếp theo
Tính đến ngày 3 tháng 8 năm 2026, không có đánh giá độc lập nào về Qwen 3.8-Max tồn tại. Artificial Analysis chưa công bố các con số vào thời điểm viết bài, và không có bảng xếp hạng cộng đồng nào chấm điểm mô hình này. Điều đó sẽ thay đổi trong vài ngày tới, và sự khác biệt giữa bảng của Alibaba và các lần chạy độc lập sẽ là câu chuyện thực sự. Chúng tôi sẽ cập nhật bài đăng này khi chúng xuất hiện.
Cho đến lúc đó, đây là danh sách kiểm tra ngắn gọn để đánh giá bất kỳ bảng điểm chuẩn của nhà cung cấp nào, bao gồm cả bảng này:
- Ai đã chạy đánh giá? Các con số tự báo cáo của đối thủ cạnh tranh đáng bị nghi ngờ hơn các con số tự báo cáo của mô hình của chính nhà cung cấp.
- Bộ công cụ và cài đặt nào? Các điểm chuẩn agentic rất nhạy cảm với bộ công cụ. Một bảng nêu tên bộ công cụ của nó (như Alibaba đã làm) hữu ích hơn một bảng không nêu, nhưng lựa chọn đó vẫn định hình kết quả.
- Nhà cung cấp đã xây dựng những điểm chuẩn nào? Các đánh giá nội bộ đo lường điều gì đó, nhưng không giống với các đánh giá công khai.
- Đọc chú thích. "Có thể liên quan đến các lần dự phòng" đang thực hiện rất nhiều công việc với cỡ chữ nhỏ.
- Kiểm tra những gì bị thiếu. Các hàng mà nhà cung cấp không công bố thường cung cấp thông tin nhiều như các hàng đã công bố. Các bảng của nhà cung cấp trong quá khứ đã âm thầm loại bỏ các điểm chuẩn mà mô hình hoạt động kém; so sánh với cách thế hệ trước xếp hạng giữa các nhà cung cấp để phát hiện những hàng nào đã biến mất.
- Chờ nguồn thứ hai. Một tuần kiên nhẫn thường giúp bạn có được các con số độc lập.
Thay vào đó, hãy tự chạy đánh giá của riêng bạn
Danh sách kiểm tra giúp bạn đọc các bảng. Cách tốt hơn là ít cần đến chúng hơn. Qwen 3.8-Max hiện đã có sẵn trên Alibaba Cloud Model Studio (ID mô hình qwen3.8-max, được liệt kê trên trang mô hình chính thức) với cả API tương thích OpenAI và API tương thích Anthropic, và một điểm chuẩn sử dụng các lời nhắc thực tế của bạn sẽ đánh bại bất kỳ đánh giá công khai nào không sử dụng.
Một thiết lập thực tế trong Apidog trông như thế này. Tạo một yêu cầu đến điểm cuối chat-completions của Model Studio với qwen3.8-max và một yêu cầu giống hệt thứ hai đến mô hình cơ sở hiện tại của bạn, cho dù đó là Qwen3.7-Max, Kimi K3, hay một điểm cuối Claude hoặc GPT. Lưu 20 đến 30 lời nhắc sản xuất thực tế của bạn dưới dạng một kịch bản kiểm tra, thêm các khẳng định cho các thuộc tính phản hồi mà bạn thực sự quan tâm (JSON hợp lệ, có các trường bắt buộc, độ trễ dưới ngưỡng của bạn) và chạy cả hai kịch bản liên tiếp. Báo cáo kiểm tra của Apidog cung cấp cho bạn tỷ lệ thành công và thời gian phản hồi cho mỗi mô hình, cạnh nhau, trên khối lượng công việc của bạn thay vì của Alibaba.
Hai điều cụ thể của Qwen cần kiểm tra trong khi bạn thực hiện: mô hình mặc định là reasoning_effort: xhigh, vì vậy hãy đo chi phí và độ trễ ở mức độ nỗ lực mà bạn thực sự sẽ triển khai, và nếu bạn định sử dụng điểm cuối tương thích Anthropic, hãy kiểm tra hình dạng giao thức đó một cách riêng biệt, bởi vì đó là giao thức mà hầu hết các điểm chuẩn mã hóa của chính Alibaba đã chạy qua. Tải xuống Apidog miễn phí, kết nối cả hai điểm cuối dưới dạng môi trường, và bạn sẽ có các con số đầu tiên trước khi các bảng xếp hạng độc lập công bố của họ.
Các câu hỏi thường gặp
Các con số điểm chuẩn Qwen 3.8 có được xác minh độc lập không?
Không. Tính đến ngày 3 tháng 8 năm 2026, mọi con số được công bố đều đến từ bảng của chính Alibaba. Artificial Analysis và các bảng xếp hạng cộng đồng chưa chấm điểm Qwen 3.8-Max tại thời điểm viết bài. Hãy xem bảng là tuyên bố của nhà cung cấp cho đến khi các lần chạy độc lập được công bố.
Kết quả điểm chuẩn tốt nhất của Qwen 3.8-Max là gì?
PaperBench, ở mức 93.0, là hàng flagship tốt nhất của nó: dẫn trước GPT-5.6 Sol (90.5), Fable 5 (88.8) và Opus 4.8 (80.3). Trong bảng đa phương thức, MathVision (95.2) và các hàng OCR là kết quả mạnh nhất của nó nói chung.
Qwen 3.8-Max rõ ràng thua ở đâu?
Trên HLE, nó đạt 43.6, đứng cuối cùng trong số bốn flagship và kém xa Fable 5 (53.3). Trên SWE-bench Pro, nó đạt 67.7 so với 80.0 của Fable 5, và nó cũng kém trên DeepSWE. Các đánh giá kỹ thuật phần mềm sâu và các bài kiểm tra kiến thức rộng là những lĩnh vực yếu nhất của nó trong bảng của chính Alibaba.
Qwen 3.8 tốt hơn Qwen 3.7-Max bao nhiêu trên các điểm chuẩn?
Những cải tiến thế hệ trong bảng của Alibaba là đáng kể: Terminal Bench 2.1 tăng từ 74.5 lên 86.6, SWE-bench Pro từ 60.6 lên 67.7, và PaperBench từ 64.8 lên 93.0. Liệu việc nâng cấp có đáng giá cho khối lượng công việc của bạn hay không còn tùy thuộc vào giá cả và phương thức; bài so sánh Qwen 3.8 và Qwen 3.7 của chúng tôi sẽ đi sâu vào quyết định này.
