Alibaba đã chính thức phát hành Qwen 3.8-Max vào đầu tháng 8 năm 2026, và nó đi kèm với một sự kết hợp độc đáo: một mô hình Mixture-of-Experts với 2.4 nghìn tỷ tham số nhưng chỉ kích hoạt 95 tỷ tham số mỗi token, mức giá cố định $2/$6 mỗi triệu token trên toàn bộ ngữ cảnh 1M, và lời hứa rằng các trọng số sẽ được công khai trên Hugging Face và ModelScope trong vòng một tuần. Phần cuối cùng đó rất quan trọng. Chưa từng có mô hình Qwen-Max-class nào trước đây được phát hành với trọng số mở.
Thông báo chính thức gọi đây là Qwen có khả năng nhất cho đến nay, và bảng điểm chuẩn của nhà cung cấp cũng chứng minh điều đó với một số kết quả thực sự mạnh mẽ và một vài điểm yếu rõ ràng. Hướng dẫn này sẽ phân tích Qwen 3.8-Max thực sự là gì, các con số nói lên điều gì, vị trí của nó so với Kimi K3, Fable 5 và GPT-5.6 Sol, cùng mọi cách để bạn có thể chạy nó ngay hôm nay. Nếu bạn dự định xây dựng ứng dụng dựa trên API, mô hình này được cung cấp với cả các điểm cuối tương thích OpenAI và tương thích Anthropic, điều này làm cho một client nhận biết giao thức như Apidog trở nên hữu ích để kiểm tra cả hai dạng với cùng một khóa.
Tổng quan Qwen 3.8-Max
| Thông số | Qwen 3.8-Max |
|---|---|
| Nhà phát triển | Alibaba (nhóm Qwen) |
| Phát hành | Đầu tháng 8 năm 2026 (GA trên Model Studio, ngày 3 tháng 8) |
| Kiến trúc | MoE, xây dựng trên nền tảng Qwen 3.5 |
| Tổng tham số | 2.4T |
| Tham số hoạt động | 95B (~4% kích hoạt) |
| Cửa sổ ngữ cảnh | 1.000.000 token |
| Đầu ra tối đa | 65.536 token |
| Phương thức | Đầu vào văn bản + hình ảnh, đầu ra văn bản |
| Điều khiển lập luận | reasoning_effort: xhigh (mặc định), medium, low |
| ID mô hình API | qwen3.8-max |
| Giá | $2 đầu vào / $6 đầu ra cho mỗi 1 triệu token, cố định trên toàn bộ ngữ cảnh |
| Trọng số mở | Đã hứa trong tuần tới (~10 tháng 8); chưa thể tải xuống tính đến đầu tháng 8 năm 2026 |
| Giao thức API | Tương thích OpenAI và tương thích Anthropic |
Mọi thông tin trong bảng đó đều đến từ tài liệu phát hành của Alibaba và trang giá Model Studio. Bây giờ là chi tiết.
Qwen 3.8-Max là gì
Qwen 3.8-Max là mẫu flagship mới của dòng Qwen của Alibaba, được xây dựng trên nền tảng kiến trúc Qwen 3.5. Nó thay thế Qwen3.7-Max ở vị trí hàng đầu, và bảng của nhà cung cấp cho thấy những bước nhảy vọt đáng kể so với phiên bản tiền nhiệm: Terminal Bench 2.1 từ 74.5 lên 86.6, và PaperBench từ 64.8 lên 93.0. Nếu bạn đang cân nhắc có nên chuyển từ mô hình cũ hơn hay không, sự khác biệt được trình bày chi tiết trong bài so sánh Qwen 3.8 và Qwen 3.7 Max của chúng tôi.

Thông số kỹ thuật nổi bật là sự phân chia tham số. Tổng cộng 2.4 nghìn tỷ tham số nghe có vẻ khổng lồ, và đúng là như vậy, nhưng thiết kế MoE chỉ kích hoạt 95 tỷ tham số cho mỗi lượt chuyển tiếp (forward pass). Tỷ lệ kích hoạt khoảng 4% đó là lý do tại sao Alibaba có thể cung cấp một mô hình lớn như vậy với giá $2/$6 mỗi triệu token. Để so sánh, Kimi K3 chạy tổng cộng 2.8 nghìn tỷ với 104 tỷ tham số hoạt động, vì vậy Qwen 3.8-Max là mô hình nhỏ hơn ở cả hai chỉ số.
Về phía đầu vào, mô hình chấp nhận văn bản và hình ảnh thông qua API. Blog của Alibaba cũng trình diễn khả năng hiểu tài liệu dài (PDF hơn 200 trang) và hiểu video 100 giờ thông qua cái mà họ gọi là biểu đồ bộ nhớ. Hãy coi những điều này là khả năng được trình diễn trên blog hơn là các loại đầu vào API riêng biệt; các cấu hình API đã xuất bản liệt kê văn bản và hình ảnh là các phương thức đầu vào.
Khả năng lập luận được kiểm soát thông qua tham số reasoning_effort với ba cấp độ: xhigh (mặc định), medium và low. Cũng có enable_thinking và preserve_thinking, với suy nghĩ được bảo toàn theo mặc định. Một chi tiết về giá đáng biết sớm: chế độ suy nghĩ và không suy nghĩ được tính phí với cùng một mức, nhưng các token suy nghĩ được tính là đầu ra, vì vậy hóa đơn thực tế ở chế độ xhigh mặc định sẽ cao hơn so với tính toán đơn giản ban đầu.
Qwen Max-class đầu tiên với trọng số mở
Đây là động thái chiến lược lớn nhất của bản phát hành này. Alibaba đã mở mã nguồn nhiều mô hình Qwen trong nhiều năm, nhưng chưa bao giờ là cấp Max. Qwen 3.8-Max phá vỡ khuôn mẫu đó: công ty cho biết trọng số sẽ có mặt trên Hugging Face và ModelScope “tuần tới,” tức là khoảng ngày 10 tháng 8.
Hai lưu ý, được nêu rõ ràng:
- Trọng số chưa thể tải xuống. Tính đến đầu tháng 8 năm 2026, lời hứa vẫn chỉ là lời hứa. Kimi K3 đã tạo tiền lệ gần đây: trọng số của nó đến 11 ngày sau khi ra mắt, vì vậy một sự chậm trễ nhỏ sẽ không gây ngạc nhiên.
- Tự lưu trữ một mô hình 2.4T là một dự án đa node. Ngay cả khi được lượng tử hóa mạnh mẽ, đây không phải là thứ bạn có thể chạy trên một máy trạm. Đối với hầu hết các nhóm, “trọng số mở” sẽ có nghĩa là truy cập lưu trữ rẻ hơn thông qua các nhà cung cấp bên thứ ba chứ không phải triển khai cục bộ.
Nếu sự quan tâm của bạn đến Qwen 3.8-Max chủ yếu là để không phải trả giá niêm yết, các cách tiếp cận thực tế hiện tại là Qwen Chat và hạn mức miễn phí của Model Studio, cả hai đều được đề cập trong hướng dẫn sử dụng Qwen 3.8 miễn phí của chúng tôi.
Các điểm chuẩn cho thấy điều gì, bao gồm cả những điểm yếu
Alibaba đã công bố một bảng điểm chuẩn đầy đủ so sánh Qwen 3.8-Max với Claude Opus 4.8, Fable 5, GPT-5.6 Sol và Qwen3.7-Max. Hai tiết lộ trước bất kỳ con số nào: đây là kết quả do nhà cung cấp tự thực hiện, và hầu hết các hàng mã hóa được chạy bằng công cụ Claude Code cho tất cả các mô hình. Một số điểm chuẩn (QwenSWEBench, QwenQoderBench, CoWorkBench, RecreationBench) là sản phẩm tự tạo của Alibaba. Không có số liệu độc lập nào từ các tổ chức như Artificial Analysis tồn tại vào thời điểm viết bài.
Với bối cảnh đó, các hàng nổi bật theo bảng của Alibaba:
Nơi nó giành chiến thắng:
- PaperBench: 93.0, kết quả flagship tốt nhất của nó, vượt trội so với GPT-5.6 Sol (90.5), Fable 5 (88.8) và Opus 4.8 (80.3)
- IFBench: 82.8, điểm số cao nhất trong hàng, vượt trội so với 72.7 của Sol
- Terminal Bench 2.1: 86.6, đánh bại Opus 4.8 và Fable 5 (cả hai đều 84.6), chỉ đứng sau Sol (88.8)
- Đa phương thức là thế mạnh lớn nhất của nó: MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1, và các hàng OCR dẫn đầu gần như mọi thứ trong bảng
Nơi nó thua cuộc:
- SWE-bench Pro: 67.7, kém xa 80.0 của Fable 5 và hơi kém 69.2 của Opus 4.8 (nhưng nó vẫn đánh bại 64.6 của Sol)
- HLE: 43.6, điểm số flagship yếu nhất trong hàng; Fable 5 đạt 53.3, Sol 47.2 và Opus 4.8 45.7
Tóm tắt thẳng thắn: theo số liệu của Alibaba, Qwen 3.8-Max đánh bại Opus 4.8 ở một số hàng liên quan đến tác tử, kém Fable 5 ở hầu hết các công việc mã hóa cốt lõi, và thắng lớn ở khả năng đa phương thức và xử lý tài liệu thông minh. Trên GPQA Diamond, nó đạt 92.6, ngang với Fable 5 và chỉ đứng sau 94.1 của Sol, vì vậy khả năng lập luận khoa học thô là cạnh tranh. Để xem chi tiết bảng đầy đủ, bao gồm cả những chi tiết nhỏ của công cụ và những xác minh độc lập cần chú ý, hãy xem phân tích điểm chuẩn Qwen 3.8 của chúng tôi.
Alibaba cũng đã công bố một loạt các màn trình diễn: một phiên mã hóa tự động kéo dài 16 ngày trên một kho lưu trữ công khai (265 commit, 127 yêu cầu kéo), một lượt tái tạo bài báo đánh bại kết quả AIME24 của bài báo gốc, và một mục dự thi Tianchi đã vượt trội hơn 458 trong số 526 đội người trong 24 giờ. Đây là các bản demo của chính nhà cung cấp, vì vậy hãy đọc chúng như các quảng cáo về khả năng hơn là các đánh giá có kiểm soát. Câu chuyện mã hóa, bao gồm cách tái tạo các thiết lập công cụ, được xử lý chi tiết trong Qwen 3.8 cho mã hóa.
Vị trí của nó so với Kimi K3, Fable 5 và GPT-5.6 Sol
So với Kimi K3. Đây là sự cạnh tranh tự nhiên: hai phòng thí nghiệm Trung Quốc, hai mô hình MoE khổng lồ có trọng số mở, được phát hành cách nhau vài tuần. K3 lớn hơn (tổng 2.8T, 104B hoạt động so với 2.4T/95B), chỉ xử lý văn bản trong khi Qwen là đa phương thức, và trọng số của nó đã được công bố trong khi của Qwen vẫn chỉ là lời hứa. Giá cả cũng khác biệt rõ rệt: K3 tính phí $3 đầu vào/$15 đầu ra với $0.30 cho các lượt cache hit, so với mức cố định $2/$6 của Qwen. Chưa có đánh giá trực tiếp đối đầu nào tồn tại; mỗi nhà cung cấp đều công bố bảng của riêng mình. Chúng tôi so sánh chúng từng hàng một trong Qwen 3.8 vs Kimi K3, và nếu bạn mới làm quen với mô hình của Moonshot, hãy bắt đầu với Kimi K3 là gì.
So với Fable 5. Mô hình flagship của Anthropic vẫn là điểm chuẩn về mã hóa cần vượt qua, và Qwen 3.8-Max không đánh bại được nó: SWE-bench Pro (67.7 so với 80.0) và HLE (43.6 so với 53.3) là những khoảng cách rõ ràng, theo bảng của Alibaba. Những gì Qwen mang lại thay vào đó là giá (một phần nhỏ so với mức giá cao cấp), ngữ cảnh 1M, trọng số mở đang trên đường đến và các hàng đa phương thức mạnh hơn.
So với GPT-5.6 Sol. Sol giành chiến thắng ở Terminal Bench (88.8 so với 86.6), GPQA (94.1 so với 92.6) và HLE (47.2 so với 43.6), trong khi Qwen 3.8-Max thắng ở PaperBench (93.0 so với 90.5) và IFBench (82.8 so với 72.7). Về giá, $2/$6 của Qwen thấp hơn $2/$12 của GPT-5.6 Terra về đầu ra, và quyền truy cập cấp Sol còn đắt hơn nữa.
Một điểm so sánh nữa: Claude Opus 5 có giá niêm yết $5/$25. Dù bạn đánh giá bảng của nhà cung cấp thế nào, Alibaba đang định giá mẫu flagship của mình ở một mức thay đổi đáng kể tính toán chi phí cho các khối lượng công việc lớn.
Giá: $2/$6, cố định trên 1 triệu token
Mức giá đủ đơn giản để nêu trong một câu: $2 cho mỗi triệu token đầu vào, $6 cho mỗi triệu token đầu ra, một mức giá cố định từ token đầu tiên đến giới hạn ngữ cảnh 1M, dù ở chế độ suy nghĩ hay không.
Mức giá cố định là phần khác thường. Hầu hết các mô hình ngữ cảnh dài đều tăng giá khi lời nhắc của bạn dài ra; Qwen 3.8-Max thì không. Nó cũng ra mắt rẻ hơn giá niêm yết $2.5/$7.5 của Qwen3.7-Max, mặc dù mô hình cũ hơn đó hiện đang có chương trình khuyến mãi 50% ($1.25/$3.75), điều này giữ cho nó vẫn phù hợp như một lựa chọn có giá trị.
Bộ nhớ đệm ngữ cảnh làm cho các khối lượng công việc có tiền tố lặp lại trở nên hấp dẫn hơn: các lần truy cập bộ nhớ đệm (cache hits) được tính phí bằng 10% mức giá đầu vào, và việc tạo bộ nhớ đệm rõ ràng tốn 125%. Cũng có một hạn mức miễn phí (1 triệu token, chỉ dành cho khu vực Singapore, có giá trị trong 90 ngày) để dùng thử. Phân tích chi phí đầy đủ, với các ví dụ cụ thể cho từng tác vụ và định lượng chi phí ẩn của token suy nghĩ, có trong hướng dẫn giá Qwen 3.8 của chúng tôi.
Cách truy cập Qwen 3.8-Max
Ma trận truy cập rộng hơn một lần ra mắt thông thường. Năm cách:
1. Qwen Chat. Ứng dụng dành cho người dùng, không cần khóa API. Cách nhanh nhất để có cái nhìn tổng quan.
2. API trên Alibaba Cloud Model Studio (DashScope). Lấy khóa từ home.qwencloud.com, đặt DASHSCOPE_API_KEY, và gọi ID mô hình qwen3.8-max thông qua các điểm cuối chat-completions hoặc responses tương thích OpenAI. Ba URL cơ sở khu vực đang hoạt động: Bắc Kinh (dashscope.aliyuncs.com/compatible-mode/v1), Singapore (dashscope-intl.aliyuncs.com/compatible-mode/v1) và US-Virginia (dashscope-us.aliyuncs.com/compatible-mode/v1). Trang mô hình Model Studio liệt kê nó ở đầu danh sách đề xuất.
3. Điểm cuối tương thích Anthropic. Đây là điểm khác biệt thực sự độc đáo: https://dashscope-intl.aliyuncs.com/apps/anthropic sử dụng giao thức Anthropic Messages, vì vậy các công cụ được xây dựng cho Claude có thể trỏ đến Qwen với hai biến môi trường.
4. Công cụ mã hóa (Coding harnesses). Alibaba đã công bố các cấu hình chính thức cho năm tác tử: Claude Code (thông qua ANTHROPIC_BASE_URL cộng với ANTHROPIC_MODEL=qwen3.8-max), Codex, Qoder, Qwen Code và OpenClaw. Điều đáng chú ý là Alibaba đã chạy hầu hết các điểm chuẩn mã hóa của mình bên trong công cụ Claude Code, vì vậy cấu hình mà họ công bố cũng chính là cấu hình đằng sau các con số của họ.
5. Trọng số mở, sớm thôi. Hugging Face và ModelScope, đã hứa trong tuần tới, chưa thể tải xuống tính đến đầu tháng 8 năm 2026.
Chi tiết cài đặt cho các cách 2 đến 4, với các đoạn mã Python và cURL có thể sao chép, có trong hướng dẫn API Qwen 3.8 của chúng tôi.
Kiểm tra API hai giao thức
Việc cùng một mô hình trả lời trên hai dạng giao thức khác nhau tạo ra một câu hỏi kiểm thử thực tế: liệu yêu cầu của bạn có hoạt động giống hệt trên cả hai không? Đây là lúc một client API phát huy tác dụng. Trong Apidog, bạn có thể lưu ba URL cơ sở khu vực làm môi trường và chuyển đổi khu vực mà không cần chỉnh sửa yêu cầu, gửi cùng một lời nhắc thông qua điểm cuối tương thích OpenAI và điểm cuối giao thức Anthropic song song, và kiểm tra luồng SSE để xem các thay đổi reasoning_content đến trước câu trả lời cuối cùng. Phần cuối cùng đó hữu ích để xác minh lượng suy nghĩ mà chế độ mặc định xhigh thực sự tạo ra, vì các token đó sẽ được tính vào hóa đơn của bạn dưới dạng đầu ra. Tải xuống Apidog miễn phí nếu bạn muốn làm theo khi kết nối các điểm cuối; cùng một không gian làm việc cũng giúp dễ dàng A/B qwen3.8-max so với qwen3.7-max hoặc kimi-k3 trên các lời nhắc giống hệt trước khi bạn cam kết một khối lượng công việc.
Vị trí của Qwen 3.8-Max trong danh mục sản phẩm
Nếu bạn đang hình dung về dòng sản phẩm lớn hơn, Qwen 3.8-Max hiện đứng trên Qwen3.7-Max và các mô hình cấp plus, và hướng dẫn về các mô hình Qwen tốt nhất của chúng tôi đề cập đến cấp độ nào phù hợp với khối lượng công việc nào. Tóm lại: 3.8-Max là lựa chọn khi bạn cần khả năng đa phương thức và tác tử tối đa, 3.7-Max với ưu đãi 50% là flagship giá trị khi khuyến mãi còn hiệu lực, và các mô hình plus vẫn là những cỗ máy làm việc giá rẻ cho các tác vụ thường ngày.
Câu hỏi thường gặp
Qwen 3.8 có phải là mã nguồn mở không?
Chưa, nhưng rất gần. Alibaba đã hứa trọng số sẽ có trên Hugging Face và ModelScope “tuần tới” kể từ khi ra mắt vào đầu tháng 8 năm 2026, điều này sẽ biến nó thành Qwen Max-class đầu tiên với trọng số mở. Hiện tại chưa có gì có thể tải xuống. Cho đến lúc đó, quyền truy cập thông qua API hoặc Qwen Chat; xem cách sử dụng Qwen 3.8 miễn phí để biết các cách không tốn phí.
Qwen 3.8-Max có giá bao nhiêu?
$2 cho mỗi triệu token đầu vào và $6 cho mỗi triệu token đầu ra, ở một mức giá cố định trên toàn bộ ngữ cảnh 1M. Các lần truy cập bộ nhớ đệm được tính phí bằng 10% giá đầu vào. Các token suy nghĩ được tính phí là đầu ra, và nỗ lực lập luận mặc định là xhigh, vì vậy hãy dự trù ngân sách cao hơn giá niêm yết cho các công việc cần nhiều lập luận.
Qwen 3.8-Max có tốt hơn Kimi K3 không?
Hiện chưa có đánh giá trực tiếp đối đầu nào; cả hai nhà cung cấp đều công bố bảng của riêng mình. Trên lý thuyết, Qwen 3.8-Max nhỏ hơn (2.4T/95B hoạt động so với 2.8T/104B), đa phương thức trong khi K3 chỉ xử lý văn bản, và rẻ hơn về đầu ra ($6 so với $15). Lợi thế của K3 hiện tại là trọng số của nó đã được công khai.
Tôi có thể sử dụng Qwen 3.8-Max trong Claude Code không?
Có. Alibaba đã công bố một cấu hình chính thức: trỏ ANTHROPIC_BASE_URL đến điểm cuối DashScope tương thích Anthropic và đặt ANTHROPIC_MODEL=qwen3.8-max. Codex, Qoder, Qwen Code và OpenClaw cũng có các cấu hình chính thức.
Những việc cần làm tiếp theo
Qwen 3.8-Max là một bản phát hành flagship thực sự, không phải bản xem trước cho báo chí: đã GA trên ba khu vực API, giá đã công bố, một bảng điểm chuẩn đầy đủ (do nhà cung cấp thực hiện) với thắng thua, và trọng số mở sẽ sớm ra mắt. Nhận định thẳng thắn là nó không hạ bệ Fable 5 về mã hóa cốt lõi, nhưng nó đánh bại Opus 4.8 ở một số hàng liên quan đến tác tử, dẫn đầu về công việc tài liệu và đa phương thức, và có giá $2/$6 khi làm điều đó.
Động thái hợp lý là kiểm tra nó với khối lượng công việc của riêng bạn thay vì dựa vào bảng của bất kỳ ai. Lấy hạn mức miễn phí, kết nối cả hai điểm cuối giao thức và so sánh kết quả trên các lời nhắc bạn thực sự chạy. Bắt đầu với hướng dẫn thiết lập API, và kiểm tra lại khoảng ngày 10 tháng 8 để xem liệu trọng số đã được phát hành đúng lịch trình hay chưa.
