Alibaba đã phát hành Qwen 3.8-Max vào đầu tháng 8 năm 2026, và các kết quả tìm kiếm đã tràn ngập những tuyên bố "sử dụng miễn phí mãi mãi" mà thực tế không đúng với các điều khoản. Dưới đây là phiên bản trung thực, được kiểm tra dựa trên các trang của Alibaba tính đến ngày 3 tháng 8 năm 2026.
Có chính xác bốn cách đáng để bạn quan tâm. Hai cách hoạt động ngay hôm nay. Một là lời hứa có kèm ngày cụ thể. Một là phương án dự phòng. Nếu bạn muốn có cái nhìn toàn diện về mô hình trước tiên (tổng cộng 2.4 nghìn tỷ tham số, 95B hoạt động, ngữ cảnh 1M token), hãy bắt đầu với tổng quan về Qwen 3.8 của chúng tôi và quay lại đây sau.
Bản đồ nhanh trước khi đi vào chi tiết:
| Cách thức | Miễn phí? | Hoạt động hôm nay? | Lưu ý |
|---|---|---|---|
| Qwen Chat | Có | Có | Ứng dụng người dùng, không có API |
| Hạn mức API Model Studio | 1M token | Có | Chỉ ở khu vực Singapore, 90 ngày |
| Trọng số mở (tự lưu trữ) | Trọng số miễn phí | Chưa | Hứa hẹn "tuần tới", phần cứng không miễn phí |
| Các mô hình Qwen cũ hơn | Có | Có | Không phải Qwen 3.8 |
Cách 1: Qwen Chat, tùy chọn không cần cài đặt
Cách miễn phí nhanh nhất là cách mà Alibaba muốn người dùng sử dụng: Qwen Chat. Đăng nhập, chọn mô hình, và bạn có thể trò chuyện với Qwen 3.8-Max mà không cần thẻ tín dụng hay bảng điều khiển đám mây. Bài đăng ra mắt chính thức giới thiệu đây là cách mặc định để dùng thử mô hình.

Bạn nhận được gì: sử dụng miễn phí mô hình hàng đầu thông qua giao diện trò chuyện, bao gồm khả năng hiểu hình ảnh và tài liệu mà các bản demo ra mắt đã thể hiện.
Bạn không nhận được gì: một API. Không có khóa, không có tự động hóa, không có cách nào để tích hợp nó vào ứng dụng hoặc bộ kiểm thử của bạn. Các ứng dụng trò chuyện cũng áp dụng các lời nhắc hệ thống và cài đặt riêng, vì vậy hành vi bạn thấy ở đó sẽ không hoàn toàn khớp với những gì API thô trả về. Nếu bạn đang đánh giá Qwen 3.8 cho một sản phẩm, hãy coi Qwen Chat như một bản demo, không phải một tiêu chuẩn.
Kết luận: thật, miễn phí và tốt để thử nghiệm. Không phải là lựa chọn cho nhà phát triển.
Cách 2: Hạn mức miễn phí của Model Studio (đọc kỹ các điều khoản)
Đây là cách quan trọng nếu bạn viết code. Alibaba Cloud Model Studio cung cấp cho các tài khoản mới một hạn mức miễn phí cho qwen3.8-max: 1 triệu token. Đây là một lượng token thực sự hữu ích, nhưng nó cũng đi kèm với các điều khoản nhỏ mà hầu hết các bài tổng hợp thường bỏ qua.
Đây là những gì trang giá thực sự nói, được dịch thành các quyết định:
1. Chỉ ở khu vực Singapore. Hạn mức miễn phí áp dụng cho khu vực Singapore (quốc tế). Điều đó có nghĩa là URL cơ sở của bạn là:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Nếu bạn trỏ đến các điểm cuối ở Bắc Kinh hoặc US-Virginia, bạn sẽ phải trả tiền ngay từ token đầu tiên. Nếu yêu cầu về độ trễ của bạn đòi hỏi một điểm cuối ở Mỹ, hạn mức miễn phí này sẽ không giúp ích được gì.
2. 90 ngày, sau đó hết hạn. Hạn mức có hiệu lực trong 90 ngày kể từ khi kích hoạt. Các token chưa sử dụng sẽ không được cộng dồn; chúng sẽ hết hạn. Đồng hồ đã bắt đầu chạy kể từ khi mô hình ra mắt vào đầu tháng 8, vì vậy đừng kích hoạt bây giờ và lên kế hoạch đánh giá vào tháng 11.
3. Sau khi hết hạn mức: $2 đầu vào / $6 đầu ra cho mỗi triệu token. Đó là mức giá cố định trên toàn bộ ngữ cảnh 1M, không phân cấp. Mức giá này rẻ đối với một mô hình hàng đầu, nhưng nó không miễn phí, và quá trình chuyển đổi là tự động ngay khi hạn mức của bạn cạn kiệt hoặc hết hạn. Hãy thiết lập cảnh báo thanh toán trước khi bắt đầu. Chúng tôi sẽ phân tích chi phí cho các khối lượng công việc thực tế trong hướng dẫn định giá Qwen 3.8 của chúng tôi.
Để nhận hạn mức: tạo tài khoản tại Model Studio, kích hoạt dịch vụ và tạo khóa API (quy ước biến môi trường là DASHSCOPE_API_KEY). Danh mục mô hình liệt kê qwen3.8-max ở đầu các mô hình được khuyến nghị. Điểm cuối tương thích với giao thức OpenAI, và cũng có một điểm cuối tương thích với Anthropic. Hướng dẫn API Qwen 3.8 của chúng tôi bao gồm cả hai, với tính năng streaming và output suy luận.
Một cái bẫy tiêu tốn hạn mức: suy luận được bật theo mặc định
Qwen 3.8-Max được cài đặt reasoning_effort ở mức xhigh, và các token suy luận được tính phí như output. Một lời nhắc phức tạp duy nhất có thể ngầm tạo ra hàng nghìn token suy luận trước khi câu trả lời bắt đầu. Đối với tài khoản trả phí, đó là một khoản chi phí; đối với hạn mức miễn phí 1M, đó là sự khác biệt giữa hai tuần thử nghiệm và hai ngày. Hãy giảm reasoning_effort xuống low hoặc medium cho bất kỳ tác vụ nào không phải là tác vụ suy luận thực sự.
Giữ cho triệu token tồn tại lâu hơn
Một triệu token biến mất rất nhanh khi mỗi lần lặp gỡ lỗi lại gửi lại toàn bộ chuỗi lời nhắc của bạn. Một vài thói quen giúp kéo dài thời gian sử dụng:
- Sửa yêu cầu đúng trước khi lặp lại. Xây dựng lệnh gọi trong Apidog, điều chỉnh các tham số và kiểm tra phản hồi stream, bao gồm các thay đổi suy luận, từng yêu cầu một. Gỡ lỗi tương tác trong một client tốt hơn là đốt hạn mức bằng một vòng lặp thử lại trong mã ứng dụng của bạn.
- Giả lập những gì bạn đã thấy. Khi bạn biết cấu trúc phản hồi, hãy lưu một ví dụ và để máy chủ giả lập của Apidog phục vụ nó cho giao diện người dùng hoặc tác nhân của bạn trong khi bạn xây dựng. Các lần lặp phát triển với một bản giả lập không tốn token nào; bạn chỉ truy cập điểm cuối thực tế để xác minh cuối cùng.
- Theo dõi mức sử dụng thực tế của bạn. Số lượng token được trả về trong mỗi phản hồi. Hãy theo dõi chúng trên mỗi yêu cầu, và bạn sẽ biết tốc độ tiêu thụ thực tế của mình thay vì phát hiện ra khi hạn mức hết giữa chừng.
Tải xuống Apidog miễn phí nếu bạn muốn thực hiện quy trình này; nó cũng giúp việc chuyển đổi khu vực trở nên dễ dàng, vì bạn có thể lưu trữ các URL cơ sở Singapore, Bắc Kinh và Mỹ dưới dạng các môi trường và chuyển đổi giữa chúng.
Kết luận: thật, miễn phí trong 90 ngày, và là cách tốt nhất cho nhà phát triển hiện nay. Chỉ cần tôn trọng khóa khu vực và ngày hết hạn.
Cách 3: Trọng số mở, được hứa hẹn nhưng chưa thể tải xuống
Tiêu đề lớn nhất của đợt ra mắt cho những người yêu thích miễn phí: Qwen 3.8-Max là mô hình đầu tiên thuộc lớp Qwen-Max có trọng số mở. Alibaba nói rằng các trọng số sẽ có mặt trên Hugging Face và ModelScope "tuần tới," tức là khoảng ngày 10 tháng 8.
Tính đến ngày 3 tháng 8 năm 2026, chúng chưa thể tải xuống. Không có gì để kéo về, không có gì để lượng tử hóa, không có gì để chạy. Nếu bạn thấy một hướng dẫn "chạy Qwen 3.8 cục bộ ngay hôm nay" có ngày trước khi các trọng số thực sự tồn tại, hãy đóng tab đó đi. Để tham khảo, Kimi K3 cũng đưa ra lời hứa về trọng số mở tương tự khi ra mắt và đã thực hiện 11 ngày sau đó, vì vậy dòng thời gian này là có thể. Nó chỉ là chưa xảy ra thôi.
Kiểm tra thực tế tự lưu trữ
Ngay cả khi các trọng số được phát hành, "miễn phí" cần một dấu hoa thị lớn bằng một giá đỡ máy chủ. Qwen 3.8-Max có tổng cộng 2.4 nghìn tỷ tham số. Tiền lệ gần nhất là Kimi K3: một mô hình 2.8T tham số được phát hành với 594 GB trọng số ngay cả với lượng tử hóa MXFP4 mạnh. Giảm nhẹ con số đó cho Qwen 2.4T và bạn vẫn đang xem xét hàng trăm gigabyte trọng số và một thiết lập phục vụ đa GPU, thực tế là đa nút. Không có GPU tiêu dùng nào có thể chứa được điều này. Không có một máy trạm đơn lẻ nào có thể chứa được điều này. Chúng tôi đã xem xét chính xác loại phần cứng đó trông như thế nào để chạy Kimi K3 cục bộ, và các tính toán kinh tế áp dụng ở đây không thay đổi.
Vậy trọng số mở thực sự mang lại cho bạn điều gì? Chủ yếu là điều này: một khi các trọng số được công khai, các nhà cung cấp bên thứ ba có thể phục vụ mô hình, và cạnh tranh có xu hướng đẩy giá dịch vụ xuống dưới mức giá của bên phát hành. Đối với hầu hết độc giả, "trọng số mở miễn phí" sẽ chuyển thành quyền truy cập API rẻ hơn thông qua các nhà cung cấp dịch vụ lưu trữ, chứ không phải một mô hình chạy trên máy tính xách tay của bạn. Đó vẫn là một chiến thắng. Nó chỉ là một chiến thắng khác so với những gì cụm từ này gợi ý.
Kết luận: chưa có thật. Hãy kiểm tra lại vào giữa tháng 8, và dành ngân sách cho dịch vụ lưu trữ, không phải phần cứng.
Cách 4: Phương án dự phòng, các mô hình Qwen cũ hơn hoàn toàn miễn phí
Nếu điều bạn cần là "một mô hình Qwen có năng lực với chi phí bằng không" thay vì "đặc biệt là Qwen 3.8-Max," thì thế hệ trước có các cách miễn phí không hết hạn trong 90 ngày. Các mô hình Qwen trọng số mở nhỏ hơn đã chạy trên phần cứng mà mọi người thực sự sở hữu, và dòng sản phẩm cũ hơn có các con đường truy cập miễn phí riêng. Chúng tôi có một hướng dẫn riêng về cách sử dụng Qwen 3.7 miễn phí luôn cập nhật các tùy chọn đó.
Sự đánh đổi trung thực: bạn từ bỏ những cải tiến về hiệu suất đã làm nên tin tức cho 3.8-Max. Đối với một dự án nhỏ, một bộ phân loại, hoặc học cách sử dụng API của Qwen trước khi chi tiền, các mô hình cũ hơn thường là đủ.
Những gì không có thật
Để giúp bạn tiết kiệm thời gian tìm kiếm, đây là những điều không tồn tại tính đến ngày 3 tháng 8 năm 2026:
- Không có bậc API miễn phí không giới hạn. Hạn mức 1M token là tất cả, và nó sẽ hết hạn.
- Không có bậc miễn phí bên ngoài Singapore. Các điểm cuối ở Bắc Kinh và US-Virginia sẽ tính phí ngay từ token đầu tiên.
- Chưa có trọng số để tải xuống. "Tuần tới" là một lời hứa, không phải một liên kết.
- Không có Qwen 3.8 miễn phí chính thức trên các nền tảng tổng hợp của bên thứ ba. Quyền truy cập thông qua bên thứ ba có thể sẽ xuất hiện sau khi các trọng số được phát hành; bất cứ điều gì trước đó tuyên bố là 3.8-Max miễn phí đều đáng nghi ngờ về mô hình thực sự đằng sau nó.
Câu hỏi thường gặp
API của Qwen 3.8 có thực sự miễn phí không?
Một phần. Bạn nhận được 1 triệu token miễn phí thông qua Alibaba Cloud Model Studio, có giá trị trong 90 ngày và chỉ ở khu vực Singapore. Sau đó, mức giá là 2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra, vì vậy hãy lên kế hoạch đánh giá của bạn trong vòng 90 ngày.
Tôi có thể tải xuống và chạy Qwen 3.8 cục bộ ngay bây giờ không?
Không. Các trọng số được hứa hẹn sẽ có trên Hugging Face và ModelScope vào khoảng ngày 10 tháng 8 năm 2026, và chưa được phát hành tại thời điểm viết bài này. Khi chúng được phát hành, hãy chuẩn bị cho hàng trăm gigabyte và thiết lập phục vụ đa GPU; đây là một mô hình 2.4T tham số, không phải thứ mà một máy tính xách tay có thể chạy.
Điều này khác với các tùy chọn miễn phí của Kimi K3 như thế nào?
Trọng số của Kimi K3 đã có sẵn và có thể tải xuống, vì vậy cách tự lưu trữ của nó là có thật ngay hôm nay, trong khi của Qwen 3.8 vẫn đang chờ. Tuy nhiên, cả hai đều quá lớn đối với phần cứng tiêu dùng. Hướng dẫn của chúng tôi về cách sử dụng Kimi K3 miễn phí đề cập đến các cách thức của mô hình đó nếu bạn muốn so sánh.
Hạn mức miễn phí có bao gồm token suy luận không?
Có, nhưng chúng làm cạn kiệt hạn mức. Output suy luận được tính phí như output thông thường, và reasoning_effort mặc định là xhigh. Hãy giảm nó xuống cho các lệnh gọi thông thường nếu không hạn mức của bạn sẽ biến mất vào chuỗi suy luận mà bạn không bao giờ đọc.
Điểm mấu chốt
Truy cập Qwen 3.8 miễn phí là có thật, nhưng nó cụ thể: Qwen Chat cho mục đích sử dụng thông thường, và 1M token ở khu vực Singapore với thời hạn 90 ngày cho các nhà phát triển. Cách trọng số mở chỉ còn vài ngày nữa trên lý thuyết và trong thực tế chủ yếu sẽ có nghĩa là quyền truy cập lưu trữ rẻ hơn. Mọi thứ ngoài ra đều là mô hình cũ hơn hoặc những bài viết blog mang tính mơ mộng.
Nếu bạn chọn cách API, hãy sử dụng hạn mức của bạn để nhận câu trả lời, không phải để gỡ lỗi. Tạo mẫu các yêu cầu trong Apidog, giả lập các phản hồi trong khi bạn xây dựng, và tiết kiệm các token trực tiếp cho các lần chạy đánh giá mà thực sự cho bạn biết liệu Qwen 3.8-Max có xứng đáng có một vị trí trong hệ thống của bạn hay không.
