Qwen 3.8 Giải thích giá: 2 USD Đầu vào / 6 USD Đầu ra trên Ngữ cảnh 1M

Giá của Qwen 3.8 khi ra mắt chính thức: 2 đô la đầu vào / 6 đô la đầu ra cho mỗi 1 triệu token, áp dụng đồng nhất trên toàn bộ 1 triệu ngữ cảnh. Các khoản giảm giá bộ nhớ đệm, các điều khoản chi tiết về hạn mức miễn phí và các tính toán chi phí cụ thể.

INEZA Felin-Michel

INEZA Felin-Michel

3 tháng 8 2026

Qwen 3.8 Giải thích giá: 2 USD Đầu vào / 6 USD Đầu ra trên Ngữ cảnh 1M

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Alibaba đã phát hành Qwen 3.8-Max vào đầu tháng 8 năm 2026, và câu hỏi về giá cả cuối cùng đã có một câu trả lời thực sự. Trong thời gian xem trước vào tháng 7, câu chuyện được lan truyền là một chương trình khuyến mãi "giá xem trước 10%". Câu chuyện đó đã kết thúc. Tại thời điểm phát hành rộng rãi, trang giá chính thức của Model Studio liệt kê qwen3.8-max với giá 2 đô la cho 1M token đầu vào và 6 đô la cho 1M token đầu ra, một mức giá cố định bao gồm toàn bộ cửa sổ ngữ cảnh 1M token.

Mức giá cố định đó là phần thú vị. Hầu hết các mô hình tiên tiến đều tính phí cao hơn trên mỗi token khi lời nhắc của bạn vượt qua một ngưỡng ngữ cảnh nhất định. Qwen 3.8-Max thì không: gửi 5.000 token hay 900.000 token, mức giá vẫn là 2 đô la/6 đô la.

Bài viết này bao gồm toàn bộ bức tranh: thiết kế mức giá cố định, so sánh với Qwen 3.7-Max, Kimi K3, Claude Opus 5 và GPT-5.6 Terra, các khoản giảm giá khi sử dụng bộ nhớ cache, các điều khoản nhỏ về hạn mức miễn phí, và các ví dụ về chi phí được tính toán cụ thể. Để có cái nhìn tổng quan rộng hơn về mô hình, hãy bắt đầu với Qwen 3.8 là gì và tại sao nó lại quan trọng, sau đó quay lại để xem các con số.

Một lưu ý đầu tiên: giá niêm yết chỉ cho bạn một ước tính. Qwen 3.8-Max được vận chuyển với khả năng suy luận ở mức độ nỗ lực xhigh theo mặc định, và các token suy nghĩ được tính phí như token đầu ra. Cách đáng tin cậy để dự đoán chi phí là gửi các yêu cầu thực tế và đo lường mức sử dụng token. Apidog hiển thị toàn bộ phân tích token của mọi phản hồi trong khi bạn kiểm tra, điều này biến việc ước tính chi phí thành phép tính số học. Chi tiết hơn về điều đó bên dưới.

Con số GA: $2 đầu vào, $6 đầu ra, một mức giá

Đây là bảng giá chính thức cho qwen3.8-max, đã được xác minh trên trang giá của Model Studio tính đến ngày 3 tháng 8 năm 2026:

Mục Giá (mỗi 1M token)
Đầu vào $2.00
Đầu ra (bao gồm token suy nghĩ) $6.00
Đầu vào được lưu trữ (cache hit) 10% của giá đầu vào
Tạo cache rõ ràng 125% của giá đầu vào
Cấp độ ngữ cảnh Một cấp độ duy nhất, từ 0 đến 1M token
Suy nghĩ so với không suy nghĩ Được tính phí như nhau

Ba chi tiết đáng chú ý: cửa sổ ngữ cảnh 1M được bao phủ hoàn toàn bởi một mức giá, không có phụ phí cho lời nhắc dài. Các chế độ suy nghĩ và không suy nghĩ có cùng mức giá, mặc dù các token suy nghĩ được tính là đầu ra (xem phần trung thực bên dưới). Và đầu ra tối đa là 65.536 token cho mỗi yêu cầu, vì vậy một phản hồi duy nhất tối đa sẽ tính phí khoảng 0.39 đô la cho đầu ra.

Thông báo chính thức của Qwen 3.8 định vị mô hình này là mô hình mạnh mẽ nhất của Alibaba cho đến nay: tổng cộng 2.4T tham số với 95B đang hoạt động, cửa sổ ngữ cảnh 1M token, đầu vào đa phương thức. Có được điều đó với giá 2 đô la/6 đô la làm giảm giá của hầu hết các mô hình hàng đầu, bao gồm cả mô hình hàng đầu trước đây của Alibaba.

Tại sao giá cố định cho 1M token là điều bất thường

Định giá ngữ cảnh theo cấp độ là tiêu chuẩn ngành: một mức giá dưới một ngưỡng ngữ cảnh, một mức giá cao hơn trên ngưỡng đó, vì ngữ cảnh dài tốn nhiều chi phí hơn để phục vụ.

Alibaba cũng tự mình làm điều này. Trên cùng trang giá của Model Studio, các mô hình như qwen3-max và qwen3-coder-plus được định giá theo cấp độ độ dài ngữ cảnh, với mức giá mỗi token tăng lên khi đầu vào tăng. Qwen 3.8-Max phá vỡ mô hình đó trong danh mục của chính Alibaba: bảng giá của nó chỉ hiển thị một dòng, "0<Token≤1M", và thế là hết.

Tại sao điều này quan trọng: với định giá theo cấp độ, khối lượng công việc ngữ cảnh dài mang một hệ số nhân ẩn. Một quy trình RAG đôi khi nhồi nhét 300K token tài liệu vào một lời nhắc có thể tốn gấp mấy lần mức giá thông thường cho các yêu cầu đó. Với Qwen 3.8-Max, token biên luôn có giá như nhau, vì vậy việc lập ngân sách là tuyến tính: token nhân với giá, xong. Đối với phân tích tài liệu dài, các tác nhân cơ sở mã lớn, hoặc các quy trình truy xuất nặng, sự dễ đoán đó có giá trị ngang với mức giá thấp.

Rẻ hơn Qwen 3.7-Max ở giá niêm yết

Qwen 3.8-Max ra mắt với giá thấp hơn giá niêm yết của phiên bản tiền nhiệm, điều này hiếm thấy đối với một thế hệ flagship mới:

Đó là mức giảm 20% ở cả hai phía trong khi mô hình có cửa sổ ngữ cảnh lớn hơn, đầu vào đa phương thức và điểm số benchmark tốt hơn.

Một vấn đề phức tạp: Qwen 3.7-Max hiện đang có chương trình khuyến mãi 50%, giảm giá xuống còn 1.25 đô la/3.75 đô la. Với mức giá khuyến mãi, flagship cũ hơn rẻ hơn mẫu mới. Nếu khối lượng công việc của bạn không cần ngữ cảnh 1M của Qwen 3.8 hoặc các cải tiến đa phương thức và tác nhân của nó, 3.7-Max giảm giá là một lựa chọn giá trị hợp lý trong thời gian khuyến mãi; chỉ cần đừng xây dựng mô hình chi phí của bạn dựa trên khuyến mãi. Xa hơn nữa, Qwen 3.7-Plus vẫn là "ngựa chiến" giá rẻ với 0.4 đô la/1.6 đô la, kèm theo chương trình khuyến mãi 20% của riêng nó.

Phần trung thực: các token suy nghĩ được tính phí là đầu ra

Đây là phần mà hầu hết các bài viết về giá cả thường bỏ qua, và là phần có khả năng làm bạn ngạc nhiên nhất trên hóa đơn.

Qwen 3.8-Max hỗ trợ tham số reasoning_effort với ba cấp độ: xhigh, medium, và low. Mặc định là xhigh, cài đặt mạnh mẽ nhất. Ở chế độ suy nghĩ, mô hình tạo ra các token suy luận nội bộ trước câu trả lời cuối cùng, và các token suy luận đó được tính phí theo mức giá đầu ra 6 đô la, giống như văn bản hiển thị.

Hậu quả: ở cài đặt mặc định, các yêu cầu nặng về suy luận tốn nhiều chi phí hơn so với ước tính "token lời nhắc cộng token trả lời" đơn giản dự đoán. Một phản hồi hiển thị 800 token câu trả lời có thể đã tiêu thụ vài nghìn token suy nghĩ cho một vấn đề khó.

Ba biện pháp giảm nhẹ: giảm reasoning_effort xuống medium hoặc low cho các tác vụ không cần suy luận sâu (phân loại, trích xuất, định dạng); đo lường mức sử dụng thực tế cho từng loại tác vụ trước khi dự kiến chi tiêu hàng tháng, vì đối tượng usage trong mỗi phản hồi báo cáo số lượng thực tế bao gồm suy luận; và đặc biệt chú ý đến token đầu ra, vì đầu ra tốn gấp 3 lần đầu vào ở đây và suy nghĩ làm tăng đầu ra.

Lưu trữ ngữ cảnh: 10% cho lượt truy cập, 125% cho việc tạo

Nếu ứng dụng của bạn gửi lại cùng một tiền tố lời nhắc nhiều lần (một lời nhắc hệ thống dài, một tài liệu ổn định, định nghĩa công cụ), việc lưu trữ ngữ cảnh sẽ thay đổi đáng kể kinh tế học:

Phép toán hòa vốn rất đơn giản. Việc tạo tốn thêm 25% một lần; mỗi lượt truy cập sau đó tiết kiệm 90%. Nếu một tiền tố được sử dụng lại dù chỉ hai lần, việc lưu trữ đã tự trả chi phí. Đối với các tác nhân tần suất cao hoặc các ứng dụng trò chuyện có lời nhắc hệ thống nặng, khoản tiết kiệm sẽ tăng lên nhanh chóng (ví dụ chi tiết bên dưới).

Chi tiết nhỏ về hạn mức miễn phí: 1M token, Singapore, 90 ngày

Model Studio cung cấp một hạn mức miễn phí cho qwen3.8-max, và các chi tiết nhỏ rất quan trọng:

Các token suy nghĩ cũng được trừ vào hạn mức này giống như bất kỳ đầu ra nào khác, vì vậy một vài tá tác vụ suy luận khó ở chế độ xhigh có thể làm cạn kiệt 1M token nhanh hơn bạn mong đợi. Nếu quyền truy cập miễn phí là mục tiêu chính của bạn, chúng tôi đã tổng hợp mọi cách không tốn phí, bao gồm Qwen Chat, trong bài viết cách sử dụng Qwen 3.8 miễn phí.

Giá Qwen 3.8 so sánh như thế nào

Đây là bức tranh hiện tại, sử dụng giá niêm yết cho mỗi 1M token. Các mức giá khuyến mãi được đánh dấu, vì các chương trình khuyến mãi sẽ hết hạn.

Mô hình Đầu vào Đầu ra Ghi chú
Qwen 3.8-Max $2.00 $6.00 Cố định trên ngữ cảnh 1M; lượt truy cập bộ nhớ cache 10%
Qwen 3.7-Max $2.50 $7.50 Hiện đang giảm 50%: $1.25/$3.75 (khuyến mãi)
Qwen 3.7-Plus $0.40 $1.60 Hiện đang giảm 20% (khuyến mãi)
Kimi K3 $3.00 $15.00 Lượt truy cập bộ nhớ cache $0.30
Claude Opus 5 $5.00 $25.00
GPT-5.6 Terra $2.00 $12.00

Đọc bảng:

Giá không phải là chất lượng, và bảng benchmark của nhà cung cấp cũng chỉ là bảng benchmark của nhà cung cấp. Nhưng ở mức giá niêm yết thuần túy, Qwen 3.8-Max là flagship cấp tiên tiến rẻ nhất trong danh sách này.

Ví dụ thực tế: chi phí của các tác vụ thực tế

Giá niêm yết không có nhiều ý nghĩa nếu không có tính toán dựa trên tác vụ. Ba kịch bản, được tính toán ở mức 2 đô la/6 đô la:

Ví dụ 1: một phiên tác nhân 50K token

Một tác vụ tác nhân tiêu thụ 38.000 token đầu vào (hướng dẫn, schema công cụ, kết quả công cụ) và tạo ra 12.000 token đầu ra:

Bây giờ hãy thêm suy luận xhigh mặc định. Giả sử mô hình dành 8.000 token suy nghĩ trong suốt quá trình chạy. Đầu ra trở thành 20.000 token: 20.000 × 6 đô la / 1.000.000 = 0.12 đô la, và tổng cộng phiên là khoảng 0.20 đô la. Đó là mức tăng 33% chỉ từ suy luận, đó chính xác là lý do tại sao bạn đo lường trước khi lập ngân sách.

Ví dụ 2: phân tích tài liệu dài với 800K token

Bạn tải 800.000 token tài liệu vào ngữ cảnh và yêu cầu một bản tóm tắt có cấu trúc 5.000 token:

Mức giá cố định đang phát huy tác dụng ở đây. Mỗi 800K token đó đều có giá 2 đô la/1M như ngàn token đầu tiên. Trên một mô hình phân cấp, đây chính xác là hình dạng yêu cầu kích hoạt khung giá đắt đỏ.

Ví dụ 3: một lời nhắc hệ thống 100K token được lưu vào bộ nhớ cache, 50 lượt gọi mỗi ngày

Ứng dụng của bạn tải trước 100.000 token lời nhắc hệ thống, tài liệu sản phẩm và định nghĩa công cụ trong mỗi lần gọi, 50 lần một ngày.

Không có bộ nhớ đệm: 100.000 × 2 đô la / 1.000.000 = 0.20 đô la mỗi lần gọi, vậy 10.00 đô la mỗi ngày chỉ riêng cho tiền tố.

Với bộ nhớ đệm rõ ràng: việc tạo tốn 100.000 × 2.50 đô la / 1.000.000 = 0.25 đô la một lần, sau đó 49 lượt truy cập bộ nhớ đệm với 100.000 × 0.20 đô la / 1.000.000 = 0.02 đô la mỗi lượt, hoặc 0.98 đô la. Tổng cộng hàng ngày: khoảng 1.23 đô la, tiết kiệm 88%. Trong một tháng, đó là khoảng 300 đô la so với dưới 40 đô la.

Ước tính chi phí từ mức sử dụng được đo lường, không phải đoán mò

Cả ba ví dụ đều dựa trên số lượng token giả định. Con số thực tế của bạn sẽ khác, và với các token suy luận đang hoạt động, chúng sẽ khác theo những cách mà bạn không thể dự đoán chỉ từ độ dài lời nhắc. Cách khắc phục là đo lường.

Một quy trình làm việc thực tế: lấy khóa API của bạn, thiết lập điểm cuối ( hướng dẫn API Qwen 3.8 bao gồm cả ba URL cơ sở khu vực và cả giao thức tương thích OpenAI và Anthropic), và gửi các yêu cầu đại diện cho từng loại tác vụ trong ứng dụng của bạn. Mỗi phản hồi trả về một đối tượng usage với số lượng token đầu vào, đầu ra và suy luận chính xác.

Trong Apidog, lưu ba URL cơ sở khu vực làm môi trường, gửi cùng một yêu cầu ở mỗi cấp độ reasoning_effort và đọc mức sử dụng token trực tiếp từ trình kiểm tra phản hồi. Chạy mười yêu cầu đại diện cho mỗi loại tác vụ, tính trung bình số lượng, nhân với 2 đô la/6 đô la, và bạn có một mô hình chi phí được xây dựng trên dữ liệu đo lường. Bạn cũng có thể A/B cùng một lời nhắc với qwen3.7-max hoặc Kimi K3 trong cùng một không gian làm việc để xem liệu mô hình rẻ hơn có phù hợp với khối lượng công việc của bạn hay không. Tải xuống Apidog miễn phí và bạn có thể có số liệu chi phí thực tế cho mỗi tác vụ trong vòng một giờ.

Kết luận

Qwen 3.8-Max với giá 2 đô la/6 đô la là mức giá cạnh tranh cho một flagship cấp tiên tiến: thấp hơn giá niêm yết của phiên bản tiền nhiệm, bằng một nửa giá đầu ra của GPT-5.6 Terra, một phần nhỏ của Opus 5, và cố định trên toàn bộ ngữ cảnh 1M token nơi mà phần lớn thị trường tăng giá theo cấp bậc. Thêm 10% lượt truy cập bộ nhớ đệm và kinh tế học cho các khối lượng công việc ngữ cảnh dài, lặp lại nhiều trông thực sự mạnh mẽ.

Hai lưu ý: suy luận xhigh mặc định làm tăng hóa đơn đầu ra so với ước tính đơn giản, và các yếu tố xung quanh nó (3.7-Max giảm giá 50%, hạn mức miễn phí ở Singapore) có giới hạn thời gian. Đo lường mức sử dụng token thực tế của bạn, cài đặt reasoning_effort một cách có chủ đích, và bảng giá sẽ ít gây ngạc nhiên.

nút

Các câu hỏi thường gặp

Qwen 3.8 có tốn nhiều chi phí hơn cho các lời nhắc dài không?

Không. Bảng giá chính thức liệt kê một mức giá duy nhất bao gồm từ 0 đến 1M token, vì vậy một lời nhắc 900K token được tính phí ở cùng mức giá đầu vào 2 đô la cho 1M như một lời nhắc ngắn. Điều này khác với các mô hình phân cấp, bao gồm một số trong danh mục riêng của Alibaba trên danh sách mô hình của Model Studio, nơi mức giá tăng theo độ dài ngữ cảnh.

Các token suy nghĩ có tốn thêm chi phí trên Qwen 3.8 không?

Không có mức giá riêng cho suy nghĩ: các chế độ suy nghĩ và không suy nghĩ được tính phí ở cùng mức 2 đô la/6 đô la. Nhưng các token suy nghĩ được tính là token đầu ra với giá 6 đô la cho 1M, và reasoning_effort mặc định là xhigh. Do đó, các yêu cầu nặng về suy luận tốn nhiều chi phí hơn so với câu trả lời hiển thị. Giảm mức độ nỗ lực cho các tác vụ đơn giản, và kiểm tra đối tượng usage trong mỗi phản hồi để xem bạn thực sự đang trả tiền cho cái gì.

Có cách nào để dùng thử Qwen 3.8 miễn phí không?

Có. Model Studio bao gồm một hạn mức miễn phí 1M token, có giá trị trong 90 ngày, chỉ trên điểm cuối khu vực Singapore. Qwen Chat cũng cung cấp quyền truy cập miễn phí trong trình duyệt. Cả hai cách, cùng với các chi tiết nhỏ, đều được đề cập trong bài viết cách sử dụng Qwen 3.8 miễn phí.

Chương trình "giá xem trước 10%" cũ còn khả dụng không?

Không. Đó là một chương trình khuyến mãi trong thời gian xem trước được báo cáo vào tháng 7 năm 2026; việc phát hành rộng rãi đã thay thế nó bằng bảng giá tiêu chuẩn 2 đô la/6 đô la. Hãy coi trang giá của Model Studio là nguồn thông tin đáng tin cậy.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API