Alibaba đã phát hành Qwen 3.8-Max vào đầu tháng 8 năm 2026, và API đã có mặt trên Model Studio. Mô hình này có tổng cộng 2.4T tham số (95B hoạt động), cửa sổ ngữ cảnh 1 triệu token, và mức giá cố định $2 đầu vào / $6 đầu ra cho mỗi triệu token. Nếu bạn muốn tìm hiểu đầy đủ về bản thân mô hình, hãy bắt đầu với bài giải thích Qwen 3.8 của chúng tôi. Hướng dẫn này bao gồm các khía cạnh thực tế: lấy khóa, chọn khu vực, thực hiện cuộc gọi đầu tiên và tích hợp mô hình vào các công cụ của bạn.
Một chi tiết làm cho API này khác biệt so với hầu hết các lần ra mắt mô hình. Qwen 3.8 được phát hành với hai giao thức ngay từ ngày đầu: một điểm cuối tương thích OpenAI và một điểm cuối tương thích Anthropic. Mã SDK OpenAI hiện có của bạn vẫn hoạt động. Thiết lập Claude Code của bạn cũng hoạt động, chỉ với ba biến môi trường. Thiết kế hai giao thức đó cũng làm cho đây trở thành một API thú vị để thử nghiệm trong Apidog, nơi bạn có thể gửi cùng một lời nhắc đến cả hai dạng giao thức và xem cách mỗi giao thức truyền dữ liệu trở lại. Thông tin chi tiết hơn sẽ được trình bày bên dưới.
Dưới đây là hướng dẫn chi tiết.
Những gì bạn cần trước khi bắt đầu
Tham khảo nhanh để bạn không ngạc nhiên về bất cứ điều gì bên dưới:
| Mục | Giá trị |
|---|---|
| ID Mô hình | qwen3.8-max |
| Cửa sổ ngữ cảnh | 1.000.000 token |
| Đầu ra tối đa | 65.536 token |
| Loại đầu vào | Văn bản và hình ảnh |
| Giá cả | $2 đầu vào / $6 đầu ra cho mỗi 1 triệu token, giá cố định trên toàn bộ ngữ cảnh |
| Kiểm soát suy luận | reasoning_effort: xhigh (mặc định), medium, low |
| Giao thức | Hoàn thành + phản hồi chat OpenAI, Tin nhắn Anthropic |
| Biến môi trường khóa | DASHSCOPE_API_KEY |

Tất cả thông tin này đến từ bài đăng chính thức về Qwen 3.8 và tài liệu của Alibaba Cloud Model Studio. Một lưu ý về trọng số: Alibaba đã hứa sẽ cung cấp trọng số mở trên Hugging Face và ModelScope vào tuần tới, nhưng tính đến đầu tháng 8 năm 2026, chúng vẫn chưa thể tải xuống. Mọi thứ trong hướng dẫn này đều chạy dựa trên API được lưu trữ.
Bước 1: lấy khóa API từ QwenCloud
Truy cập home.qwencloud.com và đăng nhập hoặc tạo tài khoản. Khi bạn đã vào bảng điều khiển, hãy tạo khóa API. Nền tảng của Alibaba vẫn sử dụng tên DashScope nội bộ, vì vậy quy ước biến môi trường là DASHSCOPE_API_KEY:
export DASHSCOPE_API_KEY="sk-your-key-here"
Hãy đặt nó trong hồ sơ shell của bạn hoặc tệp .env, không phải trong mã nguồn của bạn. Mỗi đoạn mã trong hướng dẫn này đều đọc khóa từ biến đó.
Nếu bạn muốn kiểm tra mô hình trước khi bỏ tiền thật, có một hạn mức miễn phí: 1 triệu token, có giá trị trong 90 ngày, chỉ có sẵn ở khu vực Singapore. Điều đó đủ để chạy một đánh giá nghiêm túc.
Bước 2: chọn URL cơ sở theo khu vực
Model Studio phục vụ API tương thích OpenAI từ ba khu vực. Hãy chọn khu vực gần máy chủ của bạn nhất:
| Khu vực | URL cơ sở |
|---|---|
| Bắc Kinh | https://dashscope.aliyuncs.com/compatible-mode/v1 |
| Singapore | https://dashscope-intl.aliyuncs.com/compatible-mode/v1 |
| Mỹ (Virginia) | https://dashscope-us.aliyuncs.com/compatible-mode/v1 |
Điểm cuối Singapore (dashscope-intl) là lựa chọn mặc định cho hầu hết người dùng quốc tế và là nơi có hạn mức miễn phí. Danh sách mô hình Model Studio xác nhận rằng qwen3.8-max có sẵn để tạo văn bản cùng với hiểu hình ảnh và video, và nó đứng đầu bảng các mô hình được đề xuất tính đến bản cập nhật ngày 3 tháng 8.
Các ví dụ dưới đây sử dụng Singapore. Hãy thay đổi URL cơ sở nếu bạn ở gần Bắc Kinh hoặc Virginia hơn.
Bước 3: thực hiện cuộc gọi đầu tiên của bạn
Điểm cuối này sử dụng định dạng hoàn thành chat của OpenAI, vì vậy SDK Python openai chính thức hoạt động nguyên trạng. Hãy trỏ nó đến URL cơ sở của DashScope:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{"role": "system", "content": "You are a precise technical assistant."},
{"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
],
)
print(completion.choices[0].message.content)
Cuộc gọi tương tự trong cURL:
curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{"role": "user", "content": "Explain idempotency in REST APIs in two sentences."}
]
}'
Nếu bạn đã từng sử dụng bất kỳ nhà cung cấp tương thích OpenAI nào trước đây, không có gì ở đây sẽ cảm thấy mới mẻ. Đó chính là mục đích. Việc di chuyển từ một mô hình khác chỉ là thay đổi URL cơ sở và ID mô hình. Nếu bạn đang chuyển từ thế hệ trước, quy trình làm việc giống hệt với quy trình trong hướng dẫn API Qwen 3.7 Plus của chúng tôi, chỉ với một ID mô hình mới và các con số tốt hơn đằng sau nó.
Bước 4: truyền phát phản hồi và đọc suy luận
Qwen 3.8-Max là một mô hình suy luận và nó suy nghĩ theo mặc định. Ở chế độ truyền phát, quá trình suy nghĩ đến dưới dạng các thay đổi reasoning_content trước khi câu trả lời cuối cùng đến dưới dạng các thay đổi content thông thường. Hãy xử lý cả hai:
stream = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{"role": "user", "content": "Design a rate limiting strategy for a public API."}
],
stream=True,
)
thinking_done = False
for chunk in stream:
delta = chunk.choices[0].delta
reasoning = getattr(delta, "reasoning_content", None)
if reasoning:
print(reasoning, end="", flush=True)
elif delta.content:
if not thinking_done:
print("\n--- answer ---")
thinking_done = True
print(delta.content, end="", flush=True)
Hai điều cần biết về luồng suy nghĩ. Thứ nhất, các token suy nghĩ được tính phí như token đầu ra với cùng mức giá như mọi thứ khác, vì vậy các chuỗi suy luận dài sẽ xuất hiện trên hóa đơn của bạn. Thứ hai, ở cấp độ nỗ lực mặc định, mô hình suy luận rất kỹ, điều này rất tốt cho tính chính xác nhưng lại chậm đối với giao diện người dùng trò chuyện. Điều đó đưa chúng ta đến các điều khiển.
Bước 5: điều chỉnh reasoning_effort và các cờ suy nghĩ
API cung cấp ba cấp độ chính thức của reasoning_effort: xhigh (mặc định), medium và low. Nỗ lực cao hơn có nghĩa là nhiều token suy nghĩ hơn, kết quả tốt hơn trên các vấn đề khó, và độ trễ cùng chi phí cao hơn. Nỗ lực thấp hơn là lựa chọn phù hợp cho việc phân loại, trích xuất và trò chuyện đơn giản.
Hai cờ liên quan kiểm soát hành vi suy nghĩ: enable_thinking bật hoặc tắt quá trình suy luận, và preserve_thinking (mặc định là bật) giữ ngữ cảnh suy luận qua các lượt. Hãy truyền chúng qua extra_body khi bạn sử dụng SDK OpenAI, vì chúng là các phần mở rộng của DashScope:
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Classify this ticket: 'Login page 500s on Safari.'"}],
extra_body={
"reasoning_effort": "low",
"enable_thinking": True,
},
)
Việc tính phí là như nhau cho dù tính năng suy nghĩ được bật hay tắt, tính theo từng token. Yếu tố thay đổi chi phí của bạn là số lượng token suy nghĩ mà mô hình tạo ra, điều này được kiểm soát trực tiếp bởi reasoning_effort. Một mặc định hợp lý: xhigh cho mã hóa và phân tích tác nhân, low cho các điểm cuối sản xuất khối lượng lớn, medium khi bạn không chắc chắn. Hãy kiểm tra hiệu suất khối lượng công việc của riêng bạn thay vì tin tưởng vào các mặc định của bất kỳ ai, bao gồm cả của Alibaba.
Điểm cuối tương thích Anthropic
Đây là phần bất thường. Cùng với API tương thích OpenAI, Qwen 3.8 cung cấp một điểm cuối giao thức Anthropic:
https://dashscope-intl.aliyuncs.com/apps/anthropic
Nó sử dụng định dạng Anthropic Messages, có nghĩa là bất kỳ công cụ nào được xây dựng cho API của Claude đều có thể giao tiếp với Qwen 3.8-Max mà không cần thay đổi mã. Trường hợp sử dụng nổi bật là Claude Code. Alibaba đã công bố một cấu hình chính thức, và đó là ba biến môi trường:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=$DASHSCOPE_API_KEY
export ANTHROPIC_MODEL=qwen3.8-max
Khởi chạy claude sau khi thiết lập các biến đó, và Claude Code sẽ chạy vòng lặp tác nhân đầy đủ của nó với Qwen 3.8-Max. Có một chi tiết đáng để tạm dừng ở đây: Alibaba đã chạy hầu hết các điểm chuẩn mã hóa của riêng mình bằng cách sử dụng bộ công cụ Claude Code. Điểm cuối Anthropic không phải là một tính năng tương thích được bổ sung sau; đó là cấu hình mà chính nhà cung cấp đã sử dụng để tạo ra các số liệu mã hóa. Nếu mã hóa tác nhân là trường hợp sử dụng của bạn, phân tích Qwen 3.8 của chúng tôi về mã hóa sẽ hướng dẫn bạn qua các hàng điểm chuẩn đó và các bộ công cụ được hỗ trợ khác (Codex, Qoder, Qwen Code và OpenClaw đều có cấu hình chính thức).
Tại sao giao thức kép lại quan trọng ngoài Claude Code? Bởi vì nhóm của bạn có thể có mã và công cụ phân chia trên cả hai hệ sinh thái. Một API đáp ứng cả hai định dạng có nghĩa là bạn có thể kiểm tra quá trình di chuyển theo bất kỳ hướng nào mà không cần viết lại ứng dụng khách trước.
Chi phí là bao nhiêu
Tóm tắt: $2 cho mỗi triệu token đầu vào, $6 cho mỗi triệu token đầu ra, một mức giá cố định từ 0 đến 1 triệu ngữ cảnh. Không có phụ phí cho ngữ cảnh dài, điều này hiếm thấy ở các mô hình có 1 triệu ngữ cảnh. Bộ nhớ đệm ngữ cảnh cắt giảm đầu vào lặp lại xuống còn 10% giá đầu vào khi có lượt truy cập bộ nhớ đệm, với việc tạo bộ nhớ đệm rõ ràng được tính phí 125%. Trang giá chính thức có các con số hiện tại.

Để so sánh, mức giá ra mắt đó thấp hơn giá niêm yết của Qwen 3.7-Max là $2.5/$7.5. Tuy nhiên, hãy nhớ ghi chú về thanh toán từ phần truyền phát: các token suy nghĩ được tính là đầu ra, và cấp độ nỗ lực mặc định là xhigh, vì vậy hóa đơn thực tế sẽ cao hơn so với tính toán đơn giản. Để biết các ví dụ về chi phí và các điều khoản chi tiết về hạn mức miễn phí, hãy xem phân tích chi phí Qwen 3.8 đầy đủ.
Kiểm tra và gỡ lỗi API Qwen 3.8 trong Apidog
Một API có giao thức kép, ba khu vực, suy luận truyền phát chính là loại bề mặt mà một công cụ API phù hợp phát huy giá trị của nó. Dưới đây là một thiết lập thực tế trong Apidog:

Nhập thông số kỹ thuật tương thích OpenAI. Tạo một dự án và thêm điểm cuối hoàn thành chat (POST /chat/completions) với lược đồ thân yêu cầu. Vì API tuân theo định dạng OpenAI, bạn có thể nhập một thông số kỹ thuật OpenAI hiện có và không cần thay đổi gì ngoài URL máy chủ. Thêm điểm cuối Anthropic Messages làm API thứ hai trong cùng một dự án để cả hai dạng giao thức cùng tồn tại song song.
Mô hình hóa các khu vực dưới dạng môi trường. Tạo ba môi trường Apidog (Bắc Kinh, Singapore, Mỹ-Virginia), mỗi môi trường có biến base_url được đặt thành URL chế độ tương thích tương ứng và một khóa bí mật DASHSCOPE_API_KEY được chia sẻ. Việc chuyển đổi khu vực trở thành một cú nhấp chuột chọn từ danh sách thả xuống thay vì chỉnh sửa từng yêu cầu. Đây cũng là cách sạch sẽ để kiểm tra độ trễ từ vị trí của bạn đối với từng khu vực trước khi bạn đưa một khu vực vào sản xuất.
Kiểm tra luồng SSE. Gửi yêu cầu với "stream": true và xem các sự kiện được gửi từ máy chủ thô trong chế độ xem phản hồi. Bạn sẽ thấy các thay đổi reasoning_content đến trước, sau đó là các thay đổi content. Khi trình phân tích cú pháp luồng của bạn hoạt động sai trong môi trường sản xuất, việc so sánh đầu ra của nó với chuỗi sự kiện thô trong Apidog là cách nhanh nhất để tìm ra lỗi là của bạn hay của nhà cung cấp.
So sánh các mô hình cạnh nhau. Sao chép một yêu cầu, thay đổi ID mô hình thành qwen3.7-max và chạy cả hai với cùng một lời nhắc. Kỹ thuật tương tự cũng hoạt động trên các nhà cung cấp: giữ một yêu cầu API Kimi K3 trong cùng một dự án và thực hiện kiểm tra A/B hai mô hình flagship trọng số mở trên khối lượng công việc thực tế của bạn, với thời gian phản hồi và số lượng token được ghi lại cho mỗi lần chạy. Bảng điểm chuẩn của nhà cung cấp là điểm khởi đầu; lời nhắc của riêng bạn mới là thử nghiệm thực sự.
Tải xuống Apidog miễn phí để làm theo; toàn bộ thiết lập trên mất khoảng mười phút.
Câu hỏi thường gặp
Có cách nào miễn phí để thử API Qwen 3.8 không? Có. Các tài khoản Model Studio mới nhận được hạn mức miễn phí 1 triệu token cho qwen3.8-max, có giá trị trong 90 ngày, chỉ ở khu vực Singapore. Đó là toàn bộ ưu đãi, vì vậy hãy định tuyến lưu lượng truy cập đánh giá của bạn qua dashscope-intl để sử dụng nó.
Tôi có thể chạy Qwen 3.8 cục bộ thay vì sử dụng API không? Chưa. Alibaba đã hứa sẽ cung cấp trọng số mở trên Hugging Face và ModelScope vào tuần tới, nhưng tính đến đầu tháng 8 năm 2026, chúng vẫn chưa thể tải xuống. Và với tổng cộng 2.4T tham số, việc tự lưu trữ sẽ là một dự án đa nút ngay cả khi được lượng tử hóa. Hiện tại, API được lưu trữ là cách duy nhất để chạy mô hình.
Điểm cuối Anthropic có hỗ trợ các tính năng tương tự như điểm cuối OpenAI không? Điểm cuối Anthropic sử dụng giao thức Anthropic Messages và tồn tại chủ yếu để cung cấp sức mạnh cho các công cụ từ hệ sinh thái đó, với Claude Code là tích hợp được tài liệu hóa chính thức. Đối với mã ứng dụng trực tiếp, điểm cuối tương thích OpenAI là con đường được tài liệu hóa tốt hơn, với reasoning_effort, enable_thinking và truyền phát reasoning_content đều được đề cập ở trên.
Qwen3.8-Max so sánh thế nào với Qwen3-Coder cho công việc mã hóa? Chúng là những công cụ khác nhau. Qwen3-Coder là dòng mô hình mã hóa chuyên biệt; qwen3.8-max là mô hình flagship tổng quát mà tình cờ đạt được các con số mã hóa tác nhân mạnh mẽ trên bảng của Alibaba (86.6 trên Terminal Bench 2.1, theo điểm chuẩn do nhà cung cấp chạy). Nếu bạn đang chọn giữa chúng, hãy thử cả hai thông qua cùng một bề mặt API: các cuộc gọi giống hệt nhau ngoại trừ ID mô hình.
Tổng kết
API Qwen 3.8 là một trong những lần ra mắt flagship dễ dàng áp dụng nhất. Mã SDK OpenAI của bạn hoạt động sau khi thay đổi URL cơ sở, thiết lập Claude Code của bạn hoạt động sau ba biến môi trường, và mức giá cố định $2/$6 có nghĩa là bạn không cần bảng tính để dự đoán chi phí trên toàn bộ ngữ cảnh 1 triệu. Những điều chính cần thực sự chú ý: token suy nghĩ được tính phí là đầu ra ở mức nỗ lực mặc định xhigh, và sự phân chia khu vực đối với hạn mức miễn phí.
Bắt đầu với hạn mức miễn phí ở Singapore, truyền phát một vài yêu cầu để xem các thay đổi suy luận hoạt động như thế nào, và đưa các lời nhắc của riêng bạn qua đó trước khi tin tưởng bất kỳ bảng điểm chuẩn nào, kể cả của Alibaba. Thiết lập toàn bộ mọi thứ như một dự án trong Apidog, với các khu vực là môi trường và cả hai giao thức là các yêu cầu đã lưu, biến việc đánh giá đó từ một buổi chiều với các lệnh cURL ngẫu hứng thành thứ mà toàn bộ nhóm của bạn có thể chạy lại khi mô hình tiếp theo ra mắt.
