So sánh Qwen 3.8 và Kimi K3: Hai gã khổng lồ AI nguồn mở Trung Quốc

Qwen 3.8-Max so với Kimi K3: so sánh thông số, trọng số mở, phương thức, giá cả và khả năng hỗ trợ harness, kèm theo đánh giá chân thực về các điểm chuẩn do nhà cung cấp thực hiện.

INEZA Felin-Michel

INEZA Felin-Michel

3 tháng 8 2026

So sánh Qwen 3.8 và Kimi K3: Hai gã khổng lồ AI nguồn mở Trung Quốc

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Tháng 7 năm 2026 đã chứng kiến cuộc đua song mã trong lĩnh vực mô hình biên có trọng số mở, và cả hai đối thủ đều đến từ Trung Quốc. Moonshot AI đã ra mắt Kimi K3 vào ngày 16 tháng 7. Ba ngày sau, Alibaba đã công bố trước Qwen 3.8-Max, sau đó chính thức phát hành rộng rãi vào đầu tháng 8. Cả hai đều là các mô hình mixture-of-experts (MoE) với hàng nghìn tỷ tham số. Cả hai đều hứa hẹn (hoặc đã cung cấp) trọng số mở. Cả hai đều có thể tích hợp vào các khung tác nhân kiểu Claude Code. Và cả hai đều có mức giá cạnh tranh hơn so với các phòng thí nghiệm tiên phong của Hoa Kỳ.

Sự tương đồng bề ngoài che giấu những khác biệt thực sự: ở những gì bạn có thể tải xuống hôm nay, ở những gì các mô hình có thể "nhìn thấy", và ở chi phí sử dụng nặng trong một tháng. Bài so sánh này sẽ đi sâu vào mọi khía cạnh bạn có thể kiểm chứng tính đến ngày 3 tháng 8 năm 2026. Để có phân tích đầy đủ về thông số kỹ thuật của sản phẩm chủ lực mới của Alibaba, hãy bắt đầu với bài giải thích về Qwen 3.8-Max của chúng tôi rồi quay lại đây.

nút

Một lưu ý chân thật trước khi bắt đầu: hiện tại vẫn chưa có bảng đánh giá độc lập trực tiếp nào giữa hai mô hình này. Mỗi con số trong bài viết này đều lấy từ bảng của chính nhà cung cấp, và chúng tôi sẽ ghi rõ con số đó thuộc về nhà cung cấp nào. Hãy coi phần đánh giá hiệu năng này chỉ mang tính chỉ dẫn, không phải là kết luận cuối cùng.

Dòng thời gian: ai đã phát hành gì, và khi nào

Thứ tự phát hành ở đây quan trọng hơn bình thường, bởi vì khái niệm “trọng số mở” hiện tại có ý nghĩa khác nhau đối với mỗi mô hình.

Kimi K3 ra mắt vào ngày 16 tháng 7 năm 2026. Moonshot đã hứa hẹn trọng số mở khi ra mắt, và đã thực hiện lời hứa đó 11 ngày sau: các trọng số đã được đưa lên Hugging Face vào ngày 27 tháng 7 dưới dạng bản phát hành MXFP4 dung lượng 594 GB. Tính đến hôm nay, bạn có thể tải xuống K3, lượng tử hóa nó thêm và chạy trên phần cứng của riêng bạn. Đó không phải là một lời hứa. Nó đã xảy ra.

Qwen 3.8-Max đã được giới thiệu vào ngày 19 tháng 7 và đạt trạng thái khả dụng chung trên Alibaba Cloud Model Studio vào đầu tháng 8, theo bài đăng phát hành chính thức của Qwen. Các trọng số được hứa hẹn sẽ có mặt trên Hugging Face và ModelScope “tuần tới”, tức là khoảng ngày 10 tháng 8. Tính đến ngày 3 tháng 8 năm 2026, chúng chưa thể tải xuống được. Khoảng cách 11 ngày giữa thời điểm ra mắt và phát hành trọng số của K3 cho thấy diễn biến này là bình thường, nhưng hiện tại chỉ có một trong số các mô hình này là thực sự mở.

Nếu việc tự lưu trữ là yếu tố quyết định của bạn, thì thực tế đó có thể kết thúc sớm sự so sánh này.

Tham số: hai mô hình MoE quy mô nghìn tỷ, một mô hình tinh gọn hơn

Cả hai mô hình đều là thiết kế mixture-of-experts (MoE) thưa thớt, điều này có nghĩa là tổng số tham số và chi phí tính toán trên mỗi token là hai con số rất khác nhau.

Thông số Qwen 3.8-Max Kimi K3
Tổng số tham số 2.4T 2.8T
Số tham số hoạt động trên mỗi token 95B 104B
Tỷ lệ kích hoạt ~4% ~3.7%
Nền tảng kiến trúc Nền tảng Qwen 3.5, MoE MoE
Định dạng trọng số mở Đã hứa hẹn (khoảng 10 tháng 8) MXFP4, 594 GB trên Hugging Face

Qwen 3.8-Max là mô hình nhỏ hơn ở cả hai khía cạnh: ít hơn 400 tỷ tổng tham số và ít hơn 9 tỷ tham số hoạt động so với K3. Cả hai khoảng cách đều không quá lớn, và số lượng tham số hoạt động không chuyển đổi tuyến tính thành khả năng. Điều mà chúng chuyển đổi thành là chi phí vận hành. Một mô hình kích hoạt 95 tỷ tham số trên mỗi token sẽ rẻ hơn khi chạy ở quy mô lớn so với một mô hình kích hoạt 104 tỷ tham số, nếu các yếu tố khác đều như nhau, và sự khác biệt đó thể hiện rõ trong bảng giá API dưới đây.

Đối với những người tự lưu trữ, con số quan trọng hơn là tệp tải xuống K3 dung lượng 594 GB ở độ chính xác MXFP4. Đó là phạm vi đa nút ngay cả trước khi bạn tính đến bộ đệm KV ở ngữ cảnh dài. Dự kiến Qwen 3.8-Max, với tổng số 2.4 nghìn tỷ tham số, sẽ thuộc phân khúc trọng lượng tương tự khi các tệp của nó xuất hiện. Hầu hết các đội sẽ sử dụng các điểm cuối được lưu trữ cho cả hai mô hình và chỉ dành việc tự lưu trữ cho các trường hợp tuân thủ hoặc nghiên cứu.

Độ mở hôm nay: trọng số trực tuyến so với một lời hứa hẹn chưa được thực hiện

Khía cạnh này xứng đáng có một phần riêng vì hoạt động marketing của cả hai bên đều nói là “mở” trong khi thực tế lại khác biệt.

Trọng số của Kimi K3 đã được công khai. Bạn có thể xác minh kho lưu trữ, kiểm tra giấy phép và tải các tệp xuống ngay bây giờ. Điều đó mang lại mọi lợi ích mà tính mở thực sự mang lại: lưu trữ bên thứ ba, lượng tử hóa cộng đồng, tinh chỉnh và sự đảm bảo rằng mô hình bạn đã đánh giá sẽ không bị âm thầm thay thế.

Qwen 3.8-Max sẽ là mô hình thuộc lớp Qwen-Max đầu tiên được phát hành với trọng số mở, đánh dấu một sự thay đổi thực sự trong chiến lược của Alibaba sau khi giữ tất cả các mô hình cấp Max trước đây chỉ thông qua API. Nhưng "lần đầu tiên" chỉ thực sự là lần đầu tiên khi nó xảy ra. Cho đến khi kho lưu trữ trên Hugging Face hoạt động, Qwen 3.8-Max vẫn chỉ là một mô hình API kèm theo một thông báo.

Hiện tại, K3 dẫn điểm ở khía cạnh này, với một ghi chú để kiểm tra lại vào khoảng ngày 10 tháng 8. Nếu Alibaba thực hiện lời hứa, khía cạnh này sẽ hòa và sự so sánh sẽ chuyển sang các điều khoản cấp phép và chất lượng lượng tử hóa.

Phương thức: Qwen nhìn thấy hình ảnh, K3 đọc văn bản

Ở đây, khoảng cách lại đi theo chiều ngược lại, và nó không hề nhỏ.

Qwen 3.8-Max chấp nhận đầu vào là văn bản và hình ảnh, theo cấu hình mô hình chính thức (`"input_modalities": ["text", "image"]`). Bài đăng ra mắt của Alibaba còn đi xa hơn, trình diễn khả năng hiểu tài liệu dài qua các tệp PDF hơn 200 trang và hiểu video 100 giờ thông qua biểu đồ bộ nhớ; hãy coi những điều đó là các bản demo trên blog, chứ không phải các loại đầu vào API được tài liệu hóa. Tuy nhiên, đầu vào hình ảnh là có thật và hiện có trong API. Các bảng đánh giá của nhà cung cấp Alibaba cũng tập trung vào điều này: bảng đa phương thức (MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1, các dòng OCR mạnh) là nơi Qwen 3.8-Max đạt được những con số vượt trội nhất.

Kimi K3 là một mô hình văn bản. Nếu công việc của bạn liên quan đến ảnh chụp màn hình, tài liệu quét, hiểu giao diện người dùng, hoặc bất kỳ tác vụ tác nhân nào liên quan đến thị giác, K3 cần một mô hình thị giác riêng biệt được gắn vào quy trình, với tất cả mã kết nối và độ trễ bổ sung đi kèm.

Đối với công việc lập trình và tác nhân chỉ xử lý văn bản, khía cạnh này không liên quan. Đối với trí tuệ tài liệu và các tác nhân sử dụng máy tính, nó mang tính quyết định.

Ngữ cảnh, đầu ra và giao diện API

Qwen 3.8-Max cung cấp cửa sổ ngữ cảnh 1.000.000 token dưới dạng một tầng duy nhất, với đầu ra tối đa là 65.536 token. Khả năng suy luận được kiểm soát bởi tham số reasoning_effort (mặc định là xhigh, cùng với medium và low), và đầu ra suy nghĩ được giữ lại theo mặc định. Đáng chú ý, các chế độ suy nghĩ và không suy nghĩ đều được tính phí với cùng một mức giá.

Truy cập được thực hiện thông qua Alibaba Cloud Model Studio với ba URL cơ sở khu vực (Bắc Kinh, Singapore, US-Virginia) và, một cách bất thường, hai dạng giao thức trên một nền tảng: một điểm cuối tương thích OpenAI và một điểm cuối tương thích Anthropic. Giao diện hai giao thức đó là lý do tại sao Qwen 3.8-Max dễ dàng tích hợp vào Claude Code chỉ với ANTHROPIC_BASE_URL và ANTHROPIC_MODEL=qwen3.8-max. Toàn bộ danh sách và khả năng truy cập theo khu vực được ghi lại trên trang mô hình của Model Studio; nếu bạn làm việc trên nhiều khu vực, các công cụ như Apidog cho phép bạn lưu trữ mỗi URL cơ sở dưới dạng một môi trường và chuyển đổi giữa chúng mà không cần chỉnh sửa yêu cầu.

Kimi K3 cũng sử dụng giao thức Anthropic và tích hợp vào các khung tác nhân kiểu Claude Code, đó chính là lý do tại sao hai mô hình này cạnh tranh cho cùng một vị trí: vị trí “hướng khung tác nhân hiện có của bạn tới một mô hình biên rẻ hơn”. Để biết chi tiết về điểm cuối của K3 và các giới hạn hiện tại, hãy xem bài giải thích về Kimi K3 của chúng tôi thay vì tin tưởng vào các con số có thể đã thay đổi kể từ khi ra mắt.

Giá cả: cố định và đơn giản so với giá đầu vào rẻ, đầu ra đắt

Dưới đây là mức giá đã công bố, trên mỗi triệu token:

Mức giá Qwen 3.8-Max Kimi K3
Đầu vào $2.00 $3.00
Đầu ra $6.00 $15.00
Đầu vào trùng khớp bộ đệm $0.20 (10% của đầu vào) $0.30
Phân tầng Cố định trên toàn bộ ngữ cảnh 1M Theo lịch trình đã công bố của Moonshot

Qwen 3.8-Max có giá 2 USD cho đầu vào và 6 USD cho đầu ra, cố định từ token đầu tiên đến một triệu token, có suy nghĩ hay không, theo trang giá chính thức của Model Studio. Việc tạo bộ đệm rõ ràng được tính phí 125% của đầu vào, lượt truy cập bộ đệm được tính 10%. Ngoài ra còn có một hạn mức miễn phí: 1M token, chỉ áp dụng cho khu vực Singapore, có hiệu lực trong 90 ngày.

Giá của K3 là 0,30 USD trên mỗi triệu token cho lượt truy cập bộ đệm, 3 USD trên mỗi triệu token đầu vào và 15 USD trên mỗi triệu token đầu ra.

Sự so sánh không chỉ là một con số duy nhất. Đối với các tác vụ nặng về đầu vào với kỷ luật bộ đệm tốt (lời nhắc hệ thống dài, ngữ cảnh tài liệu lặp lại), hai mô hình này có mức giá gần nhau hơn so với con số niêm yết: 0,20 USD so với 0,30 USD cho mỗi megatoken được lưu vào bộ đệm là một khoảng cách nhỏ. Đối với các tác vụ nặng về đầu ra, khoảng cách rất lớn: tỷ lệ đầu ra 15 USD của K3 gấp 2,5 lần 6 USD của Qwen. Các vòng lặp tác nhân tạo ra nhiều suy luận và mã thường nặng về đầu ra, điều này ưu tiên Qwen 3.8-Max trên lý thuyết.

Một lưu ý đặc biệt áp dụng cho Qwen: reasoning_effort mặc định là xhigh, và các token suy nghĩ được tính phí như đầu ra. Các hóa đơn thực tế sẽ cao hơn so với ước tính đơn giản về token đầu vào-đầu ra. Phân tích giá Qwen 3.8 của chúng tôi sẽ đưa ra các ví dụ về chi phí cho mỗi tác vụ nếu bạn muốn lập mô hình này trước khi cam kết.

Điểm chuẩn: hai bảng của nhà cung cấp, không có trọng tài

Đây là điểm mà hầu hết các so sánh giữa hai mô hình này thường sai, vì vậy chúng ta hãy chính xác về những gì đang tồn tại.

Những gì đang tồn tại: Alibaba đã công bố bảng điểm chuẩn cho Qwen 3.8-Max so với Claude Opus 4.8, Fable 5, GPT-5.6 Sol và Qwen 3.7-Max. Moonshot đã công bố bảng ra mắt của riêng mình cho Kimi K3 so với một loạt các mô hình tiên phong tương tự. Cả hai đều được thực hiện bởi nhà cung cấp.

Những gì không tồn tại: bất kỳ đánh giá độc lập nào đặt Qwen 3.8-Max và Kimi K3 vào cùng một bảng dưới cùng một khung đánh giá. Không có số liệu phân tích độc lập nào cho Qwen 3.8-Max có sẵn tại thời điểm viết bài. Hai nhà cung cấp đã không đánh giá mô hình của nhau.

Với khung nhìn đó, đây là những gì mỗi bên tuyên bố trong lần chạy của riêng mình.

Từ bảng của Alibaba (do Alibaba tự thực hiện, chủ yếu thông qua khung Claude Code, một chi tiết mà chính Alibaba cũng tiết lộ):

Điểm chuẩn Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86.6 84.6 84.6 88.8
SWE-bench Pro 67.7 69.2 80.0 64.6
PaperBench 93.0 80.3 88.8 90.5
GPQA Diamond 92.6 92.0 92.6 94.1
HLE 43.6 45.7 53.3 47.2

Các con số của chính Alibaba bao gồm những điểm yếu rõ ràng: Qwen 3.8-Max thua kém Fable 5 đáng kể trên SWE-bench Pro và thua kém tất cả các mô hình khác được liệt kê trên HLE. Các điểm nổi bật của nó là PaperBench, khả năng tuân thủ hướng dẫn (IFBench 82.8) và đánh giá đa phương thức. Một số kết quả nổi bật khác sử dụng các điểm chuẩn nội bộ của Alibaba (QwenSWEBench, CoWorkBench, và các điểm khác), những điểm này không thể đối chiếu với bất kỳ ai khác.

Về phía Moonshot, bảng ra mắt của K3 cho thấy nó vượt qua Claude Opus 4.8 trên các hàng điểm chuẩn nổi bật của Moonshot, trong khi vẫn kém Fable 5 và GPT-5.6 Sol nói chung. Chúng tôi đã đề cập đến những tuyên bố đó, cùng với các cảnh báo của chúng, trong bài so sánh Kimi K3 vs Claude Opus 4.8 của chúng tôi.

Bạn có thể đối chiếu hai bảng nơi các điểm chuẩn trùng lặp không? Bạn có thể, và mọi người sẽ làm, nhưng các khung đánh giá, cấu trúc hỗ trợ và cài đặt lấy mẫu khác nhau khiến việc đọc chéo các bảng chỉ mang tính chỉ dẫn tốt nhất. Tóm tắt trung thực: cả hai nhà cung cấp đều cho thấy mô hình của họ có tính cạnh tranh, và vượt trội một cách chọn lọc so với các mô hình tiên phong của Mỹ trong các tác vụ tác nhân. Không có bảng nào khẳng định mô hình nào trong hai mô hình mạnh hơn. Để biết chi tiết về các con số của Alibaba, hãy xem phân tích điểm chuẩn Qwen 3.8 của chúng tôi.

Tự chạy so sánh trực tiếp trong Apidog

Vì không có trọng tài, điểm chuẩn hữu ích nhất là điểm chuẩn bạn chạy trên khối lượng công việc của riêng mình. Cả hai mô hình đều cung cấp các điểm cuối hoàn thành cuộc trò chuyện tương thích OpenAI, điều này giúp việc kiểm thử song song trở nên đơn giản trong Apidog.

Thiết lập hai môi trường, một môi trường chứa URL cơ sở DashScope và qwen3.8-max, môi trường kia chứa điểm cuối của Moonshot và ID mô hình K3, mỗi môi trường có biến khóa API riêng. Lưu một yêu cầu với lời nhắc thực tế của bạn (một tác vụ thực tế từ sản phẩm của bạn, không phải một câu đố) và chuyển đổi giữa các môi trường để gửi cùng một tải trọng đến cả hai mô hình. Chế độ xem phản hồi của Apidog cung cấp cho bạn trạng thái, độ trễ và toàn bộ nội dung cạnh nhau, và tính năng gỡ lỗi SSE của nó cho thấy cách mỗi mô hình truyền tải nội dung suy luận, điều này quan trọng nếu giao diện người dùng của bạn hiển thị các token suy nghĩ. Thêm một vài xác nhận (lược đồ phản hồi, giới hạn độ trễ, từ khóa bắt buộc trong đầu ra) và bạn đã biến một lần kiểm tra sơ bộ thành một thử nghiệm lặp lại mà bạn có thể chạy lại khi một trong hai nhà cung cấp phát hành bản cập nhật. Tải xuống Apidog miễn phí để chạy so sánh; mười lời nhắc qua cả hai điểm cuối sẽ cho bạn biết nhiều hơn bảng của bất kỳ nhà cung cấp nào.

Thẻ điểm

Tiêu chí Người thắng hôm nay Lưu ý/Hạn chế
Tổng/tham số hoạt động Qwen 3.8-Max (tinh gọn hơn: 2.4T/95B so với 2.8T/104B) Nhỏ hơn tự thân không phải là tốt hơn hay tệ hơn; nó chủ yếu báo hiệu chi phí vận hành
Trọng số mở, hôm nay Kimi K3 (trực tuyến trên Hugging Face, 594 GB MXFP4) Trọng số của Qwen dự kiến vào khoảng 10 tháng 8; hãy kiểm tra lại, tiêu chí này có thể hòa sớm
Phương thức Qwen 3.8-Max (đầu vào văn bản + hình ảnh) Các tuyên bố về video/tài liệu dài là bản demo trên blog, không phải loại đầu vào API được tài liệu hóa
Cửa sổ ngữ cảnh Qwen 3.8-Max (tầng cố định 1M, đầu ra tối đa 65.536) Xác minh các giới hạn hiện tại của K3 so với tài liệu của Moonshot cho trường hợp sử dụng của bạn
Giá Qwen 3.8-Max (2$/6$ cố định so với 3$/15$) Mặc định suy nghĩ ở mức xhigh làm tăng chi phí đầu ra thực tế của Qwen
Điểm chuẩn Không thể đưa ra kết luận Cả hai bảng đều do nhà cung cấp thực hiện; không có so sánh trực tiếp độc lập nào tồn tại
Hệ sinh thái khung Hòa Cả hai đều tích hợp vào các khung kiểu Claude Code thông qua các điểm cuối giao thức Anthropic
Lịch sử thực hiện lời hứa Kimi K3 Trọng số đã được phát hành 11 ngày sau khi ra mắt; lời hứa của Qwen vẫn đang chờ thực hiện

Chọn cái nào khi nào

Chọn Kimi K3 nếu bạn cần trọng số trên phần cứng của riêng mình trong tuần này, yêu cầu tuân thủ của bạn đòi hỏi một mô hình mà bạn có thể ghim và kiểm tra, hoặc khối lượng công việc của bạn chỉ là văn bản và nặng về đầu vào đến mức giá bộ đệm chiếm ưu thế.

Chọn Qwen 3.8-Max nếu khối lượng công việc của bạn liên quan đến hình ảnh hoặc tài liệu, bạn tạo ra nhiều token đầu ra (vòng lặp tác nhân, tạo mã), hoặc bạn muốn ngữ cảnh 1M token mà không gặp bất ngờ về giá theo tầng.

Hãy đợi một tuần nếu trọng số mở là toàn bộ lý do bạn xem xét một trong hai mô hình. Nếu trọng số của Qwen được phát hành đúng như lời hứa vào khoảng ngày 10 tháng 8, tiêu chí về độ mở sẽ được đặt lại và quyết định sẽ phụ thuộc vào phương thức, giá cả và kết quả đánh giá của riêng bạn.

Câu chuyện thực sự là các nhà phát triển giờ đây có hai lựa chọn mô hình tiên phong đáng tin cậy, giá cả phải chăng, và tương thích khung từ Trung Quốc, chỉ trong vòng ba tuần kể từ khi ra mắt. Dù bạn nghiêng về lựa chọn nào, hãy tự chạy các lời nhắc của riêng mình thông qua cả hai điểm cuối trước khi cam kết lộ trình dựa trên bảng của bất kỳ nhà cung cấp nào.

nút

Câu hỏi thường gặp

Kimi K3 có mở hơn Qwen 3.8-Max không?

Hôm nay, có, trên thực tế đơn thuần là: trọng số của K3 đã có trên Hugging Face từ ngày 27 tháng 7 năm 2026 (594 GB, MXFP4), trong khi trọng số của Qwen 3.8-Max được hứa hẹn vào khoảng ngày 10 tháng 8 và vẫn chưa thể tải xuống được. Nếu Alibaba thực hiện lời hứa, cả hai sẽ là mô hình biên có trọng số mở và những khác biệt có ý nghĩa sẽ chuyển sang các điều khoản cấp phép và hỗ trợ cộng đồng. Cho đến lúc đó, chỉ K3 mới có thể tự lưu trữ; hướng dẫn K3 cục bộ của chúng tôi giải thích những gì cần thiết để làm điều đó.

Mô hình nào tốt hơn trong việc viết mã, Qwen 3.8-Max hay Kimi K3?

Hiện tại chưa ai có thể trả lời một cách trung thực. Cả hai nhà cung cấp đều công bố các con số mạnh mẽ về khả năng lập trình tác nhân, nhưng mỗi bên đều tự chạy đánh giá trong điều kiện riêng của mình, và không có so sánh trực tiếp độc lập nào tồn tại. Ngay cả bảng của Alibaba cũng cho thấy Qwen 3.8-Max thua Fable 5 trên SWE-bench Pro, vì vậy các bảng của nhà cung cấp vẫn thừa nhận những điểm yếu; chúng chỉ không thể so sánh được giữa các nhà cung cấp. Hãy chạy cả hai mô hình trên các tác vụ từ kho lưu trữ của riêng bạn trước khi quyết định.

Tôi có thể sử dụng cả hai mô hình trong Claude Code không?

Có. Cả hai đều cung cấp các điểm cuối tương thích với Anthropic. Đối với Qwen 3.8-Max, hãy đặt ANTHROPIC_BASE_URL thành điểm cuối Anthropic của DashScope và ANTHROPIC_MODEL=qwen3.8-max sử dụng cấu hình từ bài đăng phát hành của Alibaba. K3 hỗ trợ cùng một kiểu thông qua điểm cuối của Moonshot. Khả năng tương thích khung chung đó là điều làm cho việc kiểm thử A/B giữa hai mô hình trở nên rất dễ thiết lập.

Cái nào rẻ hơn cho một khối lượng công việc tác nhân thông thường?

Theo giá niêm yết, Qwen 3.8-Max: 2$/6$ mỗi triệu token so với 3$/15$ của K3, và các vòng lặp tác nhân thường nghiêng về token đầu ra, nơi khoảng cách là 2,5 lần. Hai yếu tố bổ sung: tỷ lệ 0,30 USD cho lượt truy cập bộ đệm của K3 giúp các tác vụ nặng về đầu vào, được lưu vào bộ đệm tốt vẫn cạnh tranh, và nỗ lực suy luận mặc định xhigh của Qwen tính phí suy nghĩ như đầu ra, vì vậy chi phí thực tế của nó sẽ cao hơn ước tính đơn giản. Hãy mô hình hóa hỗn hợp token của riêng bạn trước khi cho rằng giá niêm yết nói lên toàn bộ câu chuyện.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API