Mô hình nguồn mở vừa đánh bại Claude Opus 4.8 trên mọi benchmark Moonshot được công bố

Kimi K3 đã đánh bại Claude Opus 4.8 trên tất cả năm điểm chuẩn ra mắt của Moonshot, với chi phí chỉ bằng một phần nhỏ, và trọng số mở dự kiến công bố vào ngày 27 tháng 7. Dưới đây là ý nghĩa của điều đó.

INEZA Felin-Michel

INEZA Felin-Michel

17 tháng 7 2026

Mô hình nguồn mở vừa đánh bại Claude Opus 4.8 trên mọi benchmark Moonshot được công bố

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Vào ngày 16 tháng 7 năm 2026, một phòng thí nghiệm của Trung Quốc đã công bố một mô hình vượt trội hơn Claude Opus 4.8 trên mọi tiêu chuẩn mà chính những người tạo ra nó đã chọn để trình diễn. Sau đó, họ thông báo rằng các trọng số sẽ được tải xuống miễn phí sau mười một ngày. Nếu bạn vẫn đang trả 5 đô la cho mỗi triệu token đầu vào và 25 đô la cho đầu ra cho một nhà cung cấp độc quyền, bạn có quyền tức giận. Không phải tức giận nhà cung cấp. Mà là tức giận câu chuyện bạn đã được kể, câu chuyện mà ranh giới là một pháo đài và con hào là vĩnh viễn. Kimi K3 vừa bước qua nó bằng dép xăng đan.

nút

TL;DR: Điều tưởng chừng không thể đã xảy ra

Một mô hình mã nguồn mở từ Moonshot AI, 2.8 nghìn tỷ tham số, ngữ cảnh một triệu token, đã đánh bại Claude Opus 4.8 trên cả năm tiêu chuẩn mà Moonshot công bố và chia đôi tỷ số 3-2 với GPT-5.6 Sol. Chi phí của nó chỉ bằng một phần nhỏ so với hai mô hình kia. Toàn bộ trọng số sẽ được công khai vào khoảng ngày 27 tháng 7 năm 2026, nghĩa là bạn có thể chạy AI tiên tiến trên phần cứng mà bạn kiểm soát. Các con số này là của Moonshot và chưa được xác minh độc lập, vì vậy hãy kiểm tra trước khi ghi chúng lên bất cứ đâu. Nhưng xu hướng là không thể nghi ngờ, và xu hướng này chính là điều khiến các đội ngũ định giá hiện tại phải trằn trọc vào ban đêm.

Bằng chứng, vì sự tức giận không có bằng chứng chỉ là tiếng ồn

Dưới đây là bảng ra mắt do Moonshot công bố, ở cài đặt suy luận tối đa. Đây là các con số do nhà cung cấp tự chạy, điều này rất quan trọng và chúng ta sẽ quay lại vấn đề đó. Nhưng đây là những con số mà Moonshot đã chọn để ủng hộ vào ngày ra mắt.

Tiêu chuẩn Kimi K3 Claude Opus 4.8 Claude Fable 5 GPT-5.6 Sol
Terminal-Bench 2.1 88.3 84.6 84.6 88.8
DeepSWE 67.5 59.0 70.0 73.0
BrowseComp 91.2 84.3 88.0 90.4
Automation Bench 30.8 27.2 29.1 29.7
SpreadsheetBench 2 34.8 31.6 34.7 32.4

Hãy đọc từng cột và suy ngẫm. So với Claude Opus 4.8, một mô hình có giá 5 đô la đầu vào và 25 đô la đầu ra cho mỗi triệu token, Kimi K3 thắng mọi hàng. Không phải là những chiến thắng sít sao. DeepSWE, chỉ số mã hóa tác nhân khó nhất trong bộ, là 67.5 so với 59.0. So với Claude Fable 5, mô hình tiên tiến hiện tại của Anthropic, K3 thắng bốn trong năm. So với GPT-5.6 Sol, nó thắng ba. Bạn có thể xem toàn bộ nguồn từ bài đăng ra mắt chính thức của Kimi K3 và phiên bản được gắn nguồn trong phân tích tiêu chuẩn Kimi K3 của chúng tôi.

Giờ đây, câu hỏi tiếp theo khó chịu là. Nếu một mô hình mã nguồn mở đánh bại mô hình trả phí của bạn trên sân nhà của mô hình trả phí, bạn đang trả tiền cho điều gì?

Khoảng cách giá không phải là một lỗi làm tròn, đó là toàn bộ lập luận

Hãy cùng tính toán mà không ai trong một bản trình bày bán hàng sẽ làm cho bạn. Kimi K3 tính phí 0.30 đô la cho mỗi triệu token khi có cache hit, 3.00 đô la khi cache miss, và 15.00 đô la cho đầu ra. Opus 4.8 tính phí 5.00 đô la và 25.00 đô la. Trong một khối lượng công việc mã hóa mà Mooncake stack của Moonshot được báo cáo đạt tỷ lệ cache hit trên 90 phần trăm, chi phí đầu vào thực tế của bạn sẽ gần với con số 0.30 đô la đó.

Vì vậy, về phía đầu vào, bạn đang xem xét một mô hình có thể rẻ hơn gấp mười lăm lần để sử dụng. Về phía đầu ra, đó là 15 đô la so với 25 đô la. Và nó đạt điểm cao hơn trên các tiêu chuẩn mà nhà cung cấp đắt tiền đã công bố. Chạy cùng một công việc một triệu token một nghìn lần một ngày và sự khác biệt không còn là một mục nhỏ mà trở thành một quyết định tuyển dụng. Chúng tôi đã trình bày chi tiết mô hình chi phí đầy đủ trong phân tích giá Kimi K3, nhưng bạn không cần bảng tính để cảm nhận được điều đó.

Các phòng thí nghiệm độc quyền sẽ nói với bạn rằng phí bảo hiểm mua được độ tin cậy, công cụ an toàn và mối quan hệ hỗ trợ. Một số điều đó là thật, và chúng ta sẽ nói đến. Nhưng hãy thành thật với bản thân về việc bao nhiêu trong số phí bảo hiểm đó từng là về chi phí suy luận, và bao nhiêu là về thực tế đơn giản là bạn không có lựa chọn nào khác.

Con hào đã được thuê, và hợp đồng thuê đã hết hạn

Đây là câu nói sẽ định hình lại toàn bộ cuộc trò chuyện. Khoảng ngày 27 tháng 7 năm 2026, Moonshot sẽ phát hành toàn bộ trọng số.

Hãy suy nghĩ kỹ về ý nghĩa của điều đó. Mọi mô hình tiên tiến độc quyền đều là một dịch vụ bạn thuê. Bạn gửi dữ liệu của mình ra ngoài, bạn chấp nhận các giới hạn tốc độ, bạn thừa hưởng lộ trình, và bạn trả phí vì lựa chọn thay thế là một mô hình mã nguồn mở yếu hơn nhiều. Giao dịch đó có thể được bảo vệ khi các trọng số mã nguồn mở có nghĩa là phải từ bỏ hai cấp độ chất lượng. Nhưng nó không còn được bảo vệ khi các trọng số mã nguồn mở có nghĩa là không phải từ bỏ hầu như bất cứ điều gì.

Khi trọng số của K3 được phát hành, một ngân hàng được quản lý có thể chạy nó trong tường của riêng mình. Một công ty khởi nghiệp có thể tinh chỉnh nó trên dữ liệu của riêng mình. Một nhà nghiên cứu ở một quốc gia mà API không phục vụ vẫn có thể tải xuống. Không nhà cung cấp nào có thể giới hạn tốc độ của bạn, loại bỏ mô hình của bạn hoặc thay đổi các điều khoản vào quý tới. Nếu bạn đã từng gặp lỗi tính năng sản xuất vì nhà cung cấp ngừng cung cấp một mô hình, bạn đã hiểu tại sao “trọng số chạy trên phần cứng của chúng tôi” không phải là một điều đáng có. Đó là toàn bộ vấn đề. Hướng dẫn của chúng tôi về cách sử dụng Kimi K3 miễn phí sẽ hướng dẫn bạn cách tự lưu trữ sau khi các trọng số được phát hành.

Con hào chưa bao giờ là mô hình. Con hào là sự thiếu vắng một lựa chọn thay thế. K3 chính là lựa chọn thay thế.

Các biện pháp kiểm soát xuất khẩu lẽ ra phải ngăn chặn chính xác điều này

Trong hai năm, luận điểm thoải mái ở San Francisco là sức mạnh tính toán là định mệnh. Hạn chế chip, hạn chế biên giới, và sự dẫn đầu sẽ tồn tại mãi mãi. Kimi K3 là một mô hình 2.8 nghìn tỷ tham số, mô hình mã nguồn mở lớn nhất xuất phát từ Trung Quốc, và nó đang so kè với những gì tốt nhất mà các phòng thí nghiệm được tài trợ tốt nhất trên thế giới có thể tạo ra.

Bạn không cần phải có ý kiến về chính sách thương mại để nhận thấy rằng tiền đề vừa bị phá vỡ. Câu trả lời kỹ thuật thú vị cho một ràng buộc tính toán không phải là bỏ cuộc. Đó là tìm cách vượt qua nó bằng cách sáng tạo, đó chính xác là những gì kiến trúc K3 thể hiện: Kimi Delta Attention, một thiết kế chú ý lai tuyến tính, và Stable LatentMoE kích hoạt 16 trong số 896 chuyên gia cho mỗi token, tất cả đều nhằm mục đích làm được nhiều hơn với ít hơn. Ràng buộc không ngăn cản việc đạt được biên giới từ phía bên kia. Nó có lẽ đã làm sắc bén hơn con dao.

Trước khi bạn hủy bỏ hợp đồng Anthropic trong cơn giận dữ, hãy đọc phần này

Một bài viết kích động mà nói dối bạn thì vô giá trị, vì vậy đây là nơi tôi đứng ở phía khác, bởi vì phiên bản trung thực hữu ích hơn là một cú đả kích.

Đầu tiên, đây là những con số của chính Moonshot. Một phòng thí nghiệm công bố các bộ dữ liệu mà nó trông tốt. Chưa ai độc lập tái tạo các điểm mã hóa của K3, và các tiêu chuẩn tác nhân dao động mạnh mẽ theo cấu trúc và logic thử lại. Hãy coi bảng này là định hướng cho đến khi một bên trung lập chạy lại nó.

Thứ hai, chính Moonshot nói rằng K3 “vẫn còn kém các mô hình độc quyền mạnh nhất, Claude Fable 5 và GPT-5.6 Sol.” Đọc điều đó so với bảng và một điều thú vị xuất hiện: ngay cả trên các tiêu chuẩn mà Moonshot đã chọn, K3 vẫn đánh bại Fable 5 ở bốn trong năm, nhưng công ty vẫn tuyên bố nó tụt hậu nói chung. Hoặc Moonshot đang đánh lừa, hoặc bảng công bố chỉ là phần đẹp mắt và khoảng cách thực sự nằm ở các số liệu mà nó không hiển thị, rất có thể là suy luận khó nhất và các trường hợp ngoại lệ dài. Trên DeepSWE, hàng mã hóa khó nhất, K3 thua cả Sol và Fable 5. Điều đó không phải là không có gì. So sánh Kimi K3 so với GPT-5.6 Sol đi sâu vào chính xác nơi biên giới vẫn còn dẫn trước.

Thứ ba, trọng số mở không miễn phí để chạy. Một mô hình kết hợp chuyên gia 2.8 nghìn tỷ tham số cần bộ tăng tốc nghiêm túc trước khi bạn cung cấp một token duy nhất. Đối với hầu hết các nhóm, "tự lưu trữ" là một lựa chọn chiến lược, không phải triển khai vào thứ Ba tuần tới.

Thứ tư, K3 chậm hơn. Artificial Analysis ghi nhận nó gần 62 token đầu ra mỗi giây, dưới mức trung bình cho cấp của nó, và gắn cờ nó là dài dòng, điều này âm thầm làm tăng hóa đơn đầu ra 15 đô la đó. Và các mô hình của Anthropic có lịch sử sản xuất lâu hơn trong công việc tác nhân khó khăn mà một số nhóm sẽ tiếp tục trả tiền cho đến khi các con số của K3 tồn tại khi tiếp xúc với thế giới thực.

Không có điều nào trong số đó thay đổi tiêu đề. Nó làm sắc nét nó. Tuyên bố chưa bao giờ là K3 là mô hình tốt nhất thế giới. Tuyên bố là khoảng cách giữa mô hình độc quyền tốt nhất và mô hình mã nguồn mở tốt nhất vừa thu hẹp đến mức giá cả, kiểm soát và tính mở quyết định việc mua, chứ không phải khả năng thô. Đó là cuộc cách mạng. Nó yên tĩnh hơn một biểu đồ tiêu chuẩn và tốn kém hơn nhiều đối với các công ty đương nhiệm.

Điều gì thực sự đã thay đổi vào ngày 16 tháng 7

Loại bỏ sự gay gắt và đây là sự thay đổi cấu trúc. Lần đầu tiên, mô hình mã nguồn mở hàng đầu là một sự thay thế thực sự cho một mô hình độc quyền hàng đầu trong hầu hết các công việc thực tế, và nó làm giảm giá mô hình độc quyền đó với biên độ lớn, và trọng số của nó sắp được công khai. Ba sự thật đó chưa bao giờ đồng thời xảy ra trước đây. Khi chúng đồng thời xảy ra, sức mạnh định giá của các phòng thí nghiệm độc quyền không còn là quy luật tự nhiên mà bắt đầu trở thành một cuộc đàm phán.

Điều đó không có nghĩa là các phòng thí nghiệm độc quyền sẽ chết. Fable 5 và GPT-5.6 Sol vẫn giữ vị trí hàng đầu, và nhiều nhóm sẽ trả tiền cho hiệu suất cao nhất, công cụ và mối quan hệ với nhà cung cấp. Điều đó có nghĩa là mức sàn vừa tăng mạnh, và mọi thứ được định giá dựa trên mức sàn cũ hiện đều bị định giá quá cao cho đến khi được chứng minh ngược lại. Nếu ngân sách AI của bạn được xây dựng trên giả định rằng chất lượng gần với biên giới có giá biên giới, giả định đó đã hết hạn trong tuần này.

Ai nên lo lắng, và ai không nên

Hãy cụ thể về những người bị điều này đe dọa. Những người nên lo lắng là những người mà toàn bộ lập luận của họ dựa vào sự khan hiếm. Nếu giá của bạn giả định khách hàng không có lựa chọn thay thế tương đương, K3 vừa xây dựng một lựa chọn thay thế và sắp sửa phát miễn phí bản thiết kế. Nếu bạn bán lại token mô hình độc quyền với giá cao hơn, lợi nhuận của bạn giờ đây phải cạnh tranh với một mô hình rẻ hơn ở nguồn và có thể tự lưu trữ trong mười một ngày. Nếu rào cản duy nhất của sản phẩm của bạn là quyền truy cập vào một mô hình tốt, đó chưa bao giờ là rào cản, và giờ đây mọi người đều có thể thấy điều đó.

Những người nên bình tĩnh là những người đã xây dựng một cái gì đó thực sự trên nền mô hình: công cụ đánh giá, dữ liệu, quy trình làm việc, kỹ thuật tin cậy và sự tinh tế. Một mô hình rẻ hơn, mở hơn không xóa bỏ bất kỳ điều gì trong số đó. Nó chỉ làm cho việc chạy trở nên rẻ hơn. Đây là dấu hiệu cho thấy đây là một sự thay đổi thực sự, chứ không chỉ là một sự ra mắt. Nó định giá lại những người thua cuộc và mang lại chiết khấu cho những người thắng cuộc. So sánh toàn bộ tính toán giá với những gì bạn đang trả hôm nay và bạn sẽ biết mình thuộc nhóm nào.

Hãy tự mình kiểm tra, đừng tin lời Moonshot hay của tôi

Phản ứng đúng đắn đối với một bảng tiêu chuẩn hấp dẫn không phải là tin tưởng nó và cũng không phải là gạt bỏ nó. Đó là tự mình chạy đánh giá trên khối lượng công việc của riêng bạn, bởi vì tiêu chuẩn duy nhất trả tiền cho hóa đơn của bạn là tiêu chuẩn được tạo ra từ lưu lượng truy cập của bạn.

Kimi K3 cung cấp một API tương thích với OpenAI, vì vậy bạn có thể trỏ một máy khách API như Apidog vào điểm cuối `kimi-k3` và gửi các lời nhắc thực của bạn vào đó trong một buổi chiều. Gửi yêu cầu giống hệt nhau đến `kimi-k3` và đến bất cứ thứ gì bạn đang trả tiền hôm nay, sau đó so sánh đầu ra, độ trễ và chi phí token cạnh nhau. Kiểm tra phản hồi trực tuyến, gỡ lỗi các cuộc gọi công cụ, lưu khóa của bạn dưới dạng biến môi trường và lưu toàn bộ mọi thứ dưới dạng một thử nghiệm có thể lặp lại để bạn đang đo lường, chứ không phải cảm nhận. Nếu bạn chưa bao giờ kết nối một điểm cuối mô hình thô vào một công cụ kiểm tra trước đây, hướng dẫn của chúng tôi về kiểm tra API mà không cần Postman sẽ đề cập đến mẫu này, và Tải xuống Apidog nếu bạn muốn làm theo.

Làm điều đó một lần và cuộc tranh luận sẽ không còn mang tính ý thức hệ nữa. Bạn sẽ có bảng của riêng mình, được xây dựng từ công việc của riêng bạn, và bạn sẽ biết trong vòng một ngày liệu mô hình mà mọi người đang tranh cãi có thuộc về ngăn xếp của bạn hay không. Để so sánh trực tiếp với mô hình mà hầu hết mọi người đang trả quá nhiều tiền, hãy đọc Kimi K3 so với Claude Opus 4.8.

Điểm mấu chốt

Kimi K3 không phải là mô hình tốt nhất trên thế giới, và bất cứ ai nói với bạn như vậy đều có mục đích riêng. Điều thực sự là, đây là khoảnh khắc mà giá cả của ranh giới và vị trí của ranh giới đã tách rời nhau. Một mô hình mã nguồn mở đã đánh bại một mô hình độc quyền 25 đô la trên các tiêu chuẩn lân cận của nhà cung cấp độc quyền đó, với chi phí chỉ bằng một phần nhỏ, và nó sắp có thể tải xuống cho bất kỳ ai có phần cứng để chạy nó.

Bạn có thể tiếp tục trả giá cũ. Chỉ cần làm điều đó vì bạn đã chọn sau khi thử nghiệm lựa chọn thay thế, chứ không phải vì bạn cho rằng không có lựa chọn nào. Giờ đây đã có. Tên của nó là Kimi K3, và các phòng thí nghiệm đã dành hai năm nói với bạn rằng con hào là vĩnh viễn là những người trông lo lắng nhất hôm nay.

Câu hỏi thường gặp

Kimi K3 thực sự tốt hơn Claude Opus 4.8 không? Trên tất cả năm tiêu chuẩn mà Moonshot đã công bố khi ra mắt, vâng, bao gồm DeepSWE ở mức 67.5 so với 59.0. Đó là những con số do nhà cung cấp tự chạy, chưa được xác minh độc lập, vì vậy hãy tự mình kiểm tra trên khối lượng công việc của bạn. Các ưu điểm còn lại của Opus 4.8 là lịch sử sản xuất và sự đảm bảo của nhà cung cấp được quản lý, chứ không phải điểm chuẩn.

Kimi K3 rẻ hơn bao nhiêu? K3 tính phí 0.30 đô la cho mỗi triệu token khi có cache hit, 3.00 đô la khi miss, và 15.00 đô la cho đầu ra, so với 5.00 đô la và 25.00 đô la của Opus 4.8. Trong các khối lượng công việc mã hóa nặng về cache, phía đầu vào có thể rẻ hơn gấp mười lăm lần. Xem phân tích giá Kimi K3 để biết toàn bộ tính toán.

Kimi K3 thực sự là mã nguồn mở không? Moonshot nói rằng toàn bộ trọng số sẽ được phát hành vào khoảng ngày 27 tháng 7 năm 2026, điều này làm cho nó trở thành mã nguồn mở (open-weight), chứ không phải mã nguồn mở theo nghĩa giấy phép chặt chẽ. Cho đến lúc đó, nó chỉ có API và ứng dụng. Hãy theo dõi bài đăng ra mắt chính thứctrang Hugging Face của Moonshot để biết thời điểm phát hành.

Có bất kỳ nhược điểm nào không? Có ba nhược điểm. Các tiêu chuẩn là của Moonshot cho đến khi một phòng thí nghiệm trung lập chạy lại chúng, K3 vẫn thua Fable 5 và Sol về khả năng suy luận khó nhất theo lời thừa nhận của Moonshot, và việc tự chạy một mô hình 2.8 nghìn tỷ tham số cần phần cứng mạnh. Cuộc cách mạng là sự thu hẹp khoảng cách, chứ không phải một chiến thắng hoàn toàn.

Làm cách nào để dùng thử Kimi K3 ngay hôm nay? Sử dụng nó trong ứng dụng Kimi hoặc thông qua API với ID mô hình `kimi-k3`. Để đánh giá nó so với mô hình hiện tại của bạn, hãy trỏ một máy khách tương thích OpenAI như Apidog vào điểm cuối và so sánh đầu ra, độ trễ và chi phí trên các lời nhắc thực của bạn. Bắt đầu với phần giải thích Kimi K3 là gì của chúng tôi.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API