Mistral Đã Trở Lại: Le Chonk Đánh Bại GPT-6 Astra và Claude

Mistral Large 4 đạt 82% trong một bài kiểm tra an ninh mạng, trong khi GPT-6 Astra và Claude Opus 5.5 đạt gần bằng không. Đây là lý do tại sao, cùng với thông số kỹ thuật, giá 0,68 đô la và nơi nó thua kém.

Ashley Innocent

Ashley Innocent

6 tháng 10 2026

Mistral Đã Trở Lại: Le Chonk Đánh Bại GPT-6 Astra và Claude

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Mistral đã im ắng ở phân khúc cao cấp một thời gian. Mistral Large 3 ra mắt vào tháng 12 năm 2025, và kể từ đó, cuộc trò chuyện về các mô hình tiên tiến mã nguồn mở (open-weight frontier) đã xoay quanh Kimi, DeepSeek, GLM và Qwen. Vào ngày 6 tháng 10 năm 2026, Mistral đã đáp lại bằng Mistral Large 4, một mô hình 1 nghìn tỷ tham số mà nhóm phát triển gọi là “Le Chonk.”

Con số nổi bật là một điểm chuẩn về an ninh mạng, nơi Large 4 đạt 82% trong khi Claude Opus 5.5 và GPT-6 Astra đạt gần bằng không. Điều này là đúng, nó nằm trên trang ra mắt của Mistral, và bạn cần một câu bối cảnh trước khi chia sẻ. Bài viết này sẽ cung cấp cho bạn bối cảnh đó, thông số kỹ thuật, giá thực tế và những điểm mà Large 4 vẫn còn thua kém.

Tóm tắt

Tại sao nói “Mistral đã trở lại” là hợp lý

Trong hầu hết năm 2026, các mô hình mã nguồn mở (open-weight) mạnh nhất đến từ Trung Quốc. Mistral vẫn tiếp tục ra mắt các phiên bản như Medium 3.5, Devstral 2 và Small 4, nhưng không có gì cạnh tranh được với các mô hình tiên tiến (frontier closed models) ngay trên sân nhà của chúng.

Large 4 thay đổi cuộc chơi. Mistral tuyên bố rằng nó “vượt trội đáng kể so với bất kỳ mô hình mã nguồn mở nào được phát triển ở Mỹ hoặc Châu Âu,” và họ chứng minh điều đó bằng câu chuyện đào tạo được xây dựng cho cộng đồng muốn duy trì chủ quyền dữ liệu trong EU. Mô hình này được đào tạo từ đầu trên 3.800 GPU NVIDIA Grace Blackwell tại các trung tâm dữ liệu riêng của Mistral ở Châu Âu, bao gồm hơn 160 ngôn ngữ, trong đó có tất cả các ngôn ngữ chính thức của EU, và ra mắt vài tuần sau vòng gọi vốn Series D trị giá 3 tỷ euro mà Mistral gọi là vòng huy động vốn cổ phần lớn nhất từ trước đến nay của một công ty công nghệ Châu Âu.

Thời điểm cũng rất quan trọng. Large 4 ra mắt ngay sau khi Reflection công bố mô hình Beam mã nguồn mở của họ, vì vậy cuộc đua mô hình mở giữa Mỹ và Trung Quốc giờ đây có thêm một đối thủ đáng gờm thứ ba.

Điểm nhấn về an ninh mạng và điều cần lưu ý

Đây là kết quả mà mọi người đang chụp màn hình. Chỉ số An ninh mạng của Artificial Analysis bao gồm một bài kiểm tra yêu cầu một mô hình tái tạo một lỗ hổng thực tế trong phần mềm mã nguồn mở và sau đó vá nó. Mistral cho biết Large 4 đạt **82%, cao nhất trong số tất cả các mô hình**.

Sau đó là điều cần lưu ý, theo lời của chính Mistral: “Một số mô hình đóng hàng đầu, bao gồm Claude Opus 5.5 và GPT-6 Astra, đạt gần bằng không trong cùng bài kiểm tra vì họ từ chối thực hiện nhiệm vụ.”

Vì vậy, hãy đọc theo cách này:

Tuyên bố Ý nghĩa thực sự
“Large 4 đánh bại Astra và Opus 5.5 về an ninh mạng” Trong bài kiểm tra này, các mô hình đóng từ chối trả lời. Large 4 trả lời và thường thành công.
“Large 4 là mô hình hack tốt nhất” Chưa được xác nhận. Việc từ chối là một lựa chọn chính sách, không phải giới hạn khả năng.
“Large 4 không an toàn” Cũng chưa được xác nhận. Mistral báo cáo tỷ lệ từ chối trung bình của họ đối với các lời nhắc về an ninh mạng từ JailbreakBench, StrongREJECT và AgentHarm cao hơn mọi mô hình mã nguồn mở khác.

Có khả năng thực sự đằng sau tiêu đề này. Large 4 cũng giải quyết 93% các bài tập Cybench, một bộ gồm 40 bài tập capture-the-flag, mà Mistral gọi là một trong những điểm số cao nhất được báo cáo cho một mô hình mã nguồn mở. Trên B3 Agent Security Benchmark, nó chống lại 93.3% các cuộc tấn công.

Đối với các đội ngũ bảo mật, sự kết hợp đó chính là câu chuyện thực tế: một mô hình bạn có thể tự lưu trữ sẽ giúp tái tạo và vá lỗi CVE trong mã của riêng bạn, đồng thời vẫn từ chối hầu hết các yêu cầu gây hại rõ ràng. Đối với các đội ngũ API, đó là một công cụ hữu ích để có trên phần cứng của riêng bạn thay vì đằng sau bộ lọc chính sách của người khác.

Những lĩnh vực khác ngoài an ninh mạng mà Large 4 đánh bại GPT-6 Astra

Kết quả về an ninh mạng là nổi bật nhất. Hai chiến thắng khác trước Astra thì ít ồn ào hơn nhưng có ý nghĩa hơn, vì cả hai mô hình đều thực sự đã cố gắng thực hiện nhiệm vụ:

Điểm chuẩn Mistral Large 4 GPT-6 Astra Ghi chú
Dense 200 (nhận diện hình ảnh) 42% 41% Dẫn trước một điểm. Có thật, nhưng không đáng kể.
Finance Agent v2 (vals.ai) Dẫn trước Thua sau Mistral báo cáo thứ hạng, không phải điểm số.
Điểm chuẩn Harvey Legal Agent Mô hình mở tốt nhất Được liệt kê Không có số liệu đối đầu trực tiếp được công bố.

So với các mô hình mở khác, khoảng cách rộng hơn:

Điểm chuẩn Mistral Large 4 Đối thủ bị đánh bại
AutomationBench (657 quy trình) 59.9% Kimi K3, DeepSeek V4 Pro
AA-Briefcase (công việc tri thức) 1,393 Elo DeepSeek V4 Pro
DeepSWE v1.1 (mã hóa) 61.7% Dẫn đầu các mô hình mã nguồn mở
SWE-Atlas-QnA 59.4%
Terminal-Bench 4.0 28.3%

Tất cả những con số này đều do Mistral báo cáo, là số liệu từ bản xem trước mô hình. Chưa có phòng thí nghiệm độc lập nào chạy lại các bài kiểm tra này, và Euronews báo cáo rằng quá trình học tăng cường (reinforcement learning) vẫn đang được hoàn thiện tại thời điểm ra mắt. Hãy coi chúng là một tín hiệu mạnh mẽ, chứ không phải là một phán quyết cuối cùng.

Những điểm vẫn còn thua kém

Mistral đã công bố một kết quả trong đó một mô hình đóng rõ ràng giành chiến thắng. Trong một đánh giá chất lượng mã hóa do con người thực hiện bởi Surge AI trên năm mô hình, Large 4 Preview xếp thứ hai:

Mô hình Điểm mã hóa do con người đánh giá (trên 5)
Claude Opus 5 4.22
Mistral Large 4 Preview 3.74
GLM-5.3 3.60
Kimi K3 3.59
GLM-5.2 3.40

Đó là một chiến thắng rõ ràng trước các mô hình mở tốt nhất của Trung Quốc, và một khoảng cách nửa điểm so với Claude. Cách diễn đạt của Mistral là Large 4 đang “thu hẹp khoảng cách” với các mô hình tiên tiến trong mã hóa, đây là một cách nhìn nhận trung thực.

Cũng cần lưu ý: không có sự so sánh nào với Claude Fable 5.1 hoặc GPT-6 Sol trong bất kỳ tài liệu ra mắt nào. Nếu ai đó nói với bạn rằng Large 4 đánh bại Fable, hãy yêu cầu điểm chuẩn.

Thông số kỹ thuật tổng quan

Thông số Mistral Large 4
ID mô hình API mistral-large-4 (bí danh mistral-large-4-0)
Phiên bản 26.10, bản xem trước công khai
Kiến trúc Mixture-of-experts, kết hợp hướng dẫn + suy luận
Tham số Tổng 1.05 nghìn tỷ, 49 tỷ hoạt động, bộ mã hóa thị giác 1.6 tỷ
Cửa sổ ngữ cảnh 1 triệu token
Đầu vào Văn bản, hình ảnh
Suy luận Tham số reasoning_effort ("high" hoặc "none")
Công cụ Gọi hàm, đầu ra có cấu trúc, công cụ agent tích hợp
Điểm cuối (Endpoints) /v1/chat/completions, /v1/conversations, /v1/agents, /v1/batch
Trọng số (Weights) Mở, vào cuối tháng 10 năm 2026; giấy phép chưa được công bố

Giá: mô hình tiên tiến rẻ nhất bạn có thể sử dụng hôm nay

Đây là phần mà các đội ngũ API nên chú ý. Trang giá của Mistral niêm yết Large 4 với giá bằng một nửa giá niêm yết trong thời gian xem trước:

Mô hình Đầu vào / 1M Đầu ra / 1M Trọng số mở
Mistral Large 4 (giá xem trước) $0.68 $2.09 Có, cuối tháng 10
Mistral Large 4 (giá niêm yết) $1.36 $4.18 Có, cuối tháng 10
Claude Opus 5.5 $4.00 $20.00 Không
GPT-6 Astra $10.00 $50.00 Không

Với giá xem trước, đầu ra của Large 4 có giá xấp xỉ một phần hai mươi tư so với Astra. Ngay cả với giá niêm yết, nó vẫn rẻ hơn khoảng 12 lần cho đầu ra. Đầu vào được lưu trữ giảm xuống còn $0.07 mỗi triệu, điều này quan trọng đối với các agent gửi lại cùng một system prompt và định nghĩa công cụ trong mỗi lượt.

Mistral chưa cho biết khi nào chương trình giảm giá xem trước kết thúc, vì vậy hãy lập ngân sách dựa trên giá niêm yết.

Bạn có nên chuyển đổi?

Cách kiểm tra Large 4 với API của riêng bạn trong Apidog

Các điểm chuẩn cho bạn biết một mô hình hoạt động như thế nào trên các tác vụ của người khác. Cách nhanh hơn để quyết định là chạy Large 4 với lời nhắc của riêng bạn và so sánh nó với mô hình bạn đang sử dụng hôm nay. Apidog xử lý điều đó mà không cần một dòng mã phụ nào:

  1. **Lưu yêu cầu một lần.** Tạo POST https://api.mistral.ai/v1/chat/completions, lưu khóa của bạn dưới dạng biến môi trường và đặt Authorization: Bearer {{MISTRAL_API_KEY}}.
  2. **Sao chép cho mỗi mô hình.** Nhân đôi yêu cầu, chỉ thay đổi trường model (mistral-large-4 so với mô hình hiện tại của bạn) và gửi cả hai. Apidog hiển thị phản hồi, trạng thái, độ trễ và kích thước cạnh nhau, và khối usage cung cấp cho bạn số lượng token để so sánh chi phí.
  3. **Thêm xác nhận.** Kiểm tra trạng thái 200, câu trả lời không trống và khớp với JSON Schema nếu bạn yêu cầu đầu ra có cấu trúc. Điều đó biến một thử nghiệm đơn lẻ thành một bài kiểm tra hồi quy.
  4. **Chạy lại sau mỗi lần cập nhật mô hình.** Gom các yêu cầu thành một kịch bản kiểm thử và chạy lại khi Mistral cập nhật bản xem trước hoặc phát hành trọng số. Bạn sẽ biết liệu chất lượng có thay đổi hay không trước khi người dùng của bạn nhận ra.

Hai điểm mạnh của Large 4 rất phù hợp với công việc API. Kết quả bảo mật của nó khiến nó trở thành một người đánh giá thứ hai tốt cho kiểm thử bảo mật API, ví dụ khi bạn tái tạo một lỗ hổng vượt quyền xác thực trong API thử nghiệm của riêng bạn. Khả năng gọi hàm và đầu ra có cấu trúc của nó cho phép bạn biến một thông số kỹ thuật OpenAPI được thiết kế trong Apidog thành định nghĩa công cụ mà một agent có thể gọi.

Để biết hướng dẫn mã đầy đủ, bao gồm khóa, các phần suy luận, hình ảnh, gọi hàm và tính toán chi phí, hãy xem hướng dẫn API Mistral Large 4 của chúng tôi. Bạn đang sử dụng một mô hình Mistral cũ hơn? Những điều cơ bản về API Mistral AI và hướng dẫn API Mistral Medium 3.5 vẫn áp dụng: cùng URL cơ sở, cùng xác thực, ID mô hình mới.

Câu hỏi thường gặp

Tóm lại

Mistral đã trở lại trong cuộc trò chuyện về các mô hình tiên tiến. Large 4 là mô hình mã nguồn mở mạnh nhất bên ngoài Trung Quốc theo số liệu của Mistral, nó có chi phí chỉ bằng một phần nhỏ so với Astra hoặc Opus 5.5, và nó sẽ chạy được trên phần cứng của riêng bạn trong vài tuần tới. Luận điểm “đánh bại Astra và Claude về an ninh mạng” là có thật nhưng xuất phát từ việc họ từ chối nhiệm vụ, và phán quyết trung thực về mã hóa là “thua kém Claude.” Hãy kiểm tra nó trên API của riêng bạn trong Apidog ngay bây giờ khi giá xem trước còn hiệu lực, và hãy hoãn quyết định đưa vào sản xuất cho đến khi các điểm chuẩn độc lập xuất hiện sau ngày 27 tháng 10.

nút

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API