Top 7 LLM Không Kiểm Duyệt Chạy Cục Bộ Tốt Nhất 2026

7 LLM không kiểm duyệt tốt nhất bạn có thể chạy cục bộ vào năm 2026, được xếp hạng theo VRAM: Qwen 3.8-27B Uncensored, Dolphin 3.0, Hermes 4, Gemma 4 A4B và hơn thế nữa, cùng với kích thước lượng tử hóa và ghi chú cài đặt.

Ashley Innocent

Ashley Innocent

19 tháng 8 2026

Top 7 LLM Không Kiểm Duyệt Chạy Cục Bộ Tốt Nhất 2026

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Cảnh quan các mô hình cục bộ không kiểm duyệt đã thay đổi vào ngày 14 tháng 8 năm 2026. Ngày hôm đó, Alibaba đã đẩy các trọng số mở cho Qwen 3.8-27B lên Hugging Face, và chỉ trong vài giờ, cộng đồng đã tạo ra các bản dựng được lượng tử hóa xuống kích thước mà một chiếc RTX 5090 hoặc MacBook 24GB có thể chạy. Lần đầu tiên, mô hình mạnh nhất bạn có thể chạy mà không bị từ chối cũng gần như là mô hình mở mạnh nhất, chấm hết.

Điều đó làm cho hầu hết các danh sách "LLM không kiểm duyệt tốt nhất" trở nên lỗi thời. Các bảng xếp hạng vẫn còn lưu hành vào năm 2026 đề xuất các phiên bản finetune của Llama 2 và Vicuna, các mô hình đã ba thế hệ sau những gì bạn có thể tải từ Hugging Face ngày nay. Danh sách này bắt đầu từ đầu: bảy mô hình, tất cả đều đã được xác minh có thể tải xuống ngay bây giờ, được phân loại theo VRAM bạn sở hữu thay vì theo các chi tiết nhỏ về điểm chuẩn.

Một định nghĩa trước khi xếp hạng, bởi vì các thuật ngữ thường bị lẫn lộn ở mọi nơi. Một LLM không kiểm duyệt là một mô hình mà hành vi từ chối đã được loại bỏ hoặc chưa bao giờ được huấn luyện. Nó sẽ không từ chối một lời nhắc dựa trên chính sách. Điều đó cũng có nghĩa là nó hoàn toàn không có rào cản: bạn là lớp an toàn, và các đầu ra là trách nhiệm của bạn. Mỗi mô hình dưới đây là một công cụ nghiên cứu và tự lưu trữ, không phải một trợ lý được lưu trữ.

“Không kiểm duyệt” diễn ra như thế nào: ba phương pháp khác nhau

Biết phương pháp nào đã tạo ra một mô hình sẽ cho bạn biết nó sẽ hoạt động như thế nào.

Loại bỏ (Abliteration). Các nhà nghiên cứu xác định hướng kích hoạt nội bộ chịu trách nhiệm cho các hành vi từ chối và loại bỏ nó một cách phẫu thuật khỏi các trọng số. Không liên quan đến việc huấn luyện lại. Mô hình giữ nguyên trí thông minh cơ bản của nó gần như nguyên vẹn nhưng ngừng từ chối các yêu cầu. Các nhà xây dựng cộng đồng như huihui-ai và orcarouter xuất bản các phiên bản đã được loại bỏ của các mô hình mở lớn trong vòng vài ngày sau khi phát hành.

Finetuning không từ chối. Phương pháp Dolphin: huấn luyện lại mô hình cơ bản trên một tập dữ liệu được tuyển chọn đã loại bỏ các hành vi từ chối. Điều này thay đổi tính cách của mô hình nhiều hơn so với phương pháp loại bỏ, và chất lượng phụ thuộc vào tập dữ liệu finetune.

Căn chỉnh trung lập. Nous Research huấn luyện các mô hình Hermes để tuân theo lời nhắc hệ thống của bạn thay vì một quy tắc đạo đức của nhà cung cấp. Mô hình không bị "mổ thùy não"; nó có thể được điều khiển. Bạn định nghĩa các quy tắc cho mỗi lần triển khai.

Cả ba đều tạo ra một mô hình trả lời nơi các trợ lý thương mại từ chối. Chúng khác nhau ở mức độ năng lực cơ bản còn sót lại và mức độ kiểm soát bạn giữ.

Cách danh sách này được xếp hạng

Ba tiêu chí, theo thứ tự:

  1. Sức mạnh của mô hình cơ bản. Một bản dựng không kiểm duyệt kế thừa giới hạn của cơ sở của nó. Một cơ sở năm 2026 đánh bại một cơ sở năm 2024 ở cùng kích thước.
  2. Chạy trên phần cứng mà mọi người sở hữu. Mỗi mục liệt kê kích thước lượng tử hóa và VRAM hoặc bộ nhớ hợp nhất tối thiểu cần thiết. Các nhóm: 12 đến 16GB, 16 đến 24GB, và cấp máy trạm.
  3. Tính khả dụng đã được xác minh. Mỗi mô hình đều liên kết đến một kho lưu trữ Hugging Face trực tiếp hoặc trang chính thức. Không có liên kết hỏng, không có "sắp ra mắt".

So sánh nhanh trước khi đi vào chi tiết:

# Mô hình Phương pháp Phù hợp với Tốt nhất cho
1 Qwen 3.8-27B Không kiểm duyệt Loại bỏ 16 đến 24GB Tổng thể tốt nhất: viết mã, tác nhân, thị giác
2 Dolphin 3.0 Mistral 24B Finetune không từ chối 16 đến 24GB Trò chuyện chung, gọi hàm, biến thể suy luận R1
3 Hermes 4 (14B / 36B / 70B) Căn chỉnh trung lập 12GB trở lên Hành vi có thể điều khiển mà bạn định nghĩa theo lời nhắc hệ thống
4 Huihui Qwen 3.6-27B đã được loại bỏ Loại bỏ 16 đến 24GB Kinh điển đã được chứng minh, hệ sinh thái lượng tử hóa khổng lồ
5 Gemma 4 26B-A4B không kiểm duyệt Loại bỏ 12 đến 16GB Tốc độ trên phần cứng khiêm tốn (MoE, ~4B hoạt động)
6 Mistral Small 3.2 đã được loại bỏ Loại bỏ 12 đến 16GB Viễn tưởng, nhập vai, viết sáng tạo
7 Huihui GLM-5.1 đã được loại bỏ Loại bỏ 256GB+ Mô hình mở đã được loại bỏ lớn nhất hiện có

1. Qwen 3.8-27B Không kiểm duyệt: tổng thể tốt nhất mới

Mô hình cơ bản là câu chuyện ở đây. Qwen 3.8-27B là phiên bản trọng số mở mật độ của Qwen 3.8-Max, được phát hành vào ngày 14 tháng 8 năm 2026 trên Hugging Face và ModelScope. Nó hiểu hình ảnh và video một cách tự nhiên, nhắm mục tiêu vào các khối lượng công việc mã hóa và tác nhân, và công bố các số liệu điểm chuẩn công khai cạnh tranh với các mô hình tiên tiến đóng. Không có mô hình nào khác trong danh sách này có cơ sở hiện đại như vậy.

Cộng đồng đã di chuyển nhanh chóng. orcarouter/Qwen3.8-27B-Uncensored-GGUF là bản dựng GGUF đã được loại bỏ, với các lượng tử hóa được ánh xạ tới phần cứng thực:

Một bản dựng FP8 tồn tại cho vLLM nếu bạn phục vụ trên một thẻ máy trạm, và một biến thể tích cực hơn (0xKitkat/Qwen3.8-27B-Uncensored-Aggressive) loại bỏ nhiều hành vi gần với từ chối hơn với một số chi phí về năng lực. Trên một chiếc RTX 5090 máy tính để bàn, hãy mong đợi khoảng 45 token mỗi giây ở Q4; người dùng đã chạy nó trong cấu hình hàng ngày trong vòng một giờ sau khi các trọng số được phát hành.

Một lưu ý khi cài đặt: kiến trúc qwen35 và hỗ trợ MTP đã có mặt trong llama.cpp vào tháng 5 năm 2026. Cập nhật lên một bản dựng từ 2026-05 trở lên, nếu không GGUF sẽ không tải. Quy tắc tương tự áp dụng thông qua Ollama và LM Studio, vốn tích hợp llama.cpp bên dưới.

Tốt nhất cho: bất kỳ ai có VRAM 16GB+ muốn mô hình cục bộ mạnh nhất, dù có kiểm duyệt hay không. Thực tế là nó không kiểm duyệt là một phần thưởng thêm vào một cơ sở gần với các mô hình tiên tiến.

2. Dolphin 3.0 Mistral 24B: cựu chiến binh finetune, vẫn sắc bén

Loạt Dolphin của Eric Hartford là dự án không kiểm duyệt hoạt động lâu nhất, và Dolphin3.0-Mistral-24B là sản phẩm hàng đầu hiện tại của nó. Không giống như các mục đã được loại bỏ, Dolphin là một finetune không từ chối hoàn chỉnh: được huấn luyện lại trên một tập dữ liệu được tuyển chọn, được điều chỉnh cho việc tuân thủ hướng dẫn, mã hóa, toán học và gọi hàm.

Hai điều giữ nó trong danh sách vào năm 2026. Thứ nhất, biến thể R1 bổ sung khả năng suy luận, được huấn luyện trong ba epoch trên 800 nghìn dấu vết suy luận từ tập dữ liệu Dolphin-R1, vì vậy bạn có được hành vi chuỗi suy nghĩ mà không cần bộ lọc của nhà cung cấp quyết định suy nghĩ nào được phép. Thứ hai, hệ sinh thái: Dolphin có hỗ trợ Ollama hạng nhất, các lượng tử hóa GGUF trưởng thành ở mọi kích thước và nhiều năm mẫu lời nhắc của cộng đồng.

Ở 24B mật độ, các lượng tử hóa Q4 có dung lượng khoảng 14 đến 15GB, thoải mái trên thẻ 24GB và có thể hoạt động trên 16GB với lượng tử hóa nhỏ hơn.

Tốt nhất cho: trò chuyện cục bộ đa năng và công việc tác nhân khi bạn thích một mô hình được huấn luyện lại một cách có chủ đích hơn là một mô hình được chỉnh sửa phẫu thuật, và cho bản dựng R1 nếu bạn muốn suy luận không kiểm duyệt.

3. Hermes 4: không kiểm duyệt theo triết lý, không phải phẫu thuật

Hermes 4 từ Nous Research có quan điểm rằng sự căn chỉnh thuộc về người vận hành. Các mô hình được huấn luyện để tuân theo lời nhắc hệ thống của bạn thay vì một quy tắc đạo đức của công ty. Nous gọi đó là căn chỉnh trung lập, và Hermes 4 đứng đầu RefusalBench trong số các mô hình mở và đóng vì tuân thủ ý định của người dùng mà không có các từ chối chung chung.

Gia đình này bao gồm 14B, 36B (bao gồm cả bản dựng 4.3-36B mới hơn), 70B và 405B cho những người có máy chủ lớn. Tất cả đều là bộ suy luận lai: bao gồm thẻ suy luận và mô hình suy nghĩ lâu hơn về các vấn đề khó, bỏ qua nó và bạn nhận được câu trả lời trực tiếp nhanh chóng.

Sự khác biệt thực tế so với các mô hình đã được loại bỏ là quan trọng. Một mô hình đã được loại bỏ không thể từ chối bất cứ điều gì, không bao giờ. Hermes sẽ tuân theo bất kỳ chính sách nào bạn viết vào lời nhắc hệ thống, bao gồm cả một chính sách với các giới hạn bạn chọn. Đối với nhiều người tự lưu trữ, đó là thuộc tính hữu ích hơn: không kiểm duyệt theo mặc định, có thể quản lý theo yêu cầu.

Tốt nhất cho: các nhà điều hành muốn tự định nghĩa hành vi của mô hình. 14B phù hợp với thẻ 12GB ở Q4; 36B cần 24GB.

4. Huihui Qwen 3.6-27B đã được loại bỏ: "con ngựa thồ" đã được chứng minh

Trước khi Qwen 3.8 ra mắt, các phiên bản loại bỏ của Qwen 3.6 của huihui-ai là khuyến nghị mặc định cho việc sử dụng cục bộ không kiểm duyệt, và chúng vẫn là lựa chọn an toàn. Qwen 3.6 (tháng 4 năm 2026) đã chứng tỏ là một cơ sở đặc biệt sạch sẽ cho việc loại bỏ: hướng từ chối được loại bỏ với tổn thất khả năng tối thiểu, đó là lý do tại sao bản dựng 27B xuất hiện ở đầu bảng xếp hạng cộng đồng suốt cả năm.

Hệ sinh thái là điểm thu hút. Huihui xuất bản toàn bộ dải lượng tử hóa trên Hugging Face và gương sang Ollama, vì vậy ollama run sẽ giúp bạn bắt đầu chỉ với một lệnh. Có một biến thể 14B có khả năng thị giác cho các thẻ nhỏ hơn, và một finetune cá tính Samantha được xếp chồng lên bản loại bỏ nếu bạn muốn một mặc định đàm thoại ấm áp hơn.

Hãy chọn cái này thay vì mục #1 nếu bạn coi trọng một bản dựng đã được kiểm chứng qua nhiều tháng xác thực của cộng đồng hơn là một cơ sở mới nhất, hoặc nếu yêu cầu llama.cpp của Qwen 3.8 chặn chuỗi công cụ hiện tại của bạn.

Tốt nhất cho: một trình điều khiển hàng ngày ổn định, được xác thực rộng rãi trên VRAM 16 đến 24GB.

5. Gemma 4 26B-A4B không kiểm duyệt: tốc độ trên phần cứng khiêm tốn

Hầu hết các mô hình trong danh sách này đều là mô hình dày đặc, vì vậy mỗi token đều phải trả giá cho mỗi tham số. Gemma 4 26B-A4B là một bản dựng kết hợp các chuyên gia (mixture-of-experts): tổng cộng 26B tham số, khoảng 4B hoạt động trên mỗi token. Phiên bản đã được loại bỏ mang lại cho bạn đầu ra không kiểm duyệt với thông lượng mà một mô hình 27B dày đặc không thể sánh được trên cùng một thẻ.

Điều đó làm cho nó trở thành người chiến thắng trong nhóm thiết lập 12 đến 16GB. Trong khi một mô hình 27B dày đặc ở Q3 cảm thấy bị ảnh hưởng trên GPU 16GB, kiến trúc A4B duy trì chất lượng cao trong khi tạo ra đầu ra nhanh hơn nhiều lần. Trên Apple Silicon với bộ nhớ hợp nhất 16GB, đó là sự khác biệt giữa có thể sử dụng và gây khó chịu.

Sự đánh đổi là chiều sâu trong các tác vụ suy luận khó, nơi các mục dày đặc #1 và #2 vượt trội hơn. Đối với tóm tắt, soạn thảo, trích xuất và trò chuyện, bạn sẽ hiếm khi nhận thấy.

Tốt nhất cho: phần cứng cấp laptop, máy Mac 16GB và bất kỳ ai coi trọng số token mỗi giây hơn chiều sâu suy luận tối đa.

6. Mistral Small 3.2 đã được loại bỏ: lựa chọn của nhà văn

Hỏi các cộng đồng nhập vai và tiểu thuyết mô hình không kiểm duyệt nào họ đang chạy và câu trả lời vào năm 2026 luôn là Mistral Small 3.2 đã được loại bỏ. Các mô hình cơ bản của Mistral có một chất lượng văn xuôi khác biệt: ít thích liệt kê hơn, tốt hơn trong việc duy trì giọng văn trong bối cảnh dài, ít có xu hướng bị giọng văn "trợ lý" rò rỉ qua các bản finetune của Qwen và Llama.

Việc loại bỏ quan trọng hơn đối với viết sáng tạo hơn là đối với mã. Các mô hình thương mại từ chối hoặc làm sạch một phần lớn các tiểu thuyết hợp pháp: nhân vật phản diện, bạo lực, người kể chuyện có đạo đức xám. Một Mistral Small đã được loại bỏ sẽ viết cảnh bạn yêu cầu và giữ nguyên giọng văn bạn đã thiết lập.

Với khoảng 24B mật độ, các lượng tử hóa có dung lượng tương tự như Dolphin: Q4 khoảng 14GB, hoạt động tốt trên các thẻ 16GB trở lên.

Tốt nhất cho: tiểu thuyết, nhập vai và bất kỳ công việc viết lách nào mà việc làm sạch gần với từ chối làm hỏng chất lượng đầu ra.

7. Huihui GLM-5.1 đã được loại bỏ: giới hạn

Mô hình mở đã được loại bỏ lớn nhất hiện có: Huihui-GLM-5.1-abliterated-GGUF, một MoE 754 tỷ tham số được phân phối dưới dạng tệp 236GB ngay cả ở lượng tử hóa IQ2_M. Đây không phải là mô hình dành cho người tiêu dùng. Nó cần một Mac Studio 256GB+, một dàn nhiều GPU, hoặc một máy chủ với RAM lớn để CPU offload.

Nó xứng đáng với vị trí của mình vì nó trả lời một câu hỏi mà sáu mô hình kia không thể: AI cục bộ không kiểm duyệt có thể mở rộng đến mức nào? Câu trả lời bây giờ là "đến một mô hình cạnh tranh với các hệ thống tiên tiến được lưu trữ," điều này không đúng một năm trước. Nếu bạn có phần cứng, không có gì tự lưu trữ và không giới hạn có thể sánh được.

Tốt nhất cho: chủ sở hữu Mac Studio, những người đam mê homelab có ngân sách máy trạm và các nhóm nghiên cứu cần khả năng cấp độ tiên tiến mà không có chính sách bên ngoài nào.

Chạy bất kỳ mô hình nào trong số này: phục vụ nó, sau đó coi nó như một API

Mọi mô hình ở trên đều được triển khai theo cùng một cách: llama.cpp, Ollama hoặc LM Studio cho các bản dựng GGUF, vLLM cho FP8. Tất cả chúng đều hiển thị một điểm cuối tương thích OpenAI trên localhost, có nghĩa là mô hình cục bộ của bạn là một API ngay khi nó tải:

ollama run huihui_ai/qwen3.6-abliterated:27b
# Điểm cuối tương thích OpenAI hiện đang hoạt động tại http://localhost:11434/v1

Điểm cuối đó xứng đáng được đối xử giống như bất kỳ API nào bạn xây dựng. Trỏ Apidog đến http://localhost:11434/v1/chat/completions và bạn có thể lưu các tải trọng lời nhắc dưới dạng yêu cầu có thể tái sử dụng, đối chiếu các phản hồi trên các lượng tử hóa của cùng một mô hình, khẳng định cấu trúc phản hồi trước khi kết nối điểm cuối vào một ứng dụng và mô phỏng các phản hồi của mô hình để các bài kiểm tra tích hợp của bạn không đốt cháy thời gian GPU. Quy trình làm việc giống hệt với quy trình trong hướng dẫn cục bộ Kimi K3 của chúng tôi: kéo trọng số, phục vụ, sau đó gỡ lỗi điểm cuối như một dịch vụ sản xuất. Tải xuống Apidog và toàn bộ vòng lặp chạy ngoại tuyến, điều này phù hợp với lý do bạn bắt đầu với cục bộ ngay từ đầu.

Các mô hình không kiểm duyệt làm cho việc kiểm tra cấp điểm cuối trở nên quan trọng hơn, chứ không phải ít quan trọng hơn. Với việc không có lớp từ chối trong mô hình, ứng dụng của bạn cần các kiểm tra đầu vào và đầu ra riêng, và đó chính xác là các khẳng định yêu cầu và phản hồi mà một ứng dụng khách API tự động hóa.

Câu hỏi thường gặp

Có hợp pháp để tải xuống và chạy các mô hình này không? Tải xuống các mô hình trọng số mở và các bản phái sinh đã được loại bỏ từ Hugging Face là hợp pháp ở hầu hết các khu vực pháp lý. Mỗi kho lưu trữ đều có giấy phép (Apache 2.0, các điều khoản của Gemma hoặc tương tự) điều chỉnh việc sử dụng lại cho mục đích thương mại. Những gì bạn tạo ra và cách bạn sử dụng nó vẫn là trách nhiệm của bạn, giống như bất kỳ công cụ nào.

Các mô hình đã được loại bỏ có trở nên kém thông minh hơn không? Hơi kém một chút, và nó thay đổi theo từng bản dựng. Việc loại bỏ một hướng trong không gian kích hoạt, và việc loại bỏ mạnh mẽ có thể ảnh hưởng đến các khả năng lân cận. Các bản dựng được tạo tốt như những bản được liệt kê ở đây đo lường tổn thất ở một vài điểm chuẩn. Các bản finetune không từ chối như Dolphin bỏ qua phẫu thuật nhưng thay đổi tính cách mô hình. Phân tích điểm chuẩn Qwen 3.8 của chúng tôi bao gồm điểm số của cơ sở không sửa đổi, đó là giới hạn của bạn trong mọi trường hợp.

Phần cứng tối thiểu để bắt đầu là gì? Một GPU 12GB hoặc một Mac Apple Silicon 16GB chạy Hermes 4 14B hoặc bản dựng Gemma 4 A4B với tốc độ có thể sử dụng được. Điểm tối ưu vào năm 2026 là 24GB VRAM hoặc 32GB bộ nhớ hợp nhất, mở khóa lớp 24B đến 27B nơi các mục #1, #2 và #4 tồn tại. Bạn cũng có thể sử dụng Qwen 3.8 miễn phí thông qua các kênh được lưu trữ trước để đánh giá xem mô hình cơ bản có phù hợp với công việc của bạn không trước khi tải xuống 17GB trọng số.

Tại sao không phải một trong các mô hình trong danh sách cũ hơn, như WizardLM hoặc Vicuna? Tuổi của mô hình cơ bản. Một bản finetune 13B thời kỳ 2023 thua một bản 27B năm 2026 trên mọi khía cạnh: suy luận, độ dài ngữ cảnh, mã hóa, đầu ra đa ngôn ngữ. Các bản dựng không kiểm duyệt kế thừa giới hạn của cơ sở của chúng, vì vậy bảng xếp hạng ở trên bắt đầu từ các cơ sở hiện tại và chỉ giảm xuống khi phần cứng yêu cầu.

Kết luận

Qwen 3.8-27B Uncensored là câu trả lời mặc định vào năm 2026: cơ sở mới nhất, hỗ trợ đa phương thức thực sự và các lượng tử hóa phù hợp với các card mà mọi người sở hữu. Dolphin 3.0 là lựa chọn finetune thay thế với hệ sinh thái sâu rộng nhất, và Hermes 4 là lựa chọn của những người vận hành có tư duy, không kiểm duyệt theo triết lý và có thể quản lý bằng lời nhắc hệ thống. Dưới 16GB, hãy chọn bản dựng Gemma 4 A4B để có tốc độ hoặc Mistral Small 3.2 đã được loại bỏ cho văn xuôi. Và bất kể bạn sử dụng cái nào, hãy nhớ rằng nó khởi động như một API không được bảo vệ trên localhost: hãy kiểm tra nó với Apidog giống như bạn sẽ làm với bất kỳ điểm cuối nào bạn định tin tưởng.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API