2026년 로컬 구동 무검열 LLM 베스트 7

2026년에 로컬에서 실행할 수 있는 검열 없는 최고의 LLM 7가지 (VRAM 순위): Qwen 3.8-27B Uncensored, Dolphin 3.0, Hermes 4, Gemma 4 A4B 등, 양자화 크기 및 설정 지침 포함.

Ashley Innocent

Ashley Innocent

19 August 2026

2026년 로컬 구동 무검열 LLM 베스트 7

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

검열되지 않은 로컬 모델 환경은 2026년 8월 14일에 변화했습니다. 그날, 알리바바는 Qwen 3.8-27B의 오픈 가중치를 Hugging Face에 공개했고, 몇 시간 안에 커뮤니티는 단일 RTX 5090 또는 24GB MacBook이 감당할 수 있는 크기로 양자화된 제거 빌드를 만들어냈습니다. 거부 없이 실행할 수 있는 가장 강력한 모델이 가장 강력한 오픈 모델에 근접한 것은 이번이 처음입니다.

이로 인해 대부분의 "최고의 검열되지 않은 LLM" 목록은 구식이 되었습니다. 2026년에 여전히 유통되는 순위는 오늘날 Hugging Face에서 얻을 수 있는 것보다 세 세대 뒤떨어진 모델인 Llama 2 파인튜닝과 Vicuna를 추천합니다. 이 목록은 벤치마크 세부 사항보다는 소유한 VRAM에 따라 분류된, 현재 다운로드 가능함이 확인된 7가지 모델로 처음부터 다시 시작합니다.

순위를 매기기 전에 용어들이 어디서든 모호해지기 때문에 한 가지 정의를 내립니다. 검열되지 않은 LLM은 거부 행동이 제거되었거나 애초에 훈련되지 않은 모델입니다. 정책적인 이유로 프롬프트를 거부하지 않습니다. 이는 또한 어떠한 안전 장치도 없음을 의미합니다. 여러분이 안전 계층이며, 출력물은 여러분의 책임입니다. 아래의 모든 모델은 연구 및 자체 호스팅 도구이며, 호스팅된 어시스턴트가 아닙니다.

"검열되지 않음"이 일어나는 방법: 세 가지 다른 방식

어떤 방법으로 모델이 만들어졌는지 알면 그 모델이 어떻게 작동할지 알 수 있습니다.

제거(Abliteration). 연구자들은 거부를 담당하는 내부 활성화 방향을 식별하여 가중치에서 외과적으로 제거합니다. 재훈련은 포함되지 않습니다. 모델은 기본 지능을 거의 그대로 유지하지만 요청을 거부하는 것을 멈춥니다. huihui-ai 및 orcarouter와 같은 커뮤니티 빌더들은 주요 오픈 모델의 제거 버전을 출시 후 며칠 내에 공개합니다.

거부 없는 파인튜닝. Dolphin 방식: 거부 반응이 제거된 선별된 데이터셋으로 기본 모델을 재훈련합니다. 이는 제거 방식보다 모델의 개성을 더 많이 변화시키며, 품질은 파인튜닝 데이터셋에 따라 달라집니다.

중립 정렬. Nous Research는 Hermes 모델이 공급업체 윤리 규범 대신 사용자의 시스템 프롬프트를 따르도록 훈련합니다. 모델은 '전두엽 절제술'을 받은 것이 아니며; 조종 가능합니다. 배포 시마다 규칙을 정의합니다.

세 가지 방식 모두 상업용 어시스턴트가 거부하는 부분에 답변하는 모델을 생성합니다. 이들은 기본 역량이 얼마나 살아남는지, 그리고 사용자가 얼마나 많은 통제권을 유지하는지에서 차이를 보입니다.

이 목록이 순위가 매겨진 방식

다음 세 가지 기준에 따라 순위가 매겨집니다:

  1. 기본 모델 강도. 검열되지 않은 빌드는 기본 모델의 한계를 이어받습니다. 동일한 크기에서 2026년 기본 모델은 2024년 기본 모델을 능가합니다.
  2. 사람들이 소유한 하드웨어에서 실행 가능 여부. 각 항목은 양자화 크기와 이를 저장할 수 있는 최소 VRAM 또는 통합 메모리를 나열합니다. 분류: 12~16GB, 16~24GB, 워크스테이션급.
  3. 확인된 가용성. 모든 모델은 활성 Hugging Face 저장소 또는 공식 페이지로 연결됩니다. 깨진 링크나 '출시 예정'은 없습니다.

자세한 내용에 앞서 간략한 비교:

# 모델 방식 적합 VRAM 최적 용도
1 Qwen 3.8-27B 검열되지 않음 제거(Abliteration) 16~24GB 종합 최고: 코딩, 에이전트, 비전
2 Dolphin 3.0 Mistral 24B 거부 없는 파인튜닝 16~24GB 일반 채팅, 함수 호출, R1 추론 변형
3 Hermes 4 (14B / 36B / 70B) 중립 정렬 12GB 이상 시스템 프롬프트별로 정의하는 조종 가능한 행동
4 Huihui Qwen 3.6-27B 제거 버전 제거(Abliteration) 16~24GB 검증된 고전, 거대한 양자화 생태계
5 Gemma 4 26B-A4B 검열되지 않음 제거(Abliteration) 12~16GB 보통 하드웨어에서의 속도 (MoE, ~4B 활성)
6 Mistral Small 3.2 제거 버전 제거(Abliteration) 12~16GB 소설, 역할극, 창의적 글쓰기
7 Huihui GLM-5.1 제거 버전 제거(Abliteration) 256GB+ 현재 가장 큰 오픈 제거 모델

1. Qwen 3.8-27B 검열되지 않음: 새로운 종합 최고 모델

여기서 핵심은 기본 모델입니다. Qwen 3.8-27B는 2026년 8월 14일 Hugging Face와 ModelScope에 출시된 Qwen 3.8-Max의 오픈 가중치 밀집형 자매 모델입니다. 이 모델은 이미지와 비디오를 기본적으로 이해하며, 코딩 및 에이전트 작업 부하를 목표로 하고, 비공개 프론티어 모델에 육박하는 공개 벤치마크 점수를 기록합니다. 이 목록의 다른 어떤 모델도 이만큼 최신 기본 모델을 가지고 있지 않습니다.

커뮤니티는 빠르게 움직였습니다. orcarouter/Qwen3.8-27B-Uncensored-GGUF는 실제 하드웨어에 매핑된 양자화된 제거 GGUF 빌드입니다:

워크스테이션 카드에서 서비스를 제공하는 경우 vLLM용 FP8 빌드가 존재하며, 더 공격적인 변형 (0xKitkat/Qwen3.8-27B-Uncensored-Aggressive)은 일부 기능 비용을 감수하고 거부 관련 행동을 더 많이 제거합니다. 데스크톱 RTX 5090에서 Q4로 초당 약 45토큰을 기대할 수 있습니다. 소유자들은 가중치 공개 후 한 시간 이내에 일상적인 설정에서 이를 실행했습니다.

한 가지 설정 주의사항: qwen35 아키텍처와 MTP 지원은 2026년 5월에 llama.cpp에 적용되었습니다. 2026년 5월 또는 그 이후 빌드로 업데이트해야 하며, 그렇지 않으면 GGUF가 로드되지 않습니다. llama.cpp를 내부에 번들로 제공하는 Ollama 및 LM Studio에도 동일한 규칙이 적용됩니다.

최적 용도: 16GB 이상의 VRAM을 가진 사용자 중 가장 강력한 로컬 모델(검열 여부 무관)을 원하는 모든 사람. 이 모델이 검열되지 않았다는 사실은 최신 기술에 가까운 기본 모델에 더해진 보너스입니다.

2. Dolphin 3.0 Mistral 24B: 여전히 날카로운 파인튜닝 베테랑

에릭 하트포드의 Dolphin 시리즈는 가장 오랫동안 운영된 검열되지 않은 프로젝트이며, Dolphin3.0-Mistral-24B는 현재 주력 모델입니다. 제거된 모델들과 달리, Dolphin은 완전한 거부 없는 파인튜닝 모델입니다. 선별된 데이터셋으로 재훈련되었으며, 지시 따르기, 코딩, 수학, 함수 호출에 최적화되어 있습니다.

2026년에도 이 모델이 목록에 남아 있는 두 가지 이유가 있습니다. 첫째, R1 변형은 추론 기능을 추가하여 Dolphin-R1 데이터셋의 80만 개 추론 트레이스에 대해 3에포크 동안 훈련되었습니다. 따라서 공급업체 필터가 어떤 사고가 허용되는지 결정하는 것 없이 연쇄적 사고(chain-of-thought) 행동을 얻을 수 있습니다. 둘째, 생태계입니다. Dolphin은 최고 수준의 Ollama 지원, 모든 크기에서 성숙한 GGUF 양자화, 그리고 수년간의 커뮤니티 프롬프트 패턴을 갖추고 있습니다.

24B 밀집 모델의 경우, Q4 양자화는 약 14~15GB이며, 24GB 카드에서는 쾌적하게, 더 작은 양자화로 16GB에서도 작동 가능합니다.

최적 용도: 외과적으로 편집된 모델보다 의도적으로 재훈련된 모델을 선호하는 경우 일반적인 로컬 채팅 및 에이전트 작업에 적합하며, 검열되지 않은 추론을 원한다면 R1 빌드에 적합합니다.

3. Hermes 4: 수술이 아닌 철학으로 검열되지 않음

Nous Research의 Hermes 4는 정렬(alignment)이 운영자에게 달려 있다는 입장을 취합니다. 이 모델은 회사 윤리 규범 대신 사용자의 시스템 프롬프트를 따르도록 훈련되었습니다. Nous는 이를 중립 정렬(neutral alignment)이라고 부르며, Hermes 4는 전면적인 거부 없이 사용자 의도를 준수하는 면에서 오픈 및 클로즈드 모델 중 RefusalBench에서 1위를 차지했습니다.

이 제품군은 14B, 36B (신형 4.3-36B 빌드 포함), 70B, 그리고 서버 랙을 가진 사람들을 위한 405B 모델로 구성됩니다. 모두 하이브리드 추론기입니다. 추론 태그를 포함하면 모델이 어려운 문제에 대해 더 오래 생각하고, 생략하면 빠른 직접 답변을 얻을 수 있습니다.

제거된 모델과의 실제적인 차이는 중요합니다. 제거된 모델은 절대로 어떤 것도 거부할 수 없습니다. Hermes는 사용자가 선택한 제한을 포함하여 시스템 프롬프트에 작성하는 모든 정책을 따릅니다. 많은 자체 호스팅 사용자에게는 이것이 더 유용한 속성입니다. 기본적으로 검열되지 않지만, 필요에 따라 제어할 수 있습니다.

최적 용도: 모델 동작을 직접 정의하고자 하는 운영자. 14B는 Q4로 12GB 카드에 적합하며; 36B는 24GB를 필요로 합니다.

4. Huihui Qwen 3.6-27B 제거 버전: 검증된 일꾼

Qwen 3.8이 출시되기 전, huihui-ai의 Qwen 3.6 제거 버전은 로컬 검열되지 않은 사용을 위한 기본 권장 사항이었으며, 여전히 안전한 선택으로 남아 있습니다. Qwen 3.6 (2026년 4월)은 제거를 위한 이례적으로 깨끗한 기반임을 입증했습니다. 거부 방향이 최소한의 기능 손실로 제거되며, 이것이 27B 빌드가 일년 내내 커뮤니티 순위 상위에 나타나는 이유입니다.

이 모델의 매력은 생태계에 있습니다. Huihui는 Hugging Face에 전체 양자화 버전을 게시하고 Ollama에도 미러링하여, ollama run 명령 하나로 시작할 수 있습니다. 더 작은 카드용 14B 비전 가능 변형이 있으며, 더 따뜻한 대화 기본값을 원한다면 제거 버전에 Samantha 성격 파인튜닝이 추가된 것도 있습니다.

최신 기본 모델보다 수개월간 커뮤니티 검증을 거친 검증된 빌드를 중요하게 생각하거나, Qwen 3.8의 llama.cpp 요구 사항이 현재 툴체인을 막는다면, 1번 항목 대신 이 모델을 선택하세요.

최적 용도: 16~24GB VRAM에서 안정적이고 널리 검증된 일상적인 드라이버.

5. Gemma 4 26B-A4B 검열되지 않음: 적당한 하드웨어에서의 속도

이 목록의 대부분 모델은 밀집형(dense)이므로, 모든 토큰이 모든 매개변수에 비용을 지불합니다. Gemma 4 26B-A4B는 전문가 혼합(mixture-of-experts) 빌드입니다. 총 26B 매개변수를 가지며, 토큰당 약 4B가 활성화됩니다. 제거 버전은 동일한 카드에서 밀집형 27B 모델이 따라올 수 없는 처리량으로 검열되지 않은 출력을 제공합니다.

이것은 12~16GB 설정에서 최고의 선택이 됩니다. 16GB GPU에서 Q3의 밀집형 27B 모델이 절충된 느낌을 주는 반면, A4B 아키텍처는 품질을 유지하면서 몇 배 더 빠르게 생성합니다. 16GB 통합 메모리를 가진 Apple Silicon에서는 사용 가능과 고통스러운 경험의 차이입니다.

단점은 어려운 추론 작업에서 깊이가 떨어진다는 점입니다. 여기서 밀집형 모델인 1번과 2번 항목이 앞섭니다. 요약, 초안 작성, 추출, 채팅의 경우 거의 차이를 느끼지 못할 것입니다.

최적 용도: 노트북급 하드웨어, 16GB Mac 사용자, 그리고 최대 추론 깊이보다 초당 토큰 수를 중요하게 생각하는 모든 사람.

6. Mistral Small 3.2 제거 버전: 작가들의 선택

역할극 및 소설 커뮤니티에 어떤 검열되지 않은 모델을 사용하는지 물어보면, 2026년에는 한결같이 Mistral Small 3.2 제거 버전이라는 답변을 들을 수 있습니다. Mistral의 기본 모델은 독특한 문체적 특성을 가지고 있습니다. 목록 나열을 덜 선호하고, 긴 컨텍스트에서도 일관된 목소리를 유지하는 데 능숙하며, Qwen 및 Llama 파인튜닝에서 나타나는 '어시스턴트 같은' 어조가 새어 나올 가능성이 적습니다.

제거는 코드보다 창의적인 글쓰기에서 더 중요합니다. 상업용 모델은 악당, 폭력, 도덕적으로 회색인 서술자 등 합법적인 소설의 상당 부분을 거부하거나 정제합니다. 제거된 Mistral Small은 사용자가 요청한 장면을 작성하고 설정한 어조를 유지합니다.

대략 24B 밀집 모델의 경우, 양자화는 Dolphin과 비슷합니다. Q4는 약 14GB이며, 16GB 이상의 카드에서 잘 작동합니다.

최적 용도: 소설, 역할극, 그리고 거부와 관련된 정제 작업이 출력 품질을 망가뜨리는 모든 글쓰기 작업.

7. Huihui GLM-5.1 제거 버전: 최고 수준

현재 사용 가능한 가장 큰 오픈 제거 모델: Huihui-GLM-5.1-abliterated-GGUF, IQ2_M 양자화에서도 236GB 파일로 제공되는 754B 매개변수 MoE 모델입니다. 이것은 일반 소비자용 모델이 아닙니다. 이 모델은 256GB 이상의 Mac Studio, 다중 GPU 장비 또는 CPU 오프로드를 위한 강력한 RAM을 갖춘 서버를 필요로 합니다.

이 모델이 이 자리를 차지하는 이유는 다른 6개 모델이 답할 수 없는 질문에 답해주기 때문입니다. 바로 검열되지 않은 로컬 AI가 어디까지 확장될 수 있는가에 대한 질문입니다. 그 답은 이제 "호스팅된 최첨단 시스템과 경쟁하는 모델"까지입니다. 이는 1년 전에는 사실이 아니었습니다. 하드웨어가 있다면, 자체 호스팅되고 무제한적인 모델 중 이 모델에 견줄 만한 것은 없습니다.

최적 용도: Mac Studio 소유자, 워크스테이션 예산을 가진 홈랩 애호가, 그리고 외부 정책이 전혀 없는 최첨단급 기능을 필요로 하는 연구 그룹.

이 모델들을 실행하는 방법: 서비스를 시작하고 API처럼 다루기

위의 모든 모델은 동일한 방식으로 배포됩니다. GGUF 빌드의 경우 llama.cpp, Ollama 또는 LM Studio를 사용하며, FP8의 경우 vLLM을 사용합니다. 이 모든 모델은 로컬호스트에 OpenAI 호환 엔드포인트를 노출하며, 이는 로컬 모델이 로드되는 순간 API가 된다는 의미입니다:

ollama run huihui_ai/qwen3.6-abliterated:27b
# OpenAI-compatible endpoint now live at http://localhost:11434/v1

그 엔드포인트는 여러분이 개발하는 어떤 API와도 동일하게 다루어져야 합니다. Apidoghttp://localhost:11434/v1/chat/completions로 지정하면 프롬프트 페이로드를 재사용 가능한 요청으로 저장하고, 동일 모델의 양자화 버전 간 응답을 비교하고, 엔드포인트를 앱에 연결하기 전에 응답 구조를 검증하고, 모델의 응답을 모의하여 통합 테스트가 GPU 시간을 소모하는 것을 막을 수 있습니다. 워크플로는 Kimi K3 로컬 가이드의 것과 동일합니다. 가중치를 가져오고, 서비스를 시작한 다음, 프로덕션 서비스처럼 엔드포인트를 디버그합니다. Apidog를 다운로드하면 전체 루프가 오프라인으로 실행되며, 이는 애초에 로컬 환경을 선택한 이유와 부합합니다.

검열되지 않은 모델은 엔드포인트 수준 테스트를 덜 중요하게 만드는 것이 아니라 더 중요하게 만듭니다. 모델에 거부 계층이 없으므로 애플리케이션은 자체적인 입력 및 출력 검사가 필요하며, 이는 API 클라이언트가 자동화하는 요청 및 응답 검증과 정확히 일치합니다.

자주 묻는 질문

이러한 모델을 다운로드하고 실행하는 것은 합법적인가요? Hugging Face에서 오픈 가중치 모델과 제거된 파생 모델을 다운로드하는 것은 대부분의 관할 구역에서 합법적입니다. 각 저장소는 상업적 재사용을 규율하는 라이선스(Apache 2.0, Gemma 약관 또는 유사)를 가집니다. 생성하는 내용과 사용 방식은 어떤 도구와 마찬가지로 사용자의 책임입니다.

제거된 모델은 성능이 저하되나요? 약간 그렇고, 빌드마다 다릅니다. 제거는 활성화 공간의 한 방향을 제거하며, 공격적인 제거는 인접한 기능을 손상시킬 수 있습니다. 여기에 나열된 잘 만들어진 빌드는 몇 가지 벤치마크 포인트에서 손실을 측정합니다. Dolphin과 같은 거부 없는 파인튜닝은 '수술'을 피하지만, 대신 모델의 개성을 변화시킵니다. 저희 Qwen 3.8 벤치마크 분석은 수정되지 않은 기본 모델 점수를 다루며, 이는 어떤 경우든 여러분의 상한선이 됩니다.

시작하기 위한 최소 하드웨어 사양은 무엇인가요? 12GB GPU 또는 16GB Apple Silicon Mac은 Hermes 4 14B 또는 Gemma 4 A4B 빌드를 사용할 수 있는 속도로 실행합니다. 2026년의 최적 지점은 24GB VRAM 또는 32GB 통합 메모리이며, 이는 1번, 2번, 4번 항목에 해당하는 24B~27B급 모델을 사용할 수 있게 해줍니다. 또한 17GB의 가중치를 다운로드하기 전에 호스팅된 채널을 통해 Qwen 3.8을 무료로 사용하여 기본 모델이 작업에 적합한지 먼저 평가할 수 있습니다.

WizardLM이나 Vicuna와 같은 구형 목록의 모델은 왜 아닌가요? 기본 모델의 노후화 때문입니다. 2023년형 13B 파인튜닝 모델은 추론, 컨텍스트 길이, 코딩, 다국어 출력 등 모든 면에서 2026년형 27B 모델에 뒤처집니다. 검열되지 않은 빌드는 기본 모델의 한계를 이어받으므로, 위의 순위는 최신 기본 모델부터 시작하며 하드웨어 요구 사항이 있는 경우에만 아래로 내려갑니다.

결론

Qwen 3.8-27B 검열되지 않음 모델은 2026년의 기본 답변입니다. 최신 기본 모델, 실제 멀티모달 지원, 그리고 사람들이 소유한 카드에 맞는 양자화 버전을 제공합니다. Dolphin 3.0은 가장 깊이 있는 생태계를 가진 파인튜닝 대안이며, Hermes 4는 철학적으로 검열되지 않고 시스템 프롬프트로 제어 가능한, 사려 깊은 운영자의 선택입니다. 16GB 미만에서는 속도를 위해 Gemma 4 A4B 빌드를 선택하거나, 문체적 품질을 위해 Mistral Small 3.2 제거 버전을 선택하세요. 어떤 모델을 사용하든, 로컬호스트에서 무방비 API로 부팅된다는 점을 기억하세요. 신뢰할 계획인 다른 모든 엔드포인트처럼 Apidog로 테스트하세요.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요