2026年 ローカル実行可能な未検閲LLMおすすめ7選

2026年にローカルで実行可能な検閲なしLLMベスト7(VRAM順ランキング):Qwen 3.8-27B Uncensored、Dolphin 3.0、Hermes 4、Gemma 4 A4Bなど、量子化サイズとセットアップノートも掲載。

Ashley Innocent

Ashley Innocent

19 8月 2026

2026年 ローカル実行可能な未検閲LLMおすすめ7選

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

ローカルの無検閲モデルの状況は、2026年8月14日に一変しました。その日、AlibabaはQwen 3.8-27BのオープンウェイトをHugging Faceに公開し、数時間のうちにコミュニティは、単一のRTX 5090または24GBのMacBookで実行できるサイズに量子化されたモデルを開発しました。拒否なく実行できる最強のモデルが、史上初めて、最強のオープンモデルに近いものとなったのです。

そのため、ほとんどの「最高の無検閲LLM」リストは時代遅れになっています。2026年現在も出回っているランキングは、今日のHugging Faceから入手できるモデルよりも3世代古いLlama 2のファインチューンやVicunaを推奨しています。このリストはゼロから作成されています。ベンチマークの瑣末な情報ではなく、あなたが所有するVRAMによって分類された、現在ダウンロードが確認されている7つのモデルを紹介します。

ランキングの前に1つ定義を述べておきます。というのも、この用語は至るところで曖昧になっているからです。無検閲LLMとは、拒否行動が除去されているか、最初から学習されていないモデルのことです。ポリシー上の理由でプロンプトを拒否することはありません。これは、ガードレールが一切ないことも意味します。安全層はあなたであり、出力はあなたの責任です。以下のすべてのモデルは、研究およびセルフホスティングツールであり、ホスト型アシスタントではありません。

「無検閲」が実現する方法:3つの異なる手法

どの手法でモデルが生成されたかを知ることで、その挙動を予測できます。

アブリテレーション(Abliteration)。研究者は、拒否の原因となる内部活性化の方向を特定し、それを重みから外科的に除去します。再トレーニングは行われません。モデルは基本的な知性をほぼ無傷で保持したまま、要求を拒否しなくなります。huihui-aiやorcarouterのようなコミュニティビルダーは、主要なオープンモデルのアブリテレーション版をリリース後数日以内に公開しています。

拒否なしファインチューニング(Refusal-free finetuning)。Dolphinのアプローチは、拒否が取り除かれた厳選されたデータセットでベースモデルを再トレーニングします。これはアブリテレーションよりもモデルのパーソナリティを大きく変え、品質はファインチューニングデータセットに依存します。

中立的なアライメント(Neutral alignment)。Nous Researchは、Hermesモデルをベンダーの倫理規定ではなく、あなたのシステムプロンプトに従うようにトレーニングします。モデルはロボトミー手術を受けているわけではなく、操作可能です。展開ごとにルールを定義します。

これら3つの手法はすべて、商用アシスタントが拒否するような質問にも答えるモデルを生み出します。基本的な能力がどの程度残るか、そしてあなたがどの程度の制御を維持できるかで異なります。

このリストのランキング方法

以下の3つの基準が優先順位順に適用されます。

  1. ベースモデルの性能。無検閲ビルドはベースモデルの性能上限を継承します。2026年のベースは、同じサイズでも2024年のベースを凌駕します。
  2. 人々が所有するハードウェアで動作するか。各エントリには、量子化サイズと、それを保持するために必要な最小VRAMまたはユニファイドメモリが記載されています。カテゴリは12~16GB、16~24GB、ワークステーションクラスです。
  3. 検証済みの利用可能性。すべてのモデルは、稼働中のHugging Faceリポジトリまたは公式ページにリンクされています。デッドリンクや「近日公開」はありません。

詳細の前に簡単な比較です。

# モデル 手法 対応VRAM 最適用途
1 Qwen 3.8-27B Uncensored アブリテレーション 16~24GB 総合的に最高:コーディング、エージェント、ビジョン
2 Dolphin 3.0 Mistral 24B 拒否なしファインチューニング 16~24GB 一般的なチャット、関数呼び出し、R1推論バリアント
3 Hermes 4 (14B / 36B / 70B) 中立的なアライメント 12GB以上 システムプロンプトで定義可能な操作可能な挙動
4 Huihui Qwen 3.6-27B abliterated アブリテレーション 16~24GB 実績ある定番、大規模な量子化エコシステム
5 Gemma 4 26B-A4B uncensored アブリテレーション 12~16GB modestハードウェアでの速度(MoE、約4Bアクティブ)
6 Mistral Small 3.2 abliterated アブリテレーション 12~16GB フィクション、ロールプレイ、クリエイティブライティング
7 Huihui GLM-5.1 abliterated アブリテレーション 256GB以上 最大のオープンアブリテレーションモデル

1. Qwen 3.8-27B Uncensored: 新たな総合ベストモデル

ここではベースモデルが重要です。Qwen 3.8-27Bは、2026年8月14日にHugging FaceとModelScopeでリリースされたQwen 3.8-Maxのオープンウェイト密結合兄弟モデルです。画像と動画をネイティブに理解し、コーディングとエージェントのワークロードをターゲットにしており、クローズドな最先端モデルに匹敵する公開ベンチマークスコアを記録しています。このリストにある他のどのモデルも、これほど最新のベースを持つものはありません。

コミュニティは迅速に動きました。orcarouter/Qwen3.8-27B-Uncensored-GGUFは、実際のハードウェアにマッピングされた量子化モデルを含むアブリテレーションされたGGUFビルドです。

ワークステーションカードでサービス提供する場合はvLLM用のFP8ビルドが存在し、より積極的なバリアント(0xKitkat/Qwen3.8-27B-Uncensored-Aggressive)は、一部の機能コストと引き換えに、より拒否に近い挙動を取り除いています。デスクトップRTX 5090では、Q4で秒間約45トークンを期待できます。オーナーは、ウェイトが公開されてから1時間以内に日常のセットアップで実行していました。

セットアップの注意点として、qwen35アーキテクチャとMTPサポートは2026年5月にllama.cppに導入されました。2026年5月以降のビルドに更新しないと、GGUFはロードされません。これは、llama.cppを内包するOllamaおよびLM Studioにも同様に適用されます。

最適用途:16GB以上のVRAMを持つ人で、検閲ありなしに関わらず最強のローカルモデルを求める人。無検閲であるという事実は、最先端に近いベースモデルのボーナスです。

2. Dolphin 3.0 Mistral 24B: ベテランのファインチューン、依然として鋭い

Eric HartfordのDolphinシリーズは、最も長く続いている無検閲プロジェクトであり、Dolphin3.0-Mistral-24Bが現在のフラッグシップです。アブリテレーションされたモデルとは異なり、Dolphinは完全な拒否なしファインチューンです。厳選されたデータセットで再トレーニングされ、指示に従うこと、コーディング、数学、関数呼び出しのために調整されています。

2026年になってもこのリストに残り続ける理由は2つあります。1つ目は、R1バリアントが推論機能を追加しており、Dolphin-R1データセットからの80万の推論トレースで3エポックにわたってトレーニングされているため、ベンダーのフィルターがどの思考を許可するかを決定することなく、思考連鎖の挙動が得られます。2つ目はエコシステムです。Dolphinは一流のOllamaサポート、あらゆるサイズの成熟したGGUF量子化、長年のコミュニティプロンプトパターンを持っています。

24B密結合モデルの場合、Q4量子化は14~15GB程度で、24GBカードでは快適に、16GBカードでもより小さい量子化で動作可能です。

最適用途:外科的に編集されたモデルよりも意図的に再トレーニングされたモデルを好む場合の汎用ローカルチャットやエージェント作業、および無検閲の推論を求める場合のR1ビルド。

3. Hermes 4: 手術ではなく哲学による無検閲

Nous ResearchのHermes 4は、アライメントはオペレーターに帰属するという立場を取っています。このモデルは、企業の倫理規定ではなく、あなたのシステムプロンプトに従うようにトレーニングされています。Nousはこれを中立的なアライメントと呼び、Hermes 4は、広範な拒否をすることなくユーザーの意図に従うことで、オープンおよびクローズドモデルの中でRefusalBenchのトップに立っています。

このファミリーは、14B、36B(新しい4.3-36Bビルドを含む)、70B、そしてサーバーラックを持つ人向けの405Bをカバーしています。すべてハイブリッド推論器です。推論タグを含めると、モデルは難しい問題についてより長く思考し、省略すると高速な直接回答が得られます。

アブリテレーションされたモデルとの実用的な違いは重要です。アブリテレーションされたモデルは、いかなる場合でも拒否することができません。Hermesは、あなたがシステムプロンプトに書き込んだポリシーに従います。これには、あなたが選択した制限を含むポリシーも含まれます。多くのセルフホストユーザーにとって、これはより有用な特性です。デフォルトで無検閲であり、必要に応じて制御可能です。

最適用途:モデルの挙動を自分で定義したいオペレーター。14BはQ4で12GBカードに適合し、36Bは24GBを必要とします。

4. Huihui Qwen 3.6-27B abliterated: 実績のある主力モデル

Qwen 3.8が登場する前は、ローカルでの無検閲利用にはhuihui-aiのQwen 3.6アブリテレーションがデフォルトの推奨モデルであり、今でも安全な選択肢です。Qwen 3.6(2026年4月)は、アブリテレーションにとって異常なほどクリーンなベースであることが証明されました。拒否の方向性を最小限の能力損失で除去できるため、27Bビルドは年間を通じてコミュニティランキングのトップに登場しました。

魅力はそのエコシステムにあります。HuihuiはHugging Faceに量子化モデルの全範囲を公開し、Ollamaにもミラーリングしているため、ollama runコマンド1つで開始できます。より小さなカード向けに14Bのビジョン対応バリアントがあり、より温かい会話のデフォルトを望む場合は、アブリテレーションの上にSamanthaパーソナリティのファインチューンが積層されています。

最新のベースよりも数ヶ月にわたるコミュニティの検証を受けた実績あるビルドを重視する場合、またはQwen 3.8のllama.cpp要件が現在のツールチェーンをブロックする場合は、エントリー1よりもこちらを選択してください。

最適用途:16~24GBのVRAMを搭載した、安定して広く検証された日常使いのモデル。

5. Gemma 4 26B-A4B uncensored: modestなハードウェアでの速度

このリストのほとんどのモデルは密結合型であり、すべてのトークンがすべてのパラメータのコストを支払います。Gemma 4 26B-A4BはMixture-of-Experts (MoE) ビルドで、総パラメータ数は26Bですが、1トークンあたり約4Bがアクティブです。アブリテレーションされたバージョンは、同じカード上で密結合27Bでは達成できないスループットで無検閲出力を提供します。

これにより、12~16GBのセットアップでのカテゴリの勝者となります。16GB GPUでQ3の密結合27Bが妥協点を感じさせるのに対し、A4Bアーキテクチャは品質を維持しつつ数倍高速に生成します。16GBのユニファイドメモリを持つApple Siliconでは、使えるか使えないかの違いを生み出します。

トレードオフは、密結合モデルであるエントリー1と2が先行するような、難しい推論タスクでの深さです。要約、下書き、抽出、チャットでは、ほとんど気づくことはないでしょう。

最適用途:ラップトップクラスのハードウェア、16GB Mac、および最大の推論深度よりも秒間トークン数を重視する人。

6. Mistral Small 3.2 abliterated: 作家のお気に入り

ロールプレイやフィクションのコミュニティに、どの無検閲モデルを使用しているかを尋ねると、2026年時点での答えは一貫してMistral Small 3.2アブリテレーションです。Mistralのベースモデルは独特の散文品質を持っています。リストを多用せず、長いコンテキストにわたって声を維持するのが得意で、QwenやLlamaのファインチューンで漏れがちなアシスタント的な口調になりにくいです。

アブリテレーションは、コードよりもクリエイティブライティングにおいて重要です。商用モデルは、悪役、暴力、倫理的に曖昧な語り手など、正当なフィクションの多くを拒否したり、健全化したりします。アブリテレーションされたMistral Smallは、あなたが要求したシーンを記述し、設定したトーンを維持します。

約24B密結合モデルの場合、量子化モデルはDolphinと同様で、Q4は約14GBとなり、16GB以上のカードで快適に動作します。

最適用途:フィクション、ロールプレイ、および拒否に近い健全化が出力品質を損なうあらゆるライティング作業。

7. Huihui GLM-5.1 abliterated: その上限

利用可能な最大のオープンアブリテレーションモデル:Huihui-GLM-5.1-abliterated-GGUFは、754BパラメータのMoEで、IQ2_M量子化でも236GBのファイルとして提供されます。これは消費者向けモデルではありません。256GB以上のMac Studio、マルチGPUリグ、またはCPUオフロード用の大量のRAMを備えたサーバーが必要です。

他の6つのモデルでは答えられない質問に答えるため、その地位を獲得しています。つまり、「無検閲のローカルAIはどこまでスケールできるのか?」という問いです。その答えは今や「ホストされた最先端システムと競合するモデルまで」であり、これは1年前には真実ではありませんでした。もしあなたがハードウェアを持っているなら、これほど強力なセルフホスト型で無制限のモデルは他にありません。

最適用途:Mac Studioのオーナー、ワークステーション予算を持つホームラボ愛好家、および外部ポリシーが一切ない最先端クラスの機能を必要とする研究グループ。

これらのいずれかを実行する:サービスとして提供し、APIとして扱う

上記のすべてのモデルは同じ方法でデプロイされます。GGUFビルドにはllama.cpp、Ollama、またはLM Studioを、FP8にはvLLMを使用します。これらはすべてlocalhost上にOpenAI互換のエンドポイントを公開するため、モデルがロードされた瞬間から、あなたのローカルモデルはAPIとなります。

ollama run huihui_ai/qwen3.6-abliterated:27b
# OpenAI互換エンドポイントが http://localhost:11434/v1 で稼働中

そのエンドポイントは、あなたが開発するいかなるAPIと同様に扱うべきです。Apidoghttp://localhost:11434/v1/chat/completionsに指定すれば、プロンプトペイロードを再利用可能なリクエストとして保存したり、同じモデルの量子化モデル間でレスポンスを比較したり、エンドポイントをアプリに組み込む前にレスポンス構造を検証したり、モデルのレスポンスをモックしてインテグレーションテストでのGPU時間を節約したりできます。このワークフローは、弊社のKimi K3ローカルガイドと全く同じです。ウェイトをプルし、サービスとして提供し、プロダクションサービスのようにエンドポイントをデバッグします。Apidogをダウンロードすれば、すべてのループがオフラインで実行され、そもそもローカル環境を選んだ理由に合致します。

無検閲モデルは、エンドポイントレベルのテストの重要性を低くするのではなく、むしろ高めます。モデルに拒否層がないため、あなたのアプリケーションは独自の入力および出力チェックを必要とし、それらはまさにAPIクライアントが自動化するリクエストとレスポンスのアサーションです。

よくある質問 (FAQ)

これらのモデルをダウンロードして実行することは合法ですか?Hugging Faceからオープンウェイトモデルやアブリテレーションされた派生モデルをダウンロードすることは、ほとんどの管轄区域で合法です。各リポジトリには、商用利用を規定するライセンス(Apache 2.0、Gemma規約など)が付いています。あなたが生成したものと、それをどのように使用するかは、他のツールと同様にあなたの責任です。

アブリテレーションされたモデルは性能が低下しますか?わずかに低下しますが、ビルドによって異なります。アブリテレーションは活性化空間内の方向を除去するもので、積極的な除去は隣接する能力を損なう可能性があります。ここに挙げられているようなよくできたビルドでは、損失は数ベンチマークポイントに抑えられています。Dolphinのような拒否なしファインチューンは、外科的な操作を回避しますが、代わりにモデルのパーソナリティを変更します。弊社のQwen 3.8ベンチマークの内訳では、未修正のベースモデルのスコアがカバーされており、いずれにせよそれがあなたの天井となります。

開始するための最小ハードウェアは何ですか?12GB GPUまたは16GBのApple Silicon Macで、Hermes 4 14BまたはGemma 4 A4Bビルドが実用的な速度で動作します。2026年現在のスイートスポットは24GBのVRAMまたは32GBのユニファイドメモリで、これによりエントリー1、2、4が存在する24Bから27Bクラスが利用可能になります。また、17GBのウェイトをダウンロードする前に、ホスト型チャネルを通じてQwen 3.8を無料で試用し、ベースモデルがあなたの作業に適しているかどうかを評価することもできます。

WizardLMやVicunaのような古いリストのモデルではないのはなぜですか?ベースモデルの年代が理由です。2023年頃の13Bファインチューンは、推論、コンテキスト長、コーディング、多言語出力のあらゆる点で2026年の27Bに劣ります。無検閲ビルドはベースモデルの性能上限を継承するため、上記のランキングは現在のベースモデルから始まり、ハードウェアが要求する場合にのみ下位のモデルに移行します。

結論

2026年のデフォルトの答えはQwen 3.8-27B Uncensoredです。最新のベースモデル、真のマルチモーダルサポート、そして人々が所有するカードに適合する量子化モデルを備えています。Dolphin 3.0は最も深いエコシステムを持つファインチューンの代替であり、Hermes 4は、哲学によって無検閲となり、システムプロンプトによって制御可能な、思慮深いオペレーターの選択です。16GB未満のVRAMでは、速度重視ならGemma 4 A4Bビルドを、散文重視ならMistral Small 3.2アブリテレーションを選択してください。そして、どのモデルをサービスとして提供する場合でも、それがlocalhost上の無防備なAPIとして起動することを忘れないでください。信頼する予定の他のエンドポイントと同様に、Apidogでテストしてください。

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる