Qwen 3.8 vs Kimi K3: 中国の2大オープンモデル徹底比較

Qwen 3.8-Max 対 Kimi K3:パラメータ、重み公開、モダリティ、価格、ハーネスサポートを比較し、ベンダー実施のベンチマークについては忖度のない評価を行います。

INEZA Felin-Michel

INEZA Felin-Michel

3 8月 2026

Qwen 3.8 vs Kimi K3: 中国の2大オープンモデル徹底比較

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

2026年7月は、オープンウェイトのフロンティアモデルにとって「二強の月」となり、両者ともに中国から登場しました。Moonshot AIは7月16日にKimi K3を出荷。その3日後、AlibabaはQwen 3.8-Maxのプレビューを公開し、8月上旬には一般提供を開始しました。どちらも兆パラメータの混合エキスパート(MoE)モデルです。どちらもオープンウェイトを約束(または提供)しています。どちらもClaude Code風のエージェントハーネスに接続できます。そして、どちらも米国のフロンティアラボの価格を下回っています。

表面的な類似性には実際の違いが隠されています。それは、今日ダウンロードできるもの、モデルが認識できるもの、そして1ヶ月間のヘビーユースにかかるコストです。この比較では、2026年8月3日時点で検証可能なあらゆる側面を検証していきます。Alibabaの新しい主力モデルの詳細な仕様については、まず弊社のQwen 3.8-Max解説をご覧ください。

ボタン

始める前に正直な補足です:これら2つのモデルに関する独立した直接比較ベンチマークはまだありません。この記事のすべての数値は、各ベンダー独自の表からのものであり、どのベンダーの実行によるものかを示しています。ベンチマークセクションは参考程度とし、確定的なものではないと認識してください。

タイムライン:誰が何をいつリリースしたか

「オープンウェイト」が現在の各モデルで異なる意味を持つため、ここではリリース順序が通常よりも重要です。

Kimi K3は2026年7月16日にローンチされました。Moonshotはローンチ時にオープンウェイトを約束し、11日後の7月27日には594 GBのMXFP4リリースとしてウェイトがHugging Faceに公開されました。今日現在、K3をダウンロードし、さらに量子化して、自身のハードウェアで実行できます。これは約束ではありません。実現したのです。

Qwen 3.8-Maxは7月19日にプレビューされ、公式Qwenリリース投稿によると、8月上旬にAlibaba Cloud Model Studioで一般提供が開始されました。ウェイトはHugging FaceとModelScopeで「来週」公開されると約束されており、それは8月10日頃になると予想されます。2026年8月3日現在、それらはダウンロードできません。K3自身のローンチとウェイト公開の間の11日間のギャップは、この流れが普通であることを示していますが、今日ではこれらのモデルのうち1つだけが実際にオープンです。

セルフホスティングがあなたの決定要因である場合、この単一の事実だけで比較が早期に終わる可能性があります。

パラメータ:2つの兆規模MoEモデル、よりスリムな1つ

どちらのモデルもスパースな混合エキスパート設計であり、そのため、目玉となるパラメータ数とトークンごとの計算コストは全く異なる数値です。

仕様 Qwen 3.8-Max Kimi K3
総パラメータ数 2.4兆 2.8兆
トークンあたりのアクティブパラメータ数 950億 1040億
アクティベーション比率 約4% 約3.7%
アーキテクチャベース Qwen 3.5基盤、MoE MoE
オープンウェイト形式 約束済み(約8月10日) MXFP4、Hugging Faceで594 GB

Qwen 3.8-Maxは、総パラメータ数が4000億少なく、アクティブパラメータ数もK3より90億少ないという点で、両方ともより小さいモデルです。どちらの差も劇的なものではなく、アクティブパラメータの数が能力に直線的に変換されるわけではありません。それらが翻訳されるのは、提供コストです。950億パラメータをトークンごとにアクティブにするモデルは、他のすべてが同じであれば、1040億パラメータをアクティブにするモデルよりも大規模に実行する方が安価であり、その違いは以下のAPI価格に表れています。

セルフホストにとって、より関連性の高い数値は、MXFP4精度でのK3の594 GBダウンロードです。これは、長いコンテキストでのKVキャッシュを考慮する前でも、マルチノードの領域です。Qwen 3.8-Maxも、合計2.4兆パラメータで、ファイルが登場した際には同様のウェイトクラスになると予想されます。ほとんどのチームは両モデルにホスト型エンドポイントを使用し、コンプライアンスや研究用途のためにセルフホスティングを予約するでしょう。

今日のオープン性:公開済みウェイト vs 期日の古い約束

この軸は、両社のマーケティングが「オープン」と謳っている一方で事実が異なるため、独自のセクションを設ける価値があります。

Kimi K3のウェイトは公開されています。リポジトリを確認し、ライセンスをチェックし、今すぐファイルをプルできます。それは真のオープン性が可能にするすべてをもたらします:サードパーティホスティング、コミュニティによる量子化、ファインチューニング、そしてベンチマークしたモデルが静かに交換されることはないという保証です。

Qwen 3.8-Maxは、これまでのすべてのMaxティアモデルをAPI専用としてきたAlibabaの戦略において真の転換点となる、オープンウェイトでリリースされる初のQwen-Maxクラスモデルとなるでしょう。しかし、最初というのは、それが実現して初めて最初となります。Hugging Faceのリポジトリが公開されるまでは、Qwen 3.8-Maxは発表が付属するAPIモデルです。

今日のところはこの軸はK3の勝利とし、8月10日頃に再確認するためのメモを残します。Alibabaが約束を果たせば、この軸は引き分けとなり、比較はライセンス条項と量子化の品質に移るでしょう。

モダリティ:Qwenは画像を認識し、K3はテキストを読み取る

ここでのギャップは逆になり、その差は小さいものではありません。

Qwen 3.8-Maxは、公式モデル設定("input_modalities": ["text", "image"])に従い、テキストと画像の入力に対応しています。Alibabaの発表投稿はさらに踏み込み、200ページ以上のPDFにわたる長文理解や、メモリーグラフを介した100時間のビデオ理解を実演していますが、これらはブログのデモとして扱い、文書化されたAPI入力タイプではないと認識してください。ただし、画像入力は実際のものであり、今日APIで利用できます。Alibabaのベンダーベンチマークはこれに注力しており、マルチモーダル表(MathVision 95.2、LogicVista 91.9、OSWorld-Verified 86.1、強力なOCR行)は、Qwen 3.8-Maxが最も一方的な数字を記録しているところです。

Kimi K3はテキストモデルです。ワークロードにスクリーンショット、スキャン文書、UI理解、または視覚関連のエージェントタスクが含まれる場合、K3はパイプラインに別のビジョンモデルを結合する必要があり、それに伴うすべての接着コードと追加のレイテンシが発生します。

テキストのみのコーディングやエージェント作業の場合、この軸は無関係です。ドキュメントインテリジェンスやコンピューター使用エージェントの場合、それは決定的な要素となります。

コンテキスト、出力、およびAPIサーフェス

Qwen 3.8-Maxは、1,000,000トークンのコンテキストウィンドウを単一のフラットティアで提供し、最大出力は65,536トークンです。推論は `reasoning_effort` パラメータ(デフォルトでxhigh、medium、lowも選択可能)によって制御され、思考の出力はデフォルトで保持されます。注目すべきは、思考モードと非思考モードが同じ料金で請求されることです。

アクセスはAlibaba Cloud Model Studioを介して、3つのリージョンベースURL(北京、シンガポール、米国バージニア)と、珍しいことに1つのプラットフォーム上に2つのプロトコル形式(OpenAI互換エンドポイントとAnthropic互換エンドポイント)で提供されます。そのデュアルプロトコルサーフェスこそが、Qwen 3.8-Maxが `ANTHROPIC_BASE_URL` と `ANTHROPIC_MODEL=qwen3.8-max` だけでClaude Codeに統合できる理由です。フルラインナップと地域ごとの利用可能性はModel Studioモデルページに記載されています。複数のリージョンで作業する場合、Apidogのようなツールを使用すると、各ベースURLを環境として保存し、リクエストを編集することなくそれらを切り替えることができます。

Kimi K3もAnthropicプロトコルに対応し、Claude Code風のハーネスに組み込めます。これこそが、これら2つのモデルが「既存のエージェントハーネスをより安価なフロンティアモデルに向ける」という同じ席を競い合う理由です。K3のエンドポイントの詳細と現在の制限については、リリース以降変更されている可能性がある数字を信頼するのではなく、弊社のKimi K3解説を参照してください。

価格:フラットでシンプル vs 安価な入力、高価な出力

100万トークンあたりの公開料金は以下の通りです。

料金 Qwen 3.8-Max Kimi K3
入力 $2.00 $3.00
出力 $6.00 $15.00
キャッシュヒット入力 $0.20(入力の10%) $0.30
ティアリング 全1Mコンテキストでフラット Moonshotの公開スケジュールによる

公式Model Studio料金ページによると、Qwen 3.8-Maxは、トークンゼロから100万トークンまで、思考の有無にかかわらずフラットで、入力が2ドル、出力が6ドルです。明示的なキャッシュ作成は入力の125%で請求され、キャッシュヒットは10%で請求されます。無料クォータも存在します:100万トークン、シンガポールリージョンのみ、90日間有効です。

K3の料金は、キャッシュヒットで100万トークンあたり0.30ドル、入力で100万トークンあたり3ドル、出力で100万トークンあたり15ドルです。

比較は1つの数字ではありません。優れたキャッシュ規律(長いシステムプロンプト、繰り返されるドキュメントコンテキスト)を持つ入力負荷の高いワークロードでは、両モデルは表示価格よりも近い位置に落ち着きます。キャッシュされたメガトークンあたり0.20ドル vs 0.30ドルは狭い差です。出力負荷の高いワークロードでは、差は大きい:K3の15ドルの出力料金はQwenの6ドルの2.5倍です。多くの推論とコードを生成するエージェントループは出力負荷が高く、書面上ではQwen 3.8-Maxが有利です。

Qwenに特化した1つの注意点:reasoning_effort はデフォルトでxhighであり、思考トークンは出力として課金されます。実際の請求額は、単純なトークンイン・トークンアウトの見積もりよりも高くなるでしょう。コミットする前にこれをモデル化したい場合、弊社のQwen 3.8料金内訳ではタスクごとのコスト例を詳しく説明しています。

ベンチマーク:2つのベンダー表、審判なし

ここがこれら2つのモデルの比較のほとんどが誤る点なので、何が存在するかを正確に述べましょう。

存在する情報:AlibabaはQwen 3.8-Maxのベンチマーク表をClaude Opus 4.8、Fable 5、GPT-5.6 Sol、Qwen 3.7-Maxと比較して公開しました。MoonshotはKimi K3の独自の発表表を同様のフロンティアラインナップと比較して公開しました。どちらもベンダーが実施したものです。

存在しない情報:Qwen 3.8-MaxとKimi K3を同じハーネスの下で同じ表にまとめた独立した評価。執筆時点では、Qwen 3.8-MaxのArtificial Analysisの数値は利用できませんでした。両ベンダーは互いのモデルをベンチマークしていません。

その前提で、各社が独自に主張する内容は以下の通りです。

Alibabaの表より(Alibabaが実施し、その多くはClaude Codeハーネスを通じて実行されたという詳細はAlibaba自身が公開している):

ベンチマーク Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86.6 84.6 84.6 88.8
SWE-bench Pro 67.7 69.2 80.0 64.6
PaperBench 93.0 80.3 88.8 90.5
GPQA Diamond 92.6 92.0 92.6 94.1
HLE 43.6 45.7 53.3 47.2

Alibaba自身の数字には明確な敗北が含まれています:Qwen 3.8-MaxはSWE-bench ProでFable 5に大きく遅れをとり、HLEではリストされているすべてのモデルに遅れをとっています。その際立った項目はPaperBench、指示追従(IFBench 82.8)、およびマルチモーダル全体のスイープです。他のいくつかの目玉となる結果はAlibabaの社内ベンチマーク(QwenSWEBench、CoWorkBenchなど)を使用しており、これらは他のものと相互参照できません。

Moonshot側では、K3の発表表は、Moonshotの主要ベンチマーク項目全体でClaude Opus 4.8を上回る一方、Fable 5とGPT-5.6 Sol全体には遅れをとっていることを示しました。これらの主張とその注意点については、弊社のKimi K3 vs Claude Opus 4.8比較で扱いました。

ベンチマークが重なる2つの表を並べることができますか?できますし、人々もそうするでしょうが、異なるハーネス、足場、サンプリング設定があるため、表を横断した読み取りはせいぜい参考程度にしかなりません。正直なまとめ:両ベンダーとも、彼らのモデルがエージェントタスクにおいて米国のフロンティアモデルと同等であり、一部では優れていることを示しています。どちらの表も、どちらがより強いかを決定するものではありません。Alibabaの数値の詳細については、弊社のQwen 3.8ベンチマーク分析を参照してください。

Apidogで独自の直接比較を実行する

審判が存在しないため、最も役立つベンチマークは、自身のワークロードで実行するものです。両モデルともOpenAI互換のチャット完了エンドポイントを公開しており、Apidogでのサイドバイサイドテストが簡単になります。

DashScopeのベースURLとqwen3.8-maxを保持する環境と、MoonshotのエンドポイントとK3モデルIDを保持する環境の2つをセットアップし、それぞれに独自のAPIキー変数を設定します。実際のプロンプト(なぞなぞではなく、製品からの実際のタスク)で1つのリクエストを保存し、環境を切り替えて、両方のモデルに同じペイロードを送信します。Apidogの応答ビューは、ステータス、レイテンシ、完全なボディを並べて表示し、SSEデバッグは各モデルが推論コンテンツをどのようにストリーミングするかを示します。これは、UIが思考トークンをレンダリングする場合に重要です。いくつかのアサーション(応答スキーマ、レイテンシ上限、出力内の必須キーワード)を追加すれば、気分的なチェックを、どちらかのベンダーがアップデートを出荷したときに再実行できる反復可能なテストに変えることができます。無料のApidogをダウンロードして比較を実行してください。両エンドポイントに10個のプロンプトを送信するだけで、どちらのベンダーの表よりも多くのことがわかるでしょう。

スコアカード

軸 今日の勝者 注意点
合計/アクティブパラメータ Qwen 3.8-Max (よりスリム: 2.4兆/950億 vs 2.8兆/1040億) 小さいからといってそれ自体が良い悪いというわけではない。主に提供コストを示す
今日のオープンウェイト Kimi K3 (Hugging Faceで公開中、594 GB MXFP4) Qwenのウェイトは8月10日頃に公開予定。再確認、この軸はすぐに同点になる可能性がある
モダリティ Qwen 3.8-Max (テキスト + 画像入力) ビデオ/長文ドキュメントに関する主張はブログデモであり、文書化されたAPI入力タイプではない
コンテキストウィンドウ Qwen 3.8-Max (1Mフラットティア、最大出力65,536) ユースケースに合わせてMoonshotのドキュメントでK3の現在の制限を確認する
価格 Qwen 3.8-Max (2ドル/6ドルフラット vs 3ドル/15ドル) xhigh思考のデフォルトはQwenの実際の出力料金を膨らませる
ベンチマーク 判断不可 両方の表はベンダーが作成したもの。独立した直接比較は存在しない
ハーネスエコシステム 引き分け 両方ともAnthropicプロトコルエンドポイントを介してClaude Codeスタイルのハーネスに組み込める
約束の実績 Kimi K3 ウェイトは発売から11日後に提供された。Qwenの約束はまだ実現されていない

どちらをいつ選ぶか

今週中に自身のハードウェアでウェイトが必要な場合、コンプライアンス要件により固定して監査できるモデルが必要な場合、またはワークロードが純粋なテキストであり、キャッシュ料金が支配的になるほど入力負荷が高い場合は、Kimi K3を選ぶ。

ワークロードが画像やドキュメントに触れる場合、多くの出力トークン(エージェントループ、コード生成)を生成する場合、またはティアード料金の予期せぬ事態なしに1Mトークンのコンテキストが必要な場合は、Qwen 3.8-Maxを選ぶ。

オープンウェイトがどちらかのモデルを検討する唯一の理由である場合は、1週間待つ。Qwenのウェイトが約束通り8月10日頃に公開されれば、オープン性の軸はリセットされ、決定はモダリティ、価格、そして自身の評価結果にかかってくる。

本当のところ、開発者は中国から、わずか3週間の間に、信頼性が高く、安価で、ハーネス互換性のある2つのフロンティアオプションを手に入れたということである。どちらに傾倒するにしても、どちらかのベンダーの表にロードマップをコミットする前に、両方のエンドポイントで自身のプロンプトを実行してください。

ボタン

よくある質問

Kimi K3はQwen 3.8-Maxよりもオープンですか?

今日では、率直に言って、はい。K3のウェイトは2026年7月27日からHugging Faceで公開されており(594 GB、MXFP4)、Qwen 3.8-Maxのウェイトは8月10日頃に公開されると約束されているものの、まだダウンロードできません。Alibabaが約束を果たせば、両方ともオープンウェイトのフロンティアモデルとなり、意味のある違いはライセンス条件とコミュニティサポートに移ります。それまではK3のみがセルフホスト可能であり、弊社のローカルK3ガイドでその方法を説明しています。

コーディングにおいて、Qwen 3.8-MaxとKimi K3のどちらが優れていますか?

現時点では誰も正直に答えることはできません。両ベンダーとも強力なエージェントコーディングの数値を発表していますが、それぞれが独自の条件で評価を実施しており、独立した直接比較は存在しません。Alibaba自身の表でも、Qwen 3.8-MaxがSWE-bench ProでFable 5に敗れていることが示されており、ベンダーの表は敗北を認めるものですが、ベンダー間で比較することはできません。決定する前に、自身のレポジトリからのタスクで両モデルを実行してください。

Claude Codeで両モデルを使用できますか?

はい、両方ともAnthropic互換のエンドポイントを公開しています。Qwen 3.8-Maxの場合、Alibabaのリリース投稿の構成を使用して、ANTHROPIC_BASE_URL をDashScopeのAnthropicエンドポイントに、ANTHROPIC_MODEL を qwen3.8-max に設定します。K3もMoonshotのエンドポイントを通じて同じパターンをサポートしています。その共有されたハーネス互換性こそが、両者のA/Bテストを安価にセットアップできる理由です。

典型的なエージェントワークロードの場合、どちらが安いですか?

定価では、Qwen 3.8-Maxの方が安い:K3の100万トークンあたり3ドル/15ドルに対して、2ドル/6ドルであり、エージェントループは出力トークンに偏るため、その差は2.5倍になります。2つの条件:K3のキャッシュヒット率0.30ドルは、入力負荷が高く、適切にキャッシュされたワークロードを競争力のあるものに保ち、Qwenのデフォルトのxhigh推論努力は思考を出力として課金するため、その実際のコストは単純な見積もりを上回ります。表示価格が全てを物語っていると仮定する前に、自身のトークンミックスをモデル化してください。

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる