Qwen 3.8ベンチマーク分析:アリババの性能評価から読み解く真価と限界

Qwen 3.8-Maxのベンチマーク結果、正直なレビュー:PaperBenchで93.0点を記録しマルチモーダル分野で勝利した一方、HLEおよびSWE-bench Proでは劣勢にあり、さらにほとんどの報道が見過ごす細部の情報。

INEZA Felin-Michel

INEZA Felin-Michel

3 8月 2026

Qwen 3.8ベンチマーク分析:アリババの性能評価から読み解く真価と限界

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

2週間にわたり、Qwen 3.8に関する記事には抜け穴がありました。7月のプレスプレビューではフロンティアクラスのモデルが約束されましたが、スコアは公開されなかったため、初期のレポートはすべて感覚に基づいていました。それが2026年8月3日に変わりました。AlibabaのQwen 3.8-Maxに関する公式リリース投稿には、Claude Opus 4.8、Fable 5、GPT-5.6 Sol、およびその前身であるQwen3.7-Maxとの完全なベンチマークテーブルが掲載されており、さらにGemini 3.1 ProとGPT-5.6 Solとの個別のマルチモーダルテーブルも含まれています。

そのテーブルは詳しく読む価値があります。そこには真の勝利、正直な敗北、そしてほとんどの報道が見落とすであろう細かい注意書きが含まれています。この投稿では、これら3つすべてを順に解説し、ベンダーのテーブルを全面的に信用するのをやめる実用的な方法として、APIに対して独自の評価を実行することを提案します。まずモデルの全体像(パラメータ、価格、アクセス方法)を知りたい場合は、当社のQwen 3.8-Max解説から始めて、後で戻ってきてください。

数字の前に、前提として留意すべき点があります。以下のすべてのスコアはAlibabaが公開したテーブルからのものであり、リーダーボードのデータは脚注によると2026年8月3日時点のものです。執筆時点では独立した評価は存在しませんでした。続く各行について、この点を念頭に置いてください。

ベンチマークテーブルの概要

以下は、Alibabaが公開した主要なテキストモデルの行です。これらはすべて数値が高いほど優れています。

ベンチマーク Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max
Terminal Bench 2.1 86.6 84.6 84.6 88.8 74.5
SWE-bench Pro 67.7 69.2 80.0 64.6 60.6
PaperBench 93.0 80.3 88.8 90.5 64.8
GPQA Diamond 92.6 92.0 92.6 94.1 92.4
IFBench 82.8 62.2 63.5 72.7 79.1
HLE (Humanity’s Last Exam) 43.6 45.7 53.3 47.2 41.4

出典: Alibabaがベンダーとして実施したテーブル。この「ベンダー実施」が実際に何を意味するのかについては、後ほど詳しく説明します。なぜなら、ここではそれが通常よりも重要だからです。

Qwen 3.8-Maxが優位に立つ点

PaperBench: 最も優れたフラッグシップの項目

研究論文の結果をモデルが再現できるかをテストするPaperBenchでは、Qwen 3.8-Maxがフロンティアモデルの中で最も強い単一の結果を示しました。そのスコアは93.0で、GPT-5.6 Solの90.5、Fable 5の88.8、Opus 4.8の80.3を上回っています。これはQwen3.7-Maxの64.8から驚異的な飛躍でもあります。どのベンチマークにおいても28ポイントもの世代間の飛躍は精査に値しますが、独立したテストでこの結果が維持されれば、モデルの長期的な研究能力について真実を物語ることになります。

IFBench: 大きな差をつけて指示追従

IFBenchでは、Qwen 3.8-Maxが82.8を記録しました。テーブル内でQwen以外の最も近い競合はGPT-5.6 Solの72.7で、Fable 5が63.5、Opus 4.8が62.2でした。これは10から20ポイントの差であり、これほど飽和したベンチマークでは異例です。興味深いことに、Qwen3.7-Maxもすでにこの項目で79.1を記録しており、指示追従は一時的なものではなく、Qwenの持続的な強みであるように見えます。

Terminal Bench 2.1: Claudeをわずかに上回る

Alibabaが実施したTerminal Bench 2.1では、Qwen 3.8-Maxが86.6を記録し、Opus 4.8とFable 5の84.6を上回りました。GPT-5.6 Solが88.8でこの項目をリードしているため、これは2位の成績であり、圧勝ではありません。しかし、エージェント的なターミナルベンチマークでAnthropicの2つのフラッグシップモデルを打ち負かしたことは、Alibabaがこのリリースで求めていた結果そのものであり、Claudeに対する2ポイントの差は、あらゆる場所で引用されるでしょう。

マルチモーダルでの圧勝

個別のマルチモーダルテーブルでは、Qwen 3.8-Maxが全体的に最も強力に見えます。AlibabaはMathVisionで95.2、LogicVistaで91.9、OSWorld-Verifiedで86.1を報告しており、テーブル内のほとんどすべてのOCR項目でモデルがリードしています。Opus 4.8もFable 5もここでは直接競合しないため(この比較ではテキストに特化しているため)、マルチモーダルテーブルが圧勝に見えるのはそのためです。Gemini 3.1 ProおよびGPT-5.6 Solと比較すると、視覚的推論と文書インテリジェンスの項目がモデルの最も明確な差別化要因となっています。

この夏にリリースされたもう1つの大きなオープンウェイトモデルと比較するなら、マルチモーダルの差も最も鮮明な対比となります。Kimi K3はテキストのみだからです。当社のQwen 3.8とKimi K3の比較で、この対決について完全に解説しています。

正直に認められる敗北点

Alibabaが敗北点もテーブルに残したことは、ある程度の評価に値します。3つの点が際立っています。

HLE: 43.6、Fable 5に大きく遅れ。広範囲な知識を問うフロンティアベンチマークであるHumanity’s Last Exam (HLE) で、Qwen 3.8-Maxは43.6点を記録しました。Fable 5は53.3点、GPT-5.6 Solは47.2点、Opus 4.8は45.7点でした。これは4つのフラッグシップモデルの中で最下位であり、首位に約10ポイントの差をつけられています。Qwen3.7-Maxの41.4点よりは上回っていますが、わずかです。HLEはほとんどの評価よりもベンチマーク固有のチューニングに強く抵抗するため、この項目は重要視する価値があります。

SWE-bench Pro: 67.7 対 Fable 5の80.0。より難易度の高いソフトウェア工学ベンチマークでは、Qwen 3.8-Maxは中間に位置します。GPT-5.6 Sol (64.6) よりは上ですが、Opus 4.8 (69.2) のわずかに下、そしてFable 5からは12ポイントもの大差をつけられています。Qwen3.7-Max (60.6) からの世代間の改善は確かですが、「Terminal BenchでClaudeに勝つ」と「SWE-bench ProでFable 5に大きく遅れる」は同時に真実であり、後者の主張ははるかに少ない見出しにしか現れないでしょう。

DeepSWEとより難しいエージェント的な項目。DeepSWEは、Alibaba自身のテーブルでもQwen 3.8-Maxがフロンティアに遅れをとるもう一つの項目です。コーディングセクション全体に見られるパターンは一貫しており、ターミナル駆動のエージェントタスクでは競争力があるものの、最も深いソフトウェア工学の評価では遅れをとっています。

正直なまとめ:Qwen 3.8-Maxはいくつかのエージェント的な項目でOpus 4.8に勝ち、ほとんどのコアなコーディング作業ではFable 5に遅れをとり、マルチモーダルおよび文書インテリジェンスでは大きく優位に立ちます。これは、100万トークンあたり入力2ドル、出力6ドルという価格設定のモデルとしては(公式料金ページを参照)、本当に強力な結果ですが、リリース報道をざっと読んだだけでは示唆されないような、全面的なフロンティアでの勝利ではありません。

ほとんどの報道が見落とすであろう細かい注意書き

ここは、見出しだけでなくベンチマークの投稿を読む価値があることを正当化するセクションです。Alibaba自身の公開情報から得られる4つの詳細が、テーブルの読み方を変えるでしょう。

1. すべての数値はベンダーが実施。Alibabaは自社のモデルと競合モデルを評価しました。これは発表テーブルの標準的な慣行であり、発表テーブルが後で改訂される標準的な理由でもあります。ベンダーはベンチマークのバージョン、プロンプト戦略、サンプリング設定、リトライポリシーを選択します。これらは詐欺ではありませんが、すべてが有利になるように操作されています。

2. ほとんどのコーディング項目はClaude Codeハーネスで実行。これが本当に興味深い詳細です。Alibabaは、ほとんどのコーディングベンチマークを、Anthropic独自のClaude Codeエージェントハーネスを使用して実行しました。これは、Anthropic互換APIを介してQwen 3.8-Maxを指すように設定されました。一方では、これは公平な動きと言えます。同じ広く使用されているツール内で各モデルを評価するからです。他方では、「Qwenのコーディングスコア」は実際には「Anthropicのハーネス内でのQwenのスコア」を意味し、ハーネスの選択によってエージェント的な結果が数ポイント変動する可能性があります。これはまた、Alibabaがこのモデルが実際にどのように動作することを期待しているかについて何かを物語っています。

3. いくつかのベンチマークはQwenの自社製。QwenSWEBench、QwenQoderBench、CoWorkBench、RecreationBenchはすべてQwenチームによって構築されました。自社製ベンチマークには価値がないわけではありません。多くの場合、公開された評価では見落とされがちな能力を探求します。しかし、モデルがその開発者自身のベンチマークで高いスコアを出したことは、SWE-bench Proで高いスコアを出したこととは異なる種類の証拠であり、テーブルでは視覚的な区別なく両方が並べて提示されています。このテーブルから数値を引用する際は、まずそれがどのカテゴリに属するかを確認してください。

4. Fable 5に関する脚注。Alibaba自身のテーブルには、「Fable5の結果にはフォールバックが含まれる場合があります」という脚注が付いています。これは、少なくとも1つの競合モデルの数値がクリーンな状態で実行されたモデルを反映していない可能性があるという静かな告白です。技術的な原因が何であれ、これはQwen 3.8-Maxが最も頻繁に遅れをとるモデルであるFable 5の列に、それを公開した人々からの注意書きが付いていることを意味します。

これらはAlibabaに限ったことではありません。Anthropic、OpenAI、Googleもすべて、独自の方法論的選択に基づいて自社で実施したテーブルを公開しています。私たちはKimi K3ベンチマーク分析でも同様のパターンを指摘しており、そこでも当てはまりました。要点はAlibabaが不正をしたということではありません。ベンダーのテーブルは「主張」であり、「測定」ではないということです。

注目すべき点と次のテーブルの読み方

2026年8月3日現在、Qwen 3.8-Maxの独立した評価は存在しません。執筆時点ではArtificial AnalysisやコミュニティのリーダーボードはまだQwen 3.8-Maxを評価していませんでした。数日中に状況は変わり、Alibabaのテーブルと独立した実行結果との間の差異が本当のストーリーとなるでしょう。それらが公開され次第、この投稿を更新します。

それまでは、このテーブルを含め、ベンダーのベンチマークテーブルを判断するための簡単なチェックリストを以下に示します。

  1. 誰が評価を実行したか?競合他社に関する自己申告の数値は、ベンダー自身のモデルに関する自己申告の数値よりも懐疑的に見るべきです。
  2. どのハーネスと設定が使用されたか?エージェント的なベンチマークはハーネスに敏感です。ハーネス名を明記しているテーブル(Alibabaのように)は、そうでないテーブルよりも有用ですが、その選択が結果を左右します。
  3. ベンダーがどのベンチマークを構築したか?自社製評価はあるものを測定しますが、公開されているものとは異なります。
  4. 脚注を読む。「フォールバックが含まれる場合があります」という小さな文字が多くの意味を持っています。
  5. 何が欠けているかを確認する。ベンダーが公開しなかった項目は、公開した項目と同じくらい有益であることがよくあります。過去のベンダーテーブルでは、モデルの性能が低かったベンチマークを静かに削除した例があります。前世代が各ベンダー間でどのように比較されたかと照らし合わせ、どの項目が消えたかを確認してください。
  6. 二次情報源を待つ。通常、1週間待てば独立した数値が得られます。

代わりに独自の評価を実行する

チェックリストはテーブルを読むのに役立ちますが、より良い動きは、それらを必要としないようにすることです。Qwen 3.8-Maxは現在、Alibaba Cloud Model Studio(モデルID qwen3.8-max公式モデルページに記載)で、OpenAI互換APIとAnthropic互換APIの両方で利用可能です。そして、実際のプロンプトを使用するベンチマークは、そうでない公開評価よりも優れています。

Apidogでの実用的なセットアップは以下のようになります。Model Studioのチャット補完エンドポイントに対してqwen3.8-maxで1つのリクエストを作成し、現在のベースラインモデル(Qwen3.7-Max、Kimi K3、またはClaudeやGPTのエンドポイントなど)に対して2つ目の同一のリクエストを作成します。実際のプロダクションプロンプトを20〜30個テストシナリオとして保存し、実際に重視する応答プロパティ(有効なJSON、必須フィールドの存在、しきい値以下のレイテンシなど)のアサーションを追加し、両方のシナリオを連続して実行します。Apidogのテストレポートは、Alibabaのワークロードではなく、あなたのワークロードに基づいて、モデルごとの合格率と応答時間を並べて表示します。

その際に確認すべきQwen固有の点が2つあります。モデルはデフォルトでreasoning_effort: xhighになっているため、実際にデプロイするであろう労力レベルでコストとレイテンシを測定してください。また、Anthropic互換エンドポイントを使用する予定がある場合は、そのプロトコル形式を個別にテストしてください。Alibaba自身のコーディングベンチマークのほとんどがそれを使用していたからです。Apidogを無料でダウンロードし、両方のエンドポイントを環境として設定すれば、独立したリーダーボードが独自の数値を公開する前に、あなた自身の一次データを入手できるでしょう。

よくある質問

Qwen 3.8のベンチマーク数値は独立して検証されていますか?

いいえ。2026年8月3日現在、公開されているすべての数値はAlibaba自身のテーブルからのものです。執筆時点ではArtificial AnalysisやコミュニティのリーダーボードはまだQwen 3.8-Maxを評価していませんでした。独立した評価が公開されるまでは、このテーブルはベンダーの主張として扱うべきです。

Qwen 3.8-Maxの最高のベンチマーク結果は何ですか?

PaperBenchの93.0が、フラッグシップテーブルで最も良い項目です。GPT-5.6 Sol(90.5)、Fable 5(88.8)、Opus 4.8(80.3)を上回っています。マルチモーダルテーブルでは、MathVision(95.2)とOCRの項目が全体的に最も強力な結果です。

Qwen 3.8-Maxが明確に劣る点はどこですか?

HLEでは43.6点を記録し、4つのフラッグシップモデルの中で最下位であり、Fable 5の53.3点に大きく遅れをとっています。SWE-bench ProではFable 5の80.0点に対して67.7点であり、DeepSWEでも劣っています。深いソフトウェア工学の評価と広範な知識を問う試験が、Alibaba自身のテーブルでは最も弱い分野です。

Qwen 3.8はベンチマークでQwen 3.7-Maxよりどのくらい優れていますか?

Alibabaのテーブルにおける世代間の向上は大きく、Terminal Bench 2.1は74.5から86.6へ、SWE-bench Proは60.6から67.7へ、PaperBenchは64.8から93.0へと向上しました。アップグレードがあなたのワークロードにとって価値があるかどうかは、価格やモダリティにもよります。当社のQwen 3.8とQwen 3.7の比較で、その決定プロセス全体を詳しく解説しています。

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる