ほとんどのモデルの発表では、コーディング能力は同じ方法で宣伝されます。すなわち、「HumanEvalのスコアはこれ、バイナリ検索を書いたコードの抜粋はこれ」といった具合です。しかし、AlibabaはQwen 3.8-Maxで異なるアプローチを取りました。彼らの主張は「優れた関数を書ける」というものではありません。その主張は、数週間にわたりソフトウェアプロジェクトを単独で実行できるというものです。これは、人間が介在することなく、イシューを開き、プルリクエストをマージし、機能をリリースすることを含みます。
これは大胆な主張であり、精査されるべきです。この記事では、Alibabaが発表時に公開した3つのコーディングショーケース(すべてベンダーデモであり、1つは監査可能な公開リポジトリがあります)、それらの背景にあるコーディングベンチマークの数値、そして今日から実際に試せる部分、すなわちClaude Code、Codex、Qoder、Qwen Code、OpenClawでqwen3.8-maxを使ってコーディングする方法、そして生成されたコードが生成するAPI出力をテストする方法について解説します。
モデル自体に馴染みがない方は、Qwen 3.8とは何かの概要から始めてください。総パラメータ数2.4T、アクティブパラメータ数95B、1Mトークンのコンテキストウィンドウを持ち、リリース後1週間以内にオープンウェイトが約束されています。ここでは、コーディングのストーリーに焦点を当てます。以下に示す内容はすべて、2026年8月3日時点のものです。
Alibabaが実際に主張していること
公式のQwen 3.8リリース投稿における枠組みは、スニペットを超えた自律性です。AlibabaはQwen 3.8-Maxを、長期的なエンジニアリングタスクを頭の中で保持し、作業を計画し、数日間にわたって実行し、自身の過ちから回復し、最終的にレビュー可能なものを納品できるモデルとして位置付けています。

この主張を通常のリリース日のマーケティングよりも興味深いものにしている3つの点があります。
- デモが長い。 16日間というのは、20分間のエージェントベンチマークとは異なる領域です。この規模では、エラー回復、コンテキスト管理、ドリフトがはるかに重要になります。
- 1つのデモは公開されている。 リポジトリを閲覧し、コミットを読み、コードの品質を自分で判断できます。ほとんどのベンダーショーケースでは、このような機会は提供されません。
- ハーネスは競合他社のもの。 Alibabaは、コーディングベンチマークのほとんどをClaude Codeハーネスで実行し、公式設定を公開しているため、あなたも同じことができます。詳細は後述します。
標準的な注意点として、この記事全体に当てはまりますが、ここにあるすべての数字はAlibaba自身の発表資料からのものです。2026年8月上旬現在、独立した検証はまだ存在しません。ショーケースはデモとして扱い、監査とは見なさないでください。
3つのコーディングショーケース
oh-my-cli: 16日間の自律開発
目玉のデモ。AlibabaはQwen 3.8-Maxをコマンドラインツールの構築に投入し、無人で実行させました。7月30日時点で、実行は16日間続き、265のコミット、127のプルリクエスト、151のイシューを生成しました。これらはすべてモデル自体によって開かれ、作業され、クローズされました。
リポジトリはqwen-code-dev-bot/oh-my-cliで公開されており、これがショーケース全体で最も有用な部分です。コミット数を鵜呑みにする必要はありません。PRの記述を読み、イシューが本当のバグなのか、それとも無駄な作業なのかを確認し、コードがしっかりしているかを確認できます。人間のレビューなしでモデルから16日間の出力が得られるというのは、品質についてどのような結論に至ろうとも、 genuinely rareな成果物です。
監査する際に注目すべき点:PRが実際に参照しているイシューを修正しているか、モデルが閉じるために人工的な作業を作成しているか、そしてモデルが自身の回帰をどのように処理しているか。これらのパターンは、単一のベンチマークスコアよりも、長期的な信頼性について多くを教えてくれます。
論文再現実行:研究コード、アプリケーションコードではない
2つ目のデモは、より困難な種類のコーディングを対象としています。機械学習の研究論文をゼロから再現することです。Alibabaの数字によると、この実行にはおよそ125時間かかり、約7,600行のコードを生成し、その過程で33回のGPUトレーニングラウンドを実行しました。

その結果、モデルは論文の知見のうち6つを再現し、さらに一歩進んで、AIME24で論文が報告した結果を2.7ポイント上回りました。研究の再現は、容赦ない作業として知られています。環境が壊れ、ハイパーパラメータが脚注に隠れていたり、単一のサイレントバグが、数時間後に気づくトレーニング実行を無効にしたりします。33回のトレーニングラウンドを乗り越え、一致する数値を出すモデルは、オートコンプリート以上のことをしています。
このデモは、Qwen 3.8-Maxの最強のベンチマーク行であるPaperBench(下記参照)と対をなします。
天池コンテスト:人間のチームと24時間の対決
3つ目のショーケースは、Alibabaの天池プラットフォームで、24時間という制限時間付きで、モデルをライブデータサイエンスコンペティションに投入しました。モデルはその期間中に45回の提出を行い、毎回アプローチを繰り返し改善し、最終的に0.853の精度でフィニッシュしました。これにより、参加した526チーム中458チームの人間のチームを上回る成績を収めました。

この結果の形に注目する価値があります。モデルは優勝しませんでした。しかし、出場チームの87%を打ち負かしたというのは、印象的でありながら正直な結果です。また、他の2つのデモにはない能力も示しています。それは、デッドラインの下での素早い反復であり、各提出のスコアが次の試みにフィードバックされるというものです。
さらに一つ、特にここで強調される注意点があります。天池はAlibaba自身のプラットフォームです。デモは本物ですが、ベンダーが会場を管理していました。
デモの背景にあるコーディングベンチマーク
Alibabaは発表時に完全なベンチマーク表を公開しました。正直な部分を残したコーディング関連の行を以下に示します。すべての数値はAlibaba自身の実行によるものです。
| ベンチマーク | Qwen 3.8-Max | 最高の競合他社(Alibabaの表による) |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 (GPT-5.6 Sol) |
| SWE-bench Pro | 67.7 | 80.0 (Fable 5) |
| PaperBench | 93.0 | 90.5 (GPT-5.6 Sol) |
3つのポイント:
- Terminal Bench 2.1 (86.6) は、Qwen 3.8-MaxがClaude Opus 4.8とFable 5(Alibabaの表ではどちらも84.6)をターミナル駆動型のエージェント作業で上回っていることを示しています。この数値がoh-my-cliデモの裏付けとなっています。
- SWE-bench Pro (67.7) は劣勢であり、その差は小さいものではありません。Fable 5は同じ表で80.0を記録しています。「自分のコードベースのこの問題を修正する」に最も直接的に対応するベンチマークであるリポジトリ規模のバグ修正において、Qwen 3.8-Maxはリーダーに12ポイント以上も遅れをとっています。Alibabaはそれでもこの数値を公開しており、これは彼らの信用になります。
- PaperBench (93.0) は、このモデルの単一の最高の主要な行であり、比較対象のすべてを打ち破っています。これは論文再現デモを直接裏付けています。
ほとんどの報道が見落とすであろう細かい点ですが、AlibabaはこれらのコーディングベンチマークのほとんどをClaude Codeハーネス上で実行しており、競合モデルの実行も含まれています。また、表の脚注には、Fable 5の結果にはフォールバックが含まれる可能性があると記されています。ハーネスの選択はエージェントベンチマークのスコアに大きく影響するため、特定のハーネス上でベンダーが実行した表は一つのデータポイントであり、最終的な判断ではありません。
ただし、Claude Codeの詳細は両方の意味を持ちます。つまり、Alibabaはあなたがすでに使っているかもしれないハーネスに最適化しており、それを証明するために設定を公開しているということです。
今日からQwen 3.8で実際にコーディングする方法
ここからが実践的な部分です。Qwen 3.8-MaxはAlibaba Cloud Model Studioで一般公開されており、Alibabaは発表時に5つのコーディングツール用の公式設定を公開しました。これらすべてにはDashScope APIキー(home.qwencloud.comから取得)が必要です。料金は、公式Model Studio料金ページによると、入力トークン100万あたり2ドル、出力100万あたり6ドルで、全1Mコンテキストで均一です。
Claude Code
このモデルはAnthropic互換のAPIエンドポイントを提供しているため、Claude Codeをこれに接続するには3つの環境変数が必要です。
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
通常通りClaude Codeを起動すると、すべてのリクエストがClaudeの代わりにQwen 3.8-Maxにルーティングされます。Alibabaがこの正確なハーネスでコーディングベンチマークを実行したことを考えると、これは測定されたものとあなたが体験するものの間に最も違いがない設定です。
Codex
Codexは設定にプロバイダーのエントリーが必要です。公式ドキュメントからの抜粋です。
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
これはAnthropic互換のエンドポイントではなく、OpenAI互換のエンドポイントを使用します。モデル、キーは同じですが、プロトコルの形式が異なります。
Qoder, Qwen Code, OpenClaw
残りの3つはより手早くまとめられます。
- Qoder CLI: Alibaba自身のエージェント型コーディングツール。モデルとして
qwen3.8-maxを選択します。これはファーストパーティの統合なので、設定は設定値のみです。 - Qwen Code: QwenチームによるオープンソースのCLI。
DASHSCOPE_API_KEYを設定し、モデルを選択します。以前のQwenコーディングモデルで使用したことがあれば、他に変更はありません。 - OpenClaw: 公式設定では、モデルIDと
maxTokensが65,536に設定されており、これはモデルの最大出力長でもあります。
これら5つの設定はすべてリリース投稿にあるので、ブログのスナップショットに固定するのではなく、そこで正確な最新バージョンを入手してください。
推論の努力を意図的に設定する
Qwen 3.8-Maxは、3つのレベル(xhigh(デフォルト)、medium、low)を持つreasoning_effortパラメータをサポートしています。コーディングの場合、この設定はほとんどのノブよりも重要です。
- エージェント作業には
xhighを維持する:複数ファイルの変更、デバッグセッション、モデルが編集前に計画するあらゆる作業。ショーケースの実行はこのモードを表しています。 - 素早い編集には
lowに下げる:名前変更、ドキュメント文字列の追加、深い推論が時間とトークンを浪費する機械的な変更。
推論トークンは出力トークンとして100万あたり6ドルで課金され、xhighがデフォルトであることを覚えておいてください。全力を尽くした長時間のエージェントセッションは実際のお金がかかります。xhighでの機械的な編集は、メリットがないのにお金を浪費することになります。
もしQwen 3.8-Maxがあなたのタスクに必要な以上のモデルである場合、以前のQwen3 Coderラインは専用のコーディング作業のためにまだ存在し、Qwen3 Coder Flashは高速で安価な領域をカバーしています。この分野の他のオープンウェイトの強力なモデルについては、Kimi K3がコーディング作業をどのように処理するかをご覧ください。
モデルが構築するものをテストする:Apidogのステップ
Alibabaのものを含む、あらゆる自律コーディングデモにはギャップがあります。それは、モデルがAPIを呼び出すコードを書くのに、その呼び出しを検証することについては誰も語らないことです。エージェントはきれいにコンパイルされる7,600行のコードを生成するかもしれませんが、間違ったエンドポイントをヒットしたり、429エラーを誤って処理したり、本番環境で検証に失敗するリクエストボディを送信したりする可能性があります。
そのギャップを埋める2つの習慣があります。
生成されたコードが呼び出すエンドポイントをテストする。 Qwen 3.8-Maxがサービスを構築したりAPIクライアントを作成したりする場合、関連する仕様をApidogにインポートし、認証フロー、エラー応答、エッジケースのペイロードなど、エンドポイントを直接試してみてください。自律セッション中にスタックトレースで2日後に誤った仮定を見つけるよりも、テスト実行中に見つける方がはるかに安価です。モデル自身のAPIをコミットする前に評価している場合、Qwen 3.8 APIガイドは、OpenAIとAnthropicの両プロトコル設定を詳細にカバーしており、Apidogはストリーミング応答と推論の差分を含め、両プロトコル形式を並べて検査するのに便利な場所です。
エージェント実行が本番環境に影響しないようAPIをモックする。 これは、実行時間が長くなるほど重要になります。本番インフラストラクチャに対してライブコールを行う16日間の自律セッションは、本当に悪いアイデアです。レート制限、データ変更、予期せぬ請求が発生する可能性があります。Apidogのモックサーバーは、実際のシステムに触れることなく、エージェントに現実的な応答を提供します。実行中は生成されたコードをモックURLに向け、人間が出力をレビューしたら実際のベースURLに切り替えます。Apidogを無料でダウンロードして数分でモックを設定できます。これは、無人エージェント実行が持つことができる最も安価な保険です。
このパターンは一般化されます。コーディングモデルに与える自律性が増せば増すほど、APIレイヤーが制御面になります。すべてのコミットをリアルタイムでレビューすることはできませんが、コードが何と通信することを許可されているかを制御することはできます。
よくある質問 (FAQ)
Qwen 3.8はコーディングに適していますか?
Alibaba自身の数値によると、エージェント型および研究スタイルのコーディング(Terminal Bench 2.1で86.6、PaperBenchで93.0)には強いですが、リポジトリ規模のバグ修正(SWE-bench Proで67.7、Fable 5の80.0に対して)では中程度の性能です。すべての数値はベンダーによるもので、現時点では独立した検証はありません。正直な評価としては、長期的な自律作業には優れていますが、従来のイシュー修正ではトップではありません。
Claude CodeでQwen 3.8を使用できますか?
はい、公式に可能です。ANTHROPIC_BASE_URLをhttps://dashscope-intl.aliyuncs.com/apps/anthropicに、ANTHROPIC_AUTH_TOKENをDashScopeキーに、ANTHROPIC_MODELをqwen3.8-maxに設定してください。Alibaba自身がこの設定を公開しており、コーディングベンチマークのほとんどをClaude Codeハーネスで実行しています。
Qwen 3.8でのコーディングにはどれくらいの費用がかかりますか?
入力トークン100万あたり2ドル、出力トークン100万あたり6ドルで、1Mコンテキスト全体で均一です。思考トークンは出力として課金され、デフォルトのxhigh推論努力は大量の思考トークンを生成するため、エージェントセッションでは表示価格よりも多く予算を見積もってください。完全な費用計算と比較は、Qwen 3.8ベンチマークの内訳およびそこにリンクされている料金に関する記事で確認できます。
16日間のoh-my-cli実行は本当に自律的でしたか?
それはAlibabaの主張であり、ほとんどのベンダーデモとは異なり、成果物を確認することができます。リポジトリは2026年7月30日時点でqwen-code-dev-bot/oh-my-cliで公開されており、265のコミット、127のPR、151のイシューが含まれています。コードの品質がその主張を正当化するかどうかは、あなたがそれを読んで判断できます。これこそが、このショーケースをスクリーンショットよりも信頼できるものにしている理由です。
