Alibabaは2026年8月上旬にQwen 3.8-Maxをリリースし、ついに価格に関する疑問が解決されました。7月のプレビュー期間中、流れていた話は「プレビュー価格10%割引」というプロモーションでしたが、それはもう過去の話です。一般提供開始時点では、公式のModel Studio料金ページには、qwen3.8-maxの価格が入力トークン100万あたり2ドル、出力トークン100万あたり6ドルと記載されており、100万トークン全体のコンテキストウィンドウをカバーする単一のフラットな料金体系となっています。
このフラットな料金体系が興味深い点です。ほとんどのフロンティアモデルは、プロンプトが特定のコンテキストしきい値を超えると、トークンあたりの料金が高くなります。しかし、Qwen 3.8-Maxは違います。5,000トークンを送ろうと900,000トークンを送ろうと、料金は2ドル/6ドルのままです。
この記事では、フラットな料金体系の設計、Qwen 3.7-Max、Kimi K3、Claude Opus 5、GPT-5.6 Terraとの比較、キャッシング割引、無料枠に関する詳細、具体的な計算例によるコスト分析など、全体像を網羅しています。モデルのより広範な概要については、まずQwen 3.8とは何か、そしてそれが重要な理由から始め、その後でこの数値に戻ってきてください。
まず一点注意:表示価格はあくまで目安です。Qwen 3.8-Maxはデフォルトでxhighの推論努力で提供され、思考トークンは出力として課金されます。コストを正確に見積もる信頼できる方法は、実際の要求を送信してトークンの使用量を測定することです。Apidogは、テスト中にすべての応答の完全なトークン内訳を表示するため、コスト見積もりが算術計算になります。これについては後述します。
一般提供の数値:入力2ドル、出力6ドル、単一ティア
以下は、2026年8月3日時点のModel Studio料金ページで確認されたqwen3.8-maxの公式料金表です。
| 項目 | 価格 (100万トークンあたり) |
|---|---|
| 入力 | $2.00 |
| 出力 (思考トークンを含む) | $6.00 |
| キャッシュされた入力 (キャッシュヒット) | 入力料金の10% |
| 明示的なキャッシュ作成 | 入力料金の125% |
| コンテキスト層 | 単一層、0~100万トークン |
| 思考トークンと非思考トークン | 同じ料金で課金 |
注目すべき3つの詳細があります。100万トークンのコンテキストウィンドウは単一の料金で完全にカバーされており、長文プロンプトの追加料金はありません。思考モードと非思考モードは同じ料金ですが、思考トークンは出力としてカウントされます(後述の「正直なセクション」を参照)。そして、1リクエストあたりの最大出力は65,536トークンなので、1回の応答で課金される出力は最大約0.39ドルです。
公式のQwen 3.8発表では、このモデルをAlibabaのこれまでで最も高性能なものとして位置付けています。総パラメータ数2.4兆、アクティブパラメータ数950億、100万トークンのコンテキストウィンドウ、マルチモーダル入力に対応しています。これを2ドル/6ドルで提供することは、Alibaba自身の以前のフラッグシップモデルを含む、フロンティア層のほとんどの価格を下回っています。
100万トークン全体でのフラットな価格設定が異例な理由
階層化されたコンテキスト料金は業界の標準です。コンテキストのしきい値以下ではある料金、それを超えるとより高い料金が設定されます。これは、長いコンテキストを提供するのにより多くのコストがかかるためです。
Alibaba自体もこれを行っています。同じModel Studio料金ページでは、qwen3-maxやqwen3-coder-plusのようなモデルはコンテキスト長の階層で価格が設定されており、入力が増えるにつれてトークンあたりの料金が上がります。Qwen 3.8-Maxは、Alibaba自身のカタログ内においてこのパターンから逸脱しています。その料金表には「0<トークン≤1M」という1つの行しかありません。
これが重要な理由:階層化された料金設定では、長いコンテキストのワークロードには隠れた乗数がかかります。例えば、たまに30万トークンのドキュメントをプロンプトに詰め込むRAGパイプラインは、そのようなリクエストに対して通常の何倍もの料金がかかることがあります。Qwen 3.8-Maxの場合、限界トークンは常に同じコストなので、予算編成は線形になります。トークン数×料金、これだけです。長文ドキュメント分析、大規模なコードベースのエージェント、または大量の検索パイプラインにとって、その予測可能性は低料金そのものと同じくらい価値があります。
Qwen 3.7-Maxの定価よりも安い
Qwen 3.8-Maxは、フラッグシップモデルの世代交代としては珍しく、前モデルの定価を下回る価格でリリースされました。
- Qwen 3.7-Maxの定価:100万トークンあたり**入力2.5ドル / 出力7.5ドル**
- Qwen 3.8-Max:100万トークンあたり**入力2ドル / 出力6ドル**
これは、モデルがより大きなコンテキストウィンドウ、マルチモーダル入力、そしてより良いベンチマークスコアを獲得したにもかかわらず、両側で20%の値下げです。
一つの複雑な点:Qwen 3.7-Maxは現在50%割引プロモーションを実施しており、これにより**1.25ドル/3.75ドル**に下がっています。プロモーション価格では、古いフラッグシップモデルが新しいモデルよりも安くなります。もしあなたのワークロードがQwen 3.8の100万トークンのコンテキストやマルチモーダル、エージェント機能の向上を必要としないのであれば、プロモーション期間中は割引された3.7-Maxが正当なバリュープレイとなります。ただし、コストモデルをプロモーションに依存しないように構築してください。さらに下の階層では、Qwen 3.7-Plusが独自の20%プロモーションを実施し、0.4ドル/1.6ドルで予算重視の主力モデルであり続けています。
正直なセクション:思考トークンは出力として課金される
これは、ほとんどの料金に関する説明が見落としがちで、請求書を見て最も驚く可能性のある部分です。
Qwen 3.8-Maxは、reasoning_effortパラメーターを3つのレベル(xhigh、medium、low)でサポートしています。デフォルトは最も積極的な設定であるxhighです。思考モードでは、モデルは最終的な回答の前に内部的な推論トークンを生成し、**これらの推論トークンは目に見えるテキストと同様に、出力料金である6ドルで課金されます**。
その結果:デフォルト設定では、推論を多く含むリクエストは、単純な「プロンプトトークン+回答トークン」の見積もりよりもコストが高くなります。800トークンの目に見える回答を示す応答でも、難しい問題では数千の思考トークンを消費している可能性があります。
3つの対策:深い推論が必要ないタスク(分類、抽出、フォーマットなど)では、reasoning_effortをmediumまたはlowに下げます。毎月の支出を見積もる前に、タスクタイプごとの実際の使用量を測定します。なぜなら、すべての応答に含まれるusageオブジェクトは推論を含む実際のカウントを報告するからです。そして、特に出力トークンに注意してください。ここでは出力が入力の3倍のコストがかかり、思考が出力を膨らませるからです。
コンテキストキャッシング:ヒットで10%、作成で125%
アプリケーションが同じプロンプトプレフィックス(長いシステムプロンプト、安定したドキュメント、ツール定義など)を繰り返し再送信する場合、コンテキストキャッシングは経済性を大きく変えます。
- **キャッシュヒットは入力料金の10%で課金されます。** キャッシュされた入力トークンは、2ドルではなく100万あたり0.20ドルです。
- **明示的なキャッシュ作成は入力料金の125%で課金されます。** トークンをキャッシュに書き込むコストは100万あたり2.50ドルで、通常の入力に対して25%の1回限りのプレミアムです。
損益分岐点の計算は簡単です。作成には1回限り追加で25%のコストがかかりますが、その後のヒットごとに90%節約できます。プレフィックスが2回でも再利用されれば、キャッシングはすでに元が取れます。高頻度で動作するエージェントや、重いシステムプロンプトを持つチャットアプリケーションでは、節約効果が急速に増大します(具体的な例は以下を参照)。
無料枠の詳細:100万トークン、シンガポール、90日間
Model Studioはqwen3.8-maxの無料枠を提供しており、その詳細が重要です。
- **サイズ:100万トークン。** 実際の評価には十分ですが、本番環境向けではありません。
- **リージョン:シンガポールのみ。** クライアントを
https://dashscope-intl.aliyuncs.com/compatible-mode/v1に設定してください。この枠は北京や米国バージニアリージョンには適用されません。 - **期間:有効化から90日間。** 未使用の枠は期限切れとなります。
思考トークンも他の出力と同様にこの枠から消費されるため、xhighで数十件の難しい推論タスクを実行すると、予想よりも早く100万トークンを使い果たしてしまう可能性があります。もし無料アクセスが主な目的であれば、Qwen Chatを含むすべての無料利用方法をQwen 3.8を無料で使う方法にまとめました。
Qwen 3.8の料金比較
以下に、100万トークンあたりの定価を用いた現在の状況を示します。プロモーション料金にはフラグが付けられていますが、プロモーションは期限切れになるためです。
| モデル | 入力 | 出力 | 備考 |
|---|---|---|---|
| Qwen 3.8-Max | $2.00 | $6.00 | 100万トークンコンテキスト全体でフラット;キャッシュヒット10% |
| Qwen 3.7-Max | $2.50 | $7.50 | 現在50%オフ:$1.25/$3.75 (プロモーション) |
| Qwen 3.7-Plus | $0.40 | $1.60 | 現在20%オフ (プロモーション) |
| Kimi K3 | $3.00 | $15.00 | キャッシュヒット$0.30 |
| Claude Opus 5 | $5.00 | $25.00 | |
| GPT-5.6 Terra | $2.00 | $12.00 |
この表を見ると:
- 最も近いオープンウェイトのライバルである**Kimi K3**と比較して、Qwen 3.8-Maxは入力が3分の1安く、出力が60%安く、キャッシュヒット率(0.20ドル)もK3(0.30ドル)を下回ります。出力重視のエージェント作業では、この出力の差が決定的な要素となります。K3の詳細については、Kimi K3 APIガイドをご覧ください。
- **Claude Opus 5**と比較して、Qwenは入力が60%安く、出力が76%安いです。
- **GPT-5.6 Terra**と比較して、入力は2ドルで同じですが、Qwenの出力は半額です。長文生成や推論重視の作業では、この数字が請求額を大きく左右します。
価格は品質を示すものではなく、ベンダーのベンチマーク表はベンダーのベンチマーク表に過ぎません。しかし、純粋な料金表レベルでは、Qwen 3.8-Maxはこのラインアップの中で最も安価なフロンティアクラスのフラッグシップモデルです。
計算例:実際のタスクのコスト
表示料金は、タスクに応じた計算がなければほとんど意味がありません。以下に、2ドル/6ドルで計算した3つのシナリオを示します。
例1:5万トークンのエージェントセッション
エージェントの実行では、38,000の入力トークン(指示、ツールスキーマ、ツール結果)を消費し、12,000の出力トークンを生成します。
- 入力:38,000 × $2 / 1,000,000 = **$0.076**
- 出力:12,000 × $6 / 1,000,000 = **$0.072**
- **合計:1セッションあたり約0.15ドル**
ここでデフォルトのxhigh推論を追加します。モデルが実行全体で8,000の思考トークンを消費するとします。出力は20,000トークンとなり、20,000 × $6 / 1,000,000 = $0.12、セッション合計は**約0.20ドル**になります。これは推論だけで33%の増加であり、予算を立てる前に測定すべき理由です。
例2:80万トークンの長文ドキュメント分析
80万トークンのドキュメントをコンテキストに読み込み、5,000トークンの構造化された要約を要求します。
- 入力:800,000 × $2 / 1,000,000 = **$1.60**
- 出力:5,000 × $6 / 1,000,000 = **$0.03**
- **合計:1実行あたり約1.63ドル**
ここでフラットな料金体系が機能しています。これら80万トークンのすべてのコストは、最初の千トークンと同じ100万トークンあたり2ドルの料金です。階層化されたモデルでは、このようなリクエスト形状こそが高額な料金帯をトリガーするものです。
例3:キャッシュされた10万トークンのシステムプロンプト、1日あたり50回呼び出し
あなたのアプリケーションは、システムプロンプト、製品ドキュメント、ツール定義からなる10万トークンを、毎日50回、各呼び出し時に事前に読み込みます。
キャッシュなしの場合:100,000 × $2 / 1,000,000 = 1呼び出しあたり$0.20、したがってプレフィックスだけで**1日あたり$10.00**。
明示的なキャッシングを使用する場合:作成コストは100,000 × $2.50 / 1,000,000 = $0.25が1回発生し、その後49回のキャッシュヒットがそれぞれ100,000 × $0.20 / 1,000,000 = $0.02で、合計$0.98。**1日の合計は約$1.23**で、88%の節約になります。1ヶ月では、約300ドルが40ドル未満になります。
推測ではなく、測定された使用量からコストを見積もる
これら3つの例はすべて仮定のトークン数に基づいています。実際の数値は異なり、推論トークンが絡む場合、プロンプトの長さだけでは予測できない形で異なります。解決策は測定することです。
実用的なワークフロー:APIキーを取得し、エンドポイントを設定し(Qwen 3.8 APIガイドには、3つの地域別ベースURLと、OpenAI互換およびAnthropic互換プロトコルの両方が網羅されています)、アプリケーション内の各タスクタイプに対して代表的なリクエストを送信します。すべての応答には、正確な入力、出力、推論トークン数を示すusageオブジェクトが返されます。
Apidogでは、3つの地域別ベースURLを環境として保存し、各reasoning_effortレベルで同じリクエストを送信し、応答インスペクターから直接トークン使用量を読み取ります。タスクタイプごとに10個の代表的なリクエストを実行し、カウントを平均し、$2/$6を乗算すると、測定データに基づいたコストモデルが完成します。また、同じワークスペースでqwen3.7-maxまたはKimi K3に対して同じプロンプトをA/Bテストし、より安価なモデルがあなたのワークロードで通用するかどうかを確認することもできます。Apidogを無料でダウンロードすれば、1時間以内に実際のタスクごとのコスト数値を得ることができます。
結論
Qwen 3.8-Maxの2ドル/6ドルという価格設定は、フロンティアクラスのフラッグシップモデルとしては積極的です。前モデルの定価を下回り、GPT-5.6 Terraの出力料金の半分、Opus 5の数分の一であり、市場の多くが階層化された料金設定である中で、完全な100万トークンのコンテキスト全体でフラットです。10%のキャッシュヒットを追加すると、長いコンテキスト、高頻度の繰り返しワークロードに対する経済性は本当に強力に見えます。
2つの注意点:デフォルトのxhigh推論は、素朴な見積もりよりも出力の課金を膨らませます。また、それに付随する(3.7-Maxの50%オフ、シンガポールの無料枠など)プロモーションは期間限定です。実際のトークン使用量を測定し、reasoning_effortを意図的に設定すれば、料金表にほとんど驚きはないでしょう。
よくある質問
Qwen 3.8は長いプロンプトの場合、料金が高くなりますか?
いいえ。公式料金では0から100万トークンをカバーする単一の層が記載されているため、90万トークンのプロンプトも短いプロンプトと同じ100万入力トークンあたり2ドルの料金で課金されます。これは、Alibaba自身のカタログのModel Studioモデルリストにある一部のモデルを含む、コンテキスト長に応じて料金が上がる階層型モデルとは異なります。
Qwen 3.8では思考トークンに追加料金がかかりますか?
思考のための別途料金はありません。思考モードと非思考モードは同じ2ドル/6ドルで課金されます。しかし、思考トークンは100万トークンあたり6ドルの出力トークンとしてカウントされ、reasoning_effortはデフォルトでxhighです。したがって、推論を多く必要とするリクエストは、目に見える回答が示唆するよりもコストが高くなります。簡単なタスクでは努力レベルを下げ、各応答のusageオブジェクトをチェックして、実際に何に対して料金を支払っているかを確認してください。
Qwen 3.8を無料で試す方法はありますか?
はい。Model Studioには、シンガポールリージョンのエンドポイントのみで有効な、90日間で100万トークンの無料枠が含まれています。Qwen Chatもブラウザで無料でアクセスできます。これらの両方の方法と詳細については、Qwen 3.8を無料で使う方法で説明しています。
以前の「10%プレビュー料金」はまだ利用可能ですか?
いいえ。それは2026年7月のプレス報道で報じられたプレビュー期間中のプロモーションでした。一般提供開始に伴い、標準の2ドル/6ドルの料金表に置き換えられました。Model Studioの料金ページを信頼できる情報源として扱ってください。
