Alibabaは現在、バージョン系列を共有しない2つのQwen画像ラインを出荷しています。2026年9月20日にリリースされたQwen-Image-2.1は、オープンウェイトモデルで、生成器に7Bのパラメータを持ち、ネイティブな透明出力、最大10個の参照による編集が可能で、Hugging Faceからダウンロードできます。Qwen Image 3.0および3.0 Proは、2026年7月22日に発表され、同年8月4日からAPIで提供されており、画像ごとの料金設定でウェイトが公開されていないホスト型モデルです。数字上は「3.0が新しい」となっていますが、正直なところ、これらは異なる問いに答えます。モデルを自分で実行したいのか、それともレンタルしたいのか、ということです。
このページでは、ライセンス、コスト、機能、および運用に関して両者を比較し、最後に決定表を掲載しています。2.1の機能の詳細については、Qwen-Image-2.1とはをご覧ください。コードについては、ハウツーガイドをご覧ください。どちらを選択しても、最終的にはアプリが呼び出すHTTPエンドポイントとなり、Apidogは両方を1つのコレクションの下に保持できるため、切り替えは設定変更のみで済みます。
比較
| Qwen-Image-2.1 | Qwen Image 3.0 / 3.0 Pro | |
|---|---|---|
| リリース日 | 2026年9月20日 | 2026年7月22日発表、APIは2026年8月4日より提供 |
| 提供形式 | オープンウェイト(Hugging Face、ModelScope) | ホスト型APIのみ。ウェイトは非公開 [要確認] |
| ライセンス / 利用規約 | Qwen Research License。商用利用には別途ライセンスが必要 | 標準API利用規約 |
| 料金 | ご自身のGPU時間 | qwen-image-3.0: 1Kまたは2K画像あたり0.03ドル。qwen-image-3.0-pro: 1Kで0.04ドル、2Kで0.075ドル。入力画像は1枚あたり0.003ドル [要確認] |
| 生成器サイズ | 7B(32層のシングルストリームDiT)+ Qwen3-VL 8Bエンコーダ | 非公開 |
| 最大解像度 | デフォルト2048 x 2048、最大2752 x 1536 | 2048 x 2048 |
| 透明出力 | ネイティブRGBA生成と編集 | 宣伝されていない |
| 参照画像 | 最大10枚 | 入力画像対応(画像ごとに課金)。枚数制限は非公開 [要確認] |
| ローカル編集 | 円、ペイントによる注釈、個別マスク | リリース資料では宣伝されていない |
| テキストレンダリング | 改善されたタイポグラフィ、スタイル、レイアウト | 主要機能:約10pxの微細なテキスト、12言語(自己申告) |
| 呼び出しあたりの出力数 | 1つ(ループが必要) | 最大6つ |
| プロンプト長 | 記載なし | Pro版で約4.5Kトークン(公式発表) |
| プロンプト書き換え | 自分で実行する独立したPE-T2I / PE-I2Iモデル | サーバー側で処理 |
| 試用方法 | HF Space、Qwen Chat、ComfyUI | Model Studioコンソール、Qwen Chat |
3.0に関する情報の出典は、Alibabaの7月の発表とLLM StatsにまとめられたQwenCloudのドキュメントです。画像料金は地域によって異なるため、予算を立てる前にModel Studioの料金表を再確認してください。
ライセンスが最初のフィルター
ほとんどのチームにとって、この行で比較は終わりです。2.1のライセンスには、「別途商用ライセンスを取得することなく、いかなる商業目的にも本資料を使用してはならない」と明記されています。これは、オリジナルのQwen-Imageが提供されていたApache 2.0の条件とは異なり、2.1上に構築された顧客向けの機能は、リリース前にQwenのビジネスチームへのメールと署名済みの契約書が必要であることを意味します。
Qwen Image 3.0は、標準的な商用条件を持つ有料APIです。画像ごとに料金を支払い、製品を出荷できます。
したがって、研究、評価、社内ツール、またはライセンス交渉の意欲があるプロジェクトであれば、2.1が選択肢に入ります。今四半期にリリース予定で法務予算がない製品機能の場合、3.0がデフォルトとなります。
コスト:GPU費用対1枚3セント
3.0の標準ティアでは、いずれの解像度でも画像あたり0.03ドルなので、月に10,000枚の画像で300ドルになります。加えて、編集時の入力画像は1枚あたり0.003ドルです。Pro版は2Kで料金が倍になります。
2.1のセルフホスティングには画像ごとの料金はありませんが、その算術は大量の処理を行う場合や、他に利用されていないGPUがある場合にのみ有利です。Qwenはスループットの数値を公開していないため、ご自身で測定してください。単一のデータセンターGPUで40ステップ、2048 x 2048の場合、1時間あたりの画像数を数え、時間あたりの料金を算出し、0.03ドルと比較します。多数の参照画像を使った編集では、参照画像がステップごとではなくリクエストごとに1回エンコードされるため、2.1のKVキャッシュ再利用が役立ちます。GPUが他のワークロードと共有されている場合、画像生成がバースト時にGPUを占有することに注意してください。
大まかな目安として、月数千枚未満の画像であれば、エンジニアリング時間を考慮するとAPIの方が安価です。安定した負荷で月に数万枚を超える場合、およびライセンス契約が締結されている場合は、セルフホスティングが有利です。その中間では、すでにGPUを運用しているかどうかによります。
機能:透明性対高密度テキスト
この2つのモデルは異なる目的に合わせて構築されています。
出力にアルファチャンネルが必要な場合は2.1を選択してください。ステッカー、製品の切り抜き、UIアセット、レイヤー合成、写真から被写体をRGBAとして抽出するなど、2.1は同じモデル内でこれをネイティブに実行し、透明レイヤーをその透明性を失うことなく編集できます。3.0のリリース資料にはアルファ出力については言及されていません。3.0でこれを行う場合、それに伴うハローアーティファクトが発生する別の背景除去ステップが必要になります。
編集が主な作業負荷である場合は2.1を選択してください。10枚の参照画像、円、ペイント、またはマスクによる領域選択、顔や製品の忠実度調整は2.1リリースの中心です。リリース投稿では、6枚のポートレートから作成された集合写真、5枚の製品写真から作成された衣装、10枚の家具写真から作成された家具付きの部屋が示されています。
画像がほとんどテキストである場合は3.0を選択してください。ダッシュボード、ワイヤーフレーム、ポスター、多くの言語で微細なテキストを含むスライドのようなレイアウトは、3.0が調整された対象です。2.1もタイポグラフィを改善しましたが、3.0の「12言語で10pxの微細なテキスト」はより強力な公表された主張であり、Pro版の4.5Kトークンのプロンプト予算は長いレイアウト仕様に適しています。
呼び出しごとに複数の候補が必要な場合は3.0を選択してください。1リクエストあたり最大6つの出力は2.1にはないワークフロー機能です。2.1ではシードをループする必要があります。
どちらのベンダーページも数値を含むベンチマーク表を公開していません。2.1の投稿にはQwen-Image-Benchのチャートが示されており、3.0の主張は自己申告です。Apidogセクションで再現可能なご自身の評価のためのプロンプトとして両方を扱ってください。
運用:あなたが所有するもの
2.1をセルフホストするということは、モデルのダウンロードと更新、十分なメモリを持つGPU(QwenはVRAM表を公開していませんが、READMEではCPUオフロードやFP8、SGLang、LightX2Vを備えたvLLM-Omniが紹介されています)、サービングラッパー、バースト負荷時のキューイング、そしてワンラインプロンプトを機能させたい場合の2つのオプションのプロンプト書き換えモデルを所有することを意味します。その見返りとして、データの局所性、独自のレート制限、誰も勝手に変更しない固定されたモデルバージョンが得られます。
3.0を使用するということは、Alibaba Cloudアカウントとリージョン選択、APIキー、レート制限の処理、そしてホストされたモデルがテスト実行と本番稼働の間で動作を変更するリスクを所有することを意味します。その見返りとして、インフラゼロで画像ごとの請求書が得られます。
Nano Banana 2 APIおよびgpt-image-2.5 APIガイドでは、Qwen内ではなくベンダー間で比較する場合に、GoogleとOpenAIについても同様のホスト型トレードオフについて説明しています。
決定表
| あなたの状況 | 選択肢 |
|---|---|
| 今四半期に商用機能をリリース予定で、法務予算がない | 3.0 |
| 透明なPNGまたはRGBA編集が必要 | 2.1(商用利用の場合はライセンスが必要) |
| 多数の参照画像を使った編集 | 2.1 |
| 複数の言語でのテキスト中心のレイアウト | 3.0 |
| 研究、評価、社内ツール | 2.1 |
| 月数千枚未満の画像の場合 | 3.0 |
| 月数万枚、GPUがすでに稼働しており、ライセンス契約済みの場合 | 2.1 |
| データがネットワークから外部に出られない | 2.1 |
| 1リクエストあたり6つの候補が必要 | 3.0 |
両方を1つのコレクションで実行
多くのチームにとって現実的な答えは両方です。透明なアセットパイプラインと社内ツールには2.1を、顧客向けのテキストレイアウトには3.0を利用します。両方が1つの契約の下で運用されれば、クリーンに機能します。
Apidogで、prompt、aspect、transparent、seed、およびreferencesファイルフィールドを持つPOST /v1/imagesエンドポイントを一度定義し、2つの環境を設定します。1つは2.1ラッパー(ハウツーガイドには40行のFastAPIバージョンがあります)を指すbase_url、もう1つはModel Studioの3.0エンドポイント用アダプターを指すものです。そして:
- 固定シードで同じプロンプトセットを両方に送信し、応答をテストケースとして保存します。
- 何が異なるかを確認します:
Content-Type、応答サイズの最小値、そして2.1の場合、透明性が要求された際のX-Image-Mode: RGBAヘッダーです。 - リクエストごとの応答時間を記録します。Apidogは実行ごとにこれを示し、これはQwenが公開していないスループットの数値です。
- 週ごとにシナリオを実行します。3.0のホストされた動作が変更された場合や、2.1を量子化ビルドに置き換えた場合、その差分はサポートチケットではなくレポートに表示されます。
- モデルの選択肢がまだ未定の間に、フロントエンドが契約に基づいて構築できるようにエンドポイントをモックします。
Apidogをダウンロードし、エンドポイントをインポートして比較を開始してください。
FAQ
Qwen Image 3.0はオープンソースですか? 3.0または3.0 Proの公開ウェイトはリリースされていません。これらはホスト型APIモデルです [要確認]。Qwen-Image-2.1がオープンウェイトのリリースです。
Qwen-Image-2.1を商用利用できますか? Qwenからの別途商用ライセンスがある場合に限ります。デフォルトのQwen Research Licenseは商用利用を対象外としています。
どちらが安いですか? 少量の場合、画像あたり0.03ドルの3.0が安価です。すでに運用しているハードウェアで大量かつ安定したボリュームの場合、ライセンスを確保しご自身のスループットを測定した後であれば2.1が安価です。
3.0は透明な画像を生成しますか? 宣伝されていません。ネイティブRGBA出力は2.1の機能です。詳細はQwen-Image-2.1とはをご覧ください。
どちらも無料で試せますか? 2.1はHugging Face SpaceとQwen Chatからアクセス可能です。無料ティアガイドにオプションが記載されています。3.0はQwen ChatとModel Studioの試用クォータ(地域によって異なります)を通じて利用可能です。
次のステップ
2.1と3.0はフォークであり、アップグレードパスではありません。ライセンスが最初の問いを決定し、ワークロードが2番目を、そしてボリュームが3番目を決定します。どちらを選択するにしても、テストする契約の背後に配置してください。ハウツーガイドは2.1側を構築し、同じApidogコレクションは、必要になった日に3.0側をフロントエンドとして機能させることができます。
