ما هو Qwen-Image-2.1؟ النموذج مفتوح المصدر للصور 7B مع شفافية أصلية

توضيح حول Qwen-Image-2.1: إطلاق الأوزان المفتوحة في 20 سبتمبر، 7B للجيل والتحرير الموحد، إخراج RGBA أصلي، 10 صور مرجعية، ورخصة البحث التي تقيد الاستخدام التجاري.

Ashley Innocent

Ashley Innocent

21 سبتمبر 2026

ما هو Qwen-Image-2.1؟ النموذج مفتوح المصدر للصور 7B مع شفافية أصلية

Apidog للمؤسسات

النشر على الخوادم المحلية

SSO و RBAC

متوافق مع SOC 2

استكشف Apidog للمؤسسات

كشف فريق Qwen التابع لشركة Alibaba عن نسخة Qwen-Image-2.1 مفتوحة المصدر في 20 سبتمبر 2026. إنه نموذج واحد يقوم بتوليد الصور من النصوص وتحرير الصور، ويحتوي على 7 مليارات معلمة في مكون توليد الصور المرئية، ويمكنه إخراج صور PNG شفافة مباشرة من المطالبة بدلاً من تزييفها بمسح لإزالة الخلفية. يسرد المنشور الإطلاق أربعة تغييرات: بنية أخف وأسرع، وشفافية أصلية، وتحرير باستخدام ما يصل إلى 10 صور مرجعية، وتحسين الخطوط وتفاصيل البورتريه. الأوزان موجودة على Hugging Face و ModelScope، والرمز البرمجي موجود على GitHub.

سطر واحد في بطاقة النموذج يهم أكثر من أي ميزة: الترخيص هو ترخيص Qwen Research License، وليس Apache 2.0. يتطلب الاستخدام التجاري اتفاقية منفصلة. إذا كنت تقوم بتقييم 2.1 لمنتج، اقرأ هذا القسم قبل المعايير. إذا كنت ترغب في تشغيله، فإن دليل كيفية استخدام Qwen-Image-2.1 يحتوي على رمز diffusers وغلاف HTTP يمكنك اختباره في Apidog. إذا كنت تقارنه بواجهة برمجة تطبيقات Qwen Image 3.0 المستضافة، فإن مقارنة 2.1 مقابل 3.0 هي صفحة القرار.

نظرة سريعة على Qwen-Image-2.1

العنصر التفاصيل (منشور الإطلاق، بطاقة النموذج، ملف GitHub README)
تاريخ الإصدار 20 سبتمبر 2026
ماذا يفعل تحويل النص إلى صورة وتحرير الصور في نموذج واحد، بما في ذلك إخراج شفاف (RGBA)
مولد الصور المرئية 32 طبقة DiT أحادية التدفق، 7 مليارات معلمة
مشفر النص Qwen3-VL 8B
VAE مشفر تلقائي RGBA بـ 64 قناة، ضغط مكاني 16x
الإخراج الافتراضي 2048 × 2048؛ سبع نسب أبعاد تصل إلى 2752 × 1536
الصور المرجعية ما يصل إلى 10 لكل عملية تحرير
التحرير المحلي دوائر، تعليقات مرسومة، أو صورة قناع منفصلة
النماذج المرافقة نماذج إعادة كتابة المطالبات Qwen-Image-2.1-PE-T2I و PE-I2I (تعديلات دقيقة لـ Qwen3.5-VL 9B)
الترخيص اتفاقية ترخيص بحث Qwen؛ الاستخدام التجاري يتطلب ترخيصًا منفصلاً
جربه مساحة Hugging Face، Qwen Chat، ComfyUI (دعم أصلي منذ يوم الإطلاق)

موقعه في سلسلة Qwen-Image

تم إطلاق Qwen-Image الأصلي في أغسطس 2025 كنموذج MMDiT بحجم 20 مليار معلمة معروف بتقديم النصوص، مع Qwen-Image-Edit كنموذج تحرير منفصل. حتى أواخر عام 2025، انقسم الخط بشكل أكبر: تحديث 2512 للواقعية، و Edit-2511 للاتساق بين عدة أشخاص، و Qwen-Image-Layered في ديسمبر للطبقات الشفافة. دمج Qwen-Image-2.0 في فبراير 2026 التوليد والتحرير في نموذج واحد بحجم 7 مليارات معلمة مع إخراج أصلي بدقة 2K.

يحافظ الإصدار 2.1 على حجم وتصميم 2.0 الموحد ويضم شفافية نموذج Layered، لذلك تغطي نقطة تفتيش واحدة الآن ما كان يتطلب ثلاثة. كما أنه يحصل على مسار استنتاج جديد (المزيد عن ذلك أدناه) وواجهة تحرير مبنية حول الأقنعة والمراجع المتعددة. بالتوازي، تدير Alibaba خطًا مستضافًا: تم إطلاق Qwen Image 3.0 و 3.0 Pro في يوليو 2026 كنماذج API بدون أوزان منشورة. لذا فإن التسمية هي تفرع وليست تسلسلًا. 2.1 هو النموذج المفتوح الذي تقوم بتنزيله؛ 3.0 هو النموذج الذي تستأجره.

ما الجديد في 2.1

هندسة معمارية أخف ومسار تحرير أسرع

المولد البصري هو 32 طبقة DiT أحادية التدفق بـ 7 مليارات معلمة، مقترنة بمشفر Qwen3-VL 8B وVAE يحمل قناة ألفا بشكل أصلي. الهندسة المثيرة للاهتمام تكمن في الانتباه. تسميها Qwen متعددة الدقة: تستخدم رموز النص (بادئة النظام وتعليمات التحرير الخاصة بك) قناعًا سببيًا على مستوى الرمز، بينما يستخدم توليد الصورة قناعًا على مستوى القطعة. نظرًا لأن صور الإدخال والتعليمات ثابتة عبر خطوات إزالة الضوضاء، يقوم النموذج بحساب ذاكرة التخزين المؤقت للقيم الرئيسية مرة واحدة في الخطوة الأولى ويعيد استخدامها. الفائدة المعلنة من Qwen هي تقليل زمن الاستجابة والذاكرة عند التحرير باستخدام عدة صور مرجعية، وهو بالضبط عبء العمل الذي أصبح أثقل مع حد الـ 10 صور.

الجدولة هي مطابقة التدفق مع خطوات Euler المنفصلة، ويعمل الرمز المرجعي 40 خطوة افتراضيًا.

شفافية أصلية في نفس النموذج

هذا هو العنوان الرئيسي. تطلب صورة شفافة في المطالبة ويقوم النموذج بإرجاع RGBA. الصياغة الموصى بها من README حرفية: ابدأ بـ "هذه صورة RGBA بشفافية" وقل إن الخلفية شفافة. يعرض منشور الإطلاق مواضيع فردية، وتراكيب متعددة العناصر، وثلاث حالات تحرير على مدخلات شفافة: تغيير تعبير الموضوع مع الحفاظ على الألفا، واستبدال النص داخل طبقة شفافة، واستخراج موضوع من صورة RGB عادية كقصة RGBA.

بالنسبة لفرق المنتجات، هذا يحل محل مسار من نموذجين (توليد، ثم قناع) بمكالمة واحدة. كما أنه يزيل الهالات التي تتركها مزيلات الخلفية حول الشعر والزجاج، لأن الألفا يتم إنشاؤها، وليس استنتاجها لاحقًا. ما إذا كانت الحواف تصمد بدقة 2K على أصولك الخاصة هو شيء يجب اختباره بدلاً من افتراضه؛ دليل المستوى المجاني يوضح أين يمكن إجراء هذه الاختبارات بدون وحدة معالجة رسومات.

التحرير باستخدام ما يصل إلى 10 مراجع وتحكم حقيقي في المنطقة

تبرز ثلاث ميزات تحرير في أمثلة الإطلاق:

يتعامل مسار التحرير نفسه مع البانوراما من صورة شخصية، والرسوم البيانية من صورة منتج، ولوحات القصة من ورقة شخصيات بثلاثة مناظر. يمكن ربط التعديلات المحلية المتتالية في رسوم متحركة قصيرة، وهو ما يوضحه المنشور بمقطع كابيبارا.

جودة الخطوط والصور الشخصية

تصدّر Qwen عرض النصوص المفتوحة منذ Qwen-Image الأول، ويوسع 2.1 هذا ليشمل نمط الخط، وتخطيطه، وكيفية وضع النص في التركيبة بدلاً من الإملاء فقط. كما يتم تحسين إضاءة الصور الشخصية والتفاصيل الدقيقة. يدعم منشور الإطلاق هذا بمخطط Qwen-Image-Bench مقابل النماذج المفتوحة والمغلقة؛ المخطط عبارة عن صورة ولا يطبع المنشور أي أرقام، لذلك لا نقتبس أيًا منها هنا.

الترخيص: أوزان مفتوحة، شروط بحثية

كان Qwen-Image الأصلي تحت ترخيص Apache 2.0. يُصدر Qwen-Image-2.1 بموجب اتفاقية ترخيص بحث Qwen، ونص الترخيص قصير وواضح في النقطة المهمة:

يتم شحن النماذج المرافقة لإعادة كتابة المطالبات بنفس الشروط. بالنسبة لمشروع هواية، أو ورقة بحثية، أو تقييم داخلي، هذا جيد. بالنسبة لميزة SaaS، فهذا يعني محادثة مع Alibaba أولاً، أو استخدام واجهة برمجة تطبيقات 3.0 المستضافة، والتي تأتي بشروط تجارية عادية وسعر لكل صورة.

نموذجا إعادة كتابة المطالبات

بالإضافة إلى المولد، نشرت Qwen نموذجي Qwen-Image-2.1-PE-T2I و Qwen-Image-2.1-PE-I2I. PE-T2I هو نموذج Qwen3.5-VL 9B معدّل بدقة يأخذ طلبًا قصيرًا بأي لغة ويعيد JSON مع مطالبة إنجليزية مفصلة ونسبة عرض إلى ارتفاع موصى بها. PE-I2I هو النظير التحريري [تحقق]. إنهما اختياريان، وهما كيف تحصل مساحة العرض التوضيحي على مطالبات طويلة ومنظمة من مدخلات سطر واحد. إذا كنت تقوم ببناء واجهة برمجة تطبيقات حول 2.1، فهذه هي خطوة "تحسين المطالبة" التي تقوم بها منتجات مثل ChatGPT Images بشكل غير مرئي.

ما لم يذكره الإطلاق

وضعها خلف واجهة برمجة تطبيقات واختبارها

لن يقوم معظم الفرق باستدعاء خط أنابيب diffusers من رمز التطبيق. سيقومون بلفه في خدمة HTTP على صندوق GPU واستدعاء ذلك. بمجرد أن يصبح نقطة نهاية، يصبح واجهة برمجة تطبيقات كأي واجهة أخرى، و Apidog هو المكان الذي تصممه وتختبره فيه: حدد مخطط الطلب (المطالبة، صور مرجعية اختيارية، نسبة العرض إلى الارتفاع، علامة شفافية)، أرسل مكالمات حقيقية، تأكد من أن الاستجابة هي PNG مع قناة ألفا، وحول الحالات الجيدة إلى مجموعة اختبار تراجعي تعيد تشغيلها بعد كل تحديث للنموذج. يمكنك أيضًا محاكاة نقطة النهاية بحيث يقوم فريق الواجهة الأمامية بالبناء مقابل عقد ثابت بينما يكون GPU مشغولاً. يوضح الدليل الإرشادي هذا الغلاف واختبارات Apidog خطوة بخطوة.

قم بتنزيل Apidog للمتابعة.

الأسئلة الشائعة

هل Qwen-Image-2.1 مجاني للاستخدام التجاري؟ لا، ليس بدون ترخيص تجاري منفصل من Qwen. الأوزان مجانية للتنزيل والاستخدام لأغراض البحث وغير التجارية. راجع قسم الترخيص أعلاه ودليل الفئة المجانية لمعرفة الطرق المجانية لتجربته.

ما هو الاختلاف بين 2.1 و Qwen-Image-2.0؟ نفس الحجم 7 مليارات معلمة وتصميم موحد للتوليد والتحرير. الجديد في 2.1: إخراج وتحرير RGBA أصلي، وما يصل إلى 10 صور مرجعية، وتعديلات محلية مدفوعة بالقناع والتعليقات التوضيحية، ومسار انتباه متعدد الدقة مع إعادة استخدام ذاكرة التخزين المؤقت KV لتحرير أسرع لصور متعددة، وتحسين الخطوط وتفاصيل الصورة الشخصية.

هل هو نفس Qwen Image 3.0؟ لا. 3.0 و 3.0 Pro هما نموذجان API مستضافان تم إطلاقهما في يوليو 2026 بدون أوزان مفتوحة؛ 2.1 هو النموذج ذو الأوزان المفتوحة. تغطي المقارنة اختلافات السعر والقدرات.

ما هي الأجهزة التي يحتاجها؟ لم تنشر Qwen متطلبات VRAM. يقوم الرمز المرجعي بتحميل خط الأنابيب في bfloat16 على جهاز CUDA واحد ويوفر إفراغًا لوحدة المعالجة المركزية؛ تضيف حزم الخدمة المجتمعية FP8. توقع وحدة معالجة رسومات لمركز بيانات أو وحدة معالجة رسومات استهلاكية راقية لإخراج 2K في 40 خطوة.

هل يمكنه تحرير الصور الشفافة، وليس فقط توليدها؟ نعم. أمثلة الإطلاق تغير تعبير الموضوع وتستبدل النص داخل طبقة شفافة مع الحفاظ على قناة ألفا، وتستخرج موضوع RGBA من صورة RGB.

إلى أين نذهب بعد ذلك

Qwen-Image-2.1 هو نموذج تحرير مفتوح قوي يتميز بميزة لا يقدمها أي نموذج آخر في نقطة تفتيش واحدة، وهي الشفافية الأصلية، وقيد واحد يحدد ما إذا كان يمكنك استخدامه، وهو ترخيص البحث. قم بتشغيله محليًا باستخدام الدليل الإرشادي، جربه بدون وحدة معالجة رسومات عبر الخيارات المجانية، وقارن واجهة برمجة تطبيقات 3.0 المستضافة قبل الالتزام. أيًا كان ما تختاره، ضع نقطة النهاية قيد الاختبار في Apidog حتى لا يؤدي تبديل النموذج أبدًا إلى تعطيل منتجك بصمت.

زر

ممارسة تصميم API في Apidog

اكتشف طريقة أسهل لبناء واستخدام واجهات برمجة التطبيقات