تحليل معايير Qwen 3.8: ما تكشفه جداول علي بابا وما تخفيه

معايير Qwen 3.8-Max، قراءة بصراحة: PaperBench 93.0 وانتصارات متعددة الوسائط، وخسائر HLE وSWE-bench Pro، والتفاصيل الدقيقة التي تتجاهلها معظم التغطيات.

INEZA Felin-Michel

INEZA Felin-Michel

3 أغسطس 2026

تحليل معايير Qwen 3.8: ما تكشفه جداول علي بابا وما تخفيه

Apidog للمؤسسات

النشر على الخوادم المحلية

SSO و RBAC

متوافق مع SOC 2

استكشف Apidog للمؤسسات

لمدة أسبوعين، كانت قصة Qwen 3.8 غير مكتملة. الاستعراضات الصحفية في يوليو وعدت بنموذج رائد من الفئة المتقدمة لكنها لم تقدم أي درجات، لذلك اعتمدت كل التقييمات المبكرة على الانطباعات. تغير هذا في 3 أغسطس 2026. يتضمن منشور الإصدار الرسمي لـ Alibaba لنموذج Qwen 3.8-Max جدولًا كاملاً للمعايير مقارنةً بـ Claude Opus 4.8 و Fable 5 و GPT-5.6 Sol، وسابقه Qwen3.7-Max، بالإضافة إلى جدول منفصل متعدد الوسائط مقارنةً بـ Gemini 3.1 Pro و GPT-5.6 Sol.

هذا الجدول يستحق القراءة المتأنية. إنه يحتوي على انتصارات حقيقية وخسائر صادقة وتفاصيل دقيقة ستتجاهلها معظم التغطيات تمامًا. تستعرض هذه التدوينة النقاط الثلاث كلها، ثم تقدم لك طريقة عملية للتوقف عن الثقة بجداول الموردين تمامًا: قم بإجراء تقييمك الخاص مقابل واجهة برمجة التطبيقات (API). إذا كنت ترغب في الحصول على نظرة عامة كاملة عن النموذج أولاً (المعاملات والتسعير والوصول)، ابدأ بـ شرح Qwen 3.8-Max ثم عد إلى هنا.

ملاحظة مهمة قبل الخوض في الأرقام. كل درجة أدناه مأخوذة من جدول Alibaba المنشور الخاص بها، مع بيانات لوحة المتصدرين التي تعود حواشيها إلى 3 أغسطس 2026. لم تكن هناك أي تقييمات مستقلة موجودة وقت كتابة هذا النص. ضع ذلك في اعتبارك لكل صف يتبع.

الجدول، في لمحة

فيما يلي الصفوف الرئيسية لنموذج النص كما نشرتها Alibaba. الأعلى أفضل في جميع هذه الحالات.

المعيار Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max
Terminal Bench 2.1 86.6 84.6 84.6 88.8 74.5
SWE-bench Pro 67.7 69.2 80.0 64.6 60.6
PaperBench 93.0 80.3 88.8 90.5 64.8
GPQA Diamond 92.6 92.0 92.6 94.1 92.4
IFBench 82.8 62.2 63.5 72.7 79.1
HLE (الاختبار الأخير للبشرية) 43.6 45.7 53.3 47.2 41.4

المصدر: جدول Alibaba الذي أعده المورد. سنتناول معنى "الذي أعده المورد" عمليًا لاحقًا، لأنه يهم هنا أكثر من المعتاد.

حيث يتفوق Qwen 3.8-Max

PaperBench: أفضل أداء رئيسي له

يعتبر PaperBench، الذي يختبر ما إذا كان النموذج يمكنه استنساخ نتائج الأوراق البحثية، أقوى أداء منفرد لـ Qwen 3.8-Max مقارنة بالنماذج الرائدة: 93.0، متقدمًا على GPT-5.6 Sol (90.5)، و Fable 5 (88.8)، و Opus 4.8 (80.3). وهي أيضًا قفزة مذهلة من 64.8 لـ Qwen3.7-Max. تستدعي قفزة جيلية بمقدار 28 نقطة في أي معيار التدقيق، ولكن إذا صمدت تحت الاختبار المستقل، فإنها تقول شيئًا حقيقيًا عن قدرة النموذج على البحث طويل الأمد.

IFBench: اتباع التعليمات بفارق كبير

في IFBench، سجل Qwen 3.8-Max نتيجة 82.8. أقرب منافس غير Qwen في الجدول هو GPT-5.6 Sol بنتيجة 72.7، يليه Fable 5 بنتيجة 63.5، و Opus 4.8 بنتيجة 62.2. هذه فجوة تتراوح بين 10 إلى 20 نقطة، وهو أمر غير معتاد في معيار بهذا التشبع. ومن المثير للاهتمام أن Qwen3.7-Max كان يتصدر هذا الصف بالفعل بنتيجة 79.1، لذا يبدو اتباع التعليمات قوة دائمة لـ Qwen وليست مجرد صدفة.

Terminal Bench 2.1: يتفوق بصعوبة على Claude

في اختبار Alibaba لـ Terminal Bench 2.1، سجل Qwen 3.8-Max نتيجة 86.6 مقابل 84.6 لكل من Opus 4.8 و Fable 5. لا يزال GPT-5.6 Sol يتصدر هذا الصف بنتيجة 88.8، لذا فهذه نتيجة المركز الثاني، وليست اكتساحًا. لكن التغلب على كلا نموذجي Anthropic الرائدين في معيار طرفي عامل هو بالضبط نوع النتيجة التي أرادتها Alibaba من هذا الإطلاق، والهامش بنقطتين على Claude هو الرقم الذي ستراه يُقتبس في كل مكان.

الاكتساح متعدد الوسائط

الجدول المنفصل متعدد الوسائط هو حيث يبدو Qwen 3.8-Max الأقوى بشكل عام. تفيد Alibaba بأن MathVision حقق 95.2، و LogicVista 91.9، و OSWorld-Verified 86.1، ويتصدر النموذج تقريبًا كل صف من صفوف OCR في الجدول. لا يتنافس Opus 4.8 ولا Fable 5 بشكل مباشر هنا (فهما يركزان على النصوص في هذه المقارنة)، وهذا جزئيًا سبب ظهور الجدول متعدد الوسائط كـ "اكتساح". مقارنةً بـ Gemini 3.1 Pro و GPT-5.6 Sol، تعد صفوف الاستدلال البصري وذكاء المستندات هي أوضح عوامل تمييز النموذج.

إذا كنت تقارنه بالإصدار الكبير الآخر ذي الوزن المفتوح لهذا الصيف، فإن الفجوة متعددة الوسائط هي أيضًا التباين الأكثر حدة: Kimi K3 يعتمد على النصوص فقط. مقارنتنا بين Qwen 3.8 و Kimi K3 تغطي هذه المواجهة بالكامل.

حيث يخسر، بصدق

تركت Alibaba الخسائر في الجدول، وهو ما يستحق بعض الثناء. ثلاثة نقاط تبرز.

HLE: 43.6، متأخرًا بكثير عن Fable 5. في اختبار البشرية الأخير (Humanity’s Last Exam)، المعيار الرائد للمعرفة الواسعة، سجل Qwen 3.8-Max نتيجة 43.6. يأتي Fable 5 عند 53.3، و GPT-5.6 Sol عند 47.2، و Opus 4.8 عند 45.7. هذا هو المركز الأخير بين النماذج الرائدة الأربعة، متأخرًا بحوالي 10 نقاط عن المتصدر. لقد تفوق على Qwen3.7-Max الذي سجل 41.4، ولكن بصعوبة بالغة. يقاوم HLE الضبط الخاص بالمعيار أفضل من معظم التقييمات، مما يجعل هذا الصف يستحق وزنًا كبيرًا.

SWE-bench Pro: 67.7 مقابل 80.0 لـ Fable 5. في معيار هندسة البرمجيات الأصعب، يحتل Qwen 3.8-Max مركزًا متوسطًا: متقدمًا على GPT-5.6 Sol (64.6)، ومتأخرًا قليلاً عن Opus 4.8 (69.2)، ومتأخرًا بفارق 12 نقطة كاملة عن Fable 5. التحسن الجيلي على Qwen3.7-Max (60.6) حقيقي، لكن "يتفوق على Claude في Terminal Bench" و "يتأخر عن Fable 5 بشكل كبير في SWE-bench Pro" كلاهما صحيح في آن واحد، وسيظهر الادعاء الثاني في عدد أقل بكثير من العناوين الرئيسية.

DeepSWE والصفوف العاملة الأصعب. DeepSWE هو صف آخر يتأخر فيه Qwen 3.8-Max عن النماذج الرائدة في جدول Alibaba الخاص. النمط عبر قسم الترميز ثابت: تنافسي في المهام العاملة التي تعتمد على الطرفية، ومتأخر في أعمق تقييمات هندسة البرمجيات.

الملخص الصادق: يتفوق Qwen 3.8-Max على Opus 4.8 في عدة صفوف عاملة، ويتأخر عن Fable 5 في معظم أعمال الترميز الأساسية، ويحقق فوزًا كبيرًا في الذكاء متعدد الوسائط وذكاء المستندات. هذه نتيجة قوية حقًا لنموذج بسعر 2 دولار للإدخال و 6 دولارات للإخراج لكل مليون رمز (انظر صفحة التسعير الرسمية)، لكنه ليس الفوز الشامل على جميع المستويات الذي قد توحي به نظرة سريعة على تغطية الإطلاق.

التفاصيل الدقيقة التي ستتجاهلها معظم التغطيات

هذا هو القسم الذي يبرر قراءة تدوينة المعايير بدلاً من مجرد عنوان رئيسي. أربعة تفاصيل من منشور Alibaba الخاص تغير كيفية قراءتك للجدول.

1. كل رقم تم اختباره من قبل المورد. قامت Alibaba بتقييم نموذجها الخاص ونماذج منافسيها. هذه ممارسة قياسية لجداول الإطلاق، وهي أيضًا السبب القياسي وراء مراجعة جداول الإطلاق لاحقًا. يختار الموردون إصدارات المعايير، واستراتيجيات التوجيه، وإعدادات أخذ العينات، وسياسات إعادة المحاولة. لا شيء من ذلك احتيال. كل ذلك هو تحيز.

2. تم تشغيل معظم صفوف الترميز على حزمة Claude Code. هذه هي التفاصيل المثيرة للاهتمام حقًا. أجرت Alibaba معظم معايير الترميز الخاصة بها باستخدام Claude Code، وهي حزمة العوامل الخاصة بـ Anthropic، موجهة إلى Qwen 3.8-Max عبر واجهة برمجة التطبيقات المتوافقة مع Anthropic. من ناحية، هذه خطوة عادلة: فهي تقيّم كل نموذج داخل نفس الأداة المستخدمة على نطاق واسع. من ناحية أخرى، هذا يعني أن "درجات ترميز Qwen" هي في الواقع درجات "Qwen داخل حزمة Anthropic"، ويمكن أن يؤدي اختيار الحزمة إلى تغيير نتائج العوامل بعدة نقاط. كما يخبرك شيئًا عن المكان الذي تتوقع Alibaba أن يعمل فيه هذا النموذج عمليًا.

3. العديد من المعايير داخلية لـ Qwen. تم بناء QwenSWEBench و QwenQoderBench و CoWorkBench و RecreationBench جميعها بواسطة فريق Qwen. المعايير الداخلية ليست بلا قيمة؛ فهي غالبًا ما تستكشف قدرات تغفل عنها التقييمات العامة. لكن درجة النموذج القوية في معيار صنعه هو نفسه دليل من نوع مختلف عن درجة قوية في SWE-bench Pro، ويقدم الجدول كلاهما جنبًا إلى جنب دون تمييز بصري. عند اقتباس رقم من هذا الجدول، تحقق أولاً من الفئة التي ينتمي إليها.

4. الحاشية المتعلقة بـ Fable 5. يتضمن جدول Alibaba الخاص حاشية تقول "قد تتضمن نتائج Fable5 حالات تراجع". هذا اعتراف ضمني بأن أرقام أحد المنافسين على الأقل قد لا تعكس تشغيل النموذج بشكل نظيف. بغض النظر عن السبب التقني، فهذا يعني أن عمود Fable 5، النموذج الذي يتأخر عنه Qwen 3.8-Max غالبًا، يأتي مع علامة نجمية من الأشخاص الذين نشروه.

لا شيء من هذا خاص بـ Alibaba. تنشر Anthropic و OpenAI و Google جميعها جداول خاصة بها مع خيارات منهجية خاصة بها. لقد أشرنا إلى نفس النمط في تحليلنا لمعايير Kimi K3، وقد انطبق هناك أيضًا. النقطة ليست أن Alibaba غشت. النقطة هي أن جدول المورد هو ادعاء، وليس قياسًا.

ما يجب مراقبته، وكيفية قراءة الجدول التالي

اعتبارًا من 3 أغسطس 2026، لا توجد تقييمات مستقلة لـ Qwen 3.8-Max. لم تُسجل Artificial Analysis ولوحات المتصدرين المجتمعية نموذج Qwen 3.8-Max بعد وقت كتابة هذا النص. سيتغير ذلك في غضون أيام، وستكون الفروقات بين جدول Alibaba والنتائج المستقلة هي القصة الحقيقية. سنقوم بتحديث هذه التدوينة عندما تتوفر تلك النتائج.

حتى ذلك الحين، إليك قائمة تحقق قصيرة لتقييم أي جدول معايير من قبل المورد، وهذا الجدول مشمول:

  1. من أجرى التقييم؟ الأرقام التي يبلغ عنها المنافسون تستحق تشكيكًا أكبر من الأرقام التي يبلغ عنها النموذج الخاص بالمورد نفسه.
  2. أي حزمة وإعدادات؟ تعتمد المعايير العاملة على الحزمة المستخدمة. الجدول الذي يذكر حزمته (كما فعلت Alibaba) يكون أكثر فائدة من الجدول الذي لا يذكرها، لكن الاختيار لا يزال يؤثر على النتائج.
  3. ما هي المعايير التي بناها المورد؟ التقييمات الداخلية تقيس شيئًا ما، لكن ليس نفس الشيء الذي تقيسه التقييمات العامة.
  4. اقرأ الحواشي. عبارة "قد تتضمن حالات تراجع" تؤدي عملًا كبيرًا بخط صغير.
  5. تحقق مما هو مفقود. غالبًا ما تكون الصفوف التي لم ينشرها المورد مفيدة بنفس القدر مثل الصفوف التي نشرها. لقد أسقطت جداول الموردين السابقة بهدوء المعايير التي كان أداء النموذج فيها ضعيفًا؛ قارن بـ كيف كان أداء الجيل السابق عبر الموردين لتحديد الصفوف التي اختفت.
  6. انتظر المصدر الثاني. عادة ما يكفيك أسبوع واحد من الصبر للحصول على أرقام مستقلة.

قم بإجراء تقييمك الخاص بدلاً من ذلك

تساعدك قائمة التحقق في قراءة الجداول. الخطوة الأفضل هي أن تقلل اعتمادك عليها. يتوفر Qwen 3.8-Max الآن على Alibaba Cloud Model Studio (معرّف النموذج qwen3.8-max، والمدرج في صفحة النماذج الرسمية) بواجهة برمجة تطبيقات متوافقة مع OpenAI وأخرى متوافقة مع Anthropic، ومعيار يستخدم مطالباتك الفعلية يتفوق على أي تقييم عام لا يستخدمها.

إعداد عملي في Apidog يبدو كالتالي. أنشئ طلبًا واحدًا مقابل نقطة نهاية إكمال الدردشة في Model Studio باستخدام qwen3.8-max وطلبًا ثانيًا مطابقًا مقابل نموذجك الأساسي الحالي، سواء كان Qwen3.7-Max أو Kimi K3 أو نقطة نهاية Claude أو GPT. احفظ من 20 إلى 30 من مطالبات الإنتاج الحقيقية الخاصة بك كسيناريو اختبار، وأضف تأكيدات لخصائص الاستجابة التي تهتم بها فعليًا (JSON صالح، حقول مطلوبة موجودة، زمن استجابة أقل من عتبتك)، وقم بتشغيل كلا السيناريوهين على التوالي. تقارير اختبار Apidog تمنحك معدلات النجاح وأوقات الاستجابة لكل نموذج، جنبًا إلى جنب، على عبء عملك بدلاً من عبء عمل Alibaba.

شيئان خاصان بـ Qwen يجب التحقق منهما أثناء قيامك بذلك: النموذج يُعيّن افتراضيًا reasoning_effort: xhigh، لذا قم بقياس التكلفة وزمن الاستجابة عند مستوى الجهد الذي ستستخدمه فعليًا، وإذا كنت تخطط لاستخدام نقطة النهاية المتوافقة مع Anthropic، اختبر شكل هذا البروتوكول بشكل منفصل، لأنه هو الذي استخدمته معظم معايير الترميز الخاصة بـ Alibaba. قم بتنزيل Apidog مجانًا، اربط نقطتي النهاية كبيئات، وستحصل على أرقام أولية قبل أن تنشر لوحات المتصدرين المستقلة أرقامها.

الأسئلة المتكررة

هل تم التحقق من أرقام معايير Qwen 3.8 بشكل مستقل؟

لا. اعتبارًا من 3 أغسطس 2026، كل رقم منشور يأتي من جدول Alibaba الخاص. لم تُسجل Artificial Analysis ولوحات المتصدرين المجتمعية نموذج Qwen 3.8-Max بعد وقت كتابة هذا النص. تعامل مع الجدول كادعاء من المورد حتى تتوفر النتائج المستقلة.

ما هي أفضل نتيجة لـ Qwen 3.8-Max في المعايير؟

PaperBench، بنتيجة 93.0، هو أفضل صف له في الجدول الرئيسي: متقدمًا على GPT-5.6 Sol (90.5)، و Fable 5 (88.8)، و Opus 4.8 (80.3). في الجدول متعدد الوسائط، يعد MathVision (95.2) وصفوف OCR أقوى نتائجه بشكل عام.

أين يخسر Qwen 3.8-Max بوضوح؟

في HLE، سجل 43.6، وهو الأخير بين النماذج الرائدة الأربعة ومتأخرًا بكثير عن Fable 5 الذي سجل 53.3. في SWE-bench Pro، سجل 67.7 مقابل 80.0 لـ Fable 5، ويتأخر أيضًا في DeepSWE. تعتبر تقييمات هندسة البرمجيات العميقة واختبارات المعرفة الواسعة هي أضعف مجالاته في جدول Alibaba الخاص.

ما مدى تحسن Qwen 3.8 مقارنة بـ Qwen 3.7-Max في المعايير؟

المكاسب الجيلية في جدول Alibaba كبيرة: ارتفع Terminal Bench 2.1 من 74.5 إلى 86.6، و SWE-bench Pro من 60.6 إلى 67.7، و PaperBench من 64.8 إلى 93.0. يعتمد ما إذا كانت الترقية تستحق العناء لعبء عملك على السعر والنمط أيضًا؛ مقارنتنا بين Qwen 3.8 و Qwen 3.7 تستعرض القرار بالكامل.

ممارسة تصميم API في Apidog

اكتشف طريقة أسهل لبناء واستخدام واجهات برمجة التطبيقات