معظم عمليات إطلاق النماذج تقدم قدرات البرمجة بالطريقة نفسها: إليك درجة HumanEval الخاصة بنا، وإليك مقتطف يوضح كيفية كتابة النموذج لبحث ثنائي. اتخذت Alibaba مسارًا مختلفًا مع Qwen 3.8-Max. الادعاء ليس "إنه يكتب وظائف جيدة". الادعاء هو أنه يمكنه إدارة مشروع برمجي بمفرده لأسابيع: فتح المشاكل، ودمج طلبات السحب، وشحن الميزات دون تدخل بشري.
هذه فكرة جريئة، وتستحق التدقيق. تتناول هذه المقالة العروض التوضيحية الثلاثة للبرمجة التي نشرتها Alibaba عند الإطلاق (جميعها عروض توضيحية للموردين، أحدها مع مستودع عام يمكنك تدقيقه)، وأرقام معايير البرمجة الكامنة وراءها، ثم الجزء الذي يمكنك التصرف بناءً عليه اليوم: كيفية البرمجة فعليًا باستخدام qwen3.8-max في Claude Code وCodex وQoder وQwen Code وOpenClaw، وكيفية اختبار مخرجات API التي ينتجها الكود الذي تم إنشاؤه.
إذا كنت جديدًا على النموذج نفسه، فابدأ بالنظرة العامة حول ما هو Qwen 3.8: 2.4 تريليون معلمة إجمالية، 95 مليار معلمة نشطة، نافذة سياقية بحجم مليون رمز، وأوزان مفتوحة موعودة للأسبوع الذي يلي الإطلاق. هنا سنركز على قصة البرمجة. كل ما يلي يعكس حالة الأمور اعتبارًا من 3 أغسطس 2026.
ما تدعيه Alibaba بالفعل
الإطار في منشور إصدار Qwen 3.8 الرسمي هو الاستقلالية على حساب المقتطفات. تضع Alibaba نموذج Qwen 3.8-Max كنموذج يمكنه الاحتفاظ بمهمة هندسية طويلة الأفق في ذهنه: تخطيط العمل، تنفيذه على مدى أيام، التعافي من أخطائه الخاصة، وتقديم شيء قابل للمراجعة في النهاية.

ثلاثة أمور تجعل هذا الادعاء أكثر إثارة للاهتمام من التسويق المعتاد ليوم الإطلاق:
- العروض التوضيحية طويلة. ستة عشر يومًا هي نظام مختلف عن معيار وكيل مدته 20 دقيقة. استعادة الأخطاء، وإدارة السياق، والانجراف لها أهمية أكبر بكثير على هذا النطاق.
- أحد العروض التوضيحية عام. يمكنك تصفح المستودع، وقراءة التعهدات، والحكم على جودة الكود بنفسك. معظم عروض الموردين لا تقدم ذلك.
- النظام المستخدم هو نظام منافس. أجرت Alibaba معظم معايير البرمجة الخاصة بها باستخدام نظام Claude Code، ونشرت تكوينًا رسميًا حتى تتمكن من فعل الشيء نفسه. المزيد عن ذلك أدناه.
تحذير قياسي، وينطبق على هذه المقالة بأكملها: كل رقم هنا يأتي من مواد إطلاق Alibaba الخاصة. لا يوجد تحقق مستقل حتى أوائل أغسطس 2026. تعامل مع العروض التوضيحية كعروض، وليس كتدقيقات.
العروض التوضيحية الثلاثة للبرمجة
oh-my-cli: 16 يومًا من التطوير المستقل
العرض التوضيحي الرئيسي. أطلقت Alibaba نموذج Qwen 3.8-Max لبناء أداة سطر أوامر وتركته يعمل دون مراقبة. اعتبارًا من 30 يوليو، كانت العملية مستمرة لمدة 16 يومًا وأنتجت 265 تعهدًا، و127 طلب سحب، و151 مشكلة، جميعها تم فتحها والعمل عليها وإغلاقها بواسطة النموذج نفسه.
المستودع عام على qwen-code-dev-bot/oh-my-cli، وهو الجزء الأكثر فائدة في العرض التوضيحي بأكمله. لا يتعين عليك أخذ عدد التعهدات على محمل الجد. يمكنك قراءة أوصاف طلبات السحب، والتحقق مما إذا كانت المشاكل أخطاء حقيقية أم عملًا روتينيًا، ومعرفة ما إذا كان الكود يصمد. ستة عشر يومًا من مخرجات نموذج بدون مراجعة بشرية هي قطعة نادرة حقًا، مهما كان استنتاجك النهائي بشأن الجودة.
ما يجب البحث عنه عند تدقيقه: ما إذا كانت طلبات السحب تُصلح المشاكل التي تشير إليها بالفعل، وما إذا كان النموذج ينشئ عملًا مصطنعًا لإغلاقه، وكيف يتعامل مع تراجعاته الخاصة. تخبرك هذه الأنماط المزيد عن الموثوقية طويلة الأمد أكثر من أي درجة معيار واحدة.
تشغيل استنساخ الأبحاث: كود بحثي، وليس كود تطبيق
يستهدف العرض التوضيحي الثاني فئة أصعب من البرمجة: استنساخ ورقة بحثية في مجال تعلم الآلة من الصفر. وفقًا لأرقام Alibaba، استغرقت العملية حوالي 125 ساعة، وأنتجت حوالي 7,600 سطر من الكود، ونفذت 33 جولة تدريب على وحدات معالجة الرسوميات على طول الطريق.

النتيجة: استنسخ النموذج 6 من نتائج الورقة، ثم ذهب خطوة أبعد وتجاوز النتيجة المبلغ عنها في الورقة بـ 2.7 نقطة على AIME24. يُعرف استنساخ الأبحاث بأنه عمل لا يرحم. تتكسر البيئات، وتختبئ المعلمات الفائقة في الحواشي، ويُبطل خطأ صامت واحد جولة تدريب تكتشفها بعد ساعات. النموذج الذي يمكنه تجاوز 33 جولة تدريب والخروج بأرقام متطابقة يفعل شيئًا يتجاوز الإكمال التلقائي.
يتطابق هذا العرض التوضيحي مع أقوى صف معياري لـ Qwen 3.8-Max، وهو PaperBench، والذي سيتم تغطيته أدناه.
مسابقة Tianchi: 24 ساعة ضد فرق بشرية
وضع العرض التوضيحي الثالث النموذج في مسابقة حية لعلوم البيانات على منصة Tianchi التابعة لـ Alibaba بحد أقصى 24 ساعة. قدم النموذج 45 مشاركة في تلك النافذة، مكررًا نهجه في كل مرة، وانتهى بدقة نهائية بلغت 0.853. وهذا وضعه متقدمًا على 458 من أصل 526 فريقًا بشريًا متنافسًا.

تجدر الإشارة إلى شكل هذه النتيجة: النموذج لم يفز. لقد تغلب على 87٪ من المشاركين، وهو أمر مثير للإعجاب وصادق في نفس الوقت. كما أنه يظهر قدرة لا تظهرها العرضان التوضيحيان الآخران: التكرار السريع تحت ضغط الموعد النهائي، حيث تغذي درجة كل مشاركة المحاولة التالية.
تحذير إضافي ينطبق بقوة خاصة هنا: Tianchi هي منصة Alibaba الخاصة. العرض التوضيحي حقيقي، لكن المورد تحكم في المكان.
معايير البرمجة وراء العروض التوضيحية
نشرت Alibaba جدولًا كاملًا للمعايير عند الإطلاق. فيما يلي الصفوف المتعلقة بالبرمجة، مع إبقاء الأجزاء الصادقة. جميع الأرقام هي نتائج تشغيل Alibaba نفسها.
| المعيار | Qwen 3.8-Max | أفضل منافس (وفقًا لجدول Alibaba) |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 (GPT-5.6 Sol) |
| SWE-bench Pro | 67.7 | 80.0 (Fable 5) |
| PaperBench | 93.0 | 90.5 (GPT-5.6 Sol) |
ثلاث نقاط رئيسية:
- Terminal Bench 2.1 (86.6) يضع Qwen 3.8-Max متقدمًا على Claude Opus 4.8 وFable 5 (كلاهما 84.6 في جدول Alibaba) في العمل الوكائي القائم على الطرفيات. هذا هو الرقم الذي يدعم عرض oh-my-cli التوضيحي.
- SWE-bench Pro (67.7) هي الخسارة، وهي ليست قريبة. يسجل Fable 5 80.0 في نفس الجدول. في إصلاح الأخطاء على نطاق المستودع، وهو المعيار الذي يرتبط ارتباطًا مباشرًا بـ "إصلاح هذه المشكلة في قاعدة الكود الخاصة بي"، يتخلف Qwen 3.8-Max عن المتصدر بأكثر من 12 نقطة. نشرت Alibaba هذا الرقم على أي حال، وهذا يحسب لها.
- PaperBench (93.0) هو أفضل صف رئيسي منفرد للنموذج، متفوقًا على كل شيء في مجموعة المقارنة. وهو يدعم عرض استنساخ الأوراق البحثية مباشرة.
الآن التفاصيل الدقيقة التي ستتجاهلها معظم التغطيات: أجرت Alibaba معظم معايير البرمجة هذه على نظام Claude Code، بما في ذلك التشغيل لنماذج منافسة، وتشير حواشي الجدول إلى أن نتائج Fable 5 قد تتضمن عمليات احتياطية. يؤثر اختيار النظام بشكل جوهري على درجات المعايير الوكائية، لذا فإن جدولًا يديره مورد على نظام معين هو نقطة بيانات واحدة، وليس حكمًا نهائيًا.
تفاصيل Claude Code تعمل في اتجاهين، مع ذلك. هذا يعني أن Alibaba قامت بالتحسين للنظام الذي قد تستخدمه بالفعل، ونشرت التكوين لإثبات ذلك.
كيفية البرمجة فعليًا باستخدام Qwen 3.8 اليوم
هذا هو الجزء العملي. يتوفر Qwen 3.8-Max بشكل عام على Alibaba Cloud Model Studio، ونشرت Alibaba تكوينات رسمية لخمس أدوات برمجة عند الإطلاق. تحتاج إلى مفتاح API لـ DashScope (من home.qwencloud.com) لجميعها. الأسعار هي 2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج، بسعر ثابت عبر سياق 1 مليون كامل، وفقًا لصفحة تسعير Model Studio الرسمية.
Claude Code
يأتي النموذج مع نقطة نهاية API متوافقة مع Anthropic، لذا فإن توجيه Claude Code إليه يتطلب ثلاثة متغيرات بيئة:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
ابدأ Claude Code كالمعتاد وسيقوم بتوجيه كل طلب إلى Qwen 3.8-Max بدلاً من Claude. نظرًا لأن Alibaba أجرت معايير البرمجة الخاصة بها على هذا النظام بالضبط، فإن هذا هو التكوين الذي يقل فيه الاختلاف بين ما تم قياسه وما ستختبره.
Codex
يحتاج Codex إلى إدخال مزود في تكوينه. المخطط من الوثائق الرسمية:
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
يستخدم هذا نقطة النهاية المتوافقة مع OpenAI بدلاً من نقطة Anthropic. نفس النموذج، نفس المفتاح، شكل بروتوكول مختلف.
Qoder، Qwen Code، و OpenClaw
الثلاثة المتبقية يمكن تلخيصها بسرعة أكبر:
- Qoder CLI: أداة البرمجة الوكائية الخاصة بـ Alibaba. اختر
qwen3.8-maxكنموذج؛ إنه تكامل من طرف أول، لذا الإعداد هو قيمة تكوين. - Qwen Code: واجهة سطر الأوامر مفتوحة المصدر من فريق Qwen. قم بتعيين
DASHSCOPE_API_KEYواختر النموذج. إذا كنت قد استخدمته مع نماذج Qwen البرمجية السابقة، فلن يتغير شيء آخر. - OpenClaw: يعيّن التكوين الرسمي معرف النموذج و
maxTokensبقيمة 65,536، وهو أيضًا المكان الذي يأتي منه الحد الأقصى لطول إخراج النموذج.
جميع التكوينات الخمسة موجودة في منشور الإطلاق، لذا احصل على الإصدار الدقيق الحالي من هناك بدلاً من الاعتماد على لقطة مدونة.
حدد جهد التفكير عمدًا
يدعم Qwen 3.8-Max معلمة reasoning_effort بثلاثة مستويات: xhigh (الافتراضي)، medium، و low. بالنسبة للبرمجة، هذا الإعداد أكثر أهمية من معظم الأدوات الأخرى:
- احتفظ بـ
xhighللعمل الوكائي: إعادة هيكلة متعددة الملفات، جلسات تصحيح الأخطاء، أي شيء يخطط فيه النموذج قبل التعديل. تمثل عمليات العرض التوضيحي هذا الوضع. - اخفض إلى
lowللتعديلات السريعة: إعادة تسمية، تمريرات docstring، تغييرات ميكانيكية حيث يؤدي التفكير العميق إلى إهدار الوقت والرموز.
تذكر أن رموز التفكير تُحاسب كرموز إخراج بسعر 6 دولارات لكل مليون، و xhigh هو الافتراضي. تكلف جلسة وكائية طويلة بجهد كامل أموالًا حقيقية؛ يكلف التعديل الميكانيكي بـ xhigh أموالًا بلا فائدة.
إذا كان Qwen 3.8-Max نموذجًا أكثر مما تحتاجه مهمتك، فإن خط Qwen3 Coder السابق لا يزال موجودًا لأعمال البرمجة المخصصة، ويغطي Qwen3 Coder Flash الطرف السريع والرخيص. بالنسبة للثقل الثقيل الآخر ذي الأوزان المفتوحة في هذا المجال، انظر كيف يتعامل Kimi K3 مع أعمال البرمجة.
اختبار ما يبنيه النموذج: خطوة Apidog
هنا تكمن الفجوة في كل عرض توضيحي للبرمجة المستقلة، بما في ذلك عرض Alibaba: يكتب النموذج كودًا يستدعي واجهات برمجة التطبيقات (APIs)، ولا أحد يتحدث عن التحقق من هذه الاستدعاءات. يمكن للوكيل أن ينتج 7,600 سطر يتم تجميعها بشكل نظيف ومع ذلك يضرب نقطة نهاية خاطئة، أو يتعامل بشكل غير صحيح مع خطأ 429، أو يشحن نص طلب يفشل في التحقق في الإنتاج.
عادتان تغلقان تلك الفجوة.
اختبر نقاط النهاية التي يستدعيها الكود الذي تم إنشاؤه. عندما يقوم Qwen 3.8-Max ببناء خدمة أو كتابة عميل API، قم باستيراد المواصفات ذات الصلة إلى Apidog واختبر نقاط النهاية مباشرة: تدفقات المصادقة، استجابات الأخطاء، حمولات الحالات الهامشية. من الأرخص بكثير العثور على افتراض خاطئ في تشغيل اختباري بدلاً من تتبع مكدس بعد يومين من جلسة مستقلة. إذا كنت تقيّم واجهة برمجة التطبيقات الخاصة بالنموذج قبل الالتزام بها، فإن دليل Qwen 3.8 API يغطي إعداد بروتوكول OpenAI و Anthropic المزدوج بالتفصيل، و Apidog مكان مناسب لفحص أشكال البروتوكولين جنبًا إلى جنب، بما في ذلك الاستجابات المتدفقة وفروق التفكير.
محاكاة واجهات برمجة التطبيقات حتى لا تضرب عمليات الوكلاء الإنتاج. هذا الأمر يزداد أهمية كلما طالت مدة عملياتك. جلسة مستقلة لمدة 16 يومًا تقوم باستدعاءات حية ضد البنية التحتية للإنتاج هي فكرة سيئة حقًا: حدود معدل الطلبات، تغييرات البيانات، فواتير مفاجئة. توفر خوادم المحاكاة في Apidog للوكيل استجابات واقعية دون لمس أنظمة حقيقية. وجه الكود الذي تم إنشاؤه إلى عنوان URL للنموذج أثناء التشغيل، واستبدل عنوان URL الأساسي الحقيقي عندما يراجع الإنسان الإخراج. قم بتنزيل Apidog مجانًا لإعداد محاكاة في بضع دقائق؛ إنه أرخص تأمين يمكن أن تحصل عليه عملية وكيل غير مراقبة.
يتعمم النمط: كلما زادت الاستقلالية التي تمنحها لنموذج البرمجة، زادت طبقة API لتصبح سطح التحكم الخاص بك. لا يمكنك مراجعة كل التزامه في الوقت الفعلي، ولكن يمكنك التحكم في ما يسمح للكود بالتحدث معه.
الأسئلة الشائعة
هل Qwen 3.8 جيد للبرمجة؟
وفقًا لأرقام Alibaba الخاصة، فهو قوي في البرمجة الوكائية والبحثية (Terminal Bench 2.1 عند 86.6، PaperBench عند 93.0) ومتوسط الأداء في إصلاح الأخطاء على نطاق المستودع (SWE-bench Pro عند 67.7 مقابل 80.0 لـ Fable 5). جميع الأرقام هي نتائج يديرها الموردون بدون تحقق مستقل حتى الآن. القراءة الصادقة: ممتاز للعمل المستقل طويل الأمد، وليس الرائد في إصلاح المشكلات التقليدية.
هل يمكنني استخدام Qwen 3.8 في Claude Code؟
نعم، رسميًا. عيّن ANTHROPIC_BASE_URL إلى https://dashscope-intl.aliyuncs.com/apps/anthropic، و ANTHROPIC_AUTH_TOKEN إلى مفتاح DashScope الخاص بك، و ANTHROPIC_MODEL إلى qwen3.8-max. نشرت Alibaba هذا التكوين بنفسها وأجرت معظم معايير البرمجة الخاصة بها على نظام Claude Code.
كم يكلف البرمجة باستخدام Qwen 3.8؟
2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج، بسعر ثابت عبر سياق 1 مليون. تُحاسب رموز التفكير كرموز إخراج، وينتج جهد التفكير الافتراضي xhigh الكثير منها، لذا خصص ميزانية أعلى من السعر المعلن للجلسات الوكائية. تتوفر حسابات التكلفة الكاملة والمقارنات في تفصيل معايير Qwen 3.8 وتغطية التسعير المرتبطة هناك.
هل كان تشغيل oh-my-cli لمدة 16 يومًا مستقلًا حقًا؟
هذا ادعاء Alibaba، وعلى عكس معظم عروض الموردين، يمكنك التحقق من القطعة الأثرية: المستودع عام على qwen-code-dev-bot/oh-my-cli مع 265 التزامًا، و127 طلب سحب، و151 مشكلة اعتبارًا من 30 يوليو 2026. ما إذا كانت جودة الكود تبرر الإطار هو حكم يمكنك إصداره بنفسك من خلال قراءته، وهذا بالضبط ما يجعل هذا العرض التوضيحي أكثر مصداقية من لقطة شاشة.
