في 13 أبريل 2025، أصدرت SkyworkAI سلسلة Skywork-OR1 (Open Reasoner 1) والتي تضم ثلاثة نماذج:
- Skywork-OR1-Math-7B
- Skywork-OR1-7B-Preview
- Skywork-OR1-32B-Preview
- تم تدريب هذه النماذج باستخدام تعلم تعزيزي قائم على القواعد واسع النطاق، مع تركيز خاص على قدرات الاستدلال الرياضي والبرمجي.
- تعتمد النماذج على بنى DeepSeek المقطرة: إصدارات 7B تستخدم DeepSeek-R1-Distill-Qwen-7B كأساس، بينما يعتمد نموذج 32B على DeepSeek-R1-Distill-Qwen-32B.
هل تريد منصة متكاملة لجميع الفرق المطورة لديك للعمل معًا بأقصى إنتاجية؟
تقدم Apidog جميع متطلباتك، وتحل محل Postman بسعر أكثر affordability!

Skywork-OR1-32B: ليس مجرد نموذج استدلالي مفتوح المصدر
يحتوي نموذج Skywork-OR1-32B-Preview على 32.8 مليار معلمة ويستخدم نوع الموتر BF16 للدقة العددية. يتم توزيع النموذج بتنسيق safetensors ويعتمد على بنية Qwen2. وفقًا لمستودع النموذج، يحتفظ بنفس بنية النموذج الأساسي DeepSeek-R1-Distill-Qwen-32B ولكن مع تدريب متخصص لمهام الاستدلال الرياضي والبرمجي.
المعلومات الفنية الأساسية لعائلة Skywork:
Skywork-OR1-32B-Preview
- عدد المعلمات: 32.8 مليار
- النموذج الأساسي: DeepSeek-R1-Distill-Qwen-32B
- نوع الموتر: BF16
- التخصص: استدلال عام
- الأداء الرئيسي:z
- AIME24: 79.7 (Avg@32)
- AIME25: 69.0 (Avg@32)
- LiveCodeBench: 63.9 (Avg@4)
يظهر النموذج 32B تحسنًا بمقدار 6.8 نقطة في AIME24 و10.0 نقطة في AIME25 مقارنة بالنموذج الأساسي. يحقق كفاءة في المعلمات من خلال تقديم أداء مماثل لنموذج DeepSeek-R1 الذي يحتوي على 671B معلمة باستخدام 4.9% فقط من المعلمات.
Skywork-OR1-Math-7B
- عدد المعلمات: 7.62 مليار
- النموذج الأساسي: DeepSeek-R1-Distill-Qwen-7B
- نوع الموتر: BF16
- التخصص: استدلال رياضي
- الأداء الرئيسي:
- AIME24: 69.8 (Avg@32)
- AIME25: 52.3 (Avg@32)
- LiveCodeBench: 43.6 (Avg@4)
يتفوق النموذج بشكل كبير على النموذج الأساسي في المهام الرياضية (69.8 مقابل 55.5 في AIME24، 52.3 مقابل 39.2 في AIME25)، مما يظهر فعالية منهج التدريب المتخصص.
Skywork-OR1-7B-Preview
- عدد المعلمات: 7.62 مليار
- النموذج الأساسي: DeepSeek-R1-Distill-Qwen-7B
- نوع الموتر: BF16
- التخصص: استدلال عام
- الأداء الرئيسي:
- AIME24: 63.6 (Avg@32)
- AIME25: 45.8 (Avg@32)
- LiveCodeBench: 43.9 (Avg@4)
بينما يظهر تخصصًا رياضيًا أقل من إصدار Math-7B، يقدم هذا النموذج أداءً أكثر توازنًا بين المهام الرياضية والبرمجية.
مجموعة بيانات تدريب Skywork-OR1-32B
تحتوي مجموعة التدريب على:
- 110,000 مسألة رياضية متنوعة وقابلة للتحقق
- 14,000 سؤال برمجي
- جميعها من مجموعات بيانات مفتوحة المصدر

خطوة معالجة البيانات:
- تقدير الصعوبة بناءً على النموذج: يتم تقييم صعوبة كل مسألة بالنسبة لقدرات النموذج الحالية للسماح بالتدريب المستهدف.
- تقييم الجودة: يتم تطبيق تصفية صارمة قبل التدريب لضمان جودة مجموعة البيانات.
- تصفية خارجية وداخلية: عملية تصفية من مرحلتين:
- إزالة الأمثلة غير المثلى قبل التدريب (خارجي)
- ضبط اختيار المسائل ديناميكيًا أثناء التدريب (داخلي)
- أخذ العينات بالرفض: تستخدم هذه التقنية للتحكم في توزيع أمثلة التدريب للمحافظة على منحنى تعلم مثالي.


خط أنابيب التدريب المتقدم بالتعلم التعزيزي
تستخدم النماذج نسخة مخصصة من GRPO (التعزيز التوليدي عبر تحسين السياسة) مع تحسينات تقنية متعددة:
- خط أنابيب تدريب متعدد المراحل: يتقدم التدريب عبر مراحل مميزة، كل مرحلة تبني على القدرات المكتسبة سابقًا.
- التحكم الديناميكي في الإنتروبيا: يضبط توازن الاستكشاف والاستغلال أثناء التدريب.
- نسخة مخصصة من إطار VERL: تم تدريب النماذج باستخدام نسخة معدلة من مشروع VERL، مكيفة خصيصًا لمهام الاستدلال.
اقرأ الورقة البحثية الكاملة هنا.
معايير أداء Skywork-OR1-32B



المواصفات الفنية:
- عدد المعلمات: 32.8 مليار
- نوع الموتر: BF16
- تنسيق النموذج: Safetensors
- عائلة البنية: Qwen2
- النموذج الأساسي: DeepSeek-R1-Distill-Qwen-32B
تقدم سلسلة Skywork-OR1 مقياس Avg@K كأداة تقييم رئيسية بدلاً من Pass@1 التقليدي. يحسب هذا المقياس متوسط الأداء عبر محاولات مستقلة متعددة (32 لاختبارات AIME، 4 لـ LiveCodeBench)، مما يقلل التباين ويوفر قياسًا أكثر موثوقية لاتساق الاستدلال.
تظهر البيانات أن Skywork-OR1-32B-Preview يعمل بمستوى قريب من DeepSeek-R1 (79.7 مقابل 79.8 في AIME24، 69.0 مقابل 70.0 في AIME25، و63.9 مقابل 65.9 في LiveCodeBench)، على الرغم من أن الأخير يحتوي على 20 ضعف المعلمات (671B مقابل 32.8B).
كيفية اختبار نماذج Skywork-OR1
إعداد بيئة Docker:
docker pull whatcanyousee/verl:vemlp-th2.4.0-cu124-vllm0.6.3-ray2.10-te2.0-megatron0.11.0-v0.0.6
docker run --runtime=nvidia -it --rm --shm-size=10g --cap-add=SYS_ADMIN -v <مسار>:<مسار> صورة:وسم
إعداد بيئة Conda:
conda create -n verl python==3.10
conda activate verl
pip3 install torch==2.4.0 --index-url <https://download.pytorch.org/whl/cu124>
pip3 install flash-attn --no-build-isolation
git clone <https://github.com/SkyworkAI/Skywork-OR1.git>
cd Skywork-OR1
pip3 install -e .
لتقييم AIME24:
MODEL_PATH=Skywork/Skywork-OR1-32B-Preview \\\\\\\\\\\\\\\\
DATA_PATH=or1_data/eval/aime24.parquet \\\\\\\\\\\\\\\\
SAMPLES=32 \\\\\\\\\\\\\\\\
TASK_NAME=Aime24_Avg-Skywork_OR1_Math_7B \\\\\\\\\\\\\\\\
bash ./or1_script/eval/eval_32b.sh
لتقييم AIME25:
MODEL_PATH=Skywork/Skywork-OR1-Math-7B \\\\\\\\\\\\\\\\
DATA_PATH=or1_data/eval/aime25.parquet \\\\\\\\\\\\\\\\
SAMPLES=32 \\\\\\\\\\\\\\\\
TASK_NAME=Aime25_Avg-Skywork_OR1_Math_7B \\\\\\\\\\\\\\\\
bash ./or1_script/eval/eval_7b.sh
لتقييم LiveCodeBench:
MODEL_PATH=Skywork/Skywork-OR1-Math-7B \\\\\\\\\\\\\\\\
DATA_PATH=or1_data/eval/livecodebench/livecodebench_2408_2502.parquet \\\\\\\\\\\\\\\\
SAMPLES=4 \\\\\\\\\\\\\\\\
TASK_NAME=LiveCodeBench_Avg-Skywork_OR1_Math_7B \\\\\\\\\\\\\\\\
bash ./or1_script/eval/eval_7b.sh
الإصدارات النهائية القادمة
يتم تصنيف النماذج الحالية كإصدارات "معاينة"، مع إصدارات نهائية متوقعة خلال أسبوعين من الإعلان الأولي. سيتم إصدار وثائق تقنية إضافية تشمل:
- تقرير تقني مفصل عن منهجية التدريب
- مجموعة بيانات Skywork-OR1-RL-Data
- نصوص تدريب إضافية
الخلاصة: التقييم التقني لـ Skywork-OR1-32B
يمثل نموذج Skywork-OR1-32B-Preview تقدمًا كبيرًا في نماذج الاستدلال الفعالة من حيث المعلمات. بـ 32.8 مليار معلمة، يحقق مقاييس أداء قريبة جدًا من نموذج DeepSeek-R1 الذي يحتوي على 671 مليار معلمة عبر معايير متعددة.
على الرغم من عدم التحقق منها بعد، تشير هذه النتائج إلى أنه للتطبيقات العملية التي تتطلب قدرات استدلال متقدمة، يقدم Skywork-OR1-32B-Preview بديلاً عمليًا للنماذج الأكبر بكثير، مع متطلبات حسابية أقل بشكل كبير.
بالإضافة إلى ذلك، توفر الطبيعة مفتوحة المصدر لهذه النماذج، جنبًا إلى جنب مع نصوص التقييم وبيانات التدريب القادمة، موارد تقنية قيمة للباحثين والممارسين العاملين على قدرات الاستدلال في نماذج اللغة.
هل تريد منصة متكاملة لجميع الفرق المطورة لديك للعمل معًا بأقصى إنتاجية؟
تقدم Apidog جميع متطلباتك، وتحل محل Postman بسعر أكثر affordability!


