Skywork-OR1-32B: نموذج مفتوح المصدر من الطراز الأول يُنافس Deepseek R1

Ahmed Waheed

Ahmed Waheed

28 نوفمبر 2025

Skywork-OR1-32B: نموذج مفتوح المصدر من الطراز الأول يُنافس Deepseek R1

Apidog للمؤسسات

النشر على الخوادم المحلية

SSO و RBAC

متوافق مع SOC 2

استكشف Apidog للمؤسسات

في 13 أبريل 2025، أصدرت SkyworkAI سلسلة Skywork-OR1 (Open Reasoner 1) والتي تضم ثلاثة نماذج:

💡
هل تريد أداة اختبار واجهة برمجة تطبيقات رائعة تنتج وثائق واجهة برمجة تطبيقات جميلة؟

هل تريد منصة متكاملة لجميع الفرق المطورة لديك للعمل معًا بأقصى إنتاجية؟

تقدم Apidog جميع متطلباتك، وتحل محل Postman بسعر أكثر affordability!
button

Skywork-OR1-32B: ليس مجرد نموذج استدلالي مفتوح المصدر

يحتوي نموذج Skywork-OR1-32B-Preview على 32.8 مليار معلمة ويستخدم نوع الموتر BF16 للدقة العددية. يتم توزيع النموذج بتنسيق safetensors ويعتمد على بنية Qwen2. وفقًا لمستودع النموذج، يحتفظ بنفس بنية النموذج الأساسي DeepSeek-R1-Distill-Qwen-32B ولكن مع تدريب متخصص لمهام الاستدلال الرياضي والبرمجي.

المعلومات الفنية الأساسية لعائلة Skywork:

Skywork-OR1-32B-Preview

يظهر النموذج 32B تحسنًا بمقدار 6.8 نقطة في AIME24 و10.0 نقطة في AIME25 مقارنة بالنموذج الأساسي. يحقق كفاءة في المعلمات من خلال تقديم أداء مماثل لنموذج DeepSeek-R1 الذي يحتوي على 671B معلمة باستخدام 4.9% فقط من المعلمات.

Skywork-OR1-Math-7B

يتفوق النموذج بشكل كبير على النموذج الأساسي في المهام الرياضية (69.8 مقابل 55.5 في AIME24، 52.3 مقابل 39.2 في AIME25)، مما يظهر فعالية منهج التدريب المتخصص.

Skywork-OR1-7B-Preview

بينما يظهر تخصصًا رياضيًا أقل من إصدار Math-7B، يقدم هذا النموذج أداءً أكثر توازنًا بين المهام الرياضية والبرمجية.

مجموعة بيانات تدريب Skywork-OR1-32B

تحتوي مجموعة التدريب على:

خطوة معالجة البيانات:

  1. تقدير الصعوبة بناءً على النموذج: يتم تقييم صعوبة كل مسألة بالنسبة لقدرات النموذج الحالية للسماح بالتدريب المستهدف.
  2. تقييم الجودة: يتم تطبيق تصفية صارمة قبل التدريب لضمان جودة مجموعة البيانات.
  3. تصفية خارجية وداخلية: عملية تصفية من مرحلتين:
  1. أخذ العينات بالرفض: تستخدم هذه التقنية للتحكم في توزيع أمثلة التدريب للمحافظة على منحنى تعلم مثالي.

خط أنابيب التدريب المتقدم بالتعلم التعزيزي

تستخدم النماذج نسخة مخصصة من GRPO (التعزيز التوليدي عبر تحسين السياسة) مع تحسينات تقنية متعددة:

  1. خط أنابيب تدريب متعدد المراحل: يتقدم التدريب عبر مراحل مميزة، كل مرحلة تبني على القدرات المكتسبة سابقًا.
  2. التحكم الديناميكي في الإنتروبيا: يضبط توازن الاستكشاف والاستغلال أثناء التدريب.
  3. نسخة مخصصة من إطار VERL: تم تدريب النماذج باستخدام نسخة معدلة من مشروع VERL، مكيفة خصيصًا لمهام الاستدلال.

اقرأ الورقة البحثية الكاملة هنا.

معايير أداء Skywork-OR1-32B

Skywork/Skywork-OR1-32B-Preview · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Skywork/Skywork-OR1-7B-Preview · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Skywork/Skywork-OR1-Math-7B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.

المواصفات الفنية:

تقدم سلسلة Skywork-OR1 مقياس Avg@K كأداة تقييم رئيسية بدلاً من Pass@1 التقليدي. يحسب هذا المقياس متوسط الأداء عبر محاولات مستقلة متعددة (32 لاختبارات AIME، 4 لـ LiveCodeBench)، مما يقلل التباين ويوفر قياسًا أكثر موثوقية لاتساق الاستدلال.

تظهر البيانات أن Skywork-OR1-32B-Preview يعمل بمستوى قريب من DeepSeek-R1 (79.7 مقابل 79.8 في AIME24، 69.0 مقابل 70.0 في AIME25، و63.9 مقابل 65.9 في LiveCodeBench)، على الرغم من أن الأخير يحتوي على 20 ضعف المعلمات (671B مقابل 32.8B).

كيفية اختبار نماذج Skywork-OR1

إعداد بيئة Docker:

docker pull whatcanyousee/verl:vemlp-th2.4.0-cu124-vllm0.6.3-ray2.10-te2.0-megatron0.11.0-v0.0.6
docker run --runtime=nvidia -it --rm --shm-size=10g --cap-add=SYS_ADMIN -v <مسار>:<مسار> صورة:وسم

إعداد بيئة Conda:

conda create -n verl python==3.10
conda activate verl
pip3 install torch==2.4.0 --index-url <https://download.pytorch.org/whl/cu124>
pip3 install flash-attn --no-build-isolation
git clone <https://github.com/SkyworkAI/Skywork-OR1.git>
cd Skywork-OR1
pip3 install -e .

لتقييم AIME24:

MODEL_PATH=Skywork/Skywork-OR1-32B-Preview \\\\\\\\\\\\\\\\
DATA_PATH=or1_data/eval/aime24.parquet \\\\\\\\\\\\\\\\
SAMPLES=32 \\\\\\\\\\\\\\\\
TASK_NAME=Aime24_Avg-Skywork_OR1_Math_7B \\\\\\\\\\\\\\\\
bash ./or1_script/eval/eval_32b.sh

لتقييم AIME25:

MODEL_PATH=Skywork/Skywork-OR1-Math-7B \\\\\\\\\\\\\\\\
DATA_PATH=or1_data/eval/aime25.parquet \\\\\\\\\\\\\\\\
SAMPLES=32 \\\\\\\\\\\\\\\\
TASK_NAME=Aime25_Avg-Skywork_OR1_Math_7B \\\\\\\\\\\\\\\\
bash ./or1_script/eval/eval_7b.sh

لتقييم LiveCodeBench:

MODEL_PATH=Skywork/Skywork-OR1-Math-7B \\\\\\\\\\\\\\\\
DATA_PATH=or1_data/eval/livecodebench/livecodebench_2408_2502.parquet \\\\\\\\\\\\\\\\
SAMPLES=4 \\\\\\\\\\\\\\\\
TASK_NAME=LiveCodeBench_Avg-Skywork_OR1_Math_7B \\\\\\\\\\\\\\\\
bash ./or1_script/eval/eval_7b.sh

الإصدارات النهائية القادمة

يتم تصنيف النماذج الحالية كإصدارات "معاينة"، مع إصدارات نهائية متوقعة خلال أسبوعين من الإعلان الأولي. سيتم إصدار وثائق تقنية إضافية تشمل:

  1. تقرير تقني مفصل عن منهجية التدريب
  2. مجموعة بيانات Skywork-OR1-RL-Data
  3. نصوص تدريب إضافية
GitHub - SkyworkAI/Skywork-OR1
Contribute to SkyworkAI/Skywork-OR1 development by creating an account on GitHub.

الخلاصة: التقييم التقني لـ Skywork-OR1-32B

يمثل نموذج Skywork-OR1-32B-Preview تقدمًا كبيرًا في نماذج الاستدلال الفعالة من حيث المعلمات. بـ 32.8 مليار معلمة، يحقق مقاييس أداء قريبة جدًا من نموذج DeepSeek-R1 الذي يحتوي على 671 مليار معلمة عبر معايير متعددة.

على الرغم من عدم التحقق منها بعد، تشير هذه النتائج إلى أنه للتطبيقات العملية التي تتطلب قدرات استدلال متقدمة، يقدم Skywork-OR1-32B-Preview بديلاً عمليًا للنماذج الأكبر بكثير، مع متطلبات حسابية أقل بشكل كبير.

بالإضافة إلى ذلك، توفر الطبيعة مفتوحة المصدر لهذه النماذج، جنبًا إلى جنب مع نصوص التقييم وبيانات التدريب القادمة، موارد تقنية قيمة للباحثين والممارسين العاملين على قدرات الاستدلال في نماذج اللغة.

💡
هل تريد أداة اختبار واجهة برمجة تطبيقات رائعة تنتج وثائق واجهة برمجة تطبيقات جميلة؟

هل تريد منصة متكاملة لجميع الفرق المطورة لديك للعمل معًا بأقصى إنتاجية؟

تقدم Apidog جميع متطلباتك، وتحل محل Postman بسعر أكثر affordability!
button

ممارسة تصميم API في Apidog

اكتشف طريقة أسهل لبناء واستخدام واجهات برمجة التطبيقات