أعلنت OpenAI عن GPT-5.6 Sol في 26 يونيو 2026 مع مجموعة من أرقام المقارنات المعيارية التي تبدو كإنجاز نظيف. حالة فنية في Terminal-Bench، النموذج الوحيد الذي تجاوز 50% في اختبار Agent’s Last Exam في وضع الكود، وتقييمات الأمن السيبراني التي تضاهي منافسًا رائدًا بثلث التوكنات. المشكلة التي يجب أن تقرأها أولاً: لا يمكنك تشغيل أي منها. يتم شحن Sol كمعاينة محدودة ومقيدة من الحكومة عبر واجهة برمجة تطبيقات OpenAI و Codex فقط، مقتصرة على حوالي 20 شريكًا تمت الموافقة على أسمائهم فرديًا من قبل الحكومة الأمريكية. إنه ليس موجودًا في ChatGPT، ولا يوجد شيء للتسجيل فيه اليوم.
لذا فإن المقارنات المعيارية ليست نصيحة شراء. إنها تجيب على سؤال واحد، وواحد فقط: هل يستحق GPT-5.6 Sol الانتظار، أم يجب أن تنتقل إلى نموذج يمكنك استخدامه بالفعل؟ هذا ما توضحه هذه المقالة. نستعرض ما يقيسه كل معيار رئيسي، ونضع كل رقم بجانب المعيار الأساسي لـ GPT-5.5 و Claude Mythos 5 الذي لديك بالفعل، وننهي بحكم صريح: انتظر أم انتقل. كل رقم هنا يأتي من تأطير OpenAI الخاص بها والتغطية الثانوية المبكرة، وليس من اختبار أجريناه.
ملخص سريع
- يتوفر GPT-5.6 Sol في معاينة محدودة: عبر OpenAI API و Codex فقط، وليس في ChatGPT، لحوالي 20 شريكًا معتمدًا من الحكومة. يتوفر بشكل عام في "الأسابيع القادمة" وفقًا لـ OpenAI.
- النتائج المبلغ عنها قوية ولكنها مستقاة من مصادر ثانوية. تعامل معها على أنها ادعاءات OpenAI، وليست نتائج مقاسة، حتى يتم إتاحة النموذج.
- الأرقام الرئيسية (وفقًا لـ OpenAI / التغطية المبكرة): Terminal-Bench 2.1 في صدارة الفن (SOTA)، Agent’s Last Exam وضع الكود أعلى من 50%، تكافؤ ExploitBench بحوالي ثلث التوكنات المُنتجة.
- انتظر إذا كان عملك يتضمن البرمجة الذاتية (agentic coding)، أو مهام الطرفيات الطويلة، أو الأمن الدفاعي، ويمكنك التريث لبضعة أسابيع.
- لا داعي للانتظار إذا كنت بحاجة إلى نموذج قيد الإنتاج الآن. البدائل التي يمكنك اختبارها اليوم تسد معظم الفجوة.
اقرأ هذا قبل أن تقرأ النتائج
تخبرك المقارنات المعيارية بما يمكن للنموذج فعله. لكنها لا تخبرك ما إذا كان يمكنك استخدامه. بالنسبة لـ GPT-5.6 Sol، هاتان حقيقتان مختلفتان، والثانية هي المهيمنة حاليًا.
تم تقييد الإطلاق من قبل الإدارة الأمريكية بموجب أمر تنفيذي صادر في 2 يونيو 2026، والذي وضع معايير وتقييمات لنماذج الذكاء الاصطناعي الجديدة. وافقت OpenAI على ذلك كخطوة مؤقتة. على حد تعبيرها، نقلاً عن MacRumors، "نحن نتخذ هذه الخطوة قصيرة المدى لأننا نعتقد أنها أقوى مسار نحو توفير أوسع في الأسابيع القادمة." تقول OpenAI إن التوفر العام في ChatGPT و Codex وواجهة برمجة التطبيقات سيأتي في الأسابيع القادمة. حتى ذلك الحين، النتائج هي معاينة لشيء لا يمكنك شراؤه.
هذا التأطير مهم لكيفية قراءة بقية هذه المقالة. التقدم بأربع نقاط في Terminal-Bench ذو مغزى إذا كان بإمكانك نشره. إنه سبب للمراقبة، وليس لوقف خارطة طريقك، إذا لم تتمكن من ذلك. إذا كنت تريد الصورة الكاملة لما هو Sol ولماذا هو مقفل، فإن شرحنا لـ GPT-5.6 Sol يغطي العائلة والقيود. لم يتم نشر معرفات نموذج واجهة برمجة التطبيقات الدقيقة بعد، لذلك لا يوجد شيء لربطه حتى لو أردت ذلك.
Terminal-Bench 2.1: الرقم الرئيسي
يقيس Terminal-Bench مدى جودة النموذج في إنجاز المهام الحقيقية في الطرفية: تحرير الملفات، تشغيل الأوامر، ربط الأدوات، التعافي من الأخطاء. إنه أقرب بديل عام لـ "هل يمكن لهذا الشيء أن يقوم بعمل برمجة ذاتية (agentic coding) من البداية إلى النهاية" بدلاً من الإجابة على استفسار واحد. لهذا السبب، بدأت OpenAI به.

وفقًا لـ OpenAI والتغطية المبكرة، في Terminal-Bench 2.1، تسجل التكوين الجديد "Ultra"، Sol Ultra، حوالي 91.91%، بينما يسجل Sol القياسي حوالي 88.8%. الخطوط الأساسية التي لديك بالفعل للسياق: Claude Mythos 5 حوالي 88% و GPT-5.5 حوالي 83.4%. إذا صحت هذه الأرقام، فإن وضع Sol القياسي يتعادل تقريبًا مع Mythos 5، ويتفوق Sol Ultra ببضع نقاط واضحة عن البقية.
جزء "Ultra" يؤدي عملًا حقيقيًا في هذه النتيجة العليا. وفقًا لإعلان OpenAI، يتجاوز وضع Ultra "العامل الفردي من خلال الاستفادة من الوكلاء الفرعيين لتسريع العمل المعقد". لذا فإن 91.91% ليست نموذجًا واحدًا يفكر بجدية أكبر؛ بل هو نموذج يولد مساعدين. هذا تحول حقيقي في القدرة، ويعني أيضًا أن الرقم الرئيسي لا ينطبق بشكل مباشر على استدعاء واحد لـ GPT-5.5. للمقارنة المباشرة بين النماذج التي يمكنك تشغيلها اليوم، فإن مقارنتنا بين Claude Opus 4.8 و GPT-5.5 و Gemini 3.5 هي المرجع الأفضل بينما يظل Sol مقيدًا.
اختبار Agent’s Last Exam: ادعاء "النموذج الوحيد الذي تجاوز 50%"
اختبار Agent’s Last Exam هو معيار ذاتي (agentic) صعب تم بناؤه لمقاومة التشبع: مهام متعددة الخطوات حيث يجب على النموذج التخطيط، واستخدام الأدوات، والمتابعة دون تدخل بشري لإعادته إلى المسار الصحيح. وضع الكود هو الجزء الذي يركز بشكل خاص على عمل البرمجيات.
وفقًا للتغطية المبكرة، يسجل GPT-5.6 Sol حوالي 50.9% في وضع الكود ويوصف بأنه النموذج الوحيد الذي يتجاوز 50%. هذا التأطير هو جوهر الأمر. في معيار حيث تجلس معظم النماذج الرائدة في الأربعينات، فإن تجاوز النصف هو نوع القفزة التي تريد OpenAI أن ترتكز عليها في إطلاقها.
اقرأ هذا بنفس الحذر الذي قرأت به رقم Terminal-Bench. 50.9% هو ادعاء من تقارير ثانوية، وليس رقمًا قمنا بقياسه، و"النموذج الوحيد فوق 50%" هو لقطة سريعة ستعمل عليها مختبرات أخرى في غضون أسابيع. القراءة الصادقة: إذا كان عملك برمجة ذاتية (agentic) حقيقية، ترمي إلى أفق طويل حيث يتعين على النموذج إكمال مهمة ما، فهذا هو المعيار الذي يدعو إلى الانتظار. إذا كان عملك برمجة أقصر تعتمد على الطلب والاستجابة، فإن الفجوة مقارنة بنموذج تستخدمه بالفعل أصغر مما توحي به العناوين الرئيسية.
ExploitBench: الكفاءة تتجاوز النتيجة الخام
المعيار الثالث هو الأكثر إثارة للاهتمام بالنسبة لقرار الانتظار أو المضي قدمًا، لأنه لا يتعلق حقًا بنتيجة أكبر. يقيس ExploitBench (و ExploitGym المرتبط به) قدرة الأمن السيبراني. تم ضبط Sol للعثور على نقاط ضعف البرامج وكتابة الإصلاحات مع مقاومة الجهود المبذولة لإنشاء سلاسل استغلال كاملة. هذا موقف دفاعي، وليس نموذجًا للاختراق الهجومي، وتصفه OpenAI بأنه "مكدس الأمان الأكثر قوة حتى الآن".
وفقًا للتغطية المبكرة، في ExploitBench، ينافس Sol نموذج Mythos Preview من Anthropic بينما يستخدم حوالي ثلث التوكنات المنتجة. يظهر نفس النمط في الجانب العلمي: في GeneBench v1، أبلغت OpenAI عن تحسن على GPT-5.5 باستخدام عدد أقل من التوكنات.

قصة التوكنات هي التي تحمل عواقب حقيقية على الميزانية. إذا وصل Sol إلى مستوى جودة مماثل بثلث التوكنات المنتجة، فإن التكلفة الفعلية لكل مهمة تم حلها تنخفض بشكل كبير عما تشير إليه بطاقة الأسعار التي تبلغ 5 دولارات للمدخلات / 30 دولارًا للمخرجات لكل مليون توكن. هذه هي حجة الكفاءة للانتظار: ليس أن Sol أذكى في كل مطالبة، ولكن أنه قد يحصل على نفس الإجابة بتكلفة أقل في أعباء العمل التي تم ضبطه لها. تعد بطاقة نظام أمان النشر من OpenAI هي المكان الذي يتم فيه توثيق إطار السلامة والأمن السيبراني، ومن الجدير قراءتها قبل التعامل مع أي رقم سيبراني على أنه ذو أهمية.
كيفية قراءة هذه النتائج مقارنةً بمعاييرك الأساسية
ضع المقارنات المعيارية الثلاثة معًا وسيظهر شكل. تكون حالة Sol الأقوى في العمل الطويل، والذاتي (agentic)، والذي يعتمد على الأدوات بشكل كبير: مهام الطرفية، البرمجة متعددة الخطوات، عمليات المسح الأمني الدفاعية. في هذه المجالات، تدعي أنها تتفوق ببضع نقاط على Mythos 5 وفجوة أوسع على GPT-5.5، بالإضافة إلى ميزة كفاءة التوكنات.
ما لا تظهره المقارنات المعيارية لا يقل أهمية. لا يوجد حد أقصى منشور لتوكنات الإخراج، ولا يوجد تحديد لقطع المعرفة، ولا قائمة طرق مؤكدة. يتم الإبلاغ عن نافذة السياق بحوالي 1.5 مليون توكن من قبل مصدر واحد و"غير محدد" من قبل مصدر آخر، لذا تعامل معها على أنها غير مؤكدة.
الحكم: انتظر أم انتقل
إليك الملخص الصادق.
انتظر إذا: كان عبء عملك الأساسي يتضمن البرمجة الذاتية (agentic coding)، أو جلسات الطرفيات الطويلة، أو الأمن الدفاعي، ويمكنك الانتظار لبضعة أسابيع. يشير تقدم Terminal-Bench، ونتيجة Agent’s Last Exam، وكفاءة توكنات ExploitBench جميعها إلى هذا الملف الشخصي المحدد. إذا كانت بضع نقاط مئوية في تلك المهام تغير اقتصادياتك، فإن Sol يستحق المراقبة عن كثب. راقب التوفر العام، والأهم من ذلك، المقارنات المعيارية المستقلة التي تؤكد أو تقلل من أرقام الإطلاق.
لا داعي للانتظار إذا: كنت بحاجة إلى نموذج قيد الإنتاج الآن، أو كان عملك يتضمن برمجة أقصر تعتمد على الطلب والاستجابة، أو الدردشة، أو التلخيص، أو التصنيف. لا يمكنك الحصول على Sol اليوم على أي حال، حتى معرفات النموذج لم تُنشر بعد، والبدائل التي يمكنك تشغيلها الآن تسد معظم الفجوة في العمل اليومي. الانتظار لنموذج مقفل ليتم شحنه قبل إصلاح مشكلة لديك اليوم هو صفقة خاطئة. الخطوة الأذكى هي اختيار نموذج رائد يمكنك استخدامه بالفعل؛ فملخصنا لـ النماذج الرائدة التي يمكنك استخدامها اليوم يطابق كل منها بالوظيفة التي يُروّج لها Sol.
ملاحظة صادقة أخرى: حتى عندما يتم التوفر العام (GA)، ستكون الموجة الأولى هي GPT-5.6 عبر جميع مستويات التشكيلة، بما في ذلك Terra و Luna، وليس Sol فقط. يُصنف Terra ليكون أرخص بحوالي مرتين من GPT-5.5 مع أداء مماثل، وهو المستوى الذي ستنتهي معظم الفرق باستخدامه. لذلك، قد يعني "الانتظار لـ Sol" في الواقع الانتظار لاختيار المستوى الصحيح، وهذا قرار أكثر هدوءًا مما توحي به عناوين المقارنات المعيارية.
مكان Apidog بينما تنتظر
لا يمكنك اختبار Sol بعد. يمكنك اختبار كل ما كنت ستلجأ إليه في هذه الأثناء. كل من Mythos 5 و GPT-5.5 و Gemini والبقية يكشفون عن واجهات برمجة تطبيقات متوافقة مع OpenAI أو HTTP قياسية، ويمكنك تشغيلها، والتأكد من استجاباتها، ومقارنة سلوكها في Apidog اليوم. قم بإعداد طلب، ووجهه إلى نقطة نهاية كل نموذج، وسيكون لديك أداة اختبار قابلة للتكرار للقرار الذي تدور حوله هذه المقالة.

هذه الأداة هي أيضًا استعدادك ليوم الإطلاق لـ Sol. في اليوم الذي تحصل فيه على وصول المعاينة، أو عند فتح التوفر العام، تقوم بتبديل نقطة النهاية ومعرف النموذج وتشغيل نفس السيناريوهات التي أنشأتها بالفعل. لا حاجة لأدوات جديدة، ولا استعجال. حمّل Apidog لبناء تلك الاختبارات ضد النماذج التي يمكنك استخدامها الآن، لتكون جاهزًا في اللحظة التي يُتاح فيها النموذج المقيد.
الخلاصة
نتائج GPT-5.6 Sol قوية، وخصوصًا في أعمال الوكلاء (agentic) والأمن التي تم ضبطها لها، وهي لا تزال مجرد ادعاءات تحت قيود حكومية لا يمكنك تجاوزها اليوم. انتظر إذا كان هذا النمط الرائد هو عملك ويمكنك التريث لبضعة أسابيع. خلاف ذلك، انتقل إلى نموذج يمكنك نشره الآن وراجعه عندما يحصل Sol على أرقام مستقلة ونقطة نهاية عامة.
ابنِ أداة التقييم الخاصة بك مقابل النماذج التي يمكنك استخدامها اليوم في Apidog، لتكون جاهزًا لاختبار Sol في اليوم الذي تحصل فيه على الوصول.
