لديك معرف نموذج في ملف تهيئة وقرار يجب اتخاذه هذا الأسبوع. ففي 22 سبتمبر 2026، أطلقت OpenAI نموذج GPT-6 Sol وشحنت Anthropic نموذج Claude Opus 5.5، بفارق ساعات قليلة. وكل جدول مقارنة وجدته منذ ذلك الحين يحتوي على ثغرة، وهذه الثغرة أكبر مما تبدو.
وهذه هي الثغرة. يقوم إعلان إطلاق OpenAI بمقارنة Sol بنموذج Claude Opus 5، لأن Claude Opus 5.5 لم يكن موجودًا عندما كُتب ذلك الإعلان. ثم أصدرت Anthropic نموذج Opus 5.5 في نفس اليوم بسعر أقل بنسبة 20% من Opus 5. لذا، فإن الادعاء الرئيسي الذي يتداوله المطورون فيما بينهم، بأن Sol يضاهي أو يتفوق على جودة فئة Opus بجزء بسيط من التكلفة لكل مهمة، تم قياسه مقابل نموذج تم استبداله في غضون ساعات من نشر القياس.
هذا لا يجعل أرقام OpenAI خاطئة. بل يجعلها قديمة بطريقة محددة، ومعرفة مدى قدمها هو الفرق بين قرار توجيه جيد وقرار مكلف. أدناه: ما نشره كل بائع، أين تتطابق مجموعتا المعايير بصدق، ما هي الفجوة السعرية بمجرد تضمين التخزين المؤقت، وكيفية اختبار كليهما مقابل نقاط النهاية الخاصة بك.
للحصول على صورة أوسع لثلاثة عمليات إطلاق رائدة في غضون يومين، انظر حرب أسعار نماذج الذكاء الاصطناعي في سبتمبر 2026.
ورقة المواصفات، جنبًا إلى جنب
| GPT-6 Sol | Claude Opus 5.5 | |
|---|---|---|
| معرف نموذج واجهة برمجة التطبيقات (API) | gpt-6-sol |
claude-opus-5-5 |
| المدخلات لكل مليون رمز | 2 دولار | 4 دولارات |
| المخرجات لكل مليون رمز | 10 دولارات | 20 دولارًا |
| قراءات المدخلات المخزنة مؤقتًا | خصم 90% | 0.20 دولار لكل مليون |
| كتابة التخزين المؤقت | لم يتم نشره فيما لدينا | 5 دولارات لكل مليون |
| نافذة السياق | 872,000 رمز | 1,000,000 رمز |
| الحد الأقصى للمخرجات | لم يتم نشره فيما لدينا | 128,000 رمز |
| مؤشر التحليل الاصطناعي للذكاء | 48 | 58، في المرتبة الأولى من أصل 212 |
| حيث يمكنك استدعاؤه | API، ChatGPT Work، Codex | منصة Claude، AWS، Google Cloud، Azure |
صفّان يحملان معظم القرار.
بالنسبة للرموز الخام، يبلغ سعر Sol بالضبط نصف سعر Opus 5.5 على كل من المدخلات والمخرجات. ليس تقريباً النصف. بل النصف تماماً. وهذا نظيف بشكل غير عادي لمقارنة بين بائعين متعددين ويجعل الحساب الذهني سهلاً.
بناءً على مؤشر الذكاء الاصطناعي للتحليل الاصطناعي، وهو نتيجة طرف ثالث وليس ادعاء من البائع، يحصل Opus 5.5 على 58 نقطة ويحتل المرتبة الأولى من بين 212 نموذجًا، بينما يحصل Sol على 48 نقطة. لذا فإن شكل هذه المواجهة مألوف: تدفع ضعف السعر للحصول على قمة لوحة الصدارة، والسؤال هو ما إذا كان حجم عملك يلاحظ ذلك.
نافذة سياق Sol تبلغ 872,000 رمز مقابل مليون رمز كامل لـ Opus 5.5. بالنسبة لمعظم الأعمال، هذا لا يمثل مشكلة أبداً. إذا قمت بإدخال مستودع برمجيات (monorepo) بالكامل أو مستند OpenAPI يحتوي على 400 نقطة نهاية بالإضافة إلى السجل في استدعاء واحد، قم بقياسه أولاً، لأن وضع الفشل هو الرفض التام بدلاً من تدهور المخرجات.
التوافر يهم أيضاً. وصل Sol إلى واجهة برمجة التطبيقات (API) بالإضافة إلى ChatGPT Work و Codex لحسابات Plus و Pro و Business و Enterprise و Edu، وهو ليس متاحاً في الدردشة بعد. تم شحن Opus 5.5 عبر منصة Claude و AWS و Google Cloud و Azure في اليوم الأول، وهو الفرق بين محادثة المشتريات وتغيير التكوين إذا كنت تقوم بالفعل بالتوجيه عبر Bedrock أو Vertex.
المقارنة التي لم تتمكن OpenAI من إجرائها
تعتبر أرقام التكلفة لكل مهمة الخاصة بـ OpenAI هي الجزء الأكثر فائدة في منشور إطلاقها، وجميعها تشير إلى Opus 5:
| المعيار | GPT-6 Sol | Claude Opus 5 | علاقة التكلفة |
|---|---|---|---|
| AutomationBench 1.0.6 | 33.2% بمستوى xhigh، 0.27 دولار لكل مهمة | 26.9% بحد أقصى | تكلفة Opus 5 أعلى 11.1 مرة من Sol لكل مهمة |
| Agents’ Last Exam V1 | 56.4% بحد أقصى | أقل من نتيجة Sol | تكلفة Sol أقل بنسبة 60% لكل مهمة |
| DeepSWE 1.1 | 68.8% بحد أقصى | غير متوفر | في نطاق 1.1 نقطة مئوية من Fable 5 xhigh بنسبة 69.9%، حوالي 80% أرخص لكل مهمة |
| OSWorld 2.0 بلا اتصال | 60.5% بمستوى xhigh | 60.3% بمستوى متوسط | حوالي 80% أرخص لكل مهمة |
اقرأ صف AutomationBench مرة أخرى. لقد تفوق Sol بمستوى استدلال مرتفع جداً (extra-high) على Opus 5 بمستوى استدلال أقصى (max) بحوالي 9% من تكلفة Opus 5 لكل مهمة. هذا هو الرقم الذي يقوم بكل العمل في النقاش.
الآن ضع Opus 5.5 بجانبه. نشرت Anthropic رقمها الخاص بـ AutomationBench لـ Opus 5.5: 40.0%. قامت OpenAI بقياس Opus 5 بنسبة 26.9% على AutomationBench 1.0.6. إذا كانت هذه هي نفس المعيار بنفس الإصدار، وهذا افتراض حقيقي، فإن الرقم الخاص بـ Opus الذي تفوق عليه Sol بـ 6.3 نقاط قد تم استبداله برقم يتفوق على Sol بـ 6.8 نقاط. لم تكتفِ المقارنة بالتقادم. بل انقلبت رأساً على عقب.
تحذيران يجب أن تضعهما في اعتبارك في أي نقاش حول هذا الأمر:
- تحدد OpenAI الإصدار، 1.0.6. الرقم الذي لدينا من Anthropic لا يحمل سلسلة إصدار. تتغير المعايير ذات الاسم نفسه بين الإصدارات، وتختلف الأنظمة بين المختبرات. تعامل مع القفزة من 26.9 إلى 40.0 على أنها اتجاهية حتى يقوم شخص ما بتشغيل كلا النموذجين على نظام واحد.
- لا تزال OpenAI تذكر بوضوح أن GPT-6 Astra "يظل أفضل نماذجنا على الإطلاق". Sol هو المستوى الاقتصادي من عائلة GPT-6، وليس ذروتها، لذا فإن استخلاص النتائج حول حدود OpenAI من مقارنة Sol هو خطأ فئوي. القراءة من الأوائل إلى الأوائل هي Astra مقابل Opus 5.5، ولم ينشر أي من البائعين ذلك.
يوجد تداخل آخر. تشير Anthropic إلى أن Opus 5.5 يحقق 81.8% في OSWorld 2.0، بينما تشير OpenAI إلى أن Sol يحقق 60.5% في OSWorld 2.0 غير المتصل بالإنترنت. قد تكون هذه متغيرات مختلفة من نفس المجموعة، وفجوة الـ 21 نقطة هي بالضبط نوع الرقم الذي يتضح أنه نتاج مقارنة غير متكافئة. لا تقتبسها على أنها مقارنة مباشرة.
ما هي فجوة السعر الحقيقية
فجوة سعر الرمز النظيف هي 2x. أما الفجوة التي تدفعها فعلاً فليست كذلك، والسبب هو التخزين المؤقت للموجهات.
يقرأ Opus 5.5 المدخلات المخزنة مؤقتًا بسعر 0.20 دولار لكل مليون رمز، وهو ما يمثل 5% من سعر المدخلات البالغ 4 دولارات. شحنت GPT-6 إصدارًا جديدًا للتخزين المؤقت جنبًا إلى جنب مع Sol يخصم قراءات المدخلات المخزنة مؤقتًا بنسبة 90%، مما يجعل قراءات Sol المخزنة مؤقتًا بسعر 0.20 دولار لكل مليون أيضًا. بالنسبة للبادئة المتكررة، الجزء من موجه الوكيل الذي لا يتغير أبدًا، يكلف النموذجان نفس السعر.
لنأخذ مثالاً على عبء عمل وكيل ملموس: 50,000 رمز إدخال لكل تشغيل، 3,000 رمز إخراج، 1,000 تشغيل يوميًا، مع 45,000 رمز إدخال يشكل بادئة ثابتة (موجه النظام، مخططات الأدوات، مستند OpenAPI، ملف الاتفاقيات).
| التكلفة اليومية | GPT-6 Sol | Claude Opus 5.5 | النسبة |
|---|---|---|---|
| لا توجد عمليات تخزين مؤقت ناجحة | 130 دولارًا | 260 دولارًا | 2.00x |
| بادئة مخبأة | 49 دولارًا | 89 دولارًا | 1.82x |
هذا حساب حسابي على الأسعار المنشورة، وليس قياسًا، وهو يستبعد كتابة التخزين المؤقت، حيث يفرض Opus 5.5 رسومًا قدرها 5 دولارات لكل مليون ولم يتم نشر سعر كتابة Sol فيما لدينا. الاتجاه موثوق به: كلما اعتمدت أكثر على التخزين المؤقت، زادت ميزة النموذج الرخيص، لأن الخصم ينزل إلى نفس الحد الأدنى لكليهما. الذين يعتمدون على التخزين المؤقت بشكل كبير يشترون فجوة تبلغ 1.8x، وليس 2x.
التكلفة لكل رمز هي الوحدة الخاطئة على أي حال. تشرح أرقام OpenAI الداخلية لماذا: ينفق متوسط الباحث لديها أكثر من 600 دولار يوميًا على وكلاء البرمجة، وينفق 90% منهم 7000 دولار يوميًا. لا يصل أحد إلى ذلك عن طريق تسعير الرموز بشكل خاطئ. بل يصلون إلى ذلك عن طريق تشغيل حلقات تعيد المحاولة، وتتفرع، وتعيد قراءة السياق. النموذج الذي يكلف ضعف السعر ولكنه ينهي المهمة في تمريرة واحدة بدلاً من ثلاث هو النموذج الأرخص.
هناك جزء آخر من سياق السعر، لأنه يُقتبس بشكل خاطئ باستمرار. تصف OpenAI Sol و Luna بأنهما أرخص بنسبة 50% من أسعار GPT-5.6 الترويجية. "ترويجية" هي كلمة OpenAI الخاصة. مقابل أسعار قائمة GPT-5.6 التي وثقناها في ذلك الوقت في تحليل أسعار GPT-5.6، يعتبر Sol بسعر 2 دولار / 10 دولارات خصمًا أكبر مما يوحي به العنوان الرئيسي، لكن العنوان الرئيسي نفسه يقاس بخصم، وليس بسعر قائمة. اقتبسه مع التقييد المرفق.
زمن الوصول: النموذج الرخيص ليس النموذج السريع
قاس "Artificial Analysis" متغير الاستدلال "الأقصى" لـ GPT-6 Sol عند 115.2 رمز إخراج في الثانية مع زمن وصول للرمز الأول يبلغ 102.15 ثانية. هذا قياس من طرف ثالث لأعلى إعداد للاستدلال، وليس رقمًا من البائع، ولا يمثل Sol في مستوى جهد أقل. تعامل معه كحد أقصى لمدى سوء الوضع، وليس كوقت استجابة نموذجي.
لا يزال يغير طريقة البناء. مائة ثانية قبل الرمز الأول تعني:
- مهلة عميل HTTP الافتراضية خاطئة. معظم المكتبات تضبطها على 30 أو 60 ثانية.
- أي موازن تحميل، أو بوابة API، أو دالة لا خادمية (serverless function) موجودة قبل الاستدعاء لديها مهلتها الخاصة للخمول، ومن المحتمل أن تكون أقصر من مهلة عميلك.
- التدفق يتوقف عن أن يكون رفاهية. بدونه ليس لديك إشارة على أن الطلب حي.
- منطق إعادة المحاولة الذي ينطلق عند انتهاء المهلة سيضاعف فاتورتك وزمن وصولك في نفس الوقت.
ادعاء Anthropic المماثل لـ Opus 5.5 هو نسبي: إخراج أسرع بنسبة 30% من Opus 5. هذا بيان بائع حول نسبة، وليس رقمًا لعدد الرموز في الثانية، لذلك لا يمكن وضعه على نفس المحور مع أرقام التحليل الاصطناعي. سيتعين عليك قياس كليهما مقابل عبء عملك الخاص.
هذا عمل اختبار API عادي. أرسل نفس الموجه إلى كلتا نقطتي النهاية، سجل وقت الوصول إلى البايت الأول والمدة الإجمالية عبر عدد كافٍ من التشغيلات لرؤية الانتشار، وتأكد من مخطط الاستجابة أثناء وجودك هناك. في Apidog، يمكنك الاحتفاظ بكلا المكالمتين في مشروع واحد، تشغيلهما كسيناريو اختبار، والاحتفاظ بسجل زمن الوصول بجانب التأكيدات بدلاً من ملف مسودة.
تختلف أشكال الطلبات بما يكفي لتكون ذات أهمية:
# Anthropic
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5-5",
"max_tokens": 1024,
"stream": true,
"messages": [{"role": "user", "content": "Summarize this OpenAPI path."}]
}'
# OpenAI
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "content-type: application/json" \
-d '{
"model": "gpt-6-sol",
"stream": true,
"input": "Summarize this OpenAPI path."
}'
تختلف رؤوس التوثيق (auth headers)، ومفاتيح الجسم (body keys)، وتنسيقات أحداث البث (streaming event formats) بما يكفي لإحداث فرق. أي طبقة تجريد تكتبها للتبديل بينهما هي رمز تمتلكه الآن، وسوف تتعطل أولاً عندما يطلق أي من البائعين حقلاً جديداً.
كيف تختار
| إذا كان حجم عملك | ارجح | لأن |
|---|---|---|
| حجم كبير، بادئة ثابتة، يتحمل إعادة المحاولة | GPT-6 Sol | نصف سعر الرمز، والتخزين المؤقت يبقي التكلفة منخفضة |
| تشغيل مستقل طويل حيث يكون الفشل مكلفًا | Claude Opus 5.5 | يتصدر مؤشر ذكاء الطرف الثالث ورقم AutomationBench الخاص بـ Anthropic |
| محدود بحجم سياق يزيد عن 872 ألف رمز | Claude Opus 5.5 | نافذة المليون رمز الكاملة |
| موجه بالفعل عبر Bedrock أو Vertex أو Azure | Claude Opus 5.5 | تم شحنه على الثلاثة في اليوم الأول |
| يعمل داخل Codex أو ChatGPT Work | GPT-6 Sol | هناك حيث تم إطلاقه أولاً |
| لم يتقرر بعد | كلاهما، خلف موجه | فجوة 1.8x في السعر المخزن مؤقتًا صغيرة بما يكفي للتوجيه حسب المهمة بدلاً من الولاء |
بالنسبة لمعظم الفرق، الصف الأخير هو الإجابة الصادقة. عند فجوة سعر مخبأة تبلغ 1.8x، يؤتي التوجيه ثماره بشكل أسرع مما تفعله تسويق أي من البائعين. أرسل العمل عالي الحجم والمحدد جيداً إلى Sol والعمل الطويل والغامض والمكلف في حال الخطأ إلى Opus 5.5. قم بقياس التكلفة لكل مهمة مكتملة، وراجعها في غضون شهر، ولا تنسخ جدول مقارنة من أي من إعلاني الإطلاق وتعامله على أنه حديث. أحدهما يقارن بنموذج تم استبداله في نفس الظهيرة.
