عندما أطلقت xAI نموذج Grok 4.5 في 8 يوليو 2026، اختار إيلون ماسك المقارنة بنفسه: "نموذج من فئة Opus، ولكنه أسرع وأكثر كفاءة في استخدام التوكنات وأقل تكلفة." هذا ادعاء محدد وقابل للتحقق حول Claude Opus 4.8، نموذج Anthropic القوي للبرمجة.
لذا دعنا نتحقق من ذلك. تستخدم هذه المقارنة الأرقام التي نشرتها xAI في إعلانها، والتسعير المعلن من Anthropic، والأجزاء من القصة التي لم يضعها أي من البائعين في عنوان رئيسي. باختصار: الادعاء صحيح في الغالب، مع خسارتين في المعايير ونجمة كبيرة واحدة حول التحقق.
بطاقة الأداء
نشرت xAI أربعة معايير للبرمجة. إليك هي، مع كلا النموذجين بالإضافة إلى السياق المحيط بهما:
| المعيار | Grok 4.5 | Opus 4.8 (حد أقصى) | الفائز |
|---|---|---|---|
| DeepSWE 1.0 (pass@1) | 62.0% | 55.75% | Grok 4.5 (+6.25) |
| DeepSWE 1.1 | 53% | 59% | Opus 4.8 (+6) |
| Terminal Bench 2.1 | 83.3% | 78.9% | Grok 4.5 (+4.4) |
| SWE Bench Pro (resolve) | 64.7% | 69.2% | Opus 4.8 (+4.5) |
فوزان لكل منهما. وفقًا لرسوم بيانية xAI الخاصة، فإن وصف "فئة Opus" دقيق كفئة قدرة وخاطئ كادعاء بالتفوق، وهو ما لم يدعيه ماسك، وهذا يحسب لـ xAI.

تجدر الإشارة إلى أن: Claude Fable 5 (الحد الأقصى) يتصدر جميع هذه الرسوم البيانية الأربعة (66.1 / 70 / 84.3 / 80.4)، ويتفوق GPT 5.5 (عالي الأداء) على كلا النموذجين في ثلاثة من الأربعة. يتنافس Grok 4.5 في الفئة الأدنى من الريادة، ضد النموذج الذي تسعره Anthropic للعمل اليومي بدلاً من القدرة القصوى. إذا كنت تريد المعركة الحدودية، فهي Fable 5 مقابل Opus 4.8.
علامة النجمة للمصدر
هذه ليست نتائج اختبارات مستقلة. تشير xAI إلى أن أرقام المنافسين تأتي من "بطاقات النظام المنشورة للمطورين المعنيين أو لوحات صدارة المعايير"، مع تقييمات DeepSWE التي أنشأتها Datacurve والتشغيل الذي تم التعامل معه باستخدام أدوات كل مزود. هذا أفضل من الإبلاغ الذاتي الغامض، ولكن خلط المصادر يعني أن اختلافات الأدوات والهياكل تتسرب إلى المقارنة. لم يقم أي طرف ثالث مستقل تمامًا بتقييم Grok 4.5 بعد. يتتبع تعمقنا في المعايير هذا الوضع.
السعر: Grok يفوز على الورق، وأكبر في الممارسة العملية
أسعار الملصقات لكل مليون توكن:
| Grok 4.5 | Opus 4.8 | |
|---|---|---|
| الإدخال | $2.00 | $5.00 |
| الإخراج | $6.00 | $25.00 |
هذا يمثل 40% من سعر إدخال Opus و24% من سعر إخراجه. (تفاصيل Anthropic الكاملة في تحليل تسعير Opus 4.8 الخاص بنا.)
تتسع الفجوة عندما تأخذ في الاعتبار الإسهاب. تشير xAI إلى أن Grok 4.5 يحل مهام SWE Bench Pro بمتوسط 15,954 توكن إخراج؛ بينما يبلغ متوسط Opus 4.8 (الحد الأقصى) 67,020 على نفس المعيار. قم بضربها لكل مهمة تم حلها:
- Grok 4.5: 15,954 توكن × 6 دولارات/مليون ≈ 0.10 دولار من الإخراج لكل مهمة
- Opus 4.8 (الحد الأقصى): 67,020 توكن × 25 دولارًا/مليون ≈ 1.68 دولار من الإخراج لكل مهمة
أرخص بنحو 17 مرة في الإخراج لكل مهمة مكتملة، وفقًا لعدد التوكنات التي أبلغ عنها البائع. تعامل مع المضاعف الدقيق بحذر (معيار واحد، قياس بائع واحد، ووضع الجهد "الأقصى" يضخم عدد توكنات Opus)، لكن الاتجاه لا يمكن المجادلة فيه: نموذج موجز بسعر 6 دولارات يتفوق على نموذج مطول بسعر 25 دولارًا بأكثر مما تشير إليه قائمة الأسعار. نقوم بتشغيل سيناريوهات أكمل في شرح تسعير Grok 4.5.
ينطبق التحذير أيضًا في الاتجاه الآخر: يخسر Opus المزيد من التوكنات لكل مهمة جزئيًا لأن وضع "الحد الأقصى" يستدل بتوسع، وهذا الاستدلال جزء من سبب فوزه في SWE Bench Pro بفارق 4.5 نقاط. أنت تدفع مقابل التفكير. أحيانًا يكون التفكير هو المنتج.
السرعة: 80 توكن في الثانية والإجابات الأقصر تتضاعف
يعمل Grok 4.5 بسرعة حوالي 80 توكن في الثانية، وهو ما تسميه xAI "سرعات النماذج السريعة". بالاقتران مع مخرجات أقصر بربع الطول، ينخفض الوقت الفعلي لكل مهمة مرتين: توكنات أقل، يتم تسليمها بشكل أسرع. بالنسبة لحلقات العميل التي تربط عشرات من استدعاءات النماذج، تتراكم فترة الكمون لكل خطوة لتصل إلى دقائق يتم توفيرها لكل جلسة.
لا تنشر Anthropic رقمًا مكافئًا لـ TPS لـ Opus 4.8، وتختلف السرعات في العالم الحقيقي حسب الحمل والفئة، لذا قم بقياس ذلك على حركة المرور الخاصة بك بدلاً من الثقة في أي من صفحات التسويق.
أين يحافظ Opus 4.8 على تفوقه
السعر ليس كل شيء، وبطاقة الأداء تحدد المجالات التي لا ينطبق فيها ذلك:
- أصعب البرمجة القائمة على الوكيل. SWE Bench Pro، الأقرب من الأربعة إلى العمل الفعلي المعقد للمستودعات، يذهب إلى Opus بفارق 4.5 نقاط. DeepSWE 1.1، التعديل الأحدث، يذهب إلى Opus بفارق 6 نقاط.
- نضج النظام البيئي. يندمج Opus 4.8 في Claude Code، وأنماط استخدام الأدوات الراسخة، وسنة من التصلب في الإنتاج. تم إطلاق Grok 4.5 بالأمس؛ سطح تكامله هو Grok Build، Cursor، وواجهة برمجة تطبيقات جديدة. تكلفة الهجرة حقيقية حتى عندما تكون تكلفة التوكن الواحد أقل.
- القدرة على التنبؤ. سلوك Opus في سياقات طويلة، وأنماط رفضه، وأنماط فشله موثقة جيدًا، بما في ذلك من قبلنا. أما Grok 4.5، فهو عمره أسبوع واحد.
أيًا منهما يجب أن تستخدم؟
اختر Grok 4.5 إذا كان عبء عملك يتضمن برمجة وكيلية عالية الحجم أو عملًا معرفيًا، وفاتورة واجهة برمجة التطبيقات الخاصة بك هي بند تراقبه، وتقسيم 2 من 4 في المعايير بربع سعر الإخراج يبدو وكأنه مراجحة. تسعير الإطلاق بالإضافة إلى النوافذ المجانية الحالية تجعل تجربته شبه مجانية هذا الشهر.
ابق على Opus 4.8 إذا كنت متعمقًا في نظام Anthropic البيئي، أو كنت بحاجة إلى أقوى النتائج المنشورة على المعايير الصعبة على مستوى المستودع في هذه الفئة السعرية، أو لا يمكنك قبول مخاطر النموذج في أسبوعه الأول في الإنتاج.
في كلتا الحالتين، قم بقياس ذلك بنفسك. تدعم كلتا واجهتي برمجة التطبيقات الأشكال المتوافقة مع OpenAI، لذا فإن بناء أداة اختبار A/B رخيص. في Apidog، احفظ طلبًا واحدًا لكل نموذج، ووجههما إلى أصعب خمسة مطالبات حقيقية لديك، وقارن جودة الإخراج، ووقت الاستجابة، وكائن الاستخدام جنبًا إلى جنب. تأكد بشكل خاص من output_tokens: إذا لم تكن إجابات Grok على مطالباتك أقصر، فإن الجدوى الاقتصادية المذكورة أعلاه لا تنطبق عليك. قم بتنزيل Apidog مجانًا وقم بتشغيل المقارنة على حركة المرور الخاصة بك قبل نقل عبء العمل.
أدلة الإعداد لكلا الجانبين: كيفية استخدام واجهة برمجة تطبيقات Grok 4.5 و كيفية استخدام واجهة برمجة تطبيقات Claude Opus 4.8.
الأسئلة الشائعة
هل Grok 4.5 أفضل من Claude Opus 4.8؟ لقد تقاسموا المعايير المنشورة من xAI بنتيجة 2-2. Grok 4.5 أرخص وأكثر كفاءة في استخدام التوكنات؛ بينما يفوز Opus 4.8 في التقييمين الأصعب على مستوى المستودعات. "الأفضل" يعتمد على ما إذا كان قيدك هو الميزانية أو القدرة القصوى.
ما مدى رخص Grok 4.5 مقارنة بـ Opus 4.8؟ 2 دولار مقابل 5 دولارات لكل مليون توكن إدخال و 6 دولارات مقابل 25 دولارًا لكل مليون إخراج. لكل مهمة برمجة تم حلها، تشير أعداد التوكنات المبلغ عنها من قبل البائع إلى فجوة فعالة أكبر بكثير.
هل توجد معايير مستقلة لـ Grok 4.5؟ ليس بعد. تمزج الأرقام المنشورة بين تشغيل xAI وتقييمات Datacurve وبطاقات أنظمة البائعين الآخرين. من المتوقع أن تظهر الأرقام المستقلة في غضون أسابيع من الإطلاق.
هل يمكنني اختبار كلا النموذجين بنفس الكود؟ في الغالب، نعم. كلاهما يقدم إكمال محادثة متوافقًا مع OpenAI، لذا فإن تبديل base_url والمفتاح ومعرف النموذج يغطي الأساسيات. تختلف تفاصيل استدعاء الأدوات والإخراج المنظم؛ اختبر تلك المسارات بشكل صريح قبل التبديل.
