أطلقت أنثروبيك كلود فيبل 5.1 في 1 سبتمبر 2026، مع جدول مقارنة معيارية يقارنه بفيبل 5، وأوبوس 5، وجي بي تي-5.6 سول عبر تسعة اختبارات. كان العنوان الرئيسي الذي نشرته جميع المنافذ هو Terminal-Bench-Science، حيث سجل فيبل 5.1 نسبة 52.6% مقابل 24.7% لفيبل 5. الرقم الذي نشرته منافذ أقل كان CursorBench، حيث الفارق بينه وبين أوبوس 5 هو 3.4 نقطة في نموذج يكلف ضعف الثمن.
يقدم هذا الدليل كل رقم منشور في مكان واحد مع الإسناد، ويشرح ما يقيسه كل معيار، ويفصل الفروقات الكبيرة عن الصغيرة، ثم يغطي الجزء الذي أغفلته تغطية الإطلاق: جميع هذه النتائج مُشغّلة من قِبل البائع، ويتفوق ميثوس 5.1 على فيبل 5.1 في اختبار البرمجة الآلية الوحيد الذي نُشر فيه كلاهما، والاستجابة الصحيحة لجدول الإطلاق هي تشغيل تقييماتك الخاصة. المصدر الأساسي هو منشور إطلاق أنثروبيك؛ سياق النموذج موجود في ما هو كلود فيبل 5.1.
الجدول الكامل
| المعيار | ما يقيسه | فيبل 5.1 | فيبل 5 | أوبوس 5 | جي بي تي-5.6 سول |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | بحث علمي آلي في طرفية | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | برمجة آلية في طرفية | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | عمل معرفي ذو قيمة اقتصادية (إيلو) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (جزئي) | استخدام الحاسوب في مهام سطح المكتب الحقيقية | 77.9% | 72.9% | 75.4% | لم يتم الإبلاغ عنه |
| OSWorld 2.0 (صارم) | نفسه، إكمال المهمة بالكامل فقط | 41.7% | 36.1% | 39.6% | لم يتم الإبلاغ عنه |
| اختبار البشرية الأخير (بدون أدوات) | أسئلة استدلالية على مستوى الخبراء | 60.9% | 57.8% | 56.6% | لم يتم الإبلاغ عنه |
| اختبار البشرية الأخير (مع الأدوات) | نفسه، مع البحث والبرمجة | 65.0% | 63.8% | 63.6% | لم يتم الإبلاغ عنه |
| AutomationBench | سير عمل الأعمال الشاملة | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | مهام البرمجة على غرار بيئة التطوير المتكاملة (IDE) | 73.4% | 70.5% | 70.0% | 67.2% |
نشرت أنثروبيك أيضًا رقمًا واحدًا لميثوس 5.1: 60.9% في Terminal-Bench 4.0. ذكرت VentureBeat أيضًا نتيجة 82% في Browserbase لفيبل 5.1 مقابل 74% لأوبوس 5 و 57% لفيبل 5 في أصعب مهام وكلاء المتصفح؛ هذا الرقم مأخوذ من التغطية الصحفية وليس من منشور الإطلاق، لذا يجب أخذه بعين الاعتبار بناءً على ذلك.
الفروقات الكبيرة
Terminal-Bench-Science 0.1: 52.6% مقابل 24.7% (فيبل 5) و 29.0% (أوبوس 5). هذه هي النتيجة. يضاعف فيبل 5.1 أداء سلفه بأكثر من الضعف ويقترب من مضاعفة أداء أوبوس 5 في معيار يضع النموذج في طرفية مزودة بأدوات علمية ويطلب منه إجراء بحث متعدد الخطوات. إنه أوضح دليل على أن تركيز أنثروبيك المعلن على "حل المشكلات طويلة الأجل" قد أثمر شيئًا قابلاً للقياس. وهو أيضًا معيار من الإصدار 0.1، مما يعني أن مجموعة المهام جديدة ومن المرجح أن تتغير النتائج مع نضوجها.

AutomationBench: 31.4% مقابل 17.1% (فيبل 5) و 26.9% (أوبوس 5). معيار لسير عمل الأعمال الشاملة عبر التطبيقات، حيث تكون الأرقام المطلقة منخفضة للجميع. يقترب فيبل 5.1 من مضاعفة أداء فيبل 5 هنا ويتفوق على أوبوس 5 بـ 4.5 نقطة. إذا كان منتجك يقوم بأتمتة مهام الأعمال متعددة التطبيقات، فهذا هو الصف الذي يجب الاهتمام به.
Terminal-Bench 4.0: 55.8% مقابل 42.0% (فيبل 5). قفزة بلغت 13.8 نقطة على فيبل 5 في البرمجة الآلية، وهو الرقم الذي تصدر به منشور إطلاق أنثروبيك قسم البرمجة. أما مقابل أوبوس 5، فالتقدم هو 3.5 نقطة. كان أوبوس 5 قد تجاوز فيبل 5 بالفعل في هذا المعيار في يوليو، لذا عادت ميزة فئة فيبل على فئة أوبوس في البرمجة الآلية، لكنها أضيق مما كانت عليه في يونيو. توضح تفاصيل معايير أوبوس 5 أرقام يوليو.

GDPval-AA v2: 1853 مقابل 1723 (فيبل 5). مكاسب بلغت 130 إيلو على فيبل 5 في مهام العمل المعرفي، وهو المعيار الذي تشير إليه أنثروبيك في ادعاءاتها الخاصة بالمستندات وجداول البيانات والعروض التقديمية. مقابل أوبوس 5، الفارق هو 29 إيلو، وهو صغير.
الفروقات الصغيرة
CursorBench 3.2.0: 73.4% مقابل 70.5% (فيبل 5) و 70.0% (أوبوس 5). مهام البرمجة على غرار بيئة التطوير المتكاملة (IDE). ثلاث نقاط فوق أي من النموذجين. هذا هو المعيار الأكثر أهمية لأكبر عدد من المطورين، وهو المكان الذي تكون فيه ريادة فيبل 5.1 أضعف. إذا كان عبء عملك هو "ساعدني في محرري"، فإن جدول الإطلاق لا يبرر سعرًا مضاعفًا بحد ذاته.

OSWorld 2.0: 77.9% / 41.7% مقابل 75.4% / 39.6% (أوبوس 5). استخدام الحاسوب. نقطتان فوق أوبوس 5 في كلا التقييمين، وخمس نقاط فوق فيبل 5. حقيقي، وليس دراماتيكيًا. لاحظ النتيجة الصارمة: أقل من نصف المهام تكتمل بالكامل في أي نموذج. لا يزال استخدام الحاسوب هو أضعف منطقة في الحدود الجديدة.
اختبار البشرية الأخير: 60.9% / 65.0% مقابل 56.6% / 63.6% (أوبوس 5). بدون أدوات، تقدم 4.3 نقطة على أوبوس 5، وهو الأكبر بين الفروقات الصغيرة. مع الأدوات يتقلص إلى 1.4 نقطة، لأن البحث وتنفيذ الكود يحددان المستوى. الرقم بدون أدوات هو المقياس الأفضل للاستدلال الخام؛ الرقم مع الأدوات أقرب إلى كيفية استخدام النموذج.

فيبل 5.1 مقابل جي بي تي-5.6 سول
نشرت أنثروبيك أربعة صفوف مع عمود جي بي تي-5.6 سول، ويتفوق فيبل 5.1 في الأربعة جميعها: Terminal-Bench-Science بـ 30.2 نقطة، Terminal-Bench 4.0 بـ 18.5، AutomationBench بـ 11.8، و CursorBench بـ 6.2. يظهر GDPval-AA 1853 مقابل 1711. ملاحظتان تحذيريتان. هذه هي نتائج أنثروبيك على نموذج منافس، والصفوف الخمسة التي لا تحتوي على عمود جي بي تي-5.6 سول مفقودة لسبب لم تذكره أنثروبيك. تغطت مقارنتنا بين جي بي تي-5.6 سول وفيبل 5 المواجهة السابقة؛ بناءً على هذه الأرقام، يوسع فيبل 5.1 كل فجوة كانت لفيبل 5.
ما أغفلته تغطية الإطلاق
كل رقم هو نتيجة يديرها البائع. أنثروبيك هي من قامت بإجراء كل هذه الاختبارات، بما في ذلك عمود المنافسين، ولم يقم أي مختبر مستقل بإعادة إنتاج أي منها عند الإطلاق. بشكل عام، صمد تاريخ أنثروبيك في المعايير، ولكن الفروقات في CursorBench و OSWorld صغيرة بما يكفي لدرجة أن اختيار أداة أو طريقة تقييم مختلفة يمكن أن يقلبها.
ميثوس 5.1 هو السقف الحقيقي. تذكر بطاقة نظام أنثروبيك ومنشور الإطلاق أن فيبل 5.1 وميثوس 5.1 هما "نفس النموذج ولكن بمستويات مختلفة من إجراءات الحماية"، وقد نشرت ميثوس 5.1 بنسبة 60.9% في Terminal-Bench 4.0 مقابل 55.8% لفيبل 5.1. هذه الفجوة البالغة خمس نقاط هي تكلفة إجراءات الحماية في البرمجة الآلية، وهذا يعني أن "النموذج الأكثر قدرة الذي أطلقته أنثروبيك على نطاق واسع" لديه أخ أفضل معروف فوقه. تغطي مقارنة ميثوس 5.1 مقابل فيبل 5.1 من يمكنه الوصول إليه.
لم يتم ذكر الجهد. تذكر وثائق الجهد من أنثروبيك أن مكاسب فيبل 5.1 تكون الأكبر عند مستويي `xhigh` و `max`. لم يذكر منشور الإطلاق أي مستوى جهد أنتج كل نتيجة، أو ما هو الجهد الذي تم تشغيل النماذج المقارنة به. بما أن الجهد هو الرافعة الأساسية للجودة في هذه النماذج، فإن هذا الإغفال مهم عندما تحاول إعادة إنتاج رقم.
الأداء متعدد اللغات ثابت. تذكر أنثروبيك أن الأداء متعدد اللغات على قدم المساواة مع فيبل 5، وليس محسّنًا. إذا كان عبء عملك غير إنجليزي، فإن جدول الإطلاق يبالغ في تقدير المكاسب.
أرقام إجراءات الحماية هي نوع مختلف من المعايير. تشير أنثروبيك إلى انخفاض بنسبة 85% في الإيجابيات الكاذبة البيولوجية في الطلبات الحميدة وحوالي 60% أقل من تدخلات الأمن السيبراني لكل جلسة كود كلود مقارنة بفيبل 5. هذه الأرقام مقاسة على حركة مرور أنثروبيك الخاصة ولا يمكن إعادة إنتاجها خارجيًا، ولكن بالنسبة لمستخدمي فيبل 5 الذين واجهوا حالات رفض، قد تكون هذه الأرقام أكثر أهمية من أي صف قدرة.
ما يجب اختباره بنفسك
يخبرك جدول الإطلاق أين تبحث. تقييماتك الخاصة تخبرك ما إذا كنت ستنتقل أم لا. أربعة اختبارات تتوافق مع الصفوف أعلاه:
- مهمة عامل طويل الأجل من منتجك الخاص، تُشغل حتى الاكتمال على فيبل 5.1 بمستوى `high`، وأوبوس 5 بمستوى `xhigh`، وفيبل 5 بمستوى `high`. هذا هو نظير Terminal-Bench-Science و AutomationBench، وهو المكان الذي يدفع فيه السعر المزدوج ثماره أو لا يدفع.
- أصعب عشرة مطالبات برمجة لديك بنفس الجهد على فيبل 5.1 وأوبوس 5. إذا كانت النتائج متساوية، فقد أعدت إنتاج قصة CursorBench ويكون أوبوس 5 هو الحل.
- مسح للجهد على فيبل 5.1 وحده، من `low` إلى `max`، في مهمة روتينية. تدعي أنثروبيك أن مستوى `medium` يطابق فيبل 5 وأن `low` ينافس أوبوس 5 من حيث التكلفة لكل مهمة. تحقق من ذلك.
- عدد حالات الرفض في مطالبات الأمان الحميدة أو علوم الحياة الخاصة بك، فيبل 5 مقابل فيبل 5.1. هذا هو الادعاء بنسبتي 60% و 85%، وهو الادعاء الذي يمكنك التحقق منه في فترة ما بعد الظهر.
قم بإنشاء جميع الاختبارات الأربعة كطلبات في Apidog مع `model` و `effort` كمتغيرات بيئة، وأضف تأكيدات على `stop_reason` وعلى وجود سلسلة نصية متوقعة في الإجابة، وقم بتشغيل المجموعة لكل نموذج. يمنحك سجل التشغيل جدول تقييم قابل لإعادة الإنتاج بدون أي بنية تحتية جديدة. حمل Apidog لإعداده؛ شرح واجهة برمجة التطبيقات يحتوي على أشكال الطلبات.

كيف تتوافق المعايير مع القرار
- الوكلاء طويلي الأجل، البحث، الأتمتة: الفروقات كبيرة ومتسقة. فيبل 5.1 هو النموذج، وتُظهر تفاصيل التسعير أن قراءات ذاكرة التخزين المؤقت الأرخص تقلص فجوة التكلفة في أعباء العمل هذه تحديدًا.
- برمجة IDE، أسئلة وأجوبة المعرفة، الاستدلال بمساعدة الأدوات: الفروقات إلى أوبوس 5 تتراوح بين نقطة وأربع نقاط. تنطبق قاعدة أنثروبيك الخاصة: ابقَ على أوبوس 5 ما لم يفشل في تقييماتك بجهد أعلى. توضح مقارنة فيبل 5.1 مقابل أوبوس 5 ذلك.
- قادمون من فيبل 5: كل صف شهد تحسنًا، ولم يتغير السعر، وانخفض معدل الإيجابيات الكاذبة. تغطي مقارنة فيبل 5.1 مقابل فيبل 5 تكلفة الهجرة.
الأسئلة الشائعة
ما هي أفضل نتيجة معيارية لكلود فيبل 5.1؟ Terminal-Bench-Science 0.1 بنسبة 52.6%، أي أكثر من ضعف 24.7% لفيبل 5 ومتفوقًا على 29.0% لأوبوس 5 و 22.4% لجي بي تي-5.6 سول. جميع الأرقام من أنثروبيك.
كيف يقارن فيبل 5.1 بأوبوس 5 في البرمجة؟ 55.8% مقابل 52.3% في Terminal-Bench 4.0 و 73.4% مقابل 70.0% في CursorBench 3.2.0، وفقًا لأرقام أنثروبيك. فروقات حقيقية لكنها ضيقة حوالي ثلاث نقاط.
هل فيبل 5.1 أفضل من جي بي تي-5.6 سول؟ في المعايير الأربعة التي نشرت فيها أنثروبيك كلاهما، نعم، بفارق يتراوح من 6 إلى 30 نقطة. أجرت أنثروبيك أرقام جي بي تي-5.6 سول بنفسها، وخمسة من صفوفها التسعة لا تحتوي على إدخال لجي بي تي-5.6 سول.
هل تم التحقق من معايير فيبل 5.1 بشكل مستقل؟ لم يتم ذلك عند الإطلاق. كل رقم هو نتيجة يديرها أنثروبيك. عاملها كادعاءات لاختبارها على عبء عملك الخاص.
كيف يحرز ميثوس 5.1؟ نشرت أنثروبيك رقمًا واحدًا: 60.9% في Terminal-Bench 4.0، أي خمس نقاط فوق 55.8% لفيبل 5.1. النموذجان هما نفس النموذج ولكن مع مستويات مختلفة من إجراءات الحماية.
ما مستوى الجهد الذي أنتج هذه النتائج؟ لم تذكر أنثروبيك ذلك. إرشاداتها هي أن مكاسب فيبل 5.1 تكون الأكبر عند مستويي `xhigh` و `max`، لذا افترض جهدًا عاليًا وتوقع أن تحقق الإعدادات المنخفضة نتائج أقل.
