مقاييس أداء كلود أوبوس 5: ماذا تكشف الأرقام؟

كل مزاعم الأداء المعياري لـ Claude Opus 5 في جدول واحد مُسنَد: فرونتير-بنش، آرك-إي جي آي 3، أو إس وورلد 2.0، كيرسوربنش 3.2، أوتوميشن-بنش. جميعها تم تشغيلها من قبل البائع، ولم يتم استنساخ أي منها.

Ashley Innocent

Ashley Innocent

25 يوليو 2026

مقاييس أداء كلود أوبوس 5: ماذا تكشف الأرقام؟

Apidog للمؤسسات

النشر على الخوادم المحلية

SSO و RBAC

متوافق مع SOC 2

استكشف Apidog للمؤسسات

أطلقت Anthropic نموذج Claude Opus 5 في 24 يوليو 2026 مع مجموعة من ادعاءات المقارنة المعيارية التي تبدو وكأنها اكتساح شامل. أكثر من ضعف Opus 4.8 في تقييم واحد. ثلاثة أضعاف أفضل نموذج تالٍ في تقييم آخر. تجاوز Fable 5 بثلث التكلفة في تقييم ثالث.

هذا لا يجعلهم مخطئين. لكنه يعني أنه يجب عليك قراءتها بنفس الطريقة التي تقرأ بها أي مخطط إطلاق لمورد: بعناية، مع الانتباه إلى ما يتم قياسه وما تم حذفه. يضع هذا الدليل كل ادعاء مقارنة معيارية منشور لـ Opus 5 في جدول واحد موثق، ويوضح ما يمكن لكل رقم أن يدعمه وما لا يمكنه، ويسمي السقف الذي تضعه Anthropic فوق نموذجها الخاص، وينتهي بخطة تقييم يمكنك تشغيلها بنفسك في Apidog.

زر

بالنسبة للنموذج نفسه (claude-opus-5، سياق 1 مليون، أقصى إخراج 128 ألف، قطع المعرفة في مايو 2026)، ابدأ بـ ما هو Claude Opus 5. المصدر الأساسي أدناه هو منشور إطلاق Claude Opus 5 من Anthropic.

كل ادعاء منشور، في جدول واحد

فيما يلي المجموعة الكاملة من بيانات المقارنة المعيارية التي قدمتها Anthropic عند الإطلاق. عمود المقارنة مهم بقدر عمود النتائج، لأن العديد من هذه البيانات تُذكر بالنسبة إلى نموذج آخر بدلاً من أن تكون درجة.

المعيار ادعاء Anthropic صيغة التعبير مقارنة بـ
Frontier-Bench v0.1 يتفوق على جميع النماذج الأخرى؛ أكثر من ضعف نتيجة Opus 4.8، بتكلفة أقل لكل مهمة نسبة بالإضافة إلى ادعاء التكلفة Opus 4.8 والمجال
ARC-AGI 3 حوالي 3 أضعاف نتيجة أفضل نموذج تالٍ نسبة أفضل نموذج تالٍ (غير مسمى)
OSWorld 2.0 يتفوق على Fable 5 بثلث التكلفة ترتيب بالإضافة إلى ادعاء التكلفة Fable 5
CursorBench 3.2 في حدود 0.5% من ذروة Fable 5، بنصف السعر فجوة بالإضافة إلى ادعاء التكلفة Fable 5
Zapier AutomationBench معدل النجاح حوالي 1.5 ضعف أفضل نموذج تالٍ نسبة أفضل نموذج تالٍ (غير مسمى)
الكيمياء العضوية +10.2 نقطة فوق Opus 4.8 فرق مطلق Opus 4.8
تحليل البروتين +7.7 نقطة فوق Opus 4.8 فرق مطلق Opus 4.8
استغلال الأمن السيبراني متخلف عن Mythos 5 ترتيب Mythos 5
البحث البيولوجي المستقل متخلف عن Mythos 5 ترتيب Mythos 5

مصدر كل ما سبق: منشور إطلاق Anthropic ووثائق النموذج. لم ينشر أي طرف ثالث إعادة إنتاج لأي من هذه النتائج وقت كتابة هذا التقرير.

شيئان يبرزان قبل أن تقرأ أي رقم فردي. فقط اثنان من الصفوف التسعة تعطي حركة مطلقة بالنقاط. و Anthropic نفسها تقدم الصفين الأخيرين، حيث يخسر نموذجها الرائد الجديد.

مشكلة النسبة ولماذا هي مهمة

أربعة من الادعاءات (Frontier-Bench، ARC-AGI 3، AutomationBench، وبدرجة ما CursorBench) يتم ذكرها كنسب أو فجوات بدلاً من درجات. هذا قيد حقيقي، وليس تفصيلاً دقيقاً، ويستحق أن نكون محددين بشأن السبب.

النسبة تخفي المقام. "حوالي 3 أضعاف أفضل نموذج تالٍ" في ARC-AGI 3 يعني شيئاً مختلفاً اعتماداً على مكان المجال. إذا كان أفضل نموذج تالٍ يسجل 8%، فإن 3 أضعاف هو 24%: حركة حقيقية على معيار لا أحد يقترب من حله. إذا كان أفضل نموذج تالٍ يسجل 25%، فإن 3 أضعاف هو 75%، نتيجة مختلفة تماماً. كلاهما يمكن وصفه بأمانة بأنه "3 أضعاف". لا يمكنك معرفة أي منهما حدث، و Anthropic لم تقل.

المضاعفة أسهل في أسفل المقياس. "أكثر من ضعف نتيجة Opus 4.8" في Frontier-Bench v0.1 هي نفس شكل المشكلة. على معيار صعب وجديد حيث سجل النموذج الرائد السابق أرقاماً فردية أو عشرات منخفضة، فإن المضاعفة هي قفزة مطلقة أصغر مما يوحي به التعبير. على معيار حيث سجل 4.8 بالفعل 40%، فإن المضاعفة ستكون استثنائية. سلسلة الإصدار هنا تلميح: v0.1 هو معيار بدون سجل تتبع منشور، ولا عمليات إعادة إنتاج من المجتمع، ولا نقطة تشبع ثابتة.

"أفضل نموذج تالٍ" غير مسمى. ادعاءان يقارنان Opus 5 بمنافس غير محدد. يمكن أن يكون هذا المنافس Fable 5، Mythos 5، أو نموذجاً من مختبر آخر. تحدد مجموعة المقارنة مدى أهمية النسبة، ولم يتم الكشف عنها.

الفجوات تحتاج إلى وحدات. "في حدود 0.5% من ذروة Fable 5" في CursorBench 3.2 لا يوضح ما إذا كانت 0.5 نقطة مئوية أو فرقاً نسبياً بنسبة 0.5%، و "الذروة" تشير إلى تشغيل بأفضل تكوين بدلاً من الافتراضي. في معيار البرمجة، الفرق بين إعداد effort الافتراضي وإعداد ذروة ليس تافهاً. يغطي تحليلنا لمعايير Fable 5 كيفية تأطير أرقام هذا النموذج.

الرقمان العلميان هما أوضح الادعاءات في المجموعة على وجه التحديد لأنهما يتجنبان كل هذا: +10.2 نقطة في الكيمياء العضوية و +7.7 نقطة في تحليل البروتين هي فروق مطلقة مقابل خط أساس مسمى. لا يزال لا يمكنك الحصول على النتيجة الأولية، ولكنك تعرف بالضبط إلى أي مدى تحرك النموذج.

تعتمد ادعاءات التكلفة لكل مهمة على التكوين

ثلاثة من ادعاءات Anthropic تجمع بين القدرة والتكلفة: تكلفة أقل لكل مهمة في Frontier-Bench، ثلث التكلفة في OSWorld 2.0، نصف السعر في CursorBench 3.2.

نصف السعر المعلن يمكن التحقق منه ويصمد. Opus 5 يكلف 5 دولارات لكل مليون رمز إدخال و 25 دولاراً لكل مليون رمز إخراج، وهو مطابق لـ Opus 4.8 ونصف سعر Fable 5 (10 دولارات / 50 دولاراً) بالضبط. هذا منشور على صفحة التسعير الخاصة بـ Anthropic وليس نتيجة مقارنة معيارية على الإطلاق. الحسابات الكاملة، بما في ذلك عمليات كتابة التخزين المؤقت، ومعدلات الدفعات، وقسط الوضع السريع، موجودة في تحليلنا لتسعير Opus 5.

التكلفة لكل مهمة هي كمية مختلفة. تعتمد على عدد الرموز التي استهلكها التشغيل، والذي يعتمد على مستوى الجهد، وما إذا كان التفكير ممكّناً، وعدد الدورات التي استغرقتها الحلقة الوكيلية، وعدد الوكلاء الفرعيين الذين تم إنشاؤهم. تشير إرشادات المطالبة الخاصة بـ Anthropic إلى أن Opus 5 ينتج استجابات افتراضية أطول من Opus 4.8، ويفوض المهام إلى الوكلاء الفرعيين بسهولة أكبر، ويوسع نطاق المهام بشكل متكرر. تدفع هذه العوامل الثلاثة استهلاك الرموز لأعلى في أعباء العمل الحقيقية، لذا فإن تشغيلاً معدلاً لمخطط التكلفة لكل مهمة ليس هو التكوين الذي ستطبقه تلقائياً.

لا شيء من هذا يجعل قصة التكلفة خاطئة. نصف السعر المعلن هو نصف السعر المعلن، و مقارنتنا بين Opus 5 و Fable 5 توضح أين تؤتي هذه الفجوة ثمارها بالفعل. هذا يعني أن نسبة التكلفة لكل مهمة هي نتاج إعداد معين، وسيختلف إعدادك الخاص. قم بقياسه.

السقف الذي تسميه Anthropic لنفسها

السطر الأكثر فائدة في مادة الإطلاق هو الذي ليس انتصاراً. تذكر Anthropic بصراحة أن Opus 5 لا يزال يتخلف عن Mythos 5 في استغلال الأمن السيبراني وفي البحث البيولوجي المستقل. كما يحتفظ Fable 5 بلقب "النموذج الأكثر قدرة الذي تم إصداره على نطاق واسع".

يجب إعادة التأكيد على ذلك لأن التغطية الصحفية تجاهلته إلى حد كبير. Opus 5 ليس قمة مكدس Claude. الملخص الصادق هو قدرة على مستوى الحدود بنصف سعر الحدود، مع سقف مسمى فوقه. لأبحاث الأمن على مستوى الحدود أو العمل العلمي المستقل، الإجابة المعيارية لا تزال من فئة Mythos، والتي يغطيها شرحنا لنموذج فئة Mythos و مقارنة Fable 5 vs Mythos 5.

هناك أيضاً نتيجة تشغيلية. قدمت Anthropic خيار fallbacks: "default" (خلف ترويسة الإصدار التجريبي server-side-fallback-2026-07-01) الذي يعود تلقائياً إلى Opus 4.8 عندما يرفض Opus 5 طلباً يتعلق بفئة الأمن السيبراني. النموذج الذي لديه رفضات أمن سيبراني أكثر صرامة يحتاج إلى مخرج، ووجود هذا المخرج يخبرك بشيء لا يظهره المخطط.

ما لا تغطيه المعايير على الإطلاق

تقيس المعايير إنجاز المهام. لا تقيس الأشياء التي تحدد ما إذا كان النموذج يعمل في منتجك:

ما يجب اختباره بنفسك بالفعل

معايير البائع هي فرضية أولية. إليك تقييم موجز يمكنك تشغيله في فترة ما بعد الظهر وسيخبرك المزيد عن Opus 5 لحمل عملك أكثر من كل رقم أعلاه مجتمعين.

1. قم بإنشاء مجموعة صغيرة من المهام من تاريخك الخاص. من عشرين إلى خمسين مهمة حقيقية: تذاكر مغلقة، طلبات سحب مدمجة، سلاسل دعم كان نموذجك سيتعامل معها. المدخلات الحقيقية تتفوق على الاصطناعية لأنها تحمل تنسيقك الفعلي، والغموض، والحالات الهامشية.

2. قم بتثبيت التكوين واكتبه. معرف النموذج بالضبط claude-opus-5، بالإضافة إلى مستوى output_config.effort، وما إذا كان التفكير مفعلاً، و max_tokens الخاص بك. التكوين غير المثبت يجعل كل مقارنة لاحقة بلا معنى.

3. قم بتقييم التكلفة لكل مهمة تم حلها، وليس التكلفة لكل رمز. اقرأ كتلة usage في كل استجابة وسجل رموز الإدخال والإخراج وقراءة التخزين المؤقت وكتابة التخزين المؤقت لكل مهمة. ثم اقسم إجمالي الإنفاق على المهام التي اجتازت بالفعل فحص القبول الخاص بك. هذا هو الرقم الذي يدعيه مخطط Anthropic، لذا فهو الرقم الذي يجب إعادة إنتاجه.

4. قم بتشغيل مسح جهد حقيقي. نفس مجموعة المهام بمستويات low و medium و high و xhigh. تعني إعادة المعايرة أن low و medium أقوى بشكل ملحوظ في Opus 5 مما كانت عليه في نماذج Opus السابقة، وستجد العديد من أعباء العمل أن مستوى أرخص يمر بنفس القدر من المرات. راقب max_tokens في النهاية العليا.

5. اختبر الحلقة الوكيلية، وليس الدورة الواحدة. معظم معايير الإطلاق وكيلية (OSWorld، CursorBench، AutomationBench). الفحوصات الفورية ذات الدورة الواحدة لن تعيد إنتاجها. قم بتشغيل دورات متعددة مع أدواتك الحقيقية المرفقة وعد الدورات، وليس فقط النتائج.

6. قارن بنظامك الحالي على نفس مجموعة المهام. أياً كان ما تديره اليوم، سواء كان Opus 4.8 أو Sonnet 5 أو شيئاً آخر، قم بتشغيله من خلال نفس الإطار. النتيجة النسبية على بياناتك الخاصة تستحق أكثر من النتيجة المطلقة على بيانات شخص آخر.

7. سجل الرفضات بشكل منفصل. سيتعرض العمل المتعلق بالأمن السيبراني لرفضات أكثر تكراراً مما كان عليه في 4.8. احسبها قبل أن تقرر ما إذا كانت ترويسة الرجوع تستحق التوصيل.

لمنهجية المقارنة في إطلاق سابق، يوضح مقالة معايير Sonnet 5 نفس التمرين، ويحتوي دليل API الخاص بـ Opus 5 على أشكال الطلبات.

تشغيل التقييم في Apidog

التقييم أعلاه عبارة عن مجموعة من طلبات HTTP مع ترويسات المصادقة، ونصوص JSON، واستجابات متدفقة، وكتلة usage تحتاج إلى قراءتها في كل مكالمة. هذا عمل API عادي، وهذا ما يتعامل معه Apidog.

إعداد عملي:

  1. أنشئ طلباً واحداً مقابل نقطة نهاية Anthropic Messages وخزّن مفتاح API الخاص بك كمتغير بيئة بدلاً من لصقه في النص الأساسي.
  2. كرر هذا الطلب مرة واحدة لكل مستوى جهد حتى تتمكن من إطلاق نفس المطالبة بمستويات low إلى xhigh ومقارنة الاستجابات جنباً إلى جنب.
  3. قم بتشغيل التدفق وافحص أحداث SSE مباشرة عندما تحتاج إلى رؤية كيف تتراكم رموز التفكير قبل بدء الإجابة المرئية.
  4. افحص حمولات استدعاءات الأدوات في الاستجابة لتأكيد أن النموذج يصدر بالفعل استدعاءات أدوات منظمة بدلاً من وصفها بالنثر، وهو ما يستحق المراقبة كأثر جانبي لتعطيل التفكير.
  5. أضف تأكيداً على حقول usage بحيث يتم التقاط مرات الوصول إلى ذاكرة التخزين المؤقت وإجمالي الرموز في كل تشغيل بدلاً من تقديرها بالعين.
  6. احفظ كل ذلك كمجموعة بحيث يكون إطلاق النموذج التالي مجرد تبديل لمعرف النموذج، وليس إعادة بناء.

إليك الطلب الأساسي:

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 8192,
    "output_config": {"effort": "medium"},
    "messages": [
      {"role": "user", "content": "Fix the failing test in this diff."}
    ]
  }'

غيّر حقلاً واحداً في كل تشغيل، وحافظ على كل شيء آخر ثابتاً، وسجل كتلة usage في كل مرة. قم بتنزيل Apidog إذا كنت ترغب في اتباع هذا النمط مع البيئات والتأكيدات الموصلة بالفعل.

الملخص الصادق

قصة معايير Opus 5 قوية حقاً: أكبر قفزة على سلفه تدعيها Anthropic لإصدار Opus، بأسعار قائمة لم تتغير. كما أنها تدار بالكامل من قبل البائع، ولم يتم إعادة إنتاجها اعتباراً من 25 يوليو 2026، ويتم ذكرها إلى حد كبير في نسب تخفي مقاماتها. كل هذين الأمرين صحيحان في آن واحد.

اعتبر الجدول في أعلى هذه الصفحة فرضية Anthropic حول نموذجها الخاص. ثم اذهب واحصل على رقمك الخاص. الفجوة بين مخطط الإطلاق وحمل العمل الإنتاجي هي حيث يتم اتخاذ قرار ترحيل كل نموذج فعلياً، ويغطي دليل أساسيات Opus 5 بقية ما تغير.

زر

الأسئلة الشائعة

هل تم التحقق من معايير Claude Opus 5 بشكل مستقل؟ لا. اعتباراً من 25 يوليو 2026، تأتي كل نتيجة معيارية منشورة لـ Opus 5 من Anthropic. لم ينشر أي مختبر طرف ثالث أو مقيم مستقل إعادة إنتاج. اقرأها كأرقام مبلغ عنها من البائع.

ما هو أكبر ادعاء لمعايير Opus 5؟ Frontier-Bench v0.1، حيث تقول Anthropic إن Opus 5 أكثر من ضعف نتيجة Opus 4.8 بتكلفة أقل لكل مهمة. لم تنشر Anthropic النتائج الأساسية، فقط النسبة، و Frontier-Bench v0.1 هو معيار جديد بدون سجل تتبع ثابت.

هل Claude Opus 5 هو نموذج Claude الأكثر قدرة؟ لا. يحتفظ Fable 5 بلقب "النموذج الأكثر قدرة الذي تم إصداره على نطاق واسع"، وتذكر Anthropic أن Opus 5 لا يزال يتخلف عن Mythos 5 في استغلال الأمن السيبراني والبحث البيولوجي المستقل. عرض Opus 5 هو قدرة على مستوى الحدود بنصف سعر Fable 5، وليس قمة المكدس.

ما مدى تحسن Opus 5 مقارنة بـ Opus 4.8 في المهام العلمية؟ تبلغ Anthropic عن +10.2 نقطة في الكيمياء العضوية و +7.7 نقطة في تحليل البروتين فوق Opus 4.8. هذان هما الادعاءان المذكوران كفروق مطلقة بدلاً من نسب، مما يجعلهما الأسهل في التفسير، على الرغم من أن النتائج الأساسية لم تُنشر.

هل يتفوق Opus 5 على Fable 5؟ وفقاً لأرقام Anthropic، يتفوق على Fable 5 في OSWorld 2.0 بثلث التكلفة ويصل إلى 0.5% من ذروة Fable 5 في CursorBench 3.2 بنصف السعر. لا يزال Fable 5 يحتفظ بتصنيف القدرة الكلية. راجع المقارنة الكاملة.

ما الذي يجب أن أقوم باختباره بنفسي؟ التكلفة لكل مهمة تم حلها على عشرين إلى خمسين مهمة حقيقية من قائمة المهام الخاصة بك، يتم تشغيلها على مستويات جهد متعددة، مع أدواتك الفعلية المرفقة وتمكين حلقات متعددة الأدوار. قارن بما تديره اليوم على نفس الإطار.

ممارسة تصميم API في Apidog

اكتشف طريقة أسهل لبناء واستخدام واجهات برمجة التطبيقات