كلود سونيت 5.5: اختبارات الأداء، نتائج أنثروبيك والمستقلة، وتحليلها

معايير أداء كلود سونيت 5.5: 70.6% في ترمينال-بنش 4.0، 81.3 في إس دبليو إي-بنش برو، مؤشر AA 56. من أجرى كل اختبار، وما هي تكاليف الجهد، وكيفية إجراء تقييمك الخاص.

Medy Evrard

29 سبتمبر 2026

كلود سونيت 5.5: اختبارات الأداء، نتائج أنثروبيك والمستقلة، وتحليلها

Apidog للمؤسسات

النشر على الخوادم المحلية

SSO و RBAC

متوافق مع SOC 2

استكشف Apidog للمؤسسات

حقق Claude Sonnet 5.5 نسبة 70.6% في Terminal-Bench 4.0، و 55.5% في CursorBench 4.0، و 46.2% في FrontierCode 1.1 بأقصى جهد (52.1% بجهد عالٍ جدًا)، و 81.3 في SWE-Bench Pro، مرتفعًا عن Sonnet 5 الذي حقق 10.3% و 34.1% و 42.4% و 63.2% على التوالي. يتصدر Opus 5.5 معظم صفوف جدول الإطلاق بحوالي نقطتين إلى 3 نقاط ولكنه يتخلف في Terminal-Bench. سجلت Artificial Analysis بشكل مستقل Sonnet 5.5 عند 56 نقطة في مؤشر الذكاء الخاص بها، ليحتل المرتبة الثالثة من أصل 216.

أدناه: معايير Claude Sonnet 5.5 بالكامل، ومن قام بتشغيلها، وتغيرات الجهد، وكيفية اختبار النموذج على حركة المرور الخاصة بك في Apidog. للمواصفات، انظر ما هو Claude Sonnet 5.5.

جدول الإطلاق

تقارن نشرة Anthropic للإطلاق بين أربعة نماذج (يشير "n/r" إلى شرطة). خلايا Sonnet 5.5 هي بأقصى جهد ما لم يُحدد خلاف ذلك؛ الإعدادات الافتراضية لواجهة برمجة التطبيقات هي جهد عالٍ، بينما Claude Code والتطبيقات بجهد متوسط.

المعيار Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ n/r
FrontierCode 1.1 (الرئيسي) 46.2% أقصى² / 52.1% عالٍ جدًا 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% n/r
GDPval-AA v2.1³ 1844 1449 1846 1487⁴
AA-Briefcase v1.1³ 1811 1359 1822 1483⁴
امتحان البشرية الأخير (مع الأدوات) 64.5% 54.9% 67.7% n/r
OSWorld 2.1 (جزئي) 80.1% 57.0% 81.8% n/r
Chartography (بدون أدوات) 61.6% 15.6% 64.4% 53.6%⁴

الحواشي، بعبارات بسيطة:

  1. نتيجة Opus 5.5 في Terminal-Bench هي عند الجهد العالي جدًا (xhigh)، وهي الأفضل له؛ بينما عند أقصى جهد (max) سجل 64.8%.
  2. FrontierCode يعاقب على التعديلات خارج النطاق. عند أقصى جهد، كان Sonnet 5.5 يستخدم مهارة مراجعة الكود في Claude Code بشكل متكرر، متفرعًا إلى العديد من الوكلاء الفرعيين؛ في حالتين فحصتهما Cognition، تسبب ذلك في مهلة أو تعديلات خارج النطاق.
  3. أجرت Artificial Analysis كلا اختباري العمل المعرفي على نشر قبل الإصدار به خطأ في الإخراج المنظم، تم إصلاحه منذ ذلك الحين. تتوقع Anthropic تأثيرًا صغيرًا، إن وجد، يقلل من تقدير Sonnet 5.5.
  4. قامت OpenAI مؤخرًا بإصلاح خطأ في فهم الصور في GPT-6 Sol قد لا تعكسه درجات AA و Surge AI.

من قام بتشغيل كل معيار

أجرت Anthropic كل اختبار بنفسها ما لم يُذكر طرف ثالث. الصفوف المشتركة بين البائعين تشترك في اسم المعيار، وليس في الأداة أو إعداد الجهد.

القائم بالتشغيل المعيار الظروف
Anthropic Terminal-Bench 4.0، HLE، OSWorld 2.1 TB: Claude Code --bare، 5 محاولات، مع تشغيل وسائل الحماية. HLE: البحث وتنفيذ الكود. OSWorld: 108 مهام
Cognition FrontierCode 1.1 Claude في Claude Code، GPT في Codex CLI
Cursor CursorBench 4.0 أداة Cursor الإنتاجية؛ قدرت Anthropic التكلفة بالسعر المعلن
Artificial Analysis GDPval-AA، AA-Briefcase نشر قبل الإصدار
Anthropic Chartography معيار Surge AI، تم تقييمه باستخدام Gemini 3.5 Flash؛ نتيجة Sol من Surge

تأثرت نسبة 1.5% من محاولات Sonnet 5.5 في Terminal-Bench بالعودة إلى حل بديل، بينما بلغت النسبة 10% لمحاولات Opus 5.5 (بطاقة النظام §8.5)، لذا يجب قراءة تقدم Sonnet البالغ 4.2 نقطة بحذر.

إضافات بطاقة النظام

الصفوف من واحد إلى ستة هي ملخص بطاقة النظام لأقصى جهد.

المعيار Sonnet 5.5 Sonnet 5 Opus 5.5
SWE-Bench Pro 81.3 63.2 89.9
SWE-Bench Multilingual 90.3 78.3 93.9
SWE-Bench Multimodal 54.3 28.1 61.4
HLE، بدون أدوات 56.9 43.1 64.4
HealthBench Professional 69.2 57.8 65.6
AutomationBench (تشغيل Zapier) 44.7 10.7 42.5
DeepSWE v1.1 71.0% n/r n/r
Terminal-Bench-Science 0.1 59.9% n/r 58.7%
FrontierSWE v2 (تشغيل Proximal) 61.9% n/r 62.3%
ArXivMath (بدون أدوات / مع أدوات) 86.8% / 95.2% n/r 91.2% / 96.9%
ProgramBench (سياق طويل) 79.7% 77.3% 91.2%
OSWorld 2.1، نجاح صارم 43.5% 25.6% 48.7%
Toolathlon-Verified (نجاح@1) 77.8% 74.7% 77.8%
OfficeQA / OfficeQA Pro 76.9% / 65.6% 75.1% / 62.1% 78.9% / 67.7%

يتفوق Sonnet 5.5 على Opus 5.5 في HealthBench Professional و AutomationBench و Terminal-Bench-Science؛ بينما يتصدر Opus أو يتعادل في البقية. تتصدر Opus بفارق كبير في ProgramBench و SWE-Bench Pro و HLE بدون أدوات. نتيجة OSWorld البالغة 80.1% هي تقدير جزئي؛ 43.5% فقط من المهام تنجح بشكل كامل.

الجهد يغير الصورة

رسوم بيانية الإطلاق، كدرجة (تكلفة). تكلفة Terminal-Bench هي لكل محاولة، والأخرى لكل مهمة. يظهر مخططان GPT-5.6 Sol (*) لأن أرقام GPT-6 Sol لم تُنشر.

النموذج منخفض متوسط عالٍ عالٍ جدًا أقصى
Terminal-Bench 4.0
Sonnet 5.5 20.0% (0.76 دولار) 28.8% (0.83 دولار) 43.0% (1.94 دولار) 61.5% (5.30 دولار) 70.6% (12.54 دولار)
Opus 5.5 38.5% (1.29 دولار) 57.6% (2.94 دولار) 64.2% (3.88 دولار) 66.4% (7.35 دولار) 64.8% (11.24 دولار)
Sonnet 5 3.2% (3.78 دولار) 4.4% (4.83 دولار) 4.5% (8.20 دولار) 7.0% (9.95 دولار) 10.3% (11.62 دولار)
GPT-5.6 Sol* 7.9% (1.46 دولار) 20.9% (2.69 دولار) 26.1% (4.12 دولار) 28.5% (5.39 دولار) 37.3% (7.89 دولار)
FrontierCode 1.1 رئيسي
Sonnet 5.5 29.3% (0.19 دولار) 36.5% (0.24 دولار) 49.4% (0.42 دولار) 52.1% (1.59 دولار) 46.2% (20.78 دولار)
Opus 5.5 47.3% (0.40 دولار) 54.6% (0.80 دولار) 54.0% (1.09 دولار) 51.4% (2.25 دولار) 54.4% (6.19 دولار)
Sonnet 5 28.7% (2.39 دولار) 35.2% (3.81 دولار) 39.4% (6.10 دولار) 42.7% (10.07 دولار) 42.4% (17.12 دولار)
GPT-6 Sol 37.3% (0.43 دولار) 45.9% (0.77 دولار) 47.7% (1.04 دولار) 48.4% (1.32 دولار) 49.3% (2.07 دولار)
CursorBench 4.0
Sonnet 5.5 35.8% (0.50 دولار) 39.2% (0.70 دولار) 47.8% (1.67 دولار) 53.1% (3.88 دولار) 55.5% (9.67 دولار)
Opus 5.5 43.7% (1.17 دولار) 52.5% (2.91 دولار) 56.0% (3.97 دولار) 56.0% (6.98 دولار) 57.8% (13.43 دولار)
Sonnet 5 24.1% (1.39 دولار) 28.0% (2.31 دولار) 30.8% (3.48 دولار) 32.0% (4.55 دولار) 34.1% (7.17 دولار)
GPT-5.6 Sol* 24.6% (0.87 دولار) 31.1% (1.77 دولار) 35.7% (2.85 دولار) 37.7% (4.40 دولار) 41.7% (8.23 دولار)
AA-Briefcase v1.1 (Elo)
Sonnet 5.5 1264 (0.87 دولار) 1461 (1.64 دولار) 1634 (3.95 دولار) 1746 (9.63 دولار) 1811 (29.19 دولار)
Opus 5.5 1285 (1.15 دولار) 1642 (4.40 دولار) 1705 (6.27 دولار) 1780 (12.27 دولار) 1822 (21.05 دولار)
Sonnet 5 923 (0.82 دولار) 1056 (1.73 دولار) 1177 (3.76 دولار) 1274 (7.56 دولار) 1359 (14.43 دولار)
GPT-6 Sol 905 (0.12 دولار) 1142 (0.34 دولار) 1289 (0.63 دولار) 1364 (1.19 دولار) 1483 (2.67 دولار)

النتائج المستقلة

تسجل Artificial Analysis Sonnet 5.5 عند 56 نقطة في مؤشر الذكاء v4.3.2، لتحتل المرتبة الثالثة من أصل 216، خلف Opus 5.5 فقط عند أقصى جهد وعالٍ جدًا. سجل Sonnet 5 38 نقطة. تكلفة تشغيل المؤشر:

الجهد نتيجة المؤشر تكلفة التشغيل
أقصى 55.98 8,977 دولار
عالٍ جدًا 51.85 2,738 دولار
عالٍ 46.74 1,176 دولار
متوسط 40.74 701 دولار
منخفض 35.84 544 دولار

يكلف أقصى جهد 7.6 ضعف الجهد العالي مقابل 9.2 نقطة إضافية. قراءة OfficeChai لتحليل AA تضع Sonnet 5.5 خارج حدود باريتو، الأكثر تنافسية من حيث التكلفة عند الجهد العالي، وتحسب حوالي 193,000 توكن إخراج لكل مهمة مؤشر عند أقصى جهد.

معايير السلامة

حقن المطالبات، وفقًا لبطاقة النظام:

تم تشغيل التقييمات السيبرانية مع إيقاف وسائل الحماية: 46.1% على CyScenarioBench (Sonnet 5: 0.7%، Opus 5.5: 67.6%). إنه أول Sonnet مزود بوسائل حماية سيبرانية، وتحذر Anthropic من المزيد من الرفض حتى في مهام الأمان الحميدة. انظر دليلنا لحقن المطالبات.

شغّل تقييمك الخاص

لا تشبه المعايير حركة المرور الخاصة بك، ويقول دليل Anthropic للمطالبات إن الجهد قد أُعيد معايرته، لذا لا تعيد استخدام إعدادات Sonnet 5. في Apidog:

  1. قم بتخزين ANTHROPIC_API_KEY كمتغير بيئة وحفظ من 20 إلى 50 مطالبة حقيقية كطلبات رسائل (Messages requests).
  2. تأكد من أن الحالة هي 200، وأن stop_reason ليس "max_tokens" أو "refusal"، وأن المحتوى يتضمن الإجابة الصحيحة.
  3. شغّله بجهد low و medium و high و xhigh، تمريرة واحدة لكل منها؛ تغيير الجهد يلغي صلاحية ذاكرة التخزين المؤقت للمطالبات.
  4. سجل معدل النجاح وعدد التوكنات في usage، بسعر 2 دولار للإدخال و 10 دولارات للإخراج لكل مليون توكن.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 16000,
    "output_config": {"effort": "high"},
    "messages": [{"role": "user", "content": "صنف تذكرة الدعم هذه: ..."}]
  }'

انشر النموذج بأقل جهد تقبل معدل نجاحه. انظر اختبار تطبيقات LLM و اختبار واجهات برمجة تطبيقات وكلاء الذكاء الاصطناعي، ثم قم بتنزيل Apidog لبناء المجموعة.

الأسئلة الشائعة

هل يتفوق Sonnet 5.5 على Opus 5.5؟ نعم، في Terminal-Bench 4.0 و HealthBench Professional و AutomationBench و Terminal-Bench-Science و Chartography مع الأدوات. يتصدر Opus 5.5 أو يتعادل في البقية.

ما هي نتيجة Sonnet 5.5 في SWE-Bench؟ 81.3 في SWE-Bench Pro و 90.3 في Multilingual، بأقصى جهد.

لماذا يوجد رقمان لـ FrontierCode؟ 46.2% هي بأقصى جهد (max)، و 52.1% بجهد عالٍ جدًا (xhigh)؛ تسبب تفرع الوكلاء الفرعيين بأقصى جهد في عقوبات على التعديلات خارج النطاق.

هل يجب علي الترقية من Sonnet 5؟ نعم بناءً على المعايير، ولكن اقرأ أولاً التغييرات الجوهرية في واجهة برمجة التطبيقات في Sonnet 5.5 مقابل Sonnet 5.

الخطوة التالية

ابدأ بجهد عالٍ (أو متوسط للترميز الوكيلي المحدد جيدًا)، كما تقترح Anthropic، ودع تقييمك في Apidog يقرر ما إذا كانت خطوة للأعلى تستحق العناء.

ممارسة تصميم API في Apidog

اكتشف طريقة أسهل لبناء واستخدام واجهات برمجة التطبيقات