معايير أداء كلود هايكو 5.5

مقاييس أداء كلود هايكو 5.5: 72.4% OSWorld، 1620 GDPval-AA، 39.2% Terminal-Bench بأقصى جهد. من أجرى كل اختبار، تكاليف الجهد الواحد، وتقييمك الخاص.

Ashley Goolam

Ashley Goolam

8 أكتوبر 2026

معايير أداء كلود هايكو 5.5

Apidog للمؤسسات

النشر على الخوادم المحلية

SSO و RBAC

متوافق مع SOC 2

استكشف Apidog للمؤسسات

سجل Claude Haiku 5.5 نسبة 72.4% في OSWorld 2.1، و 1620 في GDPval-AA v2.1، و 46.4% في FrontierCode 1.1، و 39.2% في Terminal-Bench 4.0. سجل Haiku 4.5 نسبة 15.7% و 735 و 0.0% في ثلاثة من هذه المقاييس. جميعها أرقام أقصى جهد؛ عند الجهد الافتراضي medium، ينخفض GDPval-AA إلى 1277. لم تنشر أي مختبرات مستقلة نتائج Haiku 5.5 بعد.

أدناه: كل معيار Claude Haiku 5.5، ومن قام بتشغيله، وكيف يؤثر الجهد على الأداء والتكلفة، وكيفية اختبار النموذج على حركة المرور الخاصة بك في Apidog. للاطلاع على المواصفات والتسعير، ابدأ بـ ما هو Claude Haiku 5.5.

button

جدول الإطلاق

تستخدم كل خلية من Haiku 5.5 التفكير التكيفي بأقصى جهد، وعادة ما يتم حساب متوسطها على خمسة تجارب (استخدم Terminal-Bench عشرة لكل مهمة). تعني "n/r" عدم نشر أي نتيجة.

المعيار Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (إيلو) 1620 735 1437 1840
AA-Briefcase v1.1 (إيلو) 1578 614 1336 1824
OSWorld 2.1، مجموعة فرعية غير متصلة 72.4% 15.7% 48.9% 83.9%
آخر اختبار للبشرية، بدون أدوات 45.9% 10.2% n/r 56.9%
آخر اختبار للبشرية، مع أدوات 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 (الرئيسي) 46.4% n/r 42.4% 52.1% (xhigh)
رسم الخرائط، بدون أدوات 46.4% 6.4% 29.1% 61.6%

من أجرى كل معيار

أجرت أنثروبيك معظم الاختبارات بنفسها. تتشارك الصفوف عبر البائعين اسم المعيار، وليس دائمًا أداة أو إعداد جهد.

المعيار من أجراه الشروط
GDPval-AA v2.1، AA-Briefcase v1.1 Artificial Analysis، بشكل مستقل GDPval-AA: 220 مهمة، 44 مهنة، إيلو مرساة لـ DeepSeek V4.1 Flash (بحد أقصى) عند 1600؛ Briefcase: مشاريع متعددة الأسابيع
FrontierCode 1.1 Cognition كلود في Claude Code، و GPT في Codex؛ الرئيسي = أصعب 100 من أصل 150 مهمة
رسم الخرائط أنثروبيك، على معيار Surge AI مُصنف Gemini 3.5 Flash؛ نتيجة Luna من Surge AI
Terminal-Bench 4.0 أنثروبيك Claude Code --bare، 66 مهمة، 10 تجارب لكل منها، إجراءات حماية مفعلة
OSWorld 2.1 أنثروبيك 82 من 108 مهام، 1080p، حتى 500 خطوة
آخر اختبار للبشرية أنثروبيك ميزانية مهمة 980 ألف توكن، مُصنف Opus 4.6

يحتاج خليتان من GPT-6 Luna إلى سياق. أجرت أنثروبيك اختبار OSWorld الخاص بـ Luna عبر واجهة برمجة تطبيقات OpenAI على نفس الـ 82 مهمة. تأتي نسبة 16.4% من Terminal-Bench لـ Luna من لوحة المتصدرين العامة (Codex CLI، أقصى جهد). في Terminal-Bench، أوقفت إجراءات الحماية 1.8% من تجارب Haiku 5.5 (12 من 660)، وتم احتساب كل منها كفشل.

مصيدة FrontierCode

يضع جدول الإطلاق Haiku 5.5 عند أقصى حد (46.4%) بجوار Sonnet 5.5 عند xhigh (52.1%)، وهي أفضل نتيجة لـ Sonnet. تقدم بطاقة النظام الأرقام المتطابقة:

FrontierCode 1.1 الرئيسي ممتد
Haiku 5.5، أقصى 46.4% 58.4%
Haiku 5.5، xhigh 45.8% n/r
Sonnet 5.5، أقصى 46.2% 59.1%
Sonnet 5.5، xhigh 52.1% 64.4%

بأقصى جهد، يتفوق Haiku 5.5 على Sonnet 5.5 في الرئيسي، بنسبة 46.4% مقابل 46.2%. في أفضل إعداد لكل نموذج، يتفوق Sonnet بفارق 5.7 نقاط. اذكر مستوى الجهد الذي تقصده عند الاقتباس من أي منهما.

إضافات بطاقة النظام

تضيف بطاقة النظام صفوفًا تجاوزها منشور الإطلاق. جميعها بأقصى جهد ما لم يُذكر خلاف ذلك.

المعيار Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench متعدد اللغات 83.7 67.4 90.3
SWE-bench متعدد الأنماط 30.7 19.8 54.3
OSWorld 2.1، معدل نجاح صارم 37.1% n/r 48.8%
رسم الخرائط، مع أدوات 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Professional (معدل للطول) 64.8% 32.2% 69.2%

نسبة 72.4% في OSWorld هي درجة جزئية؛ 37.1% فقط من المهام تنجح بشكل كامل. يتضاعف أداء رسم الخرائط تقريبًا مع الأدوات (من 46.4% إلى 86.2%)، لذا زود Haiku 5.5 بالأدوات لأعمال الرسم البياني.

نتائج الجهد الافتراضي أقل

يُعين Haiku 5.5 على medium افتراضيًا في Claude API و Claude Code. تفيد بطاقة النظام بهذه النتائج للجهد الافتراضي:

المعيار متوسط (افتراضي) أقصى ملاحظة
GDPval-AA v2.1 1277 1620 استخدم المتوسط حوالي عُشر توكنات الإخراج للأقصى
AA-Briefcase v1.1 1372 1578 استخدم المتوسط أقل من ربع توكنات الإخراج للأقصى
HealthBench Professional 59.9% 64.8% منخفض 57.9%، مرتفع 61.3%

استدعِ واجهة برمجة التطبيقات بدون output_config.effort وتوقع العمود الأيسر. تغطي وثائق الجهد جميع المستويات الخمسة.

النتيجة والتكلفة حسب الجهد

من الرسوم البيانية للإطلاق، كـ النتيجة (التكلفة). تكلفة OSWorld و Terminal-Bench هي لكل محاولة؛ GDPval-AA هي لكل مهمة.

النموذج منخفض متوسط مرتفع Xhigh أقصى
OSWorld 2.1
Haiku 5.5 42.0% ($0.07) 53.3% ($0.13) 61.3% ($0.18) 67.6% ($0.28) 72.4% ($0.61)
Sonnet 5.5 57.9% ($0.68) 66.0% ($0.93) 73.2% ($1.38) 81.1% ($2.22) 83.9% ($5.73)
GPT-6 Luna 19.2% ($0.04) 37.5% ($0.13) 42.3% ($0.14) 44.8% ($0.17) 48.9% ($0.21)
GDPval-AA v2.1
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Terminal-Bench 4.0
Haiku 5.5 12.7% ($0.42) 20.3% ($0.68) 24.8% ($1.04) 31.5% ($1.75) 39.2% ($2.64)
Sonnet 5.5 20.0% ($0.62) 28.8% ($0.68) 43.0% ($1.46) 61.5% ($4.34) 70.6% ($10.44)

تستخدم التكاليف أسعار القائمة: 0.10 دولار أمريكي / 0.50 دولار أمريكي لكل مليون توكن للمطالبات التي تصل إلى 100 ألف توكن، وأعلى من ذلك (انظر تفاصيل التسعير).

المجالات التي لا يزال Haiku 5.5 يتخلف فيها

يتصدر Sonnet 5.5 كل صف في جدول الإطلاق. الفوز الوحيد لـ Haiku وجهاً لوجه هو في FrontierCode بجهد أقصى متطابق. الفجوة الأكبر هي في Terminal-Bench 4.0: 39.2% مقابل 70.6%. ويظهر SWE-Bench Pro (64.8 مقابل 81.3) و SWE-bench متعدد الأنماط (30.7 مقابل 54.3) نفس النمط.

توافق أنثروبيك: Sonnet 5.5 و Opus 5.5 "يظلان خيارات أفضل لمهام الترميز المعقدة القائمة على الوكلاء". يناسب Haiku 5.5 الأعمال ذات النطاق الضيق: الضغط، التلخيص، التصنيف، استخدام المتصفح، والوكلاء الفرعيين تحت نموذج أكبر. يتم تناول تشغيله كوكييل فرعي رخيص في Haiku 5.5 في Claude Code.

النتائج المستقلة: لا توجد بعد

حتى 8 أكتوبر 2026، لم ينشر أي مختبر مستقل نتائج Haiku 5.5. صفحة Artificial Analysis لـ Haiku 5.5 تُرجع خطأ 404، ولوحة المتصدرين الخاصة بها تسرد Claude 4.5 Haiku فقط. لم تظهر Vals و LMArena و SWE-bench و Aider أي شيء أيضًا. لا توجد أرقام سرعة من طرف ثالث؛ تصف أنثروبيك Haiku 5.5 بأنه "أسرع نموذج حتى الآن" بالسرعة القياسية، أبطأ من Opus في الوضع السريع.

أقرب رقم خارجي يأتي من Cursor. تذكر وثائق النموذج الخاصة به أن Haiku 5.5 "يحقق 48.4% في CursorBench بأقصى جهد"، بزيادة من 30.9% عند مستوى منخفض. مع إيقاف التفكير، تسجل Cursor من 22.1% إلى 26.2% عند نفس مستويات الجهد التي سجل فيها التفكير من 30.9% إلى 42.3%.

ماذا يبلغ العملاء

هذه المعلومات مأخوذة من منشور إطلاق أنثروبيك ولم يتم التحقق منها بشكل مستقل:

قم بتشغيل تقييمك الخاص

لا تبدو المعايير مثل حركة المرور الخاصة بك. يقترح دليل المطالبات الخاص بأنثروبيك استخدام xhigh أو أقصى حد فقط حيث تظهر تقييماتك مكسبًا، وتشغيل نفس التقييمات على Sonnet 5.5 للمقارنة. في Apidog:

  1. قم بتخزين ANTHROPIC_API_KEY كمتغير بيئة وحفظ من 20 إلى 50 مطالبة حقيقية كطلبات رسائل.
  2. أضف تأكيدات: حالة 200، و stop_reason بخلاف "max_tokens" أو "refusal"، والمحتوى الذي تحتاجه الإجابة الصحيحة.
  3. قم بتشغيل المجموعة عند low و medium و high. يؤدي تغيير الجهد إلى إبطال ذاكرة التخزين المؤقت للمطالبات.
  4. سجل معدل النجاح وعدد التوكنات في usage. ينتج المحلل اللغوي الجديد حوالي 30% توكنات أكثر من Haiku 4.5 لنفس النص.
  5. انسخ المجموعة، واستبدلها بـ claude-sonnet-5-5، وقارن كلا النموذجين في مشروع واحد.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
  }'

لا ترسل temperature أو top_p أو top_k أو تعبئة مسبقة للمساعد؛ كل منها يعيد 400 على Haiku 5.5. حدد كتل الاستجابة بواسطة type، حيث يمكن أن تأتي كتلة thinking أولاً. انظر دليل API واختبار تطبيقات LLM.

الأسئلة الشائعة

هل Claude Haiku 5.5 أفضل من Sonnet 5.5؟ ليس وفقًا لأرقام أنثروبيك. يتصدر Sonnet 5.5 كل صف في جدول الإطلاق؛ يتفوق Haiku عليه فقط في FrontierCode عندما يعمل كلاهما بأقصى جهد (46.4% مقابل 46.2%). انظر Haiku 5.5 مقابل Haiku 4.5 للحصول على نظرة عامة حول الترقية.

ما هي نتيجة Haiku 5.5 في SWE-bench؟ 64.8 في SWE-Bench Pro، و 83.7 في SWE-bench متعدد اللغات، و 30.7 في SWE-bench متعدد الأنماط، جميعها بأقصى جهد.

ما هو مستوى الجهد الذي تم تشغيل المعايير به؟ أقصى حد، عادةً ما يتم حساب متوسطها على خمسة تجارب. الافتراضي في API هو متوسط، حيث يسجل GDPval-AA 1277 بدلاً من 1620.

هل توجد معايير مستقلة لـ Haiku 5.5؟ لا توجد بعد. قامت Artificial Analysis بتشغيل GDPval-AA و AA-Briefcase بشكل مستقل، ولكن أنثروبيك هي التي نشرت تلك النتائج؛ لا توجد صفحة لـ Haiku 5.5 لدى AA.

هل GPT-6 Luna أرخص؟ عادةً. تكلف Luna أقل عند كل مستوى جهد لـ GDPval-AA وكل مستوى لـ OSWorld باستثناء المتوسط، حيث يكلف الاثنان نفس الشيء تقريبًا. يسجل Haiku 5.5 درجات أعلى في كليهما.

الخطوة التالية

ابدأ بـ medium وقم بالزيادة فقط حيث يؤتي مكسب معدل النجاح ثماره. قم بتنزيل Apidog، أنشئ مجموعة التقييم أعلاه، واحتفظ بالنتائج في Apidog بجوار خط الأساس لـ Sonnet 5.5 الخاص بك قبل تبديل حركة المرور الإنتاجية.

ممارسة تصميم API في Apidog

اكتشف طريقة أسهل لبناء واستخدام واجهات برمجة التطبيقات