سجل Claude Haiku 5.5 نسبة 72.4% في OSWorld 2.1، و 1620 في GDPval-AA v2.1، و 46.4% في FrontierCode 1.1، و 39.2% في Terminal-Bench 4.0. سجل Haiku 4.5 نسبة 15.7% و 735 و 0.0% في ثلاثة من هذه المقاييس. جميعها أرقام أقصى جهد؛ عند الجهد الافتراضي medium، ينخفض GDPval-AA إلى 1277. لم تنشر أي مختبرات مستقلة نتائج Haiku 5.5 بعد.
أدناه: كل معيار Claude Haiku 5.5، ومن قام بتشغيله، وكيف يؤثر الجهد على الأداء والتكلفة، وكيفية اختبار النموذج على حركة المرور الخاصة بك في Apidog. للاطلاع على المواصفات والتسعير، ابدأ بـ ما هو Claude Haiku 5.5.
جدول الإطلاق
تستخدم كل خلية من Haiku 5.5 التفكير التكيفي بأقصى جهد، وعادة ما يتم حساب متوسطها على خمسة تجارب (استخدم Terminal-Bench عشرة لكل مهمة). تعني "n/r" عدم نشر أي نتيجة.
| المعيار | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (إيلو) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (إيلو) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1، مجموعة فرعية غير متصلة | 72.4% | 15.7% | 48.9% | 83.9% |
| آخر اختبار للبشرية، بدون أدوات | 45.9% | 10.2% | n/r | 56.9% |
| آخر اختبار للبشرية، مع أدوات | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (الرئيسي) | 46.4% | n/r | 42.4% | 52.1% (xhigh) |
| رسم الخرائط، بدون أدوات | 46.4% | 6.4% | 29.1% | 61.6% |
من أجرى كل معيار
أجرت أنثروبيك معظم الاختبارات بنفسها. تتشارك الصفوف عبر البائعين اسم المعيار، وليس دائمًا أداة أو إعداد جهد.
| المعيار | من أجراه | الشروط |
|---|---|---|
| GDPval-AA v2.1، AA-Briefcase v1.1 | Artificial Analysis، بشكل مستقل | GDPval-AA: 220 مهمة، 44 مهنة، إيلو مرساة لـ DeepSeek V4.1 Flash (بحد أقصى) عند 1600؛ Briefcase: مشاريع متعددة الأسابيع |
| FrontierCode 1.1 | Cognition | كلود في Claude Code، و GPT في Codex؛ الرئيسي = أصعب 100 من أصل 150 مهمة |
| رسم الخرائط | أنثروبيك، على معيار Surge AI | مُصنف Gemini 3.5 Flash؛ نتيجة Luna من Surge AI |
| Terminal-Bench 4.0 | أنثروبيك | Claude Code --bare، 66 مهمة، 10 تجارب لكل منها، إجراءات حماية مفعلة |
| OSWorld 2.1 | أنثروبيك | 82 من 108 مهام، 1080p، حتى 500 خطوة |
| آخر اختبار للبشرية | أنثروبيك | ميزانية مهمة 980 ألف توكن، مُصنف Opus 4.6 |
يحتاج خليتان من GPT-6 Luna إلى سياق. أجرت أنثروبيك اختبار OSWorld الخاص بـ Luna عبر واجهة برمجة تطبيقات OpenAI على نفس الـ 82 مهمة. تأتي نسبة 16.4% من Terminal-Bench لـ Luna من لوحة المتصدرين العامة (Codex CLI، أقصى جهد). في Terminal-Bench، أوقفت إجراءات الحماية 1.8% من تجارب Haiku 5.5 (12 من 660)، وتم احتساب كل منها كفشل.
مصيدة FrontierCode
يضع جدول الإطلاق Haiku 5.5 عند أقصى حد (46.4%) بجوار Sonnet 5.5 عند xhigh (52.1%)، وهي أفضل نتيجة لـ Sonnet. تقدم بطاقة النظام الأرقام المتطابقة:
| FrontierCode 1.1 | الرئيسي | ممتد |
|---|---|---|
| Haiku 5.5، أقصى | 46.4% | 58.4% |
| Haiku 5.5، xhigh | 45.8% | n/r |
| Sonnet 5.5، أقصى | 46.2% | 59.1% |
| Sonnet 5.5، xhigh | 52.1% | 64.4% |
بأقصى جهد، يتفوق Haiku 5.5 على Sonnet 5.5 في الرئيسي، بنسبة 46.4% مقابل 46.2%. في أفضل إعداد لكل نموذج، يتفوق Sonnet بفارق 5.7 نقاط. اذكر مستوى الجهد الذي تقصده عند الاقتباس من أي منهما.
إضافات بطاقة النظام
تضيف بطاقة النظام صفوفًا تجاوزها منشور الإطلاق. جميعها بأقصى جهد ما لم يُذكر خلاف ذلك.
| المعيار | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-bench متعدد اللغات | 83.7 | 67.4 | 90.3 |
| SWE-bench متعدد الأنماط | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1، معدل نجاح صارم | 37.1% | n/r | 48.8% |
| رسم الخرائط، مع أدوات | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench Professional (معدل للطول) | 64.8% | 32.2% | 69.2% |
نسبة 72.4% في OSWorld هي درجة جزئية؛ 37.1% فقط من المهام تنجح بشكل كامل. يتضاعف أداء رسم الخرائط تقريبًا مع الأدوات (من 46.4% إلى 86.2%)، لذا زود Haiku 5.5 بالأدوات لأعمال الرسم البياني.
نتائج الجهد الافتراضي أقل
يُعين Haiku 5.5 على medium افتراضيًا في Claude API و Claude Code. تفيد بطاقة النظام بهذه النتائج للجهد الافتراضي:
| المعيار | متوسط (افتراضي) | أقصى | ملاحظة |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | استخدم المتوسط حوالي عُشر توكنات الإخراج للأقصى |
| AA-Briefcase v1.1 | 1372 | 1578 | استخدم المتوسط أقل من ربع توكنات الإخراج للأقصى |
| HealthBench Professional | 59.9% | 64.8% | منخفض 57.9%، مرتفع 61.3% |
استدعِ واجهة برمجة التطبيقات بدون output_config.effort وتوقع العمود الأيسر. تغطي وثائق الجهد جميع المستويات الخمسة.
النتيجة والتكلفة حسب الجهد
من الرسوم البيانية للإطلاق، كـ النتيجة (التكلفة). تكلفة OSWorld و Terminal-Bench هي لكل محاولة؛ GDPval-AA هي لكل مهمة.
| النموذج | منخفض | متوسط | مرتفع | Xhigh | أقصى |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42.0% ($0.07) | 53.3% ($0.13) | 61.3% ($0.18) | 67.6% ($0.28) | 72.4% ($0.61) |
| Sonnet 5.5 | 57.9% ($0.68) | 66.0% ($0.93) | 73.2% ($1.38) | 81.1% ($2.22) | 83.9% ($5.73) |
| GPT-6 Luna | 19.2% ($0.04) | 37.5% ($0.13) | 42.3% ($0.14) | 44.8% ($0.17) | 48.9% ($0.21) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12.7% ($0.42) | 20.3% ($0.68) | 24.8% ($1.04) | 31.5% ($1.75) | 39.2% ($2.64) |
| Sonnet 5.5 | 20.0% ($0.62) | 28.8% ($0.68) | 43.0% ($1.46) | 61.5% ($4.34) | 70.6% ($10.44) |
- أقصى حد مكلف لخطوته الأخيرة. في GDPval-AA، يكلف الأقصى حوالي 28 ضعف المتوسط مقابل 343 نقطة إيلو إضافية. في OSWorld، يكلف الأقصى أكثر من ضعف xhigh مقابل 4.8 نقطة.
- Haiku 5.5 عند متوسط يتفوق على Luna عند أقصى حد في OSWorld: 53.3% مقابل 0.13 دولار أمريكي مقارنة بـ 48.9% مقابل 0.21 دولار أمريكي. لكن Luna أرخص في كل مستوى مطابق آخر؛ عند المستوى المتوسط، يكلف كلاهما نفس الشيء تقريبًا. انظر Haiku 5.5 مقابل GPT-6 Luna.
- Haiku 5.5 عند أقصى حد يتفوق على Sonnet 5.5 عند متوسط في OSWorld (72.4% مقابل 0.61 دولار أمريكي مقارنة بـ 66.0% مقابل 0.93 دولار أمريكي).
- Terminal-Bench هو الاستثناء. يتفوق Sonnet 5.5 عند مستوى مرتفع (43.0%، 1.46 دولار أمريكي) على Haiku 5.5 عند أقصى حد (39.2%، 2.64 دولار أمريكي) بتكلفة أقل. تستخدم تكاليف Sonnet سعر قراءة ذاكرة التخزين المؤقت الجديد 0.10 دولار أمريكي.
تستخدم التكاليف أسعار القائمة: 0.10 دولار أمريكي / 0.50 دولار أمريكي لكل مليون توكن للمطالبات التي تصل إلى 100 ألف توكن، وأعلى من ذلك (انظر تفاصيل التسعير).
المجالات التي لا يزال Haiku 5.5 يتخلف فيها
يتصدر Sonnet 5.5 كل صف في جدول الإطلاق. الفوز الوحيد لـ Haiku وجهاً لوجه هو في FrontierCode بجهد أقصى متطابق. الفجوة الأكبر هي في Terminal-Bench 4.0: 39.2% مقابل 70.6%. ويظهر SWE-Bench Pro (64.8 مقابل 81.3) و SWE-bench متعدد الأنماط (30.7 مقابل 54.3) نفس النمط.
توافق أنثروبيك: Sonnet 5.5 و Opus 5.5 "يظلان خيارات أفضل لمهام الترميز المعقدة القائمة على الوكلاء". يناسب Haiku 5.5 الأعمال ذات النطاق الضيق: الضغط، التلخيص، التصنيف، استخدام المتصفح، والوكلاء الفرعيين تحت نموذج أكبر. يتم تناول تشغيله كوكييل فرعي رخيص في Haiku 5.5 في Claude Code.
النتائج المستقلة: لا توجد بعد
حتى 8 أكتوبر 2026، لم ينشر أي مختبر مستقل نتائج Haiku 5.5. صفحة Artificial Analysis لـ Haiku 5.5 تُرجع خطأ 404، ولوحة المتصدرين الخاصة بها تسرد Claude 4.5 Haiku فقط. لم تظهر Vals و LMArena و SWE-bench و Aider أي شيء أيضًا. لا توجد أرقام سرعة من طرف ثالث؛ تصف أنثروبيك Haiku 5.5 بأنه "أسرع نموذج حتى الآن" بالسرعة القياسية، أبطأ من Opus في الوضع السريع.
أقرب رقم خارجي يأتي من Cursor. تذكر وثائق النموذج الخاصة به أن Haiku 5.5 "يحقق 48.4% في CursorBench بأقصى جهد"، بزيادة من 30.9% عند مستوى منخفض. مع إيقاف التفكير، تسجل Cursor من 22.1% إلى 26.2% عند نفس مستويات الجهد التي سجل فيها التفكير من 30.9% إلى 42.3%.
ماذا يبلغ العملاء
هذه المعلومات مأخوذة من منشور إطلاق أنثروبيك ولم يتم التحقق منها بشكل مستقل:
- HubSpot: 92.8% في المتوسط على ثلاث جولات في مجموعة بوابات CRM المحاكاة الخاصة بها، وهي أفضل نتيجة رأتها في تلك المجموعة.
- AlphaSense: 0.84 مقابل 0.76 لـ Haiku 4.5 على 400 استعلام "اسأل في المستند"، وهو ما يعتبرونه ذا دلالة إحصائية.
- Box: 11 نقطة أعلى من Haiku 4.5 بحوالي نصف زمن الوصول، في الاختبارات المبكرة.
- Asana: أكثر من 30% أقل في زمن الوصول لإكمال المهام مقارنة بنموذجها الحالي.
- Cognition: يحقق Devin Fusion درجة FrontierCode تبلغ 66.2 مع Haiku 5.5 كرفيق و Opus 5.5 كقائد. هذا نظام ثنائي النماذج، وليس Haiku وحده.
قم بتشغيل تقييمك الخاص
لا تبدو المعايير مثل حركة المرور الخاصة بك. يقترح دليل المطالبات الخاص بأنثروبيك استخدام xhigh أو أقصى حد فقط حيث تظهر تقييماتك مكسبًا، وتشغيل نفس التقييمات على Sonnet 5.5 للمقارنة. في Apidog:
- قم بتخزين
ANTHROPIC_API_KEYكمتغير بيئة وحفظ من 20 إلى 50 مطالبة حقيقية كطلبات رسائل. - أضف تأكيدات: حالة 200، و
stop_reasonبخلاف"max_tokens"أو"refusal"، والمحتوى الذي تحتاجه الإجابة الصحيحة. - قم بتشغيل المجموعة عند
lowوmediumوhigh. يؤدي تغيير الجهد إلى إبطال ذاكرة التخزين المؤقت للمطالبات. - سجل معدل النجاح وعدد التوكنات في
usage. ينتج المحلل اللغوي الجديد حوالي 30% توكنات أكثر من Haiku 4.5 لنفس النص. - انسخ المجموعة، واستبدلها بـ
claude-sonnet-5-5، وقارن كلا النموذجين في مشروع واحد.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
}'
لا ترسل temperature أو top_p أو top_k أو تعبئة مسبقة للمساعد؛ كل منها يعيد 400 على Haiku 5.5. حدد كتل الاستجابة بواسطة type، حيث يمكن أن تأتي كتلة thinking أولاً. انظر دليل API واختبار تطبيقات LLM.
الأسئلة الشائعة
هل Claude Haiku 5.5 أفضل من Sonnet 5.5؟ ليس وفقًا لأرقام أنثروبيك. يتصدر Sonnet 5.5 كل صف في جدول الإطلاق؛ يتفوق Haiku عليه فقط في FrontierCode عندما يعمل كلاهما بأقصى جهد (46.4% مقابل 46.2%). انظر Haiku 5.5 مقابل Haiku 4.5 للحصول على نظرة عامة حول الترقية.
ما هي نتيجة Haiku 5.5 في SWE-bench؟ 64.8 في SWE-Bench Pro، و 83.7 في SWE-bench متعدد اللغات، و 30.7 في SWE-bench متعدد الأنماط، جميعها بأقصى جهد.
ما هو مستوى الجهد الذي تم تشغيل المعايير به؟ أقصى حد، عادةً ما يتم حساب متوسطها على خمسة تجارب. الافتراضي في API هو متوسط، حيث يسجل GDPval-AA 1277 بدلاً من 1620.
هل توجد معايير مستقلة لـ Haiku 5.5؟ لا توجد بعد. قامت Artificial Analysis بتشغيل GDPval-AA و AA-Briefcase بشكل مستقل، ولكن أنثروبيك هي التي نشرت تلك النتائج؛ لا توجد صفحة لـ Haiku 5.5 لدى AA.
هل GPT-6 Luna أرخص؟ عادةً. تكلف Luna أقل عند كل مستوى جهد لـ GDPval-AA وكل مستوى لـ OSWorld باستثناء المتوسط، حيث يكلف الاثنان نفس الشيء تقريبًا. يسجل Haiku 5.5 درجات أعلى في كليهما.
الخطوة التالية
ابدأ بـ medium وقم بالزيادة فقط حيث يؤتي مكسب معدل النجاح ثماره. قم بتنزيل Apidog، أنشئ مجموعة التقييم أعلاه، واحتفظ بالنتائج في Apidog بجوار خط الأساس لـ Sonnet 5.5 الخاص بك قبل تبديل حركة المرور الإنتاجية.
