تكلفة Claude Sonnet 5.5 هي 2 دولار/10 دولارات لكل مليون رمز إدخال/إخراج، أي نصف تكلفة Claude Opus 5.5 التي تبلغ 4 دولارات/20 دولارًا. على جدول إطلاق Anthropic، يحقق Sonnet 5.5 نتائج قريبة جدًا من Opus 5.5 في معظم الصفوف ويتفوق عليه في Terminal-Bench 4.0 (70.6% مقابل 66.4%)، ومع ذلك تقول Anthropic إن Opus 5.5 "لا يزال أقوى بوضوح في الأعمال المعقدة والمفتوحة." الحكم: وجه الأعمال محددة النطاق وذات الحجم الكبير والوكلاء الفرعيين إلى Sonnet 5.5 بجهد منخفض إلى مرتفع. ادفع مقابل Opus 5.5 للمهام الطويلة والمفتوحة، أو حيثما تدفع Sonnet إلى xhigh أو max، لأن Opus في وضع متوسط أو عالٍ غالبًا ما يحقق درجات أعلى بنفس التكلفة أو أقل.
لكل نموذج على حدة، انظر ما هو Claude Sonnet 5.5 و ما هو Claude Opus 5.5. يعرض القسم الأخير كيفية اختبار كليهما باستخدام موجهاتك الخاصة في Apidog.
المواصفات والأسعار جنبًا إلى جنب
| Sonnet 5.5 | Opus 5.5 | |
|---|---|---|
| معرف نموذج API | claude-sonnet-5-5 |
claude-opus-5-5 |
| الإدخال / الإخراج، لكل مليون رمز | $2 / $10 | $4 / $20 |
| كتابة ذاكرة التخزين المؤقت (5 دقائق) | $2.50 | $5 |
| قراءة ذاكرة التخزين المؤقت | $0.20 | $0.20 |
| وضع السرعة | غير متاح | $8 / $40 |
| الجهد الافتراضي في API | high |
medium |
| التفكير | متكيف افتراضيًا، أو between_tools |
متكيف، دائم التشغيل |
| السياق / الحد الأقصى للإخراج | 1M / 128K | 1M / 128K |
| فئة الكمون | سريع | معتدل |
ثلاثة صفوف هي الأهم:
- قراءات ذاكرة التخزين المؤقت تكلف نفس الشيء، لذا في حلقات الوكلاء التي تعتمد بشكل كبير على ذاكرة التخزين المؤقت، تكمن الفجوة في الغالب في الإخراج وكتابات ذاكرة التخزين المؤقت. تسعير Claude Sonnet 5.5 يقوم بالحساب. لا يفرض أي من النموذجين قسطًا سياقيًا طويلًا.
- يختلف الجهد الافتراضي. يضع اختبار الإعدادات الافتراضية Sonnet في وضع
highمقابل Opus في وضعmedium، وهو الزوج الذي يميل فيه Opus إلى الفوز. - وضع السرعة متاح فقط لـ Opus (الوثائق). تقول Anthropic إن Sonnet 5.5 يولد مخرجات أسرع بنسبة 30% أو أكثر من Sonnet 5.
المعايير: قريبة على جدول الإطلاق، أوسع في بطاقة النظام
الصفوف من الأول إلى الثامن هي جدول إطلاق Anthropic؛ البقية تأتي من بطاقة النظام. قامت Cognition بتشغيل FrontierCode، وقامت Cursor بتشغيل CursorBench، وقامت Zapier بتشغيل AutomationBench، وقامت Artificial Analysis (AA) بتشغيل GDPval-AA وAA-Briefcase؛ قامت Anthropic بتشغيل البقية. Sonnet في أقصى جهد ما لم يُذكر خلاف ذلك.
| المعيار | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 66.4% (xhigh) |
| FrontierCode 1.1 الرئيسي | 46.2% أقصى، 52.1% xhigh | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 (Elo) | 1844 | 1846 |
| AA-Briefcase v1.1 (Elo) | 1811 | 1822 |
| HLE، مع الأدوات | 64.5% | 67.7% |
| OSWorld 2.1، جزئي | 80.1% | 81.8% |
| Chartography، بدون أدوات | 61.6% | 64.4% |
| SWE-Bench Pro | 81.3 | 89.9 |
| SWE-Bench Multimodal | 54.3 | 61.4 |
| HLE، بدون أدوات | 56.9 | 64.4 |
| OSWorld 2.1، نجاح صارم | 43.5% | 48.7% |
| ProgramBench، سياق طويل | 79.7% | 91.2% |
| Terminal-Bench-Science 0.1 | 59.9% | 58.7% |
| AutomationBench | 44.7 | 42.5 |
| HealthBench Professional | 69.2 | 65.6 |
جدول الإطلاق هو الصورة الأكثر إشراقًا: باستثناء Terminal-Bench، يتفوق Opus في صفوف النسب المئوية الخاصة به بفارق 1.7 إلى 3.2 نقطة، باحتساب نتيجة Sonnet الـ xhigh في FrontierCode. تزيد خمسة صفوف من بطاقة النظام الفجوة إلى 5.2 إلى 11.5 نقطة: SWE-Bench Pro، SWE-Bench Multimodal، HLE بدون أدوات، OSWorld الصارم، و ProgramBench ذو السياق الطويل. الأعمال الطويلة وغير المساعدة والمهام الكاملة هي حيث يبقى Opus في المقدمة.
اقرأ فوز Terminal-Bench 4.0 بعناية: يشير القسم 8.5 من بطاقة النظام إلى أن آلية الأمان الاحتياطية قد أثرت على 10% من تجارب Opus مقابل 1.5% من Sonnet، وحققت تشغيل AA الخاص بها لـ Sonnet 5.5 نسبة 63.6%. التفاصيل في معايير Claude Sonnet 5.5.
الجهد يحدد المواجهة
يقارن جدول الإطلاق كل نموذج بأفضل إعداد له. فاتورتك لا تفعل ذلك. تعرض صفحة إطلاق Anthropic كل مستوى جهد مع التكلفة لكل محاولة أو مهمة:
| المعيار، النموذج | منخفض | متوسط | عالٍ | Xhigh | أقصى |
|---|---|---|---|---|---|
| Terminal-Bench, Sonnet | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Terminal-Bench, Opus | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| CursorBench, Sonnet | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| CursorBench, Opus | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| FrontierCode, Sonnet | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| FrontierCode, Opus | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| AA-Briefcase, Sonnet | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| AA-Briefcase, Opus | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
ما يظهره:
- يتفوق Opus في الوضع المتوسط غالبًا على Sonnet في الوضع العالي. Terminal-Bench 4.0: يحقق Opus نسبة 57.6% بتكلفة 2.94 دولار لكل محاولة، بينما يحقق Sonnet نسبة 43.0% بتكلفة 1.94 دولار.
- يمكن لـ Opus بأقل من الأقصى أن يتفوق على أفضل أداء لـ Sonnet بتكلفة أقل. CursorBench: Opus في الوضع العالي (56.0%، 3.97 دولار) مقابل Sonnet في الوضع الأقصى (55.5%، 9.67 دولار). FrontierCode: Opus في الوضع المتوسط (54.6%، 0.80 دولار) مقابل أفضل أداء لـ Sonnet (52.1%، 1.59 دولار).
- يمكن لـ Sonnet في الوضع الأقصى أن يكلف أكثر من Opus في الوضع الأقصى: 29.19 دولارًا مقابل 21.05 دولارًا في AA-Briefcase، لنتيجة أقل. في FrontierCode، انخفضت نتيجة Sonnet القصوى عن نتيجته xhigh لأنه استخدم وكلاء فرعيين للمراجعة، كما تشير حاشية Anthropic.
- يتفوق Sonnet في الجزء السفلي من المنحنى. إعداده المنخفض يقلل من نقطة Opus الأرخص في كل جدول.
نصف سعر الرمز لا يعني نصف التكلفة لكل مهمة: ينفق Sonnet المزيد من الرموز كلما زاد الجهد. تشير بيانات AA، كما ذكرها OfficeChai، إلى أن Sonnet 5.5 ينتج حوالي 193,000 رمز إخراج لكل مهمة فهرسة كحد أقصى، أي ما يقرب من 60% أكثر من Opus 5.5.
هذا هو الجدل الرئيسي في موضوع Hacker News: قرأ العديد من المعلقين الرسوم البيانية على أنها تقول إن Opus بجهد أقل يضاهي أو يتفوق على Sonnet بجهد عالٍ أو xhigh، مما يترك مكانة Sonnet في جهد منخفض أو متوسط و كوكيلاً فرعيًا تحت منظم Opus.
يقول دليل توجيه Anthropic إن جهد Sonnet 5.5 تمت إعادة معايرته: ابدأ بـ high (medium للترميز الوكيلي المحدد جيدًا) ووفر xhigh و max للمكاسب المقاسة. يؤدي تغيير الجهد على المستوى الأعلى بين الطلبات إلى إبطال ذاكرة التخزين المؤقت للموجه، لذا اضبطه لكل عبء عمل (دليل API).
اختلافات السلامة والسلوك
انقسمت نتائج حقن الموجه. في معيار حقن الموجه غير المباشر لـ Gray Swan، بلغ معدل نجاح هجوم Sonnet 5.5 3.4% في 15 محاولة (Sonnet 5: 6.7%): أقل مقاومة من Opus 5.5، وأكثر من كل نموذج غير Claude تم اختباره، وأضعف في استخدام الكمبيوتر الرسومي (12.5%). ضد مهاجمي Shade التكيفيين، يتفوق Sonnet على Opus في الترميز (3.01% مقابل 54.61% بدون حماية، 2.63% مقابل 11.13% مع تشغيل المجسات) ويتعادل معه في استخدام الكمبيوتر (0.07%)؛ في استخدام المتصفح هو أول نموذج قيمته Anthropic بدون هجمات ناجحة. انظر Opus 5.5 وحقن الموجه.
يحمل كلا النموذجين حماية إلكترونية؛ Sonnet 5.5 هو أول إصدار من Sonnet يحصل عليها. المهام الإلكترونية ذات المخاطر العالية التي يتم الإبلاغ عنها تعود إلى Sonnet 5، تلقائيًا في تطبيقات Anthropic وعلى API فقط إذا اخترت ذلك (fallbacks: "default"، بيتا). تحذر بطاقة النظام من المزيد من الرفض حتى في أعمال الأمان الحميدة.
كما وجدت بطاقة النظام أن Sonnet 5.5 أكثر صدقًا تحت الضغط من Opus 5.5 ولكنه أكثر عرضة للهلاوس.
خلط Sonnet 5.5 و Opus 5.5 في نظام واحد
طريقة واحدة للحصول على كليهما: Opus يخطط، Sonnet ينفذ. ثلاث آليات مهمة.
كتل التفكير لا تتقاطع. يسقط Sonnet 5.5 كتل تفكير Opus 5 و Opus 5.5 (غير مدفوعة الفواتير؛ الطلب لا يزال يعود بـ 200)، وترتبط الكتل بالنموذج والمحادثة والحساب. عند تبديل النماذج في منتصف المحادثة، تختفي عملية التفكير، لذا قم بالتسليم عبر النص: يكتب Opus الخطة كرسالة، ويبدأ Sonnet منها (دليل الترحيل).
تقبل أداة المستشار Opus 5.5 كمستشار لمنفذ Sonnet 5.5؛ تعود النصيحة مشفرة كـ advisor_redacted_result.
يحتوي Claude Code على opusplan: Opus في وضع التخطيط، Sonnet للتنفيذ. يشير الاسم المستعار sonnet إلى Sonnet 5.5 فقط على Anthropic API (الإصدار 2.1.284 أو أحدث)، لذا على Bedrock و Google Cloud و Foundry، يتم تنفيذ opusplan على إصدار أقدم من Sonnet. انظر Claude Sonnet 5.5 في Claude Code.
أين يتناسب GPT-6 Sol
يتشارك GPT-6 Sol سعر Sonnet 5.5 المدرج البالغ 2 دولار/10 دولارات، مع قراءات مخزنة مؤقتًا بقيمة 0.20 دولار (خصم 90%) ونافذة سياق 872 ألف. يمنح جدول Anthropic لـ Sol أربع خانات: FrontierCode 49.3%، GDPval-AA 1487، AA-Briefcase 1483، و Chartography 53.6% بدون أدوات. تشير حاشية سفلية إلى أن OpenAI قامت مؤخرًا بإصلاح خطأ في فهم صور Sol قد لا ينعكس بعد في نتائج AA و Surge AI.
تختلف التكلفة لكل مهمة حسب المعيار. في AA-Briefcase بأقصى إعداد، يكلف Sol 2.67 دولار لكل مهمة مقابل 29.19 دولارًا لـ Sonnet، مسجلاً 1483 مقابل 1811. في FrontierCode، يتطابق Sonnet في الوضع العالي مع أفضل أداء لـ Sol (49.4% مقابل 49.3%) بتكلفة 0.42 دولار مقابل 2.07 دولار. انظر GPT-6 Sol مقابل Claude Opus 5.5 و ما هو GPT-6 Sol.
أي نموذج لأي عبء عمل
| عبء العمل | النموذج والجهد |
|---|---|
| الدردشة عالية الحجم، التصنيف، الاستخراج | Sonnet 5.5، low أو medium |
| إصلاحات الأخطاء محددة النطاق، التغييرات بحجم PR | Sonnet 5.5، medium أو high |
| وكلاء فرعيون يقومون بتنفيذ خطة Opus | Sonnet 5.5، medium أو high |
| العمل الوكيلي الطويل والمفتوح | Opus 5.5، medium ثم high |
أي شيء يتطلب Sonnet عند xhigh أو max |
Opus 5.5، medium أو high |
| المنطق المتعلق بقاعدة بيانات التعليمات البرمجية ذات السياق الطويل | Opus 5.5، medium أو أعلى |
| وكلاء يقرأون محتوى غير موثوق به | كلاهما؛ اختبر حالات حقن خاصة بك |
اختبر كلاهما على حركة المرور الخاصة بك
كل الرسم البياني أعلاه جاء من نظام اختبار شخص آخر، وليس من موجهاتك أو أدواتك أو مزيج الرموز الخاص بك. ابدأ بالزوج الذي تحدده البيانات:
ask() {
curl -s https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"'"$1"'","max_tokens":16000,
"output_config":{"effort":"'"$2"'"},
"messages":[{"role":"user","content":"Review this diff and list each bug as JSON: ..."}]}' \
| jq '{model, stop_reason, usage}'
}
ask claude-sonnet-5-5 high
ask claude-opus-5-5 medium
في Apidog، اجعل الأمر قابلاً للتكرار: طلب واحد إلى https://api.anthropic.com/v1/messages، و ANTHROPIC_API_KEY كمتغير بيئة، و {{model}} و {{effort}} في النص. كرر ذلك لكل زوج وأضف معالجًا لاحقًا بحيث يتحقق كل تشغيل من نفس الأشياء:
const body = pm.response.json();
pm.test("finished cleanly", () => {
pm.expect(body.stop_reason).to.not.be.oneOf(["max_tokens", "refusal"]);
});
pm.test("stays inside the token budget", () => {
pm.expect(body.usage.output_tokens).to.be.below(8000);
});
قم بتشغيل كل زوج من 10 إلى 20 مرة وقارن usage ووقت الاستجابة ومعدل النجاح؛ الرموز مضروبة في السعر المعلن هي تكلفتك الحقيقية لكل مهمة. المزيد في كيفية اختبار تطبيقات LLM.
الأسئلة الشائعة
هل Claude Sonnet 5.5 أفضل من Opus 5.5؟ ليس في معظم الصفوف. يتصدر Opus 5.5 جدول الإطلاق باستثناء Terminal-Bench 4.0 وتعادل قريب في GDPval-AA. المواجهة بين الجيل الأخير: Claude Opus 5 مقابل Sonnet 5.
هل Sonnet 5.5 نصف تكلفة Opus 5.5؟ لكل رمز، نعم. لكل مهمة يعتمد الأمر على الجهد: في أقصى جهد، كلف Sonnet أكثر في AA-Briefcase (29.19 دولارًا مقابل 21.05 دولارًا).
هل يمكنني التبديل بين النماذج في منتصف المحادثة؟ نعم، ولكن Sonnet 5.5 يسقط كتل تفكير Opus 5.5، لذا مرر الحالة كنص.
Sonnet 5.5 أم GPT-6 Sol بسعر 2 دولار/10 دولارات؟ يتصدر Sonnet جميع الصفوف الأربعة المشتركة في أفضل إعداد له؛ يمكن أن يكون Sol أرخص بكثير لكل مهمة. اختبر كلاهما.
الخطوة التالية
قم بتشغيل أهم موجهين لديك من حيث التكلفة عبر Sonnet 5.5 في وضع high و Opus 5.5 في وضع medium، وقارن معدل النجاح والتكلفة لكل مهمة قبل تغيير قاعدة التوجيه. للاحتفاظ بالطلبات والتأكيدات والنتائج في مشروع واحد، قم بتنزيل Apidog.
