Claude Sonnet 5.5 ได้คะแนน 70.6% บน Terminal-Bench 4.0, 55.5% บน CursorBench 4.0, 46.2% บน FrontierCode 1.1 ที่ความพยายามสูงสุด (52.1% ที่ xhigh) และ 81.3 บน SWE-Bench Pro ซึ่งเพิ่มขึ้นจาก Sonnet 5 ที่ได้ 10.3%, 34.1%, 42.4% และ 63.2. Opus 5.5 นำหน้าเกือบทุกแถวในตารางเปิดตัวประมาณ 2 ถึง 3 คะแนน แต่ตามหลังใน Terminal-Bench. Artificial Analysis ให้คะแนน Sonnet 5.5 ที่ 56 บน Intelligence Index โดยเป็นอันดับ 3 จาก 216 รุ่น
ด้านล่างนี้คือข้อมูลเกณฑ์มาตรฐาน Claude Sonnet 5.5 แบบเต็ม ผู้ที่ดำเนินการทดสอบ การเปลี่ยนแปลงระดับความพยายาม และวิธีการทดสอบโมเดลด้วยข้อมูลของคุณเองใน Apidog. สำหรับรายละเอียดทางเทคนิค ดู Claude Sonnet 5.5 คืออะไร.
ตารางเปิดตัว
โพสต์เปิดตัว ของ Anthropic เปรียบเทียบโมเดลสี่รุ่น ("n/r" หมายถึงขีดกลาง). ค่าในเซลล์ของ Sonnet 5.5 คือความพยายามสูงสุด (max effort) เว้นแต่จะระบุไว้เป็นอย่างอื่น; API จะตั้งค่าเริ่มต้นเป็น high, ส่วน Claude Code และแอปพลิเคชันจะตั้งค่าเป็น medium.
| เกณฑ์มาตรฐาน | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | n/r |
| FrontierCode 1.1 (หลัก) | 46.2% Max² / 52.1% Xhigh | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | n/r |
| GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487⁴ |
| AA-Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483⁴ |
| Humanity’s Last Exam (พร้อมเครื่องมือ) | 64.5% | 54.9% | 67.7% | n/r |
| OSWorld 2.1 (บางส่วน) | 80.1% | 57.0% | 81.8% | n/r |
| Chartography (ไม่มีเครื่องมือ) | 61.6% | 15.6% | 64.4% | 53.6%⁴ |
เชิงอรรถ อธิบายอย่างง่าย:
- คะแนน Terminal-Bench ของ Opus 5.5 อยู่ที่ระดับ xhigh ซึ่งเป็นผลงานที่ดีที่สุด; ที่ระดับ max ทำได้ 64.8%.
- FrontierCode มีการลงโทษสำหรับการแก้ไขที่เกินขอบเขต (out-of-scope). ที่ระดับ max, Sonnet 5.5 มักจะใช้ทักษะการรีวิวโค้ดของ Claude Code บ่อยครั้ง ซึ่งกระจายงานไปยัง subagent จำนวนมาก; ในสองกรณีที่ Cognition ตรวจสอบ พบว่าทำให้เกิดการหมดเวลา (timeout) หรือการแก้ไขที่เกินขอบเขต.
- Artificial Analysis ได้ทดสอบงานที่ต้องใช้ความรู้ทั้งสองรายการบนการติดตั้งใช้งานเวอร์ชันก่อนเปิดตัว ซึ่งมีข้อผิดพลาดเกี่ยวกับการส่งออกข้อมูลแบบมีโครงสร้าง (structured-output bug) ซึ่งได้รับการแก้ไขแล้ว. Anthropic คาดว่าจะมีผลกระทบเพียงเล็กน้อย หากมี จะเป็นการประเมินค่า Sonnet 5.5 ต่ำกว่าความเป็นจริง.
- OpenAI ได้แก้ไขข้อบกพร่องด้านการทำความเข้าใจรูปภาพของ GPT-6 Sol เมื่อเร็วๆ นี้ ซึ่งคะแนนจาก AA และ Surge AI อาจยังไม่ได้สะท้อนถึงการแก้ไขนี้.
ใครเป็นผู้ดำเนินการแต่ละเกณฑ์มาตรฐาน
Anthropic เป็นผู้ดำเนินการทดสอบทั้งหมดเอง เว้นแต่จะระบุชื่อบุคคลที่สาม. แถวที่มีผู้จำหน่ายหลายรายจะใช้ชื่อเกณฑ์มาตรฐานเดียวกัน ไม่ใช่เครื่องมือทดสอบหรือการตั้งค่าระดับความพยายามเดียวกัน.
| ผู้ดำเนินการ | เกณฑ์มาตรฐาน | เงื่อนไข |
|---|---|---|
| Anthropic | Terminal-Bench 4.0, HLE, OSWorld 2.1 | TB: Claude Code --bare, 5 การทดลอง, เปิดใช้งานการป้องกัน. HLE: การค้นหาและการประมวลผลโค้ด. OSWorld: 108 งาน |
| Cognition | FrontierCode 1.1 | Claude ใน Claude Code, GPT ใน Codex CLI |
| Cursor | CursorBench 4.0 | เครื่องมือทดสอบสำหรับใช้งานจริงของ Cursor; Anthropic ประเมินค่าใช้จ่ายตามราคาในรายการ |
| Artificial Analysis | GDPval-AA, AA-Briefcase | การติดตั้งใช้งานเวอร์ชันก่อนเปิดตัว |
| Anthropic | Chartography | เกณฑ์มาตรฐานของ Surge AI, ให้คะแนนด้วย Gemini 3.5 Flash; คะแนนของ Sol ได้จาก Surge |
การสำรองข้อมูล (fallback) เกิดขึ้นในการทดลอง Terminal-Bench ของ Sonnet 5.5 1.5% แต่เกิดขึ้นกับ Opus 5.5 ถึง 10% (เอกสารระบบ §8.5) ดังนั้นโปรดพิจารณาความได้เปรียบ 4.2 คะแนนของ Sonnet อย่างรอบคอบ.
ข้อมูลเพิ่มเติมจากเอกสารระบบ
แถวที่หนึ่งถึงหกเป็นสรุปความพยายามสูงสุด (max-effort) จากเอกสารระบบ.
| เกณฑ์มาตรฐาน | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 81.3 | 63.2 | 89.9 |
| SWE-Bench Multilingual | 90.3 | 78.3 | 93.9 |
| SWE-Bench Multimodal | 54.3 | 28.1 | 61.4 |
| HLE, ไม่มีเครื่องมือ | 56.9 | 43.1 | 64.4 |
| HealthBench Professional | 69.2 | 57.8 | 65.6 |
| AutomationBench (การทดสอบของ Zapier) | 44.7 | 10.7 | 42.5 |
| DeepSWE v1.1 | 71.0% | n/r | n/r |
| Terminal-Bench-Science 0.1 | 59.9% | n/r | 58.7% |
| FrontierSWE v2 (การทดสอบของ Proximal) | 61.9% | n/r | 62.3% |
| ArXivMath (ไม่มีเครื่องมือ / มีเครื่องมือ) | 86.8% / 95.2% | n/r | 91.2% / 96.9% |
| ProgramBench (บริบทขนาดยาว) | 79.7% | 77.3% | 91.2% |
| OSWorld 2.1, ผ่านเกณฑ์อย่างเคร่งครัด | 43.5% | 25.6% | 48.7% |
| Toolathlon-Verified (Pass@1) | 77.8% | 74.7% | 77.8% |
| OfficeQA / OfficeQA Pro | 76.9% / 65.6% | 75.1% / 62.1% | 78.9% / 67.7% |
Sonnet 5.5 มีประสิทธิภาพดีกว่า Opus 5.5 เล็กน้อยใน HealthBench Professional, AutomationBench และ Terminal-Bench-Science; ในขณะที่ Opus มีคะแนนนำมากที่สุดใน ProgramBench, SWE-Bench Pro และ HLE แบบไม่มีเครื่องมือ. คะแนน 80.1% ของ OSWorld เป็นคะแนนบางส่วน (partial credit); มีเพียง 43.5% ของงานเท่านั้นที่ผ่านเกณฑ์โดยสมบูรณ์.
ระดับความพยายามที่เปลี่ยนภาพ
แผนภูมิเปิดตัว แสดงเป็นคะแนน (ค่าใช้จ่าย). ค่าใช้จ่ายของ Terminal-Bench คิดต่อครั้งที่พยายาม ส่วนอื่นๆ คิดต่อภารกิจ. แผนภูมิสองรายการแสดง GPT-5.6 Sol (*) เนื่องจากยังไม่มีการเผยแพร่ข้อมูลของ GPT-6 Sol.
| โมเดล | ต่ำ | ปานกลาง | สูง | Xhigh | สูงสุด |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | |||||
| Sonnet 5.5 | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Opus 5.5 | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| Sonnet 5 | 3.2% ($3.78) | 4.4% ($4.83) | 4.5% ($8.20) | 7.0% ($9.95) | 10.3% ($11.62) |
| GPT-5.6 Sol* | 7.9% ($1.46) | 20.9% ($2.69) | 26.1% ($4.12) | 28.5% ($5.39) | 37.3% ($7.89) |
| FrontierCode 1.1 หลัก | |||||
| Sonnet 5.5 | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| Opus 5.5 | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| Sonnet 5 | 28.7% ($2.39) | 35.2% ($3.81) | 39.4% ($6.10) | 42.7% ($10.07) | 42.4% ($17.12) |
| GPT-6 Sol | 37.3% ($0.43) | 45.9% ($0.77) | 47.7% ($1.04) | 48.4% ($1.32) | 49.3% ($2.07) |
| CursorBench 4.0 | |||||
| Sonnet 5.5 | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| Opus 5.5 | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| Sonnet 5 | 24.1% ($1.39) | 28.0% ($2.31) | 30.8% ($3.48) | 32.0% ($4.55) | 34.1% ($7.17) |
| GPT-5.6 Sol* | 24.6% ($0.87) | 31.1% ($1.77) | 35.7% ($2.85) | 37.7% ($4.40) | 41.7% ($8.23) |
| AA-Briefcase v1.1 (Elo) | |||||
| Sonnet 5.5 | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| Opus 5.5 | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
| Sonnet 5 | 923 ($0.82) | 1056 ($1.73) | 1177 ($3.76) | 1274 ($7.56) | 1359 ($14.43) |
| GPT-6 Sol | 905 ($0.12) | 1142 ($0.34) | 1289 ($0.63) | 1364 ($1.19) | 1483 ($2.67) |
- ประโยชน์ส่วนใหญ่จะเกิดขึ้นที่ระดับ xhigh. Max เพิ่ม 9.1 คะแนนบน Terminal-Bench ด้วยค่าใช้จ่าย 2.4 เท่า, และ 2.4 คะแนนบน CursorBench ด้วยค่าใช้จ่าย 2.5 เท่า.
- คะแนน FrontierCode ที่ระดับ max ต่ำกว่าและมีค่าใช้จ่ายมากกว่า xhigh ถึง 13 เท่า (46.2% ที่ $20.78 เทียบกับ 52.1% ที่ $1.59).
- Opus 5.5 ที่ระดับความพยายามต่ำคือคู่แข่งที่แท้จริง. บน Terminal-Bench, Opus ที่ระดับ medium ได้ 57.6% ด้วยค่าใช้จ่าย $2.94; Sonnet ที่ระดับ high ได้ 43.0% ด้วยค่าใช้จ่าย $1.94. Opus ที่ระดับ high (64.2%, $3.88) ชนะ Sonnet ที่ระดับ xhigh (61.5%, $5.30). ดู Sonnet 5.5 เทียบกับ Opus 5.5.
- ระดับ High คือจุดที่ Sonnet คุ้มค่าที่สุด. FrontierCode ที่ระดับ high: 49.4% ด้วยค่าใช้จ่าย $0.42 ซึ่งเทียบเท่ากับผลลัพธ์ที่ดีที่สุดของ GPT-6 Sol (49.3%) ด้วยค่าใช้จ่ายประมาณหนึ่งในห้า (รายละเอียดราคา).
ผลลัพธ์อิสระ
Artificial Analysis ให้คะแนน Sonnet 5.5 ที่ 56 บน Intelligence Index v4.3.2 เป็นอันดับ 3 จาก 216 รุ่น รองจาก Opus 5.5 ที่ระดับ max และ xhigh เท่านั้น. Sonnet 5 ได้คะแนน 38. ค่าใช้จ่ายในการดำเนินการดัชนี:
| ความพยายาม | คะแนนดัชนี | ค่าใช้จ่ายในการดำเนินการ |
|---|---|---|
| max | 55.98 | $8,977 |
| xhigh | 51.85 | $2,738 |
| high | 46.74 | $1,176 |
| medium | 40.74 | $701 |
| low | 35.84 | $544 |
ระดับ max มีค่าใช้จ่าย 7.6 เท่าของระดับ high เพื่อเพิ่มคะแนน 9.2 คะแนน. การตีความของ OfficeChai เกี่ยวกับ AA ระบุว่า Sonnet 5.5 ไม่ได้อยู่บนขอบเขต Pareto (Pareto frontier) และมีการแข่งขันด้านต้นทุนสูงสุดที่ระดับ high โดยมีการนับจำนวนโทเค็นเอาต์พุตประมาณ 193,000 โทเค็นต่องานดัชนีที่ระดับ max.
- การทดสอบ Terminal-Bench 4.0 ของ AA เอง: 63.6% เทียบกับ 70.6% ของ Anthropic.
- คะแนนที่ต่ำของ Sonnet 5 เป็นเรื่องจริง: AA วัดได้ 14.1% (ดู เกณฑ์มาตรฐาน Sonnet 5).
- AA-Omniscience (อ้างอิงจาก OfficeChai): ความแม่นยำ 54% และอัตราการหลอน (hallucination rate) 47% เทียบกับ 66% และ 59% สำหรับ Opus 5.5.
- ยังไม่ได้วัด: ความเร็วในการส่งออกและเวลาในการรับโทเค็นแรก ดังนั้นข้อกล่าวอ้างที่ว่า "เร็วกว่า 30%+" ยังคงเป็นของ Anthropic. ยังไม่มีรายการใน LMArena.
เกณฑ์มาตรฐานด้านความปลอดภัย
การฉีดพรอมต์ (Prompt injection) อ้างอิงจากเอกสารระบบ:
- Gray Swan: อัตราการโจมตีสำเร็จ 0.4%, 2.7% และ 3.4% ที่ k=1, 10 และ 15 (Sonnet 5: 0.7%, 5.1%, 6.7%). การใช้งานคอมพิวเตอร์ GUI อ่อนแอที่สุดที่ 12.5% (k=15).
- Shade, การเขียนโค้ด: 3.01% โดยไม่มีการป้องกัน ส่วนใหญ่เกิดจากการสำรองข้อมูลไซเบอร์ของ Sonnet 5; ตัว Sonnet 5.5 เองถูกโจมตีได้สำเร็จใน 4 จาก 5,901 คำขอ.
- การใช้งานเบราว์เซอร์: ไม่มีการโจมตีใดๆ สำเร็จใน 110 สถานการณ์.
การประเมินไซเบอร์ดำเนินการโดยปิดการป้องกัน: 46.1% บน CyScenarioBench (Sonnet 5: 0.7%, Opus 5.5: 67.6%). นี่คือ Sonnet รุ่นแรกที่มีการป้องกันไซเบอร์ และ Anthropic เตือนว่าอาจมีการปฏิเสธเพิ่มขึ้นแม้แต่งานด้านความปลอดภัยที่ไม่เป็นอันตราย. ดู คู่มือการฉีดพรอมต์ ของเรา.
ดำเนินการประเมินผลของคุณเอง
เกณฑ์มาตรฐานอาจไม่ตรงกับปริมาณงานของคุณ และ คู่มือการสร้างพรอมต์ ของ Anthropic ระบุว่าระดับความพยายามได้รับการปรับเทียบใหม่ ดังนั้นอย่าใช้การตั้งค่า Sonnet 5 ซ้ำ. ใน Apidog:
- เก็บ
ANTHROPIC_API_KEYเป็นตัวแปรสภาพแวดล้อม และบันทึกพรอมต์จริง 20 ถึง 50 รายการเป็นคำขอ Messages. - ยืนยันสถานะ 200,
stop_reasonที่ไม่ใช่"max_tokens"หรือ"refusal", และเนื้อหาที่คำตอบที่ถูกต้องต้องการ. - รันที่ระดับ
low,medium,highและxhigh, อย่างละหนึ่งรอบ; การเปลี่ยนระดับความพยายามจะทำให้แคชพรอมต์ไม่ถูกต้อง. - บันทึกอัตราการผ่านและจำนวนโทเค็นใน
usageโดยมีราคา $2 สำหรับอินพุตและ $10 สำหรับเอาต์พุตต่อล้าน.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 16000,
"output_config": {"effort": "high"},
"messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
}'
เลือกใช้ระดับความพยายามที่ต่ำที่สุดซึ่งคุณยอมรับอัตราการผ่านได้. ดู การทดสอบแอปพลิเคชัน LLM และ การทดสอบ API ของ AI agent, จากนั้น ดาวน์โหลด Apidog เพื่อสร้างคอลเล็กชัน.
คำถามที่พบบ่อย
Sonnet 5.5 เหนือกว่า Opus 5.5 หรือไม่? บน Terminal-Bench 4.0, HealthBench Professional, AutomationBench และ Terminal-Bench-Science และ Chartography พร้อมเครื่องมือ ใช่. Opus 5.5 นำหน้าหรือเสมอกับส่วนที่เหลือ.
คะแนน SWE-Bench ของ Sonnet 5.5 คือเท่าใด? 81.3 บน SWE-Bench Pro และ 90.3 บน Multilingual ที่ความพยายามสูงสุด.
เหตุใดจึงมีตัวเลข FrontierCode สองค่า? 46.2% คือระดับ max, 52.1% คือระดับ xhigh; การที่ subagent ของระดับ max ทำงานกระจายตัวเกินขอบเขตทำให้ถูกลงโทษ.
ฉันควรอัปเกรดจาก Sonnet 5 หรือไม่? ใช่ ในแง่ของเกณฑ์มาตรฐาน แต่ควรอ่านการเปลี่ยนแปลง API ที่สำคัญใน Sonnet 5.5 เทียบกับ Sonnet 5 ก่อน.
ขั้นตอนต่อไป
เริ่มต้นที่ระดับ high (หรือ medium สำหรับการเขียนโค้ดแบบ agentic ที่ระบุรายละเอียดชัดเจน) ตามที่ Anthropic แนะนำ และให้การประเมินของคุณใน Apidog เป็นตัวตัดสินว่าการเพิ่มระดับความพยายามนั้นคุ้มค่าหรือไม่.
