เกณฑ์มาตรฐาน Claude Sonnet 5.5: ผลลัพธ์จาก Anthropic, ผลลัพธ์อิสระ และบทวิเคราะห์

เกณฑ์มาตรฐานของ Claude Sonnet 5.5: 70.6% สำหรับ Terminal-Bench 4.0, 81.3% สำหรับ SWE-Bench Pro, ดัชนี AA ที่ 56 ใครเป็นผู้ทำการทดสอบแต่ละครั้ง, มีต้นทุนความพยายามเท่าใด, และวิธีการเรียกใช้การประเมินผลของคุณเอง

Medy Evrard

29 September 2026

เกณฑ์มาตรฐาน Claude Sonnet 5.5: ผลลัพธ์จาก Anthropic, ผลลัพธ์อิสระ และบทวิเคราะห์

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

Claude Sonnet 5.5 ได้คะแนน 70.6% บน Terminal-Bench 4.0, 55.5% บน CursorBench 4.0, 46.2% บน FrontierCode 1.1 ที่ความพยายามสูงสุด (52.1% ที่ xhigh) และ 81.3 บน SWE-Bench Pro ซึ่งเพิ่มขึ้นจาก Sonnet 5 ที่ได้ 10.3%, 34.1%, 42.4% และ 63.2. Opus 5.5 นำหน้าเกือบทุกแถวในตารางเปิดตัวประมาณ 2 ถึง 3 คะแนน แต่ตามหลังใน Terminal-Bench. Artificial Analysis ให้คะแนน Sonnet 5.5 ที่ 56 บน Intelligence Index โดยเป็นอันดับ 3 จาก 216 รุ่น

ด้านล่างนี้คือข้อมูลเกณฑ์มาตรฐาน Claude Sonnet 5.5 แบบเต็ม ผู้ที่ดำเนินการทดสอบ การเปลี่ยนแปลงระดับความพยายาม และวิธีการทดสอบโมเดลด้วยข้อมูลของคุณเองใน Apidog. สำหรับรายละเอียดทางเทคนิค ดู Claude Sonnet 5.5 คืออะไร.

ตารางเปิดตัว

โพสต์เปิดตัว ของ Anthropic เปรียบเทียบโมเดลสี่รุ่น ("n/r" หมายถึงขีดกลาง). ค่าในเซลล์ของ Sonnet 5.5 คือความพยายามสูงสุด (max effort) เว้นแต่จะระบุไว้เป็นอย่างอื่น; API จะตั้งค่าเริ่มต้นเป็น high, ส่วน Claude Code และแอปพลิเคชันจะตั้งค่าเป็น medium.

เกณฑ์มาตรฐาน Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ n/r
FrontierCode 1.1 (หลัก) 46.2% Max² / 52.1% Xhigh 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% n/r
GDPval-AA v2.1³ 1844 1449 1846 1487⁴
AA-Briefcase v1.1³ 1811 1359 1822 1483⁴
Humanity’s Last Exam (พร้อมเครื่องมือ) 64.5% 54.9% 67.7% n/r
OSWorld 2.1 (บางส่วน) 80.1% 57.0% 81.8% n/r
Chartography (ไม่มีเครื่องมือ) 61.6% 15.6% 64.4% 53.6%⁴

เชิงอรรถ อธิบายอย่างง่าย:

  1. คะแนน Terminal-Bench ของ Opus 5.5 อยู่ที่ระดับ xhigh ซึ่งเป็นผลงานที่ดีที่สุด; ที่ระดับ max ทำได้ 64.8%.
  2. FrontierCode มีการลงโทษสำหรับการแก้ไขที่เกินขอบเขต (out-of-scope). ที่ระดับ max, Sonnet 5.5 มักจะใช้ทักษะการรีวิวโค้ดของ Claude Code บ่อยครั้ง ซึ่งกระจายงานไปยัง subagent จำนวนมาก; ในสองกรณีที่ Cognition ตรวจสอบ พบว่าทำให้เกิดการหมดเวลา (timeout) หรือการแก้ไขที่เกินขอบเขต.
  3. Artificial Analysis ได้ทดสอบงานที่ต้องใช้ความรู้ทั้งสองรายการบนการติดตั้งใช้งานเวอร์ชันก่อนเปิดตัว ซึ่งมีข้อผิดพลาดเกี่ยวกับการส่งออกข้อมูลแบบมีโครงสร้าง (structured-output bug) ซึ่งได้รับการแก้ไขแล้ว. Anthropic คาดว่าจะมีผลกระทบเพียงเล็กน้อย หากมี จะเป็นการประเมินค่า Sonnet 5.5 ต่ำกว่าความเป็นจริง.
  4. OpenAI ได้แก้ไขข้อบกพร่องด้านการทำความเข้าใจรูปภาพของ GPT-6 Sol เมื่อเร็วๆ นี้ ซึ่งคะแนนจาก AA และ Surge AI อาจยังไม่ได้สะท้อนถึงการแก้ไขนี้.

ใครเป็นผู้ดำเนินการแต่ละเกณฑ์มาตรฐาน

Anthropic เป็นผู้ดำเนินการทดสอบทั้งหมดเอง เว้นแต่จะระบุชื่อบุคคลที่สาม. แถวที่มีผู้จำหน่ายหลายรายจะใช้ชื่อเกณฑ์มาตรฐานเดียวกัน ไม่ใช่เครื่องมือทดสอบหรือการตั้งค่าระดับความพยายามเดียวกัน.

ผู้ดำเนินการ เกณฑ์มาตรฐาน เงื่อนไข
Anthropic Terminal-Bench 4.0, HLE, OSWorld 2.1 TB: Claude Code --bare, 5 การทดลอง, เปิดใช้งานการป้องกัน. HLE: การค้นหาและการประมวลผลโค้ด. OSWorld: 108 งาน
Cognition FrontierCode 1.1 Claude ใน Claude Code, GPT ใน Codex CLI
Cursor CursorBench 4.0 เครื่องมือทดสอบสำหรับใช้งานจริงของ Cursor; Anthropic ประเมินค่าใช้จ่ายตามราคาในรายการ
Artificial Analysis GDPval-AA, AA-Briefcase การติดตั้งใช้งานเวอร์ชันก่อนเปิดตัว
Anthropic Chartography เกณฑ์มาตรฐานของ Surge AI, ให้คะแนนด้วย Gemini 3.5 Flash; คะแนนของ Sol ได้จาก Surge

การสำรองข้อมูล (fallback) เกิดขึ้นในการทดลอง Terminal-Bench ของ Sonnet 5.5 1.5% แต่เกิดขึ้นกับ Opus 5.5 ถึง 10% (เอกสารระบบ §8.5) ดังนั้นโปรดพิจารณาความได้เปรียบ 4.2 คะแนนของ Sonnet อย่างรอบคอบ.

ข้อมูลเพิ่มเติมจากเอกสารระบบ

แถวที่หนึ่งถึงหกเป็นสรุปความพยายามสูงสุด (max-effort) จากเอกสารระบบ.

เกณฑ์มาตรฐาน Sonnet 5.5 Sonnet 5 Opus 5.5
SWE-Bench Pro 81.3 63.2 89.9
SWE-Bench Multilingual 90.3 78.3 93.9
SWE-Bench Multimodal 54.3 28.1 61.4
HLE, ไม่มีเครื่องมือ 56.9 43.1 64.4
HealthBench Professional 69.2 57.8 65.6
AutomationBench (การทดสอบของ Zapier) 44.7 10.7 42.5
DeepSWE v1.1 71.0% n/r n/r
Terminal-Bench-Science 0.1 59.9% n/r 58.7%
FrontierSWE v2 (การทดสอบของ Proximal) 61.9% n/r 62.3%
ArXivMath (ไม่มีเครื่องมือ / มีเครื่องมือ) 86.8% / 95.2% n/r 91.2% / 96.9%
ProgramBench (บริบทขนาดยาว) 79.7% 77.3% 91.2%
OSWorld 2.1, ผ่านเกณฑ์อย่างเคร่งครัด 43.5% 25.6% 48.7%
Toolathlon-Verified (Pass@1) 77.8% 74.7% 77.8%
OfficeQA / OfficeQA Pro 76.9% / 65.6% 75.1% / 62.1% 78.9% / 67.7%

Sonnet 5.5 มีประสิทธิภาพดีกว่า Opus 5.5 เล็กน้อยใน HealthBench Professional, AutomationBench และ Terminal-Bench-Science; ในขณะที่ Opus มีคะแนนนำมากที่สุดใน ProgramBench, SWE-Bench Pro และ HLE แบบไม่มีเครื่องมือ. คะแนน 80.1% ของ OSWorld เป็นคะแนนบางส่วน (partial credit); มีเพียง 43.5% ของงานเท่านั้นที่ผ่านเกณฑ์โดยสมบูรณ์.

ระดับความพยายามที่เปลี่ยนภาพ

แผนภูมิเปิดตัว แสดงเป็นคะแนน (ค่าใช้จ่าย). ค่าใช้จ่ายของ Terminal-Bench คิดต่อครั้งที่พยายาม ส่วนอื่นๆ คิดต่อภารกิจ. แผนภูมิสองรายการแสดง GPT-5.6 Sol (*) เนื่องจากยังไม่มีการเผยแพร่ข้อมูลของ GPT-6 Sol.

โมเดล ต่ำ ปานกลาง สูง Xhigh สูงสุด
Terminal-Bench 4.0
Sonnet 5.5 20.0% ($0.76) 28.8% ($0.83) 43.0% ($1.94) 61.5% ($5.30) 70.6% ($12.54)
Opus 5.5 38.5% ($1.29) 57.6% ($2.94) 64.2% ($3.88) 66.4% ($7.35) 64.8% ($11.24)
Sonnet 5 3.2% ($3.78) 4.4% ($4.83) 4.5% ($8.20) 7.0% ($9.95) 10.3% ($11.62)
GPT-5.6 Sol* 7.9% ($1.46) 20.9% ($2.69) 26.1% ($4.12) 28.5% ($5.39) 37.3% ($7.89)
FrontierCode 1.1 หลัก
Sonnet 5.5 29.3% ($0.19) 36.5% ($0.24) 49.4% ($0.42) 52.1% ($1.59) 46.2% ($20.78)
Opus 5.5 47.3% ($0.40) 54.6% ($0.80) 54.0% ($1.09) 51.4% ($2.25) 54.4% ($6.19)
Sonnet 5 28.7% ($2.39) 35.2% ($3.81) 39.4% ($6.10) 42.7% ($10.07) 42.4% ($17.12)
GPT-6 Sol 37.3% ($0.43) 45.9% ($0.77) 47.7% ($1.04) 48.4% ($1.32) 49.3% ($2.07)
CursorBench 4.0
Sonnet 5.5 35.8% ($0.50) 39.2% ($0.70) 47.8% ($1.67) 53.1% ($3.88) 55.5% ($9.67)
Opus 5.5 43.7% ($1.17) 52.5% ($2.91) 56.0% ($3.97) 56.0% ($6.98) 57.8% ($13.43)
Sonnet 5 24.1% ($1.39) 28.0% ($2.31) 30.8% ($3.48) 32.0% ($4.55) 34.1% ($7.17)
GPT-5.6 Sol* 24.6% ($0.87) 31.1% ($1.77) 35.7% ($2.85) 37.7% ($4.40) 41.7% ($8.23)
AA-Briefcase v1.1 (Elo)
Sonnet 5.5 1264 ($0.87) 1461 ($1.64) 1634 ($3.95) 1746 ($9.63) 1811 ($29.19)
Opus 5.5 1285 ($1.15) 1642 ($4.40) 1705 ($6.27) 1780 ($12.27) 1822 ($21.05)
Sonnet 5 923 ($0.82) 1056 ($1.73) 1177 ($3.76) 1274 ($7.56) 1359 ($14.43)
GPT-6 Sol 905 ($0.12) 1142 ($0.34) 1289 ($0.63) 1364 ($1.19) 1483 ($2.67)

ผลลัพธ์อิสระ

Artificial Analysis ให้คะแนน Sonnet 5.5 ที่ 56 บน Intelligence Index v4.3.2 เป็นอันดับ 3 จาก 216 รุ่น รองจาก Opus 5.5 ที่ระดับ max และ xhigh เท่านั้น. Sonnet 5 ได้คะแนน 38. ค่าใช้จ่ายในการดำเนินการดัชนี:

ความพยายาม คะแนนดัชนี ค่าใช้จ่ายในการดำเนินการ
max 55.98 $8,977
xhigh 51.85 $2,738
high 46.74 $1,176
medium 40.74 $701
low 35.84 $544

ระดับ max มีค่าใช้จ่าย 7.6 เท่าของระดับ high เพื่อเพิ่มคะแนน 9.2 คะแนน. การตีความของ OfficeChai เกี่ยวกับ AA ระบุว่า Sonnet 5.5 ไม่ได้อยู่บนขอบเขต Pareto (Pareto frontier) และมีการแข่งขันด้านต้นทุนสูงสุดที่ระดับ high โดยมีการนับจำนวนโทเค็นเอาต์พุตประมาณ 193,000 โทเค็นต่องานดัชนีที่ระดับ max.

เกณฑ์มาตรฐานด้านความปลอดภัย

การฉีดพรอมต์ (Prompt injection) อ้างอิงจากเอกสารระบบ:

การประเมินไซเบอร์ดำเนินการโดยปิดการป้องกัน: 46.1% บน CyScenarioBench (Sonnet 5: 0.7%, Opus 5.5: 67.6%). นี่คือ Sonnet รุ่นแรกที่มีการป้องกันไซเบอร์ และ Anthropic เตือนว่าอาจมีการปฏิเสธเพิ่มขึ้นแม้แต่งานด้านความปลอดภัยที่ไม่เป็นอันตราย. ดู คู่มือการฉีดพรอมต์ ของเรา.

ดำเนินการประเมินผลของคุณเอง

เกณฑ์มาตรฐานอาจไม่ตรงกับปริมาณงานของคุณ และ คู่มือการสร้างพรอมต์ ของ Anthropic ระบุว่าระดับความพยายามได้รับการปรับเทียบใหม่ ดังนั้นอย่าใช้การตั้งค่า Sonnet 5 ซ้ำ. ใน Apidog:

  1. เก็บ ANTHROPIC_API_KEY เป็นตัวแปรสภาพแวดล้อม และบันทึกพรอมต์จริง 20 ถึง 50 รายการเป็นคำขอ Messages.
  2. ยืนยันสถานะ 200, stop_reason ที่ไม่ใช่ "max_tokens" หรือ "refusal", และเนื้อหาที่คำตอบที่ถูกต้องต้องการ.
  3. รันที่ระดับ low, medium, high และ xhigh, อย่างละหนึ่งรอบ; การเปลี่ยนระดับความพยายามจะทำให้แคชพรอมต์ไม่ถูกต้อง.
  4. บันทึกอัตราการผ่านและจำนวนโทเค็นใน usage โดยมีราคา $2 สำหรับอินพุตและ $10 สำหรับเอาต์พุตต่อล้าน.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 16000,
    "output_config": {"effort": "high"},
    "messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
  }'

เลือกใช้ระดับความพยายามที่ต่ำที่สุดซึ่งคุณยอมรับอัตราการผ่านได้. ดู การทดสอบแอปพลิเคชัน LLM และ การทดสอบ API ของ AI agent, จากนั้น ดาวน์โหลด Apidog เพื่อสร้างคอลเล็กชัน.

คำถามที่พบบ่อย

Sonnet 5.5 เหนือกว่า Opus 5.5 หรือไม่? บน Terminal-Bench 4.0, HealthBench Professional, AutomationBench และ Terminal-Bench-Science และ Chartography พร้อมเครื่องมือ ใช่. Opus 5.5 นำหน้าหรือเสมอกับส่วนที่เหลือ.

คะแนน SWE-Bench ของ Sonnet 5.5 คือเท่าใด? 81.3 บน SWE-Bench Pro และ 90.3 บน Multilingual ที่ความพยายามสูงสุด.

เหตุใดจึงมีตัวเลข FrontierCode สองค่า? 46.2% คือระดับ max, 52.1% คือระดับ xhigh; การที่ subagent ของระดับ max ทำงานกระจายตัวเกินขอบเขตทำให้ถูกลงโทษ.

ฉันควรอัปเกรดจาก Sonnet 5 หรือไม่? ใช่ ในแง่ของเกณฑ์มาตรฐาน แต่ควรอ่านการเปลี่ยนแปลง API ที่สำคัญใน Sonnet 5.5 เทียบกับ Sonnet 5 ก่อน.

ขั้นตอนต่อไป

เริ่มต้นที่ระดับ high (หรือ medium สำหรับการเขียนโค้ดแบบ agentic ที่ระบุรายละเอียดชัดเจน) ตามที่ Anthropic แนะนำ และให้การประเมินของคุณใน Apidog เป็นตัวตัดสินว่าการเพิ่มระดับความพยายามนั้นคุ้มค่าหรือไม่.

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API