Claude Sonnet 5.5 มีค่าใช้จ่าย $2/$10 ต่อล้านโทเค็นอินพุต/เอาต์พุต ซึ่งเป็นครึ่งหนึ่งของ Claude Opus 5.5 ที่มีราคา $4/$20 บนตารางการเปิดตัวของ Anthropic นั้น Sonnet 5.5 มีคะแนนใกล้เคียงกับ Opus 5.5 ในส่วนใหญ่ และทำได้ดีกว่าใน Terminal-Bench 4.0 (70.6% เทียบกับ 66.4%) อย่างไรก็ตาม Anthropic ระบุว่า Opus 5.5 "ยังคงแข็งแกร่งกว่าอย่างเห็นได้ชัดในงานที่ซับซ้อนและปลายเปิด" คำตัดสิน: สำหรับงานที่มีขอบเขตชัดเจนและปริมาณมาก รวมถึง subagents ให้ใช้ Sonnet 5.5 ที่ความพยายามระดับต่ำถึงสูง จ่ายเงินสำหรับ Opus 5.5 สำหรับงานที่ยาวและปลายเปิด หรือเมื่อใดก็ตามที่คุณจะผลักดัน Sonnet ไปที่ xhigh หรือ max เนื่องจาก Opus ที่ระดับ medium หรือ high มักจะให้คะแนนสูงกว่าด้วยค่าใช้จ่ายที่ใกล้เคียงกันหรือน้อยกว่า
สำหรับแต่ละโมเดล สามารถดูรายละเอียดได้ที่ Claude Sonnet 5.5 คืออะไร และ Claude Opus 5.5 คืออะไร ส่วนสุดท้ายแสดงวิธีการทดสอบทั้งสองโมเดลด้วยพรอมต์ของคุณเองใน Apidog
ข้อมูลจำเพาะและราคาเปรียบเทียบกัน
| Sonnet 5.5 | Opus 5.5 | |
|---|---|---|
| API model ID | claude-sonnet-5-5 |
claude-opus-5-5 |
| อินพุต / เอาต์พุต, ต่อ 1M โทเค็น | $2 / $10 | $4 / $20 |
| การเขียนแคช (5 นาที) | $2.50 | $5 |
| การอ่านแคช | $0.20 | $0.20 |
| โหมดเร็ว | ไม่พร้อมใช้งาน | $8 / $40 |
| ความพยายามเริ่มต้นบน API | high |
medium |
| การคิด | ปรับเปลี่ยนได้โดยค่าเริ่มต้น, หรือ between_tools |
ปรับเปลี่ยนได้, เปิดใช้งานตลอด |
| บริบท / เอาต์พุตสูงสุด | 1M / 128K | 1M / 128K |
| ระดับความหน่วง | เร็ว | ปานกลาง |
สามแถวที่สำคัญที่สุด:
- การอ่านแคชมีค่าใช้จ่ายเท่ากัน ดังนั้นในลูปของเอเจนต์ที่ใช้แคชมาก ช่องว่างส่วนใหญ่อยู่ที่เอาต์พุตและการเขียนแคช ราคาของ Claude Sonnet 5.5 มีการคำนวณไว้ ไม่มีโมเดลใดเรียกเก็บค่าพรีเมียมสำหรับบริบทที่ยาว
- ความพยายามเริ่มต้นต่างกัน การทดสอบการตั้งค่าเริ่มต้นทำให้ Sonnet อยู่ที่
highเทียบกับ Opus ที่mediumซึ่งเป็นการจับคู่ที่ Opus มักจะชนะ - โหมดเร็วมีเฉพาะใน Opus เท่านั้น (เอกสาร) Anthropic ระบุว่า Sonnet 5.5 สร้างเอาต์พุตได้เร็วกว่า Sonnet 5 ถึง 30%+
เกณฑ์มาตรฐาน: ใกล้เคียงกันบนตารางเปิดตัว กว้างขึ้นบนการ์ดระบบ
แถวที่หนึ่งถึงแปดคือ ตารางการเปิดตัว ของ Anthropic ส่วนที่เหลือมาจากการ์ดระบบ Cognition รัน FrontierCode, Cursor รัน CursorBench, Zapier รัน AutomationBench และ Artificial Analysis (AA) รัน GDPval-AA และ AA-Briefcase ส่วน Anthropic รันอื่นๆ Sonnet ใช้ความพยายามสูงสุด เว้นแต่จะระบุไว้เป็นอย่างอื่น
| เกณฑ์มาตรฐาน | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 66.4% (xhigh) |
| FrontierCode 1.1 Main | 46.2% max, 52.1% xhigh | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 (Elo) | 1844 | 1846 |
| AA-Briefcase v1.1 (Elo) | 1811 | 1822 |
| HLE, พร้อมเครื่องมือ | 64.5% | 67.7% |
| OSWorld 2.1, บางส่วน | 80.1% | 81.8% |
| Chartography, ไม่มีเครื่องมือ | 61.6% | 64.4% |
| SWE-Bench Pro | 81.3 | 89.9 |
| SWE-Bench Multimodal | 54.3 | 61.4 |
| HLE, ไม่มีเครื่องมือ | 56.9 | 64.4 |
| OSWorld 2.1, ผ่านอย่างเข้มงวด | 43.5% | 48.7% |
| ProgramBench, บริบทแบบยาว | 79.7% | 91.2% |
| Terminal-Bench-Science 0.1 | 59.9% | 58.7% |
| AutomationBench | 44.7 | 42.5 |
| HealthBench Professional | 69.2 | 65.6 |
ตารางการเปิดตัวเป็นการตัดที่ดูดี: นอกเหนือจาก Terminal-Bench แล้ว Opus นำหน้า Sonnet ในแถวเปอร์เซ็นต์ 1.7 ถึง 3.2 จุด โดยนับรวมคะแนน FrontierCode xhigh ของ Sonnet แถวระบบการ์ดห้าแถวขยายช่องว่างเป็น 5.2 ถึง 11.5 จุด: SWE-Bench Pro, SWE-Bench Multimodal, HLE โดยไม่มีเครื่องมือ, OSWorld แบบเข้มงวด และ ProgramBench บริบทแบบยาว งานที่ยาว ไม่ต้องช่วยเหลือ และงานทั้งโปรเจกต์คือจุดที่ Opus ยังคงนำหน้า
อ่านชัยชนะของ Terminal-Bench 4.0 ด้วยความระมัดระวัง: ส่วนที่ 8.5 ของการ์ดระบบระบุว่าการสำรองข้อมูลความปลอดภัยมีผลต่อ 10% ของการทดลอง Opus เทียบกับ 1.5% ของ Sonnet และการรันของ AA เองให้คะแนน Sonnet 5.5 ที่ 63.6% รายละเอียดเพิ่มเติมใน เกณฑ์มาตรฐาน Claude Sonnet 5.5
ความพยายามตัดสินการจับคู่
ตารางการเปิดตัวเปรียบเทียบแต่ละโมเดลที่การตั้งค่าที่ดีที่สุด แต่บิลของคุณไม่ได้เป็นเช่นนั้น หน้าเปิดตัวของ Anthropic แสดงระดับความพยายามทุกระดับพร้อมค่าใช้จ่ายต่อความพยายามหรืองาน:
| เกณฑ์มาตรฐาน, โมเดล | ต่ำ | ปานกลาง | สูง | สูงมาก | สูงสุด |
|---|---|---|---|---|---|
| Terminal-Bench, Sonnet | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Terminal-Bench, Opus | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| CursorBench, Sonnet | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| CursorBench, Opus | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| FrontierCode, Sonnet | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| FrontierCode, Opus | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| AA-Briefcase, Sonnet | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| AA-Briefcase, Opus | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
สิ่งที่แสดงให้เห็น:
- Opus ที่ระดับปานกลางมักจะชนะ Sonnet ที่ระดับสูง Terminal-Bench 4.0: Opus ได้คะแนน 57.6% ด้วยค่าใช้จ่าย $2.94 ต่อความพยายาม Sonnet ได้ 43.0% ด้วยค่าใช้จ่าย $1.94
- Opus ที่ต่ำกว่าระดับสูงสุดสามารถเอาชนะ Sonnet ที่ดีที่สุดได้ด้วยค่าใช้จ่ายที่น้อยกว่า CursorBench: Opus ที่ระดับสูง (56.0%, $3.97) เทียบกับ Sonnet ที่ระดับสูงสุด (55.5%, $9.67) FrontierCode: Opus ที่ระดับปานกลาง (54.6%, $0.80) เทียบกับ Sonnet ที่ดีที่สุด (52.1%, $1.59)
- Sonnet ที่ระดับสูงสุดอาจมีค่าใช้จ่ายมากกว่า Opus ที่ระดับสูงสุด: $29.19 เทียบกับ $21.05 ใน AA-Briefcase สำหรับคะแนนที่ต่ำกว่า ใน FrontierCode คะแนนสูงสุดของ Sonnet ต่ำกว่าคะแนน xhigh เนื่องจากมีการกระจาย subagents สำหรับการตรวจสอบ Anthropic ระบุในเชิงอรรถ
- Sonnet ครองส่วนล่างของเส้นโค้ง การตั้งค่าต่ำของ Sonnet มีราคาถูกกว่าจุดที่ถูกที่สุดของ Opus ในทุกแผนภูมิ
ราคาโทเค็นครึ่งหนึ่งไม่ได้หมายถึงค่าใช้จ่ายต่อภารกิจครึ่งหนึ่ง: Sonnet ใช้โทเค็นมากขึ้นเมื่อระดับความพยายามเพิ่มขึ้น ข้อมูล AA ตามที่ OfficeChai รายงาน ระบุว่า Sonnet 5.5 ใช้โทเค็นเอาต์พุตประมาณ 193,000 โทเค็นต่องานดัชนีที่ระดับสูงสุด ซึ่งมากกว่า Opus 5.5 ประมาณ 60%
นั่นคือประเด็นหลักในการถกเถียงใน เธรด Hacker News: ผู้แสดงความคิดเห็นหลายคนอ่านแผนภูมิว่า Opus ที่ระดับความพยายามต่ำกว่าสามารถเทียบเท่าหรือมีราคาถูกกว่า Sonnet ที่ระดับสูงหรือ xhigh ทำให้ Sonnet มีบทบาทในงานที่มีความพยายามต่ำถึงปานกลาง และเป็น subagent ภายใต้ orchestrator ของ Opus
คู่มือการพรอมต์ ของ Anthropic ระบุว่าความพยายามของ Sonnet 5.5 ได้รับการปรับเทียบใหม่: เริ่มต้นที่ high (medium สำหรับการเขียนโค้ดที่ระบุคุณสมบัติชัดเจน) และเก็บ xhigh และ max ไว้สำหรับผลลัพธ์ที่วัดได้ การเปลี่ยนระดับความพยายามสูงสุดระหว่างคำขอจะทำให้พรอมต์แคชไม่ถูกต้อง ดังนั้นให้ตั้งค่าตามปริมาณงาน (คู่มือ API)
ความแตกต่างด้านความปลอดภัยและพฤติกรรม
ผลการฉีดพรอมต์มีความแตกต่างกัน ในเกณฑ์มาตรฐานการฉีดพรอมต์ทางอ้อมของ Gray Swan อัตราความสำเร็จของการโจมตีของ Sonnet 5.5 อยู่ที่ 3.4% ใน 15 ครั้ง (Sonnet 5: 6.7%): ต้านทานได้น้อยกว่า Opus 5.5 แต่มากกว่าโมเดลที่ไม่ใช่ Claude ทุกโมเดลที่ทดสอบ อ่อนแอที่สุดในการใช้งานคอมพิวเตอร์แบบ GUI (12.5%) ในการต่อต้านผู้โจมตีแบบปรับตัวของ Shade Sonnet ชนะ Opus ในการเขียนโค้ด (3.01% เทียบกับ 54.61% โดยไม่มีการป้องกัน, 2.63% เทียบกับ 11.13% เมื่อมีการตรวจสอบ) และเสมอกันในการใช้งานคอมพิวเตอร์ (0.07%); ในการใช้งานเบราว์เซอร์ เป็นโมเดลแรกที่ Anthropic ประเมินโดยไม่มีการโจมตีสำเร็จ ดู Opus 5.5 และการฉีดพรอมต์
ทั้งสองโมเดลมีการป้องกันทางไซเบอร์ Sonnet 5.5 เป็น Sonnet รุ่นแรกที่มีการป้องกันดังกล่าว งานทางไซเบอร์ที่มีความเสี่ยงสูงที่ถูกตั้งค่าสถานะจะกลับไปใช้ Sonnet 5 โดยอัตโนมัติในแอปของ Anthropic และบน API ก็ต่อเมื่อคุณเลือกเข้าร่วม (fallbacks: "default", เบต้า) การ์ดระบบเตือนถึงการปฏิเสธที่มากขึ้นแม้ในงานความปลอดภัยที่ไม่เป็นอันตราย
การ์ดระบบยังพบว่า Sonnet 5.5 มีความซื่อสัตย์ภายใต้แรงกดดันมากกว่า Opus 5.5 แต่มีแนวโน้มที่จะหลงผิด (hallucination) มากกว่า
การผสมผสาน Sonnet 5.5 และ Opus 5.5 ในระบบเดียว
วิธีหนึ่งในการใช้ทั้งสอง: Opus วางแผน, Sonnet ดำเนินการ มีกลไกสำคัญสามประการ
บล็อกการคิดไม่ข้ามกัน Sonnet 5.5 ละทิ้งบล็อกการคิดของ Opus 5 และ Opus 5.5 (ไม่เรียกเก็บเงิน; คำขอยังคงส่งคืน 200) และบล็อกจะผูกติดกับโมเดล การสนทนา และบัญชี การสลับโมเดลระหว่างการสนทนาจะทำให้เหตุผลหายไป ดังนั้นให้ส่งต่อสถานะผ่านข้อความ: Opus เขียนแผนเป็นข้อความ Sonnet เริ่มต้นจากข้อความนั้น (คู่มือการย้ายข้อมูล)
เครื่องมือที่ปรึกษายอมรับ Opus 5.5 เป็นที่ปรึกษาสำหรับ Sonnet 5.5 ที่เป็นผู้ดำเนินการ; คำแนะนำจะถูกส่งคืนในรูปแบบที่เข้ารหัสเป็น advisor_redacted_result
Claude Code มี opusplan: Opus ในโหมดวางแผน, Sonnet สำหรับการดำเนินการ นามแฝง sonnet หมายถึง Sonnet 5.5 บน Anthropic API เท่านั้น (v2.1.284 หรือใหม่กว่า) ดังนั้นบน Bedrock, Google Cloud และ Foundry opusplan จะดำเนินการบน Sonnet เวอร์ชันเก่า ดู Claude Sonnet 5.5 ใน Claude Code
GPT-6 Sol อยู่ตรงไหน
GPT-6 Sol มีราคาเริ่มต้นเท่ากับ Sonnet 5.5 ที่ $2/$10 โดยมีค่าใช้จ่ายในการอ่านแคช $0.20 (ลด 90%) และหน้าต่างบริบท 872k ตารางของ Anthropic ให้ Sol สี่เซลล์: FrontierCode 49.3%, GDPval-AA 1487, AA-Briefcase 1483 และ Chartography 53.6% โดยไม่มีเครื่องมือ เชิงอรรถระบุว่า OpenAI เพิ่งแก้ไขข้อบกพร่องในการทำความเข้าใจรูปภาพของ Sol ซึ่งคะแนน AA และ Surge AI อาจยังไม่สะท้อนผล
ค่าใช้จ่ายต่องานจะผกผันตามเกณฑ์มาตรฐาน ใน AA-Briefcase ที่ระดับสูงสุด Sol มีค่าใช้จ่าย $2.67 ต่องาน เทียบกับ Sonnet ที่ $29.19 โดยทำคะแนนได้ 1483 เทียบกับ 1811 ใน FrontierCode Sonnet ที่ระดับสูงเทียบเท่ากับคะแนนที่ดีที่สุดของ Sol (49.4% เทียบกับ 49.3%) ด้วยค่าใช้จ่าย $0.42 เทียบกับ $2.07 ดู GPT-6 Sol เทียบกับ Claude Opus 5.5 และ GPT-6 Sol คืออะไร
โมเดลใดเหมาะสมกับภาระงานแบบไหน
| ภาระงาน | โมเดลและระดับความพยายาม |
|---|---|
| แชทปริมาณมาก, การจัดหมวดหมู่, การดึงข้อมูล | Sonnet 5.5, low หรือ medium |
| การแก้ไขข้อบกพร่องที่มีขอบเขตชัดเจน, การเปลี่ยนแปลงขนาด PR | Sonnet 5.5, medium หรือ high |
| Subagents ที่รันแผนของ Opus | Sonnet 5.5, medium หรือ high |
| งานเอเจนต์ปลายเปิดที่ยาวนาน | Opus 5.5, medium แล้ว high |
อะไรก็ตามที่ต้องการ Sonnet ที่ xhigh หรือ max |
Opus 5.5, medium หรือ high |
| การใช้เหตุผลในโค้ดเบสบริบทแบบยาว | Opus 5.5, medium หรือสูงกว่า |
| เอเจนต์ที่อ่านเนื้อหาที่ไม่น่าเชื่อถือ | ได้ทั้งคู่; ทดสอบกรณีการฉีดของคุณเอง |
ทดสอบทั้งสองบนทราฟฟิกของคุณเอง
แผนภูมิทั้งหมดข้างต้นมาจากชุดเครื่องมือของคนอื่น ไม่ใช่พรอมต์ เครื่องมือ หรือการผสมโทเค็นของคุณ เริ่มต้นด้วยการจับคู่ที่ข้อมูลระบุ:
ask() {
curl -s https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"'"$1"'","max_tokens":16000,
"output_config":{"effort":"'"$2"'"},
"messages":[{"role":"user","content":"Review this diff and list each bug as JSON: ..."}]}' \
| jq '{model, stop_reason, usage}'
}
ask claude-sonnet-5-5 high
ask claude-opus-5-5 medium
ใน Apidog ทำให้สามารถทำซ้ำได้: หนึ่งคำขอไปยัง https://api.anthropic.com/v1/messages, ANTHROPIC_API_KEY เป็นตัวแปรสภาพแวดล้อม และ {{model}} กับ {{effort}} ในเนื้อหา ทำซ้ำสำหรับการจับคู่แต่ละครั้งและเพิ่มตัวประมวลผลภายหลังเพื่อให้ทุกการรันตรวจสอบสิ่งเดียวกัน:
const body = pm.response.json();
pm.test("finished cleanly", () => {
pm.expect(body.stop_reason).to.not.be.oneOf(["max_tokens", "refusal"]);
});
pm.test("stays inside the token budget", () => {
pm.expect(body.usage.output_tokens).to.be.below(8000);
});
รันแต่ละคู่ 10 ถึง 20 ครั้งและเปรียบเทียบ usage, เวลาตอบสนอง และอัตราการผ่าน; จำนวนโทเค็นคูณราคาเริ่มต้นคือค่าใช้จ่ายจริงของคุณต่องาน ดูเพิ่มเติมใน วิธีการทดสอบแอปพลิเคชัน LLM
คำถามที่พบบ่อย
Claude Sonnet 5.5 ดีกว่า Opus 5.5 หรือไม่? ไม่ใช่ในส่วนใหญ่ Opus 5.5 นำในตารางการเปิดตัวยกเว้น Terminal-Bench 4.0 และ GDPval-AA ที่ใกล้เคียงกัน การจับคู่ของรุ่นก่อน: Claude Opus 5 เทียบกับ Sonnet 5
Sonnet 5.5 มีค่าใช้จ่ายครึ่งหนึ่งของ Opus 5.5 หรือไม่? ต่อโทเค็น ใช่ ต่องานขึ้นอยู่กับความพยายาม: ที่ระดับสูงสุด Sonnet มีค่าใช้จ่ายมากกว่าใน AA-Briefcase ($29.19 เทียบกับ $21.05)
ฉันสามารถสลับโมเดลระหว่างการสนทนาได้หรือไม่? ได้ แต่ Sonnet 5.5 จะละทิ้งบล็อกการคิดของ Opus 5.5 ดังนั้นให้ส่งต่อสถานะเป็นข้อความ
Sonnet 5.5 หรือ GPT-6 Sol ที่ราคา $2/$10? Sonnet นำในสี่แถวที่ใช้ร่วมกันด้วยการตั้งค่าที่ดีที่สุด; Sol อาจมีราคาถูกกว่ามากต่องาน ทดสอบทั้งสอง
ขั้นตอนต่อไป
รันพรอมต์ที่แพงที่สุดสองรายการของคุณผ่าน Sonnet 5.5 ที่ high และ Opus 5.5 ที่ medium แล้วเปรียบเทียบอัตราการผ่านและค่าใช้จ่ายต่องานก่อนที่คุณจะเปลี่ยนกฎการกำหนดเส้นทาง หากต้องการเก็บคำขอ การยืนยัน และผลลัพธ์ไว้ในโปรเจกต์เดียว ดาวน์โหลด Apidog
