Claude Haiku 5.5 ได้คะแนน 72.4% ใน OSWorld 2.1, 1620 ใน GDPval-AA v2.1, 46.4% ใน FrontierCode 1.1 และ 39.2% ใน Terminal-Bench 4.0. Haiku 4.5 ได้คะแนน 15.7%, 735 และ 0.0% ในสามรายการดังกล่าว ทั้งหมดนี้เป็นตัวเลขที่ได้จากความพยายามสูงสุด (max-effort); หากใช้ความพยายามระดับ medium ตามค่าเริ่มต้น GDPval-AA จะลดลงเหลือ 1277 ยังไม่มีห้องปฏิบัติการอิสระใดเผยแพร่ผลการทดสอบ Haiku 5.5
ด้านล่างนี้คือ: ทุกเกณฑ์มาตรฐานของ Claude Haiku 5.5, ผู้ที่ดำเนินการทดสอบ, ผลลัพธ์คะแนนและค่าใช้จ่ายที่เปลี่ยนแปลงตามระดับความพยายาม, และวิธีทดสอบโมเดลกับทราฟฟิกของคุณเองใน Apidog สำหรับข้อมูลจำเพาะและราคา เริ่มต้นได้ที่ Claude Haiku 5.5 คืออะไร
ปุ่ม
ตารางการเปิดตัว
เซลล์ Haiku 5.5 ทุกรายการใช้การคิดแบบปรับตัว (adaptive thinking) ที่ความพยายามสูงสุด (max effort) โดยปกติจะเฉลี่ยจากห้าครั้งที่ลอง (Terminal-Bench ใช้สิบครั้งต่องาน) "n/r" หมายถึงไม่มีการเผยแพร่ผลลัพธ์
| เกณฑ์มาตรฐาน | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, ชุดข้อมูลออฟไลน์ | 72.4% | 15.7% | 48.9% | 83.9% |
| การสอบครั้งสุดท้ายของมนุษยชาติ, ไม่มีเครื่องมือ | 45.9% | 10.2% | n/r | 56.9% |
| การสอบครั้งสุดท้ายของมนุษยชาติ, มีเครื่องมือ | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (หลัก) | 46.4% | n/r | 42.4% | 52.1% (xhigh) |
| Chartography, ไม่มีเครื่องมือ | 46.4% | 6.4% | 29.1% | 61.6% |
ใครเป็นผู้ดำเนินการเกณฑ์มาตรฐานแต่ละรายการ
Anthropic เป็นผู้ดำเนินการทดสอบส่วนใหญ่ด้วยตัวเอง แถวข้ามผู้จำหน่ายจะใช้ชื่อเกณฑ์มาตรฐานเดียวกัน แต่ไม่ได้หมายความว่าจะใช้ชุดทดสอบหรือการตั้งค่าความพยายามเหมือนกันเสมอไป
| เกณฑ์มาตรฐาน | ผู้ดำเนินการ | เงื่อนไข |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, โดยอิสระ | GDPval-AA: 220 งาน, 44 อาชีพ, Elo อิงกับ DeepSeek V4.1 Flash (สูงสุด) ที่ 1600; Briefcase: โปรเจกต์หลายสัปดาห์ |
| FrontierCode 1.1 | Cognition | Claude ใน Claude Code, GPT ใน Codex; หลัก = 100 งานที่ยากที่สุดจาก 150 งาน |
| Chartography | Anthropic, บนเกณฑ์มาตรฐานของ Surge AI | ตัวประเมิน Gemini 3.5 Flash; คะแนน Luna จาก Surge AI |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 งาน, 10 ครั้งที่ลองในแต่ละงาน, เปิดระบบป้องกัน |
| OSWorld 2.1 | Anthropic | 82 จาก 108 งาน, 1080p, สูงสุด 500 ขั้นตอน |
| การสอบครั้งสุดท้ายของมนุษยชาติ | Anthropic | งบประมาณงาน 980K โทเค็น, ตัวประเมิน Opus 4.6 |
เซลล์ GPT-6 Luna สองรายการต้องการบริบท Anthropic ได้รันคะแนน OSWorld ของ Luna ผ่าน API ของ OpenAI ด้วย 82 งานเดียวกัน คะแนน Terminal-Bench ของ Luna ที่ 16.4% มาจากกระดานผู้นำสาธารณะ (Codex CLI, ความพยายามสูงสุด) ใน Terminal-Bench ระบบป้องกันได้หยุดการทดสอบ Haiku 5.5 จำนวน 1.8% (12 จาก 660 ครั้ง) และแต่ละครั้งถูกนับเป็นความล้มเหลว
กับดัก FrontierCode
ตารางการเปิดตัวแสดง Haiku 5.5 ที่ระดับสูงสุด (46.4%) เทียบกับ Sonnet 5.5 ที่ระดับ xhigh (52.1%) ซึ่งเป็นคะแนนที่ดีที่สุดของ Sonnet การ์ดระบบ (system card) ให้ตัวเลขที่เทียบเคียงกันได้:
| FrontierCode 1.1 | หลัก | ขยาย |
|---|---|---|
| Haiku 5.5, สูงสุด | 46.4% | 58.4% |
| Haiku 5.5, xhigh | 45.8% | n/r |
| Sonnet 5.5, สูงสุด | 46.2% | 59.1% |
| Sonnet 5.5, xhigh | 52.1% | 64.4% |
ที่ความพยายามสูงสุด (max effort), Haiku 5.5 เหนือกว่า Sonnet 5.5 ใน Main เล็กน้อยที่ 46.4% ต่อ 46.2% ที่การตั้งค่าที่ดีที่สุดของแต่ละโมเดล Sonnet นำอยู่ 5.7 จุด โปรดระบุระดับความพยายามที่คุณหมายถึงเมื่ออ้างอิงถึงโมเดลใดโมเดลหนึ่ง
ข้อมูลเสริมจากการ์ดระบบ
การ์ดระบบได้เพิ่มรายการที่โพสต์การเปิดตัวไม่ได้กล่าวถึง ทั้งหมดนี้เป็นผลลัพธ์ที่ความพยายามสูงสุด (max effort) เว้นแต่จะระบุเป็นอย่างอื่น
| เกณฑ์มาตรฐาน | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-bench หลายภาษา | 83.7 | 67.4 | 90.3 |
| SWE-bench หลายรูปแบบ | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1, อัตราผ่านที่เข้มงวด | 37.1% | n/r | 48.8% |
| Chartography, มีเครื่องมือ | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench Professional (ปรับตามความยาว) | 64.8% | 32.2% | 69.2% |
คะแนน 72.4% ของ OSWorld เป็นคะแนนบางส่วน (partial credit); มีเพียง 37.1% ของงานเท่านั้นที่ผ่านทั้งหมด Chartography เกือบสองเท่าเมื่อใช้เครื่องมือ (46.4% เป็น 86.2%) ดังนั้นควรให้เครื่องมือแก่ Haiku 5.5 สำหรับงานที่เกี่ยวข้องกับแผนภูมิ
คะแนนความพยายามเริ่มต้นต่ำกว่า
Haiku 5.5 มีค่าเริ่มต้นเป็น medium บน Claude API และใน Claude Code การ์ดระบบรายงานผลลัพธ์ความพยายามเริ่มต้นเหล่านี้:
| เกณฑ์มาตรฐาน | กลาง (ค่าเริ่มต้น) | สูงสุด | หมายเหตุ |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | ระดับกลางใช้โทเค็นเอาต์พุตประมาณหนึ่งในสิบของระดับสูงสุด |
| AA-Briefcase v1.1 | 1372 | 1578 | ระดับกลางใช้โทเค็นเอาต์พุตน้อยกว่าหนึ่งในสี่ของระดับสูงสุด |
| HealthBench Professional | 59.9% | 64.8% | ต่ำ 57.9%, สูง 61.3% |
เรียกใช้ API โดยไม่มี output_config.effort และจะได้รับผลลัพธ์ในคอลัมน์ซ้ายมือ เอกสารความพยายาม ครอบคลุมทั้งห้าระดับ
คะแนนและค่าใช้จ่ายตามระดับความพยายาม
จากแผนภูมิการเปิดตัว แสดงเป็นคะแนน (ค่าใช้จ่าย) ค่าใช้จ่ายของ OSWorld และ Terminal-Bench คิดต่อครั้งที่ลอง; GDPval-AA คิดต่องาน
| โมเดล | ต่ำ | กลาง | สูง | Xสูง | สูงสุด |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42.0% ($0.07) | 53.3% ($0.13) | 61.3% ($0.18) | 67.6% ($0.28) | 72.4% ($0.61) |
| Sonnet 5.5 | 57.9% ($0.68) | 66.0% ($0.93) | 73.2% ($1.38) | 81.1% ($2.22) | 83.9% ($5.73) |
| GPT-6 Luna | 19.2% ($0.04) | 37.5% ($0.13) | 42.3% ($0.14) | 44.8% ($0.17) | 48.9% ($0.21) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12.7% ($0.42) | 20.3% ($0.68) | 24.8% ($1.04) | 31.5% ($1.75) | 39.2% ($2.64) |
| Sonnet 5.5 | 20.0% ($0.62) | 28.8% ($0.68) | 43.0% ($1.46) | 61.5% ($4.34) | 70.6% ($10.44) |
- ระดับสูงสุดมีราคาแพงสำหรับขั้นตอนสุดท้าย ใน GDPval-AA ระดับสูงสุดมีค่าใช้จ่ายประมาณ 28 เท่าของระดับกลางเพื่อเพิ่ม 343 Elo point ใน OSWorld ระดับสูงสุดมีค่าใช้จ่ายมากกว่าสองเท่าของระดับ xhigh เพื่อเพิ่ม 4.8 จุด
- Haiku 5.5 ที่ระดับกลางเอาชนะ Luna ที่ระดับสูงสุดใน OSWorld: 53.3% ด้วยราคา $0.13 เทียบกับ 48.9% ด้วยราคา $0.21 อย่างไรก็ตาม Luna มีราคาถูกกว่าในระดับที่ตรงกันอื่นๆ; ที่ระดับกลางทั้งสองมีค่าใช้จ่ายประมาณเท่ากัน ดู Haiku 5.5 เทียบกับ GPT-6 Luna
- Haiku 5.5 ที่ระดับสูงสุดเอาชนะ Sonnet 5.5 ที่ระดับกลางใน OSWorld (72.4% ด้วยราคา $0.61 เทียบกับ 66.0% ด้วยราคา $0.93)
- Terminal-Bench เป็นข้อยกเว้น Sonnet 5.5 ที่ระดับสูง (43.0%, $1.46) เอาชนะ Haiku 5.5 ที่ระดับสูงสุด (39.2%, $2.64) ด้วยค่าใช้จ่ายที่น้อยกว่า ค่าใช้จ่ายของ Sonnet ใช้ราคาอ่านแคชใหม่ที่ $0.10
ค่าใช้จ่ายใช้ราคาตามรายการ: $0.10/$0.50 ต่อล้านโทเค็นสำหรับพรอมต์สูงสุด 100K โทเค็น สูงกว่านั้นจะมีราคาแพงขึ้น (ดู รายละเอียดราคา)
จุดที่ Haiku 5.5 ยังตามหลัง
Sonnet 5.5 นำทุกแถวในตารางการเปิดตัว Haiku ชนะแบบตัวต่อตัวได้เพียงแค่ใน FrontierCode เมื่อเทียบที่ความพยายามสูงสุด ช่องว่างที่กว้างที่สุดคือ Terminal-Bench 4.0: 39.2% เทียบกับ 70.6% SWE-Bench Pro (64.8 เทียบกับ 81.3) และ SWE-bench Multimodal (30.7 เทียบกับ 54.3) แสดงรูปแบบเดียวกัน
Anthropic เห็นด้วยว่า: Sonnet 5.5 และ Opus 5.5 "ยังคงเป็นตัวเลือกที่ดีกว่าสำหรับงานการเขียนโค้ดที่ซับซ้อน" Haiku 5.5 เหมาะสำหรับงานที่มีขอบเขตแคบๆ: การย่อ, การสรุป, การจัดหมวดหมู่, การใช้งานเบราว์เซอร์ และการทำงานเป็น subagents ภายใต้โมเดลที่ใหญ่กว่า การรัน Haiku 5.5 เป็น subagent ราคาประหยัดสามารถดูได้ใน Haiku 5.5 ใน Claude Code
ผลลัพธ์อิสระ: ยังไม่มี
ณ วันที่ 8 ตุลาคม 2026 ยังไม่มีห้องปฏิบัติการอิสระใดเผยแพร่ผลการทดสอบ Haiku 5.5 หน้า Haiku 5.5 ของ Artificial Analysis แสดงข้อผิดพลาด 404 และ กระดานผู้นำ ของพวกเขาระบุเฉพาะ Claude 4.5 Haiku เท่านั้น Vals, LMArena, SWE-bench และ Aider ก็ยังไม่แสดงผลเช่นกัน ไม่มีตัวเลขความเร็วจากบุคคลที่สาม Anthropic เรียก Haiku 5.5 ว่าเป็น "โมเดลที่เร็วที่สุดในปัจจุบัน" ที่ความเร็วมาตรฐาน ซึ่งช้ากว่า Opus ในโหมด Fast
ตัวเลขภายนอกที่ใกล้เคียงที่สุดมาจาก Cursor เอกสารโมเดล ระบุว่า Haiku 5.5 "ได้คะแนน 48.4% บน CursorBench ที่ความพยายามสูงสุด" เพิ่มขึ้นจาก 30.9% ที่ระดับต่ำ เมื่อปิดการคิด (thinking off) Cursor รายงานว่าได้ 22.1% ถึง 26.2% ที่ระดับความพยายามเดียวกันกับที่เปิดการคิด (thinking on) ได้คะแนน 30.9% ถึง 42.3%
สิ่งที่ลูกค้ารายงาน
ข้อมูลเหล่านี้มาจากโพสต์การเปิดตัวของ Anthropic และยังไม่ได้รับการยืนยันโดยอิสระ:
- HubSpot: 92.8% โดยเฉลี่ยจากการรันสามครั้งบนชุดพอร์ทัล CRM จำลอง ซึ่งเป็นคะแนนที่ดีที่สุดที่เคยเห็นบนชุดนั้น
- AlphaSense: 0.84 เทียบกับ Haiku 4.5 ที่ 0.76 ใน 400 คำถาม "Ask in Document" ซึ่งถือว่ามีความสำคัญทางสถิติ
- Box: สูงกว่า Haiku 4.5 ถึง 11 จุด โดยมีความหน่วงประมาณครึ่งหนึ่ง ในการทดสอบเบื้องต้น
- Asana: ความหน่วงในการทำงานให้เสร็จสิ้นต่ำลงกว่า 30% เทียบกับโมเดลปัจจุบัน
- Cognition: Devin Fusion มีคะแนน FrontierCode ที่ 66.2 โดยมี Haiku 5.5 เป็นผู้ช่วยและ Opus 5.5 เป็นตัวนำ นี่คือระบบสองโมเดล ไม่ใช่ Haiku เพียงอย่างเดียว
ดำเนินการประเมินผลของคุณเอง
เกณฑ์มาตรฐานอาจไม่เหมือนกับทราฟฟิกของคุณ คู่มือการพร้อมท์ ของ Anthropic แนะนำให้ใช้ xhigh หรือ max เฉพาะในกรณีที่การประเมินของคุณแสดงให้เห็นถึงประโยชน์ และให้รันการประเมินเดียวกันบน Sonnet 5.5 เพื่อเปรียบเทียบ ใน Apidog:
- จัดเก็บ
ANTHROPIC_API_KEYเป็นตัวแปรสภาพแวดล้อม และบันทึกพรอมต์จริง 20 ถึง 50 รายการเป็นคำขอ Messages - เพิ่มการยืนยัน: สถานะ 200,
stop_reasonที่ไม่ใช่"max_tokens"หรือ"refusal", และเนื้อหาที่ต้องการคำตอบที่ถูกต้อง - รันชุดข้อมูลที่ระดับ
low,mediumและhighการเปลี่ยนระดับความพยายามจะทำให้แคชพรอมต์ไม่ถูกต้อง - บันทึกอัตราการผ่านและจำนวนโทเค็นใน
usageตัวเข้ารหัสโทเค็นใหม่สร้างโทเค็นมากกว่า Haiku 4.5 ประมาณ 30% สำหรับข้อความเดียวกัน - ทำซ้ำคอลเลกชัน, เปลี่ยนเป็น
claude-sonnet-5-5, และเปรียบเทียบทั้งสองโมเดลในโปรเจกต์เดียว
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
}'
ห้ามส่ง temperature, top_p, top_k หรือ assistant prefill; แต่ละรายการจะส่งคืนข้อผิดพลาด 400 บน Haiku 5.5 เลือกบล็อกการตอบกลับด้วย type เนื่องจากบล็อก thinking อาจปรากฏขึ้นก่อน ดู คู่มือ API และ การทดสอบแอปพลิเคชัน LLM
คำถามที่พบบ่อย
- Claude Haiku 5.5 ดีกว่า Sonnet 5.5 หรือไม่? ไม่ใช่จากตัวเลขของ Anthropic Sonnet 5.5 นำหน้าทุกแถวในตารางการเปิดตัว; Haiku เหนือกว่าเล็กน้อยใน FrontierCode เมื่อทั้งสองรันที่ระดับสูงสุด (46.4% เทียบกับ 46.2%) ดู Haiku 5.5 เทียบกับ Haiku 4.5 สำหรับมุมมองการอัปเกรด
- คะแนน SWE-bench ของ Haiku 5.5 คือเท่าไร? 64.8 ใน SWE-Bench Pro, 83.7 ใน SWE-bench Multilingual และ 30.7 ใน SWE-bench Multimodal ทั้งหมดที่ความพยายามสูงสุด
- เกณฑ์มาตรฐานถูกรันที่ระดับความพยายามเท่าไร? สูงสุด โดยปกติจะเฉลี่ยจากการลองห้าครั้ง ค่าเริ่มต้นของ API คือระดับกลาง ซึ่ง GDPval-AA ได้คะแนน 1277 แทนที่จะเป็น 1620
- มีเกณฑ์มาตรฐาน Haiku 5.5 ที่เป็นอิสระหรือไม่? ยังไม่มี Artificial Analysis ได้รัน GDPval-AA และ AA-Briefcase อย่างอิสระ แต่ Anthropic เป็นผู้เผยแพร่คะแนนเหล่านั้น; AA ไม่มีหน้า Haiku 5.5
- GPT-6 Luna ถูกกว่าหรือไม่? โดยปกติแล้ว Luna มีค่าใช้จ่ายน้อยกว่าในทุกระดับความพยายามของ GDPval-AA และทุกระดับของ OSWorld ยกเว้นระดับกลาง ซึ่งทั้งสองมีค่าใช้จ่ายประมาณเท่ากัน Haiku 5.5 ได้คะแนนสูงกว่าทั้งคู่
ขั้นตอนต่อไป
เริ่มต้นที่ระดับ medium และเพิ่มระดับขึ้นเฉพาะเมื่ออัตราการผ่านที่คุณได้รับนั้นคุ้มค่า ดาวน์โหลด Apidog สร้างชุดการประเมินข้างต้น และเก็บผลลัพธ์ไว้ใน Apidog เทียบกับ Sonnet 5.5 baseline ของคุณ ก่อนที่คุณจะเปลี่ยนไปใช้กับทราฟฟิกการผลิต
