Claude Haiku 5.5 ผลการทดสอบประสิทธิภาพ

เกณฑ์มาตรฐานของ Claude Haiku 5.5: 72.4% OSWorld, 1620 GDPval-AA, 39.2% Terminal-Bench ด้วยความพยายามสูงสุด ใครเป็นผู้ทดสอบแต่ละรายการ ต้นทุนต่อความพยายาม และการประเมินผลของคุณเอง

Ashley Goolam

Ashley Goolam

8 October 2026

Claude Haiku 5.5 ผลการทดสอบประสิทธิภาพ

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

Claude Haiku 5.5 ได้คะแนน 72.4% ใน OSWorld 2.1, 1620 ใน GDPval-AA v2.1, 46.4% ใน FrontierCode 1.1 และ 39.2% ใน Terminal-Bench 4.0. Haiku 4.5 ได้คะแนน 15.7%, 735 และ 0.0% ในสามรายการดังกล่าว ทั้งหมดนี้เป็นตัวเลขที่ได้จากความพยายามสูงสุด (max-effort); หากใช้ความพยายามระดับ medium ตามค่าเริ่มต้น GDPval-AA จะลดลงเหลือ 1277 ยังไม่มีห้องปฏิบัติการอิสระใดเผยแพร่ผลการทดสอบ Haiku 5.5

ด้านล่างนี้คือ: ทุกเกณฑ์มาตรฐานของ Claude Haiku 5.5, ผู้ที่ดำเนินการทดสอบ, ผลลัพธ์คะแนนและค่าใช้จ่ายที่เปลี่ยนแปลงตามระดับความพยายาม, และวิธีทดสอบโมเดลกับทราฟฟิกของคุณเองใน Apidog สำหรับข้อมูลจำเพาะและราคา เริ่มต้นได้ที่ Claude Haiku 5.5 คืออะไร

ปุ่ม

ตารางการเปิดตัว

เซลล์ Haiku 5.5 ทุกรายการใช้การคิดแบบปรับตัว (adaptive thinking) ที่ความพยายามสูงสุด (max effort) โดยปกติจะเฉลี่ยจากห้าครั้งที่ลอง (Terminal-Bench ใช้สิบครั้งต่องาน) "n/r" หมายถึงไม่มีการเผยแพร่ผลลัพธ์

เกณฑ์มาตรฐาน Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, ชุดข้อมูลออฟไลน์ 72.4% 15.7% 48.9% 83.9%
การสอบครั้งสุดท้ายของมนุษยชาติ, ไม่มีเครื่องมือ 45.9% 10.2% n/r 56.9%
การสอบครั้งสุดท้ายของมนุษยชาติ, มีเครื่องมือ 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 (หลัก) 46.4% n/r 42.4% 52.1% (xhigh)
Chartography, ไม่มีเครื่องมือ 46.4% 6.4% 29.1% 61.6%

ใครเป็นผู้ดำเนินการเกณฑ์มาตรฐานแต่ละรายการ

Anthropic เป็นผู้ดำเนินการทดสอบส่วนใหญ่ด้วยตัวเอง แถวข้ามผู้จำหน่ายจะใช้ชื่อเกณฑ์มาตรฐานเดียวกัน แต่ไม่ได้หมายความว่าจะใช้ชุดทดสอบหรือการตั้งค่าความพยายามเหมือนกันเสมอไป

เกณฑ์มาตรฐาน ผู้ดำเนินการ เงื่อนไข
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, โดยอิสระ GDPval-AA: 220 งาน, 44 อาชีพ, Elo อิงกับ DeepSeek V4.1 Flash (สูงสุด) ที่ 1600; Briefcase: โปรเจกต์หลายสัปดาห์
FrontierCode 1.1 Cognition Claude ใน Claude Code, GPT ใน Codex; หลัก = 100 งานที่ยากที่สุดจาก 150 งาน
Chartography Anthropic, บนเกณฑ์มาตรฐานของ Surge AI ตัวประเมิน Gemini 3.5 Flash; คะแนน Luna จาก Surge AI
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 งาน, 10 ครั้งที่ลองในแต่ละงาน, เปิดระบบป้องกัน
OSWorld 2.1 Anthropic 82 จาก 108 งาน, 1080p, สูงสุด 500 ขั้นตอน
การสอบครั้งสุดท้ายของมนุษยชาติ Anthropic งบประมาณงาน 980K โทเค็น, ตัวประเมิน Opus 4.6

เซลล์ GPT-6 Luna สองรายการต้องการบริบท Anthropic ได้รันคะแนน OSWorld ของ Luna ผ่าน API ของ OpenAI ด้วย 82 งานเดียวกัน คะแนน Terminal-Bench ของ Luna ที่ 16.4% มาจากกระดานผู้นำสาธารณะ (Codex CLI, ความพยายามสูงสุด) ใน Terminal-Bench ระบบป้องกันได้หยุดการทดสอบ Haiku 5.5 จำนวน 1.8% (12 จาก 660 ครั้ง) และแต่ละครั้งถูกนับเป็นความล้มเหลว

กับดัก FrontierCode

ตารางการเปิดตัวแสดง Haiku 5.5 ที่ระดับสูงสุด (46.4%) เทียบกับ Sonnet 5.5 ที่ระดับ xhigh (52.1%) ซึ่งเป็นคะแนนที่ดีที่สุดของ Sonnet การ์ดระบบ (system card) ให้ตัวเลขที่เทียบเคียงกันได้:

FrontierCode 1.1 หลัก ขยาย
Haiku 5.5, สูงสุด 46.4% 58.4%
Haiku 5.5, xhigh 45.8% n/r
Sonnet 5.5, สูงสุด 46.2% 59.1%
Sonnet 5.5, xhigh 52.1% 64.4%

ที่ความพยายามสูงสุด (max effort), Haiku 5.5 เหนือกว่า Sonnet 5.5 ใน Main เล็กน้อยที่ 46.4% ต่อ 46.2% ที่การตั้งค่าที่ดีที่สุดของแต่ละโมเดล Sonnet นำอยู่ 5.7 จุด โปรดระบุระดับความพยายามที่คุณหมายถึงเมื่ออ้างอิงถึงโมเดลใดโมเดลหนึ่ง

ข้อมูลเสริมจากการ์ดระบบ

การ์ดระบบได้เพิ่มรายการที่โพสต์การเปิดตัวไม่ได้กล่าวถึง ทั้งหมดนี้เป็นผลลัพธ์ที่ความพยายามสูงสุด (max effort) เว้นแต่จะระบุเป็นอย่างอื่น

เกณฑ์มาตรฐาน Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench หลายภาษา 83.7 67.4 90.3
SWE-bench หลายรูปแบบ 30.7 19.8 54.3
OSWorld 2.1, อัตราผ่านที่เข้มงวด 37.1% n/r 48.8%
Chartography, มีเครื่องมือ 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Professional (ปรับตามความยาว) 64.8% 32.2% 69.2%

คะแนน 72.4% ของ OSWorld เป็นคะแนนบางส่วน (partial credit); มีเพียง 37.1% ของงานเท่านั้นที่ผ่านทั้งหมด Chartography เกือบสองเท่าเมื่อใช้เครื่องมือ (46.4% เป็น 86.2%) ดังนั้นควรให้เครื่องมือแก่ Haiku 5.5 สำหรับงานที่เกี่ยวข้องกับแผนภูมิ

คะแนนความพยายามเริ่มต้นต่ำกว่า

Haiku 5.5 มีค่าเริ่มต้นเป็น medium บน Claude API และใน Claude Code การ์ดระบบรายงานผลลัพธ์ความพยายามเริ่มต้นเหล่านี้:

เกณฑ์มาตรฐาน กลาง (ค่าเริ่มต้น) สูงสุด หมายเหตุ
GDPval-AA v2.1 1277 1620 ระดับกลางใช้โทเค็นเอาต์พุตประมาณหนึ่งในสิบของระดับสูงสุด
AA-Briefcase v1.1 1372 1578 ระดับกลางใช้โทเค็นเอาต์พุตน้อยกว่าหนึ่งในสี่ของระดับสูงสุด
HealthBench Professional 59.9% 64.8% ต่ำ 57.9%, สูง 61.3%

เรียกใช้ API โดยไม่มี output_config.effort และจะได้รับผลลัพธ์ในคอลัมน์ซ้ายมือ เอกสารความพยายาม ครอบคลุมทั้งห้าระดับ

คะแนนและค่าใช้จ่ายตามระดับความพยายาม

จากแผนภูมิการเปิดตัว แสดงเป็นคะแนน (ค่าใช้จ่าย) ค่าใช้จ่ายของ OSWorld และ Terminal-Bench คิดต่อครั้งที่ลอง; GDPval-AA คิดต่องาน

โมเดล ต่ำ กลาง สูง Xสูง สูงสุด
OSWorld 2.1
Haiku 5.5 42.0% ($0.07) 53.3% ($0.13) 61.3% ($0.18) 67.6% ($0.28) 72.4% ($0.61)
Sonnet 5.5 57.9% ($0.68) 66.0% ($0.93) 73.2% ($1.38) 81.1% ($2.22) 83.9% ($5.73)
GPT-6 Luna 19.2% ($0.04) 37.5% ($0.13) 42.3% ($0.14) 44.8% ($0.17) 48.9% ($0.21)
GDPval-AA v2.1
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Terminal-Bench 4.0
Haiku 5.5 12.7% ($0.42) 20.3% ($0.68) 24.8% ($1.04) 31.5% ($1.75) 39.2% ($2.64)
Sonnet 5.5 20.0% ($0.62) 28.8% ($0.68) 43.0% ($1.46) 61.5% ($4.34) 70.6% ($10.44)

ค่าใช้จ่ายใช้ราคาตามรายการ: $0.10/$0.50 ต่อล้านโทเค็นสำหรับพรอมต์สูงสุด 100K โทเค็น สูงกว่านั้นจะมีราคาแพงขึ้น (ดู รายละเอียดราคา)

จุดที่ Haiku 5.5 ยังตามหลัง

Sonnet 5.5 นำทุกแถวในตารางการเปิดตัว Haiku ชนะแบบตัวต่อตัวได้เพียงแค่ใน FrontierCode เมื่อเทียบที่ความพยายามสูงสุด ช่องว่างที่กว้างที่สุดคือ Terminal-Bench 4.0: 39.2% เทียบกับ 70.6% SWE-Bench Pro (64.8 เทียบกับ 81.3) และ SWE-bench Multimodal (30.7 เทียบกับ 54.3) แสดงรูปแบบเดียวกัน

Anthropic เห็นด้วยว่า: Sonnet 5.5 และ Opus 5.5 "ยังคงเป็นตัวเลือกที่ดีกว่าสำหรับงานการเขียนโค้ดที่ซับซ้อน" Haiku 5.5 เหมาะสำหรับงานที่มีขอบเขตแคบๆ: การย่อ, การสรุป, การจัดหมวดหมู่, การใช้งานเบราว์เซอร์ และการทำงานเป็น subagents ภายใต้โมเดลที่ใหญ่กว่า การรัน Haiku 5.5 เป็น subagent ราคาประหยัดสามารถดูได้ใน Haiku 5.5 ใน Claude Code

ผลลัพธ์อิสระ: ยังไม่มี

ณ วันที่ 8 ตุลาคม 2026 ยังไม่มีห้องปฏิบัติการอิสระใดเผยแพร่ผลการทดสอบ Haiku 5.5 หน้า Haiku 5.5 ของ Artificial Analysis แสดงข้อผิดพลาด 404 และ กระดานผู้นำ ของพวกเขาระบุเฉพาะ Claude 4.5 Haiku เท่านั้น Vals, LMArena, SWE-bench และ Aider ก็ยังไม่แสดงผลเช่นกัน ไม่มีตัวเลขความเร็วจากบุคคลที่สาม Anthropic เรียก Haiku 5.5 ว่าเป็น "โมเดลที่เร็วที่สุดในปัจจุบัน" ที่ความเร็วมาตรฐาน ซึ่งช้ากว่า Opus ในโหมด Fast

ตัวเลขภายนอกที่ใกล้เคียงที่สุดมาจาก Cursor เอกสารโมเดล ระบุว่า Haiku 5.5 "ได้คะแนน 48.4% บน CursorBench ที่ความพยายามสูงสุด" เพิ่มขึ้นจาก 30.9% ที่ระดับต่ำ เมื่อปิดการคิด (thinking off) Cursor รายงานว่าได้ 22.1% ถึง 26.2% ที่ระดับความพยายามเดียวกันกับที่เปิดการคิด (thinking on) ได้คะแนน 30.9% ถึง 42.3%

สิ่งที่ลูกค้ารายงาน

ข้อมูลเหล่านี้มาจากโพสต์การเปิดตัวของ Anthropic และยังไม่ได้รับการยืนยันโดยอิสระ:

ดำเนินการประเมินผลของคุณเอง

เกณฑ์มาตรฐานอาจไม่เหมือนกับทราฟฟิกของคุณ คู่มือการพร้อมท์ ของ Anthropic แนะนำให้ใช้ xhigh หรือ max เฉพาะในกรณีที่การประเมินของคุณแสดงให้เห็นถึงประโยชน์ และให้รันการประเมินเดียวกันบน Sonnet 5.5 เพื่อเปรียบเทียบ ใน Apidog:

  1. จัดเก็บ ANTHROPIC_API_KEY เป็นตัวแปรสภาพแวดล้อม และบันทึกพรอมต์จริง 20 ถึง 50 รายการเป็นคำขอ Messages
  2. เพิ่มการยืนยัน: สถานะ 200, stop_reason ที่ไม่ใช่ "max_tokens" หรือ "refusal", และเนื้อหาที่ต้องการคำตอบที่ถูกต้อง
  3. รันชุดข้อมูลที่ระดับ low, medium และ high การเปลี่ยนระดับความพยายามจะทำให้แคชพรอมต์ไม่ถูกต้อง
  4. บันทึกอัตราการผ่านและจำนวนโทเค็นใน usage ตัวเข้ารหัสโทเค็นใหม่สร้างโทเค็นมากกว่า Haiku 4.5 ประมาณ 30% สำหรับข้อความเดียวกัน
  5. ทำซ้ำคอลเลกชัน, เปลี่ยนเป็น claude-sonnet-5-5, และเปรียบเทียบทั้งสองโมเดลในโปรเจกต์เดียว
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
  }'

ห้ามส่ง temperature, top_p, top_k หรือ assistant prefill; แต่ละรายการจะส่งคืนข้อผิดพลาด 400 บน Haiku 5.5 เลือกบล็อกการตอบกลับด้วย type เนื่องจากบล็อก thinking อาจปรากฏขึ้นก่อน ดู คู่มือ API และ การทดสอบแอปพลิเคชัน LLM

คำถามที่พบบ่อย

ขั้นตอนต่อไป

เริ่มต้นที่ระดับ medium และเพิ่มระดับขึ้นเฉพาะเมื่ออัตราการผ่านที่คุณได้รับนั้นคุ้มค่า ดาวน์โหลด Apidog สร้างชุดการประเมินข้างต้น และเก็บผลลัพธ์ไว้ใน Apidog เทียบกับ Sonnet 5.5 baseline ของคุณ ก่อนที่คุณจะเปลี่ยนไปใช้กับทราฟฟิกการผลิต

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API