Claude Haiku 5.5 đạt 72.4% trên OSWorld 2.1, 1620 trên GDPval-AA v2.1, 46.4% trên FrontierCode 1.1 và 39.2% trên Terminal-Bench 4.0. Haiku 4.5 đạt 15.7%, 735 và 0.0% trên ba trong số đó. Tất cả đều là số liệu ở mức nỗ lực tối đa; ở mức nỗ lực `medium` mặc định, GDPval-AA giảm xuống 1277. Chưa có phòng thí nghiệm độc lập nào công bố kết quả của Haiku 5.5.
Dưới đây: mọi điểm chuẩn của Claude Haiku 5.5, ai đã thực hiện, cách nỗ lực ảnh hưởng đến điểm số và chi phí, và cách kiểm tra mô hình trên lưu lượng truy cập của riêng bạn trong Apidog. Để biết thông số kỹ thuật và giá cả, hãy bắt đầu với Claude Haiku 5.5 là gì.
Bảng ra mắt
Mỗi ô Haiku 5.5 đều sử dụng tư duy thích ứng ở mức nỗ lực tối đa, thường được tính trung bình trên năm lần thử (Terminal-Bench sử dụng mười lần mỗi tác vụ). “n/r” nghĩa là không có kết quả nào được công bố.
| Điểm chuẩn | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, tập con ngoại tuyến | 72.4% | 15.7% | 48.9% | 83.9% |
| Humanity’s Last Exam, không công cụ | 45.9% | 10.2% | n/r | 56.9% |
| Humanity’s Last Exam, có công cụ | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (Chính) | 46.4% | n/r | 42.4% | 52.1% (xhigh) |
| Chartography, không công cụ | 46.4% | 6.4% | 29.1% | 61.6% |
Ai đã thực hiện từng điểm chuẩn
Anthropic tự thực hiện hầu hết các bài kiểm tra. Các hàng đa nhà cung cấp chia sẻ tên điểm chuẩn, nhưng không phải lúc nào cũng cùng một khung thử nghiệm hoặc cài đặt nỗ lực.
| Điểm chuẩn | Ai đã thực hiện | Điều kiện |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, độc lập | GDPval-AA: 220 tác vụ, 44 nghề nghiệp, Elo được neo với DeepSeek V4.1 Flash (tối đa) ở mức 1600; Briefcase: các dự án nhiều tuần |
| FrontierCode 1.1 | Cognition | Claude trong Claude Code, GPT trong Codex; Chính = 100 tác vụ khó nhất trong số 150 tác vụ |
| Chartography | Anthropic, trên điểm chuẩn của Surge AI | Bộ chấm điểm Gemini 3.5 Flash; điểm Luna từ Surge AI |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 tác vụ, mỗi tác vụ 10 lần thử, các biện pháp bảo vệ được bật |
| OSWorld 2.1 | Anthropic | 82 trong số 108 tác vụ, 1080p, lên đến 500 bước |
| Humanity’s Last Exam | Anthropic | Ngân sách tác vụ 980K token, bộ chấm điểm Opus 4.6 |
Hai ô GPT-6 Luna cần thêm ngữ cảnh. Anthropic đã chạy điểm OSWorld của Luna thông qua API của OpenAI trên cùng 82 tác vụ. 16.4% của Terminal-Bench của Luna đến từ bảng xếp hạng công khai (Codex CLI, nỗ lực tối đa). Trên Terminal-Bench, các biện pháp bảo vệ đã dừng 1.8% số lần thử của Haiku 5.5 (12 trên 660), và mỗi lần bị dừng đều được tính là thất bại.
Cạm bẫy FrontierCode
Bảng ra mắt đặt Haiku 5.5 ở mức tối đa (46.4%) cạnh Sonnet 5.5 ở mức xhigh (52.1%), đây là điểm số tốt nhất của Sonnet. Thẻ hệ thống cung cấp các con số so sánh tương đương:
| FrontierCode 1.1 | Chính | Mở rộng |
|---|---|---|
| Haiku 5.5, tối đa | 46.4% | 58.4% |
| Haiku 5.5, xhigh | 45.8% | n/r |
| Sonnet 5.5, tối đa | 46.2% | 59.1% |
| Sonnet 5.5, xhigh | 52.1% | 64.4% |
Ở mức nỗ lực tối đa, Haiku 5.5 nhỉnh hơn Sonnet 5.5 trên Main, 46.4% so với 46.2%. Ở cài đặt tốt nhất của mỗi mô hình, Sonnet dẫn trước 5.7 điểm. Hãy nói rõ mức nỗ lực bạn muốn đề cập khi trích dẫn.
Thông tin bổ sung từ thẻ hệ thống
Thẻ hệ thống bổ sung các hàng mà bài đăng ra mắt đã bỏ qua. Tất cả đều ở mức nỗ lực tối đa trừ khi có ghi chú khác.
| Điểm chuẩn | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-bench Đa ngôn ngữ | 83.7 | 67.4 | 90.3 |
| SWE-bench Đa phương thức | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1, tỷ lệ đậu nghiêm ngặt | 37.1% | n/r | 48.8% |
| Chartography, có công cụ | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench Professional (điều chỉnh theo độ dài) | 64.8% | 32.2% | 69.2% |
72.4% của OSWorld là điểm một phần; chỉ có 37.1% tác vụ vượt qua hoàn toàn. Chartography gần như tăng gấp đôi với công cụ (46.4% lên 86.2%), vì vậy hãy cung cấp công cụ cho Haiku 5.5 để làm việc với biểu đồ.
Điểm số thấp hơn ở mức nỗ lực mặc định
Haiku 5.5 mặc định là medium trên Claude API và trong Claude Code. Thẻ hệ thống báo cáo các kết quả ở mức nỗ lực mặc định này:
| Điểm chuẩn | Trung bình (mặc định) | Tối đa | Lưu ý |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | Mức trung bình sử dụng khoảng một phần mười số token đầu ra của mức tối đa |
| AA-Briefcase v1.1 | 1372 | 1578 | Mức trung bình sử dụng dưới một phần tư số token đầu ra của mức tối đa |
| HealthBench Professional | 59.9% | 64.8% | Thấp 57.9%, cao 61.3% |
Gọi API mà không có output_config.effort và bạn sẽ nhận được kết quả ở cột bên trái. Tài liệu về nỗ lực bao gồm tất cả năm cấp độ.
Điểm số và chi phí theo nỗ lực
Từ các biểu đồ ra mắt, theo điểm số (chi phí). Chi phí OSWorld và Terminal-Bench là mỗi lần thử; GDPval-AA là mỗi tác vụ.
| Mô hình | Thấp | Trung bình | Cao | Xhigh | Tối đa |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42.0% ($0.07) | 53.3% ($0.13) | 61.3% ($0.18) | 67.6% ($0.28) | 72.4% ($0.61) |
| Sonnet 5.5 | 57.9% ($0.68) | 66.0% ($0.93) | 73.2% ($1.38) | 81.1% ($2.22) | 83.9% ($5.73) |
| GPT-6 Luna | 19.2% ($0.04) | 37.5% ($0.13) | 42.3% ($0.14) | 44.8% ($0.17) | 48.9% ($0.21) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12.7% ($0.42) | 20.3% ($0.68) | 24.8% ($1.04) | 31.5% ($1.75) | 39.2% ($2.64) |
| Sonnet 5.5 | 20.0% ($0.62) | 28.8% ($0.68) | 43.0% ($1.46) | 61.5% ($4.34) | 70.6% ($10.44) |
- Mức tối đa đắt đỏ cho bước cuối cùng. Trên GDPval-AA, mức tối đa tốn gấp khoảng 28 lần mức trung bình để có thêm 343 điểm Elo. Trên OSWorld, mức tối đa tốn hơn gấp đôi mức xhigh để có 4.8 điểm.
- Haiku 5.5 ở mức trung bình đánh bại Luna ở mức tối đa trên OSWorld: 53.3% với $0.13 so với 48.9% với $0.21. Tuy nhiên, Luna rẻ hơn ở mọi cấp độ tương ứng khác; ở mức trung bình, hai mô hình có chi phí tương đương. Xem Haiku 5.5 so với GPT-6 Luna.
- Haiku 5.5 ở mức tối đa đánh bại Sonnet 5.5 ở mức trung bình trên OSWorld (72.4% với $0.61 so với 66.0% với $0.93).
- Terminal-Bench là trường hợp ngoại lệ. Sonnet 5.5 ở mức cao (43.0%, $1.46) đánh bại Haiku 5.5 ở mức tối đa (39.2%, $2.64) với chi phí thấp hơn. Chi phí của Sonnet sử dụng giá đọc bộ đệm mới $0.10.
Chi phí sử dụng giá niêm yết: $0.10/$0.50 cho mỗi triệu token đối với các lời nhắc lên đến 100K token, cao hơn đối với các mức trên đó (xem phân tích giá).
Những điểm Haiku 5.5 vẫn còn kém hơn
Sonnet 5.5 dẫn đầu mọi hàng trong bảng ra mắt. Chiến thắng đối đầu duy nhất của Haiku là FrontierCode ở mức nỗ lực tối đa tương đương. Khoảng cách lớn nhất là Terminal-Bench 4.0: 39.2% so với 70.6%. SWE-Bench Pro (64.8 so với 81.3) và SWE-bench Đa phương thức (30.7 so với 54.3) cũng cho thấy mô hình tương tự.
Anthropic đồng ý: Sonnet 5.5 và Opus 5.5 “vẫn là lựa chọn tốt hơn cho các tác vụ mã hóa phức tạp có tính tác nhân.” Haiku 5.5 phù hợp với các công việc có phạm vi hẹp: nén, tóm tắt, phân loại, sử dụng trình duyệt và các tác nhân phụ dưới một mô hình lớn hơn. Việc chạy nó như một tác nhân phụ giá rẻ được đề cập trong Haiku 5.5 trong Claude Code.
Kết quả độc lập: chưa có
Tính đến ngày 8 tháng 10 năm 2026, chưa có phòng thí nghiệm độc lập nào công bố kết quả Haiku 5.5. Trang Haiku 5.5 của Artificial Analysis trả về lỗi 404, và bảng xếp hạng của họ chỉ liệt kê Claude 4.5 Haiku. Vals, LMArena, SWE-bench và Aider cũng không hiển thị gì. Không có số liệu tốc độ từ bên thứ ba; Anthropic gọi Haiku 5.5 là “mô hình nhanh nhất của họ cho đến nay” ở tốc độ tiêu chuẩn, chậm hơn Opus ở Chế độ Nhanh.
Con số bên ngoài gần nhất đến từ Cursor. Tài liệu mô hình của họ nói rằng Haiku 5.5 “đạt 48.4% trên CursorBench ở mức nỗ lực tối đa,” tăng từ 30.9% ở mức thấp. Khi tắt tính năng suy nghĩ, Cursor báo cáo 22.1% đến 26.2% ở cùng mức nỗ lực mà tính năng suy nghĩ đã đạt 30.9% đến 42.3%.
Những gì khách hàng báo cáo
Những điều này đến từ bài đăng ra mắt của Anthropic và chưa được xác minh độc lập:
- HubSpot: 92.8% trung bình trên ba lần chạy trên bộ cổng CRM mô phỏng của họ, điểm số tốt nhất mà họ từng thấy trên bộ đó.
- AlphaSense: 0.84 so với 0.76 của Haiku 4.5 trên 400 truy vấn "Hỏi trong Tài liệu", mà họ gọi là có ý nghĩa thống kê.
- Box: Cao hơn 11 điểm so với Haiku 4.5 với độ trễ chỉ bằng khoảng một nửa, trong thử nghiệm ban đầu.
- Asana: độ trễ hoàn thành tác vụ thấp hơn hơn 30% so với mô hình hiện tại của họ.
- Cognition: Devin Fusion đạt điểm FrontierCode là 66.2 với Haiku 5.5 là trợ lý và Opus 5.5 là chính. Đó là một hệ thống hai mô hình, không phải chỉ Haiku.
Tự chạy đánh giá
Điểm chuẩn không giống với lưu lượng truy cập của bạn. Hướng dẫn tạo lời nhắc của Anthropic đề xuất chỉ sử dụng xhigh hoặc max khi các đánh giá của bạn cho thấy sự cải thiện, và chạy cùng các đánh giá đó trên Sonnet 5.5 để so sánh. Trong Apidog:
- Lưu
ANTHROPIC_API_KEYlàm biến môi trường và lưu 20 đến 50 lời nhắc thực tế dưới dạng yêu cầu tin nhắn. - Thêm các xác nhận: trạng thái 200, một
stop_reasonkhác ngoài"max_tokens"hoặc"refusal", và nội dung mà một câu trả lời đúng cần có. - Chạy bộ ở mức
low,mediumvàhigh. Việc thay đổi nỗ lực sẽ làm mất hiệu lực bộ nhớ cache lời nhắc. - Ghi lại tỷ lệ đậu và số lượng token trong
usage. Trình mã hóa token mới tạo ra nhiều hơn khoảng 30% token so với của Haiku 4.5 cho cùng một văn bản. - Sao chép bộ sưu tập, thay thế bằng
claude-sonnet-5-5, và so sánh cả hai mô hình trong một dự án.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
}'
Không gửi temperature, top_p, top_k hoặc tiền điền sẵn của trợ lý; mỗi cái sẽ trả về lỗi 400 trên Haiku 5.5. Chọn các khối phản hồi theo type, vì một khối thinking có thể xuất hiện trước. Xem hướng dẫn API và kiểm thử các ứng dụng LLM.
Câu hỏi thường gặp
- Claude Haiku 5.5 có tốt hơn Sonnet 5.5 không? Không theo số liệu của Anthropic. Sonnet 5.5 dẫn đầu mọi hàng trong bảng ra mắt; Haiku chỉ nhỉnh hơn ở FrontierCode khi cả hai chạy ở mức tối đa (46.4% so với 46.2%). Xem Haiku 5.5 so với Haiku 4.5 để biết về nâng cấp.
- Điểm SWE-bench của Haiku 5.5 là bao nhiêu? 64.8 trên SWE-Bench Pro, 83.7 trên SWE-bench Đa ngôn ngữ và 30.7 trên SWE-bench Đa phương thức, tất cả đều ở mức nỗ lực tối đa.
- Các điểm chuẩn được chạy ở mức nỗ lực nào? Tối đa, thường được tính trung bình trên năm lần thử. Mặc định của API là trung bình, nơi GDPval-AA đạt 1277 thay vì 1620.
- Có điểm chuẩn Haiku 5.5 độc lập nào không? Chưa có. Artificial Analysis đã chạy GDPval-AA và AA-Briefcase một cách độc lập, nhưng Anthropic đã công bố các điểm số đó; AA không có trang Haiku 5.5.
- GPT-6 Luna có rẻ hơn không? Thường thì có. Luna có chi phí thấp hơn ở mọi cấp độ nỗ lực của GDPval-AA và mọi cấp độ của OSWorld trừ mức trung bình, nơi cả hai có chi phí tương đương. Haiku 5.5 đạt điểm cao hơn trên cả hai.
Bước tiếp theo
Bắt đầu ở mức medium và chỉ tăng lên khi lợi ích về tỷ lệ đậu bù đắp được chi phí. Tải xuống Apidog, xây dựng bộ sưu tập đánh giá như trên và giữ kết quả trong Apidog bên cạnh điểm chuẩn Sonnet 5.5 của bạn trước khi chuyển lưu lượng sản xuất.
