Claude Haiku 5.5 Điểm chuẩn

Điểm chuẩn Claude Haiku 5.5: 72.4% OSWorld, 1620 GDPval-AA, 39.2% Terminal-Bench ở mức nỗ lực tối đa. Ai đã chạy từng bài kiểm tra, chi phí theo từng nỗ lực, và đánh giá của riêng bạn.

Ashley Goolam

Ashley Goolam

8 tháng 10 2026

Claude Haiku 5.5 Điểm chuẩn

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Claude Haiku 5.5 đạt 72.4% trên OSWorld 2.1, 1620 trên GDPval-AA v2.1, 46.4% trên FrontierCode 1.1 và 39.2% trên Terminal-Bench 4.0. Haiku 4.5 đạt 15.7%, 735 và 0.0% trên ba trong số đó. Tất cả đều là số liệu ở mức nỗ lực tối đa; ở mức nỗ lực `medium` mặc định, GDPval-AA giảm xuống 1277. Chưa có phòng thí nghiệm độc lập nào công bố kết quả của Haiku 5.5.

Dưới đây: mọi điểm chuẩn của Claude Haiku 5.5, ai đã thực hiện, cách nỗ lực ảnh hưởng đến điểm số và chi phí, và cách kiểm tra mô hình trên lưu lượng truy cập của riêng bạn trong Apidog. Để biết thông số kỹ thuật và giá cả, hãy bắt đầu với Claude Haiku 5.5 là gì.

nút

Bảng ra mắt

Mỗi ô Haiku 5.5 đều sử dụng tư duy thích ứng ở mức nỗ lực tối đa, thường được tính trung bình trên năm lần thử (Terminal-Bench sử dụng mười lần mỗi tác vụ). “n/r” nghĩa là không có kết quả nào được công bố.

Điểm chuẩn Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, tập con ngoại tuyến 72.4% 15.7% 48.9% 83.9%
Humanity’s Last Exam, không công cụ 45.9% 10.2% n/r 56.9%
Humanity’s Last Exam, có công cụ 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 (Chính) 46.4% n/r 42.4% 52.1% (xhigh)
Chartography, không công cụ 46.4% 6.4% 29.1% 61.6%

Ai đã thực hiện từng điểm chuẩn

Anthropic tự thực hiện hầu hết các bài kiểm tra. Các hàng đa nhà cung cấp chia sẻ tên điểm chuẩn, nhưng không phải lúc nào cũng cùng một khung thử nghiệm hoặc cài đặt nỗ lực.

Điểm chuẩn Ai đã thực hiện Điều kiện
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, độc lập GDPval-AA: 220 tác vụ, 44 nghề nghiệp, Elo được neo với DeepSeek V4.1 Flash (tối đa) ở mức 1600; Briefcase: các dự án nhiều tuần
FrontierCode 1.1 Cognition Claude trong Claude Code, GPT trong Codex; Chính = 100 tác vụ khó nhất trong số 150 tác vụ
Chartography Anthropic, trên điểm chuẩn của Surge AI Bộ chấm điểm Gemini 3.5 Flash; điểm Luna từ Surge AI
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 tác vụ, mỗi tác vụ 10 lần thử, các biện pháp bảo vệ được bật
OSWorld 2.1 Anthropic 82 trong số 108 tác vụ, 1080p, lên đến 500 bước
Humanity’s Last Exam Anthropic Ngân sách tác vụ 980K token, bộ chấm điểm Opus 4.6

Hai ô GPT-6 Luna cần thêm ngữ cảnh. Anthropic đã chạy điểm OSWorld của Luna thông qua API của OpenAI trên cùng 82 tác vụ. 16.4% của Terminal-Bench của Luna đến từ bảng xếp hạng công khai (Codex CLI, nỗ lực tối đa). Trên Terminal-Bench, các biện pháp bảo vệ đã dừng 1.8% số lần thử của Haiku 5.5 (12 trên 660), và mỗi lần bị dừng đều được tính là thất bại.

Cạm bẫy FrontierCode

Bảng ra mắt đặt Haiku 5.5 ở mức tối đa (46.4%) cạnh Sonnet 5.5 ở mức xhigh (52.1%), đây là điểm số tốt nhất của Sonnet. Thẻ hệ thống cung cấp các con số so sánh tương đương:

FrontierCode 1.1 Chính Mở rộng
Haiku 5.5, tối đa 46.4% 58.4%
Haiku 5.5, xhigh 45.8% n/r
Sonnet 5.5, tối đa 46.2% 59.1%
Sonnet 5.5, xhigh 52.1% 64.4%

Ở mức nỗ lực tối đa, Haiku 5.5 nhỉnh hơn Sonnet 5.5 trên Main, 46.4% so với 46.2%. Ở cài đặt tốt nhất của mỗi mô hình, Sonnet dẫn trước 5.7 điểm. Hãy nói rõ mức nỗ lực bạn muốn đề cập khi trích dẫn.

Thông tin bổ sung từ thẻ hệ thống

Thẻ hệ thống bổ sung các hàng mà bài đăng ra mắt đã bỏ qua. Tất cả đều ở mức nỗ lực tối đa trừ khi có ghi chú khác.

Điểm chuẩn Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench Đa ngôn ngữ 83.7 67.4 90.3
SWE-bench Đa phương thức 30.7 19.8 54.3
OSWorld 2.1, tỷ lệ đậu nghiêm ngặt 37.1% n/r 48.8%
Chartography, có công cụ 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Professional (điều chỉnh theo độ dài) 64.8% 32.2% 69.2%

72.4% của OSWorld là điểm một phần; chỉ có 37.1% tác vụ vượt qua hoàn toàn. Chartography gần như tăng gấp đôi với công cụ (46.4% lên 86.2%), vì vậy hãy cung cấp công cụ cho Haiku 5.5 để làm việc với biểu đồ.

Điểm số thấp hơn ở mức nỗ lực mặc định

Haiku 5.5 mặc định là medium trên Claude API và trong Claude Code. Thẻ hệ thống báo cáo các kết quả ở mức nỗ lực mặc định này:

Điểm chuẩn Trung bình (mặc định) Tối đa Lưu ý
GDPval-AA v2.1 1277 1620 Mức trung bình sử dụng khoảng một phần mười số token đầu ra của mức tối đa
AA-Briefcase v1.1 1372 1578 Mức trung bình sử dụng dưới một phần tư số token đầu ra của mức tối đa
HealthBench Professional 59.9% 64.8% Thấp 57.9%, cao 61.3%

Gọi API mà không có output_config.effort và bạn sẽ nhận được kết quả ở cột bên trái. Tài liệu về nỗ lực bao gồm tất cả năm cấp độ.

Điểm số và chi phí theo nỗ lực

Từ các biểu đồ ra mắt, theo điểm số (chi phí). Chi phí OSWorld và Terminal-Bench là mỗi lần thử; GDPval-AA là mỗi tác vụ.

Mô hình Thấp Trung bình Cao Xhigh Tối đa
OSWorld 2.1
Haiku 5.5 42.0% ($0.07) 53.3% ($0.13) 61.3% ($0.18) 67.6% ($0.28) 72.4% ($0.61)
Sonnet 5.5 57.9% ($0.68) 66.0% ($0.93) 73.2% ($1.38) 81.1% ($2.22) 83.9% ($5.73)
GPT-6 Luna 19.2% ($0.04) 37.5% ($0.13) 42.3% ($0.14) 44.8% ($0.17) 48.9% ($0.21)
GDPval-AA v2.1
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Terminal-Bench 4.0
Haiku 5.5 12.7% ($0.42) 20.3% ($0.68) 24.8% ($1.04) 31.5% ($1.75) 39.2% ($2.64)
Sonnet 5.5 20.0% ($0.62) 28.8% ($0.68) 43.0% ($1.46) 61.5% ($4.34) 70.6% ($10.44)

Chi phí sử dụng giá niêm yết: $0.10/$0.50 cho mỗi triệu token đối với các lời nhắc lên đến 100K token, cao hơn đối với các mức trên đó (xem phân tích giá).

Những điểm Haiku 5.5 vẫn còn kém hơn

Sonnet 5.5 dẫn đầu mọi hàng trong bảng ra mắt. Chiến thắng đối đầu duy nhất của Haiku là FrontierCode ở mức nỗ lực tối đa tương đương. Khoảng cách lớn nhất là Terminal-Bench 4.0: 39.2% so với 70.6%. SWE-Bench Pro (64.8 so với 81.3) và SWE-bench Đa phương thức (30.7 so với 54.3) cũng cho thấy mô hình tương tự.

Anthropic đồng ý: Sonnet 5.5 và Opus 5.5 “vẫn là lựa chọn tốt hơn cho các tác vụ mã hóa phức tạp có tính tác nhân.” Haiku 5.5 phù hợp với các công việc có phạm vi hẹp: nén, tóm tắt, phân loại, sử dụng trình duyệt và các tác nhân phụ dưới một mô hình lớn hơn. Việc chạy nó như một tác nhân phụ giá rẻ được đề cập trong Haiku 5.5 trong Claude Code.

Kết quả độc lập: chưa có

Tính đến ngày 8 tháng 10 năm 2026, chưa có phòng thí nghiệm độc lập nào công bố kết quả Haiku 5.5. Trang Haiku 5.5 của Artificial Analysis trả về lỗi 404, và bảng xếp hạng của họ chỉ liệt kê Claude 4.5 Haiku. Vals, LMArena, SWE-bench và Aider cũng không hiển thị gì. Không có số liệu tốc độ từ bên thứ ba; Anthropic gọi Haiku 5.5 là “mô hình nhanh nhất của họ cho đến nay” ở tốc độ tiêu chuẩn, chậm hơn Opus ở Chế độ Nhanh.

Con số bên ngoài gần nhất đến từ Cursor. Tài liệu mô hình của họ nói rằng Haiku 5.5 “đạt 48.4% trên CursorBench ở mức nỗ lực tối đa,” tăng từ 30.9% ở mức thấp. Khi tắt tính năng suy nghĩ, Cursor báo cáo 22.1% đến 26.2% ở cùng mức nỗ lực mà tính năng suy nghĩ đã đạt 30.9% đến 42.3%.

Những gì khách hàng báo cáo

Những điều này đến từ bài đăng ra mắt của Anthropic và chưa được xác minh độc lập:

Tự chạy đánh giá

Điểm chuẩn không giống với lưu lượng truy cập của bạn. Hướng dẫn tạo lời nhắc của Anthropic đề xuất chỉ sử dụng xhigh hoặc max khi các đánh giá của bạn cho thấy sự cải thiện, và chạy cùng các đánh giá đó trên Sonnet 5.5 để so sánh. Trong Apidog:

  1. Lưu ANTHROPIC_API_KEY làm biến môi trường và lưu 20 đến 50 lời nhắc thực tế dưới dạng yêu cầu tin nhắn.
  2. Thêm các xác nhận: trạng thái 200, một stop_reason khác ngoài "max_tokens" hoặc "refusal", và nội dung mà một câu trả lời đúng cần có.
  3. Chạy bộ ở mức low, medium và high. Việc thay đổi nỗ lực sẽ làm mất hiệu lực bộ nhớ cache lời nhắc.
  4. Ghi lại tỷ lệ đậu và số lượng token trong usage. Trình mã hóa token mới tạo ra nhiều hơn khoảng 30% token so với của Haiku 4.5 cho cùng một văn bản.
  5. Sao chép bộ sưu tập, thay thế bằng claude-sonnet-5-5, và so sánh cả hai mô hình trong một dự án.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
  }'

Không gửi temperature, top_p, top_k hoặc tiền điền sẵn của trợ lý; mỗi cái sẽ trả về lỗi 400 trên Haiku 5.5. Chọn các khối phản hồi theo type, vì một khối thinking có thể xuất hiện trước. Xem hướng dẫn API và kiểm thử các ứng dụng LLM.

Câu hỏi thường gặp

Bước tiếp theo

Bắt đầu ở mức medium và chỉ tăng lên khi lợi ích về tỷ lệ đậu bù đắp được chi phí. Tải xuống Apidog, xây dựng bộ sưu tập đánh giá như trên và giữ kết quả trong Apidog bên cạnh điểm chuẩn Sonnet 5.5 của bạn trước khi chuyển lưu lượng sản xuất.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API