Đánh giá hiệu năng Claude Sonnet 5.5: Dữ liệu Anthropic, kết quả độc lập và ý nghĩa

Điểm chuẩn Claude Sonnet 5.5: 70,6% Terminal-Bench 4.0, 81,3 SWE-Bench Pro, chỉ số AA 56. Ai đã chạy từng bài kiểm tra, chi phí công sức là bao nhiêu, cách tự chạy đánh giá của riêng bạn.

Medy Evrard

29 tháng 9 2026

Đánh giá hiệu năng Claude Sonnet 5.5: Dữ liệu Anthropic, kết quả độc lập và ý nghĩa

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Claude Sonnet 5.5 đạt 70.6% trên Terminal-Bench 4.0, 55.5% trên CursorBench 4.0, 46.2% trên FrontierCode 1.1 ở mức nỗ lực tối đa (52.1% ở mức rất cao) và 81.3 trên SWE-Bench Pro, tăng từ Sonnet 5’s 10.3%, 34.1%, 42.4% và 63.2. Opus 5.5 dẫn đầu hầu hết các hàng trong bảng ra mắt khoảng 2 đến 3 điểm nhưng lại bị tụt lại trên Terminal-Bench. Artificial Analysis độc lập chấm điểm Sonnet 5.5 là 56 trên Chỉ số Thông minh của mình, xếp thứ 3 trong số 216.

Dưới đây: các điểm chuẩn đầy đủ của Claude Sonnet 5.5, những người đã chạy chúng, những thay đổi về mức độ nỗ lực và cách kiểm tra mô hình trên lưu lượng truy cập của riêng bạn trong Apidog. Để biết thông số kỹ thuật, hãy xem Claude Sonnet 5.5 là gì.

Bảng ra mắt

Bài đăng ra mắt của Anthropic so sánh bốn mô hình (“n/r” đánh dấu dấu gạch ngang). Các ô của Sonnet 5.5 là mức nỗ lực tối đa trừ khi được đánh dấu; API mặc định là cao, Claude Code và các ứng dụng là trung bình.

Điểm chuẩn Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ không có dữ liệu
FrontierCode 1.1 (Chính) 46.2% Tối đa² / 52.1% Rất cao 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% không có dữ liệu
GDPval-AA v2.1³ 1844 1449 1846 1487⁴
AA-Briefcase v1.1³ 1811 1359 1822 1483⁴
Kỳ thi cuối cùng của nhân loại (có công cụ) 64.5% 54.9% 67.7% không có dữ liệu
OSWorld 2.1 (một phần) 80.1% 57.0% 81.8% không có dữ liệu
Chartography (không công cụ) 61.6% 15.6% 64.4% 53.6%⁴

Các chú thích, theo cách diễn đạt đơn giản:

  1. Điểm Terminal-Bench của Opus 5.5 ở mức rất cao (xhigh), là tốt nhất của nó; ở mức tối đa (max), nó đạt 64.8%.
  2. FrontierCode phạt các chỉnh sửa nằm ngoài phạm vi. Ở mức tối đa, Sonnet 5.5 thường xuyên chạy kỹ năng đánh giá mã của Claude Code, phân nhánh ra nhiều tác nhân phụ; trong hai trường hợp mà Cognition đã kiểm tra, điều đó đã gây ra lỗi hết thời gian hoặc các chỉnh sửa ngoài phạm vi.
  3. Artificial Analysis đã chạy cả hai thử nghiệm công việc tri thức trên một triển khai tiền phát hành có lỗi đầu ra có cấu trúc, đã được sửa. Anthropic dự kiến một ảnh hưởng nhỏ, nếu có thì sẽ đánh giá thấp Sonnet 5.5.
  4. OpenAI gần đây đã sửa lỗi hiểu hình ảnh của GPT-6 Sol mà điểm số của AA và Surge AI có thể chưa phản ánh.

Ai đã chạy từng điểm chuẩn

Anthropic đã tự chạy mọi thử nghiệm trừ khi có bên thứ ba được nêu tên. Các hàng của các nhà cung cấp khác nhau chia sẻ tên điểm chuẩn, không phải cài đặt harness hoặc nỗ lực.

Người chạy Điểm chuẩn Điều kiện
Anthropic Terminal-Bench 4.0, HLE, OSWorld 2.1 TB: Claude Code --bare, 5 lần thử, bảo vệ bật. HLE: tìm kiếm và thực thi mã. OSWorld: 108 tác vụ
Cognition FrontierCode 1.1 Claude trong Claude Code, GPT trong Codex CLI
Cursor CursorBench 4.0 Harness sản xuất của Cursor; Anthropic ước tính chi phí theo giá niêm yết
Artificial Analysis GDPval-AA, AA-Briefcase Triển khai tiền phát hành
Anthropic Chartography Điểm chuẩn của Surge AI, được chấm điểm bằng Gemini 3.5 Flash; điểm của Sol từ Surge

Tính năng dự phòng (fallback) đã chạm đến 1.5% số lần thử nghiệm Terminal-Bench của Sonnet 5.5 nhưng là 10% của Opus 5.5 (thẻ hệ thống §8.5), vì vậy hãy đọc kỹ lợi thế 4.2 điểm của Sonnet.

Các bổ sung thẻ hệ thống

Các hàng từ một đến sáu là tóm tắt nỗ lực tối đa của thẻ hệ thống.

Điểm chuẩn Sonnet 5.5 Sonnet 5 Opus 5.5
SWE-Bench Pro 81.3 63.2 89.9
SWE-Bench Đa ngôn ngữ 90.3 78.3 93.9
SWE-Bench Đa phương thức 54.3 28.1 61.4
HLE, không công cụ 56.9 43.1 64.4
HealthBench Chuyên nghiệp 69.2 57.8 65.6
AutomationBench (chạy bởi Zapier) 44.7 10.7 42.5
DeepSWE v1.1 71.0% không có dữ liệu không có dữ liệu
Terminal-Bench-Science 0.1 59.9% không có dữ liệu 58.7%
FrontierSWE v2 (chạy bởi Proximal) 61.9%không có dữ liệu62.3%
ArXivMath (không công cụ / có công cụ) 86.8% / 95.2% không có dữ liệu 91.2% / 96.9%
ProgramBench (ngữ cảnh dài) 79.7% 77.3% 91.2%
OSWorld 2.1, đạt chuẩn nghiêm ngặt 43.5% 25.6% 48.7%
Toolathlon-Verified (Pass@1) 77.8% 74.7% 77.8%
OfficeQA / OfficeQA Pro 76.9% / 65.6% 75.1% / 62.1% 78.9% / 67.7%

Sonnet 5.5 vượt Opus 5.5 trên HealthBench Professional, AutomationBench và Terminal-Bench-Science; Opus dẫn đầu rộng nhất trên ProgramBench, SWE-Bench Pro và HLE không có công cụ. Tỷ lệ 80.1% của OSWorld là điểm tín dụng một phần; chỉ 43.5% các tác vụ được thông qua hoàn toàn.

Mức độ nỗ lực thay đổi bức tranh

Các biểu đồ ra mắt, dưới dạng điểm số (chi phí). Chi phí Terminal-Bench tính trên mỗi lần thử, các loại khác tính trên mỗi tác vụ. Hai biểu đồ hiển thị GPT-5.6 Sol (*) vì số liệu của GPT-6 Sol chưa được công bố.

Mô hình Thấp Trung bình Cao Rất cao Tối đa
Terminal-Bench 4.0
Sonnet 5.5 20.0% ($0.76) 28.8% ($0.83) 43.0% ($1.94) 61.5% ($5.30) 70.6% ($12.54)
Opus 5.5 38.5% ($1.29) 57.6% ($2.94) 64.2% ($3.88) 66.4% ($7.35) 64.8% ($11.24)
Sonnet 5 3.2% ($3.78) 4.4% ($4.83) 4.5% ($8.20) 7.0% ($9.95) 10.3% ($11.62)
GPT-5.6 Sol* 7.9% ($1.46) 20.9% ($2.69) 26.1% ($4.12) 28.5% ($5.39) 37.3% ($7.89)
FrontierCode 1.1 Chính
Sonnet 5.5 29.3% ($0.19) 36.5% ($0.24) 49.4% ($0.42) 52.1% ($1.59) 46.2% ($20.78)
Opus 5.5 47.3% ($0.40) 54.6% ($0.80)54.0% ($1.09)51.4% ($2.25)54.4% ($6.19)
Sonnet 5 28.7% ($2.39) 35.2% ($3.81) 39.4% ($6.10) 42.7% ($10.07)42.4% ($17.12)
GPT-6 Sol 37.3% ($0.43) 45.9% ($0.77) 47.7% ($1.04)48.4% ($1.32)49.3% ($2.07)
CursorBench 4.0
Sonnet 5.5 35.8% ($0.50) 39.2% ($0.70) 47.8% ($1.67) 53.1% ($3.88) 55.5% ($9.67)
Opus 5.5 43.7% ($1.17) 52.5% ($2.91) 56.0% ($3.97) 56.0% ($6.98)57.8% ($13.43)
Sonnet 5 24.1% ($1.39) 28.0% ($2.31) 30.8% ($3.48) 32.0% ($4.55)34.1% ($7.17)
GPT-5.6 Sol* 24.6% ($0.87) 31.1% ($1.77)35.7% ($2.85)37.7% ($4.40)41.7% ($8.23)
AA-Briefcase v1.1 (Elo)
Sonnet 5.5 1264 ($0.87) 1461 ($1.64)1634 ($3.95)1746 ($9.63)1811 ($29.19)
Opus 5.5 1285 ($1.15) 1642 ($4.40)1705 ($6.27)1780 ($12.27)1822 ($21.05)
Sonnet 5 923 ($0.82) 1056 ($1.73)1177 ($3.76)1274 ($7.56)1359 ($14.43)
GPT-6 Sol 905 ($0.12) 1142 ($0.34)1289 ($0.63)1364 ($1.19)1483 ($2.67)

Kết quả độc lập

Artificial Analysis chấm điểm Sonnet 5.5 là 56 trên Chỉ số Thông minh v4.3.2, đứng thứ 3 trong số 216, chỉ sau Opus 5.5 ở mức tối đa (max) và rất cao (xhigh). Sonnet 5 đạt 38 điểm. Chi phí để chạy chỉ số:

Mức độ nỗ lực Điểm chỉ số Chi phí chạy
tối đa 55.98 $8,977
rất cao 51.85 $2,738
cao 46.74 $1,176
trung bình 40.74 $701
thấp 35.84 $544

Mức tối đa (max) có chi phí gấp 7.6 lần mức cao (high) để đạt thêm 9.2 điểm. Đánh giá của OfficeChai về AA cho thấy Sonnet 5.5 nằm ngoài đường cong Pareto, cạnh tranh nhất về chi phí ở mức cao, và tính khoảng 193,000 token đầu ra trên mỗi tác vụ chỉ số ở mức tối đa.

Điểm chuẩn an toàn

Tấn công chèn câu lệnh (prompt injection), theo thẻ hệ thống:

Các đánh giá an ninh mạng đã chạy khi tắt biện pháp bảo vệ: 46.1% trên CyScenarioBench (Sonnet 5: 0.7%, Opus 5.5: 67.6%). Đây là Sonnet đầu tiên có biện pháp bảo vệ an ninh mạng, và Anthropic cảnh báo về việc từ chối nhiều hơn ngay cả đối với các tác vụ bảo mật lành tính. Xem hướng dẫn tấn công chèn câu lệnh của chúng tôi.

Tự chạy đánh giá của riêng bạn

Các điểm chuẩn không giống với lưu lượng truy cập của bạn, và hướng dẫn nhắc lệnh của Anthropic nói rằng mức độ nỗ lực được hiệu chỉnh lại, vì vậy đừng tái sử dụng cài đặt của Sonnet 5. Trong Apidog:

  1. Lưu ANTHROPIC_API_KEY làm biến môi trường và lưu 20 đến 50 câu lệnh thực dưới dạng yêu cầu tin nhắn (Messages requests).
  2. Xác nhận trạng thái 200, một stop_reason khác ngoài "max_tokens" hoặc "refusal", và nội dung cần thiết cho một câu trả lời chính xác.
  3. Chạy ở các mức thấp (low), trung bình (medium), cao (high) và rất cao (xhigh), mỗi mức một lần; việc thay đổi mức độ nỗ lực sẽ làm mất hiệu lực bộ nhớ cache câu lệnh.
  4. Ghi lại tỷ lệ đạt và số lượng token trong usage, với giá 2 đô la đầu vào và 10 đô la đầu ra cho mỗi triệu.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 16000,
    "output_config": {"effort": "high"},
    "messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
  }'

Sử dụng mức nỗ lực thấp nhất mà bạn chấp nhận được tỷ lệ đạt. Xem kiểm thử ứng dụng LLM và kiểm thử API tác nhân AI, sau đó tải xuống Apidog để xây dựng bộ sưu tập.

Câu hỏi thường gặp

Sonnet 5.5 có đánh bại Opus 5.5 không? Trên Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science và Chartography có công cụ, thì có. Opus 5.5 dẫn đầu hoặc hòa ở các tiêu chí còn lại.

Điểm SWE-Bench của Sonnet 5.5 là bao nhiêu? 81.3 trên SWE-Bench Pro và 90.3 trên Đa ngôn ngữ, ở mức nỗ lực tối đa.

Tại sao có hai con số FrontierCode? 46.2% là mức tối đa (max), 52.1% là mức rất cao (xhigh); việc phân nhánh tác nhân phụ ở mức tối đa đã gây ra các hình phạt ngoài phạm vi.

Tôi có nên nâng cấp từ Sonnet 5 không? Có, dựa trên các điểm chuẩn, nhưng trước tiên hãy đọc các thay đổi API quan trọng trong Sonnet 5.5 so với Sonnet 5.

Bước tiếp theo

Hãy bắt đầu ở mức cao (hoặc trung bình đối với mã hóa tác nhân được chỉ định rõ ràng), theo gợi ý của Anthropic, và để đánh giá của bạn trong Apidog quyết định xem việc nâng cấp có đáng giá hay không.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API