Claude Sonnet 5.5 đạt 70.6% trên Terminal-Bench 4.0, 55.5% trên CursorBench 4.0, 46.2% trên FrontierCode 1.1 ở mức nỗ lực tối đa (52.1% ở mức rất cao) và 81.3 trên SWE-Bench Pro, tăng từ Sonnet 5’s 10.3%, 34.1%, 42.4% và 63.2. Opus 5.5 dẫn đầu hầu hết các hàng trong bảng ra mắt khoảng 2 đến 3 điểm nhưng lại bị tụt lại trên Terminal-Bench. Artificial Analysis độc lập chấm điểm Sonnet 5.5 là 56 trên Chỉ số Thông minh của mình, xếp thứ 3 trong số 216.
Dưới đây: các điểm chuẩn đầy đủ của Claude Sonnet 5.5, những người đã chạy chúng, những thay đổi về mức độ nỗ lực và cách kiểm tra mô hình trên lưu lượng truy cập của riêng bạn trong Apidog. Để biết thông số kỹ thuật, hãy xem Claude Sonnet 5.5 là gì.
Bảng ra mắt
Bài đăng ra mắt của Anthropic so sánh bốn mô hình (“n/r” đánh dấu dấu gạch ngang). Các ô của Sonnet 5.5 là mức nỗ lực tối đa trừ khi được đánh dấu; API mặc định là cao, Claude Code và các ứng dụng là trung bình.
| Điểm chuẩn | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | không có dữ liệu |
| FrontierCode 1.1 (Chính) | 46.2% Tối đa² / 52.1% Rất cao | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | không có dữ liệu |
| GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487⁴ |
| AA-Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483⁴ |
| Kỳ thi cuối cùng của nhân loại (có công cụ) | 64.5% | 54.9% | 67.7% | không có dữ liệu |
| OSWorld 2.1 (một phần) | 80.1% | 57.0% | 81.8% | không có dữ liệu |
| Chartography (không công cụ) | 61.6% | 15.6% | 64.4% | 53.6%⁴ |
Các chú thích, theo cách diễn đạt đơn giản:
- Điểm Terminal-Bench của Opus 5.5 ở mức rất cao (xhigh), là tốt nhất của nó; ở mức tối đa (max), nó đạt 64.8%.
- FrontierCode phạt các chỉnh sửa nằm ngoài phạm vi. Ở mức tối đa, Sonnet 5.5 thường xuyên chạy kỹ năng đánh giá mã của Claude Code, phân nhánh ra nhiều tác nhân phụ; trong hai trường hợp mà Cognition đã kiểm tra, điều đó đã gây ra lỗi hết thời gian hoặc các chỉnh sửa ngoài phạm vi.
- Artificial Analysis đã chạy cả hai thử nghiệm công việc tri thức trên một triển khai tiền phát hành có lỗi đầu ra có cấu trúc, đã được sửa. Anthropic dự kiến một ảnh hưởng nhỏ, nếu có thì sẽ đánh giá thấp Sonnet 5.5.
- OpenAI gần đây đã sửa lỗi hiểu hình ảnh của GPT-6 Sol mà điểm số của AA và Surge AI có thể chưa phản ánh.
Ai đã chạy từng điểm chuẩn
Anthropic đã tự chạy mọi thử nghiệm trừ khi có bên thứ ba được nêu tên. Các hàng của các nhà cung cấp khác nhau chia sẻ tên điểm chuẩn, không phải cài đặt harness hoặc nỗ lực.
| Người chạy | Điểm chuẩn | Điều kiện |
|---|---|---|
| Anthropic | Terminal-Bench 4.0, HLE, OSWorld 2.1 | TB: Claude Code --bare, 5 lần thử, bảo vệ bật. HLE: tìm kiếm và thực thi mã. OSWorld: 108 tác vụ |
| Cognition | FrontierCode 1.1 | Claude trong Claude Code, GPT trong Codex CLI |
| Cursor | CursorBench 4.0 | Harness sản xuất của Cursor; Anthropic ước tính chi phí theo giá niêm yết |
| Artificial Analysis | GDPval-AA, AA-Briefcase | Triển khai tiền phát hành |
| Anthropic | Chartography | Điểm chuẩn của Surge AI, được chấm điểm bằng Gemini 3.5 Flash; điểm của Sol từ Surge |
Tính năng dự phòng (fallback) đã chạm đến 1.5% số lần thử nghiệm Terminal-Bench của Sonnet 5.5 nhưng là 10% của Opus 5.5 (thẻ hệ thống §8.5), vì vậy hãy đọc kỹ lợi thế 4.2 điểm của Sonnet.
Các bổ sung thẻ hệ thống
Các hàng từ một đến sáu là tóm tắt nỗ lực tối đa của thẻ hệ thống.
| Điểm chuẩn | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 81.3 | 63.2 | 89.9 |
| SWE-Bench Đa ngôn ngữ | 90.3 | 78.3 | 93.9 |
| SWE-Bench Đa phương thức | 54.3 | 28.1 | 61.4 |
| HLE, không công cụ | 56.9 | 43.1 | 64.4 |
| HealthBench Chuyên nghiệp | 69.2 | 57.8 | 65.6 |
| AutomationBench (chạy bởi Zapier) | 44.7 | 10.7 | 42.5 |
| DeepSWE v1.1 | 71.0% | không có dữ liệu | không có dữ liệu |
| Terminal-Bench-Science 0.1 | 59.9% | không có dữ liệu | 58.7% |
| FrontierSWE v2 (chạy bởi Proximal) | 61.9% | không có dữ liệu | 62.3% |
| ArXivMath (không công cụ / có công cụ) | 86.8% / 95.2% | không có dữ liệu | 91.2% / 96.9% |
| ProgramBench (ngữ cảnh dài) | 79.7% | 77.3% | 91.2% |
| OSWorld 2.1, đạt chuẩn nghiêm ngặt | 43.5% | 25.6% | 48.7% |
| Toolathlon-Verified (Pass@1) | 77.8% | 74.7% | 77.8% |
| OfficeQA / OfficeQA Pro | 76.9% / 65.6% | 75.1% / 62.1% | 78.9% / 67.7% |
Sonnet 5.5 vượt Opus 5.5 trên HealthBench Professional, AutomationBench và Terminal-Bench-Science; Opus dẫn đầu rộng nhất trên ProgramBench, SWE-Bench Pro và HLE không có công cụ. Tỷ lệ 80.1% của OSWorld là điểm tín dụng một phần; chỉ 43.5% các tác vụ được thông qua hoàn toàn.
Mức độ nỗ lực thay đổi bức tranh
Các biểu đồ ra mắt, dưới dạng điểm số (chi phí). Chi phí Terminal-Bench tính trên mỗi lần thử, các loại khác tính trên mỗi tác vụ. Hai biểu đồ hiển thị GPT-5.6 Sol (*) vì số liệu của GPT-6 Sol chưa được công bố.
| Mô hình | Thấp | Trung bình | Cao | Rất cao | Tối đa |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | |||||
| Sonnet 5.5 | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Opus 5.5 | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| Sonnet 5 | 3.2% ($3.78) | 4.4% ($4.83) | 4.5% ($8.20) | 7.0% ($9.95) | 10.3% ($11.62) |
| GPT-5.6 Sol* | 7.9% ($1.46) | 20.9% ($2.69) | 26.1% ($4.12) | 28.5% ($5.39) | 37.3% ($7.89) |
| FrontierCode 1.1 Chính | |||||
| Sonnet 5.5 | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| Opus 5.5 | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| Sonnet 5 | 28.7% ($2.39) | 35.2% ($3.81) | 39.4% ($6.10) | 42.7% ($10.07) | 42.4% ($17.12) |
| GPT-6 Sol | 37.3% ($0.43) | 45.9% ($0.77) | 47.7% ($1.04) | 48.4% ($1.32) | 49.3% ($2.07) |
| CursorBench 4.0 | |||||
| Sonnet 5.5 | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| Opus 5.5 | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| Sonnet 5 | 24.1% ($1.39) | 28.0% ($2.31) | 30.8% ($3.48) | 32.0% ($4.55) | 34.1% ($7.17) |
| GPT-5.6 Sol* | 24.6% ($0.87) | 31.1% ($1.77) | 35.7% ($2.85) | 37.7% ($4.40) | 41.7% ($8.23) |
| AA-Briefcase v1.1 (Elo) | |||||
| Sonnet 5.5 | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| Opus 5.5 | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
| Sonnet 5 | 923 ($0.82) | 1056 ($1.73) | 1177 ($3.76) | 1274 ($7.56) | 1359 ($14.43) |
| GPT-6 Sol | 905 ($0.12) | 1142 ($0.34) | 1289 ($0.63) | 1364 ($1.19) | 1483 ($2.67) |
- Hầu hết các cải tiến đều đạt được ở mức rất cao (xhigh). Mức tối đa (max) tăng thêm 9.1 điểm trên Terminal-Bench với chi phí gấp 2.4 lần, 2.4 điểm trên CursorBench với chi phí gấp 2.5 lần.
- Điểm tối đa của FrontierCode thấp hơn và chi phí gấp 13 lần so với mức rất cao (xhigh) (46.2% với $20.78 so với 52.1% với $1.59).
- Opus 5.5 ở mức nỗ lực thấp hơn là đối thủ thực sự. Trên Terminal-Bench, Opus ở mức trung bình đạt 57.6% với $2.94; Sonnet ở mức cao đạt 43.0% với $1.94. Opus ở mức cao (64.2%, $3.88) đánh bại Sonnet ở mức rất cao (61.5%, $5.30). Xem Sonnet 5.5 so với Opus 5.5.
- Mức cao là điểm tối ưu về chi phí của Sonnet. FrontierCode ở mức cao: 49.4% với $0.42, khớp với điểm tốt nhất của GPT-6 Sol (49.3%) với chi phí khoảng một phần năm (phân tích chi phí).
Kết quả độc lập
Artificial Analysis chấm điểm Sonnet 5.5 là 56 trên Chỉ số Thông minh v4.3.2, đứng thứ 3 trong số 216, chỉ sau Opus 5.5 ở mức tối đa (max) và rất cao (xhigh). Sonnet 5 đạt 38 điểm. Chi phí để chạy chỉ số:
| Mức độ nỗ lực | Điểm chỉ số | Chi phí chạy |
|---|---|---|
| tối đa | 55.98 | $8,977 |
| rất cao | 51.85 | $2,738 |
| cao | 46.74 | $1,176 |
| trung bình | 40.74 | $701 |
| thấp | 35.84 | $544 |
Mức tối đa (max) có chi phí gấp 7.6 lần mức cao (high) để đạt thêm 9.2 điểm. Đánh giá của OfficeChai về AA cho thấy Sonnet 5.5 nằm ngoài đường cong Pareto, cạnh tranh nhất về chi phí ở mức cao, và tính khoảng 193,000 token đầu ra trên mỗi tác vụ chỉ số ở mức tối đa.
- Điểm chạy Terminal-Bench 4.0 của riêng AA: 63.6%, so với 70.6% của Anthropic.
- Điểm thấp của Sonnet 5 là có thật: AA đo được 14.1% (xem điểm chuẩn của Sonnet 5).
- AA-Omniscience (theo OfficeChai): độ chính xác 54% và tỷ lệ ảo giác 47%, so với 66% và 59% đối với Opus 5.5.
- Chưa đo lường: tốc độ đầu ra và thời gian cho token đầu tiên, do đó “nhanh hơn 30%” vẫn là tuyên bố của Anthropic. Chưa có danh sách LMArena.
Điểm chuẩn an toàn
Tấn công chèn câu lệnh (prompt injection), theo thẻ hệ thống:
- Gray Swan: tỷ lệ tấn công thành công 0.4%, 2.7% và 3.4% ở k=1, 10 và 15 (Sonnet 5: 0.7%, 5.1%, 6.7%). Sử dụng máy tính GUI yếu nhất ở 12.5% (k=15).
- Shade, mã hóa: 3.01% không có biện pháp bảo vệ, chủ yếu thông qua tính năng dự phòng mạng của Sonnet 5; bản thân Sonnet 5.5 đã bị xâm phạm trên 4 trong số 5,901 yêu cầu.
- Sử dụng trình duyệt: không có cuộc tấn công nào thành công trên 110 kịch bản.
Các đánh giá an ninh mạng đã chạy khi tắt biện pháp bảo vệ: 46.1% trên CyScenarioBench (Sonnet 5: 0.7%, Opus 5.5: 67.6%). Đây là Sonnet đầu tiên có biện pháp bảo vệ an ninh mạng, và Anthropic cảnh báo về việc từ chối nhiều hơn ngay cả đối với các tác vụ bảo mật lành tính. Xem hướng dẫn tấn công chèn câu lệnh của chúng tôi.
Tự chạy đánh giá của riêng bạn
Các điểm chuẩn không giống với lưu lượng truy cập của bạn, và hướng dẫn nhắc lệnh của Anthropic nói rằng mức độ nỗ lực được hiệu chỉnh lại, vì vậy đừng tái sử dụng cài đặt của Sonnet 5. Trong Apidog:
- Lưu
ANTHROPIC_API_KEYlàm biến môi trường và lưu 20 đến 50 câu lệnh thực dưới dạng yêu cầu tin nhắn (Messages requests). - Xác nhận trạng thái 200, một
stop_reasonkhác ngoài"max_tokens"hoặc"refusal", và nội dung cần thiết cho một câu trả lời chính xác. - Chạy ở các mức
thấp(low),trung bình(medium),cao(high) vàrất cao(xhigh), mỗi mức một lần; việc thay đổi mức độ nỗ lực sẽ làm mất hiệu lực bộ nhớ cache câu lệnh. - Ghi lại tỷ lệ đạt và số lượng token trong
usage, với giá 2 đô la đầu vào và 10 đô la đầu ra cho mỗi triệu.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 16000,
"output_config": {"effort": "high"},
"messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
}'
Sử dụng mức nỗ lực thấp nhất mà bạn chấp nhận được tỷ lệ đạt. Xem kiểm thử ứng dụng LLM và kiểm thử API tác nhân AI, sau đó tải xuống Apidog để xây dựng bộ sưu tập.
Câu hỏi thường gặp
Sonnet 5.5 có đánh bại Opus 5.5 không? Trên Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science và Chartography có công cụ, thì có. Opus 5.5 dẫn đầu hoặc hòa ở các tiêu chí còn lại.
Điểm SWE-Bench của Sonnet 5.5 là bao nhiêu? 81.3 trên SWE-Bench Pro và 90.3 trên Đa ngôn ngữ, ở mức nỗ lực tối đa.
Tại sao có hai con số FrontierCode? 46.2% là mức tối đa (max), 52.1% là mức rất cao (xhigh); việc phân nhánh tác nhân phụ ở mức tối đa đã gây ra các hình phạt ngoài phạm vi.
Tôi có nên nâng cấp từ Sonnet 5 không? Có, dựa trên các điểm chuẩn, nhưng trước tiên hãy đọc các thay đổi API quan trọng trong Sonnet 5.5 so với Sonnet 5.
Bước tiếp theo
Hãy bắt đầu ở mức cao (hoặc trung bình đối với mã hóa tác nhân được chỉ định rõ ràng), theo gợi ý của Anthropic, và để đánh giá của bạn trong Apidog quyết định xem việc nâng cấp có đáng giá hay không.
