Claude Sonnet 5.5 có giá $2/$10 cho mỗi triệu token đầu vào/đầu ra, bằng một nửa so với $4/$20 của Claude Opus 5.5. Trên bảng ra mắt của Anthropic, nó đạt được điểm số gần với Opus 5.5 ở hầu hết các dòng và vượt trội hơn trên Terminal-Bench 4.0 (70.6% so với 66.4%), tuy nhiên Anthropic cho biết Opus 5.5 “rõ ràng vẫn mạnh mẽ hơn trong các công việc phức tạp, mở.” Phán quyết: định tuyến các công việc có phạm vi rõ ràng, khối lượng lớn và các tác nhân phụ tới Sonnet 5.5 ở mức độ nỗ lực thấp đến cao. Trả tiền cho Opus 5.5 đối với các tác vụ dài, mở, hoặc bất cứ nơi nào bạn muốn đẩy Sonnet lên xhigh hoặc max, bởi vì Opus ở mức trung bình hoặc cao thường đạt điểm cao hơn với chi phí tương đương hoặc thấp hơn.
Đối với mỗi mô hình riêng lẻ, xem Claude Sonnet 5.5 là gì và Claude Opus 5.5 là gì. Phần cuối cùng cho thấy cách kiểm tra cả hai trên các câu lệnh của riêng bạn trong Apidog.
Thông số kỹ thuật và giá cả so sánh
| Sonnet 5.5 | Opus 5.5 | |
|---|---|---|
| ID mô hình API | claude-sonnet-5-5 |
claude-opus-5-5 |
| Đầu vào / đầu ra, mỗi 1 triệu token | $2 / $10 | $4 / $20 |
| Ghi bộ nhớ đệm (5 phút) | $2.50 | $5 |
| Đọc bộ nhớ đệm | $0.20 | $0.20 |
| Chế độ nhanh | Không có sẵn | $8 / $40 |
| Nỗ lực mặc định trên API | high |
medium |
| Suy nghĩ | Thích ứng theo mặc định, hoặc between_tools |
Thích ứng, luôn bật |
| Ngữ cảnh / đầu ra tối đa | 1M / 128K | 1M / 128K |
| Lớp độ trễ | Nhanh | Trung bình |
Ba dòng quan trọng nhất:
- Đọc bộ nhớ đệm có chi phí như nhau, vì vậy trong các vòng lặp tác nhân nặng bộ nhớ đệm, khoảng cách chủ yếu nằm ở đầu ra và ghi bộ nhớ đệm. Định giá của Claude Sonnet 5.5 thực hiện tính toán. Không mô hình nào tính phí cao cấp cho ngữ cảnh dài.
- Nỗ lực mặc định khác nhau. Một thử nghiệm cài đặt mặc định đặt Sonnet ở `high` đấu với Opus ở `medium`, cặp đôi mà Opus có xu hướng thắng.
- Chế độ nhanh chỉ dành cho Opus (tài liệu). Anthropic cho biết Sonnet 5.5 tạo đầu ra nhanh hơn 30%+ so với Sonnet 5.
Điểm chuẩn: gần trên bảng ra mắt, rộng hơn trên thẻ hệ thống
Các hàng từ một đến tám là bảng ra mắt của Anthropic; phần còn lại đến từ thẻ hệ thống. Cognition chạy FrontierCode, Cursor chạy CursorBench, Zapier chạy AutomationBench, và Artificial Analysis (AA) chạy GDPval-AA và AA-Briefcase; Anthropic chạy các phần còn lại. Sonnet ở mức nỗ lực tối đa trừ khi có ghi chú khác.
| Điểm chuẩn | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 66.4% (xhigh) |
| FrontierCode 1.1 Main | 46.2% max, 52.1% xhigh | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 (Elo) | 1844 | 1846 |
| AA-Briefcase v1.1 (Elo) | 1811 | 1822 |
| HLE, with tools | 64.5% | 67.7% |
| OSWorld 2.1, partial | 80.1% | 81.8% |
| Chartography, no tools | 61.6% | 64.4% |
| SWE-Bench Pro | 81.3 | 89.9 |
| SWE-Bench Multimodal | 54.3 | 61.4 |
| HLE, no tools | 56.9 | 64.4 |
| OSWorld 2.1, strict pass | 43.5% | 48.7% |
| ProgramBench, long context | 79.7% | 91.2% |
| Terminal-Bench-Science 0.1 | 59.9% | 58.7% |
| AutomationBench | 44.7 | 42.5 |
| HealthBench Professional | 69.2 | 65.6 |
Bảng ra mắt là lát cắt thuận lợi: ngoài Terminal-Bench, Opus dẫn trước các hàng phần trăm của nó từ 1.7 đến 3.2 điểm, tính cả điểm FrontierCode xhigh của Sonnet. Năm hàng thẻ hệ thống nới rộng khoảng cách lên 5.2 đến 11.5 điểm: SWE-Bench Pro, SWE-Bench Multimodal, HLE không công cụ, OSWorld nghiêm ngặt và ProgramBench ngữ cảnh dài. Các công việc dài, không trợ giúp, toàn bộ tác vụ là nơi Opus vẫn dẫn đầu.
Đọc kỹ chiến thắng Terminal-Bench 4.0: phần 8.5 của thẻ hệ thống cho biết tính năng dự phòng an toàn đã chạm 10% số lần thử của Opus so với 1.5% của Sonnet, và kết quả chạy riêng của AA chấm Sonnet 5.5 ở mức 63.6%. Chi tiết trong điểm chuẩn của Claude Sonnet 5.5.
Mức độ nỗ lực quyết định cuộc đối đầu
Bảng ra mắt so sánh mỗi mô hình ở cài đặt tốt nhất của nó. Hóa đơn của bạn thì không. Trang ra mắt của Anthropic biểu diễn mọi cấp độ nỗ lực với chi phí cho mỗi lần thử hoặc tác vụ:
| Điểm chuẩn, mô hình | Thấp | Trung bình | Cao | Rất cao | Tối đa |
|---|---|---|---|---|---|
| Terminal-Bench, Sonnet | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Terminal-Bench, Opus | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| CursorBench, Sonnet | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| CursorBench, Opus | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| FrontierCode, Sonnet | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| FrontierCode, Opus | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| AA-Briefcase, Sonnet | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| AA-Briefcase, Opus | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
Những gì nó cho thấy:
- Opus ở mức trung bình thường đánh bại Sonnet ở mức cao. Terminal-Bench 4.0: Opus đạt 57.6% với $2.94 mỗi lần thử, Sonnet 43.0% với $1.94.
- Opus dưới mức tối đa có thể đánh bại Sonnet tốt nhất với chi phí thấp hơn. CursorBench: Opus ở mức cao (56.0%, $3.97) so với Sonnet ở mức tối đa (55.5%, $9.67). FrontierCode: Opus ở mức trung bình (54.6%, $0.80) so với Sonnet tốt nhất (52.1%, $1.59).
- Sonnet ở mức tối đa có thể tốn kém hơn Opus ở mức tối đa: $29.19 so với $21.05 trên AA-Briefcase, để đạt điểm thấp hơn. Trên FrontierCode, điểm tối đa của Sonnet thấp hơn điểm xhigh của nó vì nó đã mở rộng các tác nhân phụ đánh giá, chú thích của Anthropic cho biết.
- Sonnet chiếm phần dưới của đường cong. Cài đặt thấp của nó làm giảm điểm thấp nhất của Opus trên mọi biểu đồ.
Một nửa giá token không phải là một nửa chi phí cho mỗi tác vụ: Sonnet sử dụng nhiều token hơn khi mức độ nỗ lực tăng lên. Dữ liệu của AA, như OfficeChai đã báo cáo, cho thấy Sonnet 5.5 sử dụng khoảng 193.000 token đầu ra cho mỗi tác vụ lập chỉ mục ở mức tối đa, nhiều hơn khoảng 60% so với Opus 5.5.
Đó là cuộc tranh luận chính trong chuỗi Hacker News: nhiều người bình luận đọc biểu đồ cho rằng Opus ở mức nỗ lực thấp hơn ngang bằng hoặc thấp hơn Sonnet ở mức cao hoặc xhigh, để lại chỗ đứng cho Sonnet ở mức nỗ lực thấp hoặc trung bình và với vai trò tác nhân phụ dưới sự điều phối của Opus.
Hướng dẫn tạo lời nhắc của Anthropic cho biết mức độ nỗ lực của Sonnet 5.5 đã được hiệu chỉnh lại: bắt đầu ở `high` (`medium` cho mã hóa tác nhân được chỉ định rõ ràng) và dành `xhigh` và `max` cho những cải thiện có thể đo lường được. Thay đổi mức độ nỗ lực cao nhất giữa các yêu cầu sẽ làm mất hiệu lực bộ nhớ đệm lời nhắc, vì vậy hãy đặt nó theo từng khối lượng công việc (hướng dẫn API).
Sự khác biệt về an toàn và hành vi
Kết quả tiêm lời nhắc phân tách. Trên điểm chuẩn tiêm lời nhắc gián tiếp của Gray Swan, tỷ lệ thành công tấn công của Sonnet 5.5 là 3.4% trong 15 lần thử (Sonnet 5: 6.7%): ít kháng hơn Opus 5.5, nhiều hơn mọi mô hình không phải Claude được thử nghiệm, yếu nhất trong việc sử dụng máy tính GUI (12.5%). Đối với các kẻ tấn công thích nghi của Shade, Sonnet đánh bại Opus trong mã hóa (3.01% so với 54.61% không có biện pháp bảo vệ, 2.63% so với 11.13% khi có thăm dò) và ngang bằng trong việc sử dụng máy tính (0.07%); trong việc sử dụng trình duyệt, đây là mô hình đầu tiên mà Anthropic đánh giá không có cuộc tấn công thành công nào. Xem Opus 5.5 và tiêm lời nhắc.
Cả hai mô hình đều có các biện pháp bảo vệ an ninh mạng; Sonnet 5.5 là Sonnet đầu tiên có chúng. Các tác vụ mạng có rủi ro cao hơn bị gắn cờ sẽ chuyển về Sonnet 5, tự động trong các ứng dụng của Anthropic và trên API chỉ khi bạn chọn tham gia (`fallbacks: "default"`, beta). Thẻ hệ thống cảnh báo về nhiều lần từ chối hơn ngay cả đối với công việc bảo mật lành tính.
Thẻ hệ thống cũng nhận thấy Sonnet 5.5 trung thực hơn dưới áp lực so với Opus 5.5 nhưng dễ bị ảo giác hơn.
Kết hợp Sonnet 5.5 và Opus 5.5 trong một hệ thống
Một cách để có cả hai: Opus lập kế hoạch, Sonnet thực thi. Ba cơ chế quan trọng.
Các khối suy nghĩ không chồng chéo. Sonnet 5.5 bỏ qua các khối suy nghĩ của Opus 5 và Opus 5.5 (không tính phí; yêu cầu vẫn trả về 200), và các khối bị ràng buộc với mô hình, cuộc hội thoại và tài khoản. Chuyển đổi mô hình giữa cuộc hội thoại sẽ làm mất lý luận, vì vậy hãy chuyển giao thông qua văn bản: Opus viết kế hoạch dưới dạng một tin nhắn, Sonnet bắt đầu từ đó (hướng dẫn di chuyển).
Công cụ cố vấn chấp nhận Opus 5.5 làm cố vấn cho một trình thực thi Sonnet 5.5; lời khuyên trả về được mã hóa dưới dạng `advisor_redacted_result`.
Claude Code có `opusplan`: Opus ở chế độ lập kế hoạch, Sonnet để thực thi. Biệt danh `sonnet` chỉ có nghĩa là Sonnet 5.5 trên API của Anthropic (v2.1.284 trở lên), vì vậy trên Bedrock, Google Cloud và Foundry, `opusplan` thực thi trên một Sonnet cũ hơn. Xem Claude Sonnet 5.5 trong Claude Code.
Vị trí của GPT-6 Sol
GPT-6 Sol có cùng mức giá niêm yết $2/$10 với Sonnet 5.5, với $0.20 cho các lượt đọc bộ nhớ đệm (giảm 90%) và cửa sổ ngữ cảnh 872k. Bảng của Anthropic cung cấp cho Sol bốn ô: FrontierCode 49.3%, GDPval-AA 1487, AA-Briefcase 1483 và Chartography 53.6% không có công cụ. Một chú thích cho biết OpenAI gần đây đã sửa một lỗi hiểu hình ảnh của Sol mà điểm số của AA và Surge AI có thể chưa phản ánh.
Chi phí mỗi tác vụ thay đổi theo điểm chuẩn. Trên AA-Briefcase ở mức tối đa, Sol có giá $2.67 mỗi tác vụ so với $29.19 của Sonnet, đạt điểm 1483 so với 1811. Trên FrontierCode, Sonnet ở mức cao ngang bằng với mức tốt nhất của Sol (49.4% so với 49.3%) với chi phí $0.42 so với $2.07. Xem GPT-6 Sol so với Claude Opus 5.5 và GPT-6 Sol là gì.
Mô hình nào cho khối lượng công việc nào
| Khối lượng công việc | Mô hình và nỗ lực |
|---|---|
| Trò chuyện khối lượng lớn, phân loại, trích xuất | Sonnet 5.5, low hoặc medium |
| Sửa lỗi có phạm vi rõ ràng, thay đổi kích thước PR | Sonnet 5.5, medium hoặc high |
| Các tác nhân phụ chạy kế hoạch Opus | Sonnet 5.5, medium hoặc high |
| Công việc tác nhân dài, mở | Opus 5.5, medium sau đó high |
Bất cứ điều gì cần Sonnet ở xhigh hoặc max |
Opus 5.5, medium hoặc high |
| Lý luận codebase ngữ cảnh dài | Opus 5.5, medium hoặc cao hơn |
| Các tác nhân đọc nội dung không đáng tin cậy | Tùy chọn; kiểm tra các trường hợp tiêm của riêng bạn |
Kiểm tra cả hai trên lưu lượng truy cập của riêng bạn
Mọi biểu đồ trên đều đến từ bộ công cụ của người khác, không phải từ các lời nhắc, công cụ hay sự kết hợp token của bạn. Bắt đầu với cặp mà dữ liệu đánh dấu:
ask() {
curl -s https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{"model":"'"$1"'","max_tokens":16000,
"output_config":{"effort":"'"$2"'"},
"messages":[{"role":"user","content":"Review this diff and list each bug as JSON: ..."}]}' \
| jq '{model, stop_reason, usage}'
}
ask claude-sonnet-5-5 high
ask claude-opus-5-5 medium
Trong Apidog, hãy làm cho nó có thể lặp lại: một yêu cầu tới `https://api.anthropic.com/v1/messages`, `ANTHROPIC_API_KEY` là một biến môi trường, và `{{model}}` và `{{effort}}` trong phần thân. Nhân đôi nó cho mỗi cặp và thêm một bộ xử lý hậu kỳ để mỗi lần chạy kiểm tra những điều tương tự:
const body = pm.response.json();
pm.test("finished cleanly", () => {
pm.expect(body.stop_reason).to.not.be.oneOf(["max_tokens", "refusal"]);
});
pm.test("stays inside the token budget", () => {
pm.expect(body.usage.output_tokens).to.be.below(8000);
});
Chạy mỗi cặp 10 đến 20 lần và so sánh `mức sử dụng`, thời gian phản hồi và tỷ lệ thành công; số token nhân với giá niêm yết là chi phí thực của bạn cho mỗi tác vụ. Thêm chi tiết trong cách kiểm tra các ứng dụng LLM.
Câu hỏi thường gặp
Claude Sonnet 5.5 có tốt hơn Opus 5.5 không? Không phải ở hầu hết các dòng. Opus 5.5 dẫn đầu bảng ra mắt ngoại trừ Terminal-Bench 4.0 và một kết quả gần hòa trên GDPval-AA. Cuộc đối đầu thế hệ trước: Claude Opus 5 so với Sonnet 5.
Sonnet 5.5 có giá bằng một nửa Opus 5.5 không? Theo mỗi token, có. Theo mỗi tác vụ thì tùy thuộc vào mức độ nỗ lực: ở mức tối đa, Sonnet tốn kém hơn trên AA-Briefcase ($29.19 so với $21.05).
Tôi có thể chuyển đổi mô hình giữa cuộc hội thoại không? Có, nhưng Sonnet 5.5 bỏ qua các khối suy nghĩ của Opus 5.5, vì vậy hãy truyền trạng thái dưới dạng văn bản.
Sonnet 5.5 hay GPT-6 Sol với giá $2/$10? Sonnet dẫn đầu tất cả bốn hàng chung ở cài đặt tốt nhất của nó; Sol có thể rẻ hơn nhiều cho mỗi tác vụ. Hãy thử nghiệm cả hai.
Bước tiếp theo
Chạy hai lời nhắc tốn kém nhất của bạn qua Sonnet 5.5 ở mức `high` và Opus 5.5 ở mức `medium`, và so sánh tỷ lệ thành công và chi phí mỗi tác vụ trước khi bạn thay đổi quy tắc định tuyến. Để giữ các yêu cầu, xác nhận và kết quả trong một dự án, hãy tải xuống Apidog.
