Điểm chuẩn Claude Opus 5: Ý nghĩa thực sự của các con số

Tất cả các tuyên bố về điểm chuẩn của Claude Opus 5 trong một bảng được ghi nhận nguồn: Frontier-Bench, ARC-AGI 3, OSWorld 2.0, CursorBench 3.2, AutomationBench. Tất cả đều do nhà cung cấp thực hiện, không cái nào được tái tạo lại.

Ashley Innocent

Ashley Innocent

25 tháng 7 2026

Điểm chuẩn Claude Opus 5: Ý nghĩa thực sự của các con số

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Anthropic đã ra mắt Claude Opus 5 vào ngày 24 tháng 7 năm 2026 với một loạt các tuyên bố về hiệu suất đọc lên như một chiến thắng toàn diện. Hơn gấp đôi Opus 4.8 trên một đánh giá. Gấp ba lần mô hình tốt thứ hai trên một đánh giá khác. Vượt qua Fable 5 với chi phí chỉ bằng một phần ba trên đánh giá thứ ba.

Điều đó không có nghĩa là chúng sai. Điều đó có nghĩa là bạn nên đọc chúng theo cách bạn đọc biểu đồ ra mắt của bất kỳ nhà cung cấp nào: cẩn thận, chú ý đến những gì đang được đo lường và những gì bị bỏ qua. Hướng dẫn này tổng hợp mọi tuyên bố hiệu suất của Opus 5 đã được công bố vào một bảng có nguồn gốc, giải thích những gì mỗi con số có thể và không thể chứng minh, nêu tên giới hạn mà Anthropic đặt ra cho chính mô hình của mình, và kết thúc bằng một kế hoạch đánh giá bạn có thể tự chạy trong Apidog.

nút

Đối với chính mô hình (claude-opus-5, ngữ cảnh 1M, đầu ra tối đa 128k, cắt bỏ kiến thức tháng 5 năm 2026), hãy bắt đầu với Claude Opus 5 là gì. Nguồn chính dưới đây là bài đăng ra mắt Claude Opus 5 của Anthropic.

Mọi tuyên bố đã công bố, trong một bảng

Dưới đây là tập hợp đầy đủ các tuyên bố về hiệu suất mà Anthropic đã đưa ra khi ra mắt. Cột so sánh quan trọng ngang với cột kết quả, bởi vì một số tuyên bố trong số này được nêu liên quan đến một mô hình khác thay vì dưới dạng một điểm số.

Tiêu chuẩn đánh giá Tuyên bố của Anthropic Được nêu dưới dạng So sánh với
Frontier-Bench v0.1 Vượt trội hơn tất cả các mô hình khác; hơn gấp đôi điểm của Opus 4.8, với chi phí thấp hơn cho mỗi tác vụ Tỷ lệ cộng với tuyên bố chi phí Opus 4.8 và các mô hình khác
ARC-AGI 3 Khoảng 3 lần điểm của mô hình tốt thứ hai Tỷ lệ Mô hình tốt thứ hai không được nêu tên
OSWorld 2.0 Vượt qua Fable 5 với chi phí bằng một phần ba Thứ tự cộng với tuyên bố chi phí Fable 5
CursorBench 3.2 Trong vòng 0.5% so với đỉnh của Fable 5, với giá bằng một nửa Khoảng cách cộng với tuyên bố chi phí Fable 5
Zapier AutomationBench Tỷ lệ vượt qua khoảng 1.5 lần mô hình tốt thứ hai Tỷ lệ Mô hình tốt thứ hai không được nêu tên
Hóa học hữu cơ +10.2 điểm so với Opus 4.8 Chênh lệch tuyệt đối Opus 4.8
Phân tích protein +7.7 điểm so với Opus 4.8 Chênh lệch tuyệt đối Opus 4.8
Khai thác an ninh mạng Thua Mythos 5 Thứ tự Mythos 5
Nghiên cứu sinh học tự động Thua Mythos 5 Thứ tự Mythos 5

Nguồn cho tất cả những điều trên: bài đăng ra mắt và tài liệu mô hình của Anthropic. Không có bên thứ ba nào đã công bố tái tạo bất kỳ kết quả nào trong số này tại thời điểm viết bài.

Hai điều nổi bật trước khi bạn đọc bất kỳ con số nào. Chỉ có hai trong số chín hàng đưa ra một sự dịch chuyển tuyệt đối về điểm số. Và chính Anthropic đã cung cấp hai hàng cuối cùng, nơi mô hình chủ lực mới của họ bị thua.

Vấn đề tỷ lệ, và tại sao nó quan trọng

Bốn trong số các tuyên bố (Frontier-Bench, ARC-AGI 3, AutomationBench, và một phần CursorBench) được nêu dưới dạng tỷ lệ hoặc khoảng cách thay vì điểm số. Đó là một hạn chế thực sự, không phải là một chi tiết nhỏ, và điều đáng nói rõ là tại sao.

Một tỷ lệ che giấu mẫu số. “Khoảng 3 lần mô hình tốt nhất tiếp theo” trên ARC-AGI 3 có ý nghĩa khác nhau tùy thuộc vào vị trí của các mô hình khác. Nếu mô hình tốt nhất tiếp theo đạt 8%, thì 3 lần là 24%: một sự tiến bộ thực sự trên một tiêu chuẩn mà chưa ai gần đạt được. Nếu mô hình tốt nhất tiếp theo đạt 25%, thì 3 lần là 75%, một kết quả khác biệt hoàn toàn. Cả hai đều có thể được mô tả một cách trung thực là “3 lần.” Bạn không thể biết điều nào đã xảy ra, và Anthropic đã không nói.

Gấp đôi dễ hơn ở phần dưới của thang đo. “Hơn gấp đôi điểm của Opus 4.8” trên Frontier-Bench v0.1 cũng có hình dạng vấn đề tương tự. Trên một tiêu chuẩn mới, khó mà mô hình hàng đầu trước đó chỉ đạt điểm ở hàng chữ số đơn hoặc thấp, việc gấp đôi là một bước nhảy tuyệt đối nhỏ hơn so với cách diễn đạt ngụ ý. Trên một tiêu chuẩn mà 4.8 đã đạt 40%, việc gấp đôi sẽ là phi thường. Chuỗi phiên bản ở đây là một gợi ý: v0.1 là một tiêu chuẩn chưa có lịch sử công bố, chưa có sự tái tạo của cộng đồng và chưa có điểm bão hòa được thiết lập.

“Mô hình tốt nhất tiếp theo” không được nêu tên. Hai tuyên bố so sánh Opus 5 với một đối thủ không xác định. Đối thủ đó có thể là Fable 5, Mythos 5, hoặc một mô hình từ phòng thí nghiệm khác. Tập hợp so sánh xác định ý nghĩa của tỷ lệ, và nó không được tiết lộ.

Khoảng cách cần đơn vị. “Trong vòng 0.5% so với đỉnh của Fable 5” trên CursorBench 3.2 không nói rõ đó là 0.5 điểm phần trăm hay 0.5% khác biệt tương đối, và “đỉnh” gợi ý một lần chạy cấu hình tốt nhất chứ không phải mặc định. Trên một tiêu chuẩn mã hóa, sự khác biệt giữa cài đặt `effort` mặc định và cài đặt tối đa không phải là nhỏ. Phân tích tiêu chuẩn Fable 5 của chúng tôi đề cập đến cách các con số của chính mô hình đó được định hình.

Hai con số khoa học là những tuyên bố rõ ràng nhất trong tập hợp chính xác vì chúng tránh được tất cả những điều này: +10.2 điểm về hóa học hữu cơ và +7.7 điểm về phân tích protein là những chênh lệch tuyệt đối so với một cơ sở được đặt tên. Bạn vẫn không nhận được điểm khởi đầu, nhưng bạn biết chính xác mô hình đã di chuyển bao xa.

Các tuyên bố về chi phí cho mỗi tác vụ phụ thuộc vào cấu hình

Ba trong số các tuyên bố của Anthropic kết hợp khả năng với chi phí: chi phí thấp hơn cho mỗi tác vụ trên Frontier-Bench, một phần ba chi phí trên OSWorld 2.0, một nửa giá trên CursorBench 3.2.

Một nửa của mức giá niêm yết có thể kiểm chứng và giữ vững. Opus 5 có giá 5 đô la cho mỗi triệu token đầu vào và 25 đô la cho mỗi triệu token đầu ra, giống hệt Opus 4.8 và chính xác bằng một nửa mức 10 đô la/50 đô la của Fable 5. Điều này được công bố trên trang giá của Anthropic và hoàn toàn không phải là kết quả đánh giá. Toàn bộ phép tính, bao gồm ghi bộ nhớ đệm, tốc độ lô và phí cao cấp cho chế độ nhanh, có trong phân tích giá Opus 5 của chúng tôi.

Chi phí cho mỗi *tác vụ* là một số lượng khác. Nó phụ thuộc vào số lượng token mà lần chạy đã tiêu thụ, điều này phụ thuộc vào mức độ nỗ lực, liệu việc suy nghĩ có được kích hoạt hay không, tác nhân đã thực hiện bao nhiêu lượt trong vòng lặp và bao nhiêu tác nhân phụ đã được sinh ra. Hướng dẫn nhắc nhở của chính Anthropic lưu ý rằng Opus 5 tạo ra các phản hồi mặc định dài hơn Opus 4.8, ủy quyền cho các tác nhân phụ dễ dàng hơn và mở rộng phạm vi tác vụ thường xuyên hơn. Cả ba điều này đều đẩy mức tiêu thụ token lên cao trong các khối lượng công việc thực tế, vì vậy một lần chạy được điều chỉnh cho biểu đồ chi phí trên mỗi tác vụ không tự động là cấu hình bạn sẽ triển khai.

Không có điều nào trong số này làm cho câu chuyện về chi phí trở nên sai lệch. Nửa giá niêm yết là nửa giá niêm yết, và so sánh Opus 5 và Fable 5 của chúng tôi xem xét nơi mà khoảng cách đó thực sự có giá trị. Điều đó có nghĩa là tỷ lệ chi phí trên mỗi tác vụ là một tạo tác của một thiết lập cụ thể, và của bạn sẽ khác. Hãy đo lường nó.

Giới hạn mà Anthropic tự đặt ra

Dòng hữu ích nhất trong tài liệu ra mắt là dòng không phải là một chiến thắng. Anthropic tuyên bố rõ ràng rằng Opus 5 vẫn thua kém **Mythos 5** về khai thác an ninh mạng và nghiên cứu sinh học tự động. Fable 5 cũng giữ vững danh hiệu "mô hình có khả năng nhất được phát hành rộng rãi".

Điều đó đáng được nhắc lại bởi vì các tin tức đã bỏ qua nó một cách đáng kể. Opus 5 không phải là đỉnh cao của hệ thống Claude. Tóm tắt trung thực là khả năng cấp độ tiên tiến với giá bằng một nửa giá tiên tiến, với một giới hạn được đặt tên ở trên nó. Đối với nghiên cứu bảo mật tiên tiến hoặc công việc khoa học tự động, câu trả lời tiêu chuẩn vẫn là cấp độ Mythos, được đề cập trong giải thích mô hình cấp độ Mythosso sánh Fable 5 với Mythos 5 của chúng tôi.

Cũng có một hệ quả vận hành. Anthropic đã phát hành tùy chọn `fallbacks: "default"` (đằng sau tiêu đề beta `server-side-fallback-2026-07-01`) tự động chuyển về Opus 4.8 khi Opus 5 từ chối một yêu cầu thuộc danh mục an ninh mạng. Một mô hình với các từ chối an ninh mạng chặt chẽ hơn cần một lối thoát, và sự tồn tại của lối thoát đó cho bạn biết điều gì đó mà biểu đồ không thể hiện.

Những gì các điểm chuẩn hoàn toàn không đề cập

Các điểm chuẩn đo lường việc hoàn thành tác vụ. Chúng không đo lường những yếu tố quyết định liệu một mô hình có hoạt động trong sản phẩm của bạn hay không:

Những gì bạn nên tự kiểm tra

Các tiêu chuẩn đánh giá của nhà cung cấp là một giả thuyết ban đầu. Dưới đây là một đánh giá gọn nhẹ mà bạn có thể chạy trong một buổi chiều, sẽ cho bạn biết nhiều hơn về Opus 5 cho khối lượng công việc của bạn so với tất cả các con số trên cộng lại.

1. Xây dựng một tập hợp tác vụ nhỏ từ lịch sử của riêng bạn. Hai mươi đến năm mươi tác vụ thực tế: các ticket đã đóng, các PR đã hợp nhất, các luồng hỗ trợ mà mô hình của bạn lẽ ra phải xử lý. Đầu vào thực tế tốt hơn đầu vào tổng hợp vì chúng mang định dạng, sự mơ hồ và các trường hợp ngoại lệ thực tế của bạn.

2. Cố định cấu hình và ghi lại. ID mô hình chính xác `claude-opus-5`, cộng với mức `output_config.effort` của bạn, liệu tính năng suy nghĩ có được bật hay không và `max_tokens` của bạn. Một cấu hình không cố định sẽ khiến mọi so sánh sau này trở nên vô nghĩa.

3. Đánh giá chi phí cho mỗi tác vụ đã giải quyết, không phải chi phí cho mỗi token. Đọc khối `usage` trên mọi phản hồi và ghi lại token đầu vào, đầu ra, đọc bộ nhớ đệm và ghi bộ nhớ đệm cho mỗi tác vụ. Sau đó chia tổng chi tiêu cho các tác vụ thực sự vượt qua kiểm tra chấp nhận của bạn. Đây là con số mà biểu đồ của Anthropic đang tuyên bố, vì vậy đây là con số cần tái tạo.

4. Chạy một lần quét mức độ nỗ lực thực tế. Cùng một tập hợp tác vụ ở `low`, `medium`, `high` và `xhigh`. Việc hiệu chỉnh lại có nghĩa là `low` và `medium` mạnh mẽ hơn đáng kể trên Opus 5 so với các mô hình Opus trước đây, và nhiều khối lượng công việc sẽ thấy một mức độ rẻ hơn cũng vượt qua thường xuyên như vậy. Theo dõi `max_tokens` ở mức cao nhất.

5. Kiểm tra vòng lặp tác nhân, không phải một lượt duy nhất. Hầu hết các tiêu chuẩn đánh giá khi ra mắt đều là tác nhân (OSWorld, CursorBench, AutomationBench). Các kiểm tra nhanh một lượt sẽ không tái tạo được chúng. Chạy đa lượt với các công cụ thực tế của bạn được đính kèm và đếm số lượt, không chỉ kết quả.

6. So sánh với mô hình hiện tại của bạn trên cùng một tập hợp tác vụ. Bất kể bạn đang chạy mô hình nào hôm nay, Opus 4.8 hay Sonnet 5 hay cái gì đó khác, hãy chạy nó thông qua cùng một hệ thống kiểm tra. Một kết quả tương đối trên dữ liệu của riêng bạn có giá trị hơn một điểm số tuyệt đối trên dữ liệu của người khác.

7. Ghi lại các từ chối riêng biệt. Công việc liên quan đến an ninh mạng sẽ gặp các từ chối thường xuyên hơn so với trên 4.8. Hãy đếm chúng trước khi bạn quyết định liệu tiêu đề dự phòng có đáng để kết nối hay không.

Để biết phương pháp so sánh trên một lần ra mắt trước, bài viết về điểm chuẩn của Sonnet 5 của chúng tôi sẽ hướng dẫn bạn qua cùng một bài tập, và hướng dẫn API Opus 5 có các dạng yêu cầu.

Chạy đánh giá trong Apidog

Đánh giá trên là một chồng các yêu cầu HTTP với tiêu đề xác thực, thân JSON, phản hồi luồng và một khối `usage` mà bạn cần đọc trên mỗi lệnh gọi. Đó là công việc API thông thường, điều mà Apidog xử lý.

Một thiết lập khả thi:

  1. Tạo một yêu cầu đến điểm cuối Anthropic Messages và lưu khóa API của bạn dưới dạng biến môi trường thay vì dán vào thân yêu cầu.
  2. Nhân bản yêu cầu đó một lần cho mỗi mức độ nỗ lực để bạn có thể gửi cùng một lời nhắc từ `low` đến `xhigh` và so sánh các phản hồi cạnh nhau.
  3. Bật tính năng phát trực tuyến và kiểm tra trực tiếp các sự kiện SSE khi bạn cần xem các token suy nghĩ tích lũy như thế nào trước khi câu trả lời hiển thị bắt đầu.
  4. Kiểm tra các tải trọng gọi công cụ trong phản hồi để xác nhận mô hình thực sự phát ra các lệnh gọi công cụ có cấu trúc thay vì mô tả chúng bằng văn xuôi, đây là một điểm đáng chú ý khi tính năng suy nghĩ bị tắt.
  5. Thêm một khẳng định trên các trường `usage` để các lượt truy cập bộ nhớ đệm và tổng số token được ghi lại trong mỗi lần chạy thay vì ước lượng.
  6. Lưu toàn bộ dưới dạng một bộ sưu tập để lần ra mắt mô hình tiếp theo chỉ là việc thay đổi ID mô hình, không phải xây dựng lại.

Dưới đây là yêu cầu cơ sở:

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 8192,
    "output_config": {"effort": "medium"},
    "messages": [
      {"role": "user", "content": "Sửa lỗi kiểm thử không thành công trong diff này."}
    ]
  }'

Thay đổi một trường mỗi lần chạy, giữ nguyên mọi thứ khác và ghi lại khối `usage` mỗi lần. Tải Apidog nếu bạn muốn làm theo mẫu đó với các môi trường và khẳng định đã được thiết lập sẵn.

Tóm tắt trung thực

Câu chuyện về hiệu suất của Opus 5 thực sự mạnh mẽ: bước nhảy vọt lớn nhất so với phiên bản tiền nhiệm mà Anthropic từng tuyên bố cho một bản phát hành Opus, với giá niêm yết không đổi. Nó cũng hoàn toàn do nhà cung cấp tự thực hiện, chưa được tái tạo tính đến ngày 25 tháng 7 năm 2026, và được nêu chủ yếu dưới dạng tỷ lệ che giấu mẫu số của chúng. Cả hai điều đó đều đúng cùng một lúc.

Hãy xem bảng ở đầu trang này như giả thuyết của Anthropic về mô hình của chính họ. Sau đó, hãy tự mình tìm ra con số của bạn. Khoảng cách giữa biểu đồ ra mắt và khối lượng công việc sản xuất là nơi mọi quá trình di chuyển mô hình thực sự được quyết định, và hướng dẫn trụ cột Opus 5 bao gồm phần còn lại của những gì đã thay đổi.

nút

Câu hỏi thường gặp

Các điểm chuẩn của Claude Opus 5 có được xác minh độc lập không? Không. Tính đến ngày 25 tháng 7 năm 2026, mọi kết quả điểm chuẩn Opus 5 được công bố đều đến từ Anthropic. Không có phòng thí nghiệm bên thứ ba hoặc người đánh giá độc lập nào đã phát hành một bản tái tạo. Hãy đọc chúng như các số liệu do nhà cung cấp báo cáo.

Tuyên bố điểm chuẩn lớn nhất của Opus 5 là gì? Frontier-Bench v0.1, nơi Anthropic cho biết Opus 5 đã tăng gấp đôi điểm của Opus 4.8 với chi phí thấp hơn cho mỗi tác vụ. Anthropic không công bố điểm số cơ bản, chỉ tỷ lệ, và Frontier-Bench v0.1 là một điểm chuẩn mới không có lịch sử được thiết lập.

Claude Opus 5 có phải là mô hình Claude có khả năng nhất không? Không. Fable 5 vẫn giữ danh hiệu "mô hình có khả năng nhất được phát hành rộng rãi", và Anthropic tuyên bố rằng Opus 5 vẫn thua kém Mythos 5 về khai thác an ninh mạng và nghiên cứu sinh học tự động. Lời chào hàng của Opus 5 là khả năng cấp độ tiên tiến với giá bằng một nửa giá của Fable 5, không phải là đứng đầu hệ thống.

Opus 5 tốt hơn Opus 4.8 bao nhiêu trong các tác vụ khoa học? Anthropic báo cáo +10.2 điểm về hóa học hữu cơ và +7.7 điểm về phân tích protein so với Opus 4.8. Đây là hai tuyên bố được nêu dưới dạng chênh lệch tuyệt đối chứ không phải tỷ lệ, điều này làm cho chúng dễ hiểu nhất, mặc dù điểm số cơ bản không được công bố.

Opus 5 có đánh bại Fable 5 không? Theo số liệu của Anthropic, nó vượt qua Fable 5 trên OSWorld 2.0 với chi phí bằng một phần ba và đạt trong vòng 0.5% so với đỉnh của Fable 5 trên CursorBench 3.2 với giá bằng một nửa. Fable 5 vẫn giữ danh hiệu về khả năng tổng thể. Xem so sánh đầy đủ.

Tôi nên tự đánh giá những gì? Chi phí cho mỗi tác vụ đã giải quyết trên hai mươi đến năm mươi tác vụ thực tế từ danh sách công việc tồn đọng của riêng bạn, chạy ở nhiều mức độ nỗ lực, với các công cụ thực tế của bạn được đính kèm và các vòng lặp đa lượt được bật. So sánh với bất cứ thứ gì bạn đang chạy hôm nay trên cùng một hệ thống kiểm tra.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API