Điểm chuẩn Claude Fable 5.1: Ý nghĩa thực sự của các con số

Mọi điểm chuẩn của Claude Fable 5.1 có ghi nhận nguồn: Terminal-Bench-Science 52,6%, Terminal-Bench 4.0 55,8%, CursorBench 73,4%, so với Fable 5, Opus 5 và GPT-5.6 Sol.

INEZA Felin-Michel

INEZA Felin-Michel

2 tháng 9 2026

Điểm chuẩn Claude Fable 5.1: Ý nghĩa thực sự của các con số

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Anthropic đã ra mắt Claude Fable 5.1 vào ngày 1 tháng 9 năm 2026, kèm theo bảng so sánh điểm chuẩn giữa phiên bản này với Fable 5, Opus 5 và GPT-5.6 Sol trên chín bài kiểm tra. Tiêu đề mà mọi trang tin đều đăng là Terminal-Bench-Science, nơi Fable 5.1 đạt 52.6% so với 24.7% của Fable 5. Con số ít trang tin đăng hơn là CursorBench, nơi khoảng cách với Opus 5 là 3.4 điểm trên một mô hình có giá gấp đôi.

Hướng dẫn này tổng hợp tất cả các con số đã công bố vào một nơi có ghi nguồn, giải thích từng điểm chuẩn đo lường điều gì, phân biệt các khoảng cách lớn với nhỏ, và sau đó đề cập đến phần mà các tin tức ra mắt đã bỏ qua: tất cả các kết quả này đều do nhà cung cấp thực hiện, Mythos 5.1 vượt trội hơn Fable 5.1 trên một bài kiểm tra mã hóa tác nhân duy nhất mà cả hai đều được công bố, và phản ứng đúng đắn đối với một bảng ra mắt là tự mình chạy các đánh giá. Nguồn chính là bài đăng ra mắt của Anthropic; ngữ cảnh mô hình có trong Claude Fable 5.1 là gì.

Bảng đầy đủ

Điểm chuẩn Nội dung đo lường Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 Nghiên cứu khoa học tác nhân trong terminal 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 Mã hóa tác nhân trong terminal 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 Công việc kiến thức có giá trị kinh tế (Elo) 1853 1723 1824 1711
OSWorld 2.0 (điểm một phần) Sử dụng máy tính trên các tác vụ máy tính để bàn thực tế 77.9% 72.9% 75.4% không báo cáo
OSWorld 2.0 (nghiêm ngặt) Tương tự, chỉ hoàn thành đầy đủ tác vụ 41.7% 36.1% 39.6% không báo cáo
Humanity’s Last Exam (không công cụ) Các câu hỏi suy luận cấp độ chuyên gia 60.9% 57.8% 56.6% không báo cáo
Humanity’s Last Exam (có công cụ) Tương tự, có tìm kiếm và mã hóa 65.0% 63.8% 63.6% không báo cáo
AutomationBench Quy trình làm việc kinh doanh đầu cuối 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 Các tác vụ mã hóa kiểu IDE 73.4% 70.5% 70.0% 67.2%

Anthropic cũng công bố một con số của Mythos 5.1: 60.9% trên Terminal-Bench 4.0. VentureBeat cũng báo cáo kết quả Browserbase 82% cho Fable 5.1 so với 74% cho Opus 5 và 57% cho Fable 5 trên các tác vụ tác nhân trình duyệt khó nhất; con số đó là từ các tin tức báo chí hơn là bài đăng ra mắt, vì vậy hãy cân nhắc tương ứng.

Những khoảng cách lớn

Terminal-Bench-Science 0.1: 52.6% so với 24.7% (Fable 5) và 29.0% (Opus 5). Đây là kết quả. Fable 5.1 tăng hơn gấp đôi so với phiên bản tiền nhiệm và gần gấp đôi Opus 5 trên một điểm chuẩn đặt mô hình vào một terminal với các công cụ khoa học và yêu cầu nó thực hiện nghiên cứu nhiều bước. Đây là bằng chứng rõ ràng nhất cho thấy trọng tâm được Anthropic tuyên bố về "giải quyết vấn đề dài hạn" đã tạo ra một điều gì đó có thể đo lường được. Đây cũng là điểm chuẩn phiên bản 0.1, có nghĩa là bộ tác vụ còn non trẻ và điểm số có thể sẽ thay đổi khi nó trưởng thành.

AutomationBench: 31.4% so với 17.1% (Fable 5) và 26.9% (Opus 5). Một điểm chuẩn về quy trình làm việc kinh doanh đầu cuối trên các ứng dụng, nơi các con số tuyệt đối đều thấp đối với mọi mô hình. Fable 5.1 gần gấp đôi Fable 5 ở đây và dẫn trước Opus 5 4.5 điểm. Nếu sản phẩm của bạn tự động hóa các tác vụ kinh doanh đa ứng dụng, đây là hàng cần quan tâm.

Terminal-Bench 4.0: 55.8% so với 42.0% (Fable 5). Mức tăng 13.8 điểm so với Fable 5 về mã hóa tác nhân, đây là con số mà bài đăng ra mắt của Anthropic đã đưa ra trong phần mã hóa. So với Opus 5, mức dẫn trước là 3.5 điểm. Opus 5 đã vượt qua Fable 5 trên điểm chuẩn này vào tháng 7, vì vậy lợi thế của cấp Fable so với cấp Opus về mã hóa tác nhân đã trở lại, nhưng hẹp hơn so với tháng 6. Phân tích điểm chuẩn Opus 5 có các con số của tháng 7.

GDPval-AA v2: 1853 so với 1723 (Fable 5). Mức tăng 130 Elo so với Fable 5 trong các tác vụ công việc kiến thức, và đây là điểm chuẩn mà Anthropic chỉ ra cho các tuyên bố về tài liệu, bảng tính và slide của mình. So với Opus 5, khoảng cách là 29 Elo, khá nhỏ.

Những khoảng cách nhỏ

CursorBench 3.2.0: 73.4% so với 70.5% (Fable 5) và 70.0% (Opus 5). Các tác vụ mã hóa kiểu IDE. Hơn bất kỳ mô hình nào 3 điểm. Đây là điểm chuẩn quan trọng nhất đối với số lượng lớn nhất các nhà phát triển, và đây là nơi lợi thế của Fable 5.1 mỏng nhất. Nếu khối lượng công việc của bạn là "hãy giúp tôi trong trình chỉnh sửa của tôi", bảng ra mắt không tự nó biện minh cho mức giá gấp 2 lần.

OSWorld 2.0: 77.9% / 41.7% so với 75.4% / 39.6% (Opus 5). Sử dụng máy tính. Hơn Opus 5 hai điểm trên cả hai thang điểm, hơn Fable 5 năm điểm. Có thực, nhưng không đáng kể. Lưu ý điểm nghiêm ngặt: chưa đến một nửa số tác vụ được hoàn thành đầy đủ trên bất kỳ mô hình nào. Sử dụng máy tính vẫn là lĩnh vực yếu nhất của biên giới công nghệ.

Humanity’s Last Exam: 60.9% / 65.0% so với 56.6% / 63.6% (Opus 5). Không có công cụ, dẫn trước Opus 5 4.3 điểm, đây là khoảng cách lớn nhất trong các khoảng cách nhỏ. Với công cụ, nó giảm xuống còn 1.4 điểm, bởi vì tìm kiếm và thực thi mã làm cân bằng sân chơi. Con số không công cụ là thước đo tốt hơn về khả năng suy luận thô; con số có công cụ gần hơn với cách mô hình được sử dụng.

Fable 5.1 so với GPT-5.6 Sol

Anthropic đã công bố bốn hàng với cột GPT-5.6 Sol, và Fable 5.1 dẫn đầu cả bốn: Terminal-Bench-Science 30.2 điểm, Terminal-Bench 4.0 18.5 điểm, AutomationBench 11.8 điểm, và CursorBench 6.2 điểm. GDPval-AA cho thấy 1853 so với 1711. Hai lưu ý. Đây là các thử nghiệm của Anthropic trên mô hình của đối thủ cạnh tranh, và năm hàng không có cột GPT-5.6 Sol bị thiếu vì một lý do mà Anthropic không nêu. So sánh GPT-5.6 Sol với Fable 5 của chúng tôi đã đề cập đến trận đấu trước đó; trên những con số này, Fable 5.1 mở rộng mọi khoảng cách mà Fable 5 đã có.

Những gì tin tức ra mắt đã bỏ qua

Mọi con số đều do nhà cung cấp thực hiện. Anthropic đã chạy tất cả, bao gồm cả cột của đối thủ cạnh tranh, và không có phòng thí nghiệm độc lập nào đã tái tạo được bất kỳ con số nào tại thời điểm ra mắt. Lịch sử điểm chuẩn của Anthropic nhìn chung vẫn được giữ vững, nhưng khoảng cách của CursorBench và OSWorld đủ nhỏ để một công cụ kiểm thử hoặc lựa chọn chấm điểm khác có thể đảo ngược chúng.

Mythos 5.1 là giới hạn thực sự. Thẻ hệ thống và bài đăng ra mắt của Anthropic nói rằng Fable 5.1 và Mythos 5.1 là "cùng một mô hình nhưng có các cấp độ bảo vệ khác nhau," và nó công bố Mythos 5.1 đạt 60.9% trên Terminal-Bench 4.0 so với 55.8% của Fable 5.1. Khoảng cách năm điểm đó là chi phí của các biện pháp bảo vệ đối với mã hóa tác nhân, và nó có nghĩa là "mô hình mạnh nhất được phát hành rộng rãi của Anthropic" có một người anh em tốt hơn được biết đến. So sánh Mythos 5.1 vs Fable 5.1 đề cập đến những ai có thể truy cập nó.

Mức độ nỗ lực không được nêu rõ. Tài liệu về mức độ nỗ lực của Anthropic nói rằng lợi ích của Fable 5.1 lớn nhất ở xhighmax. Bài đăng ra mắt không nói rõ mức độ nỗ lực nào đã tạo ra từng điểm số, hoặc các mô hình so sánh đã chạy ở mức độ nỗ lực nào. Vì mức độ nỗ lực là đòn bẩy chất lượng chính trên các mô hình này, việc bỏ sót thông tin đó rất quan trọng khi bạn cố gắng tái tạo một con số.

Đa ngôn ngữ không thay đổi. Anthropic tuyên bố rằng hiệu suất đa ngôn ngữ ngang bằng với Fable 5, không được cải thiện. Nếu khối lượng công việc của bạn không phải tiếng Anh, bảng ra mắt đã phóng đại mức tăng.

Các con số bảo vệ là một loại điểm chuẩn khác. Anthropic báo cáo giảm 85% các trường hợp dương tính giả sinh học trên các yêu cầu lành tính và giảm khoảng 60% các can thiệp mạng trên mỗi phiên Claude Code so với Fable 5. Những con số này được đo lường trên lưu lượng truy cập riêng của Anthropic và không thể tái tạo từ bên ngoài, nhưng đối với người dùng Fable 5 đã gặp phải sự từ chối, chúng có thể quan trọng hơn bất kỳ hàng khả năng nào.

Những gì bạn nên tự kiểm tra

Một bảng ra mắt cho bạn biết nên tìm ở đâu. Các đánh giá của bạn cho bạn biết có nên chuyển đổi hay không. Bốn thử nghiệm tương ứng với các hàng trên:

  1. Một tác vụ tác nhân dài hạn từ sản phẩm của riêng bạn, chạy đến khi hoàn thành trên Fable 5.1 ở mức high, Opus 5 ở mức xhigh, và Fable 5 ở mức high. Đây là phiên bản tương tự của Terminal-Bench-Science và AutomationBench, và đây là nơi mức giá gấp 2 lần có trả giá hay không.
  2. Mười lời nhắc mã hóa khó nhất của bạn ở cùng mức độ nỗ lực trên Fable 5.1 và Opus 5. Nếu kết quả hòa, bạn đã tái tạo câu chuyện CursorBench và Opus 5 là câu trả lời.
  3. Một lần quét mức độ nỗ lực trên riêng Fable 5.1, từ low đến max, trên một tác vụ thông thường. Tuyên bố của Anthropic là medium khớp với Fable 5 và low cạnh tranh với Opus 5 về chi phí trên mỗi tác vụ. Hãy kiểm tra điều đó.
  4. Một số lượng từ chối trên các lời nhắc bảo mật hoặc khoa học đời sống lành tính của bạn, Fable 5 so với Fable 5.1. Đó là tuyên bố 60% và 85%, và đó là điều bạn có thể xác minh trong một buổi chiều.

Xây dựng cả bốn yêu cầu này trong Apidog với modeleffort là biến môi trường, thêm các xác nhận trên stop_reason và sự hiện diện của một chuỗi dự kiến trong câu trả lời, và chạy bộ sưu tập cho từng mô hình. Lịch sử chạy cung cấp cho bạn một bảng đánh giá có thể tái tạo mà không cần bất kỳ cơ sở hạ tầng mới nào. Tải xuống Apidog để thiết lập; hướng dẫn API có các dạng yêu cầu.

Cách các điểm chuẩn liên quan đến quyết định

Câu hỏi thường gặp

Kết quả điểm chuẩn tốt nhất của Claude Fable 5.1 là gì? Terminal-Bench-Science 0.1 với 52.6%, hơn gấp đôi 24.7% của Fable 5 và vượt trội so với 29.0% của Opus 5 và 22.4% của GPT-5.6 Sol. Tất cả các số liệu đều do Anthropic cung cấp.

Fable 5.1 so sánh với Opus 5 như thế nào về mã hóa? 55.8% so với 52.3% trên Terminal-Bench 4.0 và 73.4% so với 70.0% trên CursorBench 3.2.0, theo số liệu của Anthropic. Dẫn trước có thật nhưng hẹp khoảng ba điểm.

Fable 5.1 có tốt hơn GPT-5.6 Sol không? Trên bốn điểm chuẩn mà Anthropic đã công bố cả hai, có, với chênh lệch từ 6 đến 30 điểm. Anthropic đã tự chạy các con số GPT-5.6 Sol, và năm trong chín hàng của nó không có mục GPT-5.6 Sol.

Các điểm chuẩn Fable 5.1 có được xác minh độc lập không? Không tại thời điểm ra mắt. Mọi con số đều do Anthropic thực hiện. Hãy coi chúng là những tuyên bố cần được kiểm tra trên khối lượng công việc của riêng bạn.

Mythos 5.1 đạt điểm bao nhiêu? Anthropic đã công bố một con số: 60.9% trên Terminal-Bench 4.0, cao hơn 5 điểm so với 55.8% của Fable 5.1. Hai mô hình này là một nhưng có các biện pháp bảo vệ khác nhau.

Mức độ nỗ lực nào đã tạo ra những điểm số này? Anthropic không nói rõ. Hướng dẫn của họ là lợi ích của Fable 5.1 lớn nhất ở xhighmax, vì vậy hãy giả định mức độ nỗ lực cao và mong đợi các cài đặt thấp hơn sẽ có điểm thấp hơn.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API