So sánh GPT-5.6 Sol và Claude Fable 5: Đánh giá trung thực

GPT-5.6 và Claude Fable 5: một so sánh trung thực, do nhà cung cấp công bố về điểm chuẩn, giá cả và các giao diện API, cộng với cách tự kiểm tra cả hai trên khối lượng công việc của riêng bạn.

Ashley Innocent

Ashley Innocent

10 tháng 7 2026

So sánh GPT-5.6 Sol và Claude Fable 5: Đánh giá trung thực

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

GPT-5.6 của OpenAI đã chính thức ra mắt vào ngày 9 tháng 7 năm 2026, sau hai tuần xem trước giới hạn, và phiên bản hàng đầu Sol của nó đã ra mắt với những con số tuyên bố giành vương miện tác tử (agentic crown). Claude Fable 5 của Anthropic đã giữ danh hiệu "mô hình mạnh nhất" ở phía đối diện kể từ đầu tháng 6. Nếu bạn đang chọn một mô hình chủ lực cho công việc thực sự trong quý này, bạn hiện có hai câu trả lời đáng tin cậy và một chồng các tiêu đề mâu thuẫn.

Đây là phần mà hầu hết các so sánh đều bỏ qua: không mô hình nào thắng hoàn toàn, và chính số liệu của các nhà cung cấp cũng nói lên điều đó. Theo báo cáo ra mắt của OpenAI, Sol dẫn đầu các điểm chuẩn tác tử rộng lớn với biên độ rộng. Cùng báo cáo đó cho thấy Claude Fable 5 dẫn trước SWE-Bench Pro gần 16 điểm. Bất kỳ so sánh nào tuyên bố một người chiến thắng chung cuộc đều đang bán cho bạn một thứ gì đó.

nút

Vì vậy, bài viết này sẽ không làm điều đó. Dưới đây là phân tích điểm chuẩn với mọi con số được ghi nhận, ý nghĩa của phân tích đó đối với công việc bạn làm, giá cả của cả hai bên, sự khác biệt về giao diện API và hướng dẫn đưa ra quyết định. Chúng tôi đã đề cập GPT-5.6 Sol là gì trong một bài giải thích riêng, và thông báo chính thức về GPT-5.6 là nguồn chính cho các tuyên bố của OpenAI.

Phán quyết ngay từ đầu

Công việc cần làm Lựa chọn mạnh hơn hiện tại Bằng chứng
Thực hiện tác vụ tác tử rộng GPT-5.6 Sol Agents’ Last Exam ~53 so với 46.9 của GPT-5.5, theo OpenAI
Kỹ thuật phần mềm chuyên sâu Claude Fable 5 SWE-Bench Pro 80.3% so với 64.6% của Sol, theo biểu đồ của OpenAI
Công việc tác tử điều khiển qua terminal GPT-5.6 Sol, dẫn trước sát nút Terminal-Bench 2.1: 88.8%, 91.9% với ultra, theo OpenAI
Giá niêm yết thấp nhất trên mỗi token GPT-5.6 Sol 5 USD / 30 USD cho 1 triệu token so với 10 USD / 50 USD công bố của Fable 5
Thực thi đa tác tử song song tích hợp GPT-5.6 Thiết lập ultra chạy bốn tác tử song song theo mặc định
Một mô hình thắng mọi thứ Không có Mô hình đó hiện chưa tồn tại

Một lưu ý bao trùm toàn bộ bảng: mọi số liệu điểm chuẩn đều do nhà cung cấp báo cáo, được công bố khi ra mắt và chưa được tái kiểm tra độc lập. Hãy coi đây là bản đồ các tuyên bố, không phải bảng xếp hạng đã được xác nhận. Điểm chuẩn duy nhất giải quyết được mọi thứ là khối lượng công việc của riêng bạn, và chúng tôi sẽ chỉ ra cách chạy song song khối lượng đó trong Apidog gần cuối bài.

Phân tích điểm chuẩn, theo OpenAI

Ba con số định nghĩa sự so sánh này, và cả ba đều đến từ tài liệu ra mắt của OpenAI. Việc này có ý nghĩa hai chiều, vì vậy hãy giữ nó trong tầm mắt.

Điểm chuẩn GPT-5.6 Sol Claude Fable 5 Nguồn
Agents’ Last Exam ~53 (báo cáo dao động từ 52.7 đến 53.6) Thấp hơn Sol khoảng 13 điểm OpenAI, ngày ra mắt
SWE-Bench Pro 64.6% 80.3% OpenAI, ngày ra mắt
Terminal-Bench 2.1 88.8% (91.9% với ultra) Không được nêu trong biểu đồ của OpenAI OpenAI, ngày ra mắt

Về Agents’ Last Exam, OpenAI báo cáo Sol đạt khoảng 53, tăng từ 46.9 của GPT-5.5 và vượt trội khoảng 13 điểm so với Claude Fable 5. Đó là một bước nhảy vọt thế hệ thực sự trên một điểm chuẩn được xây dựng xung quanh các tác vụ tác tử dài, nhiều bước, và đó là con số mà OpenAI đã dẫn đầu.

Về SWE-Bench Pro, bức tranh đảo ngược. Biểu đồ so sánh của OpenAI cho thấy Claude Fable 5 đạt 80.3% so với 64.6% của Sol. Đáng khen ngợi: việc công bố một mức thua 15.7 điểm trong tài liệu ra mắt của chính bạn là điều bất thường, và nó làm cho phần còn lại của biểu đồ dễ được xem xét nghiêm túc hơn. Nó cũng phù hợp với những gì SWE-Bench Pro đo lường, đó là giải quyết các vấn đề kỹ thuật phần mềm khó, trong kho lưu trữ thực từ đầu đến cuối.

Terminal-Bench 2.1 làm tròn trịa trường hợp của Sol. OpenAI báo cáo 88.8% cho Sol tiêu chuẩn và 91.9% khi ultra phân tán công việc trên bốn tác tử song song. Lưu ý rằng con số ultra là một chế độ thực thi khác với mức chi tiêu token cao hơn một cách cố ý, không phải cùng một mô hình suy nghĩ khó khăn hơn.

Hai kiểm tra tính trung thực trước khi bạn xem xét bất kỳ điều gì trong số này. Thứ nhất, đây là các tuyên bố vào ngày ra mắt từ nhà cung cấp có nhiều lợi ích nhất; chưa ai bên ngoài OpenAI tái tạo chúng, và các lựa chọn công cụ đánh giá có thể làm thay đổi điểm số. Thứ hai, các điểm chuẩn đơn lẻ nén rất nhiều thông tin. Bài viết đầu tiên của Simon Willison là một bài đọc độc lập hữu ích về bản phát hành, và phân tích điểm chuẩn GPT-5.6 Sol của chúng tôi đi sâu vào chi tiết những gì mỗi thử nghiệm đo lường.

Ý nghĩa của sự phân chia

Mẫu hình trong ba con số đó không phải ngẫu nhiên. Nó phác thảo hai chuyên môn khác nhau.

Ưu thế của Sol là sự rộng lớn. Agents’ Last Exam và Terminal-Bench đều thưởng cho một mô hình có thể lập kế hoạch qua nhiều bước, điều phối công cụ, phục hồi từ lỗi và hoàn thành các tác vụ đa dạng. Nếu khối lượng công việc của bạn giống như các đội tác tử xử lý vé, chạy nghiên cứu, tự động hóa vận hành hoặc các quy trình điều khiển qua terminal, thì số liệu của OpenAI cho rằng Sol là người chạy mạnh hơn.

Ưu thế của Fable 5 là chiều sâu. SWE-Bench Pro là thước đo công khai gần nhất cho câu hỏi "mô hình này có thể thực hiện kỹ thuật phần mềm khó, thực tế trong một cơ sở mã hiện có mà không cần con người gỡ rối sau đó hay không." Khoảng cách 15.7 điểm ở đó, được đối thủ thừa nhận, không phải là nhiễu ngay cả sau khi tính toán sai số rộng rãi. Nếu khối lượng công việc của bạn là refactor quy mô kho lưu trữ, gỡ lỗi phức tạp, hoặc các lần chạy kỹ thuật dự án đơn lẻ dài, thì đó là con số nên là điểm tựa mặc định của bạn.

Điều đó có nghĩa là câu hỏi đúng không phải là "mô hình nào tốt hơn." Mà là "công việc nào trong hai công việc này giống công việc của tôi hơn." Lựa chọn theo tổng hợp bảng xếp hạng sẽ tối ưu hóa cho một khối lượng công việc mà bạn không có.

So sánh giá cả

OpenAI đã công bố giá GA rõ ràng cho cả ba cấp độ GPT-5.6. Giá Fable 5 của Anthropic dưới đây là những gì đã được công bố khi ra mắt; hãy xác nhận tỷ giá hiện tại trên trang giá của Anthropic trước khi bạn lập ngân sách, vì các điều khoản truy cập đã chuyển sang tín dụng sử dụng cho người đăng ký vào tháng Bảy.

Mô hình Đầu vào trên 1 triệu token Đầu ra trên 1 triệu token
gpt-5.6-sol (bí danh gpt-5.6 trỏ đến đây) 5.00 USD 30.00 USD
gpt-5.6-terra 2.50 USD 15.00 USD
gpt-5.6-luna 1.00 USD 6.00 USD
claude-fable-5 10.00 USD (đã công bố; xác minh) 50.00 USD (đã công bố; xác minh)

Trên bảng giá, Sol có giá bằng một nửa Fable 5 trên mỗi token ở cả hai chiều. Đó là một khoảng cách đáng kể, nhưng giá niêm yết là một yếu tố dự đoán yếu về chi phí của một tác vụ. Hai mô hình token hóa khác nhau, tạo ra độ dài đầu ra khác nhau cho cùng một lời nhắc và tiêu tốn lượng suy luận khác nhau để đạt được câu trả lời. Một mô hình rẻ hơn trên mỗi token và lắm lời hơn trên mỗi tác vụ vẫn có thể ngang bằng.

Bộ nhớ đệm càng thu hẹp khoảng cách ở cả hai phía. GPT-5.6 hỗ trợ các điểm ngắt bộ nhớ đệm rõ ràng với ghi bộ nhớ đệm được tính phí 1.25 lần tỷ lệ đầu vào không được đệm, đọc bộ nhớ đệm được giảm giá 90% và thời gian tồn tại bộ nhớ đệm tối thiểu 30 phút. Bộ nhớ đệm lời nhắc của Fable 5 cũng giảm giá 90% cho các lần truy cập bộ nhớ đệm, điều này quan trọng gấp đôi ở mức cơ bản cao hơn của nó. Phân tích giá Claude Fable 5 của chúng tôi bao gồm những nơi mà các khoản tiết kiệm đó xuất hiện trong thực tế. Dù bằng cách nào, con số cần theo dõi là chi phí cho mỗi tác vụ hoàn thành, không phải chi phí trên một triệu token.

Sự khác biệt về giao diện API

Cả hai công ty hiện cung cấp nhiều hơn một điểm cuối hoàn thành trò chuyện, và các hình dạng khác nhau đủ để ảnh hưởng đến lựa chọn.

Giao diện của GPT-5.6, theo tài liệu dành cho nhà phát triển của OpenAI, tập trung vào kiểm soát và điều phối bên trong API Responses:

Claude Fable 5 nằm ở đầu dòng Claude 5, được giới thiệu cùng với Claude Mythos 5 trong thông báo của Anthropic. Giao diện công bố của nó bao gồm một cửa sổ ngữ cảnh 1 triệu token làm mặc định, lên đến 128K token đầu ra trên mỗi yêu cầu, và một tham số dự phòng phía máy chủ có thể chuyển hướng một yêu cầu bị từ chối an toàn đến Claude Opus 4.8 bên trong cùng một lệnh gọi API. Anthropic giới thiệu mô hình này cho các công việc suy luận đòi hỏi và tác vụ tác tử dài hạn, và nó có một bộ công cụ tác tử riêng xung quanh Claude Code và các quy trình công việc tác tử phụ. Bài giải thích về Claude Fable 5 của chúng tôi bao gồm toàn bộ thông số kỹ thuật.

Các cửa sổ ngữ cảnh gần như ngang bằng: 1M của Fable 5 đã được xác nhận, và các báo cáo tài liệu ban đầu cũng cho thấy GPT-5.6 ở mức 1M, mặc dù trang thông số kỹ thuật của OpenAI nên là nguồn thông tin chính xác nhất cho điều đó. Sự khác biệt lớn hơn nằm ở triết lý. OpenAI đang phơi bày các nguyên thủy điều phối (song song, gọi công cụ theo chương trình, các nút điều chỉnh nỗ lực) dưới dạng các tính năng API hạng nhất. Anthropic đang cung cấp một công cụ mô hình đơn sâu với hệ thống đường ống đáng tin cậy xung quanh nó. Không có cách tiếp cận nào sai; chúng ánh xạ đến cùng một sự phân chia rộng-chuyên-sâu mà các điểm chuẩn đã chỉ ra.

Hướng dẫn quyết định thực tế

Loại bỏ những thông tin ồn ào khi ra mắt, sự lựa chọn sẽ được thu gọn lại thành một vài câu hỏi.

Chọn GPT-5.6 Sol làm mặc định khi:

Chọn Claude Fable 5 làm mặc định khi:

Hãy chạy cả hai khi có thể. Đây là các API HTTP với SDK trưởng thành, và việc định tuyến theo loại tác vụ (Sol cho các luồng nặng về điều phối, Fable 5 cho các luồng nặng về kỹ thuật) là một kiến trúc bình thường vào năm 2026, chứ không phải là một kiến trúc kỳ lạ.

Thử nghiệm cả hai trên khối lượng công việc của riêng bạn

Các điểm chuẩn của nhà cung cấp đã giúp bạn có một danh sách rút gọn gồm hai. Lời nhắc của riêng bạn nên đưa ra quyết định cuối cùng, và việc này mất một buổi chiều, không phải một cuộc chạy nước rút.

Cả hai mô hình đều có thể truy cập qua HTTP đơn giản: GPT-5.6 qua API Responses của OpenAI và Fable 5 qua API Messages của Anthropic. Trong Apidog, hãy lưu mỗi mô hình dưới dạng một môi trường riêng với URL cơ sở, tiêu đề xác thực và ID mô hình làm biến. Sau đó, xây dựng một bộ sưu tập yêu cầu với 10 đến 20 lời nhắc được lấy từ khối lượng công việc thực tế của bạn, các vé, khác biệt và chuỗi gọi công cụ mà bạn xử lý hàng tuần, và chạy bộ đó đối với từng môi trường.

So sánh hai điều trên mỗi lời nhắc. Thứ nhất, chất lượng phản hồi, được đánh giá bởi người sở hữu khối lượng công việc đó. Thứ hai, các trường sử dụng trong mỗi phần thân phản hồi, bởi vì số lượng token nhân với bảng giá sẽ cho bạn biết chi phí thực sự trên mỗi tác vụ, nơi giả định "Sol rẻ bằng một nửa" được kiểm tra đối với các đầu ra ngắn gọn hơn hoặc dài hơn của Fable 5 trên dữ liệu của bạn. Nếu các tác tử của bạn sẽ điều phối các công cụ nội bộ, hãy mô phỏng các điểm cuối công cụ đó trước để cả hai mô hình lập kế hoạch dựa trên các phản hồi giống hệt, ổn định. Một giờ bằng chứng song song tốt hơn bất kỳ biểu đồ ra mắt nào.

Câu hỏi thường gặp

GPT-5.6 Sol có tốt hơn Claude Fable 5 không?

Trong một số công việc, theo số liệu ra mắt của OpenAI. Sol dẫn đầu Agents’ Last Exam khoảng 13 điểm, trong khi Fable 5 dẫn đầu SWE-Bench Pro 15.7 điểm trên cùng một biểu đồ. Không có người chiến thắng duy nhất trung thực. Hãy ghép mô hình với công việc: chạy tác vụ tác tử rộng ưu tiên Sol, kỹ thuật phần mềm chuyên sâu ưu tiên Fable 5.

Mô hình nào rẻ hơn để chạy?

Bảng giá của Sol bằng một nửa giá công bố của Fable 5: 5 USD / 30 USD cho 1 triệu token so với 10 USD / 50 USD (hãy xác minh tỷ giá Anthropic hiện tại trước khi lập ngân sách). Chi phí thực tế phụ thuộc vào việc token hóa, độ dài đầu ra và bộ nhớ đệm, vì vậy hãy đo lường chi phí cho mỗi tác vụ hoàn thành trên các lời nhắc của riêng bạn trước khi coi khoảng cách 2 lần là cố định.

Tôi có thể sử dụng cả hai mô hình trong một sản phẩm không?

Có, và nhiều nhóm làm điều đó. Cả hai đều là API HTTP tiêu chuẩn, vì vậy bạn có thể định tuyến các luồng nặng về điều phối đến Sol và các luồng nặng về kỹ thuật đến Fable 5 phía sau một giao diện. Hướng dẫn của chúng tôi về cách sử dụng API Claude Fable 5 bao gồm phía Anthropic, bao gồm xác thực và hình dạng yêu cầu.

Những con số điểm chuẩn này có được xác minh độc lập không?

Không. Mọi số liệu trong bài viết này đều do nhà cung cấp báo cáo từ tài liệu ra mắt ngày 9 tháng 7 của OpenAI, bao gồm kết quả SWE-Bench Pro nơi Fable 5 thắng. Các bản tái tạo độc lập thường xuất hiện trong vòng vài tuần sau khi phát hành GA. Cho đến lúc đó, hãy coi tất cả là tuyên bố và ưu tiên việc kiểm tra của riêng bạn cao hơn.

Sự so sánh quan trọng là của bạn

Phán quyết phân chia là phát hiện, không phải là sự trốn tránh. Biểu đồ ra mắt của OpenAI trao cho Sol vương miện về sự rộng lớn của tác tử và Fable 5 vương miện kỹ thuật phần mềm, và cả hai công ty đều đã phát hành những mô hình hàng đầu thực sự, có thể sử dụng được trong vòng vài tuần. Lựa chọn theo bảng xếp hạng tổng hợp bỏ qua biến số duy nhất quyết định kết quả của bạn: khối lượng công việc của bạn trông như thế nào.

Vì vậy, hãy chạy thử nghiệm. Lấy 15 lời nhắc thực tế từ công việc tuần trước, tải xuống Apidog, thiết lập cả hai API làm môi trường và so sánh chất lượng cũng như chi phí cho mỗi tác vụ trên dữ liệu của riêng bạn. Bạn sẽ có một câu trả lời đáng tin cậy trước khi bản tái tạo điểm chuẩn độc lập đầu tiên được phát hành.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API