Anthropic đã phát hành Claude Opus 4.8 vào ngày 28 tháng 5 năm 2026 và cung cấp nó ngay trong cùng ngày trên Claude API, ứng dụng Claude, Claude Code và các nền tảng đám mây lớn. Đây là mô hình mạnh mẽ nhất trong dòng Claude, được xây dựng cho suy luận phức tạp, mã hóa tác nhân dài hạn và công việc tự chủ cao. ID mô hình API là claude-opus-4-8.
Nếu bạn đang xây dựng trên Opus 4.7, việc nâng cấp chỉ là một thao tác thay đổi mô hình duy nhất. Thay đổi nổi bật không phải là một bậc giá mới hay cửa sổ ngữ cảnh lớn hơn; cả hai đều giữ nguyên. Đó là chất lượng. Theo thông báo của Anthropic, Opus 4.8 ít có khả năng để một lỗi trong mã không bị phát hiện gấp khoảng bốn lần so với 4.7, và nó trung thực hơn về những gì nó không biết. Hướng dẫn này bao gồm những gì đã thay đổi, cách truy cập và liệu có đáng để chuyển đổi hay không.
Phiên bản tóm tắt
Ba điểm quan trọng trong ngày đầu tiên:
- ID mô hình
claude-opus-4-8: hiện đã có trên Claude API, AWS, Vertex AI và Microsoft Foundry - Giá tương đương Opus 4.7: 5 USD cho mỗi triệu token đầu vào, 25 USD cho mỗi triệu token đầu ra ở chế độ tiêu chuẩn
- Ngữ cảnh 1 triệu token, đầu ra 128K token: không thay đổi so với 4.7, vì vậy ngân sách token của bạn được giữ nguyên
Những gì bạn nhận được thêm vào đó:
- Một tham số
effortmới giúp cân bằng giữa sự kỹ lưỡng và hiệu quả token trên toàn bộ phản hồi - Suy luận thích ứng, nơi mô hình quyết định mức độ suy luận cho mỗi yêu cầu
- Quy trình làm việc động (Dynamic Workflows) trong Claude Code, có thể khởi tạo hàng trăm tác nhân phụ song song trong một phiên
- Trung thực hơn, ít lỗi mã bị lọt và gọi công cụ hiệu quả hơn
Để biết chi tiết đầy đủ về tính toán token và các kịch bản chi phí, xem phân tích giá của Opus 4.8. Để bắt đầu xây dựng, hãy truy cập hướng dẫn API Opus 4.8.
Thực sự có gì mới trong Opus 4.8
Opus 4.8 giữ nguyên các thông số kỹ thuật của 4.7 và cải thiện mô hình bên dưới. Những cải tiến tập trung vào bốn lĩnh vực.
Chất lượng mã. Mô hình tự phát hiện lỗi thường xuyên hơn. Anthropic báo cáo số lỗi không bị phát hiện giảm khoảng 4 lần so với 4.7. Đối với mã hóa tác nhân, điều đó có nghĩa là ít lỗi ngầm trong các bản diff được tạo.

Tính trung thực và độ phù hợp. Opus 4.8 dễ dàng đánh dấu sự không chắc chắn hơn và đưa ra ít tuyên bố không được hỗ trợ hơn. Anthropic cũng báo cáo tỷ lệ lừa dối và hợp tác lạm dụng thấp hơn so với 4.7. Nếu bạn vận hành các tác nhân tự động, khả năng đánh giá đó quan trọng hơn một điểm chuẩn.
Gọi công cụ. Mô hình chọn công cụ hiệu quả hơn và lãng phí ít cuộc gọi hơn, giúp giảm cả độ trễ và chi phí token trong các vòng lặp tác nhân.
Kiểm soát nỗ lực. Đây là thay đổi lớn nhất có thể thấy được trên API và nó xứng đáng có một phần riêng.
Kiểm soát nỗ lực: một mô hình, năm cấp độ
Tham số effort cho phép bạn điều chỉnh mức độ Claude "nỗ lực" trong việc sử dụng token. Nó nằm trong output_config và chấp nhận năm cấp độ: low, medium, high, xhigh và max. Mặc định là high trên mọi giao diện, bao gồm API và Claude Code.
{
"model": "claude-opus-4-8",
"max_tokens": 4096,
"messages": [{"role": "user", "content": "Refactor this module."}],
"output_config": { "effort": "xhigh" }
}
Chi tiết quan trọng: nỗ lực ảnh hưởng đến tất cả các token, không chỉ suy luận. Điều đó bao gồm văn bản, các cuộc gọi công cụ và đối số hàm. Nỗ lực thấp hơn có nghĩa là Claude thực hiện ít cuộc gọi công cụ hơn và viết phản hồi ngắn gọn hơn. Nỗ lực cao hơn có nghĩa là phân tích sâu hơn và công việc kỹ lưỡng hơn.
Hướng dẫn của Anthropic cho Opus 4.8 là bắt đầu với xhigh cho các tác vụ mã hóa và tác nhân, giữ high làm mức tối thiểu cho hầu hết các công việc nặng về suy luận, và chỉ chuyển xuống medium hoặc low sau khi các đánh giá của bạn xác nhận rằng cấp độ thấp hơn vẫn đảm bảo chất lượng. Chi tiết đầy đủ có trong tài liệu về nỗ lực của Anthropic.
Suy luận thích ứng thay thế ngân sách thủ công
Opus 4.8 sử dụng suy luận thích ứng. Bạn đặt thinking: {type: "adaptive"} và mô hình sẽ quyết định khi nào và mức độ suy luận cho mỗi yêu cầu. Ở mức nỗ lực `high`, `xhigh` và `max`, nó hầu như luôn suy nghĩ sâu sắc. Ở các cấp độ thấp hơn, nó có thể bỏ qua việc suy nghĩ đối với các vấn đề đơn giản.
Một điều cần biết trước khi bạn di chuyển: suy luận mở rộng thủ công với budget_tokens không được hỗ trợ trên Opus 4.8 và sẽ trả về lỗi 400. Nếu bạn đã sử dụng mẫu đó từ một phiên bản Opus cũ hơn, hãy chuyển sang suy luận thích ứng cộng với tham số `effort`. Chúng tôi sẽ hướng dẫn chi tiết về cấu trúc yêu cầu trong hướng dẫn API Opus 4.8.
Quy trình làm việc động trong Claude Code
Tính năng mới nổi bật nhất được tích hợp trong Claude Code. Quy trình làm việc động (Dynamic Workflows) cho phép một phiên duy nhất khởi chạy hàng trăm tác nhân phụ song song để xử lý các tác vụ lớn, phân nhánh. Về cơ bản, đây là cấp độ nỗ lực `xhigh` kết hợp với các thông báo hệ thống giữa cuộc hội thoại, cùng một bản cập nhật API Messages hiện chấp nhận các mục nhập hệ thống ở giữa cuộc hội thoại thay vì chỉ ở đầu.
Khả năng giữa cuộc hội thoại đó là điều cho phép một tác nhân điều phối có quyền tạo ra các tác nhân con khi nhiệm vụ diễn ra. Nếu bạn muốn tìm hiểu cơ chế và cách xây dựng một chế độ điều phối tương tự thông qua API thô, hãy xem phân tích chuyên sâu về Quy trình làm việc động của Claude Code. Để có thông tin cơ bản về cách Claude Code cấu trúc các lần chạy tác nhân, phân tích kiến trúc bộ khung tác nhân của Claude Code của chúng tôi là một tài liệu khởi đầu tốt.
Những điểm nổi bật của điểm chuẩn
Các con số tiêu đề của Anthropic tập trung vào công việc của tác nhân:
- Vượt qua GPT-5.5 trên điểm chuẩn Super-Agent, bộ công cụ đo lường hoàn thành tác vụ từ đầu đến cuối
- Dẫn đầu điểm chuẩn Legal Agent và là mô hình đầu tiên vượt qua 10% tổng thể trên đó
- 84% trên Online-Mind2Web, một bài kiểm tra tác nhân điều hướng web
Đây là điểm số của tác nhân, không phải điểm số trò chuyện, điều này cho bạn biết Opus 4.8 đang nhắm đến đâu. Để so sánh trực tiếp với các mô hình tiên tiến khác, hãy đọc Opus 4.8 so với GPT-5.5 so với Gemini 3.5. So sánh cũ hơn Gemini 3.5 so với GPT-5.5 so với Opus 4.7 vẫn có giá trị cho đường cơ sở 4.7.
Opus 4.8 so với Opus 4.7: Tổng quan nhanh
| Thuộc tính | Opus 4.7 | Opus 4.8 |
|---|---|---|
| ID API | claude-opus-4-7 |
claude-opus-4-8 |
| Giá đầu vào | 5 USD / 1 triệu token | 5 USD / 1 triệu token |
| Giá đầu ra | 25 USD / 1 triệu token | 25 USD / 1 triệu token |
| Cửa sổ ngữ cảnh | 1 triệu token | 1 triệu token |
| Đầu ra tối đa | 128K token | 128K token |
| Mức độ nỗ lực | thấp đến tối đa | thấp đến tối đa |
| Lỗi mã bị lọt | cơ bản | ít hơn ~4 lần |
| Trung thực / phù hợp | cơ bản | cải thiện |
| Giới hạn kiến thức | Thg 1 năm 2026 | Thg 1 năm 2026 |
Các thông số kỹ thuật giống hệt nhau một cách có chủ đích. Bạn trả cùng một mức giá cho một mô hình ít mắc lỗi hơn, vì vậy đối với hầu hết các nhóm, việc di chuyển có rủi ro thấp. Hãy kiểm tra lược đồ công cụ và đánh giá của bạn sau khi chuyển đổi, sau đó triển khai.
Cách truy cập Claude Opus 4.8
Bạn có bốn cách truy cập chính:
- Claude API: sử dụng ID mô hình
claude-opus-4-8với endpoint Messages. Bắt đầu với hướng dẫn API Opus 4.8. - Ứng dụng Claude: đây là mô hình cao cấp mặc định tại claude.ai cho các gói trả phí, với quyền truy cập hạn chế trên gói miễn phí.
- Claude Code: có sẵn dưới dạng mô hình hàng đầu, với Quy trình làm việc động (Dynamic Workflows) khi bạn chọn chế độ nỗ lực cao.
- Nền tảng đám mây: AWS (`anthropic.claude-opus-4-8` trên Bedrock), Vertex AI (`claude-opus-4-8`) và Microsoft Foundry, nơi cửa sổ ngữ cảnh được giới hạn ở 200K token.
Nếu bạn muốn dùng thử mà không cần gói API trả phí trước, hướng dẫn cách sử dụng Opus 4.8 miễn phí bao gồm các cách hợp lệ với chi phí thấp.
Ai nên sử dụng Opus 4.8
Opus 4.8 được xây dựng cho những tác vụ khó khăn nhất. Hãy sử dụng nó khi:
- Bạn đang chạy các phiên mã hóa tác nhân dài mà một lỗi ngầm sẽ rất tốn kém
- Bạn cần một tác nhân đưa ra các quyết định sáng suốt mà không cần giám sát
- Bạn đang điều phối việc sử dụng công cụ nhiều bước và muốn giảm thiểu các cuộc gọi lãng phí
- Nhiệm vụ thực sự cần suy luận tiên tiến, không phải phân loại nhanh
Đối với khối lượng công việc lớn, nhạy cảm với độ trễ hoặc công việc đơn giản, một mô hình nhỏ hơn hoặc mức độ nỗ lực thấp hơn sẽ phục vụ bạn tốt hơn và ít tốn kém hơn. Mục đích của việc kiểm soát nỗ lực là bạn không còn phải chuyển đổi mô hình để thay đổi cách làm việc.
Kiểm tra Opus 4.8 trước khi triển khai
Việc thay đổi mô hình rất dễ thực hiện nhưng cũng dễ mắc lỗi. Các phân đoạn streaming, xác thực cuộc gọi công cụ, định dạng output_config mới và phản hồi suy luận thích ứng đều thay đổi dữ liệu mà mã của bạn phải phân tích cú pháp. Trước khi bạn đẩy claude-opus-4-8 vào sản xuất, hãy phát lại các yêu cầu thực tế của bạn với nó và so sánh đầu ra.

Apidog xử lý toàn bộ giao diện API Messages trong một không gian làm việc:
- Lưu endpoint Opus 4.8 dưới dạng yêu cầu, đính kèm `x-api-key` của bạn và nhấn Gửi
- Thay đổi `claude-opus-4-7` bằng `claude-opus-4-8` trên cùng một yêu cầu và so sánh các phản hồi
- Xem các phân đoạn streaming hiển thị trực tiếp với thời gian từng phân đoạn
- Thêm các xác nhận để phát hiện sự thay đổi lược đồ khi bạn thay đổi các mức `effort`
- Mock endpoint để bạn có thể kiểm tra mã hạ nguồn mà không tốn tín dụng
Tải xuống Apidog, hướng một yêu cầu đến endpoint Messages và dán đoạn mã curl từ hướng dẫn API. Việc thiết lập mất khoảng hai phút.
Câu hỏi thường gặp
Claude Opus 4.8 có tốt hơn Opus 4.7 không? Có, về chất lượng. Nó phát hiện lỗi mã gấp khoảng 4 lần, trung thực hơn về sự không chắc chắn và gọi công cụ hiệu quả hơn. Giá cả, cửa sổ ngữ cảnh và đầu ra tối đa là giống nhau, vì vậy có ít lý do để duy trì 4.7.
Opus 4.8 có giá bao nhiêu? 5 USD cho mỗi triệu token đầu vào và 25 USD cho mỗi triệu token đầu ra ở chế độ tiêu chuẩn. Chế độ nhanh chạy với giá 10 USD và 50 USD cho đầu ra nhanh hơn 2.5 lần. Chi tiết đầy đủ có trong phân tích giá.
Cửa sổ ngữ cảnh của Opus 4.8 là bao nhiêu? 1 triệu token đầu vào và lên đến 128K token đầu ra trên API Messages đồng bộ. API Batch hỗ trợ lên đến 300K token đầu ra với một tiêu đề beta. Trên Microsoft Foundry, cửa sổ ngữ cảnh là 200K token.
Opus 4.8 có hỗ trợ suy luận mở rộng không? Nó sử dụng suy luận thích ứng (`thinking: {type: "adaptive"}`), nơi mô hình quyết định mức độ suy luận. Suy luận thủ công `budget_tokens` không được hỗ trợ và sẽ trả về lỗi 400.
Tham số `effort` là gì? Một cài đặt bên trong `output_config` kiểm soát số lượng token mà Claude sử dụng cho văn bản, cuộc gọi công cụ và suy luận. Các cấp độ gồm `low`, `medium`, `high` (mặc định), `xhigh` và `max`.
Tôi có thể sử dụng Opus 4.8 miễn phí không? Không có bậc API miễn phí, nhưng bạn có thể dùng thử trên gói miễn phí tại claude.ai với các giới hạn, hoặc thông qua tín dụng dùng thử. Xem hướng dẫn truy cập miễn phí.
Quy trình làm việc động (Dynamic Workflows) là gì? Một tính năng của Claude Code cho phép khởi chạy nhiều tác nhân phụ song song trong một phiên, được hỗ trợ bởi mức nỗ lực `xhigh` và các thông báo hệ thống giữa cuộc hội thoại. Chi tiết trong hướng dẫn Quy trình làm việc động.
