Tính năng nổi bật của GPT-6 Astra là khả năng sử dụng máy tính. Không phải theo kiểu năm 2025, nơi một mô hình chỉ nhấp chuột qua bản demo rồi lại mắc kẹt ở một danh sách thả xuống. Trong bài đăng ra mắt của OpenAI, Astra đạt 72,6% trên OSWorld 2.0 với khoảng 40 phút mỗi tác vụ, điền biểu mẫu, cập nhật CRM, cài đặt phần mềm và chạy các kiểm tra QA giao diện người dùng trên một trang web mà nó tự xây dựng. OpenAI gọi đây là “mô hình sử dụng máy tính tốt nhất thế giới,” và lần này các bản demo đã chứng minh cho tuyên bố đó.
Nếu bạn xây dựng hoặc kiểm thử API, khả năng đó gợi ý một lối tắt hấp dẫn: hướng Astra vào ứng dụng của bạn và để nó nhấp chuột. Bài đăng này lập luận rằng bạn nên làm điều gì đó ít ấn tượng hơn nhưng hữu ích hơn. Hãy giao cho nó bản hợp đồng. Một đặc tả OpenAPI là một giao diện nhanh hơn, rẻ hơn và dễ xác minh hơn cho một mô hình so với màn hình, và một mô hình có năng lực như vậy sẽ sử dụng nó tốt. Chúng tôi đã thấy Astra tự động thực hiện chuyển đổi đó trong thử nghiệm thực tế kéo dài hai ngày của mình, và phần còn lại của bài viết này giải thích tại sao đó là lựa chọn đúng đắn và cách thiết lập nó với Apidog.
TÓM TẮT
Khả năng sử dụng máy tính của GPT-6 Astra là có thật: đạt 72,6% trên OSWorld 2.0, 92,7% trên ScreenSpot-Pro, và một khung Codex hoàn thành các tác vụ sử dụng máy tính nhanh hơn 1,9 lần so với trải nghiệm GPT-5.6 Sol. Nhưng việc điều khiển màn hình tốn hàng chục phút và nhiều token hình ảnh mỗi tác vụ, và nó kiểm tra giao diện người dùng (UI), chứ không phải API. Đối với các dịch vụ của riêng bạn, hãy cung cấp cho Astra đặc tả OpenAPI thông qua Apidog MCP Server hoặc dưới dạng các công cụ chức năng, để nó viết các kịch bản kiểm thử và chạy chúng từ Apidog CLI trong CI. Hãy giữ lại việc sử dụng máy tính cho những bề mặt không có API.
Khả năng sử dụng máy tính của GPT-6 Astra có thể làm gì
Khả năng này rộng hơn nhiều so với việc “duyệt một trang web.” OpenAI liệt kê các công việc tri thức nhàm chán (biểu mẫu trực tuyến, hồ sơ CRM, lịch), nghiên cứu và soạn thảo trong trình chỉnh sửa tài liệu, phân tích dữ liệu khoa học với biểu đồ, xây dựng và lưu trữ một trang web thông qua ChatGPT Sites, và kiểm tra QA giao diện người dùng trên trang web đó. Các bản demo bao gồm việc bố trí một bo mạch in trong KiCad và mô hình hóa một ngôi nhà trong Blender.
Các con số tiêu chuẩn, tất cả đều được OpenAI thực hiện từ bài đăng ra mắt:
| Tiêu chuẩn đánh giá | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (bộ dữ liệu ngoại tuyến, điểm một phần) | 72,6% với ~40 phút/tác vụ | 65,7% với ~75 phút/tác vụ | 70,2% |
| ScreenSpot-Pro (không công cụ) | 92,7% | 76,9% | - |
| Bài kiểm tra cuối cùng của các Agent | 59,3% | 53,6% | 55,5% |
| AutomationBench | 41,4% | 18,1% | 26,9% |
Hai chi tiết quan trọng hơn điểm số. Astra hoàn thành các tác vụ OSWorld nhanh hơn khoảng 47% thời gian so với Sol, và trong Bài kiểm tra cuối cùng của các Agent, nó sử dụng ít hơn khoảng 65% token đầu ra so với Opus 5 ở các cài đặt đạt điểm cao nhất. Cùng với mô hình, OpenAI đã cập nhật khung Codex để việc hoàn thành tác vụ sử dụng máy tính nhanh hơn 1,9 lần so với trải nghiệm Sol hiện tại trên Mind2Web. Các vòng lặp nhanh hơn đồng nghĩa với các vòng lặp rẻ hơn, đó là phần quan trọng đối với bất kỳ ai trả tiền theo mỗi token.

Hành vi cũng được cải thiện. Astra chỉ đặt những câu hỏi trọng tâm khi câu trả lời có thể thay đổi kết quả, giữ vững định hướng khi bạn điều khiển nó giữa tác vụ, và trong Codex, nó có thể đặt câu hỏi bất đồng bộ trong khi tiếp tục công việc không phụ thuộc vào phản hồi của bạn. Trên tiêu chuẩn an toàn sử dụng máy tính nội bộ của OpenAI, nơi điểm số thấp hơn là tốt hơn, Astra đạt 2,4% so với 22,0% của Sol.
Chi phí của một tác vụ 40 phút
Việc sử dụng máy tính là một vòng lặp: chụp màn hình, suy luận, thực hiện, chụp màn hình lại. Mỗi ảnh chụp màn hình là một đầu vào hình ảnh, mỗi bước đều mang theo cuộc trò chuyện cho đến thời điểm đó, và một tác vụ kéo dài 40 phút sẽ tốn hàng trăm bước. Với mức giá tiêu chuẩn của Astra là 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra, cùng với các lời nhắc (prompts) vượt quá 272K token đầu vào được tính phí 20 USD cho mỗi triệu, một phiên làm việc dài giữ toàn bộ lịch sử trong ngữ cảnh sẽ chuyển sang giá ngữ cảnh dài trước khi kết thúc. Bộ nhớ đệm lời nhắc (prompt caching) giúp xử lý các tiền tố lặp lại, với giá 1 USD cho mỗi triệu token được lưu vào bộ nhớ đệm, nhưng bản thân các ảnh chụp màn hình là mới ở mỗi bước.
So sánh điều đó với con đường hợp đồng. Đặc tả OpenAPI của bạn là một tiền tố, được lưu vào bộ nhớ đệm một lần. Mỗi kiểm thử mà mô hình viết là vài trăm token JSON. Mỗi lần chạy kiểm thử đó là một lời gọi HTTP không tốn phí về phía mô hình, bởi vì một kịch bản kiểm thử, một khi đã được viết, không cần một mô hình để thực thi nó.
Có một chi phí thứ hai không liên quan gì đến tiền bạc. Tổng quan về an toàn của OpenAI cho biết trình giám sát sai lệch sản xuất của họ “đôi khi có thể làm chậm, tạm dừng hoặc dừng công việc hợp pháp,” và nhấn mạnh “các tác vụ mà một agent đang chạy trong một khoảng thời gian dài.” Trong ChatGPT hoặc Codex, bạn sẽ được yêu cầu xem xét hành động. Trong API, tác vụ sẽ dừng lại. Một phiên điều khiển màn hình kéo dài 40 phút chính xác là loại tác vụ dễ bị gián đoạn nhất. Một lời gọi API kéo dài năm giây thì không.
Sử dụng máy tính so với hợp đồng: khi nào mỗi bên thắng thế
| Tình huống | Công cụ tốt hơn | Lý do |
|---|---|---|
| Kiểm thử API của riêng bạn | Đặc tả | Có tính xác định, chạy lại rẻ, xác nhận trên hợp đồng thực tế |
| Bộ kiểm thử hồi quy trong CI | Đặc tả | Kịch bản chạy mà không cần mô hình trong vòng lặp |
| Cổng thông tin bên thứ ba không có API | Sử dụng máy tính | Không có hợp đồng nào để giao |
| Kiểm tra QA giao diện người dùng đầu cuối trước khi phát hành | Sử dụng máy tính | Giao diện người dùng là thứ đang được kiểm thử |
| Công cụ máy tính để bàn cũ | Sử dụng máy tính | Chỉ có màn hình tồn tại |
| Kiểm tra xem tài liệu có khớp với hành vi không | Đặc tả, sau đó là giao diện người dùng | Gửi yêu cầu đã được ghi lại, so sánh phản hồi, sau đó kiểm tra ngẫu nhiên trang đã hiển thị |
Sự khác biệt nằm ở thứ bạn đang kiểm thử. Sử dụng máy tính kiểm thử các pixel. Đặc tả kiểm thử lời hứa. Khi một giao diện người dùng (frontend) bị hỏng, API thường vẫn hoạt động tốt, và khi API bị hỏng, giao diện người dùng có thể ẩn nó phía sau một lỗi thân thiện. Cả hai đều quan trọng, nhưng các đội API thực hiện lời hứa, vì vậy hãy kiểm thử lời hứa trước.
Cách giao hợp đồng API của bạn cho Astra
Có ba cách để cung cấp một đặc tả cho Astra, và chúng có thể kết hợp.
1. Cung cấp tệp. Xuất đặc tả OpenAPI từ dự án Apidog của bạn (hoặc nhập đặc tả hiện có vào Apidog trước) và đưa nó vào yêu cầu. Cửa sổ ngữ cảnh 1.050.000 token của Astra có thể chứa bất kỳ đặc tả thực tế nào trong một lời nhắc, và thử nghiệm truy xuất MRCR của OpenAI cho thấy nó giữ độ chính xác 96,3% trong khoảng 512K đến 1M, nơi Sol giảm xuống còn 73,8%. Các đặc tả lớn không còn là vấn đề chia nhỏ nữa.
2. Kết nối dự án qua MCP. Apidog MCP Server phơi bày dự án Apidog, tài liệu đã xuất bản của bạn hoặc một tệp OpenAPI cho bất kỳ máy khách hỗ trợ MCP nào, do đó Astra đọc hợp đồng hiện tại thay vì một bản xuất lỗi thời. Codex và các agent máy tính để bàn có thể kéo các định nghĩa điểm cuối khi chúng hoạt động. Đó là cấu hình cho phép Astra, trong thử nghiệm của chúng tôi, tự tìm và đọc đặc tả.
3. Biến đặc tả thành công cụ. Để sử dụng theo chương trình, hãy chuyển đổi các điểm cuối thành các công cụ chức năng và gọi Astra thông qua Responses API, mẫu mà chúng tôi đề cập trong OpenAPI to AI agent tools. Trang mô hình liệt kê việc gọi hàm, đầu ra có cấu trúc và tìm kiếm tệp trong số các tính năng của Astra, và việc gọi công cụ yêu cầu Responses API, không phải Chat Completions.
Một yêu cầu tối thiểu yêu cầu Astra soạn thảo các kịch bản kiểm thử từ một đặc tả trông như sau:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{"role": "developer", "content": "You are writing API test scenarios. Bias towards action. Only ask a question if the answer changes the test design. Output JSON matching the schema."},
{"role": "user", "content": "Here is our OpenAPI 3.1 spec. Draft a test scenario per resource: happy path, auth boundary, and one negative case each.\n\n<paste spec>"}
],
"text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
}'
Hai lưu ý từ hướng dẫn mô hình của OpenAI. Astra không có mức độ nỗ lực none hoặc minimal, vì vậy hãy bắt đầu từ low hoặc medium, và nó “dễ dàng yêu cầu làm rõ hơn” so với các mô hình trước, do đó dòng “ưu tiên hành động” trong thông báo nhà phát triển đang thực sự phát huy tác dụng.
4. Chạy các kịch bản mà không cần mô hình. Nhập các kịch bản đã tạo vào Apidog, đính kèm các xác nhận về mã trạng thái và lược đồ phản hồi, và chạy chúng từ Apidog CLI trong quy trình của bạn. Mô hình đã viết các kiểm thử một lần. CI của bạn chạy chúng hàng nghìn lần miễn phí. Đó là lập luận kinh tế trong một câu, và đó là lý do tại sao Tải Apidog nằm cạnh khóa API trong quy trình làm việc này.
Giữ các rào chắn bảo vệ, ngay cả khi Astra tôn trọng chúng
Kết quả điều chỉnh của OpenAI cho Astra là tốt nhất mà họ từng công bố. Trong thử nghiệm honeypot được xây dựng sau sự cố Hugging Face, Sol đã vượt quá mục tiêu được ủy quyền 48% thời gian và Astra thì 0%. Astra chưa bao giờ cố gắng lách qua một lần từ chối tự động xem xét của Codex, ngay cả khi lần từ chối đó được cố tình cấu hình để có thể lách được. Khả năng chống tấn công gián tiếp qua lời nhắc (prompt-injection robustness) của nó là 99,79%, tăng từ 96,23%.
Không điều nào trong số đó loại bỏ sự cần thiết của các cổng bảo vệ. Nó có nghĩa là các cổng bảo vệ sẽ ít khi được kích hoạt hơn. Một mô hình với cửa sổ 1M token, xếp hạng an ninh mạng "Critical", và khả năng gửi các yêu cầu tùy ý đến API của bạn vẫn nên được chạy trên môi trường staging với thông tin đăng nhập được giới hạn phạm vi, một cổng phê duyệt đối với các thay đổi, và theo dõi mọi lời gọi. Trình giám sát của Astra cũng có thể dừng một lần chạy giữa tác vụ, vì vậy hãy xem mỗi công việc dài là có thể tiếp tục được. Thiết kế kiểm thử cho các agent không xác định vẫn áp dụng không thay đổi: xác nhận trên hợp đồng, chứ không phải trên bản ghi.
Nơi việc sử dụng máy tính vẫn còn giá trị
Đừng hiểu điều này là “đừng bao giờ để nó nhấp chuột.” Ba trường hợp sau đây tốt hơn khi thực hiện trên màn hình. Một cổng đối tác hoặc bảng điều khiển quản trị không có API. Một kiểm tra giao diện người dùng vào ngày phát hành mà nếu không thì con người sẽ phải làm thủ công. Một công cụ máy tính để bàn cũ mà giao diện người dùng là bề mặt duy nhất. Astra là mô hình đầu tiên mà những công việc đó đáng để giao phó, và việc tăng tốc của khung Codex làm cho chúng đủ rẻ để chạy hàng đêm.
Quy tắc thực tế: tìm đến hợp đồng khi có hợp đồng, và tìm đến màn hình khi không có.
Câu hỏi thường gặp
Khả năng sử dụng máy tính của GPT-6 Astra có hoạt động qua API không? Có. Khả năng sử dụng máy tính được liệt kê trong số các công cụ được hỗ trợ của Astra trên Responses API, cùng với tìm kiếm web, tìm kiếm tệp, trình thông dịch mã và tạo hình ảnh. Ứng dụng của bạn cung cấp môi trường và thực thi các hành động mà mô hình đề xuất. API cũng thực hiện các biện pháp bảo vệ nghiêm ngặt hơn của OpenAI: một tác vụ bị tạm dừng bởi trình giám sát sai lệch sẽ dừng lại thay vì chờ xem xét.
Tôi có thể cung cấp đặc tả lớn đến mức nào? Cửa sổ ngữ cảnh là 1.050.000 token với 128.000 token đầu ra. Một đặc tả với hàng trăm điểm cuối và lược đồ đầy đủ vẫn vừa vặn. Các lời nhắc vượt quá 272K token đầu vào được tính phí gấp đôi tỷ lệ đầu vào và bộ nhớ đệm, vì vậy hãy lưu tiền tố đặc tả vào bộ nhớ đệm và giữ các thông báo kiểm thử riêng lẻ nhỏ.
Liệu nó có tạo ra các điểm cuối không có trong đặc tả không? Ít hơn các mô hình trước đây. Tiêu chuẩn đánh giá ảo giác nội bộ của OpenAI, nơi điểm thấp hơn là tốt hơn, cho thấy Astra đạt 4,2% so với 12,2% của Sol, và nó ít có khả năng xuyên tạc khả năng của chính mình gấp ba lần. Đầu ra có cấu trúc cộng với một lần chạy đã được xác thực lược đồ trong Apidog sẽ phát hiện phần còn lại, đó là lý do tại sao kiểm thử hợp đồng là lời cuối cùng, chứ không phải mô hình.
Việc này có rẻ hơn GPT-5.6 Sol cho việc tạo kiểm thử không? Theo mỗi token, không. Astra có giá 10 USD và 50 USD cho mỗi triệu token so với giá khuyến mãi của Sol là 4 USD và 20 USD. Theo mỗi tác vụ hoàn thành, OpenAI tuyên bố Astra sử dụng ít token hơn nhiều, và quy trình làm việc ưu tiên đặc tả khiến chi phí mô hình trở thành chi phí một lần. Hãy đo lường nó trên đặc tả của riêng bạn trước khi quyết định; hướng dẫn API chỉ ra cách so sánh cả hai song song.
Phiên bản tóm tắt
GPT-6 Astra có thể điều khiển máy tính của bạn, và đối với những bề mặt không có API, đó là một món quà thực sự. Đối với API bạn sở hữu, màn hình là con đường chậm. Hãy giao bản hợp đồng cho mô hình, để nó viết các kịch bản, chạy chúng trong CI, và giữ các cổng bảo vệ. Astra đã tự mình đưa ra kết luận đó trong vòng hai mươi phút. Nhóm của bạn có thể bắt đầu từ đó.
