OpenAI đã phát hành GPT-6 Astra vào ngày 3 tháng 9 năm 2026, đầu tiên cho một số tổ chức giới hạn và sau đó, trong những ngày tiếp theo, cho mọi người dùng ChatGPT Plus, Pro, Business và Enterprise, OpenAI API, Microsoft Azure và AWS Bedrock. ID mô hình là gpt-6-astra, nó có cửa sổ ngữ cảnh 1.050.000 token, và OpenAI gọi đây là “mô hình tốt nhất cho kỹ thuật phần mềm tính đến thời điểm hiện tại.” Đây cũng là mô hình đầu tiên OpenAI đánh giá là Critical về khả năng an ninh mạng, điều này định hình cách nó hoạt động trong API.
Đây là hướng dẫn thực tế. Nó bao gồm ID mô hình và các điểm cuối, yêu cầu đầu tiên của bạn, năm cấp độ nỗ lực suy luận, bảng giá đầy đủ bao gồm các mức giá cho ngữ cảnh dài và chế độ Nhanh, những thay đổi làm phá vỡ tích hợp GPT-5.6 Sol, và liệu mức giá cao hơn 2.5 lần so với mức giá khuyến mãi của Sol có đáng giá hay không. Trang mô hình của OpenAI là nguồn thông tin chính thức cho các số liệu dưới đây. Để biết cảm giác khi làm việc với nó, hãy đọc trải nghiệm thực tế hai ngày của chúng tôi; bài viết này tập trung vào API.
Tóm tắt
- ID mô hình
gpt-6-astra, một phiên bản duy nhất. Hỗ trợ Chat Completions, Responses, và Batch. Không có Realtime, không có Assistants, không có tinh chỉnh. Gọi công cụ cần API Responses. - Cửa sổ ngữ cảnh 1.050.000 token, đầu ra tối đa 128.000 token, thời điểm cắt kiến thức ngày 30 tháng 4 năm 2026. Đầu vào văn bản và hình ảnh, đầu ra văn bản.
- Giá tiêu chuẩn: $10 đầu vào, $1 đọc từ bộ đệm, $12.50 ghi vào bộ đệm, $50 đầu ra cho mỗi triệu token. Lời nhắc vượt quá 272K token đầu vào sẽ được tính phí $20 / $2 / $75. Batch và Flex có giá giảm một nửa. Chế độ Nhanh có giá gấp đôi.
- Mức độ nỗ lực suy luận:
low,medium,high,xhigh,max.nonevàminimalđã bị loại bỏ. - Những thay đổi so với Sol:
temperature,top_p, và logprobs đã bị loại bỏ;prompt_cache_retentiontrở thànhprompt_cache_options.ttl. - GPT-5.6 Sol có giá $4 / $20 theo chương trình khuyến mãi kéo dài ít nhất đến ngày 21 tháng 11 năm 2026, vì vậy Astra có giá cao hơn 2.5 lần ở cả hai phía.
GPT-6 Astra sơ lược
| Mục | Giá trị |
|---|---|
| ID mô hình | gpt-6-astra |
| Cửa sổ ngữ cảnh | 1.050.000 token |
| Đầu ra tối đa | 128.000 token |
| Thời điểm cắt kiến thức | 30 tháng 4 năm 2026 |
| Chế độ | Đầu vào: văn bản, hình ảnh. Đầu ra: văn bản |
| Điểm cuối | Chat Completions, Responses, Batch |
| Không hỗ trợ | Realtime, Assistants, tinh chỉnh |
| Tính năng | Truyền phát, đầu ra có cấu trúc, gọi hàm, tìm kiếm tệp, tìm kiếm web, bộ nhớ đệm lời nhắc, đầu vào hình ảnh |
| Công cụ tích hợp sẵn | Sử dụng máy tính, tìm kiếm web, tìm kiếm tệp, trình thông dịch mã, tạo hình ảnh |
| Mức độ nỗ lực suy luận | low, medium, high, xhigh, max |
| Giới hạn tốc độ (Bậc 5) | 15.000 RPM, 40.000.000 TPM |
| Cũng có sẵn trên | Microsoft Azure, AWS Bedrock; OpenRouter dưới dạng openai/gpt-6-astra |
| Xử lý dữ liệu | Không lưu giữ dữ liệu cho khách hàng API đủ điều kiện |
Không gian làm việc Enterprise có Astra bị tắt mặc định; quản trị viên phải bật nó. Trên ChatGPT, việc sử dụng Astra được tính vào lượng sử dụng gói đăng ký hiện có, và các gói Pro, Business, và Enterprise cũng nhận được GPT-6 Astra Pro.

Yêu cầu đầu tiên của bạn
API Responses là giao diện chính, và nó là bắt buộc đối với các công cụ. Một cuộc gọi Python tối thiểu:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
reasoning={"effort": "medium"},
input=[
{"role": "developer", "content": "Bạn là một kỹ sư API cấp cao. Ưu tiên hành động. Chỉ hỏi khi câu trả lời có thể thay đổi kết quả."},
{"role": "user", "content": "Đánh giá hoạt động OpenAPI này để tìm các lỗ hổng xác thực và xác minh, sau đó đề xuất ba trường hợp kiểm thử."},
],
)
print(response.output_text)
print(response.usage)
Yêu cầu tương tự trong curl:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."
}'
Chat Completions vẫn hoạt động cho văn bản thuần túy: thay đổi điểm cuối và hình dạng tin nhắn, và loại bỏ bất kỳ trường temperature hoặc top_p nào, điều mà hướng dẫn của OpenAI khuyên nên làm. Ngay khi bạn cần gọi hàm hoặc một công cụ tích hợp sẵn, hãy chuyển sang Responses. Hướng dẫn API Responses của chúng tôi bao gồm chi tiết về hình dạng yêu cầu.
Thông điệp của nhà phát triển quan trọng hơn trước đây. Hướng dẫn mô hình của OpenAI nói rằng Astra “dễ dàng yêu cầu làm rõ hơn” so với các phiên bản tiền nhiệm và khuyến nghị yêu cầu nó ưu tiên hành động. Nó cũng “nhạy cảm hơn với các hướng dẫn có trong kỹ năng” và các tệp đính kèm khác, vì vậy hãy nêu rõ rằng hướng dẫn của người dùng thắng thế khi chúng xung đột. Và nó mặc định là danh sách và bảng; nếu bạn muốn văn xuôi, hãy yêu cầu nó.
Mức độ nỗ lực suy luận: năm cấp độ, không có “none”
GPT-5.6 hiển thị sáu cấp độ nỗ lực từ none đến max. Astra hiển thị năm cấp độ: low, medium, high, xhigh, và max. Lời khuyên di chuyển của OpenAI là trực tiếp: nếu bạn đang chạy none hoặc minimal hiện tại, hãy chuyển sang low và đánh giá. Mọi cài đặt khác giữ nguyên.
Việc loại bỏ đó thay đổi phần chi phí thấp trong khối lượng công việc của bạn. Luna ở mức none là tùy chọn hoàn thành cổ điển nhanh trong dòng GPT-5.6, và không có phiên bản tương đương ở Astra. Astra là một mô hình suy luận ở mọi cài đặt, đó là lý do tại sao việc chuyển công việc máy móc sang GPT-5.6 Terra hoặc Luna và dành Astra cho các cuộc gọi khó khăn vẫn là mô hình hợp lý.
Ở phía đối diện, max là nơi các điểm chuẩn ra mắt được chạy (“điểm đánh giá là tối đa ở mọi mức độ nỗ lực”) và nơi Artificial Analysis đo được thời gian để có token đầu tiên hơn bảy phút trong lần chạy ở mức nỗ lực tối đa của họ. Dự trù cho độ trễ trước khi dự trù cho token.
Chi phí của GPT-6 Astra
Mỗi triệu token, từ trang giá của OpenAI:
| Bậc | Đầu vào | Đầu vào được lưu vào bộ đệm | Đầu ra |
|---|---|---|---|
| Tiêu chuẩn | $10.00 | $1.00 | $50.00 |
| Tiêu chuẩn, ngữ cảnh dài (hơn 272K đầu vào) | $20.00 | $2.00 | $75.00 |
| Batch / Linh hoạt | $5.00 | $0.50 | $25.00 |
| Batch, ngữ cảnh dài | $10.00 | $1.00 | $37.50 |
| Chế độ Nhanh | $20.00 | $2.00 | $100.00 |
| Chế độ Nhanh, ngữ cảnh dài | $40.00 | $4.00 | $150.00 |
Ghi vào bộ nhớ đệm tính phí $12.50 cho mỗi triệu. Chế độ Nhanh mang lại “tốc độ xử lý lên tới gấp 2 lần so với Tiêu chuẩn với giá gấp 2 lần giá Tiêu chuẩn.”
Để so sánh, dòng GPT-5.6 hiện tại:
| Mô hình | Đầu vào | Đầu vào được lưu vào bộ đệm | Đầu ra |
|---|---|---|---|
| GPT-5.6 Sol (khuyến mãi kéo dài ít nhất đến ngày 21 tháng 11 năm 2026) | $4.00 | $0.40 | $20.00 |
| GPT-5.6 Terra | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Luna | $0.20 | $0.02 | $1.20 |
Giá niêm yết của Sol là $5 và $30; mức giá $4 và $20 đã được áp dụng từ ngày 21 tháng 8 và OpenAI cho biết nó sẽ kéo dài ít nhất đến ngày 21 tháng 11. So với đó, Astra có giá cao hơn 2.5 lần ở đầu vào và 2.5 lần ở đầu ra. So với giá niêm yết của Sol, nó cao hơn 2 lần và 1.67 lần.
Một ví dụ minh họa. Một tác vụ tác nhân đọc ảnh chụp mã nguồn 200.000 token một lần, tái sử dụng nó như một tiền tố được lưu vào bộ nhớ đệm qua 30 cuộc gọi, và ghi tổng cộng 60.000 token đầu ra:
- Astra: $2.00 cho lần đọc đầu tiên, sau đó 29 lần đọc từ bộ nhớ đệm với giá $0.20 mỗi lần ($5.80), cộng thêm $3.00 đầu ra. Tổng cộng khoảng $10.80.
- Sol đang khuyến mãi: $0.80 cho lần đọc đầu tiên, $2.32 cho các lần đọc từ bộ nhớ đệm, $1.20 đầu ra. Tổng cộng khoảng $4.32.
Tỷ lệ này giữ ở mức 2.5 lần. Điều OpenAI lập luận, và điều bạn nên đo lường, là Astra hoàn thành trong ít cuộc gọi hơn và ít token đầu ra hơn. Trên Terminal-Bench 4.0, nó tuyên bố chi phí mỗi tác vụ thấp hơn khoảng 9% so với Sol mặc dù tỷ lệ cao hơn, và ít hơn khoảng 65% token đầu ra so với Claude Opus 5 trên Agents’ Last Exam. Nếu những điều đó đúng với khối lượng công việc của bạn, hóa đơn mỗi tác vụ có thể ngang bằng. Nếu không, bạn phải trả 2.5 lần.
Hai đòn bẩy giúp giảm hóa đơn. Ngưỡng 272K là điều cần chú ý: một lời nhắc vượt quá ngưỡng đó sẽ tăng gấp đôi tỷ lệ đầu vào và bộ nhớ đệm, vì vậy hãy cắt bớt đầu ra của công cụ và lưu vào bộ nhớ đệm tiền tố tĩnh. Và Batch giảm một nửa mọi thứ cho công việc có thể chờ đợi.
Di chuyển từ GPT-5.6 Sol: những gì bị phá vỡ
OpenAI đã công bố một danh sách ngắn, và nó đáng để hiểu theo nghĩa đen.
- Các tham số lấy mẫu đã biến mất. Loại bỏ
temperature,top_p, vàtop_logprobs. Trên Chat Completions cũng loại bỏlogprobs; trên Responses, loại bỏmessage.output_text.logprobskhỏiinclude. Hướng dẫn của OpenAI là hãy loại bỏ chúng thay vì dựa vào việc API bỏ qua chúng, vì vậy hãy tìm kiếm trong mã client của bạn. - Mức sàn nỗ lực là
low. Mọi cài đặtnonehoặcminimalđều chuyển sanglow. - Việc giữ lại bộ nhớ đệm đã thay đổi hình dạng. Thay thế
prompt_cache_retentionbằngprompt_cache_options.ttlđược đặt thành"30m". Chế độ lưu bộ nhớ đệm rõ ràng mà bạn đã thiết lập cho GPT-5.6 sẽ được giữ nguyên. - Công cụ cần Responses. Chat Completions được hỗ trợ cho văn bản, nhưng gọi hàm và các công cụ tích hợp sẵn nằm trên API Responses.
- Lời nhắc muốn bạn ít rào đón hơn và nó chủ động hơn. Thêm dòng ưu tiên hành động, tuyên bố rằng hướng dẫn của người dùng được ưu tiên hơn các tệp kỹ năng, và yêu cầu văn xuôi nơi giao diện người dùng của bạn mong đợi văn xuôi.
Không có gì trong danh sách này chạm đến đầu ra có cấu trúc hoặc định nghĩa hàm, vì vậy một lược đồ hoạt động trên Sol cũng hoạt động trên Astra. Thay đổi hành vi mà hầu hết các nhóm nhận thấy đầu tiên là việc đặt câu hỏi: một lời nhắc của Sol từng chạy hoàn tất giờ đây có thể dừng lại với một câu hỏi làm rõ. Trả lời nó trong thông điệp của nhà phát triển ngay từ đầu và nó sẽ ngừng hỏi.
Liệu có đáng giá gấp 2.5 lần Sol?
Đối với công việc tác nhân và ngữ cảnh dài, các con số ra mắt cho thấy là có. Tất cả các số liệu dưới đây đều do OpenAI thực hiện, ở mức nỗ lực tốt nhất cho mỗi mô hình:
| Điểm chuẩn | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| FrontierCode 1.1 Extended | 64.5% | 60.6% | 63.6% |
| Các tác vụ di chuyển cơ sở dữ liệu nội bộ | 63.9% | 42.7% | 57.8% |
| OSWorld 2.0 | 72.6% | 65.7% | - |
| MRCR v2 8-needle, 512K đến 1M | 96.3% | 73.8% | - |
| GPQA Diamond | 96.0% | 94.6% | 93.7% |
| Humanity’s Last Exam (với công cụ) | 57.2% | - | 65.0% |
Khoảng cách về Terminal-Bench và di chuyển cơ sở dữ liệu là những điều quan trọng đối với các nhà phát triển: hơn Sol 20 điểm trong công việc đầu cuối tác nhân, và điểm truy xuất ngữ cảnh dài khiến cửa sổ 1M có thể sử dụng được thay vì chỉ trên danh nghĩa. Khoảng cách DeepSWE nhỏ, và Claude Fable 5.1 vẫn dẫn đầu trong Humanity’s Last Exam gần tám điểm, vì vậy đây không phải là một chiến thắng hoàn toàn. Trên chỉ số độc lập của Artificial Analysis, Astra đứng thứ hai trong số 202 mô hình. Phân tích điểm chuẩn Fable 5.1 của chúng tôi có mặt khác của sự so sánh đó.
Nơi Sol giữ vững vị trí của mình: các cuộc gọi ngắn, khối lượng lớn nơi mức sàn nỗ lực và tỷ lệ 2.5 lần chiếm ưu thế, và bất cứ điều gì cần độ trễ kiểu none. Nơi Astra chứng tỏ giá trị của nó: các tác vụ tác nhân dài, ngữ cảnh toàn bộ kho lưu trữ, sử dụng máy tính và bất kỳ tác vụ nào mà chế độ lỗi của Sol là trôi dạt hoặc từ bỏ.
Kiểm tra việc chuyển đổi trước khi triển khai
Việc di chuyển đủ nhỏ để thực hiện trong một buổi chiều và đủ quan trọng để đo lường. Trong Apidog, hãy giữ ID mô hình dưới dạng biến môi trường để cùng một yêu cầu đã lưu chạy với gpt-5.6-sol và gpt-6-astra chỉ với một công tắc. Thêm các xác nhận trên usage.input_tokens, usage.output_tokens, và số lượng token được lưu vào bộ nhớ đệm, sau đó gửi một tập hợp tác vụ đại diện qua cả hai và so sánh tổng số; đó là câu trả lời cho câu hỏi 2.5 lần bằng lưu lượng truy cập của riêng bạn thay vì biểu đồ ra mắt.
Hai kiểm tra nữa thuộc cùng một dự án. Gửi một yêu cầu vẫn chứa temperature và ghi lại những gì trả về, để bạn tìm hiểu hành vi trong một thử nghiệm thay vì trong môi trường sản xuất. Và xác nhận rằng một lời nhắc dài vẫn dưới 272K token đầu vào, vì vượt qua ngưỡng đó sẽ âm thầm tăng gấp đôi tỷ lệ. Lên lịch tập hợp này như một hồi quy và Tải Apidog nếu bạn chưa có; hướng dẫn API GPT-5.6 cho thấy cùng một cấu hình trên thế hệ trước.
Câu hỏi thường gặp
ID mô hình GPT-6 Astra là gì? gpt-6-astra, với một phiên bản duy nhất. Nó cũng được hiển thị thông qua Azure và AWS Bedrock, và trên OpenRouter dưới dạng openai/gpt-6-astra.
GPT-6 Astra có hỗ trợ tinh chỉnh hay API Realtime không? Không. Trang mô hình liệt kê Chat Completions, Responses, và Batch là được hỗ trợ, còn Realtime, Assistants, và tinh chỉnh thì không được hỗ trợ.
Cửa sổ ngữ cảnh và đầu ra tối đa là bao nhiêu? 1.050.000 token đầu vào và 128.000 token đầu ra. Lời nhắc trên 272K token đầu vào được tính phí theo tỷ lệ ngữ cảnh dài.
Tại sao yêu cầu của tôi thất bại sau khi chuyển từ Sol? Rất có thể là do temperature hoặc top_p còn sót lại, mức độ nỗ lực none, hoặc prompt_cache_retention. Astra đã loại bỏ cả ba; xem danh sách di chuyển ở trên.
Một yêu cầu có thể tự dừng không? Có. OpenAI chạy một bộ giám sát sai lệch trên các yêu cầu sử dụng công cụ, và trong API, một tác vụ bị gắn cờ sẽ dừng lại thay vì tạm dừng để xem xét. Các tác vụ tác nhân dài là dễ bị ảnh hưởng nhất, vì vậy hãy làm cho chúng có thể tiếp tục được. Bài đăng về ngưỡng an ninh mạng Critical giải thích các biện pháp bảo vệ đằng sau hành vi đó.
Nên làm gì trong tuần này
Chuyển một khối lượng công việc tác nhân sang gpt-6-astra trên API Responses, loại bỏ các tham số lấy mẫu, đặt mức nỗ lực thành medium, và đo lường token và thời gian thực tế so với Sol trên cùng một đầu vào. Nếu chi phí mỗi tác vụ tương đương hoặc tốt hơn, hãy di chuyển phần còn lại. Nếu không, bạn sẽ có một con số cụ thể, điều mà hầu hết các nhóm sẽ không có được vào thứ Sáu.
