Nếu bạn đã chuyển khối lượng công việc của một tác nhân sang GPT-6 Astra vào đầu tháng 9, đến nay bạn đã có hóa đơn ba tuần và bạn đã biết bản chất của vấn đề. Astra tính phí 10 đô la cho mỗi triệu token đầu vào và 50 đô la cho mỗi triệu token đầu ra. Một vòng lặp chạy dài với một lời nhắc hệ thống lớn và một schema công cụ đính kèm sẽ đốt cháy số tiền đó nhanh hơn bất kỳ bảng tính nào dự đoán.
Vào ngày 22 tháng 9, OpenAI đã phát hành GPT-6 Sol với giá 2 đô la và 10 đô la. Cùng một dòng mô hình, cùng một bề mặt API, nhưng giá chỉ bằng một phần năm trên mỗi dòng hóa đơn.
Đây là sự di chuyển. Điều gì thay đổi trong mã của bạn, gần như không có gì. Điều gì thay đổi trong hóa đơn của bạn, đó là tất cả. Và phần mà hầu hết các bài đưa tin trong ngày ra mắt đã bỏ qua: OpenAI vẫn nói Astra là mô hình tốt hơn, và bài so sánh trực tiếp giữa hai mô hình được công bố không phải là sự so sánh như vẻ ngoài của nó.
Tóm tắt
gpt-6-astrasanggpt-6-sollà việc hoán đổi chuỗi mô hình cho hầu hết các trình gọi. Cửa sổ ngữ cảnh, đầu ra tối đa, điểm cuối, công cụ tích hợp, tính năng được hỗ trợ và các tầng giới hạn tốc độ đều giống hệt nhau.- Mọi mức giá đều giảm chính xác 5 lần: đầu vào từ 10 đô la xuống 2 đô la, đầu vào đã lưu trong bộ nhớ cache từ 1 đô la xuống 0.20 đô la, ghi vào bộ nhớ cache từ 12.50 đô la xuống 2.50 đô la, đầu ra từ 50 đô la xuống 10 đô la. Hóa đơn của bạn sẽ giảm năm lần bất kể tỷ lệ token.
- Sol bổ sung nỗ lực suy luận
none. Nó cũng hạn chế gọi hàm Chat Completions chỉ vớireasoning_effort: "none", đây là thay đổi duy nhất có thể làm hỏng một tích hợp đang hoạt động. - Thời điểm cắt dữ liệu của Sol là ngày 20 tháng 4 năm 2026. Của Astra là ngày 30 tháng 4 năm 2026.
- OpenAI nói rằng Astra "tiếp tục là mô hình tốt nhất của chúng tôi trên mọi phương diện." Thử nghiệm so sánh Sol với Astra được công bố chạy Astra ở mức
lowso với Sol ở mứcxhigh, vì vậy nó đo lường hiệu quả chi phí, chứ không phải giới hạn khả năng.
Bảng giá
Cả hai bộ giá đều đến từ các trang mô hình của OpenAI, gpt-6-astra và gpt-6-sol, được đọc vào ngày 23 tháng 9 năm 2026.
| Chỉ số, mỗi 1 triệu token | GPT-6 Astra | GPT-6 Sol | Thay đổi |
|---|---|---|---|
| Đầu vào | $10 | $2 | Rẻ hơn 5 lần |
| Đầu vào đã lưu trong bộ nhớ cache | $1 | $0.20 | Rẻ hơn 5 lần |
| Ghi vào bộ nhớ cache | $12.50 | $2.50 | Rẻ hơn 5 lần |
| Đầu ra | $50 | $10 | Rẻ hơn 5 lần |
Các yếu tố sửa đổi hóa đơn trùng khớp trên cả hai mô hình. Các lời nhắc trên 272K token đầu vào sẽ được tính phí gấp 2 lần tỷ lệ đầu vào và bộ nhớ cache, và 1.5 lần tỷ lệ đầu ra cho toàn bộ yêu cầu. Chế độ Batch và Flex giảm một nửa giá. Chế độ Fast tăng gấp đôi, và trên Astra nó không có SLA độ trễ.

Vì cả bốn mức giá đều giảm theo cùng một hệ số, bạn không cần phải mô hình hóa tỷ lệ token của mình để dự đoán mức tiết kiệm. Lấy một ví dụ cụ thể về khối lượng công việc của một tác nhân: 10,000 yêu cầu mỗi ngày, mỗi yêu cầu có 30,000 token tiền tố đã lưu trong bộ nhớ cache, 10,000 token đầu vào mới và 3,000 token đầu ra.
| Thành phần | Token hàng ngày | Astra | Sol |
|---|---|---|---|
| Đầu vào đã lưu trong bộ nhớ cache | 300M | $300 | $60 |
| Đầu vào mới | 100M | $1,000 | $200 |
| Đầu ra | 30M | $1,500 | $300 |
| Tổng cộng | $2,800 | $560 |
Dù bạn chuyển đổi tỷ lệ token theo hướng đầu ra, hướng bộ nhớ cache, hay chạy ở ngữ cảnh 272K và trả phí nhân cho lời nhắc dài: tỷ lệ vẫn giữ nguyên ở mức năm.
Về quy mô tại sao điều đó quan trọng, OpenAI báo cáo rằng các nhà nghiên cứu của họ chi hơn 600 đô la mỗi ngày cho các tác nhân lập trình, với mức phần trăm thứ 90 là 7,000 đô la mỗi ngày. Chia những con số đó cho năm và số lượng thử nghiệm mà một nhóm có thể thực hiện sẽ thay đổi. Ngữ cảnh rộng hơn cho cả hai lần ra mắt nằm trong bài phân tích cuộc chiến giá mô hình AI tháng 9 năm 2026 của chúng tôi.
Một điều kiện cần lưu ý: OpenAI mô tả Sol rẻ hơn 50% so với GPT-5.6, và sự so sánh này là với giá khuyến mãi của GPT-5.6, đây là từ ngữ của chính OpenAI. So với mức giá niêm yết của GPT-5.6 mà chúng tôi đã ghi nhận vào thời điểm đó trong bài viết về giá GPT-5.6 của chúng tôi, mức giảm còn lớn hơn. So với Astra, nó giảm thẳng 5 lần.
Những gì vẫn giữ nguyên
Đây là phần giúp việc di chuyển trở nên rẻ tiền.
| GPT-6 Astra | GPT-6 Sol | |
|---|---|---|
| ID mô hình | gpt-6-astra |
gpt-6-sol |
| Cửa sổ ngữ cảnh | 1,050,000 | 1,050,000 |
| Token đầu vào tối đa | 922,000 | 922,000 |
| Token đầu ra tối đa | 128,000 | 128,000 |
| Phương thức | văn bản, hình ảnh vào; văn bản ra | văn bản, hình ảnh vào; văn bản ra |
| Điểm cuối | Chat Completions, Responses, Batch | Chat Completions, Responses, Batch |
| Không được hỗ trợ | Thời gian thực, Trợ lý, tinh chỉnh, nhúng, âm thanh | giống nhau |
| Công cụ tích hợp | tìm kiếm web, tìm kiếm tệp, tạo hình ảnh, trình thông dịch mã, shell được lưu trữ, áp dụng bản vá, kỹ năng, sử dụng máy tính, MCP, tìm kiếm công cụ | danh sách tương tự |
| Tính năng | streaming, đầu ra có cấu trúc, gọi hàm, tìm kiếm tệp, đầu vào hình ảnh, tìm kiếm web, bộ nhớ đệm lời nhắc | danh sách tương tự |
| Giới hạn tốc độ Tier 5 | 15,000 RPM, 40M TPM | 15,000 RPM, 40M TPM |
| Ảnh chụp nhanh | gpt-6-astra |
gpt-6-sol |
Cửa sổ ngữ cảnh là điểm nổi bật. Sol không phải là một mô hình có ngữ cảnh ngắn hơn: nó mang cùng cửa sổ 1,050,000 token và cùng giới hạn đầu vào 922,000 token như Astra. Không có gì liên quan đến việc phân đoạn, ngân sách truy xuất hoặc chiến lược nén của bạn phải thay đổi.
Những gì thực sự thay đổi trong mã của bạn
Bốn điều, theo thứ tự có thể gây ra vấn đề.
1. Gọi hàm Chat Completions. Trên Astra, Chat Completions hoạt động và gọi công cụ yêu cầu API Responses. Trên Sol, Chat Completions chỉ hỗ trợ gọi hàm khi reasoning_effort là "none". Nếu bạn đang gọi công cụ qua Chat Completions với bất kỳ nỗ lực nào khác, yêu cầu đó sẽ ngừng hoạt động như trước. Hướng dẫn GPT-6 của OpenAI nói rằng nên sử dụng Responses để suy luận với các công cụ. Nếu bạn đã sử dụng Responses, điều này sẽ không tốn gì cho bạn.
2. Mức độ nỗ lực none. Astra hỗ trợ từ low đến max. Sol hỗ trợ tất cả những mức đó cộng với none, đây là đòn bẩy giúp nó khả thi cho công việc phân loại và trích xuất, nơi các token suy luận là chi phí không cần thiết. Mặc định trên cả hai là medium.
3. Thời điểm cắt dữ liệu. Astra được huấn luyện đến ngày 30 tháng 4 năm 2026, Sol đến ngày 20 tháng 4 năm 2026. Mười ngày là nhỏ, nhưng nếu một lời nhắc giả định kiến thức từ cuối tháng 4, hãy kiểm tra giả định đó.
4. Các tham số không được hỗ trợ. Bất cứ khi nào nỗ lực suy luận không phải là none, các tham số temperature, top_p và top_logprobs phải không có mặt, và Chat Completions cũng loại bỏ logprobs. Astra cũng áp dụng quy tắc tương tự, vì vậy một tích hợp Astra "sạch" đã tuân thủ. Điều này chỉ quan trọng nếu bạn chuyển sang reasoning_effort: "none" trên Sol và muốn đặt lại temperature.
Đây là ví dụ trước và sau cho một cuộc gọi Responses điển hình. Sự khác biệt chỉ là một dòng.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
- model="gpt-6-astra",
+ model="gpt-6-sol",
reasoning={"effort": "xhigh"},
tools=[{"type": "function", "name": "run_api_test", "parameters": {...}}],
input=[
{"role": "developer", "content": "You are a senior API engineer. Bias towards action."},
{"role": "user", "content": "Read this OpenAPI operation and propose three negative test cases."},
],
)
Lưu ý mức độ nỗ lực trong ví dụ đó. Chuyển sang Sol và giữ nguyên mức độ nỗ lực không phải là sự di chuyển thú vị. Chuyển sang Sol và tăng mức độ nỗ lực mới thú vị, bởi vì bạn có ngân sách gấp năm lần để chi cho các token suy luận với cùng một số tiền.
Những gì bạn phải từ bỏ
Hãy trung thực về phần này, bởi vì các con số ra mắt rất dễ bị hiểu sai.
OpenAI nói rằng Astra vẫn là mô hình tốt hơn. Bài đăng ra mắt nêu rõ rằng Astra "tiếp tục là mô hình tốt nhất của chúng tôi trên mọi phương diện." Đó là cách nhà cung cấp tự định hình bản phát hành mới của mình, và đó là câu cần trích dẫn cho bất kỳ ai nói với bạn rằng Sol thay thế Astra.
Bài so sánh trực tiếp được công bố không phải là so sánh khả năng. Trên AutomationBench 1.0.6, Sol ở mức xhigh đạt 33.2% với chi phí 0.27 đô la mỗi tác vụ, và Astra ở mức low đạt 30.3% với chi phí gấp 3.9 lần Sol mỗi tác vụ. Hãy đọc kỹ mức độ nỗ lực. Sol được đẩy lên mức cao nhất, Astra được đẩy xuống mức thấp nhất. Điều mà cặp này chứng minh là giới hạn của Sol vượt qua mức sàn của Astra với chi phí chỉ bằng khoảng một phần tư mỗi tác vụ, đây là một kết quả thực tế và hữu ích. Nó không nói gì về Sol ở mức xhigh so với Astra ở mức max. Không có số liệu được công bố nào bao gồm sự so sánh đó. Nếu khối lượng công việc của bạn là một nơi mà Astra ở mức nỗ lực cao cuối cùng đã làm cho nó hoạt động, Sol là một thử nghiệm, không phải là một sự thay thế.
Độ trễ ở mức cao nhất. Artificial Analysis đã đo biến thể suy luận tối đa của GPT-6 Sol ở mức 115.2 token đầu ra mỗi giây với thời gian đến token đầu tiên là 102.15 giây. Con số này là từ bên thứ ba, không phải từ OpenAI, và nó mô tả cụ thể biến thể max, vì vậy nó không cho bạn biết medium hoặc none hoạt động như thế nào. Hãy coi đó là một cảnh báo rằng mô hình rẻ tiền không tự động là mô hình nhanh ở mức nỗ lực cao, và hãy tự đo lường mức độ nỗ lực của bạn thay vì thừa hưởng con số đó.
Tính khả dụng. Sol hiện có mặt trên ChatGPT Work và Codex dành cho người dùng Plus, Pro, Business, Enterprise và Edu, và chưa có trong Chat. API đã sẵn sàng; giao diện Chat thì chưa.
Đối với những gì Astra làm để duy trì vị trí của nó trong ngăn xếp, bài kiểm tra thực tế hai ngày của chúng tôi, bài viết về việc sử dụng máy tính và giải thích ngưỡng mạng quan trọng đều có giá trị, và bảng thông số kỹ thuật đầy đủ có trong hướng dẫn API GPT-6 Astra của chúng tôi.
Quyết định bằng các yêu cầu của riêng bạn, không phải bằng các điểm chuẩn
AutomationBench không chạy các lời nhắc của bạn. Sự so sánh duy nhất để giải quyết một lần di chuyển là cùng một bộ yêu cầu, được gửi đến cả hai ID mô hình, được chấm điểm theo tiêu chí của riêng bạn. Thiết lập điều đó một lần và nó sẽ tự trả tiền cho mọi lần ra mắt trong tương lai. Trong Apidog, đặt ID mô hình vào một biến môi trường, lưu yêu cầu một lần và chuyển đổi môi trường để định lại mục tiêu:
{
"model": "{{MODEL_ID}}",
"reasoning": { "effort": "xhigh" },
"input": [
{ "role": "user", "content": "{{TEST_PROMPT}}" }
]
}
Xây dựng một kịch bản thử nghiệm từ 20 hoặc 30 lời nhắc sản xuất thực tế, thêm các xác nhận cho định dạng phản hồi mà trình phân tích cú pháp của bạn phụ thuộc vào (output_text hiện diện, các đối số gọi công cụ hợp lệ so với JSON Schema của bạn, không bị cắt bớt ở max_output_tokens), sau đó chạy hai lần, mỗi lần cho một môi trường. Apidog ghi lại nội dung và thời gian đã trôi qua cho mỗi yêu cầu, vì vậy bạn có được độ chính xác và độ trễ song song mà không cần viết một bộ điều khiển. Khối usage trên mỗi phản hồi cung cấp cho bạn số lượng token để định giá so sánh một cách chính xác.
Hai xác nhận đáng được thêm vào cụ thể cho lần di chuyển này: kiểm tra xem các cuộc gọi công cụ vẫn đến nếu bạn đang sử dụng Chat Completions, và đánh giá trên lời nhắc chậm nhất của bạn thay vì lời nhắc trung bình, bởi vì rủi ro độ trễ nằm ở mức nỗ lực cao trên các đầu vào dài.
Danh sách kiểm tra di chuyển
- Xác nhận bạn đang sử dụng API Responses ở bất cứ nơi nào bạn gọi công cụ. Nếu bạn gọi công cụ qua Chat Completions, hãy chuyển đổi trước khi chuyển đổi mô hình.
- Hoán đổi
gpt-6-astrathànhgpt-6-solvà để mọi thứ khác giữ nguyên cho lần chạy đầu tiên. - Chạy lại bộ hồi quy của bạn chống lại cả hai ID và so sánh sự khác biệt của các đầu ra, không chỉ các mã trạng thái.
- Hãy thử tăng một bước nỗ lực suy luận trên Sol. Giờ đây bạn có ngân sách cho điều đó.
- Kiểm tra lại bất kỳ lời nhắc nào phụ thuộc vào kiến thức từ cuối tháng 4 năm 2026.
- Giữ một đường dẫn Astra đằng sau một cờ cho các tác vụ mà khả năng vượt trội là điều bạn đang trả tiền.
Tổng kết
Astra sang Sol là một lần di chuyển hiếm hoi mà bề mặt API không thay đổi, cửa sổ ngữ cảnh không thu nhỏ, và giá giảm theo một hệ số cố định trên mọi chỉ số. Công việc không nằm ở mã nguồn. Nó nằm ở việc bạn chạy hai mươi lời nhắc qua cả hai mô hình để tìm ra liệu tác vụ khó nhất của bạn có đang sử dụng khả năng vượt trội của Astra hay chỉ đơn thuần là trả tiền cho nó.
Hãy thực hiện so sánh đó trước khi bạn bật cờ, và hãy luôn ghi nhớ câu nói của chính OpenAI khi bạn đọc kết quả: Astra vẫn là mô hình tốt nhất của họ. Sol là mô hình bạn có thể đủ khả năng để cho chạy liên tục.
