GPT-6 Luna vs Sol vs Astra: Chọn gói theo Chi phí trên mỗi Tác vụ

Giá mỗi token cho thấy Luna rẻ hơn Astra một trăm lần. Theo từng tác vụ, dựa trên số liệu do chính OpenAI công bố, Sol với mức độ nỗ lực cao đã vượt trội hơn Astra với mức độ nỗ lực thấp, trong khi chi phí chỉ bằng khoảng một phần tư. Cách chọn gói GPT-6 dựa trên đơn vị mà bạn thực sự phải trả tiền.

INEZA Felin-Michel

INEZA Felin-Michel

23 tháng 9 2026

GPT-6 Luna vs Sol vs Astra: Chọn gói theo Chi phí trên mỗi Tác vụ

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

OpenAI đã ra mắt GPT-6 Sol và GPT-6 Luna vào ngày 22 tháng 9 năm 2026, cùng với GPT-6 Astra tạo thành một gia đình ba cấp. Điều đầu tiên hầu hết các nhóm làm là mở trang giá, thấy $0.10 cạnh Luna và $10 cạnh Astra, và kết luận rằng cấp cao nhất đắt gấp trăm lần.

Con số đó là thật và nó cũng là đơn vị sai. Bạn không đưa token vào sản xuất. Bạn đưa thành phẩm: một yêu cầu đã giải quyết, một tệp đã di chuyển, một tác vụ trình duyệt đã hoàn thành. Các mô hình suy luận tự quyết định cần bao nhiêu token, và mức độ nỗ lực bạn truyền vào làm thay đổi câu trả lời theo một bậc độ lớn. Một mô hình rẻ tiền ở mức nỗ lực tối đa có thể tốn kém hơn cho mỗi tác vụ hoàn thành so với một mô hình đắt tiền trả lời nhanh chóng.

Hướng dẫn này là phiên bản kế nhiệm GPT-6 của bài so sánh GPT-5.6 Sol vs Terra vs Luna của chúng tôi. Bài viết đó so sánh các cấp độ dựa trên giá mỗi triệu token, vốn là đơn vị phù hợp cho thế hệ đó. Bài viết này so sánh chúng dựa trên chi phí cho mỗi tác vụ, vì đó là đơn vị mà OpenAI tự sử dụng để biện minh cho các mô hình mới.

Ba cấp độ trên giấy

Mô hình API id Đầu vào $/M Đầu ra $/M Đầu vào đã lưu cache Ngữ cảnh Chỉ số thông minh AA
GPT-6 Astra xem hướng dẫn API Astra của chúng tôi $10 $50 không nêu trong bảng ra mắt không nêu chưa công bố
GPT-6 Sol gpt-6-sol $2 $10 Giảm 90% khi đọc 872k 48
GPT-6 Luna gpt-6-luna $0.10 $0.50 Giảm 90% khi đọc 1M 37

Hai điều trong bảng đó làm mọi người ngạc nhiên.

Thứ nhất, Luna có cửa sổ ngữ cảnh lớn nhất trong ba mô hình. Mô hình rẻ nhất trong dòng sản phẩm xử lý tới một triệu token, trong khi Sol dừng lại ở 872k. Nếu khối lượng công việc của bạn là “đọc nhiều, quyết định ít”, cấp độ ngân sách không phải là cấp độ bị giới hạn.

Thứ hai, hàng Astra có những chỗ trống. Bài đăng ra mắt Sol và Luna không nêu lại cửa sổ ngữ cảnh của Astra hay tỷ lệ đọc được lưu trữ của nó, và Astra không có điểm chỉ số Artificial Analysis được công bố cùng với hai mô hình còn lại. Đó là những khoảng trống trong tài liệu gốc, không phải số không.

Sol và Luna đều được mô tả là rẻ hơn 50% so với GPT-5.6, và cách diễn đạt của OpenAI là so sánh này dựa trên giá khuyến mãi của GPT-5.6. Yếu tố này quan trọng đến mức chúng tôi đã dành một phân tích riêng cho nó. So với giá niêm yết của GPT-5.6 mà chúng tôi ghi nhận vào thời điểm ra mắt, mức giảm còn lớn hơn tiêu đề.

Tại sao giá mỗi token không còn dự đoán được hóa đơn của bạn

Ba yếu tố nhân riêng biệt nằm giữa biểu giá và hóa đơn.

Token suy luận là token đầu ra. Khi một mô hình suy nghĩ trước khi trả lời, quá trình suy nghĩ đó được tính theo tỷ lệ đầu ra, gấp năm lần tỷ lệ đầu vào trên cả ba cấp độ. Một tác vụ trả về câu trả lời 200 token sau 8.000 token suy luận sẽ được tính như một câu trả lời 8.200 token.

Mức độ nỗ lực là một nút điều chỉnh, không phải là một cờ hiệu. Bảng điểm chuẩn của OpenAI báo cáo kết quả theo cài đặt nỗ lực: thấp, trung bình, cao, rất cao, tối đa. Cùng một mô hình ở mức nỗ lực tối đa và ở mức nỗ lực thấp, về mặt ngân sách, là hai sản phẩm khác nhau với hai mức giá khác nhau cho mỗi tác vụ.

Vòng lặp tác tử gửi lại lời nhắc. Một tác tử mười hai bước gửi lời nhắc hệ thống, định nghĩa công cụ và lịch sử tích lũy của nó ở mỗi bước. Khối lượng đầu vào tăng theo cấp số nhân với số bước trừ khi việc lưu cache hấp thụ nó, đó chính là lý do tại sao GPT-6 đã phát hành tính năng lưu cache cùng với các mô hình: giảm 90% khi đọc đầu vào đã lưu cache, và nỗ lực suy luận hoặc thay đổi công cụ không còn làm mất hiệu lực tiền tố.

Đặt tất cả những điều đó lại với nhau trên một tác vụ tác tử thực tế: mười hai lệnh gọi mô hình, tiền tố lời nhắc 40k token, 2k token đầu ra cho mỗi lệnh gọi. Giả sử lệnh gọi đầu tiên trả toàn bộ giá đầu vào và mười một lệnh còn lại đọc tiền tố từ cache.

Cấp độ Đầu vào chưa lưu cache Đầu vào đã lưu cache Đầu ra Chi phí cho mỗi tác vụ
Luna $0.004 $0.0044 $0.012 $0.02
Sol $0.08 $0.088 $0.24 $0.41
Astra, không áp dụng chiết khấu cache $0.40 $4.40 $1.20 $6.00
Astra, nếu có cùng chiết khấu đọc 90% $0.40 $0.44 $1.20 $2.04

Tỷ lệ đầu vào tiêu đề là 1:20:100. Khi có cache, sự chênh lệch mở rộng đến khoảng 1:20:294, hoặc nén lại còn 1:20:100 một lần nữa, hoàn toàn phụ thuộc vào tỷ lệ đọc từ cache của Astra mà bảng ra mắt không cung cấp cho chúng ta. Một ẩn số duy nhất đó làm thay đổi chi phí mỗi tác vụ của cấp cao nhất lên gấp ba lần. Hãy tìm hiểu xem nó là bao nhiêu cho tài khoản của bạn trước khi bạn lập ngân sách dựa trên Astra.

Những gì con số chi phí mỗi tác vụ của OpenAI cho thấy

Bài đăng ra mắt công bố điểm số và chi phí tương đối cùng nhau, đó là phần hữu ích. Trên AutomationBench 1.0.6:

Mô hình và nỗ lực Điểm Chi phí cho mỗi tác vụ
GPT-6 Sol, rất cao 33.2% $0.27
GPT-6 Astra, thấp 30.3% 3.9x Sol
Claude Fable 5.1 với Opus 5 dự phòng, tối đa 31.4% hơn 8.9x Sol
Claude Opus 5, tối đa 26.9% 11.1x Sol

Hãy đọc kỹ cặp đầu tiên đó. Cấp trung ở mức nỗ lực rất cao đạt điểm cao hơn 2.9 điểm so với mô hình hàng đầu ở mức nỗ lực thấp và chi phí chỉ khoảng một phần tư cho mỗi tác vụ. Với mức cơ bản $0.27, điều đó đặt Astra ở mức nỗ lực thấp gần $1.05, đây là phép tính số học dựa trên hệ số nhân của OpenAI chứ không phải con số mà OpenAI đã in.

Hình dạng tương tự lặp lại ở những nơi khác:

Hai lưu ý chân thực. Mỗi so sánh đó đều được viết dựa trên Claude Opus 5, bởi vì Anthropic đã phát hành Opus 5.5 vào cùng ngày và bài đăng của OpenAI ra đời trước đó. Và các con số của Astra trong bảng đó chỉ là một điểm dữ liệu ở mức nỗ lực thấp; OpenAI tuyên bố rõ ràng rằng Astra “tiếp tục là mô hình tốt nhất của chúng tôi trên mọi phương diện.” Không có gì ở đây nói rằng Astra thua cuộc. Nó chỉ nói rằng Astra ở mức nỗ lực thấp là một cách đắt đỏ để đạt được 30.3%.

Cấp độ bị thiếu, và cấp độ đã thay đổi

GPT-5.6 là Sol, Terra và Luna. GPT-6 là Astra, Sol và Luna. Không có GPT-6 Terra.

Đó không phải là việc đổi tên cấp trung cũ. Astra nằm trên vị trí của GPT-5.6 Sol, và GPT-6 Sol đã kế thừa vị trí trung tâm với mức giá thấp hơn đáng kể so với mức giá trước đây của tên cấp độ. Nếu mã của bạn hiện đang ghim gpt-5.6-terra, mô hình GPT-6 gần nhất theo vai trò là Sol, chứ không phải một phiên bản kế nhiệm có cùng tên. Giải thích đặt tên của chúng tôi giờ đây là lịch sử thế hệ hơn là một bản đồ hiện tại.

Sơ đồ giá cho hai tên còn sót lại:

Tên cấp độ Giá niêm yết GPT-5.6 GPT-6
Sol $5 / $30 $2 / $10
Luna $1 / $6 $0.10 / $0.50

Cùng tên, mô hình khác, kinh tế khác. Bất cứ điều gì trong cấu hình của bạn coi tên cấp độ là một mức khả năng ổn định đều cần được đọc lại.

Chọn một cấp độ

Khối lượng công việc Cấp độ Lý do
Phân loại, trích xuất, định tuyến, gắn thẻ Luna ở mức thấp hoặc trung bình Đầu ra một từ khiến token suy luận chiếm toàn bộ hóa đơn. Tỷ lệ đầu ra rẻ nhất thắng tuyệt đối.
Nhập tài liệu lớn, bảng sao chép dài, đọc toàn bộ kho lưu trữ Luna Ngữ cảnh 1M, đầu vào $0.10, và chiết khấu đọc từ cache 90% cho bất kỳ thứ gì bạn gửi hai lần.
Tác tử mã hóa, sử dụng công cụ đa bước, tự động hóa trình duyệt Sol ở mức cao hoặc rất cao Đây là dải mà các con số chi phí mỗi tác vụ được công bố của OpenAI mạnh nhất so với mọi lựa chọn thay thế trong bảng.
Tạo kiểm thử, xác thực schema, xem xét đặc tả Luna trước, Sol khi thất bại Định tuyến theo kết quả, không phải theo phỏng đoán. Thử lại các lỗi ở cấp cao hơn.
Công việc thực sự tiên phong mà câu trả lời sai tốn kém Astra Nhà cung cấp tuyên bố là tốt nhất trên mọi phương diện. Lập ngân sách cho nó như một phương án dự phòng, không phải mặc định.

Mô hình định tuyến ở hàng thứ tư là mô hình mang lại lợi nhuận. Chạy cấp độ rẻ, xác thực đầu ra theo chương trình, và chỉ leo thang những gì thất bại. Nếu Luna xử lý 80% hàng đợi với $0.02 mỗi tác vụ và Sol giải quyết phần còn lại với $0.41, chi phí hỗn hợp của bạn là khoảng $0.10, không phải $0.41.

Một chú thích về độ trễ trước khi bạn cho rằng cấp độ rẻ cũng là cấp độ nhanh. Artificial Analysis, một bên thứ ba chứ không phải nhà cung cấp, đo các biến thể suy luận tối đa ở mức 115.2 token đầu ra mỗi giây và 102.15 giây để có token đầu tiên cho Sol, và 153.9 token mỗi giây và 124.23 giây để có token đầu tiên cho Luna. Đó là các số liệu ở mức nỗ lực tối đa và sẽ không mô tả một lệnh gọi ở mức nỗ lực thấp. Chúng tôi phân tích chi tiết tác động của hai phút cho token đầu tiên đối với hợp đồng API trong bài viết về độ trễ của chúng tôi.

Đo lường nó trên lưu lượng truy cập của riêng bạn

Các con số chi phí mỗi tác vụ của nhà cung cấp đến từ các hệ thống thử nghiệm của nhà cung cấp. Của bạn sẽ khác, và sự so sánh duy nhất quyết định mọi thứ là sự so sánh được thực hiện trên các lời nhắc của bạn.

Khối sử dụng trong mỗi phản hồi chứa những gì bạn cần:

{
  "model": "gpt-6-luna",
  "usage": {
    "input_tokens": 41200,
    "input_tokens_details": { "cached_tokens": 39800 },
    "output_tokens": 2140,
    "total_tokens": 43340
  }
}

Chi phí cho lệnh gọi đó, theo tỷ lệ của Luna: 1,400 đầu vào chưa lưu cache với $0.10/M, 39,800 đã lưu cache với $0.01/M, 2,140 đầu ra với $0.50/M. Đó là $0.00014 cộng $0.000398 cộng $0.00107, hay khoảng $0.0016. Nhân với số lệnh gọi mà một tác vụ cần, không phải với số tác vụ.

Ba quy tắc giúp việc đo lường đáng tin cậy:

  1. Đếm toàn bộ tác vụ, không phải lệnh gọi. Tổng hợp việc sử dụng trên mọi bước trong một lần chạy, bao gồm các lần thử lại và những lần thất bại.
  2. Giữ nỗ lực không đổi cho mỗi hàng. Một bảng so sánh Luna-ở-mức-tối-đa với Sol-ở-mức-thấp không cho bạn biết điều gì trừ khi bạn ghi rõ trong tiêu đề.
  3. Ghi lại số lượng token đã lưu cache riêng biệt. Một lần chạy so sánh cấp độ trên bộ nhớ cache lạnh làm cho mô hình đắt tiền có vẻ tốt hơn, bởi vì lợi thế của mô hình rẻ nhất là lớn nhất trên các tiền tố lặp lại.

Trong thực tế, đây là một yêu cầu đã lưu, một biến cho id mô hình, và một khẳng định trên các trường sử dụng. Apidog xử lý hình thức này tốt: xác định lệnh gọi một lần, hoán đổi mô hình thông qua biến môi trường, và chạy bộ đó như một kịch bản để các số liệu sử dụng hiển thị trong một báo cáo thay vì ba cửa sổ terminal. Kịch bản tương tự cũng đóng vai trò kiểm tra hồi quy khi một cấp độ được định giá lại, điều mà với chu kỳ phát hành này là một vấn đề của vài tháng.

Phiên bản ngắn gọn

Theo mỗi token, Luna rẻ hơn Astra một trăm lần đối với đầu vào. Theo mỗi tác vụ, trên các điểm chuẩn được công bố của OpenAI, thứ hạng không rõ ràng như vậy: Sol ở mức nỗ lực rất cao đã vượt qua Astra ở mức nỗ lực thấp trên AutomationBench trong khi chi phí chỉ khoảng một phần tư, và Luna ở mức nỗ lực tối đa đã tiệm cận các mô hình có chi phí gấp mười lần mỗi tác vụ.

Bắt đầu với Luna, leo thang khi thất bại, dành Astra cho những công việc mà việc sai sót tốn kém hơn việc chậm trễ. Sau đó tự mình đo lường, bởi vì mọi con số ở trên đều được tạo ra trên khối lượng công việc của người khác.

Để có cái nhìn rộng hơn về cả hai lần ra mắt trong cùng 48 giờ, hãy xem tổng hợp cuộc chiến giá mô hình AI tháng 9 năm 2026 của chúng tôi.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API