OpenAI đã ra mắt GPT-5.6 cho khả dụng rộng rãi vào ngày 9 tháng 7 năm 2026, và lần đầu tiên một bản phát hành GPT chủ lực ra mắt dưới dạng ba mô hình với ba mức giá riêng biệt. Sol xử lý các tác vụ suy luận khó nhất với giá 5 đô la cho mỗi triệu token đầu vào và 30 đô la cho mỗi triệu token đầu ra. Terra nằm ở phân khúc giữa với giá 2,50 đô la và 15 đô la. Luna phục vụ công việc khối lượng lớn với giá 1 đô la và 6 đô la. Đó là một mức chênh lệch gấp 5 lần từ trên xuống dưới, khiến việc lựa chọn mô hình trở thành đòn bẩy lớn nhất cho hóa đơn API của bạn trong năm nay.
Có một cái bẫy ẩn trong cách đặt tên. Bí danh đơn giản gpt-5.6 chuyển hướng đến Sol, cấp suy luận chủ lực. Sao chép một quickstart, giữ nguyên chuỗi mô hình, và mọi yêu cầu sản xuất sẽ phải trả mức giá của mô hình chủ lực cho công việc mà Luna có thể xử lý với một phần năm chi phí. Mặc định là lựa chọn đắt tiền, và không có gì trong phản hồi sẽ cảnh báo bạn.
Hướng dẫn này trình bày đầy đủ bảng giá, các ví dụ chi phí thực tế cho từng cấp, giải thích cách tính toán cache, cách nỗ lực suy luận và chế độ siêu cấp (ultra mode) thay đổi chi tiêu, và kết thúc với các mẫu định tuyến giúp giữ hóa đơn ổn định mà không làm giảm chất lượng khi cần thiết.
TL;DR
- Giá GPT-5.6 cho mỗi 1 triệu token: Sol 5 đô la đầu vào / 30 đô la đầu ra, Terra 2,50 đô la / 15 đô la, Luna 1 đô la / 6 đô la.
- Bí danh đơn giản
gpt-5.6chuyển hướng đến Sol. Hãy chỉ định rõgpt-5.6-terrahoặcgpt-5.6-lunatrừ khi bạn muốn mức giá của mô hình chủ lực theo mặc định. - OpenAI định vị Terra cạnh tranh với GPT-5.5 với giá rẻ hơn khoảng một nửa, biến nó thành mục tiêu di chuyển tự nhiên.
- Bộ nhớ đệm (Prompt caching): ghi tốn 1.25 lần mức giá đầu vào, đọc được giảm giá 90%, và thời gian sống tối thiểu của bộ nhớ đệm là 30 phút. Bộ nhớ đệm tự bù chi phí từ yêu cầu thứ hai.
- Nỗ lực suy luận cao hơn đồng nghĩa với nhiều token đầu ra hơn; chế độ siêu cấp (ultra mode) chạy bốn tác nhân song song và nhân đôi chi tiêu token một cách có chủ đích.
- Các gói ChatGPT Free và Go nhận được Terra; Plus và cao hơn có thể chọn giữa cả ba.
- So sánh các cấp độ cạnh nhau và xem mức sử dụng token mỗi yêu cầu trong Apidog trước khi bạn đưa một ID mô hình vào sản xuất.
Bảng giá GPT-5.6
Dưới đây là chi phí của mỗi mô hình cho mỗi triệu token, bao gồm cả mức giá cache được suy ra (đọc ở 10% giá đầu vào, ghi ở 125%):
| Mô hình | Đầu vào / 1 triệu | Đầu ra / 1 triệu | Đọc đầu vào đã cache / 1 triệu | Ghi cache / 1 triệu |
|---|---|---|---|---|
gpt-5.6-sol (bí danh: gpt-5.6) |
$5.00 | $30.00 | $0.50 | $6.25 |
gpt-5.6-terra |
$2.50 | $15.00 | $0.25 | $3.13 |
gpt-5.6-luna |
$1.00 | $6.00 | $0.10 | $1.25 |
Các ID mô hình đã được xác nhận trong tài liệu dành cho nhà phát triển của OpenAI, và quyền truy cập API là tự phục vụ cho bất kỳ tài khoản API nào. Không có hạn chế gói nào về phía API; hạn chế xem trước tháng 6 đã kết thúc trước khi ra mắt rộng rãi (GA) và giờ đã là quá khứ.
Một lần nữa, bởi vì nó sẽ gây khó khăn cho một ai đó trong nhóm của bạn: gpt-5.6 không có hậu tố là Sol. Nếu cấu hình, mặc định SDK, hoặc ví dụ được sao chép của bạn sử dụng bí danh trần, bạn đang trả mức giá 5 đô la/30 đô la dù nhiệm vụ có cần chúng hay không. Hãy chỉ định đầy đủ ID mô hình ở mọi nơi và làm cho lựa chọn cấp độ rõ ràng trong quá trình xem xét mã.
Ý nghĩa của việc phân cấp
Con số là thế hệ; Sol, Terra và Luna là các cấp khả năng bền vững sẽ phát triển theo tốc độ riêng của chúng. Biết được mục đích của mỗi cấp là phần lớn quyết định về chi phí.
Terra là điểm nhấn về hiệu suất giá. OpenAI định vị nó cạnh tranh với GPT-5.5 với giá rẻ hơn khoảng 2 lần. Nếu bạn đang chạy GPT-5.5 trong sản xuất hiện nay, Terra là ứng cử viên thay thế trực tiếp giúp giảm một nửa bảng giá của bạn; hãy kiểm tra chi tiêu hiện tại của bạn so với phân tích giá GPT-5.5 để ước tính mức tiết kiệm trước khi di chuyển. Coi tuyên bố về chất lượng là của OpenAI cho đến khi các đánh giá của riêng bạn xác nhận, nhưng việc giảm giá là vô điều kiện.
Luna là cấp độ dành cho khối lượng lớn. Với giá 1 đô la/6 đô la, nó được xây dựng cho việc phân loại, trích xuất, định tuyến và soạn thảo bản nháp đầu tiên: những công việc tần suất cao, nhạy cảm về độ trễ, nơi chi phí mỗi yêu cầu chiếm ưu thế hơn mọi mối quan tâm khác.
Sol dành cho những vấn đề thất bại ở các cấp khác. Suy luận sâu nhất, mức giá cao nhất. Bài đánh giá ngày ra mắt của Simon Willison đáng đọc để có cái nhìn từ góc độ người thực hành về nơi mà mô hình chủ lực xứng đáng với phí bảo hiểm của nó và nơi không.
Cả ba mô hình được cho là đều chia sẻ cửa sổ ngữ cảnh 1 triệu token và đầu ra tối đa 128K, theo tài liệu ban đầu, vì vậy bạn không đánh đổi dung lượng khi chuyển xuống một cấp. Bạn đang đánh đổi độ sâu suy luận để lấy giá.
Chi phí thực tế của các yêu cầu
Mức giá cho mỗi triệu token là trừu tượng cho đến khi bạn định giá một yêu cầu thực tế. Hãy lấy một cuộc gọi kiểu RAG điển hình: 10.000 token đầu vào (prompt hệ thống, ngữ cảnh đã truy xuất, câu hỏi người dùng) và 1.000 token đầu ra.
| Mô hình | Chi phí đầu vào | Chi phí đầu ra | Tổng cộng mỗi yêu cầu |
|---|---|---|---|
| Sol | $0.050 | $0.030 | $0.080 |
| Terra | $0.025 | $0.015 | $0.040 |
| Luna | $0.010 | $0.006 | $0.016 |
Một yêu cầu có vẻ rẻ ở mọi nơi. Khối lượng là nơi các cấp độ tách biệt. Định giá một khối lượng công việc phân loại: 1 triệu yêu cầu mỗi tháng, mỗi yêu cầu 500 token đầu vào và 50 token đầu ra. Tức là 500 triệu token đầu vào và 50 triệu token đầu ra hàng tháng.
| Mô hình | Đầu vào | Đầu ra | Tổng cộng hàng tháng |
|---|---|---|---|
| Luna | $500 | $300 | $800 |
| Terra | $1,250 | $750 | $2,000 |
| Sol | $2,500 | $1,500 | $4,000 |
Chạy khối lượng công việc đó trên bí danh gpt-5.6 trần và bạn phải trả 4.000 đô la mỗi tháng cho một công việc mà Luna làm chỉ với 800 đô la. Mặc định bí danh là một lỗi đánh máy trị giá 3.200 đô la mỗi tháng, mỗi tháng, cho đến khi ai đó đọc hóa đơn.
Kinh tế học bộ nhớ đệm, với toán học thực tế
GPT-5.6 sử dụng các điểm ngắt bộ nhớ đệm rõ ràng: bạn chọn tham gia bằng prompt_cache_options.mode: "explicit" và trường ttl, thay vì dựa vào tính năng phát hiện tiền tố tự động. Ba con số điều chỉnh kinh tế học. Ghi bộ nhớ đệm tính phí gấp 1.25 lần mức giá đầu vào không được cache. Đọc bộ nhớ đệm được giảm giá 90%. Thời gian sống tối thiểu của bộ nhớ đệm là 30 phút.
{
"model": "gpt-5.6-terra",
"input": [
{ "role": "system", "content": "You are a support triage assistant. Classify each ticket..." },
{ "role": "user", "content": "Ticket #4821: webhook retries firing twice after 502s" }
],
"prompt_cache_options": { "mode": "explicit", "ttl": "30m" }
}
Bây giờ là ví dụ thực tế. Giả sử bạn có một prompt hệ thống 5.000 token được tái sử dụng trong 100 yêu cầu trong cửa sổ bộ nhớ đệm, chạy trên Sol.
- Không cache: 100 yêu cầu x 5.000 token = 500.000 token tiền tố với giá 5 đô la cho 1 triệu = 2,50 đô la
- Đã cache: một lần ghi (5.000 token với giá 6,25 đô la cho 1 triệu = 0,031 đô la) cộng với 99 lần đọc (495.000 token với giá 0,50 đô la cho 1 triệu = 0,248 đô la) = khoảng 0,28 đô la
Đó là giảm khoảng 89% phần tiền tố của hóa đơn. Điểm hòa vốn nằm ở yêu cầu thứ hai: phí ghi premium tốn 25% của một lần không cache, trong khi mỗi lần đọc tiết kiệm 90% của một lần. Một tiền tố được sử dụng hai lần đã rẻ hơn khi được cache.
Thời hạn 30 phút có tác dụng hai chiều. Một trợ lý trò chuyện hoặc hệ thống hỗ trợ gửi yêu cầu mỗi vài phút sẽ giữ cache "nóng" miễn phí. Một công việc xử lý hàng loạt chạy mỗi đêm một lần sẽ không đạt được gì và phải trả phí ghi premium 1,25 lần cho mỗi lần khởi động lạnh; hãy tắt tính năng cache trong trường hợp đó. Cache phần tiền tố ổn định (prompt hệ thống, định nghĩa công cụ, ví dụ few-shot) và giữ phần không ổn định (đầu vào người dùng, tài liệu được truy xuất thay đổi theo mỗi yêu cầu) sau điểm ngắt.
Nỗ lực suy luận, chế độ chuyên nghiệp (pro mode) và siêu cấp (ultra)
GPT-5.6 cung cấp sáu cấp độ nỗ lực suy luận: none, low, medium, high, xhigh và max. Nỗ lực là một công cụ điều chỉnh chi phí, không chỉ là công cụ điều chỉnh chất lượng. Các cài đặt cao hơn tạo ra nhiều token đầu ra hơn cho mỗi yêu cầu, và đầu ra là hướng tốn kém: 30 đô la cho mỗi triệu trên Sol, gấp năm lần mức giá đầu vào. Hai yêu cầu với cùng một prompt có thể khác nhau vài lần về chi phí chỉ dựa trên cài đặt nỗ lực.
Hướng dẫn di chuyển của OpenAI khuyên nên coi việc chuyển đổi như một lần điều chỉnh, không chỉ là thay đổi tên mô hình: hãy đánh giá mức nỗ lực hiện tại của bạn và một cấp độ thấp hơn trên các tác vụ đại diện. Nhiều khối lượng công việc vẫn giữ chất lượng ở cài đặt thấp hơn, và khoản tiết kiệm tích lũy trên mỗi yêu cầu.
Chế độ chuyên nghiệp (Pro mode - reasoning.mode: "pro") là một cài đặt có sẵn trên cả ba mô hình, không phải là một mô hình riêng biệt với bảng giá riêng. Bạn trả cùng một mức giá mỗi token; mô hình dành nhiều token hơn để suy nghĩ, vì vậy hãy dự trù cho đầu ra lớn hơn đối với các khối lượng công việc ưu tiên chất lượng.
Chế độ siêu cấp (Ultra) là một sự phung phí có chủ đích. Nó chạy bốn tác nhân song song theo mặc định, nhân chi phí token một cách có mục đích để đổi lấy kết quả nhanh hơn và cải thiện chất lượng đáng kể: theo OpenAI, nó nâng điểm Terminal-Bench 2.1 của Sol từ 88,8% lên 91,9%. Ở mức xấp xỉ đầu tiên, hãy dự trù khoảng bốn lần số token của một lần chạy tác nhân đơn và dành nó cho công việc mà thời gian trả lời quan trọng hơn chi phí mỗi câu trả lời. Phân tích đầy đủ về khi nào chi tiêu song song đáng giá nằm trong bài giải thích về chế độ siêu cấp GPT-5.6 của chúng tôi. Ultra có mặt trong ChatGPT Work trên các gói Pro và Enterprise, và trong Codex từ gói Plus trở lên.
Những gì các gói ChatGPT nhận được
Nếu việc sử dụng GPT-5.6 của bạn mang tính hội thoại hơn là lập trình, một gói đăng ký có thể vượt trội so với API về chi phí. Dưới đây là cách quyền truy cập mô hình tương ứng với các gói:
| Gói | Truy cập GPT-5.6 |
|---|---|
| Free / Go | Terra |
| Plus | Sol, Terra, Luna; kiểm soát nỗ lực theo mô hình (Sol ở mức nỗ lực trung bình trở lên) |
| Pro / Business / Enterprise | Cả ba, cộng với Sol Pro |
| ChatGPT Work (Pro / Enterprise) | Thêm Ultra |
Người dùng Free và Go được mặc định dùng Terra là một lựa chọn mạnh mẽ; đó là cấp độ mà OpenAI so sánh với GPT-5.5. Plus là nơi xuất hiện tính năng kiểm soát nỗ lực theo mô hình, điều này quan trọng nếu bạn phụ thuộc vào Sol cho các vấn đề khó trong ChatGPT. Các nhóm lập trình đang cân nhắc giữa việc sử dụng Codex và chi tiêu API thô nên lưu ý rằng Ultra đi kèm với Codex từ Plus trở lên; phân tích giá Codex đề cập đến cách các gói đó so sánh với việc trả tiền cho mỗi token.
Các mẫu giúp giảm hóa đơn
Bảng giá thưởng cho kỷ luật định tuyến hơn là việc tinh chỉnh prompt. Các mẫu giúp thay đổi con số:
- Định tuyến theo nhiệm vụ, không theo thói quen. Luna cho phân loại, trích xuất và định tuyến; Terra là mặc định cho mọi thứ khác; Sol chỉ dành cho những vấn đề mà Terra rõ ràng thất bại. Hầu hết các nhóm đều thấy rằng phần xứng đáng với Sol là nhỏ.
- Gắn chặt các ID mô hình đầy đủ. Cấm bí danh
gpt-5.6đơn thuần trong quá trình xem xét mã. Mọi chuỗi mô hình trong cơ sở mã của bạn nên ghi rõ đã chọn cấp độ nào và tại sao. - Bộ nhớ đệm các tiền tố dài. Bất kỳ tiền tố ổn định nào trên vài nghìn token mà lặp lại trong vòng 30 phút đều nên được đặt sau một điểm ngắt rõ ràng. Toán học trên cho thấy nó tự bù chi phí từ yêu cầu thứ hai.
- Giảm mức nỗ lực xuống một cấp. Đánh giá mức nỗ lực hiện tại so với một cấp thấp hơn trước khi bạn triển khai. Đây là lời khuyên của OpenAI, và nó là khoản tiền miễn phí khi chất lượng vẫn giữ nguyên.
- Để các câu trả lời ngắn vẫn ngắn gọn. GPT-5.6 tạo ra các phản hồi ngắn gọn hơn đáng kể với ít phần giới thiệu chung chung hơn so với các thế hệ trước. Loại bỏ các cụm từ "hãy súc tích" rườm rà khỏi các prompt cũ; các hướng dẫn thừa thãi chỉ làm tăng token đầu vào để khắc phục một vấn đề không còn tồn tại.
- Đo lường trước khi cam kết. Lưu
gpt-5.6-sol,gpt-5.6-terravàgpt-5.6-lunadưới dạng biến môi trường trong Apidog, gửi cùng một yêu cầu đến từng cấp độ và đọc các trường sử dụng token trong các phản hồi cạnh nhau. Số liệu thực tế từ các prompt của riêng bạn tốt hơn bất kỳ ước tính nào trong bài viết này, bao gồm cả các bảng trên.
FAQ
GPT-5.6 có rẻ hơn GPT-5.5 không?
Điểm so sánh là Terra, mà OpenAI định vị là cạnh tranh với GPT-5.5 với giá rẻ hơn khoảng 2 lần, ở mức 2,50 đô la đầu vào và 15 đô la đầu ra cho mỗi triệu token. Sol đắt hơn Terra nhưng mang lại khả năng suy luận sâu hơn. Hãy chạy các đánh giá của riêng bạn trước khi di chuyển các khối lượng công việc nhạy cảm về chất lượng, nhưng chỉ riêng về giá, Terra đã giảm một nửa bảng giá của GPT-5.5.
ID mô hình gpt-5.6 đơn thuần tốn bao nhiêu?
Bí danh gpt-5.6 chuyển hướng đến Sol, vì vậy bạn phải trả mức giá cao nhất: 5 đô la cho mỗi triệu token đầu vào và 30 đô la cho mỗi triệu token đầu ra. Mặc định này thường làm các nhóm sao chép mã quickstart mà không thay đổi phải trả giá. Hãy chỉ định rõ gpt-5.6-terra hoặc gpt-5.6-luna khi nhiệm vụ không cần khả năng suy luận của mô hình chủ lực.
Token suy luận có được tính vào giá đầu ra không?
Có. Các cài đặt nỗ lực cao hơn tạo ra nhiều token phía đầu ra hơn, được tính theo mức giá đầu ra, là 30 đô la cho mỗi triệu trên Sol và 6 đô la trên Luna. Công cụ điều chỉnh nỗ lực là một trong những đòn bẩy chi phí lớn nhất trong GPT-5.6, vì vậy hãy đánh giá khối lượng công việc của bạn ở cấp độ hiện tại và một cấp độ thấp hơn trước khi khóa.
Cách rẻ nhất để bắt đầu thử nghiệm GPT-5.6 là gì?
Hướng các yêu cầu đầu tiên của bạn đến gpt-5.6-luna: một yêu cầu 10K đầu vào, 1K đầu ra có giá khoảng 0,016 đô la, vì vậy một buổi chiều thử nghiệm đầy đủ sẽ tốn chưa đến một đô la. Hướng dẫn sử dụng API GPT-5.6 của chúng tôi sẽ hướng dẫn bạn từng bước về xác thực, hình dạng gọi API phản hồi và lựa chọn cấp độ.
Những điều này để lại cho bạn
Hãy chọn Terra làm mặc định của bạn, định tuyến công việc khối lượng lớn xuống Luna, và giữ Sol cho những vấn đề xứng đáng với mức đầu ra 30 đô la/triệu. Thêm bộ nhớ đệm rõ ràng cho bất kỳ tiền tố nào lặp lại trong vòng 30 phút, và kiểm tra một cấp độ nỗ lực thấp hơn so với nơi bạn đang chạy hôm nay. Bốn bước này thường xuyên cắt giảm hóa đơn GPT-5.6 hơn một nửa mà không ảnh hưởng đến chất lượng.
Trước khi bất kỳ điều nào trong số đó được đưa vào sản xuất, hãy lấy số liệu thực tế từ các prompt của riêng bạn. Tải xuống Apidog, lưu ba ID mô hình làm biến môi trường, gửi cùng một yêu cầu qua mỗi cấp độ và so sánh các trường sử dụng token trong các phản hồi. Mười phút thử nghiệm song song sẽ cho bạn biết nhiều hơn về hóa đơn của bạn so với bất kỳ bảng giá nào, kể cả bảng này.
