Hướng dẫn sử dụng API GPT-5.6: Sol, Terra, và Luna

Học cách sử dụng API của GPT-5.6: ID mô hình Sol, Terra và Luna, các yêu cầu đầu tiên bằng Python và curl, nỗ lực suy luận, bộ nhớ đệm cho prompt và kiểm thử chi phí.

Ashley Innocent

Ashley Innocent

10 tháng 7 2026

Hướng dẫn sử dụng API GPT-5.6: Sol, Terra, và Luna

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

OpenAI đã phát hành GPT-5.6 rộng rãi vào ngày 9 tháng 7 năm 2026, và quyền truy cập API là tự phục vụ: bất kỳ tài khoản API nào cũng có thể gọi nó ngay hôm nay, không cần danh sách chờ và không giới hạn kế hoạch. Bản xem trước giới hạn đã kết thúc vào đầu tháng 7 đã là quá khứ. Điều thay đổi đối với các nhà phát triển là hình thức của chính đợt ra mắt. Thay vì một mô hình, bạn có ba: Sol, Terra và Luna, mỗi loại có mức giá riêng, cộng thêm sáu cấp độ nỗ lực suy luận và các điều khiển bộ nhớ đệm lời nhắc rõ ràng. Điều đó đòi hỏi nhiều quyết định hơn một lần thay đổi mô hình thông thường, và các cài đặt mặc định bạn chọn trong tuần đầu tiên có xu hướng duy trì. Hướng dẫn này sẽ trình bày các ID mô hình và khi nào mỗi loại phát huy tác dụng, yêu cầu đầu tiên của bạn trong Python và curl, nỗ lực suy luận, thiết lập bộ nhớ đệm, giao diện API Phản hồi mới và cách di chuyển từ GPT-5.5 mà không gặp bất ngờ. Nếu bạn muốn tìm hiểu toàn bộ thông tin nền tảng về cấp độ cao cấp trước, tổng quan về GPT-5.6 Sol bao gồm vị trí và điểm chuẩn; bài viết này tập trung vào thực hành. Đến cuối cùng, bạn sẽ có các cuộc gọi hoạt động tới cả ba cấp độ và một cách lặp lại để so sánh chúng trên các lời nhắc của riêng bạn trong Apidog, để các quyết định về chi phí và chất lượng đến từ dữ liệu của bạn chứ không phải từ bài đăng ra mắt.

TL;DR

Ba ID mô hình và khi nào nên chọn từng loại

GPT-5.6 phá vỡ cách đặt tên thông thường của OpenAI. Số là thế hệ; Sol, Terra và Luna là các cấp độ khả năng bền vững sẽ phát triển theo tốc độ riêng của chúng, như tin tức ra mắt của MarkTechPost đã nêu. Cấp độ bạn tiêu chuẩn hóa hôm nay sẽ giữ nguyên ý nghĩa trong thế hệ tiếp theo.

ID Mô hình Cấp độ Đầu vào / đầu ra cho mỗi 1 triệu token Sử dụng khi
gpt-5.6-sol Flagship $5 / $30 Suy luận sâu, điều phối tác tử, gỡ lỗi khó khăn
gpt-5.6-terra Cân bằng $2.50 / $15 Các tính năng sản phẩm hàng ngày, công việc tương đương GPT-5.5 với chi phí thấp hơn
gpt-5.6-luna Nhanh $1 / $6 Phân loại, trích xuất, định tuyến, soạn thảo bản nháp đầu tiên

Sol là mô hình hàng đầu. OpenAI báo cáo nó đạt khoảng 53 trên Agents’ Last Exam so với 46.9 của GPT-5.5, vì vậy hãy coi đó là tuyên bố vào ngày ra mắt và xác minh trên các tác vụ của riêng bạn. Terra là lựa chọn thực dụng: OpenAI định vị nó cạnh tranh với GPT-5.5 với chi phí chỉ bằng một nửa. Luna tồn tại cho các công việc có khối lượng lớn, nhạy cảm với độ trễ, nơi bạn quan tâm đến kinh tế đơn vị hơn là chiều sâu.

Một cài đặt mặc định hợp lý: tạo nguyên mẫu trên Terra, chỉ nâng cấp lên Sol khi Terra thất bại một cách rõ rệt, và đẩy các đường dẫn có khối lượng lớn xuống Luna khi lời nhắc đã ổn định. Phân tích chi tiết giá GPT-5.6 đi sâu hơn về cách các mức giá này so sánh giữa các thế hệ và đối thủ.

Một bí danh đáng biết: gpt-5.6 không có hậu tố sẽ chuyển hướng đến Sol. Gắn các ID cấp độ rõ ràng vào mã sản xuất để mỗi cuộc gọi cho biết chính xác chi phí của nó.

Yêu cầu đầu tiên của bạn

Các ID mô hình dưới đây khớp với tài liệu dành cho nhà phát triển của OpenAI một cách chính xác. Bạn cần một khóa OpenAI API có bật thanh toán; không cần gì khác.

Chat Completions hoạt động không thay đổi, vì vậy mã hiện có chỉ cần thay đổi mô hình:

from openai import OpenAI

client = OpenAI()

response = client.chat.completions.create(
    model="gpt-5.6-sol",
    messages=[
        {"role": "system", "content": "You are a concise code reviewer."},
        {"role": "user", "content": "Review this for edge cases: def parse_price(raw): return float(raw.strip('$'))"}
    ]
)

print(response.choices[0].message.content)

Cuộc gọi tương tự trong curl:

curl https://api.openai.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d '{
    "model": "gpt-5.6-sol",
    "messages": [
      {"role": "user", "content": "Explain idempotency keys in one paragraph."}
    ]
  }'

Đối với các bản dựng mới, hãy nhắm mục tiêu API Phản hồi thay thế. Mọi bổ sung GA đều nằm ở đó và nó trực tiếp chấp nhận một khối suy luận:

response = client.responses.create(
    model="gpt-5.6-terra",
    input="Summarize the trade-offs between webhooks and polling.",
    reasoning={"effort": "low"}
)

print(response.output_text)

Chạy cùng một lời nhắc trên cả ba cấp độ trước khi bạn viết thêm một dòng mã tích hợp nào. Sự khác biệt về giọng điệu, độ dài và độ trễ dễ cảm nhận hơn là đọc.

Chọn mức độ nỗ lực suy luận

GPT-5.6 cung cấp sáu cấp độ nỗ lực suy luận: none, low, medium, high, xhighmax.

none tắt tính năng suy luận. Sử dụng nó khi tác vụ mang tính cơ học và độ trễ quan trọng hơn chiều sâu: định dạng lại, trích xuất theo một lược đồ rõ ràng, điền mẫu. Luna ở chế độ none hoạt động như một mô hình hoàn thành cổ điển nhanh, và sự kết hợp đó là nơi mức giá đầu vào 1 đô la của nó tỏa sáng.

max nằm ở phía đối diện. Dành nó cho những vấn đề mà một câu trả lời sai sẽ tốn kém hơn một câu trả lời chậm: lỗi đồng thời tinh vi, đánh giá kiến trúc, lập kế hoạch nhiều bước. Hãy chờ đợi thời gian chờ lâu hơn và hóa đơn lớn hơn.

Hầu hết các khối lượng công việc nằm ở giữa. Bắt đầu ở medium, di chuyển từng cấp một và đo lường chất lượng trước khi bạn chấp nhận chi phí bổ sung khi tăng cấp. Giảm cấp thường miễn phí: hướng dẫn di chuyển của OpenAI cho biết nhiều khối lượng công việc GPT-5.5 vẫn giữ được chất lượng ở một cấp độ thấp hơn trên GPT-5.6.

Chế độ Pro tách biệt với nỗ lực. Đặt reasoning.mode: "pro" và mô hình sẽ ưu tiên chất lượng câu trả lời hơn tốc độ. Nó hoạt động trên cả ba cấp độ và là một cài đặt, không phải là một ID mô hình khác, vì vậy không có mã định danh cụ thể nào cho chế độ pro để tìm kiếm. Các khối lượng công việc ưu tiên chất lượng như tóm tắt pháp lý hoặc phân tích nguyên nhân sự cố là lĩnh vực của nó. Để biết hình dạng và ràng buộc yêu cầu chính xác, hãy xem tài liệu tham khảo API của OpenAI.

Thiết lập bộ nhớ đệm lời nhắc

GPT-5.6 bổ sung kiểm soát bộ nhớ đệm rõ ràng. Đặt prompt_cache_options.mode thành "explicit" và bạn quyết định cái gì sẽ được lưu vào bộ nhớ đệm thay vì dựa vào tính năng phát hiện tiền tố tự động:

response = client.responses.create(
    model="gpt-5.6-luna",
    input=[
        {"role": "system", "content": SUPPORT_PLAYBOOK},
        {"role": "user", "content": ticket_text}
    ],
    prompt_cache_options={"mode": "explicit"}
)

Một trường ttl trên cùng một đối tượng tùy chọn đặt thời gian tiền tố được lưu trong bộ nhớ đệm vẫn "ấm"; bất kể bạn yêu cầu gì, thời gian tối thiểu là 30 phút. Các giá trị ttl được chấp nhận và quy tắc đặt điểm dừng nằm trong tài liệu tham khảo API của OpenAI.

Kinh tế học đơn giản. Ghi vào bộ nhớ đệm tính phí 1.25x so với tốc độ đầu vào không có bộ nhớ đệm. Đọc từ bộ nhớ đệm vẫn giữ mức giảm giá 90%. Vì vậy, bộ nhớ đệm có lợi từ lần truy cập thứ hai: hai lượt không có bộ nhớ đệm trên một tiền tố có giá 2.0x giá token của nó, trong khi một lần ghi cộng một lần đọc có giá 1.35x.

Một ví dụ minh họa. Giả sử một bot hỗ trợ gửi một cuốn sổ tay 40.000 token trong mỗi cuộc gọi Luna. Không có bộ nhớ đệm, tiền tố đó tốn 0.04 đô la cho mỗi cuộc gọi với tốc độ đầu vào 1 đô la cho mỗi 1 triệu token của Luna. Với bộ nhớ đệm rõ ràng, cuộc gọi đầu tiên ghi với giá 0.05 đô la, và mỗi lần đọc trong thời gian ttl tốn 0.004 đô la. Trong một đợt 100 cuộc gọi, đó là 0.45 đô la thay vì 4.00 đô la, tiết kiệm khoảng 89% phần cố định trong hóa đơn của bạn. Thời gian tồn tại tối thiểu 30 phút có nghĩa là lưu lượng truy cập đột biến với khoảng trống dưới nửa giờ cũng tiếp tục nhận được các lần đọc rẻ.

Quy tắc chung: bất kỳ lời nhắc nào có tiền tố tĩnh lớn được tái sử dụng ít nhất hai lần trong thời gian ttl đều nên chạy ở chế độ rõ ràng.

Có gì mới trong API Phản hồi tại GA

Ba bổ sung đã được phát hành cùng với GA, tất cả đều trong API Phản hồi:

Ngoài ra còn có các cài đặt chi tiết tầm nhìn mới, originalauto, giúp giữ nguyên kích thước hình ảnh gốc. Các hình dạng và tham số yêu cầu cho tất cả những điều này có trong tài liệu tham khảo API của OpenAI; các cơ chế trên là những gì cần thiết để thiết kế xung quanh.

Di chuyển từ GPT-5.5

Hướng dẫn của OpenAI rất rõ ràng: hãy coi việc di chuyển như một bước điều chỉnh, không chỉ là thay đổi mã định danh mô hình. Nếu tích hợp của bạn tuân theo quy trình làm việc trong hướng dẫn API GPT-5.5 của chúng tôi, ba điều chỉnh sau đây là quan trọng.

Đầu tiên, hãy kiểm tra mức độ nỗ lực suy luận hiện tại của bạn và một mức độ thấp hơn. GPT-5.6 thường giữ được chất lượng ở một cấp độ thấp hơn, điều này trực tiếp cắt giảm chi phí trên cùng một lưu lượng truy cập.

Thứ hai, hãy mong đợi các câu trả lời ngắn hơn. GPT-5.6 tạo ra đầu ra chặt chẽ hơn đáng kể với ít phần giới thiệu chung chung hơn. Nếu các lời nhắc của bạn có các chỉ thị như “hãy ngắn gọn” hoặc “bỏ qua phần mở đầu”, hãy loại bỏ chúng và kiểm tra lại, vì các chỉ thị ngắn gọn chồng chất giờ đây có thể bị quá mức. Bài viết vào ngày ra mắt của Simon Willison là một tài liệu độc lập hữu ích về cách gia đình mô hình này hoạt động trong thực tế.

Thứ ba, theo dõi việc sử dụng token được lưu trữ trong phản hồi của bạn khi bạn điều chỉnh và đánh giá một bộ tác vụ đại diện trước khi chuyển đổi lưu lượng truy cập sản xuất. Đầu ra tương đương trên Terra với một nửa giá của GPT-5.5 là kết quả đáng để kiểm tra đầu tiên.

Kiểm thử API trong Apidog

Curl chứng minh điểm cuối hoạt động. Việc lựa chọn giữa ba cấp độ cần một cái gì đó có thể lặp lại. Tải xuống Apidog và thiết lập một bộ so sánh nhỏ:

  1. Tạo một môi trường với OPENAI_API_KEY của bạn cộng với ba biến: MODEL_SOL=gpt-5.6-sol, MODEL_TERRA=gpt-5.6-terra, MODEL_LUNA=gpt-5.6-luna.
  2. Xây dựng một yêu cầu POST tới API và tham chiếu {{MODEL_SOL}} trong phần thân, sau đó sao chép nó hai lần và thay thế bằng các biến khác.
  3. Gửi cùng một lời nhắc có cấu trúc sản xuất thông qua cả ba và đọc các câu trả lời cạnh nhau.
  4. Kiểm tra khối sử dụng trong mỗi phản hồi. Nhân số lượng token với tỷ lệ của mỗi cấp độ và bạn sẽ nhận được ước tính chi phí cho mỗi yêu cầu dựa trên lời nhắc của riêng bạn, không phải điểm chuẩn của người khác.

Bộ công cụ tương tự vẫn giữ được giá trị trong quá trình điều chỉnh nỗ lực. Thay đổi mức độ nỗ lực trên một yêu cầu đã lưu, gửi lại và xem các token đầu ra thay đổi; con số đó nhân với tỷ lệ mỗi token là đường cong chất lượng-so-với-chi phí của bạn, hiển thị từng yêu cầu một.

Câu hỏi thường gặp

API GPT-5.6 có sẵn cho tất cả mọi người không?

Có. Kể từ ngày 9 tháng 7 năm 2026, bất kỳ tài khoản OpenAI API nào cũng có thể gọi cả ba mô hình một cách tự phục vụ. Hạn chế xem trước trước khi ra mắt đã được gỡ bỏ trước GA, và quyền truy cập API không phụ thuộc vào gói ChatGPT của bạn. Các cấp độ gói chỉ định hình sản phẩm trò chuyện, nơi người dùng Free và Go nhận được Terra và các gói trả phí mở khóa trình chọn mô hình đầy đủ.

Cửa sổ ngữ cảnh và giới hạn kiến thức của GPT-5.6 là gì?

Theo tài liệu ban đầu, dòng mô hình này có cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 128K và giới hạn kiến thức đến ngày 16 tháng 2 năm 2026. Trang mô hình của OpenAI là nguồn thông tin chính thức; hãy coi đây là những con số được báo cáo cho đến khi bạn xác nhận chúng cho tài khoản của mình.

Sự khác biệt giữa chế độ pro và ultra là gì?

Chế độ Pro là một cài đặt API (reasoning.mode: "pro") hoạt động trên cả ba mô hình và đánh đổi tốc độ lấy chất lượng câu trả lời. Ultra là một cài đặt đa tác tử chạy bốn tác tử song song theo mặc định và nó có trong ChatGPT Work trên các gói Pro và Enterprise cộng với Codex từ Plus trở lên. Phân tích chi tiết chế độ ultra của GPT-5.6 bao gồm khi nào việc chi tiêu token bổ sung một cách có chủ ý là đáng giá.

Tôi nên xây dựng trên Chat Completions hay API Phản hồi?

Mã Chat Completions hiện có vẫn hoạt động chỉ với việc thay đổi ID mô hình, vì vậy không cần viết lại bắt buộc. Các bản dựng mới nên nhắm mục tiêu API Phản hồi: gọi công cụ có lập trình, đa tác tử và suy luận được duy trì đều được phát hành ở đó, và tài liệu GPT-5.6 của OpenAI tập trung vào nó.

Những điều này mang lại cho bạn

Bạn không cần một dự án di chuyển để bắt đầu. Hãy chọn Terra, chạy một lời nhắc thực tế từ sản phẩm của bạn thông qua nó ở mức độ nỗ lực medium, sau đó di chuyển xuống một cấp độ và so sánh. Cấu hình bộ nhớ đệm rõ ràng nếu các lời nhắc của bạn chia sẻ một tiền tố tĩnh lớn; mức tiết kiệm 89% trong ví dụ trên là điển hình cho những gì một lời nhắc hệ thống lớn mang lại. Chỉ sau đó mới quyết định Sol và Luna thuộc về đâu trong hệ thống của bạn.

Cũng nên giữ lại bộ so sánh ba cấp độ. Sol, Terra và Luna sẽ tiến bộ theo tốc độ riêng của chúng, vì vậy bản phát hành tiếp theo là một lần chạy lại các yêu cầu đã lưu thay vì một dự án nghiên cứu. Apidog giữ các yêu cầu, môi trường và số lượng token đó ở một nơi, biến mỗi lần ra mắt mô hình trong tương lai thành một buổi chiều kiểm thử thay vì một phỏng đoán.

nút

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API