Hướng dẫn sử dụng GPT-6.1 Sol API?

Hướng dẫn API GPT-6.1 Sol: yêu cầu gpt-6.1-sol đầu tiên của bạn, các cấp độ nỗ lực, định giá Batch/Flex/Fast, và bốn thay đổi để di chuyển từ gpt-6-sol.

INEZA Felin-Michel

INEZA Felin-Michel

30 tháng 9 2026

Hướng dẫn sử dụng GPT-6.1 Sol API?

Apidog cho doanh nghiệp

Triển khai tại chỗ

SSO & RBAC

Tuân thủ SOC 2

Khám phá Apidog Enterprise

Để gọi API GPT-6.1 Sol, hãy gửi yêu cầu POST đến https://api.openai.com/v1/responses với "model": "gpt-6.1-sol" và khóa của bạn dưới dạng Bearer token. Nó có giá niêm yết tương tự là 2 đô la đầu vào và 10 đô la đầu ra cho mỗi triệu token như GPT-6 Sol, và đầu vào đã cache giảm từ 0,20 đô la xuống 0,10 đô la. Việc di chuyển từ gpt-6-sol chủ yếu là thay đổi chuỗi. Thay đổi đột phá là về mức độ nỗ lực (effort): GPT-6.1 Sol không chấp nhận none hoặc minimal, vì vậy các yêu cầu đó phải chuyển sang low, cùng với bất kỳ mã nào dựa vào none.

OpenAI đã phát hành GPT-6.1 Sol tại DevDay vào ngày 29 tháng 9 năm 2026. Tổng hợp DevDay 2026 bao gồm các bản phát hành khác, và GPT-6.1 Sol là gì đi sâu vào các điểm chuẩn. Hướng dẫn này bao gồm yêu cầu đầu tiên của bạn, mức độ nỗ lực cần bắt đầu, mọi thay đổi di chuyển, các tầng Batch, Flex và Fast, và chạy thử hồi quy song song cả hai ID mô hình trong Apidog trước khi bạn chuyển đổi lưu lượng truy cập sản xuất.

Tải ứng dụng

GPT-6 Sol so với GPT-6.1 Sol: những thay đổi trong API

Hầu hết các thông số kỹ thuật đều giống hệt nhau. Dưới đây là toàn bộ sự khác biệt từ trang mô hình GPT-6.1 Sol, trang mô hình GPT-6 Sol và hướng dẫn di chuyển sử dụng GPT-6 của OpenAI:

gpt-6-sol gpt-6.1-sol Cần làm gì
Đầu vào / đầu ra mỗi 1M (Tiêu chuẩn) $2 / $10 $2 / $10 Không cần làm gì
Đầu vào đã cache mỗi 1M $0.20 $0.10 Chạy lại phép tính cache của bạn
Ghi cache mỗi 1M $2.50 $2.50 Không cần làm gì
Cửa sổ ngữ cảnh / đầu vào tối đa / đầu ra tối đa 1,050,000 / 922,000 / 128,000 1,050,000 / 922,000 / 128,000 Không cần làm gì
Thời điểm cắt dữ liệu 20 tháng 4, 2026 30 tháng 4, 2026 Kiểm tra lại các đánh giá nhạy cảm về ngày tháng
reasoning.effort none, low, medium (mặc định), high, xhigh, max low, medium (mặc định), high, xhigh, max Di chuyển none sang low và đánh giá lại
Gọi hàm trong Chat Completions Chỉ với reasoning_effort: "none" Không được hỗ trợ Di chuyển các lệnh gọi công cụ sang Responses
Điểm cuối Chat Completions, Responses, Batch Giống nhau Không cần làm gì
Giới hạn tốc độ Bậc 1: 500 RPM / 500K TPM; Bậc 5: 15,000 RPM / 40M TPM Giống nhau Không cần làm gì

Trang GPT-6 Sol hiện chuyển hướng người đọc đến GPT-6.1 Sol như là “mô hình Sol mới hơn.”

Gửi yêu cầu GPT-6.1 Sol đầu tiên của bạn

Xuất khóa của bạn dưới dạng OPENAI_API_KEY, sau đó gọi API Responses:

curl https://api.openai.com/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d '{
    "model": "gpt-6.1-sol",
    "reasoning": {"effort": "medium"},
    "input": "List three ways a webhook retry policy can create duplicate orders. One line each."
  }'

SDK Python đọc cùng biến môi trường:

from openai import OpenAI

client = OpenAI()
response = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "medium"},
    input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)
print(response.output_text)
print(response.usage)

Bốn phần của phản hồi quan trọng:

Sử dụng API Responses cho bất kỳ thứ gì có công cụ; GPT-6.1 Sol chỉ hỗ trợ Chat Completions cho các yêu cầu không có công cụ. Hướng dẫn API Responses bao gồm hình dạng yêu cầu chi tiết hơn.

Chọn mức độ nỗ lực lập luận

Mức độ nỗ lực là yếu tố chính về chi phí và chất lượng của bạn, và medium là mặc định khi bạn bỏ qua nó. Hướng dẫn lựa chọn mô hình của OpenAI kết hợp medium với “công việc kỹ thuật phức tạp và các sản phẩm phối hợp mà bạn dự kiến sẽ sửa đổi,” và xhigh với các sản phẩm hoàn thiện và các quyết định được xây dựng từ bằng chứng mâu thuẫn. Bài đăng ra mắt của OpenAI bổ sung kết quả theo cài đặt. Các điểm chuẩn này do OpenAI báo cáo, và bảng trích dẫn các thay đổi mà OpenAI nêu trong văn bản của mình:

Mức độ nỗ lực Bắt đầu ở đây cho OpenAI báo cáo gì về GPT-6.1 Sol
low Trò chuyện, trích xuất, phân loại, bất cứ thứ gì bạn đã chạy ở none Trên các cuộc hội thoại được người dùng gắn cờ, phản hồi có lỗi thực tế giảm từ 11.4% (GPT-6 Sol) xuống 7.7%
medium (mặc định) Tự động hóa dựa trên tác nhân và quy trình gọi công cụ AutomationBench 1.0.6: +2.2 điểm phần trăm so với Claude Opus 5.5 với chi phí chỉ bằng khoảng một phần ba; +4.8 điểm phần trăm so với GPT-6 Sol ở cùng cài đặt
high Gỡ lỗi khó và lập kế hoạch sâu Không có tuyên bố cụ thể theo cài đặt
xhigh Sản phẩm hoàn thiện và các lần chạy không đồng bộ dài Không có tuyên bố cụ thể theo cài đặt
max Sử dụng máy tính và các nhiệm vụ khoa học khó OSWorld 2.0: +7 điểm phần trăm so với GPT-6 Sol ở mức tối đa với chi phí chưa đến một nửa. Terminal-Bench Science 0.1: 5.47 đô la cho mỗi tác vụ, so với 23.21 đô la cho Opus 5.5 và 23.80 đô la cho GPT-6 Astra

Hai lưu ý. Bộ dữ liệu tính xác thực là các cuộc hội thoại đã bị gắn cờ lỗi trước đây, không phải lưu lượng truy cập thông thường. Và trên Terminal-Bench Science, GPT-6 Astra vẫn đạt điểm cao nhất (68.1%), vì vậy OpenAI khuyến nghị Astra cho những công việc khoa học khó nhất.

Đối với các lệnh gọi nhạy cảm về độ trễ đã sử dụng none, hãy bắt đầu ở low và đo lường. Hướng dẫn lập luận mô tả low là lập luận hiệu quả “với mức tăng độ trễ khiêm tốn.” Để thay đổi mức độ nỗ lực giữa cuộc hội thoại mà không làm hỏng bộ nhớ đệm lời nhắc, hãy thêm một mục nhập configuration_update thay vì thay đổi reasoning.effort ở cấp độ yêu cầu.

Di chuyển từ gpt-6-sol: bốn thay đổi mã

  1. Hoán đổi ID mô hình. Thay thế gpt-6-sol bằng gpt-6.1-sol, và giữ nó trong cấu hình hoặc một biến môi trường để việc khôi phục chỉ cần một lần chỉnh sửa.
  2. Ánh xạ lại none và minimal. Hướng dẫn của OpenAI: sử dụng low thay vì none, và bắt đầu minimal ở low rồi so sánh trên các tác vụ đại diện. Trên GPT-6 Astra, vốn cũng không có none, việc gửi nó sẽ trả về HTTP 400, vì vậy hãy sửa lỗi này trước khi bạn chuyển lưu lượng truy cập.
  3. Loại bỏ các tham số lấy mẫu. Khi mức độ nỗ lực không phải là none, hãy loại bỏ temperature, top_p và top_logprobs (và logprobs trong Chat Completions). Mã đã ghép nối temperature với none trên GPT-6 Sol cần điều này.
  4. Di chuyển các lệnh gọi công cụ Chat Completions sang Responses. GPT-6 Sol cho phép gọi hàm trong Chat Completions chỉ với reasoning_effort: "none". Sự kết hợp đó không có tương đương trên 6.1 Sol.

Sau đó chạy lại bất kỳ thứ gì phụ thuộc vào tính thời sự: thời điểm cắt dữ liệu di chuyển từ ngày 20 tháng 4 sang ngày 30 tháng 4 năm 2026. Nếu bạn chuyển sang Sol từ Astra, hướng dẫn di chuyển từ Astra sang Sol bao gồm bước trước đó.

Giá Batch, Flex, Fast và đầu vào đã cache

Mỗi tầng giữ nguyên cấu trúc của GPT-6 Sol, với cột đầu vào đã cache giảm một nửa. Giá mỗi 1 triệu token được lấy từ trang giá API. Trang mô hình bổ sung rằng một lời nhắc trên 272K token đầu vào được tính phí với tỷ lệ đầu vào và cache gấp 2 lần và đầu ra gấp 1.5 lần cho toàn bộ yêu cầu, quy tắc tương tự mà GPT-6 Sol sử dụng:

Tầng Đầu vào Đầu vào đã cache Ghi cache Đầu ra
Tiêu chuẩn $2.00 $0.10 $2.50 $10.00
Batch $1.00 $0.05 $1.25 $5.00
Flex $1.00 $0.05 $1.25 $5.00
Fast $4.00 $0.20 $5.00 $20.00
Tiêu chuẩn, lời nhắc trên 272K token đầu vào $4.00 $0.20 $5.00 $15.00

Flex là service_tier: "flex" cho mỗi yêu cầu. Fast là service_tier: "fast", với `"priority"` được chấp nhận làm bí danh. Chế độ Fast không khả dụng với nơi cư trú dữ liệu EU. Ultrafast cho GPT-6.1 Sol “sắp ra mắt” và hiện chỉ khả dụng rộng rãi cho GPT-6 Astra; xem chế độ OpenAI Ultrafast. Đối với các công việc qua đêm, hướng dẫn OpenAI Batch API sẽ hướng dẫn bạn chạy một lượt batch.

Bộ nhớ đệm là nơi nâng cấp giúp tiết kiệm tiền. Đọc có giá 0.05 lần tỷ lệ đầu vào trên 6.1 Sol so với 0.1 lần trên GPT-6 Sol, và ghi có giá 1.25 lần trên cả hai, theo hướng dẫn bộ nhớ đệm lời nhắc. Lấy một lời nhắc hệ thống 50.000 token được tái sử dụng trên 1.000 yêu cầu. Một lần ghi có giá 0.125 đô la trên cả hai mô hình; 999 lần đọc có giá 9.99 đô la trên GPT-6 Sol và 5.00 đô la trên GPT-6.1 Sol. Tiền tố có thể cache tối thiểu là 1.024 token hiển thị, và tiền tố đã cache vẫn đủ điều kiện trong ít nhất 30 phút sau lần ghi hoặc tái sử dụng cuối cùng của nó. Để biết chiến lược điểm ngắt, xem bộ nhớ đệm lời nhắc GPT-6.

Kiểm tra việc hoán đổi trong Apidog

Đừng chuyển đổi sản xuất chỉ dựa vào giá niêm yết. Gửi cùng một yêu cầu đã lưu đến cả hai ID và so sánh kết quả trả về. Trong Apidog:

  1. Tạo một môi trường với OPENAI_API_KEY (được lưu dưới dạng bí mật), MODEL_ID được đặt thành gpt-6-sol, và EFFORT được đặt thành medium.
  2. Tạo POST https://api.openai.com/v1/responses với tiêu đề Authorization: Bearer {{OPENAI_API_KEY}} và nội dung này, sau đó lưu lại:
{
  "model": "{{MODEL_ID}}",
  "reasoning": {"effort": "{{EFFORT}}"},
  "max_output_tokens": 25000,
  "input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."
}
  1. Thêm các khẳng định: HTTP 200, $.status bằng completed, $.output[*].type chứa message, $.usage.output_tokens lớn hơn 0, và $.usage.output_tokens_details.reasoning_tokens tồn tại. Sau đó kiểm tra định dạng đầu ra mà mã của bạn phụ thuộc vào, chẳng hạn như JSON hợp lệ với các khóa bạn phân tích.
  2. Thêm một script xử lý sau chuyển đổi usage thành đô la, sử dụng phân chia đầu vào từ hướng dẫn bộ nhớ đệm lời nhắc của OpenAI:
const u = pm.response.json().usage;
const d = u.input_tokens_details || {};
const cached = d.cached_tokens || 0;
const writes = d.cache_write_tokens || 0;
const model = pm.environment.get("MODEL_ID");
const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;
const cost = ((u.input_tokens - cached - writes) * 2 + cached * cachedRate
  + writes * 2.5 + u.output_tokens * 10) / 1e6;
console.log(model, "cost per call $", cost.toFixed(5));
  1. Gửi nó, đặt MODEL_ID thành gpt-6.1-sol, và gửi lại. So sánh reasoning_tokens, output_tokens, câu trả lời và chi phí đã ghi. Nếu bạn đang ánh xạ lại từ none, hãy chạy baseline ở none và ứng cử viên ở low.

Sau đó di chuyển yêu cầu và một số lời nhắc thực tế vào một kịch bản kiểm tra và chạy cặp từ Apidog CLI trong CI. --env-var ghi đè một biến cho một lần chạy, vì vậy một kịch bản duy nhất bao gồm cả hai mô hình:

npm install -g apidog-cli
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  --env-var "MODEL_ID=gpt-6-sol" -r cli,junit
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  --env-var "MODEL_ID=gpt-6.1-sol" -r cli,junit

Một khẳng định không thành công sẽ làm thất bại công việc, và các báo cáo JUnit cung cấp cho bạn cả hai lần chạy song song. Để biết các khẳng định về đầu ra thay đổi theo từng lần chạy, hãy xem kiểm tra các tác nhân AI không xác định.

Câu hỏi thường gặp

Bước tiếp theo

Lưu yêu cầu đầu tiên, chạy nó trên gpt-6-sol với mức độ nỗ lực hiện tại của bạn, sau đó trên gpt-6.1-sol, và so sánh usage và đầu ra trên một lời nhắc từ lưu lượng truy cập của riêng bạn. Tải Apidog để giữ cả hai lần chạy dưới dạng các khẳng định bạn có thể chạy lại trong CI. Đang cân nhắc Anthropic thay vào đó? Xem GPT-6.1 Sol so với Claude Sonnet 5.5.

Thực hành thiết kế API trong Apidog

Khám phá cách dễ dàng hơn để xây dựng và sử dụng API