GPT-6.1 Sol API를 호출하려면, Bearer 토큰으로 키를 사용하고 "model": "gpt-6.1-sol"을 포함하여 https://api.openai.com/v1/responses로 POST 요청을 보내세요. GPT-6 Sol과 동일하게 1백만 토큰당 입력 $2, 출력 $10으로 책정되며, 캐시된 입력은 $0.20에서 $0.10으로 인하됩니다. gpt-6-sol에서 마이그레이션하는 것은 대부분 문자열 교체입니다. 주요 변경사항은 effort입니다. GPT-6.1 Sol은 none 또는 minimal을 허용하지 않으므로, 이와 관련된 요청은 low로 이동해야 합니다. none에 의존하던 모든 코드도 마찬가지입니다.
OpenAI는 2026년 9월 29일 DevDay에서 GPT-6.1 Sol을 출시했습니다. DevDay 2026 요약에서 다른 출시 내용을 다루고 있으며, GPT-6.1 Sol이란 무엇인가에서 벤치마크를 자세히 설명합니다. 이 가이드는 첫 요청, 시작할 effort 수준, 모든 마이그레이션 변경사항, Batch, Flex 및 Fast 티어, 그리고 프로덕션 트래픽을 전환하기 전에 Apidog에서 두 모델 ID의 사이드 바이 사이드 회귀 실행을 다룹니다.
GPT-6 Sol vs GPT-6.1 Sol: API 변경점
대부분의 사양은 동일합니다. 다음은 GPT-6.1 Sol 모델 페이지, GPT-6 Sol 모델 페이지 및 OpenAI의 GPT-6 마이그레이션 가이드에서 발췌한 전체 차이점입니다:
gpt-6-sol |
gpt-6.1-sol |
조치 사항 | |
|---|---|---|---|
| 1백만 토큰당 입력/출력 (표준) | $2 / $10 | $2 / $10 | 없음 |
| 1백만 토큰당 캐시된 입력 | $0.20 | $0.10 | 캐시 계산 재실행 |
| 1백만 토큰당 캐시 쓰기 | $2.50 | $2.50 | 없음 |
| 컨텍스트 윈도우 / 최대 입력 / 최대 출력 | 1,050,000 / 922,000 / 128,000 | 1,050,000 / 922,000 / 128,000 | 없음 |
| 지식 차단 시점 | 2026년 4월 20일 | 2026년 4월 30일 | 날짜에 민감한 평가 재확인 |
reasoning.effort |
none, low, medium (기본값), high, xhigh, max |
low, medium (기본값), high, xhigh, max |
none을 low로 이동하고 재평가 |
| Chat Completions에서 함수 호출 | reasoning_effort: "none"에서만 가능 |
지원되지 않음 | 도구 호출을 Responses로 이동 |
| 엔드포인트 | Chat Completions, Responses, Batch | 동일 | 없음 |
| 속도 제한 | 티어 1: 500 RPM / 500K TPM; 티어 5: 15,000 RPM / 40M TPM | 동일 | 없음 |
GPT-6 Sol 페이지는 이제 독자들을 "더 새로운 Sol 모델"인 GPT-6.1 Sol로 안내합니다.
첫 번째 GPT-6.1 Sol 요청 보내기
키를 OPENAI_API_KEY로 내보낸 다음, Responses API를 호출하세요:
curl https://api.openai.com/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-d '{
"model": "gpt-6.1-sol",
"reasoning": {"effort": "medium"},
"input": "List three ways a webhook retry policy can create duplicate orders. One line each."
}'
Python SDK는 동일한 환경 변수를 읽습니다:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "medium"},
input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)
print(response.output_text)
print(response.usage)
응답의 네 가지 부분이 중요합니다:
status는 성공 시completed입니다. 모델이 출력 예산이 부족하면, 때로는 가시적인 텍스트가 나오기 전에도incomplete_details.reason이max_output_tokens로 설정된incomplete를 받게 됩니다. 추론 가이드는 실험하는 동안 추론 및 출력을 위해 최소 25,000 토큰을 예약할 것을 제안합니다.output은 배열입니다. 답변은type: "message"인 항목이며, 해당 내용에output_text가 포함됩니다. 인덱스가 아닌 유형별로 읽으세요.usage.output_tokens에는 출력 요율로 청구되는 추론 토큰이 포함됩니다.usage.output_tokens_details.reasoning_tokens는 그 개수를 보여줍니다.usage.input_tokens_details는cached_tokens및cache_write_tokens를 보고합니다. 더 저렴한 캐시가 나타나는 곳입니다.
도구가 있는 모든 것에 Responses API를 사용하세요. GPT-6.1 Sol은 도구가 없는 요청에 대해서만 Chat Completions를 지원합니다. Responses API 가이드는 요청 형태를 더 자세히 다룹니다.
추론 노력 수준 선택
Effort는 주요 비용 및 품질 다이얼이며, 생략하면 medium이 기본값입니다. OpenAI의 모델 선택 가이드는 medium을 "수정할 것으로 예상되는 복잡한 기술 작업 및 조정된 결과물"과, xhigh를 "세련된 결과물 및 상충되는 증거를 기반으로 한 결정"과 연결합니다. OpenAI의 출시 게시물은 설정별 결과를 추가합니다. 이러한 벤치마크는 OpenAI가 보고한 것이며, 표는 OpenAI가 텍스트에 명시한 델타를 인용합니다:
| Effort | 다음 용도로 시작 | OpenAI가 GPT-6.1 Sol에 대해 보고한 내용 |
|---|---|---|
low |
채팅, 추출, 분류, none으로 실행했던 모든 것 |
사용자가 오류를 표시한 대화에서 사실 오류가 있는 응답이 11.4% (GPT-6 Sol)에서 7.7%로 감소 |
medium (기본값) |
에이전트 자동화 및 도구 호출 워크플로 | AutomationBench 1.0.6: Claude Opus 5.5보다 약 3분의 1 비용으로 +2.2 pp; 동일 설정에서 GPT-6 Sol보다 +4.8 pp |
high |
어려운 디버깅 및 심층 계획 | 설정별 특정 주장 없음 |
xhigh |
세련된 결과물 및 긴 비동기 실행 | 설정별 특정 주장 없음 |
max |
컴퓨터 사용 및 어려운 과학 작업 | OSWorld 2.0: 최대 설정에서 GPT-6 Sol보다 절반 이하의 비용으로 +7 pp. Terminal-Bench Science 0.1: 작업당 $5.47, Opus 5.5는 $23.21, GPT-6 Astra는 $23.80 |
두 가지 주의사항. 사실성 세트는 이전에 오류로 플래그가 지정된 대화이며, 일반적인 트래픽이 아닙니다. 그리고 Terminal-Bench Science에서 GPT-6 Astra는 여전히 가장 높은 점수(68.1%)를 기록하므로, OpenAI는 가장 어려운 과학 작업에 Astra를 권장합니다.
none을 사용했던 지연 시간에 민감한 호출의 경우, low부터 시작하여 측정하세요. 추론 가이드는 low를 "적당한 지연 시간 증가와 함께 효율적인 추론"으로 설명합니다. 프롬프트 캐시를 손상시키지 않고 대화 중에 effort를 변경하려면, 요청 수준 reasoning.effort를 변경하는 대신 configuration_update 입력 항목을 추가하세요.
gpt-6-sol에서 마이그레이션: 네 가지 코드 변경 사항
- 모델 ID를 교체합니다.
gpt-6-sol을gpt-6.1-sol로 교체하고, 구성 또는 환경 변수에 보관하여 롤백이 한 번의 편집으로 가능하도록 합니다. none및minimal을 재매핑합니다. OpenAI의 지침:none대신low를 사용하고,minimal은low에서 시작하여 대표적인 작업에서 비교합니다.none이 없는 GPT-6 Astra의 경우, 이를 전송하면 HTTP 400이 반환되므로 트래픽을 이동하기 전에 이를 수정해야 합니다.- 샘플링 매개변수를 제거합니다. effort가
none이 아닌 경우,temperature,top_p및top_logprobs(및 Chat Completions의logprobs)를 제거합니다. GPT-6 Sol에서temperature와none을 함께 사용했던 코드는 이 작업이 필요합니다. - Chat Completions 도구 호출을 Responses로 이동합니다. GPT-6 Sol은
reasoning_effort: "none"일 때만 Chat Completions에서 함수 호출을 허용했습니다. 이 조합은 6.1 Sol에 해당 사항이 없습니다.
그런 다음 최근성에 의존하는 모든 것을 다시 실행하세요. 지식 차단 시점이 2026년 4월 20일에서 4월 30일로 변경됩니다. Astra에서 Sol로 넘어왔다면, Astra-to-Sol 마이그레이션 가이드에서 이전 단계를 다룹니다.
Batch, Flex, Fast 및 캐시된 입력 가격
모든 티어는 GPT-6 Sol의 형태를 유지하며, 캐시된 입력 열은 절반으로 줄었습니다. 1백만 토큰당 가격은 API 가격 페이지에서 가져왔습니다. 모델 페이지는 272K 입력 토큰을 초과하는 프롬프트는 GPT-6 Sol이 사용하는 것과 동일한 규칙에 따라 전체 요청에 대해 입력 및 캐시 요율의 2배, 출력의 1.5배로 청구된다고 덧붙입니다:
| 티어 | 입력 | 캐시된 입력 | 캐시 쓰기 | 출력 |
|---|---|---|---|---|
| 표준 | $2.00 | $0.10 | $2.50 | $10.00 |
| Batch | $1.00 | $0.05 | $1.25 | $5.00 |
| Flex | $1.00 | $0.05 | $1.25 | $5.00 |
| Fast | $4.00 | $0.20 | $5.00 | $20.00 |
| 표준, 272K 입력 토큰 초과 프롬프트 | $4.00 | $0.20 | $5.00 | $15.00 |
Flex는 요청당 service_tier: "flex"입니다. Fast는 service_tier: "fast"이며, "priority"도 별칭으로 허용됩니다. Fast 모드는 EU 데이터 레지던시에서는 사용할 수 없습니다. GPT-6.1 Sol용 Ultrafast는 "곧 출시 예정"이며, 현재 GPT-6 Astra에서만 광범위하게 사용할 수 있습니다. OpenAI Ultrafast 모드를 참조하세요. 야간 작업을 위해 OpenAI Batch API 가이드는 배치 실행을 안내합니다.
캐시가 업그레이드로 비용을 절감하는 부분입니다. 프롬프트 캐싱 가이드에 따르면, 읽기 비용은 6.1 Sol에서 입력 요율의 0.05배인 반면 GPT-6 Sol에서는 0.1배이며, 쓰기 비용은 두 모델 모두 1.25배입니다. 1,000개 요청에 걸쳐 재사용되는 50,000 토큰 시스템 프롬프트를 예로 들어봅시다. 하나의 쓰기는 두 모델 모두에서 $0.125가 소요되며, 999개의 읽기는 GPT-6 Sol에서 $9.99, GPT-6.1 Sol에서 $5.00가 소요됩니다. 캐시 가능한 최소 접두사는 1,024개의 가시 토큰이며, 캐시된 접두사는 마지막 쓰기 또는 재사용 후 최소 30분 동안 유효합니다. 브레이크포인트 전략은 GPT-6 프롬프트 캐싱을 참조하세요.
Apidog에서 스왑 테스트하기
정가만 보고 프로덕션을 전환하지 마세요. 동일하게 저장된 요청을 두 ID 모두에 보내고 반환되는 내용을 비교하세요. Apidog에서:
OPENAI_API_KEY(비밀로 저장됨),MODEL_ID를gpt-6-sol로,EFFORT를medium으로 설정하여 환경을 생성합니다.- 헤더
Authorization: Bearer {{OPENAI_API_KEY}}와 다음 본문을 사용하여POST https://api.openai.com/v1/responses를 생성한 다음 저장합니다:
{
"model": "{{MODEL_ID}}",
"reasoning": {"effort": "{{EFFORT}}"},
"max_output_tokens": 25000,
"input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."
}
- 어설션을 추가합니다: HTTP 200,
$.status가completed와 같음,$.output[*].type이message를 포함함,$.usage.output_tokens가 0보다 큼, 그리고$.usage.output_tokens_details.reasoning_tokens가 존재함. 그런 다음 파싱하는 키가 있는 유효한 JSON과 같이 코드가 의존하는 출력 형태를 확인합니다. - OpenAI의 프롬프트 캐싱 가이드에서 입력 분할을 사용하여
usage를 달러로 변환하는 후처리 스크립트를 추가합니다:
const u = pm.response.json().usage;
const d = u.input_tokens_details || {};
const cached = d.cached_tokens || 0;
const writes = d.cache_write_tokens || 0;
const model = pm.environment.get("MODEL_ID");
const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;
const cost = ((u.input_tokens - cached - writes) * 2 + cached * cachedRate
+ writes * 2.5 + u.output_tokens * 10) / 1e6;
console.log(model, "cost per call $", cost.toFixed(5));
- 전송한 다음,
MODEL_ID를gpt-6.1-sol로 설정하고 다시 전송합니다.reasoning_tokens,output_tokens, 답변 및 기록된 비용을 비교합니다.none에서 재매핑하는 경우,none에서 기준선을 실행하고low에서 후보를 실행합니다.
그런 다음 요청과 몇 가지 실제 프롬프트를 테스트 시나리오로 이동하고 Apidog CLI에서 CI에서 쌍을 실행합니다. --env-var는 한 번의 실행을 위해 변수를 재정의하므로, 단일 시나리오가 두 모델을 모두 포함합니다:
npm install -g apidog-cli
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6-sol" -r cli,junit
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6.1-sol" -r cli,junit
어설션 실패는 작업을 실패하게 만들고, JUnit 보고서는 두 실행을 나란히 보여줍니다. 실행마다 달라지는 출력에 대한 어설션은 비결정적 AI 에이전트 테스트를 참조하세요.
FAQ
GPT-6.1 Sol이 GPT-6 Sol보다 비싼가요? 아니요. 두 모델 모두 1백만 토큰당 입력 $2, 출력 $10입니다. GPT-6.1 Sol의 캐시된 입력은 $0.20에서 $0.10으로 저렴하므로, 캐시 사용량이 많은 워크로드는 비용이 절감됩니다.
reasoning.effort: "none"은 어떻게 해야 하나요? GPT-6.1 Sol은 none과 minimal을 모두 지원하지 않습니다. 둘 다 low로 매핑하고, temperature와 top_p를 제거한 다음 전환하기 전에 평가를 다시 실행하세요.
GPT-6.1 Sol을 Chat Completions에서 사용할 수 있나요? 예, 도구가 없는 요청에 한해 가능합니다. 도구 호출은 Responses API가 필요합니다.
무료 GPT-6.1 Sol API 티어가 있나요? 아니요. API 호출은 첫 요청부터 토큰당 요금이 청구됩니다. GPT-6.1 Sol은 무료인가요?에서 가장 저렴한 경로를 다룹니다.
다음 단계
첫 번째 요청을 저장하고, 현재 effort 수준에서 gpt-6-sol로 실행한 다음, gpt-6.1-sol로 실행하고, 자체 트래픽의 프롬프트에서 usage 및 출력을 비교하세요. CI에서 다시 실행할 수 있는 어설션으로 두 실행을 유지하려면 Apidog 다운로드를 이용하세요. 대신 Anthropic을 고려 중이신가요? GPT-6.1 Sol vs Claude Sonnet 5.5를 참조하세요.
