이번 주에는 설정 파일에 있는 모델 ID와 결정해야 할 사항이 있습니다. 2026년 9월 22일, OpenAI는 GPT-6 Sol을, Anthropic은 Claude Opus 5.5를 몇 시간 간격으로 출시했습니다. 그 이후로 발견한 모든 비교표에는 구멍이 있으며, 그 구멍은 보이는 것보다 훨씬 큽니다.
구멍은 다음과 같습니다. OpenAI의 출시 게시물은 Sol을 Claude Opus 5와 비교 벤치마크했습니다. 그 게시물이 작성될 당시 Claude Opus 5.5는 존재하지 않았기 때문입니다. Anthropic은 같은 날 Opus 5.5를 Opus 5보다 20% 낮은 가격으로 출시했습니다. 그래서 개발자들이 서로 인용하는 주요 주장은, Sol이 Opus 등급 품질과 일치하거나 능가하며 작업당 비용이 훨씬 저렴하다는 것이었지만, 이 측정은 측정 발표 몇 시간 만에 대체된 모델을 대상으로 이루어졌습니다.
버튼
그렇다고 OpenAI의 수치가 틀렸다는 것은 아닙니다. 다만 특정 방식으로 시대에 뒤떨어졌다는 것이며, 얼마나 시대에 뒤떨어졌는지 아는 것은 좋은 라우팅 결정과 값비싼 결정의 차이입니다. 아래에서는 각 공급업체가 발표한 내용, 두 벤치마크 세트가 실제로 일치하는 부분, 캐싱이 포함될 때의 가격 차이, 그리고 자신의 엔드포인트에 대해 둘 다 테스트하는 방법을 설명합니다.
이틀 만에 이루어진 세 가지 선두 모델 출시의 더 넓은 그림을 보려면 2026년 9월 AI 모델 가격 전쟁을 참조하십시오.
사양 시트, 나란히 비교
| GPT-6 Sol | Claude Opus 5.5 | |
|---|---|---|
| API 모델 ID | gpt-6-sol |
claude-opus-5-5 |
| 100만 토큰당 입력 | $2 | $4 |
| 100만 토큰당 출력 | $10 | $20 |
| 캐시된 입력 읽기 | 90% 할인 | 100만당 $0.20 |
| 캐시 쓰기 | 우리가 가진 자료에는 미공개 | 100만당 $5 |
| 컨텍스트 창 | 872,000 토큰 | 1,000,000 토큰 |
| 최대 출력 | 우리가 가진 자료에는 미공개 | 128,000 토큰 |
| 인공 분석 지능 지수 | 48 | 58, 212개 중 1위 |
| 호출 가능 위치 | API, ChatGPT Work, Codex | Claude Platform, AWS, Google Cloud, Azure |
두 줄이 결정의 대부분을 차지합니다.
순수 토큰 기준으로, Sol은 입력과 출력 모두에서 Opus 5.5 가격의 정확히 절반입니다. 대략 절반이 아닙니다. 절반입니다. 이는 공급업체 간 비교에서는 이례적으로 깔끔한 수치이며 정신적인 계산을 쉽게 만듭니다.
공급업체 주장이 아닌 제3자 점수인 인공 분석 지능 지수에서 Opus 5.5는 58점으로 212개 모델 중 1위를 차지하는 반면 Sol은 48점입니다. 따라서 이 대결의 양상은 익숙합니다. 선두에 서기 위해 두 배를 지불해야 하며, 문제는 귀하의 작업 부하가 이를 인식하는지 여부입니다.
Sol의 컨텍스트 창은 872,000 토큰이며 Opus 5.5는 100만 토큰입니다. 대부분의 작업에서는 이 차이가 문제가 되지 않습니다. 전체 모노레포나 400개 엔드포인트 OpenAPI 문서와 히스토리를 한 번의 호출로 푸시한다면, 먼저 측정하십시오. 실패 모드는 성능 저하된 출력이 아니라 강력한 거부이기 때문입니다.
가용성도 중요합니다. Sol은 API와 ChatGPT Work 및 Codex for Plus, Pro, Business, Enterprise, Edu 계정에 도달했으며, 아직 Chat에는 포함되지 않았습니다. Opus 5.5는 첫날 Claude Platform, AWS, Google Cloud 및 Azure에 출시되었으며, 이는 Bedrock 또는 Vertex를 통해 이미 라우팅하는 경우 조달 대화와 구성 변경 간의 차이입니다.
OpenAI가 실행할 수 없었던 비교
OpenAI 자체의 작업당 비용 수치는 출시 게시물의 가장 유용한 부분이며, 이들은 모두 Opus 5를 가리킵니다.
| 벤치마크 | GPT-6 Sol | Claude Opus 5 | 비용 관계 |
|---|---|---|---|
| AutomationBench 1.0.6 | xhigh에서 33.2%, 작업당 $0.27 | max에서 26.9% | Opus 5는 Sol 대비 작업당 11.1배 비쌈 |
| Agents’ Last Exam V1 | max에서 56.4% | Sol 점수 미만 | Sol이 작업당 60% 저렴 |
| DeepSWE 1.1 | max에서 68.8% | 해당 없음 | Fable 5 xhigh의 69.9%와 1.1%p 내, 작업당 약 80% 저렴 |
| OSWorld 2.0 오프라인 | xhigh에서 60.5% | medium에서 60.3% | 작업당 약 80% 저렴 |
AutomationBench 행을 다시 읽어보십시오. Sol은 초고난이도 추론에서 Opus 5의 최대 추론을 능가했으며, 작업당 Opus 5 비용의 약 9%에 불과했습니다. 이것이 바로 담론에서 모든 역할을 하는 숫자입니다.
이제 Opus 5.5를 그 옆에 놓아보십시오. Anthropic은 Opus 5.5에 대한 자체 AutomationBench 수치인 **40.0%**를 발표했습니다. OpenAI는 AutomationBench 1.0.6에서 Opus 5를 26.9%로 측정했습니다. 만약 이들이 동일한 버전의 동일한 벤치마크라면, 그리고 그것이 정말 '만약'이라면, Sol이 6.3점 차이로 이겼던 Opus 수치는 이제 Sol을 6.8점 차이로 앞서는 수치로 대체되었습니다. 이 비교는 단순히 시대에 뒤떨어진 것이 아니라, 완전히 역전되었습니다.
이 문제에 대해 논할 때 명심해야 할 두 가지 주의사항:
- OpenAI는 버전 1.0.6을 명시합니다. 우리가 가진 Anthropic 수치에는 버전 문자열이 없습니다. 동일한 이름의 벤치마크는 릴리스 사이에 변동될 수 있으며, 하네스(측정 도구)는 연구실마다 다릅니다. 26.9에서 40.0으로의 점프는 누군가가 하나의 하네스에서 두 모델을 모두 실행할 때까지는 방향성 있는 것으로만 간주하십시오.
- OpenAI는 여전히 GPT-6 Astra가 "전반적으로 최고의 모델"이라고 분명히 밝히고 있습니다. Sol은 GPT-6 제품군의 가치 등급이지 최고 등급이 아니므로, Sol 비교를 통해 OpenAI의 선두 기술에 대해 결론을 내리는 것은 범주 오류입니다. 선두 대 선두 비교는 Astra 대 Opus 5.5이며, 두 공급업체 모두 아직 이를 발표하지 않았습니다.
한 가지 더 중복되는 부분이 있습니다. Anthropic은 OSWorld 2.0에서 Opus 5.5가 81.8%를 기록했다고 보고한 반면, OpenAI는 OSWorld 2.0 오프라인에서 Sol이 60.5%를 기록했다고 보고했습니다. 이들은 동일한 제품군의 다른 변형일 수 있으며, 21점 차이는 종종 사과와 오렌지를 비교한 결과로 밝혀지는 종류의 숫자입니다. 이것을 정면 대결로 인용하지 마십시오.
실질적인 가격 차이
토큰당 가격 차이는 깔끔하게 2배입니다. 하지만 실제로 지불하는 가격 차이는 그렇지 않으며, 프롬프트 캐싱이 그 이유입니다.
Opus 5.5는 캐시된 입력을 100만 토큰당 0.20달러로 읽는데, 이는 입력 요금 4달러의 5%입니다. GPT-6는 Sol과 함께 캐싱 릴리스를 발표하여 캐시된 입력 읽기에 90% 할인을 적용했는데, 이는 Sol의 캐시된 읽기도 100만 토큰당 0.20달러로 만듭니다. 에이전트 프롬프트에서 절대 변하지 않는 부분인 반복되는 접두사에 대해서는 두 모델의 비용이 동일합니다.
구체적인 에이전트 작업 부하를 예로 들어 봅시다. 실행당 50,000개의 입력 토큰, 3,000개의 출력 토큰, 하루 1,000회 실행, 45,000개의 입력 토큰이 안정적인 접두사(시스템 프롬프트, 도구 스키마, OpenAPI 문서, 규칙 파일)라고 가정합니다.
| 일일 비용 | GPT-6 Sol | Claude Opus 5.5 | 비율 |
|---|---|---|---|
| 캐시 적중 없음 | $130 | $260 | 2.00x |
| 접두사 캐싱됨 | $49 | $89 | 1.82x |
이것은 발표된 요금에 대한 산술 계산이며 측정이 아니며, 캐시 쓰기(Opus 5.5는 100만당 5달러를 청구하고 Sol의 쓰기 요금은 우리가 가진 자료에는 발표되지 않음)는 제외됩니다. 방향성은 신뢰할 수 있습니다. 캐싱에 더 많이 의존할수록 저렴한 모델의 이점이 압축됩니다. 할인이 둘 다 동일한 최저가에 적용되기 때문입니다. 적극적인 캐싱 사용자는 2배가 아닌 1.8배의 차이를 구매하는 것입니다.
어쨌든 토큰당 비용은 잘못된 단위입니다. OpenAI의 자체 내부 수치가 그 이유를 설명합니다. OpenAI의 중간 연구원은 코딩 에이전트에 하루 600달러 이상을 지출하며, 상위 10%는 하루 7,000달러를 지출합니다. 아무도 토큰 가격을 잘못 책정하여 그렇게 많은 비용을 지출하지 않습니다. 그들은 재시도하고, 분기하고, 컨텍스트를 다시 읽는 루프를 실행하여 그렇게 합니다. 두 배의 비용이 들지만 세 번의 패스 대신 한 번의 패스로 끝내는 모델이 더 저렴한 모델입니다.
가격과 관련하여 한 가지 더 추가할 내용이 있습니다. 끊임없이 잘못 인용되기 때문입니다. OpenAI는 Sol과 Luna가 GPT-5.6 **프로모션** 가격보다 50% 저렴하다고 설명합니다. 프로모션은 OpenAI 자신의 단어입니다. 당시 GPT-5.6 가격 분석에서 우리가 기록한 GPT-5.6 정가 대비 Sol의 2달러/10달러는 헤드라인이 시사하는 것보다 더 큰 인하이지만, 헤드라인 자체는 정가가 아닌 할인율을 기준으로 측정되었습니다. 해당 한정자를 붙여서 인용하십시오.
지연 시간: 저렴한 모델이 빠른 모델은 아니다
Artificial Analysis는 GPT-6 Sol의 "최대" 추론 버전을 초당 115.2개의 출력 토큰으로 측정했으며, **첫 토큰까지 102.15초**가 걸렸습니다. 이는 최고 추론 설정에 대한 제3자 측정이며, 공급업체 수치가 아니며, 낮은 노력의 Sol을 대표하지도 않습니다. 이를 얼마나 나빠질 수 있는지에 대한 상한선으로 간주하고, 일반적인 응답 시간으로 간주하지 마십시오.
그래도 구축 방식은 달라집니다. 첫 토큰까지 100초가 걸린다는 것은 다음을 의미합니다.
- 기본 HTTP 클라이언트 타임아웃이 잘못되었습니다. 대부분의 라이브러리는 기본적으로 30초 또는 60초입니다.
- 호출 앞에 있는 로드 밸런서, API 게이트웨이 또는 서버리스 함수에는 자체 유휴 타임아웃이 있으며, 이는 클라이언트의 타임아웃보다 짧을 가능성이 높습니다.
- 스트리밍은 더 이상 사치품이 아닙니다. 스트리밍 없이는 요청이 살아있다는 신호가 없습니다.
- 타임아웃 시 발동되는 재시도 로직은 청구서와 지연 시간을 동시에 두 배로 늘릴 것입니다.
Anthropic의 Opus 5.5에 대한 비슷한 주장은 상대적입니다. Opus 5보다 30% 빠른 출력입니다. 이것은 비율에 대한 공급업체 진술이며, 초당 토큰 수치가 아니므로 Artificial Analysis 수치와 동일한 축에 놓을 수 없습니다. 두 모델을 모두 자신의 작업 부하에 대해 측정해야 합니다.
이것은 일반적인 API 테스트 작업입니다. 동일한 프롬프트를 두 엔드포인트에 보내고, 확산을 확인하기 위해 충분한 실행에서 첫 번째 바이트까지의 시간과 총 지속 시간을 기록하고, 응답 스키마를 확인하는 동안 확인하십시오. Apidog에서는 두 호출을 하나의 프로젝트에 유지하고, 테스트 시나리오로 실행하며, 지연 시간 기록을 스크래치 파일에 보관하는 대신 어설션 옆에 보관할 수 있습니다.
두 요청 모양은 중요할 만큼 충분히 다릅니다.
# Anthropic
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5-5",
"max_tokens": 1024,
"stream": true,
"messages": [{"role": "user", "content": "Summarize this OpenAPI path."}]
}'
# OpenAI
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "content-type: application/json" \
-d '{
"model": "gpt-6-sol",
"stream": true,
"input": "Summarize this OpenAPI path."
}'
다른 인증 헤더, 다른 본문 키, 다른 스트리밍 이벤트 형식. 이들을 전환하기 위해 작성하는 모든 추상화 계층은 이제 본인이 소유하게 되는 코드이며, 어느 공급업체가 새 필드를 출시할 때 먼저 고장날 것입니다.
선택 방법
| 작업 부하가 다음인 경우 | 다음으로 기울기 | 이유 |
|---|---|---|
| 높은 볼륨, 안정적인 접두사, 재시도 허용 | GPT-6 Sol | 토큰 가격 절반, 캐싱으로 최저가 유지 |
| 실패 시 비용이 많이 드는 긴 자율 실행 | Claude Opus 5.5 | 제3자 지능 지수 및 Anthropic 자체 AutomationBench 수치에서 선두 |
| 872k 토큰 이상의 컨텍스트 크기에 묶이는 경우 | Claude Opus 5.5 | 전체 백만 토큰 창 |
| 이미 Bedrock, Vertex 또는 Azure를 통해 라우팅 중인 경우 | Claude Opus 5.5 | 첫날 세 곳 모두에 출시됨 |
| Codex 또는 ChatGPT Work 내에서 작업 중인 경우 | GPT-6 Sol | 그곳에 먼저 착륙했습니다. |
| 미정 | 둘 다, 라우터 뒤에 | 1.8배의 캐시된 가격 차이는 충성도보다는 작업별로 라우팅하기에 충분히 작습니다. |
대부분의 팀에게 마지막 행이 솔직한 답변입니다. 1.8배의 캐시된 가격 차이에서 라우팅은 어느 공급업체의 마케팅보다도 빠르게 그 가치를 증명합니다. 높은 볼륨의 명확한 작업은 Sol로 보내고, 길고 모호하며 잘못될 경우 비용이 많이 드는 작업은 Opus 5.5로 보내십시오. 완료된 작업당 비용을 측정하고, 한 달 후에 다시 확인하며, 어느 출시 게시물에서든 벤치마크 표를 복사하여 현재 상태로 취급하지 마십시오. 그 중 하나는 같은 날 오후에 교체된 모델과 비교합니다.
