GPT-6.1 Sol과 Claude Sonnet 5.5는 둘 다 1백만 입력 토큰당 2달러, 1백만 출력 토큰당 10달러로 책정되어 있으며, 출시일은 하루 차이였습니다. Sonnet 5.5는 2026년 9월 28일, GPT-6.1 Sol은 9월 29일에 출시되었습니다. 어떤 벤더도 상대 모델과 벤치마크를 진행하지 않았습니다. OpenAI는 GPT-6.1 Sol을 Claude Opus 5.5 및 Fable 5.1과 비교했고, Anthropic은 Sonnet 5.5를 이전 Sol 모델인 GPT-6 Sol과 비교했습니다. 정직한 선택 방법은 토큰당 가격이 아니라 자신의 작업에 두 모델을 모두 실행하여 작업당 비용을 비교하는 것입니다.
아래 내용: 사양 및 가격 비교, 각 벤더의 주장 및 비교 모델, 제3자 수치(모두 GPT-6 Sol 기준이며 6.1 아님), 그리고 Apidog에서 직접 비교를 실행하는 방법입니다. 각 모델에 대한 자세한 내용은 GPT-6.1 Sol이란 무엇인가 및 Claude Sonnet 5.5란 무엇인가를 참조하세요.
GPT-6.1 Sol 대 Claude Sonnet 5.5: 사양 및 가격
출처: OpenAI의 가격 페이지, Anthropic의 Sonnet 5.5 개요 및 가격 책정, 그리고 아래 링크된 GPT-6.1 Sol 모델 페이지입니다.
| GPT-6.1 Sol | Claude Sonnet 5.5 | |
|---|---|---|
| 모델 ID | gpt-6.1-sol |
claude-sonnet-5-5 (Bedrock: anthropic.claude-sonnet-5-5) |
| 출시일 | 2026년 9월 29일 | 2026년 9월 28일 |
| 100만당 입력 / 출력 | $2 / $10 | $2 / $10 |
| 100만당 캐시 읽기 | $0.10 | $0.20 |
| 100만당 캐시 쓰기 | $2.50 | $2.50 (5분), $4 (1시간) |
| 100만당 배치 | $1 / $5 | $1 / $5 |
| 272K 입력 토큰 초과 프롬프트 | 전체 요청에 대해 입력 $4, 캐시 $0.20, 출력 $15 | 1M 윈도우 전체에 걸쳐 프리미엄 없음 |
| 더 빠른 계층 | $4 / $20의 Fast; Ultrafast는 “출시 예정” | Fast 모드 사용 불가 |
| 컨텍스트 윈도우 | 1,050,000 (최대 입력 922,000) | 1M |
| 최대 출력 | 128,000 | 128K (베타 헤더가 있는 Batch에서 300K) |
| 지식 차단 시점 | 2026년 4월 30일 | 2026년 6월 |
| 노력 수준 | low, medium (기본), high, xhigh, max; none 없음 |
low, medium, high (API 기본), xhigh, max; 사고를 끌 수 없음 (가장 낮은 설정: between_tools) |
| API 형태 | 응답 (도구 포함), 채팅 완료 (도구 없음), 배치 | 메시지, 배치 |
| 기타 플랫폼 | OpenRouter (openai/gpt-6.1-sol) |
Bedrock, Google Cloud, Microsoft Foundry, AWS의 Claude Platform |
| 무료 액세스 | 없음. Plus, Pro, Business, Enterprise 및 Edu 사용자는 ChatGPT Work 및 Codex에서 사용 가능 (Chat에서는 불가; Enterprise 및 Edu는 관리자가 활성화해야 함, 모델 문서 참조); 무료 API 계층 없음 | 누구나 Claude.ai에서 채팅 가능; API는 토큰당 청구 |
두 줄은 비용에 가장 중요합니다. GPT-6.1 Sol의 캐시 읽기 비용은 Sonnet 5.5의 절반이므로, 긴 시스템 프롬프트를 재사용하는 것이 OpenAI에서 더 저렴합니다. 272K 입력 토큰을 초과하면 균형이 바뀝니다. GPT-6.1 Sol 모델 페이지는 전체 요청에 대해 입력 및 캐시 요율의 2배, 출력의 1.5배를 책정하는 반면, Sonnet 5.5는 2달러와 10달러를 유지합니다. 캐시되지 않은 400,000 토큰 프롬프트와 5,000 토큰 답변은 GPT-6.1 Sol에서 약 1.68달러, Sonnet 5.5에서 약 0.85달러가 소요됩니다.
각 벤더의 주장 및 비교 모델
| OpenAI (GPT-6.1 Sol에 대해) | Anthropic (Claude Sonnet 5.5에 대해) | |
|---|---|---|
| 비교 대상 | GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 | Sonnet 5, Opus 5.5, GPT-6 Sol (두 차트에서는 GPT-5.6 Sol) |
| 다른 모델 포함 여부 | 아니요 | 아니요 (GPT-6.1 Sol은 아직 존재하지 않음) |
| 헤드라인 | Astra의 표준 토큰 가격의 5분의 1로 "Astra급 지능" | Sonnet 5보다 30% 이상 빠르고, 작업당 비용은 최대 30% 절감 |
| 측정 주체 | OpenAI (각주에 따르면 경쟁사 결과는 공개 보고서 기반) | Anthropic, Cognition, Cursor, Artificial Analysis 및 Surge AI (명명된 벤치마크에 대해) |
OpenAI의 GPT-6.1 Sol 출시 게시물은 OpenAI가 보고한 다음 결과를 텍스트에 명시하고 있습니다.
- AutomationBench 1.0.6, 중간 노력: Opus 5.5보다 약 3분의 1 비용으로 +2.2 pp, GPT-6 Sol보다 +4.8 pp.
- Terminal-Bench Science 0.1, 최대 노력: Opus 5.5의 23.21달러 대비 작업당 5.47달러. GPT-6 Astra는 여전히 68.1%로 가장 높은 점수를 기록.
- OSWorld 2.0 오프라인, 최대 노력: GPT-6 Sol보다 절반 이하의 비용으로 +7 pp.
Anthropic의 Sonnet 5.5 출시 게시물에는 GPT-6 Sol 열이 포함되어 있습니다.
- FrontierCode 1.1, Cognition 실행: Sonnet 5.5는 xhigh에서 52.1% (max에서 46.2%)를 기록했으며, GPT-6 Sol은 49.3%를 기록했습니다. 높은 노력 수준에서 Anthropic은 Sonnet 5.5가 GPT-6 Sol의 최고 점수를 약 5분의 1 비용으로 달성한다고 말합니다.
- GDPval-AA v2.1 및 AA-Briefcase v1.1, Artificial Analysis 실행: 1844 대 1487, 1811 대 1483.
Sonnet 5.5 벤치마크 분석은 Anthropic 표의 나머지 부분을 다룹니다.
Opus 5.5는 두 차트에 모두 나타나고, 두 벤더 모두 AutomationBench 및 Terminal-Bench Science를 보고하므로 둘을 연결하고 싶을 수 있습니다. 하지만 숫자가 일치하지 않습니다. OpenAI는 자체 하네스에서 AutomationBench 1.0.6을 중간 노력으로 보고하는 반면, Anthropic의 시스템 카드 요약 표는 Claude 모델을 최대 노력으로 실행합니다(Sonnet 5.5 44.7, Opus 5.5 42.5; GPT-6 Sol 32.0). Anthropic은 Terminal-Bench Science에서 Sonnet 5.5에게 59.9%를 부여하지만, OpenAI 텍스트는 GPT-6.1 Sol에 대한 원점수를 제공하지 않습니다. 또한 OpenAI는 OSWorld 2.0 오프라인에서 컴퓨터 사용을 테스트했고, Anthropic은 OSWorld 2.1에서 테스트했습니다. GPT-6 Sol 대 Claude Opus 5.5 비교에서도 같은 벽에 부딪혔습니다.
제3자가 측정한 내용 (GPT-6 Sol 기준, 6.1 아님)
검색 결과의 모든 제3자 비교는 Sonnet 5.5와 GPT-6 Sol을 짝지었습니다. 가장 완전한 것은 Artificial Analysis이며, 이들의 Intelligence Index v4.3.2는 10가지 평가를 종합합니다.
| 노력 | Sonnet 5.5 인덱스 | Sonnet 5.5 작업당 비용 | GPT-6 Sol 인덱스 | GPT-6 Sol 작업당 비용 |
|---|---|---|---|---|
| medium | 41 | $0.59 | 40 | $0.25 |
| high | 47 | $1.08 | 43 | $0.38 |
| xhigh | 52 | $2.74 | 44 | $0.52 |
| max | 56 | $7.60 | 48 | $1.05 |
최대 노력에서 같은 페이지는 Sonnet 5.5를 초당 138 출력 토큰, GPT-6 Sol을 76으로 측정합니다. Sonnet 5.5는 동일한 정가에도 불구하고 표시된 모든 노력 수준에서 더 높은 점수를 얻고 작업당 비용이 더 높습니다. 이는 토큰 소비의 차이입니다. Sonnet 5.5 (47, $1.08)는 GPT-6 Sol의 max (48, $1.05)와 비슷합니다.
Anthropic 자체 차트 데이터는 양쪽 모두에 적용됩니다. AA-Briefcase에서는 GPT-6 Sol이 모든 노력 수준에서 작업당 비용이 더 적지만(중간에서 0.34달러 대 1.64달러), Sonnet 5.5는 더 높은 점수를 받습니다. FrontierCode에서는 Sonnet 5.5가 높은 노력에서 49.4%를 달성하며 작업당 0.42달러가 소요되는 반면, GPT-6 Sol은 최대 노력에서 49.3%를 달성하며 2.07달러가 소요됩니다.
이 모든 것은 구형 Sol 모델에 대한 것입니다. OpenAI는 GPT-6.1 Sol이 여러 벤치마크에서 동일하거나 더 낮은 노력으로 GPT-6 Sol을 능가한다고 주장하므로, 제3자가 이를 테스트하면 그 결과가 바뀔 것으로 예상됩니다.
각 벤더의 관점에서 강점으로 예상되는 부분
GPT-6.1 Sol. OpenAI는 "더 낮은 비용으로 Astra에 준하는 성능을 원할 때 복잡한 코딩, 컴퓨터 사용 및 전문적인 작업"에 GPT-6.1 Sol을 추천합니다. 명시된 이점은 에이전트 자동화, 컴퓨터 사용 및 과학 작업, 낮은 노력에서의 사실 오류 감소입니다. 가격 면에서는 272K 입력 토큰 미만의 캐시 집중 워크로드에 유리하며, 유료 속도 계층(Fast)을 가진 두 모델 중 유일한 모델입니다.
Claude Sonnet 5.5. Anthropic은 잘 정의된 일상적인 작업, 버그 수정, 세련된 문서, 슬라이드 및 스프레드시트에 Sonnet 5.5를 추천하며, Opus 5.5는 "복잡하고 개방형 작업에서 여전히 훨씬 더 강력하다"고 말합니다(Sonnet 5.5 대 Opus 5.5 참조). 보고된 강점은 에이전트 코딩(Anthropic 실행 Terminal-Bench 4.0에서 최대 70.6%), 지식 작업 및 컴퓨터 사용(OSWorld 2.1에서 80.1% 부분)입니다. 가격 면에서는 272K 토큰을 초과하는 프롬프트에 유리하며, Bedrock, Google Cloud 및 Microsoft Foundry에서 실행됩니다.
두 가지 동작이 순진한 테스트를 왜곡합니다. 기본 노력 수준이 다릅니다(GPT-6.1 Sol은 medium, Sonnet 5.5는 API에서 high). 따라서 일치하는 설정을 비교해야 합니다. 그리고 둘 다 샘플링 노브를 취하지 않습니다. Sonnet 5.5는 비기본 temperature, top_p 또는 top_k에서 400을 반환하며, OpenAI의 GPT-6 지침은 노력이 none이 아닐 때 temperature 및 top_p를 낮추라고 합니다. 반복 실행으로 분산을 제어하세요.
Apidog에서 직접 비교 실행
JSON 필드 또는 레이블과 같이 확인 가능한 답변이 있는 실제 트래픽에서 20~50개의 작업을 선택합니다. 그런 다음 Apidog에서:
OPENAI_API_KEY및ANTHROPIC_API_KEY를 비밀로,EFFORT를 포함하는 환경을 생성합니다.{{prompt}}변수를 공유하는 두 개의 요청을 저장합니다. 형태는 다릅니다(응답 참조, 메시지 참조). API 형식 비교에서 그 이유를 설명합니다.
POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json
{"model": "gpt-6.1-sol", "reasoning": {"effort": "{{EFFORT}}"},
"max_output_tokens": 25000, "input": "{{prompt}}"}
POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json
{"model": "claude-sonnet-5-5", "max_tokens": 25000,
"output_config": {"effort": "{{EFFORT}}"},
"messages": [{"role": "user", "content": "{{prompt}}"}]}
- 각 형태에 대한 어설션과
expected열에 대해 답변 자체에 대한 어설션을 추가합니다.
| 확인 | OpenAI 응답 | Anthropic 메시지 |
|---|---|---|
| 정상적으로 완료됨 | $.status가 completed와 같음 |
$.stop_reason이 end_turn과 같음 |
| 답변 존재 | $.output[*].type에 message 포함 |
$.content[*].type에 text 포함 |
| 출력 토큰 (추론 포함) | $.usage.output_tokens |
$.usage.output_tokens |
| 캐시 읽기 | $.usage.input_tokens_details.cached_tokens |
$.usage.cache_read_input_tokens |
| 캐시 쓰기 | $.usage.input_tokens_details.cache_write_tokens |
$.usage.cache_creation_input_tokens |
- 사후 처리 스크립트에서 각 응답의 가격을 책정합니다. OpenAI의
input_tokens에는 캐시된 토큰과 캐시 쓰기 토큰이 포함되므로, 2달러 요율을 적용하기 전에 이를 빼야 합니다(OpenAI 프롬프트 캐싱). Anthropic의input_tokens는 마지막 캐시 중단점 이후의 토큰만 계산합니다(Anthropic 프롬프트 캐싱). OpenAI 측에는 272K 규칙을 적용합니다. - 두 요청을 하나의 테스트 시나리오에 넣고, 프롬프트는 CSV 파일에 따옴표 없이 한 줄로 유지하며, 원하는 각 노력 수준에서 Apidog CLI로 실행합니다.
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
-d prompts.csv --env-var "EFFORT=medium" -r cli,junit
총 지출을 통과한 작업 수로 나누세요. 이것이 작업당 비용입니다. 벤더마다 동일한 노력 이름이 동일하게 보정되지 않으므로, 둘 다 최소 medium 및 high 수준으로 실행하세요. 요청 세부 정보는 GPT-6.1 Sol API 가이드 및 Claude Sonnet 5.5 API 사용 방법을 참조하세요.
자주 묻는 질문
GPT-6.1 Sol이 Claude Sonnet 5.5보다 저렴합니까? 정가는 1백만 토큰당 2달러/10달러로 동일합니다. GPT-6.1 Sol의 캐시 읽기 비용이 더 저렴하고, Sonnet 5.5는 272K 입력 토큰을 초과할 때 더 저렴합니다. 실제 비용은 작업당 사용된 토큰에 따라 달라집니다.
코딩에 더 뛰어난 모델은 무엇입니까? 공유된 벤치마크는 없습니다. Anthropic은 FrontierCode에서 Sonnet 5.5가 GPT-6 Sol보다 우수하다고 보고하고, OpenAI는 GPT-6.1 Sol이 GPT-6 Sol의 최고 DeepSWE 점수를 6.4 pp 능가한다고 보고합니다. 자신의 리포지토리에서 테스트해 보세요.
어떤 모델이 더 빠릅니까? Artificial Analysis는 Sonnet 5.5가 초당 138 토큰, GPT-6 Sol이 초당 76 토큰으로 측정했으며, 둘 다 최대 노력 수준이었습니다. GPT-6.1 Sol에 대한 제3자 수치는 아직 없습니다.
둘 중 하나라도 무료입니까? GPT-6.1 Sol은 무료 계층이 없습니다. Sonnet 5.5는 Claude.ai 채팅 앱에서 사용할 수 있지만, API는 토큰당 청구됩니다. Claude Sonnet 5.5를 무료로 사용하는 방법을 참조하세요.
둘 다 실행하여 선택하기
백로그에서 10개의 작업을 선택하여 두 모델을 medium 및 high 수준으로 실행하고, 통과 작업당 비용을 비교해 보세요. Artificial Analysis가 GPT-6.1 Sol 수치를 발표하거나 어느 벤더든 새 스냅샷을 출시할 때 다시 실행할 수 있는 하나의 시나리오로 유지하려면 Apidog를 다운로드하세요.
