Claude Sonnet 5.5는 Terminal-Bench 4.0에서 70.6%, CursorBench 4.0에서 55.5%, FrontierCode 1.1에서 최대 노력(xhigh에서는 52.1%)으로 46.2%를 기록했으며, SWE-Bench Pro에서는 81.3%를 기록했습니다. 이는 Sonnet 5의 10.3%, 34.1%, 42.4%, 63.2%에서 상승한 수치입니다. Opus 5.5는 대부분의 출시 테이블 항목에서 약 2~3점 앞서지만, Terminal-Bench에서는 뒤처집니다. Artificial Analysis는 Sonnet 5.5를 자체 Intelligence Index에서 56점으로 독립적으로 평가하여 216개 중 3위를 차지했습니다.
아래: Claude Sonnet 5.5 벤치마크 전체 내용, 누가 실행했는지, 어떤 노력이 변경되었는지, 그리고 Apidog에서 자신의 트래픽으로 모델을 테스트하는 방법입니다. 사양은 Claude Sonnet 5.5란 무엇인가를 참조하십시오.
출시 테이블
Anthropic의 출시 게시물은 네 가지 모델을 비교합니다("n/r"은 대시를 나타냅니다). Sonnet 5.5 셀은 표시되지 않는 한 최대 노력을 기준으로 하며, API는 high, Claude Code 및 앱은 medium이 기본값입니다.
| 벤치마크 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | n/r |
| FrontierCode 1.1 (메인) | 46.2% 최대² / 52.1% Xhigh | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | n/r |
| GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487⁴ |
| AA-Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483⁴ |
| 인류의 마지막 시험 (도구 포함) | 64.5% | 54.9% | 67.7% | n/r |
| OSWorld 2.1 (부분) | 80.1% | 57.0% | 81.8% | n/r |
| Chartography (도구 없음) | 61.6% | 15.6% | 64.4% | 53.6%⁴ |
각주는 간단히 말해 다음과 같습니다:
- Opus 5.5의 Terminal-Bench 점수는 xhigh에서 최고점을 기록했으며, max에서는 64.8%를 기록했습니다.
- FrontierCode는 범위를 벗어난 편집에 대해 페널티를 부과합니다. max에서 Sonnet 5.5는 Claude Code의 코드 검토 스킬을 더 자주 실행하여 많은 서브 에이전트로 분기했습니다. Cognition이 조사한 두 가지 경우에서 이는 타임아웃 또는 범위를 벗어난 편집을 야기했습니다.
- Artificial Analysis는 구조화된 출력 버그가 있던 출시 전 배포본에서 두 가지 지식 작업 테스트를 실행했으며, 이 버그는 현재 수정되었습니다. Anthropic은 Sonnet 5.5를 과소평가하는 등 작은 영향이 있을 것으로 예상합니다.
- OpenAI는 최근 GPT-6 Sol 이미지 이해 버그를 수정했으며, AA 및 Surge AI 점수는 이를 반영하지 않을 수 있습니다.
각 벤치마크를 실행한 주체
Anthropic은 명시적으로 제3자가 언급되지 않는 한 모든 테스트를 직접 실행했습니다. 공급업체 간 행은 벤치마크 이름은 공유하지만 하네스 또는 노력 설정은 공유하지 않습니다.
| 실행자 | 벤치마크 | 조건 |
|---|---|---|
| Anthropic | Terminal-Bench 4.0, HLE, OSWorld 2.1 | TB: Claude Code --bare, 5회 시도, 안전장치 켜짐. HLE: 검색 및 코드 실행. OSWorld: 108개 작업 |
| Cognition | FrontierCode 1.1 | Claude Code의 Claude, Codex CLI의 GPT |
| Cursor | CursorBench 4.0 | Cursor의 프로덕션 하네스; Anthropic은 정가로 비용 추정 |
| Artificial Analysis | GDPval-AA, AA-Briefcase | 출시 전 배포본 |
| Anthropic | Chartography | Surge AI의 벤치마크, Gemini 3.5 Flash로 채점; Surge로부터 Sol의 점수 |
Fallback은 Sonnet 5.5의 Terminal-Bench 시도 중 1.5%에 영향을 미쳤지만, Opus 5.5의 10%에 영향을 미쳤으므로(시스템 카드 §8.5), Sonnet의 4.2점 선두는 주의해서 해석해야 합니다.
시스템 카드 추가 사항
첫 6개 행은 시스템 카드의 최대 노력 요약입니다.
| 벤치마크 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 81.3 | 63.2 | 89.9 |
| SWE-Bench 다국어 | 90.3 | 78.3 | 93.9 |
| SWE-Bench 멀티모달 | 54.3 | 28.1 | 61.4 |
| HLE, 도구 없음 | 56.9 | 43.1 | 64.4 |
| HealthBench Professional | 69.2 | 57.8 | 65.6 |
| AutomationBench (Zapier 실행) | 44.7 | 10.7 | 42.5 |
| DeepSWE v1.1 | 71.0% | n/r | n/r |
| Terminal-Bench-Science 0.1 | 59.9% | n/r | 58.7% |
| FrontierSWE v2 (Proximal 실행) | 61.9% | n/r | 62.3% |
| ArXivMath (도구 없음 / 도구 포함) | 86.8% / 95.2% | n/r | 91.2% / 96.9% |
| ProgramBench (긴 컨텍스트) | 79.7% | 77.3% | 91.2% |
| OSWorld 2.1, 엄격한 통과 | 43.5% | 25.6% | 48.7% |
| Toolathlon-Verified (Pass@1) | 77.8% | 74.7% | 77.8% |
| OfficeQA / OfficeQA Pro | 76.9% / 65.6% | 75.1% / 62.1% | 78.9% / 67.7% |
Sonnet 5.5는 HealthBench Professional, AutomationBench, Terminal-Bench-Science에서 Opus 5.5를 근소하게 앞서며, Opus는 ProgramBench, SWE-Bench Pro, 도구 없는 HLE에서 가장 크게 앞섭니다. OSWorld의 80.1%라는 헤드라인은 부분 점수이며, 전체 작업의 43.5%만이 완전히 통과합니다.
노력에 따라 결과가 달라집니다
출시 차트는 점수(비용)를 나타냅니다. Terminal-Bench 비용은 시도당, 다른 항목은 작업당입니다. 두 차트는 GPT-6 Sol 수치가 공개되지 않았기 때문에 GPT-5.6 Sol (*)을 보여줍니다.
| 모델 | 낮음 | 중간 | 높음 | X높음 | 최대 |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | |||||
| Sonnet 5.5 | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Opus 5.5 | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| Sonnet 5 | 3.2% ($3.78) | 4.4% ($4.83) | 4.5% ($8.20) | 7.0% ($9.95) | 10.3% ($11.62) |
| GPT-5.6 Sol* | 7.9% ($1.46) | 20.9% ($2.69) | 26.1% ($4.12) | 28.5% ($5.39) | 37.3% ($7.89) |
| FrontierCode 1.1 메인 | |||||
| Sonnet 5.5 | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| Opus 5.5 | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| Sonnet 5 | 28.7% ($2.39) | 35.2% ($3.81) | 39.4% ($6.10) | 42.7% ($10.07) | 42.4% ($17.12) |
| GPT-6 Sol | 37.3% ($0.43) | 45.9% ($0.77) | 47.7% ($1.04) | 48.4% ($1.32) | 49.3% ($2.07) |
| CursorBench 4.0 | |||||
| Sonnet 5.5 | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| Opus 5.5 | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| Sonnet 5 | 24.1% ($1.39) | 28.0% ($2.31) | 30.8% ($3.48) | 32.0% ($4.55) | 34.1% ($7.17) |
| GPT-5.6 Sol* | 24.6% ($0.87) | 31.1% ($1.77) | 35.7% ($2.85) | 37.7% ($4.40) | 41.7% ($8.23) |
| AA-Briefcase v1.1 (Elo) | |||||
| Sonnet 5.5 | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| Opus 5.5 | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
| Sonnet 5 | 923 ($0.82) | 1056 ($1.73) | 1177 ($3.76) | 1274 ($7.56) | 1359 ($14.43) |
| GPT-6 Sol | 905 ($0.12) | 1142 ($0.34) | 1289 ($0.63) | 1364 ($1.19) | 1483 ($2.67) |
- 대부분의 이득은 xhigh에서 발생합니다. Max는 Terminal-Bench에서 2.4배의 비용으로 9.1점을, CursorBench에서 2.5배의 비용으로 2.4점을 추가합니다.
- FrontierCode의 max 점수는 xhigh보다 낮고 비용은 13배 더 비쌉니다 (46.2%, $20.78 vs 52.1%, $1.59).
- 낮은 노력의 Opus 5.5가 진정한 경쟁자입니다. Terminal-Bench에서 Opus는 medium 노력으로 $2.94에 57.6%를 기록하고, Sonnet은 high 노력으로 $1.94에 43.0%를 기록합니다. Opus의 high 노력(64.2%, $3.88)은 Sonnet의 xhigh 노력(61.5%, $5.30)을 능가합니다. Sonnet 5.5 vs Opus 5.5를 참조하십시오.
- High는 Sonnet의 비용 효율이 가장 좋은 지점입니다. high 노력의 FrontierCode: $0.42에 49.4%로, GPT-6 Sol의 최고치(49.3%)와 거의 비슷하며 비용은 약 5분의 1에 불과합니다(가격 분석).
독립적인 결과
Artificial Analysis는 Sonnet 5.5를 Intelligence Index v4.3.2에서 56점으로 평가하여 216개 중 3위를 차지했으며, 이는 max 및 xhigh의 Opus 5.5에만 뒤처지는 결과입니다. Sonnet 5는 38점을 기록했습니다. 인덱스를 실행하는 비용:
| 노력 | 인덱스 점수 | 실행 비용 |
|---|---|---|
| max | 55.98 | $8,977 |
| xhigh | 51.85 | $2,738 |
| high | 46.74 | $1,176 |
| medium | 40.74 | $701 |
| low | 35.84 | $544 |
Max는 high보다 7.6배 비싸지만 9.2점 더 높습니다. OfficeChai의 AA 해석에 따르면 Sonnet 5.5는 파레토 효율 곡선에서 벗어나 있으며, high에서 가장 비용 경쟁력이 있으며, max에서 인덱스 작업당 약 193,000개의 출력 토큰을 계산합니다.
- AA 자체 Terminal-Bench 4.0 실행: 63.6%, Anthropic의 70.6% 대비.
- Sonnet 5의 낮은 점수는 실제입니다: AA는 14.1%를 측정했습니다(Sonnet 5 벤치마크 참조).
- AA-Omniscience (OfficeChai에 따르면): 54%의 정확도와 47%의 환각률을 보였으며, Opus 5.5는 66%와 59%를 기록했습니다.
- 아직 측정되지 않음: 출력 속도와 첫 토큰 생성 시간. 따라서 "30%+ 더 빠름"은 Anthropic의 주장으로 남아 있습니다. 아직 LMArena 목록에는 없습니다.
안전 벤치마크
시스템 카드에 따른 프롬프트 주입:
- Gray Swan: 공격 성공률 0.4%, 2.7%, 3.4%(k=1, 10, 15) (Sonnet 5: 0.7%, 5.1%, 6.7%). GUI 컴퓨터 사용이 12.5%(k=15)로 가장 취약합니다.
- Shade, 코딩: 안전장치 없이 3.01%로, 대부분 Sonnet 5 사이버 폴백을 통해 이루어졌습니다. Sonnet 5.5 자체는 5,901건의 요청 중 4건에서 침해되었습니다.
- 브라우저 사용: 110가지 시나리오에서 공격 성공 사례 없음.
사이버 평가는 안전장치를 끈 상태로 실행되었습니다: CyScenarioBench에서 46.1% (Sonnet 5: 0.7%, Opus 5.5: 67.6%). 사이버 안전장치를 갖춘 최초의 Sonnet이며, Anthropic은 양성 보안 작업에서도 거부율이 더 높아질 수 있다고 경고합니다. 프롬프트 주입 가이드를 참조하십시오.
자체 평가 실행
벤치마크는 귀하의 트래픽과 같지 않으며, Anthropic의 프롬프트 가이드에 따르면 노력은 재조정되므로 Sonnet 5 설정을 재사용하지 마십시오. Apidog에서:
ANTHROPIC_API_KEY를 환경 변수로 저장하고 20~50개의 실제 프롬프트를 메시지 요청으로 저장합니다.- 상태 200,
"max_tokens"또는"refusal"이외의stop_reason, 그리고 올바른 답변에 필요한 내용이 포함되어 있는지 확인합니다. low,medium,high,xhigh로 각각 한 번씩 실행합니다. 노력 변경은 프롬프트 캐시를 무효화합니다.- 통과율과
usage의 토큰 수를 기록하고, 백만 개당 입력 $2, 출력 $10으로 가격을 책정합니다.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 16000,
"output_config": {"effort": "high"},
"messages": [{"role": "user", "content": "이 지원 티켓을 분류하세요: ..."}]
}'
수용 가능한 통과율을 가진 가장 낮은 노력을 사용하세요. LLM 애플리케이션 테스트 및 AI 에이전트 API 테스트를 참조한 다음, Apidog 다운로드하여 컬렉션을 구축하세요.
FAQ
Sonnet 5.5가 Opus 5.5를 능가합니까? Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science 및 도구를 사용한 Chartography에서는 그렇습니다. Opus 5.5는 나머지 항목에서 선두를 달리거나 동률입니다.
Sonnet 5.5의 SWE-Bench 점수는 얼마입니까? SWE-Bench Pro에서 81.3점, 다국어 버전에서 90.3점(최대 노력 기준)입니다.
FrontierCode 숫자가 두 개인 이유는 무엇입니까? 46.2%는 max, 52.1%는 xhigh입니다. max의 서브 에이전트 분산은 범위를 벗어난 페널티를 유발했습니다.
Sonnet 5에서 업그레이드해야 합니까? 벤치마크에서는 그렇습니다. 하지만 먼저 Sonnet 5.5 vs Sonnet 5의 주요 API 변경 사항을 읽어보십시오.
다음 단계
Anthropic이 제안하는 대로 high(또는 잘 지정된 에이전트 코딩의 경우 medium)로 시작하고, Apidog에서의 자체 평가를 통해 더 높은 단계로 이동할 가치가 있는지 결정하세요.
