클로드 소네트 5.5 벤치마크: 앤트로픽 공식 데이터와 독립 결과 분석

Claude Sonnet 5.5 벤치마크: Terminal-Bench 4.0 70.6%, SWE-Bench Pro 81.3%, AA 지수 56. 누가 각 테스트를 실행했는지, 노력 비용은 얼마인지, 직접 평가를 실행하는 방법.

Medy Evrard

29 September 2026

클로드 소네트 5.5 벤치마크: 앤트로픽 공식 데이터와 독립 결과 분석

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

Claude Sonnet 5.5는 Terminal-Bench 4.0에서 70.6%, CursorBench 4.0에서 55.5%, FrontierCode 1.1에서 최대 노력(xhigh에서는 52.1%)으로 46.2%를 기록했으며, SWE-Bench Pro에서는 81.3%를 기록했습니다. 이는 Sonnet 5의 10.3%, 34.1%, 42.4%, 63.2%에서 상승한 수치입니다. Opus 5.5는 대부분의 출시 테이블 항목에서 약 2~3점 앞서지만, Terminal-Bench에서는 뒤처집니다. Artificial Analysis는 Sonnet 5.5를 자체 Intelligence Index에서 56점으로 독립적으로 평가하여 216개 중 3위를 차지했습니다.

아래: Claude Sonnet 5.5 벤치마크 전체 내용, 누가 실행했는지, 어떤 노력이 변경되었는지, 그리고 Apidog에서 자신의 트래픽으로 모델을 테스트하는 방법입니다. 사양은 Claude Sonnet 5.5란 무엇인가를 참조하십시오.

출시 테이블

Anthropic의 출시 게시물은 네 가지 모델을 비교합니다("n/r"은 대시를 나타냅니다). Sonnet 5.5 셀은 표시되지 않는 한 최대 노력을 기준으로 하며, API는 high, Claude Code 및 앱은 medium이 기본값입니다.

벤치마크 Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ n/r
FrontierCode 1.1 (메인) 46.2% 최대² / 52.1% Xhigh 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% n/r
GDPval-AA v2.1³ 1844 1449 1846 1487⁴
AA-Briefcase v1.1³ 1811 1359 1822 1483⁴
인류의 마지막 시험 (도구 포함) 64.5% 54.9% 67.7% n/r
OSWorld 2.1 (부분) 80.1% 57.0% 81.8% n/r
Chartography (도구 없음) 61.6% 15.6% 64.4% 53.6%⁴

각주는 간단히 말해 다음과 같습니다:

  1. Opus 5.5의 Terminal-Bench 점수는 xhigh에서 최고점을 기록했으며, max에서는 64.8%를 기록했습니다.
  2. FrontierCode는 범위를 벗어난 편집에 대해 페널티를 부과합니다. max에서 Sonnet 5.5는 Claude Code의 코드 검토 스킬을 더 자주 실행하여 많은 서브 에이전트로 분기했습니다. Cognition이 조사한 두 가지 경우에서 이는 타임아웃 또는 범위를 벗어난 편집을 야기했습니다.
  3. Artificial Analysis는 구조화된 출력 버그가 있던 출시 전 배포본에서 두 가지 지식 작업 테스트를 실행했으며, 이 버그는 현재 수정되었습니다. Anthropic은 Sonnet 5.5를 과소평가하는 등 작은 영향이 있을 것으로 예상합니다.
  4. OpenAI는 최근 GPT-6 Sol 이미지 이해 버그를 수정했으며, AA 및 Surge AI 점수는 이를 반영하지 않을 수 있습니다.

각 벤치마크를 실행한 주체

Anthropic은 명시적으로 제3자가 언급되지 않는 한 모든 테스트를 직접 실행했습니다. 공급업체 간 행은 벤치마크 이름은 공유하지만 하네스 또는 노력 설정은 공유하지 않습니다.

실행자 벤치마크 조건
Anthropic Terminal-Bench 4.0, HLE, OSWorld 2.1 TB: Claude Code --bare, 5회 시도, 안전장치 켜짐. HLE: 검색 및 코드 실행. OSWorld: 108개 작업
Cognition FrontierCode 1.1 Claude Code의 Claude, Codex CLI의 GPT
Cursor CursorBench 4.0 Cursor의 프로덕션 하네스; Anthropic은 정가로 비용 추정
Artificial Analysis GDPval-AA, AA-Briefcase 출시 전 배포본
Anthropic Chartography Surge AI의 벤치마크, Gemini 3.5 Flash로 채점; Surge로부터 Sol의 점수

Fallback은 Sonnet 5.5의 Terminal-Bench 시도 중 1.5%에 영향을 미쳤지만, Opus 5.5의 10%에 영향을 미쳤으므로(시스템 카드 §8.5), Sonnet의 4.2점 선두는 주의해서 해석해야 합니다.

시스템 카드 추가 사항

첫 6개 행은 시스템 카드의 최대 노력 요약입니다.

벤치마크 Sonnet 5.5 Sonnet 5 Opus 5.5
SWE-Bench Pro 81.3 63.2 89.9
SWE-Bench 다국어 90.3 78.3 93.9
SWE-Bench 멀티모달 54.3 28.1 61.4
HLE, 도구 없음 56.9 43.1 64.4
HealthBench Professional 69.2 57.8 65.6
AutomationBench (Zapier 실행) 44.7 10.7 42.5
DeepSWE v1.1 71.0% n/r n/r
Terminal-Bench-Science 0.1 59.9% n/r 58.7%
FrontierSWE v2 (Proximal 실행) 61.9% n/r 62.3%
ArXivMath (도구 없음 / 도구 포함) 86.8% / 95.2% n/r 91.2% / 96.9%
ProgramBench (긴 컨텍스트) 79.7% 77.3% 91.2%
OSWorld 2.1, 엄격한 통과 43.5% 25.6% 48.7%
Toolathlon-Verified (Pass@1) 77.8% 74.7% 77.8%
OfficeQA / OfficeQA Pro 76.9% / 65.6% 75.1% / 62.1% 78.9% / 67.7%

Sonnet 5.5는 HealthBench Professional, AutomationBench, Terminal-Bench-Science에서 Opus 5.5를 근소하게 앞서며, Opus는 ProgramBench, SWE-Bench Pro, 도구 없는 HLE에서 가장 크게 앞섭니다. OSWorld의 80.1%라는 헤드라인은 부분 점수이며, 전체 작업의 43.5%만이 완전히 통과합니다.

노력에 따라 결과가 달라집니다

출시 차트는 점수(비용)를 나타냅니다. Terminal-Bench 비용은 시도당, 다른 항목은 작업당입니다. 두 차트는 GPT-6 Sol 수치가 공개되지 않았기 때문에 GPT-5.6 Sol (*)을 보여줍니다.

모델 낮음 중간 높음 X높음 최대
Terminal-Bench 4.0
Sonnet 5.5 20.0% ($0.76) 28.8% ($0.83) 43.0% ($1.94) 61.5% ($5.30) 70.6% ($12.54)
Opus 5.5 38.5% ($1.29) 57.6% ($2.94) 64.2% ($3.88) 66.4% ($7.35) 64.8% ($11.24)
Sonnet 5 3.2% ($3.78) 4.4% ($4.83) 4.5% ($8.20) 7.0% ($9.95) 10.3% ($11.62)
GPT-5.6 Sol* 7.9% ($1.46) 20.9% ($2.69) 26.1% ($4.12) 28.5% ($5.39) 37.3% ($7.89)
FrontierCode 1.1 메인
Sonnet 5.5 29.3% ($0.19) 36.5% ($0.24) 49.4% ($0.42) 52.1% ($1.59) 46.2% ($20.78)
Opus 5.5 47.3% ($0.40) 54.6% ($0.80) 54.0% ($1.09) 51.4% ($2.25) 54.4% ($6.19)
Sonnet 5 28.7% ($2.39) 35.2% ($3.81) 39.4% ($6.10) 42.7% ($10.07) 42.4% ($17.12)
GPT-6 Sol 37.3% ($0.43) 45.9% ($0.77) 47.7% ($1.04) 48.4% ($1.32) 49.3% ($2.07)
CursorBench 4.0
Sonnet 5.5 35.8% ($0.50) 39.2% ($0.70) 47.8% ($1.67) 53.1% ($3.88) 55.5% ($9.67)
Opus 5.5 43.7% ($1.17) 52.5% ($2.91) 56.0% ($3.97) 56.0% ($6.98) 57.8% ($13.43)
Sonnet 5 24.1% ($1.39) 28.0% ($2.31) 30.8% ($3.48) 32.0% ($4.55) 34.1% ($7.17)
GPT-5.6 Sol* 24.6% ($0.87) 31.1% ($1.77) 35.7% ($2.85) 37.7% ($4.40) 41.7% ($8.23)
AA-Briefcase v1.1 (Elo)
Sonnet 5.5 1264 ($0.87) 1461 ($1.64) 1634 ($3.95) 1746 ($9.63) 1811 ($29.19)
Opus 5.5 1285 ($1.15) 1642 ($4.40) 1705 ($6.27) 1780 ($12.27) 1822 ($21.05)
Sonnet 5 923 ($0.82) 1056 ($1.73) 1177 ($3.76) 1274 ($7.56) 1359 ($14.43)
GPT-6 Sol 905 ($0.12) 1142 ($0.34) 1289 ($0.63) 1364 ($1.19) 1483 ($2.67)

독립적인 결과

Artificial Analysis는 Sonnet 5.5를 Intelligence Index v4.3.2에서 56점으로 평가하여 216개 중 3위를 차지했으며, 이는 max 및 xhigh의 Opus 5.5에만 뒤처지는 결과입니다. Sonnet 5는 38점을 기록했습니다. 인덱스를 실행하는 비용:

노력 인덱스 점수 실행 비용
max 55.98 $8,977
xhigh 51.85 $2,738
high 46.74 $1,176
medium 40.74 $701
low 35.84 $544

Max는 high보다 7.6배 비싸지만 9.2점 더 높습니다. OfficeChai의 AA 해석에 따르면 Sonnet 5.5는 파레토 효율 곡선에서 벗어나 있으며, high에서 가장 비용 경쟁력이 있으며, max에서 인덱스 작업당 약 193,000개의 출력 토큰을 계산합니다.

안전 벤치마크

시스템 카드에 따른 프롬프트 주입:

사이버 평가는 안전장치를 끈 상태로 실행되었습니다: CyScenarioBench에서 46.1% (Sonnet 5: 0.7%, Opus 5.5: 67.6%). 사이버 안전장치를 갖춘 최초의 Sonnet이며, Anthropic은 양성 보안 작업에서도 거부율이 더 높아질 수 있다고 경고합니다. 프롬프트 주입 가이드를 참조하십시오.

자체 평가 실행

벤치마크는 귀하의 트래픽과 같지 않으며, Anthropic의 프롬프트 가이드에 따르면 노력은 재조정되므로 Sonnet 5 설정을 재사용하지 마십시오. Apidog에서:

  1. ANTHROPIC_API_KEY를 환경 변수로 저장하고 20~50개의 실제 프롬프트를 메시지 요청으로 저장합니다.
  2. 상태 200, "max_tokens" 또는 "refusal" 이외의 stop_reason, 그리고 올바른 답변에 필요한 내용이 포함되어 있는지 확인합니다.
  3. low, medium, high, xhigh로 각각 한 번씩 실행합니다. 노력 변경은 프롬프트 캐시를 무효화합니다.
  4. 통과율과 usage의 토큰 수를 기록하고, 백만 개당 입력 $2, 출력 $10으로 가격을 책정합니다.
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 16000,
    "output_config": {"effort": "high"},
    "messages": [{"role": "user", "content": "이 지원 티켓을 분류하세요: ..."}]
  }'

수용 가능한 통과율을 가진 가장 낮은 노력을 사용하세요. LLM 애플리케이션 테스트 및 AI 에이전트 API 테스트를 참조한 다음, Apidog 다운로드하여 컬렉션을 구축하세요.

FAQ

Sonnet 5.5가 Opus 5.5를 능가합니까? Terminal-Bench 4.0, HealthBench Professional, AutomationBench, Terminal-Bench-Science 및 도구를 사용한 Chartography에서는 그렇습니다. Opus 5.5는 나머지 항목에서 선두를 달리거나 동률입니다.

Sonnet 5.5의 SWE-Bench 점수는 얼마입니까? SWE-Bench Pro에서 81.3점, 다국어 버전에서 90.3점(최대 노력 기준)입니다.

FrontierCode 숫자가 두 개인 이유는 무엇입니까? 46.2%는 max, 52.1%는 xhigh입니다. max의 서브 에이전트 분산은 범위를 벗어난 페널티를 유발했습니다.

Sonnet 5에서 업그레이드해야 합니까? 벤치마크에서는 그렇습니다. 하지만 먼저 Sonnet 5.5 vs Sonnet 5의 주요 API 변경 사항을 읽어보십시오.

다음 단계

Anthropic이 제안하는 대로 high(또는 잘 지정된 에이전트 코딩의 경우 medium)로 시작하고, Apidog에서의 자체 평가를 통해 더 높은 단계로 이동할 가치가 있는지 결정하세요.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요