클로드 오푸스 5 벤치마크: 숫자가 말하는 진실

하나의 표에 정리된 클로드 오푸스 5의 모든 벤치마크 주장: 프론티어-벤치, ARC-AGI 3, OS월드 2.0, 커서벤치 3.2, 오토메이션벤치. 모두 벤더가 실행했으며, 재현된 것은 없습니다.

Ashley Innocent

Ashley Innocent

25 July 2026

클로드 오푸스 5 벤치마크: 숫자가 말하는 진실

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

Anthropic은 2026년 7월 24일, Claude Opus 5를 출시하며 압도적인 성능을 과시하는 벤치마크 결과를 발표했습니다. 한 평가에서는 Opus 4.8보다 두 배 이상 뛰어났고, 다른 평가에서는 차세대 최고 모델보다 세 배나 앞섰습니다. 또 다른 평가에서는 Fable 5를 제치고 3분의 1 비용으로 더 나은 성능을 보였습니다.

그렇다고 해서 이 결과들이 틀렸다는 것은 아닙니다. 다만, 다른 모든 공급업체의 출시 차트를 읽듯이, 무엇을 측정하고 무엇을 제외했는지 주의 깊게 살펴봐야 한다는 의미입니다. 이 가이드에서는 공개된 모든 Opus 5 벤치마크 주장을 하나의 표로 정리하고, 각 수치가 무엇을 뒷받침할 수 있고 없는지 설명하며, Anthropic이 자체 모델 위에 설정한 한계를 명시하고, Apidog에서 직접 실행할 수 있는 평가 계획으로 마무리합니다.

앱 다운로드

모델 자체(claude-opus-5, 1M 컨텍스트, 최대 128k 출력, 2026년 5월 지식 차단)에 대해서는 Claude Opus 5는 무엇인가에서 시작하세요. 아래의 주요 출처는 Anthropic의 Claude Opus 5 출시 게시물입니다.

하나의 표로 보는 모든 공개된 주장

다음은 Anthropic이 출시 시점에 발표한 벤치마크 주장 전체입니다. 이 중 상당수는 점수가 아닌 다른 모델과 비교하여 명시되었으므로, 비교 항목은 결과 항목만큼 중요합니다.

벤치마크 Anthropic의 주장 표현 방식 비교 대상
Frontier-Bench v0.1 다른 모든 모델 능가; 작업당 더 낮은 비용으로 Opus 4.8 점수의 두 배 이상 비율 + 비용 주장 Opus 4.8 및 기타 모델
ARC-AGI 3 차세대 최고 모델 점수의 약 3배 비율 이름 없는 차세대 최고 모델
OSWorld 2.0 Fable 5를 능가하며 비용은 3분의 1 서수 + 비용 주장 Fable 5
CursorBench 3.2 Fable 5 최고 성능의 0.5% 이내, 가격은 절반 격차 + 비용 주장 Fable 5
Zapier AutomationBench 통과율이 차세대 최고 모델의 약 1.5배 비율 이름 없는 차세대 최고 모델
유기 화학 Opus 4.8보다 10.2점 증가 절대 차이 Opus 4.8
단백질 분석 Opus 4.8보다 7.7점 증가 절대 차이 Opus 4.8
사이버 보안 공격 Mythos 5에 뒤처짐 서수 Mythos 5
자율 생물학 연구 Mythos 5에 뒤처짐 서수 Mythos 5

위 모든 내용의 출처: Anthropic의 출시 게시물 및 모델 문서. 이 글을 쓰는 시점까지 이러한 결과에 대한 제3자의 재현은 발표되지 않았습니다.

개별 숫자를 읽기 전에 두 가지 사실이 눈에 뜁니다. 9개 항목 중 두 개만이 절대적인 점수 변동을 나타냅니다. 그리고 Anthropic 자체는 새로운 플래그십 모델이 뒤처지는 마지막 두 항목을 제공합니다.

비율 문제와 그 중요성

4가지 주장(Frontier-Bench, ARC-AGI 3, AutomationBench, 그리고 어느 정도는 CursorBench)은 점수가 아닌 비율이나 격차로 표현됩니다. 이는 사소한 불만이 아니라 실제적인 한계이며, 그 이유에 대해 구체적으로 설명할 가치가 있습니다.

비율은 분모를 숨깁니다. ARC-AGI 3에서 "차세대 최고 모델의 약 3배"라는 것은 해당 분야의 위치에 따라 다른 의미를 가집니다. 차세대 최고 모델이 8%를 득점했다면, 3배는 24%입니다. 이는 아무도 해결에 근접하지 못한 벤치마크에서 실질적인 진전입니다. 차세대 최고 모델이 25%를 득점했다면, 3배는 75%로, 완전히 다른 결과입니다. 둘 다 정직하게 "3배"로 설명될 수 있습니다. 어떤 경우인지 알 수 없으며, Anthropic은 밝히지 않았습니다.

배가 되는 것은 척도 하단에서 더 쉽습니다. Frontier-Bench v0.1에서 "Opus 4.8 점수의 두 배 이상"이라는 것도 같은 문제입니다. 이전 플래그십이 한 자릿수나 낮은 10대 점수를 기록한 어렵고 새로운 벤치마크에서는, 두 배가 된다는 것은 표현이 암시하는 것보다 작은 절대적 증가입니다. 4.8이 이미 40%를 기록한 벤치마크에서 두 배가 된다는 것은 이례적인 일일 것입니다. 여기서 버전 문자열은 힌트입니다. v0.1은 공개된 실적 기록, 커뮤니티 재현, 확립된 포화 지점이 없는 벤치마크입니다.

"차세대 최고 모델"은 이름이 지정되지 않았습니다. 두 가지 주장은 Opus 5를 특정되지 않은 경쟁자와 비교합니다. 이 경쟁자는 Fable 5, Mythos 5 또는 다른 연구소의 모델일 수 있습니다. 비교 대상 설정이 비율의 의미를 얼마나 결정하는지, 그리고 그것은 공개되지 않았습니다.

격차에는 단위가 필요합니다. CursorBench 3.2에서 "Fable 5 최고 성능의 0.5% 이내"라는 것은 0.5 퍼센트 포인트인지 0.5% 상대적 차이인지를 명시하지 않으며, "최고 성능(peak)"은 기본 설정 실행보다는 최적 설정 실행을 의미합니다. 코딩 벤치마크에서 기본 `effort` 설정과 최대 설정 간의 차이는 무시할 수 없습니다. Fable 5 벤치마크 분석은 해당 모델 자체의 수치가 어떻게 구성되었는지 다룹니다.

두 과학 관련 수치는 이러한 모든 문제를 피하기 때문에 가장 깔끔한 주장입니다. 유기 화학에서 +10.2점, 단백질 분석에서 +7.7점은 명명된 기준선 대비 절대적인 차이를 나타냅니다. 시작 점수는 여전히 알 수 없지만, 모델이 얼마나 발전했는지는 정확히 알 수 있습니다.

작업당 비용 주장은 구성에 따라 달라집니다

Anthropic의 주장 중 세 가지는 기능과 비용을 함께 묶습니다. Frontier-Bench에서는 작업당 비용이 더 낮고, OSWorld 2.0에서는 비용이 3분의 1이며, CursorBench 3.2에서는 가격이 절반입니다.

정가에 대한 절반 주장은 검증 가능하며 사실입니다. Opus 5는 백만 입력 토큰당 5달러, 백만 출력 토큰당 25달러이며, 이는 Opus 4.8과 동일하고 Fable 5의 10달러/50달러의 정확히 절반입니다. 이 정보는 Anthropic의 가격 책정 페이지에 게시되어 있으며, 벤치마크 결과가 전혀 아닙니다. 캐시 쓰기, 배치 처리율 및 빠른 모드 프리미엄을 포함한 전체 계산은 Opus 5 가격 분석에서 확인할 수 있습니다.

작업당 비용은 다른 양입니다. 이는 실행이 소비한 토큰 수에 따라 달라지며, 이는 노력 수준, 사고 활성화 여부, 에이전트 루프가 걸린 턴 수, 생성된 하위 에이전트 수에 따라 달라집니다. Anthropic 자체의 프롬프트 지침은 Opus 5가 Opus 4.8보다 기본 응답을 더 길게 생성하고, 하위 에이전트에게 더 쉽게 위임하며, 작업 범위를 더 자주 확장한다고 명시합니다. 이 세 가지 모두 실제 작업 부하에서 토큰 소비를 증가시키므로, 작업당 비용 차트에 맞춰 조정된 실행이 자동으로 출시할 구성이 되는 것은 아닙니다.

이 중 어느 것도 비용 관련 이야기가 거짓이라는 것을 의미하지는 않습니다. 정가의 절반은 정가의 절반이며, Opus 5 대 Fable 5 비교는 그 격차가 실제로 어디에서 이점을 제공하는지 자세히 설명합니다. 이는 작업당 비용 비율이 특정 설정의 결과이며, 사용자의 경우는 다를 것이라는 의미입니다. 직접 측정하십시오.

Anthropic이 스스로 명시한 한계

출시 자료에서 가장 유용한 부분은 승리가 아닌 부분입니다. Anthropic은 Opus 5가 사이버 보안 공격 및 자율 생물학 연구에서 여전히 **Mythos 5**에 뒤처진다고 분명히 밝힙니다. Fable 5 또한 "가장 유능한 광범위하게 출시된 모델"이라는 명칭을 유지합니다.

언론 보도에서 이 부분이 대부분 빠졌기 때문에 다시 언급할 가치가 있습니다. Opus 5는 Claude 스택의 최상단이 아닙니다. 솔직한 요약은 최첨단 가격의 절반으로 최첨단급 기능을 제공하며, 그 위에 명시된 한계가 있다는 것입니다. 최첨단 보안 연구 또는 자율 과학 작업을 위해서는 벤치마크 답변은 여전히 Mythos-급이며, 이는 Mythos-급 모델 설명Fable 5 대 Mythos 5에서 다룹니다.

운영상의 결과도 있습니다. Anthropic은 Opus 5가 사이버 카테고리 요청을 거부할 때 자동으로 Opus 4.8로 대체되는 fallbacks: "default" 옵션(server-side-fallback-2026-07-01 베타 헤더 뒤에 있음)을 출시했습니다. 더 엄격한 사이버 거부를 가진 모델은 비상 탈출구가 필요하며, 그러한 비상 탈출구의 존재는 차트가 알려주지 않는 어떤 것을 알려줍니다.

벤치마크가 전혀 다루지 않는 것

벤치마크는 작업 완료도를 측정합니다. 벤치마크는 모델이 귀하의 제품에서 작동하는지 여부를 결정하는 다음 사항을 측정하지 않습니다.

직접 테스트해야 할 사항

공급업체 벤치마크는 초기 가설입니다. 다음은 오후에 실행하여 위에서 언급된 모든 숫자를 합친 것보다 귀하의 작업 부하에 대한 Opus 5에 대해 더 많은 것을 알려줄 수 있는 간결한 평가 방법입니다.

이전 출시의 비교 방법론에 대해서는 Sonnet 5 벤치마크 문서에서 동일한 연습을 다루며, Opus 5 API 가이드에는 요청 형태가 나와 있습니다.

Apidog에서 평가 실행하기

위 평가는 인증 헤더, JSON 본문, 스트리밍 응답, 그리고 모든 호출에서 읽어야 하는 usage 블록을 포함하는 HTTP 요청의 묶음입니다. 이는 일반적인 API 작업이며, Apidog가 처리하는 부분입니다.

실용적인 설정:

  1. Anthropic Messages 엔드포인트에 대한 요청을 하나 생성하고 API 키를 본문에 붙여넣는 대신 환경 변수로 저장합니다.
  2. 각 노력 수준별로 해당 요청을 복제하여 `low`에서 `xhigh`까지 동일한 프롬프트를 실행하고 응답을 나란히 비교할 수 있도록 합니다.
  3. 스트리밍을 켜고, 보이는 답변이 시작되기 전에 사고 토큰이 어떻게 축적되는지 확인해야 할 경우 SSE 이벤트를 직접 검사합니다.
  4. 모델이 산문으로 설명하는 대신 실제로 구조화된 도구 호출을 내보내는지 확인하기 위해 응답의 도구 호출 페이로드를 검사합니다. 이는 사고 기능 비활성화 시 주목해야 할 아티팩트입니다.
  5. `usage` 필드에 어설션을 추가하여 캐시 적중 및 총 토큰 수가 육안으로 확인하는 대신 모든 실행에서 캡처되도록 합니다.
  6. 전체 내용을 컬렉션으로 저장하여 다음 모델 출시 시 재구축이 아닌 모델 ID 교체로 처리할 수 있도록 합니다.

기본 요청은 다음과 같습니다.

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 8192,
    "output_config": {"effort": "medium"},
    "messages": [
      {"role": "user", "content": "Fix the failing test in this diff."}
    ]
  }'

실행당 하나의 필드를 변경하고 나머지는 모두 고정하며, 매번 `usage` 블록을 기록하십시오. 환경 및 어설션이 이미 설정된 이 패턴을 따르고 싶다면 Apidog를 다운로드하십시오.

솔직한 요약

Opus 5의 벤치마크 이야기는 진정으로 강력합니다. Anthropic이 Opus 출시를 위해 주장한 이전 모델 대비 가장 큰 도약이며, 정가는 변동이 없습니다. 또한, 2026년 7월 25일 현재 완전히 공급업체 주도로 이루어졌고 재현되지 않았으며, 분모를 숨기는 비율로 주로 표현되었습니다. 이 두 가지 사실은 동시에 존재합니다.

이 페이지 상단의 표를 Anthropic이 자체 모델에 대해 세운 가설로 취급하십시오. 그런 다음 자신만의 수치를 얻으십시오. 출시 차트와 실제 운영 워크로드 사이의 간극이 모든 모델 마이그레이션이 실제로 결정되는 지점이며, Opus 5 핵심 가이드는 변경된 나머지 부분을 다룹니다.

앱 다운로드

자주 묻는 질문

Claude Opus 5 벤치마크는 독립적으로 검증되었습니까? 아니요. 2026년 7월 25일 현재, 공개된 모든 Opus 5 벤치마크 결과는 Anthropic에서 제공한 것입니다. 제3자 연구소나 독립 평가 기관은 재현 결과를 발표하지 않았습니다. 공급업체가 보고한 수치로 읽으십시오.

Opus 5의 가장 큰 벤치마크 주장은 무엇입니까? Frontier-Bench v0.1에서 Anthropic은 Opus 5가 더 낮은 작업당 비용으로 Opus 4.8 점수의 두 배 이상을 기록했다고 주장합니다. Anthropic은 기본 점수는 공개하지 않고 비율만 공개했으며, Frontier-Bench v0.1은 확립된 실적이 없는 새로운 벤치마크입니다.

Claude Opus 5가 가장 유능한 Claude 모델입니까? 아니요. Fable 5는 여전히 "가장 유능한 광범위하게 출시된" 모델이라는 명칭을 유지하며, Anthropic은 Opus 5가 사이버 보안 공격 및 자율 생물학 연구에서 여전히 Mythos 5에 뒤처진다고 명시합니다. Opus 5의 주장은 Fable 5 가격의 절반으로 최첨단급 기능을 제공하는 것이지, 스택의 최상단이 아닙니다.

과학 작업에서 Opus 5는 Opus 4.8보다 얼마나 더 좋습니까? Anthropic은 Opus 4.8 대비 유기 화학에서 10.2점, 단백질 분석에서 7.7점 증가를 보고합니다. 이 두 주장은 비율이 아닌 절대적인 차이로 명시되어 있어 해석하기 가장 쉽지만, 기준 점수는 공개되지 않았습니다.

Opus 5가 Fable 5를 능가합니까? Anthropic의 수치에 따르면, OSWorld 2.0에서 Fable 5를 비용 3분의 1로 능가하고, CursorBench 3.2에서는 Fable 5 최고 성능의 0.5% 이내에 절반 가격으로 도달합니다. Fable 5는 여전히 전반적인 기능 면에서 우위를 유지합니다. 전체 비교를 참조하십시오.

무엇을 직접 벤치마크해야 합니까? 자체 백로그에서 가져온 20~50개의 실제 작업에 대한 해결된 작업당 비용을 여러 노력 수준에서 실행하고, 실제 도구를 연결하고 다중 턴 루프를 활성화하여 측정하십시오. 동일한 하니스에서 오늘날 실행하는 모든 모델과 비교하십시오.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요