Anthropic은 2026년 9월 1일 Claude Fable 5.1을 출시했으며, 9가지 테스트를 통해 Fable 5, Opus 5, GPT-5.6 Sol과 비교한 벤치마크 표를 공개했습니다. 모든 언론사가 주목한 헤드라인은 Terminal-Bench-Science였는데, Fable 5.1은 Fable 5의 24.7%에 비해 52.6%를 기록했습니다. 상대적으로 적은 언론사가 다룬 수치는 CursorBench였는데, 여기서 Opus 5와의 격차는 두 배 비싼 모델에서 3.4점 차이였습니다.
이 가이드는 공개된 모든 수치를 출처와 함께 한곳에 모으고, 각 벤치마크가 무엇을 측정하는지 설명하며, 큰 격차와 작은 격차를 구분한 다음, 출시 보도에서 놓쳤던 부분인 "이 모든 것은 공급업체가 실행한 결과이며, 유일하게 둘 다 공개된 에이전트 코딩 테스트에서 Mythos 5.1이 Fable 5.1보다 점수가 높고, 출시 표에 대한 올바른 대응은 자체 평가를 실행하는 것"을 다룹니다. 주요 출처는 Anthropic의 출시 게시물이며, 모델 컨텍스트는 Claude Fable 5.1이 무엇인지에서 확인할 수 있습니다.
전체 표
| 벤치마크 | 측정 항목 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 터미널에서의 에이전트 과학 연구 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 터미널에서의 에이전트 코딩 | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | 경제적으로 가치 있는 지식 작업 (Elo) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (부분 점수) | 실제 데스크톱 작업에서의 컴퓨터 사용 | 77.9% | 72.9% | 75.4% | 보고되지 않음 |
| OSWorld 2.0 (엄격) | 동일, 전체 작업 완료만 | 41.7% | 36.1% | 39.6% | 보고되지 않음 |
| Humanity’s Last Exam (도구 없음) | 전문가 수준 추론 질문 | 60.9% | 57.8% | 56.6% | 보고되지 않음 |
| Humanity’s Last Exam (도구 사용) | 동일, 검색 및 코드 포함 | 65.0% | 63.8% | 63.6% | 보고되지 않음 |
| AutomationBench | 엔드투엔드 비즈니스 워크플로 | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | IDE 스타일 코딩 작업 | 73.4% | 70.5% | 70.0% | 67.2% |
Anthropic은 또한 Mythos 5.1의 한 가지 수치인 Terminal-Bench 4.0에서 60.9%를 공개했습니다. VentureBeat는 가장 어려운 브라우저 에이전트 작업에서 Fable 5.1이 82%, Opus 5가 74%, Fable 5가 57%를 기록했다고 보도했습니다. 이 수치는 출시 게시물이 아닌 언론 보도에서 나온 것이므로, 그에 따라 비중을 두어야 합니다.
큰 격차
Terminal-Bench-Science 0.1: Fable 5의 24.7%, Opus 5의 29.0% 대비 52.6%. 이것이 바로 결과입니다. Fable 5.1은 과학 도구를 갖춘 터미널에서 모델을 사용하여 다단계 연구를 수행하도록 하는 벤치마크에서 이전 모델의 두 배 이상, Opus 5의 거의 두 배에 달하는 점수를 기록했습니다. 이는 Anthropic이 명시한 "장기적 문제 해결"에 대한 집중이 측정 가능한 결과를 낳았다는 가장 명확한 증거입니다. 또한 이는 버전 0.1 벤치마크이므로, 작업 세트가 아직 초기 단계이며 성숙함에 따라 점수가 변동될 가능성이 있습니다.

AutomationBench: Fable 5의 17.1%, Opus 5의 26.9% 대비 31.4%. 이 벤치마크는 모든 애플리케이션에 걸친 엔드투엔드 비즈니스 워크플로를 측정하며, 모든 모델에서 절대 점수는 낮습니다. Fable 5.1은 여기에서 Fable 5의 거의 두 배를 기록했으며, Opus 5보다 4.5점 앞섰습니다. 제품이 다중 애플리케이션 비즈니스 작업을 자동화한다면 이 부분이 중요합니다.
Terminal-Bench 4.0: Fable 5의 42.0% 대비 55.8%. 에이전트 코딩에서 Fable 5보다 13.8점 상승한 수치로, Anthropic의 출시 게시물 코딩 섹션에서 주요하게 다룬 숫자입니다. Opus 5에 비해 3.5점 앞섰습니다. Opus 5는 이미 7월에 이 벤치마크에서 Fable 5를 추월했으므로, 에이전트 코딩에서 Fable 티어가 Opus 티어에 비해 다시 우위를 점했지만, 6월보다 그 폭은 좁아졌습니다. Opus 5 벤치마크 분석에서 7월 수치를 확인할 수 있습니다.

GDPval-AA v2: Fable 5의 1723 대비 1853. 지식 작업에서 Fable 5보다 130 Elo가 향상된 수치이며, Anthropic이 문서, 스프레드시트, 슬라이드 관련 주장을 할 때 언급하는 벤치마크입니다. Opus 5와의 격차는 29 Elo로 작은 편입니다.
작은 격차
CursorBench 3.2.0: Fable 5의 70.5%, Opus 5의 70.0% 대비 73.4%. IDE 스타일 코딩 작업입니다. 두 모델보다 3점 앞섰습니다. 이는 가장 많은 개발자들에게 가장 중요한 벤치마크이며, Fable 5.1의 우위가 가장 얇은 부분입니다. 작업이 "내 편집기에서 나를 도와줘"라면, 출시 표만으로는 2배 가격을 정당화하기 어렵습니다.

OSWorld 2.0: Opus 5의 75.4% / 39.6% 대비 77.9% / 41.7%. 컴퓨터 사용입니다. 두 점수 모두 Opus 5보다 2점, Fable 5보다 5점 앞섰습니다. 실제로는 큰 차이가 아닙니다. 엄격한 점수에 주목하세요: 어떤 모델에서도 절반 미만의 작업만 완전히 완료되었습니다. 컴퓨터 사용은 여전히 최첨단 기술의 가장 취약한 영역입니다.
Humanity’s Last Exam: Opus 5의 56.6% / 63.6% 대비 60.9% / 65.0%. 도구 없이 Opus 5보다 4.3점 앞섰으며, 이는 작은 격차 중 가장 큰 것입니다. 도구를 사용하면 검색 및 코드 실행이 수준을 평준화하여 1.4점으로 줄어듭니다. 도구 없는 수치는 순수한 추론 능력을 더 잘 측정하며, 도구 사용 수치는 모델이 어떻게 사용되는지에 더 가깝습니다.

Fable 5.1 대 GPT-5.6 Sol
Anthropic은 GPT-5.6 Sol 열이 있는 4개의 행을 공개했으며, Fable 5.1은 이 4개 모두에서 앞섰습니다: Terminal-Bench-Science에서 30.2점, Terminal-Bench 4.0에서 18.5점, AutomationBench에서 11.8점, CursorBench에서 6.2점 앞섰습니다. GDPval-AA는 1853 대 1711을 보여줍니다. 두 가지 주의사항이 있습니다. 이 수치들은 Anthropic이 경쟁사의 모델을 실행한 결과이며, GPT-5.6 Sol 열이 없는 5개 행은 Anthropic이 명시하지 않은 이유로 누락되었습니다. 저희의 GPT-5.6 Sol 대 Fable 5 비교는 이전 대결을 다루었으며, 이 수치들에서 Fable 5.1은 Fable 5가 가졌던 모든 격차를 더욱 벌렸습니다.
출시 보도에서 놓친 점
모든 수치는 공급업체 실행입니다. 경쟁사 열을 포함하여 모든 벤치마크는 Anthropic이 직접 실행했으며, 출시 시점에는 어떤 독립적인 연구소도 이를 재현하지 못했습니다. Anthropic의 벤치마크 역사는 일반적으로 신뢰할 수 있었지만, CursorBench 및 OSWorld의 격차는 너무 작아서 다른 테스트 환경이나 점수 측정 방식이 적용되면 결과가 뒤바뀔 수도 있습니다.
Mythos 5.1이 진정한 한계입니다. Anthropic의 시스템 카드와 출시 게시물에 따르면 Fable 5.1과 Mythos 5.1은 "안전 장치 수준만 다른 동일한 모델"이며, Terminal-Bench 4.0에서 Mythos 5.1은 60.9%를 기록하여 Fable 5.1의 55.8%보다 높았습니다. 이 5점 차이는 에이전트 코딩에서 안전 장치로 인한 비용이며, "Anthropic의 가장 유능한 널리 출시된 모델" 위에 더 나은 형제가 있다는 것을 의미합니다. Mythos 5.1 대 Fable 5.1 비교에서 누가 액세스할 수 있는지 다룹니다.
노력 수준이 명시되지 않았습니다. Anthropic의 노력 문서에 따르면 Fable 5.1의 성능 향상은 `xhigh` 및 `max` 수준에서 가장 큽니다. 출시 게시물에는 각 점수가 어떤 노력 수준에서 산출되었는지, 또는 비교 모델이 어떤 노력 수준에서 실행되었는지 명시되어 있지 않습니다. 노력 수준이 이러한 모델의 주요 품질 결정 요소이므로, 이 누락은 수치를 재현하려고 할 때 중요합니다.
다국어 성능은 정체. Anthropic은 다국어 성능이 향상되지 않고 Fable 5와 동등하다고 밝혔습니다. 작업이 영어가 아닌 경우, 출시 표는 성능 향상을 과장하고 있습니다.
안전 장치 수치는 다른 종류의 벤치마크입니다. Anthropic은 Fable 5에 비해 악의 없는 요청에서 생물학적 오탐이 85% 감소했으며, Claude Code 세션당 사이버 개입이 약 60% 감소했다고 보고합니다. 이러한 수치는 Anthropic 자체 트래픽을 기반으로 측정되며 외부에서 재현할 수 없지만, 거부를 경험했던 Fable 5 사용자에게는 다른 어떤 기능보다 중요할 수 있습니다.
직접 테스트할 내용
출시 표는 어디를 봐야 할지 알려줍니다. 자체 평가는 진행 여부를 알려줍니다. 위 행에 매핑되는 4가지 테스트:
- 자체 제품의 장기적인 에이전트 작업을 Fable 5.1은 `high`에서, Opus 5는 `xhigh`에서, Fable 5는 `high`에서 완료될 때까지 실행합니다. 이는 Terminal-Bench-Science 및 AutomationBench와 유사한 테스트이며, 2배의 가격이 가치가 있는지 없는지를 결정하는 부분입니다.
- Fable 5.1과 Opus 5에서 동일한 노력 수준으로 **가장 어려운 코딩 프롬프트 10개**를 테스트합니다. 결과가 동일하다면, CursorBench의 결과를 재현한 것이며 Opus 5가 해답입니다.
- 일상적인 작업에 대해 Fable 5.1만으로 `low`부터 `max`까지 **노력 수준을 스윕**합니다. Anthropic의 주장은 `medium`이 Fable 5와 일치하고 `low`는 작업당 비용에서 Opus 5와 경쟁한다는 것입니다. 이를 확인하십시오.
- Fable 5 대 Fable 5.1에서 악의 없는 보안 또는 생명 과학 프롬프트에 대한 **거부 횟수**를 확인합니다. 이는 60% 및 85% 주장과 관련된 부분이며, 오후에 직접 확인할 수 있습니다.
이 네 가지 테스트를 Apidog에서 `model`과 `effort`를 환경 변수로 사용하여 요청으로 구축하고, `stop_reason`과 답변에 예상되는 문자열의 존재 여부에 대한 어설션을 추가한 다음, 각 모델별로 컬렉션을 실행하십시오. 실행 기록은 새로운 인프라 없이 재현 가능한 평가 표를 제공합니다. 설정하려면 Apidog를 다운로드하십시오. API 워크스루에는 요청 형태가 있습니다.

벤치마크가 결정에 미치는 영향
- 장기 에이전트, 연구, 자동화: 격차가 크고 일관적입니다. Fable 5.1이 적합한 모델이며, 가격 분석에 따르면 더 저렴한 캐시 읽기가 이러한 워크로드에서 비용 격차를 좁혀줍니다.
- IDE 코딩, 지식 Q&A, 도구 지원 추론: Opus 5와의 격차는 1~4점입니다. Anthropic의 자체 규칙이 적용됩니다: 더 높은 노력 수준에서 평가를 통과하지 못하는 경우가 아니라면 Opus 5를 계속 사용하십시오. Fable 5.1 대 Opus 5 비교에서 이를 자세히 다룹니다.
- Fable 5 사용자: 모든 행이 개선되었고, 가격은 변동 없으며, 오탐율이 감소했습니다. Fable 5.1 대 Fable 5 비교에서 마이그레이션 비용을 다룹니다.
자주 묻는 질문
- Claude Fable 5.1의 최고 벤치마크 결과는 무엇인가요? Terminal-Bench-Science 0.1에서 52.6%로, Fable 5의 24.7%보다 두 배 이상 높고, Opus 5의 29.0% 및 GPT-5.6 Sol의 22.4%보다 앞섭니다. 모든 수치는 Anthropic의 자료입니다.
- Fable 5.1은 코딩에서 Opus 5와 어떻게 비교되나요? Anthropic의 수치에 따르면 Terminal-Bench 4.0에서 55.8% 대 52.3%, CursorBench 3.2.0에서 73.4% 대 70.0%를 기록했습니다. 약 3점 정도의 실질적이지만 좁은 우위를 보였습니다.
- Fable 5.1이 GPT-5.6 Sol보다 나은가요? Anthropic이 둘 모두 공개한 4가지 벤치마크에서는 6점에서 30점 차이로 Fable 5.1이 더 좋습니다. Anthropic이 GPT-5.6 Sol 수치를 직접 실행했으며, 9개 행 중 5개 행에는 GPT-5.6 Sol 항목이 없습니다.
- Fable 5.1 벤치마크는 독립적으로 검증되었나요? 출시 시점에는 그렇지 않습니다. 모든 수치는 Anthropic이 실행한 것입니다. 자체 워크로드에서 테스트할 주장으로 간주하십시오.
- Mythos 5.1의 점수는 어떻게 되나요? Anthropic은 Terminal-Bench 4.0에서 60.9%라는 한 가지 수치를 공개했는데, 이는 Fable 5.1의 55.8%보다 5점 높은 것입니다. 이 두 모델은 안전 장치만 다를 뿐 동일한 모델입니다.
- 이 점수들은 어떤 노력 수준에서 산출되었나요? Anthropic은 밝히지 않았습니다. Anthropic의 지침에 따르면 Fable 5.1의 성능 향상은 `xhigh` 및 `max` 수준에서 가장 크므로, 높은 노력 수준을 가정하고 낮은 설정에서는 점수가 낮아질 것으로 예상해야 합니다.
