Claude Fable 5로 개발을 시작했는데, 몇몇 요청이 다른 요청들과 다르게 동작하는 것을 발견했다면, 그것은 Claude Fable 5의 안전장치가 작동하는 것을 보고 있는 것입니다. Fable 5는 2026년 6월 9일에 모델 ID claude-fable-5로 출시되었으며, 일반적인 사용을 위해 안전하게 만들어진 미토스(Mythos)급 모델이기 때문에 내장된 안전 라우팅 계층과 함께 제공됩니다. 메커니즘은 이해하면 간단합니다: 분류기(classifier)가 몇몇 민감한 영역의 쿼리를 감시하며, 하나가 감지되면 전체 Fable 5 모델 대신 Claude Opus 4.8이 요청에 응답합니다. 이는 평균적으로 세션의 5% 미만에서 발생하므로, 대부분의 개발자는 이를 거의 접하지 않습니다. 이 글에서는 안전 라우팅이 어떻게 작동하는지, 어떤 주제를 다루는지, 실제로 어떻게 느껴지는지, 그리고 Anthropic이 거부하는 대신 라우팅을 선택한 이유를 설명합니다.
요약
Claude Fable 5는 세 가지 민감한 영역의 쿼리를 감지하고 이를 전체 Fable 5 모델 대신 Claude Opus 4.8로 라우팅하는 분류기를 실행합니다. 안전장치는 평균적으로 세션의 5% 미만에서 작동합니다. 세 가지 보호 영역은 사이버 보안, 생물학 및 화학, 그리고 모델 증류(distillation)입니다. 사용자가 따로 설정할 필요가 없으며, 가격은 변동 없습니다.
안전장치의 역할
Claude Fable 5 안전장치의 핵심 아이디어는 전면적인 필터링이 아니라 라우팅 결정입니다. claude-fable-5로 보내는 모든 요청은 일련의 분류기를 거칩니다. 이 분류기들은 쿼리를 분석하여 보호된 카테고리 중 하나에 속하는지 여부를 결정합니다. 대부분의 요청에 대해서는 해당 사항이 없으며, 요청은 예상대로 전체 Fable 5 모델에 의해 처리됩니다.

분류기가 요청을 민감하다고 플래그할 때, 요청이 즉시 거부되지 않습니다. 대신, Claude Opus 4.8로 대체되어 Fable 5를 대신하여 쿼리에 응답합니다. 애플리케이션의 관점에서는 응답이 동일한 API 호출과 동일한 모델 ID를 통해 반환됩니다. 차이점은 답변을 생성한 기본 모델이 전체 Fable 5 모델이 아닌 Opus 4.8이었다는 것입니다. 두 모델은 다른 출력을 생성할 수 있고 대체가 적용되는 주제에 대해 다르게 동작할 수 있으므로 이러한 구별은 중요합니다.
이것은 설계의 핵심이므로 다시 한번 강조할 가치가 있습니다. Fable 5는 미토스(Mythos)급 모델로, Anthropic 제품군의 고성능 끝에 위치합니다. 그렇게 유능한 모델을 일반 대중이 안전하게 사용할 수 있도록 한다는 것은 가장 큰 위험을 수반하는 좁은 범위의 기능 주변에 안전장치를 두는 것을 의미합니다. Fable 5 자체가 그러한 쿼리를 거부하도록 시도하는 대신, Anthropic은 해당 주제에 대한 동작이 잘 이해되고 광범위하게 노출하기에 안전하다고 간주되는 모델로 조용히 리디렉션하는 계층을 구축했습니다. 모델 클래스 자체에 대한 배경 정보는 미토스(Mythos)급 모델이란 무엇인가에 대한 설명을 참조하십시오.
라우팅은 자동으로 이루어지며 Anthropic 측에서 관리합니다. 사용자가 전달하는 매개변수, 설정하는 헤더, 또는 요청에서 켜고 끄는 플래그는 없습니다. 분류기는 모든 세션에서 실행되며, 그 중 하나가 작동할 때만 대체(fallback)가 발생합니다.
세 가지 보호 영역
Claude Fable 5 안전장치는 세 가지 카테고리를 다룹니다. 각 카테고리는 고성능 모델이 해를 끼치는 장벽을 의미 있게 낮출 수 있는 영역이므로, 각각 제한됩니다. 아래 설명은 무엇이 제한되는지를 다루며, 이 영역에서 무엇을 하는 방법에 대한 내용은 아닙니다.
사이버 보안
첫 번째 보호 영역은 공격적인 사이버 보안입니다. 이는 익스플로잇 개발, 공격적인 사이버 작업, 그리고 모델에게 공격을 수행하거나 가속화하도록 요청할 수 있는 에이전트형 해킹 워크플로우와 같은 것들을 포함합니다. 분류기가 이러한 종류의 쿼리를 감지하면, 요청은 Opus 4.8로 라우팅됩니다.

사이버 보안 안전장치는 Fable 5가 공격 능력을 측정하는 사이버 평가 작업에서 진전을 이루지 못하도록 설계되었습니다. 모델을 테스트한 외부 파트너는 Fable 5의 유해한 사이버 쿼리에 대한 안전장치가 그들이 테스트한 것 중 가장 "견고하다"고 평가했습니다(출처의 표현을 빌리자면). 여기서의 접근 방식은 방어적입니다. 목표는 모델이 공격자의 작업을 진행하는 것을 방지하는 동시에, 일반적인 보안 질문, 방어 작업 및 교육 자료는 영향을 받지 않도록 하는 것입니다.
생물학 및 화학
두 번째 보호 영역은 해당 분야에서 가장 위험한 기능과 관련된 생물학 및 화학 쿼리를 다룹니다. 예로는 AAV 설계 및 생물학 무기 관련 쿼리가 있습니다. 사이버 보안과 마찬가지로, 분류기가 이러한 요청 중 하나를 플래그하면 답변은 전체 Fable 5 모델 대신 Opus 4.8에서 제공됩니다.

목표는 가장 위험한 생물학 및 화학 기능을 안전장치 뒤에 두는 동시에, 이 분야의 대다수 과학, 의료 및 교육 관련 질문에는 영향을 미치지 않는 것입니다. 생물학 또는 화학 도구를 개발하는 대부분의 개발자는 이 대체(fallback)에 도달하지 않을 것입니다. 그 이유는 이 제한이 진정으로 위험한 콘텐츠의 좁은 범위에 맞춰져 있기 때문입니다.
증류(Distillation)
세 번째 보호 영역은 모델 증류(model distillation)입니다. 이는 경쟁 모델을 훈련하기 위해 모델을 추출하려는 시도를 다루며, 예를 들어 모델의 동작을 포착하고 다른 곳에서 재현하기 위해 체계적으로 탐색하는 것을 포함합니다. 증류 시도처럼 보이는 쿼리는 사이버 및 생체 쿼리와 동일한 방식으로 Opus 4.8로 라우팅됩니다.
증류는 다른 두 영역과는 성격이 다릅니다. 실제 물리적 해를 방지하는 것이 아니라, 모델 자체가 복사되는 것을 보호하는 것입니다. 하지만 라우팅 메커니즘은 동일하며, 이는 전체 시스템을 단순하게 유지합니다: 하나의 분류기 계층, 하나의 대체 대상, 세 가지 카테고리.
얼마나 자주 트리거되며 실제로는 어떻게 느껴지는가
주요 수치는 Claude Fable 5 안전장치가 평균적으로 세션의 5% 미만에서 작동한다는 것입니다. 대부분의 애플리케이션에서 이는 대체(fallback)가 지속적인 현상이라기보다는 드문 이벤트임을 의미합니다. 일반적인 코딩 도우미, 글쓰기 도구, 고객 지원 봇 또는 대부분의 다른 일반적인 제품을 개발하고 있다면, 오랫동안 이를 전혀 경험하지 못할 수도 있습니다.
실제로 발생했을 때 어떤 느낌일까요? 외부적으로는 거의 변화가 없습니다. API 호출은 성공하고, 응답을 받으며, 응답은 일관되고 주제와 관련이 있습니다. 직접 볼 수 없는 것은 답변이 전체 Fable 5 모델이 아닌 Opus 4.8에 의해 생성되었다는 것입니다. 두 모델은 다르기 때문에, 해당 특정 주제에 대한 출력은 Fable 5가 생성했을 내용과 어조, 깊이 또는 접근 방식이 다를 수 있습니다.
실제로, 이것은 시스템을 관찰하는 방식에 있어 몇 가지 의미를 가집니다:
- 세 가지 보호 영역에 집중된 극히 일부 요청은 Opus 4.8에 의해 처리될 것입니다.
- 해당 주제에 대한 출력은 Fable 5가 관련 없는 주제에서 보여주었던 스타일이나 기능 프로필과 일치하지 않을 수 있습니다.
- 일반적인 경우에는 오류나 강한 거부를 받지 않을 것입니다; 요청은 정상적으로 완료됩니다.
- 동작은 일관적입니다: 동일한 종류의 민감한 쿼리는 동일한 방식으로 라우팅되는 경향이 있습니다.
귀하의 제품이 사이버 보안, 생물학, 화학 또는 모델 추출과 유사한 어떤 것과도 관련이 없다면, 안전장치를 전혀 인지하지 못할 가능성이 큽니다. 귀하의 제품이 이러한 도메인 중 하나에 속한다면, 대체(fallback)는 귀하의 경험에서 더 자주 발생하는 부분이 될 것이며, 이를 고려하여 설계하는 것이 좋습니다. 이를 직접 확인하는 실용적인 방법은 API를 통해 다양한 프롬프트를 보내고 어떤 프롬프트가 다르게 동작하는지 관찰하는 것입니다. Apidog와 같은 도구에서 Fable 5 API를 테스트할 때, 프롬프트 모음을 저장하고 반복적으로 실행하여 어떤 카테고리가 대체(fallback)를 유발하는지 확인할 수 있습니다.
왜 거부하는 대신 라우팅하는가
당연한 질문은 왜 Anthropic이 많은 모델처럼 Fable 5가 민감한 쿼리를 단순히 거부하도록 하는 대신 라우팅 계층을 구축했는가 하는 것입니다. 답변은 '안전성을 갖춘 기능(capability-with-safety)'이라는 설계 목표로 귀결됩니다.
거부는 막다른 길입니다. 사용자가 질문을 하면, 모델은 거부하고, 상호작용은 중단됩니다. 이는 진정으로 악의적인 요청에 대해서는 올바른 결과이지만, 무딘 도구입니다. 민감한 영역에 걸쳐 있는 많은 쿼리들은 합법적입니다: 방어적인 질문을 하는 보안 연구원, 생물학 주제를 공부하는 학생, 분류기에게 적대적으로 보이는 것을 디버깅하는 개발자 등이 있습니다. 강력한 거부는 이 모든 것을 동일하게 취급하며, 합법적인 작업을 수행하는 사람들에게는 불만스러운 경험을 제공합니다.
Opus 4.8로 라우팅하는 것은 더 부드러운 응답입니다. 시스템은 거부하는 대신, 해당 영역에서 동작이 잘 이해되고 대중에게 노출하기에 안전하다고 간주되는 모델에 쿼리를 전달합니다. 사용자는 여전히 답변을 받지만, 해당 좁은 범위의 주제에 대해서는 다른 기능 프로필을 가진 모델에서 온 것입니다. 이는 Fable 5가 보호 영역 외부의 모든 것에 대해 완전한 기능으로 광범위하게 유용하도록 유지하면서, 가장 위험한 기능이 일반 대중에게 전면적으로 제공되지 않도록 보장합니다.
사이버 보안 사례는 이러한 틀을 명확히 보여줍니다. 안전장치의 목적은 일반적인 보안 작업을 차단하는 것이 아니라, 모델이 공격적인 사이버 작업에서 진전을 이루는 것을 방지하는 것입니다. 방어적 보안, 교육 및 일반적인 엔지니어링 질문은 정상적으로 처리됩니다. 외부 파트너가 Fable 5의 유해한 사이버 쿼리에 대한 안전장치가 그들이 테스트한 것 중 가장 "견고하다"고 평가한 것은 이 방어적 경계가 얼마나 잘 유지되는지를 말해줍니다. Anthropic은 안전 및 책임감 있는 확장 페이지에서 일반적인 접근 방식에 대해 더 자세히 설명하고 있으며, 두 모델의 출시 세부 정보는 Fable 5 및 Mythos 5 발표에서 확인할 수 있습니다.
Fable 5 대 Mythos 5: 안전장치
Fable 5에는 Claude Mythos 5라는 대응 모델이 있습니다. Mythos 5는 일부 영역에서 안전장치가 해제된 동일한 기본 모델입니다. 일반적인 의미에서 다른 아키텍처나 더 유능한 시스템이 아니라, 공개 버전을 안전하게 유지하는 일부 라우팅이 없는 Fable 5입니다.
이러한 안전장치를 해제하면 위험 프로필이 변경되므로 Mythos 5는 공개되지 않습니다. 접근은 사이버 방어자 및 인프라 제공업체와 엄선된 생물학 연구원을 포함하는 프로젝트 글래스윙(Glasswing) 파트너에게만 제한됩니다. 이들은 진정으로 제한 없는 기능이 필요하고 적절한 감독 하에 운영되는 조직 및 개인입니다. 두 모델의 비교 분석은 Fable 5 대 Mythos 5를 참조하십시오.
대부분의 개발자를 위한 실질적인 핵심은 간단합니다: 여러분은 Fable 5를 기반으로 개발하고 있으며, 안전장치는 그 일부이고, 제한 없는 버전에 대한 공개 경로는 없습니다. 귀하의 작업이 파트너 카테고리 중 하나에 해당한다면, Mythos 5로 가는 경로는 API 플래그를 통하는 것이 아니라 프로젝트 글래스윙(Glasswing)을 통해서입니다.
귀하의 앱에 대한 의미
일반적인 애플리케이션의 경우, Claude Fable 5 안전장치는 사용자에게 아무것도 요구하지 않습니다. 설정 단계나 설정할 토글, 그리고 요청 코드에 추가해야 할 특별한 처리는 없습니다. 분류기와 대체(fallback)는 전적으로 Anthropic 측에서 관리됩니다. claude-fable-5 모델 ID로 API를 호출하면 라우팅이 투명하게 이루어집니다.
핵심적으로 이해해야 할 점은 귀하의 요청 중 극히 일부가 Fable 5 대신 Opus 4.8에 의해 처리될 수 있으며, 이는 보호된 주제에 대한 출력 및 동작에 영향을 미칠 수 있다는 것입니다. 귀하의 제품이 사이버 보안, 생물학, 화학 또는 모델 추출과 유사한 어떤 것과 관련이 있다면, 대체(fallback)를 예외적인 경우가 아닌 경험의 정상적인 부분으로 계획하십시오. 다른 모든 사람들에게는 이것이 너무 드물게 발생하여 특별한 주의를 기울일 필요가 거의 없습니다.
염두에 두어야 할 몇 가지 구체적인 사항:
- 설정할 것이 없습니다. 안전장치는 자동으로 작동하며 API를 통해 끌 수 없습니다.
- 비용은 변동 없습니다. Fable 5 가격은 특정 요청이 Fable 5에 의해 처리되었든 Opus 4.8로 대체되었든 상관없이 백만 입력 토큰당 10달러, 백만 출력 토큰당 50달러로 유지됩니다. 대체가 발생해도 다른 가격으로 변경되지 않습니다. 전체 가격 세부 정보는 Claude Fable 5 가격 가이드를 참조하십시오.
- 민감한 도메인에서 개발하는 경우, 대체(fallback)를 예상하십시오. 라우팅을 염두에 두고 프롬프트, 평가 및 사용자 기대치를 설계하십시오.
- 출시 전에 테스트하십시오. 대표적인 프롬프트 세트를 API를 통해 실행하고 어떤 카테고리가 다르게 동작하는지 관찰하여 프로덕션 환경에서 놀라지 않도록 하십시오.
응답이 동일한 호출과 동일한 모델 ID를 통해 반환되므로, 단일 응답만으로는 어떤 모델이 생성했는지 항상 알 수 없습니다. 이는 의도된 것이며 대부분의 사용 사례에 적합합니다. 동작 경계를 정확하게 이해해야 한다면, 세 가지 보호 영역의 경계를 테스트하고 차이점을 직접 관찰하는 테스트 스위트를 구축하는 것이 가장 신뢰할 수 있는 접근 방식입니다. 민감한 주제의 요청이 대체(fallback)되는 모델이 Opus 4.8이므로, Opus 4.8 API 사용 가이드는 유용한 배경 지식이 됩니다.
간단히 말해, Claude Fable 5 안전장치는 민감한 요청의 작은 부분을 Opus 4.8로 보내는 조용하고 자동적인 라우팅 계층이며, 다른 모든 것은 설정 변경이나 비용 변동 없이 Fable 5의 완전한 기능을 유지합니다. 사이버 보안, 생물학, 화학 또는 모델 추출과 관련된 분야에서 개발하는 경우, 다음 단계는 소규모 테스트 프롬프트 세트를 만들고 API를 통해 실행하여 보호 영역이 어떻게 동작하는지 관찰하여 애플리케이션이 대체(fallback)에 대비하도록 하는 것입니다. 모델 계열에 대한 더 넓은 맥락을 원한다면, Claude Fable 5란 무엇인가와 모델 개요부터 시작한 다음, Fable 5 API 가이드를 통해 스택에 연결하는 방법을 알아보십시오. 테스트할 준비가 되면, Apidog가 해당 프롬프트를 실행하고 비교할 수 있는 공간을 제공합니다.
