클로드 오푸스 5.5 프롬프트 캐싱: 20센트 캐시 읽기 손익분기점 분석

클로드 오푸스 5.5는 캐시된 입력 토큰 백만 개당 0.20달러의 비용이 청구됩니다. 이는 신규 입력(fresh) 토큰에는 4.00달러, 출력(write) 토큰에는 5.00달러가 부과되는 것과 대조적입니다. 실제 요청 형태를 기반으로 계산된 손익분기점 재사용률은 21%입니다.

INEZA Felin-Michel

INEZA Felin-Michel

23 September 2026

클로드 오푸스 5.5 프롬프트 캐싱: 20센트 캐시 읽기 손익분기점 분석

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

귀하의 에이전트는 모든 호출에서 동일한 40,000 토큰의 시스템 프롬프트, 도구 정의 및 정책 문서를 다시 보냅니다. Claude Opus 5.5의 입력 가격 백만 토큰당 4달러를 기준으로, 해당 프리픽스는 마지막 요청 이후 단 한 바이트도 변경되지 않았더라도 전송될 때마다 0.16달러가 소요됩니다.

프롬프트 캐싱이 해결책이며, Anthropic은 Opus 5.5에서 이를 공격적으로 가격 책정했습니다. 캐시된 읽기는 신규 입력 백만 토큰당 4.00달러와 비교하여 백만 토큰당 0.20달러로, 95% 할인됩니다. 하지만 캐시 쓰기는 백만 토큰당 5.00달러로, 토큰을 캐시하지 않고 보내는 것보다 비쌉니다. 따라서 캐싱이 공짜는 아닙니다. 이는 프리픽스를 재사용할 것이라는 일종의 도박이며, 대부분의 사람이 캐싱을 활성화하기 전에 정확한 손익분기점을 계산하지 않습니다.

이 글은 해당 계산을 자세히 설명합니다. 짧게 말하면: 단일 프리픽스에서 1.26회 호출 후 손익분기점에 도달하고, 안정 상태에서는 약 21%의 캐시 적중률에서 손익분기점에 도달합니다. 그 미만에서는 캐싱으로 인해 비용이 더 많이 듭니다.

버튼

먼저 그 규모를 언급할 가치가 있습니다. OpenAI는 자체 출시 행사에서 중간 수준의 연구원이 코딩 에이전트에 하루 600달러 이상을 지출하며, 상위 10%는 하루 7,000달러 이상을 지출한다고 밝혔습니다. 그 정도의 볼륨에서는 적중률 20%p 차이가 급여와 맞먹습니다. 9월에 출시된 세 가지 제품 전체의 광범위한 가격 책정 그림은 당사의 2026년 9월 모델 가격 전쟁 분석을 참조하십시오.

모든 것을 결정하는 세 가지 요율

토큰 유형 Claude Opus 5.5 백만당 요율 신규 입력 대비
신규 입력 $4.00 기준
캐시 쓰기 $5.00 $1.00 프리미엄
캐시된 읽기 $0.20 $3.80 절약
출력 $20.00 캐싱은 여기에 영향을 주지 않음

해당 표에서 두 가지 사실을 바로 알 수 있습니다. 캐시에 프리픽스를 쓰는 것은 전혀 캐싱하지 않는 것보다 백만당 1.00달러가 더 듭니다. 해당 프리픽스를 나중에 읽을 때마다 백만당 3.80달러를 절약할 수 있습니다. 출력 가격은 변동이 없으므로, 짧은 프롬프트에서 긴 답변을 내보내는 에이전트는 여기서 얻을 이득이 거의 없지만, 크고 안정적인 컨텍스트를 읽고 짧은 결론을 반환하는 에이전트는 상당한 이득을 얻을 수 있습니다.

1,000,000 토큰 컨텍스트 창과 128,000 토큰 최대 출력을 포함한 전체 사양은 Claude Opus 5.5란 무엇인가에서 확인할 수 있습니다.

손익분기점은 두 번이 아니라 1.26회 호출입니다

정확히 백만 토큰의 프리픽스와 이를 공유하는 N번의 호출을 가정해 봅시다. 한 번의 쓰기와 N-1번의 읽기입니다.

uncached:  N * $4.00
cached:    $5.00 + (N - 1) * $0.20

4.00N = 5.00 + 0.20(N - 1)
3.80N = 4.80
N     = 1.26

쓰기 프리미엄을 상환하려면 1.26회 호출이 필요합니다. 호출은 정수로 이루어지므로, 이는: 프리픽스가 단 한 번이라도 다시 읽히면 캐싱이 옳았다는 것을 의미합니다. 두 번의 호출만으로도 이미 35% 이득을 얻습니다.

한 번의 쓰기를 공유하는 호출 수 캐시되지 않은 백만 프리픽스당 비용 캐시된 비용 절감액
1 $4.00 $5.00 25% 더 나쁨
2 $8.00 $5.20 35%
5 $20.00 $5.80 71%
10 $40.00 $6.80 83%
100 $400.00 $24.80 94%

이 표는 한 번의 쓰기와 그 이후의 완벽한 재사용을 가정합니다. 실제 시스템은 더 복잡하며, 여기서 두 번째 계산이 등장합니다.

안정 상태에서 중요한 유일한 숫자는 적중률입니다

하루 동안의 트래픽에서 한 번만 쓰는 것이 아닙니다. 캐시는 만료되고, 프리픽스는 수정되며, 새로운 테넌트가 추가됩니다. 여기서 h를 캐시에서 제공되는 프리픽스 토큰의 비율이라고 합시다. 미스는 쓰기로, 히트는 읽기로 청구됩니다:

effective cost per 1M prefix tokens = $5.00 * (1 - h) + $0.20 * h
                                    = $5.00 - $4.80h

break-even against $4.00 uncached:  h = 1.00 / 4.80 = 20.8%

기억해야 할 숫자는 21%입니다. 프리픽스 토큰의 대략 5분의 1 미만이 캐시에서 제공된다면, 캐싱을 켜는 것이 비용을 더 나쁘게 만들었습니다.

캐시 적중률 백만 프리픽스당 실질 비용 $4.00 캐시되지 않은 경우 대비
0% $5.00 25% 더 나쁨
20.8% $4.00 손익분기점
50% $2.60 35% 더 저렴
75% $1.40 65% 더 저렴
90% $0.68 83% 더 저렴
95% $0.44 89% 더 저렴
99% $0.25 94% 더 저렴
100% $0.20 95% 더 저렴

두 표는 다른 관점에서 본 동일한 방정식입니다. N번의 호출당 한 번의 쓰기는 (N-1)/N의 적중률이기 때문입니다. 쓰기당 10번의 호출은 90%의 적중률이며, 두 표 모두 83%를 나타냅니다.

세 가지 요청 형태 분석

형태 1: 고빈도 에이전트, 작은 프리픽스

40,000 토큰 프리픽스, 800 토큰 가변 사용자 턴, 600 토큰 출력, 하루 10,000회 호출을 처리하는 지원 분류 에이전트. 호출의 3%에서 쓰기가 발생한다고 가정하면, 적중률은 97%입니다.

캐시되지 않음 캐시됨
프리픽스, 일 4억 토큰 $1,600.00 $137.60
가변 턴, 일 8백만 토큰 $32.00 $32.00
일일 총 입력 $1,632.00 $169.60

이는 입력 라인에서 89.6% 절감된 금액으로, 하루 약 1,462달러, 또는 한 달에 43,800달러에 해당합니다. 출력은 어느 쪽이든 하루 120달러로 유지됩니다. 프리픽스가 40,000 토큰에 불과하다는 점에 주목하십시오. 캐싱은 크기 때문이 아니라 빈도 때문에 이득이 됩니다.

형태 2: 1백만 컨텍스트에 대한 단일 패스

백만 토큰 입력, 하나의 답변 출력, 절대로 재사용되지 않음. 캐시되지 않은 경우 해당 호출은 입력으로 4.00달러가 소요됩니다. 캐시된 경우 5.00달러가 소요되는데, 이는 아무도 읽지 않는 프리픽스를 쓰는 데 비용을 지불했기 때문입니다. 하루에 500개의 문서를 이 패턴으로 처리하면 캐싱은 아무것도 얻지 못한 채 하루에 500달러를 추가로 지불하게 됩니다.

이는 사람들이 가장 자주 오해하는 형태입니다. 컨텍스트가 방대하고 방대한 컨텍스트는 당연히 캐싱이 필요하다는 본능 때문입니다. 크기는 중요하지 않습니다. 재사용이 전체 변수입니다.

형태 3: 1백만 창에서 긴 에이전트 세션

이제 동일한 백만 토큰 컨텍스트를 가져와 에이전트가 200턴에 걸쳐 다시 읽도록 합니다. 이는 18시간 작업 루프와 정확히 같습니다.

비용
캐시되지 않음, 200 x $4.00 $800.00
캐시됨, 1회 쓰기 + 199회 읽기 $44.80
캐시됨, 5회 쓰기 + 195회 읽기 $64.00

캐시가 세션 중간에 네 번 식고 다섯 번의 전체 쓰기 비용을 지불하더라도, 캐시되지 않은 청구서보다 여전히 92% 저렴합니다. 긴 세션은 0.20달러 요율이 명성을 얻는 곳입니다.

비용이 많이 드는 실수: 변경되는 부분을 캐싱하는 것

공유된 6,000 토큰 명령어 헤더 뒤에서 각각 한 번씩 요약되는 60,000 토큰 문서 5,000개를 고려해 보십시오.

전략 입력 비용
전혀 캐싱하지 않음 $1,320
각 문서를 포함하여 전체 요청을 캐시 $1,650
6,000 토큰 헤더만 캐시 $1,206

잘못된 경계를 캐싱하는 것은 캐싱하지 않는 것보다 25% 더 나쁩니다. 올바른 경계를 캐싱하는 것은 9% 더 좋습니다. 동일한 기능, 동일한 요율이지만, 캐시된 프리픽스가 끝나는 위치에 따라 444달러의 차이가 발생합니다.

여기서 도출되는 규칙: 호출 전반에 걸쳐 동일한 가장 긴 바이트 선행 부분을 캐시하고, 단 한 바이트도 더 캐시하지 마십시오. 타임스탬프, 요청 ID 또는 요청당 문서가 캐시된 프리픽스 내에 포함되어 있다면, 적중률은 0으로 떨어지고 모든 호출은 4.00달러 대신 5.00달러로 청구됩니다. 프리픽스 매칭의 일반적인 메커니즘은 프롬프트 캐싱 입문서에 설명되어 있습니다.

95%는 점근선이며, 받는 할인이 아닙니다

헤드라인 숫자는 캐시된 읽기가 신규 입력의 5% 비용이 든다는 것입니다. 실제로 5%만 지불하는 일은 없을 것입니다. 항상 최소 한 번의 쓰기 비용을 지불하기 때문입니다. 쓰기당 100회 호출 시 94% 절감, 쓰기당 10회 호출 시 83% 절감, 2회 호출 시 35% 절감입니다.

헤드라인이 아닌 적중률 표를 기준으로 예산을 책정하십시오. 95% 절감을 예상하고 83%를 관찰하는 재무팀은 기능이 가격대로 정확히 작동하고 있음에도 불구하고 기능이 고장 났다고 결론 내릴 것입니다.

출시 자료에 나와 있지 않은 내용

이 계산에 필요한 세 가지 입력은 Anthropic의 Opus 5.5 출시 자료에 포함되어 있지 않으며, 이를 추측하는 것은 예산을 잘못 책정하는 가장 빠른 방법이 될 것입니다:

숫자를 확정하기 전에 공급업체 가격 페이지에서 이 세 가지를 모두 확인하십시오. 이 글의 요율은 공개되어 있습니다. 이 세 가지는 그렇지 않습니다.

캐시가 실제로 적중하는지 테스트

실패 모드는 침묵합니다. 프리픽스가 비활성 상태가 되어도 오류가 발생하지 않습니다. 누군가 시스템 메시지에 디버그 ID를 추가하면 적중률이 97%에서 0으로 떨어지고, 유일한 신호는 3주 후 청구서에 찍힌 한 줄입니다.

Messages API는 모든 응답에서 분할을 보고합니다:

"usage": {
  "input_tokens": 812,
  "cache_creation_input_tokens": 0,
  "cache_read_input_tokens": 40960,
  "output_tokens": 604
}

첫 번째 호출에서 cache_creation_input_tokens가 프리픽스를 전달합니다. 그 이후의 모든 호출에서는 해당 필드가 0이어야 하고 cache_read_input_tokens가 동일한 부하를 전달해야 합니다. Apidog에 요청을 한 번 저장하고, 두 번 실행하여 어떤 필드가 움직이는지 확인하십시오.

그런 다음 해당 관찰을 어설션으로 만들어 조용히 퇴보하지 않도록 하십시오. 요청을 두 번 보내고 두 번째 응답에서 cache_read_input_tokens > 40000을 어설션하는 Apidog 테스트 시나리오는 팀원이 프리픽스를 비결정적으로 만드는 순간 CI에서 실패할 것입니다. 이는 프리픽스 청구 비용이 25배 증가하는 것과 당신 사이에 서 있는 한 줄짜리 테스트이며, 이 글에서 단일 최고 수익률을 가진 사항입니다.

GPT-6가 동일한 계산에 어떻게 적용되는가

GPT-6 Sol은 백만당 2.00달러의 입력 가격에 캐시된 읽기에 대해 90% 할인을 적용하여, 캐시된 읽기 비용이 백만당 0.20달러로 Opus 5.5와 동일합니다. GPT-6 Luna는 백만당 0.10달러 입력으로 백만당 0.01달러 캐시 비용이 됩니다.

차이점은 우리가 계산할 수 있다는 것입니다. OpenAI의 출시 자료에는 캐시 쓰기 요율이 명시되어 있지 않으므로, GPT-6의 손익분기 재사용률은 Opus 5.5처럼 도출할 수 없습니다. Anthropic이 명시적인 5.00달러의 쓰기 가격을 공개했기 때문에 21%라는 수치를 계산할 수 있게 된 것입니다. 캐시 유지 노력 변경 및 새로운 진단 도구를 포함한 OpenAI의 나머지 캐싱 출시에 대한 내용은 당사의 GPT-6 프롬프트 캐싱 분석에 있습니다.

결론

Claude Opus 5.5의 프롬프트 캐싱은 한 가지 산술적 질문으로 귀결됩니다: 프리픽스 토큰의 5분의 1 이상이 캐시에서 활성화된 상태로 반환될 것인가? 그렇다면 캐싱을 켜고 광고된 95% 대신 입력 비용에서 83%에서 94% 할인을 기대하십시오. 작업 부하가 고유 문서에 대한 단일 패스라면 캐싱을 끄고 백만당 1.00달러의 쓰기 프리미엄을 절약하십시오. 그리고 어떤 선택을 하든, CI에서 cache_read_input_tokens를 어설션하십시오. 캐시 회귀는 결코 스스로 알리지 않기 때문입니다.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요