클로드 소네트 5 vs 소네트 4.6: 무엇이 달라졌고, 업그레이드해야 할까?

Claude Sonnet 5 대 Sonnet 4.6: 무엇이 달라졌나, 세 가지 코드 변경 사항, 새로운 토크나이저, 동일한 토큰당 가격, 그리고 앱 업그레이드 여부.

Ashley Innocent

Ashley Innocent

1 July 2026

클로드 소네트 5 vs 소네트 4.6: 무엇이 달라졌고, 업그레이드해야 할까?

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

Anthropic은 2026년 6월 30일에 Claude Sonnet 5를 출시했으며, 이는 Sonnet 4.6의 드롭인 대체(drop-in replacement) 모델입니다. 모델 ID를 변경하기만 하면 대부분의 경우 코드가 계속 작동합니다. 하지만 이 문장에서 "대부분의 경우"라는 표현에는 몇 가지 의미가 있습니다. Sonnet 5는 새로운 토크나이저, 기본적으로 활성화된 적응형 사고(adaptive thinking), 그리고 이제 실행되는 대신 오류를 반환하는 몇 가지 요청 매개변수와 함께 제공됩니다. 이 글은 정확히 무엇이 변경되었는지, 비용은 얼마인지, 그리고 워크로드에 업그레이드가 가치가 있는지 자세히 설명합니다.

간단히 말하면: 토큰당 가격은 동일하며, 코딩 및 에이전트 작업에서 더 나은 점수를 보이고, 세 가지 작은 코드 변경 사항이 있으며, 토큰 수와 예산에 영향을 미치는 눈에 띄지 않는 토크나이저 문제가 하나 있습니다. 프로덕션에서 스위치를 전환하기 전에 세부 사항을 읽어보세요.

한눈에 보는 업그레이드

Sonnet 5는 Sonnet 4.6과 동일한 토큰당 가격을 유지하므로, 토큰당 요금 측면에서는 청구서에 아무런 변화가 없습니다. 도구 사용 및 코딩에 중요한 벤치마크에서 개선되었습니다. 그리고 기본 동작이 충분히 변경되어 묻지마 교체는 예상치 못한 결과를 초래할 수 있습니다.

다음은 비교표입니다.

속성 Sonnet 4.6 (claude-sonnet-4-6) Sonnet 5 (claude-sonnet-5)
출시일 이전 버전 2026년 6월 30일
컨텍스트 창 최대 100만 토큰 100만 토큰 (기본 및 최대)
최대 출력 128K 토큰 128K 토큰
사고 기본 설정 thinking 필드 없을 시 비활성화 적응형 사고 기본 활성화
확장 사고 (budget_tokens) 사용 중단됨 400 오류 반환
샘플링 매개변수 (temperature, top_p, top_k) 허용됨 기본값이 아닌 값은 400 오류 반환
토크나이저 이전 토크나이저 새 토크나이저 (텍스트당 약 30% 더 많은 토큰)
표준 가격 백만 입력/출력 토큰당 $3 / $15 백만 입력/출력 토큰당 $3 / $15
도입 가격 해당 없음 2026년 8월 31일까지 백만 토큰당 $2 / $10

Sonnet 4.6에서 실행되는 다른 모든 기능은 코드 변경 없이 Sonnet 5에서 실행됩니다. 구조화된 출력, 비전, 프롬프트 캐싱, 도구 사용, 배치가 모두 그대로 유지됩니다. 한 가지 잃게 되는 플랫폼 기능은 Priority Tier이며, 이는 Sonnet 5에서 사용할 수 없습니다.

개선된 점: 벤치마크

Sonnet 5는 지금까지 가장 에이전트적인(agentic) Sonnet 모델로 자리매김하고 있으며, 보고된 수치는 도구 의존적인 작업에서 이를 뒷받침합니다. 이들은 Anthropic의 출시 벤치마크이며, 출시 당일 기사들을 통해 확인되었습니다. 독립적인 테스트가 아닌 보고된 수치로 간주하세요.

벤치마크 Sonnet 4.6 Sonnet 5
SWE-bench Pro (에이전트 코딩) 58.1% 63.2%
OSWorld-Verified (컴퓨터 사용) 78.5% 81.2%

이는 Sonnet이 가장 많이 사용되는 작업에서 실제로 큰 도약입니다. 즉, 도구를 활용하여 코드를 작성하고 수정하며, 컴퓨터나 터미널을 조작하는 것입니다. Anthropic은 또한 Sonnet 5가 도구가 관여하면 Opus 4.8에 근접하며, 에이전트 작업에서 몇 점 차이로 뒤처지면서도 비용은 훨씬 저렴하다고 보고합니다. 앱이 에이전트 기반 형태라면, 이 업그레이드는 기다려온 것입니다. 프리미엄 모델과의 정면 비교는 Sonnet 5 vs Opus 4.8을 참조하세요.

Sonnet 5는 Anthropic의 측정에 따르면 4.6보다 더 안전합니다. 바람직하지 않은 행동 발생률이 낮고, 환각 및 아첨 현상이 적으며, 프롬프트 인젝션에 대한 저항력이 더 뛰어납니다. 실시간 사이버 보안 안전장치를 갖춘 최초의 Sonnet 등급 모델입니다. 알아두어야 할 한 가지 동작은, 금지된 요청에 대한 거부는 오류가 아닌 `stop_reason: "refusal"`과 함께 성공적인 HTTP 200으로 반환됩니다. 응답 구문 분석에서 이 중단 이유를 처리하세요.

세 가지 실제 코드 변경사항

대부분의 마이그레이션은 이 세 가지만 다룹니다. 필요한 부분을 검토하고 조정하면 나머지 통합은 변경되지 않습니다.

1. 적응형 사고가 이제 기본적으로 활성화됩니다.

Sonnet 4.6에서는 `thinking` 필드가 없으면 사고를 하지 않았습니다. Sonnet 5에서는 `thinking` 필드가 없는 요청도 적응형 사고를 활성화한 상태로 실행됩니다. 모델은 작업에 따라 얼마나 사고할지 결정하며, `effort` 매개변수(`low`, `medium`, `high`, 또는 `xhigh`)로 깊이를 제어합니다.

이것이 중요한 이유는 `max_tokens`가 총 출력에 대한 엄격한 제한이며, 이제 총 출력에는 사고 토큰과 응답 텍스트가 모두 포함되기 때문입니다. Sonnet 4.6에서 응답 텍스트만을 위해 설정된 `max_tokens`는 Sonnet 5에서 답변을 자를 수 있습니다. 사고 토큰이 동일한 예산을 소모하기 때문입니다.

이전에 사고 없이 실행되었던 워크로드를 계속 그렇게 유지하려면 사고를 명시적으로 끄세요.

from anthropic import Anthropic

client = Anthropic()

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=1024,
    thinking={"type": "disabled"},
    messages=[
        {"role": "user", "content": "Return the OpenAPI 3.1 path object for GET /invoices/{id}."}
    ],
)

print(response.content[0].text)

제어된 깊이로 적응형 사고를 사용하려면 비활성화하는 대신 노력을 설정하세요.

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=8192,
    thinking={"type": "adaptive"},
    effort="medium",
    messages=[
        {"role": "user", "content": "Draft integration tests for the POST /orders endpoint."}
    ],
)

형태에 유의하세요: 토큰 예산이 아닌 `thinking={"type": "adaptive"}`입니다. 이는 다음 변경 사항으로 이어집니다.

2. 수동 확장 사고가 제거되었습니다.

이전의 `thinking: {type: "enabled", budget_tokens: N}` 패턴은 Sonnet 5에서 400 오류를 반환합니다. 이 기능은 4.6에서 이미 사용 중단되었으므로 대부분의 현재 코드는 이를 사용하지 않지만, 확인해야 합니다. 모든 수동 예산을 적응형 사고와 `effort` 매개변수로 대체하세요. 어려운 작업에 대해 큰 `budget_tokens`를 설정하고 있었다면, `effort="high"` 또는 `effort="xhigh"`가 대체 수단입니다.

3. 샘플링 매개변수가 이제 400을 반환합니다.

`temperature`, `top_p`, 또는 `top_k`를 기본값이 아닌 값으로 설정하면 Sonnet 5에서 400 오류를 반환합니다. 생략하거나 기본값으로 두는 것은 괜찮습니다. 이 제약은 Opus 4.7 이상에서 이미 존재했으며, Sonnet 클래스에는 새로운 것입니다.

결정론적인 느낌의 출력(deterministic-feeling output)을 위해 `temperature=0`에 의존했다면, 이를 제거하고 대신 시스템 프롬프트를 통해 동작을 제어하세요. 샘플링을 통해 제어하는 대신 지침에 형식, 어조 및 제약 사항을 명시하세요. 코드베이스에서 이러한 매개변수에 대한 빠른 grep 검색은 프로덕션에서 발생할 수 있는 400 오류를 줄일 수 있습니다.

4.6에서 변경되지 않은 한 가지 사항: 어시스턴트 메시지 미리 채우기(assistant-message prefilling)는 여전히 지원되지 않으며 400을 반환합니다. 어시스턴트 차례를 미리 채워서 응답 시작을 강제하는 경우, 대신 구조화된 출력 또는 `output_config.format` 또는 시스템 프롬프트 지침을 사용하세요.

아무도 알려주지 않는 토크나이저 문제

Sonnet 5는 새로운 토크나이저를 사용합니다. 동일한 입력 텍스트가 Sonnet 4.6보다 약 30% 더 많은 토큰, 즉 약 1.3배의 토큰을 생성합니다. 이는 API 변경이 아닙니다. 요청, 응답 및 스트리밍 형태는 동일하며, 이를 위해 새로운 코드를 작성할 필요는 없습니다. 하지만 토큰 단위로 측정하거나 예산을 책정하는 모든 것에 영향을 미칩니다.

다음은 다시 측정해야 할 사항입니다.

마지막 요점은 예시를 통해 설명할 가치가 있습니다. Sonnet 4.6에서 프롬프트와 응답이 10,000 토큰이었다고 가정해 봅시다. 동일한 텍스트는 Sonnet 5에서 약 13,000 토큰입니다. 토큰당 요금이 동일하더라도, 가격표가 변경되지 않은 것처럼 보여도 해당 요청은 약 30% 더 많은 비용이 듭니다. 균일한 비용 동등성을 가정하기 전에 토큰 계산을 통해 실제 워크로드를 모델링하세요. Sonnet 5 가격 분석은 도입 가격과 표준 가격 비교 계산으로 이 부분을 더 깊이 다룹니다.

토큰 카운팅 엔드포인트를 사용하여 직접 변화를 측정할 수 있습니다.

curl https://api.anthropic.com/v1/messages/count_tokens \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-sonnet-5",
    "messages": [
      {"role": "user", "content": "Summarize the changelog for our billing API v3 release."}
    ]
  }'

`claude-sonnet-4-6`으로 동일한 호출을 실행하고 토큰 수를 비교하세요. 그 차이가 실제 예산에 미치는 영향입니다.

업그레이드 비용

토큰당 Sonnet 5는 Sonnet 4.6과 동일한 비용이 듭니다. 표준 요금으로 백만 입력 토큰당 $3, 백만 출력 토큰당 $15입니다. 2026년 8월 31일까지는 백만 입력 토큰당 $2, 백만 출력 토큰당 $10의 도입 요금이 적용되며, 그 이후에는 표준 $3 / $15로 전환됩니다.

따라서 도입 기간 동안에는 동일한 텍스트가 4.6의 표준 요금보다 토큰당 저렴하여, 토크나이저의 약 30% 토큰 증가를 부분적으로 상쇄합니다. 8월 31일 이후에는 토큰당 요금이 다시 4.6과 일치하며, 토크나이저 효과로 인해 동일한 요청이 4.6에서보다 더 많은 비용이 들 수 있습니다. 실제 트래픽에 맞춰 이를 모델링하세요. 배치 및 프롬프트 캐싱 요금의 경우, 고정 할인을 가정하기보다는 Anthropic의 가격 페이지를 확인하세요.

이전 세대의 비용을 고려하고 있다면, Sonnet 4.6 가격Claude API 비용 가이드가 비교할 기준선을 제공합니다.

업그레이드해야 할까요? 사용자별 평가

모델 ID 교체는 사소합니다. 전환 여부는 실행하는 작업에 따라 달라집니다.

에이전트, 코딩 도구 또는 도구 의존적인 워크플로를 구축하는 경우 지금 바로 업그레이드하세요. 이것이 가장 확실한 이점입니다. SWE-bench Pro 및 OSWorld의 개선 사항은 에이전트 기반 앱이 주로 사용되는 곳에 정확히 적용되며, 안전성 개선은 자율 루프에서 바람직하지 않은 행동을 줄입니다. 세 가지 매개변수 검토를 수행하고, 토큰 예산을 다시 측정하고, 배포하세요.

고용량 프로덕션 워크로드를 실행하는 경우, 업그레이드하되 신중하게 테스트하세요. 토큰당 가격이 동일하다는 것은 좋은 소식이지만, 토크나이저로 인해 총 토큰 지출과 `max_tokens` 자르기 동작이 모두 변경됩니다. 실제 트래픽을 라우팅하기 전에 토큰 계산 과정과 회귀 테스트 스위트를 실행하세요. 8월 31일까지의 도입 가격은 더 낮은 요금으로 유효성을 검사할 수 있는 기회를 제공합니다.

`temperature`, `budget_tokens`, 또는 미리 채우기(prefilling)에 의존하는 경우 신중하게 업그레이드하세요. 이제 이들은 400을 반환합니다. 마이그레이션은 간단하며, 결정론적 동작을 시스템 프롬프트로 옮기고 예산을 노력으로 바꾸는 것이지만, 사소한 작업은 아닙니다. 전환 전이 아니라 전환 전에 이들을 수정하세요.

특히 Priority Tier가 필요한 경우 보류하세요. Sonnet 5에서는 사용할 수 없습니다. SLA(서비스 수준 계약)가 이에 의존한다면, 요구 사항이 변경될 때까지 해당 경로에 대해 4.6을 유지하세요.

대부분의 팀에게 답은 업그레이드이며, 곧 업그레이드해야 합니다. 동일한 명목 가격으로 더 나은 에이전트 성능을 얻을 수 있기 때문입니다. 금요일에 배포하는 한 글자 편집이 아니라 테스트 과정을 거치는 실제 마이그레이션으로 취급하세요. 더 광범위하게 세대 간을 비교한다면, Sonnet 4.6 API 가이드는 이전할 표면을 문서화합니다.

Apidog에 저장된 요청 스위트로 회귀 테스트를 감지하세요.

업그레이드의 가장 안전한 방법은 벤치마크 표가 아니라 사용자 자신의 프롬프트에서 Sonnet 5를 Sonnet 4.6과 비교하는 것입니다. 이는 API 플랫폼이 구축된 이전-이후 테스트와 정확히 일치합니다.

Apidog는 올인원 API 개발 및 테스트 도구입니다. Claude API를 호출할 때, 인증 헤더, JSON 요청 본문, JSON 응답을 가진 HTTP 엔드포인트에 요청하는 것입니다. Apidog를 사용하면 요청을 한 번 저장하고 재사용 가능한 컬렉션으로 다시 실행할 수 있으므로, 모델 마이그레이션이 수동 재시도가 아닌 반복 가능한 테스트로 바뀝니다.

실용적인 마이그레이션 워크플로는 다음과 같습니다.

  1. 대표적인 프롬프트당 하나씩, 프로덕션 Messages API 요청을 Apidog 컬렉션으로 저장하세요.
  2. 요청 본문에 붙여넣지 않도록 `ANTHROPIC_API_KEY`를 환경 변수로 저장하세요.
  3. `model` 값만 다른 두 가지 환경을 설정하세요: `claude-sonnet-4-6` 및 `claude-sonnet-5`.
  4. 응답 형태와 `usage` 토큰 수에 대한 어설션(assertion)을 추가한 다음, 두 환경 모두에서 컬렉션을 실행하세요.
  5. 두 실행을 비교하세요. 토큰 수 차이는 토크나이저가 프롬프트에 미치는 실제 영향을 보여주며, 실패한 어설션은 배포 전에 조사해야 할 회귀입니다.

또한 Apidog에서 Claude 엔드포인트를 모의(mock)하여 토큰을 사용하지 않고 `stop_reason: "refusal"` 경로를 포함한 주변 통합을 구축하고 테스트할 수 있습니다. 앱이 에이전트 기반 형태이며 다른 도구를 호출하는 경우, Apidog는 그러한 다운스트림 API도 테스트하고 모의할 수 있는 곳입니다.

비교 스위트를 구축하려면 Apidog를 다운로드하거나, 브라우저에서 Apidog를 열어 요청부터 시작하세요. Postman에서 이 작업을 전환하는 경우, Postman 없이 API 테스트하기 가이드가 동일한 흐름을 다룹니다.

자주 묻는 질문

Claude Sonnet 5는 Sonnet 4.6의 드롭인 대체품인가요? 대부분 그렇습니다. 모델 ID를 `claude-sonnet-4-6`에서 `claude-sonnet-5`로 변경한 다음 세 가지를 검토해야 합니다. 적응형 사고가 이제 기본적으로 활성화되어 `max_tokens`에 영향을 미치고, `budget_tokens` 확장 사고는 400을 반환하며, 기본값이 아닌 샘플링 매개변수는 400을 반환합니다. 나머지는 모두 그대로 유지됩니다. 전체 요청 설정은 Sonnet 5 API 가이드를 참조하세요.

Sonnet 5는 Sonnet 4.6보다 비용이 더 많이 드나요? 토큰당으로는 아닙니다. 둘 다 표준 요금으로 백만 입력 토큰당 $3, 백만 출력 토큰당 $15입니다. 하지만 Sonnet 5의 새로운 토크나이저는 동일한 텍스트에 대해 약 30% 더 많은 토큰을 생성하므로, 동일한 토큰당 요율에서도 동일한 요청 비용이 더 많이 들 수 있습니다. 2026년 8월 31일까지는 백만 토큰당 $2 / $10의 도입 요금이 적용됩니다.

업그레이드 후 응답이 잘리는 이유는 무엇인가요? Sonnet 5에서는 적응형 사고가 기본적으로 활성화되어 있으며, 사고 토큰은 응답 텍스트와 동일한 `max_tokens` 예산을 공유합니다. 4.6에서 답변에 충분했던 예산이 이제는 잘릴 수 있습니다. `max_tokens`를 늘리거나, 해당 호출에서 사고를 원하지 않는 경우 `thinking={"type": "disabled"}`로 설정하세요.

새로운 토크나이저를 위해 코드를 변경해야 하나요? 아니요. 요청, 응답 및 스트리밍 형태는 동일하므로 코드 변경이 필요하지 않습니다. 하지만 토큰으로 예산을 책정하는 모든 것(토큰 수, `max_tokens` 크기, 요청당 비용 추정치)은 다시 측정해야 합니다. Sonnet 4.6 토큰 수를 재사용하지 마세요.

`temperature`와 `budget_tokens`는 어떻게 되었나요? 둘 다 Sonnet 5에서 기본값이 아닌 값으로 설정하면 400 오류를 반환합니다. 기본값이 아닌 `temperature`, `top_p`, `top_k`를 제거하고, 시스템 프롬프트를 통해 동작을 제어하세요. `budget_tokens` 확장 사고는 적응형 사고와 `effort` 매개변수로 대체하세요. Fable 5 및 Mythos API 변경 사항 가이드는 상위 계층에서 동일한 패턴을 다룹니다.

버튼

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요