Claude Haiku 5.5는 OSWorld 2.1에서 72.4%, GDPval-AA v2.1에서 1620점, FrontierCode 1.1에서 46.4%, Terminal-Bench 4.0에서 39.2%를 기록했습니다. Haiku 4.5는 이 중 세 가지에서 15.7%, 735점, 0.0%를 기록했습니다. 이 모든 수치는 최대 노력(max-effort) 기준이며, 기본 medium 노력 기준으로는 GDPval-AA가 1277점으로 하락합니다. 아직 어떤 독립 연구소도 Haiku 5.5 결과를 발표하지 않았습니다.
아래는 모든 Claude Haiku 5.5 벤치마크, 실행 주체, 노력 수준에 따른 점수 및 비용 변화, 그리고 Apidog에서 자체 트래픽으로 모델을 테스트하는 방법입니다. 사양 및 가격 정보는 Claude Haiku 5.5란 무엇인가에서 시작하세요.
출시 표
모든 Haiku 5.5 셀은 최대 노력(max effort)에서 적응적 사고(adaptive thinking)를 사용하며, 일반적으로 5회 시험(Terminal-Bench는 작업당 10회)의 평균치입니다. "n/r"은 결과가 발표되지 않았음을 의미합니다.
| 벤치마크 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (엘로) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (엘로) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, 오프라인 하위 집합 | 72.4% | 15.7% | 48.9% | 83.9% |
| 인류의 마지막 시험, 도구 없음 | 45.9% | 10.2% | n/r | 56.9% |
| 인류의 마지막 시험, 도구 사용 | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (메인) | 46.4% | n/r | 42.4% | 52.1% (xhigh) |
| 차트 제작, 도구 없음 | 46.4% | 6.4% | 29.1% | 61.6% |
각 벤치마크 실행 주체
Anthropic은 대부분의 테스트를 자체적으로 실행했습니다. 공급업체 간 행은 벤치마크 이름은 공유하지만, 항상 동일한 하네스나 노력 설정(effort setting)을 공유하는 것은 아닙니다.
| 벤치마크 | 실행 주체 | 조건 |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | 인공 분석, 독립적으로 | GDPval-AA: 220개 작업, 44개 직업, DeepSeek V4.1 Flash (최대)의 엘로 점수 1600점에 고정; Briefcase: 수주간 프로젝트 |
| FrontierCode 1.1 | 코그니션 | 클로드 코드의 클로드, 코덱스의 GPT; 메인 = 150개 작업 중 가장 어려운 100개 |
| 차트 제작 | Anthropic, Surge AI 벤치마크 사용 | 제미니 3.5 플래시 평가자; Surge AI의 루나 점수 |
| Terminal-Bench 4.0 | Anthropic | 클로드 코드 --bare, 66개 작업, 각 10회 시험, 안전장치 켜짐 |
| OSWorld 2.1 | Anthropic | 108개 작업 중 82개, 1080p, 최대 500단계 |
| 인류의 마지막 시험 | Anthropic | 98만 토큰 작업 예산, Opus 4.6 평가자 |
두 개의 GPT-6 Luna 셀에는 문맥이 필요합니다. Anthropic은 동일한 82개 작업에 대해 OpenAI의 API를 통해 Luna의 OSWorld 점수를 실행했습니다. Luna의 Terminal-Bench 16.4%는 공개 리더보드(Codex CLI, 최대 노력)에서 가져온 것입니다. Terminal-Bench에서 안전장치(safeguards)는 Haiku 5.5 시험의 1.8%(660회 중 12회)를 중단시켰으며, 각 중단은 실패로 간주되었습니다.
프론티어 코드의 함정
출시 표에서는 Haiku 5.5의 최대 점수(46.4%)를 Sonnet 5.5의 xhigh 점수(52.1%)인 Sonnet의 최고 점수 옆에 두었습니다. 시스템 카드는 동일 조건 비교 수치를 제공합니다:
| 프론티어 코드 1.1 | 메인 | 확장 |
|---|---|---|
| Haiku 5.5, 최대 | 46.4% | 58.4% |
| Haiku 5.5, xhigh | 45.8% | n/r |
| Sonnet 5.5, 최대 | 46.2% | 59.1% |
| Sonnet 5.5, xhigh | 52.1% | 64.4% |
최대 노력(max effort)에서 Haiku 5.5는 메인에서 Sonnet 5.5를 46.4% 대 46.2%로 간발의 차로 앞섭니다. 각 모델의 최적 설정에서는 Sonnet이 5.7점 앞섭니다. 어떤 수치를 인용할 때 어떤 노력 수준(effort)을 의미하는지 명시하세요.
시스템 카드 추가 정보
시스템 카드는 출시 게시물에서 생략된 행을 추가합니다. 모든 수치는 별도로 명시되지 않는 한 최대 노력(max effort) 기준입니다.
| 벤치마크 | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-벤치 다국어 | 83.7 | 67.4 | 90.3 |
| SWE-벤치 멀티모달 | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1, 엄격한 통과율 | 37.1% | n/r | 48.8% |
| 차트 제작, 도구 사용 | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench 전문가 (길이 조정) | 64.8% | 32.2% | 69.2% |
OSWorld의 72.4%는 부분 점수입니다. 37.1%의 작업만 완전히 통과합니다. 차트 제작(Chartography)은 도구를 사용하면 거의 두 배가 되므로(46.4%에서 86.2%로), 차트 작업에는 Haiku 5.5 도구를 사용하세요.
기본 노력 수준에서는 점수가 낮음
Claude API 및 Claude Code에서 Haiku 5.5는 기본적으로 medium으로 설정됩니다. 시스템 카드에는 다음과 같은 기본 노력(default-effort) 결과가 보고됩니다.
| 벤치마크 | 중간 (기본) | 최대 | 참고 |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | 중간은 최대의 출력 토큰 약 10분의 1을 사용했습니다 |
| AA-Briefcase v1.1 | 1372 | 1578 | 중간은 최대의 출력 토큰 4분의 1 미만을 사용했습니다 |
| HealthBench 전문가 | 59.9% | 64.8% | 낮음 57.9%, 높음 61.3% |
output_config.effort 없이 API를 호출하면 왼쪽 열의 값을 예상할 수 있습니다. 노력 문서(effort docs)는 모든 5가지 수준을 다룹니다.
노력 수준별 점수 및 비용
출시 차트에서 점수(비용) 형태로 나타냈습니다. OSWorld 및 Terminal-Bench 비용은 시도당이며, GDPval-AA는 작업당입니다.
| 모델 | 낮음 | 중간 | 높음 | Xhigh | 최대 |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42.0% ($0.07) | 53.3% ($0.13) | 61.3% ($0.18) | 67.6% ($0.28) | 72.4% ($0.61) |
| Sonnet 5.5 | 57.9% ($0.68) | 66.0% ($0.93) | 73.2% ($1.38) | 81.1% ($2.22) | 83.9% ($5.73) |
| GPT-6 Luna | 19.2% ($0.04) | 37.5% ($0.13) | 42.3% ($0.14) | 44.8% ($0.17) | 48.9% ($0.21) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12.7% ($0.42) | 20.3% ($0.68) | 24.8% ($1.04) | 31.5% ($1.75) | 39.2% ($2.64) |
| Sonnet 5.5 | 20.0% ($0.62) | 28.8% ($0.68) | 43.0% ($1.46) | 61.5% ($4.34) | 70.6% ($10.44) |
- 최대 노력은 마지막 단계에서 비쌉니다. GDPval-AA에서 최대 노력은 중간 노력보다 약 28배 비싸지만, 엘로 점수는 343점 더 높습니다. OSWorld에서는 최대 노력이 xhigh보다 두 배 이상 비싸지만, 점수는 4.8점 더 높습니다.
- Haiku 5.5 중간 노력은 OSWorld에서 Luna 최대 노력을 능가합니다: 0.13달러에 53.3% 대 0.21달러에 48.9%. 그러나 다른 모든 동일 수준에서는 Luna가 더 저렴하며, 중간 수준에서는 둘의 비용이 거의 같습니다. 자세한 내용은 Haiku 5.5 대 GPT-6 Luna를 참조하십시오.
- Haiku 5.5 최대 노력은 OSWorld에서 Sonnet 5.5 중간 노력을 능가합니다 (0.61달러에 72.4% 대 0.93달러에 66.0%).
- Terminal-Bench는 예외입니다. Sonnet 5.5의 높은 노력 수준(43.0%, 1.46달러)이 Haiku 5.5의 최대 노력 수준(39.2%, 2.64달러)보다 적은 비용으로 더 나은 성능을 보입니다. Sonnet 비용은 새로운 0.10달러 캐시 읽기 가격을 사용합니다.
비용은 정가를 사용합니다: 최대 10만 토큰 프롬프트의 경우 백만 토큰당 0.10달러/0.50달러이며, 그 이상은 더 높습니다 (가격 분석 참조).
Haiku 5.5가 여전히 뒤처지는 곳
Sonnet 5.5는 출시 표의 모든 행에서 앞섭니다. Haiku의 유일한 일대일 승리는 동일한 최대 노력에서 FrontierCode입니다. 가장 큰 격차는 Terminal-Bench 4.0으로, 39.2% 대 70.6%입니다. SWE-Bench Pro(64.8 대 81.3)와 SWE-bench Multimodal(30.7 대 54.3)도 동일한 패턴을 보입니다.
Anthropic도 동의합니다: Sonnet 5.5와 Opus 5.5는 "복잡한 에이전트 코딩 작업에 더 나은 선택으로 남아있습니다." Haiku 5.5는 압축, 요약, 분류, 브라우저 사용 및 더 큰 모델의 하위 에이전트와 같은 좁은 범위의 작업에 적합합니다. 저렴한 하위 에이전트로 실행하는 방법은 Claude Code의 Haiku 5.5에서 다룹니다.
독립적인 결과: 아직 없음
2026년 10월 8일 현재, 어떤 독립 연구소도 Haiku 5.5 결과를 발표하지 않았습니다. Artificial Analysis의 Haiku 5.5 페이지는 404 오류를 반환하며, 리더보드에는 Claude 4.5 Haiku만 나열되어 있습니다. Vals, LMArena, SWE-bench, Aider도 아무것도 보여주지 않았습니다. 타사 속도 수치는 없지만, Anthropic은 Haiku 5.5를 표준 속도에서 "현재까지 가장 빠른 모델"이라고 부르며, Fast Mode의 Opus보다 느리다고 말합니다.
가장 가까운 외부 수치는 Cursor에서 나옵니다. 모델 문서에 따르면 Haiku 5.5는 "CursorBench에서 최대 노력 시 48.4%를 기록"했으며, 이는 낮은 노력 시 30.9%에서 상승한 것입니다. 사고(thinking) 기능을 끈 상태에서는 Cursor가 22.1%에서 26.2%를 보고했는데, 이는 사고 기능을 켰을 때 30.9%에서 42.3%를 기록한 것과 동일한 노력 수준에서입니다.
고객 보고서
다음 내용은 Anthropic의 출시 게시물에서 가져온 것이며, 독립적으로 검증되지 않았습니다.
- HubSpot: 시뮬레이션된 CRM 포털 스위트에서 3회 실행 평균 92.8%로, 해당 스위트에서 본 최고의 점수입니다.
- AlphaSense: 400개의 문서 내 질문(Ask in Document) 쿼리에서 Haiku 4.5의 0.76 대비 0.84를 기록했으며, 이는 통계적으로 유의미하다고 합니다.
- Box: 초기 테스트에서 Haiku 4.5보다 약 절반의 지연 시간으로 11점 더 높았습니다.
- Asana: 현재 모델 대비 작업 완료에 대한 지연 시간이 30% 이상 감소했습니다.
- Cognition: Devin Fusion은 Haiku 5.5를 보조로, Opus 5.5를 주력으로 사용하여 FrontierCode 점수 66.2를 기록했습니다. 이는 Haiku 단독이 아닌 두 모델 시스템입니다.
자체 평가 실행
벤치마크는 실제 트래픽과 다를 수 있습니다. Anthropic의 프롬프트 가이드는 자체 평가에서 이득을 보일 때만 xhigh 또는 max를 사용하고, 비교를 위해 Sonnet 5.5에서도 동일한 평가를 실행할 것을 제안합니다. Apidog에서:
ANTHROPIC_API_KEY를 환경 변수로 저장하고 20~50개의 실제 프롬프트를 메시지 요청(Messages requests)으로 저장합니다.- 어설션(assertion)을 추가합니다: 상태 200,
"max_tokens"또는"refusal"이 아닌stop_reason, 그리고 올바른 답변에 필요한 내용. low,medium,high로 설정을 실행합니다. 노력 수준(effort)을 변경하면 프롬프트 캐시가 무효화됩니다.- 통과율과
usage에 있는 토큰 개수를 기록합니다. 새 토크나이저는 동일한 텍스트에 대해 Haiku 4.5보다 약 30% 더 많은 토큰을 생성합니다. - 컬렉션을 복제하고
claude-sonnet-5-5로 교체한 다음, 한 프로젝트에서 두 모델을 비교합니다.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
}'
temperature, top_p, top_k 또는 어시스턴트 사전 채우기를 보내지 마십시오. Haiku 5.5에서는 각 요청이 400 오류를 반환합니다. thinking 블록이 먼저 올 수 있으므로 type별로 응답 블록을 선택하십시오. API 가이드 및 LLM 애플리케이션 테스트를 참조하십시오.
자주 묻는 질문
Claude Haiku 5.5가 Sonnet 5.5보다 낫습니까? Anthropic의 수치로는 아닙니다. Sonnet 5.5는 출시 표의 모든 행에서 앞섭니다. Haiku는 둘 다 최대 노력으로 실행될 때 FrontierCode에서만 근소하게 앞섭니다(46.4% 대 46.2%). 업그레이드 관점은 Haiku 5.5 대 Haiku 4.5를 참조하십시오.
Haiku 5.5의 SWE-벤치 점수는 얼마입니까? SWE-Bench Pro에서 64.8점, SWE-벤치 다국어에서 83.7점, SWE-벤치 멀티모달에서 30.7점이며, 모두 최대 노력(max effort) 기준입니다.
벤치마크는 어떤 노력 수준에서 실행되었습니까? 최대 노력(Max)으로, 일반적으로 5회 시험 평균치입니다. API 기본값은 중간(medium)이며, 이 경우 GDPval-AA는 1620점이 아닌 1277점을 기록합니다.
독립적인 Haiku 5.5 벤치마크가 있습니까? 아직 없습니다. Artificial Analysis는 GDPval-AA와 AA-Briefcase를 독립적으로 실행했지만, Anthropic이 해당 점수를 발표했습니다. AA에는 Haiku 5.5 페이지가 없습니다.
GPT-6 Luna가 더 저렴합니까? 일반적으로 그렇습니다. Luna는 모든 GDPval-AA 노력 수준과 중간을 제외한 모든 OSWorld 수준에서 비용이 적게 듭니다. 중간 수준에서는 둘의 비용이 거의 같습니다. Haiku 5.5는 두 벤치마크 모두에서 더 높은 점수를 기록합니다.
다음 단계
medium으로 시작하여 통과율 증가로 이득을 얻는 경우에만 상향 조정하십시오. Apidog를 다운로드하여 위에서 설명한 평가 컬렉션을 구축하고, 프로덕션 트래픽을 전환하기 전에 Apidog에 Sonnet 5.5 기준선과 함께 결과를 보관하십시오.
