Claude Sonnet 5.5 ベンチマーク:Anthropicの公式データ、独自結果、そして考察

クロードソネット5.5 ベンチマーク: Terminal-Bench 4.0で70.6%、SWE-Bench Proで81.3、AAインデックス56。各テストは誰が実行し、必要な労力はどれくらいで、自分で評価を実行する方法。

Medy Evrard

29 9月 2026

Claude Sonnet 5.5 ベンチマーク:Anthropicの公式データ、独自結果、そして考察

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

Claude Sonnet 5.5は、Terminal-Bench 4.0で70.6%、CursorBench 4.0で55.5%、FrontierCode 1.1で最大努力時に46.2%(xhighでは52.1%)、SWE-Bench Proで81.3%を記録しました。これはSonnet 5の10.3%、34.1%、42.4%、63.2%から向上しています。Opus 5.5はほとんどのローンチテーブルの項目で約2〜3ポイント上回っていますが、Terminal-Benchでは劣っています。Artificial Analysisは、Sonnet 5.5のIntelligence Indexを独自に56と評価し、216モデル中3位に位置付けています。

以下に、Claude Sonnet 5.5のベンチマーク全詳細、実行者、努力の変化、そしてApidogで自身のトラフィックに対してモデルをテストする方法を記載します。仕様については、Claude Sonnet 5.5とはをご覧ください。

ローンチテーブル

Anthropicのローンチ投稿では、4つのモデルを比較しています(「n/r」はダッシュを示します)。Sonnet 5.5のセルは、特に指定がない限り最大努力時のものです。APIのデフォルトはhigh、Claude Codeおよびアプリのデフォルトはmediumです。

ベンチマーク Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ n/r
FrontierCode 1.1 (Main) 46.2% Max² / 52.1% Xhigh 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% n/r
GDPval-AA v2.1³ 1844 1449 1846 1487⁴
AA-Briefcase v1.1³ 1811 1359 1822 1483⁴
Humanity’s Last Exam (with tools) 64.5% 54.9% 67.7% n/r
OSWorld 2.1 (partial) 80.1% 57.0% 81.8% n/r
Chartography (no tools) 61.6% 15.6% 64.4% 53.6%⁴

脚注(平易な言葉で):

  1. Opus 5.5のTerminal-Benchスコアはxhighでの最高値であり、maxでは64.8%でした。
  2. FrontierCodeは範囲外の編集に対してペナルティを課します。max時、Sonnet 5.5はClaude Codeのコードレビュー機能をより頻繁に実行し、多くのサブエージェントに展開しました。Cognitionが調査した2つのケースでは、これがタイムアウトまたは範囲外の編集を引き起こしました。
  3. Artificial Analysisは、構造化出力のバグ(現在は修正済み)があるリリース前デプロイメントで両方の知識作業テストを実行しました。Anthropicは、もし何か影響があるとしても、Sonnet 5.5をわずかに過小評価している程度と予想しています。
  4. OpenAIは最近、GPT-6 Solの画像理解バグを修正しましたが、AAおよびSurge AIのスコアには反映されていない可能性があります。

各ベンチマークの実行者

サードパーティが明記されていない限り、すべてのテストはAnthropic自身が実行しました。ベンチマーク名が共有されているクロスベンダーの項目は、ハーネスや努力設定は共有されていません。

実行者 ベンチマーク 条件
Anthropic Terminal-Bench 4.0, HLE, OSWorld 2.1 TB: Claude Code --bare、5試行、セーフガードオン。HLE: 検索とコード実行。OSWorld: 108タスク
Cognition FrontierCode 1.1 Claude Code内のClaude、Codex CLI内のGPT
Cursor CursorBench 4.0 Cursorのプロダクションハーネス。Anthropicは定価でのコストを推定
Artificial Analysis GDPval-AA, AA-Briefcase リリース前デプロイメント
Anthropic Chartography Surge AIのベンチマーク、Gemini 3.5 Flashで採点。SolのスコアはSurgeより

フォールバックはSonnet 5.5のTerminal-Bench試行の1.5%に影響しましたが、Opus 5.5では10%に影響しました(システムカード §8.5)。したがって、Sonnetの4.2ポイントリードは慎重に解釈してください。

システムカード追加情報

1〜6行目はシステムカードの最大努力サマリーです。

ベンチマーク Sonnet 5.5 Sonnet 5 Opus 5.5
SWE-Bench Pro 81.3 63.2 89.9
SWE-Bench Multilingual 90.3 78.3 93.9
SWE-Bench Multimodal 54.3 28.1 61.4
HLE, no tools 56.9 43.1 64.4
HealthBench Professional 69.2 57.8 65.6
AutomationBench (Zapier’s run) 44.7 10.7 42.5
DeepSWE v1.1 71.0% n/r n/r
Terminal-Bench-Science 0.1 59.9% n/r 58.7%
FrontierSWE v2 (Proximal’s run) 61.9% n/r 62.3%
ArXivMath (no tools / tools) 86.8% / 95.2% n/r 91.2% / 96.9%
ProgramBench (long context) 79.7% 77.3% 91.2%
OSWorld 2.1, strict pass 43.5% 25.6% 48.7%
Toolathlon-Verified (Pass@1) 77.8% 74.7% 77.8%
OfficeQA / OfficeQA Pro 76.9% / 65.6% 75.1% / 62.1% 78.9% / 67.7%

Sonnet 5.5はHealthBench Professional、AutomationBench、Terminal-Bench-ScienceでOpus 5.5をわずかに上回ります。OpusはProgramBench、SWE-Bench Pro、HLE(ツールなし)で最も大きくリードしています。OSWorldの80.1%という見出しは部分的な評価であり、タスクの43.5%のみが完全に合格しています。

努力によって状況が変わる

ローンチチャートをスコア(コスト)で示します。Terminal-Benchのコストは試行ごと、その他はタスクごとです。GPT-6 Solの数値が公開されていないため、2つのチャートではGPT-5.6 Sol(*)を使用しています。

モデル Low Medium High Xhigh Max
Terminal-Bench 4.0
Sonnet 5.5 20.0% ($0.76) 28.8% ($0.83) 43.0% ($1.94) 61.5% ($5.30) 70.6% ($12.54)
Opus 5.5 38.5% ($1.29) 57.6% ($2.94) 64.2% ($3.88) 66.4% ($7.35) 64.8% ($11.24)
Sonnet 5 3.2% ($3.78) 4.4% ($4.83) 4.5% ($8.20) 7.0% ($9.95) 10.3% ($11.62)
GPT-5.6 Sol* 7.9% ($1.46) 20.9% ($2.69) 26.1% ($4.12) 28.5% ($5.39) 37.3% ($7.89)
FrontierCode 1.1 Main
Sonnet 5.5 29.3% ($0.19) 36.5% ($0.24) 49.4% ($0.42) 52.1% ($1.59) 46.2% ($20.78)
Opus 5.5 47.3% ($0.40) 54.6% ($0.80) 54.0% ($1.09) 51.4% ($2.25) 54.4% ($6.19)
Sonnet 5 28.7% ($2.39) 35.2% ($3.81) 39.4% ($6.10) 42.7% ($10.07) 42.4% ($17.12)
GPT-6 Sol 37.3% ($0.43) 45.9% ($0.77) 47.7% ($1.04) 48.4% ($1.32) 49.3% ($2.07)
CursorBench 4.0
Sonnet 5.5 35.8% ($0.50) 39.2% ($0.70) 47.8% ($1.67) 53.1% ($3.88) 55.5% ($9.67)
Opus 5.5 43.7% ($1.17) 52.5% ($2.91) 56.0% ($3.97) 56.0% ($6.98) 57.8% ($13.43)
Sonnet 5 24.1% ($1.39) 28.0% ($2.31) 30.8% ($3.48) 32.0% ($4.55) 34.1% ($7.17)
GPT-5.6 Sol* 24.6% ($0.87) 31.1% ($1.77) 35.7% ($2.85) 37.7% ($4.40) 41.7% ($8.23)
AA-Briefcase v1.1 (Elo)
Sonnet 5.5 1264 ($0.87) 1461 ($1.64) 1634 ($3.95) 1746 ($9.63) 1811 ($29.19)
Opus 5.5 1285 ($1.15) 1642 ($4.40) 1705 ($6.27) 1780 ($12.27) 1822 ($21.05)
Sonnet 5 923 ($0.82) 1056 ($1.73) 1177 ($3.76) 1274 ($7.56) 1359 ($14.43)
GPT-6 Sol 905 ($0.12) 1142 ($0.34) 1289 ($0.63) 1364 ($1.19) 1483 ($2.67)

独立した評価結果

Artificial Analysisは、Sonnet 5.5のIntelligence Index v4.3.2を56と評価し、216モデル中3位に位置付けています。これはmaxとxhighのOpus 5.5のみに次ぐものです。Sonnet 5は38点を記録しました。インデックスを実行するコスト:

努力 インデックススコア 実行コスト
max 55.98 $8,977
xhigh 51.85 $2,738
high 46.74 $1,176
medium 40.74 $701
low 35.84 $544

maxはhighの7.6倍のコストで9.2ポイント多く獲得します。OfficeChaiによるAAの読み解きによると、Sonnet 5.5はパレート効率曲線から外れており、highが最も費用対効果が高く、maxではインデックスタスクあたり約193,000の出力トークンを使用するとされています。

安全性ベンチマーク

システムカードによるプロンプトインジェクション:

サイバー評価はセーフガードをオフにして実行されました:CyScenarioBenchで46.1%(Sonnet 5:0.7%、Opus 5.5:67.6%)。これはサイバーセーフガードを備えた最初のSonnetであり、Anthropicは無害なセキュリティタスクでも拒否が増える可能性があると警告しています。プロンプトインジェクションガイドをご覧ください。

独自の評価を実行する

ベンチマークは実際のトラフィックとは異なります。Anthropicのプロンプトガイドによると、努力設定は再調整されているため、Sonnet 5の設定を再利用しないようにとのことです。Apidogでは:

  1. ANTHROPIC_API_KEYを環境変数として保存し、20〜50の実際のプロンプトをMessagesリクエストとして保存します。
  2. ステータス200、"max_tokens"または"refusal"以外のstop_reason、および正しい回答に必要なコンテンツをアサートします。
  3. low、medium、high、xhighでそれぞれ1回ずつ実行します。努力設定を変更するとプロンプトキャッシュが無効になります。
  4. 合格率と、百万トークンあたり入力2ドル、出力10ドルで価格設定されたusage内のトークン数を記録します。
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5-5",
    "max_tokens": 16000,
    "output_config": {"effort": "high"},
    "messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
  }'

許容できる合格率の最低努力レベルで出荷してください。LLMアプリケーションのテストとAIエージェントAPIのテストを参照し、次にApidogをダウンロードしてコレクションを構築してください。

FAQ

Sonnet 5.5はOpus 5.5を上回りますか? Terminal-Bench 4.0、HealthBench Professional、AutomationBench、Terminal-Bench-Science、およびツールを使用したChartographyでは上回ります。残りのほとんどではOpus 5.5がリードまたは同点です。

Sonnet 5.5のSWE-Benchスコアは? 最大努力時でSWE-Bench Proで81.3、Multilingualで90.3です。

FrontierCodeの数値が2つあるのはなぜですか? 46.2%はmax、52.1%はxhighです。maxでのサブエージェントのファンアウトにより、範囲外のペナルティが課されました。

Sonnet 5からアップグレードすべきですか? ベンチマーク上では「はい」ですが、まずSonnet 5.5 vs Sonnet 5で破壊的API変更を確認してください。

次のステップ

Anthropicが推奨するようにhigh(または、適切に指定されたエージェントコーディングの場合はmedium)から開始し、Apidogでの評価によって、さらにステップアップすべきかを判断してください。

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる