Claude Sonnet 5.5は、Terminal-Bench 4.0で70.6%、CursorBench 4.0で55.5%、FrontierCode 1.1で最大努力時に46.2%(xhighでは52.1%)、SWE-Bench Proで81.3%を記録しました。これはSonnet 5の10.3%、34.1%、42.4%、63.2%から向上しています。Opus 5.5はほとんどのローンチテーブルの項目で約2〜3ポイント上回っていますが、Terminal-Benchでは劣っています。Artificial Analysisは、Sonnet 5.5のIntelligence Indexを独自に56と評価し、216モデル中3位に位置付けています。
以下に、Claude Sonnet 5.5のベンチマーク全詳細、実行者、努力の変化、そしてApidogで自身のトラフィックに対してモデルをテストする方法を記載します。仕様については、Claude Sonnet 5.5とはをご覧ください。
ローンチテーブル
Anthropicのローンチ投稿では、4つのモデルを比較しています(「n/r」はダッシュを示します)。Sonnet 5.5のセルは、特に指定がない限り最大努力時のものです。APIのデフォルトはhigh、Claude Codeおよびアプリのデフォルトはmediumです。
| ベンチマーク | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | n/r |
| FrontierCode 1.1 (Main) | 46.2% Max² / 52.1% Xhigh | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | n/r |
| GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487⁴ |
| AA-Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483⁴ |
| Humanity’s Last Exam (with tools) | 64.5% | 54.9% | 67.7% | n/r |
| OSWorld 2.1 (partial) | 80.1% | 57.0% | 81.8% | n/r |
| Chartography (no tools) | 61.6% | 15.6% | 64.4% | 53.6%⁴ |
脚注(平易な言葉で):
- Opus 5.5のTerminal-Benchスコアはxhighでの最高値であり、maxでは64.8%でした。
- FrontierCodeは範囲外の編集に対してペナルティを課します。max時、Sonnet 5.5はClaude Codeのコードレビュー機能をより頻繁に実行し、多くのサブエージェントに展開しました。Cognitionが調査した2つのケースでは、これがタイムアウトまたは範囲外の編集を引き起こしました。
- Artificial Analysisは、構造化出力のバグ(現在は修正済み)があるリリース前デプロイメントで両方の知識作業テストを実行しました。Anthropicは、もし何か影響があるとしても、Sonnet 5.5をわずかに過小評価している程度と予想しています。
- OpenAIは最近、GPT-6 Solの画像理解バグを修正しましたが、AAおよびSurge AIのスコアには反映されていない可能性があります。
各ベンチマークの実行者
サードパーティが明記されていない限り、すべてのテストはAnthropic自身が実行しました。ベンチマーク名が共有されているクロスベンダーの項目は、ハーネスや努力設定は共有されていません。
| 実行者 | ベンチマーク | 条件 |
|---|---|---|
| Anthropic | Terminal-Bench 4.0, HLE, OSWorld 2.1 | TB: Claude Code --bare、5試行、セーフガードオン。HLE: 検索とコード実行。OSWorld: 108タスク |
| Cognition | FrontierCode 1.1 | Claude Code内のClaude、Codex CLI内のGPT |
| Cursor | CursorBench 4.0 | Cursorのプロダクションハーネス。Anthropicは定価でのコストを推定 |
| Artificial Analysis | GDPval-AA, AA-Briefcase | リリース前デプロイメント |
| Anthropic | Chartography | Surge AIのベンチマーク、Gemini 3.5 Flashで採点。SolのスコアはSurgeより |
フォールバックはSonnet 5.5のTerminal-Bench試行の1.5%に影響しましたが、Opus 5.5では10%に影響しました(システムカード §8.5)。したがって、Sonnetの4.2ポイントリードは慎重に解釈してください。
システムカード追加情報
1〜6行目はシステムカードの最大努力サマリーです。
| ベンチマーク | Sonnet 5.5 | Sonnet 5 | Opus 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 81.3 | 63.2 | 89.9 |
| SWE-Bench Multilingual | 90.3 | 78.3 | 93.9 |
| SWE-Bench Multimodal | 54.3 | 28.1 | 61.4 |
| HLE, no tools | 56.9 | 43.1 | 64.4 |
| HealthBench Professional | 69.2 | 57.8 | 65.6 |
| AutomationBench (Zapier’s run) | 44.7 | 10.7 | 42.5 |
| DeepSWE v1.1 | 71.0% | n/r | n/r |
| Terminal-Bench-Science 0.1 | 59.9% | n/r | 58.7% |
| FrontierSWE v2 (Proximal’s run) | 61.9% | n/r | 62.3% |
| ArXivMath (no tools / tools) | 86.8% / 95.2% | n/r | 91.2% / 96.9% |
| ProgramBench (long context) | 79.7% | 77.3% | 91.2% |
| OSWorld 2.1, strict pass | 43.5% | 25.6% | 48.7% |
| Toolathlon-Verified (Pass@1) | 77.8% | 74.7% | 77.8% |
| OfficeQA / OfficeQA Pro | 76.9% / 65.6% | 75.1% / 62.1% | 78.9% / 67.7% |
Sonnet 5.5はHealthBench Professional、AutomationBench、Terminal-Bench-ScienceでOpus 5.5をわずかに上回ります。OpusはProgramBench、SWE-Bench Pro、HLE(ツールなし)で最も大きくリードしています。OSWorldの80.1%という見出しは部分的な評価であり、タスクの43.5%のみが完全に合格しています。
努力によって状況が変わる
ローンチチャートをスコア(コスト)で示します。Terminal-Benchのコストは試行ごと、その他はタスクごとです。GPT-6 Solの数値が公開されていないため、2つのチャートではGPT-5.6 Sol(*)を使用しています。
| モデル | Low | Medium | High | Xhigh | Max |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | |||||
| Sonnet 5.5 | 20.0% ($0.76) | 28.8% ($0.83) | 43.0% ($1.94) | 61.5% ($5.30) | 70.6% ($12.54) |
| Opus 5.5 | 38.5% ($1.29) | 57.6% ($2.94) | 64.2% ($3.88) | 66.4% ($7.35) | 64.8% ($11.24) |
| Sonnet 5 | 3.2% ($3.78) | 4.4% ($4.83) | 4.5% ($8.20) | 7.0% ($9.95) | 10.3% ($11.62) |
| GPT-5.6 Sol* | 7.9% ($1.46) | 20.9% ($2.69) | 26.1% ($4.12) | 28.5% ($5.39) | 37.3% ($7.89) |
| FrontierCode 1.1 Main | |||||
| Sonnet 5.5 | 29.3% ($0.19) | 36.5% ($0.24) | 49.4% ($0.42) | 52.1% ($1.59) | 46.2% ($20.78) |
| Opus 5.5 | 47.3% ($0.40) | 54.6% ($0.80) | 54.0% ($1.09) | 51.4% ($2.25) | 54.4% ($6.19) |
| Sonnet 5 | 28.7% ($2.39) | 35.2% ($3.81) | 39.4% ($6.10) | 42.7% ($10.07) | 42.4% ($17.12) |
| GPT-6 Sol | 37.3% ($0.43) | 45.9% ($0.77) | 47.7% ($1.04) | 48.4% ($1.32) | 49.3% ($2.07) |
| CursorBench 4.0 | |||||
| Sonnet 5.5 | 35.8% ($0.50) | 39.2% ($0.70) | 47.8% ($1.67) | 53.1% ($3.88) | 55.5% ($9.67) |
| Opus 5.5 | 43.7% ($1.17) | 52.5% ($2.91) | 56.0% ($3.97) | 56.0% ($6.98) | 57.8% ($13.43) |
| Sonnet 5 | 24.1% ($1.39) | 28.0% ($2.31) | 30.8% ($3.48) | 32.0% ($4.55) | 34.1% ($7.17) |
| GPT-5.6 Sol* | 24.6% ($0.87) | 31.1% ($1.77) | 35.7% ($2.85) | 37.7% ($4.40) | 41.7% ($8.23) |
| AA-Briefcase v1.1 (Elo) | |||||
| Sonnet 5.5 | 1264 ($0.87) | 1461 ($1.64) | 1634 ($3.95) | 1746 ($9.63) | 1811 ($29.19) |
| Opus 5.5 | 1285 ($1.15) | 1642 ($4.40) | 1705 ($6.27) | 1780 ($12.27) | 1822 ($21.05) |
| Sonnet 5 | 923 ($0.82) | 1056 ($1.73) | 1177 ($3.76) | 1274 ($7.56) | 1359 ($14.43) |
| GPT-6 Sol | 905 ($0.12) | 1142 ($0.34) | 1289 ($0.63) | 1364 ($1.19) | 1483 ($2.67) |
- ほとんどの成果はxhighまでに得られます。maxではTerminal-Benchで9.1ポイント追加されますが、コストは2.4倍になります。CursorBenchでは2.4ポイント追加されますが、コストは2.5倍になります。
- FrontierCodeのmaxスコアはxhighより低く、コストは13倍です(46.2%で20.78ドルに対し、52.1%で1.59ドル)。
- 低努力時のOpus 5.5が真のライバルです。Terminal-Benchでは、Opusがmediumで2.94ドルで57.6%を達成します。Sonnetがhighで1.94ドルで43.0%を達成します。Opusがhigh(64.2%、3.88ドル)でSonnetのxhigh(61.5%、5.30ドル)を上回ります。Sonnet 5.5 vs Opus 5.5をご覧ください。
- highがSonnetのコストパフォーマンスのスイートスポットです。FrontierCodeのhighでは49.4%で0.42ドルとなり、GPT-6 Solの最高値(49.3%)に匹敵し、コストは約5分の1です(価格内訳)。
独立した評価結果
Artificial Analysisは、Sonnet 5.5のIntelligence Index v4.3.2を56と評価し、216モデル中3位に位置付けています。これはmaxとxhighのOpus 5.5のみに次ぐものです。Sonnet 5は38点を記録しました。インデックスを実行するコスト:
| 努力 | インデックススコア | 実行コスト |
|---|---|---|
| max | 55.98 | $8,977 |
| xhigh | 51.85 | $2,738 |
| high | 46.74 | $1,176 |
| medium | 40.74 | $701 |
| low | 35.84 | $544 |
maxはhighの7.6倍のコストで9.2ポイント多く獲得します。OfficeChaiによるAAの読み解きによると、Sonnet 5.5はパレート効率曲線から外れており、highが最も費用対効果が高く、maxではインデックスタスクあたり約193,000の出力トークンを使用するとされています。
- AA独自のTerminal-Bench 4.0実行結果:Anthropicの70.6%に対し、63.6%。
- Sonnet 5の低スコアは現実的:AAは14.1%を測定しました(Sonnet 5のベンチマークを参照)。
- AA-Omniscience(OfficeChaiによる):54%の精度と47%の幻覚率に対し、Opus 5.5は66%と59%でした。
- まだ測定されていないもの:出力速度と最初のトークンまでの時間。したがって、「30%以上高速」というAnthropicの主張はまだ検証されていません。LMArenaへの掲載もまだです。
安全性ベンチマーク
システムカードによるプロンプトインジェクション:
- Gray Swan:攻撃成功率はk=1で0.4%、k=10で2.7%、k=15で3.4%(Sonnet 5:0.7%、5.1%、6.7%)。GUIコンピューターの使用は12.5%(k=15)で最も脆弱です。
- Shade(コーディング):セーフガードなしで3.01%。主にSonnet 5のサイバーフォールバック経由。Sonnet 5.5自体は5,901件のリクエスト中4件で侵害されました。
- ブラウザ使用:110のシナリオすべてで攻撃は成功しませんでした。
サイバー評価はセーフガードをオフにして実行されました:CyScenarioBenchで46.1%(Sonnet 5:0.7%、Opus 5.5:67.6%)。これはサイバーセーフガードを備えた最初のSonnetであり、Anthropicは無害なセキュリティタスクでも拒否が増える可能性があると警告しています。プロンプトインジェクションガイドをご覧ください。
独自の評価を実行する
ベンチマークは実際のトラフィックとは異なります。Anthropicのプロンプトガイドによると、努力設定は再調整されているため、Sonnet 5の設定を再利用しないようにとのことです。Apidogでは:
ANTHROPIC_API_KEYを環境変数として保存し、20〜50の実際のプロンプトをMessagesリクエストとして保存します。- ステータス200、
"max_tokens"または"refusal"以外のstop_reason、および正しい回答に必要なコンテンツをアサートします。 low、medium、high、xhighでそれぞれ1回ずつ実行します。努力設定を変更するとプロンプトキャッシュが無効になります。- 合格率と、百万トークンあたり入力2ドル、出力10ドルで価格設定された
usage内のトークン数を記録します。
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-sonnet-5-5",
"max_tokens": 16000,
"output_config": {"effort": "high"},
"messages": [{"role": "user", "content": "Classify this support ticket: ..."}]
}'
許容できる合格率の最低努力レベルで出荷してください。LLMアプリケーションのテストとAIエージェントAPIのテストを参照し、次にApidogをダウンロードしてコレクションを構築してください。
FAQ
Sonnet 5.5はOpus 5.5を上回りますか? Terminal-Bench 4.0、HealthBench Professional、AutomationBench、Terminal-Bench-Science、およびツールを使用したChartographyでは上回ります。残りのほとんどではOpus 5.5がリードまたは同点です。
Sonnet 5.5のSWE-Benchスコアは? 最大努力時でSWE-Bench Proで81.3、Multilingualで90.3です。
FrontierCodeの数値が2つあるのはなぜですか? 46.2%はmax、52.1%はxhighです。maxでのサブエージェントのファンアウトにより、範囲外のペナルティが課されました。
Sonnet 5からアップグレードすべきですか? ベンチマーク上では「はい」ですが、まずSonnet 5.5 vs Sonnet 5で破壊的API変更を確認してください。
次のステップ
Anthropicが推奨するようにhigh(または、適切に指定されたエージェントコーディングの場合はmedium)から開始し、Apidogでの評価によって、さらにステップアップすべきかを判断してください。
