Claude Haiku 5.5は、OSWorld 2.1で72.4%、GDPval-AA v2.1で1620、FrontierCode 1.1で46.4%、Terminal-Bench 4.0で39.2%のスコアを記録しました。Haiku 4.5は、これら3つのうち、15.7%、735、0.0%のスコアでした。これらはすべて最大努力の数値であり、デフォルトのmedium努力では、GDPval-AAは1277に低下します。現時点では、独立した研究機関からHaiku 5.5の結果はまだ発表されていません。
以下に、Claude Haiku 5.5のすべてのベンチマーク、実行者、努力がスコアとコストにどう影響するか、そしてApidogで独自のトラフィックでモデルをテストする方法を示します。仕様と価格については、Claude Haiku 5.5とはから始めてください。
公開時のテーブル
Haiku 5.5の各セルは、最大努力で適応的思考を使用しており、通常は5回の試行の平均値です(Terminal-Benchではタスクごとに10回使用)。「n/r」は結果が公開されていないことを意味します。
| ベンチマーク | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, オフラインサブセット | 72.4% | 15.7% | 48.9% | 83.9% |
| Humanity’s Last Exam, ツールなし | 45.9% | 10.2% | n/r | 56.9% |
| Humanity’s Last Exam, ツールあり | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (メイン) | 46.4% | n/r | 42.4% | 52.1% (xhigh) |
| Chartography, ツールなし | 46.4% | 6.4% | 29.1% | 61.6% |
各ベンチマークの実行者
Anthropicはほとんどのテストを自社で実行しました。ベンダー間の行はベンチマーク名を共有していますが、必ずしもハーネスや努力設定が同じとは限りません。
| ベンチマーク | 実行者 | 条件 |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis、独立して | GDPval-AA: 220タスク、44職種、EloはDeepSeek V4.1 Flash (最大) の1600に固定。Briefcase: 数週間のプロジェクト |
| FrontierCode 1.1 | Cognition | ClaudeはClaude Code、GPTはCodexで実行。メイン = 150タスク中最も難しい100タスク |
| Chartography | Anthropic、Surge AIのベンチマークで | Gemini 3.5 Flashグレーダー。LunaのスコアはSurge AIから |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare、66タスク、各10回試行、セーフガード有効 |
| OSWorld 2.1 | Anthropic | 108タスク中82タスク、1080p、最大500ステップ |
| Humanity’s Last Exam | Anthropic | 98万トークンのタスク予算、Opus 4.6グレーダー |
GPT-6 Lunaの2つのセルには文脈が必要です。Anthropicは、OpenAIのAPIを介して、LunaのOSWorldスコアを同じ82タスクで実行しました。LunaのTerminal-Bench 16.4%は、公開リーダーボード(Codex CLI、最大努力)からのものです。Terminal-Benchでは、Haiku 5.5の試行の1.8%(660回中12回)がセーフガードによって停止され、それぞれが失敗としてカウントされました。
FrontierCodeの罠
公開時のテーブルでは、Haiku 5.5の最大値(46.4%)と、Sonnet 5.5の最高のスコアであるxhigh値(52.1%)が並んでいます。システムカードには、同条件での数値が示されています。
| FrontierCode 1.1 | メイン | 拡張 |
|---|---|---|
| Haiku 5.5, 最大 | 46.4% | 58.4% |
| Haiku 5.5, xhigh | 45.8% | n/r |
| Sonnet 5.5, 最大 | 46.2% | 59.1% |
| Sonnet 5.5, xhigh | 52.1% | 64.4% |
最大努力では、Haiku 5.5がメインでSonnet 5.5を46.4%対46.2%でわずかに上回ります。各モデルの最高のセッティングでは、Sonnetが5.7ポイントリードしています。どちらかの数値を引用する際は、どの努力レベルを指しているのかを明記してください。
システムカードの追加情報
システムカードには、公開投稿で省略された行が追加されています。特に明記されていない限り、すべて最大努力での結果です。
| ベンチマーク | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-bench Multilingual | 83.7 | 67.4 | 90.3 |
| SWE-bench Multimodal | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1, 厳格な合格率 | 37.1% | n/r | 48.8% |
| Chartography, ツールあり | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench Professional (長さを調整済み) | 64.8% | 32.2% | 69.2% |
OSWorldの72.4%は部分点であり、完全に合格したタスクは37.1%に過ぎません。Chartographyはツールを使用するとほぼ2倍になるため(46.4%から86.2%)、Haiku 5.5にはチャート作業にツールを提供してください。
デフォルトの努力レベルではスコアが低い
Claude APIおよびClaude Codeでは、Haiku 5.5のデフォルトはmediumです。システムカードには、これらのデフォルト努力レベルの結果が報告されています。
| ベンチマーク | Medium (デフォルト) | 最大 | 注記 |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | Mediumでは、最大努力の約10分の1の出力トークンが使用されました |
| AA-Briefcase v1.1 | 1372 | 1578 | Mediumでは、最大努力の4分の1未満の出力トークンが使用されました |
| HealthBench Professional | 59.9% | 64.8% | Low 57.9%、high 61.3% |
output_config.effortなしでAPIを呼び出すと、左の列の結果が期待されます。努力に関するドキュメントには、すべての5つのレベルが記載されています。
努力レベル別のスコアとコスト
公開チャートより、スコア(コスト)として示します。OSWorldとTerminal-Benchのコストは試行ごと、GDPval-AAはタスクごとです。
| モデル | Low | Medium | High | Xhigh | Max |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42.0% ($0.07) | 53.3% ($0.13) | 61.3% ($0.18) | 67.6% ($0.28) | 72.4% ($0.61) |
| Sonnet 5.5 | 57.9% ($0.68) | 66.0% ($0.93) | 73.2% ($1.38) | 81.1% ($2.22) | 83.9% ($5.73) |
| GPT-6 Luna | 19.2% ($0.04) | 37.5% ($0.13) | 42.3% ($0.14) | 44.8% ($0.17) | 48.9% ($0.21) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12.7% ($0.42) | 20.3% ($0.68) | 24.8% ($1.04) | 31.5% ($1.75) | 39.2% ($2.64) |
| Sonnet 5.5 | 20.0% ($0.62) | 28.8% ($0.68) | 43.0% ($1.46) | 61.5% ($4.34) | 70.6% ($10.44) |
- 最大努力は最後のステップで高価になります。 GDPval-AAでは、最大努力はmediumの約28倍のコストで、Eloポイントは343ポイント高くなります。OSWorldでは、最大努力はxhighの2倍以上のコストで、4.8ポイント高くなります。
- OSWorldでは、Haiku 5.5のmediumがLunaの最大努力を上回ります: 53.3%(0.13ドル)対48.9%(0.21ドル)。ただし、他の同レベルではLunaの方が安価です。mediumでは両者のコストはほぼ同じです。Haiku 5.5 vs GPT-6 Lunaを参照してください。
- OSWorldでは、Haiku 5.5の最大努力がSonnet 5.5のmediumを上回ります(72.4%(0.61ドル)対66.0%(0.93ドル))。
- Terminal-Benchは例外です。 Sonnet 5.5のhigh(43.0%、1.46ドル)は、Haiku 5.5の最大努力(39.2%、2.64ドル)を、より低いコストで上回ります。Sonnetのコストには新しい0.10ドルのキャッシュ読み取り価格が適用されています。
コストは定価に基づいています。10万トークンまでのプロンプトには100万トークンあたり0.10ドル/0.50ドル、それ以上は高くなります(価格の内訳を参照)。
Haiku 5.5がまだ劣る点
Sonnet 5.5は、公開テーブルのすべての行でリードしています。Haikuが唯一直接対決で勝利したのは、同じ最大努力でのFrontierCodeです。最大の差はTerminal-Bench 4.0で、39.2%対70.6%でした。SWE-Bench Pro(64.8対81.3)とSWE-bench Multimodal(30.7対54.3)も同様の傾向を示しています。
Anthropicも同意しており、Sonnet 5.5とOpus 5.5は「複雑なエージェント型コーディングタスクには依然として優れた選択肢」であると述べています。Haiku 5.5は、要約、分類、ブラウザの使用、より大きなモデルの下でのサブエージェントなど、範囲の狭い作業に適しています。安価なサブエージェントとしてHaiku 5.5を実行する方法については、Claude CodeにおけるHaiku 5.5で説明されています。
独立した結果:まだなし
2026年10月8日現在、独立した研究機関からHaiku 5.5の結果は発表されていません。Artificial AnalysisのHaiku 5.5ページは404エラーを返し、そのリーダーボードにはClaude 4.5 Haikuのみが掲載されています。Vals、LMArena、SWE-bench、Aiderでも何も示されていませんでした。第三者機関による速度の数値はなく、AnthropicはHaiku 5.5を標準速度では「現時点で最速のモデル」と呼んでいますが、Fast ModeのOpusよりは遅いです。
最も近い外部の数値はCursorから来ています。そのモデルドキュメントによると、Haiku 5.5は「CursorBenchで最大努力時に48.4%のスコア」を記録しており、lowの30.9%から上昇しています。思考オフの場合、Cursorは思考オンで30.9%から42.3%を記録したのと同じ努力レベルで22.1%から26.2%を報告しています。
顧客の報告
これらはAnthropicの公開投稿からのもので、独立して検証されていません。
- HubSpot: シミュレーションされたCRMポータルスイートでの3回の実行の平均で92.8%を記録。これは同スイートでこれまでに見られた最高のスコアです。
- AlphaSense: 400のドキュメント内質問クエリで、Haiku 4.5の0.76に対し0.84を記録。これを統計的に有意であると述べています。
- Box: 初期テストで、Haiku 4.5よりも約半分のレイテンシで11ポイント高いスコアを記録。
- Asana: タスク完了のレイテンシが、現在のモデルと比較して30%以上低い。
- Cognition: Devin Fusionは、Haiku 5.5をサイドキック、Opus 5.5をリードとして使用し、FrontierCodeで66.2のスコアを保持。これはHaiku単独ではなく、2つのモデルシステムです。
独自の評価を実行する
ベンチマークは実際のトラフィックとは異なります。Anthropicのプロンプトガイドでは、独自の評価で改善が見られる場合にのみxhighまたはmaxを使用し、比較のためにSonnet 5.5でも同じ評価を実行することを推奨しています。Apidogでは:
ANTHROPIC_API_KEYを環境変数として保存し、20〜50個の実際のプロンプトをMessagesリクエストとして保存します。- アサーションを追加します:ステータス200、
"max_tokens"または"refusal"以外のstop_reason、および正しい回答に必要なコンテンツ。 low、medium、highでセットを実行します。努力レベルを変更すると、プロンプトキャッシュが無効になります。- 合格率と
usage内のトークン数を記録します。新しいトークナイザーは、同じテキストに対してHaiku 4.5よりも約30%多くのトークンを生成します。 - コレクションを複製し、
claude-sonnet-5-5に切り替えて、両方のモデルを1つのプロジェクトで比較します。
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
}'
temperature、top_p、top_k、またはアシスタントの事前入力は送信しないでください。これらはHaiku 5.5では400エラーを返します。thinkingブロックが最初に来る可能性があるため、レスポンスブロックはtypeで選択してください。APIガイドとLLMアプリケーションのテストを参照してください。
よくある質問
Claude Haiku 5.5はSonnet 5.5よりも優れていますか? Anthropicの数値ではそうではありません。Sonnet 5.5は公開テーブルのすべての行でリードしています。Haikuがそれをわずかに上回るのは、両方が最大努力で実行された場合のFrontierCodeのみです(46.4%対46.2%)。アップグレードの視点については、Haiku 5.5 vs Haiku 4.5を参照してください。
Haiku 5.5のSWE-benchスコアはどのくらいですか? SWE-Bench Proで64.8、SWE-bench Multilingualで83.7、SWE-bench Multimodalで30.7で、すべて最大努力での結果です。
ベンチマークはどの努力レベルで実行されましたか? 最大努力で、通常は5回の試行の平均です。APIのデフォルトはmediumであり、GDPval-AAは1620ではなく1277を記録します。
独立したHaiku 5.5のベンチマークはありますか? まだありません。Artificial AnalysisはGDPval-AAとAA-Briefcaseを独立して実行しましたが、これらのスコアはAnthropicが公開したものです。AAにはHaiku 5.5のページはありません。
GPT-6 Lunaの方が安価ですか? 通常はそうです。Lunaは、GDPval-AAのすべての努力レベルと、mediumを除くOSWorldのすべてのレベルでコストが低く、mediumでは両者のコストはほぼ同じです。Haiku 5.5は両方でより高いスコアを記録しています。
次のステップ
mediumから始め、合格率の向上がコストに見合う場合にのみステップアップしてください。Apidogをダウンロードし、上記の評価コレクションを作成し、本番環境のトラフィックを切り替える前に、Sonnet 5.5のベースラインとともにApidogに結果を保存してください。
