クロード・ハイク 5.5 ベンチマーク

クロード俳句5.5ベンチマーク:OSWorldで72.4%、GDPval-AAで1620、Terminal-Benchで39.2%(最大努力時)。各テストの実行者、努力レベルごとのコスト、および独自の評価。

Ashley Goolam

Ashley Goolam

8 10月 2026

クロード・ハイク 5.5 ベンチマーク

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

Claude Haiku 5.5は、OSWorld 2.1で72.4%、GDPval-AA v2.1で1620、FrontierCode 1.1で46.4%、Terminal-Bench 4.0で39.2%のスコアを記録しました。Haiku 4.5は、これら3つのうち、15.7%、735、0.0%のスコアでした。これらはすべて最大努力の数値であり、デフォルトのmedium努力では、GDPval-AAは1277に低下します。現時点では、独立した研究機関からHaiku 5.5の結果はまだ発表されていません。

以下に、Claude Haiku 5.5のすべてのベンチマーク、実行者、努力がスコアとコストにどう影響するか、そしてApidogで独自のトラフィックでモデルをテストする方法を示します。仕様と価格については、Claude Haiku 5.5とはから始めてください。

ボタン

公開時のテーブル

Haiku 5.5の各セルは、最大努力で適応的思考を使用しており、通常は5回の試行の平均値です(Terminal-Benchではタスクごとに10回使用)。「n/r」は結果が公開されていないことを意味します。

ベンチマーク Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, オフラインサブセット 72.4% 15.7% 48.9% 83.9%
Humanity’s Last Exam, ツールなし 45.9% 10.2% n/r 56.9%
Humanity’s Last Exam, ツールあり 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 (メイン) 46.4% n/r 42.4% 52.1% (xhigh)
Chartography, ツールなし 46.4% 6.4% 29.1% 61.6%

各ベンチマークの実行者

Anthropicはほとんどのテストを自社で実行しました。ベンダー間の行はベンチマーク名を共有していますが、必ずしもハーネスや努力設定が同じとは限りません。

ベンチマーク 実行者 条件
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis、独立して GDPval-AA: 220タスク、44職種、EloはDeepSeek V4.1 Flash (最大) の1600に固定。Briefcase: 数週間のプロジェクト
FrontierCode 1.1 Cognition ClaudeはClaude Code、GPTはCodexで実行。メイン = 150タスク中最も難しい100タスク
Chartography Anthropic、Surge AIのベンチマークで Gemini 3.5 Flashグレーダー。LunaのスコアはSurge AIから
Terminal-Bench 4.0 Anthropic Claude Code --bare、66タスク、各10回試行、セーフガード有効
OSWorld 2.1 Anthropic 108タスク中82タスク、1080p、最大500ステップ
Humanity’s Last Exam Anthropic 98万トークンのタスク予算、Opus 4.6グレーダー

GPT-6 Lunaの2つのセルには文脈が必要です。Anthropicは、OpenAIのAPIを介して、LunaのOSWorldスコアを同じ82タスクで実行しました。LunaのTerminal-Bench 16.4%は、公開リーダーボード(Codex CLI、最大努力)からのものです。Terminal-Benchでは、Haiku 5.5の試行の1.8%(660回中12回)がセーフガードによって停止され、それぞれが失敗としてカウントされました。

FrontierCodeの罠

公開時のテーブルでは、Haiku 5.5の最大値(46.4%)と、Sonnet 5.5の最高のスコアであるxhigh値(52.1%)が並んでいます。システムカードには、同条件での数値が示されています。

FrontierCode 1.1 メイン 拡張
Haiku 5.5, 最大 46.4% 58.4%
Haiku 5.5, xhigh 45.8% n/r
Sonnet 5.5, 最大 46.2% 59.1%
Sonnet 5.5, xhigh 52.1% 64.4%

最大努力では、Haiku 5.5がメインでSonnet 5.5を46.4%対46.2%でわずかに上回ります。各モデルの最高のセッティングでは、Sonnetが5.7ポイントリードしています。どちらかの数値を引用する際は、どの努力レベルを指しているのかを明記してください。

システムカードの追加情報

システムカードには、公開投稿で省略された行が追加されています。特に明記されていない限り、すべて最大努力での結果です。

ベンチマーク Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench Multilingual 83.7 67.4 90.3
SWE-bench Multimodal 30.7 19.8 54.3
OSWorld 2.1, 厳格な合格率 37.1% n/r 48.8%
Chartography, ツールあり 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Professional (長さを調整済み) 64.8% 32.2% 69.2%

OSWorldの72.4%は部分点であり、完全に合格したタスクは37.1%に過ぎません。Chartographyはツールを使用するとほぼ2倍になるため(46.4%から86.2%)、Haiku 5.5にはチャート作業にツールを提供してください。

デフォルトの努力レベルではスコアが低い

Claude APIおよびClaude Codeでは、Haiku 5.5のデフォルトはmediumです。システムカードには、これらのデフォルト努力レベルの結果が報告されています。

ベンチマーク Medium (デフォルト) 最大 注記
GDPval-AA v2.1 1277 1620 Mediumでは、最大努力の約10分の1の出力トークンが使用されました
AA-Briefcase v1.1 1372 1578 Mediumでは、最大努力の4分の1未満の出力トークンが使用されました
HealthBench Professional 59.9% 64.8% Low 57.9%、high 61.3%

output_config.effortなしでAPIを呼び出すと、左の列の結果が期待されます。努力に関するドキュメントには、すべての5つのレベルが記載されています。

努力レベル別のスコアとコスト

公開チャートより、スコア(コスト)として示します。OSWorldとTerminal-Benchのコストは試行ごと、GDPval-AAはタスクごとです。

モデル Low Medium High Xhigh Max
OSWorld 2.1
Haiku 5.5 42.0% ($0.07) 53.3% ($0.13) 61.3% ($0.18) 67.6% ($0.28) 72.4% ($0.61)
Sonnet 5.5 57.9% ($0.68) 66.0% ($0.93) 73.2% ($1.38) 81.1% ($2.22) 83.9% ($5.73)
GPT-6 Luna 19.2% ($0.04) 37.5% ($0.13) 42.3% ($0.14) 44.8% ($0.17) 48.9% ($0.21)
GDPval-AA v2.1
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Terminal-Bench 4.0
Haiku 5.5 12.7% ($0.42) 20.3% ($0.68) 24.8% ($1.04) 31.5% ($1.75) 39.2% ($2.64)
Sonnet 5.5 20.0% ($0.62) 28.8% ($0.68) 43.0% ($1.46) 61.5% ($4.34) 70.6% ($10.44)

コストは定価に基づいています。10万トークンまでのプロンプトには100万トークンあたり0.10ドル/0.50ドル、それ以上は高くなります(価格の内訳を参照)。

Haiku 5.5がまだ劣る点

Sonnet 5.5は、公開テーブルのすべての行でリードしています。Haikuが唯一直接対決で勝利したのは、同じ最大努力でのFrontierCodeです。最大の差はTerminal-Bench 4.0で、39.2%対70.6%でした。SWE-Bench Pro(64.8対81.3)とSWE-bench Multimodal(30.7対54.3)も同様の傾向を示しています。

Anthropicも同意しており、Sonnet 5.5とOpus 5.5は「複雑なエージェント型コーディングタスクには依然として優れた選択肢」であると述べています。Haiku 5.5は、要約、分類、ブラウザの使用、より大きなモデルの下でのサブエージェントなど、範囲の狭い作業に適しています。安価なサブエージェントとしてHaiku 5.5を実行する方法については、Claude CodeにおけるHaiku 5.5で説明されています。

独立した結果:まだなし

2026年10月8日現在、独立した研究機関からHaiku 5.5の結果は発表されていません。Artificial AnalysisのHaiku 5.5ページは404エラーを返し、そのリーダーボードにはClaude 4.5 Haikuのみが掲載されています。Vals、LMArena、SWE-bench、Aiderでも何も示されていませんでした。第三者機関による速度の数値はなく、AnthropicはHaiku 5.5を標準速度では「現時点で最速のモデル」と呼んでいますが、Fast ModeのOpusよりは遅いです。

最も近い外部の数値はCursorから来ています。そのモデルドキュメントによると、Haiku 5.5は「CursorBenchで最大努力時に48.4%のスコア」を記録しており、lowの30.9%から上昇しています。思考オフの場合、Cursorは思考オンで30.9%から42.3%を記録したのと同じ努力レベルで22.1%から26.2%を報告しています。

顧客の報告

これらはAnthropicの公開投稿からのもので、独立して検証されていません。

独自の評価を実行する

ベンチマークは実際のトラフィックとは異なります。Anthropicのプロンプトガイドでは、独自の評価で改善が見られる場合にのみxhighまたはmaxを使用し、比較のためにSonnet 5.5でも同じ評価を実行することを推奨しています。Apidogでは:

  1. ANTHROPIC_API_KEYを環境変数として保存し、20〜50個の実際のプロンプトをMessagesリクエストとして保存します。
  2. アサーションを追加します:ステータス200、"max_tokens"または"refusal"以外のstop_reason、および正しい回答に必要なコンテンツ。
  3. low、medium、highでセットを実行します。努力レベルを変更すると、プロンプトキャッシュが無効になります。
  4. 合格率とusage内のトークン数を記録します。新しいトークナイザーは、同じテキストに対してHaiku 4.5よりも約30%多くのトークンを生成します。
  5. コレクションを複製し、claude-sonnet-5-5に切り替えて、両方のモデルを1つのプロジェクトで比較します。
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [{"role": "user", "content": "Classify this support ticket as billing, bug or feature request: ..."}]
  }'

temperature、top_p、top_k、またはアシスタントの事前入力は送信しないでください。これらはHaiku 5.5では400エラーを返します。thinkingブロックが最初に来る可能性があるため、レスポンスブロックはtypeで選択してください。APIガイドとLLMアプリケーションのテストを参照してください。

よくある質問

Claude Haiku 5.5はSonnet 5.5よりも優れていますか? Anthropicの数値ではそうではありません。Sonnet 5.5は公開テーブルのすべての行でリードしています。Haikuがそれをわずかに上回るのは、両方が最大努力で実行された場合のFrontierCodeのみです(46.4%対46.2%)。アップグレードの視点については、Haiku 5.5 vs Haiku 4.5を参照してください。

Haiku 5.5のSWE-benchスコアはどのくらいですか? SWE-Bench Proで64.8、SWE-bench Multilingualで83.7、SWE-bench Multimodalで30.7で、すべて最大努力での結果です。

ベンチマークはどの努力レベルで実行されましたか? 最大努力で、通常は5回の試行の平均です。APIのデフォルトはmediumであり、GDPval-AAは1620ではなく1277を記録します。

独立したHaiku 5.5のベンチマークはありますか? まだありません。Artificial AnalysisはGDPval-AAとAA-Briefcaseを独立して実行しましたが、これらのスコアはAnthropicが公開したものです。AAにはHaiku 5.5のページはありません。

GPT-6 Lunaの方が安価ですか? 通常はそうです。Lunaは、GDPval-AAのすべての努力レベルと、mediumを除くOSWorldのすべてのレベルでコストが低く、mediumでは両者のコストはほぼ同じです。Haiku 5.5は両方でより高いスコアを記録しています。

次のステップ

mediumから始め、合格率の向上がコストに見合う場合にのみステップアップしてください。Apidogをダウンロードし、上記の評価コレクションを作成し、本番環境のトラフィックを切り替える前に、Sonnet 5.5のベースラインとともにApidogに結果を保存してください。

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる