Claude Sonnet 5.5 と Opus 5.5 徹底比較:価格半額で品質差は?Opus課金はどんな時?

Sonnet 5.5対Opus 5.5:費用は2ドル/10ドル対4ドル/20ドル、ベンチマークは数ポイント差で、Opus 5.5に費用をかける価値がある時を示す労力あたりのコストデータ。

INEZA Felin-Michel

INEZA Felin-Michel

29 9月 2026

Claude Sonnet 5.5 と Opus 5.5 徹底比較:価格半額で品質差は?Opus課金はどんな時?

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

Claude Sonnet 5.5の料金は、入力トークン100万個あたり2ドル、出力トークン100万個あたり10ドルで、Claude Opus 5.5の4ドル/20ドルの半額です。Anthropicの発表表では、ほとんどの項目でOpus 5.5と数ポイント差で並び、Terminal-Bench 4.0では(70.6%対66.4%で)Opus 5.5を上回っていますが、AnthropicはOpus 5.5が「複雑でオープンエンドな作業において明確に優れている」と述べています。結論として、明確なスコープの大量の作業やサブエージェントには、低から高エフォートでSonnet 5.5を使用すべきです。長期的でオープンエンドなタスク、またはSonnetをxhighやmaxまでプッシュするような場面ではOpus 5.5の料金を支払いましょう。なぜなら、Opusのmediumまたはhighエフォートは、同等またはそれ以下の費用でより高いスコアを出すことが多いからです。

ボタン

各モデルの詳細については、Claude Sonnet 5.5とはとClaude Opus 5.5とはをご覧ください。最後のセクションでは、Apidogで独自のプロンプトを使って両方をテストする方法を紹介しています。

仕様と価格の比較

Sonnet 5.5 Opus 5.5
APIモデルID claude-sonnet-5-5 claude-opus-5-5
入力 / 出力、100万トークンあたり $2 / $10 $4 / $20
キャッシュ書き込み (5分) $2.50 $5
キャッシュ読み取り $0.20 $0.20
高速モード 利用不可 $8 / $40
APIのデフォルトエフォート high medium
思考 デフォルトで適応型、またはbetween_tools 適応型、常時オン
コンテキスト / 最大出力 1M / 128K 1M / 128K
レイテンシクラス 高速 中程度

特に重要な3つの項目:

ベンチマーク:発表表では僅差、システムカードでは差が拡大

1から8行目はAnthropicの発表表からのもので、残りはシステムカードからのものです。CognitionはFrontierCodeを、CursorはCursorBenchを、ZapierはAutomationBenchを、Artificial Analysis (AA)はGDPval-AAとAA-Briefcaseを実行し、Anthropicがその他を実行しました。Sonnetは特記がない限り最大エフォートです。

ベンチマーク Sonnet 5.5 Opus 5.5
Terminal-Bench 4.0 70.6% 66.4% (xhigh)
FrontierCode 1.1 Main 46.2% max, 52.1% xhigh 54.4%
CursorBench 4.0 55.5% 57.8%
GDPval-AA v2.1 (Elo) 1844 1846
AA-Briefcase v1.1 (Elo) 1811 1822
HLE、ツールあり 64.5% 67.7%
OSWorld 2.1、部分的に 80.1% 81.8%
Chartography、ツールなし 61.6% 64.4%
SWE-Bench Pro 81.3 89.9
SWE-Bench Multimodal 54.3 61.4
HLE、ツールなし 56.9 64.4
OSWorld 2.1、厳密合格 43.5% 48.7%
ProgramBench、ロングコンテキスト 79.7% 91.2%
Terminal-Bench-Science 0.1 59.9% 58.7%
AutomationBench 44.7 42.5
HealthBench Professional 69.2 65.6

発表表は良い面だけを示しており、Terminal-Benchを除けば、Sonnetのxhigh FrontierCodeスコアを含めて、Opusが1.7〜3.2ポイントリードしています。システムカードの5つの項目では、その差が5.2〜11.5ポイントに拡大しています:SWE-Bench Pro、SWE-Bench Multimodal、ツールなしのHLE、厳密なOSWorld、ロングコンテキストのProgramBench。長期的で補助なしのタスク全体では、Opusが優位を保っています。

Terminal-Bench 4.0の勝利は注意深く解釈する必要があります。システムカードのセクション8.5によると、Opusの試行の10%が安全対策のフォールバックに触れたのに対し、Sonnetでは1.5%でした。また、AA自身の実行ではSonnet 5.5が63.6%を記録しています。詳細はClaude Sonnet 5.5のベンチマークをご覧ください。

エフォートが対決を左右する

発表表は各モデルが最高のセッティングで比較されています。しかし、あなたの請求書はそうではありません。Anthropicの発表ページは、各エフォートレベルと試行またはタスクあたりのコストをグラフで示しています。

ベンチマーク、モデル 低 中 高 X高 最大
Terminal-Bench、Sonnet 20.0% ($0.76) 28.8% ($0.83) 43.0% ($1.94) 61.5% ($5.30) 70.6% ($12.54)
Terminal-Bench、Opus 38.5% ($1.29) 57.6% ($2.94) 64.2% ($3.88) 66.4% ($7.35) 64.8% ($11.24)
CursorBench、Sonnet 35.8% ($0.50) 39.2% ($0.70) 47.8% ($1.67) 53.1% ($3.88) 55.5% ($9.67)
CursorBench、Opus 43.7% ($1.17) 52.5% ($2.91) 56.0% ($3.97) 56.0% ($6.98) 57.8% ($13.43)
FrontierCode、Sonnet 29.3% ($0.19) 36.5% ($0.24) 49.4% ($0.42) 52.1% ($1.59) 46.2% ($20.78)
FrontierCode、Opus 47.3% ($0.40) 54.6% ($0.80) 54.0% ($1.09) 51.4% ($2.25) 54.4% ($6.19)
AA-Briefcase、Sonnet 1264 ($0.87) 1461 ($1.64) 1634 ($3.95) 1746 ($9.63) 1811 ($29.19)
AA-Briefcase、Opus 1285 ($1.15) 1642 ($4.40) 1705 ($6.27) 1780 ($12.27) 1822 ($21.05)

示されていること:

トークンあたりの価格が半分だからといって、タスクあたりのコストが半分になるわけではありません。Sonnetはエフォートが上がるにつれてより多くのトークンを消費します。OfficeChaiが報じたAAデータによると、Sonnet 5.5は最大エフォートでインデックス作成タスクあたり約193,000の出力トークンを消費し、Opus 5.5よりも約60%多いとされています。

これがHacker Newsのスレッドでの主な議論です。多くのコメント投稿者は、チャートを読んで、Opusの低いエフォートがSonnetのhighまたはxhighに匹敵するか、それを下回ると解釈しており、Sonnetのニッチはlowまたはmediumエフォート、そしてOpusのオーケストレーターの下のサブエージェントであると結論付けています。

Anthropicのプロンプトガイドによると、Sonnet 5.5のエフォートは再調整されています。high(明確に指定されたエージェントコードの場合はmedium)から開始し、xhighとmaxは測定可能な改善があった場合にのみ使用することを推奨しています。リクエスト間で最上位のエフォートを変更するとプロンプトキャッシュが無効になるため、ワークロードごとに設定してください(APIガイド)。

安全性と動作の違い

プロンプトインジェクションの結果は分かれています。Gray Swanの間接プロンプトインジェクションベンチマークでは、Sonnet 5.5の攻撃成功率は15回の試行で3.4%(Sonnet 5は6.7%)でした。Opus 5.5よりも耐性は低いですが、テストされた他のすべての非Claudeモデルよりも優れており、GUIコンピューター使用では最も弱い(12.5%)です。Shadeの適応型攻撃者に対しては、コード生成(安全対策なしで3.01%対54.61%、プローブありで2.63%対11.13%)でSonnetがOpusを上回り、コンピューター使用(0.07%)では同等でした。ブラウザ使用では、Anthropicが評価した中で最初の攻撃成功なしのモデルでした。Opus 5.5とプロンプトインジェクションを参照してください。

どちらのモデルもサイバー安全対策を備えており、Sonnet 5.5はSonnetシリーズで初めてこれらを搭載しました。危険度の高いサイバータスクとしてフラグが立てられた場合、Anthropicのアプリでは自動的に、APIではオプトインした場合にのみ(fallbacks: "default"、ベータ版)Sonnet 5にフォールバックします。システムカードは、無害なセキュリティ作業であっても拒否が増える可能性があると警告しています。

システムカードによると、Sonnet 5.5はOpus 5.5よりもプレッシャー下でより正直ですが、幻覚を起こしやすい傾向があることも示されています。

1つのシステムでのSonnet 5.5とOpus 5.5の組み合わせ

両方を利用する一つの方法は、Opusが計画を立て、Sonnetが実行するというものです。重要なメカニズムは3つあります。

思考ブロックは交差しない。Sonnet 5.5はOpus 5とOpus 5.5の思考ブロックをドロップします(課金されません。リクエストは200を返します)。ブロックはモデル、会話、アカウントに紐付けられています。会話の途中でモデルを切り替えると、推論は失われるため、テキストを介して状態を受け渡す必要があります。Opusが計画をメッセージとして書き込み、Sonnetがそれから開始します(移行ガイド)。

アドバイザーツールはOpus 5.5を受け入れます。Sonnet 5.5実行者のアドバイザーとして機能し、アドバイスはadvisor_redacted_resultとして暗号化されて返されます。

Claude Codeにはopusplanがあります。Opusが計画モードで、Sonnetが実行を担当します。sonnetエイリアスはAnthropic API(v2.1.284以降)でのみSonnet 5.5を意味するため、Bedrock、Google Cloud、Foundryではopusplanは古いSonnetで実行されます。Claude CodeにおけるClaude Sonnet 5.5を参照してください。

GPT-6 Solの立ち位置

GPT-6 Solは、Sonnet 5.5と同じ2ドル/10ドルの定価で、キャッシュからの読み取りは0.20ドル(90%オフ)、コンテキストウィンドウは872kです。Anthropicの表ではSolに4つのセルが与えられています:FrontierCode 49.3%、GDPval-AA 1487、AA-Briefcase 1483、そしてツールなしのChartography 53.6%。脚注には、OpenAIが最近、AAとSurge AIのスコアにまだ反映されていない可能性があるSolの画像理解バグを修正したとあります。

ベンチマークによってタスクあたりのコストは逆転します。AA-Briefcaseの最大エフォートでは、Solはタスクあたり2.67ドルでSonnetの29.19ドルに対して1483対1811のスコアです。FrontierCodeでは、SonnetのhighはSolの最高スコア(49.4%対49.3%)に匹敵し、コストは0.42ドル対2.07ドルです。GPT-6 Sol vs Claude Opus 5.5およびGPT-6 Solとはを参照してください。

どのワークロードにどのモデルを

ワークロード モデルとエフォート
大量チャット、分類、抽出 Sonnet 5.5、lowまたはmedium
スコープが明確なバグ修正、PRサイズの変更 Sonnet 5.5、mediumまたはhigh
Opusプランを実行するサブエージェント Sonnet 5.5、mediumまたはhigh
長期的でオープンエンドなエージェント作業 Opus 5.5、medium、次にhigh
Sonnetのxhighまたはmaxが必要な場合 Opus 5.5、mediumまたはhigh
ロングコンテキストのコードベース推論 Opus 5.5、medium以上
信頼できないコンテンツを読むエージェント どちらでも可;独自のインジェクションケースをテスト

自分のトラフィックで両方をテストする

上記のすべてのチャートは、あなた自身のプロンプト、ツール、トークンミックスではなく、他社のハーネスから得られたものです。データが示唆する組み合わせから始めましょう:

ask() {
  curl -s https://api.anthropic.com/v1/messages \
    -H "x-api-key: $ANTHROPIC_API_KEY" \
    -H "anthropic-version: 2023-06-01" \
    -H "content-type: application/json" \
    -d '{"model":"'"$1"'","max_tokens":16000,
         "output_config":{"effort":"'"$2"'"},
         "messages":[{"role":"user","content":"Review this diff and list each bug as JSON: ..."}]}' \
  | jq '{model, stop_reason, usage}'
}
ask claude-sonnet-5-5 high
ask claude-opus-5-5 medium

Apidogでは、繰り返し可能に設定できます: https://api.anthropic.com/v1/messagesへの1つのリクエスト、環境変数としてのANTHROPIC_API_KEY、そしてボディ内の{{model}}と{{effort}}。ペアリングごとに複製し、各実行が同じことをチェックするようにポストプロセッサを追加します:

const body = pm.response.json();
pm.test("finished cleanly", () => {
  pm.expect(body.stop_reason).to.not.be.oneOf(["max_tokens", "refusal"]);
});
pm.test("stays inside the token budget", () => {
  pm.expect(body.usage.output_tokens).to.be.below(8000);
});

各ペアを10回から20回実行し、usage、応答時間、合格率を比較してください。トークン数に定価をかけたものが、タスクあたりの実際のコストです。詳細はLLMアプリケーションのテスト方法をご覧ください。

よくある質問

Claude Sonnet 5.5はOpus 5.5より優れていますか? ほとんどの項目ではそうではありません。Opus 5.5はTerminal-Bench 4.0とGDPval-AAでのほぼ同点を除き、発表表でリードしています。前世代の対決: Claude Opus 5 vs Sonnet 5。

Sonnet 5.5はOpus 5.5の半額ですか? トークンあたりでははい。タスクあたりではエフォートによります。maxエフォートでは、SonnetはAA-Briefcaseでより高価でした(29.19ドル対21.05ドル)。

会話の途中でモデルを切り替えられますか? はい、ただしSonnet 5.5はOpus 5.5の思考ブロックをドロップするため、状態はテキストとして渡す必要があります。

Sonnet 5.5かGPT-6 Sol、どちらが2ドル/10ドルですか? Sonnetは、共有されている4つの項目すべてで最高のセッティングでリードしていますが、Solはタスクあたりのはるかに安価になる可能性があります。両方をテストしてください。

次のステップ

ルーティングルールを変更する前に、最も高価なプロンプトの2つをSonnet 5.5のhighとOpus 5.5のmediumで実行し、合格率とタスクあたりのコストを比較してください。リクエスト、アサーション、結果を1つのプロジェクトにまとめるには、Apidogをダウンロードしてください。

ボタン

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる