OpenAIのGPT-5.6は、2週間のゲート付きプレビューを経て2026年7月9日に一般提供が開始され、そのフラッグシップであるSolティアは、エージェント能力の王座を主張するローンチ時数値と共に登場しました。一方、AnthropicのClaude Fable 5は6月初旬から「最も有能なモデル」の旗を掲げています。この四半期に実際の業務でフラッグシップモデルを選ぶのであれば、今や信頼できる2つの答えと、矛盾する見出しの山に直面することになります。
ほとんどの比較が触れない部分がここにあります。どちらのモデルもすべてにおいて勝者ではなく、ベンダー自身の数値もそれを示しています。OpenAIの発表レポートによると、Solは幅広いエージェントベンチマークで大差をつけてリードしています。同じレポートでは、Claude Fable 5がSWE-Bench Proで約16ポイントリードしていることを示しています。どちらか一方を総合的な勝者と断定する比較は、あなたに何かを売りつけようとしているのです。
ですから、この比較はそうではありません。以下に、すべての数値の出典を明記したベンチマークの内訳、その内訳があなたの仕事に何を意味するのか、両社の価格設定、API表面の違い、そして意思決定ガイドを示します。GPT-5.6 Solとは何かについては別の解説記事で取り上げており、公式のGPT-5.6発表がOpenAIの主張の主要な情報源です。
まず結論
| タスク | 今日の推奨 | 根拠 |
|---|---|---|
| 幅広いエージェントタスクの実行 | GPT-5.6 Sol | OpenAIによると、Agents’ Last Examで〜53 (GPT-5.5の46.9に対し) |
| 深層ソフトウェアエンジニアリング | Claude Fable 5 | OpenAI自身のチャートによると、SWE-Bench Proで80.3% (Solの64.6%に対し) |
| ターミナル駆動型エージェントワーク | GPT-5.6 Sol (わずかに) | OpenAIによると、Terminal-Bench 2.1で88.8% (ultra使用時91.9%) |
| トークンあたりの最低表示価格 | GPT-5.6 Sol | 100万トークンあたり$5/$30 (Fable 5の公表価格は$10/$50に対し) |
| 組み込みの並列マルチエージェント実行 | GPT-5.6 | ultra設定はデフォルトで4つのエージェントを並列実行 |
| 全てに勝る単一モデル | なし | 現時点ではそのようなモデルは存在しない |
この表全体には一つの注意点があります。すべてのベンチマーク数値はベンダーが報告したもので、発表時に公開されたものであり、まだ独立した検証は行われていません。これは主張の地図として読み取り、確定したランキングとして捉えないでください。唯一確定的なベンチマークはあなた自身のワークロードであり、その並列実行方法を最後の方でApidogで示す予定です。
OpenAIによるベンチマークの内訳
この比較を定義する3つの数値があり、そのすべてがOpenAIの発表資料から来ています。この情報源は諸刃の剣ですので、心に留めておいてください。
| ベンチマーク | GPT-5.6 Sol | Claude Fable 5 | 出典 |
|---|---|---|---|
| Agents’ Last Exam | 〜53 (報告範囲52.7〜53.6) | Solより約13ポイント低い | OpenAI、発表日 |
| SWE-Bench Pro | 64.6% | 80.3% | OpenAI、発表日 |
| Terminal-Bench 2.1 | 88.8% (ultra使用時91.9%) | OpenAIのチャートには記載なし | OpenAI、発表日 |
Agents’ Last Examでは、OpenAIはSolが約53であると報告しており、GPT-5.5の46.9から上昇し、Claude Fable 5を約13ポイント上回っています。これは、長く、多段階のエージェントタスクを中心に構築されたベンチマークにおける真の世代間の飛躍であり、OpenAIが最初に提示した数値です。
SWE-Bench Proでは状況が逆転します。OpenAI自身の比較チャートでは、Claude Fable 5が80.3%に対し、Solが64.6%となっています。評価すべきは、自社の発表資料で15.7ポイントの損失を公開することは異例であり、残りのチャートを真剣に受け止めることを容易にする点です。また、SWE-Bench Proが測定するもの、つまり既存のコードベースにおける困難な実際のソフトウェアエンジニアリングの問題をエンドツーエンドで解決することにも合致しています。
Terminal-Bench 2.1はSolの優位性を裏付けています。OpenAIは、標準のSolで88.8%、ultraが4つの並列エージェントに作業を分散した場合で91.9%と報告しています。ultraの数値は、意図的に高いトークン消費を伴う異なる実行モードであり、同じモデルがより深く思考しているわけではないことに注意してください。
これらの情報を重視する前に、2つの誠実性チェックを行ってください。まず、これらは最も利益を得る可能性のあるベンダーからの発表日時点の主張であり、OpenAI以外の誰もまだ再現しておらず、評価ハーネスの選択によってスコアが数ポイント変動する可能性があります。次に、単一のベンチマークは多くの情報を圧縮しています。Simon Willisonの発表初日の記事は、リリースに関する有用な独立した情報であり、我々のGPT-5.6 Solベンチマークの内訳では、各テストが何を詳細に測定しているかを解説しています。
内訳の意味するもの
これら3つの数値のパターンはランダムではありません。それは2つの異なる専門性を示唆しています。
Solの強みは「広さ」です。Agents’ Last ExamとTerminal-Benchはどちらも、多くのステップにわたって計画を立て、ツールを調整し、エラーから回復し、さまざまなタスクを完了させるモデルを評価します。ワークロードが、チケット処理、研究実行、運用自動化、またはターミナル駆動型パイプラインを処理するエージェントのフリートのようなものであれば、OpenAIの数値はSolがより強力な選択肢であると主張します。
Fable 5の強みは「深さ」です。SWE-Bench Proは、「このモデルが、人間が後で問題を解きほぐすことなく、既存のコードベースで困難な実際のソフトウェアエンジニアリングを実行できるか」を測る最も近い公開プロキシです。競合他社が認めた15.7ポイントのリードは、たとえ寛大な誤差範囲を考慮しても無視できるものではありません。ワークロードがレポジトリ規模のリファクタリング、厄介なデバッグ、または長期にわたる単一プロジェクトのエンジニアリング実行である場合、それがデフォルトを決定する数値となるでしょう。
これはつまり、「どちらのモデルが優れているか」ではなく、「これら2つの仕事のどちらが自分の仕事に似ているか」が正しい問いであるということです。リーダーボードの集計で選ぶことは、あなたが持っていないワークロードに最適化することになります。
価格比較
OpenAIは、GPT-5.6の3つのティアすべてについて明確なGA価格を発表しました。AnthropicのFable 5の価格は、発表時に公開されたものです。7月にサブスクライバー向けのアクセス条件が使用クレジットに移行したため、予算を組む前にAnthropicの価格ページで現在の料金を確認してください。
| モデル | 入力 (100万トークンあたり) | 出力 (100万トークンあたり) |
|---|---|---|
| gpt-5.6-sol (エイリアス gpt-5.6 はここにルーティングされる) | $5.00 | $30.00 |
| gpt-5.6-terra | $2.50 | $15.00 |
| gpt-5.6-luna | $1.00 | $6.00 |
| claude-fable-5 | $10.00 (公表値; 要確認) | $50.00 (公表値; 要確認) |
料金表によると、SolはFable 5の半額で、入力・出力ともにトークンあたりのコストが安いです。これは大きな差ですが、表示価格はタスクのコストを予測する上では弱い指標です。両モデルはトークン化の仕方が異なり、同じプロンプトに対して異なる出力長を生成し、回答に到達するために異なる量の推論を消費します。トークンあたりの価格が安くても、タスクあたりの出力が多いモデルは、結果的に同等のコストになることもあります。
キャッシングは両者の差をさらに縮めます。GPT-5.6は明示的なキャッシュブレークポイントをサポートしており、キャッシュ書き込みは非キャッシュ入力レートの1.25倍で課金され、キャッシュ読み取りは90%割引を維持し、最低30分のキャッシュ寿命があります。Fable 5のプロンプトキャッシングもキャッシュヒットを90%割引し、これは基本レートが高いFable 5にとって2倍重要になります。Claude Fable 5の価格内訳では、これらの節約が実際にどのように現れるかを解説しています。いずれにせよ、追跡すべき数値は100万トークンあたりのコストではなく、完了したタスクあたりのコストです。
API表面の違い
両社ともチャット補完エンドポイントをはるかに超える機能を提供しており、その形状は選択に影響を与えるほど異なります。
OpenAIの開発者ドキュメントによると、GPT-5.6の表面はResponses API内の制御とオーケストレーションが中心です。
- 推論の労力レベルは、なしから最大までの6段階があり、リクエストごとに深さを調整可能。
- 品質優先のワークロード向けに、3つのモデルすべてに設定 (reasoning.mode: “pro”) としてのProモード。これはノブであり、独立したモデルではない。
- Ultraは、デフォルトで4つのエージェントを並列実行するマルチエージェント設定。高いトークン消費と引き換えに実測時間を短縮し、ProおよびEnterpriseプランのChatGPT Workと、Plus以上のCodexで利用可能。
- プログラムによるツール呼び出し。モデルがJavaScriptを記述し、ネットワークアクセスなしの隔離されたV8ランタイム内でツール呼び出しをオーケストレートする。
- ターンをまたいだ永続的な推論、ベータ版のマルチエージェント実行、および元の画像寸法を保持するビジョン詳細設定。
Claude Fable 5はClaude 5ファミリーのトップに位置し、Anthropicの発表でClaude Mythos 5と共に導入されました。公開された表面には、デフォルトで100万トークンのコンテキストウィンドウ、リクエストあたり最大12万8000トークンの出力、および安全上の理由で拒否されたリクエストを同じAPI呼び出し内でClaude Opus 4.8に再ルーティングできるサーバーサイドのフォールバックパラメーターが含まれています。Anthropicは、要求の厳しい推論と長期的なエージェント作業にこのモデルを位置づけており、Claude Codeとサブエージェントワークフローを中心に独自のエージェントスタックを持っています。Claude Fable 5解説では、完全なスペックシートを網羅しています。
コンテキストウィンドウはほぼ同等です。Fable 5の100万トークンは確認済みであり、初期のドキュメントではGPT-5.6も100万トークンであると報告されていますが、OpenAIのスペックページがそこでの真の情報源となるはずです。より大きな違いは哲学にあります。OpenAIはオーケストレーションのプリミティブ(並列処理、プログラムによるツール呼び出し、労力ダイヤル)を第一級のAPI機能として公開しています。Anthropicは、信頼性のある配管を備えた深い単一モデルエンジンを提供しています。どちらのアプローチも間違いではなく、ベンチマークが示す「広さ対深さ」の区別にそれぞれ対応しています。
実用的な意思決定ガイド
発表時のノイズを取り除けば、選択はいくつかの質問に集約されます。
次の場合、GPT-5.6 Solをデフォルトとして選択してください。
- ワークロードがエージェントフリート、ツールオーケストレーション、または多数の多様なタスクの自動実行である場合。
- 並列処理とリクエストごとの労力制御を、自作するものではなくAPIプリミティブとして利用したい場合。
- トークン予算のプレッシャーが現実的で、$5/$30の料金表、さらにTerraとLunaといった下位モデルがユニットエコノミクスに合致する場合。
次の場合、Claude Fable 5をデフォルトとして選択してください。
- SWE-Bench Proの差が示すように、実際のレポジトリでの困難なソフトウェアエンジニアリングが仕事である場合。
- 長く、深い単一タスクのセッションを実行し、フリートのスループットよりもタスクあたりの最大能力を重視する場合。
- すでにClaudeのツールチェーンと、そのフォールバックおよびキャッシング動作に投資している場合。
可能な場合は両方を実行してください。これらは成熟したSDKを備えたHTTP APIであり、タスクタイプに応じてルーティングする(オーケストレーション重視のフローにはSol、エンジニアリング重視のフローにはFable 5)のは、2026年には一般的で、珍しいアーキテクチャではありません。
自身のワークロードで両方をテストする
ベンダーのベンチマークによって2つの候補が絞り込まれました。最終的な決定はあなた自身のプロンプトで行うべきであり、これには急いで行うのではなく、午後一杯を費やす価値があります。
両モデルは通常のHTTP経由でアクセス可能です。GPT-5.6はOpenAIのResponses API経由、Fable 5はAnthropicのMessages API経由です。Apidogでは、それぞれをベースURL、認証ヘッダー、モデルIDを変数として独自の環境として保存します。次に、毎週処理するチケット、差分、ツール呼び出しチェーンなど、実際のワークロードから10〜20個のプロンプトを抽出してリクエストコレクションを作成し、各環境でそのセットを実行します。
プロンプトごとに2つの点を比較します。1つ目は、そのワークロードを担当する人が判断する応答の品質です。2つ目は、各応答ボディの使用量フィールドです。なぜなら、トークン数に料金表を掛け合わせることで、タスクあたりの真のコストがわかるからです。ここで、「Solは半額」という仮定が、あなたのデータに対するFable 5のより簡潔またはより長い出力に対して検証されます。もしエージェントが社内ツールを調整する場合、最初にそれらのツールエンドポイントをモックアップして、両モデルが同一で安定した応答に対して計画を立てるようにしてください。1時間の並列検証は、どの発表チャートよりも確かな証拠となります。
よくある質問 (FAQ)
GPT-5.6 SolはClaude Fable 5より優れていますか?
OpenAIの発表数値によると、一部のタスクでは優れています。SolはAgents’ Last Examで約13ポイントリードしていますが、同じチャートではFable 5がSWE-Bench Proで15.7ポイントリードしています。正直なところ、単独の勝者はいません。モデルをタスクに合わせてください。広範なエージェントタスクの実行にはSolが有利であり、深層ソフトウェアエンジニアリングにはFable 5が有利です。
どちらのモデルの方が安価に実行できますか?
Solの料金表はFable 5の公表価格の半額です。100万トークンあたり$5/$30に対し、$10/$50です(予算を立てる前に現在のAnthropicの料金を確認してください)。実際のコストはトークン化、出力長、キャッシングに依存するため、2倍の差を確定と見なす前に、あなた自身のプロンプトで完了したタスクあたりのコストを測定してください。
1つの製品で両方のモデルを使用できますか?
はい、多くのチームがそうしています。どちらも標準的なHTTP APIなので、1つのインターフェースの背後で、オーケストレーション重視のフローはSolに、エンジニアリング重視のフローはFable 5にルーティングできます。Claude Fable 5 APIの使用方法に関するガイドでは、認証とリクエストの形状を含め、Anthropic側の情報を網羅しています。
これらのベンチマーク数値は独自に検証されていますか?
いいえ。この記事のすべての数値は、Fable 5が勝利したSWE-Bench Proの結果を含め、OpenAIの7月9日の発表資料からベンダーが報告したものです。独立した再現は通常、一般提供開始から数週間以内に公開されます。それまでは、すべてを主張として扱い、あなた自身のテストをより重視してください。
重要なのはあなた自身の比較です
分かれた評決は結論であり、言い逃れではありません。OpenAI自身の発表チャートでは、Solがエージェントの広範な能力の王座を、Fable 5がソフトウェアエンジニアリングの王座を手にしていることが示されており、両社は数週間以内に本物の、利用可能なフラッグシップモデルを出荷しました。集計リーダーボードで選択することは、あなたの結果を決定する唯一の変数、つまりあなたのワークロードがどのようなものかを見落とすことになります。
だからテストを実行してください。先週の作業から15個の実際のプロンプトを抽出し、Apidogをダウンロードし、両方のAPIを環境として設定して、あなた自身のデータでタスクあたりの品質とコストを比較してください。最初の独立したベンチマークの再現が公開される前に、あなたは確固たる答えを持つことができるでしょう。
