configファイルにモデルIDがあり、今週は決断を下す必要があります。2026年9月22日、OpenAIはGPT-6 Solを、AnthropicはClaude Opus 5.5を数時間差でリリースしました。それ以来見つけたすべての比較表には穴があり、その穴は見た目よりも大きいです。
その穴とはこれです。OpenAIの発表記事は、SolをClaude Opus 5と比較ベンチマークしていますが、これはその記事が書かれた時点ではClaude Opus 5.5が存在しなかったためです。Anthropicはその後、Opus 5の価格より20%安くOpus 5.5を同日リリースしました。そのため、開発者たちが互いに引用している見出しの主張、つまり「SolはOpusレベルの品質に匹敵するか上回り、タスクあたりのコストははるかに低い」という主張は、測定結果が公開されてから数時間以内に置き換えられたモデルを対象に測定されたものです。
これはOpenAIの数値が間違っているということではありません。特定の点で古くなっているということであり、どれほど古いかを知ることが、適切なルーティングの決定と高価な決定との違いになります。以下に、各ベンダーが公開した情報、2つのベンチマークセットが本当に重なる点、キャッシングが関与した場合の価格差、そして両方を自身のエンドポイントでテストする方法を記します。
2日間での3つのフロンティアモデル発表の全体像については、2026年9月のAIモデル価格戦争をご覧ください。
スペックシート、比較
| GPT-6 Sol | Claude Opus 5.5 | |
|---|---|---|
| APIモデルID | gpt-6-sol |
claude-opus-5-5 |
| 入力(100万トークンあたり) | $2 | $4 |
| 出力(100万トークンあたり) | $10 | $20 |
| キャッシュ済み入力読み取り | 90%割引 | 100万あたり$0.20 |
| キャッシュ書き込み | 公開されている情報には記載なし | 100万あたり$5 |
| コンテキストウィンドウ | 872,000トークン | 1,000,000トークン |
| 最大出力 | 公開されている情報には記載なし | 128,000トークン |
| 人工分析インテリジェンス指数 | 48 | 58、212モデル中1位 |
| 呼び出し可能な場所 | API、ChatGPT Work、Codex | Claude Platform、AWS、Google Cloud、Azure |
この決定の大部分は2つの行にかかっています。
生のトークンで見ると、Solは入力と出力の両方でOpus 5.5のちょうど半分の価格です。およそ半分ではなく、きっかり半分です。これはベンダー間の比較としては異例の明確さで、暗算が簡単になります。
ベンダーの主張ではなく第三者機関のスコアである「人工分析インテリジェンス指数」では、Opus 5.5が58で212モデル中1位にランクされているのに対し、Solは48です。したがって、この対戦の構図はよく知られたものです。リーダーボードのトップには2倍の料金を支払い、問題はあなたのワークロードがその違いを認識するかどうかです。
Solのコンテキストウィンドウは872,000トークンで、Opus 5.5は完全な100万トークンです。ほとんどの作業では、この差は問題になりません。もしモノレポ全体や400エンドポイントのOpenAPIドキュメントと履歴を1回の呼び出しに詰め込む場合は、まず測定してください。なぜなら、失敗のモードは出力の劣化ではなく、ハードな拒否だからです。
可用性も重要です。SolはAPIに加えて、Plus、Pro、Business、Enterprise、Eduアカウント向けのChatGPT WorkとCodexで利用可能になりましたが、まだChatには対応していません。Opus 5.5は初日からClaude Platform、AWS、Google Cloud、Azureで提供されており、これはBedrockまたはVertex経由で既にルーティングしている場合、調達の交渉と設定変更のどちらになるかの違いを生じさせます。
OpenAIが実行できなかった比較
OpenAI自身のタスクあたりのコストの数値は、発表記事の中で最も有用な部分であり、それらはすべてOpus 5を指しています。
| ベンチマーク | GPT-6 Sol | Claude Opus 5 | コスト関係 |
|---|---|---|---|
| AutomationBench 1.0.6 | xhighで33.2%、タスクあたり$0.27 | maxで26.9% | Opus 5はSolのタスクあたりコストの11.1倍 |
| Agents’ Last Exam V1 | maxで56.4% | Solのスコアを下回る | Solはタスクあたりコストが60%低い |
| DeepSWE 1.1 | maxで68.8% | 該当なし | Fable 5のxhigh (69.9%) と1.1pp以内、タスクあたり約80%安い |
| OSWorld 2.0 offline | xhighで60.5% | mediumで60.3% | タスクあたり約80%安い |
AutomationBenchの行をもう一度読んでください。Solは「極高」推論で、Opus 5の「最大」推論を、Opus 5のタスクあたりコストのおよそ9%で打ち負かしました。この数字が議論のすべてを支配しています。
次に、Opus 5.5をその隣に置いてみましょう。AnthropicはOpus 5.5のAutomationBenchの数値を40.0%と発表しました。OpenAIはAutomationBench 1.0.6でOpus 5を26.9%と測定しました。もしこれらが同じバージョンの同じベンチマークであるならば(そしてそれは「もしそうなら」という大きな前提ですが)、Solが6.3ポイント差で上回ったOpusの数値は、Solを6.8ポイント上回るものに置き換えられたことになります。この比較は単に古くなっただけでなく、逆転しました。
この件について議論する際に考慮すべき2つの注意点があります。
- OpenAIはバージョン1.0.6を指定しています。我々が持っているAnthropicの数値にはバージョン文字列がありません。同じ名前のベンチマークでもリリース間で内容が変化することがあり、テストハーネスも研究室によって異なります。26.9から40.0への跳躍は、誰かが両方のモデルを同じハーネスで実行するまでは、あくまで方向性を示すものとして扱ってください。
- OpenAIは依然として、GPT-6 Astraが「総合的に見て最高のモデルであり続けている」と明確に述べています。SolはGPT-6ファミリーのバリューティアであり、その上限ではありません。したがって、Solの比較からOpenAIの最先端に関する結論を導き出すのはカテゴリーエラーです。フロンティア対フロンティアの比較はAstraとOpus 5.5であり、どちらのベンダーもそれを公開していません。
もう一つ、重なる点があります。AnthropicはOSWorld 2.0でOpus 5.5が81.8%と報告している一方、OpenAIはOSWorld 2.0オフラインでSolが60.5%と報告しています。これらは同じスイートの異なるバリアントである可能性があり、21ポイントの差は、異種間の比較の成果物であることが判明する種類の数値です。直接的な比較として引用しないでください。
実際の価格差とは
トークンあたりの差はきっかり2倍です。しかし、実際に支払う差はそうではなく、プロンプトキャッシングがその理由です。
Opus 5.5はキャッシュされた入力を100万トークンあたり$0.20で読み取ります。これはその入力料金$4の5%です。GPT-6はSolと共にキャッシング機能をリリースし、キャッシュされた入力読み取りを90%割引するため、Solのキャッシュ読み取りも100万トークンあたり$0.20となります。エージェントプロンプトの決して変わらない部分である繰り返しプレフィックスにおいては、両モデルのコストは同じです。
具体的なエージェントのワークロードを例にとってみましょう。1回あたり50,000入力トークン、3,000出力トークン、1日あたり1,000回実行し、そのうち45,000入力トークンが安定したプレフィックス(システムプロンプト、ツールスキーマ、OpenAPIドキュメント、規約ファイル)であるとします。
| 1日あたりのコスト | GPT-6 Sol | Claude Opus 5.5 | 比率 |
|---|---|---|---|
| キャッシュヒットなし | $130 | $260 | 2.00倍 |
| プレフィックスキャッシュあり | $49 | $89 | 1.82倍 |
これは公開レートに基づく計算であり、測定結果ではありません。また、Opus 5.5が100万トークンあたり$5を課金し、Solの書き込みレートが公開されていないキャッシュ書き込みは除外されています。方向性は信頼できます。キャッシングに頼るほど、安いモデルの利点は縮小します。なぜなら、割引は両者にとって同じ下限に着地するからです。積極的にキャッシングするユーザーは2倍ではなく1.8倍の差を購入していることになります。
いずれにしても、トークンあたりのコストは間違った単位です。OpenAI自身の内部数値がその理由を説明しています。同社の研究者の半数は、コーディングエージェントに1日あたり$600以上を費やし、上位10%は1日あたり$7,000を費やしています。誰もトークンの価格設定を誤ってこの額に達するわけではありません。彼らは、リトライ、分岐、コンテキストの再読み込みを行うループを実行することで到達するのです。コストが2倍でも、3回ではなく1回で完了するモデルの方が、結果的には安価なモデルとなります。
もう一つ、常に誤引用される価格に関する情報があります。OpenAIはSolとLunaを、GPT-5.6のプロモーション価格より50%安いと説明しています。プロモーションという言葉はOpenAI自身のものです。当時私たちのGPT-5.6価格の内訳で記録したGPT-5.6の定価と比較すると、$2/$10のSolは、見出しが示唆するよりも大きな値下げですが、その見出し自体は割引を基準にしており、定価ではありません。修飾語を付けて引用してください。
レイテンシー:安いモデルは速いモデルではない
人工分析(Artificial Analysis)は、GPT-6 Solの「最大」推論バリアントを、1秒あたり115.2出力トークン、最初のトークンまでの時間102.15秒と測定しました。これは最高の推論設定における第三者機関による測定であり、ベンダーの数値ではなく、低負荷時のSolを代表するものではありません。これを最悪の場合の天井として扱い、典型的な応答時間として扱わないでください。
それでも開発方法を変えることになります。最初のトークンまでに100秒かかるということは、次のことを意味します。
- デフォルトのHTTPクライアントタイムアウトが誤っています。ほとんどのライブラリは30秒または60秒がデフォルトです。
- 呼び出しの手前にあるロードバランサー、APIゲートウェイ、またはサーバーレス関数は、独自のアイドルタイムアウトを持っており、それはおそらくクライアントのタイムアウトよりも短いです。
- ストリーミングはもはや気の利いた機能ではなくなります。それがなければ、リクエストが生きているというシグナルがありません。
- タイムアウト時に発火するリトライロジックは、請求額とレイテンシーを同時に2倍にします。
AnthropicのOpus 5.5に関する比較可能な主張は相対的なものです。Opus 5よりも30%速い出力です。これは比率に関するベンダーの声明であり、秒あたりのトークン数ではないため、人工分析の数値と同じ軸で比較することはできません。両方を自身のワークロードに対して測定する必要があります。
これは通常のAPIテスト作業です。十分な実行回数で同じプロンプトを両方のエンドポイントに送信し、最初のバイトまでの時間と合計時間を記録して分布を確認し、その場でレスポンススキーマをアサートしてください。Apidogでは、両方の呼び出しを1つのプロジェクトにまとめ、テストシナリオとして実行し、レイテンシー履歴をスクラッチファイルではなくアサーションの隣に保持できます。
2つのリクエストの形式は、重要であるほど十分に異なります。
# Anthropic
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-opus-5-5",
"max_tokens": 1024,
"stream": true,
"messages": [{"role": "user", "content": "このOpenAPIパスを要約してください。"}]
}'
# OpenAI
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "content-type: application/json" \
-d '{
"model": "gpt-6-sol",
"stream": true,
"input": "このOpenAPIパスを要約してください。"
}'
認証ヘッダー、ボディキー、ストリーミングイベントの形式が異なります。これらを切り替えるために書く抽象化レイヤーは、今やあなたが所有するコードとなり、どちらかのベンダーが新しいフィールドを出荷したときに最初に壊れるでしょう。
選び方
| あなたのワークロードが | 傾けるべき選択肢 | 理由 |
|---|---|---|
| 大量、安定したプレフィックス、リトライを許容できる場合 | GPT-6 Sol | トークン価格が半分で、キャッシングによりコストを低く抑えられる |
| 失敗が高コストになるような長時間の自律実行の場合 | Claude Opus 5.5 | 第三者機関のインテリジェンス指数とAnthropic自身のAutomationBenchの数値で上位 |
| コンテキストサイズが872kトークンを超える制約がある場合 | Claude Opus 5.5 | 完全な100万トークンウィンドウ |
| すでにBedrock、Vertex、またはAzure経由でルーティングされている場合 | Claude Opus 5.5 | 初日からこれらすべてで提供されたため |
| CodexまたはChatGPT Work内で運用する場合 | GPT-6 Sol | まず最初にそこで利用可能になったため |
| 未定の場合 | ルーターの背後で両方 | 1.8倍のキャッシュされた差は、忠誠心ではなくタスクごとにルーティングするのに十分小さい |
ほとんどのチームにとって、最後の行が正直な答えです。1.8倍のキャッシュされた価格差では、ルーティングはどちらのベンダーのマーケティングよりも早く元が取れます。大量で明確な作業はSolに、長く曖昧で、失敗すると高コストになる作業はOpus 5.5に送ってください。完了したタスクあたりのコストを測定し、1ヶ月後に再評価し、どちらの発表記事からベンチマーク表をコピーして最新のものとして扱わないでください。そのうちの1つは、同日午後に置き換えられたモデルと比較しています。
