Grok 4.7は、出力トークン単価が3つの中で最も安価です(GPT-6 Solの10ドル、Claude Opus 5.5の20ドルに対し、100万トークンあたり6ドル)。そして、これらベンダーのうち2社が同じ名称で公開しているあらゆるコーディングベンチマークにおいて、Opus 5.5がリードしています。第三者機関による複合指標であるArtificial Analysis Intelligence Indexでは、Opus 5.5が58、Solが48、Grok 4.7が46という順位です。どちらが安くなるかは、キャッシュの利用状況と、各モデルがタスクあたりに費やすトークン数によって異なります。キャッシュを多用するエージェントのワークロードでは、SolがGrokをわずかに上回ります。
3つすべてが約36時間以内にリリースされました。SpaceXAIは2026年9月21日にGrok 4.7をリリースし、AnthropicとOpenAIは9月22日にOpus 5.5とSolをリリースしました。このタイミングは、比較記事(本記事も含む)を読む前に知っておくべき問題を引き起こしました。以下に、スペックシート、重複するベンチマーク項目、キャッシュあり・なしでの価格計算、ルーティングのアドバイス、そしてApidogプロジェクトで3つすべてをテストする方法をご紹介します。各モデル単体については、Grok 4.7とは何か、GPT-6 Solとは何か、Claude Opus 5.5とは何かをご覧ください。
誰もこれら3つを相互にベンチマークしていません
各リリースは、それが書かれた時点に存在していたモデルと比較しています。
- SpaceXAIのGrok 4.7に関する投稿は、Grok 4.6、GPT-5.6 Sol、Claude Fable 5.1、さらに2つのグラフでGPT-6 Astraと比較しています。名前に注意してください。GPT-5.6 Solは前世代であり、そのページでは4ドル/20ドルと記載されており、翌日リリースされたGPT-6 Solではありません。
- OpenAIのSolのローンチは、数時間後にOpus 5.5に置き換えられたClaude Opus 5と比較しています。
- AnthropicのOpus 5.5のローンチは、競合モデルとの比較列なしでスコアを公開しています。
そのため、どのベンダーの表にもこれら3つすべてが含まれているものはありません。できることは、ベンチマーク名が共通する行を並べ、それらを順位付けではなく方向性として読み取り、第三者機関の指標をタイブレーカーとして使用することです。私たちのGPT-6 Sol vs Claude Opus 5.5の比較分析では、この2つのモデルについてさらに詳しく掘り下げています。
スペックシート
| Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 | |
|---|---|---|---|
| APIモデルID | grok-4.7 |
gpt-6-sol |
claude-opus-5-5 |
| リリース日 | 2026年9月21日 | 2026年9月22日 | 2026年9月22日 |
| 入力 / 出力 (100万トークンあたり) | $2 / $6 | $2 / $10 | $4 / $20 |
| キャッシュされた入力読み込み (100万トークンあたり) | $0.50 | $0.20 (90%オフ) | $0.20 |
| コンテキストウィンドウ | 500,000 | 872,000 | 1,000,000 |
| 最大出力 | 記載なし | 未発表 | 128,000 |
| AAインテリジェンス指標(第三者機関) | 46 (211件中21位) | 48 | 58 (212件中1位) |
| AA出力速度(第三者機関) | xhighで82.6トークン/秒 | maxで115.2トークン/秒、最初のトークンまで102秒 | 当社の情報源にはなし |
| 呼び出し元 | xAI API、Cursor、GitHub Copilot、Grok Build、OpenRouter、Vercel | OpenAI API、ChatGPT Work、Codex | Claude Platform、AWS、Google Cloud、Azure |
ほとんどのワークロードは2つの行で決まります。出力価格:Grok 4.7の6ドルはSolより40%、Opus 5.5より70%安く、推論モデルでは思考トークンが出力として課金されるため、これは重要です。コンテキスト:Grok 4.7はウィンドウが最も小さく、プロンプトが20万トークンに達すると、xAIはリクエスト全体を2倍の料金(入力4ドル、出力12ドル)で課金します。
重複するベンチマーク
これらの行は、ベンダーシート間でベンチマーク名が共通しています。各ベンダーは、独自のハーネスと独自の努力設定で自社モデルを実行しているため、小さな差はノイズです。大きな差は依然として何かを教えてくれます。
| ベンチマーク(ベンダー実施) | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 37.6% (xhigh) | 未公開 | 66.4% |
| CursorBench 4.0 | 46.3% (xhigh) | 未公開 | 57.8% |
| DeepSWE v1.1 | 71.0% (high) | 68.8% (max) | 未公開 |
| GDPval, Elo | 1,695 (xhigh) | 未公開 | 1,846 (GDPval-AA v2.1) |
読み方:
- ターミナル作業ではOpus 5.5が大幅に優位です。Terminal-Bench 4.0での28.8ポイントの差は、ハーネスの違いだけでは説明できないほど大きいです。Grok 4.7の37.6%はGrok 4.6の20.3%から大幅に向上していますが、それでもまだ大きく後れを取っています。
- CursorBenchも同様の傾向を示しており、11.5ポイントの差があります。
- DeepSWEは互角です。Grok 4.7(高努力)とSol(最大努力)は2.2ポイントの差で、異なるハーネスが生み出す誤差の範囲内です。
- GDPvalのバージョンが異なる可能性があります。Grokのグラフにはバージョンが記載されていないため、151ポイントの差はあくまで目安として扱ってください。
Grok 4.7は、独自のシートで発表されている2つの評価ではリードしています。Harvey’s Legal Agent Benchmarkでは19.6%(GPT-5.6 Sol 2.5%、Fable 5.1 6.7%)、電気工学評価であるEEBenchでは64.0%(Fable 5.1 56.4%、GPT-6 Astra 69.3%)です。SolもOpus 5.5もこれらいずれの評価でもスコアが公開されていないため、これらは法律および工学の知識作業におけるシグナルとして捉えるべきであり、これら2つの競合に対する勝利ではありません。
ある独立したハーネスでは、3つのモデルのうち2つを同じ方法で実行しています。SWE-Togetherでは、109の実際のレポジトリタスクが1つのエージェントハーネスで実行され、Opus 5.5がpass@1で68.8%、Grok 4.7が64.7%を記録し、Terminal-Benchの29ポイントとは異なり、約4ポイントの差でした。GPT-6 Solはまだそこには記載されていません。また、Grok 4.7はそのボードでタスクあたり7.81ドルを費やしており、そのトークン価格はタスクあたりの安さにはつながりませんでした。
第三者機関の指標も全体の順位と一致しています:Opus 5.5が58、Solが48、Grok 4.7が46です。Grok側のすべての行と注意点については、Grok 4.7ベンチマーク分析をご覧ください。この分析では、Grok 4.7がサンドボックスを回避してアップストリームの修正を取得したというベンチマークメンテナーのレポートもカバーしています。
実際のワークロードでの各モデルのコスト
トークンあたりの価格は、話の一部を伝えるに過ぎません。ここでは、1日あたり1,000回の実行を想定した2つのワークロード形状に対する公開料金での計算を示します。キャッシュ書き込みは除外されています。Opus 5.5はこれらに100万トークンあたり5ドルを課金します。
エージェントループ、キャッシュフレンドリー:実行あたり50,000入力トークン、そのうち45,000が安定したプレフィックス(システムプロンプト、ツールスキーマ、ドキュメント)、プラス3,000出力トークン。
| 日額コスト | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| キャッシュなし | $118.00 | $130.00 | $260.00 |
| プレフィックスがキャッシュ済み | $50.50 | $49.00 | $89.00 |
キャッシュがなければ、Grok 4.7が最も安価です。プレフィックスがキャッシュされている場合、Solがわずかに上回ります。これは、Solのキャッシュ読み取りが100万トークンあたり0.20ドルであるのに対し、Grokは0.50ドルだからです。プロンプトの繰り返しが多いほど、Grokの出力割引のメリットは薄れます。
推論重視のタスク:実行あたり10,000入力トークンと20,000出力トークン。
| 日額コスト | Grok 4.7 | GPT-6 Sol | Claude Opus 5.5 |
|---|---|---|---|
| キャッシュなし | $140 | $220 | $440 |
ここでは出力価格が支配的です。Grok 4.7はSolの約64%、Opus 5.5の約32%のコストです。
両方の表は、すべてのモデルが同じトークン数を消費すると仮定していますが、実際は異なります。SpaceXAI自身のCursorBenchデータによると、Grok 4.7はxhighでタスクあたり平均70,141出力トークン、lowで15,677出力トークンを使用しています。2倍のトークンが必要なモデルは、その価格優位性を失います。このことは、あなたのプロンプトにおけるタスク完了あたりのコストによって決まります。私たちの価格競争分析では、なぜベンダーがこの指標を公開し始めたかを説明しています。
どちらにルーティングするか
ワークロードから始め、次にテストします。
- Grok 4.7は、出力が多いエージェントループ、予算重視の推論、法律および工学の知識作業、そしてCursor、GitHub Copilot、またはGrok Buildをすでに使用しているチームに適しており、モデルピッカーを切り替えるだけで利用できます。プロンプトは20万トークン未満に保ってください。
- Claude Opus 5.5は、その優位性が最も大きい最も難しいコーディングおよびターミナルタスク、および100万トークンのウィンドウまたは128,000トークンの出力が必要なあらゆるものに適しています。また、初日からAWS、Google Cloud、Azureで動作するため、調達が重要な場合に役立ちます。
- GPT-6 Solは、キャッシュを多用するエージェントと自動化、および20万から872,000トークンのプロンプトに適しています。Artificial Analysisが最大努力で測定した最初のトークンまでの102秒の時間を考慮した予算を立ててください。私たちのSolレイテンシーガイドではタイムアウトについて説明しています。
- GPT-6 Lunaは、0.10ドル/0.50ドルで、上記の3つがいずれも費用対効果が高くない大量の抽出および分類において検討対象となります。
多くのチームは、これらのうち2つをルーターの後ろで実行するでしょう。安価なデフォルトと、失敗したタスクのための高価なエスカレーションパスです。
Apidogプロジェクトで3つすべてをテストする
重要な比較とは、あなたのハーネスであなたのプロンプトをテストすることです。Apidogはそれを週末のプロジェクトではなく、保存されたテストに変えます。
- プロバイダーごとに3つの環境を作成し、それぞれに
base_url、APIキーをシークレットとして、そしてmodelを保持させます。Grok 4.7とGPT-6 Solは両方ともResponses API(POST {{base_url}}/responsesとinputフィールド)を使用するため、1つのリクエスト定義で両方をカバーできます。Opus 5.5はAnthropicのMessages API(POST /v1/messagesとmessages、必須のmax_tokens、およびx-api-keyとanthropic-versionヘッダー)を使用するため、独自の要求を与えます。 - すべてのリクエストで同じプロンプトテキストを使用します。これは共有変数から取得されるため、変化することはありません。
- ステータス200、空でない応答、および
usage.input_tokensとusage.output_tokensの存在に関するアサーションを追加します。 - それらを1つのテストシナリオとして実行し、応答時間、トークン数、および出力を並べて比較します。上記の価格行でトークン数を乗算して、タスクごとの実行コストを算出します。
ベンチマークチャート上のレベルではなく、出荷する努力レベルで実行してください。Apidogをダウンロードして構築してください。
よくある質問
Grok 4.7はGPT-6より優れていますか?利用可能な数字からはそうではありません。Artificial AnalysisインデックスではGPT-6 Solが48、Grok 4.7が46であり、OpenAIはGPT-6 Astraを最高のモデルと呼んでいます。Grok 4.7は出力が安価であり、独自の法律および工学評価ではリードしています。
Grok 4.7はClaude Opus 5.5より優れていますか?Opus 5.5はTerminal-Bench 4.0(66.4%対37.6%)とCursorBench 4.0(57.8%対46.3%)でリードしており、Artificial Analysisインデックスでは1位です。Grok 4.7は入力コストが半分、出力コストが3分の1以下です。
最も安いのはどれですか?トークンあたりでは、Grok 4.7が出力で、Solは入力で同等です。プロンプトのキャッシュを多用する場合、Solのキャッシュ読み取りがGrokの0.50ドルに対し0.20ドルであるため、Solが有利になることがあります。
3つすべて無料で試せますか?それぞれに限定的な無料ルートがあります。Grok 4.7を無料で使う方法、GPT-6 Solを無料で使う方法、そしてClaude Opus 5.5を無料で使う方法をご覧ください。
コードからGrok 4.7を呼び出すにはどうすればよいですか?"model": "grok-4.7"とともにPOST https://api.x.ai/v1/responsesを呼び出します。Grok 4.7 APIガイドにcurlとSDKの例があります。
独自の数値で判断する
ワークロードが指し示す2つのモデルを選び、Apidogに同じプロンプトを保存し、本番の努力レベルで実行します。タスクあたりの完了コストとレイテンシーを比較し、ルーティングします。次のモデルがリリースされたら、環境を追加して再実行してください。
