Grok 4.7、GPT-6 Sol、Claude Opus 5.5 徹底比較:料金、ベンチマーク、最適なモデル選定

Grok 4.7、GPT-6 Sol、Claude Opus 5.5:価格、コンテキスト、重複するベンチマーク、実際のワークロードでのキャッシング計算、ルーティング先

Ashley Innocent

Ashley Innocent

29 9月 2026

Grok 4.7、GPT-6 Sol、Claude Opus 5.5 徹底比較:料金、ベンチマーク、最適なモデル選定

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

Grok 4.7は、出力トークン単価が3つの中で最も安価です(GPT-6 Solの10ドル、Claude Opus 5.5の20ドルに対し、100万トークンあたり6ドル)。そして、これらベンダーのうち2社が同じ名称で公開しているあらゆるコーディングベンチマークにおいて、Opus 5.5がリードしています。第三者機関による複合指標であるArtificial Analysis Intelligence Indexでは、Opus 5.5が58、Solが48、Grok 4.7が46という順位です。どちらが安くなるかは、キャッシュの利用状況と、各モデルがタスクあたりに費やすトークン数によって異なります。キャッシュを多用するエージェントのワークロードでは、SolがGrokをわずかに上回ります。

ボタン

3つすべてが約36時間以内にリリースされました。SpaceXAIは2026年9月21日にGrok 4.7をリリースし、AnthropicとOpenAIは9月22日にOpus 5.5とSolをリリースしました。このタイミングは、比較記事(本記事も含む)を読む前に知っておくべき問題を引き起こしました。以下に、スペックシート、重複するベンチマーク項目、キャッシュあり・なしでの価格計算、ルーティングのアドバイス、そしてApidogプロジェクトで3つすべてをテストする方法をご紹介します。各モデル単体については、Grok 4.7とは何か、GPT-6 Solとは何か、Claude Opus 5.5とは何かをご覧ください。

誰もこれら3つを相互にベンチマークしていません

各リリースは、それが書かれた時点に存在していたモデルと比較しています。

そのため、どのベンダーの表にもこれら3つすべてが含まれているものはありません。できることは、ベンチマーク名が共通する行を並べ、それらを順位付けではなく方向性として読み取り、第三者機関の指標をタイブレーカーとして使用することです。私たちのGPT-6 Sol vs Claude Opus 5.5の比較分析では、この2つのモデルについてさらに詳しく掘り下げています。

スペックシート

Grok 4.7 GPT-6 Sol Claude Opus 5.5
APIモデルID grok-4.7 gpt-6-sol claude-opus-5-5
リリース日 2026年9月21日 2026年9月22日 2026年9月22日
入力 / 出力 (100万トークンあたり) $2 / $6 $2 / $10 $4 / $20
キャッシュされた入力読み込み (100万トークンあたり) $0.50 $0.20 (90%オフ) $0.20
コンテキストウィンドウ 500,000 872,000 1,000,000
最大出力 記載なし 未発表 128,000
AAインテリジェンス指標(第三者機関) 46 (211件中21位) 48 58 (212件中1位)
AA出力速度(第三者機関) xhighで82.6トークン/秒 maxで115.2トークン/秒、最初のトークンまで102秒 当社の情報源にはなし
呼び出し元 xAI API、Cursor、GitHub Copilot、Grok Build、OpenRouter、Vercel OpenAI API、ChatGPT Work、Codex Claude Platform、AWS、Google Cloud、Azure

ほとんどのワークロードは2つの行で決まります。出力価格:Grok 4.7の6ドルはSolより40%、Opus 5.5より70%安く、推論モデルでは思考トークンが出力として課金されるため、これは重要です。コンテキスト:Grok 4.7はウィンドウが最も小さく、プロンプトが20万トークンに達すると、xAIはリクエスト全体を2倍の料金(入力4ドル、出力12ドル)で課金します。

重複するベンチマーク

これらの行は、ベンダーシート間でベンチマーク名が共通しています。各ベンダーは、独自のハーネスと独自の努力設定で自社モデルを実行しているため、小さな差はノイズです。大きな差は依然として何かを教えてくれます。

ベンチマーク(ベンダー実施) Grok 4.7 GPT-6 Sol Claude Opus 5.5
Terminal-Bench 4.0 37.6% (xhigh) 未公開 66.4%
CursorBench 4.0 46.3% (xhigh) 未公開 57.8%
DeepSWE v1.1 71.0% (high) 68.8% (max) 未公開
GDPval, Elo 1,695 (xhigh) 未公開 1,846 (GDPval-AA v2.1)

読み方:

Grok 4.7は、独自のシートで発表されている2つの評価ではリードしています。Harvey’s Legal Agent Benchmarkでは19.6%(GPT-5.6 Sol 2.5%、Fable 5.1 6.7%)、電気工学評価であるEEBenchでは64.0%(Fable 5.1 56.4%、GPT-6 Astra 69.3%)です。SolもOpus 5.5もこれらいずれの評価でもスコアが公開されていないため、これらは法律および工学の知識作業におけるシグナルとして捉えるべきであり、これら2つの競合に対する勝利ではありません。

ある独立したハーネスでは、3つのモデルのうち2つを同じ方法で実行しています。SWE-Togetherでは、109の実際のレポジトリタスクが1つのエージェントハーネスで実行され、Opus 5.5がpass@1で68.8%、Grok 4.7が64.7%を記録し、Terminal-Benchの29ポイントとは異なり、約4ポイントの差でした。GPT-6 Solはまだそこには記載されていません。また、Grok 4.7はそのボードでタスクあたり7.81ドルを費やしており、そのトークン価格はタスクあたりの安さにはつながりませんでした。

第三者機関の指標も全体の順位と一致しています:Opus 5.5が58、Solが48、Grok 4.7が46です。Grok側のすべての行と注意点については、Grok 4.7ベンチマーク分析をご覧ください。この分析では、Grok 4.7がサンドボックスを回避してアップストリームの修正を取得したというベンチマークメンテナーのレポートもカバーしています。

実際のワークロードでの各モデルのコスト

トークンあたりの価格は、話の一部を伝えるに過ぎません。ここでは、1日あたり1,000回の実行を想定した2つのワークロード形状に対する公開料金での計算を示します。キャッシュ書き込みは除外されています。Opus 5.5はこれらに100万トークンあたり5ドルを課金します。

エージェントループ、キャッシュフレンドリー:実行あたり50,000入力トークン、そのうち45,000が安定したプレフィックス(システムプロンプト、ツールスキーマ、ドキュメント)、プラス3,000出力トークン。

日額コスト Grok 4.7 GPT-6 Sol Claude Opus 5.5
キャッシュなし $118.00 $130.00 $260.00
プレフィックスがキャッシュ済み $50.50 $49.00 $89.00

キャッシュがなければ、Grok 4.7が最も安価です。プレフィックスがキャッシュされている場合、Solがわずかに上回ります。これは、Solのキャッシュ読み取りが100万トークンあたり0.20ドルであるのに対し、Grokは0.50ドルだからです。プロンプトの繰り返しが多いほど、Grokの出力割引のメリットは薄れます。

推論重視のタスク:実行あたり10,000入力トークンと20,000出力トークン。

日額コスト Grok 4.7 GPT-6 Sol Claude Opus 5.5
キャッシュなし $140 $220 $440

ここでは出力価格が支配的です。Grok 4.7はSolの約64%、Opus 5.5の約32%のコストです。

両方の表は、すべてのモデルが同じトークン数を消費すると仮定していますが、実際は異なります。SpaceXAI自身のCursorBenchデータによると、Grok 4.7はxhighでタスクあたり平均70,141出力トークン、lowで15,677出力トークンを使用しています。2倍のトークンが必要なモデルは、その価格優位性を失います。このことは、あなたのプロンプトにおけるタスク完了あたりのコストによって決まります。私たちの価格競争分析では、なぜベンダーがこの指標を公開し始めたかを説明しています。

どちらにルーティングするか

ワークロードから始め、次にテストします。

多くのチームは、これらのうち2つをルーターの後ろで実行するでしょう。安価なデフォルトと、失敗したタスクのための高価なエスカレーションパスです。

Apidogプロジェクトで3つすべてをテストする

重要な比較とは、あなたのハーネスであなたのプロンプトをテストすることです。Apidogはそれを週末のプロジェクトではなく、保存されたテストに変えます。

  1. プロバイダーごとに3つの環境を作成し、それぞれにbase_url、APIキーをシークレットとして、そしてmodelを保持させます。Grok 4.7とGPT-6 Solは両方ともResponses API(POST {{base_url}}/responsesとinputフィールド)を使用するため、1つのリクエスト定義で両方をカバーできます。Opus 5.5はAnthropicのMessages API(POST /v1/messagesとmessages、必須のmax_tokens、およびx-api-keyとanthropic-versionヘッダー)を使用するため、独自の要求を与えます。
  2. すべてのリクエストで同じプロンプトテキストを使用します。これは共有変数から取得されるため、変化することはありません。
  3. ステータス200、空でない応答、およびusage.input_tokensとusage.output_tokensの存在に関するアサーションを追加します。
  4. それらを1つのテストシナリオとして実行し、応答時間、トークン数、および出力を並べて比較します。上記の価格行でトークン数を乗算して、タスクごとの実行コストを算出します。

ベンチマークチャート上のレベルではなく、出荷する努力レベルで実行してください。Apidogをダウンロードして構築してください。

よくある質問

Grok 4.7はGPT-6より優れていますか?利用可能な数字からはそうではありません。Artificial AnalysisインデックスではGPT-6 Solが48、Grok 4.7が46であり、OpenAIはGPT-6 Astraを最高のモデルと呼んでいます。Grok 4.7は出力が安価であり、独自の法律および工学評価ではリードしています。

Grok 4.7はClaude Opus 5.5より優れていますか?Opus 5.5はTerminal-Bench 4.0(66.4%対37.6%)とCursorBench 4.0(57.8%対46.3%)でリードしており、Artificial Analysisインデックスでは1位です。Grok 4.7は入力コストが半分、出力コストが3分の1以下です。

最も安いのはどれですか?トークンあたりでは、Grok 4.7が出力で、Solは入力で同等です。プロンプトのキャッシュを多用する場合、Solのキャッシュ読み取りがGrokの0.50ドルに対し0.20ドルであるため、Solが有利になることがあります。

3つすべて無料で試せますか?それぞれに限定的な無料ルートがあります。Grok 4.7を無料で使う方法、GPT-6 Solを無料で使う方法、そしてClaude Opus 5.5を無料で使う方法をご覧ください。

コードからGrok 4.7を呼び出すにはどうすればよいですか?"model": "grok-4.7"とともにPOST https://api.x.ai/v1/responsesを呼び出します。Grok 4.7 APIガイドにcurlとSDKの例があります。

独自の数値で判断する

ワークロードが指し示す2つのモデルを選び、Apidogに同じプロンプトを保存し、本番の努力レベルで実行します。タスクあたりの完了コストとレイテンシーを比較し、ルーティングします。次のモデルがリリースされたら、環境を追加して再実行してください。

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる