Gemini 4 Argonは、GPT-6 Astra、Claude Opus 5.5、Claude Fable 5.1に対して、Googleのベンチマークテーブルの19行中13行でトップを飾っています。しかし、どのスコアよりも重要な事実が1つあります。それは、AstraとOpus 5.5は今日購入できますが、Argonは購入できないということです。Googleの新しいフロンティアモデルは、現在、Fairwindプログラムの参加者のみが利用可能で、導入期間中は100万トークンあたり$2/$10、その後は$4/$20です。これは、Opus 5.5と全く同じ費用です。
この比較では、価格と制限の面で4つのモデルを並べ、ベンチマーク行をどのモデルが優位かによってグループ化し、数字が単純に比較できない理由を説明し、ルーティングガイドと、Apidogで独自のプロンプトを使って3つのモデルすべてをテストする方法で締めくくります。Argonは初めてですか?まずGemini 4 Argonとは何かから始めましょう。タイミングについては、Argonリリース日ガイドをご覧ください。
button
価格と制限の比較
GoogleのテーブルにはClaude Fable 5.1も含まれているため、このモデルも欄が設けられています。価格は100万トークンあたりで、各ベンダーのページから引用しています。Googleのローンチ投稿、OpenAIのGPT-6 Astraモデルページ、Anthropicの価格ページです。
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| 今日利用可能か? | Fairwindのみ | はい | はい | はい |
| APIモデルID | 未公開 | gpt-6-astra |
claude-opus-5-5 |
claude-fable-5-1 |
| 入力 | $2 導入時、その後 $4 | $10 | $4 | $10 |
| キャッシュ済み入力 | $0.10 導入時、その後 $0.20 | $1 | $0.20 | $0.25 |
| 出力 | $10 導入時、その後 $20 | $50 | $20 | $50 |
| 最大出力 | 1M (Googleの公称制限) | 128K | 128K (Batchでは300K、ベータ版) | 128K |
| コンテキストウィンドウ | 未公開 | 1,050,000 (最大入力 922K) | 1M | 1M |
| 長文プロンプトの追加料金 | 記載なし | 272K以上の入力:入力とキャッシュが2倍、出力が1.5倍(全体のリクエストに適用) | なし | なし |
3つの点が際立っています。Argonの標準価格は、入力、キャッシュ済み入力、出力においてOpus 5.5と一致するため、Anthropicに対する価格優位性は導入期間中のみであり、Googleはその期間を明らかにしていません。AstraとFable 5.1は、Argonの標準入力および出力レートの2.5倍、導入レートの5倍に設定されています。そして、1Mの出力値はGoogleのものです。Vals AIは、テストしたArgon構成の最大出力を262Kと記載しています。リクエストあたりのコスト計算については、Gemini 4 Argonの価格設定をご覧ください。
Googleのテーブルで各モデルがリードするベンチマーク
数字を見る前に:これはGoogleのテーブルです。ArgonのスコアはGoogleが報告したもので、一部は自己計算、一部はリーダーボードからのものです。競合モデルのスコアは、ほとんどが各ベンダー自身の数値、または可能な場合は最大推論設定での公開リーダーボードの結果です。ハーネスが異なるため、わずかな差はノイズとして読んでください。
| 優位モデル | ベンチマーク | Argon | Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Argon: 知識労働 | Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| Argon: 知識労働 | AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| Argon: 知識労働 | Harvey’s Legal Agent Benchmark | 19.6% | 5.4% | 6.7% | 3.8% |
| Argon: コーディング | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| Argon: 長いコンテキスト | GraphWalks 256K to 1M (F1) | 84.2% | 71.8% | 65.0% | 66.8% |
| Argon: マルチモーダル | LVBench | 91.7% | 87.5% | 79.7% | 83.7% |
| Argon: マルチモーダル | Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
| Astra | FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| Astra | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| Astra | OSWorld-2.0 (オフライン、部分) | 69.2% | 72.6% | 未報告 | 未報告 |
| Opus 5.5 | Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| Opus 5.5 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| 引き分け | CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
Argonの他の完全な勝利は、Vals Finance Agent v2、Vibe Code Bench、LABBench 2、RiemannBench、GraphWalks up to 128K、Agent’s Last Examです。Fable 5.1はどの行でもリードしていません。CWE-bench v1では、DeepMindのサイバーリーダーボードによると、Argon、Astra、Grok 4.7の3つが68%で同率トップ、Opus 5.5が67%となっています。
Gemini 4 Argon対Fable 5.1の比較では、両方が数値を報告している17行のうち15行でArgonがより高いスコアを出しています。Fableが優位に立つのは、FrontierSWE v2 (56.3%対55.0%) とTerminal-bench 4.0 (57.9%対57.4%) のみです。Anthropic自身の数値は、弊社のClaude Fable 5.1ベンチマークの投稿にあり、全19行のテーブルはGemini 4 Argonベンチマークに掲載されています。
差異を鵜呑みにする前に考慮すべき3つの注意点
競合の数値はGoogleの実行結果ではありません。Googleの方法論によると、Gemini以外のモデルの結果は「特に明記されていない限り、プロバイダーが自己申告した数値から引用されている」とされており、いくつかの行はVals AI、Proximal、Surgeによって運営されている公開リーダーボードからのものです。
ハーネスが異なります。DeepSWE v1.1では、Googleはミニswe-agentハーネスを使用してArgonの77.9%を自己計算しましたが、Astraのスコアは公開リーダーボードから、Anthropicのスコアはシステムカードから来ています。LVBenchでは、Geminiは1秒あたり1フレームでビデオをサンプリングしましたが、Astraは800フレーム、Opus 5.5は600フレーム、Fable 5.1は300フレームを「APIの制限により」取得しました。
同じモデルでもチャートによってスコアが異なります。Opus 5.5のTerminal-bench 4.0の数値は、ハーネスと努力設定によってチャート間で異なります。Anthropicは、xhigh努力での66.4%を報告しています。したがって、複数の情報源を一つのテーブルで混在させないでください。
第三者評価者の見解
独立したリーダーボードは、その差を縮めます。Artificial Analysisでは、Argonは223モデル中8位にランクされていますが、このリストでは各推論設定が個別にカウントされています。個別のモデルで見ると、Argon (53) はGPT-6 AstraおよびClaude Fable 5.1と同点で、Claude Opus 5.5 (最大で58) およびClaude Sonnet 5.5 (56) に次いでいます。AAはまた、AA-OmniscienceでのArgonの幻覚発生率を15%と記載しており、Astraの最大設定では51%でした。
Arenaでは、ArgonはTextで1525点を獲得し1位にランクされており、4,942票で予備評価されています。Opus 5.5は4位です。Vals AIは、Vals Indexで41モデル中1位にランクしており、Geminiモデルでトップに立ったのは初めてです。
Google社内でも全員が納得しているわけではありません。Bloombergの報道によると、アクセス権を持つ一部の従業員は、Argonがベンチマークと比較して一部のコーディングやフロントエンド設計作業において期待外れであると述べており、Googleはこの特徴付けが不正確であるとしています。
どちらにルーティングするか
2026年現在、唯一の最高のフロンティアモデルというものはありません。タスクごとにルーティングし、Argonがリリースされる日に備えてArgonの列を残しておきましょう。
| タスク | 今日のルーティング先 | Argon出荷時 |
|---|---|---|
| 法律、金融、オフィス自動化エージェント | Opus 5.5 (67.0% Vals Index) | Argonをテスト: 知識労働の4項目すべてでリード |
| ターミナルを多用するコーディングエージェント | Opus 5.5 (66.4% Terminal-bench 4.0) | Opus 5.5が引き続きリード |
| エージェント型ソフトウェアエンジニアリング | Astra (65.5% FrontierSWE v2) または Opus 5.5 | ArgonはDeepSWEをリードするがFrontierSWEでは劣る。両方をテスト |
| コンピュータ利用とGUIエージェント | Astra (72.6% OSWorld-2.0) | AstraがOSWorldをリード。ArgonはAgent’s Last Examをリード |
| 256K+トークンプロンプトでの推論 | Opus 5.5 (追加料金なし) または Astra (272K以上で追加料金) | Argon (84.2% GraphWalks 256K to 1M) |
| ビデオとチャートの理解 | Astra (87.5% LVBench) | Argon (91.7%)、ただしフレーム数に注意 |
| 科学とMLエンジニアリング | Astra (Terminal-Bench Science), Opus 5.5 (PostTrainBench) | ArgonはLABBench 2とRiemannBenchをリード。テストを推奨 |
| 128Kトークンを超える単一応答 | Batch上のOpus 5.5 (300K、ベータ版) | Argon、Googleの公称1Mまで |
| 大量処理、コスト重視の作業 | Opus 5.5 ($4/$20) | 導入期間中はArgonが$2/$10 |
価格が最高スコアよりも重要である場合、弊社のGPT-6 Sol vs Claude Opus 5.5の比較では、OpenAIのより安価なSolラインとOpusを比較しています。
独自のプロンプトで3つのモデルすべてを比較する
ベンダーのテーブルだけでは、各モデルがあなたのプロンプトをどのように処理するかはわかりません。Apidogでの小さな評価でそれを今日から構築できます。
- 3つのリクエストを持つ1つのプロジェクトを作成します:GPT-6 Astra、Claude Opus 5.5、そしてモデルフィールドが
{{GEMINI_MODEL}}と読み込まれ、GoogleがArgonのIDを公開するまでgemini-3.8-flashに設定されているGeminiリクエストです。弊社のGPT-6 Astra APIガイドとClaude Opus 5.5とは何かでは、各ベンダーのリクエスト形式をカバーしています。 - 各ベンダーのAPIキーを環境変数として保存し、プロンプトを1つの共有変数に置くことで、3つのリクエストすべてが同一の入力を受け取ることができます。
- アサーションを追加します:ステータス200、空でない回答、出力トークンが上限以下であること、そして各ベンダーの公開レートで予算内の計算コストであること。
- これら3つを1つのテストシナリオとして実行し、テストレポートで各リクエストの結果を比較します。
コストアサーションは単純な算術です。20,000入力トークンと4,000出力トークンのリクエストの場合、Astraのコストは20,000 x $10/1M + 4,000 x $50/1M = $0.20 + $0.20 = $0.40です。Opus 5.5のコストは$0.08 + $0.08 = $0.16です。Argonは導入レートでは$0.08、標準レートでは$0.16かかるでしょう。ただし、トークンあたりの価格はタスクあたりのコストではありません。Artificial Analysisは、Argonのタスクあたり約62Kの出力トークンに対し、Astraは最大努力で約27Kと測定しています。そのため、独自のプロンプトで出力トークンを測定してください。
Argonが出荷されたら、GEMINI_MODELを変更し、シナリオを再実行するだけで、現在購入できる2つのモデルとの同一プロンプト比較が可能になります。
FAQ
Gemini 4 ArgonはGPT-6 Astraより優れていますか? Artificial Analysisでは53点で同点です。GoogleのテーブルではArgonがほとんどの項目で高いスコアを出していますが、AstraはFrontierSWE v2、Terminal-Bench Science 0.1、OSWorld-2.0で勝利しており、Astraは今日利用できるモデルです。
Gemini 4 ArgonとClaude Opus 5.5:どちらが優れていますか? GoogleのテーブルではArgonがほとんどの項目で優位ですが、Opus 5.5はTerminal-bench 4.0とPostTrainBenchで勝利し、Artificial AnalysisではOpus 5.5が58点に対しArgonが53点です。標準料金では同じコストです。
Gemini 4 ArgonはClaude Opus 5.5より安いですか? 導入期間中は半額です ($2/$10 対 $4/$20)。その後は定価は同じですが、Googleは導入期間がいつ終了するかを述べていません。
最も大きな出力制限を持つモデルはどれですか? Argonは公称1Mトークンですが、Vals AIはテストした構成で262Kと記載しています。他のモデルは同期出力を128Kに制限しています。弊社の1M出力トークンガイドでは、それがクライアントにとって何を意味するかを解説しています。
Gemini 4 Argonは今日利用できますか? GoogleのFairwindプログラムを通じてのみ、審査されたサイバー防御パートナー向けに提供されています。有料API顧客とGoogle AI Ultra加入者はその後に提供されますが、日程は未定です。
ワークロードで選択し、テストする
Argonは知識労働、長文コンテキスト、マルチモーダルの項目で最も強力に見えます。AstraはFrontierSWE、Terminal-Bench Science、OSWorldで優位です。Opus 5.5はターミナル作業とMLエンジニアリングで優れており、導入期間後のArgonと同じ価格帯です。今日購入できる2つのモデルで開発を進め、Geminiモデルを変数に保持し、Argonが一般公開された日にシナリオを再実行しましょう。1つのプロジェクトで3つのリクエスト比較を設定するには、Apidogをダウンロードしてください。
button
