Gemini 4 Argonは、Googleの発表した19のベンチマークにおいて、13項目で単独トップ、1項目で同率首位(CWE-bench v1、GPT-6 Astraと同率)、5項目で後塵を拝しています。後塵を拝しているのは、FrontierSWE v2、Terminal-bench 4.0、PostTrainBench、Terminal-Bench Science 0.1、OSWorld-2.0です。問題はアクセスです。Argonは現在、Fairwindプログラムのディフェンダーのみが利用できるため、Googleのパートナーリストや一部のベンチマーク組織以外は、まだこれらの数値を再実行することはできません。
以下に、各項目を測定した組織、5つの敗北項目、詳細情報、サイバースコア、サードパーティのスコアボード、そしてアクセスが開始される前にApidogで独自の評価を構築する方法を記載しています。モデルの概要については、Gemini 4 Argonとは何かをご覧ください。購入の意思決定については、Argon vs GPT-6 Astra vs Claude Opus 5.5をご覧ください。
各項目を測定した組織を含む完全な表
これらは、発表記事および「2026年10月時点の結果」と題された評価方法PDFからのGoogleが報告した結果です。Googleは19のArgonスコアのうち10を自社で算出し、残りの9は公開リーダーボードからのものです。競合モデルの数値は、これらのリーダーボード、Google自身の実行結果、またはベンダーのシステムカードやブログ記事から得られており、評価方法は項目ごとに異なります。太字は項目でのトップを示します。
| ベンチマーク | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | 測定者 |
|---|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% | Vals AI |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | Zapierリーダーボード(プライベートセット) |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Vals AI |
| Harvey Legal Agent | 19.6% | 5.4% | 6.7% | 3.8% | Vals AI |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% | Argon自己算出; Astraリーダーボード; Anthropicシステムカード |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | Proximalリーダーボード |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | Vals AI |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | Argon自己算出; 競合リーダーボード |
| PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% | 全モデル自己算出 |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | Argon自己算出; 競合リーダーボード |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | 全モデル自己算出 |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | Surgeリーダーボード |
| GraphWalks up to 128K | 99.7% | 98.7% | 91.4% | 90.6% | 全モデル自己算出 |
| GraphWalks 256K to 1M | 84.2% | 71.8% | 65.0% | 66.8% | 全モデル自己算出 |
| Agent’s Last Exam | 39.5% | 34.2% | n/r | 38.2% | Argon自己算出; 競合リーダーボード |
| OSWorld-2.0 (offline) | 69.2% | 72.6% | n/r | n/r | Argon自己算出; AstraはOpenAIのブログ記事より |
| Chartography | 71.6% | 71.0% | 46.2% | 66.3% | Surgeリーダーボード |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | 全モデル自己算出 |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% | 公開リーダーボード |
n/r = 未報告。Googleの表にはないGrok 4.7もCWE-benchリーダーボードで68%を記録しており、この同率は3つ巴です。
出典別に見ると、9項目は全モデルの公開リーダーボード(Vals AI、Zapier、Proximal、Surge、CWE-bench)からのものです。Argonはそのうち7項目でトップを飾り、1項目で同率です。Googleは全4モデルについて5項目を自社で実行し、Argonはそのうち4項目でトップを飾っています。残りの5項目は、GoogleがArgonのスコアを算出し、競合モデルの数値を他のソースから得たものであり、Argonが最も劣勢に立たされているのはここです。5つの敗北項目のうち3つが、この混合項目に含まれています。自己算出がArgonを実力以上に良く見せているのであれば、逆の結果になるはずです。
Argonが劣勢に立たされている項目、そしてエージェント型コーディングにとって重要な理由
- FrontierSWE v2: Astraの65.5%に対し55.0%。Fable 5.1 (56.3%)、Opus 5.5 (62.3%) にも劣り、全モデルが評価されたリーダーボードで4モデル中最下位です。
- Terminal-bench 4.0: Opus 5.5の66.4%に対し57.4%。再び最下位ですが、AstraとFable 5.1は1ポイント差以内です。
- PostTrainBench: Opus 5.5の49.3%に対し45.3%。Googleが全モデルに対して実行した項目では2位です。
- Terminal-Bench Science 0.1: Astraの68.1%に対し57.6%。Fable 5.1のみを上回る3位です。GoogleはArgonの試行を6倍の検証タイムアウトで実行しました。
- OSWorld-2.0 (オフラインサブセット): Astraの72.6%に対し69.2%。Anthropicはオンラインとオフラインを合わせたスコアしか報告していないため、Claudeモデルはどちらも登場しません。
エージェント型コーディングは2勝2敗です。ArgonはDeepSWE v1.1とVibe Code Benchで勝利し、FrontierSWE v2とTerminal-bench 4.0で最下位に終わっています。DeepSWEの勝利は、評価方法が混在しています。ArgonはミニSWEエージェントハーネスで実行され、Astraの数値は公開リーダーボードから、Claudeの数値はシステムカードからのものです。Vibe Code Benchは、Vals AIが4モデルすべてを評価しているため、よりクリーンですが、差はわずか1.6ポイントです。
もしワークロードがターミナル重視のエージェントや大規模なリポジトリタスクである場合、上記の最下位の2項目を、見出しの勝敗数よりも重視してください。AstraはFrontierSWEで優位を保っており、GPT-6 Astraハンズオンでは、このモデルが現在どのように使用されているかを示しています。Anthropic側については、Claude Fable 5.1ベンチマークの分析でFable自身の発表数値について解説しています。
Bloombergは、アクセス権を持つ匿名のGoogle社員が、Argonはベンチマークスコアに比べて一部のコーディングやフロントエンドの設計作業で期待外れだと報告していると伝えています。Googleはこの特徴付けを不正確だと述べています。
表の読み方を変える評価方法上の注意点
- 双方の最大限の努力。 Argonは「Gemini APIで最高の思考設定」で実行されました。Astra、Fable 5.1、Opus 5.5については、Googleは「利用可能な最高の思考/推論設定」をデフォルトとしています。これはデフォルトの動作やコストではなく、上限を比較したものです。
- LVBenchのフレーム数。 GoogleはLVBenchを全4モデルに対し、ツールなしで自社で実行しました。Geminiは動画を1秒あたり1フレームでサンプリングしました。Astraは800フレーム、Fable 5.1は300フレーム、Opus 5.5は600フレームを「APIの制限により」得ました。モデルは同一の入力を見ていません。
- OSWorldのベスト3。 Argonのスコアは「1回の実行につき1回の試行で3回の実行のうち最高値」であり、平均ではなく最高の結果です。
- Agent’s Last Examのウィンドウ。 ArgonはALE-Clawハーネスで5時間のウィンドウで実行されました。
- 安全フィルターはオン。 Agent’s Last ExamとOSWorldは安全フィルターを有効にして実行され、フラグが立てられた応答は空の文字列として返されました。これはArgonにとって不利に働く可能性があります。
DeepMindのサイバーページからのサイバー項目
DeepMindのサイバーページには、発表テーブル以外の4つのスコアが追加されています。
| サイバー評価 | Gemini 4 Argon | 比較対象 |
|---|---|---|
| 実世界の脆弱性発見 | 85.8% | Gemini 3.8 Flash Cyber 71.0% |
| Wiz 侵入テストベンチマーク | 70.9% | Gemini 3.8 Flash Cyber 58.2% |
| Gray Swan IPI攻撃成功率 (k=15, 低いほど良い) | 0.7% | チャートで最も低い; Kimi K3が52.7%で最も高い |
| CWE-bench v1 | 68% | Grok 4.7およびGPT-6 Astraと同率の3つ巴; Opus 5.5は67% |
脆弱性評価は、内部のAntigravityハーネスを使用し、「サイバーに特化していない」とされ、ソースコードへのアクセスがありました。Wizテストは、モデルに「実行中のウェブサイトとその公開されている動作へのアクセスのみを与え、アプリケーションのソースコードは提供しません」。両方の主要な比較は、競合モデルではなく、Googleの以前のサイバーモデルとの比較です。Argonサイバー防御解説では、これらが実行するAPIにとって何を意味するのかを解説しています。
サードパーティのスコアボード
これらの組織は、発表後数分でスコアを公開しており、事前にリリース前のアクセスを得ていました。
- Artificial AnalysisはGemini 4 Argon (High) をインテリジェンスインデックス53とし、223モデル中8位にランク付けしています。この順位は、各推論設定を個別にカウントしています。個別のモデルで見ると、ArgonはFable 5.1とGPT-6 Astraと同率で、Opus 5.5 (最大58) およびSonnet 5.5 (最大56) の後ろに位置します。AAはAA-Omniscienceで15%の幻覚率を報告しており(Astraは最大51%)、精度は50%対63%です。インデックスの実行コストはタスクあたり1.99ドルで、タスクあたりの出力トークン数は約62K(Astraは最大約27K)でした。Artificial Analysisは、速度やレイテンシのデータは示していません。
- Vals AIはArgonをVals Indexで68.90%とし、41モデル中1位、Geminiモデルで初めてトップを獲得しました。テストあたりのコストは15.68ドルです。Vals AIは、テストした構成の最大出力が262Kであると記載しており、Googleが公表している1Mを下回っています。
- Arenaは、ArgonをTextで1525点とし、4,942票で暫定1位に、WebDevでは8位にランク付けしています。
なぜメディアは12勝、13勝、14勝と報じるのか
メディアは3種類の異なる勝利数を報道しています。以下はGoogleの19項目からの再集計です。
| 比較対象 | Argonの勝利数 | 引き分け数 | Argonの敗北数 | 未報告数 |
|---|---|---|---|---|
| 競合3モデルすべての中で最高 | 13 | 1 | 5 | 0 |
| GPT-6 Astraのみと比較 | 14 | 1 | 4 | 0 |
| Claude Opus 5.5のみと比較 | 14 | 0 | 4 | 1 |
| Claude Fable 5.1のみと比較 | 15 | 0 | 2 | 2 |
13勝は全競合モデルと比較した場合に正しいです。14勝はAstraまたはOpus 5.5と直接比較した場合に正しいです。12勝は、全19項目に対するこれらのフレームワークのいずれとも一致しないため、その情報源がどの項目を数えたかを確認する必要があります。差も様々です。Harvey Legal Agent(19.6%対6.7%)は大きな差ですが、Chartographyは0.6ポイントです。
アクセス開始日に独自の評価を実行する方法
ベンチマークはGoogleの評価方法を記述していますが、あなたのプロンプトはあなたの製品を記述します。今日、呼び出し可能なモデルで評価を構築し、1つの変更を加えてArgonに向けてください。
- 気になる項目に合致する実際のプロンプトを選びます。例えば、リポジトリの修正、ターミナルタスク、長文ドキュメントに関する質問などです。
- Apidogで、`GEMINI_API_KEY`と`GEMINI_MODEL`を`gemini-3.8-flash`に設定した環境を作成します。GoogleはArgonのモデルIDを公開していないため、この変数が唯一変更する値になります。
- 各プロンプトを、`{{GEMINI_MODEL}}`からモデルを読み取るリクエストとして保存し、テストシナリオにグループ化します。
- 出力(ステータス、必須フィールド、予期される内容)と`usageMetadata`にアサーションを追加します。これには、コスト上限に応じた`thoughtsTokenCount`の制限も含まれます。
- 現時点でシナリオを3.8 Flashで実行し、そのレポートをベースラインとして保持します。
ArgonのIDが出荷されたら、変数を交換して再実行します。Googleは「すべての新しいモデル」がInteractions APIで起動すると述べているため、各リクエストのInteractionsバージョンも保存しておきましょう。Argon vs Gemini 3.8 Flashの比較では、価格と制限について何が期待できるかを説明しています。
FAQ
Gemini 4 Argonのベンチマークは独立して検証されていますか? 部分的にそうです。19項目のうち9項目は、すべてのモデルについて公開されているリーダーボードからのものであり、Artificial Analysis、Vals AI、Arenaも独自の結果を公開しています。残りはGoogleがArgonのために実行したものです。
Gemini 4 ArgonのDeepSWEスコアはどのくらいですか? DeepSWE v1.1で77.9%であり、Opus 5.5 (74.2%) およびAstra (74.1%) を上回っています。Argonの実行はミニSWEエージェントハーネスを使用し、競合モデルの数値はリーダーボードおよびシステムカードからのものです。
ArgonはベンチマークでGPT-6 Astraに勝ちますか? Googleの表での直接対決では、Argonは14項目で勝利し、1項目で同率、4項目で敗北しています。Artificial Analysisでは、両者とも53で同率です。
これらのベンチマークを自分で再実行できますか? まだできません。ArgonはFairwindパートナーに限定されており、Googleは一般公開日を発表していません。Argonリリース日トラッカーで展開を追跡しています。
次のステップ
今すぐシナリオを構築し、3.8 Flashで実行してレポートを保管してください。Argonが利用可能になったら、切り替え後数分で独自の数値を得ることができます。Apidogをダウンロードして設定しましょう。
