ジェミニ4アルゴン ベンチマーク: 全19項目、Googleの実行方法と劣勢5項目

ジェミニ 4 アルゴン ベンチマーク結果:測定者情報を含む全19行、ジェミニが劣る5項目、Googleの測定方法に関する留意事項、AA、Vals、Arenaの各スコア。

INEZA Felin-Michel

INEZA Felin-Michel

2 10月 2026

ジェミニ4アルゴン ベンチマーク: 全19項目、Googleの実行方法と劣勢5項目

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

Gemini 4 Argonは、Googleの発表した19のベンチマークにおいて、13項目で単独トップ、1項目で同率首位(CWE-bench v1、GPT-6 Astraと同率)、5項目で後塵を拝しています。後塵を拝しているのは、FrontierSWE v2、Terminal-bench 4.0、PostTrainBench、Terminal-Bench Science 0.1、OSWorld-2.0です。問題はアクセスです。Argonは現在、Fairwindプログラムのディフェンダーのみが利用できるため、Googleのパートナーリストや一部のベンチマーク組織以外は、まだこれらの数値を再実行することはできません。

以下に、各項目を測定した組織、5つの敗北項目、詳細情報、サイバースコア、サードパーティのスコアボード、そしてアクセスが開始される前にApidogで独自の評価を構築する方法を記載しています。モデルの概要については、Gemini 4 Argonとは何かをご覧ください。購入の意思決定については、Argon vs GPT-6 Astra vs Claude Opus 5.5をご覧ください。

各項目を測定した組織を含む完全な表

これらは、発表記事および「2026年10月時点の結果」と題された評価方法PDFからのGoogleが報告した結果です。Googleは19のArgonスコアのうち10を自社で算出し、残りの9は公開リーダーボードからのものです。競合モデルの数値は、これらのリーダーボード、Google自身の実行結果、またはベンダーのシステムカードやブログ記事から得られており、評価方法は項目ごとに異なります。太字は項目でのトップを示します。

ベンチマーク Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 測定者
Vals Index 68.9% 63.1% 65.8% 67.0% Vals AI
AutomationBench 51.3% 41.4% 31.4% 42.5% Zapierリーダーボード(プライベートセット)
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6% Vals AI
Harvey Legal Agent 19.6% 5.4% 6.7% 3.8% Vals AI
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2% Argon自己算出; Astraリーダーボード; Anthropicシステムカード
FrontierSWE v2 55.0% 65.5% 56.3% 62.3% Proximalリーダーボード
Vibe Code Bench 91.9% 89.6% 90.3% 90.3% Vals AI
Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4% Argon自己算出; 競合リーダーボード
PostTrainBench 45.3% 44.3% 40.2% 49.3% 全モデル自己算出
Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3% Argon自己算出; 競合リーダーボード
LABBench 2 88.8% 85.4% 68.6% 73.1% 全モデル自己算出
RiemannBench 76.0% 72.0% 65.6% 69.6% Surgeリーダーボード
GraphWalks up to 128K 99.7% 98.7% 91.4% 90.6% 全モデル自己算出
GraphWalks 256K to 1M 84.2% 71.8% 65.0% 66.8% 全モデル自己算出
Agent’s Last Exam 39.5% 34.2% n/r 38.2% Argon自己算出; 競合リーダーボード
OSWorld-2.0 (offline) 69.2% 72.6% n/r n/r Argon自己算出; AstraはOpenAIのブログ記事より
Chartography 71.6% 71.0% 46.2% 66.3%Surgeリーダーボード
LVBench 91.7% 87.5% 79.7% 83.7% 全モデル自己算出
CWE-bench v1 68.0% 68.0% 58.0% 67.0% 公開リーダーボード

n/r = 未報告。Googleの表にはないGrok 4.7もCWE-benchリーダーボードで68%を記録しており、この同率は3つ巴です。

出典別に見ると、9項目は全モデルの公開リーダーボード(Vals AI、Zapier、Proximal、Surge、CWE-bench)からのものです。Argonはそのうち7項目でトップを飾り、1項目で同率です。Googleは全4モデルについて5項目を自社で実行し、Argonはそのうち4項目でトップを飾っています。残りの5項目は、GoogleがArgonのスコアを算出し、競合モデルの数値を他のソースから得たものであり、Argonが最も劣勢に立たされているのはここです。5つの敗北項目のうち3つが、この混合項目に含まれています。自己算出がArgonを実力以上に良く見せているのであれば、逆の結果になるはずです。

Argonが劣勢に立たされている項目、そしてエージェント型コーディングにとって重要な理由

エージェント型コーディングは2勝2敗です。ArgonはDeepSWE v1.1とVibe Code Benchで勝利し、FrontierSWE v2とTerminal-bench 4.0で最下位に終わっています。DeepSWEの勝利は、評価方法が混在しています。ArgonはミニSWEエージェントハーネスで実行され、Astraの数値は公開リーダーボードから、Claudeの数値はシステムカードからのものです。Vibe Code Benchは、Vals AIが4モデルすべてを評価しているため、よりクリーンですが、差はわずか1.6ポイントです。

もしワークロードがターミナル重視のエージェントや大規模なリポジトリタスクである場合、上記の最下位の2項目を、見出しの勝敗数よりも重視してください。AstraはFrontierSWEで優位を保っており、GPT-6 Astraハンズオンでは、このモデルが現在どのように使用されているかを示しています。Anthropic側については、Claude Fable 5.1ベンチマークの分析でFable自身の発表数値について解説しています。

Bloombergは、アクセス権を持つ匿名のGoogle社員が、Argonはベンチマークスコアに比べて一部のコーディングやフロントエンドの設計作業で期待外れだと報告していると伝えています。Googleはこの特徴付けを不正確だと述べています。

表の読み方を変える評価方法上の注意点

DeepMindのサイバーページからのサイバー項目

DeepMindのサイバーページには、発表テーブル以外の4つのスコアが追加されています。

サイバー評価 Gemini 4 Argon 比較対象
実世界の脆弱性発見 85.8% Gemini 3.8 Flash Cyber 71.0%
Wiz 侵入テストベンチマーク 70.9% Gemini 3.8 Flash Cyber 58.2%
Gray Swan IPI攻撃成功率 (k=15, 低いほど良い) 0.7% チャートで最も低い; Kimi K3が52.7%で最も高い
CWE-bench v1 68% Grok 4.7およびGPT-6 Astraと同率の3つ巴; Opus 5.5は67%

脆弱性評価は、内部のAntigravityハーネスを使用し、「サイバーに特化していない」とされ、ソースコードへのアクセスがありました。Wizテストは、モデルに「実行中のウェブサイトとその公開されている動作へのアクセスのみを与え、アプリケーションのソースコードは提供しません」。両方の主要な比較は、競合モデルではなく、Googleの以前のサイバーモデルとの比較です。Argonサイバー防御解説では、これらが実行するAPIにとって何を意味するのかを解説しています。

サードパーティのスコアボード

これらの組織は、発表後数分でスコアを公開しており、事前にリリース前のアクセスを得ていました。

なぜメディアは12勝、13勝、14勝と報じるのか

メディアは3種類の異なる勝利数を報道しています。以下はGoogleの19項目からの再集計です。

比較対象 Argonの勝利数 引き分け数 Argonの敗北数 未報告数
競合3モデルすべての中で最高 13 1 5 0
GPT-6 Astraのみと比較 14 1 4 0
Claude Opus 5.5のみと比較 14 0 4 1
Claude Fable 5.1のみと比較 15 0 2 2

13勝は全競合モデルと比較した場合に正しいです。14勝はAstraまたはOpus 5.5と直接比較した場合に正しいです。12勝は、全19項目に対するこれらのフレームワークのいずれとも一致しないため、その情報源がどの項目を数えたかを確認する必要があります。差も様々です。Harvey Legal Agent(19.6%対6.7%)は大きな差ですが、Chartographyは0.6ポイントです。

アクセス開始日に独自の評価を実行する方法

ベンチマークはGoogleの評価方法を記述していますが、あなたのプロンプトはあなたの製品を記述します。今日、呼び出し可能なモデルで評価を構築し、1つの変更を加えてArgonに向けてください。

  1. 気になる項目に合致する実際のプロンプトを選びます。例えば、リポジトリの修正、ターミナルタスク、長文ドキュメントに関する質問などです。
  2. Apidogで、`GEMINI_API_KEY`と`GEMINI_MODEL`を`gemini-3.8-flash`に設定した環境を作成します。GoogleはArgonのモデルIDを公開していないため、この変数が唯一変更する値になります。
  3. 各プロンプトを、`{{GEMINI_MODEL}}`からモデルを読み取るリクエストとして保存し、テストシナリオにグループ化します。
  4. 出力(ステータス、必須フィールド、予期される内容)と`usageMetadata`にアサーションを追加します。これには、コスト上限に応じた`thoughtsTokenCount`の制限も含まれます。
  5. 現時点でシナリオを3.8 Flashで実行し、そのレポートをベースラインとして保持します。

ArgonのIDが出荷されたら、変数を交換して再実行します。Googleは「すべての新しいモデル」がInteractions APIで起動すると述べているため、各リクエストのInteractionsバージョンも保存しておきましょう。Argon vs Gemini 3.8 Flashの比較では、価格と制限について何が期待できるかを説明しています。

FAQ

Gemini 4 Argonのベンチマークは独立して検証されていますか? 部分的にそうです。19項目のうち9項目は、すべてのモデルについて公開されているリーダーボードからのものであり、Artificial Analysis、Vals AI、Arenaも独自の結果を公開しています。残りはGoogleがArgonのために実行したものです。

Gemini 4 ArgonのDeepSWEスコアはどのくらいですか? DeepSWE v1.1で77.9%であり、Opus 5.5 (74.2%) およびAstra (74.1%) を上回っています。Argonの実行はミニSWEエージェントハーネスを使用し、競合モデルの数値はリーダーボードおよびシステムカードからのものです。

ArgonはベンチマークでGPT-6 Astraに勝ちますか? Googleの表での直接対決では、Argonは14項目で勝利し、1項目で同率、4項目で敗北しています。Artificial Analysisでは、両者とも53で同率です。

これらのベンチマークを自分で再実行できますか? まだできません。ArgonはFairwindパートナーに限定されており、Googleは一般公開日を発表していません。Argonリリース日トラッカーで展開を追跡しています。

次のステップ

今すぐシナリオを構築し、3.8 Flashで実行してレポートを保管してください。Argonが利用可能になったら、切り替え後数分で独自の数値を得ることができます。Apidogをダウンロードして設定しましょう。

ボタン

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる