Gemini 3.8 Flashは本日より提供開始されます。これは、2026年12月31日まで1Mトークンあたり入力$0.75、出力$3.75、その後は$1.50と$7.50で利用できる、フリーティア付きの安定したモデルで、出力上限は64Kです。Gemini 4 Argonはそうではありません。Googleの発表記事によると、発表期間(期間未定)中は$2と$10、その後は$4と$20の価格設定です。Googleは、その出力上限が1Mトークンであり、本日よりFairwindプログラムの防御者にのみ提供されると述べています。今四半期中にリリースする必要がある場合はFlashでリリースし、Argonは設定変更一つで切り替えられる状態にしておきましょう。
この記事では、両モデルの仕様、両方の発表記事で共通するベンチマークの項目、サイバースコア、同一の呼び出しのコストを比較し、意思決定ルールを提供します。背景については、Gemini 4 Argonとは何か、Gemini 3.8 Flashとは何かをご覧ください。最後のセクションでは、切り替えを単一の変数で行うためのApidogのセットアップを紹介します。
サイドバイサイド:今日利用できるもの
| Gemini 3.8 Flash | Gemini 4 Argon | |
|---|---|---|
| 提供状況 | Gemini API、AI Studio、Antigravity、Gemini Enterpriseで安定版 | Fairwindプログラムパートナーのサブセット、Gemini Enterpriseのマネージドモデルとして |
| モデルID | gemini-3.8-flash |
未公開 |
| 1Mトークンあたりの料金(入力/出力) | 2026年12月31日まで $0.75 / $3.75、その後 $1.50 / $7.50 | 発表期間中 $2 / $10(終了日未定)、その後 $4 / $20 |
| 1Mトークンあたりのキャッシュ入力 | $0.075、その後 $0.15 | 発表期間中 $0.10、その後 $0.20(入力から95%オフ) |
| 出力上限 | 65,536トークン | 1Mトークン(Googleの公称上限) |
| 入力ウィンドウ | 1,048,576トークン | 未公開 |
| 思考レベル | low、medium(デフォルト)、high; minimalはHTTP 400を返す |
未文書化 |
| 無料APIティア | あり(レート制限あり) | 発表なし |
| 消費者アクセス | AI ProおよびUltraのGeminiアプリ、検索のAIモード | まだ;AI Ultra加入者は最初の波に含まれるが、日程未定 |
いくつかのセルには補足が必要です。GoogleはArgonの入力ウィンドウを公開していませんが、Google自身の長文コンテキスト評価では最大1Mトークンのプロンプトが使用されました。GoogleはArgonの出力上限を1Mトークンと述べていますが、少なくともサードパーティの評価者であるVals AIは、テストした構成では最大262Kの出力と記載しています。Argonの評価は「最高の思考設定」で実行されたため、高いレベルが存在する可能性はありますが、Googleはレベル名やデフォルトを公開していません。FlashのレベルはGoogleの思考ドキュメントおよび弊社の3.8 Flash思考レベルガイドに記載されています。
Flashのフリーティアはレート制限があり、Googleはフリーティアのデータが「製品の改善に使用される」と述べています。GoogleはArgonを無料で利用する方法を発表していません。代わりに利用できる無料のGeminiモデルについては、弊社のArgon無料アクセス説明をご覧ください。
両方の発表記事で共通するベンチマーク項目(テキスト)
両モデルのGoogleの発表テーブルでは、2つの項目がテキストで共通しています。これらはGoogleが報告した数値であり、Argonの評価方法は両項目をVals AIによるものとしています。
| ベンチマーク | Gemini 3.8 Flash(9月2日のテーブル) | Gemini 4 Argon(9月30日のテーブル) |
|---|---|---|
| Vals Finance Agent v2 | 61.4% | 65.4% |
| Harvey Legal Agent Benchmark | 10.0% | 19.6% |
Googleはこれらのテーブルを1ヶ月間隔で、異なる競合セットに対して公開したため、このギャップは制御されたテストというよりは方向性を示すものとして読んでください。それでも、法律に関する項目は際立っており、Argonの19.6%はFlashの10.0%のほぼ2倍です。金融に関するギャップは4ポイントです。
Argonのテーブルにあるその他の項目には、テキストで対応する3.8 Flashの項目がありません。Googleの3.8 FlashのテーブルではHLE-Verifiedが報告されていましたが、Argonのテーブルにはなく、FlashのDeepSWEスコアはモデルカード画像にのみ表示されていました。サードパーティのランキングであるArenaのText leaderboardでは、Argon (High)が予備投票で1位を獲得している一方、Gemini 3.8 Flash (High)は11位です。各項目を誰が測定したかを含むArgonの全19項目のテーブルは、弊社のArgonベンチマークの内訳にあります。
サイバー:Argon vs 3.8 Flash Cyber
DeepMindのサイバーページでは、ArgonとGemini 3.8 Flash Cyber(FlashのFairwind限定版サイバー兄弟モデル)を比較しています。
| サイバー評価 | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|
| 実世界の脆弱性発見 | 85.8% | 71.0% |
| Wiz Penetration Test Benchmark | 70.9% | 58.2% |
両モデルともゲートされています。Gemini 3.8 Flash Cyberは、Gemini Enterprise Agent Platform上の許可リストの背後でGA(一般提供)されており、ArgonはFairwind限定です。Fairwindパートナーでない場合、どちらの数値も今日利用できるものには影響しません。一般的な3.8 Flashモデルが、あなたが開発できるモデルです。
両モデルで同じ呼び出しを行った場合のコスト
入力100,000トークン、出力8,000トークンの呼び出しを想定します。現在のGeminiモデル(3.8 Flashを含む)では、思考トークンも出力として課金されるため、8,000トークンにはそれらも含まれます。GoogleはArgonがそれらをどのように課金するかを述べていません。Argonの項目では、現在のGeminiモデルに従うと仮定しています。
| モデルと期間 | 入力コスト | 出力コスト | 呼び出しごとの合計 |
|---|---|---|---|
| 3.8 Flash、発表期間中 | 0.1M x $0.75 = $0.075 | 0.008M x $3.75 = $0.030 | $0.105 |
| 3.8 Flash、2027年1月1日以降 | 0.1M x $1.50 = $0.150 | 0.008M x $7.50 = $0.060 | $0.210 |
| Argon、発表期間中 | 0.1M x $2 = $0.200 | 0.008M x $10 = $0.080 | $0.280 |
| Argon、標準 | 0.1M x $4 = $0.400 | 0.008M x $20 = $0.160 | $0.560 |
Argonのトークンあたりの料金は、発表期間中の価格と標準価格の両方で、Flashの8/3(約2.67倍)です。このような呼び出しを1日1,000回行うと、Flashでは1日105ドルに対し、Argonの発表期間中の料金では280ドルになります。
以下の3つの要因が、このきれいな比率を崩します。
- トークン数は一致しない。同じプロンプトでも、モデルが異なれば出力トークン数と思考トークン数は異なります。Argonで公開されている評価は最高の思考設定で実行されており、3.8 Flashでは、Googleは高い労力レベルを使用するとより多くのトークンを使用する可能性があると警告しています。
- 長い出力は計算を変える。200,000トークンの回答はFlashの65,536トークン上限に収まらないため、複数の呼び出しに分割する必要があります。Argonの公称上限内であれば1つの応答で済みます。発表期間中の料金で0.2M x $10 = $2.00、または標準料金で$4.00です。1Mトークンの完全な回答は、発表期間中で$10、標準で$20かかります。
- 発表期間の終了日は1つしか不明。Flashの発表期間中の料金は2026年12月31日に終了します。GoogleはArgonの終了時期を述べていません。
Flashには、Gemini API料金ページによると、Batchが50%オフ(12月31日まで$0.375と$1.875)で提供されています。GoogleはArgonのBatch料金を公開していません。弊社のArgon料金ガイドと3.8 Flash料金ガイドで詳細をご確認ください。
Argonを待つべきか、Flashでリリースすべきか?
以下の場合は、今すぐ3.8 Flashでリリースする
- コストを重視する場合。FlashはArgonのトークンあたり3/8のコストで、Batchはそれを半減させます。
- 大量に実行する場合。分類、抽出、ルーティング、大規模チャットは、1M出力トークンあたり10ドルではすぐにコストが膨らみます。
- 今日中に必要とする場合。Flashには安定したモデルID、プロトタイピング用のフリーティア、公開された料金体系があります。
- 応答が65,536トークンに収まる場合。ほとんどのAPIワークロードはこれに該当します。
以下の場合は、Argonを計画する
- 長期的な作業の場合。GoogleはArgonが「複雑で長期的なワークフロー全体で深い推論を維持するように構築されている」と述べています。
- 64Kを超える出力が必要な場合。完全なモジュールの書き換え、長いレポート、大規模な移行には、1Mの出力制限が必要です。
- 法律または金融エージェントを実行する場合。これらはGoogleが両モデルを公開した2つの項目であり、Argonが両方で優位に立っています。
- Fairwindの資格のある防御者である場合。Argonは、このプログラムが現在推進しているモデルです。
一度決めたらそれきり、というわけではありません。トラフィックの大部分をFlashにルーティングし、困難なタスクはArgonがリリースされたときに、両方を同じ設定の背後でArgonに送ることもできます。
1つの保存されたリクエスト、2つのモデル
パターンは次のとおりです。モデル名を環境変数に保持し、現在のリクエストを3.8 Flashに対して実行し、ArgonのモデルIDがリリースされた日に変数を入れ替えます。GoogleはそのIDを公開していないため、推測しないでください。
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
curl -s -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize this contract clause in 3 bullets."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"medium"},"maxOutputTokens":8192}}'
すべてのgenerateContent応答はusageMetadataで終わります。Apidogで、GEMINI_API_KEYとGEMINI_MODELを環境に保存し、このリクエストを保存してアサーションを追加します。ステータス200、アプリが読み取るフィールド、およびコストキャップに合わせたusageMetadata.thoughtsTokenCountの上限を設定します。長い回答が予算を使い果たさないようにmaxOutputTokensを設定し続けてください。これをテストシナリオに追加し、Flashで実行してレポートをベースラインとして保存します。
リリース日に関する2つの注意点。Googleは「すべての新しいモデル」がInteractions APIでリリースされると述べており、ArgonがgenerateContentをサポートするかどうかは述べていないため、これとは別にInteractionsバージョン(POST https://generativelanguage.googleapis.com/v1beta/interactions と generation_config.thinking_level)を保存してください。また、Argonの思考レベル名は文書化されていないため、mediumが引き継がれない可能性があります。Argonがリリースされたら、変数を1つ変更し、再実行して、出力とusageMetadataを並べて比較してください。
FAQ
Gemini 4 ArgonはGemini 3.8 Flashより優れていますか? 両方の発表テーブルで共通する2つの項目(テキスト)では、はい、優れています。Vals Finance Agent v2では65.4%対61.4%、Harvey's Legal Agent Benchmarkでは19.6%対10.0%です。また、トークンあたりのコストは約2.67倍高く、まだ呼び出すことはできません。
Gemini 4 Argonを待つべきですか? リリースが必要な場合は待つべきではありません。Googleは「できるだけ早く」としかリリース日を提示しておらず、有料API顧客とAI Ultra加入者から開始されます。
新しいプロジェクトにはGemini 3.8 FlashとArgonのどちらが良いですか? まずは、モデルを変数に入れた状態で3.8 Flashから始めましょう。長い出力や法的・金融的な深さが必要なリクエストは、独自のプロンプトでテストした後、Argonに移行してください。
Argonを無料で利用する方法はありますか? いいえ。Googleはフリーティアを発表していません。現在利用できる無料のGeminiモデルについては、弊社のArgon無料アクセス説明をご覧ください。
ArgonはGemini 3.8 Flashを置き換えますか? Googleは言及していません。GoogleはArgonを新しいフロンティアモデルと呼んでおり、ロイター通信は従来のProラインよりも大きいと報じているため、Flashとは異なるティアのモデルです。
次のステップ
今日のうちにリクエストを設定し、3.8 Flashで実行してレポートを保存してください。Argonがリリースされたとき、それがあなたのトラフィックに対してその価格に見合うかどうかを数分で判断できるでしょう。比較を構築するにはApidogをダウンロードしてください。
