Googleは2026年7月21日にFlash層を刷新し、主力モデルはバージョンアップしてGemini 3.6 Flashになりました。現在、本番環境で3.5 Flashをご利用の場合、簡単に言うと、3.6 Flashはより安価で、トークン効率の高いドロップイン代替品であり、ほとんどのチームがアップグレードすべきです。同じモデルファミリー、同じ100万トークンのコンテキスト、同じ入力価格です。出力はトークンあたりのコストが安くなり、同じタスクを完了するためにモデルが生成する出力トークンも少なくなります。新モデルの詳細については、Gemini 3.6 Flashとはをご覧ください。
結論から言うと
アップグレードしてください。Gemini 3.6 Flashは、入力価格を100万トークンあたり1.50ドルに据え置き、出力価格を100万トークンあたり9.00ドルから7.50ドルに引き下げ、同じタスクで3.5 Flashよりも約17%少ない出力トークンを生成します。また、コンピュータ使用ベンチマーク(OSWorld-Verifiedで83.0対78.4)でも高いスコアを記録し、複数ステップのワークフローでの推論ステップ数も少なくなっています。唯一アップグレードを控えるべき理由は、3.5 Flashを本番環境で固定(ピン留め)して検証済みであり、まだ評価を再実行できない場合です。
Gemini 3.6 Flashと3.5 Flashの比較
Googleの発表データに基づく重要な比較です。詳細は、Googleのブログ記事およびDeepMindのFlashモデルページで確認できます。
| 属性 | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| モデルID | gemini-3.6-flash |
gemini-3.5-flash |
| 入力価格 (100万トークンあたり) | $1.50 | $1.50 |
| 出力価格 (100万トークンあたり) | $7.50 | $9.00 |
| 出力トークン効率 | 出力トークンが約17%少ない | 基準 |
| コンピュータ使用 (OSWorld-Verified) | 83.0 | 78.4 |
| コンテキストウィンドウ | 100万入力トークン | 100万入力トークン |
入力価格は変更されていません。コンテキストウィンドウも変更されていません。変更点は、コストの出力側と、モデルがどれだけ効率的に回答に到達するかという点です。
実際に改善された点
4つの点が変更され、それが移行すべき理由です。

出力トークン数の削減。 Gemini 3.6 Flashは、同じタスクで3.5 Flashよりも約17%少ない出力トークンを生成します。出力トークンには思考トークンも含まれるため、より効率的な推論器は同じ回答に到達するためにより少ない記述で済みます。すべての出力トークンに対して料金が発生するため、これは直接的なコスト削減であり、見せかけの指標ではありません。
出力価格の引き下げ。 Googleは出力価格を100万トークンあたり9.00ドルから7.50ドルに引き下げました。これは、上記のトークン数削減に加えて、トークンあたりの料金で17%の値下げとなります。
コンピュータ使用能力の向上。 実際のコンピュータインターフェースを操作するためのベンチマークであるOSWorld-Verifiedにおいて、3.6 Flashは3.5 Flashの78.4に対し、83.0を記録しました。UIのクリック、フォームへの入力、ツールの操作を行うエージェントを構築している場合、この差は失敗ステップの減少として現れます。
推論ステップとツール呼び出しの削減。 複数ステップのエージェントワークフローにおいて、3.6 Flashはより少ない推論ステップと少ないツール呼び出しで目標に到達します。回避されたツール呼び出しは、費用を払う必要がなく、待機する必要もないラウンドトリップであるため、これはエージェント的なあらゆるタスクにおけるトークン節約と相まって効果を発揮します。コーディング精度も向上しており、モデルがファイルを編集したり、1つの誤ったトークンでビルドが壊れる可能性のある差分を生成したりする場合には重要です。
これらの変更は、APIの形式を変えるものではありません。リクエスト形式も、入力モダリティ(テキスト、画像、ビデオ、オーディオ、PDF)も、出力テキストも同じです。
請求書への影響
2つのコスト削減効果は累積します。出力トークンあたりの価格が下がり、さらに支払うべき出力トークン数も減ります。これらは単に加算されるのではなく、乗算されます。
以下に分かりやすい例を示します。ある日次ジョブが3.5 Flashで1,000万の出力トークンを生成するとします。
- 3.5 Flashの場合: 1,000万出力トークン × 100万あたり9.00ドル = 出力コストは1日あたり90.00ドル
- 3.6 Flashの場合: 出力トークンが17%少ないと約830万トークン、100万あたり7.50ドルで = 1日あたり62.25ドル
これはそのワークロードの出力側で約31%の削減に相当し、あなたはプロンプトを一切変更していません。入力価格は100万あたり1.50ドルで同じであり、プロンプトも変更されていないため、入力コストは変わりません。ツール呼び出しが多いエージェントワークロードでは、ラウンドトリップが少なくなることで全体のトークン数も削減されるため、削減率はさらに大きくなる可能性があります。
実際の数値は、入力と出力の比率によって異なります。多くの読み込みと少量の書き込みを行うジョブ(分類、抽出など)では、節約が出力に集中するため、全体の変化は小さくなります。大量の書き込みを行うジョブ(下書き作成、コード生成、長いエージェントトレースなど)では、最大の恩恵が得られます。料金、キャッシング、思考トークンの詳細については、Gemini 3.6 Flashの料金および公式のGemini API料金ドキュメントをご覧ください。
3.5 Flashを使い続ける理由はありますか?
はい、ごく限られた理由です。ご自身の状況について正直になりましょう。
3.5 Flashを固定する正当な理由は、本番環境で既に検証済みであり、現時点では再テストできない場合です。コンプライアンス承認に縛られた評価スイートを持っているかもしれません。あるいは、下流のパーサーが依存するプロンプト調整済みの出力があり、今回のスプリントでは回帰テストの期間がないかもしれません。モデルの入れ替えは出力に微妙な変化をもたらすため、「より安価である」という理由だけで、今日再検証できないシステムを静かに壊す価値はありません。その場合、テスト期間が確保できるまでgemini-3.5-flashに固定し、その後慎重に移行してください。
明確にしておきます。3.6がリリースされた日に3.5 Flashがなくなるわけではありません。APIを通じて引き続き利用可能であり、それに固定することは短期的な選択肢として有効です。これは「いつか」ではなく「今」の問題です。厳格な検証ロックがないほとんどのチームにとって、コストと品質の両方が今すぐアップグレードを促しています。
移行方法
機械的な作業は1行だけです。API呼び出しで、モデルIDを入れ替えます。
gemini-3.5-flashからgemini-3.6-flashへ
コード変更はこれだけです。リクエストボディ、認証、エンドポイントは同じなので、統合における他の変更はありません。リクエストごとの詳細な手順については、Gemini 3.6 Flash APIの使用方法とGemini APIドキュメントをご覧ください。
本当の作業は、入れ替えではなく検証です。新しいモデルIDを本番環境にデプロイする前に:
- 3.6 Flashに対して評価スイートを再実行し、品質スコアを3.5 Flashのベースラインと比較します。
- バージョン間で出力の形式や言い回しが変わる可能性があるため、回帰テストを再実行します。
- モデル出力を厳密な構造(JSONキー、正規表現、下流のスキーマ検証など)で解析するすべてのものを確認します。
- 完全展開する前に、実際のトラフィックのサンプルでレイテンシとトークン数を監視します。
出力が別のサービスに供給される場合は、この入れ替えを他の依存関係のアップグレードと同様に扱ってください。フラグの裏で変更し、比較し、その後昇格させます。
Apidogでの入れ替えの回帰テスト
ここでApidogが移行においてその価値を発揮します。ApidogはAPIクライアント兼テストプラットフォームであるため、3.6 Flashが本番環境で信頼できる動作をするかどうかを証明するのに最適な場所です。モデル自体を実行するのではなく、リクエストを送信し、レスポンスをチェックします。
2つのモデルをA/Bテストする簡潔な方法:
- 既存のGeminiリクエストを保存します。 ApidogでGemini APIへの
POST呼び出しを作成し、APIキーを環境変数に保存してリクエストボディに入らないようにします。 - それを複製します。 変更する箇所はモデルIDのみで、
gemini-3.5-flashからgemini-3.6-flashに変更します。その他はすべて同じにして、同条件で比較できるようにします。 - アサーションを追加します。 ステータスコードと、アプリが実際に読み取るJSONフィールドについてアサートすることで、形式の変更が下流に漏れるのではなく、明確に失敗するようにします。
- レスポンスとレイテンシを比較します。 両方を実行し、出力を並べて、3.6のレスポンスが3.5のレスポンスがパスしたすべてのアサーションを依然としてパスするかどうかを確認します。それぞれのレスポンス時間とトークン使用量を記録します。
- アサーションを常にパスした状態に保ちます。 両方をテストシナリオとして保存し、回帰テストとしてスケジュールすることで、将来のモデルやプロンプトの変更によって契約が静かに破られることがないようにします。
これが正直なワークフローです。リクエストを複製し、モデルIDのみを変更し、アサーションに交換が安全かどうかを判断させます。ご自身のGemini呼び出しと比較を実行したい場合は、Apidogをダウンロードしてください。
よくある質問
Gemini 3.6 Flashは3.5 Flashのドロップイン代替品ですか? 機械的にはそうです。モデルIDをgemini-3.5-flashからgemini-3.6-flashに変更すれば、リクエストの残りの部分は同じままです。ただし、出力の言い回しや構造はバージョン間で変わる可能性があるため、本番環境にデプロイする前に評価と回帰テストを再実行すべきです。
入力価格は変更されましたか? いいえ。両モデルとも入力は100万トークンあたり1.50ドルで変わりません。出力価格のみが100万トークンあたり9.00ドルから7.50ドルに変更されました。
なぜモデルは3.6なのに、LiteとCyberのバリアントは3.5なのですか? Googleはこの刷新で、主力であるFlashモデルのみを3.6にバージョンアップしました。Flash-LiteとFlash Cyberは3.5バージョンとして出荷されました。バージョン番号は階層全体で同期しているわけではないため、ファミリー番号だけでなくモデルIDを読むようにしてください。
請求額は確実に31%削減されますか? いいえ、その数値は出力負荷の高いワークロードにおける例示に過ぎません。実際の節約額は、入力と出力のトークン比率によって異なります。出力負荷の高いジョブが最も節約でき、読み込み負荷の高いジョブは割引が出力にかかるため節約は少なくなります。
3.5 Flashはまだ使えますか? はい、APIを通じて引き続き利用可能です。検証済みであり、まだ再テストできない場合は、それに固定することが合理的な短期的な選択肢です。次のテスト期間に向けて移行を計画してください。
このモデルが置き換える以前の世代については、Gemini 3.5とはをご覧ください。
ほとんどのチームにとって、計算結果とベンチマークは一致しています。モデルIDをgemini-3.6-flashに交換し、Apidogで評価と迅速な回帰テストを実行して、より安価で効率的なモデルを採用しましょう。検証ロックによりやむを得ない場合にのみ3.5 Flashを固定し、その期間が終わり次第移行してください。
