Googleは、3.6 Flashの3週間後となる2026年8月13日にGemini 3.7 Flashを出荷し、これを「最もインテリジェントな主力モデル」と呼んでいます。API料金を監視している人にとって最も重要な詳細は、ベンチマークではなく料金表にあります。100万入力トークンあたり0.75ドル、100万出力トークンあたり3.75ドルという導入価格は2026年12月31日に期限切れとなります。2027年1月1日からは、両料金が2倍になります。
これは、このモデルで構築するすべてのワークロードに対して2倍に予定されているものです。現在月額790ドルのチャットボットは、コード、トラフィック、プロンプトの変更なしに、1月には月額1,575ドルになります。そのため、3.7 Flashプロジェクトの予算を立てる際には、表示価格ではなく、両方の料金体系を考慮してください。
このガイドでは、2つの料金体系、3つの実際のワークロードにおけるトークン計算、他のモデルAPIと比較した場合の価格、および料金が2倍になる前にコストを削減する方法について説明します。まだ最初のリクエストを送信していない場合は、Gemini 3.7 Flash APIクイックスタートでセットアップについて説明しています。呼び出しを行うようになると、Apidogがすべての応答でusageMetadataトークン数を表示するため、以下の各見積もりは実際のトラフィックと照合できる数値になります。
要点
- 導入料金:100万入力トークンあたり0.75ドル、100万出力トークンあたり3.75ドル(2026年12月31日まで有効)。
- 2027年1月1日からの標準料金:入力1.50ドル、出力7.50ドル。ちょうど2倍。
- 導入価格は、Gemini 3.6 Flashのリリース時の半額。
- このモデルは、1Mトークンのコンテキストウィンドウでテキスト、画像、ビデオ、オーディオ、PDF入力を受け付け、64kトークンの出力上限を持つ。
- 例:1日あたり10,000リクエストを処理するチャットボットは、導入料金で1日あたり約26ドル、標準料金で1日あたり52.50ドル。
- コンテキストキャッシング、出力上限、バッチ処理、軽量トラフィックを小規模モデルにルーティングすることが、支出を削減する主な手段。
2つの料金体系
Gemini 3.7 Flashは、恒久的な価格ではなく、期間限定の割引価格でリリースされました。以下は、Gemini APIの料金の全体像です。
| 料金体系 | 期間 | 入力 (100万トークンあたり) | 出力 (100万トークンあたり) |
|---|---|---|---|
| 導入 | 2026年8月13日~2026年12月31日 | $0.75 | $3.75 |
| 標準 | 2027年1月1日以降 | $1.50 | $7.50 |
2つの点が際立っています。第一に、導入料金はGemini 3.6 Flashのリリース時の半額であり、これにより今後4ヶ月半がこのモデルファミリー史上最も安価な期間となります。3.6からのアップグレードを検討している場合、3.6から3.7 Flashへの移行ガイドで変更点について説明しています。価格の引き下げだけで回帰テストの費用を賄えるでしょう。
第二に、出力トークンは両方の料金体系で入力トークンの5倍の費用がかかります。この比率は、このガイドの後のすべての最適化決定に影響を与えます。冗長なシステムプロンプトを削減してもわずかな節約にしかなりませんが、暴走した出力を制限すると大幅な節約になります。
上記の料金は、AI Studioキーを介して請求されるGemini APIを対象としています。Vertex AIは、独自のSKUでGoogle Cloudの請求を通じて実行され、コンテキストキャッシュやバッチ処理などの機能には独自の項目があるため、予算を確定する前に公式料金ページで現在の数値を確認してください。
実際のワークロードにかかる費用
100万トークンあたりの価格は、トラフィックを掛けて初めて意味を持ちます。ここに、仮定を記載した3つのワークロードプロファイルがありますので、ご自身の数値を当てはめてください。
ワークロード1:カスタマーサポートチャットボット
1日あたり10,000リクエストを仮定します。各リクエストには約2,000の入力トークン(システムプロンプト、短い履歴ウィンドウ、ユーザーメッセージ)が含まれ、約300の出力トークンを返します。
| 項目 | 1日のトークン数 | 導入時の1日あたり費用 | 標準時の1日あたり費用 |
|---|---|---|---|
| 入力 | 20M | $15.00 | $30.00 |
| 出力 | 3M | $11.25 | $22.50 |
| 合計 | 23M | $26.25 | $52.50 |
これは、30日間で計算すると、導入料金で月額約788ドル、標準料金で月額1,575ドルに相当します。今日の会話1ターンあたり、約0.25セントを支払うことになります。
ワークロード2:PDFドキュメントパイプライン
Gemini 3.7 FlashはPDFをネイティブに読み取り、GDP.pdfのベンチマークスコアは3.6 Flashから22.0%から34.0%に上昇したため、ドキュメント抽出はGoogleがここで実行することを期待するワークロードです。1日あたり500ドキュメントを想定し、それぞれ平均40,000入力トークン(長い契約書やレポート)で、1,000トークンの構造化された要約を生成するとします。
| 項目 | 1日のトークン数 | 導入時の1日あたり費用 | 標準時の1日あたり費用 |
|---|---|---|---|
| 入力 | 20M | $15.00 | $30.00 |
| 出力 | 0.5M | $1.88 | $3.75 |
| 合計 | 20.5M | $16.88 | $33.75 |
現在月額約506ドル、1月からは1,013ドルになります。形状に注目してください。ドキュメントが長く、要約が短いため、入力が大部分を占めます。キャッシングとバッチ処理がこのワークロードに最も大きな影響を与えます。
ワークロード3:エージェントループ
エージェントは呼び出しを増やします。1日あたり200タスクを想定し、それぞれ平均12回のモデル呼び出しを行い、各呼び出しが8,000の入力トークン(増大するコンテキストとツール結果)を運び、400の出力トークンを返すとします。
| 項目 | 1日のトークン数 | 導入時の1日あたり費用 | 標準時の1日あたり費用 |
|---|---|---|---|
| 入力 | 19.2M | $14.40 | $28.80 |
| 出力 | 0.96M | $3.60 | $7.20 |
| 合計 | 20.16M | $18.00 | $36.00 |
これは、導入料金で月額540ドル、標準料金で1,080ドルです。エージェントの課金から得られる教訓は、コンテキストがステップごとに増加するため、呼び出し回数とコンテキストの長さが複合的に影響するということです。12回の呼び出しから20回に膨らむタスクは、67%の追加費用がかかりますが、料金表には何も警告がありません。
もう一つ覚えておくべき数値は、64kの出力上限が、1回あたりの最悪のケースを現在約0.24ドル、来年約0.48ドルに制限していることです。試行ごとに最大出力になるリトライループはすぐに高価になりますが、際限なく高価になることはありません。
3.7 Flashの価格比較
プロバイダー間の正確なトークンあたりの比較は数週間で陳腐化するため、これを価格表ではなくポジショニングとして扱ってください。
Gemini 3.7 Flashは主力層に位置づけられます。Gemini独自のProライン、Claudeの大規模モデル、OpenAIのフラッグシップ層のようなフロンティアモデルよりもはるかに安価でありながら、わずか前までフラッグシップモデルが達成していたベンチマークスコア(DeepSWE v1.1で65.3%、WebDev Arena Eloで1588)と重なっています。Googleの賭けは、ほとんどのプロダクショントラフィックはフロンティアモデルを必要としないというものであり、導入割引は、その主張を自身のワークロードで試すための4ヶ月間の招待状です。
競争環境も重要です。予算層のプロバイダーは価格を逆方向に動かしています。DeepSeekはAPI料金を値上げし、チームにトークン予算の見直しを促しました。この話はDeepSeekの価格値上げとコスト最適化ガイドで取り上げられています。その教訓はGeminiにも直接当てはまります。利益を築いている価格は変動する可能性があり、Googleはすでにその日付と金額を伝えています。これはほとんどのプロバイダーが与える警告よりも多いです。
トラフィックがバースト的であったり実験的である場合は、2倍の料金は持続的なワークロードにのみ影響することを忘れないでください。導入期間中に3ドルかかるプロトタイプは、後で6ドルになります。誰も気にしません。しかし、月額10,000ドルのパイプラインが20,000ドルになることは、2月に財務チームが問い合わせる項目になるでしょう。
トークン消費を削減する5つの方法
出力と入力の5倍の価格比率と1月の料金2倍化は、同じ一連の手段を指しています。
- エンドポイントごとの出力トークンを制限する。
generationConfig内のmaxOutputTokensを、各エンドポイントが必要とする最小値に設定してください。サポートの返信が500トークンを超えることはめったにありません。上限をデフォルトの64kに設定したままにすると、一度の混乱した生成で通常の100倍の費用がかかる可能性があります。出力トークンには5倍の乗数があるため、これは最も高いリターンをもたらす変更です。 - 静的コンテキストをキャッシュする。 各リクエストで同じ3,000トークンのシステムプロンプトとポリシー文書を再送信している場合、同じバイトに対して1日に何千回も全入力価格を支払っています。コンテキストキャッシュは、繰り返されるトークンを割引料金で請求します。Gemini APIドキュメントで現在のキャッシュ設定と料金を確認してください。上記のチャットボットの場合、1,500トークンの静的プレフィックスをキャッシュすると、入力料金のほとんど半分を削減できます。
- 非インタラクティブな作業をバッチ処理する。 ドキュメントパイプラインはサブ秒の応答を必要としません。バッチ処理は、遅延と引き換えに割引料金を提供し、夜間のドキュメント実行は、まさにこのために存在するトラフィックの形状です。
- ルートごとにモデルを適切なサイズにする。 すべての呼び出しに3.7 Flashが必要なわけではありません。分類、ルーティング、短い抽出タスクは、Flash-Lite層のモデルでも費用の一部で十分に実行できます。多段階の計画、デバッグ、ツール呼び出しチェーンなど、支払っているものを利用する呼び出しには3.7 Flashを維持してください。
- フリーティアでプロトタイプを作成する。 AI Studioの無料クォータは、課金されるトークンが1つも発生する前にプロンプトと応答スキーマを確定させるのに十分です。無料のGemini APIアクセスガイドでは、無料パスがどこまで利用可能で、その制限がどこにあるかを説明しています。
Apidogでエンドポイントごとの費用を追跡する
見積もりは予算を立てるのに役立ちますが、リクエストごとの測定は予算内に収めるために役立ちます。すべてのGemini応答には、プロンプトと出力トークン数を含むusageMetadataブロックが含まれており、これはAPIテストレイヤーがコストメーターとして機能できることを意味します。
Apidogでのワークフローは次のとおりです。
- 本番環境の各エンドポイント(チャットターン、ドキュメント要約、エージェントステップ)ごとに1つのリクエストをコレクションに保存し、APIキーを
GEMINI_API_KEY環境変数にバインドします。 - 現実的なペイロードに対して各リクエストを発行し、応答から
usageMetadata.promptTokenCountとusageMetadata.candidatesTokenCountを抽出するテストシナリオを構築します。 - これらのカウントにアサーションを追加します。たとえば、プロンプトの編集がチャットエンドポイントの入力トークンを2,500を超えて押し上げる場合、変更がデプロイされる前にシナリオが失敗し、密かに請求額が25%増加するのを防ぎます。
- プロンプトまたはスキーマの変更があるたびにシナリオを再実行します。トークン数はレイテンシと同様に回帰します。違いは、トークン回帰が請求書として届くことです。
測定されたカウントにこのガイドの料金体系の価格を乗算すると、推測ではなく実際の応答に基づいたエンドポイントごとのコスト数値が得られます。アサーションベースのAPIスイートをすでに実行しているチームは、このパターンを認識するでしょう。QAエンジニア向けAPIテストガイドでは、サービス全体でこのようなシナリオを構築する方法について説明しています。
FAQ
Gemini 3.7 Flashの価格はいつ2倍になりますか?
2027年1月1日です。100万入力トークンあたり0.75ドル、100万出力トークンあたり3.75ドルの導入料金は2026年12月31日まで適用され、その後標準料金の1.50ドルと7.50ドルに移行します。Googleはリリース時に両方の料金体系を公表しているため、この値上げは推測ではなく、予定されています。
Gemini 3.7 FlashはGemini 3.6 Flashよりも安いですか?
リリース時点では、はい、そうです。3.7 Flashの導入価格は3.6 Flashのリリース価格の半額であり、ベンチマークは全体的に向上しています(DeepSWE v1.1は49.0%から65.3%に上昇)。両方を比較したい場合は、Gemini 3.7 Flashクイックリファレンスで完全な仕様とベンチマーク表を参照できます。
Vertex AIにも導入価格は適用されますか?
このガイドの料金は、AI Studioキーを介して請求されるGemini APIの料金です。Vertex AIは、独自のSKUとエンタープライズ条項でGoogle Cloudを通じて請求されます。Vertexで本番トラフィックを実行している場合は、同等性を仮定するのではなく、GCP課金コンソールと公式料金ページで現在の数値を確認してください。
入力トークンの請求対象となるものは何ですか?
送信するすべてのもの:テキスト、画像、動画、音声、PDFページはすべてトークンに変換され、入力料金で請求されます。入力コストが人々を驚かせるのは、長いドキュメントやメディアを多用するリクエストの場合であり、それが上記のパイプラインの例でドキュメントあたり40,000トークンを仮定している理由です。各応答のusageMetadataブロックは、後で正確なカウントを教えてくれます。
リクエストを送信する前にトークンを推定するにはどうすればよいですか?
APIのcountTokensエンドポイントを使用して、何も生成せずにペイロードを測定するか、いくつかの代表的なリクエストを送信し、応答からusageMetadataを読み取ります。いずれにせよ、実際のペイロードで測定してください。他のプロバイダーからのトークナイザーの直感は、モデルファミリー間ではうまく適用できません。
3.7 Flashがあなたのスタックにどのようにフィットするか
導入価格のGemini 3.7 Flashは、これほど高性能なモデルとしては過去最低の価格であり、Googleはその価格が終了する正確な日付を通知しました。賢明な対応策は、主力となるトラフィックを今すぐこれに移行させ、割引期間中にエンドポイントごとの実際のトークン消費量を測定し、その4ヶ月間のデータを使用して、何が3.7 Flashに残るか、何が軽量モデルに移行するか、そして標準料金の請求がどのように見えるかを、それが届く前に決定することです。
その計画の測定の部分にはツールが必要です。Apidogをダウンロードして、Geminiのリクエスト、環境、トークンのアサーション、コストチェックを1つのワークスペースに保持し、1月の請求書が発見するものではなく、予測した数値となるようにしましょう。
