Googleは2026年7月21日にFlashティアを刷新し、Gemini 3.5 Flash-Liteはその中でも最も手頃な価格帯のモデルです。これは、今日利用できるGeminiの中で最も安価で高速なモデルであり、分類、抽出、短いチャット返信、スループットとコストが深い推論よりも重視されるシンプルな情報検索応答など、大量かつレイテンシに敏感な作業向けに構築されています。1日に何百万もの小さなリクエストを処理している場合、Googleはこのティアをあなたのホットパスで使ってほしいと考えています。
この刷新では3つのモデルが同時にリリースされ、そのネーミングは人々を混乱させがちです。そこで、まずはその点を迅速に解消し、その後、仕様、価格設定、ベンチマーク、そしてエンドポイントを自分でテストする方法について掘り下げていきましょう。
Gemini 3.5 Flash-Liteとは?
Gemini 3.5 Flash-Liteは、GoogleのGeminiファミリーの中で最も小さく、最も安価なモデルです。最も高度な推論ではなく、速度と量に特化してチューニングされています。Googleによると、このモデルは毎秒約350出力トークンを記録するため、負荷がかかっていても応答はほぼ瞬時に感じられます。モデルID gemini-3.5-flash-lite を使ってGemini API経由で呼び出します。

退屈で反復的、かつ高頻度なタスクに適用するティアと考えてください。サポートチケットのタグ付け、ドキュメントからのフィールド抽出、検索されたテキストの塊からの短い質問への回答、ユーザーが遅延に気づく前に応答する必要があるチャットウィジェットの駆動などです。これらのそれぞれにおいて、あなたは大量のリクエストを送信し、それぞれが安価で迅速であることを望みます。Flash-Liteは、そのようなワークロードに対するGoogleの回答です。

これは3つのモデルからなるFlashの刷新の一部として登場しました。新しい主力モデルであるGemini 3.6 Flash、このGemini 3.5 Flash-Lite、そしてゲート付きセキュリティモデルであるGemini 3.5 Flash Cyberです。Google自身の概要はGoogleのブログで、モデルの詳細はDeepMind Flashページで読むことができます。Flash-Liteは、そのスタックの中で価格面では最下位に位置し、純粋な速度では最上位に位置します。
なぜ3.6ではなく3.5なのか?
ここが混乱しやすい点です。新しい主力モデルはGemini 3.6 Flashです。しかし、Flash-Liteは3.5に留まり、ゲート付きのCyberセキュリティモデルも同様でした。つまり、1回の発表、1日で、3つのモデル、2つのバージョン番号がリリースされたのです。これはGoogle側のタイプミスでも、この記事の間違いでもありません。Googleは異なるバージョニングを採用しました。主力Flashは3.6にジャンプしましたが、LiteおよびCyberの派生モデルは3.5のラベルを維持しました。
なぜGoogleはこのようなことをするのでしょうか?バージョン番号はモデルを追跡し、発表イベントを追跡するものではありません。主力モデルはより大きな世代的な進歩を遂げたため、3.6のタグを獲得しました。Flash-Liteも新しいモデルですが、Googleはこれを3.5ラインと整合させることを選択しました。追跡するには面倒ですが、これがラベル付けの現状です。
もう一つ、今ここで解消しておくべき混乱の元があります。Gemini 3.5 Flash-Liteは、前世代の古いGemini 3.1 Flash-Liteとは異なります。「Flash-Lite」という名前は同じですが、モデルも数字も異なります。もし以前3.1 Flash-Liteで構築していたとしても、これは既存のものをリネームしたものではなく、より新しく高速な後継モデルです。推測する前にモデルIDを確認してください: gemini-3.5-flash-lite が新しいモデルです。
仕様と価格設定
Flash-Liteのコストと動作は以下の通りです。すべての価格はGemini APIを介した100万トークンあたりのものです。
| 属性 | 値 |
|---|---|
| モデルID | gemini-3.5-flash-lite |
| 入力価格 | $0.30 / 100万トークン |
| 出力価格 | $2.50 / 100万トークン |
| 速度 | 約350出力トークン/秒 |
| 無料枠 | あり (Google AI Studio、レート制限あり) |
| コンテキストキャッシング | $0.03 / 100万トークン + $1.00 / 100万トークン/時間ストレージ |
入力$0.30、出力$2.50は、現在のGeminiラインナップで公開されている最も安価な料金です。比較として、主力モデルである3.6 Flashは入力が$1.50、出力が$7.50であり、Flash-Liteは入力コストが約5分の1、出力コストが約3分の1となっています。何百万もの短い呼び出しを処理する場合、この価格差が重要になります。Googleがこのページを直接更新するため、現在の数値はGemini APIの価格ドキュメントで確認できます。
コンテキストキャッシングは、固定のシステムプロンプトや長い参照ドキュメントなど、繰り返し送信するプロンプトのコストをさらに削減します。トークンをキャッシュするために少額の料金と時間ごとのストレージ料金を支払い、キャッシュされた入力は再利用ごとに大幅に安価になります。
パフォーマンスはどうなのか?
見出しの数字:Gemini 3.5 Flash-LiteはTerminal-Bench 2.1で54%を記録し、前身モデルの31%から向上しました。これはLiteクラスのモデルとしては大きな飛躍であり、これまでのモデルでは対応しきれなかったタスクにも、この小規模ティアが真に役立つようになったことを意味します。
強みは、分類、抽出、チャット応答、シンプルな検索拡張応答です。これらは、高速で安価なモデルがその価値を発揮するタスクです。入力をカテゴリに分類したり、雑多なテキストから構造化データを抽出したり、検索された文章に基づいた短い質問に答えたり、軽量なアシスタントを応答性の高い状態に保ったりするなどの処理を、Flash-Liteはすべてうまく、そして迅速にこなします。
さて、正直な限界点です。Flash-Liteは品質と引き換えにコストと速度を追求しています。最も困難なエージェントコーディング、長い多段階のツールチェーン、深い推論問題には向いていません。タスクが多くのステップにわたる計画を立てたり、ツールを順番に確実に呼び出したり、複雑なコードベースを推論したりする必要がある場合は、代わりにGemini 3.6 Flashまたはそれ以上のモデルが必要になるでしょう。そのような作業にFlash-Liteを選ぶと、間違った回答によって節約した以上の費用がかかるまで、お金を節約できます。タスクに合わせてティアを選択してください。
GoogleがFlash-Liteを使用する場所
GoogleはFlash-Liteを開発者に販売しているだけではありません。このモデルをGoogle検索にも導入しています。これは有用なシグナルです。Googleが検索規模のトラフィックにモデルを投入するときは、レイテンシーや予算の問題を起こすことなく、膨大な数のクエリを処理するのに十分な速さと安さがあるモデルだと確信しているということです。
あなたにとって、それは証明となるでしょう。Flash-Liteが検索に適している理由である高スループットと低コストは、まさにそれが多忙な本番エンドポイントに適している理由でもあります。検索トラフィックを処理できるのであれば、あなたの分類パイプラインも処理できるはずです。
Flash-Lite vs Gemini 3.6 Flash: どちらを選ぶべきか?
結論から言うと、タスクがシンプルで大量、かつ速度に敏感な場合はFlash-Liteを選択してください。より強力な推論、コーディング、または多段階のエージェント作業が必要な場合は、3.6 Flashを選択してください。
Flash-Liteは価格とレイテンシーで優位に立ちます。最も安価なGeminiであり、毎秒約350トークンで実行されるため、分類、抽出、短いチャット、シンプルなRAGを大規模に行うのに適したデフォルトモデルです。Gemini 3.6 Flashはトークンあたりのコストは高くなりますが、より強力な推論、優れたコーディング、Flash-Liteが躓くようなエージェントワークフローにも対応できます。3.6 Flashの価格設定はそれを反映しており、追加の機能に対して費用を支払うことになります。
実用的なパターンとしては、難易度によってルーティングする方法があります。簡単で頻繁な呼び出しはFlash-Liteに送り、難しいものは3.6 Flashにエスカレートします。これにより、トラフィックの大部分では安価なスループットを得られ、コストに見合う場所でのみより強力な推論を利用できます。速度、価格、品質に関する詳細な比較については、Gemini 3.5 Flash-Lite vs 3.6 Flashをご覧ください。
アクセス方法とテスト方法
Flash-LiteはGemini API上で動作します。最も早く始める方法はGoogle AI Studioです。APIキーを取得すれば、無料枠で課金設定なしにモデルを試すことができます。無料枠はレート制限があり、Googleが無料枠のデータを使って製品を改善する可能性があるため、機密性の高い入力は有料キーで使用するように注意してください。完全なリファレンスはGemini APIドキュメントにあります。モデルをgemini-3.5-flash-liteに設定すれば、最も安価なティアを呼び出していることになります。
リクエストが機能し始めたら、それを維持したいと思うでしょう。GoogleがAPIを更新すると、価格、レート制限、応答の形式が変更される可能性があり、高速だが時折間違った動作をするLiteモデルには、ずれを検出するためのアサーションが必要です。そこでAPIクライアントが役立ちます。Apidogを使えば、GeminiエンドポイントへのPOSTリクエストを構築し、APIキーを環境変数として保存してリクエストボディに決して表示されないようにし、ステータスコードと依存するJSONフィールドに対してアサーションを追加できます。
そこから、そのリクエストを保存されたリグレッションテストに変換し、実行をスケジュールして、ユーザーが気づく前に壊れた応答や価格変更を検出できます。Apidogはモデルを実行したり、Gemini APIを置き換えたりするものではありません。エンドポイントを呼び出し、検証し、監視するために使用するクライアントです。gemini-3.5-flash-liteエンドポイントを他のAPIスタックと並行してテストしたい場合は、Apidogをダウンロードしてください。
よくある質問 (FAQ)
Gemini 3.5 Flash-LiteはGemini 3.6 Flashと同じですか? いいえ、異なります。これらは2026年7月21日の同じ刷新でリリースされた2つの異なるモデルです。Flash-Liteは、シンプルで大量の作業向けの最も安価で高速なティアです。3.6 Flashは、より強力な推論とコーディング機能を備えた、より高価な主力モデルです。
なぜ3.6ではなく3.5なのですか? バージョニングが混在しているためです。Googleは主力Flashを3.6に上げましたが、同じリリースでFlash-Liteとゲート付きCyberモデルを3.5のラベルに維持しました。この番号はモデルの系統を追跡するものであり、リリース日を追跡するものではありません。
これは以前のGemini 3.1 Flash-Liteですか? いいえ。Gemini 3.5 Flash-Liteは新しいモデルです。古い3.1 Flash-Liteは前世代のものです。ファミリー名は同じですが、モデルとバージョンが異なるため、新しいモデルであることを確認するにはモデルID gemini-3.5-flash-lite を確認してください。
Gemini 3.5 Flash-Liteは無料ですか? Google AI Studioを通じて無料枠があり、レート制限があります。テストや軽い使用には問題ありません。本番環境で大量に使用する場合は有料のAPIキーに移行し、Googleは無料枠のデータを使用して製品を改善する可能性があります。
Flash-Liteは何に最適ですか? 分類、抽出、短いチャット応答、および大量のシンプルな検索拡張応答に優れています。困難なエージェントコーディングや、3.6 Flashの方が適しているような長い多段階の推論には向いていません。
