Googleは、会話型動画モデルを2026年8月27日に一般公開しました。モデルIDはgemini-omni-1.1-flashで、6月30日にパブリックプレビューとして提供されたgemini-omni-flash-previewエンドポイントに代わるものです。プレビュー版で何かを構築した場合、期限があります。Googleは2026年9月30日にプレビューエンドポイントを停止します。
このGAリリースは、単なるバージョンアップではありません。4つの新機能が搭載され、それぞれがプレビュー版のプロダクションでの使用を困難にしていたギャップを解消しています。具体的には、最大40秒のシーン拡張、最初と最後のフレームの制御、安価な360pドラフトモード、そして4Kアップスケーリングです。この記事では、変更点、コスト、モデルの実行場所、そしてまだできないことについて説明します。
Omniファミリーとは何か、なぜGoogleがそもそも推論優先の動画モデルを構築したのかについて背景を知りたい場合は、Gemini Omniとは何かから始めてください。この記事では、その部分はすでに理解しており、1.1の詳細を知りたい方を想定しています。
Gemini Omni 1.1 Flashのできること
Omni 1.1 Flashは、テキスト、画像、動画を入力として受け取り、動画を返します。これは、ステートフルな多段階生成にGoogleが使用するのと同じインターフェースであるgenerateContentではなく、Interactions APIで実行されます。これは思った以上に重要です。クリップを生成した後、何も再アップロードすることなく、作成したばかりのクリップを編集するフォローアップのターンを送信できます。
モデルがサポートする5つのタスクの形式:
- テキストから動画へ:プロンプトを入力すると、クリップが出力されます。
- 画像から動画へ:1枚の画像がオープニングフレームになったり、動きのスタイルガイドになったりします。
- リファレンスから動画へ:それぞれ3秒までの参照クリップを最大3つ使用して、動き、見た目、キャラクターの一貫性を新しいシーンにマッピングします。
- 編集:すでに生成した動画内の何かを、会話を通じて変更します。
- 拡張:クリップの終わりにさらに10秒追加します。
参照クリップの音声は無視されます。モデルは動きと見た目のみを読み取ります。
シーン拡張で10秒のコンテキストが読み込まれるように
これが主要な変更点です。プレビューモデルは、クリップの最後の1秒を見てから継続していましたが、これはカラーパレットを安定させる程度のコンテキストであり、それ以上のことはできませんでした。キャラクターはブレ、カメラの動きはリセットされていました。動画を拡張することはできましたが、ショットを拡張することはできませんでした。
Omni 1.1は最大10秒の以前のコンテキストを分析し、Googleはその結果を「視覚的な一貫性と物語の一貫性の向上」と説明しています。10秒単位で最大累積40秒まで拡張できます。
注意すべき2つの制限があります。拡張はクリップの末尾にのみ追加されます。先頭にフッテージを追加したり、途中に挿入したりすることはできません。また、アップロードされた動画は、モデルが以前の状態を保持しているマルチターンインタラクション内に留まらない限り、入力は最大10秒までです。
40秒のシーン拡張ウォークスルーでは、リクエストの形式と、継ぎ目がどこに現れるかについて説明しています。
2つの画像間のキーフレーム制御
モデルに最初と最後のフレーム、およびそれらの間の動きを記述するプロンプトを与えることで、2つを繋ぐフッテージを生成できるようになりました。Googleは、カメラの軌道、ズームトランジション、ループクリップを明白な使用例として挙げています。
おもちゃではなく動画ツールを構築している人にとって、これは出力を予測可能にする機能です。テキストから動画への生成はスロットマシンのようなものです。フレーム補間は2つの固定点を与え、モデルに中間を解決させることで、エラーが発生する可能性のある範囲を大幅に縮小します。
360pドラフト作成とそれがコスト計算をどう変えるか
Omni 1.1は、360pのプレビューを720pよりも最大60%高速に、かつ3分の1のコストで生成します。Googleは意図するワークフローを明確にしています。プロンプトが適切になるまで360pでドラフトを作成し、その後、最終版を720p、1080p、または4Kで再レンダリングします。
この1つの変更は、今回のリリースにおける他のどの項目よりも制作予算にとって価値があります。動画生成は1秒あたりのコストが高く、プロンプトの試行中に生成されたもののほとんどは破棄されます。使い捨ての試行に対して3分の1の料金を支払うことは、自由に試行錯誤できるか、試行回数を制限するかの違いになります。完全な料金の内訳には、1秒あたりの計算が含まれています。
解像度はレスポンス形式で設定され、1080pと4kはネイティブレンダリングではなく、生成されたフレームのアップスケールです。
実行場所
Omni 1.1 Flashは以下を通じて利用可能です。
- 開発者向けのGoogle AI StudioのGemini API
- エンタープライズ展開向けのGemini Enterprise Agent Platform API
- AI Plus、Pro、およびUltraのサブスクライバー向けのGoogle Flow
- サブスクライバーがシーン拡張を利用できるGeminiアプリ
Googleは、自社製品内でこのモデルを実行するローンチパートナーも発表しました。Adobe Firefly、Figma Weave、Runway、GMI Cloudです。これらのツールのいずれかを使用している場合、すでにこのモデルにトラフィックを送信しています。
APIには無料枠がありません。AI Studioでレート制限付きの無料利用枠があるテキストFlashモデルとは異なり、Omniの出力は最初のリクエストから毎秒課金されます。モデル自体はYouTube ShortsとYouTube Createで無料で利用できますが、これらは異なる制限を持つ別の製品です。無料アクセスに関する概要では、各経路で何が得られるかを説明しています。
まだできないこと
モデルを中心とした機能を検討する前に、このリストを読んでください。
- 期待されるプロンプト制御がない。システム指示、
temperature、top_p、ストップシーケンス、ネガティブプロンプトはすべてサポートされていません。何かを除外したい場合は、通常のプロンプトに記述します。 - 地域制限。欧州経済領域、スイス、英国では、動画のアップロードと編集、未成年者を含む画像の編集は利用できません。モデル生成された動画はこれらの地域で引き続き編集可能です。
- 識別可能な人物。特定の識別可能な個人の編集はブロックされています。
- アップロードされた動画での会話。アップロードされたクリップをサイレントに拡張したり、マルチターンインタラクションで作業したりすることはできますが、他の人がアップロードしたものを拡張する際に会話を追加することはできません。
- 推論のための動画は一度に1つ。モデルは複数の入力動画にわたる推論は行いません。
- 実際には英語のみ。Googleは英語が完全にサポートされており、他の言語は未テストであると述べています。
すべての出力には、視聴者には見えないがプログラムで検出可能なSynthIDウォーターマークが付与されます。製品が出所の主張をする場合は、この点を考慮してください。
Omni 1.1 FlashかVeo 3.1か?
Googleは現在、同じAPIキーで2つの動画生成ファミリーを提供しており、これは非常に混乱を招く状況です。簡潔に言えば、Veo 3.1はネイティブオーディオを備えたシネマティックレンダラーであり、Omni 1.1 Flashは複数ターンにわたって対話する会話型モデルです。Omniの720p動画は、標準的なVeo 3.1の1秒あたりのコストの約4分の1であり、Veoにはマルチターン編集ループに相当するものはありません。
詳細な比較では、それぞれがどのようなケースで優れているかについて説明しています。すでにVeoとの統合がある場合、Veo 3.1 APIガイドは引き続き正確です。今回のリリースで廃止されるものはありません。
プレビューエンドポイントからの移行
gemini-omni-flash-previewを指すすべての機能は、2026年9月30日以降動作しなくなります。移行自体は通常、モデル文字列の1行変更で済みますが、それだけだと仮定する前に確認すべき2つの点があります。
- 解像度のデフォルト。現在、720pがデフォルトであり、360pと4Kのオプションは新規です。コードが固定出力サイズを前提としている場合、実際に何が返されるかを確認してください。
- レスポンスサイズ。4MBを超える動画は、インラインのbase64ではなくURIとして返されます。ハンドラーが
output_video.dataのみを読み取る場合、高解像度の動画では何も静かに返されなくなります。
この両方を捕捉する最もクリーンな方法は、APIクライアントにリクエストを保存し、切り替える前に2つのモデルID間のレスポンスを比較することです。Apidogはこれをうまく処理します。モデルIDを環境変数に入れ、保存されたリクエストを1つ保持し、環境を切り替えて比較します。APIウォークスルーでは、この設定をステップバイステップで説明しています。
FAQ
Gemini Omni 1.1 FlashのモデルIDは何ですか? gemini-omni-1.1-flashです。廃止されるプレビューIDはgemini-omni-flash-previewです。
Gemini Omni 1.1 Flashはいつリリースされましたか? GAリリースとして2026年8月27日です。プレビュー版は2026年6月30日に提供されました。
Gemini Omni 1.1 Flashは無料ですか? いいえ。Omniには無料枠がないため、すべての生成が課金されます。Gemini 3.6 Flashのようなテキストモデルには無料のAI Studioレーンがありますが、Omniにはありません。
Gemini Omniの動画はどのくらいの長さになりますか? クリップは10秒で生成され、シーン拡張により10秒単位で累積40秒まで延長できます。
Gemini Omniは音声を生成しますか? ドキュメントでは動画出力についてのみ触れており、参照クリップの音声は無視されます。Veo 3.1はネイティブ音声生成に対応したモデルです。音声が重要な場合は、そちらから始めてください。
自分で撮影した動画を編集できますか? はい、EEA、スイス、英国以外であれば、最大10秒の入力で可能です。Files APIでアップロードし、URIを入力として渡します。
Omni 1.1 Flashは、実際に製品として出荷できる形になったこのモデルの最初のバージョンです。ショットの一貫性を保つシーン拡張、出力の予測可能性を高めるキーフレーム、そして繰り返し作業を費用対効果の高いものにするドラフトモード。GAモデルIDに対して保存されたリクエストを1つ設定し、使用予定のすべての解像度でのレスポンス形状を確認し、9月末までにプレビューエンドポイントから移行してください。期限後に確認するのではなく、期限前にその確認を保存したい場合は、Apidogをダウンロードしてください。
