Gemini Omni 1.1 Flash generiert 10-sekündige Clips. Szenenerweiterung ist der Weg, dies zu umgehen: Jeder Erweiterungsaufruf fügt weitere 10 Sekunden hinzu, bis zu kumulativen 40 Sekunden.
Der Mechanismus existierte bereits im Vorabmodell, war aber nicht sehr nützlich. Die Vorschau betrachtete die letzte Sekunde des Materials, bevor es fortgesetzt wurde, was gerade genug Kontext ist, um die Farben grob konsistent zu halten und sonst nichts. Charaktere wechselten die Kleidung. Kamerabewegungen wurden zurückgesetzt. Die GA-Veröffentlichung am 27. August 2026 erhöhte dieses Fenster auf 10 Sekunden vorherigen Kontexts, und Google schreibt der Änderung „verbesserte visuelle Konsistenz und narrative Kohärenz“ zu.
Dieser Leitfaden behandelt, wie man es aufruft, welche Grenzen tatsächlich bestehen und wie man verhindert, dass eine 40-sekündige Sequenz im dritten Segment auseinanderfällt.
Der grundlegende Erweiterungsaufruf
Die Erweiterung funktioniert über die Files API. Laden Sie den Clip hoch, übergeben Sie seinen URI zusammen mit einem Prompt, der beschreibt, was als Nächstes passiert:
import base64
from google import genai
client = genai.Client()
video_file = client.files.upload(file="my_video.mp4")
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
input=[
{"type": "document", "uri": video_file.uri},
{"type": "text", "text": "Continue the scene."},
],
)
with open("extended.mp4", "wb") as f:
f.write(base64.b64decode(interaction.output_video.data))
Uploads werden asynchron verarbeitet, daher fragen Sie den Dateistatus ab, bevor Sie die Interaktion senden:
import time
while video_file.state == "PROCESSING":
time.sleep(10)
video_file = client.files.get(name=video_file.name)
if video_file.state == "FAILED":
raise ValueError(video_file.state)
Wenn das Video, das Sie erweitern, aus Omni in derselben Sitzung stammt, überspringen Sie den Upload vollständig und verketten stattdessen die Interaktions-ID. Dieser Pfad ist günstiger in Bezug auf Tokens und behält mehr Zustand bei:
res2 = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=res1.id,
input="The camera pulls back to reveal the whole street.",
)
Der API-Walkthrough behandelt den Rest der Anfrageoberfläche, einschließlich Auflösungs- und Lieferoptionen.
Einen Charakter in die Erweiterung einbeziehen
Sie können Referenzmedien an eine Erweiterung anhängen und über den Prompt darauf verweisen. Hochgeladene Referenzen erhalten Slots, die Sie als <IMAGE_REF_0>, <IMAGE_REF_1> usw. ansprechen:
video_file = client.files.upload(file="my_video.mp4")
character_img = client.files.upload(file="character.png")
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
input=[
{"type": "document", "uri": video_file.uri},
{"type": "document", "uri": character_img.uri},
{"type": "text", "text": "Extend this video: have the character shown in <IMAGE_REF_0> enter the scene and wave."},
],
)
Videoreferenzen funktionieren ebenfalls, begrenzt auf drei Clips von jeweils drei Sekunden. Das Modell liest sie für Bewegung und Aussehen; Audio auf Referenzclips wird ignoriert.
Die Grenzen, die Sie kennen sollten, bevor Sie eine Sequenz planen
40 Sekunden sind die Obergrenze. Insgesamt vier Segmente: eine Generierung plus drei Erweiterungen. Es gibt keine Möglichkeit, innerhalb einer einzigen Sequenz weiterzugehen.
Nur anhängen. Die Erweiterung fügt am Ende eines Clips hinzu. Sie können kein Material voranstellen oder in die Mitte einfügen. Wenn Segment zwei falsch ist, generieren Sie ab Segment zwei neu, und alles, was danach kommt, geht damit verloren.
Hochgeladene Eingabe ist auf 10 Sekunden begrenzt. Das ist die Grenze für Videos, die Sie hochladen. Mehrstufige Ketten über previous_interaction_id sind davon nicht betroffen, da das Modell den früheren Zustand bereits kennt.
Kein Dialog bei erweiterten Uploads. Sie können den hochgeladenen Clip einer anderen Person stillschweigend erweitern oder in einer mehrstufigen Interaktion arbeiten, aber Sie können keinen Dialog hinzufügen, wenn Sie einen Upload erweitern.
Regionale Beschränkungen. Das Hochladen und Bearbeiten von Videos ist im Europäischen Wirtschaftsraum, der Schweiz und Großbritannien nicht verfügbar. Vom Modell generierte Videos bleiben in diesen Regionen bearbeitbar, sodass der Pfad mit previous_interaction_id dort weiterhin funktioniert, während der Upload-Pfad nicht funktioniert.
Ein Video gleichzeitig. Das Modell kann nicht über mehrere Eingabevideos hinweg Schlussfolgerungen ziehen.
Den gesamten Ablauf entwerfen, bevor Sie ihn rendern
Hier ist der Workflow, der am meisten Geld und Frustration spart.
Eine 40-sekündige Sequenz in 720p kostet etwa 4,06 $ an Videoausgabe, und der Fehlermodus ist spezifisch: Die Geschichte driftet irgendwo im dritten Segment ab, sodass Sie die Segmente drei und vier neu generieren, und manchmal ändert das etwas, das Ihnen im Beginn von Segment drei gefallen hat. Sie können mehrere vollständige Renderings verbrauchen, um die Version zu finden, die passt.
Entwerfen Sie den gesamten Ablauf zuerst in 360p. Es generiert bis zu 60 % schneller zu einem Drittel der Kosten, sodass dieselben vier Segmente etwa 1,35 $ kosten. Bestätigen Sie, dass die Geschichte alle vier Erweiterungen übersteht, und rendern Sie dann in 720p oder höher mit den von Ihnen validierten Prompts neu. Der Preisartikel enthält die vollständige Berechnung.
Legen Sie die Auflösung im Antwortformat fest:
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
input=[
{"type": "document", "uri": video_file.uri},
{"type": "text", "text": "Continue the scene."},
],
response_format={"type": "video", "resolution": "360p"},
)
Prompts schreiben, die vier Segmente überleben
Einige Muster, die besser halten als andere.
Beschreiben Sie die Änderung, nicht die gesamte Szene. Das Modell sieht bereits 10 Sekunden dessen, was zuvor kam. Die Neubesprechung der Szene lädt dazu ein, das, was bereits auf dem Bildschirm ist, neu zu interpretieren. „Die Kamera fährt auf die Tür zu“ ist besser als ein neuer Absatz über den Raum.
Geben Sie ihm eine Bewegung pro Segment. Erweiterungen, die zwei Ereignisse anfordern, liefern tendenziell eine überstürzte Version beider. Zehn Sekunden sind eine Aktion.
Halten Sie Kontinuitätsanker explizit. Die Benennung dessen, was konstant bleiben muss („dieselbe rote Jacke“, „derselbe niedrige Winkel“), gibt dem Modell etwas, woran es sich über die Naht hinweg festhalten kann.
Kämpfen Sie nicht gegen die Nur-Anhängen-Grenze an. Planen Sie Ihre Sequenz in der Reihenfolge, in der sie abgespielt wird. Es gibt keine Möglichkeit, den Anfang später zu korrigieren, ohne alles danach neu zu generieren.
Prompt-Gestaltung hat hier viel Gewicht, und der Veo-Prompt-Leitfaden behandelt Prinzipien, die zwischen Videomodellen übertragbar sind.
Ihre Erweiterungen zweimal auf dieselbe Weise überprüfen
Vier verkettete Aufrufe bedeuten vier Stellen, an denen sich eine Änderung im Modellverhalten zeigen kann, und die Videoausgabe ist schwer auf Regressionen zu prüfen, wenn man nur das Endergebnis betrachtet.
Speichern Sie jede Stufe als eigene Anfrage in Apidog, mit der Datei-URI und Interaktions-ID in Umgebungsvariablen, damit Sie ein bestimmtes Segment erneut ausführen können, ohne die Kette manuell neu aufbauen zu müssen. Prüfen Sie die Antwortstruktur, da eine Erweiterung mit höherer Auflösung die Datei über 4 MB hinaus treiben und Sie von inline base64 zu einem URI wechseln kann. Erhöhen Sie das Timeout weit über den Standardwert hinaus; Erweiterungen laufen länger als die anfängliche Generierung, da das Modell zuerst 10 Sekunden Kontext liest.
Dieser Aufbau kostet zehn Minuten und macht sich bezahlt, sobald Sie wissen müssen, ob das Nahtproblem an Ihrem Prompt oder an einem Modell-Update liegt. Laden Sie Apidog herunter, um es einzurichten.
FAQ
Wie lang kann ein Gemini Omni Video sein? Kumulativ 40 Sekunden, bestehend aus einer 10-sekündigen Generierung plus drei 10-sekündigen Erweiterungen.
Kann ich ein selbst gefilmtes Video erweitern? Ja, bis zu 10 Sekunden Eingabe, außerhalb des EWR, der Schweiz und Großbritanniens. Laden Sie es über die Files API hoch und übergeben Sie den URI.
Kann ich am Anfang eines Clips hinzufügen? Nein. Die Erweiterung fügt nur am Ende an.
Warum ändert mein Charakter sein Aussehen zwischen Segmenten? Normalerweise beschreibt der Prompt die Szene neu anstatt der Änderung, oder der Kontinuitätsanker ist nicht explizit. Benennen Sie, was gleich bleiben muss, und erwägen Sie, ein Charakterbild als Referenz in der Erweiterung zu übergeben.
Kostet jede Erweiterung extra? Ja. Jede Erweiterung berechnet ihre eigenen 10 Sekunden Videoausgabe plus die Eingabetokens für den Kontext, den sie liest.
Was, wenn ich mehr als 40 Sekunden benötige? Veo 3.1 erweitert jeweils um 7 Sekunden auf bis zu 148 Sekunden, nur in 720p. Der Modellvergleich behandelt diesen Kompromiss, und der API-Leitfaden von Veo enthält die Integrationsdetails.
Szenenerweiterung ist die Funktion, die Omni vom Demo zum lieferbaren Produkt macht, aber sie belohnt Planung. Storyboarden Sie die vier Schlüsselmomente, entwerfen Sie den gesamten Ablauf in 360p, beschränken Sie jeden Prompt auf eine Bewegung und geben Sie das Geld für 720p nur für die Version aus, von der Sie bereits wissen, dass sie funktioniert.
