Google kini menyediakan dua model video generatif dengan kunci API yang sama, dan keduanya bukan versi satu sama lain. Veo 3.1 adalah perender sinematik dengan audio bawaan. Gemini Omni 1.1 Flash, tersedia secara umum sejak 27 Agustus 2026, adalah model percakapan yang dapat Anda edit secara bergiliran.
Memilih di antara keduanya bergantung pada tiga pertanyaan: apakah Anda membutuhkan suara, apakah Anda perlu mengulang klip setelah melihatnya, dan berapa lama durasi video yang jadi. Berikut adalah bagaimana setiap model menjawabnya.
Tabel perbandingan
| Gemini Omni 1.1 Flash | Veo 3.1 | |
|---|---|---|
| ID Model | gemini-omni-1.1-flash |
veo-3.1-generate-preview (ditambah varian cepat dan ringan) |
| Antarmuka API | API Interaksi (/v1beta/interactions) |
generateContent, operasi jangka panjang |
| Audio bawaan | Tidak | Ya, selalu aktif |
| Durasi klip dasar | 10 detik | 4, 6, atau 8 detik |
| Durasi maks via ekstensi | 40 detik, dalam langkah 10 detik | 148 detik, 7 detik setiap kali, hingga 20 ekstensi |
| Konteks dibaca saat memperpanjang | Hingga 10 detik rekaman sebelumnya | Tidak disebutkan |
| Pengeditan percakapan | Ya, via previous_interaction_id |
Tidak |
| Bingkai pertama dan terakhir | Ya | Ya, via lastFrame |
| Media referensi | Hingga 3 klip video masing-masing 3 detik | Hingga 3 gambar referensi |
| Resolusi | 360p, 720p, 1080p, 4K | 720p, 1080p, 4K (hanya 720p saat diperpanjang) |
| Rasio aspek | 16:9, 9:16 | 16:9, 9:16 |
| Biaya 720p per detik | ~$0.10 | $0.40 standar, $0.10 cepat, $0.05 ringan |
| Tingkat gratis | Tidak | Tidak |
| Tanda air | SynthID | SynthID |
Di mana Omni 1.1 Flash unggul
Anda perlu mengubah sesuatu setelah melihatnya. Ini adalah pembeda yang sesungguhnya. Omni berjalan pada API Interaksi, jadi Anda menghasilkan klip, melihatnya, dan mengirim giliran lanjutan yang mengeditnya:
res1 = client.interactions.create(
model="gemini-omni-1.1-flash",
input="A woman playing violin outdoors.",
)
res2 = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=res1.id,
input="Make the violin invisible.",
)
Tidak ada pengunggahan ulang, tidak ada deskripsi ulang adegan. Veo tidak memiliki padanan: setiap permintaan Veo adalah generasi baru, dan perubahan berarti prompt baru dan 'putaran dadu' baru.
Anda ingin membuat draf dengan murah. Tingkat 360p Omni menghasilkan hingga 60% lebih cepat dengan sepertiga biaya 720p. Resolusi terendah Veo adalah 720p. Ketika Anda sudah mencoba dua belas kali dengan sebuah prompt, perbedaan itu berlipat ganda; rincian harga menjelaskan angkanya.
Anda memasukkannya video, bukan gambar diam. Omni mengambil hingga tiga klip referensi masing-masing tiga detik dan memetakan gerakan mereka ke adegan baru. Referensi Veo adalah gambar. Jika Anda mencocokkan gerakan atau karakter di seluruh adegan, referensi gerakan melakukan pekerjaan yang tidak bisa dilakukan oleh gambar diam.
Anda membutuhkan bidikan untuk tetap menyatu selama ekstensi. Omni membaca hingga 10 detik rekaman sebelumnya sebelum melanjutkan, dibandingkan dengan satu detik terakhir yang digunakan model pratinjau. Panduan ekstensi adegan menjelaskan manfaatnya.
Di mana Veo 3.1 unggul
Anda membutuhkan audio. Veo menghasilkan audio bawaan dengan video. Dokumentasi Omni mencakup keluaran video dan mengabaikan audio pada klip referensi. Jika hasil akhir Anda memiliki suara, ini akan menentukannya sendiri, dan panduan API Veo 3.1 adalah integrasi yang perlu dibaca.
Anda membutuhkan lebih dari 40 detik. Veo memperpanjang 7 detik setiap kali hingga 20 kali, mencapai 148 detik. Omni membatasi pada 40 detik. Perhatikan batasannya: keluaran Veo yang diperpanjang hanya 720p, jadi klip panjang dan klip 4K adalah pekerjaan yang berbeda.
Anda menginginkan detik termurah. Veo 3.1 Lite berjalan $0.05 per detik pada 720p, setengah dari tarif Omni. Ini menghilangkan dukungan 4K sebagai gantinya. Untuk generasi volume tinggi, berisiko rendah, Lite adalah batas anggaran terendah di kedua keluarga.
Anda menginginkan klip yang lebih pendek. Veo melakukan generasi 4 detik dan 6 detik. Omni menghasilkan 10 detik. Jika Anda membutuhkan potongan 4 detik, Veo menagih untuk 4 detik dan Omni menagih untuk 10 detik.
Keputusan dalam empat baris
- Membutuhkan suara? Veo 3.1.
- Membutuhkan durasi lebih dari 40 detik? Veo 3.1.
- Membutuhkan pengeditan setelah Anda melihatnya, atau membuat draf dengan anggaran terbatas? Omni 1.1 Flash.
- Membutuhkan detik termurah dan tidak ada yang lain? Veo 3.1 Lite.
Banyak alur kerja akhirnya menggunakan keduanya: Omni untuk menjelajahi dan mengunci bidikan secara percakapan, Veo untuk merender hasil akhir dengan audio. Keduanya berbagi kunci API, jadi menjalankan keduanya tidak memakan biaya apa pun dalam pengaturan.
Dua integrasi, bukan satu
Bagaimanapun pilihan Anda, ingatlah bahwa keduanya adalah endpoint yang berbeda secara struktural. Omni adalah POST ke /v1beta/interactions dengan model di dalam body, dan ia mengembalikan video secara inline sebagai base64 kecuali jika file melebihi 4MB, dalam hal ini Anda akan mendapatkan URI. Veo berjalan sebagai operasi jangka panjang yang Anda polling, dan file yang dihasilkan akan tersimpan di server Google selama 2 hari sebelum dihapus.
Perbedaan itu penting jika Anda berencana untuk menukar model nanti. Kode yang ditulis untuk satu model tidak akan berpindah ke model lain hanya dengan perubahan string model, dan lapisan abstraksi apa pun yang Anda bangun perlu menangani operasi yang di-polling dan body respons dua bentuk. Panduan API Omni mencakup penanganan respons tersebut.
Keduanya layak disematkan dengan permintaan tersimpan sebelum Anda membangun di atasnya. Siapkan satu permintaan per model di Apidog, simpan kunci API dalam variabel lingkungan, tegaskan bentuk respons, dan tingkatkan waktu tunggu jauh melampaui default. Saat Anda membandingkan kualitas keluaran, menjalankan prompt yang sama melalui kedua permintaan tersimpan adalah pekerjaan dua klik, bukan dua perintah curl yang akan Anda tulis ulang dari memori bulan depan.
FAQ
Apakah Gemini Omni pengganti Veo? Tidak. Google menyediakan keduanya, dan Veo 3.1 tidak usang. Keduanya adalah alat yang berbeda yang kebetulan sama-sama menghasilkan video.
Mana yang lebih murah? Pada 720p, Omni (~$0.10/detik) dan Veo 3.1 Fast ($0.10/detik) setara. Veo 3.1 Lite lebih murah dengan $0.05. Veo 3.1 Standar adalah yang paling mahal dengan $0.40.
Bisakah salah satu menghasilkan video dengan dialog? Veo menghasilkan audio bawaan. Keluaran video Omni tidak mencakup generasi audio, dan tidak dapat menambahkan dialog saat memperpanjang video yang diunggah.
Apakah keduanya memberi tanda air pada keluarannya? Ya, keduanya menerapkan SynthID, yang tidak terlihat oleh pemirsa dan dapat dideteksi secara programatis.
Bagaimana dengan Sora atau API video lainnya? Penyedia yang berbeda, kompromi yang berbeda. OpenAI Sora 2 dan Seedance 1.0 patut dipertimbangkan jika Anda mengevaluasi di luar jajaran Google.
Mana yang harus saya mulai? Jika Anda membuat prototipe dan tidak membutuhkan suara, mulailah dengan Omni pada 360p. Ini adalah cara termurah untuk mengetahui apakah video yang dihasilkan dapat menyelesaikan masalah Anda sama sekali. Unduh Apidog dan simpan permintaan pertama itu agar perbandingan dapat diulang.
Ringkasan jujur: Veo merender, Omni bercakap-cakap. Dokumentasi pembuatan video Google mencakup keduanya, dan tidak ada yang akan hilang, jadi pilihlah per pekerjaan daripada per tim.
