Google đã cung cấp rộng rãi mô hình video đàm thoại của mình vào ngày 27 tháng 8 năm 2026. ID mô hình là gemini-omni-1.1-flash, và nó thay thế điểm cuối gemini-omni-flash-preview đã được phát hành dưới dạng bản xem trước công khai vào ngày 30 tháng 6. Nếu bạn đã xây dựng bất cứ thứ gì dựa trên bản xem trước, bạn có thời hạn: Google sẽ tắt điểm cuối xem trước vào ngày 30 tháng 9 năm 2026.
Bản phát hành GA (General Availability) không phải là một bản cập nhật phiên bản mà không có thay đổi nào. Bốn khả năng đã được ra mắt cùng với nó, và mỗi khả năng đều khắc phục một lỗ hổng khiến bản xem trước khó sử dụng trong môi trường sản xuất: kéo dài cảnh quay lên tới 40 giây, kiểm soát khung hình đầu và cuối, chế độ nháp 360p giá rẻ và nâng cấp lên 4K. Bài đăng này sẽ đề cập đến những thay đổi, chi phí, nơi mô hình hoạt động và những gì nó vẫn chưa thể làm được.
Nếu bạn muốn tìm hiểu về dòng Omni là gì và tại sao Google lại xây dựng một mô hình video ưu tiên khả năng lập luận, hãy bắt đầu với Gemini Omni là gì. Bài đăng này giả định bạn đã biết phần đó và muốn tìm hiểu chi tiết về phiên bản 1.1.
Gemini Omni 1.1 Flash làm được gì
Omni 1.1 Flash nhận văn bản, hình ảnh và video làm đầu vào, và trả về video. Nó chạy trên API Interactions thay vì generateContent, đây là giao diện mà Google sử dụng cho việc tạo đa lượt có trạng thái. Điều đó quan trọng hơn những gì nghe có vẻ: bạn có thể tạo một đoạn clip, sau đó gửi một lượt tiếp theo để chỉnh sửa đoạn clip vừa tạo, mà không cần tải lên lại bất cứ thứ gì.
Năm loại tác vụ mà mô hình hỗ trợ:
- Văn bản thành video: một lời nhắc được đưa vào, một đoạn clip được tạo ra.
- Hình ảnh thành video: một hình ảnh trở thành khung mở đầu, hoặc hướng dẫn phong cách cho chuyển động.
- Tham chiếu thành video: tối đa ba đoạn clip tham chiếu, mỗi đoạn ba giây, ánh xạ chuyển động, hình dáng và tính nhất quán của nhân vật vào một cảnh mới.
- Chỉnh sửa: thay đổi nội dung trong một video bạn đã tạo, trong cuộc hội thoại.
- Kéo dài: thêm 10 giây vào cuối một đoạn clip.
Âm thanh trên các đoạn clip tham chiếu bị bỏ qua. Mô hình chỉ đọc chúng để lấy thông tin về chuyển động và hình dáng.
Tính năng kéo dài cảnh quay giờ đây đọc 10 giây ngữ cảnh
Đây là thay đổi đáng chú ý nhất. Mô hình xem trước chỉ xem xét giây cuối cùng của một đoạn clip trước khi tiếp tục, điều này chỉ đủ ngữ cảnh để giữ bảng màu ổn định chứ không nhiều hơn. Các nhân vật bị trôi. Các chuyển động camera bị đặt lại. Bạn có thể kéo dài một video, nhưng bạn không thể kéo dài một cảnh quay.
Omni 1.1 phân tích tới 10 giây ngữ cảnh trước đó, và Google mô tả kết quả là “cải thiện tính nhất quán hình ảnh và tuân thủ cốt truyện”. Bạn có thể kéo dài theo từng đoạn 10 giây, tổng cộng lên tới 40 giây.
Có hai giới hạn cần lưu ý. Tính năng kéo dài chỉ thêm vào cuối một đoạn clip: bạn không thể thêm vào đầu hoặc chèn vào giữa. Và các video tải lên tối đa là 10 giây đầu vào, trừ khi bạn duy trì trong một tương tác đa lượt, nơi mô hình đã giữ trạng thái trước đó.
Hướng dẫn kéo dài cảnh quay 40 giây bao gồm hình dạng yêu cầu và nơi các điểm nối xuất hiện.
Kiểm soát khung hình chính giữa hai hình ảnh
Giờ đây, bạn có thể đưa cho mô hình một khung hình đầu tiên và một khung hình cuối cùng, cùng với một lời nhắc mô tả chuyển động giữa chúng, và mô hình sẽ tạo ra cảnh quay kết nối hai khung hình đó. Google chỉ ra các ứng dụng rõ ràng như quỹ đạo camera, chuyển đổi thu phóng và các đoạn clip lặp lại.
Đối với bất kỳ ai xây dựng một công cụ video chứ không phải một món đồ chơi, đây là tính năng giúp đầu ra trở nên dễ dự đoán. Chuyển văn bản thành video giống như một máy đánh bạc. Nội suy khung hình cung cấp cho bạn hai điểm cố định và cho phép mô hình giải quyết phần giữa, đây là một không gian nhỏ hơn nhiều để mắc lỗi.
Chế độ nháp 360p và lý do nó thay đổi cách tính chi phí
Omni 1.1 tạo bản xem trước 360p nhanh hơn tới 60% so với 720p, với chi phí bằng một phần ba. Google nói rõ về quy trình làm việc dự kiến: tạo nháp ở 360p cho đến khi lời nhắc chính xác, sau đó kết xuất lại bản cuối cùng ở 720p, 1080p hoặc 4K.
Thay đổi duy nhất đó có giá trị hơn đối với ngân sách sản xuất so với bất kỳ mục nào khác trong bản phát hành. Việc tạo video tốn kém theo từng giây, và hầu hết những gì bạn tạo ra trong quá trình lặp lại lời nhắc đều bị loại bỏ. Trả chi phí bằng một phần ba cho các lần thử bỏ đi là sự khác biệt giữa việc khám phá tự do và phân bổ các lần thử của bạn. Bảng phân tích giá đầy đủ có tính toán theo từng giây.
Độ phân giải được đặt trong định dạng phản hồi, và 1080p và 4k là các bản nâng cấp của các khung hình đã tạo chứ không phải là kết xuất gốc.
Nơi nó hoạt động
Omni 1.1 Flash có sẵn thông qua:
- API Gemini trong Google AI Studio, dành cho nhà phát triển
- API Nền tảng Tác nhân Doanh nghiệp Gemini, dành cho triển khai doanh nghiệp
- Google Flow, dành cho người đăng ký AI Plus, Pro và Ultra
- Ứng dụng Gemini, nơi người đăng ký nhận được tính năng kéo dài cảnh quay
Google cũng đã công bố các đối tác ra mắt đang chạy mô hình này trong sản phẩm của họ: Adobe Firefly, Figma Weave, Runway và GMI Cloud. Nếu bạn sử dụng bất kỳ công cụ nào trong số đó, bạn đã đang gửi lưu lượng truy cập đến mô hình này.
Không có gói miễn phí trên API. Không giống như các mô hình Flash dạng văn bản, nơi AI Studio cung cấp cho bạn một làn miễn phí có giới hạn tốc độ, mỗi giây đầu ra của Omni đều bị tính phí ngay từ yêu cầu đầu tiên. Bản thân mô hình này miễn phí trên YouTube Shorts và YouTube Create, đây là một sản phẩm khác với các giới hạn khác nhau; Tổng quan về quyền truy cập miễn phí đề cập đến những gì mỗi đường dẫn mang lại cho bạn.
Những gì nó vẫn chưa thể làm được
Đọc danh sách này trước khi bạn định hình một tính năng xoay quanh mô hình.
- Không có các điều khiển lời nhắc mà bạn mong đợi. Các hướng dẫn hệ thống,
temperature,top_p, chuỗi dừng và lời nhắc phủ định đều không được hỗ trợ. Nếu bạn muốn loại trừ thứ gì đó, bạn phải viết điều đó vào lời nhắc thông thường. - Hạn chế khu vực. Việc tải lên và chỉnh sửa video không khả dụng ở Khu vực Kinh tế Châu Âu, Thụy Sĩ và Vương quốc Anh, tương tự với việc chỉnh sửa hình ảnh có chứa trẻ vị thành niên. Các video do mô hình tạo ra vẫn có thể chỉnh sửa được ở các khu vực đó.
- Người có thể nhận dạng. Chỉnh sửa một số cá nhân có thể nhận dạng bị chặn.
- Đối thoại trên video đã tải lên. Bạn có thể kéo dài một đoạn clip đã tải lên một cách im lặng hoặc làm việc trong một tương tác đa lượt, nhưng bạn không thể thêm đối thoại khi kéo dài video tải lên của người khác.
- Chỉ một video mỗi lần cho việc lập luận. Mô hình sẽ không lập luận trên nhiều video đầu vào.
- Thực tế chỉ hỗ trợ tiếng Anh. Google cho biết tiếng Anh được hỗ trợ đầy đủ và các ngôn ngữ khác chưa được kiểm tra.
Mỗi đầu ra đều mang một hình mờ SynthID, vô hình với người xem và có thể phát hiện bằng chương trình. Hãy lên kế hoạch cho điều đó nếu sản phẩm của bạn đưa ra yêu cầu về nguồn gốc.
Omni 1.1 Flash hay Veo 3.1?
Google hiện cung cấp hai dòng sản phẩm tạo video trên cùng một khóa API, đây là một tình huống thực sự gây nhầm lẫn. Tóm lại: Veo 3.1 là công cụ kết xuất điện ảnh với âm thanh gốc, còn Omni 1.1 Flash là mô hình đàm thoại mà bạn tương tác qua các lượt. Mỗi giây 720p của Omni có giá bằng khoảng một phần tư giây tiêu chuẩn của Veo 3.1, và Veo không có tính năng tương đương với vòng lặp chỉnh sửa đa lượt.
Bảng so sánh chi tiết sẽ xem xét các trường hợp mà mỗi mô hình vượt trội. Nếu bạn đã tích hợp Veo, hướng dẫn API Veo 3.1 vẫn còn chính xác; không có gì trong bản phát hành này làm cho nó lỗi thời.
Di chuyển khỏi điểm cuối bản xem trước
Bất cứ thứ gì trỏ đến gemini-omni-flash-preview sẽ ngừng hoạt động sau ngày 30 tháng 9 năm 2026. Việc di chuyển bản thân nó thường chỉ là một thay đổi một dòng trong chuỗi mô hình, nhưng có hai điều đáng kiểm tra trước khi bạn cho rằng chỉ có vậy:
- Độ phân giải mặc định. 720p hiện là mặc định, và các tùy chọn 360p và 4K là mới. Nếu mã của bạn giả định kích thước đầu ra cố định, hãy xác nhận những gì bạn thực sự nhận được.
- Kích thước phản hồi. Video trên 4MB được trả về dưới dạng URI thay vì base64 nội tuyến. Nếu trình xử lý của bạn chỉ đọc
output_video.data, độ phân giải cao hơn sẽ âm thầm trả về không có gì.
Cách tốt nhất để nắm bắt cả hai là lưu yêu cầu trong một ứng dụng khách API và so sánh phản hồi giữa hai ID mô hình trước khi bạn chuyển đổi. Apidog xử lý việc này rất tốt: đặt ID mô hình vào một biến môi trường, giữ một yêu cầu đã lưu, thay đổi môi trường và so sánh. Hướng dẫn API thiết lập điều đó từng bước một.
Câu hỏi thường gặp
ID mô hình của Gemini Omni 1.1 Flash là gì? gemini-omni-1.1-flash. ID bản xem trước sắp ngừng hoạt động là gemini-omni-flash-preview.
Gemini Omni 1.1 Flash ra mắt khi nào? Ngày 27 tháng 8 năm 2026, dưới dạng bản phát hành GA. Bản xem trước được phát hành vào ngày 30 tháng 6 năm 2026.
Gemini Omni 1.1 Flash có miễn phí không? Không. Không có gói miễn phí cho Omni, vì vậy mỗi lần tạo đều bị tính phí. Các mô hình văn bản như Gemini 3.6 Flash vẫn có làn miễn phí trong AI Studio; mô hình này thì không.
Video Gemini Omni có thể dài bao nhiêu? Các đoạn clip được tạo ra dài 10 giây, và tính năng kéo dài cảnh quay đưa chúng lên tổng cộng 40 giây theo từng bước 10 giây.
Gemini Omni có tạo âm thanh không? Tài liệu chỉ đề cập đến đầu ra video và bỏ qua âm thanh trên các đoạn clip tham chiếu. Veo 3.1 là mô hình có khả năng tạo âm thanh gốc. Nếu âm thanh quan trọng, hãy bắt đầu từ đó.
Tôi có thể chỉnh sửa video do mình tự quay không? Có, tối đa 10 giây đầu vào, bên ngoài EEA, Thụy Sĩ và Vương quốc Anh. Tải nó lên bằng API Files và truyền URI làm đầu vào.
Omni 1.1 Flash là phiên bản đầu tiên của mô hình này có hình dạng giống như một sản phẩm bạn sẽ triển khai. Kéo dài cảnh quay giúp giữ vững một cảnh, các khung hình chính giúp đầu ra dễ dự đoán và chế độ nháp giúp việc lặp lại có chi phí phải chăng. Kết nối một yêu cầu đã lưu với ID mô hình GA, kiểm tra hình dạng phản hồi ở mọi độ phân giải bạn dự định sử dụng và thoát khỏi điểm cuối xem trước trước cuối tháng 9. Tải xuống Apidog nếu bạn muốn lưu lại kiểm tra đó trước thời hạn thay vì sau đó.
