구글은 2026년 8월 27일 대화형 비디오 모델을 정식 출시했습니다. 모델 ID는 gemini-omni-1.1-flash이며, 6월 30일 공개 프리뷰로 출시된 gemini-omni-flash-preview 엔드포인트를 대체합니다. 프리뷰를 기반으로 무언가를 구축했다면, 마감일이 있습니다. 구글은 2026년 9월 30일에 프리뷰 엔드포인트를 중단합니다.
GA(정식 출시) 버전은 단순히 버전만 올린 것이 아닙니다. 네 가지 기능이 추가되었으며, 각 기능은 프리뷰를 프로덕션에서 사용하기 어렵게 만들었던 격차를 해소합니다. 40초까지 확장 가능한 장면 확장, 첫 프레임 및 마지막 프레임 제어, 저렴한 360p 초안 모드, 그리고 4K 업스케일링입니다. 이 게시물은 변경된 내용, 비용, 모델이 실행되는 위치, 그리고 여전히 지원되지 않는 기능들을 다룹니다.
Omni 제품군이 무엇이고 왜 구글이 추론 중심의 비디오 모델을 처음부터 구축했는지에 대한 배경이 궁금하다면, Gemini Omni란 무엇인가부터 시작하세요. 이 게시물은 해당 부분은 이미 알고 있고 1.1 버전의 세부 정보에 관심이 있는 독자를 대상으로 합니다.
Gemini Omni 1.1 Flash의 기능
Omni 1.1 Flash는 텍스트, 이미지, 비디오를 입력으로 받아 비디오를 출력합니다. 이는 generateContent 대신 Interactions API에서 실행되는데, 이 API는 구글이 상태 저장(stateful) 및 다중 턴 생성에 사용하는 것과 동일한 인터페이스입니다. 이는 생각보다 중요합니다. 클립을 생성한 다음, 방금 만든 클립을 편집하는 후속 턴을 보낼 수 있으며, 아무것도 다시 업로드할 필요가 없습니다.
모델이 지원하는 다섯 가지 작업 유형:
- 텍스트를 비디오로: 프롬프트를 입력하면 클립이 출력됩니다.
- 이미지를 비디오로: 하나의 이미지가 시작 프레임이 되거나, 움직임에 대한 스타일 가이드가 됩니다.
- 참조를 비디오로: 각 3초 길이의 참조 클립을 최대 3개까지 사용하여 움직임, 모습, 캐릭터 일관성을 새 장면에 매핑합니다.
- 편집: 대화 방식으로 이미 생성한 비디오 내부의 무언가를 변경합니다.
- 확장: 클립 끝에 10초를 추가합니다.
참조 클립의 오디오는 무시됩니다. 모델은 오디오 대신 움직임과 외형만을 읽습니다.
장면 확장이 이제 10초의 컨텍스트를 읽습니다
이것이 핵심 변경 사항입니다. 이전 프리뷰 모델은 클립을 이어가기 전에 마지막 1초를 확인했는데, 이는 색상 팔레트를 안정적으로 유지하는 데는 충분했지만 그 외에는 거의 도움이 되지 않았습니다. 캐릭터가 표류하고 카메라 움직임이 재설정되었습니다. 비디오를 확장할 수는 있었지만, 샷을 확장할 수는 없었습니다.
Omni 1.1은 최대 10초의 이전 컨텍스트를 분석하며, 구글은 그 결과가 “향상된 시각적 일관성과 내러티브 준수”라고 설명합니다. 10초 단위로 최대 40초까지 확장할 수 있습니다.
고려해야 할 두 가지 제한 사항이 있습니다. 확장은 클립의 끝에만 추가할 수 있습니다. 푸티지를 앞에 붙이거나 중간에 삽입할 수 없습니다. 그리고 모델이 이전 상태를 이미 가지고 있는 다중 턴 상호작용 내에 있지 않는 한, 업로드된 비디오는 최대 10초까지만 입력으로 허용됩니다.
40초 장면 확장 가이드는 요청 형태와 이음새가 나타나는 부분을 다룹니다.
두 이미지 사이의 키프레임 제어
이제 모델에 첫 프레임과 마지막 프레임을 제공하고, 그 사이의 움직임을 설명하는 프롬프트를 함께 주면, 두 프레임을 연결하는 영상을 생성합니다. 구글은 카메라 궤도, 줌 전환, 루프 클립 등을 명백한 사용 사례로 지목합니다.
장난감이 아닌 비디오 도구를 구축하는 사람들에게, 이 기능은 출력을 예측 가능하게 만듭니다. 텍스트-투-비디오는 슬롯 머신과 같습니다. 프레임 보간은 두 개의 고정점을 제공하고 모델이 중간을 해결하도록 하여, 오류가 발생할 공간을 훨씬 줄여줍니다.
360p 초안 작성 및 비용 계산에 미치는 영향
Omni 1.1은 720p보다 최대 60% 빠르게 360p 미리 보기를 생성하며, 비용은 3분의 1에 불과합니다. 구글은 의도된 워크플로를 명확히 밝혔습니다. 프롬프트가 올바르게 될 때까지 360p로 초안을 만들고, 그런 다음 최종본을 720p, 1080p 또는 4K로 다시 렌더링하는 것입니다.
이 단일 변경 사항은 다른 어떤 출시 항목보다 프로덕션 예산에 더 큰 가치를 제공합니다. 비디오 생성은 초당 비용이 많이 들고, 프롬프트 반복 중에 생성되는 대부분은 버려집니다. 버려지는 시도에 대해 3분의 1만 지불하는 것은 자유롭게 탐색하는 것과 시도 횟수를 제한하는 것의 차이입니다. 전체 가격 분석에서 초당 비용 계산을 확인할 수 있습니다.
해상도는 응답 형식으로 설정되며, 1080p 및 4k는 네이티브 렌더링이 아닌 생성된 프레임의 업스케일입니다.
실행되는 곳
Omni 1.1 Flash는 다음을 통해 사용할 수 있습니다:
- 개발자를 위한 Google AI Studio의 Gemini API
- 기업 배포를 위한 Gemini Enterprise Agent Platform API
- AI Plus, Pro, Ultra 구독자를 위한 Google Flow
- 구독자가 장면 확장을 이용할 수 있는 Gemini 앱
구글은 또한 자사 제품 내에서 이 모델을 실행하는 출시 파트너로 Adobe Firefly, Figma Weave, Runway, GMI Cloud를 지명했습니다. 이 도구들 중 하나라도 사용하고 있다면, 이미 이 모델로 트래픽을 보내고 있는 것입니다.
API에는 무료 티어가 없습니다. AI Studio에서 사용량 제한이 있는 무료 레인을 제공하는 텍스트 Flash 모델과 달리, Omni 출력의 모든 초는 첫 요청부터 비용이 청구됩니다. 모델 자체는 YouTube Shorts 및 YouTube Create에서 무료로 제공되지만, 이는 다른 제한이 있는 별개의 제품입니다. 무료 액세스 요약은 각 경로가 제공하는 내용을 다룹니다.
여전히 불가능한 것
모델과 관련된 기능을 계획하기 전에 이 목록을 읽으십시오.
- 예상할 수 있는 프롬프트 제어 기능 없음. 시스템 지침,
temperature,top_p, 중지 시퀀스, 네거티브 프롬프트는 모두 지원되지 않습니다. 무언가를 제외하려면 일반 프롬프트에 해당 내용을 작성해야 합니다. - 지역 제한. 유럽 경제 지역, 스위스, 영국에서는 비디오 업로드 및 편집이 불가능하며, 미성년자가 포함된 이미지 편집도 마찬가지입니다. 모델로 생성된 비디오는 해당 지역에서 계속 편집할 수 있습니다.
- 식별 가능한 인물. 특정 식별 가능한 인물에 대한 편집은 차단됩니다.
- 업로드된 비디오의 대화. 업로드된 클립을 음소거 상태로 확장하거나 다중 턴 상호작용에서 작업할 수는 있지만, 다른 사람이 업로드한 클립을 확장할 때 대화를 추가할 수는 없습니다.
- 추론을 위한 한 번에 하나의 비디오. 모델은 여러 입력 비디오에 걸쳐 추론하지 않습니다.
- 실질적으로 영어만 가능. 구글은 영어가 완벽하게 지원되며 다른 언어는 테스트되지 않았다고 밝힙니다.
모든 출력물에는 시청자에게는 보이지 않지만 프로그램적으로 감지할 수 있는 SynthID 워터마크가 포함됩니다. 귀하의 제품이 출처를 주장하는 경우 이를 고려하여 계획하십시오.
Omni 1.1 Flash 또는 Veo 3.1?
구글은 이제 동일한 API 키로 두 가지 비디오 생성 제품군을 제공하며, 이는 진정으로 혼란스러운 상황입니다. 요약하자면, Veo 3.1은 네이티브 오디오를 지원하는 영화 같은 렌더러이고, Omni 1.1 Flash는 여러 턴에 걸쳐 대화할 수 있는 모델입니다. Omni의 720p 초당 비용은 표준 Veo 3.1 초당 비용의 약 4분의 1이며, Veo에는 다중 턴 편집 루프와 동등한 기능이 없습니다.
측면 비교는 각각이 우위를 차지하는 경우를 설명합니다. 이미 Veo 통합이 되어 있다면, Veo 3.1 API 가이드는 여전히 정확합니다. 이 출시로 인해 어떤 것도 사용 중단되지 않습니다.
프리뷰 엔드포인트에서 마이그레이션
gemini-omni-flash-preview를 가리키는 모든 것은 2026년 9월 30일 이후에는 작동을 멈춥니다. 마이그레이션 자체는 일반적으로 모델 문자열을 한 줄 변경하는 것이지만, 그것이 전부라고 가정하기 전에 두 가지를 확인할 가치가 있습니다.
- 해상도 기본값. 이제 720p가 기본값이며, 360p 및 4K 옵션은 새로 추가되었습니다. 코드에서 고정된 출력 크기를 가정했다면, 실제로 어떤 결과를 받는지 확인하십시오.
- 응답 크기. 4MB를 초과하는 비디오는 인라인 base64 대신 URI로 반환됩니다. 핸들러가
output_video.data만 읽는다면, 더 높은 해상도에서는 아무것도 얻지 못할 것입니다.
두 가지 모두를 가장 깔끔하게 확인하는 방법은 API 클라이언트에 요청을 저장하고 전환하기 전에 두 모델 ID 간의 응답을 비교하는 것입니다. Apidog는 이를 잘 처리합니다. 모델 ID를 환경 변수에 넣고, 하나의 저장된 요청을 유지한 다음, 환경을 전환하고 비교하십시오. API 사용 안내서는 이를 단계별로 설정하는 방법을 설명합니다.
자주 묻는 질문
Gemini Omni 1.1 Flash의 모델 ID는 무엇인가요? gemini-omni-1.1-flash입니다. 사용 중단될 프리뷰 ID는 gemini-omni-flash-preview입니다.
Gemini Omni 1.1 Flash는 언제 출시되었나요? 정식 출시(GA)는 2026년 8월 27일입니다. 프리뷰는 2026년 6월 30일에 출시되었습니다.
Gemini Omni 1.1 Flash는 무료인가요? 아니요. Omni에는 무료 티어가 없으므로 모든 생성에 비용이 청구됩니다. Gemini 3.6 Flash와 같은 텍스트 모델은 여전히 무료 AI Studio 레인을 가지고 있지만, 이 모델은 그렇지 않습니다.
Gemini Omni 비디오는 얼마나 길 수 있나요? 클립은 10초로 생성되며, 장면 확장을 통해 10초 단위로 누적 40초까지 늘릴 수 있습니다.
Gemini Omni는 오디오를 생성하나요? 문서는 비디오 출력에 대해 다루며 참조 클립의 오디오는 무시합니다. Veo 3.1은 네이티브 오디오 생성을 지원하는 모델입니다. 사운드가 중요하다면 거기서 시작하세요.
제가 직접 촬영한 비디오를 편집할 수 있나요? 네, EEA, 스위스, 영국 외부에서는 최대 10초의 입력까지 가능합니다. Files API로 업로드하고 URI를 입력으로 전달하십시오.
Omni 1.1 Flash는 실제로 제품으로 출시할 만한 형태를 갖춘 이 모델의 첫 번째 버전입니다. 샷을 하나로 유지하는 장면 확장, 출력을 예측 가능하게 하는 키프레임, 그리고 반복 작업을 저렴하게 만드는 초안 모드. GA 모델 ID에 대해 하나의 저장된 요청을 연결하고, 사용하려는 모든 해상도에서 응답 형태를 확인하며, 9월 말 이전에 프리뷰 엔드포인트에서 벗어나십시오. 마감일 이후가 아닌 마감일 전에 해당 확인을 저장하고 싶다면 Apidog를 다운로드하십시오.
