구글은 2026년 9월 15일 두 가지 새로운 음성-음성 모델을 출시했으며, 해커 뉴스 스레드는 하루 만에 337점 이상을 기록했습니다. 이는 음성 API 출시치고는 큰 반응이었고, 대부분의 논의는 데모 비디오에 관한 것이 아니었습니다. 개발자들은 동일한 질문을 던졌습니다. '이것으로 구축하는 데 드는 비용은 얼마이며, 실제로 어떻게 연결하나요?'
이것이 바로 그 가이드입니다. `gemini-3.8-live`와 `gemini-3.8-live-extended-thinking`은 현재 Gemini API 및 Google AI Studio에서 출시되고 있으며, Gemini Enterprise 및 Search Live는 비공개 프리뷰로 제공됩니다. 두 모델 모두 토큰당 및 분당 요금이 부과되는 유료 티어 외에 무료 입출력 토큰을 제공하는데, 이는 라이브 오디오 모델로서는 이례적인 일이므로 단순히 가격 책정 페이지뿐만 아니라 WebSocket 세션 자체를 살펴보는 것이 중요합니다. 저희는 이미 GPT-Live와 Gemini Live에서 소비자용 음성 비서를 비교했습니다. 이 글은 그 비교의 한 측면에 있는 API에 대한 개발자 경로입니다.
2026년 9월 15일에 실제로 출시된 것
구글의 발표에는 두 가지 모델이 포함됩니다. `gemini-3.8-live`는 표준 음성-음성 모델입니다. `gemini-3.8-live-extended-thinking`은 모델이 말하는 동안 실행되는 추론 레이어를 추가하며, 이는 아래에서 설명됩니다. 두 모델 모두 자동 대화 중 전환 기능으로 97개 언어를 지원하여, 사용자가 수동 언어 플래그 없이 영어로 문장을 시작하여 스페인어로 마칠 수 있습니다.

출시 시점 가용성: Gemini API 및 Google AI Studio(일반 액세스), 그리고 Gemini Enterprise 및 Search Live(비공개 프리뷰이므로, 이 글을 읽는 대부분의 개발자는 API 또는 AI Studio에서 시작할 것입니다). 무료 토큰은 입력 및 출력 모두에 대해 두 모델에 적용되므로, 신용카드를 사용하기 전에 실제 프로토타입을 만들 수 있습니다.
구글이 아직 발표하지 않은 한 가지 세부 사항: 두 라이브 모델에 대한 무료 티어 사용량 제한. 사용량 제한 페이지에 해당 내용이 게시되면 그것이 정확한 정보원이 됩니다. 다른 곳에서 보는 숫자는 직접 확인하기 전까지는 확인되지 않은 것으로 간주하십시오.
Search Live와 Gemini Enterprise 액세스가 API처럼 공개되지 않고 비공개 프리뷰로만 제공된다는 점은 주목할 만한 신호입니다. 구글은 동일한 모델을 소비자 검색이나 유료 엔터프라이즈 좌석에 적용하기 전에 개발자들이 이 모델을 프로덕션에 준하는 방식으로 구축하도록 허용하는 데 부담을 느끼지 않습니다. 이는 음성 모델 출시에서는 일반적인 일이며, 현재 API 표면이 안정적인 시작점이지, 나중에 더 나은 소비자 경험을 위한 축소된 미리보기가 아니라는 것을 의미합니다.
무료 API 키를 얻고 세션 열기
Gemini API 키는 Google 계정에 연결된 Google AI Studio에서 얻을 수 있으며, 무료 티어에는 별도의 승인 단계가 없으므로 출시 당일부터 라이브 모델에 사용할 수 있습니다. 키를 얻으면, 연결 지점은 REST 엔드포인트가 아닌 WebSocket입니다. 이는 `generateContent` 호출에 익숙하다면 첫 번째 조정 사항이 될 것입니다.
wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent
해당 URL은 Simon Willison이 출시 당일에 공개한 실습 가이드에서 가져온 것이며, 이는 새로운 API에 대한 그의 통찰력 있는 분석과 함께 발표되었습니다. 그는 또한 UI를 구축하기 전에 알아야 할 사항을 지적했습니다. 사람의 대화를 중단하는 것처럼 모델의 응답 중간에 중단할 수 있으며, 이로 인해 다시 받는 스크립트에는 모델이 생성하기 시작했지만 재생이 완료되지 않은(귀하의 중단으로 인해 재생이 중단되었으므로) 음성이 포함될 수 있습니다. 모든 스크립트 줄이 완전히 들렸다고 가정하기보다는 클라이언트에서 이를 별개의 상태로 처리하십시오.
해당 소켓을 통한 양방향 세션은 모든 WebSocket 기반 스트리밍 API가 사용하는 형태를 따릅니다. 즉, 먼저 모델과 생성 설정을 식별하는 설정 메시지, 그 다음 양방향으로 오디오 청크나 텍스트를 전달하는 콘텐츠 메시지 스트림이 이어지며, 서버는 준비되는 대로 부분 및 최종 응답 세그먼트를 보냅니다. 정확한 메시지 스키마는 구글이 자세히 문서화할 것이며, 프리뷰와 일반 가용성 사이에 변경될 수 있으므로, 프로덕션 클라이언트를 구축하기 전에 라이브 Gemini API 문서 및 SDK의 참조 문서를 통해 필드 이름을 확인하십시오. 안정적인 것은 패턴입니다. 연결하고, 설정을 보내고, 콘텐츠를 스트리밍하고, 스트리밍된 응답을 읽고, 중단을 오류 사례가 아닌 정상적인 이벤트로 예상하는 것입니다.
실질적으로, 첫 번째 작업 세션은 가능한 한 가장 작은 루프를 목표로 해야 합니다. 소켓을 열고, 원하는 모델(`gemini-3.8-live` 또는 `gemini-3.8-live-extended-thinking`)을 지정하는 하나의 설정 메시지를 보내고, 짧은 오디오 또는 텍스트 한 턴을 보낸 다음, 재시도 로직, 재연결 처리 또는 UI를 추가하기 전에 스트리밍 응답을 받는지 확인합니다. 해피 경로가 작동하면 두 번째로 중단 경로를 구축하십시오. 왜냐하면 이를 잘 테스트한다는 것은 모델이 응답하는 중간에 의도적으로 말을 걸고, 클라이언트가 완료된 턴으로 처리하는 대신 잘린 스크립트를 올바르게 표시하는지 확인하는 것을 의미하기 때문입니다.
확장된 사고: 추론이 소리 내어 발생할 때
일반 `gemini-3.8-live` 모델은 직접 답변합니다. `gemini-3.8-live-extended-thinking`은 다르게 작동합니다. 구글은 이 모델이 '동시에 추론하고 말한다'고 말합니다. 모델이 작동하는 동안 아무 소리도 없는 대신 '제가 확인해 보겠습니다'와 같은 말로 추론 시간을 채워 '중단 없는 대화 흐름'을 유지합니다.
이것은 특정 유형의 앱, 즉 대화 중에 도구를 호출하거나 외부 API를 사용하는 음성 에이전트에 중요합니다. 확장된 사고 모델은 '대화를 계속하면서 백그라운드에서 도구 및 API 호출을 실행'하며, 두 모델 모두 함수 호출을 지원합니다. 달력 API를 통해 가용성을 확인해야 하는 예약 에이전트를 상상해 보십시오. 조회 실행 중 2초 동안 침묵하는 대신, 모델은 요청을 소리 내어 인정하고 백그라운드에서 호출이 완료되는 동안 대화를 계속할 수 있습니다.
세션에 도구 호출, 다단계 조회 또는 침묵 간격이 부자연스럽게 느껴질 수 있는 추론 위주의 답변이 포함될 경우 확장된 사고를 선택하십시오. 추론 오버헤드가 필요 없는 짧고 지연 시간이 짧은 교환에는 일반 모델을 선택하십시오. 두 모델 모두 토큰당 비용은 동일하므로, 선택은 예산이 아니라 동작에 관한 것입니다. 에이전트가 특히 함수 호출에 의존한다면, 저희의 Gemini 3.8 Flash용 함수 호출 가이드는 현재 Gemini 3.8 제품군 전체에서 구글이 사용하는 요청 형태를 다루고 있습니다. 다만, 텍스트 및 음성 API가 스키마를 공유한다는 보장이 없으므로 출시 전에 Live 관련 함수 호출 페이로드를 Live API 문서와 비교하여 확인하십시오.
비용 분석
두 Live 모델 모두 동일한 표준 가격을 공유합니다.
| 유형 | 요금 |
|---|---|
| 텍스트 입력 | $0.75 per 1M tokens |
| 오디오 입력 | $3.00 per 1M tokens, or $0.005 per minute |
| 이미지/비디오 입력 | $1.00 per 1M tokens, or $0.002 per minute |
| 텍스트 출력 | $4.50 per 1M tokens |
| 오디오 출력 | $12.00 per 1M tokens, or $0.018 per minute |
생각 토큰은 다른 모든 Gemini 3.x 모델과 마찬가지로 출력으로 청구되므로, 확장된 사고의 백그라운드 추론은 별도의 요금이 아닌 출력 라인에 표시됩니다.
예시: 유료 표준 티어에서 10분간 음성 통화(처음부터 끝까지 오디오 입력 및 출력). 오디오 입력: 10분 x $0.005 = $0.05. 오디오 출력: 10분 x $0.018 = $0.18. 총계: 텍스트 또는 도구 호출 토큰이 추가되기 전, 완전한 10분간의 상호 대화에 $0.23. 프로토타이핑 중에 동일한 통화를 무료 티어에서 실행하면 토큰 비용은 0이며, 이는 구글이 최종적으로 발표할 사용량 제한에 따릅니다.
동일한 가격 페이지에 있는 `gemini-3.1-flash-live-preview` 모델은 두 가지 새로운 Live 모델과 동일한 요금을 적용합니다. 구형 모델에 Live 통합이 이미 있는 경우 확인할 가치가 있습니다. 가격 결정은 마이그레이션을 미룰 이유가 되지 않습니다.
개발자들이 지금까지 말하는 것
해커 뉴스 논의는 전반적으로 긍정적이지는 않습니다. 반복되는 불만 사항: 유료 Google Workspace 및 Google AI Plus 구독자들은 API 및 AI Studio 액세스가 공개되어 있음에도 불구하고, 유료 고객임에도 불구하고 아직 새로운 Live 경험에 대한 소비자 액세스를 할 수 없습니다. 스레드의 한 보고서는 모델이 원래 작업의 일부가 아닌 추가 요구 사항을 만들어내는 에이전트 루프를 설명했습니다. 이는 휴먼-인-더-루프 음성 비서가 아닌 자율 에이전트에 Live를 연결하는 경우 특별히 테스트할 가치가 있는 실패 모드입니다. 감독하는 비서보다 자율 루프에 가까운 것을 구축하고 있다면, 모델이 주장하는 요구 사항과 제공한 작업 정의를 비교하는 명시적인 확인 절차를 추가해야 합니다. 모델이 제시하는 요구 사항을 액면 그대로 신뢰해서는 안 됩니다. 이 두 가지를 단일 스레드에서 나온 첫날 신호로 간주하고, 검증된 결함 보고서가 아니므로 일반화하기 전에 자신의 사용 사례에 대해 다시 테스트하십시오.

클라이언트 코드를 작성하기 전에 원시 프로토콜 확인하기
클라이언트 라이브러리에 전념하기 전에, 실제 프레임이 전송되는 것을 확인하는 것이 도움이 됩니다. Apidog는 `BidiGenerateContent` 엔드포인트에 WebSocket 연결을 열고, JSON 설정 메시지 및 후속 콘텐츠 메시지를 수동으로 전송하며, 실시간으로 스트리밍되는 프레임을 보여줄 수 있습니다. 이는 SDK 코드를 한 줄도 작성하기 전에 설정-스트림 패턴을 이해하는 가장 빠른 방법입니다. Apidog는 마이크 오디오를 캡처하지 않습니다. 오디오 또는 텍스트 페이로드를 직접 제공하고 연결을 사용하여 서버가 무엇을 다시 보내는지 검사하고, 설정 메시지가 수락되었는지 확인하며, 프로덕션에서 오류 처리를 구축하기 전에 중단이 어떻게 작동하는지 관찰하십시오. 이러한 방식으로 WebSocket API를 구축하고 테스트하기 위한 전체 프로토콜 참조는 docs.apidog.com에서 확인할 수 있습니다. 첫 클라이언트 구축 전에 직접 연결을 시도하려면 Apidog를 다운로드하십시오.
비교를 위해, 저희의 WebSocket vs WebRTC 분석은 구글이 경쟁 음성 API들이 사용하는 WebRTC 경로 대신 이 양방향 스트림에 WebSocket을 선택한 이유와 그 절충안이 특히 브라우저 클라이언트에 어떤 의미를 가지는지 다룹니다.
FAQ
Gemini 3.8 Live API는 무료인가요? 네, 두 모델 모두 무료 티어에서는 입출력 토큰이 무료입니다. 구글이 설정한 사용량 제한을 초과하면 유료 표준 요금이 적용되며, 해당 무료 티어 제한은 아직 공개되지 않았으므로 사용량 제한 페이지에서 직접 확인하십시오.
두 가지 새로운 모델의 차이점은 무엇인가요? `gemini-3.8-live`는 직접 답변합니다. `gemini-3.8-live-extended-thinking`은 말하면서 추론하며, 배경 도구 호출 및 다단계 조회를 처리하기 위해 구두 채움말을 사용하고, 토큰당 가격은 동일합니다.
이것을 사용하려면 WebRTC가 필요한가요? 아니요. 이 API는 WebRTC 피어 연결 대신 `BidiGenerateContent` 엔드포인트에 연결하는 WebSocket 기반입니다.
클라이언트를 작성하지 않고도 테스트할 수 있나요? 네. Apidog에서 WebSocket을 열고, 설정 및 콘텐츠 메시지를 수동으로 보낸 다음, 실제 클라이언트를 구축하기 전에 스트리밍 응답을 읽어보십시오.
