A OpenAI agora tem duas tecnologias de voz com nomes que diferem por apenas uma letra no espírito, e o anúncio do GPT-Live em 8 de julho tornou a confusão generalizada. Pesquise por “GPT Live API” e você cairá na documentação do GPT-Realtime; leia a cobertura de lançamento e você encontrará os dois sendo usados de forma intercambiável. Eles não são a mesma coisa.
A desambiguação em uma linha: GPT-Live é a experiência de voz para o consumidor dentro do ChatGPT. GPT-Realtime é a família de APIs para desenvolvedores construírem suas próprias aplicações de voz. Aqui está a imagem completa e como saber qual deles você está procurando.
As duas arquiteturas, lado a lado
| GPT-Live | GPT-Realtime | |
|---|---|---|
| O que é | Família de modelos de voz que alimentam o ChatGPT Voice | Modelos de fala para fala na API Realtime |
| Para quem é | Usuários do ChatGPT | Desenvolvedores que criam produtos de voz |
| Onde executa | Aplicativos ChatGPT (iOS, Android, web), CarPlay | Sua aplicação, via API |
| Acesso à API | Nenhum ainda (“em breve”, segundo a OpenAI) | Disponível publicamente |
| Modelos atuais | GPT-Live-1, 1 mini, 1 Medium, 1 High | gpt-realtime, gpt-realtime-1.5, gpt-realtime-2.1, 2.1-mini |
| Arquitetura | Full-duplex + delegação em segundo plano para GPT-5.5 | Modelo único de fala para fala, baseado em turnos rápidos |
| Estilo de conversação | Ouve enquanto fala, com backchannels | Turnos de baixa latência com tratamento de interrupções |
| Extras | Pesquisa web, tradução, cartões visuais, memória | Chamada de função, servidores MCP, chamadas SIP, entrada de imagem |
| Preço | Não publicado (incluído nos níveis do ChatGPT) | Publicado: ex. gpt-realtime a $4/M entrada, $16/M saída |
O que é o GPT-Live
GPT-Live é o novo padrão para o ChatGPT Voice: modelos full-duplex que processam áudio de entrada enquanto geram saída, decidindo muitas vezes por segundo se devem falar, ouvir, pausar ou interromper. Quando uma pergunta requer pesquisa ou raciocínio mais profundo, o GPT-Live “pode delegar a tarefa a outro modelo como o GPT-5.5” e integrar o resultado de volta à conversa.
Você não integra o GPT-Live. Você o usa, no aplicativo ChatGPT. Os níveis pagos usam o GPT-Live-1 por padrão; o nível Gratuito recebe o GPT-Live-1 mini. O guia de configuração abrange variantes e plataformas.
O que é o GPT-Realtime
GPT-Realtime é a família de modelos por trás da API Realtime da OpenAI: modelos de fala para fala aos quais você se conecta via WebSocket ou WebRTC, com suporte SIP para chamadas telefônicas e servidores MCP remotos para uso de ferramentas. Está disponível publicamente, versionado e precificado como um produto de API. Os membros mais novos, gpt-realtime-2.1 e 2.1-mini, foram lançados em 6 de julho de 2026, dois dias antes do anúncio do GPT-Live.
Esta é a arquitetura que nossos guias práticos abordam: o passo a passo original do gpt-realtime, GPT-Realtime-2 e GPT-Realtime-2.1-mini. Se você está desenvolvendo com ele, o Apidog pode gerenciar as sessões WebSocket diretamente, o que transforma a depuração opaca em tempo real em fluxos de eventos inspecionáveis; faça o download gratuito para testar uma sessão com o gpt-realtime-2.1 em minutos.
Por que a confusão é compreensível
As duas arquiteturas estão convergindo de direções opostas. O GPT-Realtime trouxe a latência de fala para fala baixa o suficiente para agentes de produção; o GPT-Live adicionou a camada full-duplex e a delegação por cima, mas apenas dentro do ChatGPT. Arquitetonicamente, o GPT-Live se parece com o que a próxima geração da API Realtime deseja ser, e a OpenAI disse que os modelos GPT-Live chegarão à API “em breve”.
Até que isso aconteça, o mapeamento prático é:
- “Quero conversar com uma IA.” GPT-Live, no ChatGPT. Nenhum código envolvido.
- “Quero que meu aplicativo ou linha telefônica converse com usuários.” GPT-Realtime, via a API Realtime, hoje.
- “Quero o comportamento full-duplex do GPT-Live no meu aplicativo.” Não disponível ainda. As aproximações mais próximas, incluindo a implementação manual do padrão de delegação, estão em Existe uma API GPT-Live?.
O que acontece quando o GPT-Live chega à API
A OpenAI não informou se os modelos GPT-Live se juntarão à API Realtime, a substituirão ou chegarão como uma superfície separada. A estrutura de quatro variantes (Instant-backed e GPT-5.5-Thinking-backed em dois níveis de esforço) sugere tradeoffs de latência/profundidade no nível da sessão. Para equipes que estão desenvolvendo agora, a postura segura é o código de sessão orientado a eventos na API Realtime com a lógica de delegação mantida fracamente acoplada; isso se adapta facilmente a qualquer um dos três resultados.
FAQ
GPT-Live é o mesmo que GPT-Realtime? Não. O GPT-Live impulsiona o ChatGPT Voice para consumidores; o GPT-Realtime é a família de modelos para desenvolvedores na API Realtime.
Posso usar o GPT-Live no meu próprio aplicativo? Ainda não. A OpenAI planeja a disponibilidade da API “em breve”. A API Realtime com gpt-realtime-2.1 é a alternativa disponível.
O GPT-Realtime está sendo substituído pelo GPT-Live? A OpenAI não anunciou isso. O GPT-Realtime permanece geralmente disponível e foi atualizado dois dias antes do lançamento do GPT-Live, então considere a coexistência como a premissa de planejamento.
Qual é mais capaz? Funções diferentes. O GPT-Live possui conversação full-duplex e delegação para o GPT-5.5 dentro do ChatGPT; o GPT-Realtime oferece a interface para desenvolvedores: chamada de função, MCP, SIP e preços publicados.
