OpenAI ahora tiene dos tecnologías de voz con nombres que se diferencian por una letra en espíritu, y el anuncio de GPT-Live del 8 de julio generalizó la confusión. Busque "GPT Live API" y aterrizará en la documentación de GPT-Realtime; lea la cobertura del lanzamiento y encontrará que ambos se usan indistintamente. No son lo mismo.
La aclaración en una línea: GPT-Live es la experiencia de voz para el consumidor dentro de ChatGPT. GPT-Realtime es la familia de API para desarrolladores para construir sus propias aplicaciones de voz. Aquí está el panorama completo y cómo saber cuál está buscando.
Las dos pilas, lado a lado
| GPT-Live | GPT-Realtime | |
|---|---|---|
| Qué es | Familia de modelos de voz que impulsan ChatGPT Voice | Modelos de voz a voz en la API Realtime |
| Para quién es | Usuarios de ChatGPT | Desarrolladores que construyen productos de voz |
| Dónde se ejecuta | Aplicaciones de ChatGPT (iOS, Android, web), CarPlay | Su aplicación, a través de la API |
| Acceso a la API | Ninguno aún ("pronto", según OpenAI) | Disponible generalmente |
| Modelos actuales | GPT-Live-1, 1 mini, 1 Medium, 1 High | gpt-realtime, gpt-realtime-1.5, gpt-realtime-2.1, 2.1-mini |
| Arquitectura | Full-duplex + delegación en segundo plano a GPT-5.5 | Modelo de voz a voz único, basado en turnos rápidos |
| Estilo de conversación | Escucha mientras habla, retroalimentación | Turnos de baja latencia con manejo de interrupciones |
| Extras | Búsqueda web, traducción, tarjetas visuales, memoria | Llamada a funciones, servidores MCP, llamadas SIP, entrada de imágenes |
| Precios | No publicado (incluido en los niveles de ChatGPT) | Publicado: ej. gpt-realtime a $4/M entrada, $16/M salida |
Qué es GPT-Live
GPT-Live es el nuevo predeterminado para ChatGPT Voice: modelos full-duplex que procesan el audio entrante mientras generan la salida, decidiendo muchas veces por segundo si hablar, escuchar, pausar o interrumpir. Cuando una pregunta requiere búsqueda o un razonamiento más profundo, GPT-Live "puede delegar la tarea a otro modelo como GPT-5.5" e incorporar el resultado de nuevo a la conversación.
Usted no integra GPT-Live. Lo usa, en la aplicación ChatGPT. Los niveles de pago usan GPT-Live-1 por defecto; el nivel gratuito obtiene GPT-Live-1 mini. La guía de configuración cubre variantes y plataformas.
Qué es GPT-Realtime
GPT-Realtime es la familia de modelos detrás de la API Realtime de OpenAI: modelos de voz a voz a los que se conecta a través de WebSocket o WebRTC, con soporte SIP para llamadas telefónicas y servidores MCP remotos para el uso de herramientas. Está disponible generalmente, con versiones y con precios como un producto API. Los miembros más nuevos, gpt-realtime-2.1 y 2.1-mini, se lanzaron el 6 de julio de 2026, dos días antes de que se anunciara GPT-Live.
Esta es la pila que cubren nuestras guías prácticas: el recorrido original de gpt-realtime, GPT-Realtime-2 y GPT-Realtime-2.1-mini. Si está construyendo con él, Apidog puede manejar las sesiones de WebSocket directamente, lo que convierte la depuración opaca en tiempo real en flujos de eventos inspeccionables; descárguelo gratis para probar una sesión contra gpt-realtime-2.1 en minutos.
Por qué la confusión es comprensible
Las dos pilas están convergiendo desde direcciones opuestas. GPT-Realtime logró una latencia de voz a voz lo suficientemente baja para agentes de producción; GPT-Live añadió la capa full-duplex y la delegación encima, pero solo dentro de ChatGPT. Arquitectónicamente, GPT-Live se parece a lo que la próxima generación de la API Realtime quiere ser, y OpenAI ha dicho que los modelos GPT-Live llegarán a la API "pronto".
Hasta que eso suceda, el mapeo práctico es:
- "Quiero hablar con una IA". GPT-Live, en ChatGPT. No requiere código.
- "Quiero que mi aplicación o línea telefónica hable con los usuarios". GPT-Realtime, a través de la API Realtime, hoy.
- "Quiero el comportamiento full-duplex de GPT-Live en mi aplicación". Aún no disponible. Las aproximaciones más cercanas, incluyendo la implementación manual del patrón de delegación, se encuentran en ¿Existe una API de GPT-Live?.
Qué sucede cuando GPT-Live llega a la API
OpenAI no ha dicho si los modelos GPT-Live se unirán a la API Realtime, la reemplazarán o llegarán como una superficie separada. La estructura de cuatro variantes (respaldada por Instant y respaldada por GPT-5.5-Thinking en dos niveles de esfuerzo) sugiere compensaciones de latencia/profundidad a nivel de sesión. Para los equipos que construyen ahora, la postura segura es un código de sesión impulsado por eventos en la API Realtime con una lógica de delegación poco acoplada; eso se traslada limpiamente bajo cualquiera de los tres resultados.
Preguntas Frecuentes
¿Es GPT-Live lo mismo que GPT-Realtime? No. GPT-Live impulsa ChatGPT Voice para consumidores; GPT-Realtime es la familia de modelos para desarrolladores en la API Realtime.
¿Puedo usar GPT-Live en mi propia aplicación? Todavía no. OpenAI planea la disponibilidad de la API "pronto". La API Realtime con gpt-realtime-2.1 es la alternativa actual.
¿Está siendo reemplazado GPT-Realtime por GPT-Live? OpenAI no ha anunciado eso. GPT-Realtime sigue estando disponible generalmente y se actualizó dos días antes del lanzamiento de GPT-Live, así que considere la coexistencia como la hipótesis de planificación.
¿Cuál es más capaz? Trabajos diferentes. GPT-Live tiene conversación full-duplex y delegación a GPT-5.5 dentro de ChatGPT; GPT-Realtime tiene la interfaz para desarrolladores: llamada a funciones, MCP, SIP y precios publicados.
