ChatGPT Voz recibió su mayor reconstrucción desde el lanzamiento del Modo de Voz Avanzado. A partir del 8 de julio de 2026, GPT-Live es el nuevo predeterminado: GPT-Live-1 para usuarios de pago en Go, Plus y Pro, GPT-Live-1 mini para el nivel gratuito.
Si utilizas la voz a diario, importan dos preguntas: qué ha mejorado y qué has perdido. Ambas respuestas son concretas, y una de ellas es la razón por la que quizás quieras quedarte un tiempo más en el Modo de Voz Avanzado.
La comparación de un vistazo
| Modo de Voz Avanzado | GPT-Live | |
|---|---|---|
| Modelo de conversación | Por turnos: habla después de que paras | Dúplex completo: escucha mientras habla |
| Interrupciones | Soportadas, pero los límites de turno fallan | Continuas; decide muchas veces por segundo |
| Aprobaciones (“mhmm”) | No | Sí |
| Preguntas difíciles | Respondidas por el propio modelo de voz | Delegadas a GPT-5.5 en segundo plano |
| Búsqueda web | Limitada | Búsqueda delegada, integrada en la conversación |
| Traducción en vivo | Básica | Soportada |
| Tarjetas visuales (clima, acciones, deportes) | No | Sí |
| Compartir video y pantalla | Sí (suscriptores elegibles) | No en el lanzamiento |
| Disponibilidad | Sigue disponible | Predeterminado, despliegue global |
Lo que realmente mejoró
La toma de turnos dejó de ser la interfaz. El Modo de Voz Avanzado procesaba el audio en un solo modelo, lo que reducía la latencia, pero las conversaciones aún se desarrollaban en turnos discretos. Una pausa para pensar o el ruido de fondo podían interpretarse como "usuario terminó", por lo que el modelo interrumpía en los momentos equivocados. GPT-Live procesa la entrada continuamente mientras genera la salida; espera mientras piensas, asiente mientras explicas y se recupera cuando le hablas encima. En las evaluaciones de usuarios de OpenAI, las personas "prefirieron fuertemente" GPT-Live en conversaciones cara a cara de 5 a 10 minutos.
El techo de inteligencia se elevó. El Modo de Voz Avanzado respondía desde su propia capacidad. GPT-Live delega: "cuando una pregunta requiere búsqueda, razonamiento o capacidades más agenciales", le pasa la tarea a un modelo más potente, GPT-5.5 en el lanzamiento, y mantiene la conversación en curso hasta que regresa la respuesta. OpenAI informa que "supera sustancialmente" al Modo de Voz Avanzado en GPQA (preguntas científicas de nivel experto) y muestra "fuertes mejoras" en la búsqueda web agencial de BrowseComp. Informado por el proveedor y no cuantificado, pero la razón arquitectónica para creerlo es sólida: el techo ahora es el de GPT-5.5, no el del modelo de voz.
La conversación obtuvo mobiliario. Tarjetas visuales para el clima, las acciones y los deportes se renderizan en pantalla durante la conversación; las imágenes y los archivos pueden entrar en un chat de voz; la memoria se mantiene.
Lo que pierdes, por ahora
Compartir video y pantalla. OpenAI lo afirma claramente: "En el lanzamiento, GPT-Live no será compatible con voz con video o pantalla compartida en ChatGPT, pero estamos trabajando para introducir estas capacidades pronto".
El Modo de Voz Avanzado mantiene ambas para los suscriptores elegibles. Si tu flujo de trabajo implica apuntar tu cámara a un aparato averiado, compartir tu pantalla para obtener ayuda con la depuración, o cualquier interacción de mostrar en lugar de describir, GPT-Live es una regresión hoy. Esta es la razón más fuerte para retrasar el cambio, y OpenAI mantuvo disponibles tanto el Modo de Voz Estándar como el Avanzado en lugar de forzar la migración.
Una cantidad conocida. Las peculiaridades del Modo de Voz Avanzado están documentadas y son estables. GPT-Live tiene una semana y se está implementando por fases; los cambios de comportamiento en los primeros días son normales.
Quién debería cambiar, quién debería esperar
Cambia ahora si tu uso de voz es para conversación, preguntas, traducción o trabajo con manos libres. La diferencia del dúplex completo no es sutil, y la delegación hace que la voz sea viable para preguntas que antes habrías escrito. El camino de configuración, incluida la selección de variantes y CarPlay, se encuentra en cómo usar GPT-Live.
Espera si usas video o pantalla compartida. Mantén el Modo de Voz Avanzado hasta que se lance el "pronto" de GPT-Live; no pierdes nada esperando, ya que AVM permanece disponible y seleccionable.
Los usuarios del nivel gratuito no tienen que elegir: GPT-Live-1 mini se convierte en el predeterminado, y conlleva el mismo estilo de interacción dúplex completo con GPT-5.5 Instant detrás.
El panorama general
Este lanzamiento retira la era del "walkie-talkie" de la IA de voz en el asistente más utilizado del mercado, y su arquitectura, un front-end conversacional rápido que delega en un razonamiento profundo lento, es el patrón que los rivales ahora tienen que igualar. Cómo se compara con el enfoque de Google es una cuestión abierta que abordamos en GPT-Live vs Gemini Live, donde el compromiso se invierte: Gemini Live puede ver tu cámara y pantalla, y GPT-Live lo supera en conversación.
Para los desarrolladores, nada de esto está todavía en la API; la pila de trabajo y el juego de la espera se cubren en ¿Existe una API de GPT-Live?. Si estás construyendo agentes de voz con la API en tiempo real, mientras tanto, Apidog cubre las pruebas de WebSocket y la simulación de back-end que los proyectos de voz siempre necesitan; descárgalo gratis para mantener esas sesiones inspeccionables.
Preguntas Frecuentes
¿Desaparecerá el Modo de Voz Avanzado? No. OpenAI mantuvo disponibles el Modo de Voz Estándar y el Avanzado. GPT-Live se convierte en la opción predeterminada, no en la única.
¿Puedo volver al Modo de Voz Avanzado? Sí, la selección del modo de voz permanece en la configuración de voz de ChatGPT, y los suscriptores elegibles mantienen las funciones de video y pantalla compartida de AVM allí.
¿GPT-Live es compatible con video o pantalla compartida? No en el lanzamiento. OpenAI dice que estas capacidades llegarán a GPT-Live "pronto"; hasta entonces, AVM es la forma de mantenerlas.
¿Es GPT-Live más inteligente que el Modo de Voz Avanzado? Según OpenAI: sustancialmente mejor en el razonamiento científico de GPQA y más potente en la búsqueda web agencial, porque delega las preguntas difíciles a GPT-5.5 en lugar de responder solo desde el modelo de voz. Las puntuaciones no fueron publicadas.
