OpenAI dispose désormais de deux technologies vocales dont les noms ne diffèrent que d'une lettre dans l'esprit, et l'annonce de GPT-Live du 8 juillet a généralisé la confusion. Recherchez « GPT Live API » et vous tomberez sur la documentation de GPT-Realtime ; lisez la couverture du lancement et vous constaterez que les deux sont utilisés de manière interchangeable. Ce ne sont pas la même chose.
La clarification en une ligne : GPT-Live est l'expérience vocale grand public au sein de ChatGPT. GPT-Realtime est la famille d'API pour les développeurs permettant de créer leurs propres applications vocales. Voici l'image complète et comment déterminer lequel vous recherchez.
Les deux piles, côte à côte
| GPT-Live | GPT-Realtime | |
|---|---|---|
| Qu'est-ce que c'est | Famille de modèles vocaux alimentant ChatGPT Voice | Modèles parole-à-parole dans l'API Realtime |
| Pour qui | Utilisateurs de ChatGPT | Développeurs créant des produits vocaux |
| Où ça tourne | Applications ChatGPT (iOS, Android, web), CarPlay | Votre application, via API |
| Accès API | Pas encore disponible (« bientôt », selon OpenAI) | Généralement disponible |
| Modèles actuels | GPT-Live-1, 1 mini, 1 Medium, 1 High | gpt-realtime, gpt-realtime-1.5, gpt-realtime-2.1, 2.1-mini |
| Architecture | Full-duplex + délégation en arrière-plan à GPT-5.5 | Modèle parole-à-parole unique, basé sur des tours rapides |
| Style de conversation | Écoute en parlant, échanges en retour | Tours à faible latence avec gestion des interruptions |
| Suppléments | Recherche web, traduction, cartes visuelles, mémoire | Appel de fonctions, serveurs MCP, appel SIP, entrée d'images |
| Tarification | Non publié (inclus dans les niveaux ChatGPT) | Publiée : ex. gpt-realtime à 4 $/M en entrée, 16 $/M en sortie |
Qu'est-ce que GPT-Live
GPT-Live est le nouveau standard pour ChatGPT Voice : des modèles full-duplex qui traitent l'audio entrant tout en générant une sortie, décidant plusieurs fois par seconde s'il faut parler, écouter, faire une pause ou interrompre. Lorsqu'une question nécessite une recherche ou un raisonnement plus approfondi, GPT-Live « peut déléguer la tâche à un autre modèle comme GPT-5.5 » et réintégrer le résultat dans la conversation.
Vous n'intégrez pas GPT-Live. Vous l'utilisez, dans l'application ChatGPT. Les niveaux payants utilisent par défaut GPT-Live-1 ; le niveau gratuit obtient GPT-Live-1 mini. Le guide d'installation couvre les variantes et les plateformes.
Qu'est-ce que GPT-Realtime
GPT-Realtime est la famille de modèles derrière l'API Realtime d'OpenAI : des modèles parole-à-parole auxquels vous vous connectez via WebSocket ou WebRTC, avec support SIP pour les appels téléphoniques et des serveurs MCP distants pour l'utilisation d'outils. Il est généralement disponible, versionné et tarifé comme un produit API. Les membres les plus récents, gpt-realtime-2.1 et 2.1-mini, ont été livrés le 6 juillet 2026, deux jours avant l'annonce de GPT-Live.
C'est la pile que couvrent nos guides pratiques : le guide détaillé original de gpt-realtime, GPT-Realtime-2, et GPT-Realtime-2.1-mini. Si vous développez avec, Apidog peut gérer les sessions WebSocket directement, ce qui transforme le débogage temps réel opaque en flux d'événements inspectables ; téléchargez-le gratuitement pour tester une session avec gpt-realtime-2.1 en quelques minutes.
Pourquoi la confusion est compréhensible
Les deux piles convergent de directions opposées. GPT-Realtime a réduit la latence parole-à-parole à un niveau suffisant pour les agents de production ; GPT-Live a ajouté la couche full-duplex et la délégation par-dessus, mais uniquement au sein de ChatGPT. Architecturalement, GPT-Live ressemble à ce que la prochaine génération de l'API Realtime aspire à être, et OpenAI a déclaré que les modèles GPT-Live arriveraient dans l'API « bientôt ».
En attendant, la correspondance pratique est la suivante :
- « Je veux parler à une IA. » GPT-Live, dans ChatGPT. Aucun code impliqué.
- « Je veux que mon application ou ma ligne téléphonique parle aux utilisateurs. » GPT-Realtime, via l'API Realtime, dès aujourd'hui.
- « Je veux le comportement full-duplex de GPT-Live dans mon application. » Pas encore disponible. Les approximations les plus proches, y compris l'implémentation manuelle du modèle de délégation, se trouvent dans Existe-t-il une API GPT-Live ?.
Que se passe-t-il lorsque GPT-Live arrive dans l'API
OpenAI n'a pas précisé si les modèles GPT-Live rejoindront l'API Realtime, la remplaceront ou arriveront comme une surface distincte. La structure à quatre variantes (soutenue par Instant et soutenue par GPT-5.5-Thinking à deux niveaux d'effort) suggère des compromis latence/profondeur au niveau de la session. Pour les équipes qui développent actuellement, la posture sûre est un code de session piloté par les événements sur l'API Realtime avec une logique de délégation maintenue faiblement couplée ; cela se porte proprement sous n'importe lequel des trois résultats.
FAQ
GPT-Live est-il la même chose que GPT-Realtime ? Non. GPT-Live alimente ChatGPT Voice pour les consommateurs ; GPT-Realtime est la famille de modèles pour développeurs dans l'API Realtime.
Puis-je utiliser GPT-Live dans ma propre application ? Pas encore. OpenAI prévoit une disponibilité API « bientôt ». L'API Realtime avec gpt-realtime-2.1 est l'alternative actuellement disponible.
GPT-Realtime est-il remplacé par GPT-Live ? OpenAI ne l'a pas annoncé. GPT-Realtime reste généralement disponible et a été mis à jour deux jours avant le lancement de GPT-Live, donc considérez la coexistence comme l'hypothèse de planification.
Lequel est le plus performant ? Des rôles différents. GPT-Live offre une conversation full-duplex et une délégation à GPT-5.5 au sein de ChatGPT ; GPT-Realtime offre la surface développeur : appel de fonctions, MCP, SIP et une tarification publiée.
