ChatGPT Voice erhielt seinen größten Umbau seit der Einführung des erweiterten Sprachmodus. Ab dem 8. Juli 2026 ist GPT-Live die neue Standardeinstellung: GPT-Live-1 für kostenpflichtige Nutzer auf Go, Plus und Pro, GPT-Live-1 mini für die kostenlose Stufe.
Wenn Sie die Sprachfunktion täglich nutzen, sind zwei Fragen wichtig: Was ist besser und was haben Sie verloren. Beide Antworten sind konkret, und eine davon ist der Grund, warum Sie möglicherweise noch eine Weile im erweiterten Sprachmodus bleiben möchten.
Der Vergleich auf einen Blick
| Erweiterter Sprachmodus | GPT-Live | |
|---|---|---|
| Konversationsmodell | Rundenbasiert: spricht, nachdem Sie aufgehört haben | Vollduplex: hört zu, während es spricht |
| Unterbrechungen | Unterstützt, aber Rundenbegrenzungen fehlzünden | Kontinuierlich; entscheidet mehrmals pro Sekunde |
| Rückkanäle („mhmm“) | Nein | Ja |
| Schwierige Fragen | Beantwortet vom Sprachmodell selbst | Im Hintergrund an GPT-5.5 delegiert |
| Websuche | Begrenzt | Delegierte Suche, in die Konversation integriert |
| Live-Übersetzung | Grundlegend | Unterstützt |
| Visuelle Karten (Wetter, Aktien, Sport) | Nein | Ja |
| Video- und Bildschirmfreigabe | Ja (berechtigte Abonnenten) | Nicht zum Start |
| Verfügbarkeit | Bleibt verfügbar | Standard, weltweite Einführung |
Was sich wirklich verbessert hat
Die Gesprächsführung hat aufgehört, die Schnittstelle zu sein. Der erweiterte Sprachmodus verarbeitete Audio in einem einzigen Modell, was die Latenz reduzierte, aber Konversationen liefen immer noch in diskreten Runden ab. Eine Denkpause oder Hintergrundgeräusche konnten als „Benutzer fertig“ interpretiert werden, sodass das Modell in den falschen Momenten unterbrach. GPT-Live verarbeitet Eingaben kontinuierlich, während es Ausgaben generiert; es wartet, während Sie nachdenken, bestätigt, während Sie erklären, und erholt sich, wenn Sie es überreden. In OpenAIs Benutzerbewertungen bevorzugten die Leute GPT-Live in 5- bis 10-minütigen direkten Gesprächen „stark“.
Die Intelligenzgrenze wurde aufgehoben. Der erweiterte Sprachmodus antwortete aus seiner eigenen Fähigkeit heraus. GPT-Live delegiert: „Wenn eine Frage eine Suche, Argumentation oder stärker agentische Fähigkeiten erfordert“, übergibt es die Aufgabe an ein stärkeres Modell, GPT-5.5 zum Start, und hält die Konversation am Laufen, bis die Antwort zurückkommt. OpenAI berichtet, dass es den erweiterten Sprachmodus bei GPQA (wissenschaftliche Fragen auf Expertenniveau) „erheblich übertrifft“ und „starke Zuwächse“ bei BrowseComps agentischer Websuche zeigt. Vom Anbieter berichtet und unquantifiziert, aber der architektonische Grund, daran zu glauben, ist solide: Die Grenze ist jetzt die von GPT-5.5, nicht die des Sprachmodells.
Das Gespräch bekam "Möbel". Visuelle Karten für Wetter, Aktien und Sport werden während des Gesprächs auf dem Bildschirm angezeigt; Bilder und Dateien können in einen Voice-Chat eingegeben werden; der Speicher wird übernommen.
Was Sie (vorerst) verlieren
Video- und Bildschirmfreigabe. OpenAI erklärt es deutlich: „Zum Start wird GPT-Live keine Sprachfunktionen mit Video- oder Bildschirmfreigabe in ChatGPT unterstützen, aber wir arbeiten daran, diese Funktionen bald einzuführen.“
Der erweiterte Sprachmodus behält beides für berechtigte Abonnenten bei. Wenn Ihr Workflow darin besteht, Ihre Kamera auf ein kaputtes Gerät zu richten, Ihren Bildschirm für Debugging-Hilfe freizugeben oder jede Art von „Zeigen statt Erzählen“-Interaktion, ist GPT-Live heute ein Downgrade. Dies ist der stärkste Grund, den Wechsel zu verzögern, und OpenAI hat sowohl den Standard- als auch den erweiterten Sprachmodus verfügbar gelassen, anstatt die Migration zu erzwingen.
Eine bekannte Größe. Die Eigenheiten des erweiterten Sprachmodus sind dokumentiert und stabil. GPT-Live ist eine Woche alt und wird schrittweise eingeführt; Verhaltensänderungen in der Anfangsphase sind normal.
Wer wechseln sollte, wer warten sollte
Wechseln Sie jetzt, wenn Ihre Sprachnutzung Konversationen, Fragen, Übersetzungen oder freihändiges Arbeiten umfasst. Der Vollduplex-Unterschied ist nicht subtil, und die Delegation macht die Sprachfunktion für Fragen, die Sie zuvor getippt hätten, praktikabel. Der Einrichtungspfad, einschließlich Variantenauswahl und CarPlay, finden Sie unter Wie man GPT-Live verwendet.
Warten Sie, wenn Sie Video- oder Bildschirmfreigabe verwenden. Behalten Sie den erweiterten Sprachmodus bei, bis GPT-Lives „bald“ ausgeliefert wird; Sie verlieren nichts durch das Warten, da AVM weiterhin verfügbar und wählbar ist.
Nutzer des kostenlosen Tarifs stehen nicht vor der Wahl: GPT-Live-1 mini wird zum Standard, und es bietet den gleichen Vollduplex-Interaktionsstil mit GPT-5.5 Instant dahinter.
Das größere Bild
Diese Veröffentlichung beendet die Walkie-Talkie-Ära der Sprach-KI im meistgenutzten Assistenten auf dem Markt, und ihre Architektur, ein schnelles, konversationelles Frontend, das langsame, tiefe Schlussfolgerungen delegiert, ist das Muster, das Konkurrenten nun nachahmen müssen. Wie es sich im Vergleich zu Googles Ansatz schlägt, ist eine offene Frage, die wir in GPT-Live vs. Gemini Live behandeln, wo sich der Kompromiss umkehrt: Gemini Live kann Ihre Kamera und Ihren Bildschirm sehen, und GPT-Live übertrifft es im Gespräch.
Für Entwickler ist all dies noch nicht in der API; der Arbeitsstapel und das Wartespiel werden in Gibt es eine GPT-Live API? behandelt. Wenn Sie in der Zwischenzeit Sprachagenten mit der Realtime API erstellen, deckt Apidog das WebSocket-Testing und das Backend-Mocking ab, die Sprachprojekte immer benötigen; laden Sie es kostenlos herunter, um diese Sitzungen überprüfbar zu halten.
FAQ
Wird der erweiterte Sprachmodus eingestellt? Nein. OpenAI hat den Standard- und erweiterten Sprachmodus verfügbar gelassen. GPT-Live wird der Standard, aber nicht die einzige Option.
Kann ich zum erweiterten Sprachmodus zurückwechseln? Ja, die Auswahl des Sprachmodus bleibt in den Spracheinstellungen von ChatGPT erhalten, und berechtigte Abonnenten behalten dort die Video- und Bildschirmfreigabefunktionen von AVM.
Unterstützt GPT-Live Video- oder Bildschirmfreigabe? Nicht zum Start. OpenAI sagt, dass diese Funktionen „bald“ für GPT-Live verfügbar sein werden; bis dahin ist AVM der Weg, sie zu behalten.
Ist GPT-Live intelligenter als der erweiterte Sprachmodus? Laut OpenAI: wesentlich besser bei GPQA-Wissenschaftsargumentation und stärker bei agentischer Websuche, weil es schwierige Fragen an GPT-5.5 delegiert, anstatt nur aus dem Sprachmodell zu antworten. Die Ergebnisse wurden nicht veröffentlicht.
