GPT-Live vs. Advanced Voice Mode: Was hat sich im ChatGPT Sprachmodus geändert?

GPT-Live vs. Advanced Voice Mode: Vollduplex-Gespräch und GPT-5.5-Delegation gegen die Video- und Bildschirmfreigabe, die GPT-Live noch fehlt. Wer wechseln und wer warten sollte.

INEZA Felin-Michel

INEZA Felin-Michel

9 July 2026

GPT-Live vs. Advanced Voice Mode: Was hat sich im ChatGPT Sprachmodus geändert?

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

ChatGPT Voice erhielt seinen größten Umbau seit der Einführung des erweiterten Sprachmodus. Ab dem 8. Juli 2026 ist GPT-Live die neue Standardeinstellung: GPT-Live-1 für kostenpflichtige Nutzer auf Go, Plus und Pro, GPT-Live-1 mini für die kostenlose Stufe.

Wenn Sie die Sprachfunktion täglich nutzen, sind zwei Fragen wichtig: Was ist besser und was haben Sie verloren. Beide Antworten sind konkret, und eine davon ist der Grund, warum Sie möglicherweise noch eine Weile im erweiterten Sprachmodus bleiben möchten.

Der Vergleich auf einen Blick

Erweiterter Sprachmodus GPT-Live
Konversationsmodell Rundenbasiert: spricht, nachdem Sie aufgehört haben Vollduplex: hört zu, während es spricht
Unterbrechungen Unterstützt, aber Rundenbegrenzungen fehlzünden Kontinuierlich; entscheidet mehrmals pro Sekunde
Rückkanäle („mhmm“) Nein Ja
Schwierige Fragen Beantwortet vom Sprachmodell selbst Im Hintergrund an GPT-5.5 delegiert
Websuche Begrenzt Delegierte Suche, in die Konversation integriert
Live-Übersetzung Grundlegend Unterstützt
Visuelle Karten (Wetter, Aktien, Sport) Nein Ja
Video- und Bildschirmfreigabe Ja (berechtigte Abonnenten) Nicht zum Start
Verfügbarkeit Bleibt verfügbar Standard, weltweite Einführung

Was sich wirklich verbessert hat

Die Gesprächsführung hat aufgehört, die Schnittstelle zu sein. Der erweiterte Sprachmodus verarbeitete Audio in einem einzigen Modell, was die Latenz reduzierte, aber Konversationen liefen immer noch in diskreten Runden ab. Eine Denkpause oder Hintergrundgeräusche konnten als „Benutzer fertig“ interpretiert werden, sodass das Modell in den falschen Momenten unterbrach. GPT-Live verarbeitet Eingaben kontinuierlich, während es Ausgaben generiert; es wartet, während Sie nachdenken, bestätigt, während Sie erklären, und erholt sich, wenn Sie es überreden. In OpenAIs Benutzerbewertungen bevorzugten die Leute GPT-Live in 5- bis 10-minütigen direkten Gesprächen „stark“.

Die Intelligenzgrenze wurde aufgehoben. Der erweiterte Sprachmodus antwortete aus seiner eigenen Fähigkeit heraus. GPT-Live delegiert: „Wenn eine Frage eine Suche, Argumentation oder stärker agentische Fähigkeiten erfordert“, übergibt es die Aufgabe an ein stärkeres Modell, GPT-5.5 zum Start, und hält die Konversation am Laufen, bis die Antwort zurückkommt. OpenAI berichtet, dass es den erweiterten Sprachmodus bei GPQA (wissenschaftliche Fragen auf Expertenniveau) „erheblich übertrifft“ und „starke Zuwächse“ bei BrowseComps agentischer Websuche zeigt. Vom Anbieter berichtet und unquantifiziert, aber der architektonische Grund, daran zu glauben, ist solide: Die Grenze ist jetzt die von GPT-5.5, nicht die des Sprachmodells.

Das Gespräch bekam "Möbel". Visuelle Karten für Wetter, Aktien und Sport werden während des Gesprächs auf dem Bildschirm angezeigt; Bilder und Dateien können in einen Voice-Chat eingegeben werden; der Speicher wird übernommen.

Was Sie (vorerst) verlieren

Video- und Bildschirmfreigabe. OpenAI erklärt es deutlich: „Zum Start wird GPT-Live keine Sprachfunktionen mit Video- oder Bildschirmfreigabe in ChatGPT unterstützen, aber wir arbeiten daran, diese Funktionen bald einzuführen.“

Der erweiterte Sprachmodus behält beides für berechtigte Abonnenten bei. Wenn Ihr Workflow darin besteht, Ihre Kamera auf ein kaputtes Gerät zu richten, Ihren Bildschirm für Debugging-Hilfe freizugeben oder jede Art von „Zeigen statt Erzählen“-Interaktion, ist GPT-Live heute ein Downgrade. Dies ist der stärkste Grund, den Wechsel zu verzögern, und OpenAI hat sowohl den Standard- als auch den erweiterten Sprachmodus verfügbar gelassen, anstatt die Migration zu erzwingen.

Eine bekannte Größe. Die Eigenheiten des erweiterten Sprachmodus sind dokumentiert und stabil. GPT-Live ist eine Woche alt und wird schrittweise eingeführt; Verhaltensänderungen in der Anfangsphase sind normal.

Wer wechseln sollte, wer warten sollte

Wechseln Sie jetzt, wenn Ihre Sprachnutzung Konversationen, Fragen, Übersetzungen oder freihändiges Arbeiten umfasst. Der Vollduplex-Unterschied ist nicht subtil, und die Delegation macht die Sprachfunktion für Fragen, die Sie zuvor getippt hätten, praktikabel. Der Einrichtungspfad, einschließlich Variantenauswahl und CarPlay, finden Sie unter Wie man GPT-Live verwendet.

Warten Sie, wenn Sie Video- oder Bildschirmfreigabe verwenden. Behalten Sie den erweiterten Sprachmodus bei, bis GPT-Lives „bald“ ausgeliefert wird; Sie verlieren nichts durch das Warten, da AVM weiterhin verfügbar und wählbar ist.

Nutzer des kostenlosen Tarifs stehen nicht vor der Wahl: GPT-Live-1 mini wird zum Standard, und es bietet den gleichen Vollduplex-Interaktionsstil mit GPT-5.5 Instant dahinter.

Das größere Bild

Diese Veröffentlichung beendet die Walkie-Talkie-Ära der Sprach-KI im meistgenutzten Assistenten auf dem Markt, und ihre Architektur, ein schnelles, konversationelles Frontend, das langsame, tiefe Schlussfolgerungen delegiert, ist das Muster, das Konkurrenten nun nachahmen müssen. Wie es sich im Vergleich zu Googles Ansatz schlägt, ist eine offene Frage, die wir in GPT-Live vs. Gemini Live behandeln, wo sich der Kompromiss umkehrt: Gemini Live kann Ihre Kamera und Ihren Bildschirm sehen, und GPT-Live übertrifft es im Gespräch.

Für Entwickler ist all dies noch nicht in der API; der Arbeitsstapel und das Wartespiel werden in Gibt es eine GPT-Live API? behandelt. Wenn Sie in der Zwischenzeit Sprachagenten mit der Realtime API erstellen, deckt Apidog das WebSocket-Testing und das Backend-Mocking ab, die Sprachprojekte immer benötigen; laden Sie es kostenlos herunter, um diese Sitzungen überprüfbar zu halten.

button

FAQ

Wird der erweiterte Sprachmodus eingestellt? Nein. OpenAI hat den Standard- und erweiterten Sprachmodus verfügbar gelassen. GPT-Live wird der Standard, aber nicht die einzige Option.

Kann ich zum erweiterten Sprachmodus zurückwechseln? Ja, die Auswahl des Sprachmodus bleibt in den Spracheinstellungen von ChatGPT erhalten, und berechtigte Abonnenten behalten dort die Video- und Bildschirmfreigabefunktionen von AVM.

Unterstützt GPT-Live Video- oder Bildschirmfreigabe? Nicht zum Start. OpenAI sagt, dass diese Funktionen „bald“ für GPT-Live verfügbar sein werden; bis dahin ist AVM der Weg, sie zu behalten.

Ist GPT-Live intelligenter als der erweiterte Sprachmodus? Laut OpenAI: wesentlich besser bei GPQA-Wissenschaftsargumentation und stärker bei agentischer Websuche, weil es schwierige Fragen an GPT-5.5 delegiert, anstatt nur aus dem Sprachmodell zu antworten. Die Ergebnisse wurden nicht veröffentlicht.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen