ChatGPT Voice mengalami pembangunan ulang terbesar sejak Advanced Voice Mode diluncurkan. Mulai 8 Juli 2026, GPT-Live adalah standar baru: GPT-Live-1 untuk pengguna berbayar di Go, Plus, dan Pro, GPT-Live-1 mini untuk tingkat Gratis.
Jika Anda menggunakan suara setiap hari, dua pertanyaan penting: apa yang lebih baik, dan apa yang hilang dari Anda. Kedua jawaban tersebut konkret, dan salah satunya adalah alasan mengapa Anda mungkin ingin tetap menggunakan Advanced Voice Mode untuk sementara waktu lagi.
Perbandingan Sekilas
| Advanced Voice Mode | GPT-Live | |
|---|---|---|
| Model percakapan | Berbasis giliran: berbicara setelah Anda berhenti | Full-duplex: mendengarkan sambil berbicara |
| Interupsi | Didukung, tetapi batas giliran sering salah | Berkesinambungan; memutuskan berkali-kali per detik |
| Umpan balik non-verbal (“mhmm”) | Tidak | Ya |
| Pertanyaan sulit | Dijawab oleh model suara itu sendiri | Didelegasikan ke GPT-5.5 di latar belakang |
| Pencarian web | Terbatas | Pencarian didelegasikan, terintegrasi ke dalam percakapan |
| Terjemahan langsung | Dasar | Didukung |
| Kartu visual (cuaca, saham, olahraga) | Tidak | Ya |
| Berbagi video dan layar | Ya (pelanggan yang memenuhi syarat) | Tidak saat peluncuran |
| Ketersediaan | Tetap tersedia | Standar, diluncurkan secara global |
Apa yang benar-benar meningkat
Pengambilan giliran tidak lagi menjadi antarmuka. Advanced Voice Mode memproses audio dalam satu model, yang mengurangi latensi, tetapi percakapan masih berjalan dalam giliran yang terpisah. Jeda berpikir atau kebisingan latar belakang dapat diartikan sebagai “pengguna selesai,” sehingga model menginterupsi pada saat yang salah. GPT-Live memproses masukan secara terus-menerus sambil menghasilkan keluaran; ia menunggu saat Anda berpikir, mengakui saat Anda menjelaskan, dan pulih ketika Anda berbicara di atasnya. Dalam evaluasi pengguna OpenAI, orang-orang “sangat menyukai” GPT-Live dalam percakapan tatap muka 5 hingga 10 menit.
Batas kecerdasan terangkat. Advanced Voice Mode menjawab dari kemampuannya sendiri. GPT-Live mendelegasikan: “ketika sebuah pertanyaan membutuhkan pencarian, penalaran, atau kemampuan agen yang lebih canggih,” ia menyerahkan tugas tersebut kepada model yang lebih kuat, GPT-5.5 saat peluncuran, dan melanjutkan percakapan hingga jawaban kembali. OpenAI melaporkan bahwa ia “secara substansial mengungguli” Advanced Voice Mode pada GPQA (pertanyaan sains tingkat ahli) dan menunjukkan “peningkatan yang kuat” pada pencarian web agentic BrowseComp. Dilaporkan oleh vendor dan tidak terkuantifikasi, tetapi alasan arsitektur untuk mempercayainya adalah masuk akal: batasnya sekarang adalah GPT-5.5, bukan model suara.
Percakapan menjadi lebih 'berisi'. Kartu visual untuk cuaca, saham, dan olahraga ditampilkan di layar di tengah percakapan; gambar dan file dapat masuk ke obrolan suara; memori tetap terjaga.
Apa yang hilang, untuk saat ini
Berbagi video dan layar. OpenAI menyatakannya dengan jelas: “Saat peluncuran, GPT-Live tidak akan mendukung suara dengan berbagi video atau layar di ChatGPT, tetapi kami sedang berupaya untuk memperkenalkan kemampuan ini segera.”
Advanced Voice Mode mempertahankan keduanya untuk pelanggan yang memenuhi syarat. Jika alur kerja Anda melibatkan mengarahkan kamera ke peralatan yang rusak, berbagi layar untuk bantuan debugging, atau interaksi 'menunjukkan, bukan memberitahu', GPT-Live adalah penurunan saat ini. Ini adalah alasan terkuat untuk menunda peralihan, dan OpenAI mempertahankan Standard dan Advanced Voice Mode tersedia daripada memaksakan migrasi.
Sesuatu yang sudah dikenal. Kekhasan Advanced Voice Mode didokumentasikan dan stabil. GPT-Live baru berusia seminggu dan diluncurkan secara bertahap; perubahan perilaku di awal-awal adalah normal.
Siapa yang harus beralih, siapa yang harus menunggu
Beralihlah sekarang jika penggunaan suara Anda adalah untuk percakapan, pertanyaan, terjemahan, atau pekerjaan tanpa tangan. Perbedaan full-duplex tidak halus, dan pendelegasian membuat suara menjadi layak untuk pertanyaan yang sebelumnya akan Anda ketik. Jalur pengaturan, termasuk pemilihan varian dan CarPlay, ada di cara menggunakan GPT-Live.
Tunggulah jika Anda menggunakan berbagi video atau layar. Pertahankan Advanced Voice Mode hingga fitur “segera” dari GPT-Live diluncurkan; Anda tidak akan rugi apa pun dengan menunggu, karena AVM tetap tersedia dan dapat dipilih.
Pengguna tingkat gratis tidak memiliki pilihan: GPT-Live-1 mini menjadi standar, dan ia membawa gaya interaksi full-duplex yang sama dengan GPT-5.5 Instant di baliknya.
Gambaran yang lebih besar
Rilis ini mengakhiri era 'walkie-talkie' AI suara pada asisten yang paling banyak digunakan di pasar, dan arsitekturnya, sebuah front-end percakapan cepat yang mendelegasikan ke penalaran mendalam yang lambat, adalah pola yang sekarang harus ditiru oleh para pesaing. Bagaimana ia bersaing dengan pendekatan Google adalah pertanyaan hidup yang kami bahas di GPT-Live vs Gemini Live, di mana pertukarannya terbalik: Gemini Live dapat melihat kamera dan layar Anda, dan GPT-Live mengunggulinya dalam percakapan.
Untuk pengembang, semua ini belum ada di API; tumpukan kerja dan permainan menunggu dibahas dalam Apakah ada API GPT-Live?. Sementara itu, jika Anda membangun agen suara di Realtime API, Apidog mencakup pengujian WebSocket dan mocking backend yang selalu dibutuhkan oleh proyek suara; unduh gratis untuk menjaga sesi-sesi tersebut dapat diperiksa.
FAQ
Apakah Advanced Voice Mode akan dihilangkan? Tidak. OpenAI tetap menyediakan Standard dan Advanced Voice Mode. GPT-Live menjadi standar, bukan satu-satunya pilihan.
Bisakah saya beralih kembali ke Advanced Voice Mode? Ya, pemilihan mode suara tetap ada di pengaturan suara ChatGPT, dan pelanggan yang memenuhi syarat tetap memiliki fitur berbagi video dan layar AVM di sana.
Apakah GPT-Live mendukung berbagi video atau layar? Tidak saat peluncuran. OpenAI mengatakan kemampuan ini akan hadir di GPT-Live “segera”; sampai saat itu, AVM adalah cara untuk mempertahankannya.
Apakah GPT-Live lebih pintar dari Advanced Voice Mode? Menurut OpenAI: secara substansial lebih baik dalam penalaran sains GPQA dan lebih kuat dalam pencarian web agentic, karena ia mendelegasikan pertanyaan sulit ke GPT-5.5 daripada menjawab hanya dari model suara. Skor tidak dipublikasikan.
