حصل ChatGPT Voice على أكبر إعادة بناء له منذ إطلاق وضع الصوت المتقدم (Advanced Voice Mode). اعتبارًا من 8 يوليو 2026، GPT-Live هو الوضع الافتراضي الجديد: GPT-Live-1 للمستخدمين المدفوعين في Go وPlus وPro، وGPT-Live-1 mini للطبقة المجانية.
إذا كنت تستخدم الصوت يوميًا، فسؤالان مهمان: ما الذي أصبح أفضل، وماذا خسرت. كلا الإجابتين ملموستين، وإحداهما هي السبب الذي قد يجعلك ترغب في البقاء على وضع الصوت المتقدم لفترة أطول.
مقارنة سريعة
| وضع الصوت المتقدم (Advanced Voice Mode) | GPT-Live | |
|---|---|---|
| نموذج المحادثة | يعتمد على الدور: يتحدث بعد أن تتوقف | ازدواجي كامل: يستمع أثناء التحدث |
| المقاطعات | مدعومة، لكن حدود الدور تخطئ | مستمرة؛ يقرر عدة مرات في الثانية |
| قنوات رد الفعل ("اممم") | لا | نعم |
| الأسئلة الصعبة | يتم الإجابة عليها بواسطة نموذج الصوت نفسه | يتم تفويضها إلى GPT-5.5 في الخلفية |
| البحث عبر الويب | محدود | بحث مفوض، مدمج في المحادثة |
| الترجمة الفورية | أساسي | مدعومة |
| البطاقات المرئية (الطقس، الأسهم، الرياضة) | لا | نعم |
| مشاركة الفيديو والشاشة | نعم (للمشتركين المؤهلين) | ليس عند الإطلاق |
| التوفر | يبقى متاحًا | افتراضي، يطرح عالميًا |
ما الذي تحسن بالفعل
لم يعد تناوب الكلام هو الواجهة. عالج وضع الصوت المتقدم الصوت في نموذج واحد، مما قلل من زمن الاستجابة، لكن المحادثات كانت لا تزال تسير في أدوار منفصلة. يمكن أن تُفسّر وقفة التفكير أو الضوضاء الخلفية على أنها "انتهى المستخدم"، لذا كان النموذج يقاطع في اللحظات الخاطئة. يعالج GPT-Live المدخلات باستمرار أثناء توليد المخرجات؛ فهو ينتظر بينما تفكر، ويقرّ بينما تشرح، ويستعيد عندما تتحدث فوقه. في تقييمات المستخدمين من OpenAI، "فضل الناس بشدة" GPT-Live في محادثات وجهاً لوجه استمرت من 5 إلى 10 دقائق.
ارتفع سقف الذكاء. أجاب وضع الصوت المتقدم من قدرته الخاصة. GPT-Live يفوض: "عندما يتطلب سؤال بحثًا أو استدلالًا أو قدرات أكثر تفاعلية"، فإنه يسلم المهمة إلى نموذج أقوى، GPT-5.5 عند الإطلاق، ويستمر في المحادثة حتى تعود الإجابة. تُفيد OpenAI بأنه "يتفوق بشكل كبير" على وضع الصوت المتقدم في GPQA (أسئلة علمية على مستوى الخبراء) ويظهر "مكاسب قوية" في بحث الويب التفاعلي لـ BrowseComp. إنها تقارير من البائع وغير محسوبة كميًا، ولكن السبب المعماري للاعتقاد بذلك سليم: السقف الآن هو GPT-5.5، وليس نموذج الصوت.
أصبحت المحادثة مزودة بأثاث. تظهر البطاقات المرئية للطقس والأسهم والرياضة على الشاشة في منتصف المحادثة؛ ويمكن إدخال الصور والملفات إلى الدردشة الصوتية؛ وتحمل الذاكرة عبر المحادثات.
ماذا تخسر، في الوقت الحالي
مشاركة الفيديو والشاشة. تصرح OpenAI بوضوح: "عند الإطلاق، لن يدعم GPT-Live الصوت مع الفيديو أو مشاركة الشاشة في ChatGPT، لكننا نعمل على تقديم هذه القدرات قريبًا."
يحتفظ وضع الصوت المتقدم بهاتين الميزتين للمشتركين المؤهلين. إذا كانت سير عملك يتضمن توجيه الكاميرا نحو جهاز معطل، أو مشاركة شاشتك للمساعدة في تصحيح الأخطاء، أو أي تفاعل "أظهر لا تخبر"، فإن GPT-Live يعتبر تقليلًا في الميزات اليوم. هذا هو أقوى سبب وحيد لتأخير التبديل، وقد أبقت OpenAI كلاً من وضع الصوت القياسي والمتقدم متاحين بدلاً من فرض الترحيل.
كمية معروفة. تم توثيق تفاصيل وضع الصوت المتقدم وهي مستقرة. GPT-Live عمره أسبوع ويطرح على مراحل؛ التغييرات في السلوك في الأيام الأولى طبيعية.
من يجب أن ينتقل، ومن يجب أن ينتظر
انتقل الآن إذا كان استخدامك للصوت للمحادثة أو الأسئلة أو الترجمة أو العمل بدون استخدام اليدين. الفرق في الازدواج الكامل ليس خفيًا، والتفويض يجعل الصوت قابلاً للتطبيق للأسئلة التي كنت ستكتبها في السابق. مسار الإعداد، بما في ذلك اختيار البديل وCarPlay، موجود في كيفية استخدام GPT-Live.
انتظر إذا كنت تستخدم الفيديو أو مشاركة الشاشة. احتفظ بوضع الصوت المتقدم حتى يتم إطلاق ميزات GPT-Live "قريبًا"؛ لن تخسر شيئًا بالانتظار، حيث يظل وضع الصوت المتقدم متاحًا ويمكن تحديده.
لا يواجه مستخدمو الطبقة المجانية هذا الخيار: يصبح GPT-Live-1 mini هو الافتراضي، ويحمل نفس نمط التفاعل ثنائي الاتجاه مع GPT-5.5 Instant وراءه.
الصورة الأكبر
يُنهي هذا الإصدار عصر "جهاز الاتصال اللاسلكي" للذكاء الاصطناعي الصوتي في المساعد الأكثر استخدامًا في السوق، وهيكلته، وهي واجهة محادثة سريعة تفوض إلى منطق عميق بطيء، هو النمط الذي يجب على المنافسين الآن أن يطابقوه. كيفية مقارنته بنهج جوجل هو سؤال مطروح نتناوله في GPT-Live مقابل Gemini Live، حيث ينعكس التوازن: يمكن لـ Gemini Live رؤية الكاميرا والشاشة، وGPT-Live يتفوق عليه في المحادثة.
بالنسبة للمطورين، لا شيء من هذا موجود في واجهة برمجة التطبيقات بعد؛ يتم تغطية حزمة العمل ولعبة الانتظار في هل توجد واجهة برمجة تطبيقات لـ GPT-Live؟. إذا كنت تبني وكلاء صوتيين على واجهة برمجة التطبيقات في الوقت نفسه، فإن Apidog يغطي اختبار WebSocket والمحاكاة الخلفية التي تحتاجها مشاريع الصوت دائمًا؛ قم بتنزيله مجانًا للحفاظ على تلك الجلسات قابلة للفحص.
الأسئلة الشائعة
هل سيختفي وضع الصوت المتقدم (Advanced Voice Mode)؟ لا. أبقت OpenAI وضع الصوت القياسي والمتقدم متاحين. يصبح GPT-Live هو الوضع الافتراضي، وليس الخيار الوحيد.
هل يمكنني العودة إلى وضع الصوت المتقدم؟ نعم، يظل اختيار وضع الصوت متاحًا في إعدادات الصوت في ChatGPT، ويحتفظ المشتركون المؤهلون بميزات الفيديو ومشاركة الشاشة لوضع الصوت المتقدم هناك.
هل يدعم GPT-Live الفيديو أو مشاركة الشاشة؟ ليس عند الإطلاق. تقول OpenAI إن هذه القدرات ستأتي إلى GPT-Live "قريبًا"؛ وحتى ذلك الحين، فإن وضع الصوت المتقدم هو السبيل للاحتفاظ بها.
هل GPT-Live أذكى من وضع الصوت المتقدم؟ وفقًا لـ OpenAI: أفضل بكثير في استدلال GPQA العلمي وأقوى في بحث الويب التفاعلي، لأنه يفوض الأسئلة الصعبة إلى GPT-5.5 بدلاً من الإجابة من نموذج الصوت وحده. لم يتم نشر النتائج.
