أطلقت جوجل نموذجين جديدين لتحويل الكلام إلى كلام في 15 سبتمبر 2026، وتجاوز موضوع Hacker News 337 نقطة في غضون يوم واحد. هذا رد فعل كبير لإطلاق واجهة برمجة تطبيقات صوتية، ولم يكن معظم النقاش حول الفيديو التوضيحي. كان المطورون يطرحون نفس السؤال: كم يكلف البناء باستخدام هذا، وكيف يمكنك الاتصال به فعليًا؟
هذا هو الدليل. يتم طرح gemini-3.8-live و gemini-3.8-live-extended-thinking الآن في واجهة برمجة تطبيقات Gemini واستوديو Google AI، مع توفر Gemini Enterprise و Search Live في معاينة خاصة. يقبل كلا النموذجين رموزًا مجانية للإدخال والإخراج بالإضافة إلى طبقة مدفوعة بأسعار لكل رمز ولكل دقيقة، وهو أمر غير معتاد بما يكفي لنموذج صوتي مباشر يستحق المرور عبر جلسة WebSocket نفسها، وليس فقط صفحة التسعير. لقد قارنا بالفعل المساعدين الصوتيين للمستهلكين في GPT-Live مقابل Gemini Live؛ هذه المقالة هي مسار المطور إلى واجهة برمجة التطبيقات وراء أحد جانبي هذه المقارنة.
ما الذي تم إطلاقه بالفعل في 15 سبتمبر
يغطي إعلان جوجل نموذجين. gemini-3.8-live هو النموذج القياسي لتحويل الكلام إلى كلام. يضيف gemini-3.8-live-extended-thinking طبقة استدلال تعمل أثناء حديث النموذج، كما هو موضح أدناه. يدعم كلاهما 97 لغة مع التبديل التلقائي في منتصف المحادثة، مما يعني أن المتصل يمكنه بدء جملة بالإنجليزية وإنهائها بالإسبانية دون الحاجة إلى تحديد اللغة يدويًا.

التوفر عند الإطلاق: واجهة برمجة تطبيقات Gemini واستوديو Google AI (وصول عام)، بالإضافة إلى Gemini Enterprise و Search Live (معاينة خاصة، لذلك سيبدأ معظم المطورين الذين يقرأون هذا في واجهة برمجة التطبيقات أو استوديو AI). تنطبق الرموز المجانية على كلا النموذجين في كل من الإدخال والإخراج، مما يجعل النموذج الأولي الحقيقي في متناول اليد قبل أن تلمس بطاقة ائتمان.
تفصيل واحد لم تنشره جوجل: حدود معدل الطبقة المجانية لنموذجي Live. تعد صفحة حدود المعدل هي مصدر الحقيقة بمجرد أن تدرجها؛ تعامل مع أي رقم تراه في أي مكان آخر على أنه غير مؤكد حتى تتحقق منه بنفسك هناك.
كون الوصول إلى Search Live و Gemini Enterprise متاحًا كمعاينة خاصة فقط، بدلاً من أن يكون مفتوحًا مثل واجهة برمجة التطبيقات، هو إشارة تستحق القراءة: تشعر جوجل بالراحة في السماح للمطورين بالبناء باستخدام هذا بطرق قريبة من الإنتاج قبل أن تلتزم بنفس النموذج للبحث الاستهلاكي أو حسابات المؤسسات المدفوعة. هذا أمر طبيعي لإطلاق نموذج كلام، ويعني أن سطح واجهة برمجة التطبيقات هو نقطة البداية المستقرة الآن، وليس معاينة مبسطة لتجربة مستخدم أفضل ستصل لاحقًا.
احصل على مفتاح API مجاني وافتح جلسة
يأتي مفتاح API الخاص بـ Gemini من Google AI Studio، ويرتبط بحساب Google، ويعمل مع نماذج Live في نفس يوم إطلاقها نظرًا لعدم وجود خطوة موافقة منفصلة للطبقة المجانية. بمجرد حصولك على المفتاح، تكون نقطة الاتصال هي WebSocket، وليس نقطة نهاية REST، وهو التعديل الأول إذا كنت معتادًا على استدعاءات generateContent:
wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent
يأتي هذا الرابط من مراجعة سيمون ويليسون العملية من يوم الإطلاق، والتي نُشرت جنبًا إلى جنب مع قراءته الدقيقة المعتادة لواجهة برمجة تطبيقات جديدة. كما أشار إلى شيء يستحق المعرفة قبل بناء واجهة مستخدم حول هذا: يمكنك مقاطعة النموذج في منتصف الاستجابة بالطريقة التي تقاطع بها شخصًا يتحدث، ويمكن أن يتضمن النص الذي يعود كلامًا بدأ النموذج في توليده ولكنه لم يكمل تشغيله أبدًا، لأن التشغيل تم قطعه بسبب مقاطعتك. تعامل مع هذا كحالة مميزة في عميلك بدلاً من افتراض أن كل سطر من النص قد سُمع بالكامل.
تتبع الجلسة ثنائية الاتجاه عبر هذا المقبس الشكل الذي تستخدمه كل واجهة برمجة تطبيقات للبث المستندة إلى WebSocket: رسالة إعداد أولاً، تحدد النموذج وتكوين التوليد الخاص به، ثم دفق من رسائل المحتوى التي تحمل أجزاء صوتية أو نصًا في أي من الاتجاهين، مع إرسال الخادم أجزاء الاستجابة الجزئية والنهائية فور جاهزيتها. مخطط الرسالة الدقيق هو من اختصاص جوجل لتوثيقه بدقة، ويمكن أن يتغير بين المعاينة والتوفر العام، لذا تحقق من أسماء الحقول مقابل وثائق Gemini API المباشرة ومرجع SDK الخاص بك قبل الالتزام بعميل إنتاجي. ما هو مستقر هو النمط: الاتصال، إرسال الإعداد، بث المحتوى، قراءة الاستجابات المباشرة، وتوقع أن تكون المقاطعة حدثًا طبيعيًا بدلاً من حالة خطأ.
عمليًا، هذا يعني أن جلستك العملية الأولى يجب أن تهدف إلى أصغر حلقة ممكنة: افتح المقبس، أرسل رسالة إعداد واحدة تسمي النموذج الذي تريده (gemini-3.8-live أو gemini-3.8-live-extended-thinking)، أرسل دورًا صوتيًا أو نصيًا قصيرًا واحدًا، وتأكد من حصولك على استجابة متدفقة قبل إضافة منطق إعادة المحاولة، أو معالجة إعادة الاتصال، أو واجهة مستخدم. أنشئ مسار المقاطعة ثانيًا، بمجرد أن يعمل المسار السعيد، لأن اختباره جيدًا يعني التحدث عمدًا فوق النموذج في منتصف الاستجابة والتحقق من أن عميلك يحدد بشكل صحيح النص المقطوع بدلاً من التعامل معه كدور مكتمل.
التفكير الموسع: عندما يحدث الاستدلال بصوت عالٍ
يجيب نموذج gemini-3.8-live العادي مباشرة. يقوم gemini-3.8-live-extended-thinking بشيء مختلف: تقول جوجل إنه "يستدل ويتحدث في نفس الوقت"، محافظًا على ما تسميه "تدفق المحادثة غير المنقطع" عن طريق ملء وقت الاستدلال بإشارات لفظية، وعبارات مثل "دعني أتحقق من ذلك" بدلاً من الصمت التام أثناء عمل النموذج.
يهم هذا فئة معينة من التطبيقات: وكلاء الصوت الذين يستدعون الأدوات أو يجرون طلبات إلى واجهات برمجة تطبيقات خارجية في منتصف المحادثة. يقوم نموذج التفكير الموسع "بتنفيذ الأدوات واستدعاءات واجهة برمجة التطبيقات في الخلفية مع مواصلة المحادثة"، ويتم دعم استدعاء الوظائف في كلا النموذجين. تخيل وكيل حجز يحتاج إلى التحقق من التوفر مقابل واجهة برمجة تطبيقات تقويم: بدلاً من الصمت لمدة ثانيتين أثناء تشغيل البحث، يمكن للنموذج تأكيد الطلب بصوت عالٍ ومواصلة التبادل بينما يكتمل الاستدعاء في الخلفية.
اختر التفكير الموسع عندما تتضمن جلستك استدعاءات أدوات، أو عمليات بحث متعددة الخطوات، أو إجابات تتطلب تفكيرًا مكثفًا حيث قد يشعر الفراغ الصامت بأنه خلل. اختر النموذج العادي للمحادثات الأقصر وذات زمن الاستجابة المنخفض حيث لا تكون النفقات العامة للتفكير ضرورية. يكلف كلاهما نفس السعر لكل رمز، لذا فإن الاختيار يتعلق بالسلوك وليس الميزانية. إذا كان وكيلك يعتمد على استدعاء الوظائف بشكل خاص، فإن دليل استدعاء الوظائف لـ Gemini 3.8 Flash يغطي شكل الطلب الذي تستخدمه جوجل عبر عائلة Gemini 3.8 الحالية، على الرغم من أنه يجب تأكيد حمولة استدعاء الوظائف الخاصة بـ Live مقابل وثائق Live API قبل الإطلاق، حيث لا يوجد ضمان بأن واجهات برمجة تطبيقات النصوص والكلام تشترك في نفس المخطط.
ما يكلفه، محسوبًا
يشترك كلا نموذجي Live في نفس التسعير القياسي:
| النوع | السعر |
|---|---|
| إدخال نصي | 0.75 دولار لكل مليون رمز |
| إدخال صوتي | 3.00 دولارات لكل مليون رمز، أو 0.005 دولار للدقيقة |
| إدخال صورة/فيديو | 1.00 دولار لكل مليون رمز، أو 0.002 دولار للدقيقة |
| إخراج نصي | 4.50 دولارات لكل مليون رمز |
| إخراج صوتي | 12.00 دولارًا لكل مليون رمز، أو 0.018 دولار للدقيقة |
يتم احتساب رموز التفكير كإخراج، تمامًا مثل أي نموذج آخر من نماذج Gemini 3.x، لذا يظهر الاستدلال الخلفي للتفكير الموسع في سطر الإخراج بدلاً من احتسابه كرسوم منفصلة.
مثال عملي: مكالمة صوتية مدتها 10 دقائق، صوت داخلي وصوت خارجي طوال الوقت، على الطبقة القياسية المدفوعة. إدخال الصوت: 10 دقائق × 0.005 دولار = 0.05 دولار. إخراج الصوت: 10 دقائق × 0.018 دولار = 0.18 دولار. الإجمالي: 0.23 دولار لمحادثة كاملة ذهابًا وإيابًا مدتها 10 دقائق، قبل إضافة أي رموز نصية أو رموز استدعاء أدوات. قم بإجراء نفس المكالمة على الطبقة المجانية أثناء بناء النماذج الأولية وستكون تكلفة الرمز صفرًا، وذلك رهناً بأي حد معدل ستنشره جوجل في النهاية.
يحمل نموذج gemini-3.1-flash-live-preview على نفس صفحة التسعير أسعارًا مطابقة لكل من نموذجي Live الجديدين، وهو أمر يستحق التحقق منه إذا كان لديك بالفعل تكامل Live على هذا النموذج الأقدم؛ قرار التسعير ليس سببًا للتأخير في الترحيل.
ما يقوله المطورون حتى الآن
النقاش في Hacker News ليس إيجابيًا بشكل موحد. شكوى متكررة: لا يملك مشتركو Google Workspace المدفوعون و Google AI Plus وصولًا للمستهلكين إلى تجربة Live الجديدة بعد، على الرغم من أنهم عملاء يدفعون، بينما الوصول إلى API و AI Studio مفتوح. وصف أحد التقارير من الموضوع حلقة وكيلية حيث اخترع النموذج متطلبات إضافية لم تكن جزءًا من المهمة الأصلية، وهو نمط فشل يستحق الاختبار تحديدًا إذا كنت تربط Live بوكيل مستقل بدلاً من مساعد صوتي يضم إنسانًا في الحلقة. إذا كنت تبني شيئًا أقرب إلى حلقة مستقلة منه إلى مساعد تحت الإشراف، أضف فحصًا صريحًا يقارن ما يدعي النموذج أنه يحتاجه بتعريف المهمة الذي قدمته له، بدلاً من الثقة في المتطلبات المعلنة للنموذج بشكل مباشر. تعامل مع كلتا النقطتين كإشارة أولية من موضوع واحد، وليس تقرير عيب متحقق منه، وأعد الاختبار مقابل حالة الاستخدام الخاصة بك قبل التعميم منها.

اطلع على البروتوكول الخام قبل كتابة رمز العميل
قبل الالتزام بمكتبة عميل، يساعدك مشاهدة الإطارات الفعلية وهي تنتقل عبر الشبكة. يمكن لـ Apidog فتح اتصال WebSocket بنقطة النهاية BidiGenerateContent، وإرسال رسالة إعداد JSON ورسائل المحتوى اللاحقة يدويًا، وعرض الإطارات المتدفقة العائدة إليك في الوقت الفعلي، وهي أسرع طريقة لفهم نمط الإعداد ثم البث قبل كتابة سطر واحد من رمز SDK حوله. لا يقوم Apidog بالتقاط صوت الميكروفون لك؛ فأنت توفر حمولات الصوت أو النص بنفسك وتستخدم الاتصال لفحص ما يرسله الخادم، وتأكيد قبول رسالة الإعداد الخاصة بك، ومشاهدة كيفية تصرف المقاطعة قبل بناء معالجة الأخطاء لها في الإنتاج. المرجع الكامل للبروتوكول لبناء واختبار واجهات برمجة تطبيقات WebSocket بهذه الطريقة موجود على docs.apidog.com. قم بتنزيل Apidog لتجربة الاتصال بنفسك قبل بناء عميلك الأول.
للمقارنة، يغطي تحليلنا لـ WebSocket مقابل WebRTC سبب اختيار جوجل لـ WebSocket لهذا التدفق ثنائي الاتجاه بدلاً من مسار WebRTC الذي تستخدمه بعض واجهات برمجة التطبيقات الصوتية المنافسة، وماذا يعني هذا التوازن بالنسبة لعملاء المتصفح على وجه التحديد.
الأسئلة الشائعة
هل واجهة برمجة تطبيقات Gemini 3.8 Live مجانية؟ نعم، لكلا النموذجين، رموز الإدخال والإخراج مجانية في الطبقة المجانية. تنطبق الأسعار القياسية المدفوعة بمجرد تجاوز أي حد معدل تحدده جوجل، ولم يتم نشر حد الطبقة المجانية بعد، لذا تحقق من صفحة حدود المعدل مباشرة.
ما الفرق بين النموذجين الجديدين؟ يجيب gemini-3.8-live مباشرة. يقوم gemini-3.8-live-extended-thinking بالاستدلال أثناء التحدث، باستخدام كلام حشو لفظي لتغطية استدعاءات الأدوات الخلفية وعمليات البحث متعددة الخطوات، بنفس سعر الرمز.
هل أحتاج إلى WebRTC لاستخدام هذا؟ لا. تعتمد واجهة برمجة التطبيقات على WebSocket، وتتصل بنقطة نهاية BidiGenerateContent بدلاً من اتصال نظير WebRTC.
هل يمكنني اختبار هذا بدون كتابة عميل؟ نعم. افتح WebSocket في Apidog، وأرسل رسائل الإعداد والمحتوى يدويًا، واقرأ الاستجابة المتدفقة قبل بناء عميل حقيقي حولها.
