جي بي تي-6 سول زمن الاستجابة: 102 ثانية لأول رمز

يسجل GPT-6 Sol زمنًا قدره 102.15 ثانية للرمز الأول بمعدل 115.2 رمز/ثانية في وضع الاستدلال الأقصى. لماذا ليس النموذج الرخيص هو النموذج السريع، كيفية قياس TTFT بشكل صحيح، وأربعة تغييرات تصميمية تمنع استدعاءً مدته 100 ثانية من تعطيل واجهة برمجة التطبيقات الخاصة بك.

Emmanuel Mumba

Emmanuel Mumba

23 سبتمبر 2026

جي بي تي-6 سول زمن الاستجابة: 102 ثانية لأول رمز

Apidog للمؤسسات

النشر على الخوادم المحلية

SSO و RBAC

متوافق مع SOC 2

استكشف Apidog للمؤسسات

لقد استبدلت gpt-6-astra بـ gpt-6-sol لأن سعر التوكن انخفض من 10 دولارات و 50 دولارًا للمليون إلى 2 دولار و 10 دولارات. الفاتورة تبدو رائعة. ثم يتجاوز وقت استجابة p95 الخاص بك دقيقتين، ويبدأ موازن التحميل لديك في إرجاع أخطاء انتهاء مهلة البوابة، ويمتلئ الدعم بأشخاص يسألون لماذا تتوقف الصفحة.

لا شيء معطل. لقد غيرت شكل عبء العمل، وليس سعره فقط.

تقيس Artificial Analysis نموذج GPT-6 Sol بمعدل 115.2 توكن إخراج في الثانية مع وقت لأول توكن يبلغ 102.15 ثانية. ويقيس GPT-6 Luna بمعدل 153.9 توكن إخراج في الثانية مع 124.23 ثانية لأول توكن. يحمل هذان الرقمان تحذيرات كبيرة، وهذا هو النصف الأول من هذه المقالة. أما النصف الثاني فهو ما يجب فعله حيالها: كيفية قياس زمن استجابة أول توكن بصدق على عبء العمل الخاص بك، والتغييرات الأربعة في التصميم التي تمنع نموذجًا يستغرق 100 ثانية من تعطيل واجهة برمجة التطبيقات (API) الخاصة بك.

للاطلاع على السياق الأوسع لثلاثة إطلاقات رائدة في يومين، راجع حرب أسعار نماذج سبتمبر 2026.

زر

الرقم، وكل ما هو خاطئ في الاقتباس منه

اقرأ عمود التحذير قبل عمود الأرقام.

القياس GPT-6 Sol GPT-6 Luna تحذير
الوقت لأول توكن 102.15 ثانية 124.23 ثانية جهة خارجية، متغير الاستدلال "الأقصى"
سرعة الإخراج 115.2 توكن/ث 153.9 توكن/ث جهة خارجية، متغير الاستدلال "الأقصى"
سعر الإدخال للمليون $2 $0.10 OpenAI
سعر الإخراج للمليون $10 $0.50 OpenAI
نافذة السياق 872,000 1,000,000 OpenAI

ثلاثة أمور يخبرك بها هذا العمود.

هذه أرقام Artificial Analysis، وليست أرقام OpenAI. لقد نشرت OpenAI الأسعار والسياق والتوافر ومجموعة من نتائج المقارنات المعيارية عند الإطلاق. لم تنشر رقم زمن استجابة في المواد التي قرأناها. لذا، فإن 102.15 ثانية هي نتيجة طرف ثالث يقوم بتشغيل اختباره الخاص على شبكته الخاصة، ويجب أن تتعامل معها كتوجيه وليس كمواصفة. قم بتدوينها في مستنداتك الخاصة بالطريقة التي ندوّنها بها هنا.

تصف هذه الأرقام متغير الاستدلال "الأقصى". تظهر تسميات الجهد في جميع جداول المقارنات المعيارية لكلا البائعين عند الإطلاق: منخفض، متوسط، عالٍ، عالٍ جدًا، أقصى. الأقصى هو قمة هذا السلم، وجهد الاستدلال هو أكبر عامل تأثير على زمن الاستجابة لأول توكن. قياس أبطأ تهيئة ليس قياسًا للتهيئة التي ستعمل بها في الإنتاج.

هي قياسات لنقطة نهاية مزود واحد في لحظة واحدة. تتغير سعة الخدمة والتوجيه وعمق قائمة الانتظار. إن الرقم الذي تم الحصول عليه في أسبوع الإطلاق خلال ذروة حركة المرور هو أسوأ سيناريو يتنكر في هيئة ثابت.

ما يتبقى بعد كل التحذيرات الثلاثة هو الاتجاه، والاتجاه هو نقطة هذه المقالة. النموذج الرخيص ليس النموذج السريع. يكلف Sol خمس سعر Astra لكل توكن ويكلف Luna عشرين سعر Sol، ولا يمنحك أي من هذه التخفيضات بايتًا أول أسرع. وفقًا لهذا القياس، كان أرخص نموذج في العائلة هو الأبطأ في البدء.

الوقت لأول توكن هو الاسم الخاطئ لما تقيسه

في نموذج غير استدلالي، الوقت لأول توكن هو تقريبًا الشبكة بالإضافة إلى قائمة الانتظار بالإضافة إلى التعبئة المسبقة. يتناسب مع طول المطالبة ويصل إلى مئات المللي ثانية.

في نموذج استدلالي، هو كمية مختلفة تحمل نفس التسمية. يقوم النموذج بتفكيره قبل أن يصدر أي شيء طلبته، لذا فإن الفجوة قبل أول توكن مرئي تحتوي على مرحلة الاستدلال بأكملها. هذه المرحلة لا علاقة لها بطول مطالبتك. لها علاقة بمدى صعوبة المشكلة التي يقررها النموذج.

تترتب على ذلك نتيجتان، وكلاهما تظهران في الإنتاج.

الأولى هي أن معدل التوكن السريع لا ينقذك. يصدر Sol بمعدل 115.2 توكن في الثانية بمجرد أن يبدأ، وهو سريع. لا يهم كثيرًا، لأن تقريبًا كامل وقت التشغيل يُقضى قبل أول توكن.

طول الإخراج الوقت لأول توكن وقت التوليد الإجمالي النسبة المئوية لوقت الانتظار
500 توكن 102.15 ثانية 4.3 ثانية 106.5 ثانية 96%
2,000 توكن 102.15 ثانية 17.4 ثانية 119.5 ثانية 85%
8,000 توكن 102.15 ثانية 69.4 ثانية 171.6 ثانية 60%

وقت التوليد هو طول الإخراج مقسومًا على 115.2 توكن في الثانية، لذا فإن هذا الجدول هو عملية حسابية على الرقمين المقاسين بدلاً من قياس جديد. تقصير استجاباتك بالكاد يغير الإجمالي. تقليص إجابة مطولة من 2000 توكن إلى 500 يوفر ثلاثة عشر ثانية من مكالمة تستغرق دقيقتين.

النتيجة الثانية هي أن الترتيب ينقلب حسب طول الاستجابة. لدى Luna معدل توكن أسرع وبداية أبطأ. عند تشغيل الخطين مقابل بعضهما البعض، يتقاطعان عند حوالي 10100 توكن إخراج: أقل من ذلك، ينهي Sol أولاً على الرغم من التوليد ببطء أكثر، وفوق ذلك، يؤتي معدل Luna ثماره أخيرًا لانتظاره الأطول. تقريبًا لا يوجد شيء تقدمه للمستخدم هو استجابة 10000 توكن، لذلك لمعظم أعباء العمل، يكون النموذج الأبطأ في البدء هو ببساطة النموذج الأبطأ.

ما الذي يتعطل أولاً

نادرًا ما يكون الفشل في استدعاء النموذج نفسه. بل في كل ما يحيط به والذي تم تصميمه لواجهة برمجة تطبيقات (API) سريعة.

انتهاء مهلة الخمول. تحدد موازنات التحميل، ومراكز الوكيل العكسي، وبوابات واجهة برمجة التطبيقات، ومنصات بلا خادم جميعها المدة التي يمكن أن يظل فيها الاتصال بدون تدفق بايتات. الكثير من هذه الإعدادات الافتراضية تكون أقل بكثير من دقيقتين. لا تثق في رقم تقرأه في تدوينة، بما في ذلك هذه: اذهب واقرأ تكوينك الخاص. الحل عادةً هو توجيه واحد، مثل proxy_read_timeout على Nginx، بالإضافة إلى الإعداد المطابق على كل قفزة أمامه، بما في ذلك مهلة SDK للعميل نفسه.

إعادة المحاولات. سياسة إعادة المحاولة التي كانت منطقية عند 300 مللي ثانية تصبح خطيرة عند 100 ثانية. ثلاث محاولات مع تأخير زمني هي الآن طلب يستغرق خمس دقائق، واندفاع من إعادة المحاولات خلال فترة بطيئة يضع المزيد من العمل المتزامن على نقطة النهاية نفسها التي كانت تواجه صعوبة بالفعل. حدد عدد المحاولات، واحتفظ بقاطع دائرة، واجعل كل استدعاء مستقرًا (idempotent) بحيث لا يمكن لإعادة المحاولة مضاعفة الشحن أو مضاعفة الكتابة.

التزامن، وهو ما يغفله الناس. ينص قانون ليتل على أن عدد الطلبات قيد التنفيذ يساوي معدل الوصول مضروبًا في الوقت في النظام. عند طلب واحد في الثانية ومكالمة تستغرق 120 ثانية، تحتاج إلى 120 طلبًا متزامنًا قيد التنفيذ لمجرد مواكبة ذلك. تشغل هذه الاتصالات مقابس أو سلاسل أو استدعاءات دالة لمدة دقيقتين لكل منها، ولا يظهر أي من ذلك في فاتورة التوكنات. يمكن أن يكون النموذج الرخيص لكل استدعاء مكلفًا لكل ثانية من السعة المحجوزة.

واجهة المستخدم. لا توجد أي عجلة تحميل تصمد لمدة 102 ثانية. إذا كانت مرحلة الاستدلال على مسار طلبك المتزامن، فإن الحل معماري، وليس تجميليًا.

كيفية قياسه على عبء العمل الخاص بك

تُعد أرقام البائعين والأطراف الثالثة فرضية أولية. تحدد مطالبتك، منطقتك، إعدادات جهدك، ونمط حركة مرور البيانات الرقم الحقيقي.

ابدأ بالنظر إلى مستوى النقل، والذي يتطلب أمرًا واحدًا:

curl -N -s -o /dev/null \
  -w 'dns=%{time_namelookup} connect=%{time_connect} first_byte=%{time_starttransfer} total=%{time_total}\n' \
  https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"gpt-6-sol","input":"Summarise this OpenAPI operation.","stream":true}'

ثم اقرأ first_byte بشك. في نقطة نهاية البث (streaming endpoint)، تكون البايتات الأولى عادةً حدث فتح بث، وليست توكن محتوى، لذا يقيس time_starttransfer متى بدأ الخادم في التحدث بدلاً من متى بدأ النموذج في الإجابة. هذه الفجوة هي بالضبط ما تحاول قياسه، ولهذا السبب يُظهر اختبار بسيط رقمًا جذابًا.

إن توقيت دلتا المحتوى الأول هو القياس المهم:

import time
from openai import OpenAI

client = OpenAI(timeout=600)

t0 = time.perf_counter()
first_content = None

with client.responses.stream(
    model="gpt-6-sol",
    input=PROMPT,
    reasoning={"effort": "low"},
) as stream:
    for event in stream:
        if event.type == "response.output_text.delta" and first_content is None:
            first_content = time.perf_counter() - t0
    total = time.perf_counter() - t0

print(f"ttft={first_content:.2f}s total={total:.2f}s")

أسماء الحقول والأحداث في هذه المقاطع مأخوذة من أشكال واجهة برمجة تطبيقات OpenAI الحالية بدلاً من إعلان إطلاق GPT-6، لذا تحقق منها مقابل المرجع قبل النشر. ما ينتقل هو الانضباط في القياس: سجل الوقت لأول توكن محتوى والوقت الإجمالي كمعيارين منفصلين، واحتفظ بهما لكل نموذج ولكل مستوى جهد، وقم بالإبلاغ عن p95 بدلاً من المتوسط. زمن الاستجابة لأول توكن في نموذج الاستدلال له ذيل طويل، ويخفي المتوسط بالضبط الطلبات التي تنتهي مهلتها.

قم بتشغيل ذلك كفحص مجدول بدلاً من مرة واحدة. احفظ طلب البث في Apidog، وقم بتأكيد وقت الاستجابة، وقم بتشغيل السيناريو بانتظام في CI بحيث يظهر أي تراجع من جانب المزود أو تغيير في مستوى الجهد كاختبار فاشل بدلاً من تذكرة دعم. يوفر نفس المشروع للعمل الأمامي طريقة لتجاوز الانتظار: وجه العميل إلى نموذج Apidog لنقطة النهاية الخاصة بك حتى لا يتعطل أحد لمدة دقيقتين لكل تكرار بينما لا يزال التكامل الحقيقي قيد الإنشاء. إذا كنت تريد الأساسيات وراء المقاييس، فإن دليلنا إلى زمن استجابة واجهة برمجة التطبيقات (API latency) يغطي المصطلحات.

أربعة تغييرات تساعد بالفعل

أخرج استدعاء الاستدلال من المسار المتزامن. اقبل الطلب، وأعد 202 Accepted بمعرف مهمة فورًا، وقدم النتيجة عن طريق الاستقصاء (polling) أو الويب هوك. هذا هو التغيير الوحيد الذي يجعل كل مشكلة أخرى أصغر، لأن 102 ثانية تتوقف عن العيش داخل طلب HTTP ينتظر شيء أعلى منه.

وجه حسب الجهد، وليس حسب النموذج. تصف الأرقام المقاسة الاستدلال الأقصى. معظم حركة المرور لا تحتاج إليه. صنف المهمة أولاً، أرسل الغالبية الروتينية بجهد منخفض، واحتفظ بالإعداد المكلف للحالات التي تستحقه. يتم الإبلاغ عن معايير إطلاق OpenAI نفسها لكل مستوى جهد لهذا السبب بالضبط، لذا فإن الإعداد هو قرار تصميم من الدرجة الأولى بدلاً من تفصيل ضبط.

قم بالبث، واظهر الانتظار بصدق. إذا كان هناك إنسان يشاهد، فقم ببث الاستجابة وقل ما يحدث. حالة التقدم التي تعكس الواقع أفضل من عجلة تحميل تشير إلى وجود خطأ ما.

خصص وقت التشغيل بشكل منفصل عن التوكنات. التكلفة لكل مهمة وزمن الاستجابة لكل مهمة هما محوران مستقلان، وقد أدت إطلاقات سبتمبر إلى تحريك أحدهما بقوة. احتفظ بميزانية زمن الاستجابة لكل نقطة نهاية بجانب ميزانية التكلفة، واعتبر أي تراجع في أحدهما كمعيق للإصدار.

شيء واحد لا يجب افتراضه: إصدار GPT-6 لتخزين المطالبات المؤقت يخفض سعر قراءات الإدخال المخزنة بنسبة 90% ويرفع معدلات الإصابة، وهو توفير حقيقي. لم ينشر أي من البائعين ادعاء زمن استجابة لذلك، لذا تعامل مع أي تحسين لأول توكن من التخزين المؤقت على أنه شيء يجب قياسه بدلاً من شيء يجب التخطيط له.

النموذج الرخيص ليس النموذج السريع

يعد GPT-6 Sol بسعر 2 دولار و 10 دولارات لكل مليون توكن خطوة سعرية حقيقية، ونتائج المقارنات المعيارية وراءه قوية. لا شيء من ذلك يجعله سريع البدء. وفقًا لقياس زمن الاستجابة العام الوحيد المتاح، فإن النموذج الذي يوفر لك 80% من سعر توكن Astra يتطلب أكثر من دقيقة ونصف قبل أن ينطق بكلمة واحدة، ويتطلب نظيره الأرخص وقتًا أطول.

السعر موجود في الفاتورة. زمن الاستجابة موجود في بنيتك المعمارية. قم بقياس الثاني بنفسك، باستخدام اختبار يوقّت أول توكن محتوى بدلاً من أول بايت، قبل أن تروج لنموذج أرخص في مسار طلب تم بناؤه لنموذج أسرع.

ممارسة تصميم API في Apidog

اكتشف طريقة أسهل لبناء واستخدام واجهات برمجة التطبيقات