جي بي تي-6 لونا لأعباء عمل API عالية الكثافة: حسابات التكلفة بناءً على أحجام الطلبات الفعلية

التكلفة الفعلية لـ GPT-6 لونا على نطاق واسع: حسابات مفصلة لتكلفة المليون طلب للتصنيف بمعدل عالٍ من الطلبات في الثانية، واسترجاع 200 ألف رمز، وتعبئة بيانات سابقة لـ 12 مليون سجل، مع تطبيق خصم 90% على القراءات المخزنة مؤقتًا.

Medy Evrard

23 سبتمبر 2026

جي بي تي-6 لونا لأعباء عمل API عالية الكثافة: حسابات التكلفة بناءً على أحجام الطلبات الفعلية

Apidog للمؤسسات

النشر على الخوادم المحلية

SSO و RBAC

متوافق مع SOC 2

استكشف Apidog للمؤسسات

لدى كل فريق خلفي قائمة بالمهام التي ستكون أفضل بوضوح باستخدام نموذج لغوي ولم يتم إطلاق أي منها مطلقًا. تصنيف خمسة ملايين حدث دعم يوميًا. إثراء كتالوج من اثني عشر مليون صف. تسجيل كل webhook وارد قبل أن يصل إلى قائمة الانتظار. السبب دائمًا هو نفسه: اضرب التكلفة لكل طلب في عدد طلباتك الفعلية ويتوقف الرقم عن أن يكون خطأ تقريب.

يكلف GPT-6 Luna، الذي أُعلن عنه في 22 سبتمبر 2026، 0.10 دولار لكل مليون رمز إدخال و 0.50 دولار لكل مليون رمز إخراج، ويحمل نافذة سياق بحجم 1,000,000 رمز، ويطبق خصمًا بنسبة 90% على قراءات الإدخال المخزنة مؤقتًا. هذا رخيص بما يكفي لجعل العديد من تلك المهام المؤجلة قابلة للتطبيق، ورخيص بما يكفي لجعل الناس يتوقفون عن إجراء العمليات الحسابية، وهو ما يجعلك في النهاية تشرح فاتورة من خمسة أرقام.

زر

إليكم إذن العمليات الحسابية: ثلاثة أشكال واقعية لأعباء العمل، التكلفة لكل مليون طلب لكل منها، والمتغيرات الثلاثة التي تحدد فاتورتك قبل وقت طويل من سعر الملصق.

الأسعار التي تعمل بها

النموذج معرف API الإدخال لكل مليون القراءة المخزنة مؤقتًا لكل مليون الإخراج لكل مليون السياق
GPT-6 Luna gpt-6-luna $0.10 $0.01 $0.50 1,000,000
GPT-6 Sol gpt-6-sol $2.00 $0.20 $10.00 872,000
GPT-6 Astra لا ينطبق $10.00 لا ينطبق $50.00 لا ينطبق
Claude Opus 5.5 claude-opus-5-5 $4.00 $0.20 (كتابة $5.00) $20.00 1,000,000

عمود القراءة المخزنة مؤقتًا لـ Sol و Luna هو الخصم المنشور بنسبة 90% المطبق على سعر الإدخال، وليس رقمًا منشورًا بشكل منفصل. تنشر Anthropic سعر القراءة المخزنة مؤقتًا الخاص بها مباشرةً وتفرض أيضًا 5.00 دولارات لكل مليون لكتابة التخزين المؤقت، وهو أمر مهم عند الأحجام الكبيرة: عبء عمل يتضمن تغييرًا كبيرًا في البادئة يدفع تكلفة الكتابة هذه بشكل متكرر.

تصحيح إطار واحد قبل الأرقام. تصف OpenAI نموذجي Sol و Luna بأنهما أرخص بنسبة 50% من تسعيرة GPT-5.6 الترويجية. "ترويجية" هي كلمة OpenAI الخاصة وهي تؤدي عملًا حقيقيًا: المقارنة تجري مقابل سعر مخفض، وليس السعر الذي أُطلق به GPT-5.6. مقارنةً بسعر القائمة لـ GPT-5.6 Luna البالغ 1 دولار للإدخال و 6 دولارات للإخراج الذي وثقته تغطيتنا للإطلاق، يمثل GPT-6 Luna خفضًا بنسبة 90% على الإدخال و 92% على الإخراج.

عبء العمل أ: تصنيف عالي QPS

الشكل الذي تسعى إليه معظم الفرق أولاً: موجه نظام ثابت، مخططات أدوات وتصنيف، بالإضافة إلى حمولة متغيرة صغيرة، تعيد حكمًا موجزًا ومنظمًا. افترض 1,500 رمز من البادئة الثابتة، 500 رمز من الحمولة المتغيرة، 120 رمز إخراج، و 5,000,000 طلب يوميًا.

النموذج التكلفة لكل مليون طلب، بارد التكلفة لكل مليون طلب، بادئة مخزنة مؤقتًا
GPT-6 Luna $260 $125
GPT-6 Sol $5,200 $2,500
Claude Opus 5.5 $10,400 $4,700
GPT-6 Astra $26,000 لم يتم نشره
GPT-5.6 Luna، سعر القائمة $2,720 لا ينطبق

عند 5,000,000 طلب يوميًا، يكون ذلك 625 دولارًا على Luna ببادئة دافئة، أي حوالي 18,750 دولارًا شهريًا. نفس الحركة على Sol بدون تخزين مؤقت تبلغ 26,000 دولارًا يوميًا، وعلى Astra 130,000 دولارًا.

يتضح من هذا الجدول شيئان. يقلل خصم التخزين المؤقت هذه الفاتورة بنسبة 52% بينما لم يتغير شيء في عبء العمل؛ الفرق الوحيد هو ما إذا كانت الـ 1,500 رمز الرائدة بقيت متطابقة بايتًا بين المكالمات. والفجوة بين المستويات عند الحجم تمثل فرقًا في الحجم، وليس نسبة مئوية. اختيار Luna بدلاً من Sol هنا هو قرار مضاعفة عشرين مرة، وليس تعديلًا بسيطًا.

عبء العمل ب: استرجاع سياق كبير

هنا تتوقف نافذة Luna البالغة 1,000,000 رمز عن أن تكون مجرد سطر في ورقة المواصفات. افترض حزمة معرفة بحجم 200,000 رمز محفوظة ثابتة عبر المكالمات، استعلامًا بحجم 2,000 رمز، 600 رمز إخراج، و 50,000 طلب يوميًا.

بارد بادئة مخزنة مؤقتًا
GPT-6 Luna، لكل طلب $0.0205 $0.0025
GPT-6 Luna، يوميًا $1,025 $125
GPT-6 Sol، لكل طلب $0.410 $0.050
GPT-6 Sol، يوميًا $20,500 $2,500

يخفض التخزين المؤقت 88% من فاتورة Luna هنا، مقابل 52% في عبء العمل أ. هذه الفجوة هي النقطة الأساسية: يتناسب الخصم مع نسبة البادئة الثابتة إلى الرموز الجديدة. إعادة قراءة بادئة بحجم 200,000 رمز 50,000 مرة يوميًا هو الشكل الذي يحقق فيه التخزين المؤقت للموجه أكبر فائدة.

نافذة Luna أيضًا أكبر من نافذة Sol البالغة 872,000 رمز، لذا فإن حمولة بحجم 900,000 رمز لا تتسع في النموذج الأكثر تكلفة وتتسع في النموذج الأرخص. هذا يقلب قاعدة التوجيه المعتادة "الترقية إلى نموذج أكبر عندما تنمو الحمولة"، والتي تغطيناها بالتفصيل في ما هو GPT-6 Luna في الواقع.

عبء العمل ج: التعبئة الخلفية لمرة واحدة

المهام الدفعية هي المكان الذي تغير فيه الأسعار الجديدة ما هو ممكن، وليس فقط ما هو رخيص. افترض عملية إثراء 12,000,000 سجل: 900 رمز من التعليمات الثابتة، 300 رمز لكل سجل، 250 رمز إخراج.

GPT-6 Luna GPT-6 Sol
الإدخال، بارد $1,440 $28,800
الإخراج $1,500 $30,000
الإجمالي، بارد $2,940 $58,800
الإجمالي، بادئة مخزنة مؤقتًا $1,968 لم يتم حسابه

تعبئة خلفية لاثني عشر مليون سجل بأقل من 3,000 دولار، أو أقل من 2,000 دولار إذا بقيت بادئة التعليمات دافئة. هذا رقم يمكن لفريق الحصول على الموافقة عليه برسالة واحدة. نفس المهمة على Sol تتطلب محادثة حول الميزانية.

لاحظ النسبة هنا. الإخراج الآن يشكل نصف الفاتورة، مما يقود مباشرة إلى الشيء الذي يحدد تكلفتك بالفعل.

المتغيرات الثلاثة التي تحدد الفاتورة

1. رموز الإخراج، لأنها تُحاسب بخمسة أضعاف الإدخال

معدل إخراج Luna هو 5 أضعاف معدل إدخالها. في عبء العمل أ مع البادئة المخزنة مؤقتًا، يكلف الإدخال 65 دولارًا لكل مليون طلب و 120 رمز إخراج تكلف 60 دولارًا. إذا تم تخفيف تنسيق الاستجابة إلى 400 رمز، يقفز الإخراج إلى 200 دولار، مما يرفع الإجمالي من 125 دولارًا إلى 265 دولارًا لكل مليون طلب. مخطط استجابة تم اختياره في فترة ما بعد الظهر ضاعف الفاتورة أكثر من مرتين.

الحل ممل وفعال: قم بتقييد الإخراج. أعد تعدادًا، وليس جملة. أعد درجة، وليس شرحًا، واسترجع الشرح فقط للنسبة الصغيرة من الحالات التي يراجعها الإنسان. ثبت الشكل باستخدام مخطط JSON حتى لا يتمكن النموذج من إضافة حشو:

{
  "model": "gpt-6-luna",
  "response_format": {
    "type": "json_schema",
    "json_schema": {
      "name": "triage",
      "strict": true,
      "schema": {
        "type": "object",
        "properties": {
          "category": { "enum": ["billing", "outage", "how_to", "abuse"] },
          "severity": { "type": "integer", "minimum": 1, "maximum": 4 }
        },
        "required": ["category", "severity"],
        "additionalProperties": false
      }
    }
  }
}

تأكد من أسماء المعلمات مقابل مرجع نموذج OpenAI الحالي قبل البناء على هذا الشكل. معرف النموذج gpt-6-luna هو الجزء المؤكد من مواد الإطلاق.

2. معدل نجاح ذاكرة التخزين المؤقت، لأنه الخصم المجاني الوحيد من 50% إلى 88% الذي ستحصل عليه

كل ما ورد أعلاه يفترض أن البادئة تبقى متطابقة بايتًا. في الإنتاج، لا يحدث ذلك عادةً، لأن شخصًا ما يُدخل معرف طلب في موجه النظام أو يبني مصفوفة الأدوات من قاموس يتم فيه خلط ترتيب المفاتيح بين العمليات. تم الآن إزالة مسببات إتلاف ذاكرة التخزين المؤقت الكلاسيكية من هذه القائمة: مع GPT-6، لم يعد تغيير جهد التفكير أو توفر الأداة يبطل ذاكرة التخزين المؤقت، وتسمح لك نقاط التوقف الصريحة بتحديد مكان انتهاء البادئة المخزنة مؤقتًا. لوحة تحكم لتخزين الموجهات مؤقتًا وأداة تشخيص تجعل معدل النجاح شيئًا تقيسه بدلاً من افتراضه، وتفيد GitHub بأن هناك انخفاضًا بأكثر من 50% في رموز الموجه التي تحتاج إلى معالجة جديدة عبر مليارات الطلبات. تم تغطية الآليات في دليلنا الشامل لـ التخزين المؤقت للموجهات في GPT-6 بنسبة 90%.

عند الحجم، تعامل مع معدل النجاح كمؤشر مستوى خدمة (SLI) للإنتاج. إعادة هيكلة بادئة تقلل بهدوء من 95% من النجاحات إلى 40% تكلف عبء العمل أ حوالي 400 دولار يوميًا ولا تنتج أي أخطاء أو تنبيهات أو اختبارات فاشلة.

3. المحاولات المتكررة، لأنها تتضاعف

معدل إعادة محاولة بنسبة 5% على عبء العمل أ يضيف حوالي 31 دولارًا يوميًا. مقبول. نفس الـ 5% على عبء العمل ب يكلف 50 دولارًا يوميًا إذا فاتت المحاولات المتكررة ذاكرة التخزين المؤقت و 6 دولارات إذا أصابتها، والفرق يكمن بالكامل فيما إذا كانت إعادة المحاولة تعيد بناء الموجه من الصفر. المحاولات المتكررة التي تعيد إنشاء بادئة هي أغلى مرونة يمكنك شراؤها. أعد استخدام نص الطلب بالضبط.

فخ الكمون عند QPS العالي

الرخيص ليس سريعًا، وعند QPS العالي يكون ذلك مكلفًا. تضع قياسات الطرف الثالث من Artificial Analysis سرعة GPT-6 Luna عند 153.9 رمز إخراج في الثانية مع وقت لأول رمز يبلغ 124.23 ثانية، و GPT-6 Sol عند 102.15 ثانية. تنطبق محاذيران وكلاهما ذو أهمية: هذه أرقام طرف ثالث وليست منشورة من قبل البائع، ويتم قياسها على متغيرات التفكير الأقصى، وهي أبطأ تكوين متاح.

ومع ذلك، الاتجاه مهم. دقيقتان لأول رمز ستتجاوز مهلة عميل HTTP الافتراضية، وتُعطل موازن التحميل، وتتجاوز سقف التنفيذ في معظم بيئات التشغيل عديمة الخادم. المسارات المتزامنة عالية QPS تنتمي إلى الجهد المنخفض مع التدفق؛ الجهد العالي ينتمي إلى المهام الدفعية وعمال قائمة الانتظار حيث لا ينتظر شيء على مقبس. قم بضبط مهلات الوقت مقابل الكمون المقاس عند مستوى الجهد الذي تقدمه، وليس مقابل السعر.

أين يقع حد الجودة الأدنى

Luna ليس أذكى نموذج في العائلة ولا تدعي OpenAI ذلك. Astra "يظل أفضل نموذج لدينا على الإطلاق" بكلمات OpenAI الخاصة. ما تنشره OpenAI: Luna بأقصى جهد يحقق 66.6% في DeepSWE 1.1، وهو ما يضاهي Claude Opus 5 و Claude Fable 5 بجهد متوسط، بتكلفة أقل بنسبة 93% لكل مهمة من Opus 5 و 96% أقل من Fable 5. في AutomationBench 1.0.6 بجهد عالٍ، يتفوق على سلفه بـ 5.4 نقطة بتكلفة أقل بنسبة 58% لكل مهمة. في OSWorld 2.0 غير المتصل بالإنترنت بأقصى جهد، يتفوق على GPT-5.6 Sol بجهد متوسط بجزء من عشرة من التكلفة.

هذه أرقام موردين قيست مقابل Claude Opus 5، وليس Opus 5.5 الذي تم إصداره في نفس اليوم، لذا تعامل معها على أنها توجيهية. القراءة التشغيلية هي أن Luna هو النموذج الأرخص الذي يجتاز المعيار للعمل المحدد جيدًا والقابل للتحقق، و "القابل للتحقق" هي الكلمة المحورية.

أثبت نموذج التكلفة قبل الالتزام به

حسابات جداول البيانات هي فرضية. اختبرها على حركة المرور الحقيقية: خذ عينة من 500 طلب من حمولات الإنتاج، وقم بتشغيلها مقابل Luna و Sol كبيئتين، وسجل عدد الرموز، والكمون، وتطابق المخطط.

في Apidog، هذا هو نقطة نهاية محفوظة مع معرف النموذج كمتغير بيئة، يتم تشغيلها كسيناريو اختبار مقابل ملف بيانات من الحمولات الحقيقية. أضف ثلاثة تأكيدات ويصبح هذا الإجراء حاجزًا للتكلفة بدلاً من فحص للصحة: تأكد من أن الاستجابة تتطابق مع مخطط JSON الخاص بك، وتأكد من أن `usage.completion_tokens` يبقى ضمن ميزانية الإخراج لكل طلب، وتأكد من أن `usage.prompt_tokens_details.cached_tokens` غير صفري، بحيث تفشل إعادة هيكلة البادئة التي تدمر معدل نجاح ذاكرة التخزين المؤقت في التكامل المستمر بدلاً من الظهور في فاتورة الشهر المقبل. تأكد من أسماء حقول الاستخدام هذه مقابل مرجع API الحالي قبل التأكيد عليها.

هذا التأكيد الأخير هو الذي لا يكتبه أحد ويحتاجه الجميع. نمط الفشل لعبء عمل LLM عالي الحجم ليس أبدًا انقطاعًا. إنه فاتورة بأربعة أضعاف وراء لوحة تحكم خضراء.

للاطلاع على كيفية وضع تسعير Luna إلى جانب GPT-6 Sol و Claude Opus 5.5 على مدار الأسبوع بأكمله، راجع تحليلنا لـ حرب أسعار نماذج الذكاء الاصطناعي في سبتمبر 2026.

النسخة المختصرة

وجه العمل عالي الحجم، المحدد جيدًا، والقابل للتحقق برمجيًا إلى Luna وحافظ على الجزء الثابت من موجهك متطابقًا بايتًا. حدد رموز الإخراج، لأنها تُحاسب بخمسة أضعاف الإدخال. قيس معدل نجاح ذاكرة التخزين المؤقت كمقياس إنتاجي. أبعد الجهد العالي عن المسارات المتزامنة حتى تقيس وقت أول رمز على حركة المرور الخاصة بك. افعل ذلك، والوظائف التي لم يتم إطلاقها أبدًا لأن العمليات الحسابية لم تنجح تستحق التكلفة مرة أخرى هذا الأسبوع.

ممارسة تصميم API في Apidog

اكتشف طريقة أسهل لبناء واستخدام واجهات برمجة التطبيقات