الميزة الأبرز لنموذج GPT-6 Astra هي قدرته على استخدام الحاسوب. ليس بالمعنى الذي نتوقعه في عام 2025، حيث يتنقل النموذج عبر عرض توضيحي ثم يضيع في قائمة منسدلة. ففي منشور إطلاق OpenAI، حقق Astra نتيجة 72.6% على OSWorld 2.0 بمعدل 40 دقيقة تقريباً لكل مهمة، ويقوم بملء النماذج، وتحديث أنظمة إدارة علاقات العملاء (CRMs)، وتثبيت البرامج، وتشغيل فحوصات ضمان الجودة للواجهة الأمامية على موقع بناه بنفسه. تصفه OpenAI بأنه "أفضل نموذج لاستخدام الحاسوب في العالم"، وللمرة الأولى تدعم العروض التوضيحية هذا الادعاء.
إذا كنت تقوم ببناء أو اختبار واجهات برمجة التطبيقات (APIs)، فإن هذه القدرة تشير إلى اختصار مغرٍ: وجّه Astra نحو تطبيقك ودعه ينقر. تناقش هذه المقالة أنك يجب أن تفعل شيئًا أقل إبهارًا وأكثر فائدة. امنحه العقد. مواصفات OpenAPI هي واجهة أسرع وأرخص وأكثر قابلية للتحقق للنموذج من الشاشة، ونموذج بهذه القدرة سيستخدمها جيدًا. لقد رأينا Astra يقوم بهذا التحول بمفرده خلال اختبارنا العملي لمدة يومين، وبقية هذا الجزء تشرح لماذا كان هذا القرار صائبًا وكيفية إعداده باستخدام Apidog.
ملخص سريع
استخدام GPT-6 Astra للحاسوب حقيقي: 72.6% على OSWorld 2.0، و92.7% على ScreenSpot-Pro، ومجموعة أدوات Codex تُنهي مهام استخدام الحاسوب بسرعة أكبر بـ 1.9 مرة من تجربة GPT-5.6 Sol. لكن قيادة الشاشة تكلف عشرات الدقائق والعديد من رموز الصور (image tokens) لكل مهمة، وهي تختبر واجهة المستخدم (UI) وليس واجهة برمجة التطبيقات (API). لخدماتك الخاصة، امنح Astra مواصفات OpenAPI عبر خادم Apidog MCP أو كأدوات وظيفية، ودعه يكتب سيناريوهات الاختبار، وقم بتشغيلها من واجهة سطر الأوامر (CLI) الخاصة بـ Apidog في التكامل المستمر (CI). احتفظ باستخدام الحاسوب للأسطح التي لا تحتوي على واجهة برمجة تطبيقات.
ما الذي يمكن لـ GPT-6 Astra فعله في استخدام الحاسوب
تتجاوز هذه القدرة مجرد "تصفح موقع ويب". تدرج OpenAI أعمال المعرفة الروتينية (النماذج عبر الإنترنت، سجلات CRM، التقويمات)، البحث والصياغة داخل محرر المستندات، تحليل البيانات العلمية باستخدام الرسوم البيانية، بناء واستضافة موقع ويب عبر ChatGPT Sites، وضمان الجودة للواجهة الأمامية (frontend QA) على هذا الموقع. تتضمن العروض التوضيحية تصميم لوحة دوائر مطبوعة في KiCad ونمذجة منزل في Blender.
أرقام المعايير، جميعها أُجريت بواسطة OpenAI من منشور الإطلاق:
| المعيار | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (مجموعة غير متصلة، نقاط جزئية) | 72.6% بمعدل ~40 دقيقة/مهمة | 65.7% بمعدل ~75 دقيقة/مهمة | 70.2% |
| ScreenSpot-Pro (بدون أدوات) | 92.7% | 76.9% | - |
| الاختبار الأخير للوكلاء | 59.3% | 53.6% | 55.5% |
| AutomationBench | 41.4% | 18.1% | 26.9% |
تفصيلان يهمان أكثر من النتائج. ينهي Astra مهام OSWorld في وقت أقل بنسبة 47% تقريبًا من Sol، وفي الاختبار الأخير للوكلاء، يستخدم تقريبًا 65% عدد أقل من رموز الإخراج (output tokens) مقارنة بـ Opus 5 عند أعلى إعدادات التسجيل. إلى جانب النموذج، قامت OpenAI بتحديث مجموعة أدوات Codex بحيث يكون إكمال مهام استخدام الحاسوب أسرع بـ 1.9 مرة من تجربة Sol الحالية على Mind2Web. الحلقات الأسرع تعني حلقات أرخص، وهذا هو الجزء المهم لأي شخص يدفع مقابل الرموز.

تحسن السلوك أيضًا. يطرح Astra أسئلة مركزة فقط عندما يغير الجواب النتيجة، ويظل موجهًا عند توجيهه في منتصف المهمة، وفي Codex يمكنه طرح الأسئلة بشكل غير متزامن مع مواصلة العمل الذي لا يعتمد على ردك. في معيار أمان استخدام الحاسوب الداخلي لـ OpenAI، حيث الأقل أفضل، يسجل Astra 2.4% مقابل 22.0% لـ Sol.
تكلفة مهمة مدتها 40 دقيقة
استخدام الحاسوب هو حلقة متكررة: لقطة شاشة، تفكير، فعل، لقطة شاشة مرة أخرى. كل لقطة شاشة هي مدخل صورة، وكل خطوة تحمل المحادثة حتى الآن، والمهمة التي تستغرق 40 دقيقة تتطلب مئات الخطوات. بسعر Astra القياسي وهو 10 دولارات لكل مليون رمز إدخال و50 دولارًا لكل مليون رمز إخراج، مع المطالبات التي تتجاوز 272 ألف رمز إدخال يتم احتسابها بسعر 20 دولارًا لكل مليون، فإن الجلسة الطويلة التي تحتفظ بسجلها الكامل في السياق تنتقل إلى تسعير السياق الطويل قبل أن تنتهي. يساعد التخزين المؤقت للمطالبات في التعامل مع البادئة المتكررة، بسعر دولار واحد لكل مليون رمز مخزن مؤقتًا، ولكن لقطات الشاشة نفسها جديدة في كل خطوة.
هناك تكلفة ثانية لا علاقة لها بالمال. يقول نظرة عامة على السلامة من OpenAI إن مراقب عدم المواءمة الخاص بها "يمكن أن يبطئ أو يوقف أو يمنع العمل المشروع في بعض الأحيان"، ويشير إلى "المهام التي يعمل فيها الوكيل لفترة طويلة". في ChatGPT أو Codex، سيُطلب منك مراجعة الإجراء. في واجهة برمجة التطبيقات (API)، تتوقف المهمة. جلسة قيادة الشاشة التي تستغرق 40 دقيقة هي بالضبط شكل المهمة الأكثر تعرضًا لهذا الانقطاع. مكالمة API مدتها خمس ثوانٍ ليست كذلك.
استخدام الحاسوب مقابل العقد: متى يفوز كل منهما
| الموقف | أداة أفضل | لماذا |
|---|---|---|
| اختبار واجهة برمجة تطبيقاتك الخاصة | المواصفات | محدد، رخيص لإعادة التشغيل، يؤكد على العقد الفعلي |
| حزمة الانحدار في CI | المواصفات | تُشغّل السيناريوهات بدون نموذج في الحلقة |
| بوابة طرف ثالث بدون واجهة برمجة تطبيقات | استخدام الحاسوب | لا يوجد عقد لتسليمه |
| ضمان الجودة للواجهة الأمامية من البداية إلى النهاية قبل الإصدار | استخدام الحاسوب | واجهة المستخدم هي ما يتم اختباره |
| أداة سطح مكتب قديمة | استخدام الحاسوب | لا توجد سوى شاشة |
| التحقق مما إذا كانت المستندات تطابق السلوك | المواصفات، ثم واجهة المستخدم | إرسال الطلب الموثق، مقارنة الاستجابة، ثم التحقق العشوائي من الصفحة المعروضة |
التمييز هو ما تختبره. استخدام الحاسوب يختبر البكسلات. المواصفات تختبر الوعد. عندما تتعطل واجهة أمامية، عادة ما تكون واجهة برمجة التطبيقات لا تزال تعمل بشكل جيد، وعندما تتعطل واجهة برمجة التطبيقات، يمكن للواجهة الأمامية إخفاء ذلك خلف رسالة خطأ ودية. كلاهما مهم، لكن فرق واجهات برمجة التطبيقات تسلم الوعد، لذا اختبر الوعد أولاً.
كيف تسلم عقد واجهة برمجة التطبيقات الخاصة بك إلى Astra
هناك ثلاث طرق لتزويد Astra بالمواصفات، وهي متداخلة.
1. امنحه الملف. قم بتصدير مواصفات OpenAPI من مشروع Apidog الخاص بك (أو استورد مواصفاتك الحالية إلى Apidog أولاً) وقم بتضمينها في الطلب. تحتفظ نافذة سياق Astra التي تبلغ 1,050,000 رمز بأي مواصفات واقعية في مطالبة واحدة، ويظهر اختبار استرجاع MRCR الخاص بـ OpenAI أنها تحافظ على دقة 96.3% في نطاق 512 ألف إلى مليون رمز، حيث ينخفض Sol إلى 73.8%. لم تعد المواصفات الكبيرة مشكلة تقطيع.
2. اربط المشروع عبر MCP. يكشف خادم Apidog MCP عن مشروع Apidog الخاص بك، أو وثائقك المنشورة، أو ملف OpenAPI لأي عميل يدعم MCP، بحيث يقرأ Astra العقد الحالي بدلاً من تصدير قديم. يمكن لـ Codex ووكلاء سطح المكتب سحب تعريفات نقطة النهاية أثناء عملهم. هذا هو الإعداد الذي سمح لـ Astra، في اختبارنا، بالعثور على المواصفات وقراءتها بمفرده.
3. حوّل المواصفات إلى أدوات. للاستخدام البرمجي، قم بتحويل نقاط النهاية إلى أدوات وظيفية واستدعاء Astra عبر Responses API، وهو النمط الذي نغطيه في تحويل OpenAPI إلى أدوات وكيل الذكاء الاصطناعي. صفحة النموذج تدرج استدعاء الوظائف، والمخرجات المنظمة، والبحث في الملفات ضمن ميزات Astra، ويتطلب استدعاء الأداة Responses API، وليس Chat Completions.
طلب بسيط يطلب من Astra صياغة سيناريوهات الاختبار من المواصفات يبدو كالتالي:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{"role": "developer", "content": "You are writing API test scenarios. Bias towards action. Only ask a question if the answer changes the test design. Output JSON matching the schema."},
{"role": "user", "content": "Here is our OpenAPI 3.1 spec. Draft a test scenario per resource: happy path, auth boundary, and one negative case each.\n\n"}
],
"text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
}'
ملاحظتان من إرشادات نموذج OpenAI. لا يحتوي Astra على جهد `none` أو `minimal`، لذا ابدأ بـ `low` أو `medium`، و"يطلب التوضيح بسهولة أكبر" من النماذج السابقة، لذا فإن عبارة "التحيز نحو العمل" في رسالة المطور تؤدي عملاً حقيقيًا.
4. تشغيل السيناريوهات بدون النموذج. قم باستيراد السيناريوهات التي تم إنشاؤها إلى Apidog، وأرفق تأكيدات على رموز الحالة ومخططات الاستجابة، وقم بتشغيلها من واجهة سطر الأوامر (CLI) الخاصة بـ Apidog في مسار عملك. كتب النموذج الاختبارات مرة واحدة. تشغلها أدوات التكامل المستمر (CI) الخاصة بك ألف مرة مجانًا. هذا هو الجدال الاقتصادي في جملة واحدة، ولهذا السبب تجد تنزيل Apidog بجانب مفتاح API في سير العمل هذا.
احتفظ بالضوابط الوقائية، حتى لو احترمها Astra
نتائج مواءمة OpenAI لـ Astra هي الأفضل التي نشرتها. في اختبار Honeypot الذي تم بناؤه بعد حادثة Hugging Face، تجاوز Sol الهدف المصرح به 48% من الوقت ولم يفعل Astra ذلك مطلقًا (0% من الوقت). لم يحاول Astra أبدًا التحايل على رفض المراجعة التلقائية لـ Codex، حتى عندما كان الرفض معدًا عمدًا ليكون قابلاً للتجنب. تبلغ متانة حماية حقن المطالبات غير المباشرة 99.79%، مرتفعة من 96.23%.
لا يزيل أي من ذلك الحاجة إلى البوابات. بل يعني أن البوابات تطلق النار بشكل أقل تكرارًا. يجب أن يعمل النموذج الذي يحتوي على نافذة سياق بحجم مليون رمز، وتقييم سيبراني حرج، والقدرة على إرسال طلبات عشوائية إلى واجهة برمجة التطبيقات الخاصة بك، مقابل بيئة التطوير (staging) مع بيانات اعتماد محددة النطاق، وبوابة موافقة على التغييرات، وتتبع كل استدعاء. قد يوقف مراقب Astra أيضًا التشغيل في منتصف المهمة، لذا تعامل مع كل مهمة طويلة على أنها قابلة للاستئناف. تصميم الاختبار للوكلاء غير الحتميين ينطبق دون تغيير: أكد على العقد، وليس النص.
متى يظل استخدام الحاسوب يستحق مكانه
لا تقرأ هذا على أنه "لا تدعه ينقر أبدًا". ثلاث حالات تكون أفضل على الشاشة. بوابة شريك أو لوحة تحكم إدارية بدون واجهة برمجة تطبيقات. فحص للواجهة الأمامية في يوم الإصدار كان سيتم إجراؤه يدويًا بواسطة إنسان. أداة سطح مكتب قديمة حيث تكون واجهة المستخدم هي السطح الوحيد. Astra هو النموذج الأول الذي تستحق فيه هذه المهام التفويض على الإطلاق، وتسارع مجموعة أدوات Codex يجعلها رخيصة بما يكفي لتشغيلها ليلاً.
القاعدة العملية: استخدم العقد عندما يكون العقد موجودًا، واستخدم الشاشة عندما لا يكون كذلك.
الأسئلة الشائعة
هل يعمل استخدام GPT-6 Astra للحاسوب عبر واجهة برمجة التطبيقات (API)؟ نعم. يدرج استخدام الحاسوب ضمن أدوات Astra المدعومة على Responses API، إلى جانب البحث عبر الويب، والبحث في الملفات، ومترجم الشفرة، وتوليد الصور. يوفر تطبيقك البيئة وينفذ الإجراءات التي يقترحها النموذج. تحمل واجهة برمجة التطبيقات أيضًا الجانب الأكثر صرامة من إجراءات السلامة في OpenAI: تتوقف المهمة التي يتم إيقافها مؤقتًا بواسطة مراقب عدم المواءمة بدلاً من انتظار المراجعة.
ما حجم المواصفات التي يمكنني تقديمها له؟ نافذة السياق هي 1,050,000 رمز مع 128,000 رمز إخراج. تتسع مواصفات تحتوي على مئات نقاط النهاية والمخططات الكاملة مع وجود مساحة إضافية. تُحاسب المطالبات التي تتجاوز 272 ألف رمز إدخال بضعف أسعار الإدخال والتخزين المؤقت، لذا قم بتخزين بادئة المواصفات مؤقتًا واجعل رسائل كل اختبار صغيرة.
هل سيهلوس نقاط نهاية ليست موجودة في المواصفات؟ أقل من النماذج السابقة. يظهر معيار الهلوسة الداخلي لـ OpenAI، حيث الأقل أفضل، أن Astra يحقق 4.2% مقابل 12.2% لـ Sol، وهو أقل عرضة بثلاث مرات لتشويه قدراته الخاصة. المخرجات المنظمة بالإضافة إلى التشغيل المتحقق من المخطط في Apidog تلتقط الباقي، ولهذا السبب فإن اختبار العقد هو الكلمة الأخيرة، وليس النموذج.
هل هذا أرخص من GPT-5.6 Sol لتوليد الاختبارات؟ لكل رمز، لا. يكلف Astra 10 دولارات و50 دولارًا لكل مليون رمز مقابل 4 دولارات و20 دولارًا لـ Sol الترويجي. لكل مهمة منتهية، تدعي OpenAI أن Astra يستخدم رموزًا أقل بكثير، ويجعل سير العمل الذي يركز على المواصفات تكلفة النموذج بمثابة مصروف لمرة واحدة. قم بقياس ذلك على مواصفاتك الخاصة قبل أن تقرر؛ يوضح دليل API كيفية مقارنة الاثنين جنبًا إلى جنب.
النسخة المختصرة
يمكن لـ GPT-6 Astra قيادة حاسوبك، وبالنسبة للأسطح التي لا تحتوي على واجهة برمجة تطبيقات، فهذه هدية حقيقية. أما بالنسبة لواجهة برمجة التطبيقات التي تملكها، فالشاشة هي المسار البطيء. سلم النموذج العقد، ودعه يكتب السيناريوهات، وشغلها في التكامل المستمر (CI)، واحتفظ بالبوابات. توصل Astra إلى هذا الاستنتاج بمفرده في غضون عشرين دقيقة. يمكن لفريقك البدء من هناك.
