نتائج اختبارات جيميني 4 أرجون: جميع الـ 19، كيف أجرتها جوجل، والـ 5 التي خسرها

.نتائج قياسات الأداء Gemini 4 Argon: جميع الصفوف الـ 19 مع هوية القائمين بالقياس، والخمسة التي تخسرها، وتحذيرات جوجل المنهجية، ونتائج AA وVals وArena

INEZA Felin-Michel

INEZA Felin-Michel

2 أكتوبر 2026

نتائج اختبارات جيميني 4 أرجون: جميع الـ 19، كيف أجرتها جوجل، والـ 5 التي خسرها

Apidog للمؤسسات

النشر على الخوادم المحلية

SSO و RBAC

متوافق مع SOC 2

استكشف Apidog للمؤسسات

يتصدر Gemini 4 Argon 13 من أصل 19 صفًا في جدول إطلاق Google بشكل مباشر، ويتعادل في 1 (CWE-bench v1، مع GPT-6 Astra)، ويتأخر في 5: FrontierSWE v2، Terminal-bench 4.0، PostTrainBench، Terminal-Bench Science 0.1 و OSWorld-2.0. العقبة هي الوصول. Argon متاح اليوم فقط لمدافعي برنامج Fairwind، لذلك لا يمكن لأحد خارج قائمة شركاء Google وعدد قليل من منظمات قياس الأداء إعادة تشغيل هذه الأرقام بعد.

أدناه: الجدول الكامل مع من قام بقياس كل صف، والخمس خسائر، والتفاصيل الدقيقة، ودرجات الأمن السيبراني، ولوحات النتائج من أطراف ثالثة، وكيفية بناء تقييمك الخاص في Apidog قبل فتح الوصول. للحصول على نظرة عامة عن النموذج، ابدأ بـ ما هو Gemini 4 Argon. لاتخاذ قرار الشراء، انظر Argon مقابل GPT-6 Astra مقابل Claude Opus 5.5.

الجدول الكامل، مع من قام بقياس كل صف

هذه هي النتائج التي أبلغت عنها Google من منشور الإطلاق و منهجية التقييمات بصيغة PDF، والتي تحمل عنوان "النتائج اعتبارًا من أكتوبر 2026". قامت Google بحساب 10 من أصل 19 درجة لأرجون بنفسها؛ بينما تأتي الـ 9 الأخرى من لوحات الصدارة العامة. تأتي أرقام المنافسين من لوحات الصدارة تلك، أو عمليات تشغيل Google الخاصة، أو بطاقات نظام ومشاركات المدونات الخاصة بالبائعين، وتختلف الأدوات حسب الصف. يشير **الخط العريض** إلى المتصدر في الصف.

المعيار Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 من قام بقياسه
Vals Index 68.9% 63.1% 65.8% 67.0% Vals AI
AutomationBench 51.3% 41.4% 31.4% 42.5% لوحة صدارة Zapier (مجموعة خاصة)
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6% Vals AI
Harvey Legal Agent 19.6% 5.4% 6.7% 3.8% Vals AI
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2% حاسب Argon ذاتيًا؛ لوحة صدارة Astra؛ بطاقات نظام Anthropic
FrontierSWE v2 55.0% 65.5% 56.3% 62.3% لوحة صدارة Proximal
Vibe Code Bench 91.9% 89.6% 90.3% 90.3% Vals AI
Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4% حاسب Argon ذاتيًا؛ لوحة صدارة المنافسين
PostTrainBench 45.3% 44.3% 40.2% 49.3% حاسب ذاتيًا لجميع النماذج
Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3% حاسب Argon ذاتيًا؛ لوحة صدارة المنافسين
LABBench 2 88.8% 85.4% 68.6% 73.1% حاسب ذاتيًا لجميع النماذج
RiemannBench 76.0% 72.0% 65.6% 69.6% لوحة صدارة Surge
GraphWalks up to 128K 99.7% 98.7% 91.4% 90.6% حاسب ذاتيًا لجميع النماذج
GraphWalks 256K to 1M 84.2% 71.8% 65.0% 66.8% حاسب ذاتيًا لجميع النماذج
Agent’s Last Exam 39.5% 34.2% n/r 38.2% حاسب Argon ذاتيًا؛ لوحة صدارة المنافسين
OSWorld-2.0 (offline) 69.2% 72.6% n/r n/r حاسب Argon ذاتيًا؛ Astra من مدونة OpenAI
Chartography 71.6% 71.0% 46.2% 66.3% لوحة صدارة Surge
LVBench 91.7% 87.5% 79.7% 83.7% حاسب ذاتيًا لجميع النماذج
CWE-bench v1 68.0% 68.0% 58.0% 67.0% لوحة صدارة عامة

n/r = لم يتم الإبلاغ عنه. كما أن Grok 4.7، الذي لا يوجد في جدول Google، يسجل 68% على لوحة صدارة CWE-bench، لذا فإن التعادل ثلاثي.

مرتبة حسب المصدر، 9 صفوف تأتي من لوحات صدارة عامة لكل نموذج (Vals AI، Zapier، Proximal، Surge و CWE-bench). يتصدر Argon 7 من هذه الـ 9 ويتعادل في 1. قامت Google بتشغيل 5 صفوف بنفسها لجميع النماذج الأربعة، ويتصدر Argon 4 منها. الأزواج الـ 5 الأخرى تجمع درجة Argon التي تديرها Google مع أرقام المنافسين من أماكن أخرى، وهذا هو المكان الذي يخسر فيه Argon أكثر: 3 من خسائره الـ 5 تقع في تلك الصفوف المختلطة. إذا كان الحساب الذاتي يضفي جمالًا على Argon، لكانت تتوقع العكس.

أين يتأخر أرجون، ولماذا يهم ذلك في البرمجة المعتمدة على الوكلاء

تنقسم البرمجة المعتمدة على الوكلاء بنتيجة 2 إلى 2. يفوز أرجون في DeepSWE v1.1 و Vibe Code Bench، ثم يأتي في المركز الأخير في FrontierSWE v2 و Terminal-bench 4.0. يمزج فوز DeepSWE بين الأدوات: أرجون يعمل على أداة وكيل swe صغيرة، ورقم Astra من لوحة الصدارة العامة، وأرقام Claude من بطاقات النظام. يعتبر Vibe Code Bench أنظف، حيث سجل Vals AI جميع الأربعة، لكن الهامش هو 1.6 نقطة.

إذا كان حجم عملك يتضمن وكلاء ثقيلين في الطرفية أو مهام مستودع طويلة، فوازن بين هذين الصفين الأخيرين فوق العد الرئيسي. تحتفظ Astra بالصدارة في FrontierSWE؛ يوضح تجربتنا مع GPT-6 Astra كيف يبدو استخدام هذا النموذج اليوم. بالنسبة لجانب Anthropic، يغطي تحليل مقاييس Claude Fable 5.1 أرقام إطلاق Fable الخاصة.

تفيد بلومبرج أن موظفين مجهولين في Google لديهم إمكانية الوصول يقولون إن أرجون لم يحقق التوقعات في بعض أعمال البرمجة وتصميم الواجهة الأمامية مقارنة بدرجاته المرجعية. وصفت Google هذا التوصيف بأنه غير دقيق.

تحذيرات المنهجية التي تغير كيفية قراءة الجدول

صفوف الأمن السيبراني من صفحة الأمن السيبراني لـ DeepMind

تضيف صفحة الأمن السيبراني لـ DeepMind أربع درجات إضافية بخلاف جدول الإطلاق:

تقييم الأمن السيبراني Gemini 4 Argon مقارنة
اكتشاف الثغرات الأمنية في العالم الحقيقي 85.8% Gemini 3.8 Flash Cyber 71.0%
معيار Wiz Penetration Test 70.9% Gemini 3.8 Flash Cyber 58.2%
نجاح هجوم Gray Swan IPI (k=15، الأقل أفضل) 0.7% الأدنى على الرسم البياني؛ Kimi K3 الأعلى بنسبة 52.7%
CWE-bench v1 68% تعادل ثلاثي مع Grok 4.7 و GPT-6 Astra؛ Opus 5.5 بنسبة 67%

استخدم تقييم الثغرات الأمنية أداة Antigravity داخلية "غير متخصصة في الأمن السيبراني"، مع إمكانية الوصول إلى المصدر. يمنح اختبار Wiz النموذج "الوصول فقط إلى الموقع الإلكتروني قيد التشغيل وسلوكه العام، بدون كود مصدر التطبيق." كلا المقارنتين الرئيسيتين هما مقابل نموذج Google السابق للأمن السيبراني، وليس المنافسين. يغطي شرحنا لدفاع Argon السيبراني ما تعنيه هذه الأمور لواجهات برمجة التطبيقات التي تشغلها.

لوحات النتائج من أطراف ثالثة

نشرت هذه المنظمات النتائج في غضون دقائق من الإطلاق، لذا كان لديها وصول قبل الإصدار.

لماذا تنشر المنافذ أرقام فوز 12 و 13 و 14

نشرت المنافذ ثلاث أرقام فوز مختلفة. إليك إعادة العد من صفوف Google الـ 19:

مُحسوب ضد فوز أرجون تعادلات خسائر أرجون لم يتم الإبلاغ عنه
الأفضل من بين المنافسين الثلاثة 13 1 5 0
GPT-6 Astra فقط 14 1 4 0
Claude Opus 5.5 فقط 14 0 4 1
Claude Fable 5.1 فقط 15 0 2 2

رقم 13 صحيح مقابل المجال بأكمله. رقم 14 صحيح في المواجهة المباشرة ضد Astra أو Opus 5.5. رقم 12 لا يطابق أيًا من هذه الأطر للصفوف الـ 19 الكاملة، لذا تحقق من الصفوف التي قام هذا المصدر بحسابها. تختلف الهوامش أيضًا: Harvey Legal Agent (19.6% مقابل 6.7%) واسع؛ Chartography هو 0.6 نقطة.

كيف تدير تقييمك الخاص في يوم فتح الوصول

تصف المعايير أداة Google؛ تصف مطالباتك منتجك. ابنِ التقييم اليوم على نموذج يمكنك استدعاؤه، ثم وجهه إلى Argon بتغيير واحد.

  1. اختر مطالبات حقيقية تتطابق مع الصفوف التي تهتم بها: إصلاح مستودع، مهمة طرفية، سؤال مستند طويل.
  2. في Apidog، أنشئ بيئة باستخدام `GEMINI_API_KEY` و `GEMINI_MODEL` مضبوطين على `gemini-3.8-flash`. لم تنشر Google معرف نموذج Argon، لذا هذا المتغير هو القيمة الوحيدة التي ستغيرها.
  3. احفظ كل مطالبة كطلب يقرأ النموذج من `{{GEMINI_MODEL}}`، مجمعة في سيناريو اختبار.
  4. أضف تأكيدات على المخرجات (الحالة، الحقول المطلوبة، المحتوى المتوقع) وعلى `usageMetadata`، بما في ذلك سقف لـ `thoughtsTokenCount` بحجم سقف تكلفتك.
  5. شغل السيناريو على 3.8 Flash الآن واحتفظ بالتقرير كخط أساس لك.

في يوم شحن معرف Argon، استبدل المتغير وأعد التشغيل. تقول Google إن "جميع النماذج الجديدة" ستُطلق على Interactions API، لذا احفظ نسخة Interactions لكل طلب أيضًا. يغطي مقارنة Argon بـ Gemini 3.8 Flash ما يمكن توقعه بشأن السعر والقيود.

الأسئلة الشائعة

هل تم التحقق من معايير Gemini 4 Argon بشكل مستقل؟ جزئيًا. تسعة من أصل 19 صفًا تأتي من لوحات صدارة عامة لكل نموذج، ونشرت Artificial Analysis و Vals AI و Arena نتائجها الخاصة. أما البقية فقد أجرتها Google لأرجون.

ما هي درجة Gemini 4 Argon في DeepSWE؟ 77.9% على DeepSWE v1.1، متقدمًا على Opus 5.5 (74.2%) و Astra (74.1%). استخدم تشغيل Argon أداة وكيل mini-swe، بينما تأتي أرقام المنافسين من لوحة صدارة وبطاقات نظام.

هل يتفوق Argon على GPT-6 Astra في المعايير؟ في المواجهة المباشرة في جدول Google، يفوز Argon بـ 14 صفًا، ويتعادل في 1، ويخسر 4. على Artificial Analysis يتعادلان عند 53.

هل يمكنني إعادة تشغيل هذه المعايير بنفسي؟ ليس بعد. يقتصر Argon على شركاء Fairwind، ولم تحدد Google تاريخ إصدار عام؛ يتابع متتبع تاريخ إصدار Argon عملية الطرح.

الخطوة التالية

ابنِ السيناريو الآن، شغله على 3.8 Flash، واحتفظ بالتقرير. عندما يُتاح Argon، ستحصل على أرقامك الخاصة في دقائق بعد التبديل. حمل Apidog لإعداده.

button

ممارسة تصميم API في Apidog

اكتشف طريقة أسهل لبناء واستخدام واجهات برمجة التطبيقات