يتصدر Gemini 4 Argon 13 من أصل 19 صفًا في جدول إطلاق Google بشكل مباشر، ويتعادل في 1 (CWE-bench v1، مع GPT-6 Astra)، ويتأخر في 5: FrontierSWE v2، Terminal-bench 4.0، PostTrainBench، Terminal-Bench Science 0.1 و OSWorld-2.0. العقبة هي الوصول. Argon متاح اليوم فقط لمدافعي برنامج Fairwind، لذلك لا يمكن لأحد خارج قائمة شركاء Google وعدد قليل من منظمات قياس الأداء إعادة تشغيل هذه الأرقام بعد.
أدناه: الجدول الكامل مع من قام بقياس كل صف، والخمس خسائر، والتفاصيل الدقيقة، ودرجات الأمن السيبراني، ولوحات النتائج من أطراف ثالثة، وكيفية بناء تقييمك الخاص في Apidog قبل فتح الوصول. للحصول على نظرة عامة عن النموذج، ابدأ بـ ما هو Gemini 4 Argon. لاتخاذ قرار الشراء، انظر Argon مقابل GPT-6 Astra مقابل Claude Opus 5.5.
الجدول الكامل، مع من قام بقياس كل صف
هذه هي النتائج التي أبلغت عنها Google من منشور الإطلاق و منهجية التقييمات بصيغة PDF، والتي تحمل عنوان "النتائج اعتبارًا من أكتوبر 2026". قامت Google بحساب 10 من أصل 19 درجة لأرجون بنفسها؛ بينما تأتي الـ 9 الأخرى من لوحات الصدارة العامة. تأتي أرقام المنافسين من لوحات الصدارة تلك، أو عمليات تشغيل Google الخاصة، أو بطاقات نظام ومشاركات المدونات الخاصة بالبائعين، وتختلف الأدوات حسب الصف. يشير **الخط العريض** إلى المتصدر في الصف.
| المعيار | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | من قام بقياسه |
|---|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% | Vals AI |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | لوحة صدارة Zapier (مجموعة خاصة) |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Vals AI |
| Harvey Legal Agent | 19.6% | 5.4% | 6.7% | 3.8% | Vals AI |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% | حاسب Argon ذاتيًا؛ لوحة صدارة Astra؛ بطاقات نظام Anthropic |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | لوحة صدارة Proximal |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | Vals AI |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | حاسب Argon ذاتيًا؛ لوحة صدارة المنافسين |
| PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% | حاسب ذاتيًا لجميع النماذج |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | حاسب Argon ذاتيًا؛ لوحة صدارة المنافسين |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | حاسب ذاتيًا لجميع النماذج |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | لوحة صدارة Surge |
| GraphWalks up to 128K | 99.7% | 98.7% | 91.4% | 90.6% | حاسب ذاتيًا لجميع النماذج |
| GraphWalks 256K to 1M | 84.2% | 71.8% | 65.0% | 66.8% | حاسب ذاتيًا لجميع النماذج |
| Agent’s Last Exam | 39.5% | 34.2% | n/r | 38.2% | حاسب Argon ذاتيًا؛ لوحة صدارة المنافسين |
| OSWorld-2.0 (offline) | 69.2% | 72.6% | n/r | n/r | حاسب Argon ذاتيًا؛ Astra من مدونة OpenAI |
| Chartography | 71.6% | 71.0% | 46.2% | 66.3% | لوحة صدارة Surge |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | حاسب ذاتيًا لجميع النماذج |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% | لوحة صدارة عامة |
n/r = لم يتم الإبلاغ عنه. كما أن Grok 4.7، الذي لا يوجد في جدول Google، يسجل 68% على لوحة صدارة CWE-bench، لذا فإن التعادل ثلاثي.
مرتبة حسب المصدر، 9 صفوف تأتي من لوحات صدارة عامة لكل نموذج (Vals AI، Zapier، Proximal، Surge و CWE-bench). يتصدر Argon 7 من هذه الـ 9 ويتعادل في 1. قامت Google بتشغيل 5 صفوف بنفسها لجميع النماذج الأربعة، ويتصدر Argon 4 منها. الأزواج الـ 5 الأخرى تجمع درجة Argon التي تديرها Google مع أرقام المنافسين من أماكن أخرى، وهذا هو المكان الذي يخسر فيه Argon أكثر: 3 من خسائره الـ 5 تقع في تلك الصفوف المختلطة. إذا كان الحساب الذاتي يضفي جمالًا على Argon، لكانت تتوقع العكس.
أين يتأخر أرجون، ولماذا يهم ذلك في البرمجة المعتمدة على الوكلاء
- FrontierSWE v2: 55.0% مقابل 65.5% لـ Astra. أرجون هو الأخير من بين الأربعة، خلف Fable 5.1 (56.3%) و Opus 5.5 (62.3%)، في لوحة صدارة سجلت جميع النماذج.
- Terminal-bench 4.0: 57.4% مقابل 66.4% لـ Opus 5.5. الأخير مرة أخرى، على الرغم من أن Astra و Fable 5.1 يقعان ضمن نقطة واحدة.
- PostTrainBench: 45.3% مقابل 49.3% لـ Opus 5.5. المركز الثاني، في صف أدارته Google لجميع النماذج.
- Terminal-Bench Science 0.1: 57.6% مقابل 68.1% لـ Astra. الثالث، متفوقًا على Fable 5.1 فقط. أدارت Google محاولة أرجون بمهلة تحقق 6x.
- OSWorld-2.0 (غير متصل): 69.2% مقابل 72.6% لـ Astra. لا تبلغ Anthropic إلا عن درجة مجمعة عبر الإنترنت وغير متصل، لذلك لا يظهر أي من نموذجي Claude.
تنقسم البرمجة المعتمدة على الوكلاء بنتيجة 2 إلى 2. يفوز أرجون في DeepSWE v1.1 و Vibe Code Bench، ثم يأتي في المركز الأخير في FrontierSWE v2 و Terminal-bench 4.0. يمزج فوز DeepSWE بين الأدوات: أرجون يعمل على أداة وكيل swe صغيرة، ورقم Astra من لوحة الصدارة العامة، وأرقام Claude من بطاقات النظام. يعتبر Vibe Code Bench أنظف، حيث سجل Vals AI جميع الأربعة، لكن الهامش هو 1.6 نقطة.
إذا كان حجم عملك يتضمن وكلاء ثقيلين في الطرفية أو مهام مستودع طويلة، فوازن بين هذين الصفين الأخيرين فوق العد الرئيسي. تحتفظ Astra بالصدارة في FrontierSWE؛ يوضح تجربتنا مع GPT-6 Astra كيف يبدو استخدام هذا النموذج اليوم. بالنسبة لجانب Anthropic، يغطي تحليل مقاييس Claude Fable 5.1 أرقام إطلاق Fable الخاصة.
تفيد بلومبرج أن موظفين مجهولين في Google لديهم إمكانية الوصول يقولون إن أرجون لم يحقق التوقعات في بعض أعمال البرمجة وتصميم الواجهة الأمامية مقارنة بدرجاته المرجعية. وصفت Google هذا التوصيف بأنه غير دقيق.
تحذيرات المنهجية التي تغير كيفية قراءة الجدول
- أقصى جهد من كلا الجانبين. تم تشغيل Argon "باستخدام واجهة برمجة تطبيقات Gemini مع أعلى إعدادات التفكير." بالنسبة لـ Astra، و Fable 5.1، و Opus 5.5، تضبط Google الإعدادات الافتراضية على "أقصى إعدادات التفكير/الاستدلال المتاحة." يقارن هذا بين الحدود القصوى، وليس السلوك الافتراضي أو التكلفة.
- إطارات LVBench. قامت Google بتشغيل LVBench بنفسها لجميع النماذج الأربعة، بدون أدوات. أخذ Gemini عينات من الفيديو بمعدل 1 إطار في الثانية. حصل Astra على 800 إطار، وحصل Fable 5.1 على 300، وحصل Opus 5.5 على 600، "بسبب قيود واجهة برمجة التطبيقات." لم ترَ النماذج مدخلات متطابقة.
- OSWorld أفضل ثلاثة. درجة Argon هي "الحد الأقصى من 3 تشغيلات بمحاولة واحدة لكل تشغيل"، وهي أفضل نتيجة بدلاً من المتوسط.
- نافذة Agent’s Last Exam. تم تشغيل Argon على أداة ALE-Claw بمدة 5 ساعات.
- مرشحات الأمان قيد التشغيل. تم تشغيل Agent’s Last Exam و OSWorld مع تمكين مرشحات الأمان، وعادت الاستجابات التي تم وضع علامة عليها كسلاسل فارغة. إذا كان هناك أي شيء، فإن هذا يعمل ضد Argon.
صفوف الأمن السيبراني من صفحة الأمن السيبراني لـ DeepMind
تضيف صفحة الأمن السيبراني لـ DeepMind أربع درجات إضافية بخلاف جدول الإطلاق:
| تقييم الأمن السيبراني | Gemini 4 Argon | مقارنة |
|---|---|---|
| اكتشاف الثغرات الأمنية في العالم الحقيقي | 85.8% | Gemini 3.8 Flash Cyber 71.0% |
| معيار Wiz Penetration Test | 70.9% | Gemini 3.8 Flash Cyber 58.2% |
| نجاح هجوم Gray Swan IPI (k=15، الأقل أفضل) | 0.7% | الأدنى على الرسم البياني؛ Kimi K3 الأعلى بنسبة 52.7% |
| CWE-bench v1 | 68% | تعادل ثلاثي مع Grok 4.7 و GPT-6 Astra؛ Opus 5.5 بنسبة 67% |
استخدم تقييم الثغرات الأمنية أداة Antigravity داخلية "غير متخصصة في الأمن السيبراني"، مع إمكانية الوصول إلى المصدر. يمنح اختبار Wiz النموذج "الوصول فقط إلى الموقع الإلكتروني قيد التشغيل وسلوكه العام، بدون كود مصدر التطبيق." كلا المقارنتين الرئيسيتين هما مقابل نموذج Google السابق للأمن السيبراني، وليس المنافسين. يغطي شرحنا لدفاع Argon السيبراني ما تعنيه هذه الأمور لواجهات برمجة التطبيقات التي تشغلها.
لوحات النتائج من أطراف ثالثة
نشرت هذه المنظمات النتائج في غضون دقائق من الإطلاق، لذا كان لديها وصول قبل الإصدار.
- تدرج **Artificial Analysis** Gemini 4 Argon (عالي) عند مؤشر ذكاء يبلغ 53، في المرتبة 8 من أصل 223. يحسب هذا التصنيف كل إعداد استدلال على حدة. حسب النموذج المميز، يتعادل Argon مع Fable 5.1 و GPT-6 Astra ويقع خلف Opus 5.5 (58 كحد أقصى) و Sonnet 5.5 (56 كحد أقصى). تُفيد AA بمعدل هلوسة يبلغ 15% على AA-Omniscience (Astra كحد أقصى، 51%)، بدقة تبلغ 50% مقابل 63%. تكلفة تشغيل المؤشر بلغت 1.99 دولارًا لكل مهمة، بحوالي 62 ألف رمز إخراج لكل مهمة مقابل حوالي 27 ألفًا لـ Astra كحد أقصى. لا تُظهر Artificial Analysis أي بيانات للسرعة أو زمن الاستجابة.
- يضع **Vals AI** أرجون بنسبة 68.90% على مؤشر Vals، في المرتبة الأولى من 41 نموذجًا وأول نموذج من Gemini يتصدره، بتكلفة 15.68 دولارًا لكل اختبار. تُدرج Vals AI ناتجًا أقصى يبلغ 262 ألفًا للتكوين الذي تم اختباره، وهو أقل من الرقم المعلن من Google وهو 1 مليون.
- تصنف **Arena** أرجون في المرتبة الأولى على Text بنتيجة 1525، مع إشارة "مبدئي" على 4942 صوتًا، وفي المرتبة الثامنة على WebDev.
لماذا تنشر المنافذ أرقام فوز 12 و 13 و 14
نشرت المنافذ ثلاث أرقام فوز مختلفة. إليك إعادة العد من صفوف Google الـ 19:
| مُحسوب ضد | فوز أرجون | تعادلات | خسائر أرجون | لم يتم الإبلاغ عنه |
|---|---|---|---|---|
| الأفضل من بين المنافسين الثلاثة | 13 | 1 | 5 | 0 |
| GPT-6 Astra فقط | 14 | 1 | 4 | 0 |
| Claude Opus 5.5 فقط | 14 | 0 | 4 | 1 |
| Claude Fable 5.1 فقط | 15 | 0 | 2 | 2 |
رقم 13 صحيح مقابل المجال بأكمله. رقم 14 صحيح في المواجهة المباشرة ضد Astra أو Opus 5.5. رقم 12 لا يطابق أيًا من هذه الأطر للصفوف الـ 19 الكاملة، لذا تحقق من الصفوف التي قام هذا المصدر بحسابها. تختلف الهوامش أيضًا: Harvey Legal Agent (19.6% مقابل 6.7%) واسع؛ Chartography هو 0.6 نقطة.
كيف تدير تقييمك الخاص في يوم فتح الوصول
تصف المعايير أداة Google؛ تصف مطالباتك منتجك. ابنِ التقييم اليوم على نموذج يمكنك استدعاؤه، ثم وجهه إلى Argon بتغيير واحد.
- اختر مطالبات حقيقية تتطابق مع الصفوف التي تهتم بها: إصلاح مستودع، مهمة طرفية، سؤال مستند طويل.
- في Apidog، أنشئ بيئة باستخدام `GEMINI_API_KEY` و `GEMINI_MODEL` مضبوطين على `gemini-3.8-flash`. لم تنشر Google معرف نموذج Argon، لذا هذا المتغير هو القيمة الوحيدة التي ستغيرها.
- احفظ كل مطالبة كطلب يقرأ النموذج من `{{GEMINI_MODEL}}`، مجمعة في سيناريو اختبار.
- أضف تأكيدات على المخرجات (الحالة، الحقول المطلوبة، المحتوى المتوقع) وعلى `usageMetadata`، بما في ذلك سقف لـ `thoughtsTokenCount` بحجم سقف تكلفتك.
- شغل السيناريو على 3.8 Flash الآن واحتفظ بالتقرير كخط أساس لك.
في يوم شحن معرف Argon، استبدل المتغير وأعد التشغيل. تقول Google إن "جميع النماذج الجديدة" ستُطلق على Interactions API، لذا احفظ نسخة Interactions لكل طلب أيضًا. يغطي مقارنة Argon بـ Gemini 3.8 Flash ما يمكن توقعه بشأن السعر والقيود.
الأسئلة الشائعة
هل تم التحقق من معايير Gemini 4 Argon بشكل مستقل؟ جزئيًا. تسعة من أصل 19 صفًا تأتي من لوحات صدارة عامة لكل نموذج، ونشرت Artificial Analysis و Vals AI و Arena نتائجها الخاصة. أما البقية فقد أجرتها Google لأرجون.
ما هي درجة Gemini 4 Argon في DeepSWE؟ 77.9% على DeepSWE v1.1، متقدمًا على Opus 5.5 (74.2%) و Astra (74.1%). استخدم تشغيل Argon أداة وكيل mini-swe، بينما تأتي أرقام المنافسين من لوحة صدارة وبطاقات نظام.
هل يتفوق Argon على GPT-6 Astra في المعايير؟ في المواجهة المباشرة في جدول Google، يفوز Argon بـ 14 صفًا، ويتعادل في 1، ويخسر 4. على Artificial Analysis يتعادلان عند 53.
هل يمكنني إعادة تشغيل هذه المعايير بنفسي؟ ليس بعد. يقتصر Argon على شركاء Fairwind، ولم تحدد Google تاريخ إصدار عام؛ يتابع متتبع تاريخ إصدار Argon عملية الطرح.
الخطوة التالية
ابنِ السيناريو الآن، شغله على 3.8 Flash، واحتفظ بالتقرير. عندما يُتاح Argon، ستحصل على أرقامك الخاصة في دقائق بعد التبديل. حمل Apidog لإعداده.
