Gemini 4 Argon นำ 13 จาก 19 แถวในตารางเปิดตัวของ Google อย่างชัดเจน เสมอ 1 แถว (CWE-bench v1, กับ GPT-6 Astra) และตามหลัง 5 แถว: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-bench Science 0.1 และ OSWorld-2.0 ข้อจำกัดคือการเข้าถึง Argon มีให้ใช้งานในปัจจุบันเฉพาะผู้เข้าร่วมโปรแกรม Fairwind เท่านั้น ดังนั้น ไม่มีใครนอกเหนือจากรายชื่อพันธมิตรของ Google และองค์กรเกณฑ์มาตรฐานไม่กี่แห่งที่สามารถเรียกใช้ตัวเลขเหล่านี้ซ้ำได้ในขณะนี้
ด้านล่าง: ตารางฉบับเต็มพร้อมผู้ที่วัดผลแต่ละแถว, การแพ้ทั้งห้า, ข้อจำกัด, คะแนนไซเบอร์, กระดานคะแนนของบุคคลที่สาม และวิธีสร้างการประเมินของคุณเองใน Apidog ก่อนที่การเข้าถึงจะเปิดให้ใช้งาน สำหรับภาพรวมของโมเดล เริ่มต้นด้วย Gemini 4 Argon คืออะไร สำหรับการตัดสินใจซื้อ ดู Argon vs GPT-6 Astra vs Claude Opus 5.5
ตารางฉบับเต็ม พร้อมผู้ที่วัดผลแต่ละแถว
ผลลัพธ์เหล่านี้เป็นข้อมูลที่ Google รายงานจาก โพสต์เปิดตัว และ เอกสาร PDF ระเบียบวิธีการประเมิน ซึ่งมีหัวข้อว่า "ผลลัพธ์ ณ เดือนตุลาคม 2026" Google คำนวณคะแนน Argon 10 จาก 19 คะแนนด้วยตนเอง ส่วนอีก 9 คะแนนมาจากกระดานผู้นำสาธารณะ ตัวเลขของคู่แข่งมาจากกระดานผู้นำเหล่านั้น การทดสอบของ Google เอง หรือการ์ดระบบและบล็อกโพสต์ของผู้จำหน่าย และวิธีการทดสอบจะแตกต่างกันไปในแต่ละแถว ตัวหนาคือผู้นำในแถวนั้น
| เกณฑ์มาตรฐาน | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | ผู้ที่วัดผล |
|---|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% | Vals AI |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | กระดานผู้นำ Zapier (ชุดข้อมูลส่วนตัว) |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Vals AI |
| Harvey Legal Agent | 19.6% | 5.4% | 6.7% | 3.8% | Vals AI |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% | Argon คำนวณเอง; กระดานผู้นำ Astra; การ์ดระบบ Anthropic |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | กระดานผู้นำ Proximal |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | Vals AI |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | Argon คำนวณเอง; กระดานผู้นำคู่แข่ง |
| PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% | คำนวณเองสำหรับทุกโมเดล |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | Argon คำนวณเอง; กระดานผู้นำคู่แข่ง |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | คำนวณเองสำหรับทุกโมเดล |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | กระดานผู้นำ Surge |
| GraphWalks up to 128K | 99.7% | 98.7% | 91.4% | 90.6% | คำนวณเองสำหรับทุกโมเดล |
| GraphWalks 256K to 1M | 84.2% | 71.8% | 65.0% | 66.8% | คำนวณเองสำหรับทุกโมเดล |
| Agent’s Last Exam | 39.5% | 34.2% | n/r | 38.2% | Argon คำนวณเอง; กระดานผู้นำคู่แข่ง |
| OSWorld-2.0 (offline) | 69.2% | 72.6% | n/r | n/r | Argon คำนวณเอง; Astra จากบล็อกโพสต์ของ OpenAI |
| Chartography | 71.6% | 71.0% | 46.2% | 66.3% | กระดานผู้นำ Surge |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | คำนวณเองสำหรับทุกโมเดล |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% | กระดานผู้นำสาธารณะ |
n/r = ไม่ได้รายงาน Grok 4.7 ซึ่งไม่ได้อยู่ในตารางของ Google ก็ได้คะแนน 68% บนกระดานผู้นำ CWE-bench เช่นกัน ดังนั้นจึงเป็นการเสมอกันสามทาง
จัดเรียงตามแหล่งที่มา มี 9 แถวมาจากกระดานผู้นำสาธารณะสำหรับทุกโมเดล (Vals AI, Zapier, Proximal, Surge และ CWE-bench) Argon นำ 7 ใน 9 แถวนั้นและเสมอ 1 แถว Google ทดสอบเอง 5 แถวสำหรับทั้งสี่โมเดล และ Argon นำ 4 แถว อีก 5 แถวเป็นการจับคู่คะแนน Argon ที่ Google ทดสอบกับตัวเลขของคู่แข่งจากที่อื่น และนั่นคือจุดที่ Argon แพ้มากที่สุด: 3 ใน 5 การแพ้ของ Argon อยู่ในแถวผสมเหล่านี้ หากการคำนวณเองทำให้ Argon ดูดีเกินจริง คุณก็คงคาดหวังผลลัพธ์ตรงกันข้าม
จุดที่ Argon ตามหลัง และเหตุใดจึงสำคัญสำหรับการเขียนโค้ดแบบเอเจนต์
- FrontierSWE v2: 55.0% เทียบกับ 65.5% ของ Astra. Argon อยู่ในอันดับสุดท้ายจากสี่อันดับ รองจาก Fable 5.1 (56.3%) และ Opus 5.5 (62.3%) บนกระดานผู้นำที่ให้คะแนนทุกโมเดล
- Terminal-bench 4.0: 57.4% เทียบกับ 66.4% ของ Opus 5.5. อยู่ในอันดับสุดท้ายอีกครั้ง แม้ว่า Astra และ Fable 5.1 จะมีคะแนนใกล้เคียงกัน
- PostTrainBench: 45.3% เทียบกับ 49.3% ของ Opus 5.5. อันดับสองในแถวที่ Google ทดสอบสำหรับทุกโมเดล
- Terminal-bench Science 0.1: 57.6% เทียบกับ 68.1% ของ Astra. อันดับสาม นำหน้าเพียง Fable 5.1 เท่านั้น Google ได้ทดสอบ Argon โดยมีการจำกัดเวลาตรวจสอบ 6 เท่า
- OSWorld-2.0 (ชุดย่อยออฟไลน์): 69.2% เทียบกับ 72.6% ของ Astra. Anthropic รายงานเฉพาะคะแนนรวมออนไลน์และออฟไลน์ ดังนั้นจึงไม่มีโมเดล Claude ปรากฏอยู่
การเขียนโค้ดแบบเอเจนต์แบ่งเป็น 2 ต่อ 2 Argon ชนะ DeepSWE v1.1 และ Vibe Code Bench จากนั้นอยู่อันดับสุดท้ายใน FrontierSWE v2 และ Terminal-bench 4.0 ชัยชนะใน DeepSWE ใช้การทดสอบที่แตกต่างกัน: Argon ทำงานบน mini-swe agent harness, ตัวเลขของ Astra มาจากกระดานผู้นำสาธารณะ และตัวเลขของ Claude มาจากการ์ดระบบ Vibe Code Bench ชัดเจนกว่า เนื่องจาก Vals AI ให้คะแนนทั้งสี่โมเดล แต่ส่วนต่างคือ 1.6 คะแนน
หากปริมาณงานของคุณคือเอเจนต์ที่เน้นเทอร์มินัลหรืองาน repository ที่ยาวนาน ให้พิจารณาแถวสองอันดับสุดท้ายเหล่านั้นที่กล่าวมาข้างต้น นอกเหนือจากจำนวนรวม Astra เป็นผู้นำใน FrontierSWE; การทดลองใช้ GPT-6 Astra ของเรา แสดงให้เห็นว่าโมเดลนั้นเป็นอย่างไรในการใช้งานจริงในปัจจุบัน สำหรับฝั่งของ Anthropic รายละเอียดเกณฑ์มาตรฐานของ Claude Fable 5.1 ครอบคลุมตัวเลขการเปิดตัวของ Fable เอง
Bloomberg รายงานว่าพนักงาน Google ที่ไม่เปิดเผยนามซึ่งสามารถเข้าถึงได้กล่าวว่า Argon ทำงานได้ไม่น่าประทับใจในงานเขียนโค้ดและงานออกแบบส่วนหน้าบางส่วนเมื่อเทียบกับคะแนนเกณฑ์มาตรฐาน Google กล่าวว่าลักษณะดังกล่าวไม่ถูกต้อง
ข้อควรระวังเกี่ยวกับระเบียบวิธีที่เปลี่ยนวิธีที่คุณอ่านตาราง
- ความพยายามสูงสุดจากทั้งสองฝ่าย Argon ทำงาน "ด้วย Gemini API ที่มีการตั้งค่าการคิดสูงสุด" สำหรับ Astra, Fable 5.1 และ Opus 5.5, Google จะตั้งค่าเริ่มต้นเป็น "การตั้งค่าการคิด/การใช้เหตุผลสูงสุดที่มีอยู่" ซึ่งเป็นการเปรียบเทียบขีดจำกัดสูงสุด ไม่ใช่พฤติกรรมเริ่มต้นหรือต้นทุน
- เฟรม LVBench Google ได้ทดสอบ LVBench ด้วยตนเองสำหรับทั้งสี่โมเดล โดยไม่มีเครื่องมือ Gemini สุ่มตัวอย่างวิดีโอที่ 1 FPS. Astra ได้ 800 เฟรม, Fable 5.1 ได้ 300 เฟรม และ Opus 5.5 ได้ 600 เฟรม "เนื่องจากข้อจำกัดของ API" โมเดลเหล่านี้ไม่ได้รับอินพุตที่เหมือนกัน
- OSWorld ดีที่สุดจากสามครั้ง คะแนนของ Argon คือ "สูงสุดจากการรัน 3 ครั้ง โดยมีการพยายามเพียงครั้งเดียวต่อการรัน" ซึ่งเป็นคะแนนที่ดีที่สุด ไม่ใช่ค่าเฉลี่ย
- ระยะเวลาของ Agent’s Last Exam Argon ทำงานบน ALE-Claw harness โดยมีระยะเวลา 5 ชั่วโมง
- เปิดใช้งานตัวกรองความปลอดภัย Agent’s Last Exam และ OSWorld ทำงานโดยเปิดใช้งานตัวกรองความปลอดภัย และการตอบสนองที่ถูกตั้งค่าสถานะจะส่งกลับเป็นสตริงว่างเปล่า หากมีสิ่งใด สิ่งนั้นจะส่งผลเสียต่อ Argon
แถวไซเบอร์จากหน้าไซเบอร์ของ DeepMind
หน้าไซเบอร์ของ DeepMind เพิ่มอีกสี่คะแนนจากตารางเปิดตัว:
| การประเมินไซเบอร์ | Gemini 4 Argon | การเปรียบเทียบ |
|---|---|---|
| การค้นพบช่องโหว่ในโลกจริง | 85.8% | Gemini 3.8 Flash Cyber 71.0% |
| เกณฑ์มาตรฐานการทดสอบการเจาะระบบ Wiz | 70.9% | Gemini 3.8 Flash Cyber 58.2% |
| ความสำเร็จของการโจมตี Gray Swan IPI (k=15, ยิ่งน้อยยิ่งดี) | 0.7% | ต่ำสุดในกราฟ; Kimi K3 สูงสุดที่ 52.7% |
| CWE-bench v1 | 68% | เสมอกันสามทางกับ Grok 4.7 และ GPT-6 Astra; Opus 5.5 ที่ 67% |
การประเมินช่องโหว่ใช้ Antigravity harness ภายใน "ที่ไม่เชี่ยวชาญด้านไซเบอร์" พร้อมการเข้าถึงซอร์สโค้ด การทดสอบ Wiz ทำให้โมเดล "เข้าถึงได้เฉพาะเว็บไซต์ที่กำลังทำงานและพฤติกรรมสาธารณะ โดยไม่มีซอร์สโค้ดของแอปพลิเคชัน" การเปรียบเทียบพาดหัวข่าวทั้งสองรายการนี้เป็นการเทียบกับโมเดลไซเบอร์รุ่นก่อนหน้าของ Google ไม่ใช่คู่แข่ง คำอธิบายการป้องกันทางไซเบอร์ของ Argon ของเราครอบคลุมความหมายเหล่านี้สำหรับ API ที่คุณใช้งาน
กระดานคะแนนของบุคคลที่สาม
องค์กรเหล่านี้ได้โพสต์คะแนนภายในไม่กี่นาทีหลังจากเปิดตัว ดังนั้นพวกเขาจึงเข้าถึงได้ก่อนการเผยแพร่
- Artificial Analysis จัดอันดับ Gemini 4 Argon (สูง) ที่ดัชนีความฉลาด 53, อันดับที่ 8 จาก 223. การจัดอันดับนี้จะนับการตั้งค่าการใช้เหตุผลแต่ละอย่างแยกกัน ตามโมเดลที่แตกต่างกัน Argon เสมอกับ Fable 5.1 และ GPT-6 Astra และอยู่เบื้องหลัง Opus 5.5 (สูงสุด 58) และ Sonnet 5.5 (สูงสุด 56) AA รายงานอัตราการหลอน 15% บน AA-Omniscience (Astra ที่สูงสุด 51%) โดยมีความแม่นยำ 50% เทียบกับ 63% การรันดัชนีมีค่าใช้จ่าย 1.99 ดอลลาร์ต่อภารกิจ โดยมีประมาณ 62K โทเค็นเอาต์พุตต่อภารกิจ เทียบกับประมาณ 27K สำหรับ Astra ที่สูงสุด Artificial Analysis ไม่แสดงข้อมูลความเร็วหรือความล่าช้า
- Vals AI ให้คะแนน Argon ที่ 68.90% บน Vals Index, อันดับ 1 จาก 41 และเป็นโมเดล Gemini ตัวแรกที่ขึ้นอันดับสูงสุด โดยมีค่าใช้จ่าย 15.68 ดอลลาร์ต่อการทดสอบ Vals AI ระบุเอาต์พุตสูงสุดที่ 262K สำหรับการกำหนดค่าที่ทดสอบ ซึ่งต่ำกว่า 1M ที่ Google ระบุไว้
- Arena จัดอันดับ Argon ที่ #1 บน Text ที่ 1525, โดยทำเครื่องหมายว่า "เบื้องต้น" จาก 4,942 โหวต และ #8 บน WebDev
เหตุผลที่สื่อเผยแพร่จำนวนชัยชนะ 12, 13 และ 14 ครั้ง
สื่อได้ตีพิมพ์จำนวนชัยชนะที่แตกต่างกันสามแบบ นี่คือการนับใหม่จาก 19 แถวของ Google:
| นับเทียบกับ | Argon ชนะ | เสมอ | Argon แพ้ | ไม่ได้รายงาน |
|---|---|---|---|---|
| ดีที่สุดในบรรดาคู่แข่งทั้งสาม | 13 | 1 | 5 | 0 |
| GPT-6 Astra เท่านั้น | 14 | 1 | 4 | 0 |
| Claude Opus 5.5 เท่านั้น | 14 | 0 | 4 | 1 |
| Claude Fable 5.1 เท่านั้น | 15 | 0 | 2 | 2 |
13 ครั้งถูกต้องเมื่อเทียบกับทั้งหมด 14 ครั้งถูกต้องเมื่อเทียบตัวต่อตัวกับ Astra หรือ Opus 5.5 12 ครั้งไม่ตรงกับการจัดกรอบใดๆ ของทั้ง 19 แถว ดังนั้นโปรดตรวจสอบว่าแหล่งข้อมูลนั้นนับแถวใด ส่วนต่างก็แตกต่างกันด้วย: Harvey Legal Agent (19.6% เทียบกับ 6.7%) มีส่วนต่างมาก; Chartography มีส่วนต่าง 0.6 คะแนน
วิธีเรียกใช้การประเมินของคุณเองในวันที่เปิดการเข้าถึง
เกณฑ์มาตรฐานอธิบายถึงระบบการทดสอบของ Google; พรอมต์ของคุณอธิบายผลิตภัณฑ์ของคุณ สร้างการประเมินวันนี้บนโมเดลที่คุณสามารถเรียกใช้ได้ จากนั้นชี้ไปที่ Argon ด้วยการเปลี่ยนแปลงเพียงอย่างเดียว
- เลือกพรอมต์จริงที่ตรงกับแถวที่คุณสนใจ: การแก้ไข repository, งานเทอร์มินัล, คำถามเอกสารขนาดยาว
- ใน Apidog, สร้างสภาพแวดล้อมโดยตั้งค่า
GEMINI_API_KEYและGEMINI_MODELเป็นgemini-3.8-flashGoogle ยังไม่ได้เผยแพร่ ID โมเดลของ Argon ดังนั้นตัวแปรนี้จึงเป็นค่าเดียวที่คุณจะต้องเปลี่ยน - บันทึกแต่ละพรอมต์เป็นคำขอที่อ่านโมเดลจาก
{{GEMINI_MODEL}}โดยจัดกลุ่มเป็นสถานการณ์การทดสอบ - เพิ่มการยืนยันบนเอาต์พุต (สถานะ, ฟิลด์ที่จำเป็น, เนื้อหาที่คาดหวัง) และบน
usageMetadataรวมถึงขีดจำกัดบนthoughtsTokenCountที่ปรับขนาดตามงบประมาณค่าใช้จ่ายของคุณ - รันสถานการณ์บน 3.8 Flash ตอนนี้และเก็บรายงานไว้เป็นข้อมูลพื้นฐานของคุณ
ในวันที่ ID ของ Argon ถูกปล่อยออกมา ให้สลับตัวแปรและรันใหม่ Google กล่าวว่า "โมเดลใหม่ทั้งหมด" จะเปิดตัวบน Interactions API ดังนั้นให้บันทึกเวอร์ชัน Interactions ของแต่ละคำขอด้วย การเปรียบเทียบ Argon กับ Gemini 3.8 Flash ของเราครอบคลุมสิ่งที่คุณจะได้รับเกี่ยวกับราคาและข้อจำกัด
คำถามที่พบบ่อย
เกณฑ์มาตรฐานของ Gemini 4 Argon ได้รับการตรวจสอบอย่างอิสระหรือไม่? บางส่วน เก้าจาก 19 แถวมาจากกระดานผู้นำสาธารณะสำหรับทุกโมเดล และ Artificial Analysis, Vals AI และ Arena ได้โพสต์ผลลัพธ์ของตนเอง ส่วนที่เหลือเป็นการทดสอบโดย Google สำหรับ Argon
คะแนน DeepSWE ของ Gemini 4 Argon คือเท่าไร? 77.9% บน DeepSWE v1.1, นำหน้า Opus 5.5 (74.2%) และ Astra (74.1%) การทดสอบของ Argon ใช้ mini-swe agent harness ในขณะที่ตัวเลขของคู่แข่งมาจากกระดานผู้นำและ system cards
Argon ชนะ GPT-6 Astra ในเกณฑ์มาตรฐานหรือไม่? เมื่อเทียบตัวต่อตัวในตารางของ Google, Argon ชนะ 14 แถว, เสมอ 1 แถว และแพ้ 4 แถว บน Artificial Analysis ทั้งคู่เสมอกันที่ 53
ฉันสามารถรันเกณฑ์มาตรฐานเหล่านี้ด้วยตนเองได้หรือไม่? ยังไม่ได้ Argon ถูกจำกัดสำหรับพันธมิตร Fairwind เท่านั้น และ Google ยังไม่ได้ระบุวันเปิดตัวสู่สาธารณะ; ตัวติดตามวันวางจำหน่าย Argon ของเราติดตามการเปิดตัวนี้
ขั้นตอนต่อไป
สร้างสถานการณ์ตอนนี้ รันบน 3.8 Flash และเก็บรายงานไว้ เมื่อ Argon เปิดให้ใช้งาน คุณจะมีตัวเลขของคุณเองภายในไม่กี่นาทีหลังจากการสลับ ดาวน์โหลด Apidog เพื่อตั้งค่า
