ผล Benchmark Gemini 4 Argon: ครบ 19 รายการ, วิธีที่ Google ทดสอบ และ 5 จุดที่พ่ายแพ้

เกณฑ์มาตรฐาน Gemini 4 Argon: ข้อมูลทั้งหมด 19 แถวพร้อมระบุผู้ทำการวัดในแต่ละรายการ, 5 รายการที่พ่ายแพ้, ข้อควรระวังด้านระเบียบวิธีของ Google, และคะแนน AA, Vals และ Arena

INEZA Felin-Michel

INEZA Felin-Michel

2 October 2026

ผล Benchmark Gemini 4 Argon: ครบ 19 รายการ, วิธีที่ Google ทดสอบ และ 5 จุดที่พ่ายแพ้

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

Gemini 4 Argon นำ 13 จาก 19 แถวในตารางเปิดตัวของ Google อย่างชัดเจน เสมอ 1 แถว (CWE-bench v1, กับ GPT-6 Astra) และตามหลัง 5 แถว: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-bench Science 0.1 และ OSWorld-2.0 ข้อจำกัดคือการเข้าถึง Argon มีให้ใช้งานในปัจจุบันเฉพาะผู้เข้าร่วมโปรแกรม Fairwind เท่านั้น ดังนั้น ไม่มีใครนอกเหนือจากรายชื่อพันธมิตรของ Google และองค์กรเกณฑ์มาตรฐานไม่กี่แห่งที่สามารถเรียกใช้ตัวเลขเหล่านี้ซ้ำได้ในขณะนี้

ด้านล่าง: ตารางฉบับเต็มพร้อมผู้ที่วัดผลแต่ละแถว, การแพ้ทั้งห้า, ข้อจำกัด, คะแนนไซเบอร์, กระดานคะแนนของบุคคลที่สาม และวิธีสร้างการประเมินของคุณเองใน Apidog ก่อนที่การเข้าถึงจะเปิดให้ใช้งาน สำหรับภาพรวมของโมเดล เริ่มต้นด้วย Gemini 4 Argon คืออะไร สำหรับการตัดสินใจซื้อ ดู Argon vs GPT-6 Astra vs Claude Opus 5.5

ตารางฉบับเต็ม พร้อมผู้ที่วัดผลแต่ละแถว

ผลลัพธ์เหล่านี้เป็นข้อมูลที่ Google รายงานจาก โพสต์เปิดตัว และ เอกสาร PDF ระเบียบวิธีการประเมิน ซึ่งมีหัวข้อว่า "ผลลัพธ์ ณ เดือนตุลาคม 2026" Google คำนวณคะแนน Argon 10 จาก 19 คะแนนด้วยตนเอง ส่วนอีก 9 คะแนนมาจากกระดานผู้นำสาธารณะ ตัวเลขของคู่แข่งมาจากกระดานผู้นำเหล่านั้น การทดสอบของ Google เอง หรือการ์ดระบบและบล็อกโพสต์ของผู้จำหน่าย และวิธีการทดสอบจะแตกต่างกันไปในแต่ละแถว ตัวหนาคือผู้นำในแถวนั้น

เกณฑ์มาตรฐาน Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 ผู้ที่วัดผล
Vals Index 68.9% 63.1% 65.8% 67.0% Vals AI
AutomationBench 51.3% 41.4% 31.4% 42.5% กระดานผู้นำ Zapier (ชุดข้อมูลส่วนตัว)
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6% Vals AI
Harvey Legal Agent 19.6% 5.4% 6.7% 3.8% Vals AI
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2% Argon คำนวณเอง; กระดานผู้นำ Astra; การ์ดระบบ Anthropic
FrontierSWE v2 55.0% 65.5% 56.3% 62.3% กระดานผู้นำ Proximal
Vibe Code Bench 91.9% 89.6% 90.3% 90.3% Vals AI
Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4% Argon คำนวณเอง; กระดานผู้นำคู่แข่ง
PostTrainBench 45.3% 44.3% 40.2% 49.3% คำนวณเองสำหรับทุกโมเดล
Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3% Argon คำนวณเอง; กระดานผู้นำคู่แข่ง
LABBench 2 88.8% 85.4% 68.6% 73.1% คำนวณเองสำหรับทุกโมเดล
RiemannBench 76.0% 72.0% 65.6% 69.6% กระดานผู้นำ Surge
GraphWalks up to 128K 99.7% 98.7% 91.4% 90.6% คำนวณเองสำหรับทุกโมเดล
GraphWalks 256K to 1M 84.2% 71.8% 65.0% 66.8% คำนวณเองสำหรับทุกโมเดล
Agent’s Last Exam 39.5% 34.2% n/r 38.2% Argon คำนวณเอง; กระดานผู้นำคู่แข่ง
OSWorld-2.0 (offline) 69.2% 72.6% n/r n/r Argon คำนวณเอง; Astra จากบล็อกโพสต์ของ OpenAI
Chartography 71.6% 71.0% 46.2% 66.3% กระดานผู้นำ Surge
LVBench 91.7% 87.5% 79.7% 83.7% คำนวณเองสำหรับทุกโมเดล
CWE-bench v1 68.0% 68.0% 58.0% 67.0% กระดานผู้นำสาธารณะ

n/r = ไม่ได้รายงาน Grok 4.7 ซึ่งไม่ได้อยู่ในตารางของ Google ก็ได้คะแนน 68% บนกระดานผู้นำ CWE-bench เช่นกัน ดังนั้นจึงเป็นการเสมอกันสามทาง

จัดเรียงตามแหล่งที่มา มี 9 แถวมาจากกระดานผู้นำสาธารณะสำหรับทุกโมเดล (Vals AI, Zapier, Proximal, Surge และ CWE-bench) Argon นำ 7 ใน 9 แถวนั้นและเสมอ 1 แถว Google ทดสอบเอง 5 แถวสำหรับทั้งสี่โมเดล และ Argon นำ 4 แถว อีก 5 แถวเป็นการจับคู่คะแนน Argon ที่ Google ทดสอบกับตัวเลขของคู่แข่งจากที่อื่น และนั่นคือจุดที่ Argon แพ้มากที่สุด: 3 ใน 5 การแพ้ของ Argon อยู่ในแถวผสมเหล่านี้ หากการคำนวณเองทำให้ Argon ดูดีเกินจริง คุณก็คงคาดหวังผลลัพธ์ตรงกันข้าม

จุดที่ Argon ตามหลัง และเหตุใดจึงสำคัญสำหรับการเขียนโค้ดแบบเอเจนต์

การเขียนโค้ดแบบเอเจนต์แบ่งเป็น 2 ต่อ 2 Argon ชนะ DeepSWE v1.1 และ Vibe Code Bench จากนั้นอยู่อันดับสุดท้ายใน FrontierSWE v2 และ Terminal-bench 4.0 ชัยชนะใน DeepSWE ใช้การทดสอบที่แตกต่างกัน: Argon ทำงานบน mini-swe agent harness, ตัวเลขของ Astra มาจากกระดานผู้นำสาธารณะ และตัวเลขของ Claude มาจากการ์ดระบบ Vibe Code Bench ชัดเจนกว่า เนื่องจาก Vals AI ให้คะแนนทั้งสี่โมเดล แต่ส่วนต่างคือ 1.6 คะแนน

หากปริมาณงานของคุณคือเอเจนต์ที่เน้นเทอร์มินัลหรืองาน repository ที่ยาวนาน ให้พิจารณาแถวสองอันดับสุดท้ายเหล่านั้นที่กล่าวมาข้างต้น นอกเหนือจากจำนวนรวม Astra เป็นผู้นำใน FrontierSWE; การทดลองใช้ GPT-6 Astra ของเรา แสดงให้เห็นว่าโมเดลนั้นเป็นอย่างไรในการใช้งานจริงในปัจจุบัน สำหรับฝั่งของ Anthropic รายละเอียดเกณฑ์มาตรฐานของ Claude Fable 5.1 ครอบคลุมตัวเลขการเปิดตัวของ Fable เอง

Bloomberg รายงานว่าพนักงาน Google ที่ไม่เปิดเผยนามซึ่งสามารถเข้าถึงได้กล่าวว่า Argon ทำงานได้ไม่น่าประทับใจในงานเขียนโค้ดและงานออกแบบส่วนหน้าบางส่วนเมื่อเทียบกับคะแนนเกณฑ์มาตรฐาน Google กล่าวว่าลักษณะดังกล่าวไม่ถูกต้อง

ข้อควรระวังเกี่ยวกับระเบียบวิธีที่เปลี่ยนวิธีที่คุณอ่านตาราง

แถวไซเบอร์จากหน้าไซเบอร์ของ DeepMind

หน้าไซเบอร์ของ DeepMind เพิ่มอีกสี่คะแนนจากตารางเปิดตัว:

การประเมินไซเบอร์ Gemini 4 Argon การเปรียบเทียบ
การค้นพบช่องโหว่ในโลกจริง 85.8% Gemini 3.8 Flash Cyber 71.0%
เกณฑ์มาตรฐานการทดสอบการเจาะระบบ Wiz 70.9% Gemini 3.8 Flash Cyber 58.2%
ความสำเร็จของการโจมตี Gray Swan IPI (k=15, ยิ่งน้อยยิ่งดี) 0.7% ต่ำสุดในกราฟ; Kimi K3 สูงสุดที่ 52.7%
CWE-bench v1 68% เสมอกันสามทางกับ Grok 4.7 และ GPT-6 Astra; Opus 5.5 ที่ 67%

การประเมินช่องโหว่ใช้ Antigravity harness ภายใน "ที่ไม่เชี่ยวชาญด้านไซเบอร์" พร้อมการเข้าถึงซอร์สโค้ด การทดสอบ Wiz ทำให้โมเดล "เข้าถึงได้เฉพาะเว็บไซต์ที่กำลังทำงานและพฤติกรรมสาธารณะ โดยไม่มีซอร์สโค้ดของแอปพลิเคชัน" การเปรียบเทียบพาดหัวข่าวทั้งสองรายการนี้เป็นการเทียบกับโมเดลไซเบอร์รุ่นก่อนหน้าของ Google ไม่ใช่คู่แข่ง คำอธิบายการป้องกันทางไซเบอร์ของ Argon ของเราครอบคลุมความหมายเหล่านี้สำหรับ API ที่คุณใช้งาน

กระดานคะแนนของบุคคลที่สาม

องค์กรเหล่านี้ได้โพสต์คะแนนภายในไม่กี่นาทีหลังจากเปิดตัว ดังนั้นพวกเขาจึงเข้าถึงได้ก่อนการเผยแพร่

เหตุผลที่สื่อเผยแพร่จำนวนชัยชนะ 12, 13 และ 14 ครั้ง

สื่อได้ตีพิมพ์จำนวนชัยชนะที่แตกต่างกันสามแบบ นี่คือการนับใหม่จาก 19 แถวของ Google:

นับเทียบกับ Argon ชนะ เสมอ Argon แพ้ ไม่ได้รายงาน
ดีที่สุดในบรรดาคู่แข่งทั้งสาม 13 1 5 0
GPT-6 Astra เท่านั้น 14 1 4 0
Claude Opus 5.5 เท่านั้น 14 0 4 1
Claude Fable 5.1 เท่านั้น 15 0 2 2

13 ครั้งถูกต้องเมื่อเทียบกับทั้งหมด 14 ครั้งถูกต้องเมื่อเทียบตัวต่อตัวกับ Astra หรือ Opus 5.5 12 ครั้งไม่ตรงกับการจัดกรอบใดๆ ของทั้ง 19 แถว ดังนั้นโปรดตรวจสอบว่าแหล่งข้อมูลนั้นนับแถวใด ส่วนต่างก็แตกต่างกันด้วย: Harvey Legal Agent (19.6% เทียบกับ 6.7%) มีส่วนต่างมาก; Chartography มีส่วนต่าง 0.6 คะแนน

วิธีเรียกใช้การประเมินของคุณเองในวันที่เปิดการเข้าถึง

เกณฑ์มาตรฐานอธิบายถึงระบบการทดสอบของ Google; พรอมต์ของคุณอธิบายผลิตภัณฑ์ของคุณ สร้างการประเมินวันนี้บนโมเดลที่คุณสามารถเรียกใช้ได้ จากนั้นชี้ไปที่ Argon ด้วยการเปลี่ยนแปลงเพียงอย่างเดียว

  1. เลือกพรอมต์จริงที่ตรงกับแถวที่คุณสนใจ: การแก้ไข repository, งานเทอร์มินัล, คำถามเอกสารขนาดยาว
  2. ใน Apidog, สร้างสภาพแวดล้อมโดยตั้งค่า GEMINI_API_KEY และ GEMINI_MODEL เป็น gemini-3.8-flash Google ยังไม่ได้เผยแพร่ ID โมเดลของ Argon ดังนั้นตัวแปรนี้จึงเป็นค่าเดียวที่คุณจะต้องเปลี่ยน
  3. บันทึกแต่ละพรอมต์เป็นคำขอที่อ่านโมเดลจาก {{GEMINI_MODEL}} โดยจัดกลุ่มเป็นสถานการณ์การทดสอบ
  4. เพิ่มการยืนยันบนเอาต์พุต (สถานะ, ฟิลด์ที่จำเป็น, เนื้อหาที่คาดหวัง) และบน usageMetadata รวมถึงขีดจำกัดบน thoughtsTokenCount ที่ปรับขนาดตามงบประมาณค่าใช้จ่ายของคุณ
  5. รันสถานการณ์บน 3.8 Flash ตอนนี้และเก็บรายงานไว้เป็นข้อมูลพื้นฐานของคุณ

ในวันที่ ID ของ Argon ถูกปล่อยออกมา ให้สลับตัวแปรและรันใหม่ Google กล่าวว่า "โมเดลใหม่ทั้งหมด" จะเปิดตัวบน Interactions API ดังนั้นให้บันทึกเวอร์ชัน Interactions ของแต่ละคำขอด้วย การเปรียบเทียบ Argon กับ Gemini 3.8 Flash ของเราครอบคลุมสิ่งที่คุณจะได้รับเกี่ยวกับราคาและข้อจำกัด

คำถามที่พบบ่อย

เกณฑ์มาตรฐานของ Gemini 4 Argon ได้รับการตรวจสอบอย่างอิสระหรือไม่? บางส่วน เก้าจาก 19 แถวมาจากกระดานผู้นำสาธารณะสำหรับทุกโมเดล และ Artificial Analysis, Vals AI และ Arena ได้โพสต์ผลลัพธ์ของตนเอง ส่วนที่เหลือเป็นการทดสอบโดย Google สำหรับ Argon

คะแนน DeepSWE ของ Gemini 4 Argon คือเท่าไร? 77.9% บน DeepSWE v1.1, นำหน้า Opus 5.5 (74.2%) และ Astra (74.1%) การทดสอบของ Argon ใช้ mini-swe agent harness ในขณะที่ตัวเลขของคู่แข่งมาจากกระดานผู้นำและ system cards

Argon ชนะ GPT-6 Astra ในเกณฑ์มาตรฐานหรือไม่? เมื่อเทียบตัวต่อตัวในตารางของ Google, Argon ชนะ 14 แถว, เสมอ 1 แถว และแพ้ 4 แถว บน Artificial Analysis ทั้งคู่เสมอกันที่ 53

ฉันสามารถรันเกณฑ์มาตรฐานเหล่านี้ด้วยตนเองได้หรือไม่? ยังไม่ได้ Argon ถูกจำกัดสำหรับพันธมิตร Fairwind เท่านั้น และ Google ยังไม่ได้ระบุวันเปิดตัวสู่สาธารณะ; ตัวติดตามวันวางจำหน่าย Argon ของเราติดตามการเปิดตัวนี้

ขั้นตอนต่อไป

สร้างสถานการณ์ตอนนี้ รันบน 3.8 Flash และเก็บรายงานไว้ เมื่อ Argon เปิดให้ใช้งาน คุณจะมีตัวเลขของคุณเองภายในไม่กี่นาทีหลังจากการสลับ ดาวน์โหลด Apidog เพื่อตั้งค่า

ปุ่ม

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API