Gemini 4 Argon นำตารางเปรียบเทียบของ Google ใน 13 จาก 19 แถว เมื่อเทียบกับ GPT-6 Astra, Claude Opus 5.5 และ Claude Fable 5.1 แต่มีข้อเท็จจริงหนึ่งที่สำคัญกว่าคะแนนใดๆ: คุณสามารถซื้อ Astra และ Opus 5.5 ได้ในวันนี้ แต่คุณยังไม่สามารถซื้อ Argon ได้ โมเดลใหม่ล่าสุดของ Google มีให้ใช้งานในวันนี้เฉพาะผู้เข้าร่วมโครงการ Fairwind Program เท่านั้น โดยมีราคา $2/$10 ต่อล้านโทเค็นในช่วงแนะนำ และ $4/$20 หลังจากนั้น ซึ่งเป็นราคาเดียวกับ Opus 5.5
การเปรียบเทียบนี้จัดเรียงโมเดลทั้งสี่ตามราคาและข้อจำกัด จัดกลุ่มแถวเกณฑ์มาตรฐานตามว่าโมเดลใดชนะ อธิบายว่าทำไมตัวเลขถึงไม่สามารถเปรียบเทียบกันได้โดยตรง และปิดท้ายด้วยคู่มือการกำหนดเส้นทางและวิธีการทดสอบทั้งสามโมเดลด้วยข้อความแจ้งเตือนของคุณเองใน Apidog หากคุณเพิ่งเริ่มใช้ Argon? เริ่มต้นด้วย Gemini 4 Argon คืออะไร; สำหรับกำหนดเวลา ดู คู่มือกำหนดวันวางจำหน่าย Argon
ราคาและข้อจำกัดเคียงข้างกัน
ตารางของ Google รวมถึง Claude Fable 5.1 ดังนั้นจึงมีคอลัมน์สำหรับโมเดลนี้ด้วย ราคาต่อ 1 ล้านโทเค็น จากหน้าเว็บของผู้ให้บริการแต่ละราย: โพสต์เปิดตัว ของ Google, หน้าโมเดล GPT-6 Astra ของ OpenAI และ หน้าการกำหนดราคา ของ Anthropic
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| วันนี้คุณสามารถเรียกใช้ได้หรือไม่? | ไม่, เฉพาะ Fairwind | ใช่ | ใช่ | ใช่ |
| รหัสโมเดล API | ยังไม่เผยแพร่ | gpt-6-astra |
claude-opus-5-5 |
claude-fable-5-1 |
| อินพุต | $2 ช่วงแนะนำ, จากนั้น $4 | $10 | $4 | $10 |
| แคชอินพุต | $0.10 ช่วงแนะนำ, จากนั้น $0.20 | $1 | $0.20 | $0.25 |
| เอาต์พุต | $10 ช่วงแนะนำ, จากนั้น $20 | $50 | $20 | $50 |
| เอาต์พุตสูงสุด | 1 ล้าน (ขีดจำกัดที่ Google ระบุ) | 128K | 128K (300K สำหรับ Batch, รุ่นเบต้า) | 128K |
| หน้าต่างบริบท | ยังไม่เผยแพร่ | 1,050,000 (อินพุตสูงสุด 922K) | 1 ล้าน | 1 ล้าน |
| ค่าธรรมเนียมสำหรับพรอมต์ยาว | ไม่ได้ระบุ | อินพุตเกิน 272K: อินพุตและแคช 2 เท่า, เอาต์พุต 1.5 เท่า, สำหรับคำขอทั้งหมด | ไม่มี | ไม่มี |
มีสามสิ่งโดดเด่น ราคามาตรฐานของ Argon เท่ากับ Opus 5.5 ในด้านอินพุต, แคชอินพุต และเอาต์พุต ดังนั้นความได้เปรียบด้านราคาเหนือ Anthropic จะคงอยู่ตราบเท่าที่ช่วงแนะนำยังไม่สิ้นสุด และ Google ยังไม่ได้ระบุวันที่สิ้นสุด Astra และ Fable 5.1 มีราคาที่ 2.5 เท่าของอัตราอินพุตและเอาต์พุตมาตรฐานของ Argon และ 5 เท่าของอัตราช่วงแนะนำ และตัวเลขเอาต์พุต 1 ล้านเป็นของ Google: Vals AI ระบุเอาต์พุตสูงสุด 262K สำหรับการกำหนดค่า Argon ที่ทดสอบ สำหรับการคำนวณต้นทุนต่อคำขอ ดูที่ ราคา Gemini 4 Argon
โมเดลใดนำในตารางของ Google
ก่อนที่จะดูตัวเลข: นี่คือตารางของ Google คะแนนของ Argon รายงานโดย Google ซึ่งบางส่วนคำนวณเองและบางส่วนมาจากกระดานผู้นำ; คะแนนของคู่แข่งส่วนใหญ่เป็นตัวเลขที่ผู้ให้บริการรายงานเองหรือผลลัพธ์จากกระดานผู้นำสาธารณะ โดยใช้การตั้งค่าการให้เหตุผลสูงสุดหากมี ชุดการทดสอบแตกต่างกัน ดังนั้นให้พิจารณาความแตกต่างเล็กน้อยว่าเป็นเพียง "สัญญาณรบกวน"
| ผู้นำ | เกณฑ์มาตรฐาน | Argon | Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Argon: งานความรู้ | Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| Argon: งานความรู้ | AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| Argon: งานความรู้ | เกณฑ์มาตรฐานตัวแทนทางกฎหมายของ Harvey | 19.6% | 5.4% | 6.7% | 3.8% |
| Argon: การเขียนโค้ด | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| Argon: บริบทขนาดยาว | GraphWalks 256K ถึง 1M (F1) | 84.2% | 71.8% | 65.0% | 66.8% |
| Argon: มัลติโมเดล | LVBench | 91.7% | 87.5% | 79.7% | 83.7% |
| Argon: มัลติโมเดล | Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
| Astra | FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| Astra | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| Astra | OSWorld-2.0 (ออฟไลน์, บางส่วน) | 69.2% | 72.6% | ไม่ได้รายงาน | ไม่ได้รายงาน |
| Opus 5.5 | Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| Opus 5.5 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| เสมอ | CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
ชัยชนะที่เด็ดขาดอื่นๆ ของ Argon ได้แก่ Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks สูงสุด 128K และ Agent’s Last Exam Fable 5.1 ไม่นำในแถวใดเลย สำหรับ CWE-bench v1 กระดานผู้นำด้านไซเบอร์ ของ DeepMind แสดงผลเสมอกันสามทางที่ 68% ระหว่าง Argon, Astra และ Grok 4.7 โดยมี Opus 5.5 ที่ 67%
ในการเปรียบเทียบ Gemini 4 Argon กับ Fable 5.1, Argon ได้คะแนนสูงกว่าใน 15 จาก 17 แถวที่ทั้งคู่รายงานตัวเลข; Fable ชนะเพียงเล็กน้อยใน FrontierSWE v2 (56.3% เทียบกับ 55.0%) และ Terminal-bench 4.0 (57.9% เทียบกับ 57.4%) ตัวเลขของ Anthropic เองอยู่ใน โพสต์เกณฑ์มาตรฐาน Claude Fable 5.1 ของเรา และตาราง 19 แถวฉบับเต็มอยู่ใน เกณฑ์มาตรฐาน Gemini 4 Argon
สามข้อควรระวังก่อนที่คุณจะเชื่อในความแตกต่าง
ตัวเลขของคู่แข่งไม่ใช่ผลการทดสอบของ Google. วิธีการ ของ Google ระบุว่าผลลัพธ์สำหรับโมเดลที่ไม่ใช่ Gemini “มาจากตัวเลขที่ผู้ให้บริการรายงานเอง เว้นแต่จะระบุไว้เป็นอย่างอื่น” และหลายแถวมาจากกระดานผู้นำสาธารณะที่ดำเนินการโดย Vals AI, Proximal และ Surge
ชุดการทดสอบแตกต่างกัน. สำหรับ DeepSWE v1.1, Google คำนวณคะแนน 77.9% ของ Argon ด้วยชุดการทดสอบ mini-swe-agent ในขณะที่คะแนนของ Astra มาจากกระดานผู้นำสาธารณะ และคะแนนของ Anthropic มาจาก system cards สำหรับ LVBench, Gemini สุ่มตัวอย่างวิดีโอที่ 1 เฟรมต่อวินาที ในขณะที่ Astra ได้ 800 เฟรม, Opus 5.5 ได้ 600 เฟรม และ Fable 5.1 ได้ 300 เฟรม “เนื่องจากข้อจำกัดของ API”
โมเดลเดียวกันได้คะแนนต่างกันในแต่ละแผนภูมิ. ตัวเลข Terminal-bench 4.0 ของ Opus 5.5 แตกต่างกันไปในแต่ละแผนภูมิ ขึ้นอยู่กับชุดการทดสอบและการตั้งค่าความพยายาม; Anthropic รายงาน ว่าได้ 66.4% ที่ความพยายามระดับ xhigh ดังนั้นอย่ารวมแหล่งที่มาต่างกันในตารางเดียว
สิ่งที่ผู้ประเมินภายนอกกล่าวถึง
กระดานผู้นำอิสระช่วยลดความแตกต่าง Artificial Analysis จัดอันดับ Argon ที่อันดับ 8 จาก 223 แต่รายการนั้นนับการตั้งค่าการให้เหตุผลแต่ละรายการแยกกัน เมื่อพิจารณาจากโมเดลที่แตกต่างกัน Argon (53) เสมอกับ GPT-6 Astra และ Claude Fable 5.1 และตามหลัง Claude Opus 5.5 (58 ที่ค่าสูงสุด) และ Claude Sonnet 5.5 (56) AA ยังระบุอัตราการหลอนของ Argon บน AA-Omniscience ที่ 15% เทียบกับ 51% สำหรับ Astra ที่การตั้งค่าสูงสุด
บน Arena, Argon จัดอยู่อันดับหนึ่งในด้าน Text ที่ 1525 โดยมีสถานะเป็น Preliminary จาก 4,942 คะแนนโหวต โดย Opus 5.5 อยู่ในอันดับที่สี่ Vals AI จัดอันดับให้เป็นอันดับหนึ่งจาก 41 โมเดลใน Vals Index ซึ่งเป็นโมเดล Gemini ตัวแรกที่ขึ้นนำ
ไม่ใช่ทุกคนใน Google ที่เชื่อมั่น: Bloomberg รายงาน ว่าพนักงานบางคนที่มีสิทธิ์เข้าถึงกล่าวว่า Argon ทำงานได้ไม่น่าประทับใจในบางงานด้านการเขียนโค้ดและการออกแบบส่วนหน้าเมื่อเทียบกับเกณฑ์มาตรฐาน ซึ่ง Google เรียกการอธิบายนี้ว่าไม่ถูกต้อง
ควรเลือกใช้โมเดลใด
ไม่มีโมเดลล้ำสมัยที่ดีที่สุดเพียงรุ่นเดียวในปี 2026 กำหนดเส้นทางตามงาน และเก็บคอลัมน์ Argon ไว้สำหรับวันที่โมเดลพร้อมใช้งาน:
| งาน | เส้นทางวันนี้ | เมื่อ Argon พร้อมใช้งาน |
|---|---|---|
| ตัวแทนด้านกฎหมาย, การเงิน และระบบอัตโนมัติในสำนักงาน | Opus 5.5 (Vals Index 67.0%) | ทดสอบ Argon: มันนำในสี่แถวของงานความรู้ทั้งหมด |
| ตัวแทนการเขียนโค้ดที่เน้นเทอร์มินัล | Opus 5.5 (Terminal-bench 4.0 66.4%) | Opus 5.5 ยังคงนำ |
| วิศวกรรมซอฟต์แวร์แบบตัวแทน | Astra (FrontierSWE v2 65.5%) หรือ Opus 5.5 | Argon นำ DeepSWE แต่ตามหลัง FrontierSWE; ทดสอบทั้งคู่ |
| ตัวแทนการใช้งานคอมพิวเตอร์และ GUI | Astra (OSWorld-2.0 72.6%) | Astra นำ OSWorld; Argon นำ Agent’s Last Exam |
| การให้เหตุผลด้วยพรอมต์ที่มีโทเค็นมากกว่า 256K | Opus 5.5 (ไม่มีค่าธรรมเนียม) หรือ Astra (ค่าธรรมเนียมสำหรับเกิน 272K) | Argon (GraphWalks 256K ถึง 1M 84.2%) |
| ความเข้าใจวิดีโอและแผนภูมิ | Astra (LVBench 87.5%) | Argon (91.7%), โดยมีข้อควรระวังเรื่องจำนวนเฟรม |
| วิทยาศาสตร์และวิศวกรรม ML | Astra (Terminal-Bench Science), Opus 5.5 (PostTrainBench) | Argon นำ LABBench 2 และ RiemannBench; ทดสอบดู |
| การตอบสนองเดี่ยวที่เกิน 128K โทเค็น | Opus 5.5 บน Batch (300K, รุ่นเบต้า) | Argon, สูงสุด 1 ล้านที่ Google ระบุ |
| งานปริมาณมากที่ไวต่อต้นทุน | Opus 5.5 ($4/$20) | Argon ที่ $2/$10 ตราบเท่าที่ช่วงแนะนำยังอยู่ |
หากราคาสําคัญกว่าคะแนนสูงสุด การเปรียบเทียบ GPT-6 Sol เทียบกับ Claude Opus 5.5 ของเราจะครอบคลุมโมเดล Sol ที่ราคาถูกกว่าของ OpenAI เทียบกับ Opus
เปรียบเทียบทั้งสามด้วยข้อความแจ้งเตือนของคุณเอง
ตารางของผู้ขายไม่สามารถบอกคุณได้ว่าแต่ละโมเดลจัดการข้อความแจ้งเตือนของคุณอย่างไร การประเมินขนาดเล็กใน Apidog สามารถทำได้ และคุณสามารถสร้างได้ในวันนี้
- สร้างหนึ่งโปรเจกต์พร้อมสามคำขอ: GPT-6 Astra, Claude Opus 5.5 และคำขอ Gemini ที่ช่องโมเดลอ่านว่า
{{GEMINI_MODEL}}โดยตั้งค่าเป็นgemini-3.8-flashจนกว่า Google จะเผยแพร่ ID ของ Argon คู่มือ API ของ GPT-6 Astra และ Claude Opus 5.5 คืออะไร ของเราครอบคลุมรูปแบบคำขอของผู้ให้บริการแต่ละราย - จัดเก็บคีย์ API ของผู้ให้บริการแต่ละรายเป็นตัวแปรสภาพแวดล้อม และใส่พรอมต์ในตัวแปรที่ใช้ร่วมกันหนึ่งตัว เพื่อให้คำขอทั้งสามได้รับอินพุตที่เหมือนกัน
- เพิ่มการยืนยัน: สถานะ 200, คำตอบที่ไม่ว่างเปล่า, โทเค็นเอาต์พุตภายใต้ขีดจำกัด, และต้นทุนที่คำนวณแล้วภายใต้งบประมาณของคุณตามอัตราที่ผู้ให้บริการแต่ละรายเผยแพร่
- เรียกใช้ทั้งสามรายการเป็นสถานการณ์การทดสอบเดียว และเปรียบเทียบผลลัพธ์ของแต่ละคำขอในรายงานการทดสอบ
การยืนยันต้นทุนเป็นการคำนวณทางคณิตศาสตร์ธรรมดา สำหรับคำขอที่มีอินพุต 20,000 และเอาต์พุต 4,000 โทเค็น Astra มีค่าใช้จ่าย 20,000 x $10/1M + 4,000 x $50/1M = $0.20 + $0.20 = $0.40 Opus 5.5 มีค่าใช้จ่าย $0.08 + $0.08 = $0.16 Argon จะมีค่าใช้จ่าย $0.08 ในช่วงอัตราแนะนำ และ $0.16 ในอัตรามาตรฐาน อย่างไรก็ตาม ราคาต่อโทเค็นไม่ใช่ต้นทุนต่อภารกิจ: Artificial Analysis วัด Argon ที่ประมาณ 62K โทเค็นเอาต์พุตต่อภารกิจ เทียบกับประมาณ 27K สำหรับ Astra ที่ความพยายามสูงสุด ดังนั้นจึงควรวัดโทเค็นเอาต์พุตจากพรอมต์ของคุณเอง
เมื่อ Argon พร้อมใช้งาน ให้เปลี่ยน GEMINI_MODEL เรียกใช้สถานการณ์อีกครั้ง แล้วคุณจะได้การเปรียบเทียบแบบใช้พรอมต์เดียวกันกับโมเดลสองรุ่นที่คุณสามารถซื้อได้ตอนนี้
คำถามที่พบบ่อย
Gemini 4 Argon ดีกว่า GPT-6 Astra หรือไม่? ทั้งคู่เสมอกันที่ 53 ใน Artificial Analysis ในตารางของ Google Argon ได้คะแนนสูงกว่าในแถวส่วนใหญ่ แต่ Astra ชนะ FrontierSWE v2, Terminal-Bench Science 0.1 และ OSWorld-2.0 และ Astra เป็นรุ่นที่คุณสามารถเรียกใช้ได้ในวันนี้
Gemini 4 Argon เทียบกับ Claude Opus 5.5: รุ่นไหนดีกว่า? ตารางของ Google ให้ความสำคัญกับ Argon ในแถวส่วนใหญ่; Opus 5.5 ชนะ Terminal-bench 4.0 และ PostTrainBench และนำ Artificial Analysis 58 ต่อ 53 ด้วยอัตรามาตรฐาน ราคาเท่ากัน
Gemini 4 Argon ถูกกว่า Claude Opus 5.5 หรือไม่? ในช่วงแนะนำ ราคาจะถูกกว่าครึ่งหนึ่ง ($2/$10 เทียบกับ $4/$20) หลังจากนั้น ราคาที่ระบุจะเท่ากัน และ Google ยังไม่ได้ระบุว่าช่วงแนะนำจะสิ้นสุดเมื่อใด
โมเดลใดมีขีดจำกัดเอาต์พุตสูงสุด? Argon ที่ระบุว่า 1 ล้านโทเค็น แม้ว่า Vals AI จะระบุ 262K สำหรับการกำหนดค่าที่ทดสอบ โมเดลอื่น ๆ จำกัดเอาต์พุตแบบ synchronous ไว้ที่ 128K คู่มือเอาต์พุต 1 ล้านโทเค็น ของเราครอบคลุมความหมายดังกล่าวสำหรับไคลเอ็นต์ของคุณ
ฉันสามารถใช้ Gemini 4 Argon ได้ในวันนี้หรือไม่? เฉพาะผ่านโครงการ Fairwind Program ของ Google สำหรับกลุ่มพันธมิตรด้านการป้องกันภัยไซเบอร์ที่ได้รับการตรวจสอบ ลูกค้า API แบบชำระเงินและผู้สมัครสมาชิก Google AI Ultra จะได้รับสิทธิ์ถัดไป แต่ยังไม่มีการระบุวันที่
เลือกตามปริมาณงาน จากนั้นทำการทดสอบ
Argon ดูแข็งแกร่งที่สุดในงานความรู้ บริบทขนาดยาว และแถวมัลติโมเดล; Astra ใน FrontierSWE, Terminal-Bench Science และ OSWorld; Opus 5.5 ในงานเทอร์มินัลและวิศวกรรม ML ในราคาที่ Argon จะเรียกเก็บหลังจากช่วงแนะนำ สร้างขึ้นบนสองโมเดลที่คุณสามารถซื้อได้ตอนนี้ เก็บโมเดล Gemini ไว้ในตัวแปร และเรียกใช้สถานการณ์ของคุณอีกครั้งในวันที่ Argon เปิดตัว หากต้องการตั้งค่าการเปรียบเทียบสามคำขอในโปรเจกต์เดียว ดาวน์โหลด Apidog
