Gemini 4 Argon은 Google 출시 테이블의 19개 항목 중 13개에서 압도적으로 선두를 차지하고 있으며, 1개(CWE-bench v1, GPT-6 Astra와 공동)에서 동점을 기록했고, 5개 항목(FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 및 OSWorld-2.0)에서는 뒤처집니다. 문제는 접근성입니다. Argon은 현재 Fairwind 프로그램 수호자에게만 제공되므로, Google의 파트너 목록과 일부 벤치마크 기관 외에는 아직 이 수치를 재실험할 수 없습니다.
아래: 각 항목을 측정한 주체, 5가지 손실, 세부 사항, 사이버 점수, 타사 점수판, 그리고 접근 권한이 열리기 전에 Apidog에서 자신만의 평가를 구축하는 방법에 대한 전체 테이블입니다. 모델 개요는 Gemini 4 Argon이 무엇인지부터 시작하세요. 구매 결정은 Argon vs GPT-6 Astra vs Claude Opus 5.5를 참조하세요.
각 항목을 측정한 주체가 포함된 전체 테이블
이 자료는 출시 게시물과 "2026년 10월 기준 결과"라는 제목의 평가 방법론 PDF에서 가져온 Google 보고 결과입니다. Google은 19개 Argon 점수 중 10개를 자체적으로 계산했으며, 나머지 9개는 공개 리더보드에서 가져왔습니다. 경쟁사 수치는 해당 리더보드, Google 자체 실행 결과 또는 공급업체의 시스템 카드 및 블로그 게시물에서 가져왔으며, 각 항목마다 사용된 도구가 다릅니다. 굵은 글씨는 항목 선두 주자를 나타냅니다.
| 벤치마크 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | 측정 주체 |
|---|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% | Vals AI |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | Zapier 리더보드 (비공개 세트) |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Vals AI |
| Harvey Legal Agent | 19.6% | 5.4% | 6.7% | 3.8% | Vals AI |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% | Argon 자체 계산; Astra 리더보드; Anthropic 시스템 카드 |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | Proximal 리더보드 |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | Vals AI |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | Argon 자체 계산; 경쟁사 리더보드 |
| PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% | 모든 모델에 대해 자체 계산 |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | Argon 자체 계산; 경쟁사 리더보드 |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | 모든 모델에 대해 자체 계산 |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | Surge 리더보드 |
| GraphWalks up to 128K | 99.7% | 98.7% | 91.4% | 90.6% | 모든 모델에 대해 자체 계산 |
| GraphWalks 256K to 1M | 84.2% | 71.8% | 65.0% | 66.8% | 모든 모델에 대해 자체 계산 |
| Agent’s Last Exam | 39.5% | 34.2% | n/r | 38.2% | Argon 자체 계산; 경쟁사 리더보드 |
| OSWorld-2.0 (offline) | 69.2% | 72.6% | n/r | n/r | Argon 자체 계산; OpenAI 블로그 게시물에서 Astra |
| Chartography | 71.6% | 71.0% | 46.2% | 66.3% | Surge 리더보드 |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | 모든 모델에 대해 자체 계산 |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% | 공개 리더보드 |
n/r = 보고되지 않음. Google 테이블에 없는 Grok 4.7도 CWE-bench 리더보드에서 68%를 기록하여 3자 동점입니다.
출처별로 정렬하면, 9개 항목은 모든 모델에 대한 공개 리더보드(Vals AI, Zapier, Proximal, Surge 및 CWE-bench)에서 가져왔습니다. Argon은 이 9개 중 7개에서 선두를 차지하고 1개에서 동점을 기록했습니다. Google은 4개 모델 모두에 대해 5개 항목을 자체적으로 실행했으며, Argon은 4개에서 선두를 차지했습니다. 나머지 5개 항목은 Google이 실행한 Argon 점수와 다른 곳에서 가져온 경쟁사 수치를 짝지었는데, 이 부분이 Argon이 가장 많이 패배하는 지점입니다. 5개 패배 중 3개가 이러한 혼합 항목에 있습니다. 자체 계산이 Argon을 좋게 보이게 했다면, 그 반대를 예상했을 것입니다.
Argon이 뒤처지는 부분과 그것이 에이전트 코딩에 중요한 이유
- FrontierSWE v2: Astra의 65.5%에 비해 55.0%. Argon은 모든 모델을 평가한 리더보드에서 Fable 5.1 (56.3%) 및 Opus 5.5 (62.3%)에 뒤처져 4개 중 꼴찌입니다.
- Terminal-bench 4.0: Opus 5.5의 66.4%에 비해 57.4%. Astra와 Fable 5.1이 1점 이내임에도 불구하고 또 다시 꼴찌입니다.
- PostTrainBench: Opus 5.5의 49.3%에 비해 45.3%. Google이 모든 모델에 대해 실행한 항목에서 2위입니다.
- Terminal-Bench Science 0.1: Astra의 68.1%에 비해 57.6%. Fable 5.1보다만 앞서 3위입니다. Google은 6배 검증자 시간 초과로 Argon의 시도를 실행했습니다.
- OSWorld-2.0 (오프라인 하위 세트): Astra의 72.6%에 비해 69.2%. Anthropic은 온라인 및 오프라인 점수만 합산하여 보고하므로 Claude 모델은 표시되지 않습니다.
에이전트 코딩은 2승 2패로 나뉩니다. Argon은 DeepSWE v1.1과 Vibe Code Bench에서 승리한 후 FrontierSWE v2와 Terminal-bench 4.0에서 꼴찌를 기록했습니다. DeepSWE의 승리는 다양한 도구를 사용했습니다. Argon은 미니-SWE 에이전트 도구로 실행되었고, Astra의 수치는 공개 리더보드에서 가져왔으며, Claude 수치는 시스템 카드에서 가져왔습니다. Vibe Code Bench는 Vals AI가 4개 모두를 평가했기 때문에 더 명확하지만, 차이는 1.6점입니다.
작업량이 터미널 중심 에이전트 또는 긴 리포지토리 작업인 경우, 헤드라인 수치보다 해당 두 꼴찌 항목을 고려하세요. Astra는 FrontierSWE에서 선두를 유지하고 있습니다. 저희 GPT-6 Astra 실습에서는 오늘날 해당 모델이 어떻게 사용되는지 보여줍니다. Anthropic 측에서는 Claude Fable 5.1 벤치마크 분석이 Fable 자체의 출시 수치를 다룹니다.
블룸버그는 접근 권한이 있는 익명의 Google 직원이 Argon이 벤치마크 점수에 비해 일부 코딩 및 프론트엔드 디자인 작업에서 기대에 미치지 못한다고 말했다고 보도했습니다. Google은 이러한 특성화가 부정확하다고 말했습니다.
테이블 해석 방식을 변경하는 방법론적 주의 사항
- 양측의 최대 노력. Argon은 "가장 높은 사고 설정을 가진 Gemini API"로 실행되었습니다. Astra, Fable 5.1 및 Opus 5.5의 경우 Google은 "사용 가능한 최대 사고/추론 설정"을 기본값으로 사용합니다. 이는 기본 동작이나 비용이 아닌 최고 성능을 비교합니다.
- LVBench 프레임. Google은 도구 없이 4개 모델 모두에 대해 LVBench를 직접 실행했습니다. Gemini는 1 FPS로 비디오를 샘플링했습니다. Astra는 800프레임, Fable 5.1은 300프레임, Opus 5.5는 600프레임을 "API 제한으로 인해" 받았습니다. 모델들은 동일한 입력을 보지 못했습니다.
- OSWorld 3회 중 최고. Argon의 점수는 "실행당 단일 시도로 3회 실행 중 최대값"으로, 평균이 아닌 최고 실행 점수입니다.
- Agent’s Last Exam 시간 창. Argon은 5시간 시간 창을 가진 ALE-Claw 도구로 실행되었습니다.
- 안전 필터 켜짐. Agent’s Last Exam 및 OSWorld는 안전 필터가 활성화된 상태로 실행되었으며, 플래그가 지정된 응답은 빈 문자열로 반환되었습니다. 오히려 이는 Argon에게 불리하게 작용합니다.
DeepMind 사이버 페이지의 사이버 항목
DeepMind 사이버 페이지는 출시 테이블 외에 4가지 점수를 추가합니다.
| 사이버 평가 | Gemini 4 Argon | 비교 |
|---|---|---|
| 실제 취약점 발견 | 85.8% | Gemini 3.8 Flash Cyber 71.0% |
| Wiz 침투 테스트 벤치마크 | 70.9% | Gemini 3.8 Flash Cyber 58.2% |
| Gray Swan IPI 공격 성공 (k=15, 낮을수록 좋음) | 0.7% | 차트에서 가장 낮음; Kimi K3가 52.7%로 가장 높음 |
| CWE-bench v1 | 68% | Grok 4.7 및 GPT-6 Astra와 3자 동점; Opus 5.5는 67% |
취약점 평가는 소스 접근 권한이 있는 "사이버 전문이 아닌" 내부 Antigravity 도구를 사용했습니다. Wiz 테스트는 모델에게 "실행 중인 웹사이트와 그 공개 동작에만 접근 권한을 부여하며, 애플리케이션 소스 코드 없이" 진행됩니다. 두 헤드라인 비교는 경쟁사가 아닌 Google의 이전 사이버 모델에 대한 것입니다. 저희 Argon 사이버 방어 설명은 이러한 것들이 실행하는 API에 어떤 의미를 갖는지 다룹니다.
타사 점수판
이 기관들은 출시 몇 분 만에 점수를 게시했으므로, 사전 출시 접근 권한이 있었습니다.
- Artificial Analysis는 Gemini 4 Argon (높음)을 지능 지수 53점으로 223개 중 8위에 올렸습니다. 이 순위는 각 추론 설정을 별도로 계산합니다. 개별 모델별로는 Argon이 Fable 5.1 및 GPT-6 Astra와 동률이며, Opus 5.5 (최대 58) 및 Sonnet 5.5 (최대 56)에 뒤처집니다. AA는 AA-Omniscience에서 15%의 환각률(Astra는 최대 51%), 63% 대비 50%의 정확도를 보고합니다. 이 지수 실행 비용은 작업당 $1.99이며, 작업당 약 62K 출력 토큰이 소요되고 Astra는 최대 약 27K입니다. Artificial Analysis는 속도 또는 지연 시간 데이터를 보여주지 않습니다.
- Vals AI는 Argon을 Vals 지수에서 68.90%로 41개 중 1위이자 최초의 Gemini 모델로 평가했으며, 테스트당 $15.68입니다. Vals AI는 테스트한 구성에 대해 Google이 명시한 1M보다 낮은 262K의 최대 출력을 기록했습니다.
- Arena는 Argon을 텍스트에서 1525점으로 1위로 평가했으며, 4,942표 중 예비로 표시되었고, WebDev에서는 8위입니다.
언론에서 12, 13, 14승을 보도하는 이유
언론은 세 가지 다른 승리 횟수를 인쇄했습니다. Google의 19개 항목에 대한 재집계는 다음과 같습니다.
| 비교 대상 | Argon 승리 | 동점 | Argon 패배 | 보고되지 않음 |
|---|---|---|---|---|
| 세 경쟁사 모두 중 최고 | 13 | 1 | 5 | 0 |
| GPT-6 Astra만 | 14 | 1 | 4 | 0 |
| Claude Opus 5.5만 | 14 | 0 | 4 | 1 |
| Claude Fable 5.1만 | 15 | 0 | 2 | 2 |
13승은 전체 분야에서 올바른 수치입니다. 14승은 Astra 또는 Opus 5.5와의 일대일 대결에서 올바른 수치입니다. 12승은 전체 19개 항목에 대한 이러한 프레이밍 중 어느 것과도 일치하지 않으므로, 해당 출처가 어떤 항목을 계산했는지 확인하세요. 점수 차이도 다양합니다. Harvey Legal Agent (6.7% 대비 19.6%)는 큰 차이를 보였고, Chartography는 0.6점 차이입니다.
접근 권한이 열리는 날 자신만의 평가를 실행하는 방법
벤치마크는 Google의 도구를 설명하고, 당신의 프롬프트는 당신의 제품을 설명합니다. 오늘 호출할 수 있는 모델에서 평가를 구축한 다음, 한 가지 변경 사항으로 Argon을 가리키도록 하세요.
- 당신이 중요하게 생각하는 항목과 일치하는 실제 프롬프트를 선택하세요: 저장소 수정, 터미널 작업, 긴 문서 질문 등.
- Apidog에서
GEMINI_API_KEY와GEMINI_MODEL이gemini-3.8-flash로 설정된 환경을 생성하세요. Google은 Argon의 모델 ID를 아직 게시하지 않았으므로, 이 변수가 변경할 유일한 값입니다. - 각 프롬프트를
{{GEMINI_MODEL}}에서 모델을 읽는 요청으로 저장하고, 테스트 시나리오로 그룹화하세요. - 출력(상태, 필수 필드, 예상 콘텐츠)과
usageMetadata에 대한 어설션을 추가하고, 비용 상한에 맞춰thoughtsTokenCount에 대한 상한을 포함하세요. - 지금 3.8 Flash에서 시나리오를 실행하고 보고서를 기준선으로 유지하세요.
Argon의 ID가 출시되는 날, 변수를 교체하고 다시 실행하세요. Google은 "모든 새로운 모델"이 Interactions API에서 출시될 것이라고 말했으므로, 각 요청의 Interactions 버전도 저장하세요. 저희 Argon vs Gemini 3.8 Flash 비교는 가격 및 제한 사항에 대해 예상할 수 있는 내용을 다룹니다.
자주 묻는 질문 (FAQ)
- Gemini 4 Argon의 벤치마크는 독립적으로 검증되었나요? 부분적으로 그렇습니다. 19개 항목 중 9개는 모든 모델에 대한 공개 리더보드에서 가져왔고, Artificial Analysis, Vals AI 및 Arena는 자체 결과를 게시했습니다. 나머지는 Argon에 대해 Google이 실행한 것입니다.
- Gemini 4 Argon의 DeepSWE 점수는 얼마인가요? DeepSWE v1.1에서 77.9%로 Opus 5.5 (74.2%) 및 Astra (74.1%)보다 앞섭니다. Argon의 실행은 미니-SWE 에이전트 도구를 사용했으며, 경쟁사 수치는 리더보드와 시스템 카드에서 가져왔습니다.
- Argon이 벤치마크에서 GPT-6 Astra를 이기나요? Google 테이블에서 일대일 비교 시 Argon은 14개 항목에서 승리하고 1개에서 동점, 4개에서 패배했습니다. Artificial Analysis에서는 53점으로 동점입니다.
- 이 벤치마크를 직접 다시 실행할 수 있나요? 아직은 안 됩니다. Argon은 Fairwind 파트너에게만 제한되며, Google은 공식 출시일을 발표하지 않았습니다. 저희 Argon 출시일 추적기는 출시 과정을 추적합니다.
다음 단계
지금 시나리오를 구축하고 3.8 Flash에서 실행한 다음 보고서를 보관하세요. Argon이 공개되면 교체 후 몇 분 안에 자신만의 수치를 얻을 수 있습니다. 설정하려면 Apidog를 다운로드하세요.
