제미니 4 아르곤 벤치마크: 19개 항목 분석, 구글 테스트 방식 및 5개 패배

제미니 4 아르곤 벤치마크: 누가 각 항목을 측정했는지 명시된 19개 모든 행, 뒤처지는 5개 항목, 구글의 방법론적 주의사항, 그리고 AA, Vals, Arena 점수.

INEZA Felin-Michel

INEZA Felin-Michel

2 October 2026

제미니 4 아르곤 벤치마크: 19개 항목 분석, 구글 테스트 방식 및 5개 패배

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

Gemini 4 Argon은 Google 출시 테이블의 19개 항목 중 13개에서 압도적으로 선두를 차지하고 있으며, 1개(CWE-bench v1, GPT-6 Astra와 공동)에서 동점을 기록했고, 5개 항목(FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 및 OSWorld-2.0)에서는 뒤처집니다. 문제는 접근성입니다. Argon은 현재 Fairwind 프로그램 수호자에게만 제공되므로, Google의 파트너 목록과 일부 벤치마크 기관 외에는 아직 이 수치를 재실험할 수 없습니다.

아래: 각 항목을 측정한 주체, 5가지 손실, 세부 사항, 사이버 점수, 타사 점수판, 그리고 접근 권한이 열리기 전에 Apidog에서 자신만의 평가를 구축하는 방법에 대한 전체 테이블입니다. 모델 개요는 Gemini 4 Argon이 무엇인지부터 시작하세요. 구매 결정은 Argon vs GPT-6 Astra vs Claude Opus 5.5를 참조하세요.

각 항목을 측정한 주체가 포함된 전체 테이블

이 자료는 출시 게시물과 "2026년 10월 기준 결과"라는 제목의 평가 방법론 PDF에서 가져온 Google 보고 결과입니다. Google은 19개 Argon 점수 중 10개를 자체적으로 계산했으며, 나머지 9개는 공개 리더보드에서 가져왔습니다. 경쟁사 수치는 해당 리더보드, Google 자체 실행 결과 또는 공급업체의 시스템 카드 및 블로그 게시물에서 가져왔으며, 각 항목마다 사용된 도구가 다릅니다. 굵은 글씨는 항목 선두 주자를 나타냅니다.

벤치마크 Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 측정 주체
Vals Index 68.9% 63.1% 65.8% 67.0% Vals AI
AutomationBench 51.3% 41.4% 31.4% 42.5% Zapier 리더보드 (비공개 세트)
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6% Vals AI
Harvey Legal Agent 19.6% 5.4% 6.7% 3.8% Vals AI
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2% Argon 자체 계산; Astra 리더보드; Anthropic 시스템 카드
FrontierSWE v2 55.0% 65.5% 56.3% 62.3% Proximal 리더보드
Vibe Code Bench 91.9% 89.6% 90.3% 90.3% Vals AI
Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4% Argon 자체 계산; 경쟁사 리더보드
PostTrainBench 45.3% 44.3% 40.2% 49.3% 모든 모델에 대해 자체 계산
Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3% Argon 자체 계산; 경쟁사 리더보드
LABBench 2 88.8% 85.4% 68.6% 73.1% 모든 모델에 대해 자체 계산
RiemannBench 76.0% 72.0% 65.6% 69.6% Surge 리더보드
GraphWalks up to 128K 99.7% 98.7% 91.4% 90.6% 모든 모델에 대해 자체 계산
GraphWalks 256K to 1M 84.2% 71.8% 65.0% 66.8% 모든 모델에 대해 자체 계산
Agent’s Last Exam 39.5% 34.2% n/r 38.2% Argon 자체 계산; 경쟁사 리더보드
OSWorld-2.0 (offline) 69.2% 72.6% n/r n/r Argon 자체 계산; OpenAI 블로그 게시물에서 Astra
Chartography 71.6% 71.0% 46.2% 66.3% Surge 리더보드
LVBench 91.7% 87.5% 79.7% 83.7% 모든 모델에 대해 자체 계산
CWE-bench v1 68.0% 68.0% 58.0% 67.0% 공개 리더보드

n/r = 보고되지 않음. Google 테이블에 없는 Grok 4.7도 CWE-bench 리더보드에서 68%를 기록하여 3자 동점입니다.

출처별로 정렬하면, 9개 항목은 모든 모델에 대한 공개 리더보드(Vals AI, Zapier, Proximal, Surge 및 CWE-bench)에서 가져왔습니다. Argon은 이 9개 중 7개에서 선두를 차지하고 1개에서 동점을 기록했습니다. Google은 4개 모델 모두에 대해 5개 항목을 자체적으로 실행했으며, Argon은 4개에서 선두를 차지했습니다. 나머지 5개 항목은 Google이 실행한 Argon 점수와 다른 곳에서 가져온 경쟁사 수치를 짝지었는데, 이 부분이 Argon이 가장 많이 패배하는 지점입니다. 5개 패배 중 3개가 이러한 혼합 항목에 있습니다. 자체 계산이 Argon을 좋게 보이게 했다면, 그 반대를 예상했을 것입니다.

Argon이 뒤처지는 부분과 그것이 에이전트 코딩에 중요한 이유

에이전트 코딩은 2승 2패로 나뉩니다. Argon은 DeepSWE v1.1과 Vibe Code Bench에서 승리한 후 FrontierSWE v2와 Terminal-bench 4.0에서 꼴찌를 기록했습니다. DeepSWE의 승리는 다양한 도구를 사용했습니다. Argon은 미니-SWE 에이전트 도구로 실행되었고, Astra의 수치는 공개 리더보드에서 가져왔으며, Claude 수치는 시스템 카드에서 가져왔습니다. Vibe Code Bench는 Vals AI가 4개 모두를 평가했기 때문에 더 명확하지만, 차이는 1.6점입니다.

작업량이 터미널 중심 에이전트 또는 긴 리포지토리 작업인 경우, 헤드라인 수치보다 해당 두 꼴찌 항목을 고려하세요. Astra는 FrontierSWE에서 선두를 유지하고 있습니다. 저희 GPT-6 Astra 실습에서는 오늘날 해당 모델이 어떻게 사용되는지 보여줍니다. Anthropic 측에서는 Claude Fable 5.1 벤치마크 분석이 Fable 자체의 출시 수치를 다룹니다.

블룸버그는 접근 권한이 있는 익명의 Google 직원이 Argon이 벤치마크 점수에 비해 일부 코딩 및 프론트엔드 디자인 작업에서 기대에 미치지 못한다고 말했다고 보도했습니다. Google은 이러한 특성화가 부정확하다고 말했습니다.

테이블 해석 방식을 변경하는 방법론적 주의 사항

DeepMind 사이버 페이지의 사이버 항목

DeepMind 사이버 페이지는 출시 테이블 외에 4가지 점수를 추가합니다.

사이버 평가 Gemini 4 Argon 비교
실제 취약점 발견 85.8% Gemini 3.8 Flash Cyber 71.0%
Wiz 침투 테스트 벤치마크 70.9% Gemini 3.8 Flash Cyber 58.2%
Gray Swan IPI 공격 성공 (k=15, 낮을수록 좋음) 0.7% 차트에서 가장 낮음; Kimi K3가 52.7%로 가장 높음
CWE-bench v1 68% Grok 4.7 및 GPT-6 Astra와 3자 동점; Opus 5.5는 67%

취약점 평가는 소스 접근 권한이 있는 "사이버 전문이 아닌" 내부 Antigravity 도구를 사용했습니다. Wiz 테스트는 모델에게 "실행 중인 웹사이트와 그 공개 동작에만 접근 권한을 부여하며, 애플리케이션 소스 코드 없이" 진행됩니다. 두 헤드라인 비교는 경쟁사가 아닌 Google의 이전 사이버 모델에 대한 것입니다. 저희 Argon 사이버 방어 설명은 이러한 것들이 실행하는 API에 어떤 의미를 갖는지 다룹니다.

타사 점수판

이 기관들은 출시 몇 분 만에 점수를 게시했으므로, 사전 출시 접근 권한이 있었습니다.

언론에서 12, 13, 14승을 보도하는 이유

언론은 세 가지 다른 승리 횟수를 인쇄했습니다. Google의 19개 항목에 대한 재집계는 다음과 같습니다.

비교 대상 Argon 승리 동점 Argon 패배 보고되지 않음
세 경쟁사 모두 중 최고 13 1 5 0
GPT-6 Astra만 14 1 4 0
Claude Opus 5.5만 14 0 4 1
Claude Fable 5.1만 15 0 2 2

13승은 전체 분야에서 올바른 수치입니다. 14승은 Astra 또는 Opus 5.5와의 일대일 대결에서 올바른 수치입니다. 12승은 전체 19개 항목에 대한 이러한 프레이밍 중 어느 것과도 일치하지 않으므로, 해당 출처가 어떤 항목을 계산했는지 확인하세요. 점수 차이도 다양합니다. Harvey Legal Agent (6.7% 대비 19.6%)는 큰 차이를 보였고, Chartography는 0.6점 차이입니다.

접근 권한이 열리는 날 자신만의 평가를 실행하는 방법

벤치마크는 Google의 도구를 설명하고, 당신의 프롬프트는 당신의 제품을 설명합니다. 오늘 호출할 수 있는 모델에서 평가를 구축한 다음, 한 가지 변경 사항으로 Argon을 가리키도록 하세요.

  1. 당신이 중요하게 생각하는 항목과 일치하는 실제 프롬프트를 선택하세요: 저장소 수정, 터미널 작업, 긴 문서 질문 등.
  2. Apidog에서 GEMINI_API_KEY와 GEMINI_MODEL이 gemini-3.8-flash로 설정된 환경을 생성하세요. Google은 Argon의 모델 ID를 아직 게시하지 않았으므로, 이 변수가 변경할 유일한 값입니다.
  3. 각 프롬프트를 {{GEMINI_MODEL}}에서 모델을 읽는 요청으로 저장하고, 테스트 시나리오로 그룹화하세요.
  4. 출력(상태, 필수 필드, 예상 콘텐츠)과 usageMetadata에 대한 어설션을 추가하고, 비용 상한에 맞춰 thoughtsTokenCount에 대한 상한을 포함하세요.
  5. 지금 3.8 Flash에서 시나리오를 실행하고 보고서를 기준선으로 유지하세요.

Argon의 ID가 출시되는 날, 변수를 교체하고 다시 실행하세요. Google은 "모든 새로운 모델"이 Interactions API에서 출시될 것이라고 말했으므로, 각 요청의 Interactions 버전도 저장하세요. 저희 Argon vs Gemini 3.8 Flash 비교는 가격 및 제한 사항에 대해 예상할 수 있는 내용을 다룹니다.

자주 묻는 질문 (FAQ)

다음 단계

지금 시나리오를 구축하고 3.8 Flash에서 실행한 다음 보고서를 보관하세요. Argon이 공개되면 교체 후 몇 분 안에 자신만의 수치를 얻을 수 있습니다. 설정하려면 Apidog를 다운로드하세요.

button

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요