Gemini 4 Argon은 GPT-6 Astra, Claude Opus 5.5 및 Claude Fable 5.1에 비해 Google의 벤치마크 표 19개 행 중 13개에서 선두를 차지했지만, 어떤 점수보다 중요한 한 가지 사실은 오늘 Astra와 Opus 5.5를 구매할 수 있지만 Argon은 구매할 수 없다는 것입니다. Google의 새로운 프론티어 모델은 현재 Fairwind 프로그램 방어자에게만 제공되며, 소개 기간 동안 백만 토큰당 $2/$10, 그 이후에는 $4/$20이며, 이는 Opus 5.5와 정확히 동일한 비용입니다.
이 비교는 가격 및 제한 측면에서 네 가지 모델을 나열하고, 각 모델이 우세한 벤치마크 행을 그룹화하며, 숫자가 서로 비교할 수 없는 이유를 설명하고, 라우팅 가이드와 Apidog에서 자신의 프롬프트로 세 가지 모두를 테스트하는 방법으로 마무리합니다. Argon이 처음이신가요? Gemini 4 Argon이란 무엇인가로 시작하세요. 시기에 대해서는 Argon 출시일 가이드를 참조하세요.
가격 및 제한 비교
Google의 표에는 Claude Fable 5.1이 포함되어 있으므로 해당 모델도 한 열을 차지합니다. 가격은 백만 토큰당이며, 각 공급업체의 자체 페이지(Google의 출시 게시물, OpenAI의 GPT-6 Astra 모델 페이지, Anthropic의 가격 페이지)에서 가져왔습니다.
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| 오늘 사용할 수 있나요? | 아니요, Fairwind 전용 | 예 | 예 | 예 |
| API 모델 ID | 미공개 | gpt-6-astra |
claude-opus-5-5 |
claude-fable-5-1 |
| 입력 | 소개 $2, 이후 $4 | $10 | $4 | $10 |
| 캐시된 입력 | 소개 $0.10, 이후 $0.20 | $1 | $0.20 | $0.25 |
| 출력 | 소개 $10, 이후 $20 | $50 | $20 | $50 |
| 최대 출력 | 1M (Google 명시 제한) | 128K | 128K (Batch에서 300K, 베타) | 128K |
| 컨텍스트 창 | 미공개 | 1,050,000 (최대 입력 922K) | 1M | 1M |
| 긴 프롬프트 할증료 | 명시되지 않음 | 272K 입력 초과: 전체 요청에 대해 입력 및 캐시 2배, 출력 1.5배 | 없음 | 없음 |
세 가지가 눈에 뜁니다. Argon의 표준 가격은 입력, 캐시된 입력 및 출력에서 Opus 5.5와 일치하므로, Anthropic에 대한 가격 우위는 소개 기간 동안만 지속되며, Google은 그 기간을 명시하지 않았습니다. Astra와 Fable 5.1은 Argon의 표준 입출력 요금의 2.5배, 소개 요금의 5배에 해당합니다. 1M 출력 수치는 Google의 것입니다. Vals AI는 테스트한 Argon 구성에 대해 최대 262K 출력을 나열합니다. 요청당 비용 계산에 대해서는 Gemini 4 Argon 가격 책정을 참조하세요.
Google 표에서 각 모델이 선두를 차지하는 부분
수치에 앞서: 이것은 Google의 표입니다. Argon의 점수는 Google이 보고한 것으로, 일부는 자체 계산한 것이고 일부는 리더보드에서 가져온 것입니다. 경쟁 모델 점수는 대부분 공급업체 자체 수치 또는 공용 리더보드 결과이며, 가능한 경우 최대 추론 설정을 기준으로 합니다. 하네스가 다르므로 작은 차이는 노이즈로 간주하십시오.
| 선두 모델 | 벤치마크 | Argon | Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Argon: 지식 작업 | Vals 인덱스 | 68.9% | 63.1% | 65.8% | 67.0% |
| Argon: 지식 작업 | AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| Argon: 지식 작업 | Harvey의 법률 에이전트 벤치마크 | 19.6% | 5.4% | 6.7% | 3.8% |
| Argon: 코딩 | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| Argon: 긴 컨텍스트 | GraphWalks 256K ~ 1M (F1) | 84.2% | 71.8% | 65.0% | 66.8% |
| Argon: 멀티모달 | LV벤치 | 91.7% | 87.5% | 79.7% | 83.7% |
| Argon: 멀티모달 | 차트 작성 | 71.6% | 71.0% | 46.2% | 66.3% |
| Astra | FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| Astra | 터미널 벤치 과학 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| Astra | OSWorld-2.0 (오프라인, 부분) | 69.2% | 72.6% | 보고되지 않음 | 보고되지 않음 |
| Opus 5.5 | 터미널 벤치 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| Opus 5.5 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| 동점 | CWE-벤치 v1 | 68.0% | 68.0% | 58.0% | 67.0% |
Argon의 다른 확실한 승리는 Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, 최대 128K GraphWalks 및 Agent’s Last Exam입니다. Fable 5.1은 어떤 행에서도 선두를 차지하지 못했습니다. CWE-bench v1에서 DeepMind의 사이버 리더보드는 Argon, Astra, Grok 4.7이 68%로 삼파전 무승부를 기록했고, Opus 5.5는 67%를 기록했습니다.
Gemini 4 Argon 대 Fable 5.1에서 Argon은 두 모델 모두 점수를 보고한 17개 행 중 15개에서 더 높은 점수를 기록했습니다. Fable은 FrontierSWE v2 (56.3% 대 55.0%) 및 Terminal-bench 4.0 (57.9% 대 57.4%)에서만 근소하게 앞섰습니다. Anthropic의 자체 수치는 Claude Fable 5.1 벤치마크 게시물에 있으며, 전체 19개 행 표는 Gemini 4 Argon 벤치마크에 있습니다.
격차를 신뢰하기 전에 세 가지 주의사항
경쟁사 수치는 Google의 실행 결과가 아닙니다. Google의 방법론에 따르면 비-Gemini 모델의 결과는 "별도로 언급되지 않는 한 공급업체의 자체 보고 수치에서 가져온 것"이며, 여러 행은 Vals AI, Proximal 및 Surge가 운영하는 공개 리더보드에서 가져온 것입니다.
하네스가 다릅니다. DeepSWE v1.1에서 Google은 미니-swe-agent 하네스를 사용하여 Argon의 77.9%를 자체 계산했으며, Astra의 점수는 공개 리더보드에서 가져왔고 Anthropic 점수는 시스템 카드에서 가져왔습니다. LVBench에서 Gemini는 초당 1프레임으로 비디오를 샘플링했으며, Astra는 800프레임, Opus 5.5는 600프레임, Fable 5.1은 300프레임을 얻었는데, 이는 "API 제한 때문"입니다.
동일한 모델이 차트마다 다른 점수를 기록합니다. Opus 5.5의 Terminal-bench 4.0 수치는 하네스 및 노력 설정에 따라 차트마다 다릅니다. Anthropic은 xhigh 노력에서 66.4%를 보고합니다. 따라서 한 표에 여러 출처를 혼합하지 마십시오.
제3자 평가자의 의견
독립적인 리더보드는 격차를 줄입니다. Artificial Analysis는 Argon을 223개 중 8위로 나열하지만, 이 목록은 각 추론 설정을 별도로 계산합니다. 개별 모델 기준으로 Argon(53점)은 GPT-6 Astra 및 Claude Fable 5.1과 동점이며, Claude Opus 5.5(최대 58점) 및 Claude Sonnet 5.5(56점) 뒤에 있습니다. AA는 또한 AA-Omniscience에서 Argon의 환각률을 15%로, Astra의 최대 설정 시 51%와 비교하여 나열합니다.
Arena에서 Argon은 4,942표 중 예비 1525점으로 텍스트 부문 1위를 차지했으며, Opus 5.5는 4위였습니다. Vals AI는 Vals 인덱스에서 41개 모델 중 1위를 차지했으며, 이는 이 인덱스에서 1위를 차지한 최초의 Gemini 모델입니다.
Google 내부의 모든 사람이 납득하는 것은 아닙니다. 블룸버그는 보도했습니다. 접근 권한이 있는 일부 직원들은 Argon이 벤치마크에 비해 일부 코딩 및 프론트엔드 디자인 작업에서 기대에 미치지 못한다고 말했으며, Google은 이러한 특징화를 부정확하다고 밝혔습니다.
어떤 모델로 라우팅할 것인가
2026년에는 단 하나의 최고의 프론티어 모델은 없습니다. 작업별로 라우팅하고, Argon이 출시될 날을 위해 Argon 열을 남겨두십시오.
| 작업 | 오늘 라우팅 | Argon 출시 시 |
|---|---|---|
| 법률, 금융 및 사무 자동화 에이전트 | Opus 5.5 (Vals 인덱스 67.0%) | Argon 테스트: 4가지 지식 작업 행 모두에서 선두 |
| 터미널 중심 코딩 에이전트 | Opus 5.5 (터미널 벤치 4.0 66.4%) | Opus 5.5 여전히 선두 |
| 에이전트 소프트웨어 엔지니어링 | Astra (FrontierSWE v2 65.5%) 또는 Opus 5.5 | Argon은 DeepSWE에서 선두지만 FrontierSWE에서 뒤쳐짐; 둘 다 테스트 |
| 컴퓨터 사용 및 GUI 에이전트 | Astra (OSWorld-2.0 72.6%) | Astra는 OSWorld에서 선두; Argon은 Agent’s Last Exam에서 선두 |
| 256K+ 토큰 프롬프트 추론 | Opus 5.5 (할증료 없음) 또는 Astra (272K 초과 할증료) | Argon (GraphWalks 256K ~ 1M 84.2%) |
| 비디오 및 차트 이해 | Astra (LV벤치 87.5%) | Argon (91.7%), 프레임 수 주의사항 있음 |
| 과학 및 ML 엔지니어링 | Astra (터미널 벤치 과학), Opus 5.5 (PostTrainBench) | Argon은 LABBench 2 및 RiemannBench에서 선두; 테스트 필요 |
| 128K 토큰 초과 단일 응답 | Batch의 Opus 5.5 (300K, 베타) | Argon, Google이 명시한 1M까지 |
| 대량, 비용 민감 작업 | Opus 5.5 ($4/$20) | 소개 기간 동안 Argon은 $2/$10 |
최고 점수보다 가격이 중요하다면, GPT-6 Sol 대 Claude Opus 5.5 비교에서 OpenAI의 더 저렴한 Sol 라인과 Opus를 비교합니다.
자신의 프롬프트로 세 가지 모두 비교
공급업체 표는 각 모델이 사용자 프롬프트를 어떻게 처리하는지 알려줄 수 없습니다. Apidog에서 작은 평가를 통해 이를 알 수 있으며, 오늘 바로 구축할 수 있습니다.
- 세 가지 요청으로 하나의 프로젝트를 만듭니다. GPT-6 Astra, Claude Opus 5.5, 그리고 모델 필드가
{{GEMINI_MODEL}}로 표시되는 Gemini 요청입니다. Google이 Argon의 ID를 게시할 때까지gemini-3.8-flash로 설정합니다. GPT-6 Astra API 가이드 및 Claude Opus 5.5란 무엇인가에서 각 공급업체의 요청 형식을 다룹니다. - 각 공급업체의 API 키를 환경 변수로 저장하고, 세 가지 요청 모두 동일한 입력을 받도록 프롬프트를 하나의 공유 변수에 넣습니다.
- 어설션을 추가합니다. 상태 200, 비어 있지 않은 답변, 상한선 내의 출력 토큰, 각 공급업체의 게시된 요금에 따라 예산 내에서 계산된 비용입니다.
- 세 가지를 하나의 테스트 시나리오로 실행하고 테스트 보고서에서 각 요청의 결과를 비교합니다.
비용 어설션은 간단한 산술 계산입니다. 20,000 입력 토큰과 4,000 출력 토큰을 사용하는 요청의 경우 Astra는 20,000 x $10/1M + 4,000 x $50/1M = $0.20 + $0.20 = $0.40의 비용이 듭니다. Opus 5.5는 $0.08 + $0.08 = $0.16의 비용이 듭니다. Argon은 소개 요금으로 $0.08, 표준 요금으로 $0.16의 비용이 듭니다. 하지만 토큰당 가격이 작업당 비용은 아닙니다. Artificial Analysis는 Argon이 작업당 약 62K 출력 토큰을, Astra가 최대 노력 시 약 27K를 기록했다고 측정했으므로, 자신의 프롬프트에서 출력 토큰을 측정해야 합니다.
Argon이 출시되면 GEMINI_MODEL을 변경하고 시나리오를 다시 실행하면, 지금 구매할 수 있는 두 모델과 동일한 프롬프트 비교를 할 수 있습니다.
자주 묻는 질문
Gemini 4 Argon이 GPT-6 Astra보다 좋나요? Artificial Analysis에서 두 모델은 53점으로 동점입니다. Google의 표에서는 Argon이 대부분의 행에서 더 높은 점수를 기록했지만, Astra는 FrontierSWE v2, Terminal-Bench Science 0.1 및 OSWorld-2.0에서 승리했으며, Astra는 오늘 사용할 수 있는 모델입니다.
Gemini 4 Argon 대 Claude Opus 5.5: 어떤 모델이 더 좋나요? Google의 표는 대부분의 행에서 Argon에 유리합니다. Opus 5.5는 Terminal-bench 4.0 및 PostTrainBench에서 승리했으며 Artificial Analysis에서 58대 53으로 앞섰습니다. 표준 요금으로는 비용이 동일합니다.
Gemini 4 Argon이 Claude Opus 5.5보다 저렴한가요? 소개 기간 동안에는 가격이 절반입니다 ($2/$10 대 $4/$20). 그 이후에는 정가가 동일하며, Google은 소개 기간이 언제 끝나는지 명시하지 않았습니다.
어떤 모델이 가장 큰 출력 제한을 가지고 있나요? Argon은 명시된 1M 토큰이지만, Vals AI는 테스트한 구성에 대해 262K를 나열합니다. 다른 모델들은 동기식 출력을 128K로 제한합니다. 저희의 1M 출력 토큰 가이드는 이것이 클라이언트에게 무엇을 의미하는지 다룹니다.
오늘 Gemini 4 Argon을 사용할 수 있나요? Google의 Fairwind 프로그램을 통해서만 가능하며, 검증된 사이버 방어 파트너를 대상으로 합니다. 유료 API 고객과 Google AI Ultra 구독자가 그 다음이지만, 날짜는 미정입니다.
작업 부하별 선택, 그 다음 테스트
Argon은 지식 작업, 긴 컨텍스트 및 멀티모달 행에서 가장 강력해 보입니다. Astra는 FrontierSWE, Terminal-Bench Science 및 OSWorld에서 강력하며, Opus 5.5는 터미널 작업 및 ML 엔지니어링에서 강력합니다. Argon이 소개 기간 이후 청구할 가격과 동일합니다. 지금 구매할 수 있는 두 모델을 기반으로 구축하고, Gemini 모델을 변수에 보관하며, Argon이 출시되는 날 시나리오를 다시 실행하세요. 하나의 프로젝트에서 세 가지 요청 비교를 설정하려면 Apidog를 다운로드하세요.
