제미니 4 아르곤 vs 제미니 3.8 플래시: 아르곤을 기다릴까, 지금 플래시를 선택할까?

제미니 4 아르곤 대 제미니 3.8 플래시: 가격, 출력 제한, 공유 벤치마크 및 단일 호출 비용. 지금 플래시로 배포할까요, 아니면 아르곤을 기다릴까요?

Medy Evrard

2 October 2026

제미니 4 아르곤 vs 제미니 3.8 플래시: 아르곤을 기다릴까, 지금 플래시를 선택할까?

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

Gemini 3.8 Flash는 오늘부터 사용 가능합니다. 2026년 12월 31일까지 100만 토큰당 입력 $0.75, 출력 $3.75로 책정된 무료 티어가 있는 안정적인 모델이며, 이후에는 $1.50 및 $7.50으로 변경되고 출력 상한선은 64K입니다. Gemini 4 Argon은 아직 아닙니다. Google의 출시 게시물에 따르면, 프로모션 기간(기간 미정) 동안에는 $2 및 $10이며, 이후에는 $4 및 $20로 가격이 책정됩니다. Google은 출력 제한이 1M 토큰이라고 밝혔으며, 현재로서는 Fairwind 프로그램 참여자에게만 제공됩니다. 이번 분기에 출시해야 한다면 Flash를 사용하여 출시하고, Argon은 설정 변경 한 번으로 전환할 수 있도록 준비하세요.

이 게시물에서는 두 모델의 사양, 두 출시 게시물에 공통으로 나타나는 벤치마크 항목, 사이버 점수, 그리고 동일한 호출 비용을 비교하고, 의사 결정 규칙을 제공합니다. 배경 정보는 Gemini 4 Argon이란 무엇인가 및 Gemini 3.8 Flash란 무엇인가를 참조하세요. 마지막 섹션에서는 전환을 단일 변수로 만드는 Apidog 설정을 보여줍니다.

버튼

나란히 비교: 오늘 호출할 수 있는 모델

Gemini 3.8 Flash Gemini 4 Argon
사용 가능 여부 Gemini API, AI Studio, Antigravity 및 Gemini Enterprise에서 안정적 Fairwind 프로그램 파트너 중 일부, Gemini Enterprise의 관리형 모델로 제공
모델 ID gemini-3.8-flash 미공개
100만 토큰당 가격 (입력 / 출력) 2026년 12월 31일까지 $0.75 / $3.75, 이후 $1.50 / $7.50 소개 기간(종료일 미정) $2 / $10, 이후 $4 / $20
100만 토큰당 캐시된 입력 $0.075, 이후 $0.15 소개 기간 $0.10, 이후 $0.20 (입력 95% 할인)
출력 제한 65,536 토큰 1M 토큰 (Google의 명시된 제한)
입력 창 1,048,576 토큰 미공개
사고 수준 low, medium (기본값), high; minimal은 HTTP 400 반환 문서화되지 않음
무료 API 티어 예, 속도 제한 있음 발표된 바 없음
소비자 접근 AI Pro 및 Ultra의 Gemini 앱, 검색의 AI 모드 아직 아님; AI Ultra 구독자가 첫 번째 대상이며, 날짜 미정

일부 셀에는 맥락 설명이 필요합니다. Google은 Argon의 입력 창을 게시하지 않았지만, 자체적인 장문 컨텍스트 평가에는 최대 1M 토큰 프롬프트가 사용되었습니다. Google은 Argon의 출력 제한이 1M 토큰이라고 말했지만, Vals AI와 같은 최소 한 곳의 타사 평가자는 테스트한 구성에서 최대 출력 262K를 명시했습니다. Argon의 평가는 "가장 높은 사고 설정"으로 실행되었으므로 높은 수준이 존재할 가능성이 높지만, Google은 해당 수준의 이름이나 기본값을 명시하지 않았습니다. Flash의 사고 수준은 Google의 사고 문서 및 당사의 3.8 Flash 사고 수준 가이드에 나와 있습니다.

Flash의 무료 티어는 속도 제한이 있으며, Google은 무료 티어 데이터가 "제품 개선에 사용된다"고 말합니다. Google은 Argon을 무료로 사용할 수 있는 방법을 발표하지 않았습니다. 대신 사용할 수 있는 무료 Gemini 모델에 대해서는 Argon 무료 액세스 설명서를 참조하세요.

두 출시 게시물에 공통으로 나타나는 벤치마크 항목

Google의 두 모델 출시 표는 두 개의 텍스트 항목을 공유합니다. 이는 Google이 보고한 수치이며, Argon의 방법론은 두 항목 모두 Vals AI에 기인합니다.

벤치마크 Gemini 3.8 Flash (9월 2일 표) Gemini 4 Argon (9월 30일 표)
Vals Finance Agent v2 61.4% 65.4%
Harvey 법률 에이전트 벤치마크 10.0% 19.6%

Google은 이 표들을 한 달 간격으로, 서로 다른 경쟁 모델 세트와 비교하여 게시했으므로, 이 차이는 통제된 테스트라기보다는 대략적인 방향성으로 이해해야 합니다. 그렇다고 해도 법률 부문에서 차이가 두드러집니다. Argon의 19.6%는 Flash의 10.0%의 거의 두 배에 달합니다. 금융 부문에서의 차이는 4포인트입니다.

Argon 표의 다른 모든 항목은 텍스트상으로 3.8 Flash에 해당하는 것이 없습니다. Google의 3.8 Flash 표는 HLE-Verified를 보고했지만, Argon 표는 그렇지 않으며, Flash의 DeepSWE 점수는 모델 카드 이미지에서만 나타났습니다. 타사 순위인 Arena의 Text 리더보드에서는 Argon (High)이 예비 투표에서 1위를 차지한 반면, Gemini 3.8 Flash (High)는 11위입니다. 각 항목을 누가 측정했는지 포함한 전체 19개 항목의 Argon 표는 Argon 벤치마크 분석에 있습니다.

사이버: Argon vs 3.8 Flash Cyber

DeepMind 사이버 페이지는 Argon을 Flash의 Fairwind로 게이트된 사이버 형제 모델인 Gemini 3.8 Flash Cyber와 비교합니다:

사이버 평가 Gemini 4 Argon Gemini 3.8 Flash Cyber
실제 취약점 발견 85.8% 71.0%
Wiz 침투 테스트 벤치마크 70.9% 58.2%

두 모델 모두 게이트 방식으로 제공됩니다. Gemini 3.8 Flash Cyber는 Gemini Enterprise Agent Platform의 허용 목록 뒤에서 일반 출시되었으며, Argon은 Fairwind 전용입니다. Fairwind 파트너가 아니라면, 이 수치들은 오늘날 호출할 수 있는 모델에 아무런 영향을 미치지 않습니다. 일반 3.8 Flash 모델이 여러분이 기반으로 구축할 수 있는 모델입니다.

두 모델의 동일 호출 비용

입력 토큰 100,000개와 출력 토큰 8,000개로 한 번의 호출을 한다고 가정해 봅시다. 3.8 Flash를 포함한 현재 Gemini 모델은 사고 토큰을 출력으로 청구하므로, 8,000개에는 사고 토큰이 포함됩니다. Google은 Argon이 사고 토큰을 어떻게 청구하는지 밝히지 않았지만, Argon 항목에서는 현재 Gemini 모델을 따른다고 가정합니다.

모델 및 기간 입력 비용 출력 비용 호출당 총 비용
3.8 Flash, 소개 0.1M x $0.75 = $0.075 0.008M x $3.75 = $0.030 $0.105
3.8 Flash, 2027-01-01부터 0.1M x $1.50 = $0.150 0.008M x $7.50 = $0.060 $0.210
Argon, 소개 0.1M x $2 = $0.200 0.008M x $10 = $0.080 $0.280
Argon, 표준 0.1M x $4 = $0.400 0.008M x $20 = $0.160 $0.560

Argon의 토큰당 요금은 Flash의 소개 가격과 표준 가격 모두에서 Flash 요금의 8/3배 (약 2.67배)입니다. 이러한 호출을 하루에 1,000번 한다면, Flash는 하루 $105, Argon은 소개 요금으로 하루 $280가 됩니다.

Gemini API 가격 책정 페이지에 따르면 Flash는 12월 31일까지 배치(Batch) 기능을 50% 할인($0.375 및 $1.875)하여 제공합니다. Google은 Argon의 배치 가격을 공개하지 않았습니다. 당사의 Argon 가격 가이드와 3.8 Flash 가격 가이드에서 더 자세한 내용을 확인할 수 있습니다.

Argon을 기다려야 할까요, 아니면 Flash를 사용해야 할까요?

지금 3.8 Flash로 출시해야 할 경우

Argon을 계획해야 할 경우

한 번만 선택할 필요는 없습니다. 트래픽의 대부분은 Flash로 라우팅하고, 어려운 부분은 Argon이 출시되면 동일한 구성 뒤에서 Argon으로 보낼 수 있습니다.

하나의 저장된 요청, 두 가지 모델

패턴은 다음과 같습니다. 모델 이름을 환경 변수에 저장하고, 지금은 3.8 Flash에 대해 실제 요청을 실행하고, Argon의 모델 ID가 출시되는 날 변수를 교체하세요. Google은 아직 해당 ID를 공개하지 않았으므로 추측하지 마세요.

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"

curl -s -X POST \
  "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"parts":[{"text":"Summarize this contract clause in 3 bullets."}]}],
       "generationConfig":{"thinkingConfig":{"thinkingLevel":"medium"},"maxOutputTokens":8192}}'

모든 generateContent 응답은 usageMetadata로 끝납니다. Apidog에서 GEMINI_API_KEY와 GEMINI_MODEL을 환경에 저장하고, 이 요청을 저장한 다음, 어설션(assertion)을 추가하세요: 상태 200, 앱이 읽는 필드, 그리고 비용 한도에 맞춰 설정된 usageMetadata.thoughtsTokenCount의 상한선. 긴 답변이 예산을 초과하지 않도록 maxOutputTokens를 설정해 두세요. 이를 테스트 시나리오에 추가하고, Flash에서 실행한 다음 보고서를 기준선으로 유지하세요.

출시일에 대한 두 가지 주의사항이 있습니다. Google은 "모든 새로운 모델"이 Interactions API로 출시될 것이라고 말했지만, Argon이 generateContent를 지원하는지 여부는 밝히지 않았으므로, 이 요청 옆에 Interactions 버전(generation_config.thinking_level과 함께 POST https://generativelanguage.googleapis.com/v1beta/interactions)을 저장하세요. 그리고 Argon의 사고 수준 이름은 문서화되지 않았으므로 medium이 그대로 적용되지 않을 수 있습니다. Argon이 출시되면 변수 하나를 변경하고 다시 실행한 다음 출력과 usageMetadata를 나란히 비교하세요.

FAQ

Gemini 4 Argon이 Gemini 3.8 Flash보다 더 나은가요? 두 출시 표 모두에 공통으로 나타나는 텍스트 항목을 보면 그렇습니다. Vals Finance Agent v2에서 65.4% 대 61.4%, Harvey의 Legal Agent Benchmark에서 19.6% 대 10.0%입니다. 또한 토큰당 비용이 약 2.67배 더 비싸며, 아직 호출할 수 없습니다.

Gemini 4 Argon을 기다려야 할까요? 출시해야 한다면 기다리지 마세요. Google은 유료 API 고객과 AI Ultra 구독자를 시작으로 "가능한 한 빨리" 출시하겠다고만 밝혔을 뿐, 구체적인 출시 날짜는 제시하지 않았습니다.

새 프로젝트에 Gemini 3.8 Flash 또는 Argon 중 무엇을 사용할까요? 모델을 변수에 넣어 3.8 Flash로 시작하세요. 긴 출력이 필요하거나 법률 및 금융 분야의 심층적인 작업이 필요한 요청은 직접 프롬프트에서 테스트한 후 Argon으로 전환하세요.

Argon을 무료로 사용할 수 있는 방법이 있나요? 아니요. Google은 무료 티어를 발표하지 않았습니다. 오늘 사용할 수 있는 무료 Gemini 모델에 대해서는 Argon 무료 액세스 설명서를 참조하세요.

Argon이 Gemini 3.8 Flash를 대체하나요? Google은 언급하지 않았습니다. Google은 Argon을 새로운 프론티어 모델이라고 부르며, 로이터 통신은 이전 Pro 라인보다 더 크다고 보도했습니다. 따라서 Flash와는 다른 등급의 모델입니다.

다음 단계

오늘 요청을 설정하고, 3.8 Flash에서 실행한 다음 보고서를 저장하세요. Argon이 출시되면 몇 분 안에 Argon이 귀하의 트래픽에서 가격만큼의 가치를 하는지 알 수 있을 것입니다. 비교를 위해 Apidog를 다운로드하세요.

버튼

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요