Gemini 3.8 Flash는 오늘부터 사용 가능합니다. 2026년 12월 31일까지 100만 토큰당 입력 $0.75, 출력 $3.75로 책정된 무료 티어가 있는 안정적인 모델이며, 이후에는 $1.50 및 $7.50으로 변경되고 출력 상한선은 64K입니다. Gemini 4 Argon은 아직 아닙니다. Google의 출시 게시물에 따르면, 프로모션 기간(기간 미정) 동안에는 $2 및 $10이며, 이후에는 $4 및 $20로 가격이 책정됩니다. Google은 출력 제한이 1M 토큰이라고 밝혔으며, 현재로서는 Fairwind 프로그램 참여자에게만 제공됩니다. 이번 분기에 출시해야 한다면 Flash를 사용하여 출시하고, Argon은 설정 변경 한 번으로 전환할 수 있도록 준비하세요.
이 게시물에서는 두 모델의 사양, 두 출시 게시물에 공통으로 나타나는 벤치마크 항목, 사이버 점수, 그리고 동일한 호출 비용을 비교하고, 의사 결정 규칙을 제공합니다. 배경 정보는 Gemini 4 Argon이란 무엇인가 및 Gemini 3.8 Flash란 무엇인가를 참조하세요. 마지막 섹션에서는 전환을 단일 변수로 만드는 Apidog 설정을 보여줍니다.
나란히 비교: 오늘 호출할 수 있는 모델
| Gemini 3.8 Flash | Gemini 4 Argon | |
|---|---|---|
| 사용 가능 여부 | Gemini API, AI Studio, Antigravity 및 Gemini Enterprise에서 안정적 | Fairwind 프로그램 파트너 중 일부, Gemini Enterprise의 관리형 모델로 제공 |
| 모델 ID | gemini-3.8-flash |
미공개 |
| 100만 토큰당 가격 (입력 / 출력) | 2026년 12월 31일까지 $0.75 / $3.75, 이후 $1.50 / $7.50 | 소개 기간(종료일 미정) $2 / $10, 이후 $4 / $20 |
| 100만 토큰당 캐시된 입력 | $0.075, 이후 $0.15 | 소개 기간 $0.10, 이후 $0.20 (입력 95% 할인) |
| 출력 제한 | 65,536 토큰 | 1M 토큰 (Google의 명시된 제한) |
| 입력 창 | 1,048,576 토큰 | 미공개 |
| 사고 수준 | low, medium (기본값), high; minimal은 HTTP 400 반환 |
문서화되지 않음 |
| 무료 API 티어 | 예, 속도 제한 있음 | 발표된 바 없음 |
| 소비자 접근 | AI Pro 및 Ultra의 Gemini 앱, 검색의 AI 모드 | 아직 아님; AI Ultra 구독자가 첫 번째 대상이며, 날짜 미정 |
일부 셀에는 맥락 설명이 필요합니다. Google은 Argon의 입력 창을 게시하지 않았지만, 자체적인 장문 컨텍스트 평가에는 최대 1M 토큰 프롬프트가 사용되었습니다. Google은 Argon의 출력 제한이 1M 토큰이라고 말했지만, Vals AI와 같은 최소 한 곳의 타사 평가자는 테스트한 구성에서 최대 출력 262K를 명시했습니다. Argon의 평가는 "가장 높은 사고 설정"으로 실행되었으므로 높은 수준이 존재할 가능성이 높지만, Google은 해당 수준의 이름이나 기본값을 명시하지 않았습니다. Flash의 사고 수준은 Google의 사고 문서 및 당사의 3.8 Flash 사고 수준 가이드에 나와 있습니다.
Flash의 무료 티어는 속도 제한이 있으며, Google은 무료 티어 데이터가 "제품 개선에 사용된다"고 말합니다. Google은 Argon을 무료로 사용할 수 있는 방법을 발표하지 않았습니다. 대신 사용할 수 있는 무료 Gemini 모델에 대해서는 Argon 무료 액세스 설명서를 참조하세요.
두 출시 게시물에 공통으로 나타나는 벤치마크 항목
Google의 두 모델 출시 표는 두 개의 텍스트 항목을 공유합니다. 이는 Google이 보고한 수치이며, Argon의 방법론은 두 항목 모두 Vals AI에 기인합니다.
| 벤치마크 | Gemini 3.8 Flash (9월 2일 표) | Gemini 4 Argon (9월 30일 표) |
|---|---|---|
| Vals Finance Agent v2 | 61.4% | 65.4% |
| Harvey 법률 에이전트 벤치마크 | 10.0% | 19.6% |
Google은 이 표들을 한 달 간격으로, 서로 다른 경쟁 모델 세트와 비교하여 게시했으므로, 이 차이는 통제된 테스트라기보다는 대략적인 방향성으로 이해해야 합니다. 그렇다고 해도 법률 부문에서 차이가 두드러집니다. Argon의 19.6%는 Flash의 10.0%의 거의 두 배에 달합니다. 금융 부문에서의 차이는 4포인트입니다.
Argon 표의 다른 모든 항목은 텍스트상으로 3.8 Flash에 해당하는 것이 없습니다. Google의 3.8 Flash 표는 HLE-Verified를 보고했지만, Argon 표는 그렇지 않으며, Flash의 DeepSWE 점수는 모델 카드 이미지에서만 나타났습니다. 타사 순위인 Arena의 Text 리더보드에서는 Argon (High)이 예비 투표에서 1위를 차지한 반면, Gemini 3.8 Flash (High)는 11위입니다. 각 항목을 누가 측정했는지 포함한 전체 19개 항목의 Argon 표는 Argon 벤치마크 분석에 있습니다.
사이버: Argon vs 3.8 Flash Cyber
DeepMind 사이버 페이지는 Argon을 Flash의 Fairwind로 게이트된 사이버 형제 모델인 Gemini 3.8 Flash Cyber와 비교합니다:
| 사이버 평가 | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|
| 실제 취약점 발견 | 85.8% | 71.0% |
| Wiz 침투 테스트 벤치마크 | 70.9% | 58.2% |
두 모델 모두 게이트 방식으로 제공됩니다. Gemini 3.8 Flash Cyber는 Gemini Enterprise Agent Platform의 허용 목록 뒤에서 일반 출시되었으며, Argon은 Fairwind 전용입니다. Fairwind 파트너가 아니라면, 이 수치들은 오늘날 호출할 수 있는 모델에 아무런 영향을 미치지 않습니다. 일반 3.8 Flash 모델이 여러분이 기반으로 구축할 수 있는 모델입니다.
두 모델의 동일 호출 비용
입력 토큰 100,000개와 출력 토큰 8,000개로 한 번의 호출을 한다고 가정해 봅시다. 3.8 Flash를 포함한 현재 Gemini 모델은 사고 토큰을 출력으로 청구하므로, 8,000개에는 사고 토큰이 포함됩니다. Google은 Argon이 사고 토큰을 어떻게 청구하는지 밝히지 않았지만, Argon 항목에서는 현재 Gemini 모델을 따른다고 가정합니다.
| 모델 및 기간 | 입력 비용 | 출력 비용 | 호출당 총 비용 |
|---|---|---|---|
| 3.8 Flash, 소개 | 0.1M x $0.75 = $0.075 | 0.008M x $3.75 = $0.030 | $0.105 |
| 3.8 Flash, 2027-01-01부터 | 0.1M x $1.50 = $0.150 | 0.008M x $7.50 = $0.060 | $0.210 |
| Argon, 소개 | 0.1M x $2 = $0.200 | 0.008M x $10 = $0.080 | $0.280 |
| Argon, 표준 | 0.1M x $4 = $0.400 | 0.008M x $20 = $0.160 | $0.560 |
Argon의 토큰당 요금은 Flash의 소개 가격과 표준 가격 모두에서 Flash 요금의 8/3배 (약 2.67배)입니다. 이러한 호출을 하루에 1,000번 한다면, Flash는 하루 $105, Argon은 소개 요금으로 하루 $280가 됩니다.
- 토큰 수가 일치하지 않을 수 있습니다. 동일한 프롬프트라도 모델에 따라 출력 및 사고 토큰 수가 달라집니다. Argon의 공개된 평가는 가장 높은 사고 설정으로 실행되었으며, 3.8 Flash에서는 Google이 더 높은 노력 수준이 더 많은 토큰을 사용할 수 있다고 경고합니다.
- 긴 출력은 계산을 바꿉니다. 200,000 토큰 답변은 Flash의 65,536 토큰 제한에 맞지 않으므로 여러 호출로 분할해야 합니다. Argon의 명시된 제한 내에서는 단일 응답입니다: 소개 요금으로는 0.2M x $10 = $2.00, 표준 요금으로는 $4.00입니다. 전체 1M 토큰 답변은 소개 요금 $10 또는 표준 요금 $20가 듭니다.
- 소개 종료 날짜가 하나만 알려져 있습니다. Flash의 소개 가격은 2026년 12월 31일에 종료됩니다. Google은 Argon의 종료 시점을 밝히지 않았습니다.
Gemini API 가격 책정 페이지에 따르면 Flash는 12월 31일까지 배치(Batch) 기능을 50% 할인($0.375 및 $1.875)하여 제공합니다. Google은 Argon의 배치 가격을 공개하지 않았습니다. 당사의 Argon 가격 가이드와 3.8 Flash 가격 가이드에서 더 자세한 내용을 확인할 수 있습니다.
Argon을 기다려야 할까요, 아니면 Flash를 사용해야 할까요?
지금 3.8 Flash로 출시해야 할 경우
- 비용이 제한적인 경우. Flash는 토큰당 Argon 비용의 3/8이며, 배치(Batch)는 이마저도 절반으로 줄입니다.
- 높은 볼륨을 처리하는 경우. 분류, 추출, 라우팅 및 대규모 채팅은 1M 출력 토큰당 $10에서 빠르게 누적됩니다.
- 오늘 당장 필요한 경우. Flash는 안정적인 모델 ID, 프로토타입 제작을 위한 무료 티어, 그리고 공개된 가격 일정을 갖추고 있습니다.
- 응답이 65,536 토큰 내에 맞는 경우. 대부분의 API 워크로드는 그렇습니다.
Argon을 계획해야 할 경우
- 장기적인 작업인 경우. Google은 Argon이 "복잡하고 장기적인 워크플로우 전반에 걸쳐 심층적인 추론을 지속하도록 구축되었다"고 말합니다.
- 64K 이상의 출력이 필요한 경우. 전체 모듈 재작성, 긴 보고서 및 대규모 마이그레이션은 1M 출력 제한이 필요한 경우입니다.
- 법률 또는 금융 에이전트를 운영하는 경우. Google이 두 모델을 모두 게시한 두 가지 항목이며, Argon이 두 항목 모두에서 우세합니다.
- Fairwind 자격이 있는 개발자인 경우. Argon은 현재 프로그램이 주도하는 모델입니다.
한 번만 선택할 필요는 없습니다. 트래픽의 대부분은 Flash로 라우팅하고, 어려운 부분은 Argon이 출시되면 동일한 구성 뒤에서 Argon으로 보낼 수 있습니다.
하나의 저장된 요청, 두 가지 모델
패턴은 다음과 같습니다. 모델 이름을 환경 변수에 저장하고, 지금은 3.8 Flash에 대해 실제 요청을 실행하고, Argon의 모델 ID가 출시되는 날 변수를 교체하세요. Google은 아직 해당 ID를 공개하지 않았으므로 추측하지 마세요.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
curl -s -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize this contract clause in 3 bullets."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"medium"},"maxOutputTokens":8192}}'
모든 generateContent 응답은 usageMetadata로 끝납니다. Apidog에서 GEMINI_API_KEY와 GEMINI_MODEL을 환경에 저장하고, 이 요청을 저장한 다음, 어설션(assertion)을 추가하세요: 상태 200, 앱이 읽는 필드, 그리고 비용 한도에 맞춰 설정된 usageMetadata.thoughtsTokenCount의 상한선. 긴 답변이 예산을 초과하지 않도록 maxOutputTokens를 설정해 두세요. 이를 테스트 시나리오에 추가하고, Flash에서 실행한 다음 보고서를 기준선으로 유지하세요.
출시일에 대한 두 가지 주의사항이 있습니다. Google은 "모든 새로운 모델"이 Interactions API로 출시될 것이라고 말했지만, Argon이 generateContent를 지원하는지 여부는 밝히지 않았으므로, 이 요청 옆에 Interactions 버전(generation_config.thinking_level과 함께 POST https://generativelanguage.googleapis.com/v1beta/interactions)을 저장하세요. 그리고 Argon의 사고 수준 이름은 문서화되지 않았으므로 medium이 그대로 적용되지 않을 수 있습니다. Argon이 출시되면 변수 하나를 변경하고 다시 실행한 다음 출력과 usageMetadata를 나란히 비교하세요.
FAQ
Gemini 4 Argon이 Gemini 3.8 Flash보다 더 나은가요? 두 출시 표 모두에 공통으로 나타나는 텍스트 항목을 보면 그렇습니다. Vals Finance Agent v2에서 65.4% 대 61.4%, Harvey의 Legal Agent Benchmark에서 19.6% 대 10.0%입니다. 또한 토큰당 비용이 약 2.67배 더 비싸며, 아직 호출할 수 없습니다.
Gemini 4 Argon을 기다려야 할까요? 출시해야 한다면 기다리지 마세요. Google은 유료 API 고객과 AI Ultra 구독자를 시작으로 "가능한 한 빨리" 출시하겠다고만 밝혔을 뿐, 구체적인 출시 날짜는 제시하지 않았습니다.
새 프로젝트에 Gemini 3.8 Flash 또는 Argon 중 무엇을 사용할까요? 모델을 변수에 넣어 3.8 Flash로 시작하세요. 긴 출력이 필요하거나 법률 및 금융 분야의 심층적인 작업이 필요한 요청은 직접 프롬프트에서 테스트한 후 Argon으로 전환하세요.
Argon을 무료로 사용할 수 있는 방법이 있나요? 아니요. Google은 무료 티어를 발표하지 않았습니다. 오늘 사용할 수 있는 무료 Gemini 모델에 대해서는 Argon 무료 액세스 설명서를 참조하세요.
Argon이 Gemini 3.8 Flash를 대체하나요? Google은 언급하지 않았습니다. Google은 Argon을 새로운 프론티어 모델이라고 부르며, 로이터 통신은 이전 Pro 라인보다 더 크다고 보도했습니다. 따라서 Flash와는 다른 등급의 모델입니다.
다음 단계
오늘 요청을 설정하고, 3.8 Flash에서 실행한 다음 보고서를 저장하세요. Argon이 출시되면 몇 분 안에 Argon이 귀하의 트래픽에서 가격만큼의 가치를 하는지 알 수 있을 것입니다. 비교를 위해 Apidog를 다운로드하세요.
