Gemini 3.7 Flash는 Google의 최신 주력 AI 모델로, Gemini 3.6 Flash 출시 3주 후인 2026년 8월 13일에 공개되었습니다. 이전 모델의 1M 토큰 컨텍스트 창과 멀티모달 입력 기능을 유지하면서 코딩 및 에이전트 벤치마크에서 큰 향상을 보였으며, 1M 입력 토큰당 $0.75의 출시 기념 API 가격으로 제공됩니다. Google은 이를 “가장 지능적인 주력 모델”이라고 부릅니다.
출시 간격이 3주라는 점이 중요합니다. Google은 Gemini 3.5 Pro가 계속 지연되는 동안 Flash 업데이트를 빠르게 출시하고 있으며, 이는 중간 계층 모델에서 흥미로운 엔지니어링이 가장 먼저 적용된다는 의미입니다. 벤치마크 변화가 이를 뒷받침합니다. DeepSWE는 16점 상승했고, AutomationBench는 거의 두 배가 되었으며, 출시 기념 가격은 3.6 Flash 출시 가격보다 절반 저렴합니다.
이 게시물은 변경된 모든 것을 다룹니다: Google이 발표에 분산하여 공개한 전체 벤치마크 표, 일정에 맞춰야 할 가격 책정 기간, 오늘날 모델에 액세스할 수 있는 모든 장소, 그리고 5분 안에 실행할 수 있는 작동하는 cURL 요청. 더 깊이 있는 엔드포인트 둘러보기를 원한다면, Gemini 3.7 Flash API 빠른 시작이 이 설명과 짝을 이루며, Apidog는 전환을 결정하기 전에 기존 프롬프트에 대해 새 모델을 테스트할 수 있는 작업 공간을 제공합니다.
TL;DR
- Gemini 3.7 Flash는 3.6 Flash 출시 3주 후인 2026년 8월 13일에 출시되었습니다. 모델 ID:
gemini-3.7-flash. - 코딩 및 에이전트 벤치마크가 급상승했습니다: DeepSWE v1.1 49.0%에서 65.3%로, AutomationBench 17.0%에서 30.4%로, WebDev Arena Elo 1538에서 1588로.
- 출시 기념 API 가격은 1M 입력 토큰당 $0.75, 1M 출력 토큰당 $3.75로, 3.6 Flash 출시 가격의 절반입니다. 표준 요금($1.50 / $7.50)은 2027년 1월 1일부터 적용됩니다.
- 사양은 유지됩니다: 1M 토큰 입력 컨텍스트, 64k 출력 제한, 멀티모달 입력 (텍스트, 이미지, 비디오, 오디오, PDF), 함수 호출, 도구로서의 검색, 컴퓨터 사용.
- 현재 Gemini API, AI Studio, Gemini 앱, Gemini Spark, Google Antigravity, Android Studio, Gemini Enterprise에서 160개 이상의 국가에서 사용할 수 있습니다.
- Gemini 3.5 Pro는 여전히 지연되고 있으며, Google은 다음 주력 모델에 앞서 Flash 개선 사항을 출시하고 있습니다.
Gemini 3.7 Flash란 무엇인가
Flash는 Gemini 라인의 중간 계층입니다: Pro보다 저렴하고 빠르며, Flash-Lite보다 스마트하고, 대부분의 프로덕션 AI 트래픽을 구성하는 대량 워크로드에 맞춰 조정되었습니다. Gemini 3.7 Flash는 3.x 라인의 세 번째 Flash 출시이며, Google의 프레이밍도 이에 따라 변경되었습니다. 공식 발표는 이를 코딩 및 에이전트 모델로 우선시하고, 채팅 모델은 두 번째로 다룹니다.

사양은 3.6 Flash에서 이월되었습니다:
- 컨텍스트: 1M 토큰 입력 창, 64k 토큰 출력 제한.
- 입력 모달리티: 텍스트, 이미지, 비디오, 오디오, PDF. 출력은 텍스트입니다.
- 도구: 함수 호출, 도구로서의 검색, 컴퓨터 사용.
- 안전: 업데이트된 CBRN 및 사이버 보호 기능이 출시와 함께 제공됩니다.
변경된 것은 아키텍처가 아니라 동작 방식입니다. Google은 3.7 Flash가 디버깅을 더 잘하고, 배포 가능한 프로덕션 코드를 첫 시도에 더 자주 생성하며, 문제 발생 시 적응하고, 의도가 모호할 때 명확한 질문을 하고, 지시를 더 정확하게 따른다고 말합니다. 이것은 주장입니다. 아래 벤치마크가 그 증거입니다.
벤치마크 개선: 3.6 vs 3.7
Google은 이 수치들을 블로그 게시물과 모델 카드에 분산하여 공개했습니다. 중요 변화와 함께 하나의 표로 정리하면 다음과 같습니다:
| 벤치마크 | Gemini 3.6 Flash | Gemini 3.7 Flash | 변경점 |
|---|---|---|---|
| DeepSWE v1.1 (에이전트 코딩) | 49.0% | 65.3% | +16.3 pts |
| FrontierCode 1.1 Main | 34.4% | 43.6% | +9.2 pts |
| WebDev Arena (Elo) | 1538 | 1588 | +50 Elo |
| GDP.pdf (문서 추론) | 22.0% | 34.0% | +12.0 pts |
| AutomationBench (에이전트 작업) | 17.0% | 30.4% | +13.4 pts |
두 가지 개별 점수가 그림을 완성합니다: 법률 추론 벤치마크인 Harvey LAB-AA에서 90.7%, 128k-needle 장문 컨텍스트 검색에서 97.0%. 모델에 긴 문서를 공급하는 경우 두 번째 수치가 중요합니다. 깊이 있는 검색 품질은 많은 모델들이 조용히 무너지는 지점입니다.
표 전체의 패턴은 일관적입니다. 가장 큰 상승폭은 단일 답변보다는 다단계 작업을 측정하는 에이전트 벤치마크에서 나타났습니다. AutomationBench가 17.0%에서 30.4%로 상승한 것은 중간 계층 모델에 맡길 수 있는 작업의 종류를 바꿀 수 있는 변화입니다. 출시 보도는 DeepSWE 상승을 주요 결과로 꼽았으며, 그럴 만한 이유가 있습니다. 3주 만에 에이전트 코딩에서 16점 상승은 어떤 모델 라인에서도 이례적인 일입니다. 경쟁 모델 간 벤치마크 변화가 실제 워크로드에서 어떻게 작용하는지에 대한 맥락은 Grok 4.6 vs GPT 5.6 vs Claude 비교에서 유사한 차이가 어떻게 나타나는지 보여줍니다.
코딩 및 에이전트 개선 사항
벤치마크 표는 무엇이 개선되었는지 알려줍니다. Google의 릴리스 노트는 실제 적용에서 어떻게 나타나는지 설명하며, 주장은 테스트하기에 충분히 구체적입니다:
- 디버깅. 이 모델은 증상만 패치하는 대신 실패의 원인을 찾는 데 더 능숙합니다. DeepSWE의 개선은 실제 저장소에서 여러 파일의 버그 수정을 평가하므로 이 주장을 뒷받침하는 수치입니다.
- 첫 시도 배포 가능 코드. Google은 생성된 코드가 수정 없이 더 많이 실행된다고 주장합니다. FrontierCode의 9.2점 개선은 가장 근접한 공개 측정치입니다.
- 난관 처리. 도구 호출이 실패하거나 파일이 누락되면 3.7 Flash는 반복하는 대신 계획을 조정합니다. 이것은 AutomationBench가 강조하는 동작입니다.
- 의도 명확화. 모델은 추측하는 대신 요청이 모호할 때 질문을 합니다. 에이전트 파이프라인에서 한 번의 명확화는 잘못된 5,000토큰 답변보다 저렴합니다.
- 지시 충실도. 출력 형식 요청, 길이 제한, 부정적 제약 사항이 긴 대화에서 더 안정적으로 유지됩니다.
도구 스택은 원점수만큼 중요합니다. 함수 호출과 도구로서의 검색은 3.6에서 이월되었으며, 컴퓨터 사용 지원은 해당 작업에 대한 API가 없을 때 모델이 브라우저를 구동할 수 있음을 의미합니다. 이 마지막 기능은 개발자에게는 다소 이상한 위치에 있습니다. 강력하지만 구조화된 엔드포인트보다 느리고 덜 결정적입니다. 컴퓨터 사용과 구조화된 API의 비교 분석은 각 접근 방식이 언제 유용한지 다룹니다.
가격: 2026년 12월 31일까지 반값
Gemini 3.7 Flash는 Gemini API에서 두 단계로 구성된 가격 일정과 함께 출시됩니다:
| 기간 | 입력 (1M 토큰당) | 출력 (1M 토큰당) |
|---|---|---|
| 2026년 12월 31일까지 | $0.75 | $3.75 |
| 2027년 1월 1일부터 | $1.50 | $7.50 |
출시 기념 가격은 Gemini 3.6 Flash 출시 가격의 절반이며, 이는 향후 4개월 반 동안 이 모델 제품군이 가졌던 가장 저렴한 기간이 됩니다. 문제는 1월 1일에 가격이 두 배로 인상된다는 점입니다. $0.75 입력 토큰을 기준으로 예산을 책정했다면, 지금 계획하지 않으면 5개월 안에 예산이 틀어지게 됩니다.
두 가지 실질적인 교훈이 있습니다. 첫째, 무엇이든 출시하기 전에 공식 가격 페이지에서 현재 요금을 확인하세요. 출시 기념 기간은 이전에 변경된 적이 있습니다. 둘째, 2027년 비용은 프로모션 요금이 아닌 표준 요금으로 모델링하세요. 챗봇, 문서 파이프라인 및 에이전트 루프에 대한 토큰 계산을 포함한 전체 예시는 Gemini 3.7 Flash 가격 분석에 있습니다.
오늘 어디서 사용할 수 있나요
Google은 3.7 Flash를 출시 첫날부터 160개 이상의 국가에 걸쳐 전체 서비스 영역에 배포했습니다:
- Gemini API. 개발자 경로. AI Studio에서 키를 가져와
gemini-3.7-flash를 직접 호출하세요. - Google AI Studio. 코드를 작성하기 전에 프롬프트 테스트를 위한 브라우저 기반 플레이그라운드.
- Gemini 앱. 소비자용 채팅 앱은 출시와 함께 새로운 모델을 채택했습니다.
- Gemini Spark. AI Pro 및 Ultra 구독자에게 제공됩니다.
- Google Antigravity. Google의 에이전트 개발 환경이 이를 기반으로 실행됩니다.
- Android Studio. IDE 통합은 코드 지원을 위해 이 모델을 사용합니다.
- Gemini Enterprise. 규정 준수 요구 사항이 있는 조직을 위한 관리형 서비스.
대규모 API 액세스를 위해서는 OAuth, IAM 및 감사 로깅을 통해 aiplatform.googleapis.com에서 Vertex AI 경로도 사용할 수 있습니다. 동일한 모델, 동일한 요청 스키마이지만 인증 및 호스팅 보장은 다릅니다.
Google이 Gemini 3.5 Pro보다 Flash를 먼저 출시한 이유
출시 순서는 이례적입니다. 일반적으로 주력 모델이 먼저 출시되고 더 저렴한 계층이 뒤따릅니다. Google은 이를 뒤집었습니다: 7월 말 3.6 Flash, 3주 후 3.7 Flash, 그리고 Gemini 3.5 Pro는 아직 출시일이 정해지지 않았습니다. Axios는 Pro가 지연되는 동안 Google이 의도적으로 다음 주력 모델에 앞서 Flash 업데이트를 출시하고 있다고 보도했습니다.
일정 지연이 아닌 전략으로 본다면, 이 움직임은 합리적입니다. 대부분의 프로덕션 트래픽은 토큰당 비용이 허용 가능한 품질과 만나는 중간 계층 모델에서 실행됩니다. Flash를 개선하는 것은 대부분의 고객이 매일 사용하는 모델을 개선하는 것입니다. 또한 모든 주요 연구소가 빠르게 출시하는 시기에 주력 모델 발표를 서두르지 않으면서 Google이 출시 주기 논의에 참여할 수 있게 합니다.
개발자에게 실질적인 결과는 Flash 계층이 더 이상 뒤처지지 않는다는 것입니다. 에이전트 기능이 이곳에 먼저 적용되고 있습니다. Pro를 기다리느라 3.6에서 워크로드를 이동하는 것을 미루고 있었다면, 3.6에서 3.7 Flash로의 마이그레이션 가이드가 전환 방법을 다루고 있으며, 대부분의 코드베이스에서는 한 줄 모델 ID 변경과 회귀 테스트만 하면 됩니다.
5분 안에 API를 사용해 보는 방법
AI Studio에서 API 키가 필요합니다. 키를 생성하고 내보낸 다음 첫 번째 요청을 보내세요:
export GEMINI_API_KEY="AIza..."
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [{ "text": "Review this function for bugs: def dedupe(items): return list(set(items))" }]
}],
"generationConfig": {
"temperature": 0.4,
"maxOutputTokens": 1024
}
}'
응답은 `content.parts`에 생성된 텍스트가 포함된 `candidates` 배열로, 그리고 정확한 입력 및 출력 토큰 수를 보고하는 `usageMetadata` 블록과 함께 반환됩니다. 첫날부터 이 블록을 주시하세요. 이것이 비용 측정기입니다. 스트리밍의 경우, `:generateContent`를 `:streamGenerateContent?alt=sse`로 바꾸면 API가 서버 전송 이벤트를 반환합니다.
첫 호출이 성공하면 터미널 밖에서 실험을 진행하세요. Apidog에서 Generative Language API 사양을 가져오고, 환경 변수로 `GEMINI_API_KEY`를 `x-goog-api-key` 헤더에 바인딩하고, 모델 ID를 경로 변수로 저장합니다. 이제 `gemini-3.6-flash`와 `gemini-3.7-flash`에 대해 동일한 프롬프트를 나란히 다시 실행하고, SSE 스트림이 실시간으로 렌더링되는 것을 확인하며, 응답을 예시로 저장하여 회귀 테스트가 토큰을 소모하지 않도록 할 수 있습니다. 이는 출시 게시물의 주장만 믿는 대신, Google의 "더 나은 지시 준수" 주장을 자신의 프롬프트에 대해 검증하는 가장 빠른 방법입니다.
자주 묻는 질문
Gemini 3.7 Flash는 무료로 사용할 수 있나요?
Gemini API는 AI Studio를 통해 일일 할당량과 함께 무료 티어를 제공하며, 이는 프로토타이핑을 포함합니다. 유료 사용은 2026년 12월 31일까지 1M 입력 토큰당 $0.75의 출시 기념 요금으로 시작됩니다. 무료 할당량을 더 늘리고 싶다면, 무료 Gemini API 액세스 가이드가 제한 사항과 그 안에서 작업하는 방법을 다룹니다.
Gemini 3.6 Flash와 3.7 Flash의 차이점은 무엇인가요?
동일한 사양, 더 나은 동작. 컨텍스트 창, 출력 제한, 모달리티 및 도구 지원은 변경되지 않았습니다. 코딩 및 에이전트 벤치마크에서 개선이 있었습니다: DeepSWE는 16.3점, AutomationBench는 13.4점, WebDev Arena는 50 Elo 상승했습니다. Google은 또한 더 나은 디버깅, 지시 준수 및 다단계 계획을 주장합니다.
Gemini 3.7 Flash가 Gemini 3.5 Pro를 대체하나요?
아니요. Pro는 가장 어려운 추론 작업을 위한 주력 계층으로 남아 있으며, Gemini 3.5 Pro는 여전히 개발 중입니다. Flash 3.7은 비용과 지연 시간이 품질만큼 중요한 대용량 프로덕션 작업에 Google이 권장하는 모델입니다.
2027년 1월 1일에 가격은 어떻게 되나요?
출시 기념 요금이 종료되고 표준 가격이 적용됩니다: 1M 입력 토큰당 $1.50, 1M 출력 토큰당 $7.50으로, 출시 가격의 두 배입니다. 2026년 이후까지 지속될 워크로드에 대해서는 표준 요금으로 예산을 책정하세요.
Gemini 3.7 Flash는 이미지와 PDF를 처리할 수 있나요?
네. 입력 모달리티는 동일한 `contents` 배열에서 텍스트, 이미지, 비디오, 오디오 및 PDF를 포함합니다. 출력은 텍스트 전용입니다. GDP.pdf 벤치마크 점수가 22.0%에서 34.0%로 상승한 것은 코딩 개선과 함께 문서 이해 능력도 향상되었다는 Google의 증거입니다.
귀하의 스택에서 3.7 Flash가 적합한 곳
Gemini 3.7 Flash는 에이전트 계층 벤치마크 점수와 4개월간의 가격 할인 혜택을 제공하는 중간 계층 모델입니다. 이러한 조합은 평가 여부보다는 얼마나 빨리 평가할지에 대한 결정을 중요하게 만듭니다. 에이전트 기능 향상은 공개 벤치마크에서 실제 수치로 나타나며, 사양은 오늘날 3.6에서 실행하는 것과 일치하고, 출시 기념 가격은 지금 테스트하는 것이 1월에 동일한 평가를 하는 비용의 절반이라는 것을 의미합니다.
합리적인 순서는 다음과 같습니다: 기존 프롬프트 스위트를 `gemini-3.7-flash`에 대해 실행하고, 현재 모델과 출력 및 토큰 사용량을 비교한 다음, 결과에 따라 승자를 선택하세요. Apidog를 다운로드하여 하나의 작업 공간에서 비교를 실행하세요. 3.6 응답을 예시로 저장하고, 3.7에 대해 동일한 요청을 다시 실행하면, 해당 벤치마크 스토리가 귀하의 워크로드에 유효한지 오후 시간 내에 알 수 있을 것입니다.
