Gemini 3.6 Flash는 Google의 새로운 주력 모델입니다. 2026년 7월 21일에 정식 출시되었으며, 이전 모델인 Gemini 3.5 Flash보다 저렴하고 토큰 효율성이 뛰어납니다. 대량의 API 트래픽을 처리하고 플래그십 가격을 지불하지 않고도 견고한 품질을 원한다면, Google이 당신을 위해 만든 등급이 바로 이것입니다.
이 가이드에서는 모델이 무엇인지, 이전 버전에서 무엇이 변경되었는지, 전체 사양, 벤치마크 점수, 비용 및 액세스 방법에 대해 다룹니다. 또한 API 호출을 직접 보내고 회귀 테스트하는 방법도 확인할 수 있으므로 Google 페이지의 숫자가 실제로 받는 결과와 일치하는지 확인할 수 있습니다.
Gemini 3.6 Flash란 무엇인가요?
Gemini 3.6 Flash는 Google의 Gemini 제품군 중 중간 계층의 고처리량 모델입니다. "주력"이라는 단어가 이 모델에 딱 맞습니다. 이 모델은 대부분의 프로덕션 트래픽을 구성하는 일상적인 작업(요약, 추출, 분류, 채팅 및 다단계 도구 호출)에 맞춰 조정되었습니다. 빠르고 저렴하며, 단일 호출로 텍스트, 이미지, 비디오, 오디오 및 PDF를 읽을 수 있습니다.

Google은 2026년 7월 21일에 세 가지 모델 중 하나로 이 모델을 출시했습니다. 나머지 두 가지는 대용량 작업에 더 저렴하고 빠른 등급인 Gemini 3.5 Flash-Lite와 정부 및 신뢰할 수 있는 파트너만 액세스할 수 있는 게이티드 보안 모델인 Gemini 3.5 Flash Cyber입니다. 저렴한 등급에 대한 자세한 내용은 Gemini 3.5 Flash-Lite란 무엇인가 설명서에서, 게이티드 보안 모델에 대한 내용은 Gemini 3.5 Flash Cyber란 무엇인가에서 확인할 수 있습니다.

여기서 사람들이 혼동하는 부분이 있습니다. 버전 관리가 혼합되어 있다는 점입니다. 주력 모델은 3.6으로 올라섰지만, Flash-Lite와 Flash Cyber는 3.5에 머물렀습니다. 따라서 "새로운 Flash 모델"이 모두 동일한 버전 번호를 사용하는 것은 아닙니다. 모델 ID를 선택할 때 주의 깊게 읽으세요. gemini-3.6-flash와 gemini-3.5-flash-lite는 오타가 아니라 서로 다른 등급입니다.
Google은 Google 블로그에 발표 내용을 게시했으며, 모델 카드는 DeepMind Flash 페이지에 있습니다.
Gemini 3.5 Flash 대비 새로운 점
주요 변경 사항은 효율성입니다. Gemini 3.6 Flash는 동일한 작업을 완료하는 데 3.5 Flash보다 약 17% 적은 출력 토큰을 사용합니다. 토큰이 적다는 것은 청구 비용이 낮아지고 응답 속도가 빨라진다는 것을 의미합니다. 출력 토큰은 가장 많은 비용을 지불하고 스트리밍하는 데 가장 오랜 시간이 걸리기 때문입니다.
Google은 또한 출력 가격을 인하했습니다. 3.5 Flash에서는 백만 출력 토큰당 $9.00를 지불했지만, 3.6 Flash에서는 $7.50를 지불합니다. 토큰 절감에 가격 인하를 더하면 실제 작업당 비용은 표시된 숫자만으로는 알 수 없는 수준으로 떨어집니다.
이 모델은 코딩 및 컴퓨터 사용 능력도 향상되었으며, 다단계 워크플로에서 더 적은 추론 단계와 도구 호출로 답변에 도달합니다. 이는 에이전트에게 중요합니다. 모든 추가 추론 루프와 도구 호출은 지연 시간과 비용을 증가시키므로, 이를 줄이면 에이전트 실행이 처음부터 끝까지 더 저렴하고 빨라집니다.
기존 트래픽을 이전할지 결정하고 있다면, Gemini 3.6 Flash vs 3.5 Flash에서 절충안을 설명합니다.
Gemini 3.6 Flash 사양
| 속성 | Gemini 3.6 Flash |
|---|---|
| 모델 ID | gemini-3.6-flash |
| 입력 컨텍스트 창 | 1M 토큰 |
| 최대 출력 | 64k 토큰 |
| 입력 양식 | 텍스트, 이미지, 비디오, 오디오, PDF |
| 출력 | 텍스트 전용 |
| 입력 가격 | 1M 토큰당 $1.50 |
| 출력 가격 | 1M 토큰당 $7.50 (생각 토큰 포함) |
| 무료 등급 | 예, Google AI Studio를 통해 (속도 제한 있음) |
| 출시일 | 2026년 7월 21일 |
두 가지 숫자에 주목할 필요가 있습니다. 1M 입력 컨텍스트 창은 단일 요청으로 모델에 대규모 문서, 긴 스크립트 또는 전체 코드베이스를 제공할 수 있음을 의미합니다. 64k 최대 출력 제한은 단일 응답의 상한선이므로, 책 길이의 생성이 필요한 경우 작업을 여러 호출로 분할해야 합니다.
성능
벤치마크는 약속이 아닌 대리 지표이지만, 모델의 강점이 어디에 있는지 알려줍니다. Google이 보고한 공개 스위트에서 Gemini 3.6 Flash가 얻은 점수는 다음과 같습니다.
코딩에서는 프로덕션 저장소의 실제 GitHub 문제를 모델이 해결할 수 있는지 확인하는 테스트인 SWE-Bench Pro에서 58.7%를 기록했습니다. 또 다른 소프트웨어 공학 벤치마크인 DeepSWE v1.1에서는 49%를 기록했습니다. 실제 터미널에서 명령 실행을 측정하는 Terminal-bench 2.1에서는 78.0%에 도달합니다.
컴퓨터 사용 분야에서 가장 큰 도약이 나타납니다. 데스크톱 및 앱을 구동하는 모델을 평가하는 OSWorld-Verified에서 3.6 Flash는 3.5 Flash의 78.4%에서 83.0%로 상승했습니다. 이는 실제 인터페이스를 통해 클릭하는 에이전트를 구축하는 모든 사람에게 의미 있는 성과입니다.
광범위한 품질 측면에서는 GDPVal-AA v2 Elo 점수 1421을 기록했습니다. GDPVal은 실제 전문가 작업을 측정하며, Elo 점수는 체스 등급처럼 모델을 서로 비교하여 평가하므로 숫자가 높을수록 더 많은 대결에서 승리한다는 의미입니다.
긴 컨텍스트는 혼합된 결과이며, 솔직하게 말할 가치가 있습니다. 128k 토큰에서는 모델이 검색에서 평균 91.8%를 기록하며, 이는 강력한 수치입니다. 포인트별 검색을 통해 전체 1M 토큰 창으로 밀어 넣으면 정확도는 54.0%로 떨어집니다. 간단히 말해, 모델은 대규모 입력에서 날카로움을 유지하지만, 전체 컨텍스트 창을 채울 때 완벽한 회수를 기대하지 마십시오. 실제로 사용하는 길이로 직접 검색을 테스트하십시오.
가격 한눈에 보기
Gemini 3.6 Flash는 백만 입력 토큰당 $1.50, 백만 출력 토큰당 $7.50의 비용이 듭니다. 출력 가격에는 생각 토큰이 포함되므로 최종 답변에서 볼 수 없는 추론도 요금에 포함됩니다. 컨텍스트 캐싱은 백만 토큰당 $0.15에 저장 시간당 백만 토큰당 $1.00가 부과되며, 이는 동일한 대규모 프롬프트를 반복해서 보낼 때 도움이 됩니다.
Google AI Studio를 통해 무료 등급이 제공됩니다. 이는 속도 제한이 있으며, Google은 제품 개선을 위해 무료 등급 데이터를 사용할 수 있으므로 프로토타이핑용이지 프로덕션용은 아닙니다. Gemini 3.6 Flash를 무료로 사용하는 방법에서 제한 사항 및 세부 정보를 다루고 있으며, Gemini 3.6 Flash 가격에서 예시와 함께 전체 비용 분석을 제공합니다. Google의 자체 수치는 Gemini API 가격 페이지에 있습니다.
Gemini 3.6 Flash 액세스 방법
다음과 같은 몇 가지 방법이 있습니다:
- Google AI Studio를 통한 Gemini API. 키를 받아 어떤 REST 클라이언트나 SDK에서도
gemini-3.6-flash를 호출할 수 있습니다. Android Studio도 앱 개발을 위해 이를 연결합니다. - Google의 에이전트 개발 표면인 Google Antigravity에서 모델을 사용할 수 있습니다.
- 직장에서 관리형 에이전트를 구축하는 팀을 위한 Gemini Enterprise Agent Platform.
- 직접 채팅하고 싶다면 Gemini 앱.
대부분의 개발자에게는 API가 중요한 경로입니다. Gemini 3.6 Flash API 사용 방법에 대한 단계별 안내가 있으며, 이전 버전에서 오신 분들을 위해 Google Gemini 3 API 가이드에서도 요청 형식과 인증을 다루고 있습니다. 공식 참조 자료는 ai.google.dev에 있습니다.
Google 제품군 내 위치
Flash 리프레시를 비용-품질 사다리로 생각해보세요. Gemini 3.5 Flash-Lite는 3.6 Flash보다 아래에 위치합니다. 백만 토큰당 입력 $0.30, 출력 $2.50로 더 저렴하고, 초당 약 350개 출력 토큰으로 빠릅니다. 주력 모델의 완벽한 품질이 필요 없는 대용량, 지연 시간에 민감한 작업에는 Flash-Lite를 선택하세요. 작업이 더 어렵거나 출력이 더 신뢰할 수 있어야 할 때는 3.6 Flash를 선택하세요.
이제 솔직한 주의사항입니다. Gemini 3.5 Pro는 아직 출시되지 않았습니다. Google은 여전히 파트너와 테스트 중이라고 밝혔으므로, 이번 웨이브에는 공개 Pro 모델이 없으며 대부분의 보도가 이 공백을 지적했습니다. Google은 또한 Gemini 4 사전 훈련 실행을 예고하며 가장 야심찬 모델이라고 불렀지만, 예고는 출시가 아닙니다. 둘 다 오늘 바로 호출할 수 있는 것이 아닙니다. 지금 당장 최첨단 플래그십이 필요하다면 3.6 Flash는 아닙니다. 이것은 저렴하고 빠르게 대규모로 작동하도록 구축된 빠른 미드티어 모델이며, 정확히 그 역할을 수행합니다.
이전 세대에 대해서는 Gemini 3.5란 무엇인가 설명서에서 이 모델들이 개선된 기준을 제공합니다.
Apidog에서 Gemini 3.6 Flash 테스트하기
모델 페이지는 최상의 시나리오 숫자를 인용합니다. 3.6 Flash가 사용자의 프롬프트와 컨텍스트 길이에 대해 무엇을 반환하는지 아는 유일한 방법은 호출을 보내고 응답을 확인하는 것입니다. 바로 여기서 API 클라이언트의 가치가 빛을 발합니다.
Apidog는 API 클라이언트이자 테스트 플랫폼으로, Gemini 엔드포인트를 다른 REST 호출과 동일하게 취급합니다. 다음은 깔끔한 설정 방법입니다:
- Gemini API 엔드포인트에
POST요청을 생성하고 모델을gemini-3.6-flash로 설정합니다. - API 키를 URL에 붙여넣는 대신 Apidog 환경 변수에 저장합니다. 이렇게 하면 요청을 편집하지 않고도 테스트 키와 프로덕션 키를 전환할 수 있습니다.
- 호출을 보내고 응답을 읽습니다. 상태 코드와 관심 있는 JSON 필드에 어설션을 추가하여, 잘못된 페이로드나 스키마 변경이 조용히 통과하는 대신 큰 소리로 실패하도록 합니다.
- 회귀 테스트로 저장하고 모델 업데이트 후 응답 형식이나 지연 시간이 변경될 때 이를 감지할 수 있도록 실행 일정을 예약합니다.
이것이 무엇을 하고 무엇을 하지 않는지 명확히 하십시오. Apidog는 모델을 실행하지 않으며 AI 프레임워크도 아닙니다. 요청을 만들고, 보내고, 응답을 설정한 표준에 맞추는 데 사용하는 도구입니다. Google이 다음 Flash 업데이트를 출시하면, 저장된 테스트가 의존하는 모든 것이 변경되었는지 몇 분 안에 알려줄 것입니다. 첫 번째 요청을 연결하고 싶다면 Apidog를 다운로드하십시오.
자주 묻는 질문
Gemini 3.6 Flash는 무료인가요? Google AI Studio를 통해 무료 등급이 제공되지만, 속도 제한이 있으며 프로토타이핑용입니다. Google은 제품 개선을 위해 무료 등급 데이터를 사용할 수 있습니다. 프로덕션 트래픽의 경우 토큰당 비용을 지불해야 합니다: 입력 백만 개당 $1.50, 출력 백만 개당 $7.50.
Gemini 3.6 Flash가 3.5 Flash보다 더 좋은가요? 대부분의 작업에서는 그렇습니다. 약 17% 적은 출력 토큰을 사용하고, 출력 가격은 백만 개당 $9.00에서 $7.50로 떨어졌으며, OSWorld-Verified에서 78.4%에서 83.0%로 향상되는 등 코딩 및 컴퓨터 사용 능력이 더 강력합니다. 3.5 Flash를 대체하는 기본 주력 모델입니다.
Gemini 3.5 Pro는 출시되었나요? 아니요. Google은 여전히 파트너와 3.5 Pro를 테스트 중이라고 밝혔으므로, 이번 릴리스에는 공개 Pro 모델이 없습니다. Gemini 4 사전 훈련 실행이 예고되었지만 출시되지는 않았습니다.
모델 ID는 무엇인가요? gemini-3.6-flash입니다. 다른 버전 번호를 가진 더 저렴한 Flash-Lite 등급인 gemini-3.5-flash-lite와 혼동하지 마십시오.
Gemini 3.6 Flash가 할 수 없는 것은 무엇인가요? 텍스트만 출력하므로 입력으로 읽을 수 있더라도 이미지, 오디오 또는 비디오를 생성하지 않습니다. 1M 토큰 창의 가장 먼 부분에서는 회수율이 떨어지며, 전체 길이 포인트별 검색에서 약 54.0%입니다. 그리고 최첨단 플래그십이 아닌 중간 등급의 주력 모델이므로, 정말 어려운 추론에는 적합한 등급을 선택해야 합니다.
Gemini 3.6 Flash는 이제 대부분의 Gemini API 트래픽이 실행되어야 할 모델입니다. 이전 버전에 비해 더 저렴하고, 토큰 효율성이 높으며, 에이전트 작업 능력이 뛰어납니다. 대규모로 마이그레이션하기 전에 몇 개의 저장된 API 테스트를 통해 의존하는 부분을 확인하십시오. Flash-Lite, Cyber 또는 결국 Pro 및 Gemini 4가 출시되면 자신의 응답에서 무엇이 변경되었는지 정확히 알게 될 것입니다.
