Gemini 3.6 Flash 2026년 실제 비용

Gemini 3.6 Flash 가격 설명: 입력 1M당 $1.50, 출력 1M당 $7.50 (사고 토큰 포함), 캐싱 비용, 무료 등급, 그리고 월별 비용 예시.

Ashley Innocent

Ashley Innocent

22 July 2026

Gemini 3.6 Flash 2026년 실제 비용

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

Gemini 3.6 Flash는 1M 입력 토큰당 $1.50, 1M 출력 토큰당 $7.50의 비용이 듭니다. 이는 대체하는 모델보다 저렴합니다. Google은 2026년 7월 21일 이 업데이트를 출시했으며, API 요금을 주시하는 사람들에게 핵심은 간단합니다. 핵심 작업 모델인 Flash 티어가 동시에 더 빨라지고 저렴해졌다는 것입니다.

이 가이드에서는 예산 책정에 필요한 모든 숫자(토큰당 요금, 컨텍스트 캐싱 추가 사항, 무료 티어 포함 내용)와 코드 한 줄 작성 전에 월별 지출을 예측할 수 있는 예시를 설명합니다. 여기의 모든 수치는 Google 자체 Gemini API 가격 책정 문서출시 발표에서 가져왔습니다. 모델 전체 개요를 먼저 보려면 Gemini 3.6 Flash란 무엇인가를 읽어보세요.

숫자를 다루기 전에 한 가지 명명법에 대한 설명입니다. 핵심 작업 모델은 3.6 버전으로 올라섰지만, 더 저렴한 Flash-Lite 티어는 3.5에 머무릅니다. 동일한 출시이지만 버전이 혼합되어 있습니다. 이 점을 명확히 하면 가격 책정이 깔끔하게 정리됩니다.

Gemini 3.6 Flash 가격 한눈에 보기

항목 비용
입력 1M 토큰당 $1.50
출력 (사고 토큰 포함) 1M 토큰당 $7.50
컨텍스트 캐싱, 캐시된 입력 읽기 1M 토큰당 $0.15
컨텍스트 캐싱, 저장 시간당 1M 토큰당 $1.00
무료 티어 예, Google AI Studio를 통해 (속도 제한 적용)

즉시 강조해야 할 두 가지 사항이 있습니다. 출력 가격에는 사고 토큰이 포함되므로, 모델이 답변하기 전에 수행하는 추론은 별도의 항목이 아닌 1M 토큰당 $7.50의 출력 요금으로 청구됩니다. 그리고 컨텍스트 캐싱에는 두 가지 부분이 있습니다. 캐시된 입력에 대한 저렴한 읽기 요금과 캐시를 활성 상태로 유지하는 동안 적용되는 시간당 저장 요금입니다. 캐싱은 반복되는 컨텍스트에 대한 비용을 절약해주지만 무료는 아니므로, 동일한 프롬프트 접두사를 자주 재사용할 때만 절감 효과를 볼 수 있습니다.

Gemini 3.5 Flash와 비교

3.5 Flash의 1M 토큰당 $9.00였던 출력 요금이 3.6 Flash에서는 $7.50로 인하되었습니다. 이것만으로도 출력 토큰당 약 17% 더 저렴해진 것입니다.

더 중요한 소식은 Google이 DeepMind Flash 모델 페이지에서 보고한 내용입니다. 3.6 Flash는 동일한 작업에 대해 약 17% 더 적은 출력 토큰을 생성합니다. 더 적은 단계로 추론하고 다단계 작업에서 도구 호출 횟수가 줄어듭니다. 따라서 더 적은 토큰 더미에 대해 더 낮은 요금을 지불하게 됩니다. 이 두 가지 효과가 복합적으로 작용하며, 아래에서 실제 계산을 통해 보여드리겠습니다.

여전히 이전 모델을 기준으로 예산을 책정하고 있다면, Gemini 3.5 Flash 가격 분석을 함께 읽어볼 가치가 있습니다. 전체 기능 및 벤치마크 비교는 Gemini 3.6 Flash vs 3.5 Flash를 참조하세요. 지갑을 위한 요약: 3.6 Flash는 대체하는 모델보다 실행 비용이 적게 들며, 토큰 절약이 누적되는 더 길고 에이전트 기반의 워크로드에서 그 차이가 커집니다.

무료 티어가 제공하는 것

Google AI Studio를 통해 사용할 수 있는 실제 무료 티어가 있습니다. 신용카드 없이 Gemini 3.6 Flash를 호출하고 무료로 프로토타입을 만들 수 있습니다.

한계에 대해 스스로 솔직해지세요. 무료 티어는 속도 제한이 있으므로 프로토타입 제작 및 가벼운 테스트용이지 프로덕션 트래픽용이 아닙니다. 또한 Google은 제품 개선을 위해 무료 티어 데이터를 사용할 수 있습니다. 이는 무료 티어가 민감한, 독점적인 또는 고객 데이터를 위한 올바른 장소가 아니라는 것을 의미합니다. 실제 서비스로 전환할 때는 해당 데이터 사용 약관이 적용되지 않는 유료 키로 이동하세요.

무료 티어가 허용하는 사항과 설정 방법에 대한 전체 내용은 Gemini 3.6 Flash를 무료로 사용하는 방법을 참조하세요. 여기에는 "무제한 무료" 옵션이 없으므로, 출시 후에는 유료 사용으로 전환할 계획을 세우세요.

비용 계산 예시

하루에 많은 양을 읽고 적은 양을 쓰는 에이전트(2M 입력 토큰 및 500k 출력 토큰)를 운영한다고 가정해 봅시다. 이는 문서를 가져와 짧은 답변을 반환하는 검색 중심 어시스턴트의 현실적인 모습입니다.

Gemini 3.6 Flash의 일일 요금은 다음과 같습니다.

이제 복합 효과를 살펴보겠습니다. 3.5 Flash에서 동일한 작업이 600k 출력 토큰을 생성했다고 가정해 봅시다. 3.6 Flash에서는 17% 감소로 인해 이 수치가 약 500k로 줄어들며, 이는 위에서 예산을 책정한 수치입니다. 출력 항목만 비교해 봅시다.

출력 측면만 보면 하루에 $1.65, 한 달에 약 $49.50가 절약됩니다. 가격 인하와 토큰 감소가 각각 약 17%에 불과함에도 불구하고 출력 비용은 약 31% 감소합니다. 더 저렴한 토큰과 더 적은 토큰의 조합에서 진정한 절감 효과가 나타납니다.

Flash-Lite는 훨씬 저렴합니다.

작업이 간단하다면 핵심 작업 모델 아래에 티어가 있습니다. Gemini 3.5 Flash-Lite는 1M 입력 토큰당 $0.30, 1M 출력 토큰당 $2.50의 비용이 들며, 캐싱은 1M당 $0.03에 동일하게 시간당 1M당 $1.00의 저장 비용이 붙습니다. 초당 약 350개의 출력 토큰으로 빠르게 실행됩니다.

Flash-Lite에서 동일한 2M 입력 및 500k 출력 워크로드를 실행하면 일일 요금은 약 $1.85, 월별 약 $55.50가 됩니다. 이는 동일한 토큰 수에 대해 3.6 Flash보다 약 70% 저렴한 것입니다.

함정은 품질입니다. Flash-Lite는 분류, 추출, 라우팅, 짧은 구조화된 답변과 같이 볼륨이 많고 복잡도가 낮은 작업에 최적화되어 있습니다. 이것은 같은 것의 약한 버전이 아니라 비용, 품질 및 지연 시간 곡선상의 다른 지점입니다. 작업이 간단하고 볼륨이 많을 때 Flash-Lite를 사용하고, 더 어려운 추론에는 3.6 Flash를 사용하세요. 전체 그림을 보려면 Gemini 3.5 Flash-Lite란 무엇인가를 읽고, 그 다음 Gemini 3.5 Flash-Lite vs 3.6 Flash를 읽어 각 경로에 맞는 티어를 선택하세요.

비용을 제어하고 측정하는 방법

요금을 낮추는 네 가지 방법:

  1. 반복되는 컨텍스트를 캐시하세요. 모든 요청이 긴 시스템 프롬프트 또는 동일한 참조 문서를 공유하는 경우, 컨텍스트 캐싱은 1M당 $1.50 대신 캐시된 읽기에 대해 1M당 $0.15를 청구합니다. 1M당 시간당 $1.00의 저장 요금을 기억하세요. 따라서 캐싱은 한 번 사용하는 것이 아니라 시간 내에 접두사를 자주 재사용할 때 효과를 발휘합니다.
  2. 프롬프트를 다듬으세요. 출력은 입력 가격의 5배이지만, 불필요하게 늘어난 입력도 대규모에서는 비용을 증가시킵니다. 상투적인 문구를 제거하고 최대 출력 토큰을 제한하여 제어 불능의 응답으로 인해 놀라지 않도록 하세요.
  3. 간단한 작업을 Flash-Lite로 라우팅하세요. 분류 및 추출은 더 저렴한 티어로 보내고, 다단계 추론에는 3.6 Flash를 사용하세요. 혼합 라우팅은 모든 것에 하나의 모델을 선택하는 것보다 더 나은 경우가 많습니다.
  4. 실제 토큰 사용량을 측정하세요. 추정치는 틀릴 수 있습니다. 모든 Gemini 응답의 usageMetadata는 호출이 사용한 입력, 출력 및 사고 토큰 수를 정확히 알려주며, 이것이 귀하의 청구서가 기반으로 하는 숫자입니다.

이 마지막 지점에서 API 클라이언트의 가치가 드러납니다. Apidog에서는 Gemini API에 대한 POST 요청을 구축하고, 환경 변수에 키를 저장하며, 실제 프롬프트에 대해 실제 호출을 보낼 수 있습니다. 응답에서 usageMetadata 필드를 바로 읽어 요청당 실제 토큰 수를 확인한 다음, 출력 토큰을 두 배로 늘리는 프롬프트 변경이 조용히 요금을 두 배로 늘리는 대신 테스트에 실패하도록 어설션을 추가하세요. 심지어 이러한 API 테스트를 예약하여 주기적으로 실행하고 비용 회귀를 조기에 감지할 수도 있습니다. 따라하고 싶으신가요? Apidog를 다운로드하고 프로덕션에 연결하기 전에 Gemini 엔드포인트로 요청을 보내보세요.

자주 묻는 질문

Gemini 3.6 Flash는 1M 토큰당 얼마인가요? 입력은 $1.50, 출력은 $7.50입니다. 컨텍스트 캐싱 읽기는 1M당 $0.15이며, 저장 비용은 시간당 1M당 $1.00입니다.

출력 가격에 사고 토큰이 포함되나요? 예. 모델이 답변하기 전에 수행하는 추론은 1M 토큰당 $7.50의 출력 요금으로 청구됩니다. 사고 토큰에 대한 별도 요금은 없지만, 총 출력량에 포함되므로 더 많은 추론은 더 큰 청구서를 의미합니다.

정말 무료 티어가 있나요? 예, Google AI Studio를 통해 제공되며 속도 제한이 있습니다. 프로토타입 제작 및 테스트용이며 프로덕션용이 아닙니다. Google은 제품 개선을 위해 무료 티어 데이터를 사용할 수 있으므로 민감한 데이터는 유료 키에 보관하세요.

Gemini 3.6 Flash가 3.5 Flash보다 저렴한가요? 예. 출력 요금이 $9.00에서 $7.50로 떨어졌고, 3.6 Flash는 동일한 작업에 대해 약 17% 더 적은 출력 토큰을 사용합니다. 두 가지 효과가 복합적으로 작용하여 실제 출력 비용은 약 31% 감소할 수 있습니다.

대신 Flash-Lite는 언제 사용해야 하나요? 작업이 간단하고 볼륨이 높을 때입니다. Flash-Lite는 입력 $0.30, 출력 $2.50로 동일한 토큰 수에 대해 약 70% 더 저렴하고 빠르지만, 3.6 Flash가 더 어려운 추론을 더 잘 처리합니다.

Gemini 3.6 Flash는 가격이 인하되고 모델은 동시에 더 좋아진 드문 가격 업데이트입니다. 입력 $1.50, 출력 $7.50으로 예산을 책정하고, 사고 토큰이 출력 요금에 포함된다는 점을 기억하며, 캐싱과 Flash-Lite 라우팅을 활용하여 나머지 비용을 절감하세요. Gemini API 비용이 릴리스별로 어떻게 변화했는지에 대한 역사적 맥락을 보려면 Gemini 3.0 API 비용 분석이 유용한 기준점이 될 수 있습니다. 그런 다음 Apidog에서 자신의 호출을 측정하여 계획한 토큰 수가 실제로 지불하는 토큰 수가 되도록 하세요.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요