제미니 3.8 플래시 가격: 초기 요금, 사고 토큰, 작업당 실제 비용

Gemini 3.8 Flash 가격: $0.75/$3.75 초기 요금 (2027년 1월 1일부로 두 배 인상), 사고 토큰의 출력 청구 방식, 캐싱, 배치, 그리고 작업당 비용이 $0.58로 상승한 이유.

Ashley Goolam

Ashley Goolam

3 September 2026

제미니 3.8 플래시 가격: 초기 요금, 사고 토큰, 작업당 실제 비용

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

Gemini 3.8 Flash는 100만 입력 토큰당 $0.75, 100만 출력 토큰당 $3.75의 비용이 듭니다. 이는 Google이 3.7 Flash에 책정한 것과 동일한 출시 기념 가격입니다. 이 가격은 2026년 12월 31일까지 유지됩니다. 2027년 1월 1일에는 각각 $1.50와 $7.50로 두 배가 되며, 같은 날 3.6 Flash와 3.7 Flash에도 동일하게 두 배 인상이 적용됩니다. 이번 출시로 토큰당 가격은 변동되지 않았습니다.

변경된 점은 모델이 사용하는 토큰 수입니다. Google은 3.8 Flash가 "더 열심히 작동"한다고 말합니다. 즉, 더 많은 추론 단계를 거치고, 도구를 반복적으로 호출하며, "설계상 더 길고 복잡한 작업에 더 많은 토큰을 사용할 수 있습니다." Artificial Analysis는 이 효과를 독립적으로 측정했습니다. 3.8 Flash에서 높은 사고 수준으로 Intelligence Index를 실행하는 데 작업당 $0.58가 들었으며, 3.7 Flash에서는 $0.40가 들었는데, 이는 작업당 약 30% 더 많은 출력 토큰을 사용했음을 의미합니다. 가격표는 동일하지만, 청구서 금액은 더 높아졌습니다.

이 가이드는 공식 Gemini API 가격 페이지의 모든 내용을 자세히 설명하고, 각 사고 수준별로 하루 1,000개 작업 예시를 다루며, Flash-Lite, Claude Sonnet 5, GPT-5.6 Luna와 비교합니다. 모델 개요를 먼저 보려면 Gemini 3.8 Flash란 무엇인가부터 시작하세요.

Gemini 3.8 Flash 가격 요약

모든 가격은 유료 등급에서 100만 토큰당 가격입니다.

요금 출시 기념 (2026년 12월 31일까지) 표준 (2027년 1월 1일부터)
입력 (텍스트, 이미지, 비디오, 오디오, PDF) $0.75 $1.50
출력 (사고 토큰 포함) $3.75 $7.50
컨텍스트 캐시 읽기 $0.075 $0.15
캐시 저장 (시간당 100만 토큰당) $0.50 $1.00
배치 API 입력 (50% 할인) $0.375 $0.75
배치 API 출력 (50% 할인) $1.875 $3.75
Google 검색 기반 제공 Gemini 3.x 전반에 걸쳐 월 5,000회 무료 요청 공유, 이후 1,000회당 $14 동일
무료 등급 $0, 속도 제한, Google 제품 개선을 위해 데이터 사용 동일

세 가지 세부 사항이 헤드라인 숫자보다 더 중요합니다. 출력 가격에는 사고 토큰이 포함되므로, 내부 추론 비용은 $0.75가 아닌 $3.75로 청구됩니다. 출시 기념 가격에는 명확한 종료일이 있습니다. 그리고 3.7 Flash 및 3.6 Flash 모델도 1월 1일에 동일하게 가격이 두 배로 오르므로, 이전 Flash 모델을 사용한다고 해서 인상을 피할 수 있는 것은 아닙니다. 3.7 Flash 가격 분석은 작업당 더 적은 토큰을 사용하는 모델에 대한 동일한 요금을 다룹니다.

사고 토큰은 출력 토큰입니다

Gemini 3.8 Flash는 답변하기 전에 추론하며, 그 추론의 모든 토큰은 출력으로 측정됩니다. API는 generateContent 응답에서 usageMetadata.thoughtsTokenCount로 이 수를 보고하는데, 이는 candidatesTokenCount (표시되는 답변) 및 promptTokenCount (사용자 입력)와는 별개입니다. 두 출력 버킷 모두 $3.75로 청구됩니다.

thinking_level (`low`, `medium`, `high`)을 사용하여 이 양을 조절할 수 있습니다. 3.8 Flash에서는 기본값이 Gemini 3 Pro의 `high`가 아닌 `medium`입니다. `minimal`은 없어졌으며 유효성 검사 오류를 반환하므로, 이전 모델에서 가져온 구성은 해당 값을 `low`로 매핑해야 합니다. Google의 사고 문서는 이 수준을 토큰 예산이 아닌 상대적인 노력으로 설명하므로, 이전의 정수 thinking_budget이 허용했던 방식처럼 사고 토큰을 직접 제한할 수는 없습니다. 각 수준이 지연 시간 및 비용에 미치는 영향은 3.8 Flash 사고 수준 가이드에 설명되어 있습니다.

가상의 실제와 유사한 크기로 간단히 설명해 보겠습니다. 요청이 10,000개의 입력 토큰을 보내고 2,000개의 가시적 출력 토큰과 6,000개의 사고 토큰을 돌려받는다고 가정해 봅시다. 출시 기념 가격으로 계산하면:

사고 토큰은 출력 요금의 75%, 전체 요청 비용의 60%를 차지합니다. 1월 1일부터는 동일한 요청에 $0.015 + $0.06 = $0.075가 소요됩니다. "3.7과 동일한 가격"이라는 말은 사실이지만 불완전합니다. 요금은 유지되었지만, 토큰 사용량이 증가했습니다.

가격은 그대로인데 작업당 비용이 증가한 이유

Google의 출시 게시물은 이러한 트레이드오프에 대해 명확하게 설명합니다. 복잡한 작업에서 모델은 "추가 추론 단계를 실행하고 도구를 반복적으로 호출"하여 작업 과정을 검증합니다. 더 많은 단계는 더 많은 사고 토큰을 의미하며, 에이전트 루프에서는 더 많은 도구 호출 횟수를 의미합니다. Google의 완화 조언: thinking_level을 낮추거나 3.7 Flash를 계속 사용하세요.

Artificial Analysis는 이에 대한 수치를 제시했습니다. 이들의 Intelligence Index는 9가지 평가를 실행했으며, 3.8 Flash (high)는 59점을, 3.7 Flash (high)는 56점을 기록했습니다. 3.8 Flash는 작업당 평균 약 48,000개의 출력 토큰을 사용했는데, 이는 3.7 Flash보다 30% 증가한 수치입니다. 인덱스 실행을 위한 작업당 비용:

구성 작업당 비용 (AA, 출시 기념 가격) 작업당 시간
Gemini 3.8 Flash, high $0.58 2.5분
Gemini 3.8 Flash, medium $0.41 미공개
Gemini 3.8 Flash, low $0.24 0.8분
Gemini 3.7 Flash, high $0.40 2.2분

이 표를 두 가지 방식으로 해석할 수 있습니다. 이전 모델과 비교했을 때, 3.8 Flash (high)는 3점의 인덱스 점수 향상을 위해 작업당 45% 더 많은 비용($0.58 / $0.40 = 1.45)이 듭니다. 자체적으로 비교하면, `high`에서 `medium`으로 낮추면 작업당 비용이 29% 감소하고($0.41 / $0.58 = 0.71), `low`로 낮추면 59% 감소합니다($0.24 / $0.58 = 0.41). 3.8 Flash의 `medium`은 3.7 Flash의 `high`와 1센트 이내로 비슷하여, 업그레이드 여부를 결정할 때 유용한 기준점이 됩니다. 3.8 Flash 대 3.7 Flash 비교는 워크로드별로 이러한 결정 과정을 설명합니다.

Artificial Analysis는 또한 3:1의 입력-출력 비율에서 100만 토큰당 $0.58의 혼합 가격을 제시합니다. 이것이 높은 수준의 작업당 비용과 일치하는 것은 우연입니다. 하나는 토큰당 요금이고 다른 하나는 모델이 사용하기로 선택하는 토큰 수에 따라 달라지기 때문입니다.

12월 31일 전에 출시 기념 가격을 확보하세요

"확보"라는 말은 정확한 의미를 가져야 합니다. 출시 기념 가격은 계약이 아니기 때문입니다. Google은 토큰이 사용될 때 적용되는 요금으로 사용량에 대해 청구하므로, 2026년 가격으로 2027년 사용량을 선불로 지불할 수 없으며, 3.7 또는 3.6 Flash로 전환하는 것도 도움이 되지 않습니다. 할 수 있는 것은 재량적인 작업을 해당 기간으로 옮기는 것입니다.

제공업체들 간에 가격이 결정적인 요소라면, 가장 저렴한 LLM API 제공업체 비교에서 전체 내용을 확인할 수 있습니다. Fable 5.1 및 GPT-5.6 Sol 비교는 프리미엄 등급을 다룹니다.

Flash-Lite, Sonnet 5, GPT-5.6 Luna와의 비교

토큰당 요금, 100만 토큰당:

모델 입력 출력 비고
Gemini 3.8 Flash (출시 기념) $0.75 $3.75 사고 토큰은 출력으로 청구; 캐시 읽기 $0.075
Gemini 3.8 Flash (1월 1일부터) $1.50 $7.50 캐시 읽기 $0.15
Gemini 3.5 Flash-Lite $0.30 $2.50 초당 약 350 토큰
Claude Sonnet 5 $2 $10 영구; 9월 1일 인상 취소
GPT-5.6 Luna $1 $6

출시 기념 가격으로, 3.8 Flash의 입력은 Flash-Lite의 2.5배, 출력은 1.5배입니다. Sonnet 5와 비교하면, 3.8 Flash는 입력($2 / $0.75) 및 출력($10 / $3.75) 모두 약 2.7배 저렴합니다. Luna와 비교해도 더 저렴합니다. 입력은 $0.75 대 $1, 출력은 $3.75 대 $6입니다.

1월 1일에는 상황이 뒤바뀝니다. $1.50 및 $7.50로, 3.8 Flash는 Luna보다 양쪽 모두에서 더 비싸지고, Sonnet 5와의 격차는 약 1.3배($2 / $1.50 및 $10 / $7.50)로 좁혀집니다. Flash-Lite는 계속 더 저렴합니다. 출시 기념 가격 때문에 3.8 Flash를 선택했다면, 지금 바로 1월 재평가를 달력에 표시해 두세요.

토큰당 비교는 절반에 불과합니다. 답변당 더 적은 토큰을 사용하는 모델은 더 높은 요금에도 불구하고 작업당 비용이 더 적을 수 있습니다. 이를 알 수 있는 유일한 방법은 각 후보 모델을 통해 동일한 작업 세트를 실행하고 사용량 카운트를 확인하는 것입니다. 3.8 Flash API 가이드는 Interactions API와 레거시 generateContent 모두에서 usageMetadata를 읽는 방법을 보여줍니다.

Apidog 토큰 어설션으로 비용 회귀를 감지하세요

3.8 Flash의 실패 모드는 틀린 답변이 아닙니다. 이는 프롬프트 조정이나 사고 수준 변경 후 조용히 40% 더 많은 토큰을 사용한 올바른 답변이며, 아무도 청구서를 받을 때까지는 알아차리지 못합니다. Apidog는 토큰 수를 상태 코드와 같이 어설션할 필드로 취급하여 이 문제를 해결합니다.

  1. 키를 환경 변수로 저장하세요. Apidog 환경에서 GEMINI_API_KEY를 생성하고 x-goog-api-key 헤더에서 {{GEMINI_API_KEY}}로 참조하여, 키가 저장된 요청에 절대 남아있지 않도록 합니다.
  2. 골든 프롬프트를 보내세요. 대표적인 프롬프트와 명시적인 thinkingConfig.thinkingLevel을 사용하여 https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContentPOST 요청을 저장합니다. 각 프로덕션 경로당 하나씩.
  3. 사용량 필드를 어설션하세요. usageMetadata를 읽고 토큰이 기준선에서 설정된 상한을 초과하면 테스트를 실패시키는 후처리 스크립트를 추가합니다.
const usage = pm.response.json().usageMetadata;
pm.test("thinking tokens within budget", () => {
  pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("visible output within budget", () => {
  pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("request cost within budget", () => {
  const cost = usage.promptTokenCount * 0.75 / 1e6
    + (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
  pm.expect(cost).to.be.below(0.05);
});
  1. 일정을 예약하세요. 요청을 테스트 시나리오에 넣고 예약된 시간에 실행하면, 토큰 사용량 증가가 당일 실패한 실행으로 표시됩니다. Apidog에서 API 테스트 예약 방법 가이드에서 설정 방법을 다룹니다. 1월 1일에 두 가지 요금 상수를 업데이트하면 비용 어설션이 계속 청구서를 추적합니다.

동일한 시나리오는 제공업체 간 비교 역할도 합니다. Flash-Lite, Sonnet 5 또는 Luna에 사본을 지정하고 사용량 필드를 나란히 비교해 보세요. 첫 번째 시나리오를 구축하려면 Apidog를 다운로드하세요. 무료 플랜으로 이 워크플로우를 사용할 수 있습니다.

자주 묻는 질문

Gemini 3.8 Flash는 3.7 Flash보다 비용이 더 많이 드나요? 토큰당으로는 그렇지 않습니다. 둘 다 12월 31일까지는 입력 $0.75, 출력 $3.75이며, 이후에는 $1.50와 $7.50로 변경됩니다. 작업당으로는 더 많이 듭니다. Artificial Analysis는 3.8 Flash (high)에서 인덱스 작업당 $0.58, 3.7 Flash에서는 $0.40로 측정했습니다. 이는 3.8 Flash가 약 30% 더 많은 출력 토큰을 생성하기 때문입니다.

사고 토큰은 별도로 청구되나요? 아니요. 사고 토큰은 100만 토큰당 $3.75(출시 기념)의 출력 토큰으로 청구되며 usageMetadata.thoughtsTokenCount에 표시됩니다. thinking_level을 통해 간접적으로 제어합니다. 3.8 Flash에는 엄격한 토큰 예산이 없으며, minimal은 오류를 반환합니다.

Gemini 3.8 Flash에 무료 등급이 있나요? 네. AI Studio 무료 등급은 입력 또는 출력에 비용을 청구하지 않으며, AI Studio에 속도 제한이 표시됩니다. Google은 무료 등급 데이터를 사용하여 제품을 개선합니다. 소비자용 Gemini 앱은 AI Pro 및 Ultra 구독자에게만 3.8 Flash를 제공합니다. 자세한 내용은 무료 사용 가이드에 있습니다.

2027년 1월 1일에 비용은 어떻게 되나요? 입력, 출력, 캐시 읽기, 캐시 저장, 배치 요금이 모두 두 배로 증가합니다. 작업당 토큰 사용량이 동일하게 유지된다면, 청구서도 두 배로 증가합니다. 3.6 및 3.7 Flash 모델의 요금도 같은 날 두 배가 됩니다.

어떤 사고 수준이 비용을 절감하나요? Artificial Analysis의 분산형 분석부터 시작하세요. 인덱스 작업당 low $0.24, medium $0.41, high $0.58입니다. 각 수준에서 자체 평가를 실행하고, 통과하는 가장 낮은 수준을 유지하며, 토큰 수를 어설션하여 설정이 변경되지 않도록 하세요.

이번 주에 할 일

Gemini 3.8 Flash는 3.7 Flash와 동일한 가격이지만 더 큰 모델처럼 토큰을 사용합니다. 사고 수준을 비용 설정으로 간주하고 경로별로 설정하세요. 12월 31일 전에 배치 친화적인 작업을 출시 기념 기간으로 옮기세요. 지금 토큰 사용량의 기준을 설정하고 이를 어설션하여, 1월 가격 인상이 이미 반영된 변경 사항이 되도록 하세요.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요