제미니 3.8 플래시란 무엇인가요?

제미니 3.8 플래시 설명: 2026년 9월 출시, 모델 ID, 100만 토큰 컨텍스트, 사고 수준, 초기 가격 $0.75/$3.75, 3.7 플래시 대비 벤치마크, 더 많은 토큰을 사용하는 이유.

Ashley Innocent

Ashley Innocent

3 September 2026

제미니 3.8 플래시란 무엇인가요?

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

Gemini 3.8 Flash는 Google의 최신 Flash 등급 모델로, Gemini 3.8 Flash Cyber라는 보안 게이트가 적용된 쌍둥이 모델과 함께 2026년 9월 2일에 출시되었습니다. 이는 7월 21일의 Gemini 3.6 Flash와 8월 13일의 3.7 Flash에 이어 6주 만에 출시된 세 번째 Flash 모델이며, 3.7 Flash와 동일한 출시 가격인 2026년 12월 31일까지 백만 입력 토큰당 $0.75, 백만 출력 토큰당 $3.75입니다. Google은 이를 "장기적인 소프트웨어 엔지니어링, 자율 에이전트 및 복잡한 엔터프라이즈 워크플로를 위해 설계된 가장 지능적인 Flash 모델"이라고 부릅니다.

가장 중요한 변화는 새로운 가격이나 더 커진 컨텍스트 창이 아닙니다. 바로 모델의 동작입니다. Google은 3.8 Flash가 어려운 작업에 대해 "더 열심히 일하도록" 설계했습니다. 더 작은 추론 단계를 거치고, 작업 과정에서 스스로를 검증하며, 도구를 반복적으로 호출합니다. 이는 에이전트 벤치마크에서 측정 가능한 성능 향상을 가져오지만, 설계상 모델이 작업당 더 많은 토큰을 사용한다는 것을 의미합니다. Artificial Analysis는 3.7 Flash보다 약 30% 더 많은 출력 토큰을 측정했습니다. 토큰 단위로 예산을 책정한다면 가격은 동일하지만, 작업 단위로 예산을 책정한다면 비용이 증가했습니다.

이 가이드는 출시 전반에 걸쳐 사양, "더 열심히 일하는" 트레이드오프, 벤치마크, 가격, 가용성, Cyber 쌍둥이 모델, 그리고 모델이 할 수 없는 것들을 다룹니다. 여기의 모든 요청은 JSON을 사용하는 일반 HTTP이므로, 애플리케이션 코드에 도달하기 전에 Apidog에서 구축하고 검사할 수 있습니다. Google의 출시 게시물모델 페이지가 주요 정보원입니다.

Gemini 3.8 Flash 한눈에 보기

사양
API 모델 ID gemini-3.8-flash (안정, 프리뷰 접미사 없음)
출시일 2026년 9월 2일
기반 모델 Gemini 3.7 Flash (DeepMind 모델 카드 기준)
컨텍스트 창 1,048,576 입력 토큰
최대 출력 65,536 토큰
입력 양식 텍스트, 이미지, 비디오, 오디오, PDF
출력 양식 텍스트 전용
사고 수준 low, medium (기본), high; minimal은 오류 반환
출시 가격 (2026년 12월 31일까지) 백만 토큰당 $0.75 입력 / $3.75 출력; 사고 토큰은 출력으로 청구
표준 가격 (2027년 1월 1일부터) 백만 토큰당 $1.50 입력 / $7.50 출력
컨텍스트 캐싱 백만 캐시된 토큰당 $0.075 (출시), $0.15 (표준)
Batch API 50% 할인: $0.375 / $1.875 (출시)
지식 마감일 2026년 3월
개발자 가용성 Gemini API, Google AI Studio, Android Studio, Google Antigravity, Stitch, Gemini Enterprise
소비자 가용성 Gemini 앱 (AI Pro 및 Ultra 구독자), 검색의 AI 모드, Google Sheets의 Gemini
3.7 Flash 상태 완전히 지원 유지; 지원 중단일 없음

세 가지 항목을 다시 살펴볼 필요가 있습니다. 기본 사고 수준은 Gemini 3 Pro의 high가 아닌 medium이므로, Pro에 맞춰 조정된 프롬프트는 수준을 설정하지 않으면 여기에서 추론을 덜 수행합니다. minimal 수준은 자동으로 low로 매핑되지 않고 유효성 검사 오류를 반환합니다. 사고 수준 가이드에서 해결 방법을 다룹니다. 또한 2026년 3월의 지식 마감일은 모델 카드에 주의사항이 있는데, 일부 도메인에서는 지식이 2025년 1월로 제한될 수 있다는 것입니다.

Gemini 3.8 Flash란 무엇인가

Flash는 Google의 주력 모델 등급입니다. Pro 모델이 가장 어려운 문제를 처리하는 동안 대부분의 프로덕션 트래픽을 처리하도록 의도된 모델입니다. Google은 3.8 Flash를 "현재까지 가장 지능적인 주력 모델"이라고 부르며, DeepMind 모델 카드는 새로운 기본 모델이 아닌 3.7 Flash를 기반으로 한다고 설명합니다. 따라서 솔직한 평가는 3주 전에 출시된 모델을 장기적인 소프트웨어 엔지니어링 및 에이전트 작업에 맞춰 개선한 버전이라고 할 수 있습니다.

출시 주기는 이례적입니다. 3.6 Flash는 7월 21일에 $1.50 / $7.50으로 출시되었고, 3.7 Flash는 8월 13일에 $0.75 / $3.75의 출시 가격으로, 그리고 3.8 Flash는 9월 2일에 동일한 가격으로 출시되었습니다. Google은 이를 "6주 만에 세 번째 Flash 출시"라고 표현합니다. Artificial Analysis는 3.5 Flash-Lite를 포함하여 4개월 내에 네 번째 Flash 모델로 계산합니다. 모델 구성을 유지하는 사람에게는 3.7 Flash의 새로운 기능 게시물이 3주 전에 게시되었지만 이미 이전 세대를 설명하고 있습니다. 이번 출시에서는 Gemini 3.8 Pro, Gemini 4 또는 새로운 Flash-Lite가 함께 제공되지 않았으며, Google은 Pro 업데이트가 언제 나올지에 대해 언급하지 않았습니다.

"더 열심히 일하는" 설계와 그로 인한 비용

Google이 설명하는 변화는 구체적입니다. 복잡한 작업에서 3.8 Flash는 "추가 추론 단계를 실행하고, 도구를 반복적으로 호출합니다." "더 작은 추론 단계를 거치고" "작업 과정에서 스스로를 검증합니다." Google은 그 결과에 대해 직접적으로 언급합니다. 즉, 특히 더 높은 노력 수준에서 모델이 "설계상 더 오래 실행되고 복잡한 작업에서 더 많은 토큰을 사용할 수 있다"는 것입니다.

Artificial Analysis는 독립 보고서에서 이를 측정했습니다. 그들의 Intelligence Index를 실행한 결과, 3.8 Flash는 높은 추론 수준에서 작업당 평균 48,000개의 출력 토큰을 사용했으며, 이는 3.7 Flash 대비 30% 증가한 수치입니다. 토큰당 가격은 변동이 없었으므로, 작업당 비용은 3.7 Flash의 높은 추론 수준에서 $0.40에서 3.8 Flash의 높은 추론 수준에서 $0.58로 상승했습니다. 작업당 시간도 2.2분에서 2.5분으로 증가했습니다.

동일한 보고서는 여러분이 가진 제어 수단을 보여줍니다. medium 수준에서는 작업당 비용이 3.7 Flash의 높은 수준과 비슷한 $0.41로 떨어집니다. low 수준에서는 작업당 0.8분으로 $0.24로 떨어집니다. 따라서 사고 수준은 이제 전역 설정이 아니라 라우팅 결정이 됩니다. 즉, 지연 시간에 민감한 엔드포인트는 low로, 작업을 반드시 완료해야 하는 에이전트 루프는 medium 또는 high로 설정하는 것입니다. 가격 분석은 각 수준에서 하루 1,000개의 에이전트 작업에 대한 비용을 설명합니다.

속도는 변하지 않았습니다. Google의 Logan Kilpatrick은 3.8 Flash를 "3.7과 동일한 가격, 거의 동일한 속도"라고 설명했으며, Artificial Analysis는 높은 추론 수준에서 초당 302.1개의 출력 토큰을 측정했습니다. 해당 실행에서 첫 토큰까지의 시간(13.30초)은 느린 네트워크 경로가 아니라 모델이 답변하기 전에 생각하는 시간입니다.

벤치마크 결과

Google은 DeepMind Flash 페이지에 세 가지 벤치마크 표를 텍스트 형식으로 게시했습니다. 이 수치들은 Google에서 직접 실행한 결과입니다.

벤치마크 3.8 Flash 3.7 Flash Claude Opus 5 GPT-5.6 Sol GPT-5.6 Terra Claude Sonnet 5
Vals 금융 에이전트 v2 61.4% 59.0% 58.6% 53.8% 54.4% 53.9%
Harvey 법률 에이전트 벤치마크 10.0% 8.8% 6.7% 2.5% 0.8% 5.0%
HLE-검증됨 54.9% 53.6% 54.4% 54.5% 51.1% 31.0%

3.7 Flash 대비 개선은 2.4, 1.2, 1.3 포인트입니다. 미미한 수치이지만, 금융 및 법률 부문에서는 Flash 가격대의 모델이 토큰당 몇 배 더 비싼 Opus 5와 GPT-5.6 Sol을 앞섰습니다. 전날 출시된 Claude Fable 5.1은 Google의 표에 나타나지 않습니다. 삼자 비교는 Anthropic의 Opus 5 및 Sonnet 5 항목을 가장 가까운 공개 항목으로 사용합니다.

Google은 텍스트 형식의 수치 없이 세 가지 주장을 더 합니다. DeepSWE v1.1에서 3.8 Flash는 "대부분의 더 큰 최첨단 모델보다 뛰어난 성능"을 "적은 비용으로" 보여줍니다. 이 백분율은 모델 카드의 이미지 표에만 나타나므로 여기에 인쇄하지 않습니다 (3.7 Flash는 65.3%를 기록했습니다). 문서 작업이 많은 장기 워크플로우에서 내부 평가는 3.8 Flash가 "Gemini 3.7 Flash보다 세 배 이상 많은 작업을 완료한다"고 보여줍니다. Gray Swan 프롬프트 주입에서는 Google이 수치 없이 "상당한 도약"을 보고합니다. SWE-Bench Pro, Terminal-bench, OSWorld 결과는 3.8 Flash에 대해 텍스트로 게시되지 않았습니다.

독립적인 견해도 일치합니다. Artificial Analysis는 그들의 Intelligence Index에서 3.8 Flash (high)를 59점으로 평가했으며, 이는 3.7 Flash의 56점과 3.6 Flash의 52점보다 높은 수치입니다. 이 점수는 GPT-5.6 Sol (xhigh) 및 Grok 4.6 (medium)과 동점이며, GPT-5.6 Terra (max), Claude Fable 5.1 (medium), Muse Spark 1.2 (xhigh) (모두 57점)보다 높습니다. 그들의 τ³-Banking 도구 사용 평가에서 3.8 Flash는 45%를 기록하여 3.7 Flash보다 12점 높았습니다. 3.8 Flash 대 3.7 Flash 비교는 이러한 개선 사항을 워크로드별 토큰 비용과 비교합니다.

가격: 토큰당 동일, 작업당 증가

가격 페이지에는 3.8 Flash가 3.6 및 3.7 Flash와 동일한 행에 나열되어 있으며, 세 모델 모두 2027년 1월 1일에 가격이 두 배로 인상됩니다.

항목 2026년 12월 31일까지 2027년 1월 1일부터
입력 $0.75 / 100만 $1.50 / 100만
출력 (사고 토큰 포함) $3.75 / 100만 $7.50 / 100만
캐시된 입력 $0.075 / 100만 $0.15 / 100만
캐시 저장소 $0.50 / 100만 토큰 / 시간 $1.00 / 100만 토큰 / 시간
Batch 입력 / 출력 $0.375 / $1.875 $0.75 / $3.75

두 가지 세부 사항이 사람들을 혼란스럽게 합니다. 사고 토큰은 출력 토큰으로 간주됩니다. 출력 요율로 청구되며 usageMetadata.thoughtsTokenCount에 별도로 보고되므로, high 수준의 짧은 답변이 low 수준의 긴 답변보다 비용이 더 많이 들 수 있습니다. 또한 Google Search grounding은 자체 측정 기준이 있습니다. 모든 Gemini 3.x 모델에서 공유되는 월 5,000건의 무료 요청이 제공되며, 이후에는 1,000건의 요청당 $14가 부과됩니다.

AI Studio 및 API에는 사용량 제한이 있는 무료 등급이 존재하며, Google은 무료 등급 데이터가 "제품 개선에 사용된다"고 언급합니다. 모델별 사용량 제한은 문서가 아닌 AI Studio에 표시됩니다. 청구 계정을 연결하면 Tier 1이 해제되고, $100 지출 및 3일 후 Tier 2, $1,000 지출 및 30일 후 Tier 3가 해제됩니다. 무료 액세스 가이드는 무료 경로로 무엇을 얻을 수 있고 얻을 수 없는지 다루며, Batch API 가이드는 대기 가능한 작업에 대한 50% 할인 혜택을 다룹니다.

호출 방법

Google은 이제 Interactions API를 Gemini 3.x의 기본 경로로 취급합니다. generateContent는 "레거시로 간주"되지만 "완전히 지원 유지"되며 서비스 중단 날짜는 없으며, 대부분의 기존 코드는 여전히 이를 사용합니다. 최소한의 Interactions 요청은 다음과 같습니다.

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"medium"}}'

다중 턴 대화는 previous_interaction_id를 전달하여 서버가 상태를 유지하게 합니다. 함수 호출은 JSON 스키마를 사용하여 도구를 선언하고, function_call 단계를 수신하며, 3.8 Flash에서 필수인 call_idname을 모두 포함하는 function_result를 기대합니다 (레거시 generateContent에서는 필드 이름이 id입니다). API 튜토리얼은 REST 및 Python에서 두 엔드포인트를 모두 보여주며, 함수 호출 가이드는 "더 열심히 일하는" 설계가 생성하는 반복적인 도구 루프와 이를 제한하는 방법을 다룹니다.

3.7 Flash에서 마이그레이션하는 경우, 변경 사항은 작지만 오류를 유발할 수 있습니다. minimal 사고는 거부되고, thinking_budgetthinking_level로 대체되며, candidate_count는 지원되지 않습니다. Google은 temperature를 기본값인 1.0으로 유지하라고 권장하는데, 낮추면 "루프 또는 성능 저하를 유발할 수 있기 때문"입니다. 마이그레이션 가이드는 Google의 새로운 기능 노트를 전후 JSON을 포함한 체크리스트로 변환합니다.

Gemini 3.8 Flash가 할 수 없는 것

모델 페이지에 명확히 설명되어 있습니다. 지원되지 않는 기능: 오디오 생성, Live API, 이미지 생성. 입력은 텍스트, 이미지, 비디오, 오디오, PDF를 허용하지만 출력은 텍스트 전용입니다. Gemini 3 모델에서는 이미지 분할도 지원되지 않습니다. 제품에 실시간 음성 또는 이미지 출력이 필요한 경우, 이 모델은 추론 및 도구 호출 계층이며 전체 스택이 아닙니다. 복잡한 추론 없이 저렴하고 처리량이 높은 텍스트를 위해서는 Gemini 3.5 Flash-Lite가 $0.30 / $2.50의 가격으로 가격표에 남아 있습니다. 나머지 체크리스트는 함수 호출, 구조화된 출력, 컨텍스트 캐싱, 코드 실행, 검색 및 지도 기반 작업, Batch API, 미리보기의 컴퓨터 사용을 포함하여 지원됩니다.

Gemini 3.8 Flash Cyber: 게이트가 적용된 쌍둥이

Gemini 3.8 Flash Cyber는 같은 날 출시되었지만, 등록할 수 없습니다. 접근은 새로운 Fairwind Program을 통해서만 가능하며, "신뢰할 수 있는 정부 기관, 중요 인프라 운영자 및 소프트웨어 관리자"에게 개방되며, 신원 조사 및 피싱 방지 MFA와 같은 요구 사항이 있습니다. 공개 API, 공개 가격, 자체 호스팅은 제공되지 않습니다. 이는 3.5 Flash Cyber 제한적 시범 프로그램을 대체합니다.

Google의 주장은 상당합니다. 20개 프로그래밍 언어에서 70% 이상의 실제 취약점 발견 성공률을 보이며, Chrome 보안 팀은 "훨씬 더 큰 상업용 모델보다 Chrome의 취약점에 대한 2.6배 더 정확한 패치"를 보고했습니다. 이 두 가지 모두 Google이 보고한 수치입니다. Cyber 설명은 자격, 의무, 그리고 접근할 수 없는 많은 팀에게 이것이 의미하는 바를 다룹니다.

Apidog에서 Gemini 3.8 Flash 요청 테스트하기

비용 책정이 토큰당이 아닌 작업당이므로, 유용한 테스트는 "호출이 성공했는가"가 아니라 "얼마나 많은 토큰을 소모했는가"입니다. Apidog는 이를 일반적인 API 테스트로 처리합니다. GEMINI_API_KEY를 환경 변수로 저장하고, Interactions 및 generateContent 요청을 엔드포인트로 저장한 다음, 상태 200, 앱이 읽는 JSON 필드, 그리고 usageMetadata.thoughtsTokenCount의 상한선에 대해 어설션을 설정하세요. 동일한 프롬프트를 low, medium, high 수준으로 하나의 테스트 시나리오에서 실행하면 Artificial Analysis의 평균 대신 자신만의 프롬프트에 대한 수준별 토큰 분포를 얻을 수 있습니다.

스트리밍 응답은 SSE로 렌더링되는데, 이는 includeThoughts: true를 사용하여 사고 요약을 디버깅할 때 유용합니다. SSE 테스트 가이드에서 이 과정을 설명합니다. 시나리오를 매일 예약하면 토큰 회귀가 청구서에 반영되기 전에 어설션에 실패합니다. 무료 플랜으로 설정하려면 Apidog를 다운로드하세요.

자주 묻는 질문

Gemini 3.8 Flash는 새로운 모델인가요 아니면 3.7 Flash의 업데이트인가요? DeepMind 모델 카드에 따르면 Gemini 3.7 Flash를 기반으로 합니다. 조정된 후속 모델로 간주하세요. 동일한 가격, 속도, 컨텍스트 창을 가지며, 어려운 작업에서 더 많은 추론 및 도구 호출 단계를 수행합니다. 3.7 Flash는 지원 중단일 없이 계속해서 완전히 지원됩니다.

Gemini 3.8 Flash는 왜 3.7 Flash보다 더 많은 토큰을 사용하나요? 설계상 그렇습니다. Google은 "더 오래 실행되고 복잡한 작업에서 더 많은 토큰을 사용할 수 있다"고 말하며, Artificial Analysis는 그들의 지수에서 30% 더 많은 출력 토큰을 측정했습니다. 추가 추론이 필요 없는 경로에서는 thinking_levelmedium 또는 low로 낮추세요. 사고 수준 가이드에 수준별 비용표가 있습니다.

Gemini 3.8 Flash의 컨텍스트 창은 얼마인가요? 1,048,576 입력 토큰과 65,536 출력 토큰이며, 2026년 12월 31일까지 백만 캐시된 토큰당 $0.075로 컨텍스트 캐싱이 제공됩니다.

무료 Gemini 앱에서 Gemini 3.8 Flash를 사용할 수 있나요? 출시 정보에 따르면 Gemini 앱은 Google AI Pro 및 Ultra 구독자를 위한 것이며, 무료 앱 등급은 해당되지 않습니다. 개발자는 AI Studio 및 API에서 사용량 제한이 있는 무료 등급을 이용할 수 있습니다.

Gemini 3.8 Flash는 Claude Fable 5.1과 어떻게 비교되나요? Artificial Analysis는 각각 59점과 57점으로 평가했습니다. 가격 면에서 Claude Fable 5.1은 백만 토큰당 $10 / $50으로, 3.8 Flash의 출시 가격(입력 및 출력 모두)보다 약 13배 비쌉니다. 작업당 토큰을 기준으로 계산하면 그 격차는 줄어듭니다.

다음 단계

Gemini 3.8 Flash는 더 오래 생각하는 주력 모델이며, 그 트레이드오프는 명확합니다. 에이전트 벤치마크에서 몇 점, 도구 사용에서 12점 더 높은 성능을 보이지만, 높은 추론 수준에서 약 30% 더 많은 출력 토큰을 소비합니다. 3.7 Flash에서 에이전트가 한계에 부딪혔다면, 업그레이드 비용은 토큰당 동일합니다. 트래픽이 지연 시간에 민감한 채팅이라면 low로 설정하거나 여전히 지원되는 3.7 Flash를 유지하세요. API 튜토리얼로 시작하고, Apidog에서 토큰 수 어설션을 첨부하여 첫 요청을 보내고, 출시 게시물이 아닌 실제 숫자가 각 경로의 사고 수준을 결정하게 하세요.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요