Gemini 3.8 Flash vs 3.7 Flash: 무엇이 달라졌고, 업그레이드해야 할까?

제미니 3.8 플래시 vs 3.7 플래시: 가격, 속도, 컨텍스트는 동일하지만, AA 지수에서 +3, tau3-뱅킹에서 +12, 그리고 작업당 출력 토큰이 30% 더 많습니다. 업그레이드?

Medy Evrard

3 September 2026

Gemini 3.8 Flash vs 3.7 Flash: 무엇이 달라졌고, 업그레이드해야 할까?

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

구글은 2026년 9월 2일 Gemini 3.7 Flash 출시 3주 후, 3.6 Flash 출시 6주 후에 Gemini 3.8 Flash를 출시했습니다. 동일한 출시 가격(12월 31일까지 백만 토큰당 입력 $0.75, 출력 $3.75), 동일한 100만 토큰 컨텍스트, 그리고 구글 자체 설명에 따르면 거의 동일한 속도를 제공합니다. 변경된 점은 모델의 작동 방식입니다. 더 작은 추론 단계를 거치고, 자체 출력을 확인하며, 도구를 반복적으로 호출합니다. 이로 인해 모든 공개된 벤치마크에서 더 높은 점수를 얻습니다. 또한 각 작업에 더 많은 토큰 비용이 발생합니다.

따라서 업그레이드 질문은 “3.8 Flash가 더 나은가?”가 아닙니다. 서류상으로는 그렇습니다. 문제는 추가된 품질이 작업량에 필요한 추가 토큰 비용을 상쇄하는지, 그리고 두 가지 주요 변경 사항이 코드에 영향을 미치는지 여부입니다. 이 비교는 무엇이 동일하게 유지되었는지, 무엇이 개선되었는지, 비용이 얼마나 드는지, 그리고 작업량별 결정 매트릭스를 다룹니다. 출처는 구글의 출시 게시물, Gemini 3.8 Flash의 새로운 기능 페이지, 그리고 Artificial Analysis의 독립적인 테스트입니다. 전체 사양서는 Gemini 3.8 Flash란 무엇인가에서 시작하세요.

한 가지 더 말씀드리자면, 구글은 “Gemini 3.7 Flash는 계속해서 완전히 지원됩니다”라고 밝혔으며, 사용 중단 날짜를 발표하지 않았습니다. 아무도 여러분에게 강요하지 않습니다.

측면 비교

Gemini 3.8 Flash Gemini 3.7 Flash
모델 ID gemini-3.8-flash gemini-3.7-flash
출시일 2026년 9월 2일 2026년 8월 13일
기반 "Gemini 3.7 Flash 기반" (모델 카드) 해당 없음
컨텍스트 / 최대 출력 1,048,576 / 65,536 토큰 동일
입력 가격 (출시, 12월 31일까지) 백만당 $0.75 백만당 $0.75
출력 가격 (출시, 12월 31일까지) 백만당 $3.75, 추론 포함 백만당 $3.75, 추론 포함
표준 가격 (2027년 1월 1일부터) $1.50 / $7.50 $1.50 / $7.50
컨텍스트 캐시 읽기 백만당 $0.075 (출시) 동일
배치 50% 할인, 동일한 대기열 토큰 계층 동일
추론 레벨 low, medium (기본), high low, medium, high
minimal 추론 레벨 유효성 검사 오류 허용됨 (구글 마이그레이션 참고: low로 매핑)
지식 마감일 2026년 3월 3.8 문서에서 재언급되지 않음
출력 속도 (Artificial Analysis) ~300 토큰/초 (302.1 측정됨, 높음) 구글에 따르면 "거의 동일한 속도"
Artificial Analysis 지능 지수 59 (높음) 56 (높음)
지원 상태 현재 "완전 지원 유지", 서비스 종료일 없음

동일한 점

먼저 가격입니다. 두 모델 모두 구글의 가격 페이지에서 동일한 요금표에 있습니다. 12월 31일까지 입력 $0.75, 출력 $3.75이며, 2027년 1월 1일에는 $1.50 및 $7.50으로 두 배가 됩니다. 캐싱, 배치 할인, 그리고 월 5,000건의 무료 구글 검색 기반 요청(모든 Gemini 3.x 모델에서 공유) 모두 동일하게 적용됩니다. 줄별 세부 정보를 원하시면, 3.7 Flash 사양 및 가격 참조가 3.8 Flash에도 그대로 적용됩니다.

컨텍스트 및 출력 한도는 1,048,576 입력 토큰과 65,536 출력 토큰으로 변경되지 않았습니다. 모달리티도 동일합니다: 텍스트, 이미지, 비디오, 오디오, PDF 입력; 텍스트 출력. 두 모델 모두 오디오 생성, 이미지 생성 또는 Live API를 지원하지 않습니다.

속도는 거의 동일합니다. 구글의 Logan Kilpatrick은 3.8 Flash를 “3.7과 동일한 가격, 거의 동일한 속도”라고 설명했습니다. Artificial Analysis는 높은 추론 실행에서 초당 302.1개의 출력 토큰을 측정했습니다. 이는 모델이 쓰기 시작한 후의 처리량입니다. 동일한 실행에서 첫 토큰까지의 시간은 13.30초였습니다. high 레벨에서는 모델이 말하기 전에 생각하기 때문입니다.

API 표면도 동일합니다. 현재 Interactions API는 Gemini 3.x의 구글의 주요 경로이며, 레거시 generateContent 엔드포인트는 서비스 종료일 없이 “완전히 지원됩니다”. 두 엔드포인트 중 하나에서 3.7 Flash용으로 작성된 코드는 모델 문자열 교체 후 gemini-3.8-flash에 대해 실행됩니다. 단, 주요 변경 사항에 해당하는 예외는 제외됩니다.

개선된 점

구글이 3.8 Flash에 대해 내세우는 핵심 문구는 “우리의 가장 지능적인 Flash 모델”이며, “장기 소프트웨어 엔지니어링, 자율 에이전트, 복잡한 엔터프라이즈 워크플로우”를 위해 구축되었습니다. 이 주장의 배경에 있는 설계 변경 사항은 어려운 작업에서 모델이 “추가 추론 단계를 실행하고, 도구를 반복적으로 호출”하며, “더 작은 추론 단계를 거치고” “작업을 진행하면서 자체 검증”한다는 것입니다. 다음은 구글과 Artificial Analysis가 텍스트로 공개한 벤치마크 결과입니다.

구글 자체 표. 구글은 DeepMind Flash 페이지에 3.7 Flash 대비 세 가지 수치 비교를 게시했습니다. 이들은 벤더가 자체 실행한 것입니다.

벤치마크 (구글 실행) 3.8 Flash 3.7 Flash 차이
Vals 금융 에이전트 v2 61.4% 59.0% +2.4
HLE-검증됨 54.9% 53.6% +1.3
Harvey 법률 에이전트 벤치마크 10.0% 8.8% +1.2

꾸준하고 완만한 성능 향상이 있었으며, 각 항목에서 3.8 Flash는 구글 표의 더 큰 모델들(Vals Finance에서 Claude Opus 5가 58.6%, HLE-Verified에서 54.4%)보다 우위에 있습니다. Claude Fable 5.1 및 GPT-5.6 Sol과의 삼자 비교는 이 논점을 더 심화시킵니다. 이는 토큰당 비용이 몇 배 더 비싼 모델보다 Flash 가격의 모델이 더 높은 점수를 받았다는 것이며, 구글이 강조하고 싶은 점입니다.

Artificial Analysis, 독립적으로. Artificial Analysis 보고서에 따르면, 3.8 Flash는 high 레벨에서 지능 지수 59점을 기록하여 3.7 Flash의 56점과 3.6 Flash의 52점보다 높습니다. 이는 릴리스당 3점씩 상승한 것으로, 3.8 Flash는 xhigh 레벨의 GPT-5.6 Sol 및 medium 레벨의 Grok 4.6과 동점을 이루며, medium 레벨의 Claude Fable 5.1보다 1점 높습니다. 도구 사용 평가인 τ³-Banking에서 3.8 Flash는 45%를 기록하여 3.7 Flash보다 12점 상승했습니다. 실제 도구 호출을 사용하는 에이전트를 실행하는 경우, 이 항목이 지수보다 더 중요합니다.

문서 중심 에이전트 작업. 구글은 3.8 Flash가 장기간 실행되는 문서 중심 워크플로우에서 “Gemini 3.7 Flash보다 세 배 이상 많은 작업을 완료한다”고 말합니다. 이는 내부 평가이며 공개적인 테스트 도구가 없으므로, 참고 자료로만 활용하십시오. 하지만 모델의 설계와 일치합니다: 더 많은 검증 단계는 단 한 번의 실수가 40단계 작업을 망칠 수 있는 상황에서 가장 큰 도움이 됩니다.

코딩, 기록에 공백이 있음. DeepSWE v1.1에서 3.7 Flash는 3.6 Flash의 49.0%에서 상승한 65.3%를 기록했습니다. 구글은 3.8 Flash가 “비용의 극히 일부로” “대부분의 더 큰 프론티어 모델보다 뛰어난 성능”을 보인다고 말하지만, 3.8의 정확한 백분율은 텍스트가 아닌 모델 카드의 이미지 표에만 나타나므로 숫자를 인쇄하지 않겠습니다. 3.8 Flash의 SWE-Bench Pro, Terminal-bench, OSWorld 수치는 텍스트로 전혀 공개되지 않았습니다. 이러한 벤치마크가 결정에 영향을 미친다면, 타사 실행 결과를 기다리십시오.

안전 및 주입 방어. 구글은 Gray Swan 프롬프트 주입 테스트에서 구체적인 수치 없이 “상당한 도약”을 보고합니다. 모델 카드에서 3.7 Flash 대비 변화는 미미합니다: 다국어 안전 +5.4점, 텍스트-텍스트 안전 -0.4점, 부당한 거부 +1.1점. 마지막 항목은 과도한 거부의 약간 증가로 해석할 수 있습니다.

비용

토큰당 가격은 변동이 없었습니다. 작업당 비용은 변동되었습니다. 이는 구글이 공개적으로 밝힌 절충안입니다. 모델은 “더 길고 복잡한 작업에서 설계상 더 많은 토큰을 사용할 수 있으며,” “특히 더 높은 노력 수준에서 성능을 극대화하기 위해 더 많은 토큰을 사용할 수 있습니다.”

Artificial Analysis가 이를 수치화했습니다. 지수 실행 결과, 3.8 Flash는 작업당 평균 48,000개의 출력 토큰을 사용했으며, 이는 3.7 Flash보다 30% 더 많습니다. 토큰당 가격이 동일하더라도, 이는 완료된 작업당 더 높은 비용으로 이어집니다.

구성 (Artificial Analysis) 작업당 비용 작업당 시간
Gemini 3.7 Flash, high $0.40 2.2분
Gemini 3.8 Flash, low $0.24 0.8분
Gemini 3.8 Flash, medium $0.41 미공개
Gemini 3.8 Flash, high $0.58 2.5분

이 표에서 세 가지 사실을 알 수 있습니다. 첫째, high 레벨의 3.8 Flash는 high 레벨의 3.7 Flash보다 작업당 약 45% 더 많은 비용이 들고, 실제 소요 시간은 14% 더 깁니다. 둘째, 기본값인 medium 레벨의 3.8 Flash는 high 레벨의 3.7 Flash와 1센트 이내로 비슷하므로, medium 품질이 기준을 충족한다면 “동일 예산”으로 업그레이드가 가능합니다. 셋째, low 레벨의 3.8 Flash는 표에서 가장 저렴하고 빠른 항목으로, 3.7 Flash가 습관적으로 high 레벨로 실행되던 지연 시간에 민감한 경로에 명확한 선택지가 됩니다.

3.8 Flash 가격 분석은 이를 일일 사용량에 적용합니다. 요약하자면: 작업당 비용을 지불하는 경우, 업그레이드는 무료가 아니며, 추론 수준은 개선 사항을 얼마나 구매할지 결정하는 데 사용하는 다이얼입니다.

주요 변경 사항 요약

두 가지 변경 사항이 기존 3.7 Flash 코드에 직접적인 영향을 미칩니다.

thinking_level: "minimal"은 유효성 검사 오류를 반환합니다. 3.8 Flash는 low, medium, high만 허용합니다. 3.7 구성에 minimal이 있다면, low로 매핑하십시오. 추론 레벨 가이드는 각 레벨의 기능, 비용 및 지연 시간을 다룹니다.

함수 응답은 call_idname을 포함해야 합니다. Interactions API의 모든 function_result는 두 필드를 모두 필요로 하며, 레거시 generateContent의 모든 functionResponse는 일치하는 idname을 필요로 합니다. 이름만으로 결과를 반환하는 코드는 도구 루프의 두 번째 턴에서 실패할 것입니다.

이 외에도, 3.7에서 3.8 Flash 마이그레이션 가이드는 전환 시 다시 확인해야 할 Gemini 3 규칙들을 설명합니다: temperature를 기본값 1.0으로 유지하고 (구글은 낮은 값이 “반복 또는 성능 저하를 유발할 수 있다”고 경고합니다), 정수 thinking_budget 대신 thinking_level을 사용하고, candidate_count를 제거하고, 받은 그대로 추론 서명을 다시 전달하십시오. 이러한 것들은 3.8에 새로 추가된 것이 아니지만, 이를 건너뛴 3.7 코드베이스는 이제 문제가 발생할 것입니다.

작업량별 결정 매트릭스

작업량 권장 사항 이유
도구 호출을 사용하는 다단계 에이전트 medium 또는 high로 업그레이드 τ³-Banking에서 +12점; 반복 도구 루프가 3.8의 핵심 기능
긴 문서 추출 및 검토 업그레이드 구글의 3배 작업 완료 주장이 바로 이 형태를 목표로 함
하네스 내 에이전트 코딩 업그레이드 후 측정 DeepSWE 텍스트 수치 미공개; 커밋 전 리포지토리에서 검증
금융, 법률, 연구 에이전트 업그레이드 공개된 구글의 세 가지 표 모두 3.8에 유리함
대량 분류, 추출, 채팅 3.7 유지 또는 low 레벨의 3.8 사용 여기서는 작업당 비용이 중요; low 레벨은 high 레벨의 3.7보다 저렴함
지연 시간에 민감한 사용자 대면 엔드포인트 low 레벨의 3.8 사용 AA 하네스에서 작업당 0.8분 vs high 레벨의 3.7은 2.2분
minimal 추론을 사용하는 모든 항목 먼저 마이그레이션 low로 매핑하기 전까지 유효성 검사 오류 발생
센트 단위로 가격이 책정되는 배치 파이프라인 재벤치마킹 전까지 3.7 유지 토큰당 가격은 동일하지만, 출력 토큰 +30%로 배치 비용 변경

패턴: 작업이 더 어렵고 길수록 3.8 Flash의 “더 열심히 일하는” 설계가 더 많은 토큰을 사용합니다. 작업이 짧고 반복적일수록 사용하는 토큰은 줄어들고, 추론 수준(또는 현상 유지)이 더 중요해집니다.

Apidog에서 동일한 테스트 시나리오로 두 모델 모두 실행

위 작업당 수치는 Artificial Analysis의 테스트 도구에서 나온 것이지 여러분의 것이 아닙니다. 프로덕션 환경에서 모델 문자열을 바꾸기 전에, 여러분 자신의 프롬프트를 두 모델 모두에서 실행하여 토큰 수를 비교하십시오. Apidog를 사용하면 이 작업을 10분 만에 수행할 수 있습니다.

Apidog 환경에서 GEMINI_API_KEY를 환경 변수로 설정하고, https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContentx-goog-api-key가 변수에서 읽어오도록 POST 요청을 하나 추가하십시오. model도 시나리오 변수로 만드십시오. 두 실행 모두 본문은 동일합니다:

{
  "contents": [{"parts": [{"text": "{{golden_prompt}}"}]}],
  "generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}

두 단계로 테스트 시나리오를 구성하십시오: modelgemini-3.7-flash로 설정된 요청, 그리고 동일한 요청을 gemini-3.8-flash로 실행합니다. 각 단계에서 예산을 반영하는 상한선을 사용하여 usageMetadata.candidatesTokenCountusageMetadata.thoughtsTokenCount에 대한 어설션을 추가하고, 애플리케이션이 읽는 필드에 대한 JSON-경로 어설션도 추가하십시오. 10개 또는 20개의 "황금 프롬프트(golden prompts)" 데이터 세트에 대해 시나리오를 실행하십시오. 테스트 보고서는 각 단계의 응답과 어설션 결과를 함께 보여주므로, 한 번의 실행으로 두 모델의 토큰 수를 읽을 수 있으며, +30% 수치가 벤치마크의 수치가 아닌 여러분 자신의 수치가 됩니다.

숫자가 올바르게 보이면, 모델 업데이트 후 추론 토큰의 조용한 증가가 청구서에 나타나는 대신 테스트에서 실패하도록 시나리오를 예약하십시오. 설정하려면 Apidog를 다운로드하십시오. 무료 플랜으로 이 워크플로우를 사용할 수 있습니다.

자주 묻는 질문

Gemini 3.8 Flash가 3.7 Flash보다 빠른가요?

아니요. 구글 자체 설명은 “거의 동일한 속도”이며, Artificial Analysis는 high 레벨에서 초당 약 300개의 출력 토큰을 측정했습니다. 3.8 Flash는 더 많은 단계로 추론하기 때문에, 자체 테스트 도구에서 작업당 실제 소요 시간이 증가했습니다 (high 레벨에서 2.5분 대 2.2분). low 레벨로 낮추면 0.8분으로 단축됩니다.

Gemini 3.8 Flash가 3.7 Flash보다 비용이 더 많이 드나요?

토큰당은 아닙니다. 둘 다 12월 31일까지 입력 $0.75, 출력 $3.75이며, 이후 $1.50 및 $7.50입니다. 작업당 비용은 더 많이 듭니다: 3.8 Flash가 3.7 Flash보다 약 30% 더 많은 출력 토큰을 사용하기 때문에, Artificial Analysis는 high 레벨에서 3.8 Flash는 $0.58, 3.7 Flash는 $0.40을 측정했습니다.

구글이 Gemini 3.7 Flash를 중단할 예정인가요?

구글은 3.7 Flash가 “완전히 지원됩니다”라고 밝혔으며, 서비스 중단 날짜를 발표하지 않았습니다. 계속 사용할 수 있습니다. 3.7 Flash의 새로운 기능 게시물은 여전히 해당 모델의 참조 자료입니다.

3.8 Flash로 전환할 때 무엇이 변경됩니까?

두 가지가 변경됩니다: thinking_level: "minimal"은 이제 400 INVALID_ARGUMENT 오류를 반환하며, 모든 함수 응답은 호출 ID (Interactions API에서는 call_id, 레거시 generateContent에서는 id)와 name을 모두 포함해야 합니다. Gemini 3 API의 다른 모든 것은 변경되지 않습니다.

이번 개선은 3.6에서 3.7로의 변화와 비교하면 어떻습니까?

3.7 Flash는 더 큰 도약이었습니다: DeepSWE는 49.0%에서 65.3%로, Artificial Analysis 지수는 52에서 56으로 상승했습니다. 3.8 단계는 지수에서 +3점 상승과 모델이 토큰을 사용하는 방식의 재설계입니다. 이전 세대에 대해서는 3.6 Flash vs 3.5 Flash를 참조하십시오. 이 게시물은 이 일련의 릴리스를 시작한 가격 인하를 다룹니다.

요약

작업량이 에이전트 기반, 도구 중심 또는 문서 중심이라면 업그레이드하십시오. 구글과 Artificial Analysis 모두 이 분야에서 성능 향상을 보였으며, 추가 토큰은 완료된 작업을 위해 사용됩니다. 작업당 비용이 중요한 짧고 반복적인 호출을 실행하는 경우 3.7 Flash를 유지하거나 low 레벨의 3.8로 전환하십시오. 어떤 경우든, 먼저 minimal 문제를 해결하고 함수 응답을 확인한 다음, 저희를 포함한 어떤 테스트 도구도 신뢰하기 전에 여러분 자신의 프롬프트에서 토큰 수를 측정하십시오.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요