Gemini 3.6 Flash vs 3.5 Flash: 무엇이 달라졌고, 업그레이드해야 할까?

제미니 3.6 플래시 대 3.5 플래시: 입력 $1.50로 동일, 출력 $7.50로 인하, 출력 토큰 17% 감소, 컴퓨팅 사용 점수 상승. 무엇이 달라졌고, 업그레이드해야 할까요?

Ashley Innocent

Ashley Innocent

22 July 2026

Gemini 3.6 Flash vs 3.5 Flash: 무엇이 달라졌고, 업그레이드해야 할까?

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

Google은 2026년 7월 21일에 Flash 티어를 업데이트했으며, 주력 모델은 Gemini 3.6 Flash로 버전이 업그레이드되었습니다. 프로덕션 환경에서 3.5 Flash를 사용 중이라면, 요점은 다음과 같습니다. 3.6 Flash는 더 저렴하고 토큰 효율성이 높은 드롭인 대체 모델이며, 대부분의 팀은 업그레이드해야 합니다. 동일한 모델 패밀리, 동일한 1M 토큰 컨텍스트, 동일한 입력 가격을 유지합니다. 출력 토큰당 비용이 저렴하며, 모델은 동일한 작업을 완료하기 위해 더 적은 출력 토큰을 사용합니다. 새 모델에 대한 자세한 내용은 Gemini 3.6 Flash란 무엇인가를 참조하세요.

버튼

간단한 답변

업그레이드하세요. Gemini 3.6 Flash는 백만 토큰당 입력 가격을 1.50달러로 유지하고, 출력 가격을 백만 토큰당 9.00달러에서 7.50달러로 인하했으며, 동일한 작업에서 3.5 Flash보다 약 17% 적은 출력 토큰을 생성합니다. 또한 컴퓨터 사용 벤치마크(OSWorld-Verified에서 78.4점 대비 83.0점)에서 더 높은 점수를 기록하고, 다단계 워크플로우에서 추론 단계를 줄입니다. 보류할 유일한 이유는 3.5 Flash를 프로덕션 환경에서 고정 및 검증했고 아직 평가를 다시 실행할 수 없기 때문입니다.

Gemini 3.6 Flash 대 3.5 Flash 비교

다음은 Google의 출시 수치에서 가져온 중요한 비교입니다. 자세한 내용은 Google 블로그 게시물 및 DeepMind Flash 모델 페이지에서 확인할 수 있습니다.

속성 Gemini 3.6 Flash Gemini 3.5 Flash
모델 ID gemini-3.6-flash gemini-3.5-flash
입력 가격 (1백만 토큰당) $1.50 $1.50
출력 가격 (1백만 토큰당) $7.50 $9.00
출력 토큰 효율성 출력 토큰 약 17% 감소 기준
컴퓨터 사용 (OSWorld-Verified) 83.0 78.4
컨텍스트 창 1M 입력 토큰 1M 입력 토큰

입력 가격은 변동이 없었습니다. 컨텍스트 창도 변동이 없었습니다. 변경 사항은 출력 측면과 모델이 답변을 도출하는 효율성 측면에 있습니다.

실제로 개선된 점

네 가지 사항이 변경되었으며, 이것이 마이그레이션해야 하는 이유입니다.

더 적은 출력 토큰. Gemini 3.6 Flash는 동일한 작업에서 3.5 Flash보다 약 17% 적은 출력 토큰을 생성합니다. 출력 토큰에는 사고(thinking) 토큰이 포함되므로, 더 효율적인 추론기는 동일한 답변에 도달하기 위해 더 적게 작성합니다. 모든 출력 토큰에 대해 비용을 지불하므로, 이는 허영 지표가 아닌 직접적인 비용 절감입니다.

더 낮은 출력 가격. Google은 출력 가격을 백만 토큰당 9.00달러에서 7.50달러로 인하했습니다. 이는 토큰당 요금에서 17%의 가격 인하이며, 위에서 언급한 토큰 수 감소 외에 추가적인 절감입니다.

더 나은 컴퓨터 사용 능력. 실제 컴퓨터 인터페이스를 구동하는 벤치마크인 OSWorld-Verified에서 3.6 Flash는 3.5 Flash의 78.4점 대비 83.0점을 기록했습니다. UI를 클릭하거나 양식을 작성하거나 도구를 조작하는 에이전트를 구축하는 경우, 이 차이는 실패한 단계가 줄어드는 것으로 나타납니다.

더 적은 추론 단계 및 도구 호출. 다단계 에이전트 워크플로우에서 3.6 Flash는 더 적은 추론 단계와 더 적은 도구 호출로 목표에 도달합니다. 회피된 각 도구 호출은 비용을 지불하지 않고 기다리지 않는 왕복이므로, 이는 에이전트적인 모든 작업에서 토큰 절감과 함께 복합적으로 작용합니다. 코딩 정확도도 향상되었는데, 이는 모델이 파일을 편집하거나 잘못된 토큰 하나가 빌드를 망가뜨릴 수 있는 차이점을 생성하는 경우에 중요합니다.

이러한 변경 사항은 API의 형태를 바꾸지 않습니다. 동일한 요청 형식, 동일한 입력 모달리티(텍스트, 이미지, 비디오, 오디오, PDF), 동일한 텍스트 출력을 유지합니다.

청구서에 미치는 영향

두 가지 비용 절감 효과가 중첩됩니다. 출력 토큰당 더 낮은 가격을 얻을 수 있고, 지불해야 할 출력 토큰도 줄어듭니다. 이들은 단순히 더해지는 것이 아니라 곱해집니다.

다음은 설명적인 예시입니다. 일일 작업이 3.5 Flash에서 1천만 개의 출력 토큰을 생성한다고 가정해 봅시다.

이는 해당 워크로드의 출력 측면에서 약 31% 절감된 것이며, 프롬프트를 하나도 변경하지 않았습니다. 입력 가격이 백만 토큰당 $1.50으로 동일하고 프롬프트가 변경되지 않았기 때문에 입력 비용은 변동이 없습니다. 도구 호출이 많은 에이전트 워크로드에서는 왕복 횟수가 줄어들어 실행 전체의 총 토큰이 감소하기 때문에 감소폭이 더 커질 수 있습니다.

실제 수치는 입력-출력 비율에 따라 달라집니다. 많이 읽고 적게 쓰는 작업(분류, 추출)은 절감액이 출력에 집중되므로 전체 변경폭이 작습니다. 많이 쓰는 작업(초안 작성, 코드 생성, 긴 에이전트 추적)은 가장 큰 이점을 얻습니다. 요금, 캐싱 및 사고 토큰 세부 사항에 대한 자세한 내용은 Gemini 3.6 Flash 가격 및 공식 Gemini API 가격 문서를 참조하세요.

3.5 Flash를 고수해야 할 이유가 있을까요?

네, 아주 제한적인 이유가 있습니다. 자신이 어떤 경우에 해당하는지 솔직하게 판단해 보세요.

3.5 Flash를 고정할 합법적인 이유는 이미 프로덕션 환경에서 검증했으며 지금은 다시 테스트할 수 없기 때문입니다. 아마도 규정 준수 승인과 연결된 잠긴 평가 스위트가 있을 수 있습니다. 또는 다운스트림 파서가 의존하는 프롬프트 튜닝된 출력이 있고, 이번 스프린트에는 회귀 테스트 기간이 열려 있지 않을 수도 있습니다. 모델 교체는 미묘한 방식으로 출력을 변경하며, "더 저렴하다"는 이유로 오늘 다시 검증할 수 없는 시스템에서 조용한 중단을 감수할 가치는 없습니다. 이 경우, 테스트 기간이 열릴 때까지 `gemini-3.5-flash`에 고정하고 의도적으로 마이그레이션하세요.

명확히 말하자면, 3.6이 출시되는 날 3.5 Flash가 사라지는 것은 아닙니다. 여전히 API를 통해 사용할 수 있으며, 여기에 고정하는 것은 유효한 단기적인 선택입니다. 이것은 "만약"이 아니라 "언제"의 문제입니다. 엄격한 유효성 검사 잠금이 없는 대부분의 팀에게는 비용과 품질 모두 지금 업그레이드를 가리킵니다.

마이그레이션 방법

기계적인 부분은 한 줄입니다. API 호출에서 모델 ID를 교체합니다:

이것이 전체 코드 변경입니다. 요청 본문, 인증 및 엔드포인트는 동일하므로 통합의 다른 어떤 것도 변경되지 않습니다. 요청별 전체 절차는 Gemini 3.6 Flash API 사용 방법 및 Gemini API 문서를 참조하세요.

진정한 작업은 교체가 아니라 검증입니다. 새 모델 ID를 프로덕션에 배포하기 전에:

  1. 3.6 Flash에 대해 평가 스위트를 다시 실행하고 3.5 Flash 기준과 품질 점수를 비교합니다.
  2. 출력 형태와 문구가 버전 간에 변경될 수 있으므로 회귀 테스트를 다시 실행합니다.
  3. 정확한 구조(JSON 키, 정규식, 다운스트림 스키마 유효성 검사)로 모델 출력을 구문 분석하는 모든 것을 확인합니다.
  4. 완전히 배포하기 전에 실제 트래픽 샘플에서 지연 시간과 토큰 수를 모니터링합니다.

출력이 다른 서비스에 전달되는 경우, 이 교체를 다른 종속성 업그레이드와 동일하게 취급하십시오: 플래그 뒤에서 변경하고, 비교한 다음, 승격시키세요.

Apidog에서 교체 회귀 테스트

Apidog가 마이그레이션에서 제 역할을 하는 부분입니다. Apidog는 API 클라이언트이자 테스트 플랫폼이므로, 3.6 Flash를 프로덕션에 신뢰하기 전에 그 동작을 입증할 자연스러운 장소입니다. 모델을 실행하는 것이 아니라, 요청을 보내고 응답을 확인합니다.

두 모델을 A/B 테스트하는 깔끔한 방법:

  1. 기존 Gemini 요청을 저장합니다. Apidog에서 Gemini API로 `POST` 호출을 구축하고, API 키를 환경 변수에 저장하여 요청 본문에 절대 노출되지 않도록 합니다.
  2. 복제합니다. 단 하나의 항목만 변경합니다: 모델 ID를 `gemini-3.5-flash`에서 `gemini-3.6-flash`로 변경합니다. 다른 모든 것은 동일하게 유지하여 동등한 비교를 수행합니다.
  3. 어설션을 추가합니다. 상태 코드 및 앱이 실제로 읽는 JSON 필드에 대해 어설션하여, 형태 변경이 다운스트림으로 누출되지 않고 크게 실패하도록 합니다.
  4. 응답 및 지연 시간을 비교합니다. 둘 다 실행하고, 출력을 나란히 놓고, 3.6 응답이 3.5 응답이 통과한 모든 어설션을 여전히 통과하는지 확인합니다. 각 응답 시간과 토큰 사용량을 기록합니다.
  5. 시간이 지나도 어설션을 계속 녹색으로 유지합니다. 둘 다 테스트 시나리오로 저장하고 회귀 테스트로 예약하여 향후 모델 또는 프롬프트 변경으로 인해 계약이 조용히 파기되지 않도록 합니다.

이것이 정직한 워크플로우입니다: 요청을 복제하고, 모델 ID만 변경하고, 어설션이 교체가 안전한지 알려주도록 합니다. 자신의 Gemini 호출에 대해 비교를 실행하려면 Apidog를 다운로드하세요.

자주 묻는 질문

Gemini 3.6 Flash가 3.5 Flash의 드롭인 대체 모델인가요? 기계적으로는 그렇습니다. 모델 ID를 `gemini-3.5-flash`에서 `gemini-3.6-flash`로 변경하면 나머지 요청은 동일하게 유지됩니다. 하지만 출력 문구와 구조가 버전 간에 변경될 수 있으므로 프로덕션 전에 평가 및 회귀 테스트를 다시 실행해야 합니다.

입력 가격이 변경되었나요? 아니요. 두 모델 모두에서 입력은 백만 토큰당 $1.50으로 유지됩니다. 출력 가격만 백만 토큰당 $9.00에서 $7.50으로 변경되었습니다.

모델은 3.6인데 Lite 및 Cyber 변형은 3.5인 이유는 무엇인가요? Google은 이번 업데이트에서 주력 Flash 모델만 3.6으로 올렸습니다. Flash-Lite 및 Flash Cyber는 3.5 버전으로 출시되었습니다. 버전 번호는 티어 전체에서 동기화되지 않으므로, 패밀리 번호만이 아닌 모델 ID를 확인하세요.

청구서가 31% 확실히 줄어들까요? 아니요, 해당 수치는 출력 중심 워크로드에 대한 예시일 뿐입니다. 실제 절감액은 입력-출력 토큰 비율에 따라 달라집니다. 출력 중심 작업이 가장 많이 절감되고, 읽기 중심 작업은 할인이 출력에 집중되므로 절감액이 적습니다.

3.5 Flash는 여전히 사용할 수 있나요? 네. API를 통해 계속 사용할 수 있습니다. 이미 검증했고 아직 다시 테스트할 수 없다면, 여기에 고정하는 것이 합리적인 단기적인 선택입니다. 다음 테스트 기간에 마이그레이션을 계획하세요.

이 모델이 대체하는 이전 세대에 대해서는 Gemini 3.5란 무엇인가를 참조하세요.

대부분의 팀에게는 계산과 벤치마크가 동의합니다: 모델 ID를 `gemini-3.6-flash`로 교체하고, Apidog에서 평가 및 빠른 회귀 테스트를 실행한 다음, 더 저렴하고 효율적인 모델을 사용하십시오. 유효성 검사 잠금으로 인해 강요되는 경우에만 3.5 Flash를 고정하고, 해당 기간이 열리는 즉시 마이그레이션하십시오.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요