결정은 다음과 같습니다. 비용과 속도를 최우선으로 고려하며 대량의 간단한 작업을 실행할 때 Gemini 3.5 Flash-Lite를 선택하세요: 분류, 추출, 짧은 채팅 답변, RAG 답변, 자동 완성. 청구서보다 품질이 더 중요할 때 Gemini 3.6 Flash를 선택하세요: 다단계 에이전트, 도구 사용, 코딩, 컴퓨터 사용, 그리고 잘못된 결과가 큰 비용으로 이어지는 답변.
두 모델 모두 2026년 7월 21일 Google의 Flash-tier 업데이트에서 출시되었습니다. 두 모델 모두 최대 100만 개의 입력 토큰을 허용합니다. 이들은 동일한 곡선상에서 다른 지점에 위치하므로, 어떤 모델이 "더 좋다"는 질문은 사실 중요하지 않습니다. 중요한 것은 어떤 절충안이 당면한 작업에 적합한가입니다.
먼저 한 가지 명명법의 특이점을 명확히 하자면: 주력 모델은 3.6으로 올라갔지만, Lite 티어는 3.5에 머물렀습니다. 따라서 3.5 모델과 3.6 모델을 비교하는 것이며, 이는 예상된 것이지 오타가 아닙니다. 이에 대한 자세한 내용은 FAQ에서 확인할 수 있습니다.
간단히 말해서
수백만 번 실행하는 간단한 작업에는 Flash-Lite를 기본으로 사용하고, 작업에 추론, 도구 또는 코드가 필요할 때는 즉시 3.6 Flash를 선택하세요. 결정할 수 없다면 Flash-Lite로 시작하여 답변이 부족한 부분을 확인하고, 해당 호출만 3.6 Flash로 승격하세요. 전체 앱에 하나의 모델만 필요한 경우는 거의 없습니다.
가격과 속도 비교
| 특성 | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash |
|---|---|---|
| 모델 ID | gemini-3.5-flash-lite |
gemini-3.6-flash |
| 입력 가격 | $0.30 / 100만 토큰 | $1.50 / 100만 토큰 |
| 출력 가격 | $2.50 / 100만 토큰 | $7.50 / 100만 토큰 |
| 처리량 | 초당 약 350개 출력 토큰 | 별도 게시되지 않음 |
| 컨텍스트 창 | 100만 토큰 | 100만 토큰 |
| 무료 티어 | 예 (속도 제한) | 예 (속도 제한) |
Flash-Lite는 모든 토큰에서 더 저렴합니다. 입력은 5배, 출력은 3배 저렴합니다. Google은 Flash-Lite의 처리량으로 초당 약 350개 출력 토큰을 발표했으며, 이는 채팅 상자나 자동 완성 필드에서 즉각적으로 느껴지게 합니다. Google은 3.6 Flash에 대한 별도의 초당 토큰 수를 게시하지 않았지만, 3.6 Flash는 대체하는 3.5 Flash보다 약 17% 적은 출력 토큰을 생성하므로, 표시된 가격보다 다단계 작업을 더 빠르게 완료합니다. 현재 요금은 Gemini API 가격 페이지와 저희 Gemini 3.6 Flash 가격 분석에서 확인할 수 있습니다.
품질 및 벤치마크
가격 차이는 어려운 작업에 대한 여유 공간을 제공합니다. 에이전트 터미널 작업을 측정하는 Terminal-Bench 2.1에서 Flash-Lite는 54점, 3.6 Flash는 78.0점을 기록했습니다. 이 24점 차이가 전체 이야기를 말해줍니다: 진정한 다단계, 도구 기반 작업에서 3.6 Flash는 확실히 더 강력한 모델입니다.

3.6 Flash는 실제 브라우저나 데스크톱을 사용하는 것을 측정하는 컴퓨터 사용 벤치마크인 OSWorld-Verified에서 83.0점을 기록했습니다. Flash-Lite는 해당 기술을 목표로 하지 않습니다. 작업량이 화면을 클릭하는 것이라면, 그것은 3.6 Flash의 작업입니다. 코딩에 관해서는 3.6 Flash가 SWE-Bench Pro에서 58.7%, DeepSWE v1.1에서 49%를 기록하여 실제 에이전트 코딩 영역에 속하는 점수를 보여줍니다. Flash-Lite는 해당 작업을 목표로 하지 않습니다.
여기서 Flash-Lite에 대해 공정하게 평가할 필요가 있습니다. Terminal-Bench 2.1에서 54점은 이전 Lite 세대의 31점보다 향상된 것으로, 이번에 저가형 티어의 역량이 크게 강화되었습니다. 약한 모델이 아닙니다. 이 모델은 분기하지 않는 작업에서 빠르고 저렴하며 충분히 좋은 추론을 제공하도록 조정된 모델입니다. Google 자체의 Flash 모델 페이지와 출시 발표는 이 두 모델을 동일한 방식으로 설명합니다: 하나는 볼륨을 위한 티어, 다른 하나는 깊이를 위한 티어.
어떤 작업에 어떤 모델을 사용할까
이를 시작 기준으로 사용하고, 자체 평가를 통해 조정하세요.
| 작업 | 가장 적합한 모델 |
|---|---|
| 대량 분류 또는 추출 | Flash-Lite |
| 채팅 어시스턴트 및 짧은 답변 | Flash-Lite |
| 검색된 컨텍스트 기반 RAG 답변 | Flash-Lite |
| 자동 완성 스타일, 지연 시간에 민감한 UX | Flash-Lite |
| 검색 규모, 모든 요청 파이프라인 | Flash-Lite |
| 다단계 에이전트 | 3.6 Flash |
| 도구 사용 및 함수 호출 체인 | 3.6 Flash |
| 코딩 및 코드 검토 | 3.6 Flash |
| 컴퓨터 사용 (브라우저 또는 데스크톱) | 3.6 Flash |
| 오류로 인해 비용이 발생하는 중요 답변 | 3.6 Flash |
패턴은 간단합니다. Flash-Lite는 작업이 협소하고 볼륨이 엄청날 때 유리합니다. 3.6 Flash는 작업이 분기되고 잘못된 결과의 비용이 높을 때 유리합니다. 하루에 천만 번 지원 티켓을 카테고리별로 태그하는 모델은 Flash-Lite에 적합합니다. 스택 트레이스를 읽고, 세 개의 파일을 편집하고, 풀 리퀘스트를 여는 모델은 3.6 Flash에 적합합니다. Flash-Lite 대신 이전 3.5 Flash와 비교하고 있다면, 저희 3.6 Flash vs 3.5 Flash 비교에서 해당 업그레이드 경로를 다룹니다.
동일한 작업 부하에 대한 비용 비교
수치는 절충안을 구체적으로 보여줍니다. 매일 1천만 개의 입력 토큰을 보내고 2백만 개의 출력 토큰을 생성하는 작업이 있다고 가정해 봅시다. 이는 배치 요약 또는 추출 파이프라인의 일반적인 형태입니다.
| 모델 | 입력 (1천만) | 출력 (2백만) | 일일 총액 |
|---|---|---|---|
| Flash-Lite | $3.00 | $5.00 | $8.00 |
| 3.6 Flash | $15.00 | $15.00 | $30.00 |
이러한 혼합에서 3.6 Flash는 3.75배 더 비쌉니다: 하루에 $8.00 대 $30.00이며, 동일한 볼륨에 대해 월별 약 $240 대 $900입니다.
하지만 배율은 고정되어 있지 않습니다. Flash-Lite는 입력에서 5배, 출력에서 3배 저렴하므로, 실제 절감액은 트래픽 형태에 따라 3배에서 5배 사이가 됩니다. 입력 위주의 작업(긴 RAG 컨텍스트, 대용량 문서, 대용량 입력 분류)은 5배에 가까워지며, 이는 Flash-Lite가 구축된 정확한 작업 부하입니다. 출력 위주의 생성은 3배에 가깝습니다.
따라서 진짜 질문은 단순히 "3.6 Flash가 이것을 할 수 있는가?"가 아닙니다. "내 볼륨에서 호출당 3배에서 4배 더 많은 비용을 지불할 가치가 있는 품질 향상인가?"입니다. 검색 규모 파이프라인의 경우, 대개 답은 '아니오'입니다. 코드를 편집하거나 티켓을 발행하는 에이전트의 경우, 대개 답은 '예'입니다.
Apidog에서 두 모델을 A/B 테스트하는 방법
어떤 티어가 충분히 좋은지 추측할 필요가 없습니다. Gemini API는 일반 REST 엔드포인트이므로, 동일한 프롬프트를 두 모델에 보내 응답을 직접 비교할 수 있습니다. Apidog는 이러한 종류의 동시 비교를 위해 구축된 API 클라이언트입니다.

다음은 몇 분이 소요되는 워크플로입니다:
- Gemini API 엔드포인트에 POST 요청을 생성하고 API 키를 Apidog 환경 변수에 저장하여, 키가 요청 본문이나 버전 관리 시스템에 노출되지 않도록 합니다.
- 모델을
gemini-3.5-flash-lite로 설정하여 한 번 보냅니다. Apidog가 보고하는 응답과 지연 시간을 기록합니다. - 요청을 복제하고 한 가지를 변경합니다: 모델 ID를
gemini-3.6-flash로 변경합니다. 동일한 프롬프트, 동일한 매개변수이므로 유일한 변수는 모델입니다. - 두 응답의 품질을 비교하고, Apidog가 각 호출에 대해 기록한 타이밍을 비교합니다.
- 응답에 대한 어설션(상태 코드, 예상 JSON 필드, 필수 내용)을 추가하여 "충분히 좋음"이 육안이 아닌 검사를 통해 정의되도록 합니다.
요청이 생성되면, 이를 저장하고 반복 가능한 테스트로 만드세요. Google이 모델을 업데이트할 때 품질 또는 지연 시간 변화를 감지할 수 있도록 Apidog에서 API 테스트를 주기적으로 재실행하도록 예약할 수 있습니다. 경계를 명확히 하세요: Apidog는 요청을 보내고 어설션을 확인하지만, 모델을 실행하지 않으며 어떤 답변이 더 스마트한지 알려주지 않습니다. 그 판단은 여러분에게 달려 있습니다. 따라오려면 Apidog를 다운로드하고 Gemini 엔드포인트에 요청을 보내세요.
자주 묻는 질문
Flash-Lite는 3.6 Flash의 열등한 버전인가요? 아니요. 비용, 품질, 속도 곡선상의 다른 지점입니다. Flash-Lite는 더 저렴하고 빠르지만, 어려운 추론 능력에는 한계가 있습니다. 3.6 Flash는 비용이 더 들고 더 나은 추론 능력을 가집니다. 간단하고 대량의 작업에서는 Flash-Lite가 더 저렴하고 빠르기 때문에 종종 올바른 선택이 됩니다.
하나는 3.5이고 다른 하나는 3.6이라고 불리는 이유는 무엇인가요? 버전 혼용입니다. 이번 업데이트에서 Google은 주요 Flash 주력 모델을 3.6으로 옮겼지만, Lite 티어는 3.5를 유지했습니다 (동일한 릴리스에는 3.5 Flash Cyber 보안 모델도 포함되었습니다). 같은 계열이지만 버전 번호가 다릅니다. Flash-Lite의 3.5를 "오래되고 버려진" 것으로 해석하지 마세요.
동일한 컨텍스트 창을 공유하나요? 네. 두 모델 모두 최대 100만 개의 입력 토큰을 허용하므로, 긴 컨텍스트 프롬프트는 한 모델을 다른 모델보다 선택할 이유가 되지 않습니다. 대신 추론 품질, 가격, 속도를 기준으로 선택하세요.
하나의 앱에서 둘 다 사용할 수 있나요? 그것이 권장되는 패턴입니다. 저렴하고 간단하며 대량의 호출은 Flash-Lite로 라우팅하고, 어려운 호출은 3.6 Flash로 에스컬레이션하세요. API 형태가 동일하기 때문에 전환은 한 필드만 변경하면 되며, 이는 위 Apidog A/B 테스트를 빠르게 실행할 수 있게 하는 이유입니다.
무료로 사용해 볼 수 있나요? 두 모델 모두 Google AI Studio에서 속도 제한이 있는 무료 티어를 제공하며, Google은 무료 티어 데이터를 사용하여 제품을 개선할 수 있습니다. 이는 테스트에는 괜찮지만, 민감한 정보를 보내기 전에 약관을 읽어보세요.
결론
규모가 크고 저렴하며 빠른 간단한 작업에는 Flash-Lite를 기본값으로 사용하고, 24점의 Terminal-Bench 격차가 3~4배의 가격을 정당화하는 어려운, 분기형, 또는 코드 중심 호출은 3.6 Flash로 승격하세요. 추상적으로 선택하지 마세요. 실제 프롬프트를 두 모델에 모두 보내 품질과 지연 시간을 측정하고 숫자가 결정하게 하세요. Apidog는 이러한 비교를 두 번의 요청 작업으로 만듭니다.
