제미니 3.5 플래시 라이트란 무엇인가요?

Gemini 3.5 Flash-Lite는 Google의 가장 저렴하고 빠른 Gemini 티어입니다. 입력 0.30달러, 초당 약 350토큰입니다. 사양, 가격, 벤치마크, 그리고 테스트 방법을 알아보세요.

Ashley Innocent

Ashley Innocent

22 July 2026

제미니 3.5 플래시 라이트란 무엇인가요?

Apidog 엔터프라이즈

온프레미스 배포

SSO & RBAC

SOC 2 준수

Apidog Enterprise 살펴보기

구글은 2026년 7월 21일 Flash 티어를 새로 고쳤으며, Gemini 3.5 Flash-Lite는 그 중 가장 저렴한 모델입니다. 이는 현재 호출할 수 있는 가장 저렴하고 빠른 Gemini 모델이며, 높은 처리량과 저렴한 비용이 깊은 추론보다 더 중요한 분류, 추출, 짧은 채팅 응답, 간단한 검색 기반 답변과 같이 대량의 지연 시간에 민감한 작업을 위해 제작되었습니다. 하루에 수백만 건의 작은 요청을 처리해야 한다면, 구글이 가장 중요하게 여기는 경로에 이 티어가 적합합니다.

이번 업데이트로 세 가지 모델이 동시에 출시되었으며, 이름 때문에 혼란스러울 수 있으니 먼저 이를 명확히 정리한 다음 사양, 가격, 벤치마크, 그리고 직접 엔드포인트를 테스트하는 방법에 대해 알아보겠습니다.

버튼

Gemini 3.5 Flash-Lite는 무엇인가요?

Gemini 3.5 Flash-Lite는 구글 Gemini 제품군에서 가장 작고 저렴한 모델입니다. 가장 어려운 추론보다는 속도와 처리량에 최적화되어 있습니다. 구글에 따르면 초당 약 350개의 출력 토큰을 처리하여 부하가 걸린 상황에서도 응답이 거의 즉각적으로 느껴집니다. 모델 ID gemini-3.5-flash-lite를 사용하여 Gemini API를 통해 호출할 수 있습니다.

지루하고 반복적이며 빈번하게 발생하는 작업에 이 티어를 활용한다고 생각해보세요. 지원 티켓 태그 지정, 문서에서 필드 추출, 검색된 텍스트 청크에서 짧은 질문 답변, 사용자가 지연을 인지하기 전에 응답해야 하는 채팅 위젯 구동 등이 있습니다. 이러한 각각의 경우에 많은 요청을 보내게 되므로, 각 요청이 저렴하고 신속하게 처리되기를 원할 것입니다. Flash-Lite는 이러한 형태의 워크로드에 대한 구글의 답변입니다.

이는 세 가지 모델을 포함하는 Flash 업데이트의 일부로 출시되었습니다: 새로운 주력 모델인 Gemini 3.6 Flash, 이 Gemini 3.5 Flash-Lite, 그리고 게이트 보안 모델인 Gemini 3.5 Flash Cyber입니다. 관련 내용은 Google 블로그에서 구글의 자체 설명을, DeepMind Flash 페이지에서 모델 세부 정보를 확인할 수 있습니다. Flash-Lite는 이 스택에서 가격 면에서는 가장 낮고, 순수 속도 면에서는 가장 높습니다.

잠깐, 왜 3.6이 아니라 3.5인가요?

혼란스러운 부분이 바로 이것입니다. 새로운 주력 모델은 Gemini 3.6 Flash입니다. 하지만 Flash-Lite는 3.5 버전을 유지했으며, 게이트 Cyber 보안 모델도 마찬가지입니다. 따라서 한 번의 출시, 같은 날, 세 가지 모델이 두 가지 버전 번호로 나뉘었습니다. 이는 구글의 오타나 이 기사의 실수가 아닙니다. 구글은 혼합된 버전 관리를 적용했습니다: 플래그십 Flash는 3.6으로 올라갔지만, Lite 및 Cyber 변형은 3.5 라벨을 유지했습니다.

구글은 왜 이렇게 하는 걸까요? 버전 번호는 출시 이벤트가 아닌 모델 자체를 추적합니다. 주력 모델은 더 큰 세대별 개선을 거쳐 3.6 태그를 얻었습니다. Flash-Lite도 새로운 모델이지만, 구글은 이를 3.5 라인에 맞춰 유지하기로 결정했습니다. 추적하기 번거롭지만, 그렇게 라벨이 지정되었습니다.

지금 해결해야 할 또 하나의 혼란의 원인이 있습니다. Gemini 3.5 Flash-Lite는 이전 세대의 오래된 Gemini 3.1 Flash-Lite가 아닙니다. 이름은 같지만, 모델과 버전이 다릅니다. 이전에 3.1 Flash-Lite를 기반으로 구축했다면, 이것은 이미 사용하던 모델의 이름 변경이 아니라 더 새롭고 빠른 대체 모델입니다. 추측하기 전에 모델 ID를 확인하세요: `gemini-3.5-flash-lite`가 새로운 모델입니다.

사양 및 가격

Flash-Lite의 비용과 작동 방식은 다음과 같습니다. 모든 가격은 Gemini API를 통해 백만 토큰당 기준으로 책정됩니다.

속성
모델 ID gemini-3.5-flash-lite
입력 가격 $0.30 / 1M 토큰
출력 가격 $2.50 / 1M 토큰
속도 ~350 출력 토큰/초
무료 티어 예 (Google AI Studio, 사용량 제한)
컨텍스트 캐싱 $0.03 / 1M 토큰 + $1.00 / 1M/시간 저장

입력 0.30달러, 출력 2.50달러는 현재 Gemini 라인업에서 가장 저렴하게 공개된 요금입니다. 비교하자면, 3.6 Flash 주력 모델은 입력 1.50달러, 출력 7.50달러이므로, Flash-Lite는 입력 비용의 약 1/5, 출력 비용의 약 1/3 수준입니다. 수백만 건의 짧은 호출을 처리할 때는 이러한 차이가 핵심입니다. 구글이 이 페이지를 직접 업데이트하므로, Gemini API 가격 문서에서 현재 수치를 확인할 수 있습니다.

컨텍스트 캐싱은 고정된 시스템 프롬프트나 긴 참조 문서와 같이 반복적으로 보내는 프롬프트의 비용을 더욱 절감합니다. 토큰을 캐싱하는 데 소액의 요금과 시간당 저장 수수료를 지불하며, 캐시된 입력은 재사용할 때마다 훨씬 저렴해집니다.

성능은 어떤가요?

주요 수치: Gemini 3.5 Flash-Lite는 Terminal-Bench 2.1에서 54%를 기록하여 이전 모델의 31%에서 크게 상승했습니다. 이는 Lite 클래스 모델에게는 상당한 발전이며, 이 작은 티어가 과거에는 제대로 처리하지 못했던 작업에도 이제는 진정으로 유용하다는 것을 의미합니다.

이 모델이 탁월한 분야는 분류, 추출, 채팅 응답, 그리고 간단한 검색 증강 답변입니다. 이러한 작업들은 빠르고 저렴한 모델이 제 역할을 하는 분야입니다. 입력을 버킷으로 분류하고, 복잡한 텍스트에서 구조화된 데이터를 추출하고, 검색된 문단을 기반으로 짧은 질문에 답하고, 가벼운 어시스턴트를 반응적으로 유지하는 작업 등입니다. Flash-Lite는 이 모든 것을 빠르고 효율적으로 처리합니다.

이제 솔직한 한계점에 대해 이야기하겠습니다. Flash-Lite는 비용과 속도를 위해 품질을 어느 정도 희생합니다. 가장 어려운 에이전트 코딩, 긴 다단계 도구 체인, 또는 심층 추론 문제에 적합한 모델은 아닙니다. 작업이 여러 단계를 계획하거나, 도구를 순서대로 안정적으로 호출하거나, 복잡한 코드베이스를 추론해야 할 때는 대신 Gemini 3.6 Flash 또는 더 큰 모델을 사용하고 싶을 것입니다. 그러한 작업에 Flash-Lite를 선택하면 잘못된 답변이 절약한 비용보다 더 많은 손실을 초래할 때까지는 비용을 절약할 수 있습니다. 작업에 맞는 티어를 선택하세요.

구글은 Flash-Lite를 어디에 사용하나요?

구글은 Flash-Lite를 개발자에게만 판매하는 것이 아닙니다. 구글 검색에 이 모델을 통합하고 있습니다. 이는 유용한 신호입니다. 구글이 검색 규모의 트래픽에 모델을 적용할 때는, 이 모델이 엄청난 수의 쿼리에서도 지연 시간이나 예산 문제없이 작동할 만큼 빠르고 저렴하다고 판단한 것입니다.

당신에게는 이것이 증거가 됩니다. Flash-Lite가 검색에 적합하게 만드는 동일한 속성, 즉 높은 처리량과 호출당 낮은 비용은 바쁜 프로덕션 엔드포인트에 적합하게 만드는 바로 그 요소입니다. 검색 트래픽을 처리할 수 있다면, 당신의 분류 파이프라인도 처리할 수 있습니다.

Flash-Lite 대 Gemini 3.6 Flash: 무엇을 선택해야 할까요?

간단히 말해: 작업이 간단하고, 대량이며, 속도에 민감하다면 Flash-Lite를 선택하세요. 작업에 더 강력한 추론, 코딩 또는 다단계 에이전트 작업이 필요하다면 3.6 Flash를 선택하세요.

Flash-Lite는 가격과 지연 시간 면에서 우위에 있습니다. 가장 저렴한 Gemini 모델이며 초당 약 350토큰으로 작동하므로, 대규모 분류, 추출, 짧은 채팅, 간단한 RAG에 적합한 기본 모델입니다. Gemini 3.6 Flash는 토큰당 비용은 더 비싸지만, 더 강력하게 추론하고, 코드를 더 잘 생성하며, Flash-Lite가 어려움을 겪을 수 있는 에이전트 워크플로우에서도 잘 작동합니다. 3.6 Flash 가격은 이를 반영합니다: 추가 기능에 대한 비용을 지불하는 것입니다.

실용적인 패턴은 난이도별로 라우팅하는 것입니다. 쉽고 빈번한 호출은 Flash-Lite로 보내고, 어려운 호출은 3.6 Flash로 에스컬레이션하세요. 대부분의 트래픽에서 저렴한 처리량을 얻고, 비용을 지불할 가치가 있는 경우에만 더 강력한 추론을 활용할 수 있습니다. 속도, 가격, 품질에 대한 자세한 비교는 Gemini 3.5 Flash-Lite 대 3.6 Flash를 참조하세요.

접근 및 테스트 방법

Flash-Lite는 Gemini API에서 실행됩니다. 가장 빠른 시작 방법은 Google AI Studio입니다: API 키를 발급받으면, 무료 티어를 통해 비용을 청구하기 전에 모델을 사용해 볼 수 있습니다. 무료 티어는 사용량 제한이 있으며, 구글은 제품 개선을 위해 무료 티어 데이터를 사용할 수 있으므로 민감한 입력은 유료 키를 사용하세요. 전체 참조 문서는 Gemini API 문서에 있습니다. 모델을 `gemini-3.5-flash-lite`로 설정하면 가장 저렴한 티어를 호출하는 것입니다.

요청이 작동하면 계속 작동하도록 유지하고 싶을 것입니다. 구글이 API를 업데이트함에 따라 가격, 속도 제한 및 응답 형태가 변경되며, 빠르지만 가끔 잘못된 Lite 모델은 드리프트(변동)를 감지하기 위한 검증이 필요합니다. 이때 API 클라이언트가 도움이 됩니다. Apidog를 사용하면 Gemini 엔드포인트에 `POST` 요청을 생성하고, API 키를 환경 변수로 저장하여 요청 본문에 노출되지 않도록 하며, 상태 코드와 의존하는 JSON 필드에 대한 검증을 추가할 수 있습니다.

여기에서 해당 요청을 저장된 회귀 테스트로 전환하고 실행하도록 예약하여 사용자가 문제를 발견하기 전에 깨진 응답이나 가격 변경을 감지할 수 있습니다. Apidog는 모델을 실행하거나 Gemini API를 대체하지 않습니다. 이는 엔드포인트를 호출, 검증 및 모니터링하는 데 사용하는 클라이언트입니다. 나머지 API 스택과 함께 `gemini-3.5-flash-lite` 엔드포인트를 테스트하고 싶다면 Apidog를 다운로드하세요.

버튼

자주 묻는 질문

Gemini 3.5 Flash-Lite는 Gemini 3.6 Flash와 동일한가요? 아니요. 이들은 2026년 7월 21일 동일한 업데이트로 출시된 두 가지 다른 모델입니다. Flash-Lite는 간단한 대량 작업을 위한 가장 저렴하고 빠른 티어입니다. 3.6 Flash는 더 강력한 추론 및 코딩 기능을 갖춘 더 비싼 주력 모델입니다.

왜 3.6이 아니라 3.5인가요? 혼합 버전 관리 때문입니다. 구글은 주력 Flash를 3.6으로 올렸지만, Flash-Lite와 게이트 Cyber 모델은 동일한 출시에서 3.5 라벨을 유지했습니다. 이 숫자는 출시 날짜가 아닌 모델 라인을 추적합니다.

이것이 이전 Gemini 3.1 Flash-Lite인가요? 아니요. Gemini 3.5 Flash-Lite는 더 새로운 모델입니다. 이전 3.1 Flash-Lite는 구세대 모델입니다. 가족 이름은 같지만 모델과 버전이 다릅니다. 따라서 `gemini-3.5-flash-lite` 모델 ID를 확인하여 새로운 모델을 사용하고 있는지 확인하세요.

Gemini 3.5 Flash-Lite는 무료인가요? Google AI Studio를 통해 무료 티어가 제공되며, 사용량 제한이 있습니다. 테스트 및 가벼운 사용에는 적합합니다. 실제 서비스 규모에는 유료 API 키로 전환해야 하며, 구글은 제품 개선을 위해 무료 티어 데이터를 사용할 수 있습니다.

Flash-Lite는 무엇에 가장 적합한가요? 대량의 분류, 추출, 짧은 채팅 응답, 간단한 검색 증강 답변에 가장 적합합니다. 3.6 Flash가 더 적합한 어려운 에이전트 코딩이나 긴 다단계 추론에는 적합하지 않습니다.

Apidog에서 API 설계-첫 번째 연습

API를 더 쉽게 구축하고 사용하는 방법을 발견하세요