구글은 3.6 Flash 출시 3주 후인 2026년 8월 13일 Gemini 3.7 Flash를 출시하며 이를 "우리의 가장 지능적인 주력 모델"이라고 불렀습니다. 벤치마크 변화는 이러한 자신감을 뒷받침합니다. DeepSWE는 49.0%에서 65.3%로, AutomationBench는 17.0%에서 30.4%로 상승했으며, 100만 입력 토큰당 초기 가격은 0.75달러로 3.6 Flash 출시 당시 가격의 절반에 불과합니다.
이러한 조합은 이번 분기 모든 API 팀이 직면하는 질문을 던집니다. 빠르고 저렴한 Gemini 모델이 이제 Claude나 GPT로 라우팅하던 워크로드를 처리할 수 있을까요? 이 비교는 검증 가능한 사항, 즉 컨텍스트 창, 모달리티, 도구 지원, 가격 구조 및 통합할 요청 스키마에 중점을 둡니다. 경쟁사 수치가 비교할 수 없는 경우, 그렇게 명시되어 있습니다. 그리고 "어떤 API를 사용해야 하는가"에 대한 솔직한 답변은 "자신의 워크로드에서 가장 뛰어난 API"이기 때문에, 최종 섹션에서는 최종 결정 전에 Apidog에서 세 가지를 나란히 실행하는 방법을 보여줍니다.
만약 Gemini를 선택하고 설정 단계가 필요하다면, Gemini 3.7 Flash API 퀵스타트가 키, 엔드포인트 및 첫 요청을 다룹니다.
TL;DR (요약)
- Gemini 3.7 Flash: 100만 토큰 컨텍스트, 64k 출력 제한, 텍스트, 이미지, 비디오, 오디오 및 PDF에 대한 기본 입력, 함수 호출, 도구로서의 검색, 컴퓨터 사용 기능.
- 초기 가격: 2026년 12월 31일까지 100만 입력 토큰당 0.75달러, 100만 출력 토큰당 3.75달러. 2027년 1월 1일부터는 1.50달러와 7.50달러로 두 배 인상.
- 3.6 Flash 대비 코딩 성능 향상: DeepSWE v1.1 49.0%에서 65.3%로, FrontierCode 1.1 Main 34.4%에서 43.6%로, AutomationBench 17.0%에서 30.4%로.
- Claude Fable 5와 GPT-5.6 Sol은 토큰당 가격이 몇 배 더 높음에도 불구하고, 최신 코딩 깊이와 에이전트 일관성에서 여전히 선두를 유지.
- 세 제공업체는 호환되지 않는 요청 스키마를 사용: Google
contents, Anthropic Messages, OpenAImessages. - 벤치마크는 평균을 예측하며, 실제 워크로드를 대변하지 않음. 결정하기 전에 세 가지 API 모두에서 20개 프롬프트를 사용하여 성능 비교를 실행해 볼 것.
이 비교를 읽는 방법
이 비교는 최신 모델 대 최신 모델의 대결이 아닙니다. Claude Fable 5와 GPT-5.6 Sol은 최대 성능을 위해 가격이 책정된 플래그십 모델이며, Gemini 3.7 Flash는 대량 처리를 위해 가격이 책정된 주력 모델입니다. 구글은 플래그십 모델이 기다리는 동안 이를 출시하고 있습니다. Axios는 Gemini 3.5 Pro가 계속 지연되고 있으며, Flash 업데이트가 그보다 먼저 출시되고 있다고 보도했습니다.
그럼에도 불구하고 이 비교는 가치가 있습니다. 3.7 Flash의 출시 점수는 이제 몇 주 전 최신 모델들이 차지했던 범위와 겹치며, 이는 플래그십 모델이 계속 선두를 유지하더라도 라우팅 계산을 변경합니다.
두 가지 주의사항이 있습니다. 첫째, 여기에 있는 모든 수치는 출시 주간에 공급업체가 보고한 수치입니다. 독립적인 평가가 나올 때까지는 방향성 지표로만 취급하십시오. 둘째, 벤치마크 변형이 중요합니다. 구글은 FrontierCode 1.1 Main을 보고하는 반면, Claude와 GPT 출시 당시 발표된 수치는 Extended 분할에서 나온 것이므로, 이 두 열은 여기 테이블에서 함께 사용되지 않습니다.
사양 비교
사양표는 Gemini 3.7 Flash가 훨씬 더 비싼 모델들과 비교해서도 손색이 없는 부분입니다. 전체 기술 세부 정보는 Gemini Flash 모델 페이지에서 확인할 수 있습니다.
| Gemini 3.7 Flash | Claude Fable 5 | GPT-5.6 Sol | |
|---|---|---|---|
| 개발사 | Anthropic | OpenAI | |
| 컨텍스트 창 | 100만 토큰 | 100만 토큰 | 105만 토큰 |
| 출력 제한 | 64k 토큰 | 공급업체 문서 참조 | 공급업체 문서 참조 |
| 입력 모달리티 | 텍스트, 이미지, 비디오, 오디오, PDF | 텍스트, 이미지 | 텍스트, 이미지 |
| 출력 | 텍스트 | 텍스트 | 텍스트 |
| 도구 지원 | 함수 호출, 도구로서의 검색, 컴퓨터 사용 | 함수 호출, 도구 사용 | 함수 호출, 내장 도구 |
| 요청 스키마 | Google contents + generationConfig |
Anthropic Messages | OpenAI messages |
| 인증 | x-goog-api-key 헤더 |
x-api-key + 버전 헤더 |
Bearer 토큰 |
| 가격 (100만 토큰당) | 초기: 입력 $0.75 / 출력 $3.75; 2027년 1월부터: $1.50 / $7.50 | 프리미엄 최신 계층 | 프리미엄 최신 계층 |
| 포지셔닝 | 대량 처리 주력 모델 | 장기 에이전트 작업 | 리포지토리 규모 코딩 깊이 |
컨텍스트 창은 이제 사실상 동일하므로, 해당 행은 더 이상 아무것도 결정하지 않습니다. 모달리티와 가격 책정 행이 세 가지 모델의 차이점이며, 다음 섹션에서 이 두 가지를 자세히 설명합니다.
코딩 및 에이전트 작업
구글이 3.7 Flash에 대해 내세우는 주요 주장은 개발자 중심적입니다. 디버깅 개선, 첫 시도에 배포 가능한 코드 생성 능력 향상, 다단계 계획 및 도구 호출에 대한 더 높은 성실성 등입니다. 9to5Google의 출시 보도에서 확인된 세대별 수치는 이러한 주장을 뒷받침합니다.
| 벤치마크 | Gemini 3.6 Flash | Gemini 3.7 Flash |
|---|---|---|
| DeepSWE v1.1 (리포지토리 규모 수정) | 49.0% | 65.3% |
| FrontierCode 1.1 Main | 34.4% | 43.6% |
| WebDev Arena (Elo) | 1538 | 1588 |
| GDP.pdf (문서 추론) | 22.0% | 34.0% |
| AutomationBench (에이전트 작업) | 17.0% | 30.4% |
AutomationBench의 상승은 에이전트 개발자들이 주목해야 할 부분입니다. 3주 만에 에이전트 벤치마크 점수가 거의 두 배로 늘어났다는 것은 "도구 호출에 더 성실하게 생각한다"는 주장이 단순한 마케팅이 아님을 시사합니다.
이는 Claude 및 GPT와 어떻게 비교될까요? DeepSWE v1.1에서 GPT-5.6 Sol Max는 출시 당시 73.0%를 기록했고, Grok 4.6은 65.9%를 기록했습니다. 당사의 Grok 4.6 vs GPT-5.6 Sol vs Claude Fable 5 비교에서 이 결과를 심층적으로 다룹니다. Sol Max는 리포지토리 규모 버그 수정에서 실질적인 선두를 유지하며, Claude Fable 5의 강점은 코딩 및 에이전트 평가 전반에 걸친 일관성으로, 2위보다 나쁜 경우가 거의 없습니다. Gemini 3.7 Flash는 아직 그 격차를 좁히지 못했습니다. 하지만 훨씬 저렴한 비용으로 근접한 성능을 달성했으며, 이는 "최고 점수 승리"와는 다른 가치 제안입니다.
두 가지 전문 지표가 전체 그림을 완성합니다. 법률 추론을 위한 Harvey LAB-AA에서 90.7%, 128k-needle 검색에서 97.0%의 점수를 기록했는데, 이 점수는 100만 컨텍스트 창이 실제로 신뢰할 수 있음을 보여줍니다.
멀티모달 입력
이것이 세 가지 API 간의 가장 명확한 구조적 차이점입니다. Gemini 3.7 Flash는 동일한 엔드포인트에 대해 contents 배열에서 텍스트, 이미지, 비디오, 오디오 및 PDF를 모두 허용합니다. Claude와 GPT는 텍스트와 이미지를 잘 처리하지만, 비디오 및 오디오 워크로드는 일반적으로 텍스트가 모델에 도달하기 전에 별도의 전사 또는 전처리 단계를 거칩니다.
귀하의 제품이 문서를 다룬다면, GDP.pdf 점수가 22.0%에서 34.0%로 상승한 것이 관련성 높은 신호입니다. 이 벤치마크는 테이블, 스캔 및 깨진 레이아웃을 포함하는 실제 PDF에 대한 추론 능력을 측정합니다. OCR 파이프라인 없이 계약서나 인보이스를 모델에 직접 입력하면 아키텍처에서 실패할 가능성이 있는 전체 단계를 제거할 수 있습니다.
실질적인 규칙: 텍스트 및 이미지 채팅의 경우, 모달리티는 차이가 거의 없습니다. 하지만 비디오 프레임, 통화 녹음 또는 문서 더미의 경우, 입력 파이프라인이 단일 API 호출로 통합되는 세 가지 모델 중 Gemini가 유일합니다.
가격 책정 철학
세 공급업체는 서로 다른 가격 책정 전략을 운영하고 있으며, 그 차이는 각 모델이 누구를 위한 것인지 알려줍니다.
구글은 3.7 Flash의 가격을 시장 점유율 확대를 위해 책정했습니다. 2026년 12월 31일까지 100만 입력 토큰당 0.75달러, 100만 출력 토큰당 3.75달러의 초기 요금이 적용되며, 이는 3.6 Flash 출시 당시 비용의 절반입니다. 2027년 1월 1일에는 표준 요금인 1.50달러와 7.50달러로 두 배 인상됩니다. 이 마감일은 강제적인 기능입니다. 구글은 가격이 재설정되기 전에 귀하의 트래픽을 확보하고자 합니다. 챗봇 및 에이전트 루프에 대한 예제를 포함한 전체 토큰 계산은 당사의 Gemini 3.7 Flash 가격 분석에 나와 있습니다.
Anthropic과 OpenAI는 플래그십 모델을 프리미엄 기능으로 가격 책정합니다. 요금은 계층별로 다르며 자주 변경되지만, 형태는 일관적입니다. 최신 모델의 출력 토큰은 Flash 모델이 청구하는 비용의 몇 배에 달하며, 두 공급업체 모두 더 저렴한 토큰이 아니라 실패율이 적다는 점을 내세워 프리미엄을 판매합니다. Anthropic은 단일 모델 내에서 비용과 성능을 교환하는 노력 매개변수를 추가하는 반면, OpenAI는 모델 크기별로 계층을 나눕니다.
어떤 철학이 승리할지는 실패 경제학에 달려 있습니다. 작업에 실패하는 저렴한 모델은 절약된 토큰보다 더 많은 비용이 드는 수리 작업을 발생시키고, 프리미엄 모델은 그러한 실패를 방지할 때만 제값을 합니다. 토큰당 비용이 아니라 완료된 작업당 비용을 비교하고, 2027년 1월 1일 Gemini의 요금이 두 배로 인상된 후에 다시 가격을 책정하십시오.
API 인체 공학
스키마 차이는 제공업체를 전환하거나 그 사이에서 라우팅할 때 지불하는 세금입니다. 여기 세 가지 형태로 동일한 단일 턴 요청이 있습니다.
구글의 Gemini API는 contents 내의 parts로 턴을 감싸고, 생성 설정은 generationConfig에 있습니다.
{
"contents": [
{ "role": "user", "parts": [{ "text": "Summarize this changelog." }] }
],
"generationConfig": { "temperature": 0.3, "maxOutputTokens": 1024 }
}
Anthropic의 Messages API는 모델과 필수 max_tokens를 최상위 레벨에 두며, 시스템 프롬프트는 자체 필드로 존재합니다.
{
"model": "claude-fable-5",
"max_tokens": 1024,
"system": "You summarize changelogs in three bullets.",
"messages": [{ "role": "user", "content": "Summarize this changelog." }]
}
OpenAI는 시스템 프롬프트를 messages 배열 자체에 포함시킵니다.
{
"model": "gpt-5.6-sol",
"messages": [
{ "role": "system", "content": "You summarize changelogs in three bullets." },
{ "role": "user", "content": "Summarize this changelog." }
]
}
텍스트 사례는 어댑터로 해결할 수 있을 만큼 충분히 유사해 보입니다. 추상화가 무너지는 지점은 도구 사용입니다. 구글은 tools 배열에 functionDeclarations로 함수를 선언하고 toolConfig를 통해 호출을 제어하며, Anthropic은 다른 응답 블록을 가진 자체 도구 스키마를 사용하고, OpenAI는 또 다른 자체 함수 형식을 가지고 있습니다. 세 가지 모두 서버 전송 이벤트에 기반함에도 불구하고 스트리밍 청크 형태도 다릅니다. 게이트웨이와 호환성 엔드포인트는 기본 채팅 형태를 표준화하지만, 멀티모달 파트와 도구 호출은 깔끔하게 번역되는 경우가 거의 없습니다. 우리는 DeepSeek V4 Pro API 형식 비교에서 공급업체 전반에 걸쳐 동일한 문제를 문서화했습니다.
통합에 대한 조언은 특별할 것 없습니다. 제품과 모델 사이에 얇은 공급업체 계층을 유지하십시오. 그렇게 하면 팀은 분기별이 아니라 며칠 만에 공급업체를 전환할 수 있습니다.
각 모델을 선택할 시점
벤치마크와 스키마를 결정 목록으로 압축했습니다.
- Gemini 3.7 Flash 선택: 대량의 에이전트 트래픽, 비디오, 오디오 또는 PDF를 수집하는 멀티모달 파이프라인, 그리고 호출당 비용이 제품 마진을 제한하는 모든 워크로드에 적합합니다. 또한 컴퓨터 사용 실험을 위한 명확한 샌드박스이기도 합니다. 컴퓨터 사용 대 구조화된 API에 대한 당사의 분석은 이러한 기능이 언제 가치를 발휘하는지 다룹니다.
- Claude Fable 5 선택: 장기적인 자율 작업(몇 시간 동안 지속되는 에이전트 세션, 한 번의 잘못된 단계로 한 시간의 진행 상황이 낭비되는 작업) 및 노력 매개변수의 비용-성능 다이얼이 보상하는 워크로드에 적합합니다.
- GPT-5.6 Sol 선택: 최소한의 감독으로 대규모 기존 코드베이스에서 작동하는 리포지토리 규모 코딩 에이전트, 그리고 API를 둘러싼 가장 깊이 있는 타사 생태계를 원하는 팀에 적합합니다.
- 가능하다면 라우터 선택: 대부분의 프로덕션 팀이 선택하는 패턴은 다음과 같습니다. 저렴한 기본 모델이 대량의 트래픽을 처리하고, 가장 어려운 10%는 최신 모델로 에스컬레이션됩니다. Gemini 3.7 Flash의 출시 수치는 이러한 아키텍처에서 신뢰할 수 있는 기본 모델이 되었으며, 이는 3.6 Flash에서는 사실이 아니었습니다.
하나의 Apidog 워크스페이스에서 세 가지 제공업체 모두 테스트하기
중요한 비교는 귀하의 고유한 프롬프트로 실행하는 비교입니다. Apidog는 단일 프로젝트에서 Google, Anthropic, OpenAI의 컬렉션을 모두 보관하므로, 단기 작업이 아닌 오후 시간 동안 비교 테스트를 수행할 수 있습니다.
- 세 가지 환경을 생성하십시오. 제공업체별로 하나씩, 각각 고유한 기본 URL과 인증 헤더를 가집니다. Gemini의 경우
x-goog-api-key, Anthropic의 경우x-api-key, OpenAI의 경우 Bearer 토큰을 사용합니다. 제공업체 전환은 코드 변경이 아니라 드롭다운으로 이루어집니다. - 제품에서 **실제 프롬프트 20개를 수집하십시오.** 시스템 프롬프트, 함수 호출을 사용하는 경우 도구 정의, 그리고 최소 5개의 알려진 어려운 사례를 포함하십시오.
- 관심 있는 사항에 대해 **어설션을 추가하십시오.** 응답 유효성, 각 제공업체의 사용량 블록에서 가져온 토큰 수, 지연 시간 임계값 등입니다. 도구 호출 워크로드의 경우, 도구 호출 JSON이 구문 분석되고 스키마와 일치하는지 어설션하십시오. 모델은 산문보다 그곳에서 훨씬 더 자주 실패합니다.
- **각 모델별로 각 스위트를 세 번 실행하십시오.** LLM 출력은 다양합니다. 세 번의 실행은 단일 데모가 숨기는 분산을 드러냅니다. 성공률과 성공적인 작업당 비용을 비교하십시오.
- **스위트를 유지하십시오.** 이제 모델 출시는 몇 주 간격으로 이루어집니다. 3.7 Flash는 3.6 Flash 출시 3주 후에 나왔습니다. 기존 테스트 도구를 갖춘 팀은 일화에 의존하는 대신 오후 시간 동안 다시 결정을 내릴 수 있습니다.
자주 묻는 질문 (FAQ)
Gemini 3.7 Flash가 코딩 면에서 Claude나 GPT보다 나은가요?
최고 수준에서는 그렇지 않습니다. GPT-5.6 Sol Max는 DeepSWE v1.1에서 73.0%를 기록한 반면 3.7 Flash는 65.3%를 기록했으며, Claude Fable 5는 코딩 및 에이전트 벤치마크 전반에 걸쳐 일관성 면에서 앞서고 있습니다. 달라진 점은 가격 대비 점수 비율입니다. 3.7 Flash는 몇 주 전까지만 해도 최신 모델 영역에 속했던 점수를 주력 모델 수준의 가격으로 달성합니다.
Gemini 3.7 Flash는 Claude나 GPT보다 얼마나 저렴한가요?
2026년 12월 31일까지 Gemini 3.7 Flash는 100만 입력 토큰당 0.75달러, 100만 출력 토큰당 3.75달러입니다. 최신 Claude 및 GPT 모델은 토큰당 몇 배 더 많은 요금을 부과합니다. 비용을 모델링하기 전에 실시간 가격 페이지를 확인하십시오. 2027년 1월 1일에는 초기 요금이 두 배로 인상된다는 점을 기억하십시오.
OpenAI SDK를 통해 Gemini 3.7 Flash를 호출할 수 있나요?
구글은 기본적인 채팅 형태를 처리하는 OpenAI 호환 엔드포인트를 제공하므로, base_url을 교체하면 텍스트 입력-텍스트 출력에 사용할 수 있습니다. 멀티모달 부분과 도구 호출은 깔끔하게 매핑되지 않으므로, 일반 채팅 이상의 기능에는 기본 contents 스키마를 사용하십시오. Gemini 3.7 Flash 함수 호출 튜토리얼은 기본 도구 형식을 처음부터 끝까지 보여줍니다.
Gemini 3.7 Flash는 컴퓨터 사용 및 검색 기반 기능을 지원하나요?
예, 지원합니다. 함수 호출, 도구로서의 검색, 컴퓨터 사용 기능과 함께 업데이트된 CBRN 및 사이버 안전 가드레일을 제공합니다. AutomationBench 점수가 17.0%에서 30.4%로 향상된 것은 에이전트 루프가 얼마나 더 좋아졌는지 보여주는 가장 근접한 공개 지표입니다.
Gemini 3.7 Flash는 어디에서 사용할 수 있나요?
AI Studio 키가 있는 Gemini API, Google AI Studio, Gemini 앱, AI Pro 및 Ultra 구독자를 위한 Gemini Spark, Google Antigravity, Android Studio, Gemini Enterprise를 통해 160개 이상의 국가에서 사용할 수 있습니다. 프로덕션 GCP 팀은 API 키 대신 OAuth를 사용하여 Vertex AI를 통해 호출할 수 있습니다.
3.7 Flash가 귀하의 스택에 어떻게 들어맞는가
이 비교에서 잘못된 결론은 "Gemini가 최신 모델을 따라잡았다"는 것입니다. 그렇지 않습니다. Sol은 여전히 리포지토리 규모 코딩 깊이를, Fable 5는 여전히 장기적인 신뢰성을 가지고 있습니다. 올바른 결론은 기준이 바뀌었다는 것입니다. 이제 주력 모델 가격으로 한 분기 전 프리미엄 요금을 정당화했던 점수를 얻을 수 있게 되었으며, 이는 모든 라우터 아키텍처에서 기본값을 재설정합니다. Flash 클래스 모델은 대량의 작업을 처리하고, 플래그십 모델은 에스컬레이션된 작업을 처리합니다.
결정은 측정 가능하므로, 측정하십시오. 세 가지 제공업체를 하나의 워크스페이스에 연결하고, 어설션을 사용하여 실제 프롬프트를 실행한 다음, 완료된 작업당 비용이 승자를 선택하게 하십시오. Apidog를 무료로 다운로드하여 세 가지 환경을 설정하면, 초기 가격 책정 기간이 끝나기 전에 제공업체 수준의 증거를 확보할 수 있을 것입니다.

