Google lanzó Gemini 3.7 Flash el 13 de agosto de 2026, tres semanas después de 3.6 Flash, y lo llamó “nuestro modelo de trabajo más inteligente”. Las deltas de los benchmarks respaldan esta confianza. DeepSWE salta del 49.0% al 65.3%, AutomationBench sube del 17.0% al 30.4%, y el precio introductorio de $0.75 por 1M de tokens de entrada es la mitad de lo que costaba 3.6 Flash en su lanzamiento.
Esa combinación plantea una pregunta que cada equipo de API enfrenta este trimestre: ¿un modelo Gemini rápido y económico ahora cubre las cargas de trabajo que estabas dirigiendo a Claude o GPT? Esta comparación se ciñe a lo que puedes verificar: ventanas de contexto, modalidades, soporte de herramientas, estructura de precios y los esquemas de solicitud contra los que integrarás; donde los números de la competencia no son comparables, se indica. Y dado que la respuesta honesta a “qué API deberías usar” es “la que mejor funcione para tu carga de trabajo”, la sección final muestra cómo ejecutar las tres lado a lado en Apidog antes de comprometerte.
Si terminas eligiendo Gemini y quieres los pasos de configuración, la guía de inicio rápido de la API de Gemini 3.7 Flash cubre claves, endpoints y primeras solicitudes.
En resumen
- Gemini 3.7 Flash: contexto de 1M de tokens, límite de salida de 64k, entrada nativa de texto, imagen, video, audio y PDF, además de llamada a funciones, búsqueda como herramienta y uso de computadora.
- Precio de introducción: $0.75 por 1M de tokens de entrada y $3.75 por 1M de salida hasta el 31 de diciembre de 2026, duplicándose a $1.50 y $7.50 el 1 de enero de 2027.
- Mejoras en codificación respecto a 3.6 Flash: DeepSWE v1.1 del 49.0% al 65.3%, FrontierCode 1.1 Main del 34.4% al 43.6%, AutomationBench del 17.0% al 30.4%.
- Claude Fable 5 y GPT-5.6 Sol aún lideran en profundidad de codificación de vanguardia y consistencia de agentes, a varias veces el precio por token.
- Los tres proveedores usan esquemas de solicitud incompatibles: Google
contents, Anthropic Messages, OpenAImessages. - Los benchmarks predicen promedios, no tu carga de trabajo; realiza una prueba con 20 prompts en las tres APIs antes de decidir.
Cómo leer esta comparación
Esto no es un enfrentamiento de vanguardia contra vanguardia. Claude Fable 5 y GPT-5.6 Sol son modelos insignia con precios para máxima capacidad; Gemini 3.7 Flash es un modelo de trabajo con precios para volumen. Google lo está lanzando mientras su modelo insignia espera: Axios informó que Gemini 3.5 Pro sigue retrasado, con las actualizaciones de Flash llegando antes.
La comparación aún vale la pena: los resultados de lanzamiento de 3.7 Flash ahora se superponen con la franja donde se encontraban los modelos de vanguardia hace semanas, y eso cambia el cálculo de enrutamiento incluso si los modelos insignia se mantienen a la cabeza.
Se aplican dos advertencias en todo momento. Primero, cada número aquí es una cifra informada por el proveedor en la semana de lanzamiento; trátelos como direccionales hasta que se realicen evaluaciones independientes. Segundo, las variantes de los benchmarks importan. Google informa FrontierCode 1.1 Main, mientras que los números publicados para Claude y GPT en sus lanzamientos provinieron de la división Extended, por lo que esas columnas nunca comparten una tabla aquí.
Especificaciones lado a lado
La hoja de especificaciones es donde Gemini 3.7 Flash se defiende contra modelos que cuestan mucho más. Los detalles técnicos completos se encuentran en la página del modelo Gemini Flash.
| Gemini 3.7 Flash | Claude Fable 5 | GPT-5.6 Sol | |
|---|---|---|---|
| Desarrollador | Anthropic | OpenAI | |
| Ventana de contexto | 1M tokens | 1M tokens | 1.05M tokens |
| Límite de salida | 64k tokens | Ver documentación del proveedor | Ver documentación del proveedor |
| Modalidades de entrada | Texto, imagen, video, audio, PDF | Texto, imagen | Texto, imagen |
| Salida | Texto | Texto | Texto |
| Soporte de herramientas | Llamada a funciones, búsqueda como herramienta, uso de computadora | Llamada a funciones, uso de herramientas | Llamada a funciones, herramientas integradas |
| Esquema de solicitud | Google contents + generationConfig |
Anthropic Messages | OpenAI messages |
| Autenticación | Encabezado x-goog-api-key |
Encabezado x-api-key + de versión |
Token de portador (Bearer token) |
| Precios (por 1M de tokens) | $0.75 entrada / $3.75 salida introducción; $1.50 / $7.50 desde enero de 2027 | Nivel premium de vanguardia | Nivel premium de vanguardia |
| Posicionamiento | Modelo de trabajo de alto volumen | Trabajo de agente a largo plazo | Profundidad de codificación a escala de repositorio |
Las ventanas de contexto son ahora efectivamente iguales, por lo que esa fila ya no decide nada. Las filas de modalidad y precios son donde los tres divergen, y las siguientes secciones desglosan ambas.
Tareas de codificación y de agente
Las afirmaciones principales de Google para 3.7 Flash están orientadas al desarrollador: mejor en depuración, más capaz de producir código desplegable al primer intento y más diligente en la planificación de múltiples pasos y llamadas a herramientas. Los números de generación a generación, confirmados en la cobertura de lanzamiento de 9to5Google, respaldan estas afirmaciones.
| Benchmark | Gemini 3.6 Flash | Gemini 3.7 Flash |
|---|---|---|
| DeepSWE v1.1 (correcciones a escala de repositorio) | 49.0% | 65.3% |
| FrontierCode 1.1 Main | 34.4% | 43.6% |
| WebDev Arena (Elo) | 1538 | 1588 |
| GDP.pdf (razonamiento de documentos) | 22.0% | 34.0% |
| AutomationBench (tareas de agente) | 17.0% | 30.4% |
El salto en AutomationBench es el que los constructores de agentes deberían observar. Casi duplicar un benchmark de agentes en tres semanas sugiere que la afirmación de que “piensa con más diligencia en las llamadas a herramientas” es más que marketing.
¿Cómo se compara eso con Claude y GPT? En DeepSWE v1.1, el nivel de vanguardia obtuvo un 73.0% para GPT-5.6 Sol Max en su lanzamiento, con Grok 4.6 en 65.9%; nuestra comparación de Grok 4.6 vs GPT-5.6 Sol vs Claude Fable 5 cubre esos resultados en profundidad. Sol Max mantiene una ventaja real en la corrección de errores a escala de repositorio, y la fortaleza de Claude Fable 5 es la consistencia en las evaluaciones de codificación y agentes, donde rara vez es peor que el segundo. Gemini 3.7 Flash no ha cerrado esa brecha. Ha llegado a una distancia considerable a una fracción del costo, lo cual es una propuesta de valor diferente a “la mejor puntuación gana”.
Dos números especializados completan el panorama: 90.7% en Harvey LAB-AA para razonamiento legal, y 97.0% en recuperación de 128k-needle, la puntuación que hace que la ventana de 1M sea confiable en la práctica.
Entrada multimodal
Esta es la diferencia estructural más clara entre las tres APIs. Gemini 3.7 Flash acepta texto, imágenes, video, audio y PDF en el mismo array contents contra un único endpoint. Claude y GPT manejan bien el texto y las imágenes, pero las cargas de trabajo de video y audio suelen pasar por pasos separados de transcripción o preprocesamiento antes de que el texto llegue al modelo.
Si tu producto maneja documentos, el salto de GDP.pdf del 22.0% al 34.0% es la señal relevante: ese benchmark mide el razonamiento sobre PDFs del mundo real con tablas, escaneos y diseños rotos. Alimentar un contrato o una factura directamente al modelo sin una pipeline de OCR elimina una etapa completa propensa a fallos de tu arquitectura.
La regla práctica: para el chat de texto e imagen, la modalidad es equivalente. Para fotogramas de video, grabaciones de llamadas o pilas de documentos, Gemini es el único de los tres donde la pipeline de entrada se reduce a una sola llamada a la API.
Filosofía de precios
Los tres proveedores están ejecutando diferentes estrategias de precios, y la diferencia te dice para quién es cada modelo.
Google pone precio a 3.7 Flash para una rápida adopción. La tarifa introductoria de $0.75 por 1M de tokens de entrada y $3.75 por 1M de salida se mantiene hasta el 31 de diciembre de 2026, y es la mitad de lo que costaba 3.6 Flash en su lanzamiento. El 1 de enero de 2027, la tarifa estándar será de $1.50 y $7.50, un aumento limpio de 2x. Esa fecha límite es una función de forzamiento: Google quiere que tu tráfico esté comprometido antes de que el precio se reinicie. El cálculo completo de tokens, con ejemplos prácticos para chatbots y bucles de agentes, se encuentra en nuestro análisis de precios de Gemini 3.7 Flash.
Anthropic y OpenAI fijan el precio de sus modelos insignia como capacidad premium. Las tarifas varían según el nivel y cambian a menudo, pero la forma es consistente: los tokens de salida de vanguardia cuestan varias veces lo que cobra Flash, y ambos proveedores venden la prima basándose en menos ejecuciones fallidas, no en tokens más baratos. Anthropic añade un parámetro de esfuerzo que equilibra el costo con la capacidad dentro de un modelo; OpenAI escala por tamaños de modelo en su lugar.
Qué filosofía gana depende de la economía de tus fallos. Un modelo barato que falla en una tarea genera trabajo de reparación que cuesta más que los tokens ahorrados; un modelo premium solo justifica su tarifa cuando previene esos fallos. Compara el costo por tarea completada, no el costo por token, y vuelve a calcular los precios después del 1 de enero de 2027, cuando las tarifas de Gemini se dupliquen.
Ergonomía de la API
Las diferencias de esquema son el impuesto que pagas cuando cambias de proveedor o enrutas entre ellos. Aquí tienes la misma solicitud de una sola interacción en las tres formas.
La API de Gemini de Google envuelve las interacciones en contents con parts, y las configuraciones de generación residen en generationConfig:
{
"contents": [
{ "role": "user", "parts": [{ "text": "Summarize this changelog." }] }
],
"generationConfig": { "temperature": 0.3, "maxOutputTokens": 1024 }
}
La API de mensajes de Anthropic coloca el modelo y un max_tokens requerido en el nivel superior, con el prompt del sistema como su propio campo:
{
"model": "claude-fable-5",
"max_tokens": 1024,
"system": "Resume los registros de cambios en tres puntos.",
"messages": [{ "role": "user", "content": "Resume este registro de cambios." }]
}
OpenAI integra el prompt del sistema en el propio array messages:
{
"model": "gpt-5.6-sol",
"messages": [
{ "role": "system", "content": "Resume los registros de cambios en tres puntos." },
{ "role": "user", "content": "Resume este registro de cambios." }
]
}
El caso de texto parece lo suficientemente cercano como para cubrirlo con un adaptador. El uso de herramientas es donde la abstracción presenta fugas: Google declara funciones en un array tools con functionDeclarations y controla la invocación a través de toolConfig, Anthropic utiliza su propio esquema de herramientas con diferentes bloques de respuesta, y OpenAI tiene de nuevo su propio formato de función. Las formas de los bloques de streaming también difieren, aunque los tres se basan en eventos enviados por el servidor. Las pasarelas y los endpoints de compatibilidad normalizan la forma básica del chat, pero las partes multimodales y las llamadas a herramientas rara vez sobreviven a la traducción limpiamente; documentamos el mismo problema entre proveedores en la comparación de formatos de API para DeepSeek V4 Pro.
El consejo de integración es poco glamoroso: mantén una capa de proveedor delgada entre tu producto y el modelo. Los equipos que lo hacen cambian de proveedor en días en lugar de trimestres.
Cuándo elegir cada uno
- Elige Gemini 3.7 Flash para tráfico de agentes de alto volumen, pipelines multimodales que ingieren video, audio o PDFs, y cualquier carga de trabajo donde el costo por llamada limite el margen del producto. También es el sandbox obvio para experimentos de uso de computadora; nuestro desglose de uso de computadora versus APIs estructuradas cubre cuándo esa capacidad se justifica.
- Elige Claude Fable 5 para trabajo autónomo a largo plazo: sesiones de agente de varias horas, tareas donde un paso descarrilado desperdicia una hora de progreso, y cargas de trabajo que recompensan el dial de costo-capacidad del parámetro de esfuerzo.
- Elige GPT-5.6 Sol para agentes de codificación a escala de repositorio que operan en grandes bases de código existentes con supervisión mínima, y para equipos que desean el ecosistema de terceros más profundo alrededor de la API.
- Elige un enrutador si puedes. El patrón en el que la mayoría de los equipos de producción convergen: un modelo predeterminado barato maneja la mayor parte del tráfico, y el 10% más difícil se escala a un modelo de vanguardia. Los números de lanzamiento de Gemini 3.7 Flash lo convierten en un valor predeterminado creíble en esa arquitectura, lo cual no era cierto para 3.6 Flash.
Prueba los tres proveedores en un solo espacio de trabajo de Apidog
La comparación que importa es la que ejecutas con tus propios prompts. Apidog tiene colecciones para Google, Anthropic y OpenAI en un solo proyecto, por lo que la prueba se realiza en una tarde en lugar de un sprint:
- Crea tres entornos, uno por proveedor, cada uno con su propia URL base y encabezado de autenticación:
x-goog-api-keypara Gemini,x-api-keypara Anthropic, un token de portador (Bearer) para OpenAI. Cambiar de proveedor se convierte en una selección desplegable, no en un cambio de código. - Recopila 20 prompts reales de tu producto. Incluye tu prompt del sistema, tus definiciones de herramientas si utilizas la llamada a funciones, y al menos cinco casos conocidos difíciles.
- Añade aserciones para lo que te importa: validez de la respuesta, conteo de tokens del bloque de uso de cada proveedor, umbrales de latencia. Para cargas de trabajo de llamada a herramientas, asegura que el JSON de la llamada a la herramienta se analiza y coincide con tu esquema; los modelos fallan allí mucho más a menudo que en la prosa.
- Ejecuta cada suite tres veces por modelo. La salida de los LLM varía; tres ejecuciones exponen la varianza que una sola demostración oculta. Compara la tasa de éxito y el costo por tarea exitosa.
- Conserva la suite. Los lanzamientos de modelos ahora se producen con semanas de diferencia; 3.7 Flash siguió a 3.6 por tres semanas. Los equipos con un sistema de pruebas establecido vuelven a decidir en una tarde en lugar de por anécdota.
Preguntas frecuentes
¿Es Gemini 3.7 Flash mejor que Claude o GPT para la codificación?
No en el extremo superior. GPT-5.6 Sol Max obtuvo un 73.0% en DeepSWE v1.1 frente al 65.3% de 3.7 Flash, y Claude Fable 5 lidera en consistencia en benchmarks de codificación y agentes. Lo que cambió es la relación precio-puntuación: 3.7 Flash alcanza puntuaciones que estaban en territorio de vanguardia hace semanas mientras cobra tarifas de modelo de trabajo.
¿Cuánto más barato es Gemini 3.7 Flash que Claude o GPT?
Hasta el 31 de diciembre de 2026, Gemini 3.7 Flash cuesta $0.75 por 1M de tokens de entrada y $3.75 por 1M de tokens de salida. Los modelos Claude y GPT de vanguardia cobran varias veces más por token; consulta las páginas de precios actuales antes de modelar los costos. Recuerda que la tarifa introductoria se duplica el 1 de enero de 2027.
¿Puedo llamar a Gemini 3.7 Flash a través del SDK de OpenAI?
Google expone un endpoint compatible con OpenAI que maneja la forma básica del chat, por lo que un intercambio de base_url funciona para texto de entrada y texto de salida. Las partes multimodales y las llamadas a herramientas no se mapean limpiamente, así que usa el esquema nativo de contents para cualquier cosa más allá del chat simple. El tutorial de llamada a funciones para Gemini 3.7 Flash muestra el formato de herramienta nativo de principio a fin.
¿Gemini 3.7 Flash soporta el uso de computadora y el anclaje de búsqueda?
Sí. Viene con llamada a funciones, búsqueda como herramienta y uso de computadora, además de las salvaguardias de seguridad cibernética y CBRN actualizadas. La mejora de AutomationBench del 17.0% al 30.4% es el proxy publicado más cercano de cuánto mejoró el bucle de agente.
¿Dónde está disponible Gemini 3.7 Flash?
La API de Gemini con una clave de AI Studio, Google AI Studio, la aplicación Gemini, Gemini Spark para suscriptores de AI Pro y Ultra, Google Antigravity, Android Studio y Gemini Enterprise, en más de 160 países. Los equipos de producción de GCP pueden llamarlo a través de Vertex AI con OAuth en lugar de una clave API.
Dónde encaja 3.7 Flash en tu stack
La conclusión errónea de esta comparación es “Gemini alcanzó la vanguardia”. No lo ha hecho; Sol todavía posee la profundidad de codificación a escala de repositorio y Fable 5 todavía posee la fiabilidad a largo plazo. La conclusión correcta es que el nivel se movió: los precios de los modelos de trabajo ahora compran puntuaciones que justificaban tarifas premium hace un trimestre, lo que restablece el valor predeterminado en cualquier arquitectura de enrutador. Los modelos de clase Flash manejan la mayor parte, los modelos insignia manejan las escaladas.
La decisión es medible, así que mídela. Conecta los tres proveedores en un solo espacio de trabajo, ejecuta tus prompts reales con aserciones y deja que el costo por tarea completada elija al ganador. Descarga Apidog gratis, configura los tres entornos y tendrás evidencia a nivel de proveedor antes de que se cierre el período de precios introductorios.

