Google lanzó Gemini 3.7 Flash el 13 de agosto de 2026, tres semanas después de 3.6 Flash, y lo llama “nuestro modelo de caballo de batalla más inteligente”. Para cualquiera que esté atento a una factura de API, el detalle más importante se encuentra en la tabla de precios, no en los puntos de referencia: la tarifa introductoria de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida vence el 31 de diciembre de 2026. A partir del 1 de enero de 2027, ambas tarifas se duplicarán.
Eso representa una duplicación programada en cada carga de trabajo que construya sobre este modelo. Un chatbot que cuesta $790 al mes hoy, costará $1,575 al mes en enero sin cambios en su código, su tráfico o sus prompts. Así que, cuando presupueste un proyecto 3.7 Flash, modele ambos niveles, no el precio de etiqueta.
Esta guía detalla los dos niveles, el cálculo de tokens para tres cargas de trabajo reales, cómo se compara el precio con otras API de modelos y dónde recortar gastos antes de que se dupliquen las tarifas. Si aún no ha enviado una primera solicitud, la guía de inicio rápido de la API de Gemini 3.7 Flash cubre la configuración. Una vez que esté haciendo llamadas, Apidog muestra los recuentos de tokens de usageMetadata en cada respuesta, por lo que cada estimación a continuación se convierte en un número que puede verificar con el tráfico en vivo.
En resumen
- Tarifa introductoria: $0.75 por 1M de tokens de entrada y $3.75 por 1M de tokens de salida, válida hasta el 31 de diciembre de 2026.
- Tarifa estándar a partir del 1 de enero de 2027: $1.50 de entrada y $7.50 de salida. Exactamente el doble.
- El precio de introducción es la mitad de lo que costó Gemini 3.6 Flash en su lanzamiento.
- El modelo acepta entrada de texto, imagen, video, audio y PDF a través de una ventana de contexto de 1M de tokens, con un límite de salida de 64k tokens.
- Ejemplo práctico: un chatbot que atiende 10,000 solicitudes al día cuesta alrededor de $26 al día con las tarifas de introducción y $52.50 al día con las tarifas estándar.
- El almacenamiento en caché de contexto, los límites de salida, el procesamiento por lotes y el enrutamiento de tráfico ligero a un modelo más pequeño son las principales palancas para reducir el gasto.
Los dos niveles de precios
Gemini 3.7 Flash se lanzó con un descuento por tiempo limitado en lugar de un precio permanente. Aquí está el panorama completo para la API de Gemini:
| Nivel | Ventana | Entrada (por 1M de tokens) | Salida (por 1M de tokens) |
|---|---|---|---|
| Introductorio | 13 de agosto de 2026 al 31 de diciembre de 2026 | $0.75 | $3.75 |
| Estándar | A partir del 1 de enero de 2027 | $1.50 | $7.50 |
Dos cosas destacan. Primero, la tarifa introductoria es la mitad de lo que costó Gemini 3.6 Flash cuando se lanzó, lo que convierte los próximos cuatro meses y medio en el período más barato que esta familia de modelos ha tenido. Si está considerando una actualización de 3.6, la guía de migración de 3.6 a 3.7 Flash cubre el cambio; la reducción de precio por sí sola paga las pruebas de regresión.
En segundo lugar, los tokens de salida cuestan 5 veces más que los tokens de entrada en ambos niveles. Esa proporción influye en cada decisión de optimización posterior en esta guía: recortar un prompt de sistema prolijo ahorra centavos, mientras que limitar una salida descontrolada ahorra dólares.
Las tarifas anteriores cubren la API de Gemini facturada a través de una clave de AI Studio. Vertex AI funciona a través de la facturación de Google Cloud con sus propias SKU, y características como el almacenamiento en caché de contexto y el procesamiento por lotes tienen sus propios elementos de línea, así que confirme los números actuales en la página oficial de precios antes de comprometer un presupuesto.
Lo que cuesta una carga de trabajo real
Los precios por millón de tokens no significan nada hasta que los multiplica por el tráfico. Aquí hay tres perfiles de carga de trabajo con las suposiciones indicadas, para que pueda sustituir sus propios números.
Carga de trabajo 1: un chatbot de soporte al cliente
Asuma 10,000 solicitudes al día. Cada solicitud lleva aproximadamente 2,000 tokens de entrada (prompt del sistema, una pequeña ventana de historial, el mensaje del usuario) y devuelve alrededor de 300 tokens de salida.
| Elemento | Tokens diarios | Costo introductorio/día | Costo estándar/día |
|---|---|---|---|
| Entrada | 20M | $15.00 | $30.00 |
| Salida | 3M | $11.25 | $22.50 |
| Total | 23M | $26.25 | $52.50 |
Eso es aproximadamente $788 al mes con tarifas introductorias y $1,575 al mes con tarifas estándar en un mes de 30 días. Por cada turno de conversación, hoy está pagando alrededor de un cuarto de centavo.
Carga de trabajo 2: una tubería de documentos PDF
Gemini 3.7 Flash lee PDFs de forma nativa, y su puntuación de referencia GDP.pdf subió del 22.0% al 34.0% respecto a 3.6 Flash, por lo que la extracción de documentos es una carga de trabajo que Google espera que ejecute aquí. Asuma 500 documentos al día, cada uno promediando 40,000 tokens de entrada (un contrato o informe largo), produciendo un resumen estructurado de 1,000 tokens.
| Elemento | Tokens diarios | Costo introductorio/día | Costo estándar/día |
|---|---|---|---|
| Entrada | 20M | $15.00 | $30.00 |
| Salida | 0.5M | $1.88 | $3.75 |
| Total | 20.5M | $16.88 | $33.75 |
Unos $506 al mes ahora, $1,013 a partir de enero. Observe la forma: la entrada domina porque los documentos son largos y los resúmenes son cortos. El almacenamiento en caché y el procesamiento por lotes afectan más a esta carga de trabajo.
Carga de trabajo 3: un bucle de agente
Los agentes multiplican las llamadas. Asuma 200 tareas al día, cada una promediando 12 llamadas al modelo, donde cada llamada lleva 8,000 tokens de entrada (el contexto creciente más los resultados de las herramientas) y devuelve 400 tokens de salida.
| Elemento | Tokens diarios | Costo introductorio/día | Costo estándar/día |
|---|---|---|---|
| Entrada | 19.2M | $14.40 | $28.80 |
| Salida | 0.96M | $3.60 | $7.20 |
| Total | 20.16M | $18.00 | $36.00 |
Eso es $540 al mes con tarifas introductorias, $1,080 con tarifas estándar. La lección de la facturación de agentes: el contexto crece con cada paso, por lo que el número de llamadas y la longitud del contexto se acumulan. Una tarea que pasa de 12 llamadas a 20 le cuesta un 67% más, y nada en la tabla de precios le advirtió.
Un número más que vale la pena tener en cuenta: el límite de salida de 64k establece su peor caso por llamada en aproximadamente $0.24 hoy y $0.48 el próximo año. Un bucle de reintento que maximiza la salida en cada intento se vuelve costoso rápidamente, pero no puede volverse ilimitadamente costoso.
Cómo se compara el precio de 3.7 Flash
Las comparaciones exactas por token entre proveedores quedan obsoletas en semanas, así que trate esto como un posicionamiento, no como una lista de precios.
Gemini 3.7 Flash se sitúa en el nivel de "caballo de batalla": mucho más barato que los modelos de vanguardia como la línea Pro de Gemini, los modelos más grandes de Claude o el nivel insignia de OpenAI, mientras que presenta puntuaciones de referencia (65.3% en DeepSWE v1.1, un Elo de 1588 en WebDev Arena) que se superponen con lo que los modelos insignia publicaron no hace mucho. La apuesta de Google es que la mayoría del tráfico de producción no necesita un modelo de vanguardia, y el descuento introductorio es una invitación de cuatro meses para probar esa afirmación en su propia carga de trabajo.
El contexto competitivo también importa. Los proveedores de nivel económico han estado moviendo los precios en la otra dirección; DeepSeek aumentó sus tarifas de API y empujó a los equipos a reconsiderar los presupuestos de tokens, una historia cubierta en la guía de aumento de precios y optimización de costos de DeepSeek. La conclusión se traslada directamente a Gemini: cualquier precio sobre el que construya un margen puede moverse, y Google ya le ha dicho la fecha y la cantidad. Esa es más advertencia de la que la mayoría de los proveedores ofrecen.
Si su tráfico es irregular o experimental, recuerde que la duplicación solo afecta a las cargas de trabajo sostenidas. Un prototipo que cuesta $3 durante el período introductorio costará $6 más tarde. A nadie le importa. Una pipeline de $10,000 al mes que se convierte en $20,000 es una partida presupuestaria sobre la que su equipo de finanzas preguntará en febrero.
Cinco formas de reducir el gasto en tokens
La relación de precios de salida a entrada de 5x y la duplicación de enero apuntan al mismo conjunto de palancas.
- Limitar los tokens de salida por endpoint. Establezca
maxOutputTokensengenerationConfigal valor más pequeño que necesite cada endpoint. Una respuesta de soporte rara vez necesita más de 500 tokens; dejar el límite en el valor predeterminado de 64k significa que una generación confusa puede costar 100 veces más que una normal. Este es el cambio de mayor rendimiento porque los tokens de salida tienen el multiplicador de 5x. - Almacene en caché su contexto estático. Si cada solicitud reenvía el mismo prompt de sistema y documento de política de 3,000 tokens, está pagando el precio completo de entrada por bytes idénticos miles de veces al día. El almacenamiento en caché de contexto factura los tokens repetidos a una tarifa con descuento; consulte la documentación de la API de Gemini para la configuración y tarifas de almacenamiento en caché actuales. Para el chatbot anterior, el almacenamiento en caché de un prefijo estático de 1,500 tokens reduce la factura de entrada en casi la mitad.
- Procese por lotes el trabajo no interactivo. La tubería de documentos no necesita respuestas en subsegundos. El procesamiento por lotes intercambia latencia por una tarifa con descuento, y las ejecuciones de documentos durante la noche son exactamente la forma de tráfico para la que existe.
- Adapte el tamaño del modelo por ruta. No todas las llamadas necesitan 3.7 Flash. Las tareas de clasificación, enrutamiento y extracción corta a menudo funcionan bien en un modelo de nivel Flash-Lite a una fracción del costo. Mantenga 3.7 Flash para las llamadas que usan lo que está pagando: planificación de varios pasos, depuración, cadenas de llamadas a herramientas.
- Prototipado en el nivel gratuito. La cuota gratuita de AI Studio es suficiente para bloquear los prompts y los esquemas de respuesta antes de que se mueva un solo token facturado. La guía de acceso gratuito e ilimitado a la API de Gemini cubre hasta dónde se extiende la ruta gratuita y dónde residen sus límites.
Rastree el gasto por endpoint con Apidog
Las estimaciones le proporcionan un presupuesto; la medición por solicitud lo mantiene dentro de él. Cada respuesta de Gemini incluye un bloque usageMetadata con recuentos de tokens de prompt y salida, lo que significa que su capa de pruebas de API puede funcionar como un medidor de costos.
En Apidog, el flujo de trabajo es así:
- Guarde una solicitud por cada endpoint de producción (turno de chat, resumen de documento, paso de agente) en una colección, con la clave API vinculada a una variable de entorno
GEMINI_API_KEY. - Cree un escenario de prueba que dispare cada solicitud contra cargas útiles realistas y extraiga
usageMetadata.promptTokenCountyusageMetadata.candidatesTokenCountde la respuesta. - Añada aserciones sobre esos recuentos. Si una edición de prompt empuja el endpoint de chat más allá, digamos, de 2,500 tokens de entrada, el escenario falla antes de que el cambio se implemente y silenciosamente aumenta su factura en un 25%.
- Vuelva a ejecutar el escenario en cada cambio de prompt o esquema. Los recuentos de tokens regresan de la misma manera que la latencia; la diferencia es que las regresiones de tokens llegan como una factura.
Multiplique los recuentos medidos por los precios de nivel en esta guía y tendrá cifras de costos por endpoint basadas en respuestas reales en lugar de suposiciones. Los equipos que ya ejecutan suites de API basadas en aserciones reconocerán el patrón; la guía de pruebas de API para ingenieros de QA cubre cómo estructurar escenarios como estos en todo un servicio.
Preguntas frecuentes
¿Cuándo se duplica el precio de Gemini 3.7 Flash?
El 1 de enero de 2027. La tarifa introductoria de $0.75 por 1M de tokens de entrada y $3.75 por 1M de tokens de salida estará vigente hasta el 31 de diciembre de 2026, y luego pasará a la tarifa estándar de $1.50 y $7.50. Google publicó ambos niveles en el lanzamiento, por lo que el aumento está programado, no es especulativo.
¿Es Gemini 3.7 Flash más barato que Gemini 3.6 Flash?
En el lanzamiento, sí. El precio introductorio de 3.7 Flash es la mitad del precio de lanzamiento de 3.6 Flash, mientras que los puntos de referencia mejoraron en todos los ámbitos (DeepSWE v1.1 pasó del 49.0% al 65.3%). Las tablas completas de especificaciones y puntos de referencia se encuentran en la referencia rápida de Gemini 3.7 Flash si desea una comparación lado a lado.
¿Se aplica el precio introductorio en Vertex AI?
Las tarifas de esta guía son tarifas de la API de Gemini facturadas a través de una clave de AI Studio. Vertex AI factura a través de Google Cloud con sus propias SKU y términos empresariales. Si ejecuta tráfico de producción en Vertex, confirme los números actuales en su consola de facturación de GCP y en la página oficial de precios en lugar de asumir la paridad.
¿Qué se cuenta en la factura de tokens de entrada?
Todo lo que envía: texto, imágenes, video, audio y páginas PDF se convierten en tokens y se facturan a la tarifa de entrada. Los documentos largos y las solicitudes con muchos medios son donde los costos de entrada sorprenden a la gente, por eso el ejemplo de la pipeline anterior asume 40,000 tokens por documento. El bloque usageMetadata en cada respuesta le indica el recuento exacto después del hecho.
¿Cómo estimo los tokens antes de enviar una solicitud?
Utilice el endpoint countTokens de la API para medir una carga útil sin generar nada, o envíe un puñado de solicitudes representativas y lea usageMetadata de las respuestas. De cualquier manera, mida con cargas útiles reales. La intuición del tokenizador de otros proveedores se transfiere mal entre familias de modelos.
Dónde encaja 3.7 Flash en su pila
Gemini 3.7 Flash con precios de introducción es el más barato que un modelo tan capaz ha sido nunca, y Google le dijo la fecha exacta en que eso dejará de ser cierto. La estrategia racional: mueva su tráfico de "caballo de batalla" a este modelo ahora, mida el consumo real de tokens por endpoint mientras el descuento está vigente, y use esos cuatro meses de datos para decidir qué se mantiene en 3.7 Flash, qué pasa a un modelo más ligero y cómo será la factura con tarifa estándar antes de que llegue.
La mitad de medición de ese plan necesita herramientas. Descargue Apidog para mantener sus solicitudes de Gemini, entornos, aserciones de tokens y verificaciones de costos en un solo espacio de trabajo, de modo que la factura de enero sea un número que predijo en lugar de uno que descubra.
