Gemini 3.7 Flash Precios Explicados: Asegura tus Tarifas Antes de que se Dupliquen

Precios de Gemini 3.7 Flash: $0.75/$3.75 por 1M de tokens hasta el 31 de diciembre de 2026, luego las tarifas se duplican. Consulta ejemplos de costos resueltos y cinco formas de reducir tu gasto en tokens.

Ashley Innocent

Ashley Innocent

14 August 2026

Gemini 3.7 Flash Precios Explicados: Asegura tus Tarifas Antes de que se Dupliquen

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Google lanzó Gemini 3.7 Flash el 13 de agosto de 2026, tres semanas después de 3.6 Flash, y lo llama “nuestro modelo de caballo de batalla más inteligente”. Para cualquiera que esté atento a una factura de API, el detalle más importante se encuentra en la tabla de precios, no en los puntos de referencia: la tarifa introductoria de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida vence el 31 de diciembre de 2026. A partir del 1 de enero de 2027, ambas tarifas se duplicarán.

Eso representa una duplicación programada en cada carga de trabajo que construya sobre este modelo. Un chatbot que cuesta $790 al mes hoy, costará $1,575 al mes en enero sin cambios en su código, su tráfico o sus prompts. Así que, cuando presupueste un proyecto 3.7 Flash, modele ambos niveles, no el precio de etiqueta.

Esta guía detalla los dos niveles, el cálculo de tokens para tres cargas de trabajo reales, cómo se compara el precio con otras API de modelos y dónde recortar gastos antes de que se dupliquen las tarifas. Si aún no ha enviado una primera solicitud, la guía de inicio rápido de la API de Gemini 3.7 Flash cubre la configuración. Una vez que esté haciendo llamadas, Apidog muestra los recuentos de tokens de usageMetadata en cada respuesta, por lo que cada estimación a continuación se convierte en un número que puede verificar con el tráfico en vivo.

botón

En resumen

Los dos niveles de precios

Gemini 3.7 Flash se lanzó con un descuento por tiempo limitado en lugar de un precio permanente. Aquí está el panorama completo para la API de Gemini:

Nivel Ventana Entrada (por 1M de tokens) Salida (por 1M de tokens)
Introductorio 13 de agosto de 2026 al 31 de diciembre de 2026 $0.75 $3.75
Estándar A partir del 1 de enero de 2027 $1.50 $7.50

Dos cosas destacan. Primero, la tarifa introductoria es la mitad de lo que costó Gemini 3.6 Flash cuando se lanzó, lo que convierte los próximos cuatro meses y medio en el período más barato que esta familia de modelos ha tenido. Si está considerando una actualización de 3.6, la guía de migración de 3.6 a 3.7 Flash cubre el cambio; la reducción de precio por sí sola paga las pruebas de regresión.

En segundo lugar, los tokens de salida cuestan 5 veces más que los tokens de entrada en ambos niveles. Esa proporción influye en cada decisión de optimización posterior en esta guía: recortar un prompt de sistema prolijo ahorra centavos, mientras que limitar una salida descontrolada ahorra dólares.

Las tarifas anteriores cubren la API de Gemini facturada a través de una clave de AI Studio. Vertex AI funciona a través de la facturación de Google Cloud con sus propias SKU, y características como el almacenamiento en caché de contexto y el procesamiento por lotes tienen sus propios elementos de línea, así que confirme los números actuales en la página oficial de precios antes de comprometer un presupuesto.

Lo que cuesta una carga de trabajo real

Los precios por millón de tokens no significan nada hasta que los multiplica por el tráfico. Aquí hay tres perfiles de carga de trabajo con las suposiciones indicadas, para que pueda sustituir sus propios números.

Carga de trabajo 1: un chatbot de soporte al cliente

Asuma 10,000 solicitudes al día. Cada solicitud lleva aproximadamente 2,000 tokens de entrada (prompt del sistema, una pequeña ventana de historial, el mensaje del usuario) y devuelve alrededor de 300 tokens de salida.

Elemento Tokens diarios Costo introductorio/día Costo estándar/día
Entrada 20M $15.00 $30.00
Salida 3M $11.25 $22.50
Total 23M $26.25 $52.50

Eso es aproximadamente $788 al mes con tarifas introductorias y $1,575 al mes con tarifas estándar en un mes de 30 días. Por cada turno de conversación, hoy está pagando alrededor de un cuarto de centavo.

Carga de trabajo 2: una tubería de documentos PDF

Gemini 3.7 Flash lee PDFs de forma nativa, y su puntuación de referencia GDP.pdf subió del 22.0% al 34.0% respecto a 3.6 Flash, por lo que la extracción de documentos es una carga de trabajo que Google espera que ejecute aquí. Asuma 500 documentos al día, cada uno promediando 40,000 tokens de entrada (un contrato o informe largo), produciendo un resumen estructurado de 1,000 tokens.

Elemento Tokens diarios Costo introductorio/día Costo estándar/día
Entrada 20M $15.00 $30.00
Salida 0.5M $1.88 $3.75
Total 20.5M $16.88 $33.75

Unos $506 al mes ahora, $1,013 a partir de enero. Observe la forma: la entrada domina porque los documentos son largos y los resúmenes son cortos. El almacenamiento en caché y el procesamiento por lotes afectan más a esta carga de trabajo.

Carga de trabajo 3: un bucle de agente

Los agentes multiplican las llamadas. Asuma 200 tareas al día, cada una promediando 12 llamadas al modelo, donde cada llamada lleva 8,000 tokens de entrada (el contexto creciente más los resultados de las herramientas) y devuelve 400 tokens de salida.

Elemento Tokens diarios Costo introductorio/día Costo estándar/día
Entrada 19.2M $14.40 $28.80
Salida 0.96M $3.60 $7.20
Total 20.16M $18.00 $36.00

Eso es $540 al mes con tarifas introductorias, $1,080 con tarifas estándar. La lección de la facturación de agentes: el contexto crece con cada paso, por lo que el número de llamadas y la longitud del contexto se acumulan. Una tarea que pasa de 12 llamadas a 20 le cuesta un 67% más, y nada en la tabla de precios le advirtió.

Un número más que vale la pena tener en cuenta: el límite de salida de 64k establece su peor caso por llamada en aproximadamente $0.24 hoy y $0.48 el próximo año. Un bucle de reintento que maximiza la salida en cada intento se vuelve costoso rápidamente, pero no puede volverse ilimitadamente costoso.

Cómo se compara el precio de 3.7 Flash

Las comparaciones exactas por token entre proveedores quedan obsoletas en semanas, así que trate esto como un posicionamiento, no como una lista de precios.

Gemini 3.7 Flash se sitúa en el nivel de "caballo de batalla": mucho más barato que los modelos de vanguardia como la línea Pro de Gemini, los modelos más grandes de Claude o el nivel insignia de OpenAI, mientras que presenta puntuaciones de referencia (65.3% en DeepSWE v1.1, un Elo de 1588 en WebDev Arena) que se superponen con lo que los modelos insignia publicaron no hace mucho. La apuesta de Google es que la mayoría del tráfico de producción no necesita un modelo de vanguardia, y el descuento introductorio es una invitación de cuatro meses para probar esa afirmación en su propia carga de trabajo.

El contexto competitivo también importa. Los proveedores de nivel económico han estado moviendo los precios en la otra dirección; DeepSeek aumentó sus tarifas de API y empujó a los equipos a reconsiderar los presupuestos de tokens, una historia cubierta en la guía de aumento de precios y optimización de costos de DeepSeek. La conclusión se traslada directamente a Gemini: cualquier precio sobre el que construya un margen puede moverse, y Google ya le ha dicho la fecha y la cantidad. Esa es más advertencia de la que la mayoría de los proveedores ofrecen.

Si su tráfico es irregular o experimental, recuerde que la duplicación solo afecta a las cargas de trabajo sostenidas. Un prototipo que cuesta $3 durante el período introductorio costará $6 más tarde. A nadie le importa. Una pipeline de $10,000 al mes que se convierte en $20,000 es una partida presupuestaria sobre la que su equipo de finanzas preguntará en febrero.

Cinco formas de reducir el gasto en tokens

La relación de precios de salida a entrada de 5x y la duplicación de enero apuntan al mismo conjunto de palancas.

Rastree el gasto por endpoint con Apidog

Las estimaciones le proporcionan un presupuesto; la medición por solicitud lo mantiene dentro de él. Cada respuesta de Gemini incluye un bloque usageMetadata con recuentos de tokens de prompt y salida, lo que significa que su capa de pruebas de API puede funcionar como un medidor de costos.

En Apidog, el flujo de trabajo es así:

  1. Guarde una solicitud por cada endpoint de producción (turno de chat, resumen de documento, paso de agente) en una colección, con la clave API vinculada a una variable de entorno GEMINI_API_KEY.
  2. Cree un escenario de prueba que dispare cada solicitud contra cargas útiles realistas y extraiga usageMetadata.promptTokenCount y usageMetadata.candidatesTokenCount de la respuesta.
  3. Añada aserciones sobre esos recuentos. Si una edición de prompt empuja el endpoint de chat más allá, digamos, de 2,500 tokens de entrada, el escenario falla antes de que el cambio se implemente y silenciosamente aumenta su factura en un 25%.
  4. Vuelva a ejecutar el escenario en cada cambio de prompt o esquema. Los recuentos de tokens regresan de la misma manera que la latencia; la diferencia es que las regresiones de tokens llegan como una factura.

Multiplique los recuentos medidos por los precios de nivel en esta guía y tendrá cifras de costos por endpoint basadas en respuestas reales en lugar de suposiciones. Los equipos que ya ejecutan suites de API basadas en aserciones reconocerán el patrón; la guía de pruebas de API para ingenieros de QA cubre cómo estructurar escenarios como estos en todo un servicio.

Preguntas frecuentes

¿Cuándo se duplica el precio de Gemini 3.7 Flash?

El 1 de enero de 2027. La tarifa introductoria de $0.75 por 1M de tokens de entrada y $3.75 por 1M de tokens de salida estará vigente hasta el 31 de diciembre de 2026, y luego pasará a la tarifa estándar de $1.50 y $7.50. Google publicó ambos niveles en el lanzamiento, por lo que el aumento está programado, no es especulativo.

¿Es Gemini 3.7 Flash más barato que Gemini 3.6 Flash?

En el lanzamiento, sí. El precio introductorio de 3.7 Flash es la mitad del precio de lanzamiento de 3.6 Flash, mientras que los puntos de referencia mejoraron en todos los ámbitos (DeepSWE v1.1 pasó del 49.0% al 65.3%). Las tablas completas de especificaciones y puntos de referencia se encuentran en la referencia rápida de Gemini 3.7 Flash si desea una comparación lado a lado.

¿Se aplica el precio introductorio en Vertex AI?

Las tarifas de esta guía son tarifas de la API de Gemini facturadas a través de una clave de AI Studio. Vertex AI factura a través de Google Cloud con sus propias SKU y términos empresariales. Si ejecuta tráfico de producción en Vertex, confirme los números actuales en su consola de facturación de GCP y en la página oficial de precios en lugar de asumir la paridad.

¿Qué se cuenta en la factura de tokens de entrada?

Todo lo que envía: texto, imágenes, video, audio y páginas PDF se convierten en tokens y se facturan a la tarifa de entrada. Los documentos largos y las solicitudes con muchos medios son donde los costos de entrada sorprenden a la gente, por eso el ejemplo de la pipeline anterior asume 40,000 tokens por documento. El bloque usageMetadata en cada respuesta le indica el recuento exacto después del hecho.

¿Cómo estimo los tokens antes de enviar una solicitud?

Utilice el endpoint countTokens de la API para medir una carga útil sin generar nada, o envíe un puñado de solicitudes representativas y lea usageMetadata de las respuestas. De cualquier manera, mida con cargas útiles reales. La intuición del tokenizador de otros proveedores se transfiere mal entre familias de modelos.

Dónde encaja 3.7 Flash en su pila

Gemini 3.7 Flash con precios de introducción es el más barato que un modelo tan capaz ha sido nunca, y Google le dijo la fecha exacta en que eso dejará de ser cierto. La estrategia racional: mueva su tráfico de "caballo de batalla" a este modelo ahora, mida el consumo real de tokens por endpoint mientras el descuento está vigente, y use esos cuatro meses de datos para decidir qué se mantiene en 3.7 Flash, qué pasa a un modelo más ligero y cómo será la factura con tarifa estándar antes de que llegue.

La mitad de medición de ese plan necesita herramientas. Descargue Apidog para mantener sus solicitudes de Gemini, entornos, aserciones de tokens y verificaciones de costos en un solo espacio de trabajo, de modo que la factura de enero sea un número que predijo en lugar de uno que descubra.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs