Gemini 3.8 Flash: Precios, tarifas iniciales, tokens de procesamiento y el costo real por tarea

Precios de Gemini 3.8 Flash: $0.75/$3.75 tarifas introductorias que se duplicarán el 1 de enero de 2027, los tokens de pensamiento se facturan como salida, almacenamiento en caché, procesamiento por lotes, y por qué el coste por tarea subió a $0.58.

Ashley Goolam

Ashley Goolam

3 September 2026

Gemini 3.8 Flash: Precios, tarifas iniciales, tokens de procesamiento y el costo real por tarea

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Gemini 3.8 Flash cuesta $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida, la misma tarifa introductoria que Google estableció para 3.7 Flash. Esa tarifa se extiende hasta el 31 de diciembre de 2026. El 1 de enero de 2027 se duplica a $1.50 y $7.50, y la misma duplicación afecta a 3.6 Flash y 3.7 Flash el mismo día. Nada sobre el precio por token cambió con esta versión.

Lo que sí cambió es cuántos tokens gasta el modelo. Google dice que 3.8 Flash "trabaja más duro": realiza más pasos de razonamiento, llama a herramientas de forma iterativa y "puede usar más tokens en tareas más largas y complejas, por diseño". Artificial Analysis midió el efecto de forma independiente: ejecutar su Índice de Inteligencia costó $0.58 por tarea en 3.8 Flash con un pensamiento alto, frente a $0.40 en 3.7 Flash, con aproximadamente un 30% más de tokens de salida por tarea. Mismo precio de etiqueta, factura más alta.

Esta guía recorre cada línea de la página oficial de precios de la API de Gemini, elabora un ejemplo de 1,000 tareas al día en cada nivel de pensamiento y compara la tarifa con Flash-Lite, Claude Sonnet 5 y GPT-5.6 Luna. Para una descripción general del modelo, comience con qué es Gemini 3.8 Flash.

Precios de Gemini 3.8 Flash de un vistazo

Todos los precios son por 1 millón de tokens en el nivel de pago.

Tarifa Intro (hasta el 31 de dic de 2026) Estándar (a partir del 1 de enero de 2027)
Entrada (texto, imagen, vídeo, audio, PDF) $0.75 $1.50
Salida (incluye tokens de pensamiento) $3.75 $7.50
Lectura de caché de contexto $0.075 $0.15
Almacenamiento en caché (por 1M de tokens por hora) $0.50 $1.00
Entrada de API por lotes (50% de descuento) $0.375 $0.75
Salida de API por lotes (50% de descuento) $1.875 $3.75
Google Search grounding (contextualización) 5,000 solicitudes gratuitas/mes compartidas entre Gemini 3.x, luego $14 por 1,000 Igual
Nivel gratuito $0, con límites de tasa, datos utilizados para mejorar los productos de Google Igual

Tres detalles importan más que las cifras principales. El precio de salida cubre los tokens de pensamiento, por lo que el razonamiento interno se factura a $3.75, no a $0.75. La tarifa introductoria tiene una fecha de finalización fija. Y las filas de 3.7 Flash y 3.6 Flash conllevan la misma duplicación del 1 de enero, por lo que un Flash más antiguo no lo protege del aumento. El desglose de precios de 3.7 Flash cubre las mismas tarifas en un modelo que gasta menos tokens por tarea.

Los tokens de pensamiento son tokens de salida

Gemini 3.8 Flash razona antes de responder, y cada token de ese razonamiento se mide como salida. La API reporta el recuento como usageMetadata.thoughtsTokenCount en una respuesta generateContent, separado de candidatesTokenCount (la respuesta visible) y promptTokenCount (su entrada). Ambos contenedores de salida se facturan al mismo precio de $3.75.

Usted controla la cantidad con thinking_level: low (bajo), medium (medio) o high (alto). En 3.8 Flash, el valor predeterminado es medium, no high como en Gemini 3 Pro. minimal ha desaparecido y devuelve un error de validación, por lo que cualquier configuración transferida de modelos anteriores necesita que ese valor se asigne a low. La documentación de pensamiento de Google describe los niveles como esfuerzo relativo, no como un presupuesto de tokens, por lo que no puede limitar directamente los tokens de pensamiento como lo permitía el antiguo entero thinking_budget. Lo que cada nivel hace a la latencia y al costo se encuentra en la guía de niveles de pensamiento de 3.8 Flash.

Una rápida ilustración con tamaños inventados pero realistas. Suponga que una solicitud envía 10,000 tokens de entrada y recibe 2,000 tokens de salida visibles más 6,000 tokens de pensamiento. A tarifas introductorias:

El pensamiento representa el 75% del cargo de salida y el 60% de la solicitud completa. A partir del 1 de enero, la misma solicitud costará $0.015 + $0.06 = $0.075. "Mismo precio que 3.7" es cierto e incompleto: la tarifa se mantuvo, el recuento de tokens se movió.

Por qué el costo por tarea subió mientras que el precio no

La publicación de lanzamiento de Google es directa sobre el intercambio: en tareas complejas, el modelo "ejecuta pasos de razonamiento adicionales y llama a herramientas de forma iterativa", verificando su trabajo a lo largo del camino. Más pasos significan más tokens de pensamiento y, en bucles de agentes, más turnos de llamada a herramientas. El consejo de mitigación de Google: baje el thinking_level, o manténgase en 3.7 Flash.

Artificial Analysis le puso números. Su Índice de Inteligencia ejecuta nueve evaluaciones; 3.8 Flash en alto obtuvo 59 frente a 56 para 3.7 Flash en alto, utilizando aproximadamente 48,000 tokens de salida por tarea en promedio, un 30% más que 3.7 Flash. El costo de ejecutar el índice por tarea:

Configuración Costo por tarea (AA, tarifas introductorias) Tiempo por tarea
Gemini 3.8 Flash, alto $0.58 2.5 min
Gemini 3.8 Flash, medio $0.41 no publicado
Gemini 3.8 Flash, bajo $0.24 0.8 min
Gemini 3.7 Flash, alto $0.40 2.2 min

Lea la tabla de dos maneras. En comparación con su predecesor, 3.8 Flash en alto cuesta un 45% más por tarea ($0.58 / $0.40 = 1.45) para una ganancia de tres puntos en el índice. En comparación consigo mismo, bajar de alto a medio reduce el costo por tarea en un 29% ($0.41 / $0.58 = 0.71), y bajo lo reduce en un 59% ($0.24 / $0.58 = 0.41). Medio en 3.8 Flash se sitúa a un céntimo de alto en 3.7 Flash, un ancla útil al decidir si actualizar. La comparación de 3.8 Flash vs 3.7 Flash analiza esa decisión por carga de trabajo.

Artificial Analysis también enumera un precio combinado de $0.58 por millón de tokens con una relación de entrada a salida de 3:1. Que coincida con el costo de alto nivel por tarea es una coincidencia; uno es una tarifa por token, el otro depende de cuántos tokens el modelo elija gastar.

Asegure la tarifa introductoria antes del 31 de diciembre

"Asegurar" necesita un significado preciso, porque la tarifa introductoria no es un contrato. Google factura el uso a la tarifa vigente en el momento en que se consumen los tokens, por lo que no se puede prepagar el uso de 2027 a precios de 2026, y pasar a 3.7 o 3.6 Flash no ayuda. Lo que sí se puede hacer es cambiar el trabajo discrecional a este período:

Si el precio es el factor decisivo entre proveedores, nuestro resumen de proveedores de API de LLM más baratos expone todo el panorama; la comparación de Fable 5.1 y GPT-5.6 Sol cubre los niveles premium.

Cómo se compara con Flash-Lite, Sonnet 5 y GPT-5.6 Luna

Tasas por token, por 1 millón de tokens:

Modelo Entrada Salida Notas
Gemini 3.8 Flash (intro) $0.75 $3.75 El pensamiento se factura como salida; lectura de caché $0.075
Gemini 3.8 Flash (a partir del 1 de enero) $1.50 $7.50 Lectura de caché $0.15
Gemini 3.5 Flash-Lite $0.30 $2.50 Aproximadamente 350 tok/s
Claude Sonnet 5 $2 $10 Permanente; la subida del 1 de septiembre fue cancelada
GPT-5.6 Luna $1 $6

A tarifas introductorias, la entrada de 3.8 Flash es 2.5 veces la de Flash-Lite y la salida es 1.5 veces. Frente a Sonnet 5, 3.8 Flash es aproximadamente 2.7 veces más barato tanto en entrada ($2 / $0.75) como en salida ($10 / $3.75). Frente a Luna también es más barato: $0.75 vs $1 en entrada, $3.75 vs $6 en salida.

El panorama cambia el 1 de enero. Con $1.50 y $7.50, 3.8 Flash se vuelve más caro que Luna en ambos lados, y la brecha con Sonnet 5 se reduce a aproximadamente 1.3x ($2 / $1.50 y $10 / $7.50). Flash-Lite sigue siendo más barato en todo momento. Si la tarifa introductoria es la razón por la que eligió 3.8 Flash, ponga la reevaluación de enero en el calendario ahora.

La comparación por token es solo la mitad. Un modelo que gasta menos tokens por respuesta puede costar menos por tarea a una tarifa más alta, y la única forma de saberlo es ejecutar el mismo conjunto de tareas a través de cada candidato y leer los recuentos de uso. La guía de la API de 3.8 Flash muestra cómo leer usageMetadata tanto de la API de interacciones como del generateContent heredado.

Detecte regresiones de costos con las aserciones de tokens de Apidog

El modo de fallo con 3.8 Flash no es una respuesta incorrecta. Es una respuesta correcta que silenciosamente usó un 40% más de tokens después de un ajuste del prompt o un cambio en el nivel de pensamiento, y nadie lo nota hasta la factura. Apidog lo soluciona tratando el recuento de tokens como un campo sobre el cual se debe realizar una aserción, como un código de estado.

Captura de pantalla de la configuración de aserciones de tokens de Apidog.
  1. Almacene la clave como una variable de entorno. Cree GEMINI_API_KEY en un entorno de Apidog y haga referencia a ella como {{GEMINI_API_KEY}} en el encabezado x-goog-api-key, para que la clave nunca quede en una solicitud guardada.
  2. Envíe un prompt "dorado". Guarde una solicitud POST a https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent con un prompt representativo y un thinkingConfig.thinkingLevel explícito, uno por cada ruta de producción.
  3. Afirme sobre los campos de uso. Agregue un script de postprocesamiento que lea usageMetadata y falle la prueba si los tokens exceden un límite establecido a partir de su línea de base:
const usage = pm.response.json().usageMetadata;
pm.test("tokens de pensamiento dentro del presupuesto", () => {
  pm.expect(usage.thoughtsTokenCount).to.be.below(8000); // los tokens de pensamiento deben ser inferiores a 8000
});
pm.test("salida visible dentro del presupuesto", () => {
  pm.expect(usage.candidatesTokenCount).to.be.below(2500); // la salida visible debe ser inferior a 2500
});
pm.test("costo de solicitud dentro del presupuesto", () => {
  const cost = usage.promptTokenCount * 0.75 / 1e6
    + (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
  pm.expect(cost).to.be.below(0.05); // el costo debe ser inferior a 0.05
});
  1. Prográmelo. Coloque las solicitudes en un escenario de prueba y ejecútelo según un cronograma, de modo que un salto en el uso de tokens aparezca como una ejecución fallida el mismo día; nuestra guía para programar pruebas de API en Apidog cubre la configuración. Actualice las dos constantes de tarifa el 1 de enero y la aserción de costos seguirá rastreando la factura.

El mismo escenario sirve como una competencia entre proveedores: apunte una copia a Flash-Lite, Sonnet 5 o Luna y compare los campos de uso uno al lado del otro. Descargue Apidog para construir el primer escenario; el plan gratuito cubre este flujo de trabajo.

Preguntas Frecuentes

¿Gemini 3.8 Flash cuesta más que 3.7 Flash? Por token, no. Ambos cuestan $0.75 de entrada y $3.75 de salida hasta el 31 de diciembre, luego $1.50 y $7.50. Por tarea, sí: Artificial Analysis midió $0.58 por tarea de índice en 3.8 Flash en alto frente a $0.40 en 3.7 Flash, porque 3.8 Flash genera aproximadamente un 30% más de tokens de salida.

¿Los tokens de pensamiento se facturan por separado? No. Se facturan como tokens de salida a $3.75 por millón (intro) y aparecen en usageMetadata.thoughtsTokenCount. Los controla indirectamente a través de thinking_level; no hay un presupuesto de tokens fijo en 3.8 Flash, y minimal devuelve un error.

¿Existe un nivel gratuito para Gemini 3.8 Flash? Sí. El nivel gratuito de AI Studio no cobra nada por entrada ni salida, con límites de tasa mostrados en AI Studio, y Google utiliza los datos del nivel gratuito para mejorar sus productos. La aplicación Gemini para consumidores solo ofrece 3.8 Flash a los suscriptores de AI Pro y Ultra. Los detalles están en la guía de uso gratuito.

¿Qué pasa con mis costos el 1 de enero de 2027? Las tarifas de entrada, salida, lectura de caché, almacenamiento en caché y por lotes se duplican. Si el uso de tokens por tarea se mantiene igual, su factura también se duplica. Las filas de 3.6 y 3.7 Flash se duplican en la misma fecha.

¿Qué nivel de pensamiento mantiene los costos bajos? Parta de la distribución de Artificial Analysis: bajo $0.24, medio $0.41, alto $0.58 por tarea de índice. Realice sus propias evaluaciones en cada nivel, mantenga el más bajo que apruebe y afirme sobre los recuentos de tokens para que la configuración no se desvíe.

Qué hacer esta semana

Gemini 3.8 Flash tiene un precio similar a 3.7 Flash y gasta tokens como un modelo más grande. Trate el nivel de pensamiento como una configuración de costo y ajústelo por ruta. Mueva el trabajo compatible con lotes al período introductorio antes del 31 de diciembre. Establezca una línea de base para su uso de tokens ahora y afirme sobre ella, para que la duplicación de enero sea un cambio que usted ya ha tenido en cuenta en su presupuesto.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs