Gemini 3.8 Flash vs 3.7 Flash: Novedades y ¿vale la pena actualizar?

Gemini 3.8 Flash vs 3.7 Flash: mismo precio, velocidad y contexto, pero +3 en el índice AA, +12 en tau3-Banking y un 30% más de tokens de salida por tarea. ¿Actualizar?

Medy Evrard

3 September 2026

Gemini 3.8 Flash vs 3.7 Flash: Novedades y ¿vale la pena actualizar?

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026, tres semanas después de Gemini 3.7 Flash y seis semanas después de 3.6 Flash. El mismo precio de introducción ($0.75 de entrada, $3.75 de salida por millón de tokens hasta el 31 de diciembre), el mismo contexto de 1M de tokens y, según el propio encuadre de Google, aproximadamente la misma velocidad. Lo que cambió es cómo funciona el modelo: toma pasos de razonamiento más pequeños, verifica su propia salida y llama a herramientas en bucles. Eso le otorga una puntuación más alta en cada benchmark publicado. También hace que cada tarea cueste más tokens.

Así que la pregunta de la actualización no es "¿es 3.8 Flash mejor?" Sobre el papel, sí lo es. La pregunta es si la calidad adicional compensa los tokens adicionales en su carga de trabajo, y si los dos cambios importantes afectan su código. Esta comparación analiza lo que se mantuvo igual, lo que mejoró, lo que le cuesta y una matriz de decisión por carga de trabajo. Las fuentes son la publicación de lanzamiento de Google, la página Novedades de Gemini 3.8 Flash y las pruebas independientes de Artificial Analysis. Para la hoja de especificaciones completa, comience con qué es Gemini 3.8 Flash.

Una cosa más de antemano: Google dice que "Gemini 3.7 Flash sigue siendo totalmente compatible" y no ha publicado ninguna fecha de deprecación. Nadie le está obligando.

Comparativa

Gemini 3.8 Flash Gemini 3.7 Flash
ID del modelo gemini-3.8-flash gemini-3.7-flash
Lanzamiento 2 de septiembre de 2026 13 de agosto de 2026
Base "Basado en Gemini 3.7 Flash" (ficha del modelo) n/a
Contexto / salida máxima 1,048,576 / 65,536 tokens Igual
Precio de entrada (introducción, hasta el 31 de diciembre) $0.75 por millón $0.75 por millón
Precio de salida (introducción, hasta el 31 de diciembre) $3.75 por millón, pensamiento incluido $3.75 por millón, pensamiento incluido
Precio estándar (a partir del 1 de enero de 2027) $1.50 / $7.50 $1.50 / $7.50
Lectura de caché de contexto $0.075 por millón (introducción) Igual
Procesamiento por lotes 50% de descuento, los mismos niveles de tokens en cola Igual
Niveles de pensamiento low, medium (predeterminado), high low, medium, high
Nivel de pensamiento minimal Error de validación Aceptado (nota de migración de Google: asignarlo a low)
Fecha de corte de conocimiento Marzo de 2026 No se volvió a especificar en la documentación de 3.8
Velocidad de salida (Artificial Analysis) ~300 tokens/s (302.1 medidos, alta) "Aproximadamente la misma velocidad" según Google
Índice de Inteligencia de Artificial Analysis 59 (alto) 56 (alto)
Estado de soporte Actual "Permanece totalmente compatible", sin fecha de fin de soporte

Qué es idéntico

El precio, primero. Ambos modelos se encuentran en las mismas filas de la página de precios de Google: $0.75 de entrada y $3.75 de salida hasta el 31 de diciembre, duplicándose a $1.50 y $7.50 el 1 de enero de 2027. El almacenamiento en caché, los descuentos por lotes y las 5,000 solicitudes gratuitas de conexión a Google Search por mes (compartidas entre todos los modelos Gemini 3.x) se mantienen. Si desea el desglose línea por línea, la referencia de especificaciones y precios de 3.7 Flash todavía se aplica a 3.8 Flash línea por línea.

Los límites de contexto y salida no han cambiado, siendo 1,048,576 tokens de entrada y 65,536 tokens de salida. Las modalidades también son las mismas: texto, imagen, video, audio y PDF de entrada; texto de salida. Ninguno de los modelos genera audio, genera imágenes o usa la API Live.

La velocidad es casi idéntica. Logan Kilpatrick de Google describió 3.8 Flash como "el mismo precio que 3.7, y ~la misma velocidad". Artificial Analysis midió 302.1 tokens de salida por segundo en su ejecución de alto razonamiento. Eso es el rendimiento una vez que el modelo comienza a escribir; el tiempo hasta el primer token en la misma ejecución fue de 13.30 segundos, porque en el nivel high el modelo piensa antes de hablar.

La superficie de la API también es la misma. La API de Interacciones es la vía principal de Google para Gemini 3.x ahora, y el punto final heredado generateContent "sigue siendo totalmente compatible" sin fecha de fin de soporte. El código escrito para 3.7 Flash en cualquiera de los puntos finales se ejecuta contra gemini-3.8-flash después de un cambio de cadena de modelo, con las excepciones cubiertas en "cambios importantes".

Qué mejoró

El titular de Google para 3.8 Flash es "nuestro modelo Flash más inteligente", construido para "ingeniería de software de largo plazo, agentes autónomos y flujos de trabajo empresariales complejos". El cambio de diseño detrás de esa afirmación: en tareas difíciles, el modelo "ejecuta pasos de razonamiento adicionales y llama a herramientas de forma iterativa", tomando "pasos de razonamiento más pequeños" y verificando "su trabajo a lo largo del camino". Esto es lo que produce en los benchmarks que Google y Artificial Analysis han publicado en texto.

Las propias tablas de Google. Google publicó tres comparaciones numéricas contra 3.7 Flash en la página de DeepMind Flash. Estas son ejecutadas por el proveedor.

Benchmark (ejecutado por Google) 3.8 Flash 3.7 Flash Delta
Vals Finance Agent v2 61.4% 59.0% +2.4
HLE-Verificado 54.9% 53.6% +1.3
Harvey Legal Agent Benchmark 10.0% 8.8% +1.2

Ganancias modestas y consistentes, y en cada fila 3.8 Flash también supera a los modelos más grandes en la tabla de Google (Claude Opus 5 con 58.6% en Vals Finance, 54.4% en HLE-Verificado); la comparación a tres bandas con Claude Fable 5.1 y GPT-5.6 Sol lleva ese hilo más allá. Eso es un modelo con precio Flash que supera a modelos que cuestan varias veces más por token, que es el punto que Google quiere que usted entienda.

Artificial Analysis, de forma independiente. El informe de Artificial Analysis sitúa a 3.8 Flash en 59 en su Índice de Inteligencia en high, frente a 56 para 3.7 Flash y 52 para 3.6 Flash. Eso es tres puntos por cada lanzamiento, y empata a 3.8 Flash con GPT-5.6 Sol en xhigh y Grok 4.6 en medium, un punto por encima de Claude Fable 5.1 en medium. En τ³-Banking, su evaluación de uso de herramientas, 3.8 Flash obtuvo un 45%, un salto de 12 puntos sobre 3.7 Flash. Si ejecuta agentes con llamadas a herramientas reales, esa fila importa más que el índice.

Trabajo de agente intensivo en documentos. Google dice que 3.8 Flash "completa más del triple de tareas que Gemini 3.7 Flash" en flujos de trabajo de larga duración e intensivos en documentos. Evaluación interna, sin plataforma pública, así que trátelo como una indicación. Sin embargo, se alinea con el diseño del modelo: más pasos de verificación ayudan más donde un solo error descarrila un trabajo de 40 pasos.

Codificación, con un hueco en el registro. En DeepSWE v1.1, 3.7 Flash obtuvo un 65.3%, frente al 49.0% de 3.6 Flash. Google dice que 3.8 Flash "supera a la mayoría de los modelos fronterizos más grandes" allí a "una fracción del coste", pero el porcentaje exacto de 3.8 aparece solo en las tablas de imágenes de la ficha del modelo, no en texto, por lo que no imprimiremos un número. Las cifras de SWE-Bench Pro, Terminal-bench y OSWorld para 3.8 Flash no se publican en texto en absoluto. Si esos benchmarks impulsan su decisión, espere las ejecuciones de terceros.

Seguridad y resistencia a la inyección. Google informa de un "salto significativo" en las pruebas de inyección de prompts de Gray Swan sin un número. Los deltas de la ficha del modelo frente a 3.7 Flash son pequeños: seguridad multilingüe +5.4 puntos, seguridad texto a texto -0.4, rechazos injustificados +1.1. Lea este último como un ligero aumento en el exceso de rechazos.

Lo que le cuesta

Los precios por token no se movieron. El coste por tarea sí. Esta es la compensación que Google declara abiertamente: el modelo "puede usar más tokens en tareas complejas y de mayor duración, por diseño", y "podría usar más tokens para maximizar el rendimiento, especialmente en niveles de esfuerzo más altos".

Artificial Analysis lo cuantificó. Ejecutando su índice, 3.8 Flash promedió 48,000 tokens de salida por tarea, un 30% más que 3.7 Flash. Con precios idénticos por token, eso se traduce en una factura más alta por tarea completada:

Configuración (Artificial Analysis) Costo por tarea Tiempo por tarea
Gemini 3.7 Flash, high $0.40 2.2 min
Gemini 3.8 Flash, low $0.24 0.8 min
Gemini 3.8 Flash, medium $0.41 no publicado
Gemini 3.8 Flash, high $0.58 2.5 min

De esa tabla se derivan tres cosas. Primero, 3.8 Flash en high cuesta aproximadamente un 45% más por tarea que 3.7 Flash en high, y toma un 14% más de tiempo real. Segundo, 3.8 Flash en medium, que es el predeterminado, se sitúa a un centavo de 3.7 Flash en high, por lo que una actualización de "mismo presupuesto" está disponible si la calidad medium cumple con sus requisitos. Tercero, 3.8 Flash en low es la opción más barata y rápida de la tabla, lo que lo convierte en la elección obvia para rutas sensibles a la latencia donde 3.7 Flash se ejecutaba en high por costumbre.

El desglose de precios de 3.8 Flash lo incorpora a los volúmenes diarios. La versión corta: si está pagando por tarea, la actualización no es gratuita, y el nivel de pensamiento es el dial que usa para decidir cuánta mejora compra.

Cambios importantes en resumen

Dos cambios afectan directamente al código existente de 3.7 Flash.

thinking_level: "minimal" devuelve un error de validación. 3.8 Flash solo acepta low, medium y high. Si una configuración de 3.7 contiene minimal, asignela a low. La guía de niveles de pensamiento cubre lo que hace cada nivel y el coste y la latencia de cada uno.

Las respuestas de función deben llevar call_id y name. Cada function_result en la API de Interacciones necesita ambos campos, y cada functionResponse en el generateContent heredado necesita el id coincidente más name. El código que devolvía resultados solo por nombre fallará en el segundo turno de un bucle de herramientas.

Más allá de eso, la guía de migración de 3.7 a 3.8 Flash repasa las reglas de Gemini 3 que vale la pena volver a revisar durante la transición: mantenga temperature en el valor predeterminado 1.0 (Google advierte que valores más bajos "pueden causar bucles o un rendimiento degradado"), use thinking_level en lugar de un entero thinking_budget, elimine candidate_count y devuelva las firmas de pensamiento exactamente como se recibieron. Ninguno de estos es nuevo en 3.8, pero una base de código de 3.7 que los omitió ahora presentará problemas.

Matriz de decisión por carga de trabajo

Carga de trabajo Recomendación Por qué
Agentes de varios pasos con llamadas a herramientas Actualizar, medium o high +12 en τ³-Banking; los bucles de herramientas iterativos son el propósito principal de 3.8
Extracción y revisión de documentos largos Actualizar La afirmación de Google de completar el triple de tareas se dirige exactamente a esta forma
Codificación agéntica en un arnés Actualizar, luego medir El número de texto de DeepSWE no se publicó; verificar en su repositorio antes de comprometerse
Agentes de finanzas, legales e investigación Actualizar Las tres tablas publicadas por Google se inclinan a favor de 3.8
Clasificación, extracción, chat de alto volumen Mantenerse en 3.7, o 3.8 en low El costo por tarea es la métrica aquí; low es más barato que 3.7 en high
Puntos finales de cara al usuario sensibles a la latencia 3.8 en low 0.8 min por tarea en la plataforma de AA vs 2.2 para 3.7 en high
Cualquier cosa que use el nivel de pensamiento minimal Migrar primero Error de validación hasta que lo asigne a low
Pipelines por lotes con precios al céntimo Mantenerse en 3.7 hasta que se vuelva a comparar Mismo precio por token, pero +30% de tokens de salida cambia la factura por lotes

El patrón: cuanto más difícil y larga sea la tarea, más el diseño "trabaja más" de 3.8 Flash justifica sus tokens. Cuanto más corta y repetitiva sea la tarea, menos lo hace, y más importa el nivel de pensamiento (o quedarse donde está).

Ejecute ambos modelos contra el mismo escenario de prueba en Apidog

Los números por tarea anteriores provienen de la plataforma de Artificial Analysis, no de la suya. Antes de cambiar la cadena del modelo en producción, ejecute sus propios prompts a través de ambos modelos y compare el recuento de tokens. Apidog hace que esto sea un trabajo de diez minutos.

Establezca GEMINI_API_KEY como una variable de entorno en un entorno de Apidog y agregue una solicitud POST a https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent con x-goog-api-key leyendo de la variable. Haga de model también una variable de escenario. El cuerpo es el mismo para ambas ejecuciones:

{
  "contents": [{"parts": [{"text": "{{golden_prompt}}"}]}],
  "generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}

Cree un escenario de prueba con dos pasos: la solicitud con model configurado en gemini-3.7-flash, luego la misma solicitud con gemini-3.8-flash. En cada paso, agregue aserciones sobre usageMetadata.candidatesTokenCount y usageMetadata.thoughtsTokenCount con un límite que refleje su presupuesto, además de una aserción de ruta JSON sobre cualquier campo que lea su aplicación. Ejecute el escenario contra un conjunto de datos de diez o veinte prompts de oro. El informe de prueba muestra la respuesta y los resultados de las aserciones de cada paso juntos, por lo que leerá los recuentos de tokens de ambos modelos en una sola ejecución y la cifra del +30% se convertirá en su número en lugar del de un benchmark.

Una vez que los números parezcan correctos, programe el escenario para que un aumento silencioso en los tokens de pensamiento después de una actualización del modelo falle una prueba en lugar de aparecer en una factura. Descargue Apidog para configurarlo; el plan gratuito cubre este flujo de trabajo.

Preguntas frecuentes

¿Es Gemini 3.8 Flash más rápido que 3.7 Flash?

No. La propia descripción de Google es "aproximadamente la misma velocidad", y Artificial Analysis midió alrededor de 300 tokens de salida por segundo en high. Dado que 3.8 Flash razona en más pasos, el tiempo real por tarea aumentó en su plataforma (2.5 minutos frente a 2.2 en high). Bajando a low lo reduce a 0.8 minutos.

¿Cuesta Gemini 3.8 Flash más que 3.7 Flash?

No por token. Ambos cuestan $0.75 de entrada y $3.75 de salida hasta el 31 de diciembre, luego $1.50 y $7.50. Por tarea, sí: Artificial Analysis midió $0.58 en high frente a $0.40 para 3.7 Flash en high, porque 3.8 Flash escribe aproximadamente un 30% más de tokens de salida.

¿Google cerrará Gemini 3.7 Flash?

Google dice que 3.7 Flash "sigue siendo totalmente compatible" y no ha publicado ninguna fecha de deprecación. Puede seguir usándolo. La publicación novedades de 3.7 Flash sigue siendo la referencia para ese modelo.

¿Qué se rompe cuando cambio a 3.8 Flash?

Dos cosas: thinking_level: "minimal" ahora devuelve un error 400 INVALID_ARGUMENT, y cada respuesta de función debe incluir tanto el ID de llamada (call_id en la API de Interacciones, id en el generateContent heredado) como name. Todo lo demás en la API de Gemini 3 permanece sin cambios.

¿Cómo se compara este salto con el de 3.6 a 3.7?

3.7 Flash fue un paso más grande: DeepSWE pasó del 49.0% al 65.3%, y el índice de Artificial Analysis del 52 al 56. El paso de 3.8 es de +3 en el índice y un rediseño de cómo el modelo gasta tokens. Para la generación anterior, consulte 3.6 Flash vs 3.5 Flash, que cubre la reducción de precio que inició esta serie de lanzamientos.

La versión corta

Actualice si su carga de trabajo es agéntica, intensiva en herramientas o en documentos. Ahí es donde Google y Artificial Analysis muestran ganancias, y donde los tokens adicionales están comprando tareas completadas. Manténgase en 3.7 Flash, o pase a 3.8 en low, si está ejecutando llamadas cortas y repetitivas donde el costo por tarea es el número que reporta. En cualquier caso, corrija minimal y verifique primero sus respuestas de función, luego mida los recuentos de tokens en sus propios prompts antes de confiar en la plataforma de cualquier persona, incluida la nuestra.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs