Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026, tres semanas después de Gemini 3.7 Flash y seis semanas después de 3.6 Flash. El mismo precio de introducción ($0.75 de entrada, $3.75 de salida por millón de tokens hasta el 31 de diciembre), el mismo contexto de 1M de tokens y, según el propio encuadre de Google, aproximadamente la misma velocidad. Lo que cambió es cómo funciona el modelo: toma pasos de razonamiento más pequeños, verifica su propia salida y llama a herramientas en bucles. Eso le otorga una puntuación más alta en cada benchmark publicado. También hace que cada tarea cueste más tokens.
Así que la pregunta de la actualización no es "¿es 3.8 Flash mejor?" Sobre el papel, sí lo es. La pregunta es si la calidad adicional compensa los tokens adicionales en su carga de trabajo, y si los dos cambios importantes afectan su código. Esta comparación analiza lo que se mantuvo igual, lo que mejoró, lo que le cuesta y una matriz de decisión por carga de trabajo. Las fuentes son la publicación de lanzamiento de Google, la página Novedades de Gemini 3.8 Flash y las pruebas independientes de Artificial Analysis. Para la hoja de especificaciones completa, comience con qué es Gemini 3.8 Flash.
Una cosa más de antemano: Google dice que "Gemini 3.7 Flash sigue siendo totalmente compatible" y no ha publicado ninguna fecha de deprecación. Nadie le está obligando.
Comparativa
| Gemini 3.8 Flash | Gemini 3.7 Flash | |
|---|---|---|
| ID del modelo | gemini-3.8-flash |
gemini-3.7-flash |
| Lanzamiento | 2 de septiembre de 2026 | 13 de agosto de 2026 |
| Base | "Basado en Gemini 3.7 Flash" (ficha del modelo) | n/a |
| Contexto / salida máxima | 1,048,576 / 65,536 tokens | Igual |
| Precio de entrada (introducción, hasta el 31 de diciembre) | $0.75 por millón | $0.75 por millón |
| Precio de salida (introducción, hasta el 31 de diciembre) | $3.75 por millón, pensamiento incluido | $3.75 por millón, pensamiento incluido |
| Precio estándar (a partir del 1 de enero de 2027) | $1.50 / $7.50 | $1.50 / $7.50 |
| Lectura de caché de contexto | $0.075 por millón (introducción) | Igual |
| Procesamiento por lotes | 50% de descuento, los mismos niveles de tokens en cola | Igual |
| Niveles de pensamiento | low, medium (predeterminado), high |
low, medium, high |
Nivel de pensamiento minimal |
Error de validación | Aceptado (nota de migración de Google: asignarlo a low) |
| Fecha de corte de conocimiento | Marzo de 2026 | No se volvió a especificar en la documentación de 3.8 |
| Velocidad de salida (Artificial Analysis) | ~300 tokens/s (302.1 medidos, alta) | "Aproximadamente la misma velocidad" según Google |
| Índice de Inteligencia de Artificial Analysis | 59 (alto) | 56 (alto) |
| Estado de soporte | Actual | "Permanece totalmente compatible", sin fecha de fin de soporte |
Qué es idéntico
El precio, primero. Ambos modelos se encuentran en las mismas filas de la página de precios de Google: $0.75 de entrada y $3.75 de salida hasta el 31 de diciembre, duplicándose a $1.50 y $7.50 el 1 de enero de 2027. El almacenamiento en caché, los descuentos por lotes y las 5,000 solicitudes gratuitas de conexión a Google Search por mes (compartidas entre todos los modelos Gemini 3.x) se mantienen. Si desea el desglose línea por línea, la referencia de especificaciones y precios de 3.7 Flash todavía se aplica a 3.8 Flash línea por línea.
Los límites de contexto y salida no han cambiado, siendo 1,048,576 tokens de entrada y 65,536 tokens de salida. Las modalidades también son las mismas: texto, imagen, video, audio y PDF de entrada; texto de salida. Ninguno de los modelos genera audio, genera imágenes o usa la API Live.
La velocidad es casi idéntica. Logan Kilpatrick de Google describió 3.8 Flash como "el mismo precio que 3.7, y ~la misma velocidad". Artificial Analysis midió 302.1 tokens de salida por segundo en su ejecución de alto razonamiento. Eso es el rendimiento una vez que el modelo comienza a escribir; el tiempo hasta el primer token en la misma ejecución fue de 13.30 segundos, porque en el nivel high el modelo piensa antes de hablar.
La superficie de la API también es la misma. La API de Interacciones es la vía principal de Google para Gemini 3.x ahora, y el punto final heredado generateContent "sigue siendo totalmente compatible" sin fecha de fin de soporte. El código escrito para 3.7 Flash en cualquiera de los puntos finales se ejecuta contra gemini-3.8-flash después de un cambio de cadena de modelo, con las excepciones cubiertas en "cambios importantes".
Qué mejoró
El titular de Google para 3.8 Flash es "nuestro modelo Flash más inteligente", construido para "ingeniería de software de largo plazo, agentes autónomos y flujos de trabajo empresariales complejos". El cambio de diseño detrás de esa afirmación: en tareas difíciles, el modelo "ejecuta pasos de razonamiento adicionales y llama a herramientas de forma iterativa", tomando "pasos de razonamiento más pequeños" y verificando "su trabajo a lo largo del camino". Esto es lo que produce en los benchmarks que Google y Artificial Analysis han publicado en texto.
Las propias tablas de Google. Google publicó tres comparaciones numéricas contra 3.7 Flash en la página de DeepMind Flash. Estas son ejecutadas por el proveedor.
| Benchmark (ejecutado por Google) | 3.8 Flash | 3.7 Flash | Delta |
|---|---|---|---|
| Vals Finance Agent v2 | 61.4% | 59.0% | +2.4 |
| HLE-Verificado | 54.9% | 53.6% | +1.3 |
| Harvey Legal Agent Benchmark | 10.0% | 8.8% | +1.2 |
Ganancias modestas y consistentes, y en cada fila 3.8 Flash también supera a los modelos más grandes en la tabla de Google (Claude Opus 5 con 58.6% en Vals Finance, 54.4% en HLE-Verificado); la comparación a tres bandas con Claude Fable 5.1 y GPT-5.6 Sol lleva ese hilo más allá. Eso es un modelo con precio Flash que supera a modelos que cuestan varias veces más por token, que es el punto que Google quiere que usted entienda.
Artificial Analysis, de forma independiente. El informe de Artificial Analysis sitúa a 3.8 Flash en 59 en su Índice de Inteligencia en high, frente a 56 para 3.7 Flash y 52 para 3.6 Flash. Eso es tres puntos por cada lanzamiento, y empata a 3.8 Flash con GPT-5.6 Sol en xhigh y Grok 4.6 en medium, un punto por encima de Claude Fable 5.1 en medium. En τ³-Banking, su evaluación de uso de herramientas, 3.8 Flash obtuvo un 45%, un salto de 12 puntos sobre 3.7 Flash. Si ejecuta agentes con llamadas a herramientas reales, esa fila importa más que el índice.
Trabajo de agente intensivo en documentos. Google dice que 3.8 Flash "completa más del triple de tareas que Gemini 3.7 Flash" en flujos de trabajo de larga duración e intensivos en documentos. Evaluación interna, sin plataforma pública, así que trátelo como una indicación. Sin embargo, se alinea con el diseño del modelo: más pasos de verificación ayudan más donde un solo error descarrila un trabajo de 40 pasos.
Codificación, con un hueco en el registro. En DeepSWE v1.1, 3.7 Flash obtuvo un 65.3%, frente al 49.0% de 3.6 Flash. Google dice que 3.8 Flash "supera a la mayoría de los modelos fronterizos más grandes" allí a "una fracción del coste", pero el porcentaje exacto de 3.8 aparece solo en las tablas de imágenes de la ficha del modelo, no en texto, por lo que no imprimiremos un número. Las cifras de SWE-Bench Pro, Terminal-bench y OSWorld para 3.8 Flash no se publican en texto en absoluto. Si esos benchmarks impulsan su decisión, espere las ejecuciones de terceros.
Seguridad y resistencia a la inyección. Google informa de un "salto significativo" en las pruebas de inyección de prompts de Gray Swan sin un número. Los deltas de la ficha del modelo frente a 3.7 Flash son pequeños: seguridad multilingüe +5.4 puntos, seguridad texto a texto -0.4, rechazos injustificados +1.1. Lea este último como un ligero aumento en el exceso de rechazos.
Lo que le cuesta
Los precios por token no se movieron. El coste por tarea sí. Esta es la compensación que Google declara abiertamente: el modelo "puede usar más tokens en tareas complejas y de mayor duración, por diseño", y "podría usar más tokens para maximizar el rendimiento, especialmente en niveles de esfuerzo más altos".
Artificial Analysis lo cuantificó. Ejecutando su índice, 3.8 Flash promedió 48,000 tokens de salida por tarea, un 30% más que 3.7 Flash. Con precios idénticos por token, eso se traduce en una factura más alta por tarea completada:
| Configuración (Artificial Analysis) | Costo por tarea | Tiempo por tarea |
|---|---|---|
Gemini 3.7 Flash, high |
$0.40 | 2.2 min |
Gemini 3.8 Flash, low |
$0.24 | 0.8 min |
Gemini 3.8 Flash, medium |
$0.41 | no publicado |
Gemini 3.8 Flash, high |
$0.58 | 2.5 min |
De esa tabla se derivan tres cosas. Primero, 3.8 Flash en high cuesta aproximadamente un 45% más por tarea que 3.7 Flash en high, y toma un 14% más de tiempo real. Segundo, 3.8 Flash en medium, que es el predeterminado, se sitúa a un centavo de 3.7 Flash en high, por lo que una actualización de "mismo presupuesto" está disponible si la calidad medium cumple con sus requisitos. Tercero, 3.8 Flash en low es la opción más barata y rápida de la tabla, lo que lo convierte en la elección obvia para rutas sensibles a la latencia donde 3.7 Flash se ejecutaba en high por costumbre.
El desglose de precios de 3.8 Flash lo incorpora a los volúmenes diarios. La versión corta: si está pagando por tarea, la actualización no es gratuita, y el nivel de pensamiento es el dial que usa para decidir cuánta mejora compra.
Cambios importantes en resumen
Dos cambios afectan directamente al código existente de 3.7 Flash.
thinking_level: "minimal" devuelve un error de validación. 3.8 Flash solo acepta low, medium y high. Si una configuración de 3.7 contiene minimal, asignela a low. La guía de niveles de pensamiento cubre lo que hace cada nivel y el coste y la latencia de cada uno.
Las respuestas de función deben llevar call_id y name. Cada function_result en la API de Interacciones necesita ambos campos, y cada functionResponse en el generateContent heredado necesita el id coincidente más name. El código que devolvía resultados solo por nombre fallará en el segundo turno de un bucle de herramientas.
Más allá de eso, la guía de migración de 3.7 a 3.8 Flash repasa las reglas de Gemini 3 que vale la pena volver a revisar durante la transición: mantenga temperature en el valor predeterminado 1.0 (Google advierte que valores más bajos "pueden causar bucles o un rendimiento degradado"), use thinking_level en lugar de un entero thinking_budget, elimine candidate_count y devuelva las firmas de pensamiento exactamente como se recibieron. Ninguno de estos es nuevo en 3.8, pero una base de código de 3.7 que los omitió ahora presentará problemas.
Matriz de decisión por carga de trabajo
| Carga de trabajo | Recomendación | Por qué |
|---|---|---|
| Agentes de varios pasos con llamadas a herramientas | Actualizar, medium o high |
+12 en τ³-Banking; los bucles de herramientas iterativos son el propósito principal de 3.8 |
| Extracción y revisión de documentos largos | Actualizar | La afirmación de Google de completar el triple de tareas se dirige exactamente a esta forma |
| Codificación agéntica en un arnés | Actualizar, luego medir | El número de texto de DeepSWE no se publicó; verificar en su repositorio antes de comprometerse |
| Agentes de finanzas, legales e investigación | Actualizar | Las tres tablas publicadas por Google se inclinan a favor de 3.8 |
| Clasificación, extracción, chat de alto volumen | Mantenerse en 3.7, o 3.8 en low |
El costo por tarea es la métrica aquí; low es más barato que 3.7 en high |
| Puntos finales de cara al usuario sensibles a la latencia | 3.8 en low |
0.8 min por tarea en la plataforma de AA vs 2.2 para 3.7 en high |
Cualquier cosa que use el nivel de pensamiento minimal |
Migrar primero | Error de validación hasta que lo asigne a low |
| Pipelines por lotes con precios al céntimo | Mantenerse en 3.7 hasta que se vuelva a comparar | Mismo precio por token, pero +30% de tokens de salida cambia la factura por lotes |
El patrón: cuanto más difícil y larga sea la tarea, más el diseño "trabaja más" de 3.8 Flash justifica sus tokens. Cuanto más corta y repetitiva sea la tarea, menos lo hace, y más importa el nivel de pensamiento (o quedarse donde está).
Ejecute ambos modelos contra el mismo escenario de prueba en Apidog
Los números por tarea anteriores provienen de la plataforma de Artificial Analysis, no de la suya. Antes de cambiar la cadena del modelo en producción, ejecute sus propios prompts a través de ambos modelos y compare el recuento de tokens. Apidog hace que esto sea un trabajo de diez minutos.
Establezca GEMINI_API_KEY como una variable de entorno en un entorno de Apidog y agregue una solicitud POST a https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent con x-goog-api-key leyendo de la variable. Haga de model también una variable de escenario. El cuerpo es el mismo para ambas ejecuciones:
{
"contents": [{"parts": [{"text": "{{golden_prompt}}"}]}],
"generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}
Cree un escenario de prueba con dos pasos: la solicitud con model configurado en gemini-3.7-flash, luego la misma solicitud con gemini-3.8-flash. En cada paso, agregue aserciones sobre usageMetadata.candidatesTokenCount y usageMetadata.thoughtsTokenCount con un límite que refleje su presupuesto, además de una aserción de ruta JSON sobre cualquier campo que lea su aplicación. Ejecute el escenario contra un conjunto de datos de diez o veinte prompts de oro. El informe de prueba muestra la respuesta y los resultados de las aserciones de cada paso juntos, por lo que leerá los recuentos de tokens de ambos modelos en una sola ejecución y la cifra del +30% se convertirá en su número en lugar del de un benchmark.
Una vez que los números parezcan correctos, programe el escenario para que un aumento silencioso en los tokens de pensamiento después de una actualización del modelo falle una prueba en lugar de aparecer en una factura. Descargue Apidog para configurarlo; el plan gratuito cubre este flujo de trabajo.
Preguntas frecuentes
¿Es Gemini 3.8 Flash más rápido que 3.7 Flash?
No. La propia descripción de Google es "aproximadamente la misma velocidad", y Artificial Analysis midió alrededor de 300 tokens de salida por segundo en high. Dado que 3.8 Flash razona en más pasos, el tiempo real por tarea aumentó en su plataforma (2.5 minutos frente a 2.2 en high). Bajando a low lo reduce a 0.8 minutos.
¿Cuesta Gemini 3.8 Flash más que 3.7 Flash?
No por token. Ambos cuestan $0.75 de entrada y $3.75 de salida hasta el 31 de diciembre, luego $1.50 y $7.50. Por tarea, sí: Artificial Analysis midió $0.58 en high frente a $0.40 para 3.7 Flash en high, porque 3.8 Flash escribe aproximadamente un 30% más de tokens de salida.
¿Google cerrará Gemini 3.7 Flash?
Google dice que 3.7 Flash "sigue siendo totalmente compatible" y no ha publicado ninguna fecha de deprecación. Puede seguir usándolo. La publicación novedades de 3.7 Flash sigue siendo la referencia para ese modelo.
¿Qué se rompe cuando cambio a 3.8 Flash?
Dos cosas: thinking_level: "minimal" ahora devuelve un error 400 INVALID_ARGUMENT, y cada respuesta de función debe incluir tanto el ID de llamada (call_id en la API de Interacciones, id en el generateContent heredado) como name. Todo lo demás en la API de Gemini 3 permanece sin cambios.
¿Cómo se compara este salto con el de 3.6 a 3.7?
3.7 Flash fue un paso más grande: DeepSWE pasó del 49.0% al 65.3%, y el índice de Artificial Analysis del 52 al 56. El paso de 3.8 es de +3 en el índice y un rediseño de cómo el modelo gasta tokens. Para la generación anterior, consulte 3.6 Flash vs 3.5 Flash, que cubre la reducción de precio que inició esta serie de lanzamientos.
La versión corta
Actualice si su carga de trabajo es agéntica, intensiva en herramientas o en documentos. Ahí es donde Google y Artificial Analysis muestran ganancias, y donde los tokens adicionales están comprando tareas completadas. Manténgase en 3.7 Flash, o pase a 3.8 en low, si está ejecutando llamadas cortas y repetitivas donde el costo por tarea es el número que reporta. En cualquier caso, corrija minimal y verifique primero sus respuestas de función, luego mida los recuentos de tokens en sus propios prompts antes de confiar en la plataforma de cualquier persona, incluida la nuestra.
