Gemini 3.8 Flash es el modelo de nivel Flash más reciente de Google, lanzado el 2 de septiembre de 2026, junto con un gemelo de seguridad restringido llamado Gemini 3.8 Flash Cyber. Es el tercer lanzamiento de Flash en seis semanas, después de Gemini 3.6 Flash el 21 de julio y 3.7 Flash el 13 de agosto, al mismo precio de introducción que 3.7 Flash: $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida hasta el 31 de diciembre de 2026. Google lo llama "nuestro modelo Flash más inteligente, diseñado para ingeniería de software de largo plazo, agentes autónomos y flujos de trabajo empresariales complejos".
El cambio principal no es un nuevo precio ni una ventana de contexto más grande. Es el comportamiento. Google diseñó 3.8 Flash para "trabajar más duro" en tareas difíciles: toma pasos de razonamiento más pequeños, verifica su trabajo en el camino y llama a herramientas de forma iterativa. Esto se traduce en ganancias medibles en los puntos de referencia de agentes, y significa que el modelo gasta más tokens por tarea, por diseño. Artificial Analysis midió aproximadamente un 30% más de tokens de salida que 3.7 Flash. Si presupuestas por token, el precio es el mismo. Si presupuestas por tarea, la factura subió.
Esta guía cubre todo el lanzamiento: especificaciones, la compensación de "trabajar más duro", puntos de referencia, precios, disponibilidad, el gemelo Cyber y lo que el modelo no puede hacer. Cada solicitud aquí es HTTP simple con JSON, por lo que puedes construirlas e inspeccionarlas en Apidog antes de que lleguen al código de la aplicación. La publicación de lanzamiento de Google y la página del modelo son las fuentes principales.
Gemini 3.8 Flash de un vistazo
| Especificación | Valor |
|---|---|
| ID del modelo API | gemini-3.8-flash (estable, sin sufijo de vista previa) |
| Lanzado | 2 de septiembre de 2026 |
| Basado en | Gemini 3.7 Flash (según la tarjeta de modelo de DeepMind) |
| Ventana de contexto | 1.048.576 tokens de entrada |
| Salida máxima | 65.536 tokens |
| Modalidades de entrada | Texto, imagen, video, audio, PDF |
| Modalidades de salida | Solo texto |
| Niveles de pensamiento | low (bajo), medium (medio, predeterminado), high (alto); minimal (mínimo) devuelve un error |
| Precio de introducción (hasta el 31 de dic de 2026) | $0.75 entrada / $3.75 salida por millón de tokens; el pensamiento se factura como salida |
| Precio estándar (a partir del 1 de enero de 2027) | $1.50 entrada / $7.50 salida por millón de tokens |
| Caché de contexto | $0.075 por millón de tokens en caché (introducción), $0.15 estándar |
| API por lotes | 50% de descuento: $0.375 / $1.875 de introducción |
| Corte de conocimiento | Marzo de 2026 |
| Disponibilidad para desarrolladores | API de Gemini, Google AI Studio, Android Studio, Google Antigravity, Stitch, Gemini Enterprise |
| Disponibilidad para el consumidor | Aplicación Gemini (suscriptores de AI Pro y Ultra), Modo AI en Búsqueda, Gemini en Google Sheets |
| Estado de 3.7 Flash | Sigue siendo totalmente compatible; sin fecha de desuso |
Tres filas merecen una segunda revisión. El nivel de pensamiento predeterminado es medium (medio), no high (alto) como en Gemini 3 Pro, por lo que una instrucción ajustada en Pro razonará menos aquí a menos que configures el nivel. El nivel minimal (mínimo) devuelve un error de validación en lugar de mapear silenciosamente a low (bajo); la guía de niveles de pensamiento cubre la solución. Y el corte de conocimiento de marzo de 2026 lleva una advertencia en la tarjeta del modelo: en algunos dominios, el conocimiento puede estar limitado a enero de 2025.
Qué es Gemini 3.8 Flash
Flash es el nivel de "caballo de batalla" de Google: el modelo destinado a ejecutar la mayor parte del tráfico de producción mientras Pro maneja los problemas más difíciles. Google llama a 3.8 Flash su "modelo de caballo de batalla más inteligente hasta la fecha", y la tarjeta del modelo de DeepMind lo describe como basado en 3.7 Flash en lugar de un nuevo modelo base. Así que la descripción honesta es un refinamiento de un modelo lanzado tres semanas antes, ajustado para ingeniería de software de larga ejecución y trabajo de agentes.

La cadencia es inusual. 3.6 Flash se lanzó el 21 de julio a $1.50 / $7.50, 3.7 Flash el 13 de agosto a la tasa de introducción de $0.75 / $3.75, y 3.8 Flash el 2 de septiembre a la misma tasa. La frase de Google es "tercer lanzamiento de Flash en seis semanas"; Artificial Analysis cuenta un cuarto modelo Flash en menos de cuatro meses porque su recuento incluye 3.5 Flash-Lite. Para cualquiera que mantenga una configuración de modelo, la publicación de novedades de 3.7 Flash tiene tres semanas y ya describe la generación anterior. Con este lanzamiento no se envió ningún Gemini 3.8 Pro, Gemini 4 o nuevo Flash-Lite, y Google no ha dicho cuándo llegará una actualización de Pro.
El diseño de "trabajo más duro" y lo que te cuesta
La descripción de Google del cambio es específica. En tareas complejas, 3.8 Flash "ejecuta pasos de razonamiento adicionales y llama a herramientas de forma iterativa". Toma "pasos de razonamiento más pequeños" y "verifica su trabajo en el camino". Google es directo sobre la consecuencia: el modelo "puede usar más tokens en tareas complejas y de mayor duración, por diseño", especialmente en niveles de esfuerzo más altos.
Artificial Analysis lo midió en su informe independiente. Al ejecutar su Índice de Inteligencia, 3.8 Flash con razonamiento alto promedió 48.000 tokens de salida por tarea, un aumento del 30% respecto a 3.7 Flash. Los precios por token no se movieron, por lo que el costo por tarea aumentó de $0.40 en 3.7 Flash alto a $0.58 en 3.8 Flash alto. El tiempo por tarea también aumentó: 2.5 minutos frente a 2.2 minutos.
El mismo informe muestra la palanca que tienes. En medium (medio), el costo por tarea baja a $0.41, cerca de 3.7 Flash en alto. En low (bajo), baja a $0.24 con 0.8 minutos por tarea. Por lo tanto, el nivel de pensamiento ahora es una decisión de enrutamiento, no una configuración global: puntos finales sensibles a la latencia en low (bajo), bucles de agente que deben terminar el trabajo en medium (medio) o high (alto). El desglose de precios analiza 1.000 tareas de agente por día en cada nivel.
La velocidad no ha cambiado. Logan Kilpatrick de Google describió 3.8 Flash como “mismo precio que 3.7, es ~la misma velocidad”, y Artificial Analysis midió 302.1 tokens de salida por segundo con razonamiento alto. Su tiempo de 13.30 segundos hasta el primer token en esa ejecución es el modelo pensando antes de responder, no una ruta de red lenta.
Qué dicen los benchmarks
Google publicó tres tablas de benchmarks en formato de texto en la página de DeepMind Flash. Estos son números obtenidos por Google.
| Benchmark | 3.8 Flash | 3.7 Flash | Claude Opus 5 | GPT-5.6 Sol | GPT-5.6 Terra | Claude Sonnet 5 |
|---|---|---|---|---|---|---|
| Agente Financiero Vals v2 | 61.4% | 59.0% | 58.6% | 53.8% | 54.4% | 53.9% |
| Benchmark de Agente Legal Harvey | 10.0% | 8.8% | 6.7% | 2.5% | 0.8% | 5.0% |
| HLE-Verificado | 54.9% | 53.6% | 54.4% | 54.5% | 51.1% | 31.0% |
Las ganancias sobre 3.7 Flash son de 2.4, 1.2 y 1.3 puntos. Modestas, pero las filas de finanzas y legal colocan un modelo con precio Flash por delante de Opus 5 y GPT-5.6 Sol, que cuestan varias veces más por token. Claude Fable 5.1, que se lanzó el día anterior, no aparece en las tablas de Google; la comparación a tres bandas utiliza las filas de Opus 5 y Sonnet 5 de Anthropic como las entradas publicadas más cercanas.
Google hace tres afirmaciones más sin cifras en formato de texto. En DeepSWE v1.1, 3.8 Flash "supera a la mayoría de los modelos frontera más grandes" a "una fracción del costo"; el porcentaje aparece solo en las tablas de imágenes de la tarjeta del modelo, por lo que no lo imprimimos (3.7 Flash obtuvo un 65.3%). En flujos de trabajo de larga duración con muchos documentos, una evaluación interna muestra que "completa más del triple de tareas que Gemini 3.7 Flash". En la inyección de prompts Gray Swan, Google informa un "salto significativo" sin una cifra. Los resultados de SWE-Bench Pro, Terminal-bench y OSWorld no se publican en texto para 3.8 Flash.
La visión independiente coincide. Artificial Analysis califica a 3.8 Flash (alto) con 59 en su Índice de Inteligencia, frente a 56 para 3.7 Flash y 52 para 3.6 Flash. Esto lo empata con GPT-5.6 Sol (xalto) y Grok 4.6 (medio), y se sitúa por encima de GPT-5.6 Terra (máx.), Claude Fable 5.1 (medio) y Muse Spark 1.2 (xalto), todos con 57. En su evaluación de uso de herramientas τ³-Banking, 3.8 Flash obtuvo un 45%, 12 puntos por encima de 3.7 Flash. La comparación entre 3.8 y 3.7 Flash sopesa esas ganancias frente al costo de los tokens por carga de trabajo.
Precios: el mismo por token, más por tarea
La página de precios enumera 3.8 Flash en las mismas filas que 3.6 y 3.7 Flash, y los tres duplican su precio el 1 de enero de 2027.
| Artículo | Hasta el 31 de diciembre de 2026 | A partir del 1 de enero de 2027 |
|---|---|---|
| Entrada | $0.75 / 1M | $1.50 / 1M |
| Salida (incluye pensamiento) | $3.75 / 1M | $7.50 / 1M |
| Entrada en caché | $0.075 / 1M | $0.15 / 1M |
| Almacenamiento en caché | $0.50 / 1M tokens / hora | $1.00 / 1M tokens / hora |
| Entrada / salida por lotes | $0.375 / $1.875 | $0.75 / $3.75 |
Dos detalles confunden a la gente. Los tokens de pensamiento son tokens de salida: se facturan a la tarifa de salida y se informan por separado en usageMetadata.thoughtsTokenCount, por lo que una respuesta corta en high (alto) puede costar más que una larga en low (bajo). Y la conexión con la Búsqueda de Google tiene su propio medidor: 5.000 solicitudes gratuitas por mes compartidas entre todos los modelos Gemini 3.x, y luego $14 por cada 1.000 solicitudes.
Existe un nivel gratuito con límite de tasa en AI Studio y la API, y Google señala que los datos del nivel gratuito se "utilizan para mejorar nuestros productos". Los límites de tasa por modelo se muestran en AI Studio en lugar de en la documentación. El Nivel 1 se desbloquea vinculando una cuenta de facturación, el Nivel 2 después de $100 de gasto y tres días, el Nivel 3 después de $1.000 y 30 días. La guía de acceso gratuito cubre lo que el camino gratuito te ofrece y lo que no, y la guía de la API por lotes cubre el descuento del 50% para trabajos que pueden esperar.
Cómo llamarlo
Google ahora trata la API de interacciones como la ruta principal para Gemini 3.x. generateContent se "considera heredado" pero "sigue siendo totalmente compatible" sin fecha de caducidad, y la mayoría del código existente todavía lo usa. Una solicitud mínima de interacciones:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"medium"}}'
Las conversaciones de varios turnos pasan previous_interaction_id y permiten que el servidor mantenga el estado. La llamada a funciones declara herramientas con un esquema JSON, recibe un paso function_call y espera un function_result que contenga tanto call_id como name, que son obligatorios en 3.8 Flash (el generateContent heredado denomina el campo id). El tutorial de la API muestra ambos puntos finales en REST y Python, y la guía de llamada a funciones cubre los bucles iterativos de herramientas que produce el diseño de "trabajo más duro" y cómo limitarlos.
Si estás migrando desde 3.7 Flash, los cambios son pequeños pero generan errores: el pensamiento minimal (mínimo) es rechazado, thinking_budget da paso a thinking_level, candidate_count no es compatible, y Google dice que dejes temperature en el valor predeterminado de 1.0 porque bajarlo "puede causar bucles o un rendimiento degradado". La guía de migración convierte las notas de novedades de Google en una lista de verificación con JSON de antes y después.
Qué no puede hacer Gemini 3.8 Flash
La página del modelo es explícita. No compatible: generación de audio, la API Live y generación de imágenes. La salida es solo texto, aunque la entrada acepta texto, imagen, video, audio y PDF. La segmentación de imágenes tampoco es compatible con los modelos Gemini 3. Si tu producto necesita salida de voz o imagen en tiempo real, este modelo es la capa de razonamiento y llamada a herramientas, no toda la pila. Para texto económico y de alto rendimiento sin razonamiento pesado, Gemini 3.5 Flash-Lite permanece en la lista de precios a $0.30 / $2.50. El resto de la lista de verificación es compatible, incluyendo la llamada a funciones, salidas estructuradas, almacenamiento en caché de contexto, ejecución de código, conexión con Búsqueda y Mapas, API por lotes y uso de computadoras en vista previa.
Gemini 3.8 Flash Cyber: el gemelo restringido
Gemini 3.8 Flash Cyber se lanzó el mismo día, y no puedes registrarte para usarlo. El acceso solo se realiza a través del nuevo Programa Fairwind, abierto a "autoridades gubernamentales de confianza, operadores de infraestructura crítica y mantenedores de software", con verificaciones de antecedentes y requisitos como MFA resistente a phishing. No hay API pública, no hay precios públicos y no hay autoalojamiento. Reemplaza el programa piloto limitado de 3.5 Flash Cyber.
Las afirmaciones de Google son grandes: una tasa de éxito de descubrimiento de vulnerabilidades en el mundo real superior al 70% en 20 lenguajes de programación, y un informe del equipo de seguridad de Chrome de "2.6 veces más parches correctos para vulnerabilidades en Chrome que los mejores modelos comerciales que son mucho más grandes". Ambos son informados por Google. La explicación de Cyber cubre la elegibilidad, las obligaciones y lo que significa para los muchos equipos que nunca obtendrán acceso.
Probando solicitudes de Gemini 3.8 Flash en Apidog
Debido a que la historia del costo es por tarea en lugar de por token, la prueba útil no es "la llamada tuvo éxito" sino "cuántos tokens consumió". Apidog maneja eso como una prueba de API ordinaria. Almacena GEMINI_API_KEY como una variable de entorno, guarda las solicitudes de interacciones y generateContent como puntos finales, y verifica el estado 200, los campos JSON que lee tu aplicación y un límite en usageMetadata.thoughtsTokenCount. Ejecuta la misma instrucción en low (bajo), medium (medio) y high (alto) en un escenario de prueba y obtendrás la distribución de tokens por nivel para tus propias instrucciones en lugar de los promedios de Artificial Analysis.
Las respuestas en streaming se muestran como SSE, lo que ayuda al depurar resúmenes de pensamiento con includeThoughts: true; la guía de pruebas SSE explica cómo hacerlo. Programa el escenario diariamente y una regresión de tokens fallará una aserción antes de que aparezca en la factura. Descarga Apidog para configurarlo en el plan gratuito.
Preguntas frecuentes
¿Es Gemini 3.8 Flash un modelo nuevo o una actualización de 3.7 Flash? La tarjeta de modelo de DeepMind dice que se basa en Gemini 3.7 Flash. Trátalo como un sucesor ajustado: mismo precio, velocidad y ventana de contexto, con más razonamiento y pasos de llamada a herramientas en tareas difíciles. 3.7 Flash sigue siendo totalmente compatible, sin fecha de desuso.
¿Por qué Gemini 3.8 Flash usa más tokens que 3.7 Flash? Por diseño. Google dice que "puede usar más tokens en tareas complejas y de mayor duración", y Artificial Analysis midió un 30% más de tokens de salida en su índice. Baja el thinking_level a medium (medio) o low (bajo) en rutas que no necesiten el razonamiento extra; la guía de niveles de pensamiento tiene la tabla de costos por nivel.
¿Cuál es la ventana de contexto de Gemini 3.8 Flash? 1.048.576 tokens de entrada y 65.536 tokens de salida, con almacenamiento en caché de contexto a $0.075 por millón de tokens en caché hasta el 31 de diciembre de 2026.
¿Puedo usar Gemini 3.8 Flash en la aplicación gratuita de Gemini? La cobertura de lanzamiento enumera la aplicación Gemini para suscriptores de Google AI Pro y Ultra, no el nivel de aplicación gratuita. Los desarrolladores obtienen un nivel gratuito con límite de tasa en AI Studio y la API.
¿Cómo se compara Gemini 3.8 Flash con Claude Fable 5.1? Artificial Analysis los califica con 59 y 57. En cuanto al precio, Claude Fable 5.1 cuesta $10 / $50 por millón de tokens, aproximadamente 13 veces la tarifa de introducción de 3.8 Flash tanto en entrada como en salida. La brecha se reduce una vez que cuentas los tokens por tarea.
Próximos pasos
Gemini 3.8 Flash es un "caballo de batalla" que piensa más tiempo, y la compensación es explícita: unos pocos puntos más en los benchmarks de agentes y 12 puntos en el uso de herramientas, pagados con aproximadamente un 30% más de tokens de salida con razonamiento alto. Si tus agentes se topaban con un muro en 3.7 Flash, la actualización cuesta lo mismo por token. Si tu tráfico es de chat con límite de latencia, establece low (bajo) o quédate en 3.7 Flash, que sigue siendo compatible. Comienza con el tutorial de la API, envía tu primera solicitud desde Apidog con una aserción de recuento de tokens adjunta, y deja que el número, no la publicación de lanzamiento, decida el nivel de pensamiento para cada ruta.
