Gemini 3.5 Flash-Lite vs 3.6 Flash: ¿Cuál usar?

Gemini 3.5 Flash-Lite vs 3.6 Flash: comparativa de precio, velocidad, benchmarks, una matriz de casos de uso y un ejemplo de costo para la misma carga de trabajo para que elijas el nivel adecuado rápidamente.

Ashley Innocent

Ashley Innocent

22 July 2026

Gemini 3.5 Flash-Lite vs 3.6 Flash: ¿Cuál usar?

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

Aquí está la decisión de antemano. Elige Gemini 3.5 Flash-Lite cuando realices tareas sencillas en gran volumen y te importe más el coste y la velocidad: clasificación, extracción, respuestas cortas de chat, respuestas RAG, autocompletar. Elige Gemini 3.6 Flash cuando la calidad importe más que la factura: agentes de varios pasos, uso de herramientas, codificación, uso de ordenador y respuestas en las que un resultado incorrecto es costoso.

Ambos modelos se lanzaron en la actualización de la categoría Flash de Google el 21 de julio de 2026. Ambos aceptan hasta 1 millón de tokens de entrada. Se sitúan en diferentes puntos de la misma curva, por lo que la pregunta no es realmente qué modelo es "mejor". Es qué compromiso se ajusta al trabajo que tienes delante.

Una particularidad en los nombres que hay que aclarar primero: el modelo principal saltó a la versión 3.6, pero la categoría Lite se mantuvo en la 3.5. Así que estás comparando un modelo 3.5 con un modelo 3.6, y eso es lo esperado, no un error tipográfico. Más información al respecto en las Preguntas Frecuentes.

button

La respuesta corta

Por defecto, usa Flash-Lite para cualquier cosa sencilla que ejecutes millones de veces, y recurre a 3.6 Flash en el momento en que la tarea requiera razonamiento, herramientas o código. Si no puedes decidirte, empieza con Flash-Lite, observa dónde las respuestas se quedan cortas y promueve solo esas llamadas a 3.6 Flash. Raramente necesitarás un solo modelo para toda la aplicación.

Precio y velocidad uno al lado del otro

Atributo Gemini 3.5 Flash-Lite Gemini 3.6 Flash
ID del modelo gemini-3.5-flash-lite gemini-3.6-flash
Precio de entrada $0.30 / 1M de tokens $1.50 / 1M de tokens
Precio de salida $2.50 / 1M de tokens $7.50 / 1M de tokens
Rendimiento ~350 tokens de salida/seg No publicado por separado
Ventana de contexto 1M de tokens 1M de tokens
Nivel gratuito Sí (con límite de tarifa) Sí (con límite de tarifa)

Flash-Lite es más barato por cada token. La entrada cuesta 5 veces menos; la salida cuesta 3 veces menos. Google publica una cifra de rendimiento de alrededor de 350 tokens de salida por segundo para Flash-Lite, lo que hace que se sienta instantáneo en un cuadro de chat o en un campo de autocompletado. Google no publicó un número separado de tokens por segundo para 3.6 Flash, pero 3.6 Flash produce aproximadamente un 17% menos de tokens de salida que el 3.5 Flash al que reemplaza, por lo que finaliza el trabajo de varios pasos más rápido de lo que sugiere el precio de lista. Puedes confirmar las tarifas actuales en la página de precios de la API de Gemini y en nuestro desglose de precios de Gemini 3.6 Flash.

Calidad y puntos de referencia

La diferencia de precio te da margen en tareas difíciles. En Terminal-Bench 2.1, que mide el trabajo de terminal agentivo, Flash-Lite obtiene una puntuación de 54 y 3.6 Flash obtiene 78.0. Esa diferencia de 24 puntos lo dice todo: en trabajos genuinamente de varios pasos y basados en herramientas, 3.6 Flash es el modelo más fuerte por un margen claro.

3.6 Flash también reporta 83.0 en OSWorld-Verified, el benchmark de uso de ordenador que mide la capacidad de operar un navegador o escritorio real. Flash-Lite no apunta a esa habilidad. Si tu carga de trabajo implica hacer clics en una pantalla, ese es un trabajo para 3.6 Flash. En cuanto a la codificación específicamente, 3.6 Flash registra un 58.7% en SWE-Bench Pro y un 49% en DeepSWE v1.1, el tipo de puntuaciones que lo sitúan en el territorio real de la codificación agentiva. Flash-Lite no está diseñado para ese trabajo.

Vale la pena ser justo con Flash-Lite aquí. Su puntuación de 54 en Terminal-Bench 2.1 ha subido desde 31 en la generación Lite anterior, por lo que la categoría barata ha mejorado mucho en esta ronda. No es un modelo débil. Es un modelo ajustado para un trabajo diferente: razonamiento rápido, barato y suficientemente bueno en tareas que no se ramifican. La propia página del modelo Flash de Google y el anuncio de lanzamiento enmarcan los dos de la misma manera: una categoría para volumen, una categoría para profundidad.

Qué modelo para qué trabajo

Usa esto como matriz inicial, luego ajusta con tus propias evaluaciones.

Tarea Mejor ajuste
Clasificación o extracción de alto volumen Flash-Lite
Asistentes de chat y respuestas cortas Flash-Lite
Respuestas RAG sobre contexto recuperado Flash-Lite
UX de estilo autocompletar, crítica en latencia Flash-Lite
Pipelines a escala de búsqueda, por cada solicitud Flash-Lite
Agentes de varios pasos 3.6 Flash
Uso de herramientas y cadenas de llamadas a funciones 3.6 Flash
Codificación y revisión de código 3.6 Flash
Uso de ordenador (navegador o escritorio) 3.6 Flash
Respuestas de mayor riesgo donde los errores cuestan dinero 3.6 Flash

El patrón es simple. Flash-Lite gana donde la tarea es específica y el volumen es enorme. 3.6 Flash gana donde la tarea se ramifica y el costo de equivocarse es alto. Un modelo que etiqueta tickets de soporte por categoría diez millones de veces al día pertenece a Flash-Lite. Un modelo que lee un seguimiento de pila, edita tres archivos y abre una solicitud de extracción pertenece a 3.6 Flash. Si estás sopesando esto contra el antiguo 3.5 Flash en lugar de Flash-Lite, nuestra comparación de 3.6 Flash vs 3.5 Flash cubre esa ruta de actualización.

Una comparación de costes en la misma carga de trabajo

Los números concretan el compromiso. Digamos que un trabajo diario envía 10M de tokens de entrada y genera 2M de tokens de salida, una forma típica para un pipeline de resumen o extracción por lotes.

Modelo Entrada (10M) Salida (2M) Total diario
Flash-Lite $3.00 $5.00 $8.00
3.6 Flash $15.00 $15.00 $30.00

Con esa combinación, 3.6 Flash cuesta 3.75 veces más: $8.00 frente a $30.00 al día, o aproximadamente $240 frente a $900 al mes para el mismo volumen.

Sin embargo, el múltiplo no es fijo. Debido a que Flash-Lite es 5 veces más barato en la entrada y 3 veces más barato en la salida, tus ahorros reales se sitúan entre 3 y 5 veces, dependiendo de la forma de tu tráfico. El trabajo intensivo en entrada (contexto RAG largo, documentos grandes, clasificación de grandes entradas) se inclina hacia el extremo de 5x, y esas son exactamente las cargas de trabajo para las que Flash-Lite está diseñado. La generación intensiva en salida se inclina hacia 3x.

Así que la verdadera pregunta no es solo "¿puede 3.6 Flash hacer esto?". Es "¿vale la pena el aumento de calidad pagar de 3 a 4 veces más por llamada, a mi volumen?". Para un pipeline a escala de búsqueda, la respuesta suele ser no. Para un agente que edita código o presenta un ticket, la respuesta suele ser sí.

Cómo hacer A/B con ambos en Apidog

No tienes que adivinar qué nivel es suficientemente bueno. La API de Gemini es un endpoint REST simple, por lo que puedes enviar el mismo prompt a ambos modelos y comparar las respuestas directamente. Apidog es un cliente API creado precisamente para este tipo de verificación lado a lado.

Aquí hay un flujo de trabajo que toma unos minutos:

  1. Crea una solicitud POST al endpoint de la API de Gemini y almacena tu clave API en una variable de entorno de Apidog, para que la clave nunca esté en el cuerpo de la solicitud o en el control de versiones.
  2. Envíala una vez con el modelo configurado como gemini-3.5-flash-lite. Observa la respuesta y la latencia que informa Apidog.
  3. Duplica la solicitud y cambia una cosa: el ID del modelo a gemini-3.6-flash. Mismo prompt, mismos parámetros, por lo que la única variable es el modelo.
  4. Compara las dos respuestas en cuanto a calidad, y compara los tiempos que Apidog registra para cada llamada.
  5. Añade aserciones sobre la respuesta (código de estado, campos JSON esperados, contenido requerido) para que "suficientemente bueno" se defina mediante una verificación, no a simple vista.

Una vez que existan las solicitudes, guárdalas y conviértelas en una prueba repetible. Puedes programar las pruebas de API en Apidog para volver a ejecutar los mismos prompts con una cadencia, lo que detecta la deriva de calidad o latencia cuando Google actualiza cualquiera de los modelos. Sé claro sobre el límite: Apidog envía las solicitudes y verifica tus aserciones, pero no ejecuta el modelo y no te dirá qué respuesta es más inteligente. Ese juicio queda contigo. Para seguir, descarga Apidog y dirige una solicitud al endpoint de Gemini.

Preguntas frecuentes

¿Es Flash-Lite simplemente una versión peor de 3.6 Flash? No. Es un punto diferente en la curva de costo, calidad y velocidad. Flash-Lite es más barato y rápido con un límite inferior en el razonamiento difícil; 3.6 Flash cuesta más y razona mejor. En tareas simples de alto volumen, Flash-Lite suele ser la respuesta correcta precisamente porque es más barato y rápido, no a pesar de ello.

¿Por qué uno se llama 3.5 y el otro 3.6? Versionado mixto. En esta actualización, Google movió el modelo principal de Flash a 3.6 pero mantuvo la categoría Lite en 3.5 (la misma versión también incluyó un modelo de seguridad Flash Cyber 3.5). Misma familia, diferentes números de versión. No interpretes el 3.5 en Flash-Lite como "antiguo y abandonado".

¿Comparten la misma ventana de contexto? Sí. Ambos aceptan hasta 1 millón de tokens de entrada, por lo que los prompts de contexto largo no son una razón para elegir uno sobre el otro. Elige en función de la calidad del razonamiento, el precio y la velocidad.

¿Puedo usar ambos en una aplicación? Ese es el patrón recomendado. Dirige las llamadas baratas, simples y de alto volumen a Flash-Lite y escala las difíciles a 3.6 Flash. Dado que la forma de la API es idéntica, el cambio es una modificación de un solo campo, lo que hace que la prueba A/B de Apidog mencionada anteriormente sea tan rápida de ejecutar.

¿Son gratuitos para probar? Ambos tienen un nivel gratuito en Google AI Studio, con límite de tarifas, y Google puede usar los datos del nivel gratuito para mejorar sus productos. Esto está bien para pruebas; lee los términos antes de enviar cualquier cosa sensible.

En resumen

Opta por Flash-Lite como tu opción predeterminada para trabajos baratos, rápidos y sencillos a escala, y eleva las llamadas difíciles, ramificadas o con mucha codificación a 3.6 Flash, donde la diferencia de 24 puntos en Terminal-Bench justifica su precio de 3 a 4 veces mayor. No elijas en abstracto: envía tus prompts reales a ambos, mide la calidad y la latencia, y deja que los números decidan. Apidog convierte esa comparación en un trabajo de dos solicitudes.

button

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs