Gemini 3.8 Flash se envía con tres niveles de razonamiento: low, medium y high. La configuración controla cuánto razonamiento interno realiza el modelo antes de responder, y en este modelo mueve tres números a la vez: latencia, tokens de salida y su factura. Google diseñó 3.8 Flash para "trabajar más duro" en tareas complejas, por lo que el nivel que elija importa más de lo que lo hacía en 3.7 Flash. Si es nuevo en el modelo, la descripción general de Gemini 3.8 Flash cubre su lanzamiento. Esta guía trata solo sobre el control de nivel.
Dos detalles complican a los equipos en la primera hora. El nivel predeterminado en 3.8 Flash es medium, no high (Gemini 3 Pro usa high por defecto, de ahí la confusión). Y minimal, que las configuraciones escritas para Gemini 3.7 Flash aún envían, ya no se acepta: la solicitud falla la validación antes de que se genere un solo token. Google documenta ambos en la página Novedades de Gemini 3.8 Flash.
A continuación: qué hace cada nivel, cuánto cuesta por tarea, cómo configurarlo en ambos formatos de API, una estrategia por ruta y una prueba repetible que muestra la diferencia de tokens y latencia antes de implementar.
Niveles de razonamiento de un vistazo
| Nivel | Orientación de Google | Costo por tarea (AA) | Tiempo por tarea (AA) | Úselo cuando |
|---|---|---|---|---|
low |
Minimiza latencia y costo; seguimiento de instrucciones simple, chat, rutas de alto rendimiento | $0.24 | 0.8 min | la latencia de cara al usuario importa; búsqueda en transcripciones; clasificación |
medium (predeterminado) |
El predeterminado para código complejo y trabajo de agente | $0.41 | no publicado en texto | la mayoría de las rutas; preguntas y respuestas generales de video |
high |
Máxima profundidad de razonamiento para los problemas de varios pasos más difíciles | $0.58 | 2.5 min | QA visual densa; videos de 60+ minutos; pasos de planificación que rigen todo lo posterior |
minimal |
No compatible con 3.8 Flash | n/a | n/a | nunca; mapéelo a low |
Las columnas de costo y tiempo son promedios de Artificial Analysis al ejecutar su Intelligence Index en cada nivel, a los precios de introducción por token de Google. Son números independientes, no de Google, y miden una carga de trabajo de referencia, no sus prompts. Úselos para ratios, luego mida sus propias rutas.
Qué hace cada nivel
Cada respuesta de 3.8 Flash puede incluir tokens de razonamiento: razonamiento que el modelo genera antes de la respuesta visible. Usted paga por ellos como tokens de salida ($3.75 por millón a la tasa de introducción hasta el 31/12/2026, $7.50 a partir del 01/01/2027), y la API los reporta por separado como usageMetadata.thoughtsTokenCount. El nivel de razonamiento le dice al modelo cuánto de ese razonamiento debe realizar.
lowmantiene el razonamiento corto. El primer token llega más rápido y la factura de salida se mantiene pequeña. Google lo posiciona para trabajos sensibles a la latencia: seguimiento de instrucciones simple, chat y puntos finales de alto rendimiento.mediumes el punto de equilibrio y el valor predeterminado. Google lo señala como la configuración para código complejo y tareas de agente, que es la mayoría de lo que la gente ejecuta en un modelo de clase Flash.highle dice al modelo que razone tan profundamente como pueda. Google lo reserva para los problemas de varios pasos más difíciles.
Lo que hace esto diferente en 3.8 Flash es el nuevo comportamiento predeterminado del modelo. En tareas complejas "ejecuta pasos de razonamiento adicionales y llama a herramientas de forma iterativa" y "verifica su trabajo en el camino". Google dice claramente que "puede usar más tokens en tareas más largas y complejas, por diseño" y que "el modelo podría usar más tokens para maximizar el rendimiento, especialmente en niveles de esfuerzo más altos". El nivel de razonamiento es el acelerador de ese comportamiento. Reducirlo es la primera sugerencia de Google cuando el uso de tokens aumenta; la segunda es permanecer en 3.7 Flash, que sigue siendo totalmente compatible.
Una limitación a internalizar: thinking_level es un enumerado, no un presupuesto. El entero thinking_budget de modelos anteriores ya no está en Gemini 3, por lo que no puede pedir "como máximo 2,000 tokens de razonamiento". Usted elige un nivel y luego verifica lo que cuesta en sus prompts, por lo que la prueba al final de esta guía es importante.
El valor predeterminado es "medium", no "high"
Omita el campo y 3.8 Flash se ejecuta en medium. Eso afecta a dos grupos.
Los equipos que prototiparon en Gemini 3 Pro esperan high por defecto y obtienen respuestas de profundidad media sin darse cuenta. Los equipos que eliminaron thinking_budget durante una actualización de 3.7 Flash y no lo reemplazaron con un nivel terminan en medium en todas partes, incluidas las rutas de chat que deberían estar en low.
La solución para ambos es la misma: establezca thinking_level explícitamente en cada solicitud, por ruta, en la configuración, no en el código. Los valores predeterminados son de Google para cambiar; su perfil de costos no debería moverse cuando ellos lo hagan.
Por qué "minimal" ha desaparecido y cómo corregir el error
minimal funcionó en Gemini 3.7 Flash. En 3.8 Flash no está en el conjunto compatible, y la página del modelo solo enumera los niveles de razonamiento como low, medium y high. Envíelo por REST y la solicitud será rechazada antes de que el modelo se ejecute con un 400 INVALID_ARGUMENT con el mensaje "Thinking level MINIMAL is not supported for this model. Please retry with other thinking level." (verificado con una llamada en vivo el 3 de septiembre de 2026). Los SDKs envuelven eso en su propia clase de excepción, así que haga coincidir con el estado 400 o el código INVALID_ARGUMENT, no con la cadena del mensaje.
Antes:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "minimal" }
}
Después:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "low" }
}
La guía de migración de Google es un mapeo directo: minimal se convierte en low. Dos tentaciones a evitar mientras está en esa configuración. No busque thinking_budget para obtener un límite más pequeño; no es compatible con los modelos Gemini 3. Y no baje la temperature para "calmar el modelo"; Google dice que la deje en el valor predeterminado de 1.0 en todos los modelos Gemini 3 porque bajarla puede causar bucles o una salida degradada. La lista de verificación completa, incluidas las firmas de pensamiento y el requisito call_id en las respuestas de función, se encuentra en la guía de migración de 3.7 a 3.8 Flash.
Debido a que el error se dispara en el momento de la validación, una solicitud de prueba programada en cada nivel detecta una regresión de configuración a minimal de forma gratuita.
Cuánto cuesta cada nivel por tarea
El precio por token no cambia con el nivel. La página de precios de Google lista cada llamada a 3.8 Flash en $0.75 de entrada y $3.75 de salida por millón de tokens a la tarifa de introducción, duplicándose a $1.50 y $7.50 el 01/01/2027. La diferencia entre niveles es puramente el recuento de tokens, que es lo que midió Artificial Analysis.
| Modelo y nivel | Costo por tarea | Tiempo por tarea |
|---|---|---|
Gemini 3.8 Flash low |
$0.24 | 0.8 min |
Gemini 3.8 Flash medium |
$0.41 | no publicado en texto |
Gemini 3.8 Flash high |
$0.58 | 2.5 min |
Gemini 3.7 Flash high |
$0.40 | 2.2 min |
Fuente: Artificial Analysis, ejecuciones del Intelligence Index a precios de introducción. De la tabla se derivan tres relaciones.
low se ejecuta aproximadamente al 41% del costo de high y aproximadamente un tercio de su tiempo real. Esa es la mayor palanca que tiene en este modelo.
medium en 3.8 Flash cuesta aproximadamente lo mismo que high en 3.7 Flash ($0.41 frente a $0.40). Si estaba satisfecho con 3.7 Flash en high, 3.8 Flash en medium es la línea presupuestaria equivalente.
high en 3.8 Flash cuesta un 45% más por tarea que high en 3.7 Flash, con precios idénticos por token, porque el modelo emite aproximadamente un 30% más de tokens de salida (48k en promedio por tarea de índice). Eso es el diseño de "trabaja más duro" que se muestra en la factura. Si los tokens adicionales se justifican depende de la carga de trabajo; la comparación de 3.8 Flash vs 3.7 Flash explica dónde se obtuvieron las mejoras de calidad.
Una advertencia sobre la calidad: la puntuación de Intelligence Index de AA de 59 para 3.8 Flash es una ejecución en high. No publicaron las puntuaciones del índice en medium o low en el texto, así que no asuma que la curva de calidad es lineal con el costo. Pruebe sus propias evaluaciones en cada nivel antes de bajar una ruta. Para el ejemplo práctico de 1,000 tareas al día en cada nivel y el límite de precios del 31 de diciembre, consulte Precios de Gemini 3.8 Flash.
Configuración de thinking_level en la API de interacciones
La API de Interacciones es la superficie principal de Google para Gemini 3.x. El nivel se encuentra en generation_config como una cadena en formato snake_case:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" -H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
En Python:
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Explain HTTP caching in 3 sentences.",
generation_config={"thinking_level": "low"},
)
print(interaction.output_text)
Es un campo a nivel de solicitud, así que configúrelo en cada llamada, incluyendo las interacciones de seguimiento que pasen previous_interaction_id. La respuesta viene como una lista de pasos de ejecución (pensamientos, llamadas a herramientas) que terminan en model_output, y el SDK expone el texto final como output_text. Para una revisión completa de la primera llamada, incluyendo el estado de varias interacciones y el streaming, consulte cómo usar la API de Gemini 3.8 Flash.
Configurarlo en generateContent heredado
La mayoría del código Gemini existente todavía llama a generateContent. Google lo denomina heredado, pero dice que sigue siendo totalmente compatible sin fecha de obsolescencia, por lo que no hay prisa. El campo está anidado un nivel más profundo y en camelCase:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" -H 'Content-Type: application/json' -X POST \
-d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
En Python:
from google.genai import types
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Explain HTTP caching in 3 sentences.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="low")
),
)
print(response.usage_metadata.thoughts_token_count)
includeThoughts: true añade resúmenes de pensamientos a la respuesta como partes marcadas con thought: true: útil mientras se calibra un nivel, ruido una vez que haya terminado. El número que le importa es usageMetadata.thoughtsTokenCount, el recuento exacto facturado como salida y el campo que sus pruebas deben observar.
Una estrategia por ruta
Trate el nivel como una decisión de enrutamiento, no como una configuración global. Una división viable:
- Chat, autocompletado y cualquier cosa que una persona esté esperando:
low. Ahí es donde reside la latencia del primer token. - Clasificación, extracción y búsqueda de transcripciones:
low, con su propia ejecución de evaluación una vez para confirmar que la precisión se mantiene. El propio ejemplo de video de Google sitúa la búsqueda de transcripciones enlow. - Agentes de codificación y bucles de herramientas:
medium, el valor predeterminado. Eleve un único paso de planificación ahighsi su salida condiciona todos los pasos posteriores, luego baje. En 3.8 Flash, los bucles de herramientas ya ejecutan más turnos por diseño, por lo quehighen un bucle completo se acumula rápidamente. - Flujos de trabajo con muchos documentos y de largo plazo:
high, y envíelos a través de la API por lotes con un 50% de descuento cuando no sean interactivos. - Video: La documentación de Google ofrece tres ejemplos.
highpara QA visual densa o videos de más de 60 minutos,mediumpara preguntas y respuestas generales de video,lowpara buscar en una transcripción.
Si low en 3.8 Flash sigue siendo un modelo superior a lo que necesita una ruta, la línea Flash-Lite existe para ese trabajo; nuestra guía anterior de Gemini 3.1 Flash-Lite cubre la compensación, y Gemini 3.5 Flash-Lite es la entrada actual a $0.30 de entrada y $2.50 de salida.
Mantenga el nivel en la configuración por ruta y mantenga gemini-3.7-flash detrás de una bandera. Si el recuento de tokens de una ruta se dispara después de la actualización, puede bajar el nivel o el modelo sin una implementación.
Pruebe los tres niveles lado a lado en Apidog
Leer la tabla de AA le indica las proporciones. Solo sus prompts le indican los números. Aquí hay un escenario de prueba en Apidog que envía un prompt "dorado" en cada nivel y afirma lo que se obtuvo. Funciona con cualquiera de las dos formas de API; se muestra el endpoint heredado porque usageMetadata es un campo de nivel superior allí.
- Almacene la clave como una variable de entorno. Cree
GEMINI_API_KEYen un entorno de Apidog y haga referencia a ella como{{GEMINI_API_KEY}}en el encabezadox-goog-api-key. Añada una segunda variable,THINKING_LEVEL, para que una solicitud guardada sirva para los tres pasos. - Guarde una solicitud. POST a
/v1beta/models/gemini-3.8-flash:generateContentcon su prompt "dorado" y"thinkingConfig": {"thinkingLevel": "{{THINKING_LEVEL}}"}. - Construya un escenario de prueba de tres pasos. Importe la misma solicitud tres veces y sobrescriba
THINKING_LEVELalow,mediumyhighen cada paso. - Afirme los campos que se mueven. En cada paso: el estado es 200 y
usageMetadata.thoughtsTokenCountexiste. En el pasolow, afirme quethoughtsTokenCounty el tiempo de respuesta se mantienen por debajo del límite que la ruta puede tolerar (establezca la línea base después de su primera ejecución). Un script de post-procesamiento puede almacenar el recuento de cada paso en una variable para que el pasohighpueda afirmar que razonó al menos tanto como lo hizolow. Si ese orden alguna vez se invierte, el modelo o el valor predeterminado cambiaron bajo su control. - Añada un paso de guardia. Envíe
thinkingLevel: "minimal"y afirme que la respuesta no es 200. Cuando más tarde cambie los IDs del modelo, este paso le indicará si el nuevo modelo aún lo rechaza. - Prográmelo. Ejecute el escenario diariamente para que una regresión de configuración o un cambio de comportamiento silencioso aparezca como una ejecución fallida, no como una factura sorpresa. La mecánica se encuentra en cómo programar pruebas de API en Apidog.
Para respuestas en streaming, el mismo escenario se aplica con la representación SSE; cómo probar las API de LLM que transmiten a través de SSE cubre la configuración. Descargue Apidog para seguir; el plan gratuito cubre todo este escenario.
Preguntas frecuentes
¿El nivel de razonamiento cambia el precio por token?
No. La entrada cuesta $0.75 y la salida $3.75 por millón de tokens en 3.8 Flash a la tarifa de introducción, independientemente del nivel. El nivel cambia cuántos tokens de salida genera el modelo como razonamiento, y estos se facturan al precio de salida. El desglose de precios cubre el caché, los lotes y el aumento del 1 de enero.
¿Puedo establecer un presupuesto exacto de tokens de razonamiento en su lugar?
No en los modelos Gemini 3. thinking_budget fue reemplazado por el enumerado thinking_level, y 3.8 Flash solo acepta low, medium y high. Si necesita un límite, aplíquelo en pruebas y alertas en lugar de en la solicitud.
¿Qué nivel usa la puntuación de 59 de Artificial Analysis?
high. AA ejecutó el Intelligence Index en high para la puntuación principal y publicó el costo y el tiempo en low y medium también, pero no las puntuaciones del índice en esos niveles. Trate los niveles inferiores como no probados en ese benchmark hasta que ejecute sus propias evaluaciones.
¿Debo bajar la temperatura para reducir el razonamiento?
No. La guía de Google para todos los modelos Gemini 3 es mantener la temperature en su valor predeterminado de 1.0. Bajarla puede causar bucles o una salida degradada. Use thinking_level para controlar la profundidad del razonamiento.
¿Qué pasa si incluso "low" es demasiado lento o demasiado caro?
Quédese en Gemini 3.7 Flash, que Google dice que sigue siendo totalmente compatible sin fecha de obsolescencia, o mueva la ruta a un modelo Flash-Lite. La comparación de 3.8 vs 3.7 Flash muestra dónde los tokens adicionales aportan calidad medible y dónde no.
Elija el nivel por ruta, luego mídelo
Tres niveles, un enumerado y un modelo que razona más que su predecesor por defecto. Establezca thinking_level explícitamente en cada ruta, mapee cualquier minimal restante a low, y observe usageMetadata.thoughtsTokenCount donde se sitúa cada nivel. Las cifras por tarea de AA ($0.24, $0.41, $0.58) le dan la forma de la curva; un escenario de tres pasos en Apidog le proporciona sus propios números antes de que el cambio de precio del 31 de diciembre los haga el doble de importantes.
