Gemini 3.8 Flash está disponible hoy: un modelo estable con un nivel gratuito, con un precio de $0.75 de entrada y $3.75 de salida por cada millón de tokens hasta el 31/12/2026, luego $1.50 y $7.50, con un límite de salida de 64K. Gemini 4 Argon no lo está. La publicación de lanzamiento de Google lo valora en $2 y $10 durante un período de introducción de duración no especificada, luego $4 y $20. Google dice que su límite de salida es de 1M de tokens, y que hoy solo está disponible para los defensores del programa Fairwind. Si necesitas lanzar este trimestre, hazlo con Flash y mantén Argon a un cambio de configuración de distancia.
Esta publicación compara ambos en cuanto a especificaciones, las filas de referencia que ambas publicaciones de lanzamiento comparten, las puntuaciones de ciberseguridad y el costo de una llamada idéntica, para luego ofrecerte una regla de decisión. Para obtener más información, consulta qué es Gemini 4 Argon y qué es Gemini 3.8 Flash. La última sección muestra la configuración de Apidog que hace que el cambio sea una única variable.
Comparativa: lo que puedes usar hoy
| Gemini 3.8 Flash | Gemini 4 Argon | |
|---|---|---|
| Disponibilidad | Estable en la API de Gemini, AI Studio, Antigravity y Gemini Enterprise | Un subconjunto de socios del programa Fairwind, como modelo gestionado en Gemini Enterprise |
| ID del modelo | gemini-3.8-flash |
No publicado |
| Precio por 1M de tokens (entrada / salida) | $0.75 / $3.75 hasta el 31/12/2026, luego $1.50 / $7.50 | $2 / $10 introducción (fecha de finalización no indicada), luego $4 / $20 |
| Entrada en caché por 1M | $0.075, luego $0.15 | $0.10 introducción, luego $0.20 (95% de descuento en entrada) |
| Límite de salida | 65,536 tokens | 1M de tokens (límite declarado por Google) |
| Ventana de entrada | 1,048,576 tokens | No publicado |
| Niveles de pensamiento | low, medium (predeterminado), high; minimal devuelve HTTP 400 |
No documentado |
| Nivel gratuito de API | Sí, con límite de velocidad | Ninguno anunciado |
| Acceso al consumidor | Aplicación Gemini en AI Pro y Ultra, Modo AI en Search | Todavía no; los suscriptores de AI Ultra están en la primera ola, sin fecha |
Algunas celdas necesitan contexto. Google no ha publicado la ventana de entrada de Argon, aunque su propia evaluación de contexto largo utilizó prompts de hasta 1M de tokens. Google dice que el límite de salida de Argon es de 1M de tokens; al menos un evaluador de terceros, Vals AI, lista una salida máxima de 262K para la configuración que probó. Las evaluaciones de Argon se realizaron con "la configuración de pensamiento más alta", por lo que es probable que exista un nivel alto, pero Google no ha nombrado los niveles ni el predeterminado. Los niveles de Flash están en los documentos de pensamiento de Google y en nuestra guía de niveles de pensamiento de 3.8 Flash.
El nivel gratuito de Flash tiene límite de velocidad, y Google dice que los datos del nivel gratuito se "utilizan para mejorar nuestros productos". Google no ha anunciado ninguna forma gratuita de usar Argon; nuestra explicación de acceso gratuito a Argon cubre lo que puedes usar en su lugar.
Las filas de referencia que ambas publicaciones de lanzamiento comparten en texto
Las tablas de lanzamiento de Google para los dos modelos comparten dos filas en texto. Estos son números informados por Google, y la metodología de Argon atribuye ambas filas a Vals AI.
| Benchmark | Gemini 3.8 Flash (Tabla del 2 de septiembre) | Gemini 4 Argon (Tabla del 30 de septiembre) |
|---|---|---|
| Vals Finance Agent v2 | 61.4% | 65.4% |
| Harvey Legal Agent Benchmark | 10.0% | 19.6% |
Google publicó estas tablas con un mes de diferencia, frente a diferentes conjuntos de rivales, por lo que la brecha debe interpretarse como direccional en lugar de una prueba controlada. Aun así, la fila legal destaca: el 19.6% de Argon es casi el doble del 10.0% de Flash. La brecha en finanzas es de 4 puntos.
Todo lo demás en la tabla de Argon no tiene un equivalente de 3.8 Flash en texto. La tabla de Google 3.8 Flash informó HLE-Verified, lo que no hace la de Argon, y la puntuación DeepSWE de Flash solo apareció en las imágenes de la tarjeta del modelo. En la clasificación de texto de Arena, una clasificación de terceros, Argon (Alto) ocupa el puesto #1 en votos preliminares, mientras que Gemini 3.8 Flash (Alto) es el #11. La tabla completa de Argon de 19 filas, con quién midió cada fila, se encuentra en nuestro desglose de los benchmarks de Argon.
Ciberseguridad: Argon vs 3.8 Flash Cyber
La página de ciberseguridad de DeepMind compara Argon con Gemini 3.8 Flash Cyber, el hermano cibernético de Flash restringido por Fairwind:
| Evaluación de ciberseguridad | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|
| Detección de vulnerabilidades en el mundo real | 85.8% | 71.0% |
| Wiz Penetration Test Benchmark | 70.9% | 58.2% |
Ambos modelos están restringidos. Gemini 3.8 Flash Cyber está disponible generalmente (GA) detrás de una lista de permitidos en la Plataforma de Agentes de Gemini Enterprise, y Argon es solo para Fairwind. Si no eres socio de Fairwind, ninguna cifra cambia lo que puedes usar hoy. El modelo general 3.8 Flash es en el que puedes basar tus desarrollos.
Costo de la misma llamada en ambos
Consideremos una llamada con 100,000 tokens de entrada y 8,000 tokens de salida. Los modelos actuales de Gemini, incluido el 3.8 Flash, facturan los tokens de pensamiento como salida, por lo que los 8,000 los incluyen. Google no ha dicho cómo los factura Argon; las filas de Argon asumen que sigue el modelo actual de Gemini.
| Modelo y período | Costo de entrada | Costo de salida | Total por llamada |
|---|---|---|---|
| 3.8 Flash, introducción | 0.1M x $0.75 = $0.075 | 0.008M x $3.75 = $0.030 | $0.105 |
| 3.8 Flash, a partir del 01/01/2027 | 0.1M x $1.50 = $0.150 | 0.008M x $7.50 = $0.060 | $0.210 |
| Argon, introducción | 0.1M x $2 = $0.200 | 0.008M x $10 = $0.080 | $0.280 |
| Argon, estándar | 0.1M x $4 = $0.400 | 0.008M x $20 = $0.160 | $0.560 |
Las tarifas por token de Argon son 8/3 (aproximadamente 2.67 veces) las de Flash, tanto en los precios de introducción como en los estándar. Con 1,000 de estas llamadas al día, eso significa $105 al día con Flash frente a $280 con Argon a tarifas de introducción.
Tres cosas rompen esta proporción:
- El recuento de tokens no coincidirá. El mismo prompt produce diferentes recuentos de tokens de salida y pensamiento en modelos distintos. Las evaluaciones publicadas de Argon se ejecutaron con la configuración de pensamiento más alta, y en 3.8 Flash Google advierte que los niveles de esfuerzo más altos pueden usar más tokens.
- Las salidas largas cambian los cálculos. Una respuesta de 200,000 tokens no cabe en el límite de 65,536 tokens de Flash, por lo que tendrías que dividirla en varias llamadas. Bajo el límite declarado de Argon, es una sola respuesta: 0.2M x $10 = $2.00 a tarifas de introducción, o $4.00 a tarifas estándar. Una respuesta completa de 1M de tokens cuesta $10 de introducción o $20 estándar.
- Solo se conoce una fecha de finalización de introducción. La tarifa de introducción de Flash termina el 31 de diciembre de 2026. Google no ha dicho cuándo termina la de Argon.
Flash también tiene Batch con un 50% de descuento ($0.375 y $1.875 hasta el 31 de diciembre), según la página de precios de la API de Gemini. Google no ha publicado los precios de Batch para Argon. Nuestras guías de precios de Argon y 3.8 Flash profundizan en este tema.
¿Deberías esperar por Argon o lanzar con Flash?
Lanza con 3.8 Flash ahora cuando
- Estés limitado por el costo. Flash cuesta 3/8 de Argon por token, y Batch reduce eso a la mitad.
- Manejes un alto volumen. La clasificación, extracción, enrutamiento y chat a escala se suman rápidamente a $10 por 1M de tokens de salida.
- Lo necesites hoy. Flash tiene un ID de modelo estable, un nivel gratuito para prototipos y un calendario de precios publicado.
- Tus respuestas caben en 65,536 tokens. La mayoría de las cargas de trabajo de API lo hacen.
Planifica para Argon cuando
- El trabajo sea a largo plazo. Google dice que Argon está "construido para sostener un razonamiento profundo en flujos de trabajo complejos y a largo plazo".
- Necesites salidas superiores a 64K. Las reescrituras completas de módulos, los informes largos y las grandes migraciones son el caso para un límite de salida de 1M.
- Ejecutes agentes legales o financieros. Esas son las dos filas donde Google publicó ambos modelos, y Argon lidera en ambas.
- Seas un defensor elegible de Fairwind. Argon es el modelo con el que ahora lidera el programa.
No tienes que elegir de una vez. Dirige la mayor parte del tráfico a Flash y envía los casos complejos a Argon cuando se lance, con ambos detrás de la misma configuración.
Una solicitud guardada, dos modelos
Aquí tienes el patrón. Guarda el nombre del modelo en una variable de entorno, ejecuta tus solicitudes reales contra 3.8 Flash ahora y cambia la variable el día que se lance el ID del modelo de Argon. Google no ha publicado ese ID, así que no intentes adivinarlo.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
curl -s -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"Summarize this contract clause in 3 bullets."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"medium"},"maxOutputTokens":8192}}'
Cada respuesta de generateContent termina con usageMetadata. En Apidog, almacena GEMINI_API_KEY y GEMINI_MODEL en un entorno, guarda esta solicitud y añade aserciones: estado 200, los campos que lee tu aplicación y un límite en usageMetadata.thoughtsTokenCount ajustado a tu tope de costos. Mantén maxOutputTokens configurado para que una respuesta larga no agote tu presupuesto. Añádelo a un escenario de prueba, ejecútalo en Flash y guarda el informe como una línea base.
Dos advertencias para el día del lanzamiento. Google dice que "todos los modelos nuevos" se lanzarán en la API de Interacciones y no ha dicho si Argon soporta generateContent, así que guarda una versión de Interacciones (POST https://generativelanguage.googleapis.com/v1beta/interactions con generation_config.thinking_level) junto a esta. Y los nombres de los niveles de pensamiento de Argon no están documentados, por lo que medium podría no aplicarse. Cuando Argon esté disponible, cambia una variable, vuelve a ejecutar y compara las salidas y usageMetadata lado a lado.
Preguntas frecuentes
¿Es Gemini 4 Argon mejor que Gemini 3.8 Flash? En las dos filas que ambas tablas de lanzamiento comparten en texto, sí: 65.4% frente a 61.4% en Vals Finance Agent v2 y 19.6% frente a 10.0% en Harvey’s Legal Agent Benchmark. También cuesta aproximadamente 2.67 veces más por token, y todavía no puedes usarlo.
¿Debería esperar por Gemini 4 Argon? No si necesitas lanzar algo pronto. Google no ha dado una fecha de lanzamiento, solo "lo antes posible", comenzando con clientes de API de pago y suscriptores de AI Ultra.
¿Gemini 3.8 Flash o Argon para un nuevo proyecto? Comienza con 3.8 Flash con el modelo en una variable. Mueve las solicitudes que necesiten salidas largas o profundidad legal y financiera a Argon una vez que lo hayas probado con tus propios prompts.
¿Hay alguna forma gratuita de usar Argon? No. Google no ha anunciado un nivel gratuito; consulta nuestra explicación de acceso gratuito a Argon para conocer los modelos Gemini gratuitos que puedes usar hoy.
¿Argon reemplaza a Gemini 3.8 Flash? Google no lo ha dicho. Google llama a Argon su nuevo modelo de vanguardia, y Reuters informa que es más grande que la línea Pro anterior, por lo que es un nivel diferente a Flash.
Siguiente paso
Configura la solicitud hoy mismo, ejecútala en 3.8 Flash y guarda el informe. Cuando Argon se lance, sabrás en cuestión de minutos si justifica su precio en tu tráfico. Descarga Apidog para realizar la comparación.
