DeepSeek-V4.1-Flash estuvo disponible en la API el 10 de septiembre de 2026, y la nota de lanzamiento vino acompañada de un recorte de precios. La entrada con acierto de caché ahora cuesta $0.003 por millón de tokens fuera de horas pico, la entrada con fallo de caché $0.15, la salida $0.60. Cuatro días después, el 14 de septiembre, DeepSeek comienza a enrutar cada solicitud de deepseek-v4-pro a V4.1-Flash y la factura con tarifas Flash. Si ejecutas algo en la API de DeepSeek, tu factura cambia esta semana, toques tu código o no.
Esta publicación es la mitad de la historia sobre precios: las tablas completas en USD y CNY, los cambios porcentuales frente a V4-Flash y V4-Pro, dónde caen las ventanas de horas pico en tu zona horaria, y dos ejemplos de aciertos de caché con la aritmética mostrada. Para el modelo en sí, comienza con qué es DeepSeek-V4.1-Flash.
Una advertencia de antemano. Cada número de referencia en este grupo es una cifra reportada por DeepSeek de la tarjeta del modelo. Los precios provienen de la página de precios, verificados el 10 de septiembre. La última sección muestra cómo medir tu propio gasto con Apidog leyendo el bloque usage en cada respuesta en lugar de confiar en una estimación.
En resumen
- Fuera de horas pico,
deepseek-flashcuesta $0.003 por 1M de tokens de entrada con acierto de caché, $0.15 por 1M de tokens de entrada con fallo de caché, y $0.60 por 1M de tokens de salida. Las horas pico son exactamente el doble. - Frente a V4-Flash el 21 de agosto: la entrada con acierto de caché bajó un 57%, la entrada con fallo de caché un 32%, la salida un 9%.
- Frente a V4-Pro en horas pico: una carga de trabajo redirigida paga un 77% menos por la entrada con fallo de caché y un 70% menos por la salida a partir del 14 de septiembre.
- Las horas pico son de lunes a viernes, de 01:00 a 04:00 y de 06:00 a 10:00 UTC. Los fines de semana son completamente fuera de horas pico.
La tabla de precios completa
Todas las cifras son por 1M de tokens, efectivas a partir del 10 de septiembre de 2026 a las 04:00 UTC.
| deepseek-flash fuera de horas pico | deepseek-flash horas pico | deepseek-v4-pro fuera de horas pico | deepseek-v4-pro horas pico | |
|---|---|---|---|---|
| Entrada, acierto de caché | $0.003 | $0.006 | $0.022 | $0.044 |
| Entrada, fallo de caché | $0.15 | $0.30 | $0.66 | $1.32 |
| Salida | $0.60 | $1.20 | $1.98 | $3.96 |
| Concurrencia | 2,500 | 2,500 | 500 | 500 |
Las columnas de deepseek-v4-pro importan durante cuatro días más. A partir del 14 de septiembre a las 04:00 UTC (12:00 Beijing), las solicitudes a ese nombre de modelo son atendidas por V4.1-Flash y facturadas según las dos primeras columnas. La guía de retiro y migración de V4-Pro cubre lo que hay que probar antes de esa fecha.
Si tu cuenta se liquida en yuanes, la página de precios en zh-cn lista deepseek-flash como:
| Fuera de horas pico (CNY) | Horas pico (CNY) | |
|---|---|---|
| Entrada, acierto de caché | ¥0.02 | ¥0.04 |
| Entrada, fallo de caché | ¥1.00 | ¥2.00 |
| Salida | ¥4.00 | ¥8.00 |
Cada fila en CNY es la fila en USD multiplicada por aproximadamente 6.67. Dos detalles que la tabla omite: el almacenamiento en caché de contexto es automático, sin necesidad de configurar ninguna bandera, y la ID del modelo ahora es deepseek-flash. Los nombres antiguos deepseek-v4-flash y deepseek-v4-flash-vision-exp todavía se resuelven pero se dirigen a V4.1-Flash con estas tarifas.
Qué cambió frente a V4-Flash y V4-Pro
El 21 de agosto de 2026, deepseek-v4-flash facturaba $0.007 / $0.22 / $0.66 fuera de horas pico (acierto de caché / fallo de caché / salida) y $0.014 / $0.44 / $1.32 en horas pico. El registro de cambios dice que el precio fue "reducido en consecuencia" con este lanzamiento. Esto es lo que "en consecuencia" significa, calculado a partir de las dos listas:
| Elemento | V4-Flash (21 de agosto) | V4.1-Flash (10 de septiembre) | Recorte |
|---|---|---|---|
| Acierto de caché, fuera de horas pico | $0.007 | $0.003 | 57% |
| Fallo de caché, fuera de horas pico | $0.22 | $0.15 | 32% |
| Salida, fuera de horas pico | $0.66 | $0.60 | 9% |
Las filas de horas pico tienen porcentajes idénticos, ya que ambas listas se duplican en horas pico. El patrón es deliberado: el recorte más pronunciado se aplica a los aciertos de caché, el más pequeño a la salida. DeepSeek está poniendo precio para bucles de agente que releen un prefijo largo en cada turno, y el caché KV FP4 en V4.1 (890 bytes por token, aproximadamente un cuarto de la huella de V4-Flash) es lo que hace que un precio de acierto de $0.003 sea sostenible por su parte.
Para los usuarios de V4-Pro, los números son mayores, porque la redirección se produce a tarifas Flash:
- Entrada con fallo de caché en horas pico: $1.32 se convierte en $0.30, un recorte del 77%.
- Salida en horas pico: $3.96 se convierte en $1.20, un recorte del 70%.
- Entrada con acierto de caché en horas pico: $0.044 se convierte en $0.006, un recorte del 86%.
DeepSeek afirma que V4.1-Flash "ha superado ampliamente a V4 Pro en rendimiento, costo, velocidad y tiempo total", una afirmación que debe verificarse con tus propias instrucciones antes del día 14. Para el arco más largo de la fijación de precios de la familia, incluido el período en que DeepSeek aumentó los precios de la API, el desglose de precios de la API DeepSeek V4 tiene la historia.
Ventanas de horas pico en tu zona horaria
Las horas pico se aplican solo de lunes a viernes, en dos bloques: de 01:00 a 04:00 UTC y de 06:00 a 10:00 UTC. Esto es de 9:00 a 12:00 y de 14:00 a 18:00 hora de Beijing. Siete horas pico por día laborable, 35 por semana, por lo que las horas pico cubren aproximadamente el 21% de las 168 horas de la semana. Todo lo demás, incluyendo todo el sábado y el domingo, se factura a la tarifa fuera de horas pico.
| Ventana | UTC | Beijing (UTC+8) | Pacífico de EE. UU. (PDT, UTC-7) | Europa Central (CEST, UTC+2) |
|---|---|---|---|---|
| Pico 1 | 01:00 a 04:00 | 09:00 a 12:00 | 18:00 a 21:00 (tarde anterior) | 03:00 a 06:00 |
| Pico 2 | 06:00 a 10:00 | 14:00 a 18:00 | 23:00 a 03:00 (durante la noche) | 08:00 a 12:00 |
Las columnas del Pacífico y Europa Central utilizan el horario de verano. Después del cambio de hora (25 de octubre en la UE, 1 de noviembre en EE. UU.), desplaza ambas columnas una hora antes. Los límites UTC nunca se mueven.
Un día laborable en la costa oeste de EE. UU. nunca coincide con un bloque de horas pico. Una mañana en Europa Central se encuentra dentro del Pico 2, y un lote nocturno europeo a las 03:00 hora local paga el doble; moverlo a las 23:00 CEST (21:00 UTC) lo vuelve a poner a mitad de precio.
Matemáticas de acierto de caché, resueltas dos veces
Un acierto cuesta 1/50 de un fallo ($0.003 frente a $0.15), por lo que la proporción entre el prefijo repetido y los tokens nuevos decide el costo de tu entrada más que el número bruto de tokens. Si el almacenamiento en caché de prefijos es nuevo para ti, el manual de almacenamiento en caché de instrucciones explica lo que cuenta como prefijo almacenable en caché: bytes idénticos al inicio de la solicitud.
Ejemplo 1: un bucle de agente con una instrucción de sistema de 20K tokens, 1,000 llamadas en horas pico.
Un agente de clasificación de soporte lleva una instrucción de sistema de 20,000 tokens (políticas, esquemas de herramientas, ejemplos de pocas tomas), lee 2,000 tokens nuevos de texto de tickets por llamada y escribe 1,000 tokens de salida. Durante 1,000 llamadas:
- La entrada total es 1,000 × 22,000 = 22M tokens. La salida total es 1M tokens.
- La primera llamada falla en todos los 22,000 tokens. Cada llamada posterior acierta en el prefijo de 20,000 tokens y falla en sus 2,000 tokens nuevos.
- Tokens de acierto: 999 × 20,000 = 19.98M. A $0.006 por 1M: 19.98 × 0.006 = $0.12.
- Tokens de fallo: 22,000 + 999 × 2,000 = 2.02M. A $0.30 por 1M: 2.02 × 0.30 = $0.61.
- Salida: 1M × $1.20 = $1.20.
- Total: $0.12 + $0.61 + $1.20 = $1.93.
Sin caché, solo la entrada sería 22 × $0.30 = $6.60 y el trabajo costaría $7.80. El almacenamiento en caché elimina el 75% de la factura. Ejecuta el mismo bucle fuera de las horas pico y cada línea se reduce a la mitad: $0.06 + $0.30 + $0.60 = $0.96.
Las mismas 1,000 llamadas en V4-Pro en horas pico (aciertos $0.88, fallos $2.67, salida $3.96) suman $7.51, el número que un cliente Pro debería comparar con $1.93 cuando se realice la redirección.
Ejemplo 2: un trabajo por lotes con 10M tokens de salida, movido fuera de horas pico.
Un equipo de catálogo genera 10,000 descripciones de productos. Cada llamada envía 1,500 tokens de datos de producto (únicos por artículo, por lo que no hay beneficio de caché) y recibe 1,000 tokens de copia. Esto son 15M tokens de entrada, todos fallos, y 10M tokens de salida.
- En horas pico: entrada 15 × $0.30 = $4.50. Salida 10 × $1.20 = $12.00. Total $16.50.
- Fuera de horas pico: entrada 15 × $0.15 = $2.25. Salida 10 × $0.60 = $6.00. Total $8.25.
- Ahorros solo por la marca de tiempo: $8.25, sin cambios en las instrucciones.
La salida domina este trabajo y obtuvo el recorte más pequeño en el lanzamiento, por lo que la ventana fuera de horas pico es la mayor palanca. Es una ventana generosa: 15 horas cada día laborable a partir de las 10:00 UTC, más 48 horas ininterrumpidas cada fin de semana.
Contexto, salida y por qué la concurrencia es parte del precio
Ambos nombres de modelo tienen un contexto de 1M de tokens y una salida máxima de 384K de tokens. La tarjeta del modelo recomienda un máximo de 256K tokens o más, así que establece ese límite a propósito: una respuesta que llega a 384K tokens de salida cuesta $0.46 en horas pico, lo cual está bien para una transcripción de agente y un error para el autocompletado.
La concurrencia es de 2,500 para Flash frente a 500 para Pro. Pertenece a un artículo de precios porque el descuento fuera de horas pico solo vale algo si puedes hacer el trabajo dentro de la ventana, y porque el tráfico de deepseek-v4-pro redirigido el 14 de septiembre hereda el límite de Flash: una integración Pro que solía hacer cola detrás de 500 ranuras obtiene cinco veces más margen sin un cambio de configuración.
Mide el gasto real con Apidog
Las tablas de precios te dicen la tarifa. El objeto usage en cada respuesta te dice por qué se te cobró. Aquí tienes un flujo de trabajo de Apidog que lo convierte en una verificación repetible.

- Añade el endpoint. Crea
POST https://api.deepseek.com/chat/completions, o importa una especificación OpenAPI compatible con OpenAI. - Coloca los precios en los entornos. Crea dos entornos de Apidog,
deepseek-peakydeepseek-offpeak, cada uno conDEEPSEEK_API_KEYmásPRICE_HIT,PRICE_MISSyPRICE_OUTcomo{{variables}}. Peak tiene 0.006 / 0.30 / 1.20; off-peak tiene 0.003 / 0.15 / 0.60. - Envía una vez y lee el
usage. DeepSeek divide la entrada enprompt_cache_hit_tokensyprompt_cache_miss_tokensjunto concompletion_tokens[VERIFICAR]. Guarda la solicitud como un caso de prueba. - Crea un escenario de prueba que afirme el comportamiento del caché. Encadena la solicitud guardada dos veces con la misma instrucción de sistema de 20K tokens. En el segundo paso, afirma que el campo de tokens de acierto es al menos 19,000 y que el costo calculado (aciertos ×
{{PRICE_HIT}}+ fallos ×{{PRICE_MISS}}+ salida ×{{PRICE_OUT}}, dividido por 1M) se mantiene dentro del presupuesto. Un fallo en el paso dos significa que el prefijo cambió, y la afirmación lo detecta antes de que lo haga la factura. - Compara las horas pico con las horas fuera de pico. Ejecuta el escenario en cada entorno y compara la línea de costos, o ejecútalo desde CI con
apidog-clien un horario que abarque un límite de horas pico UTC.
Descarga Apidog y todo el escenario, incluidos los entornos, funciona en el plan gratuito.
Cómo esto afecta tu factura
V4.1-Flash es más barato que V4-Flash en cada línea y entre un 70 y un 86% más barato que las tarifas de V4-Pro que reemplaza. Dos palancas importan: mantén tu prefijo largo byte a byte idéntico para que acierte en la caché, y programa el trabajo por lotes fuera de las siete horas pico de los días laborables. Luego, registra el usage en cada llamada, verifica el número de aciertos y deja que los números muestren si el recorte llegó a tu factura.
