Precios de DeepSeek-V4.1-Flash Explicados: Tarifas en Horas Punta y Valle, y el Cálculo de Aciertos de Caché

La tabla de precios completa en USD y CNY para deepseek-flash, los recortes porcentuales frente a V4-Flash y la redirección de V4-Pro, las ventanas de horas punta convertidas a su zona horaria, y dos ejemplos de aciertos de caché con la aritmética mostrada.

Medy Evrard

10 September 2026

Precios de DeepSeek-V4.1-Flash Explicados: Tarifas en Horas Punta y Valle, y el Cálculo de Aciertos de Caché

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

DeepSeek-V4.1-Flash estuvo disponible en la API el 10 de septiembre de 2026, y la nota de lanzamiento vino acompañada de un recorte de precios. La entrada con acierto de caché ahora cuesta $0.003 por millón de tokens fuera de horas pico, la entrada con fallo de caché $0.15, la salida $0.60. Cuatro días después, el 14 de septiembre, DeepSeek comienza a enrutar cada solicitud de deepseek-v4-pro a V4.1-Flash y la factura con tarifas Flash. Si ejecutas algo en la API de DeepSeek, tu factura cambia esta semana, toques tu código o no.

Esta publicación es la mitad de la historia sobre precios: las tablas completas en USD y CNY, los cambios porcentuales frente a V4-Flash y V4-Pro, dónde caen las ventanas de horas pico en tu zona horaria, y dos ejemplos de aciertos de caché con la aritmética mostrada. Para el modelo en sí, comienza con qué es DeepSeek-V4.1-Flash.

Una advertencia de antemano. Cada número de referencia en este grupo es una cifra reportada por DeepSeek de la tarjeta del modelo. Los precios provienen de la página de precios, verificados el 10 de septiembre. La última sección muestra cómo medir tu propio gasto con Apidog leyendo el bloque usage en cada respuesta en lugar de confiar en una estimación.

botón

En resumen

La tabla de precios completa

Todas las cifras son por 1M de tokens, efectivas a partir del 10 de septiembre de 2026 a las 04:00 UTC.

deepseek-flash fuera de horas pico deepseek-flash horas pico deepseek-v4-pro fuera de horas pico deepseek-v4-pro horas pico
Entrada, acierto de caché $0.003 $0.006 $0.022 $0.044
Entrada, fallo de caché $0.15 $0.30 $0.66 $1.32
Salida $0.60 $1.20 $1.98 $3.96
Concurrencia 2,500 2,500 500 500

Las columnas de deepseek-v4-pro importan durante cuatro días más. A partir del 14 de septiembre a las 04:00 UTC (12:00 Beijing), las solicitudes a ese nombre de modelo son atendidas por V4.1-Flash y facturadas según las dos primeras columnas. La guía de retiro y migración de V4-Pro cubre lo que hay que probar antes de esa fecha.

Si tu cuenta se liquida en yuanes, la página de precios en zh-cn lista deepseek-flash como:

Fuera de horas pico (CNY) Horas pico (CNY)
Entrada, acierto de caché ¥0.02 ¥0.04
Entrada, fallo de caché ¥1.00 ¥2.00
Salida ¥4.00 ¥8.00

Cada fila en CNY es la fila en USD multiplicada por aproximadamente 6.67. Dos detalles que la tabla omite: el almacenamiento en caché de contexto es automático, sin necesidad de configurar ninguna bandera, y la ID del modelo ahora es deepseek-flash. Los nombres antiguos deepseek-v4-flash y deepseek-v4-flash-vision-exp todavía se resuelven pero se dirigen a V4.1-Flash con estas tarifas.

Qué cambió frente a V4-Flash y V4-Pro

El 21 de agosto de 2026, deepseek-v4-flash facturaba $0.007 / $0.22 / $0.66 fuera de horas pico (acierto de caché / fallo de caché / salida) y $0.014 / $0.44 / $1.32 en horas pico. El registro de cambios dice que el precio fue "reducido en consecuencia" con este lanzamiento. Esto es lo que "en consecuencia" significa, calculado a partir de las dos listas:

Elemento V4-Flash (21 de agosto) V4.1-Flash (10 de septiembre) Recorte
Acierto de caché, fuera de horas pico $0.007 $0.003 57%
Fallo de caché, fuera de horas pico $0.22 $0.15 32%
Salida, fuera de horas pico $0.66 $0.60 9%

Las filas de horas pico tienen porcentajes idénticos, ya que ambas listas se duplican en horas pico. El patrón es deliberado: el recorte más pronunciado se aplica a los aciertos de caché, el más pequeño a la salida. DeepSeek está poniendo precio para bucles de agente que releen un prefijo largo en cada turno, y el caché KV FP4 en V4.1 (890 bytes por token, aproximadamente un cuarto de la huella de V4-Flash) es lo que hace que un precio de acierto de $0.003 sea sostenible por su parte.

Para los usuarios de V4-Pro, los números son mayores, porque la redirección se produce a tarifas Flash:

DeepSeek afirma que V4.1-Flash "ha superado ampliamente a V4 Pro en rendimiento, costo, velocidad y tiempo total", una afirmación que debe verificarse con tus propias instrucciones antes del día 14. Para el arco más largo de la fijación de precios de la familia, incluido el período en que DeepSeek aumentó los precios de la API, el desglose de precios de la API DeepSeek V4 tiene la historia.

Ventanas de horas pico en tu zona horaria

Las horas pico se aplican solo de lunes a viernes, en dos bloques: de 01:00 a 04:00 UTC y de 06:00 a 10:00 UTC. Esto es de 9:00 a 12:00 y de 14:00 a 18:00 hora de Beijing. Siete horas pico por día laborable, 35 por semana, por lo que las horas pico cubren aproximadamente el 21% de las 168 horas de la semana. Todo lo demás, incluyendo todo el sábado y el domingo, se factura a la tarifa fuera de horas pico.

Ventana UTC Beijing (UTC+8) Pacífico de EE. UU. (PDT, UTC-7) Europa Central (CEST, UTC+2)
Pico 1 01:00 a 04:00 09:00 a 12:00 18:00 a 21:00 (tarde anterior) 03:00 a 06:00
Pico 2 06:00 a 10:00 14:00 a 18:00 23:00 a 03:00 (durante la noche) 08:00 a 12:00

Las columnas del Pacífico y Europa Central utilizan el horario de verano. Después del cambio de hora (25 de octubre en la UE, 1 de noviembre en EE. UU.), desplaza ambas columnas una hora antes. Los límites UTC nunca se mueven.

Un día laborable en la costa oeste de EE. UU. nunca coincide con un bloque de horas pico. Una mañana en Europa Central se encuentra dentro del Pico 2, y un lote nocturno europeo a las 03:00 hora local paga el doble; moverlo a las 23:00 CEST (21:00 UTC) lo vuelve a poner a mitad de precio.

Matemáticas de acierto de caché, resueltas dos veces

Un acierto cuesta 1/50 de un fallo ($0.003 frente a $0.15), por lo que la proporción entre el prefijo repetido y los tokens nuevos decide el costo de tu entrada más que el número bruto de tokens. Si el almacenamiento en caché de prefijos es nuevo para ti, el manual de almacenamiento en caché de instrucciones explica lo que cuenta como prefijo almacenable en caché: bytes idénticos al inicio de la solicitud.

Ejemplo 1: un bucle de agente con una instrucción de sistema de 20K tokens, 1,000 llamadas en horas pico.

Un agente de clasificación de soporte lleva una instrucción de sistema de 20,000 tokens (políticas, esquemas de herramientas, ejemplos de pocas tomas), lee 2,000 tokens nuevos de texto de tickets por llamada y escribe 1,000 tokens de salida. Durante 1,000 llamadas:

  1. La entrada total es 1,000 × 22,000 = 22M tokens. La salida total es 1M tokens.
  2. La primera llamada falla en todos los 22,000 tokens. Cada llamada posterior acierta en el prefijo de 20,000 tokens y falla en sus 2,000 tokens nuevos.
  3. Tokens de acierto: 999 × 20,000 = 19.98M. A $0.006 por 1M: 19.98 × 0.006 = $0.12.
  4. Tokens de fallo: 22,000 + 999 × 2,000 = 2.02M. A $0.30 por 1M: 2.02 × 0.30 = $0.61.
  5. Salida: 1M × $1.20 = $1.20.
  6. Total: $0.12 + $0.61 + $1.20 = $1.93.

Sin caché, solo la entrada sería 22 × $0.30 = $6.60 y el trabajo costaría $7.80. El almacenamiento en caché elimina el 75% de la factura. Ejecuta el mismo bucle fuera de las horas pico y cada línea se reduce a la mitad: $0.06 + $0.30 + $0.60 = $0.96.

Las mismas 1,000 llamadas en V4-Pro en horas pico (aciertos $0.88, fallos $2.67, salida $3.96) suman $7.51, el número que un cliente Pro debería comparar con $1.93 cuando se realice la redirección.

Ejemplo 2: un trabajo por lotes con 10M tokens de salida, movido fuera de horas pico.

Un equipo de catálogo genera 10,000 descripciones de productos. Cada llamada envía 1,500 tokens de datos de producto (únicos por artículo, por lo que no hay beneficio de caché) y recibe 1,000 tokens de copia. Esto son 15M tokens de entrada, todos fallos, y 10M tokens de salida.

  1. En horas pico: entrada 15 × $0.30 = $4.50. Salida 10 × $1.20 = $12.00. Total $16.50.
  2. Fuera de horas pico: entrada 15 × $0.15 = $2.25. Salida 10 × $0.60 = $6.00. Total $8.25.
  3. Ahorros solo por la marca de tiempo: $8.25, sin cambios en las instrucciones.

La salida domina este trabajo y obtuvo el recorte más pequeño en el lanzamiento, por lo que la ventana fuera de horas pico es la mayor palanca. Es una ventana generosa: 15 horas cada día laborable a partir de las 10:00 UTC, más 48 horas ininterrumpidas cada fin de semana.

Contexto, salida y por qué la concurrencia es parte del precio

Ambos nombres de modelo tienen un contexto de 1M de tokens y una salida máxima de 384K de tokens. La tarjeta del modelo recomienda un máximo de 256K tokens o más, así que establece ese límite a propósito: una respuesta que llega a 384K tokens de salida cuesta $0.46 en horas pico, lo cual está bien para una transcripción de agente y un error para el autocompletado.

La concurrencia es de 2,500 para Flash frente a 500 para Pro. Pertenece a un artículo de precios porque el descuento fuera de horas pico solo vale algo si puedes hacer el trabajo dentro de la ventana, y porque el tráfico de deepseek-v4-pro redirigido el 14 de septiembre hereda el límite de Flash: una integración Pro que solía hacer cola detrás de 500 ranuras obtiene cinco veces más margen sin un cambio de configuración.

Mide el gasto real con Apidog

Las tablas de precios te dicen la tarifa. El objeto usage en cada respuesta te dice por qué se te cobró. Aquí tienes un flujo de trabajo de Apidog que lo convierte en una verificación repetible.

  1. Añade el endpoint. Crea POST https://api.deepseek.com/chat/completions, o importa una especificación OpenAPI compatible con OpenAI.
  2. Coloca los precios en los entornos. Crea dos entornos de Apidog, deepseek-peak y deepseek-offpeak, cada uno con DEEPSEEK_API_KEY más PRICE_HIT, PRICE_MISS y PRICE_OUT como {{variables}}. Peak tiene 0.006 / 0.30 / 1.20; off-peak tiene 0.003 / 0.15 / 0.60.
  3. Envía una vez y lee el usage. DeepSeek divide la entrada en prompt_cache_hit_tokens y prompt_cache_miss_tokens junto con completion_tokens [VERIFICAR]. Guarda la solicitud como un caso de prueba.
  4. Crea un escenario de prueba que afirme el comportamiento del caché. Encadena la solicitud guardada dos veces con la misma instrucción de sistema de 20K tokens. En el segundo paso, afirma que el campo de tokens de acierto es al menos 19,000 y que el costo calculado (aciertos × {{PRICE_HIT}} + fallos × {{PRICE_MISS}} + salida × {{PRICE_OUT}}, dividido por 1M) se mantiene dentro del presupuesto. Un fallo en el paso dos significa que el prefijo cambió, y la afirmación lo detecta antes de que lo haga la factura.
  5. Compara las horas pico con las horas fuera de pico. Ejecuta el escenario en cada entorno y compara la línea de costos, o ejecútalo desde CI con apidog-cli en un horario que abarque un límite de horas pico UTC.

Descarga Apidog y todo el escenario, incluidos los entornos, funciona en el plan gratuito.

Cómo esto afecta tu factura

V4.1-Flash es más barato que V4-Flash en cada línea y entre un 70 y un 86% más barato que las tarifas de V4-Pro que reemplaza. Dos palancas importan: mantén tu prefijo largo byte a byte idéntico para que acierte en la caché, y programa el trabajo por lotes fuera de las siete horas pico de los días laborables. Luego, registra el usage en cada llamada, verifica el número de aciertos y deja que los números muestren si el recorte llegó a tu factura.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs