DeepSeek dio a los usuarios de deepseek-v4-pro cuatro días. El 14 de septiembre de 2026 a las 04:00 UTC (12:00 Beijing), cada solicitud que nombre a deepseek-v4-pro será enrutada a DeepSeek-V4.1-Flash y facturada a las tarifas de V4.1-Flash. Nada falla. Nada advierte. Su factura disminuye y un modelo diferente comienza a responder a sus solicitudes.
Esa última parte es la que hay que planificar. La nota de lanzamiento enmarca el cambio como una actualización, y según los propios números de DeepSeek, lo es. Pero "redirigido silenciosamente" no es lo mismo que "probado". Si su producto depende de una forma particular de llamada a herramienta o de un presupuesto de latencia que ajustó contra V4-Pro, querrá saber qué cambia antes del domingo, no después.
Esta guía cubre lo que DeepSeek anunció, qué sucede si no hace nada, una lista de verificación de migración y una forma de construir una suite de regresión Pro versus Flash en Apidog para que el cambio sea un evento sin incidentes. Para el modelo en sí, lea qué es DeepSeek-V4.1-Flash primero.
En resumen
- Cambio: 14 de septiembre de 2026, 04:00 UTC. Las solicitudes de
deepseek-v4-provan a V4.1-Flash desde ese momento. - Sus llamadas no fallarán y no pagará precios de Pro. El costo de entrada por caché no encontrada baja de $1.32 a $0.30 por 1 millón de tokens (77% menos); la salida baja de $3.96 a $1.20 (70% menos).
- Cambie el nombre del ID del modelo a
deepseek-flashusted mismo, luego vuelva a probar las llamadas a funciones, la salida estructurada, el streaming y el esfuerzo de razonamiento. - DeepSeek dice que V4.1-Flash supera a V4-Pro en todos los benchmarks listados. Esos son números del proveedor. Ejecute sus propias evaluaciones.
Lo que DeepSeek anunció el 10 de septiembre
La entrada del registro de cambios del 10 de septiembre cubre dos cosas: el lanzamiento general de V4.1-Flash en la API y el retiro de V4-Pro cuatro días después.

Sobre V4-Pro, la redacción es directa. DeepSeek dice que V4.1-Flash "ha superado completamente a V4 Pro en rendimiento, costo, velocidad y tiempo total", citando "pruebas realizadas por múltiples partes". A partir del 14 de septiembre a las 04:00 UTC, las solicitudes a deepseek-v4-pro serán atendidas por V4.1-Flash y se facturarán como V4.1-Flash. No hay un período de gracia donde Pro siga funcionando bajo un nombre antiguo.
La limpieza de nombres va más allá de Pro:
| Nombre del modelo | Estado después del 10 de septiembre |
|---|---|
deepseek-flash |
Nuevo ID canónico para V4.1-Flash |
deepseek-v4-flash |
Todavía aceptado, atendido por V4.1-Flash |
deepseek-v4-flash-vision-exp |
Todavía aceptado, atendido por V4.1-Flash |
deepseek-v4-pro |
Atendido por V4-Pro hasta el 14 de septiembre 04:00 UTC, luego redirigido a V4.1-Flash |
V4-Flash y V4-Flash-Vision-Exp como modelos están retirados; solo sus nombres perduran como alias. Las URL base no se mueven: https://api.deepseek.com para el formato compatible con OpenAI y https://api.deepseek.com/anthropic para el compatible con Anthropic. El manual para la API de V4.1-Flash cubre el nuevo ID del modelo, el control de razonamiento y la entrada de imágenes en detalle.
Qué sucede si no hace nada
Versión corta: su integración sigue funcionando y se vuelve más barata. Versión larga: cinco cosas cambian sin que usted haga nada.
Un modelo diferente responde. V4.1-Flash es un MoE de 552B parámetros con un nuevo diseño de Codificador-Decodificador Causal: 40 capas, 20 codificadores y 20 decodificadores, 8B parámetros activos durante el prellenado y 16B durante la decodificación. Sus prompts ahora alcanzan un presupuesto de parámetros activos diferente y un diseño de atención diferente (Atención Esparsa Comprimida 2). Espere un fraseo diferente, una verbosidad predeterminada diferente y, ocasionalmente, decisiones diferentes en llamadas a herramientas limítrofes.
El límite de salida es el mismo, la configuración recomendada no lo es. Ambos modelos listan un contexto de 1M y una salida máxima de 384K. La tarjeta de modelo de V4.1-Flash recomienda una temperatura de 1.0, top_p de 0.95 o 1.0, y un máximo de tokens de 256K o más. Si estableció un max_tokens estricto en V4-Pro para limitar el costo, verifique si la salida de razonamiento ahora se trunca antes de que llegue la respuesta.
El esfuerzo de razonamiento funciona en una escala diferente. DeepSeek describe el esfuerzo de razonamiento de V4.1-Flash como "continuamente controlable" en una escala de 1 a 100. V4-Flash aceptaba reasoning_effort más extra_body={"thinking": {"type": "enabled"}}. Cómo se mapea la escala de 1 a 100 al parámetro de la API es [VERIFICAR] contra la documentación actual; no asuma que un nivel nombrado como "high" significa la profundidad que tenía en Pro.
Los precios cambian a su favor, con una ventana de horas pico. Las horas pico son de lunes a viernes, de 01:00 a 04:00 y de 06:00 a 10:00 UTC. Las horas valle son la mitad de las horas pico. El tráfico Pro redirigido paga tarifas Flash en ambas ventanas.
El margen de concurrencia aumenta. El límite de V4-Pro era de 500 solicitudes concurrentes. El de Flash es de 2,500. El tráfico redirigido hereda el límite más alto, así que revise cualquier retroceso del lado del cliente ajustado a 500.
Lista de verificación de migración
Haga esto en orden. Juntos, convierten una redirección silenciosa en un lanzamiento deliberado.
- Cambie el nombre del ID del modelo. Busque en su código base y configuración
deepseek-v4-proy reemplácelo condeepseek-flash. Haga esto aunque el alias siga resolviendo: los ID explícitos facilitan la lectura de incidentes más adelante.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash", # era "deepseek-v4-pro"
messages=[
{"role": "system", "content": "You triage support tickets. Return a JSON object with priority, team, and summary."},
{"role": "user", "content": "Customer reports checkout returns 502 after applying a discount code."},
],
response_format={"type": "json_object"},
)
print(response.choices[0].message.content)
- Revise la configuración del esfuerzo de razonamiento. Enumere todos los lugares donde configuró
reasoning_efforto un interruptor de pensamiento. Decida por endpoint si desea profundidad o latencia, luego pruebe cada uno con la nueva escala en lugar de llevar el valor antiguo. - Vuelva a ejecutar las pruebas de llamadas a funciones y salida estructurada. El formato de los argumentos de las llamadas a herramientas es donde los cambios de modelo golpean más fuerte. Si escribió pruebas cuando configuró las llamadas a funciones en V4-Pro, ejecútelas ahora contra
deepseek-flash. Si no lo hizo, el flujo de trabajo de Apidog a continuación le ofrece un conjunto. - Verifique sus analizadores de streaming. V4.1-Flash transmite los deltas de razonamiento y los deltas de respuesta por separado en modo de pensamiento. Confirme que su manejador SSE no los concatena y que su temporizador de "primer token" mide lo que usted cree que mide.
- Vuelva a establecer la latencia y el costo. Registre la latencia p50 y p95 más los tokens por solicitud en V4-Pro esta semana, luego lo mismo en
deepseek-flash. Necesitará ambos números cuando alguien pregunte por qué el panel se movió el lunes. - Actualice los paneles y presupuestos. Las alertas de costos calibradas a $3.96 de salida en pico se silenciarán una vez que esté pagando $1.20, y un presupuesto que nunca se activa es uno que nadie mira. Restablezca los umbrales a las tarifas en la página de precios y corrija cualquier desglose por modelo que filtre por el ID antiguo.
Si utiliza los formatos de API compatibles con Anthropic o de respuestas en lugar de las completaciones de chat, se aplican los mismos pasos; la comparación de formatos de API de V4-Pro muestra cómo es cada solicitud para que pueda mapear los campos.
V4-Pro vs V4.1-Flash de un vistazo
Las cifras de los benchmarks son las reportadas por DeepSeek, de la tarjeta de modelo de V4.1-Flash. Los precios son en USD por 1 millón de tokens, efectivos el 10 de septiembre de 2026.
| deepseek-v4-pro | deepseek-flash (V4.1) | |
|---|---|---|
| Parámetros activos | No se indicó en la tarjeta V4.1 | 8B prellenado / 16B decodificación |
| HumanEval | 76.8 | 79.4 |
| GSM8K | 92.6 | 93.0 |
| DeepSWE v1.1 | 62.7 | 74.2 |
| Terminal-Bench 2.1 | 87.9 | 90.6 |
| Entrada, caché acertada (horas valle / pico) | $0.022 / $0.044 | $0.003 / $0.006 |
| Entrada, caché fallida (horas valle / pico) | $0.66 / $1.32 | $0.15 / $0.30 |
| Salida (horas valle / pico) | $1.98 / $3.96 | $0.60 / $1.20 |
| Contexto / salida máxima | 1M / 384K | 1M / 384K |
| Límite de concurrencia | 500 | 2,500 |
La mayor diferencia es DeepSWE, con 11.5 puntos de aumento. La más pequeña es GSM8K, con 0.4. Si su carga de trabajo se parece a las matemáticas de primaria, espere paridad; si se parece a ediciones de código multificheros, los números de DeepSeek dicen que usted gana. El desglose de tres vías incluyendo V4-Flash está en V4.1-Flash vs V4-Pro vs V4-Flash.
El riesgo: los benchmarks del proveedor miden tareas del proveedor
Cada número de esa tabla proviene de DeepSeek. "Pruebas de múltiples partes" es la frase de DeepSeek, y las partes no se nombran en la nota de lanzamiento. Eso no significa que los números sean incorrectos. Significa que se midieron en suites de benchmarking, no en sus prompts, sus esquemas de herramientas o las entradas desordenadas de sus usuarios.
Un modelo puede obtener una puntuación más alta en Terminal-Bench y aun así cambiar la forma en que formatea un argumento de llamada a herramienta del que depende su analizador. Los tokens de salida más baratos no ayudan si el modelo escribe el doble. La única forma de saberlo es ejecutar su propio tráfico a través de ambos modelos mientras ambos existan. Tiene hasta el 14 de septiembre.
Construya una suite de regresión en Apidog antes del cambio
Aquí hay un flujo de trabajo en Apidog que le brinda una comparación repetible de Pro versus Flash y entrega la ejecución a CI.
- Importe sus solicitudes V4-Pro existentes. Importe una especificación OpenAPI compatible con OpenAI o pegue los comandos curl que usa en producción. Coloque
DEEPSEEK_API_KEYen un entorno y haga referencia a él comoBearer {{DEEPSEEK_API_KEY}}en el encabezado de autorización. Agregue una segunda variable,{{MODEL_ID}}, establecida endeepseek-v4-pro. - Duplique cada solicitud con
deepseek-flash. Establezca{{MODEL_ID}}endeepseek-flashen un segundo entorno, o codifique los dos ID en solicitudes emparejadas. Mismos prompts, mismo array de herramientas, mismomax_tokens. La única diferencia debería ser el modelo. - Agregue aserciones sobre la forma JSON y la estructura de la llamada a herramientas. Para la salida estructurada, afirme que
choices[0].message.contentse analiza como JSON y contiene las claves que espera. Para la llamada a funciones, afirme quechoices[0].message.tool_calls[0].function.namees igual a la herramienta que espera y queargumentsse analiza. Estas comprobaciones detectan desviaciones de formato silenciosas. - Ejecútelos ambos como un escenario de prueba. Encadene las solicitudes Pro y Flash en un único escenario para que cada ejecución produzca un informe. Incluya una solicitud de streaming con
stream: true; Apidog renderiza los eventos SSE uno por uno, para que pueda ver si los deltas de razonamiento y respuesta llegan de la manera que su analizador espera. - Compare los resultados. Compare las dos mitades del informe: tasa de aprobación de aserciones, tiempo de respuesta y
usage.completion_tokens. Un modelo que aprueba todas las aserciones pero emite un 40% más de tokens de salida cambia su cálculo de costos, y lo verá antes de que llegue la factura. - Prográmelo en CI con
apidog-cli. Ejecute el escenario desde su pipeline diariamente hasta el 14 de septiembre y manténgalo en ejecución después. Una vez que Pro desaparezca, la mitad de Pro también devolverá respuestas Flash y la diferencia se reducirá a cero: confirmación de que el cambio se realizó y sus aserciones aún son válidas.
Descargue Apidog para configurar esto. El flujo vive en un proyecto compartido, por lo que el propietario de la factura y el propietario de los prompts leen el mismo informe.
Preguntas frecuentes
¿Fallarán mis llamadas V4-Pro el 14 de septiembre? No. Las solicitudes que especifican deepseek-v4-pro se redirigen a V4.1-Flash. Recibirá una respuesta 200 y una respuesta de V4.1-Flash. El modo de fallo es de comportamiento, no un código de error.
¿Se me cobrarán los precios de V4-Pro después del cambio? No. Las solicitudes redirigidas se facturan a las tarifas de V4.1-Flash: en horas pico, $0.30 en lugar de $1.32 por 1M de tokens de entrada con caché fallida y $1.20 en lugar de $3.96 por 1M de tokens de salida.
¿Debo cambiar el ID a deepseek-flash o mantener deepseek-v4-pro? Cambie el nombre. El alias funciona, pero un ID explícito significa que sus registros, paneles y informes de costos indican lo que se está llamando.
¿Sigue siendo aplicable la configuración de V4-Pro-0813? La clave, la URL base y la forma de la solicitud de la guía de la API de V4-Pro-0813 se mantienen sin cambios. Lo que cambia es el modelo detrás de ellas y el control del esfuerzo de razonamiento, así que vuelva a probar en lugar de asumir.
¿Es V4.1-Flash peor que V4-Pro en algo? Los benchmarks publicados por DeepSeek muestran mejoras en todas las tareas listadas. Los resultados independientes no estaban disponibles en el momento de la publicación. Trate "no peor en nada" como una afirmación a probar.
Cuatro días son suficientes
La migración es un cambio de cadena más una ejecución de prueba. El cambio de cadena toma un minuto. La ejecución de prueba le indica si el modelo por el que pagará la próxima semana se comporta como el que usted diseñó. Construya la suite, ejecútela mientras deepseek-v4-pro todavía resuelve a Pro, y lea la diferencia. Si está limpia, obtendrá una factura un 70% más barata y cinco veces la concurrencia de forma gratuita. Si no lo está, lo descubrió según su horario, no el de DeepSeek.
