DeepSeek-V4.1-Flash estuvo disponible de forma general en la API hoy, 10 de septiembre de 2026. La nota de lanzamiento es breve, pero cambia tres cosas para cualquiera que utilice la API de DeepSeek: hay un único ID de modelo para usar a partir de ahora, deepseek-flash; las tarifas por token volvieron a bajar; y en cuatro días, el 14 de septiembre, cada solicitud a deepseek-v4-pro será redirigida a este modelo y facturada a precios Flash.
Ese último punto es la razón por la que existe esta guía. Si tienes código de producción en V4-Pro, no puedes elegir una fecha de migración. Si estás en V4-Flash, ya estás siendo atendido por el nuevo modelo bajo el nombre antiguo. De cualquier manera, vale la pena revisar los parámetros que envías hoy.
Esta publicación cubre el lado práctico: ID del modelo, URLs base, una primera llamada en tres idiomas, esfuerzo de razonamiento, entrada de imágenes, streaming y precios. Para la historia de la arquitectura y los benchmarks, lee primero Qué es DeepSeek-V4.1-Flash.
Antes de integrar cualquier cosa en el código, querrás una forma rápida de enviar solicitudes y comparar respuestas. Apidog se encarga de eso: apúntalo a https://api.deepseek.com, guarda la clave como una variable y guarda cada llamada funcional como una prueba que se puede volver a ejecutar. El flujo de trabajo se encuentra cerca del final.
TL;DR
- ID del modelo:
deepseek-flash. Los nombres antiguosdeepseek-v4-flashydeepseek-v4-flash-vision-expsiguen funcionando pero se resuelven a V4.1-Flash. - URLs base sin cambios:
https://api.deepseek.com(compatible con OpenAI) yhttps://api.deepseek.com/anthropic(compatible con Anthropic). deepseek-v4-prose redirige a V4.1-Flash el 14 de septiembre de 2026 a las 04:00 UTC.- Contexto 1M tokens, salida máxima 384K, límite de concurrencia 2.500.
- Precios fuera de pico por 1M de tokens: $0.003 acierto de caché, $0.15 fallo de caché, $0.60 salida. El precio en pico es el doble.
- La visión es nativa. Las imágenes van en el array
contentcomo partes deimage_url.
Qué cambió para los usuarios de la API
Aquí está el delta, extraído de la nota de lanzamiento y el registro de cambios.
Un ID de modelo. El nombre canónico ahora es deepseek-flash, sin versión. Fija tus prompts y pruebas al comportamiento, no a una cadena de versión, porque la próxima versión de Flash se lanzará bajo el mismo nombre.
Los nombres antiguos aún se enrutan. deepseek-v4-flash y deepseek-v4-flash-vision-exp se aceptan por ahora, pero los modelos detrás de ellos, V4-Flash y V4-Flash-Vision-Exp, están retirados. Las solicitudes a esos nombres son atendidas por V4.1-Flash. Nada se rompe, pero no estás ejecutando el modelo que crees. Renombra cuando puedas.
El nombre beta ha desaparecido. La beta de dos días del 8 de septiembre se ejecutó como deepseek-v4.1-flash-expires-on-0910. Expiró según lo prometido. Cambia a deepseek-flash.
Las URLs base y los formatos no han cambiado. Las llamadas compatibles con OpenAI van a https://api.deepseek.com, las llamadas compatibles con Anthropic van a https://api.deepseek.com/anthropic, y el formato de la API de Respuestas que la línea Flash ya soportaba se mantiene. Tu configuración de SDK no se mueve.
V4-Pro tiene cuatro días. A partir del 14 de septiembre de 2026 a las 04:00 UTC (12:00 Beijing), cada solicitud a deepseek-v4-pro se enrutará a V4.1-Flash y se facturará a las tarifas de V4.1-Flash. La razón declarada por DeepSeek es que V4.1-Flash “ha superado exhaustivamente a V4 Pro en rendimiento, costo, velocidad y tiempo total”, citando pruebas de múltiples partes. Esa es una afirmación del proveedor. La guía de migración para la retirada de V4-Pro muestra cómo verificarlo con tus propios prompts antes de que se realice el cambio.
Paso 1: obtén una clave
Inicia sesión en la plataforma DeepSeek, abre API Keys y crea una. Las claves comienzan con sk-. Exporala en lugar de pegarla en el código fuente:
export DEEPSEEK_API_KEY="sk-your-key-here"
No se necesita un SDK específico de DeepSeek. Las bibliotecas cliente de OpenAI y Anthropic funcionan una vez que cambias la URL base.
Paso 2: haz tu primera llamada
Primero con curl, porque elimina todas las variables excepto la propia API:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-flash",
"messages": [
{"role": "system", "content": "You are a support engineer for a payments API."},
{"role": "user", "content": "A customer gets HTTP 402 on /v1/charges. List the three most likely causes."}
],
"stream": false
}'
La misma llamada a través del SDK de Python de OpenAI:
# pip install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash",
messages=[
{"role": "system", "content": "You are a support engineer for a payments API."},
{"role": "user", "content": "A customer gets HTTP 402 on /v1/charges. List the three most likely causes."},
],
)
print(response.choices[0].message.content)
Y Node:
// npm install openai
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await client.chat.completions.create({
model: "deepseek-flash",
messages: [
{ role: "user", content: "Write a Postgres migration that adds a nullable refunded_at timestamp to invoices." },
],
});
console.log(completion.choices[0].message.content);
Si te configuraste con la versión anterior siguiendo la guía de la API V4-Flash, la única diferencia es la cadena del modelo.
Paso 3: esfuerzo de razonamiento y modo de pensamiento
La ficha del modelo describe el esfuerzo de razonamiento como “continuamente controlable” en una escala de 1 a 100. Esto se aparta de los preajustes bajo/medio/alto que la mayoría de las APIs exponen, y significa que puedes ajustar el costo y la latencia por endpoint en lugar de por nivel.
La forma del parámetro que lleva ese valor de 1 a 100 es [VERIFICAR] contra la documentación de la API. Hasta que lo confirmen, comienza desde el patrón V4-Flash: reasoning_effort más un objeto thinking pasado a través de extra_body:
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Our Redis cluster drops 2% of SETs under load. Plan the investigation."}],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}},
)
Configuración de muestreo recomendada de la ficha del modelo: temperature 1.0, top_p 0.95 o 1.0, y max_tokens de 256K o más para rastros de razonamiento largos. La salida máxima es de 384K tokens.
Una división práctica: pensamiento desactivado para autocompletar, clasificación y cualquier cosa que un usuario esté esperando; pensamiento activado con alto esfuerzo para bucles de agente, refactorizaciones de múltiples archivos y depuración. Luego mide. El esfuerzo que no puedes ver en la salida es un esfuerzo que de todos modos estás pagando.
Paso 4: envía una imagen
V4.1-Flash es multimodal de forma nativa, entrenado en un corpus multimodal de 45T tokens con un codificador DeepSeek-ViT entrenado desde cero. El formato de solicitud se hereda de V4-Flash-Vision-Exp: las imágenes son partes del array content del mensaje del usuario.
response = client.chat.completions.create(
model="deepseek-flash",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extract every line item and the total from this receipt as JSON."},
{"type": "image_url", "image_url": {"url": "https://cdn.example-shop.com/receipts/48213.png"}},
],
}],
)
Para un archivo local, codifícalo como una URL de datos base64:
import base64
with open("receipt.png", "rb") as f:
data_url = "data:image/png;base64," + base64.b64encode(f.read()).decode()
# then pass {"url": data_url} in the image_url part
Límites: URLs de datos base64 de hasta 32 MiB, URLs externas de hasta 8.192 caracteres, o un ID de archivo. Se acepta un campo opcional detail. DeepSeek informa DocVQA 95.6, que es el caso de lectura de documentos mencionado. La guía de la API de visión cubre los prompts con múltiples imágenes, los niveles de detalle y el costo de las imágenes por solicitud.
Paso 5: transmite la respuesta
Establece stream=True y el endpoint devolverá eventos enviados por el servidor. El contenido del razonamiento y el contenido de la respuesta llegan como deltas separados, lo que es importante cuando estás renderizando un estado de “pensando” en una interfaz de usuario.
stream = client.chat.completions.create(
model="deepseek-flash",
messages=[{"role": "user", "content": "Explain idempotency keys in one paragraph."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta
if delta.content:
print(delta.content, end="", flush=True)
Si SSE es nuevo para ti, la transmisión de respuestas LLM con eventos enviados por el servidor explica el formato de la conexión y los casos extremos de reconexión.
Precios de un vistazo
Desde la página oficial de precios, efectivo a partir del 10 de septiembre de 2026 a las 04:00 UTC, en USD por 1M de tokens:
| deepseek-flash fuera de pico | deepseek-flash pico | |
|---|---|---|
| Entrada, acierto de caché | $0.003 | $0.006 |
| Entrada, fallo de caché | $0.15 | $0.30 |
| Salida | $0.60 | $1.20 |
Tres cosas que debes saber:
- Horarios pico son de lunes a viernes, de 01:00 a 04:00 y de 06:00 a 10:00 UTC (9:00 a 12:00 y 14:00 a 18:00 Beijing). Fuera de pico es la mitad de precio. Los trabajos por lotes que puedan esperar deberían esperar.
- Los aciertos de caché son automáticos. Un acierto cuesta 50 veces menos que un fallo, por lo que un prompt de sistema estable al inicio de cada solicitud es la optimización más barata disponible. Qué es el almacenamiento en caché de prompts explica cómo funciona la coincidencia de prefijos.
- Frente a V4-Flash, el recorte es de aproximadamente un 57% en la entrada con acierto de caché, un 32% en la entrada con fallo de caché y un 9% en la salida. Una carga de trabajo de V4-Pro redirigida el 14 de septiembre paga $0.30 en lugar de $1.32 por 1M de entrada con fallo de caché en pico, y $1.20 en lugar de $3.96 por salida.
Prueba la API en Apidog
Una vez que la primera llamada funciona, la pregunta es si seguirá funcionando. deepseek-flash no lleva versión, por lo que la próxima actualización será silenciosa. Aquí tienes un flujo de trabajo de Apidog que lo detecta:

- Añade el endpoint. Crea
POST https://api.deepseek.com/chat/completions, o importa una especificación OpenAPI compatible con OpenAI para que todas las rutas lleguen a la vez. - Guarda la clave como una variable de entorno. Coloca
DEEPSEEK_API_KEYen un entorno de Apidog y establece el encabezado enBearer {{DEEPSEEK_API_KEY}}. Cambiar entre una clave personal y la clave de producción se convierte en un desplegable. - Guarda una solicitud por nivel de esfuerzo. Duplica la solicitud base en variantes: pensamiento desactivado, pensamiento activado con bajo esfuerzo, pensamiento activado con alto esfuerzo. Mismo prompt, diferentes parámetros. Envía las tres y compara el uso de tokens y la latencia lado a lado.
- Observa el stream. Para
stream: true, Apidog renderiza los eventos SSE a medida que llegan, por lo que los deltas de razonamiento y los deltas de contenido aparecen como líneas separadas en lugar de una pared de prefijosdata:. - Convierte las variantes en un escenario de prueba. Añade aserciones sobre el código de estado, sobre el recuento de aciertos de caché en
usagesiendo superior a cero en la segunda ejecución, y sobre la respuesta que contiene los campos que tu aplicación analiza. Vuelve a ejecutar el escenario después de cada actualización del modelo, y el 14 de septiembre cuando la redirección de V4-Pro se active. - Ejecútalo en CI.
apidog-cliejecuta el mismo escenario desde una pipeline, por lo que un cambio de modelo silencioso falla una compilación en lugar de afectar a un cliente.
Descarga Apidog y toda la configuración toma unos diez minutos.
Preguntas frecuentes
- ¿**Tengo que renombrar
deepseek-v4-flashadeepseek-flash?** Hoy no. El nombre antiguo todavía redirige a V4.1-Flash. Pero V4-Flash en sí está retirado, y DeepSeek no ha dicho cuándo desaparecerá el alias. Renombra en tu próximo despliegue. - ¿**Qué pasa con mi código V4-Pro el 14 de septiembre?** Nada se rompe. Las solicitudes a
deepseek-v4-proserán respondidas por V4.1-Flash y facturadas a tarifas Flash a partir de las 04:00 UTC. Sin embargo, tus salidas pueden cambiar, así que ejecuta tu conjunto de evaluación antes de esa fecha. La guía de migración tiene una lista de verificación. - ¿**El endpoint compatible con Anthropic soporta el nuevo modelo?** Sí.
https://api.deepseek.com/anthropicno ha cambiado; usadeepseek-flashcomo el nombre del modelo allí también. - ¿**Hay una capa gratuita?** La API es de pago por uso sin una capa gratuita permanente. Los pesos tienen licencia MIT en Hugging Face si deseas autoalojarte. Las opciones actuales se recopilan en cómo usar la API de DeepSeek V4 de forma gratuita.
- ¿**Qué tan rápido es?** DeepSeek no ha publicado una cifra de tokens por segundo. Un usuario de X informó “casi 400 t/s” en pruebas de video, lo cual es una anécdota, no una especificación. Mide con tus propios prompts durante una ventana de pico.
Antes de la redirección
La superficie de la API apenas se movió: las mismas URLs base, el mismo formato de solicitud, un nuevo ID de modelo. Lo que sí se movió fue el precio y, el 14 de septiembre, la redirección de cada llamada a V4-Pro. Renombra deepseek-v4-flash a deepseek-flash, elige un nivel de esfuerzo por endpoint y ejecuta tus prompts a través del nuevo modelo antes de que DeepSeek lo haga por ti.
Guarda esos prompts como pruebas mientras lo haces. Apidog los vuelve a ejecutar con un solo clic, y la próxima actualización silenciosa de Flash aparecerá como una aserción fallida en lugar de un ticket de soporte.
