¿Cómo usar la API DeepSeek-V4.1-Flash?

Llamar a la API DeepSeek-V4.1-Flash: ID de modelo deepseek-flash, URLs base, primera llamada en curl/Python/Node, esfuerzo de razonamiento, entrada de imágenes, streaming, precios.

INEZA Felin-Michel

INEZA Felin-Michel

10 September 2026

¿Cómo usar la API DeepSeek-V4.1-Flash?

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

DeepSeek-V4.1-Flash estuvo disponible de forma general en la API hoy, 10 de septiembre de 2026. La nota de lanzamiento es breve, pero cambia tres cosas para cualquiera que utilice la API de DeepSeek: hay un único ID de modelo para usar a partir de ahora, deepseek-flash; las tarifas por token volvieron a bajar; y en cuatro días, el 14 de septiembre, cada solicitud a deepseek-v4-pro será redirigida a este modelo y facturada a precios Flash.

Ese último punto es la razón por la que existe esta guía. Si tienes código de producción en V4-Pro, no puedes elegir una fecha de migración. Si estás en V4-Flash, ya estás siendo atendido por el nuevo modelo bajo el nombre antiguo. De cualquier manera, vale la pena revisar los parámetros que envías hoy.

Esta publicación cubre el lado práctico: ID del modelo, URLs base, una primera llamada en tres idiomas, esfuerzo de razonamiento, entrada de imágenes, streaming y precios. Para la historia de la arquitectura y los benchmarks, lee primero Qué es DeepSeek-V4.1-Flash.

Antes de integrar cualquier cosa en el código, querrás una forma rápida de enviar solicitudes y comparar respuestas. Apidog se encarga de eso: apúntalo a https://api.deepseek.com, guarda la clave como una variable y guarda cada llamada funcional como una prueba que se puede volver a ejecutar. El flujo de trabajo se encuentra cerca del final.

botón

TL;DR

Qué cambió para los usuarios de la API

Aquí está el delta, extraído de la nota de lanzamiento y el registro de cambios.

Un ID de modelo. El nombre canónico ahora es deepseek-flash, sin versión. Fija tus prompts y pruebas al comportamiento, no a una cadena de versión, porque la próxima versión de Flash se lanzará bajo el mismo nombre.

Los nombres antiguos aún se enrutan. deepseek-v4-flash y deepseek-v4-flash-vision-exp se aceptan por ahora, pero los modelos detrás de ellos, V4-Flash y V4-Flash-Vision-Exp, están retirados. Las solicitudes a esos nombres son atendidas por V4.1-Flash. Nada se rompe, pero no estás ejecutando el modelo que crees. Renombra cuando puedas.

El nombre beta ha desaparecido. La beta de dos días del 8 de septiembre se ejecutó como deepseek-v4.1-flash-expires-on-0910. Expiró según lo prometido. Cambia a deepseek-flash.

Las URLs base y los formatos no han cambiado. Las llamadas compatibles con OpenAI van a https://api.deepseek.com, las llamadas compatibles con Anthropic van a https://api.deepseek.com/anthropic, y el formato de la API de Respuestas que la línea Flash ya soportaba se mantiene. Tu configuración de SDK no se mueve.

V4-Pro tiene cuatro días. A partir del 14 de septiembre de 2026 a las 04:00 UTC (12:00 Beijing), cada solicitud a deepseek-v4-pro se enrutará a V4.1-Flash y se facturará a las tarifas de V4.1-Flash. La razón declarada por DeepSeek es que V4.1-Flash “ha superado exhaustivamente a V4 Pro en rendimiento, costo, velocidad y tiempo total”, citando pruebas de múltiples partes. Esa es una afirmación del proveedor. La guía de migración para la retirada de V4-Pro muestra cómo verificarlo con tus propios prompts antes de que se realice el cambio.

Paso 1: obtén una clave

Inicia sesión en la plataforma DeepSeek, abre API Keys y crea una. Las claves comienzan con sk-. Exporala en lugar de pegarla en el código fuente:

export DEEPSEEK_API_KEY="sk-your-key-here"

No se necesita un SDK específico de DeepSeek. Las bibliotecas cliente de OpenAI y Anthropic funcionan una vez que cambias la URL base.

Paso 2: haz tu primera llamada

Primero con curl, porque elimina todas las variables excepto la propia API:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-flash",
    "messages": [
      {"role": "system", "content": "You are a support engineer for a payments API."},
      {"role": "user", "content": "A customer gets HTTP 402 on /v1/charges. List the three most likely causes."}
    ],
    "stream": false
  }'

La misma llamada a través del SDK de Python de OpenAI:

# pip install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {"role": "system", "content": "You are a support engineer for a payments API."},
        {"role": "user", "content": "A customer gets HTTP 402 on /v1/charges. List the three most likely causes."},
    ],
)

print(response.choices[0].message.content)

Y Node:

// npm install openai
import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await client.chat.completions.create({
  model: "deepseek-flash",
  messages: [
    { role: "user", content: "Write a Postgres migration that adds a nullable refunded_at timestamp to invoices." },
  ],
});

console.log(completion.choices[0].message.content);

Si te configuraste con la versión anterior siguiendo la guía de la API V4-Flash, la única diferencia es la cadena del modelo.

Paso 3: esfuerzo de razonamiento y modo de pensamiento

La ficha del modelo describe el esfuerzo de razonamiento como “continuamente controlable” en una escala de 1 a 100. Esto se aparta de los preajustes bajo/medio/alto que la mayoría de las APIs exponen, y significa que puedes ajustar el costo y la latencia por endpoint en lugar de por nivel.

La forma del parámetro que lleva ese valor de 1 a 100 es [VERIFICAR] contra la documentación de la API. Hasta que lo confirmen, comienza desde el patrón V4-Flash: reasoning_effort más un objeto thinking pasado a través de extra_body:

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Our Redis cluster drops 2% of SETs under load. Plan the investigation."}],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}},
)

Configuración de muestreo recomendada de la ficha del modelo: temperature 1.0, top_p 0.95 o 1.0, y max_tokens de 256K o más para rastros de razonamiento largos. La salida máxima es de 384K tokens.

Una división práctica: pensamiento desactivado para autocompletar, clasificación y cualquier cosa que un usuario esté esperando; pensamiento activado con alto esfuerzo para bucles de agente, refactorizaciones de múltiples archivos y depuración. Luego mide. El esfuerzo que no puedes ver en la salida es un esfuerzo que de todos modos estás pagando.

Paso 4: envía una imagen

V4.1-Flash es multimodal de forma nativa, entrenado en un corpus multimodal de 45T tokens con un codificador DeepSeek-ViT entrenado desde cero. El formato de solicitud se hereda de V4-Flash-Vision-Exp: las imágenes son partes del array content del mensaje del usuario.

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Extract every line item and the total from this receipt as JSON."},
            {"type": "image_url", "image_url": {"url": "https://cdn.example-shop.com/receipts/48213.png"}},
        ],
    }],
)

Para un archivo local, codifícalo como una URL de datos base64:

import base64

with open("receipt.png", "rb") as f:
    data_url = "data:image/png;base64," + base64.b64encode(f.read()).decode()

# then pass {"url": data_url} in the image_url part

Límites: URLs de datos base64 de hasta 32 MiB, URLs externas de hasta 8.192 caracteres, o un ID de archivo. Se acepta un campo opcional detail. DeepSeek informa DocVQA 95.6, que es el caso de lectura de documentos mencionado. La guía de la API de visión cubre los prompts con múltiples imágenes, los niveles de detalle y el costo de las imágenes por solicitud.

Paso 5: transmite la respuesta

Establece stream=True y el endpoint devolverá eventos enviados por el servidor. El contenido del razonamiento y el contenido de la respuesta llegan como deltas separados, lo que es importante cuando estás renderizando un estado de “pensando” en una interfaz de usuario.

stream = client.chat.completions.create(
    model="deepseek-flash",
    messages=[{"role": "user", "content": "Explain idempotency keys in one paragraph."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    if delta.content:
        print(delta.content, end="", flush=True)

Si SSE es nuevo para ti, la transmisión de respuestas LLM con eventos enviados por el servidor explica el formato de la conexión y los casos extremos de reconexión.

Precios de un vistazo

Desde la página oficial de precios, efectivo a partir del 10 de septiembre de 2026 a las 04:00 UTC, en USD por 1M de tokens:

deepseek-flash fuera de pico deepseek-flash pico
Entrada, acierto de caché $0.003 $0.006
Entrada, fallo de caché $0.15 $0.30
Salida $0.60 $1.20

Tres cosas que debes saber:

Prueba la API en Apidog

Una vez que la primera llamada funciona, la pregunta es si seguirá funcionando. deepseek-flash no lleva versión, por lo que la próxima actualización será silenciosa. Aquí tienes un flujo de trabajo de Apidog que lo detecta:

  1. Añade el endpoint. Crea POST https://api.deepseek.com/chat/completions, o importa una especificación OpenAPI compatible con OpenAI para que todas las rutas lleguen a la vez.
  2. Guarda la clave como una variable de entorno. Coloca DEEPSEEK_API_KEY en un entorno de Apidog y establece el encabezado en Bearer {{DEEPSEEK_API_KEY}}. Cambiar entre una clave personal y la clave de producción se convierte en un desplegable.
  3. Guarda una solicitud por nivel de esfuerzo. Duplica la solicitud base en variantes: pensamiento desactivado, pensamiento activado con bajo esfuerzo, pensamiento activado con alto esfuerzo. Mismo prompt, diferentes parámetros. Envía las tres y compara el uso de tokens y la latencia lado a lado.
  4. Observa el stream. Para stream: true, Apidog renderiza los eventos SSE a medida que llegan, por lo que los deltas de razonamiento y los deltas de contenido aparecen como líneas separadas en lugar de una pared de prefijos data:.
  5. Convierte las variantes en un escenario de prueba. Añade aserciones sobre el código de estado, sobre el recuento de aciertos de caché en usage siendo superior a cero en la segunda ejecución, y sobre la respuesta que contiene los campos que tu aplicación analiza. Vuelve a ejecutar el escenario después de cada actualización del modelo, y el 14 de septiembre cuando la redirección de V4-Pro se active.
  6. Ejecútalo en CI. apidog-cli ejecuta el mismo escenario desde una pipeline, por lo que un cambio de modelo silencioso falla una compilación en lugar de afectar a un cliente.

Descarga Apidog y toda la configuración toma unos diez minutos.

Preguntas frecuentes

Antes de la redirección

La superficie de la API apenas se movió: las mismas URLs base, el mismo formato de solicitud, un nuevo ID de modelo. Lo que sí se movió fue el precio y, el 14 de septiembre, la redirección de cada llamada a V4-Pro. Renombra deepseek-v4-flash a deepseek-flash, elige un nivel de esfuerzo por endpoint y ejecuta tus prompts a través del nuevo modelo antes de que DeepSeek lo haga por ti.

Guarda esos prompts como pruebas mientras lo haces. Apidog los vuelve a ejecutar con un solo clic, y la próxima actualización silenciosa de Flash aparecerá como una aserción fallida en lugar de un ticket de soporte.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs