DeepSeek lanzó la API oficial DeepSeek-V4-Flash esta mañana. El anuncio se realizó el 31 de julio de 2026, y las notas de la versión dejan claras tres cosas: las capacidades de agente del modelo recibieron una importante actualización, ahora habla el formato API de Respuestas de OpenAI de forma nativa y funciona con Codex desde el primer día.
Si has estado llamando a deepseek-v4-flash desde abril, estabas usando la versión preliminar. Esta versión convierte el modelo a su versión oficial, DeepSeek-V4-Flash-0731, y obtienes la actualización sin cambiar una sola línea de código. El nombre del modelo sigue siendo el mismo.
Esta guía repasa todo: cómo obtener una clave, cómo hacer tu primera llamada, cómo activar y desactivar el modo de pensamiento, y cómo es el precio de la beta pública. Si eres nuevo en la línea de productos DeepSeek, comienza con ¿Qué es DeepSeek V4? para una visión general de la familia, y luego regresa aquí.
Lo que realmente se lanzó el 31 de julio
Según el registro de cambios oficial, el lanzamiento cubre solo la API. La aplicación DeepSeek y los modelos web no han cambiado, y la API V4-Pro tampoco. Aquí está el resumen:
- DeepSeek-V4-Flash-0731 es el lanzamiento oficial de la línea V4-Flash, ahora en beta pública en la API.
- Misma arquitectura y tamaño que V4-Flash-Preview. DeepSeek afirma que el modelo solo fue re-entrenado, por lo que las mejoras provienen del entrenamiento, no de una red más grande.
- Los benchmarks de agente superaron a V4-Pro-Preview. DeepSeek informa Terminal Bench 2.1 con 82.7, Cybergym con 76.7, Toolathlon verificado con 70.3, y DeepSWE con 54.4. Estos son los números publicados por DeepSeek, probados con su arnés con el máximo esfuerzo.
- Soporte nativo para la API de Respuestas e integración oficial con Codex. Cubrimos ambos en profundidad en DeepSeek-V4-Flash ahora es compatible con la API de Respuestas y Codex.
- El lanzamiento oficial de DeepSeek-V4-Pro "llegará pronto", según el registro de cambios. Se espera soporte para la API de Respuestas y Codex para V4-Pro a principios de agosto de 2026.
Una nota de honestidad: la afirmación de referencia principal ("superando con creces a V4-Pro-Preview") proviene de la propia evaluación de DeepSeek, y dos de los benchmarks listados (DSBench-FullStack y DSBench-Hard) son conjuntos de pruebas internas. Los números independientes tardarán unos días en aparecer.

Paso 1: Obtén tu clave API
Ve a la Plataforma DeepSeek, inicia sesión y crea una clave desde la página de Claves API. Las claves comienzan con sk-. Guárdala como una variable de entorno en lugar de codificarla directamente:
export DEEPSEEK_API_KEY="sk-your-key-here"
La API de DeepSeek es compatible con los formatos de API de OpenAI y Anthropic, por lo que no necesitas un SDK específico de DeepSeek. Hay dos URL base importantes:
| Formato | URL Base |
|---|---|
| Compatible con OpenAI | https://api.deepseek.com |
| Compatible con Anthropic | https://api.deepseek.com/anthropic |
Paso 2: Haz tu primera llamada
La comprobación de cordura más rápida es curl:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "Eres un asistente útil."},
{"role": "user", "content": "Resume qué cambió en DeepSeek-V4-Flash-0731."}
],
"stream": false
}'
La misma llamada a través del SDK de OpenAI para Python:
# pip3 install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "Eres un asistente útil."},
{"role": "user", "content": "Escribe una función Python que valide una dirección de correo electrónico."}
],
stream=False
)
print(response.choices[0].message.content)
Y Node.js:
// npm install openai
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [{ role: "user", content: "¡Hola!" }],
});
console.log(completion.choices[0].message.content);
Dado que el nombre del modelo deepseek-v4-flash ahora apunta a la versión 0731, cualquier integración existente que hayas construido contra la versión preliminar adoptará el nuevo modelo automáticamente. No hay nada que migrar.
Paso 3: Controla el modo de pensamiento y el esfuerzo de razonamiento
V4-Flash soporta tanto un modo sin pensamiento como un modo con pensamiento, siendo este último el predeterminado. Lo controlas con el parámetro thinking, y puedes ajustar la profundidad con reasoning_effort:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Planifica una migración de base de datos de MySQL a Postgres."}],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}}
)
Dos comportamientos que vale la pena conocer antes de ajustar los parámetros:
temperatureytop_pno tienen efecto mientras el modo de pensamiento está activado.- La finalización FIM (fill-in-the-middle, aún en beta) solo funciona en modo sin pensamiento.
Para endpoints sensibles a la latencia como el autocompletado, desactiva el pensamiento. Para bucles de agente y tareas de depuración difíciles, mantenlo activado y aumenta el nivel de esfuerzo.
Paso 4: Transmitir la respuesta (streaming)
Establece stream: true y la API devolverá eventos enviados por el servidor (SSE). Si nunca antes has depurado cargas útiles SSE, nuestra guía sobre cómo transmitir respuestas de LLM usando eventos enviados por el servidor cubre el formato en detalle.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Explica la agrupación de conexiones."}],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Precios durante la beta pública
Según la página oficial de Modelos y Precios, V4-Flash sigue siendo agresivamente económico:
| Elemento | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Entrada, acierto de caché (por 1M de tokens) | $0.0028 | $0.003625 |
| Entrada, fallo de caché (por 1M de tokens) | $0.14 | $0.435 |
| Salida (por 1M de tokens) | $0.28 | $0.87 |
| Longitud de contexto | 1M de tokens | 1M de tokens |
| Salida máxima | 384K | 384K |
| Límite de concurrencia | 2,500 | 500 |
Tres notas sobre los precios:
- El almacenamiento en caché de contexto es automático, y un acierto de caché cuesta 50 veces menos que un fallo. Las sesiones de agente de larga duración que reutilizan un prompt del sistema se benefician enormemente.
- DeepSeek ha anunciado una política de hora punta/hora valle: el uso en hora punta (9:00-12:00 y 14:00-18:00 hora de Beijing) se facturará al doble de los precios regulares. A partir del 31 de julio, la documentación indica que la fecha efectiva está "sujeta al anuncio oficial", por lo que aún no está activa. Consulta la página de precios.
- El límite de concurrencia cuenta su propia historia: 2,500 solicitudes concurrentes para Flash frente a 500 para Pro. DeepSeek construyó este modelo para ser utilizado intensivamente por flotas de agentes.
Para una imagen más completa de los costos en la familia V4, incluyendo la historia de la reducción permanente de precio de V4-Pro, consulta nuestro desglose de precios de la API DeepSeek V4.
Prueba y depura la API en Apidog
Curl sin formato funciona para una prueba de humo, pero en el momento en que estás comparando la salida con pensamiento versus sin pensamiento, o viendo cómo el modelo transmite las llamadas a herramientas, quieres visibilidad. Aquí tienes un flujo de trabajo que toma unos cinco minutos en Apidog:

- Crea un proyecto y añade el endpoint. Añade
POST https://api.deepseek.com/chat/completions(o importa una especificación compatible con OpenAI para que todos los endpoints lleguen a la vez). - Guarda la clave como una variable de entorno. Coloca
DEEPSEEK_API_KEYen un entorno de Apidog y haz referencia a ella en el encabezado de Autorización comoBearer {{DEEPSEEK_API_KEY}}. Cambiar entre una clave de prueba y una clave de producción se convierte en un clic en un menú desplegable. - Envía e inspecciona. Para las llamadas de streaming, Apidog renderiza los eventos SSE a medida que llegan, para que puedas ver el contenido de razonamiento y el contenido de la respuesta aparecer como deltas separados en lugar de tener que examinar un muro de líneas
data:sin formato. - Guarda variantes como casos de prueba. Mantén una solicitud guardada con el modo de pensamiento habilitado y otra sin él, luego vuelve a ejecutarlas después de cada actualización del modelo. Cuando DeepSeek lance la próxima actualización silenciosa a
deepseek-v4-flash, sabrás con un solo clic si tus prompts siguen funcionando como esperas.
Descarga Apidog gratis, todo el flujo anterior funciona con el plan gratuito.
Preguntas Frecuentes
¿Necesito cambiar mi código para obtener el nuevo modelo? No. El nombre del modelo deepseek-v4-flash ahora sirve a DeepSeek-V4-Flash-0731. Las integraciones existentes se actualizan automáticamente.
¿Es este el mismo modelo que la aplicación DeepSeek? No. La actualización del 31 de julio cubre solo la API. La aplicación y los modelos web no han cambiado.
¿Qué pasó con deepseek-chat y deepseek-reasoner? Esos nombres de modelos heredados estaban programados para su descontinuación el 24 de julio de 2026. Usa deepseek-v4-flash o deepseek-v4-pro. Nuestra guía sobre cómo usar la API DeepSeek V4 cubre la migración.
¿Puedo usarlo gratis? La API de DeepSeek es de pago por uso sin un nivel gratuito permanente, pero los precios de acierto de caché hacen que la experimentación sea casi gratuita en la práctica. Consulta cómo usar la API DeepSeek V4 gratis para conocer las opciones actuales.
¿Funciona V4-Flash con Codex y la API de Respuestas? Sí, con ambos, y es el único modelo DeepSeek que lo hace hasta ahora. Se espera el soporte para V4-Pro a principios de agosto de 2026. La configuración completa se encuentra en nuestra guía de la API de Respuestas y Codex.
En resumen
DeepSeek-V4-Flash-0731 es un tipo de lanzamiento discreto: mismo nombre de modelo, mismos precios, misma arquitectura y un conjunto de puntuaciones de benchmarks de agentes que ahora superan al más grande V4-Pro-Preview, al menos en las propias pruebas de DeepSeek. El soporte para la API de Respuestas y la adaptación a Codex señalan el objetivo de este modelo: cargas de trabajo de agentes de alta concurrencia a precios que superan a cualquier laboratorio occidental.
Obtén una clave, apunta tu SDK de OpenAI a https://api.deepseek.com y somete el modelo a tu propia suite de pruebas antes de confiar en la tabla de benchmarks. Apidog acelera ese bucle de verificación: guarda tus prompts como casos de prueba una vez, vuelve a ejecutarlos en cada actualización del modelo y nunca más te sorprenderá una actualización silenciosa.
