¿Cómo usar la API DeepSeek V4 Pro 0813?

DeepSeek V4 Pro está disponible de forma general como compilación 0813. Llama a la API de deepseek-v4-pro con Python: configuración, modos de pensamiento con contenido de razonamiento, streaming, llamada a herramientas y ahorros de caché de prompts de 120x.

@apidog

@apidog

13 August 2026

¿Cómo usar la API DeepSeek V4 Pro 0813?

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

DeepSeek V4 Pro dejó la fase de previsualización el 12 de agosto de 2026. La versión de disponibilidad general (GA), con el sello 0813, ahora sirve el endpoint de la API deepseek-v4-pro, y viene con cifras que parecen errores tipográficos: una ventana de contexto de 1M de tokens, 384K tokens de salida máxima, y un precio de entrada que baja a $0.003625 por millón de tokens en aciertos de caché. Como informó Unite.AI, el modelo que pasó cuatro meses en previsualización es ahora el buque insignia de DeepSeek.

La cobertura del lanzamiento te dice qué se envió, no cómo llamarlo. Esta guía cubre la parte práctica: la primera solicitud con el SDK de OpenAI, los modos de pensamiento y el campo reasoning_content, el streaming, la llamada a herramientas y el cálculo de caché de prompts que decide si ese contexto de 1M es asequible o ruinoso. Si primero quieres la historia de la arquitectura, lee Qué es DeepSeek V4 y luego regresa.

TL;DR

Qué cambia la compilación GA 0813 para los desarrolladores

La previsualización se abrió en abril de 2026, el hermano menor V4 Flash se lanzó en julio, y el 12 de agosto el modelo Pro pasó a disponibilidad general como compilación 0813, siguiendo la convención habitual de DeepSeek de fecha (de la misma manera que v3-0324 marcaba una instantánea V3).

Tres cosas cambian con la disponibilidad general (GA):

  1. La instantánea es estable. Los modelos de previsualización pueden cambiar sin previo aviso, lo que invalida silenciosamente las evaluaciones y el ajuste de prompts. La compilación 0813 es un objetivo fijo hasta que DeepSeek anuncie una nueva instantánea.
  2. El endpoint es el alias de producción. En la API oficial, llamas a deepseek-v4-pro y obtienes la compilación 0813; para fijar la instantánea explícitamente, OpenRouter la lista como deepseek/deepseek-v4-pro-0813.
  3. La superficie completa de características está activa. Los modos de pensamiento, la llamada a funciones, las salidas estructuradas, el almacenamiento en caché de prompts y la API de múltiples formatos (OpenAI, Anthropic, Responses) están todos activos en el endpoint GA.

Bajo el capó, V4 Pro es un modelo de mezcla de expertos con 1.6T de parámetros totales y 49B activos por token. La principal historia de ingeniería es la eficiencia: dos esquemas de atención, Atención Dispersa Comprimida y Atención Fuertemente Comprimida, reducen el cálculo de inferencia de un solo token al 27% del de V3.2 y la caché KV al 10%. Esa reducción de la caché KV es lo que hace que un contexto de 1M de tokens sea utilizable a estos precios en lugar de ser una característica de demostración.

DeepSeek V4 Pro 0813: especificaciones de un vistazo

Especificación DeepSeek V4 Pro 0813
Lanzamiento GA el 12 de agosto de 2026 (instantánea 0813)
Arquitectura Mezcla de expertos, 1.6T parámetros totales, 49B activos por token
Atención Atención Dispersa Comprimida + Atención Fuertemente Comprimida
Costo de inferencia vs V3.2 27% del cálculo de un solo token, 10% de la caché KV
Ventana de contexto 1.000.000 tokens
Salida máxima 384K tokens
Modos de pensamiento sin pensamiento, pensamiento alto, pensamiento máximo
Precio de entrada $0.435/M tokens (fallo de caché), $0.003625/M (acierto de caché)
Precio de salida $0.87/M tokens
Formatos de API Completions de chat de OpenAI, Mensajes de Anthropic, Respuestas de DeepSeek
ID del modelo deepseek-v4-pro
Hermano menor deepseek-v4-flash (284B total / 13B activos), $0.14/M entrada, $0.28/M salida

En cuanto a capacidad, la propia ficha del modelo de DeepSeek enumera SWE-bench Verified en 80.6%, Terminal Bench 2.0 en 67.9%, GPQA Diamond en 90.1% y LiveCodeBench en 93.5% para V4-Pro-Max, la configuración de pensamiento máximo. Esos son números del proveedor auto-reportados que ningún tercero ha verificado aún, así que ejecuta tus propias evaluaciones específicas de tarea antes de migrar cualquier cosa importante.

Obtén una clave API y haz tu primera solicitud

La configuración toma unos cinco minutos:

  1. Crea una cuenta en la plataforma DeepSeek (platform.deepseek.com) y añade crédito, la API es prepago.
  2. Abre Claves API, genera una clave y cópiala inmediatamente (se muestra una sola vez).
  3. Exponla como una variable de entorno en lugar de pegarla en el código:
export DEEPSEEK_API_KEY="sk-..."

La API utiliza el protocolo de Completions de chat de OpenAI, por lo que el paquete estándar openai es el cliente. Tanto https://api.deepseek.com como https://api.deepseek.com/v1 funcionan como URLs base; el /v1 es compatibilidad de protocolo, no una versión del modelo.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {"role": "system", "content": "You are a concise technical assistant."},
        {"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
    ],
)

print(response.choices[0].message.content)
print(response.usage)

Imprime response.usage desde el primer día. Con un modelo tan barato en aciertos de caché y tan caro en fallos de caché de 1M de tokens, la contabilidad de tokens es la diferencia entre un error de redondeo y una factura real.

La misma solicitud sobre HTTP puro, útil para pruebas de humo y para importar a herramientas de API:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "List three ways to version a REST API."}
    ]
  }'

La referencia completa de parámetros se encuentra en la documentación oficial de DeepSeek, incluyendo el endpoint compatible con Anthropic (utilizable desde el SDK de Anthropic y Claude Code sin reescribir nada) y la propia API de Respuestas de DeepSeek.

Trabajando con los tres modos de pensamiento

V4 Pro expone el razonamiento como un selector en lugar de un modelo separado. Un endpoint, tres modos:

Los modos se asignan al parámetro estándar reasoning_effort, por lo que no se necesita ninguna configuración específica del proveedor:

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high", # "none" | "high" | "max"
    messages=[
        {"role": "user", "content": "Our API returns 502s under load but only behind the CDN. Walk through likely causes in order of probability."},
    ],
)

message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)

Dos notas prácticas. Primero, nunca vuelvas a introducir reasoning_content en el historial de la conversación; envía solo el content de los turnos anteriores. Segundo, los tokens de razonamiento se facturan como tokens de salida a $0.87/M, por lo que el pensamiento máximo cuesta dinero real y latencia real. Ajusta el modo a la tarea en lugar de establecer el máximo por defecto.

Respuestas en streaming

Con una salida máxima de 384K y modos de pensamiento que pueden razonar extensamente, las solicitudes sin streaming resultan en una mala experiencia de usuario. Establece stream=True y maneja ambos tipos de delta, en los modos de pensamiento, los fragmentos de reasoning_content llegan primero, luego la respuesta:

stream = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",
    stream=True,
    messages=[
        {"role": "user", "content": "Design a rate limiter for a public API. Compare token bucket and sliding window."},
    ],
)

for chunk in stream:
    if not chunk.choices:
        continue # final chunk may carry usage data only
    delta = chunk.choices[0].delta
    if getattr(delta, "reasoning_content", None):
        print(delta.reasoning_content, end="", flush=True) # thinking phase
    elif delta.content:
        print(delta.content, end="", flush=True) # answer phase

Un patrón de interfaz de usuario sensato: renderiza la fase de razonamiento colapsada como un indicador de “pensando”, luego cambia a la renderización normal cuando comienzan los deltas de content. Bajo el capó, esto son eventos enviados por el servidor estándar; nuestra guía sobre streaming de respuestas API con SSE cubre la mecánica.

Llamada a herramientas y salidas estructuradas

V4 Pro soporta la llamada a funciones al estilo OpenAI, lo que significa que los bucles de agente existentes se portan sin modificaciones. Define herramientas, lee tool_calls, ejecuta, añade resultados, repite:

tools = [{
    "type": "function",
    "function": {
        "name": "get_endpoint_status",
        "description": "Check the health of an internal API endpoint",
        "parameters": {
            "type": "object",
            "properties": {
                "endpoint": {"type": "string", "description": "Path, e.g. /v1/orders"}
            },
            "required": ["endpoint"],
        },
    },
}]

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Is /v1/orders healthy right now?"}],
    tools=tools,
)

print(response.choices[0].message.tool_calls)

Las salidas estructuradas funcionan a través del parámetro estándar response_format cuando necesitas JSON garantizado y parseable. Un recorrido completo por los bucles de herramientas de varios pasos merece su propio artículo; la documentación oficial cubre los detalles de la forma de los mensajes.

Economía de la caché de prompts: el número que cambia tu arquitectura

Aquí está la especificación que merece más atención que los benchmarks. DeepSeek almacena en caché automáticamente los prefijos de los prompts, sin cabeceras de control de caché, sin configuración de TTL, y los prefijos repetidos se facturan a $0.003625/M en lugar de $0.435/M. Eso es un descuento de 120 veces para la entrada que la API ya ha visto.

Calcula los números para una carga de trabajo realista. Digamos que estás construyendo un agente de codificación que mantiene un contexto de repositorio de 200K tokens y realiza 50 llamadas en una sesión:

La misma sesión, aproximadamente 35 veces más barata, y todo lo que se necesita es la estructura del prompt: contenido estable primero (prompt del sistema, documentación, contexto del repositorio), contenido volátil al final (el último mensaje del usuario, marcas de tiempo, IDs de solicitud). Cualquier cambio temprano en el prompt invalida el prefijo almacenado en caché a partir de ese punto, por lo que una marca de tiempo en tu prompt del sistema convierte silenciosamente cada llamada en un fallo de caché de precio completo.

Esto también replantea la ventana de contexto de 1M: llenarla cuesta $0.435 en un fallo, pero como prefijo de sesión estable, se lee por aproximadamente un tercio de centavo por llamada. Para la teoría general, consulta Qué es el almacenamiento en caché de prompts.

Probando deepseek-v4-pro en Apidog

Antes de que V4 Pro se acerque al código de producción, pon el endpoint bajo un depurador adecuado. Debido a que la API de DeepSeek es compatible con OpenAI, Apidog la detecta sin ninguna manipulación especial:

  1. Importa el endpoint. Pega el comando curl anterior en Apidog y se convierte en una solicitud editable, con encabezados, autenticación y cuerpo analizados automáticamente.
  2. Configura entornos para Pro y Flash. Almacena base_url y tu clave API como variables de entorno, y haz que el nombre del modelo también sea una variable. Cambiar entre deepseek-v4-pro y deepseek-v4-flash se convierte en un cambio de entorno con un solo clic, lo que convierte la pregunta "¿Vale la pena Pro el triple del precio de Flash en este prompt?" en una cuestión empírica en lugar de un debate.
  3. Inspecciona el flujo SSE. Envía una solicitud con "stream": true y Apidog renderiza el flujo de eventos como una línea de tiempo en vivo en lugar de una pared de líneas data: en bruto, fusionando los deltas para que puedas ver cómo llega reasoning_content antes de la respuesta. Cuando una llamada en modo "pensamiento máximo" se siente lenta, esta vista te muestra exactamente dónde se fue el tiempo.
  4. Guarda la sesión como una colección. Cuando DeepSeek lance la próxima instantánea, vuelve a ejecutar las mismas solicitudes y compara el comportamiento antes de actualizar, el mismo flujo de trabajo que los equipos utilizan para los endpoints compatibles con OpenAI en general.

El visor de respuestas también muestra el bloque usage en cada solicitud, que es la forma más rápida de verificar tu ratio de aciertos de caché mientras ajustas la estructura del prompt.

Precios actuales y el aumento que se avecina

Precios de lista actuales para los dos endpoints V4:

Modelo Entrada (fallo) Entrada (acierto de caché) Salida
deepseek-v4-pro $0.435/M $0.003625/M $0.87/M
deepseek-v4-flash $0.14/M $0.28/M

Incluso a precios Pro, esto supera a los modelos occidentales de vanguardia por un amplio margen. Pero planifica con una advertencia: el 6 de agosto de 2026, seis días antes de la GA, DeepSeek advirtió que se avecina un aumento "significativo" en el precio de la API, sin cifras ni fecha de entrada en vigor.

Estrategias prácticas mientras el número es desconocido:

Para un desglose más profundo de la estructura de precios de V4 y cómo se compara entre proveedores, consulta nuestra guía de precios de la API DeepSeek V4.

Preguntas frecuentes

¿Funcionará mi código existente del SDK de OpenAI sin cambios?

Casi. Cambia base_url a https://api.deepseek.com, intercambia la clave API y establece model="deepseek-v4-pro". Las Completions de Chat, el streaming, las herramientas y las salidas estructuradas siguen los formatos de OpenAI. Los equipos que utilizan el SDK de Anthropic pueden usar el endpoint de Anthropic Messages de DeepSeek en su lugar.

¿Cuándo debería usar V4 Flash en lugar de V4 Pro?

Flash (284B total, 13B activos) es el modelo de volumen: clasificación, extracción, chat simple, cualquier cosa sensible a la latencia que no necesite un razonamiento profundo. Pro justifica su precio de salida 3 veces mayor en codificación agéntica, análisis de contexto largo y cargas de trabajo en modo de pensamiento. Enruta por tarea, no por lealtad.

¿Puedo usar V4 Pro 0813 en Cursor?

Sí, Cursor acepta endpoints personalizados compatibles con OpenAI, por lo que la compilación GA se integra como un modelo personalizado. Explicamos la configuración exacta en Cómo usar DeepSeek V4 Pro con Cursor.

Para terminar

El primer día con un modelo GA es el momento adecuado para desarrollar la memoria muscular: clave, primera solicitud, modos de pensamiento, streaming y un diseño de prompt consciente del almacenamiento en caché. V4 Pro recompensa este último hábito más que cualquier modelo anterior, el descuento de caché de 120 veces convierte la estructura del prompt en una decisión de arquitectura. Conecta los ejemplos anteriores, observa los números de usage y mantén una colección de Apidog guardada para que puedas volver a verificar el comportamiento cuando llegue la próxima instantánea o el cambio de precio anunciado.

botón

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs