Cómo usar la API DeepSeek V4-Flash-Vision: Guía de entrada de imágenes

El modelo más barato de DeepSeek ahora puede ver. ID del modelo, precios de tarifa flash con imágenes de 384 tokens, tres métodos de entrada, límites y un ejemplo de coste resuelto.

Ashley Innocent

Ashley Innocent

24 August 2026

Cómo usar la API DeepSeek V4-Flash-Vision: Guía de entrada de imágenes

Apidog para empresas

Despliegue local

SSO & RBAC

Conforme con SOC 2

Explorar Apidog Enterprise

El modelo más económico de DeepSeek ahora puede ver. El 21 de agosto de 2026, DeepSeek lanzó deepseek-v4-flash-vision-exp, una versión de V4-Flash con capacidad de visión que acepta imágenes a través de la misma API de producción, al mismo precio que el modelo solo de texto, y cada imagen se factura con no más de 384 tokens de entrada. La nota de lanzamiento oficial lo presenta claramente: la misma capacidad de texto que V4-Flash, más una comprensión de imágenes que, según DeepSeek, acerca el rendimiento de su agente multimodal a Opus 4.8.

Esta guía cubre qué es el modelo, qué significa "Exp" en el nombre para el uso en producción, las tres formas de enviar imágenes, los límites que te afectarán y cómo probar correctamente las solicitudes multimodales. Debido a que las solicitudes de visión mezclan tipos de contenido y crecen rápidamente, son exactamente el tipo de llamada API que vale la pena construir en Apidog en lugar de editar JSON a mano en un terminal.

botón

Qué es deepseek-v4-flash-vision-exp

El modelo es V4-Flash-0731 con un codificador de imágenes adjunto. Según DeepSeek, iguala al modelo base en tareas de texto, incluyendo cargas de trabajo de agentes, razonamiento y conocimiento del mundo, por lo que puedes intercambiarlo sin perder lo que V4-Flash ya hacía. El listado de OpenRouter lo describe como un modelo de mezcla dispersa de expertos con 13B de parámetros activos de un total de 284B.

El contexto importante: V4-Flash es la línea económica de DeepSeek. Cubrimos el modelo de texto cuando se lanzó en nuestra guía de la API de DeepSeek V4-Flash, y la economía no ha cambiado. La visión a precios flash supera a casi todas las API multimodales del mercado, razón por la cual la afirmación "cerca de Opus 4.8 en benchmarks de agentes multimodales", el propio marco de DeepSeek, llamó la atención. Trata las afirmaciones de benchmarks de los proveedores como afirmaciones; ejecuta tus propias evaluaciones en tus propios documentos antes de migrar cualquier cosa.

A pesar de la etiqueta experimental, esto no es un juguete de caja de arena. El modelo funciona en puntos finales de API de producción con los mismos límites de velocidad y SLA que los otros modelos V4, y no hay lista de espera ni solicitud de acceso especial.

Precios: tarifas flash, imágenes incluidas

La tabla de tarifas es idéntica a la de deepseek-v4-flash solo de texto, según la página de precios de DeepSeek:

Fuera de horas pico Pico
Entrada, acierto de caché (por 1M de tokens) $0.007 $0.014
Entrada, fallo de caché (por 1M de tokens) $0.22 $0.44
Salida (por 1M de tokens) $0.66 $1.32

Las imágenes se tokenizan para la facturación a un máximo de 384 tokens cada una y se cobran a la tarifa de entrada. Con la tarifa de fallo de caché en hora pico, una imagen de costo completo asciende a aproximadamente $0.00017. Mil imágenes cuestan menos que un café.

Dos comportamientos de precios se mantienen del modelo de texto. Las tarifas fuera de horas pico son la mitad de las de horas pico, siendo las horas pico de 01:00 a 04:00 y de 06:00 a 10:00 UTC los días laborables, por lo que los trabajos de visión por lotes programados fuera de esa ventana cuestan la mitad. Y el almacenamiento en caché de contexto se aplica a las entradas repetidas, lo cual es importante cuando se reenvía el mismo prompt del sistema con imágenes variadas. La página de precios enumera una ventana de contexto de 1M de tokens para la línea V4, con una salida limitada muy por debajo de eso en la práctica.

Tres formas de enviar una imagen

El modelo funciona a través del endpoint estándar de Chat Completions de DeepSeek en https://api.deepseek.com/chat/completions (también se admiten llamadas estilo Mensajes y estilo Respuestas, como estableció el lanzamiento de la API de Respuestas de V4-Flash). Las imágenes van en el array de content de un mensaje de usuario, y tienes tres opciones de entrega.

1. Base64 en línea. Codifica la imagen como una URL de datos. Sencillo, autónomo y limitado a 32 MiB por imagen:

import base64
from openai import OpenAI

client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")

with open("invoice.png", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Extrae las partidas y los totales como JSON."},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
        ]
    }]
)
print(response.choices[0].message.content)

2. URL externa. Pasa un enlace accesible públicamente (hasta 8,192 caracteres) en lugar de codificar:

{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}

3. Referencia de la API de Archivos. Sube una vez, reutiliza por ID. La API de Archivos de DeepSeek ahora acepta subidas de imágenes de forma gratuita, y una referencia de file_id evita volver a subir la misma imagen en múltiples solicitudes, con un límite superior de 64 MiB por imagen:

{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}

Usa base64 para llamadas únicas, URLs cuando tus imágenes ya residen en una CDN, y IDs de archivo para cualquier flujo de trabajo que utilice la misma imagen más de una vez.

El parámetro detail

Un campo opcional detail en cada imagen controla el preprocesamiento:

Internamente, las imágenes se normalizan a aproximadamente 800x800 para el conteo de tokens, que es como se mantiene el límite de 384 tokens por imagen. Si estás realizando trabajos similares a OCR en recibos o paneles de control, prueba "low" frente a "high" en tu corpus real; la diferencia de costo es pequeña a estos precios, pero la diferencia de precisión puede ser grande.

Límites que vale la pena conocer antes de la producción

Restricción Valor
Máx. imágenes por solicitud 600
Tamaño de imagen en línea (base64) 32 MiB
Tamaño de imagen de la API de Archivos 64 MiB
Cuerpo total de la solicitud 48 MiB
Dimensiones de la imagen 8,192 px por lado (4,096 px cuando una solicitud lleva más de 15 imágenes)
Longitud de la URL externa 8,192 caracteres
Ubicación de la imagen solo mensajes de usuario

Esa última fila es un verdadero generador de errores 400: las imágenes en los mensajes del sistema o del asistente son rechazadas. Se admiten solicitudes de varias imágenes y se intercalan libremente con texto, lo que hace que el modelo sea utilizable para bucles de agentes que toman capturas de pantalla, razonan y actúan. Si estás orquestando esos bucles, DeepSeek lanzó soporte nativo para este modelo en DeepSeek Harness 0.1.1 el mismo día; nuestra descripción general de DeepSeek Harness cubre esa pila. Ten en cuenta también que la llamada a herramientas funciona junto con la visión, al igual que el flujo del modelo de texto descrito en nuestra guía de llamada a funciones.

Qué significa "Exp" para ti

El sufijo es un etiquetado honesto, no un muro de pago. Espera que el modelo sea revisado o reemplazado con poca antelación, como ha ocurrido antes con los endpoints experimentales de DeepSeek. Medidas prácticas:

Ejemplo práctico: lo que cuesta una pipeline de documentos

Los números hacen que el precio sea concreto. Supón que procesas 50,000 facturas escaneadas al mes, una imagen cada una, con un prompt de instrucción de 200 tokens y aproximadamente 400 tokens de salida JSON por llamada:

Total: aproximadamente entre $35 y $40 al mes a tarifas pico, y alrededor de la mitad si el lote se ejecuta fuera de las ventanas de 01:00 a 10:00 UTC de lunes a viernes. Los tokens de salida dominan, lo cual es la lección útil: con imágenes tan baratas, optimizas una pipeline de visión ajustando el formato de respuesta, no reduciendo la escala de las imágenes. Solicitar JSON compacto en lugar de descripciones en prosa reduce la factura más que cualquier preprocesamiento de imágenes.

Ese perfil de costos es también la razón por la que el modelo cambia el cálculo para los bucles de agentes. Un ciclo de captura de pantalla-razonamiento-acción que era demasiado caro para ejecutarse continuamente en modelos multimodales emblemáticos se vuelve viable a 384 tokens por fotograma.

Prueba de solicitudes multimodales en Apidog

Las solicitudes de visión son molestas de iterar a mano: los blobs de base64 hacen que el JSON puro sea ilegible, y comparar la configuración de detail significa manejar payloads casi idénticos. Un bucle más limpio:

  1. Guarda la solicitud una vez en un proyecto de Apidog, con {{model_id}}, {{detail}} y el payload de la imagen como variables. Intercambiar imágenes de prueba o niveles de detalle se convierte en un cambio en el desplegable.
  2. Programa la codificación. Un script de pre-solicitud lee la imagen e inyecta la cadena base64, para que el cuerpo visible de la solicitud se mantenga legible.
  3. Afirma la estructura, no las sensaciones. Si solicitas una salida JSON (partidas, descripciones delimitadoras, valores de gráficos), añade aserciones que analicen la respuesta y verifiquen los campos. Eso convierte "el modelo parece estar bien" en un aprobado/suspenso que puedes volver a ejecutar después de cada revisión del modelo Exp.
  4. Simula la forma de la respuesta para tu frontend mientras el prompt aún se está ajustando; el smart mock de Apidog sirve el esquema sin consumir llamadas API.

Descarga Apidog gratis y todo el montaje te llevará minutos; volver a ejecutarlo cuando DeepSeek revise el modelo experimental es un solo clic.

Preguntas frecuentes

¿Es gratuito deepseek-v4-flash-vision-exp? No, pero se acerca. Se factura exactamente a las tarifas flash del modelo de texto, con las imágenes limitadas a 384 tokens de entrada cada una. El almacenamiento de imágenes de la API de Archivos de DeepSeek es gratuito; solo pagas cuando las imágenes entran en una solicitud.

¿Reemplaza a deepseek-v4-flash? No. El modelo de texto sigue siendo el ID estable. La versión de visión lo iguala en tareas de texto, por lo que puedes consolidarte en el ID de visión si aceptas la rotación experimental, pero el patrón conservador es enrutar solo el tráfico que contiene imágenes hacia él.

¿Puedo usarlo a través del formato API estilo Anthropic? Sí. Los endpoints V4 de DeepSeek aceptan llamadas de formato Chat Completions, Mensajes y Respuestas, por lo que los clientes existentes en cualquiera de los tres estilos pueden añadir bloques de imágenes sin cambiar de dialecto de solicitud. Nuestro recorrido por la API V4 Pro muestra la mecánica del endpoint compartida en toda la familia.

¿Cómo se compara el precio con la visión de GPT o Claude? A $0.22 a $0.44 por millón de tokens de entrada con imágenes de 384 tokens, está un orden de magnitud por debajo de las tarifas multimodales emblemáticas. La pregunta abierta es la precisión en tu carga de trabajo, para lo cual sirve el escenario de evaluación anterior.

Conclusión

DeepSeek sigue ejecutando el mismo manual: toma la capacidad por la que todos cobran tarifas premium, la lanza a precios flash y la etiqueta honestamente mientras se estabiliza. deepseek-v4-flash-vision-exp te brinda comprensión de imágenes en endpoints de producción por fracciones de centavo por imagen, con tres rutas de entrada y límites reales que puedes considerar en tu diseño. Construye la solicitud una vez en Apidog, fija tus aserciones y estarás listo tanto para usar el modelo Exp hoy como para juzgar a su sucesor el día que llegue.

Practica el diseño de API en Apidog

Descubre una forma más fácil de construir y usar APIs