Como Usar a API DeepSeek V4-Flash-Vision (Guia de Entrada de Imagens)

O modelo mais barato da DeepSeek agora consegue ver. ID do modelo, preços flash-rate com imagens de 384 tokens, três métodos de entrada, limites e um exemplo de custo detalhado.

Ashley Innocent

Ashley Innocent

24 agosto 2026

Como Usar a API DeepSeek V4-Flash-Vision (Guia de Entrada de Imagens)

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

O modelo mais barato da DeepSeek agora pode "ver". Em 21 de agosto de 2026, a DeepSeek lançou deepseek-v4-flash-vision-exp, uma versão do V4-Flash com capacidade de visão que aceita imagens através da mesma API de produção, ao mesmo preço do modelo apenas de texto, com cada imagem cobrada por no máximo 384 tokens de entrada. A nota de lançamento oficial o posiciona claramente: a mesma capacidade de texto do V4-Flash, mais a compreensão de imagens que a DeepSeek afirma que aproxima o desempenho de seu agente multimodal ao Opus 4.8.

Este guia aborda o que é o modelo, o que "Exp" no nome significa para uso em produção, as três maneiras de enviar imagens, os limites que podem causar problemas e como testar requisições multimodais corretamente. Como as requisições de visão misturam tipos de conteúdo e crescem rapidamente, elas são exatamente o tipo de chamada de API que vale a pena construir no Apidog, em vez de editar JSON manualmente em um terminal.

button

O que é deepseek-v4-flash-vision-exp

O modelo é o V4-Flash-0731 com um codificador de imagem anexado. De acordo com a DeepSeek, ele corresponde ao modelo base em tarefas de texto, incluindo cargas de trabalho de agente, raciocínio e conhecimento geral, então você pode trocá-lo sem perder o que o V4-Flash já fazia. A listagem no OpenRouter o descreve como um modelo esparso de mistura de especialistas com 13B de parâmetros ativos de um total de 284B.

O contexto importante: V4-Flash é a linha econômica da DeepSeek. Cobrimos o modelo de texto quando foi lançado em nosso guia da API DeepSeek V4-Flash, e a economia não mudou. A visão a preços flash supera quase todas as APIs multimodais no mercado, e é por isso que a afirmação "próximo ao Opus 4.8 em benchmarks de agente multimodal", a própria formulação da DeepSeek, chamou a atenção. Trate as afirmações de benchmark do fornecedor como afirmações; execute suas próprias avaliações em seus próprios documentos antes de migrar qualquer coisa.

Apesar do rótulo experimental, isso não é um brinquedo de sandbox. O modelo funciona em endpoints de API de produção com os mesmos limites de taxa e SLA dos outros modelos V4, e não há lista de espera ou solicitação de acesso especial.

Preços: taxas flash, imagens incluídas

A tabela de preços é idêntica à do deepseek-v4-flash (apenas texto), conforme a página de preços da DeepSeek:

Fora de pico Pico
Entrada, acerto de cache (por 1M tokens) $0.007 $0.014
Entrada, erro de cache (por 1M tokens) $0.22 $0.44
Saída (por 1M tokens) $0.66 $1.32

As imagens são tokenizadas para cobrança em até 384 tokens cada e cobradas pela taxa de entrada. No preço de pico de erro de cache, uma imagem de custo total custa cerca de US$ 0,00017. Mil imagens custam menos que um café.

Dois comportamentos de preços são herdados do modelo de texto. As taxas fora de pico são metade das taxas de pico, com as horas de pico ocorrendo das 01:00 às 04:00 e das 06:00 às 10:00 UTC nos dias úteis, então trabalhos de visão em lote agendados fora dessa janela custam metade. E o cache de contexto se aplica a entradas repetidas, o que importa ao reenviar o mesmo prompt de sistema em torno de imagens variáveis. A página de preços lista uma janela de contexto de 1M de tokens para a linha V4, com a saída limitada muito abaixo disso na prática.

Três maneiras de enviar uma imagem

O modelo funciona através do endpoint padrão de Chat Completions da DeepSeek em https://api.deepseek.com/chat/completions (chamadas no estilo Messages e Responses também são suportadas, como estabelecido pelo lançamento da API de Respostas do V4-Flash). As imagens são incluídas no array content de uma mensagem do usuário, e você tem três opções de entrega.

1. Base64 inline. Codifique a imagem como uma URL de dados. Simples, autocontido e limitado a 32 MiB por imagem:

import base64
from openai import OpenAI

client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")

with open("invoice.png", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Extract the line items and totals as JSON."},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
        ]
    }]
)
print(response.choices[0].message.content)

2. URL Externa. Passe um link publicamente acessível (até 8.192 caracteres) em vez de codificar:

{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}

3. Referência da API de Arquivos. Faça o upload uma vez, reutilize por ID. A API de Arquivos da DeepSeek agora aceita uploads de imagens gratuitamente, e uma referência file_id evita o reenvio da mesma imagem em várias requisições, com um limite superior de 64 MiB por imagem:

{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}

Use base64 para chamadas únicas, URLs quando suas imagens já estiverem em uma CDN, e IDs de arquivo para qualquer fluxo de trabalho que utilize a mesma imagem mais de uma vez.

O parâmetro detail

Um campo opcional detail em cada imagem controla o pré-processamento:

Internamente, as imagens são normalizadas para aproximadamente 800x800 para contagem de tokens, que é como o limite de 384 tokens por imagem se mantém. Se você estiver fazendo trabalho similar a OCR em recibos ou dashboards, teste "low" versus "high" em seu corpus real; a diferença de custo é pequena a esses preços, mas a diferença de precisão pode ser grande.

Limites que vale a pena conhecer antes da produção

Restrição Valor
Máx. de imagens por requisição 600
Tamanho da imagem inline (base64) 32 MiB
Tamanho da imagem da API de Arquivos 64 MiB
Corpo total da requisição 48 MiB
Dimensões da imagem 8.192 px por lado (4.096 px quando uma requisição contém 15+ imagens)
Comprimento da URL externa 8.192 caracteres
Posicionamento da imagem apenas em mensagens user

Essa última linha é um verdadeiro gerador de erro 400: imagens em mensagens system ou assistant são rejeitadas. Requisições com múltiplas imagens são suportadas e se intercalam livremente com texto, o que torna o modelo utilizável para ciclos de agente que tiram capturas de tela, raciocinam e agem. Se você estiver orquestrando esses ciclos, a DeepSeek lançou suporte nativo para este modelo no DeepSeek Harness 0.1.1 no mesmo dia; nossa visão geral do DeepSeek Harness cobre essa pilha. Observe também que a chamada de ferramentas funciona junto com a visão, assim como o fluxo do modelo de texto descrito em nosso guia de chamada de funções.

O que “Exp” significa para você

O sufixo é uma rotulagem honesta, não um paywall. Espere que o modelo seja revisado ou substituído em curto prazo, da mesma forma que os endpoints experimentais da DeepSeek foram antes. Medidas práticas:

Exemplo prático: qual o custo de um pipeline de documentos

Os números tornam os preços concretos. Suponha que você processe 50.000 faturas digitalizadas por mês, uma imagem cada, com um prompt de instrução de 200 tokens e aproximadamente 400 tokens de saída JSON por chamada:

Total: aproximadamente US$ 35 a US$ 40 por mês nas taxas de pico, e cerca de metade disso se o lote for executado fora das janelas de dias úteis das 01:00 às 10:00 UTC. Os tokens de saída dominam, o que é a lição útil: com imagens tão baratas, você otimiza um pipeline de visão apertando o formato de resposta, e não diminuindo a escala das imagens. Solicitar JSON compacto em vez de descrições em prosa reduzirá mais a conta do que qualquer pré-processamento de imagem.

Esse perfil de custo também é a razão pela qual o modelo muda o cálculo para ciclos de agente. Um ciclo de captura de tela-raciocínio-ação que era muito caro para ser executado continuamente em modelos multimodais de ponta se torna viável com 384 tokens por quadro.

Testando requisições multimodais no Apidog

As requisições de visão são incômodas para iterar manualmente: blobs base64 tornam o JSON bruto ilegível, e comparar as configurações de detail significa alternar entre payloads quase idênticos. Um ciclo mais limpo:

  1. Salve a requisição uma vez em um projeto Apidog, com {{model_id}}, {{detail}} e o payload da imagem como variáveis. Trocar imagens de teste ou níveis de detalhe se torna uma mudança de menu suspenso.
  2. Scripts de codificação. Um script pré-requisição lê a imagem e injeta a string base64, para que o corpo da requisição visível permaneça legível.
  3. Afirme sobre a estrutura, não sobre impressões. Se você solicitar saída JSON (itens de linha, descrições de caixas delimitadoras, valores de gráfico), adicione asserções que analisem a resposta e verifiquem os campos. Isso transforma "o modelo parece bom" em um passa/falha que você pode executar novamente após cada revisão do modelo Exp.
  4. Simule o formato da resposta para o seu frontend enquanto o prompt ainda está sendo ajustado; o mock inteligente do Apidog serve o esquema sem gastar chamadas de API.

Baixe o Apidog gratuitamente e toda a configuração leva minutos; executá-lo novamente quando a DeepSeek revisar o modelo experimental é um clique.

FAQ

O deepseek-v4-flash-vision-exp é gratuito? Não, mas é quase. Ele é cobrado exatamente pelas taxas flash do modelo de texto, com as imagens limitadas a 384 tokens de entrada cada. O armazenamento de imagens na API de Arquivos da DeepSeek é gratuito; você paga apenas quando as imagens entram em uma requisição.

Ele substitui o deepseek-v4-flash? Não. O modelo de texto permanece o ID estável. A versão de visão o iguala em tarefas de texto, então você pode consolidar no ID de visão se aceitar a volatilidade experimental, mas o padrão conservador é direcionar apenas o tráfego que contém imagens para ele.

Posso usá-lo através do formato de API estilo Anthropic? Sim. Os endpoints V4 da DeepSeek aceitam chamadas no formato Chat Completions, Messages e Responses, então clientes existentes em qualquer um dos três estilos podem adicionar blocos de imagem sem mudar os dialetos de requisição. Nosso tutorial da API V4 Pro mostra a mecânica dos endpoints compartilhada em toda a família.

Como o preço se compara ao GPT ou Claude vision? Com US$ 0,22 a US$ 0,44 por milhão de tokens de entrada com imagens de 384 tokens, está uma ordem de magnitude abaixo das taxas multimodais de ponta. A questão em aberto é a precisão em sua carga de trabalho, para o que serve o cenário de avaliação acima.

Concluindo

A DeepSeek continua executando o mesmo plano: pegar a capacidade pela qual todos cobram taxas premium, lançá-la a preços flash e rotulá-la honestamente enquanto estabiliza. O deepseek-v4-flash-vision-exp oferece compreensão de imagem em endpoints de produção por frações de um centavo por imagem, com três caminhos de entrada e limites reais que você pode contornar. Construa a requisição uma vez no Apidog, fixe suas asserções, e você estará pronto tanto para usar o modelo Exp hoje quanto para julgar seu sucessor no dia em que for lançado.

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs