DeepSeek-V4.1-Flash vs V4-Pro vs V4-Flash: Comparativo de Benchmarks, Custo e Velocidade

O V4.1-Flash, menor e mais barato, supera o V4-Pro nos próprios benchmarks da DeepSeek e o absorverá em 14 de setembro. Aqui estão as especificações, preços e taxa de transferência lado a lado, além de um fluxo de trabalho Apidog para comparar ambos os modelos primeiro.

Medy Evrard

10 setembro 2026

DeepSeek-V4.1-Flash vs V4-Pro vs V4-Flash: Comparativo de Benchmarks, Custo e Velocidade

Apidog para empresas

Implantação local

SSO & RBAC

Conforme SOC 2

Explorar Apidog Enterprise

A DeepSeek publicou o cartão do modelo para o DeepSeek-V4.1-Flash em 10 de setembro de 2026, e os números são constrangedores para os clientes do V4-Pro. O modelo menor e mais barato pontua mais alto do que o carro-chefe em todos os benchmarks de codificação e agente listados pela DeepSeek, custa de 70 a 77% menos por token no pico, e em 14 de setembro ele absorve o V4-Pro completamente: cada solicitação de deepseek-v4-pro é roteada para o V4.1-Flash e cobrada pelas taxas Flash.

Esta não é a habitual troca entre pequeno e grande. É uma comparação com um prazo. Se você executa o V4-Pro em produção, você tem quatro dias para aprender o que muda quando o redirecionamento for efetivado. Se você executa o V4-Flash, a mudança já aconteceu: o nome deepseek-v4-flash é atendido pelo V4.1-Flash hoje.

Abaixo: todos os três modelos em arquitetura, benchmarks relatados pela DeepSeek, preços em USD e taxa de transferência, em seguida, um fluxo de trabalho para executar um conjunto de prompts através de ambos deepseek-v4-pro e deepseek-flash no Apidog antes da transição para comparar saídas, latência e contagens de uso. Para aprofundar na arquitetura, leia primeiro o que é o DeepSeek-V4.1-Flash; para a lista de verificação de migração, consulte o guia de desativação do V4-Pro.

TL;DR

Especificações lado a lado

A geração V4.1 é uma nova arquitetura, não um retreinamento pós-lançamento. A DeepSeek a chama de Causal Encoder-Decoder (CED): 40 camadas divididas em 20 codificadores e 20 decodificadores, com 384 especialistas roteados mais um especialista compartilhado por camada. O cartão do modelo indica que a espinha dorsal possui 552B de parâmetros (763B com o codificador de visão).

V4-Flash V4-Pro V4.1-Flash
Geração da arquitetura V4 MoE V4 MoE V4.1 Causal Encoder-Decoder, 40 camadas
Parâmetros totais 284B (listagem do OpenRouter da versão de visão) Não divulgado aqui Espinha dorsal de 552B, 763B com codificador de visão
Parâmetros ativos 13B Não divulgado aqui 8B pré-preenchimento, 16B decodificação
Janela de contexto 1M tokens 1M tokens 1M tokens
Saída máxima 384K tokens 384K tokens 384K tokens
Visão Build Vision-Exp separado Não divulgado aqui Nativo, codificador DeepSeek-ViT
Licença Não abordado aqui Não abordado aqui MIT, pesos no Hugging Face
Limite de concorrência 2.500 500 2.500
Status da API Descontinuado, alias atendido por V4.1-Flash Redireciona para V4.1-Flash em 14 de Set GA desde 10 de Set, id do modelo deepseek-flash

A contagem dividida de parâmetros ativos é o detalhe a ser observado: o V4-Flash usava 13B para cada token, enquanto o V4.1-Flash gasta 8B na entrada e 16B na saída, onde reside a qualidade.

Benchmarks: de onde vêm os 11.5 pontos

Todos os números abaixo são relatados pela DeepSeek a partir do cartão do modelo. Nenhuma execução independente foi publicada, e a frase do aviso de desativação "testes por múltiplas partes" não as nomeia. Trate-os como alegações do fornecedor e verifique com seus próprios prompts.

Pontuações do DeepSeek-V4.1-Flash comparadas com DeepSeek-V4-Pro e DeepSeek-V4-Flash

DeepSWE v1.1 (+11.5 sobre o Pro, +19.8 sobre o V4-Flash). O destaque, e a única diferença grande o suficiente para mudar decisões. O DeepSWE mede tarefas de engenharia de software multifile, a carga de trabalho que os agentes de codificação executam o dia todo. Se isso se mantiver em seus repositórios, o V4.1-Flash supera em código o modelo que custava quatro vezes mais.

Terminal-Bench 2.1 (+2.7). Tarefas de agente baseadas em shell. O V4-Flash-0731 já havia superado o V4-Pro-Preview aqui em julho; o V4.1 estende a liderança por menos de três pontos. Real, não decisivo.

HumanEval (+2.6) e GSM8K (+0.4). Ambos estão perto da saturação: todo modelo ultrapassa 90 no GSM8K, e o HumanEval diz pouco sobre código de produção. Não dê peso a essas linhas.

MiniMax M3 vs DeepSeek V4 vs Qwen 3.7 apresenta os números da geração V4 contra outros modelos abertos; nenhum inclui o V4.1 ainda.

Custo: três modelos, seis níveis de preço

O pico é de segunda a sexta-feira, das 01:00 às 04:00 e das 06:00 às 10:00 UTC; todo o resto é fora do pico pela metade do preço. As taxas são por 1M de tokens da página de preços, válidas a partir de 10 de setembro. As linhas V4-Flash usam suas taxas em USD de 21 de agosto de 2026 como a coluna "antes".

Modelo e nível Entrada, acerto de cache Entrada, erro de cache Saída
V4-Flash, fora do pico (taxas de 21 de Ago) $0.007 $0.22 $0.66
V4-Flash, pico (taxas de 21 de Ago) $0.014 $0.44 $1.32
V4-Pro, fora do pico $0.022 $0.66 $1.98
V4-Pro, pico $0.044 $1.32 $3.96
V4.1-Flash, fora do pico $0.003 $0.15 $0.60
V4.1-Flash, pico $0.006 $0.30 $1.20

Em comparação com o V4-Flash, o V4.1 reduz a entrada de acerto de cache em cerca de 57%, a entrada de erro de cache em cerca de 32% e a saída em cerca de 9%. Em comparação com o V4-Pro, os cortes são de 77% na entrada de erro de cache e 70% na saída no pico.

Um mês de trabalho. Um agente de codificação processa 2B de tokens de entrada por mês com uma taxa de acerto de cache de 70% (prompt do sistema e contexto do repositório reutilizados entre as interações) e emite 300M de tokens de saída, tudo no pico.

V4-Pro, pico V4-Flash, pico V4.1-Flash, pico V4.1-Flash, fora do pico
Entrada 1.4B acerto de cache $61.60 $19.60 $8.40 $4.20
Entrada 600M erro de cache $792.00 $264.00 $180.00 $90.00
Saída 300M $1,188.00 $396.00 $360.00 $180.00
Total mensal $2,041.60 $679.60 $548.40 $274.20

Isso é 73% menos do que o V4-Pro, e mover trabalhos em lote para fora do pico o reduz pela metade novamente. Os tokens de saída dominam todas as colunas, então o corte de 70% na saída importa mais do que o destaque do acerto de cache. A análise de preços do V4.1-Flash cobre o cálculo do acerto de cache.

Custos do DeepSeek-V4.1-Flash por 1M de tokens comparados com DeepSeek-V4-Pro e DeepSeek-V4-Flash

Velocidade e taxa de transferência

A DeepSeek não publica o número de tokens por segundo, então a história da taxa de transferência baseia-se em três fatos arquitetônicos e uma anedota.

Meça seus próprios p50 e p95 antes de confiar em qualquer coisa.

O que você perde e ganha depois de 14 de setembro

Não há "qual modelo devo escolher" após a transição. deepseek-v4-pro se torna um alias, então a abordagem honesta é um registro.

Você ganha: pontuações mais altas em todos os benchmarks listados, preços de pico 70 a 77% mais baixos, concorrência 5x maior, entrada de imagem nativa sem um ID de modelo de visão separado, e um seletor de esforço de raciocínio que a DeepSeek descreve como continuamente controlável em uma escala de 1 a 100.

Você perde: a capacidade de fixar um checkpoint da geração V4. Prompts ajustados para o estilo, verbosidade ou formatação de chamadas de ferramentas do V4-Pro podem ter desvios. O comprimento da saída e as contagens de tokens de raciocínio podem mudar, o que altera sua fatura de maneiras que a tabela de preços não mostra. E o redirecionamento acontece no cronograma da DeepSeek, não no seu.

Essa segunda lista é o motivo pelo qual você deve comparar antes do dia 14, não depois.

Compare V4-Pro com V4.1-Flash no Apidog antes da transição

O Apidog testa a camada da API, então é o lugar certo para executar um conjunto de prompts através de ambos os IDs de modelo e comparar o que retorna.

  1. Adicione o endpoint. Crie um projeto e adicione POST https://api.deepseek.com/chat/completions, ou importe uma especificação OpenAPI.
  2. Coloque a chave e o ID do modelo nos ambientes. Armazene DEEPSEEK_API_KEY e uma variável MODEL. Crie dois ambientes, v4-pro com MODEL=deepseek-v4-pro e v41-flash com MODEL=deepseek-flash, e referencie-os como Bearer {{DEEPSEEK_API_KEY}} no cabeçalho e "model": "{{MODEL}}" no corpo.
  3. Salve seus prompts reais como requisições. Escolha de 20 a 30 prompts que representem a produção: seu prompt de sistema, uma rodada de chamada de ferramenta, um resumo de contexto longo, uma edição de código multifile. Salve cada um com stream: false para que o objeto usage apareça no corpo da resposta.
  4. Afirme sobre os campos que alteram sua fatura. Construa um cenário de teste a partir das requisições salvas e adicione afirmações sobre usage.prompt_tokens, usage.completion_tokens e usage.prompt_cache_hit_tokens. Registre o tempo de resposta por etapa e adicione um script pré-requisição que insira o nome do ambiente em um cabeçalho para que as execuções sejam rotuladas.
  5. Execute uma vez por ambiente, então compare. Execute o cenário em v4-pro, depois em v41-flash. Compare as contagens de tokens de conclusão (o redirecionamento altera sua fatura de saída), a latência por etapa e o próprio conteúdo para desvios de formatação.
  6. Reexecute em CI no dia 14. Execute o mesmo cenário com apidog-cli em sua pipeline na transição. Qualquer coisa que o redirecionamento quebrar aparecerá como uma asserção falha em vez de um ticket de suporte.

A mesma comparação como um script:

import os, time
from openai import OpenAI

client = OpenAI(api_key=os.environ["DEEPSEEK_API_KEY"],
                base_url="https://api.deepseek.com")

prompt = "Make payment retries in the checkout service idempotent. Return a unified diff."

for model in ("deepseek-v4-pro", "deepseek-flash"):
    start = time.perf_counter()
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    print(model, f"{time.perf_counter() - start:.2f}s",
          r.usage.prompt_tokens, r.usage.completion_tokens)

Execute no pico e fora do pico e guarde as saídas. Baixe o Apidog para manter as diferenças, afirmações e histórico de execuções em um só lugar.

FAQ

A versão resumida

O V4.1-Flash é menor, mais barato e com pontuação mais alta ao mesmo tempo, pelo menos na tabela do fornecedor, e essa tabela não pode dizer se é melhor para seus prompts. Execute ambos os IDs de modelo através do mesmo conjunto de prompts no Apidog esta semana, guarde as diferenças, e você saberá o que muda em 14 de setembro antes que seus usuários saibam.

button

Pratique o design de API no Apidog

Descubra uma forma mais fácil de construir e usar APIs