Le modèle le moins cher de DeepSeek peut désormais voir. Le 21 août 2026, DeepSeek a lancé deepseek-v4-flash-vision-exp, une version de V4-Flash dotée de capacités de vision qui accepte les images via la même API de production, au même prix que le modèle textuel uniquement, chaque image étant facturée pour un maximum de 384 jetons d'entrée. La note de publication officielle le présente clairement : mêmes capacités textuelles que V4-Flash, plus une compréhension des images que DeepSeek affirme rapprocher ses performances d'agent multimodal de celles d'Opus 4.8.
Ce guide explique ce qu'est le modèle, ce que signifie « Exp » dans le nom pour une utilisation en production, les trois façons d'envoyer des images, les limites à connaître, et comment tester correctement les requêtes multimodales. Étant donné que les requêtes de vision mélangent les types de contenu et augmentent rapidement en taille, ce sont exactement le genre d'appels API qu'il vaut mieux construire dans Apidog plutôt que d'éditer manuellement du JSON dans un terminal.
Qu'est-ce que deepseek-v4-flash-vision-exp
Le modèle est V4-Flash-0731 avec un encodeur d'images attaché. Selon DeepSeek, il correspond au modèle de base sur les tâches textuelles, y compris les charges de travail des agents, le raisonnement et la connaissance du monde, vous pouvez donc l'interchanger sans perdre les fonctionnalités de V4-Flash. L'annonce sur OpenRouter le décrit comme un modèle de mélange d'experts sparse avec 13 milliards de paramètres actifs sur un total de 284 milliards.
Le contexte important : V4-Flash est la ligne budgétaire de DeepSeek. Nous avons couvert le modèle de texte lors de son lancement dans notre guide API DeepSeek V4-Flash, et l'économie n'a pas changé. La vision à prix flash sous-cote presque toutes les API multimodales sur le marché, c'est pourquoi l'affirmation « proche d'Opus 4.8 sur les benchmarks d'agents multimodaux », la propre formulation de DeepSeek, a attiré l'attention. Traitez les affirmations de benchmark des fournisseurs comme des affirmations ; exécutez vos propres évaluations sur vos propres documents avant de migrer quoi que ce soit.
Malgré l'étiquette expérimentale, ce n'est pas un jouet de bac à sable. Le modèle fonctionne sur des points de terminaison d'API de production avec les mêmes limites de débit et SLA que les autres modèles V4, et il n'y a pas de liste d'attente ni de demande d'accès spéciale.
Tarification : tarifs flash, images incluses
La grille tarifaire est identique à celle de deepseek-v4-flash (texte uniquement), selon la page de tarification de DeepSeek :
| Heures creuses | Heures de pointe | |
|---|---|---|
| Entrée, cache hit (par 1M jetons) | $0.007 | $0.014 |
| Entrée, cache miss (par 1M jetons) | $0.22 | $0.44 |
| Sortie (par 1M jetons) | $0.66 | $1.32 |
Les images sont tokenisées pour la facturation à hauteur de 384 jetons chacune et facturées au tarif d'entrée. Au prix de pointe de cache-miss, une image à coût plein coûte environ 0,00017 $. Mille images coûtent moins cher qu'un café.
Deux comportements de tarification sont hérités du modèle textuel. Les tarifs en heures creuses sont la moitié des tarifs de pointe, les heures de pointe étant de 01:00 à 04:00 et de 06:00 à 10:00 UTC les jours de semaine, de sorte que les tâches de vision par lots planifiées en dehors de cette fenêtre coûtent deux fois moins cher. Et la mise en cache de contexte s'applique aux entrées répétées, ce qui est important lorsque vous renvoyez le même prompt système autour d'images variées. La page de tarification indique une fenêtre de contexte de 1M de jetons pour la ligne V4, avec une sortie plafonnée bien en dessous en pratique.
Trois façons d'envoyer une image
Le modèle fonctionne via le point de terminaison standard de DeepSeek pour les Chat Completions à https://api.deepseek.com/chat/completions (les appels de style Messages et Responses sont également pris en charge, comme l'a établi le déploiement de l'API V4-Flash Responses). Les images sont contenues dans le tableau content d'un message utilisateur, et vous disposez de trois options de livraison.
1. Base64 intégré. Encodez l'image en tant qu'URL de données. Simple, autonome et plafonné à 32 MiB par image :
import base64
from openai import OpenAI
client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
with open("invoice.png", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extract the line items and totals as JSON."},
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
]
}]
)
print(response.choices[0].message.content)
2. URL externe. Passez un lien publiquement accessible (jusqu'à 8 192 caractères) au lieu d'encoder :
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}
3. Référence API de fichiers. Téléchargez une fois, réutilisez par ID. L'API de fichiers de DeepSeek accepte désormais les téléchargements d'images gratuitement, et une référence file_id évite de retélécharger la même image pour différentes requêtes, avec un plafond plus élevé de 64 MiB par image :
{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}
Utilisez Base64 pour les appels ponctuels, les URL lorsque vos images résident déjà sur un CDN, et les ID de fichier pour tout flux de travail qui utilise la même image plus d'une fois.
Le paramètre detail
Un champ detail optionnel sur chaque image contrôle le prétraitement :
"low": réduit l'échelle à 512x512. Le moins cher et le plus rapide, convient pour les questions de classification."high"/"original": conserve les dimensions originales, pour les documents denses et le petit texte."auto": laisse l'API décider.
En interne, les images sont normalisées vers environ 800x800 pour le comptage des jetons, ce qui explique le plafond de 384 jetons par image. Si vous effectuez un travail proche de l'OCR sur des reçus ou des tableaux de bord, testez "low" par rapport à "high" sur votre corpus réel ; la différence de coût est faible à ces prix, mais la différence de précision peut être importante.
Limites à connaître avant la production
| Contrainte | Valeur |
|---|---|
| Max images par requête | 600 |
| Taille d'image inline (base64) | 32 MiB |
| Taille d'image API de fichiers | 64 MiB |
| Corps de requête total | 48 MiB |
| Dimensions de l'image | 8 192 px par côté (4 096 px lorsqu'une requête contient 15+ images) |
| Longueur de l'URL externe | 8 192 caractères |
| Placement de l'image | messages user uniquement |
Cette dernière ligne est un véritable générateur d'erreurs 400 : les images dans les messages system ou assistant sont rejetées. Les requêtes multi-images sont prises en charge et s'entrelacent librement avec le texte, ce qui rend le modèle utilisable pour les boucles d'agents qui prennent des captures d'écran, raisonnent et agissent. Si vous orchestrez ces boucles, DeepSeek a intégré le support natif de ce modèle dans DeepSeek Harness 0.1.1 le même jour ; notre aperçu de DeepSeek Harness couvre cette pile. Notez également que l'appel d'outils fonctionne parallèlement à la vision, comme le flux du modèle textuel décrit dans notre guide d'appel de fonctions.
Ce que signifie « Exp » pour vous
Le suffixe est un étiquetage honnête, pas un mur de paiement. Attendez-vous à ce que le modèle soit révisé ou remplacé à court terme, comme cela a déjà été le cas pour les points de terminaison expérimentaux de DeepSeek. Mesures de précaution pratiques :
- Ne codez pas en dur l'ID du modèle à douze endroits. Placez
deepseek-v4-flash-vision-expdans une valeur de configuration ou une variable d'environnement unique. - Maintenez une solution de repli textuelle uniquement. Étant donné que le modèle correspond à
deepseek-v4-flashpour le texte, acheminer le trafic sans image vers l'ID stable ne vous coûte rien. - Capturez vos évaluations. Lorsqu'un successeur non expérimental sera disponible, vous voudrez un avant/après sur vos propres tâches, et non sur celles du fournisseur.
Exemple concret : le coût d'un pipeline de documents
Les chiffres rendent la tarification concrète. Supposons que vous traitez 50 000 factures numérisées par mois, une image chacune, avec une instruction de 200 jetons et environ 400 jetons de sortie JSON par appel :
- Entrée d'image : 50 000 x 384 jetons = 19,2M jetons. Aux tarifs de pointe de cache-miss (0,44 $/1M), cela représente 8,45 $.
- Entrée de texte : 50 000 x 200 = 10M jetons, environ 4,40 $ en pointe. Avec la mise en cache de contexte sur le bloc d'instructions répété, la majeure partie de cela tombe au taux de cache-hit (0,014 $/1M), soit environ 0,14 $.
- Sortie : 50 000 x 400 = 20M jetons à 1,32 $/1M, soit 26,40 $.
Total : environ 35 à 40 $ par mois aux tarifs de pointe, et environ la moitié si le lot est exécuté en dehors des plages horaires de semaine de 01:00 à 10:00 UTC. Les jetons de sortie dominent, ce qui est la leçon utile : avec des images aussi bon marché, vous optimisez un pipeline de vision en resserrant le format de réponse, et non en réduisant l'échelle des images. Solliciter un JSON compact au lieu de descriptions en prose réduit la facture plus que tout prétraitement d'image ne le fera.
Ce profil de coût explique également pourquoi le modèle change le calcul pour les boucles d'agents. Un cycle capture d'écran-raisonnement-action qui était trop coûteux pour être exécuté en continu sur les modèles multimodaux phares devient viable à 384 jetons par image.
Tester les requêtes multimodales dans Apidog
Les requêtes de vision sont fastidieuses à itérer manuellement : les blobs Base64 rendent le JSON brut illisible, et comparer les paramètres detail signifie jongler avec des charges utiles presque identiques. Une boucle plus propre :
- Sauvegardez la requête une fois dans un projet Apidog, avec
{{model_id}},{{detail}}et la charge utile de l'image comme variables. Changer les images de test ou les niveaux de détail devient un simple changement dans un menu déroulant. - Scriptez l'encodage. Un script pré-requête lit l'image et injecte la chaîne Base64, de sorte que le corps de la requête visible reste lisible.
- Vérifiez la structure, pas les impressions. Si vous demandez une sortie JSON (éléments de ligne, descriptions de boîtes englobantes, valeurs de graphique), ajoutez des assertions qui analysent la réponse et vérifient les champs. Cela transforme le « le modèle semble correct » en un résultat réussite/échec que vous pouvez réexécuter après chaque révision du modèle Exp.
- Simulez la forme de la réponse pour votre interface utilisateur pendant que le prompt est encore en cours de réglage ; la simulation intelligente d'Apidog sert le schéma sans consommer d'appels API.
Téléchargez Apidog gratuitement et l'ensemble de l'installation prend quelques minutes ; le réexécuter lorsque DeepSeek révise le modèle expérimental se fait en un clic.
FAQ
deepseek-v4-flash-vision-exp est-il gratuit ? Non, mais c'est presque ça. Il est facturé exactement aux tarifs flash du modèle textuel, avec des images plafonnées à 384 jetons d'entrée chacune. Le stockage d'images via l'API de fichiers de DeepSeek est gratuit ; vous ne payez que lorsque les images entrent dans une requête.
Remplace-t-il deepseek-v4-flash ? Non. Le modèle textuel reste l'ID stable. La version de vision le correspond sur les tâches textuelles, vous pouvez donc consolider sur l'ID de vision si vous acceptez les changements expérimentaux, mais le modèle conservateur est d'y acheminer uniquement le trafic contenant des images.
Puis-je l'utiliser via le format d'API de style Anthropic ? Oui. Les points de terminaison V4 de DeepSeek acceptent les appels au format Chat Completions, Messages et Responses, de sorte que les clients existants sur l'un des trois styles peuvent ajouter des blocs d'image sans changer de dialecte de requête. Notre guide détaillé de l'API V4 Pro présente les mécanismes de point de terminaison partagés au sein de la famille.
Comment la tarification se compare-t-elle à GPT ou Claude Vision ? À 0,22 $ à 0,44 $ par million de jetons d'entrée avec des images de 384 jetons, c'est un ordre de grandeur inférieur aux tarifs multimodaux phares. La question ouverte est la précision sur votre charge de travail, ce à quoi sert le scénario d'évaluation ci-dessus.
Conclusion
DeepSeek continue d'exécuter la même stratégie : prendre la capacité pour laquelle tout le monde facture des tarifs premium, la proposer à des prix flash, et l'étiqueter honnêtement pendant sa stabilisation. deepseek-v4-flash-vision-exp vous offre la compréhension d'images sur des points de terminaison de production pour des fractions de centime par image, avec trois chemins d'entrée et des limites réelles que vous pouvez prendre en compte dans votre conception. Construisez la requête une fois dans Apidog, épinglez vos assertions, et vous serez prêt à utiliser le modèle Exp dès aujourd'hui et à juger son successeur le jour de son lancement.
