DeepSeek-V4.1-Flash : Guide Tarification, Tarifs Heures Pleines/Creuses et Calcul du Cache-Hit

Le tableau complet des prix en USD et en CNY pour deepseek-flash, les réductions en pourcentage par rapport à V4-Flash et au réacheminement V4-Pro, les créneaux horaires de pointe convertis à votre fuseau horaire, et deux exemples de "cache-hit" avec l'arithmétique présentée.

Medy Evrard

10 September 2026

DeepSeek-V4.1-Flash : Guide Tarification, Tarifs Heures Pleines/Creuses et Calcul du Cache-Hit

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

DeepSeek-V4.1-Flash est devenu généralement disponible sur l'API le 10 septembre 2026, et la note de publication s'accompagnait d'une réduction de prix. L'entrée en cache coûtant désormais 0,003 $ par million de jetons hors pointe, l'entrée sans cache 0,15 $, et la sortie 0,60 $. Quatre jours plus tard, le 14 septembre, DeepSeek commence à acheminer chaque requête deepseek-v4-pro vers V4.1-Flash et à la facturer aux tarifs Flash. Si vous utilisez quoi que ce soit sur l'API DeepSeek, votre facture changera cette semaine, que vous touchiez à votre code ou non.

Cet article est la partie concernant les prix de l'histoire : les tableaux complets en USD et CNY, les changements en pourcentage par rapport à V4-Flash et V4-Pro, où se situent les fenêtres de pointe dans votre fuseau horaire, et deux exemples de cache-hit avec l'arithmétique affichée. Pour le modèle lui-même, commencez par ce qu'est DeepSeek-V4.1-Flash.

Une mise en garde d'emblée. Chaque chiffre de benchmark dans cet ensemble est une donnée rapportée par DeepSeek à partir de la carte du modèle. Les prix proviennent de la page de tarification, vérifiés le 10 septembre. La dernière section montre comment mesurer vos propres dépenses avec Apidog en lisant le bloc usage sur chaque réponse au lieu de faire confiance à une estimation.

télécharger l'application

En bref

Le tableau des prix complet

Tous les chiffres sont par million de jetons, effectifs à partir du 10 septembre 2026 à 04:00 UTC.

deepseek-flash hors pointe deepseek-flash en pointe deepseek-v4-pro hors pointe deepseek-v4-pro en pointe
Entrée, cache hit $0.003 $0.006 $0.022 $0.044
Entrée, cache miss $0.15 $0.30 $0.66 $1.32
Sortie $0.60 $1.20 $1.98 $3.96
Concurrence 2,500 2,500 500 500

Les colonnes deepseek-v4-pro sont valides encore quatre jours. À partir du 14 septembre à 04:00 UTC (12:00 heure de Pékin), les requêtes vers ce nom de modèle seront servies par V4.1-Flash et facturées selon les deux premières colonnes. Le guide de retrait et de migration de V4-Pro couvre ce qu'il faut tester avant cette date.

Si votre compte est libellé en yuans, la page de tarification zh-cn liste deepseek-flash comme suit :

Hors pointe (CNY) En pointe (CNY)
Entrée, cache hit ¥0.02 ¥0.04
Entrée, cache miss ¥1.00 ¥2.00
Sortie ¥4.00 ¥8.00

Chaque ligne en CNY est la ligne en USD multipliée par environ 6,67. Deux détails que le tableau omet : le caching de contexte est automatique, sans drapeau à définir, et l'identifiant du modèle est maintenant deepseek-flash. Les anciens noms deepseek-v4-flash et deepseek-v4-flash-vision-exp sont toujours résolus mais atterrissent sur V4.1-Flash à ces tarifs.

Ce qui a changé par rapport à V4-Flash et V4-Pro

Le 21 août 2026, deepseek-v4-flash était facturé 0,007 $ / 0,22 $ / 0,66 $ hors pointe (cache hit / cache miss / sortie) et 0,014 $ / 0,44 $ / 1,32 $ en pointe. Le journal des modifications indique que les prix ont été « réduits en conséquence » avec cette version. Voici ce que « en conséquence » signifie, calculé à partir des deux listes :

Ligne d'article V4-Flash (21 août) V4.1-Flash (10 sept.) Réduction
Cache hit, hors pointe $0.007 $0.003 57%
Cache miss, hors pointe $0.22 $0.15 32%
Sortie, hors pointe $0.66 $0.60 9%

Les lignes de pointe portent des pourcentages identiques, puisque les deux listes doublent en pointe. Le schéma est délibéré : la réduction la plus forte concerne les hits de cache, la plus faible la sortie. DeepSeek fixe ses prix pour les boucles d'agents qui relisent un long préfixe à chaque tour, et le cache KV FP4 de V4.1 (890 octets par jeton, environ un quart de l'empreinte de V4-Flash) est ce qui rend un prix de hit de 0,003 $ durable de leur côté.

Pour les utilisateurs de V4-Pro, les chiffres sont plus importants, car la redirection se fait aux tarifs Flash :

DeepSeek affirme que V4.1-Flash « a surpassé de manière exhaustive V4 Pro en termes de performances, de coût, de vitesse et de temps total », une affirmation à vérifier avec vos propres prompts avant le 14. Pour l'évolution plus longue des prix de la famille, y compris la période où DeepSeek a augmenté les prix de l'API, le détail des prix de l'API DeepSeek V4 en retrace l'historique.

Fenêtres de pointe dans votre fuseau horaire

La pointe s'applique du lundi au vendredi uniquement, en deux blocs : de 01:00 à 04:00 UTC et de 06:00 à 10:00 UTC. C'est-à-dire de 9:00 à 12:00 et de 14:00 à 18:00 heure de Pékin. Sept heures de pointe par jour de semaine, 35 par semaine, donc la pointe couvre environ 21 % de la semaine de 168 heures. Tout le reste, y compris tout le samedi et le dimanche, est facturé au tarif hors pointe.

Fenêtre UTC Pékin (UTC+8) Pacifique US (PDT, UTC-7) Europe Centrale (CEST, UTC+2)
Pointe 1 01:00 à 04:00 09:00 à 12:00 18:00 à 21:00 (soir précédent) 03:00 à 06:00
Pointe 2 06:00 à 10:00 14:00 à 18:00 23:00 à 03:00 (nuit) 08:00 à 12:00

Les colonnes du Pacifique et d'Europe Centrale utilisent l'heure d'été. Après le changement d'heure (25 octobre dans l'UE, 1er novembre aux États-Unis), déplacez les deux colonnes une heure plus tôt. Les limites UTC ne bougent jamais.

Une journée de travail sur la côte ouest des États-Unis ne touche jamais un bloc de pointe. Une matinée en Europe centrale se situe dans le bloc de Pointe 2, et un traitement de nuit européen à 03:00 heure locale paie double ; le déplacer à 23:00 CEST (21:00 UTC) le ramène à moitié prix.

Calcul de cache-hit, deux fois

Un hit coûte 1/50 d'un miss (0,003 $ contre 0,15 $), donc le rapport entre les préfixes répétés et les jetons frais détermine votre coût d'entrée plus que le nombre brut de jetons. Si le caching de préfixe est nouveau pour vous, l'introduction au caching de prompt explique ce qui compte comme un préfixe cachable : des octets identiques au début de la requête.

Exemple 1 : une boucle d'agent avec un prompt système de 20K jetons, 1 000 appels en pointe.

Un agent de triage de support utilise un prompt système de 20 000 jetons (politiques, schémas d'outils, exemples peu nombreux), lit 2 000 jetons frais de texte de ticket par appel, et écrit 1 000 jetons de sortie. Sur 1 000 appels :

  1. L'entrée totale est de 1 000 × 22 000 = 22M jetons. La sortie totale est de 1M jetons.
  2. Le premier appel manque tous les 22 000 jetons. Chaque appel ultérieur frappe sur le préfixe de 20 000 jetons et manque ses 2 000 jetons frais.
  3. Jetons frappés : 999 × 20 000 = 19,98M. À 0,006 $ par 1M : 19,98 × 0,006 = 0,12 $.
  4. Jetons manqués : 22 000 + 999 × 2 000 = 2,02M. À 0,30 $ par 1M : 2,02 × 0,30 = 0,61 $.
  5. Sortie : 1M × 1,20 $ = 1,20 $.
  6. Total : 0,12 $ + 0,61 $ + 1,20 $ = 1,93 $.

Sans mise en cache, l'entrée seule coûterait 22 × 0,30 $ = 6,60 $ et le travail coûterait 7,80 $. La mise en cache réduit la facture de 75 %. Exécutez la même boucle hors pointe et chaque ligne est divisée par deux : 0,06 $ + 0,30 $ + 0,60 $ = 0,96 $.

Les mêmes 1 000 appels sur V4-Pro en pointe (hits 0,88 $, misses 2,67 $, sortie 3,96 $) totalisent 7,51 $, le nombre qu'un client Pro devrait comparer à 1,93 $ lorsque la redirection sera effective.

Exemple 2 : un travail par lots avec 10M de jetons de sortie, déplacé hors pointe.

Une équipe de catalogue génère 10 000 descriptions de produits. Chaque appel envoie 1 500 jetons de données produit (unique par article, donc aucun avantage de cache) et reçoit en retour 1 000 jetons de texte. Cela représente 15M jetons d'entrée, tous des misses, et 10M jetons de sortie.

  1. En pointe : entrée 15 × 0,30 $ = 4,50 $. Sortie 10 × 1,20 $ = 12,00 $. Total 16,50 $.
  2. Hors pointe : entrée 15 × 0,15 $ = 2,25 $. Sortie 10 × 0,60 $ = 6,00 $. Total 8,25 $.
  3. Économies rien que grâce à l'horodatage : 8,25 $, sans aucune modification des prompts.

La sortie domine ce travail et a subi la plus petite réduction dans la version, donc la fenêtre hors pointe est le levier le plus important. C'est une fenêtre généreuse : 15 heures chaque jour de semaine à partir de 10:00 UTC, plus 48 heures ininterrompues chaque week-end.

Contexte, sortie, et pourquoi la concurrence fait partie du prix

Les deux noms de modèles ont un contexte de 1M de jetons et une sortie maximale de 384K jetons. La fiche du modèle recommande un nombre maximal de jetons de 256K ou plus, donc définissez ce plafond intentionnellement : une réponse qui atteint 384K jetons de sortie coûte 0,46 $ en pointe, ce qui est acceptable pour une transcription d'agent mais un problème pour l'autocomplétion.

La concurrence est de 2 500 pour Flash contre 500 pour Pro. Elle figure dans un article sur les prix car la remise hors pointe n'a de valeur que si vous pouvez faire passer le travail pendant la fenêtre, et parce que le trafic deepseek-v4-pro redirigé le 14 septembre hérite de la limite Flash : une intégration Pro qui s'alignait auparavant derrière 500 emplacements obtient cinq fois plus de marge de manœuvre sans modification de configuration.

Mesurez les dépenses réelles avec Apidog

Les tableaux de prix vous donnent le tarif. L'objet usage sur chaque réponse vous indique ce qui vous a été facturé. Voici un flux de travail Apidog qui en fait une vérification reproductible.

  1. Ajoutez le point d'accès. Créez POST https://api.deepseek.com/chat/completions, ou importez une spécification OpenAPI compatible OpenAI.
  2. Placez les prix dans les environnements. Créez deux environnements Apidog, deepseek-peak et deepseek-offpeak, chacun contenant DEEPSEEK_API_KEY plus PRICE_HIT, PRICE_MISS et PRICE_OUT comme {{variables}}. Peak contient 0.006 / 0.30 / 1.20 ; off-peak contient 0.003 / 0.15 / 0.60.
  3. Envoyez une fois et lisez usage. DeepSeek divise l'entrée en prompt_cache_hit_tokens et prompt_cache_miss_tokens en plus de completion_tokens [VÉRIFIER]. Enregistrez la requête comme cas de test.
  4. Créez un scénario de test qui affirme le comportement du cache. Enchaînez la requête enregistrée deux fois avec le même prompt système de 20K jetons. À la deuxième étape, assurez-vous que le champ `hit-token` est d'au moins 19 000 et que le coût calculé (hits × {{PRICE_HIT}} + misses × {{PRICE_MISS}} + output × {{PRICE_OUT}}, divisé par 1M) reste dans le budget. Un miss à la deuxième étape signifie que le préfixe a changé, et l'assertion le détecte avant la facture.
  5. Comparez le pic au hors pic. Exécutez le scénario sous chaque environnement et comparez la ligne de coût, ou exécutez-le depuis CI avec apidog-cli selon un calendrier qui chevauche une limite de pic UTC.

Téléchargez Apidog et l'ensemble du scénario, environnements inclus, fonctionne sur le plan gratuit.

Ce que cela implique pour votre facture

V4.1-Flash est moins cher que V4-Flash sur chaque ligne et 70 à 86 % moins cher que les tarifs V4-Pro qu'il remplace. Deux leviers sont importants : gardez votre long préfixe identique en octets afin qu'il frappe le cache, et planifiez le travail par lots en dehors des sept heures de pointe en semaine. Ensuite, enregistrez l'usage à chaque appel, affirmez le nombre de hits, et laissez les chiffres montrer si la réduction a atteint votre facture.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API