DeepSeek a donné quatre jours aux utilisateurs de deepseek-v4-pro. Le 14 septembre 2026 à 04h00 UTC (12h00 Pékin), chaque requête nommant deepseek-v4-pro sera redirigée vers DeepSeek-V4.1-Flash et facturée aux tarifs de V4.1-Flash. Aucune erreur. Aucun avertissement. Votre facture diminue, et un modèle différent commence à répondre à vos requêtes.
Cette dernière partie est celle à prévoir. La note de publication présente le changement comme une mise à niveau, et selon les propres chiffres de DeepSeek, c'en est une. Mais « redirigé silencieusement » n'est pas la même chose que « testé ». Si votre produit dépend d'une forme particulière d'appel d'outil ou d'un budget de latence que vous avez ajusté pour V4-Pro, vous voudrez savoir ce qui change avant dimanche, pas après.
Ce guide couvre ce que DeepSeek a annoncé, ce qui se passe si vous ne faites rien, une liste de contrôle de migration, et une manière de construire une suite de régression Pro versus Flash dans Apidog afin que la transition soit un non-événement. Pour le modèle lui-même, lisez d'abord ce qu'est DeepSeek-V4.1-Flash.
En bref
- Transition : 14 septembre 2026, 04h00 UTC. Les requêtes
deepseek-v4-prosont redirigées vers V4.1-Flash à partir de ce moment. - Vos appels ne échoueront pas et vous ne paierez pas les prix Pro. L'entrée en cas de cache-miss en période de pointe passe de 1,32 $ à 0,30 $ par million de jetons (77 % de moins) ; la sortie passe de 3,96 $ à 1,20 $ (70 % de moins).
- Renommez vous-même l'ID du modèle en
deepseek-flash, puis re-testez les appels de fonction, la sortie structurée, le streaming et l'effort de raisonnement. - DeepSeek affirme que V4.1-Flash surpasse V4-Pro sur chaque benchmark listé. Ce sont les chiffres du fournisseur. Exécutez vos propres évaluations.
Ce que DeepSeek a annoncé le 10 septembre
L'entrée du journal des modifications du 10 septembre couvre deux choses : la disponibilité générale de V4.1-Flash sur l'API, et la mise hors service de V4-Pro quatre jours plus tard.

Concernant V4-Pro, le libellé est direct. DeepSeek affirme que V4.1-Flash « a surpassé de manière exhaustive V4 Pro en termes de performances, de coût, de vitesse et de temps total », citant des « tests effectués par plusieurs parties ». À partir du 14 septembre à 04h00 UTC, les requêtes vers deepseek-v4-pro seront traitées par V4.1-Flash et facturées comme V4.1-Flash. Il n'y a pas de période de grâce où Pro continue de fonctionner sous un nom hérité.
Le nettoyage de la nomenclature va au-delà de Pro :
| Nom du modèle | Statut après le 10 septembre |
|---|---|
deepseek-flash |
Nouvel ID canonique pour V4.1-Flash |
deepseek-v4-flash |
Toujours accepté, servi par V4.1-Flash |
deepseek-v4-flash-vision-exp |
Toujours accepté, servi par V4.1-Flash |
deepseek-v4-pro |
Servi par V4-Pro jusqu'au 14 septembre 04h00 UTC, puis redirigé vers V4.1-Flash |
V4-Flash et V4-Flash-Vision-Exp en tant que modèles sont retirés ; seuls leurs noms subsistent en tant qu'alias. Les URL de base ne changent pas : https://api.deepseek.com pour le format compatible OpenAI et https://api.deepseek.com/anthropic pour le format compatible Anthropic. Le guide d'utilisation de l'API V4.1-Flash couvre en détail le nouvel ID de modèle, le contrôle du raisonnement et l'entrée d'image.
Que se passe-t-il si vous ne faites rien
Version courte : votre intégration continue de fonctionner et devient moins chère. Version longue : cinq choses changent sans que vous ne fassiez rien.
Un modèle différent répond. V4.1-Flash est un MoE de 552 milliards de paramètres avec une nouvelle architecture Causal Encoder-Decoder : 40 couches, 20 encodeurs et 20 décodeurs, 8 milliards de paramètres actifs pendant le préremplissage et 16 milliards pendant le décodage. Vos requêtes atteignent désormais un budget de paramètres actifs différent et une conception d'attention différente (Compressed Sparse Attention 2). Attendez-vous à une phraséologie différente, à une verbosité par défaut différente et, occasionnellement, à des décisions différentes sur les appels d'outils limites.
Le plafond de sortie est le même, les paramètres recommandés ne le sont pas. Les deux modèles listent 1 million de contexte et 384 000 jetons de sortie maximum. La fiche du modèle V4.1-Flash recommande une température de 1,0, un top_p de 0,95 ou 1,0, et un maximum de jetons de 256 000 ou plus. Si vous avez défini un max_tokens strict sur V4-Pro pour limiter les coûts, vérifiez si la sortie de raisonnement est maintenant tronquée avant que la réponse n'arrive.
L'effort de raisonnement fonctionne sur une échelle différente. DeepSeek décrit l'effort de raisonnement de V4.1-Flash comme « contrôlable en continu » sur une échelle de 1 à 100. V4-Flash acceptait reasoning_effort plus extra_body={"thinking": {"type": "enabled"}}. La manière dont l'échelle de 1 à 100 se traduit en paramètre API est à [VÉRIFIER] par rapport à la documentation actuelle ; ne supposez pas qu'un niveau nommé comme `"high"` signifie la même profondeur que sur Pro.
La tarification change en votre faveur, avec une fenêtre de pointe. Les heures de pointe sont du lundi au vendredi, de 01h00 à 04h00 et de 06h00 à 10h00 UTC. Les heures creuses représentent la moitié des heures de pointe. Le trafic Pro redirigé paie les tarifs Flash dans les deux fenêtres.
La marge de concurrence augmente. La limite de V4-Pro était de 500 requêtes concurrentes. Celle de Flash est de 2 500. Le trafic redirigé hérite de la limite supérieure, alors réévaluez toute temporisation côté client ajustée à 500.
Liste de contrôle de la migration
Faites-le dans l'ordre. Ensemble, cela transforme une redirection silencieuse en une publication délibérée.
- Renommez l'ID du modèle. Recherchez
deepseek-v4-prodans votre base de code et votre configuration et remplacez-le pardeepseek-flash. Faites cela même si l'alias continue de fonctionner : des ID explicites facilitent la lecture des incidents ultérieurement.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-flash", # was "deepseek-v4-pro"
messages=[
{"role": "system", "content": "You triage support tickets. Return a JSON object with priority, team, and summary."},
{"role": "user", "content": "Customer reports checkout returns 502 after applying a discount code."},
],
response_format={"type": "json_object"},
)
print(response.choices[0].message.content)
- Vérifiez les paramètres d'effort de raisonnement. Listez chaque endroit où vous avez défini
reasoning_effortou un commutateur de réflexion. Décidez par point de terminaison si vous voulez de la profondeur ou de la latence, puis testez chacun par rapport à la nouvelle échelle au lieu de conserver l'ancienne valeur. - Réexécutez les tests d'appel de fonction et de sortie structurée. Le formatage des arguments d'appel d'outil est l'endroit où les remplacements de modèles sont les plus difficiles. Si vous avez écrit des tests lorsque vous avez configuré l'appel de fonction sur V4-Pro, exécutez-les maintenant contre
deepseek-flash. Si ce n'est pas le cas, le workflow Apidog ci-dessous vous en fournit un ensemble. - Vérifiez vos analyseurs de streaming. V4.1-Flash diffuse les deltas de raisonnement et les deltas de réponse séparément en mode réflexion. Confirmez que votre gestionnaire SSE ne les concatène pas et que votre minuteur du « premier jeton » mesure ce que vous pensez qu'il mesure.
- Réinitialisez la latence et les coûts. Enregistrez la latence p50 et p95 ainsi que les jetons par requête sur V4-Pro cette semaine, puis faites de même sur
deepseek-flash. Vous voudrez ces deux chiffres lorsque quelqu'un vous demandera pourquoi le tableau de bord a changé lundi. - Mettez à jour les tableaux de bord et les budgets. Les alertes de coût calibrées à 3,96 $ de sortie en période de pointe se tairont une fois que vous paierez 1,20 $, et un budget qui ne se déclenche jamais est un budget que personne ne regarde. Réinitialisez les seuils aux tarifs indiqués sur la page de tarification et corrigez toute ventilation par modèle qui filtre sur l'ancien ID.
Si vous utilisez les formats d'API compatibles Anthropic ou Responses au lieu des complétions de chat, les mêmes étapes s'appliquent ; la comparaison des formats d'API V4-Pro montre à quoi ressemble chaque requête afin que vous puissiez mapper les champs.
V4-Pro vs V4.1-Flash en un coup d'œil
Les chiffres des benchmarks sont rapportés par DeepSeek, tirés de la fiche du modèle V4.1-Flash. Les prix sont en USD par million de jetons, effectifs à partir du 10 septembre 2026.
| deepseek-v4-pro | deepseek-flash (V4.1) | |
|---|---|---|
| Paramètres actifs | Non mentionné sur la fiche V4.1 | 8B pré-remplissage / 16B décodage |
| HumanEval | 76.8 | 79.4 |
| GSM8K | 92.6 | 93.0 |
| DeepSWE v1.1 | 62.7 | 74.2 |
| Terminal-Bench 2.1 | 87.9 | 90.6 |
| Entrée, cache hit (heures creuses / pointe) | 0,022 $ / 0,044 $ | 0,003 $ / 0,006 $ |
| Entrée, cache miss (heures creuses / pointe) | 0,66 $ / 1,32 $ | 0,15 $ / 0,30 $ |
| Sortie (heures creuses / pointe) | 1,98 $ / 3,96 $ | 0,60 $ / 1,20 $ |
| Contexte / sortie max | 1M / 384K | 1M / 384K |
| Limite de concurrence | 500 | 2 500 |
Le plus grand écart concerne DeepSWE, en hausse de 11,5 points. Le plus petit est GSM8K, en hausse de 0,4. Si votre charge de travail ressemble à des mathématiques de niveau scolaire, attendez-vous à une parité ; si elle ressemble à des modifications de code multi-fichiers, les chiffres de DeepSeek indiquent un gain. La ventilation en trois parties incluant V4-Flash se trouve dans V4.1-Flash vs V4-Pro vs V4-Flash.
Le risque : les benchmarks des fournisseurs mesurent des tâches de fournisseur
Chaque chiffre de ce tableau provient de DeepSeek. « Tests effectués par plusieurs parties » est la formulation de DeepSeek, et les parties ne sont pas nommées dans la note de publication. Cela ne rend pas les chiffres faux. Cela signifie qu'ils ont été mesurés sur des suites de benchmarks, et non sur vos propres requêtes, vos schémas d'outils ou les entrées désordonnées de vos utilisateurs.
Un modèle peut obtenir un score plus élevé sur Terminal-Bench et quand même modifier la façon dont il formate un argument d'appel d'outil dont votre analyseur dépend. Des jetons de sortie moins chers ne sont d'aucune aide si le modèle en écrit deux fois plus. La seule façon de le savoir est de faire passer votre propre trafic par les deux modèles tant qu'ils existent. Vous avez jusqu'au 14 septembre.
Construisez une suite de régression dans Apidog avant la transition
Voici un workflow dans Apidog qui vous offre une comparaison reproductible entre Pro et Flash et transfère l'exécution à l'intégration continue (CI).
- Importez vos requêtes V4-Pro existantes. Importez une spécification OpenAPI compatible OpenAI, ou collez les commandes curl que vous utilisez en production. Placez
DEEPSEEK_API_KEYdans un environnement et référencez-le commeBearer {{DEEPSEEK_API_KEY}}dans l'en-tête d'autorisation. Ajoutez une deuxième variable,{{MODEL_ID}}, définie surdeepseek-v4-pro. - Dupliquez chaque requête avec
deepseek-flash. Définissez{{MODEL_ID}}surdeepseek-flashdans un deuxième environnement, ou codez en dur les deux IDs dans des requêtes jumelées. Mêmes prompts, même tableau d'outils, mêmemax_tokens. La seule différence devrait être le modèle. - Ajoutez des assertions sur la forme JSON et la structure d'appel d'outil. Pour la sortie structurée, affirmez que
choices[0].message.contentest parsé comme JSON et contient les clés que vous attendez. Pour l'appel de fonction, affirmez quechoices[0].message.tool_calls[0].function.nameest égal à l'outil que vous attendez et que lesargumentssont parsés. Ces vérifications détectent les dérives de format silencieuses. - Exécutez les deux comme un scénario de test unique. Enchaînez les requêtes Pro et Flash dans un seul scénario afin que chaque exécution produise un rapport. Incluez une requête de streaming avec
stream: true; Apidog rend les événements SSE un par un, afin que vous puissiez voir si les deltas de raisonnement et de réponse arrivent comme votre analyseur l'attend. - Comparez les résultats. Comparez les deux moitiés du rapport : le taux de réussite des assertions, le temps de réponse et
usage.completion_tokens. Un modèle qui réussit toutes les assertions mais émet 40 % de jetons de sortie en plus modifie votre calcul de coûts, et vous le verrez avant la facture. - Planifiez-le dans l'intégration continue (CI) avec
apidog-cli. Exécutez le scénario depuis votre pipeline quotidiennement jusqu'au 14 septembre et continuez à le faire après. Une fois que Pro aura disparu, la partie Pro renverra également des réponses Flash et la différence s'effondrera à zéro : confirmation que la transition a eu lieu et que vos assertions sont toujours valides.
Téléchargez Apidog pour configurer cela. Le workflow se trouve dans un projet partagé, de sorte que le responsable de la facture et le responsable des requêtes lisent le même rapport.
FAQ
- Mes appels V4-Pro échoueront-ils le 14 septembre ? Non. Les requêtes qui spécifient
deepseek-v4-prosont redirigées vers V4.1-Flash. Vous recevez une réponse 200 et une réponse de V4.1-Flash. Le mode d'échec est comportemental, pas un code d'erreur. - Serai-je facturé aux prix V4-Pro après la transition ? Non. Les requêtes redirigées sont facturées aux tarifs de V4.1-Flash : en période de pointe, 0,30 $ au lieu de 1,32 $ par million de jetons d'entrée en cas de cache-miss et 1,20 $ au lieu de 3,96 $ par million de jetons de sortie.
- Dois-je renommer l'ID en
deepseek-flashou conserverdeepseek-v4-pro? Renommez. L'alias fonctionne, mais un ID explicite signifie que vos journaux, tableaux de bord et rapports de coûts indiquent ce qui est appelé. - La configuration V4-Pro-0813 est-elle toujours applicable ? La clé, l'URL de base et la forme de la requête du guide de l'API V4-Pro-0813 restent inchangées. Ce qui change, c'est le modèle sous-jacent et le contrôle de l'effort de raisonnement, alors re-testez au lieu de supposer.
- V4.1-Flash est-il moins bon que V4-Pro en quoi que ce soit ? Les benchmarks publiés par DeepSeek montrent des gains sur chaque tâche listée. Des résultats indépendants n'étaient pas disponibles au moment de la publication. Considérez « pas moins bon » comme une affirmation à vérifier.
Quatre jours suffisent
La migration est un simple changement de chaîne de caractères plus une exécution de test. Le changement de chaîne prend une minute. L'exécution du test vous dira si le modèle pour lequel vous paierez la semaine prochaine se comporte comme celui autour duquel vous avez conçu votre solution. Construisez la suite, exécutez-la tant que deepseek-v4-pro résout toujours vers Pro, et lisez la différence. Si elle est propre, vous obtenez une facture 70 % moins chère et cinq fois la concurrence gratuitement. Si ce n'est pas le cas, vous l'aurez découvert selon votre emploi du temps, pas celui de DeepSeek.
