DeepSeek a lancé l'API officielle DeepSeek-V4-Flash ce matin. L'annonce a été faite le 31 juillet 2026, et les notes de version précisent trois choses : les capacités d'agent du modèle ont été sérieusement améliorées, il prend désormais en charge nativement le format API de réponses d'OpenAI, et il fonctionne avec Codex dès le premier jour.
Si vous appeliez deepseek-v4-flash depuis avril, vous utilisiez la version préliminaire. Cette version fait passer le modèle à sa version officielle, DeepSeek-V4-Flash-0731, et vous bénéficiez de la mise à jour sans changer une seule ligne de code. Le nom du modèle reste le même.
Ce guide explique tout : comment obtenir une clé, effectuer votre premier appel, activer et désactiver le mode de réflexion, et à quoi ressemble la tarification de la bêta publique. Si vous êtes nouveau dans la gamme DeepSeek, commencez par Qu'est-ce que DeepSeek V4 ? pour un aperçu de la famille, puis revenez ici.
Ce qui a réellement été livré le 31 juillet
Selon le journal des modifications officiel, cette version ne concerne que l'API. L'application DeepSeek et les modèles web restent inchangés, et l'API V4-Pro reste également inchangée. Voici le résumé :
- DeepSeek-V4-Flash-0731 est la version officielle de la gamme V4-Flash, désormais en bêta publique sur l'API.
- Même architecture et taille que V4-Flash-Preview. DeepSeek indique que le modèle a seulement été ré-entraîné, donc les gains proviennent de l'entraînement, et non d'un réseau plus grand.
- Les benchmarks d'agent ont dépassé V4-Pro-Preview. DeepSeek rapporte Terminal Bench 2.1 à 82.7, Cybergym à 76.7, Toolathlon vérifié à 70.3, et DeepSWE à 54.4. Ce sont les propres chiffres publiés par DeepSeek, testés avec leur système à plein effort.
- Prise en charge native de l'API de réponses et intégration officielle de Codex. Nous couvrons les deux en détail dans DeepSeek-V4-Flash prend désormais en charge l'API de réponses et Codex.
- La version officielle de DeepSeek-V4-Pro "suivra bientôt", selon le journal des modifications. Le support de l'API de réponses et de Codex pour V4-Pro est attendu début août 2026.
Une note d'honnêteté : l'affirmation principale du benchmark (« dépassant de loin V4-Pro-Preview ») provient de l'évaluation propre à DeepSeek, et deux des benchmarks listés (DSBench-FullStack et DSBench-Hard) sont des ensembles de tests internes. Des chiffres indépendants mettront quelques jours à apparaître.

Étape 1 : Obtenez votre clé API
Rendez-vous sur la Plateforme DeepSeek, connectez-vous, et créez une clé depuis la page Clés API. Les clés commencent par sk-. Stockez-la comme variable d'environnement plutôt que de la coder en dur :
export DEEPSEEK_API_KEY="sk-your-key-here"
L'API DeepSeek est compatible avec les formats d'API OpenAI et Anthropic, vous n'avez donc pas besoin d'un SDK spécifique à DeepSeek. Deux URL de base sont importantes :
| Format | URL de base |
|---|---|
| Compatible OpenAI | https://api.deepseek.com |
| Compatible Anthropic | https://api.deepseek.com/anthropic |
Étape 2 : Effectuez votre premier appel
La vérification rapide la plus simple est curl :
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Summarize what changed in DeepSeek-V4-Flash-0731."}
],
"stream": false
}'
Le même appel via le SDK Python d'OpenAI :
# pip3 install openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Write a Python function that validates an email address."}
],
stream=False
)
print(response.choices[0].message.content)
Et Node.js :
// npm install openai
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [{ role: "user", content: "Hello!" }],
});
console.log(completion.choices[0].message.content);
Puisque le nom de modèle deepseek-v4-flash pointe désormais vers la version 0731, toute intégration existante que vous avez développée à partir de la préversion récupère automatiquement le nouveau modèle. Rien à migrer.
Étape 3 : Contrôlez le mode de réflexion et l'effort de raisonnement
V4-Flash prend en charge un mode sans réflexion et un mode de réflexion, le mode de réflexion étant la valeur par défaut. Vous le contrôlez avec le paramètre thinking, et vous pouvez ajuster la profondeur avec reasoning_effort :
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Plan a database migration from MySQL to Postgres."}],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}}
)
Deux comportements à connaître avant d'ajuster les paramètres :
temperatureettop_pn'ont aucun effet lorsque le mode de réflexion est activé.- La complétion FIM (remplissage au milieu, toujours en bêta) ne fonctionne qu'en mode sans réflexion.
Pour les points d'API sensibles à la latence, comme l'autocomplétion, désactivez la réflexion. Pour les boucles d'agent et les tâches de débogage complexes, maintenez-la activée et augmentez le niveau d'effort.
Étape 4 : Diffusez la réponse en continu (stream)
Définissez stream: true et l'API renverra des événements envoyés par le serveur (SSE). Si vous n'avez jamais débogué de charges utiles SSE auparavant, notre guide sur le streaming des réponses LLM avec les événements envoyés par le serveur couvre le format en détail.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Explain connection pooling."}],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Tarification pendant la bêta publique
Selon la page officielle Modèles et Tarification, V4-Flash reste agressivement abordable :
| Élément | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Entrée, succès de cache (par 1M jetons) | $0.0028 | $0.003625 |
| Entrée, échec de cache (par 1M jetons) | $0.14 | $0.435 |
| Sortie (par 1M jetons) | $0.28 | $0.87 |
| Longueur de contexte | 1M jetons | 1M jetons |
| Sortie maximale | 384K | 384K |
| Limite de concurrence | 2,500 | 500 |
Trois remarques sur la tarification :
- La mise en cache du contexte est automatique, et un succès de cache coûte 50 fois moins cher qu'un échec. Les sessions d'agent de longue durée qui réutilisent une invite système en bénéficient énormément.
- DeepSeek a annoncé une politique d'heures de pointe/creuses : l'utilisation aux heures de pointe (9h00-12h00 et 14h00-18h00 heure de Pékin) sera facturée 2 fois le prix normal. Au 31 juillet, la documentation indique que la date d'entrée en vigueur est « sujette à l'annonce officielle », donc ce n'est pas encore actif. Surveillez la page de tarification.
- La limite de concurrence est révélatrice : 2 500 requêtes concurrentes pour Flash contre 500 pour Pro. DeepSeek a conçu ce modèle pour être sollicité intensivement par des flottes d'agents.
Pour une image plus complète des coûts de la famille V4, y compris l'historique de la baisse de prix permanente du V4-Pro, consultez notre analyse des tarifs de l'API DeepSeek V4.
Tester et déboguer l'API dans Apidog
Un simple curl fonctionne pour un test de base, mais dès que vous comparez la sortie avec ou sans mode de réflexion, ou que vous observez comment le modèle diffuse les appels d'outils, vous voulez de la visibilité. Voici un flux de travail qui prend environ cinq minutes dans Apidog :

- Créez un projet et ajoutez le point d'API. Ajoutez
POST https://api.deepseek.com/chat/completions(ou importez une spécification compatible OpenAI pour que tous les points d'API arrivent en même temps). - Stockez la clé comme variable d'environnement. Placez
DEEPSEEK_API_KEYdans un environnement Apidog et référencez-la dans l'en-tête d'autorisation commeBearer {{DEEPSEEK_API_KEY}}. Basculer entre une clé de test et une clé de production se fait d'un simple clic. - Envoyez et inspectez. Pour les appels en streaming, Apidog affiche les événements SSE au fur et à mesure qu'ils arrivent, vous permettant d'observer le contenu de raisonnement et le contenu de réponse arriver sous forme de deltas séparés au lieu de devoir déchiffrer un mur de lignes brutes
data:. - Sauvegardez les variantes comme cas de test. Conservez une requête enregistrée avec le mode de réflexion activé et une autre sans, puis réexécutez les deux après chaque mise à jour du modèle. Lorsque DeepSeek déploiera la prochaine mise à jour silencieuse de
deepseek-v4-flash, vous saurez en un clic si vos invites se comportent toujours comme prévu.
Téléchargez Apidog gratuitement, tout le flux ci-dessus fonctionne avec le plan gratuit.
FAQ
- Dois-je modifier mon code pour obtenir le nouveau modèle ? Non. Le nom de modèle
deepseek-v4-flashsert désormais DeepSeek-V4-Flash-0731. Les intégrations existantes sont mises à jour automatiquement. - Est-ce le même modèle que l'application DeepSeek ? Non. La mise à jour du 31 juillet ne concerne que l'API. Les modèles de l'application et du web restent inchangés.
- Qu'est-il arrivé à deepseek-chat et deepseek-reasoner ? Ces noms de modèles hérités devaient être abandonnés le 24 juillet 2026. Utilisez
deepseek-v4-flashoudeepseek-v4-pro. Notre guide sur comment utiliser l'API DeepSeek V4 couvre la migration. - Puis-je l'utiliser gratuitement ? L'API de DeepSeek est payante à l'utilisation sans niveau gratuit permanent, mais la tarification au succès de cache rend l'expérimentation pratiquement gratuite en pratique. Consultez comment utiliser l'API DeepSeek V4 gratuitement pour les options actuelles.
- V4-Flash fonctionne-t-il avec Codex et l'API de réponses ? Oui, les deux, et c'est le seul modèle DeepSeek à le faire jusqu'à présent. Le support de V4-Pro est attendu début août 2026. Configuration complète dans notre guide sur l'API de réponses et Codex.
En résumé
DeepSeek-V4-Flash-0731 est une sorte de version discrète : même nom de modèle, mêmes prix, même architecture, et un ensemble de scores de benchmark d'agent qui surpassent désormais le plus grand V4-Pro-Preview, du moins selon les propres tests de DeepSeek. Le support de l'API de réponses et l'adaptation à Codex indiquent la cible de ce modèle : les charges de travail d'agents à haute concurrence à des prix qui concurrencent tous les laboratoires occidentaux.
Procurez-vous une clé, pointez votre SDK OpenAI vers https://api.deepseek.com, et soumettez le modèle à votre propre suite de tests avant de faire confiance au tableau des benchmarks. Apidog accélère ce cycle de vérification : enregistrez vos invites comme cas de test une seule fois, réexécutez-les à chaque mise à jour du modèle, et vous ne serez plus jamais surpris par une mise à niveau silencieuse.
