L'API DeepSeek-V4-Flash est en ligne : Guide d'utilisation de l'API officielle (Bêta Publique)

DeepSeek-V4-Flash-0731 est disponible en bêta publique. Obtenez une clé API, effectuez votre premier appel, contrôlez le mode de réflexion et découvrez la tarification des requêtes en cache dans ce guide pratique.

Ashley Innocent

Ashley Innocent

31 July 2026

L'API DeepSeek-V4-Flash est en ligne : Guide d'utilisation de l'API officielle (Bêta Publique)

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

DeepSeek a lancé l'API officielle DeepSeek-V4-Flash ce matin. L'annonce a été faite le 31 juillet 2026, et les notes de version précisent trois choses : les capacités d'agent du modèle ont été sérieusement améliorées, il prend désormais en charge nativement le format API de réponses d'OpenAI, et il fonctionne avec Codex dès le premier jour.

Si vous appeliez deepseek-v4-flash depuis avril, vous utilisiez la version préliminaire. Cette version fait passer le modèle à sa version officielle, DeepSeek-V4-Flash-0731, et vous bénéficiez de la mise à jour sans changer une seule ligne de code. Le nom du modèle reste le même.

Ce guide explique tout : comment obtenir une clé, effectuer votre premier appel, activer et désactiver le mode de réflexion, et à quoi ressemble la tarification de la bêta publique. Si vous êtes nouveau dans la gamme DeepSeek, commencez par Qu'est-ce que DeepSeek V4 ? pour un aperçu de la famille, puis revenez ici.

💡
Une fois que vous avez une clé, vous voudrez un moyen rapide de tester les points d'API avant de les intégrer à votre code. Apidog vous permet d'envoyer des requêtes à l'API DeepSeek, d'inspecter les réponses en streaming événement par événement, et de sauvegarder chaque appel fonctionnel comme un test réutilisable. Plus d'informations sur cette configuration ci-dessous.
bouton

Ce qui a réellement été livré le 31 juillet

Selon le journal des modifications officiel, cette version ne concerne que l'API. L'application DeepSeek et les modèles web restent inchangés, et l'API V4-Pro reste également inchangée. Voici le résumé :

Une note d'honnêteté : l'affirmation principale du benchmark (« dépassant de loin V4-Pro-Preview ») provient de l'évaluation propre à DeepSeek, et deux des benchmarks listés (DSBench-FullStack et DSBench-Hard) sont des ensembles de tests internes. Des chiffres indépendants mettront quelques jours à apparaître.

Étape 1 : Obtenez votre clé API

Rendez-vous sur la Plateforme DeepSeek, connectez-vous, et créez une clé depuis la page Clés API. Les clés commencent par sk-. Stockez-la comme variable d'environnement plutôt que de la coder en dur :

export DEEPSEEK_API_KEY="sk-your-key-here"

L'API DeepSeek est compatible avec les formats d'API OpenAI et Anthropic, vous n'avez donc pas besoin d'un SDK spécifique à DeepSeek. Deux URL de base sont importantes :

Format URL de base
Compatible OpenAI https://api.deepseek.com
Compatible Anthropic https://api.deepseek.com/anthropic

Étape 2 : Effectuez votre premier appel

La vérification rapide la plus simple est curl :

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user", "content": "Summarize what changed in DeepSeek-V4-Flash-0731."}
    ],
    "stream": false
  }'

Le même appel via le SDK Python d'OpenAI :

# pip3 install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("DEEPSEEK_API_KEY"),
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Write a Python function that validates an email address."}
    ],
    stream=False
)

print(response.choices[0].message.content)

Et Node.js :

// npm install openai
import OpenAI from "openai";

const openai = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await openai.chat.completions.create({
  model: "deepseek-v4-flash",
  messages: [{ role: "user", content: "Hello!" }],
});

console.log(completion.choices[0].message.content);

Puisque le nom de modèle deepseek-v4-flash pointe désormais vers la version 0731, toute intégration existante que vous avez développée à partir de la préversion récupère automatiquement le nouveau modèle. Rien à migrer.

Étape 3 : Contrôlez le mode de réflexion et l'effort de raisonnement

V4-Flash prend en charge un mode sans réflexion et un mode de réflexion, le mode de réflexion étant la valeur par défaut. Vous le contrôlez avec le paramètre thinking, et vous pouvez ajuster la profondeur avec reasoning_effort :

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Plan a database migration from MySQL to Postgres."}],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}}
)

Deux comportements à connaître avant d'ajuster les paramètres :

Pour les points d'API sensibles à la latence, comme l'autocomplétion, désactivez la réflexion. Pour les boucles d'agent et les tâches de débogage complexes, maintenez-la activée et augmentez le niveau d'effort.

Étape 4 : Diffusez la réponse en continu (stream)

Définissez stream: true et l'API renverra des événements envoyés par le serveur (SSE). Si vous n'avez jamais débogué de charges utiles SSE auparavant, notre guide sur le streaming des réponses LLM avec les événements envoyés par le serveur couvre le format en détail.

stream = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Explain connection pooling."}],
    stream=True
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

Tarification pendant la bêta publique

Selon la page officielle Modèles et Tarification, V4-Flash reste agressivement abordable :

Élément deepseek-v4-flash deepseek-v4-pro
Entrée, succès de cache (par 1M jetons) $0.0028 $0.003625
Entrée, échec de cache (par 1M jetons) $0.14 $0.435
Sortie (par 1M jetons) $0.28 $0.87
Longueur de contexte 1M jetons 1M jetons
Sortie maximale 384K 384K
Limite de concurrence 2,500 500

Trois remarques sur la tarification :

Pour une image plus complète des coûts de la famille V4, y compris l'historique de la baisse de prix permanente du V4-Pro, consultez notre analyse des tarifs de l'API DeepSeek V4.

Tester et déboguer l'API dans Apidog

Un simple curl fonctionne pour un test de base, mais dès que vous comparez la sortie avec ou sans mode de réflexion, ou que vous observez comment le modèle diffuse les appels d'outils, vous voulez de la visibilité. Voici un flux de travail qui prend environ cinq minutes dans Apidog :

  1. Créez un projet et ajoutez le point d'API. Ajoutez POST https://api.deepseek.com/chat/completions (ou importez une spécification compatible OpenAI pour que tous les points d'API arrivent en même temps).
  2. Stockez la clé comme variable d'environnement. Placez DEEPSEEK_API_KEY dans un environnement Apidog et référencez-la dans l'en-tête d'autorisation comme Bearer {{DEEPSEEK_API_KEY}}. Basculer entre une clé de test et une clé de production se fait d'un simple clic.
  3. Envoyez et inspectez. Pour les appels en streaming, Apidog affiche les événements SSE au fur et à mesure qu'ils arrivent, vous permettant d'observer le contenu de raisonnement et le contenu de réponse arriver sous forme de deltas séparés au lieu de devoir déchiffrer un mur de lignes brutes data:.
  4. Sauvegardez les variantes comme cas de test. Conservez une requête enregistrée avec le mode de réflexion activé et une autre sans, puis réexécutez les deux après chaque mise à jour du modèle. Lorsque DeepSeek déploiera la prochaine mise à jour silencieuse de deepseek-v4-flash, vous saurez en un clic si vos invites se comportent toujours comme prévu.

Téléchargez Apidog gratuitement, tout le flux ci-dessus fonctionne avec le plan gratuit.

FAQ

En résumé

DeepSeek-V4-Flash-0731 est une sorte de version discrète : même nom de modèle, mêmes prix, même architecture, et un ensemble de scores de benchmark d'agent qui surpassent désormais le plus grand V4-Pro-Preview, du moins selon les propres tests de DeepSeek. Le support de l'API de réponses et l'adaptation à Codex indiquent la cible de ce modèle : les charges de travail d'agents à haute concurrence à des prix qui concurrencent tous les laboratoires occidentaux.

Procurez-vous une clé, pointez votre SDK OpenAI vers https://api.deepseek.com, et soumettez le modèle à votre propre suite de tests avant de faire confiance au tableau des benchmarks. Apidog accélère ce cycle de vérification : enregistrez vos invites comme cas de test une seule fois, réexécutez-les à chaque mise à jour du modèle, et vous ne serez plus jamais surpris par une mise à niveau silencieuse.

bouton

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API