Mistral est de retour : Le Chonk bat GPT-6 Astra et Claude

Mistral Large 4 atteint 82 % à un test cyber, là où GPT-6 Astra et Claude Opus 5.5 obtiennent presque zéro. Voici pourquoi, avec ses spécifications, son prix de 0,68 $ et ses faiblesses.

Ashley Innocent

Ashley Innocent

6 October 2026

Mistral est de retour : Le Chonk bat GPT-6 Astra et Claude

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Mistral s'était fait discret sur le segment haut de gamme pendant un certain temps. Mistral Large 3 a été lancé en décembre 2025, et depuis lors, la discussion sur la frontière des modèles open-weight a tourné autour de Kimi, DeepSeek, GLM et Qwen. Le 6 octobre 2026, Mistral a répondu avec Mistral Large 4, un modèle de 1 000 milliards de paramètres que l'équipe surnomme « Le Chonk ».

Le chiffre phare est une référence en cybersécurité où Large 4 obtient 82 %, tandis que Claude Opus 5.5 et GPT-6 Astra obtiennent un score proche de zéro. C'est vrai, c'est sur la page de lancement de Mistral, et cela nécessite une phrase de contexte avant de le partager. Cet article vous donne ce contexte, les spécifications, le prix réel, et les domaines où Large 4 est encore en retrait.

En bref

Pourquoi « Mistral est de retour » est justifié

Pendant la majeure partie de 2026, les modèles open-weight les plus performants provenaient de Chine. Mistral a continué à proposer des modèles, avec Medium 3.5, Devstral 2 et Small 4, mais rien qui puisse rivaliser avec les modèles fermés de pointe sur leur propre terrain.

Large 4 change la donne. Mistral affirme qu'il « surpasse significativement tout modèle open-weight développé aux États-Unis ou en Europe », et appuie cette affirmation avec un récit de formation conçu pour le public soucieux de la souveraineté de l'UE. Le modèle a été entraîné de zéro sur 3 800 GPU NVIDIA Grace Blackwell dans les centres de données européens de Mistral, couvre plus de 160 langues, y compris toutes les langues officielles de l'UE, et arrive quelques semaines après un tour de table de série D de 3 milliards d'euros que Mistral qualifie de plus grand tour de capital jamais levé par une entreprise technologique européenne.

Le timing compte aussi. Large 4 est arrivé juste après que Reflection a dévoilé son modèle open-weight Beam, de sorte que la course aux modèles ouverts entre les États-Unis et la Chine compte désormais un troisième concurrent sérieux.

Le titre sur la cybersécurité, et la nuance

Voici le résultat que tout le monde capture d'écran. L'indice Cyber d'Artificial Analysis comprend un test qui demande à un modèle de reproduire une vulnérabilité réelle dans un logiciel open-source, puis de la corriger. Mistral affirme que Large 4 obtient **82 %, le score le plus élevé de tous les modèles**.

Puis la nuance, selon les propres mots de Mistral : « Plusieurs modèles fermés de premier plan, dont Claude Opus 5.5 et GPT-6 Astra, obtiennent un score proche de zéro sur le même test car ils refusent d'effectuer la tâche. »

Alors lisez-le de cette façon :

Affirmation Ce que cela signifie réellement
« Large 4 bat Astra et Opus 5.5 en cybersécurité » Sur ce test précis, les modèles fermés refusent de répondre. Large 4 répond et réussit généralement.
« Large 4 est le meilleur modèle de piratage » Non établi. Un refus est un choix politique, pas un plafond de capacité.
« Large 4 est dangereux » Également non établi. Mistral signale que son taux de refus moyen sur les requêtes cyber de JailbreakBench, StrongREJECT et AgentHarm est plus élevé que celui de tout autre modèle open-weight.

Il y a une réelle capacité derrière ce titre. Large 4 résout également 93 % de Cybench, un ensemble de 40 exercices de capture du drapeau, que Mistral considère comme l'un des scores les plus élevés rapportés pour un modèle open-weight. Sur le benchmark de sécurité des agents B3, il résiste à 93,3 % des attaques.

Pour les équipes de sécurité, cette combinaison est la véritable histoire : un modèle que vous pouvez auto-héberger qui aidera à reproduire et à corriger une CVE dans votre propre code, tout en refusant la plupart des requêtes clairement nuisibles. Pour les équipes API, c'est un outil utile à avoir sur votre propre matériel plutôt que derrière le filtre de politique de quelqu'un d'autre.

Où Large 4 bat GPT-6 Astra en dehors de la cybersécurité

Le résultat en cybersécurité est le plus retentissant. Deux autres victoires contre Astra sont plus discrètes et plus significatives, car les deux modèles ont réellement tenté la tâche :

Benchmark Mistral Large 4 GPT-6 Astra Notes
Dense 200 (ancrage visuel) 42% 41% Un point d'avance. Réel, mais étroit.
Finance Agent v2 (vals.ai) Devant Derrière Mistral rapporte le classement, pas les scores.
Benchmark d'agent juridique Harvey Meilleur modèle ouvert Listé Aucun chiffre de comparaison directe publié.

Contre d'autres modèles ouverts, l'écart est plus grand :

Benchmark Mistral Large 4 Qui il bat
AutomationBench (657 workflows) 59,9% Kimi K3, DeepSeek V4 Pro
AA-Briefcase (travail de connaissance) 1 393 Elo DeepSeek V4 Pro
DeepSWE v1.1 (codage) 61,7% Mène les modèles open-weight
SWE-Atlas-QnA 59,4%
Terminal-Bench 4.0 28,3%

Tous ces chiffres proviennent de Mistral et concernent des modèles en prévisualisation. Aucun laboratoire indépendant ne les a encore réexécutés, et Euronews rapporte que l'apprentissage par renforcement était encore en cours de finalisation au moment du lancement. Traitez-les comme un signal fort, pas comme un verdict.

Où il est encore en retrait

Mistral a publié un résultat où un modèle fermé l'emporte clairement. Dans une évaluation humaine de la qualité de codage menée par Surge AI sur cinq modèles, Large 4 Preview s'est classé deuxième :

Modèle Score de codage humain (sur 5)
Claude Opus 5 4,22
Mistral Large 4 Preview 3,74
GLM-5.3 3,60
Kimi K3 3,59
GLM-5.2 3,40

C'est une victoire nette sur les meilleurs modèles ouverts chinois, et un écart d'un demi-point derrière Claude. La formulation de Mistral est que Large 4 « comble l'écart » avec les modèles de pointe en codage, ce qui est une lecture honnête.

Manquant également : aucune comparaison avec Claude Fable 5.1 ou GPT-6 Sol n'est présente dans les documents de lancement. Si quelqu'un vous dit que Large 4 bat Fable, demandez le benchmark.

Spécifications en un coup d'œil

Spécification Mistral Large 4
ID du modèle API mistral-large-4 (alias mistral-large-4-0)
Version 26.10, prévisualisation publique
Architecture Mixture-of-experts, hybride instructif + raisonnement
Paramètres 1,05 T au total, 49 milliards actifs, encodeur de vision de 1,6 milliard
Fenêtre de contexte 1 million de tokens
Entrée Texte, images
Raisonnement paramètre reasoning_effort ("high" ou "none")
Outils Appel de fonctions, sorties structurées, outils d'agent intégrés
Endpoints /v1/chat/completions, /v1/conversations, /v1/agents, /v1/batch
Poids Ouverts, d'ici fin octobre 2026 ; licence non encore publiée

Prix : le modèle de pointe le moins cher que vous pouvez appeler aujourd'hui

C'est la partie qui devrait attirer l'attention des équipes API. La page de tarification de Mistral indique Large 4 à la moitié de son prix catalogue pendant la prévisualisation :

Modèle Entrée / 1M Sortie / 1M Poids ouverts
Mistral Large 4 (prix prévisualisation) 0,68 $ 2,09 $ Oui, fin octobre
Mistral Large 4 (prix catalogue) 1,36 $ 4,18 $ Oui, fin octobre
Claude Opus 5.5 4,00 $ 20,00 $ Non
GPT-6 Astra 10,00 $ 50,00 $ Non

Au prix de prévisualisation, la sortie de Large 4 coûte environ un vingt-quatrième de celle d'Astra. Même au prix catalogue, elle est environ 12 fois moins chère en sortie. L'entrée mise en cache tombe à 0,07 $ par million, ce qui est important pour les agents qui renvoient la même instruction système et les mêmes définitions d'outils à chaque tour.

Mistral n'a pas précisé quand la remise de prévisualisation prend fin, il est donc préférable de prévoir le budget en fonction du prix catalogue.

Devriez-vous changer ?

Essayez-le maintenant si :

Attendez si :

Comment tester Large 4 contre vos propres API dans Apidog

Les benchmarks vous indiquent les performances d'un modèle sur les tâches de quelqu'un d'autre. La façon la plus rapide de décider est d'exécuter Large 4 sur vos propres prompts et de le comparer avec le modèle que vous utilisez aujourd'hui. Apidog gère cela sans une ligne de code intermédiaire :

  1. Enregistrez la requête une fois. Créez POST https://api.mistral.ai/v1/chat/completions, stockez votre clé en tant que variable d'environnement, et définissez Authorization: Bearer {{MISTRAL_API_KEY}}.
  2. Clonez-le par modèle. Dupliquez la requête, modifiez uniquement le champ model (mistral-large-4 vs. votre modèle actuel), et envoyez les deux. Apidog affiche la réponse, le statut, la latence et la taille côte à côte, et le bloc usage vous donne le nombre de tokens pour une comparaison des coûts.
  3. Ajoutez des assertions. Vérifiez un statut 200, une réponse non vide et une correspondance de schéma JSON si vous demandez une sortie structurée. Cela transforme une expérience ponctuelle en un test de régression.
  4. Réexécutez-le à chaque mise à jour du modèle. Regroupez les requêtes dans un scénario de test et réexécutez-le lorsque Mistral met à jour la prévisualisation ou publie les poids. Vous verrez si la qualité a dérivé avant vos utilisateurs.

Deux atouts de Large 4 s'intègrent naturellement au travail API. Ses résultats en sécurité en font un bon second relecteur pour les tests de sécurité API, par exemple lorsque vous reproduisez un contournement d'authentification dans votre propre API de staging. Ses fonctions d'appel et ses sorties structurées vous permettent de transformer une spécification OpenAPI conçue dans Apidog en définitions d'outils qu'un agent peut appeler.

Pour un aperçu complet du code, y compris les clés, les blocs de raisonnement, les images, l'appel de fonctions et le calcul des coûts, consultez notre guide API Mistral Large 4. Vous venez d'un ancien modèle Mistral ? Les bases de l'API Mistral AI et le guide API Mistral Medium 3.5 s'appliquent toujours : même URL de base, même authentification, nouvel ID de modèle.

FAQ

Mistral Large 4 est-il open source ? Il est open-weight. Mistral indique que les poids seront publiés d'ici fin octobre 2026. La licence n'a pas encore été publiée, ne supposez donc pas qu'elle corresponde à l'Apache 2.0 de Large 3.

Mistral Large 4 bat-il vraiment GPT-6 Astra ? Sur l'ancrage visuel (42 % vs 41 %) et Finance Agent v2, oui, selon les chiffres de Mistral. Sur le test de vulnérabilité cyber, Astra obtient un score proche de zéro parce qu'il refuse, ce n'est donc pas une victoire comparable.

Batte-t-il Claude ? Pas sur le codage. Claude Opus 5 mène l'évaluation humaine du codage avec 4,22 contre 3,74. Claude Opus 5.5 refuse également la tâche de reproduction cyber, c'est pourquoi il obtient un score proche de zéro dans ce cas.

Que signifie « Le Chonk » ? C'est le surnom officieux de Mistral pour le modèle, une blague sur sa taille. Le nom officiel est Mistral Large 4, ou ML4.

Puis-je l'utiliser gratuitement ? Le plan gratuit de Mistral inclut 10 $ par mois en crédits API et l'accès à ses derniers modèles dans Le Chat et Vibe. Au prix de prévisualisation, 10 $ permettent d'acheter environ 4,8 millions de tokens de sortie sur Large 4.

En résumé

Mistral est de retour dans la discussion de pointe. Large 4 est le modèle open-weight le plus puissant en dehors de la Chine selon les chiffres de Mistral, il coûte une fraction d'Astra ou d'Opus 5.5, et il fonctionnera sur votre propre matériel en quelques semaines. L'affirmation « bat Astra et Claude en cyber » est réelle mais provient de refus, et le verdict honnête en matière de codage est « deuxième après Claude ». Testez-le sur vos propres API dans Apidog dès maintenant tant que le prix de prévisualisation est en vigueur, et suspendez votre décision de production jusqu'à ce que les benchmarks indépendants arrivent après le 27 octobre.

button

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API