Qu'est-ce que GLM-5.3-Flash ? Le premier modèle multimodal natif open source de Z.ai

Le GLM-5.3-Flash de Z.ai est un modèle MIT de 320B-A18B avec une entrée d'image native et un contexte de 1M. Spécifications, benchmarks, et pourquoi Flash signifie économique, et non rapide.

INEZA Felin-Michel

INEZA Felin-Michel

27 August 2026

Qu'est-ce que GLM-5.3-Flash ? Le premier modèle multimodal natif open source de Z.ai

Apidog pour les entreprises

Déploiement sur site

SSO & RBAC

Conforme SOC 2

Découvrir Apidog Enterprise

Z.ai a lancé GLM-5.3-Flash le 26 août 2026. Il s'agit d'un modèle mélange d'experts de 320 milliards de paramètres avec 18 milliards de paramètres actifs. Il est distribué sous licence MIT et c'est le premier modèle de la série GLM-5 qui gère les images nativement, plutôt que via un adaptateur de vision ajouté.

C'est également le modèle que de nombreux développeurs utilisaient déjà depuis une semaine sans le savoir. Plus de détails ci-dessous.

Si vous êtes venu ici en vous attendant à ce que "Flash" signifie "rapide", cet article va vous contredire. Cette convention de nommage vient de Google, où les modèles Flash sont véritablement la catégorie à faible latence. Ici, cela signifie quelque chose de différent, et bien comprendre cette distinction détermine si ce modèle convient à votre charge de travail.

En bref

Les spécifications

Propriété Valeur
Paramètres totaux 320B
Paramètres actifs 18B
Architecture Mélange d'experts, attention hybride linéaire et clairsemée
Licence MIT
Fenêtre contextuelle 1 048 576 jetons
Modalités d'entrée Texte, image, vidéo, fichiers
Sortie Texte
Modes de raisonnement faible, élevé, max (par défaut max)
ID de modèle API glm-5.3-flash
Hugging Face zai-org/GLM-5.3-Flash

Un chiffre à considérer avec prudence : le nombre maximal de jetons de sortie. OpenRouter indique 131 072 et la carte de modèle Hugging Face indique 163 840. Ces sources sont en désaccord et Z.ai n'a pas publié de chiffre qui résout la question. Si votre application dépend de très longues générations uniques, vérifiez la limite auprès de votre fournisseur réel avant de construire votre solution.

La multimodalité native est la vraie nouveauté

Toute capacité de vision précédente de la gamme GLM est apparue comme un modèle distinct ou un chemin d'accès distinct. Z.ai a livré GLM-5V-Turbo et GLM-4.6V comme des modèles de vision distincts. Si vous vouliez qu'un modèle GLM examine une capture d'écran, vous appeliez un point de terminaison différent de celui utilisé par votre trafic textuel.

GLM-5.3-Flash fait disparaître cela. Les images, les vidéos et les fichiers sont des blocs de contenu dans la même requête de complétion de chat qui contient votre texte. Il y a un seul ID de modèle, une seule ligne de facturation et une seule fenêtre contextuelle qui contient votre image et votre million de jetons de texte environnant en même temps.

Cette dernière partie est la plus intéressante. Une fenêtre contextuelle d'un million de jetons qui accepte également des images signifie que vous pouvez placer un long document de spécification et une capture d'écran du résultat rendu dans la même invite et demander au modèle de les réconcilier. Le propre cadrage de Z.ai s'appuie sur cela : il décrit le modèle observant des "interfaces, des résultats de rendu et des retours d'interaction", ce qui est un cas d'utilisation d'agent de codage, et non de légende de photo.

Si vous travaillez plus généralement avec des modèles de vision, notre guide sur l'API de GLM-5V-Turbo couvre l'approche plus ancienne dédiée à la vision, et GLM-OCR pour la compréhension de documents couvre le cas spécialisé.

L'architecture, en bref

Z.ai a construit GLM-5.3-Flash sur un nouveau modèle de base plutôt que de post-entraîner GLM-5.2. Deux choix de conception sont importants pour son comportement :

Attention hybride. Le modèle mélange l'attention linéaire avec l'attention clairsemée. L'attention linéaire gère les dépendances locales à moindre coût ; l'attention clairsemée recherche les jetons globalement pertinents. Le résultat déclaré est une puissance de calcul d'attention environ trois fois inférieure à celle de GLM-5.3 et un cache KV environ 4,4 fois plus petit.

Manifold-Constrained Hyper-Connections. Le terme de Z.ai pour son travail sur l'efficacité de la mise à l'échelle dans cette version. Il n'y a pas encore suffisamment de détails publics pour l'évaluer de manière indépendante, il faut donc le considérer comme une caractéristique architecturale décrite par le fournisseur plutôt que comme un avantage prouvé.

La réduction du cache KV est la partie avec des conséquences pratiques évidentes. Le cache KV est ce qui rend l'inférence à long contexte coûteuse en mémoire, et sa réduction par un facteur de 4,4 est la principale raison pour laquelle ce modèle peut être servi à un dixième du prix de GLM-5.2 tout en conservant une fenêtre de 1M.

L'entraînement a utilisé un corpus que Z.ai décrit comme environ 30 trillions de jetons multimodaux.

À propos du nom

Artificial Analysis mesure GLM-5.3-Flash à 48,7 jetons de sortie par seconde. Pour contextualiser, c'est dans la fourchette basse pour les modèles à poids ouverts de taille comparable. GLM-5.3, son grand frère, tourne à environ 86 jetons par seconde sur la même mesure.

Le modèle Flash est donc environ deux fois moins rapide que le modèle non-Flash.

Ce qu'il gagne, c'est le temps de premier jeton, à 1,52 seconde contre une médiane de 2,14 secondes pour les modèles à poids ouverts. Si votre charge de travail implique de nombreux échanges interactifs courts, cette réactivité est réelle. Si votre charge de travail consiste à générer de longs documents, vous attendrez plus longtemps qu'avec GLM-5.3.

L'efficacité qu'offre ce modèle réside dans le coût et la mémoire, et non dans la vitesse de génération en temps réel. Le cache KV plus petit et la puissance de calcul d'attention réduite se traduisent par un prix par jeton moins cher et un encombrement de service plus petit. Ils ne se traduisent pas par un streaming plus rapide.

C'est important car la plupart des couvertures publiées dans les jours suivant le lancement ont répété le cadre du fournisseur sans vérifier le chiffre de débit, qui était public depuis le début. Choisissez ce modèle parce qu'il est peu coûteux et gère les images, pas parce que vous vous attendez à ce qu'il diffuse rapidement.

Benchmarks

Chiffres publiés au lancement par Z.ai, à lire donc comme des affirmations du fournisseur jusqu'à ce que des tiers les reproduisent :

Le chiffre indépendant est celui d'Artificial Analysis, qui place GLM-5.3-Flash à 57 sur son indice d'intelligence v4.1.1. GLM-5.3 obtient 60. La médiane pour les modèles à poids ouverts de taille similaire est de 27, donc 57 est un excellent résultat pour cette catégorie, même s'il se situe en dessous de son grand frère.

Z.ai présente le modèle comme approchant Claude Opus 4.8 pour le codage et le travail d'agent. Il s'agit de la caractérisation du fournisseur de ses propres évaluations internes, et non d'un résultat mesuré par un tiers, et l'écart de trois points de l'indice d'intelligence par rapport à son propre GLM-5.3 suggère qu'une certaine retenue est de mise.

Pour savoir comment l'histoire des benchmarks GLM a évolué au cours des versions précédentes, notre analyse des benchmarks de GLM-5.2 explique ce que chacune de ces évaluations mesure réellement.

La semaine Ox Alpha

Le 20 août, un modèle anonyme appelé ox-alpha est apparu sur des plateformes d'inférence tierces avec une fenêtre contextuelle de 1M de jetons et un prix nul. Il est devenu l'un des modèles les plus utilisés sur ces plateformes en quelques jours. La communauté l'a identifié comme appartenant à Zhipu en environ 48 heures, grâce aux caractéristiques de sortie.

Le 26 août, Z.ai l'a confirmé : Ox Alpha était GLM-5.3-Flash, et la semaine gratuite était un test de charge délibéré.

Z.ai affirme également que pendant cette semaine, tout le trafic a été servi sur des accélérateurs chinois domestiques utilisant une pile basée sur SGLang, et revendique un coût de service par jeton comparable au matériel NVIDIA grand public. Il s'agit d'une affirmation du fournisseur concernant sa propre infrastructure, sans vérification indépendante disponible, il faut donc la considérer en conséquence.

Nous avons déjà décrit ce scénario lorsque Pony Alpha s'est avéré être un modèle DeepSeek ou GLM. Les lancements furtifs sur des routeurs tiers deviennent une étape standard avant la sortie, et la conclusion utile est qu'un modèle anonyme inhabituellement performant avec une fenêtre contextuelle étonnamment ronde est presque toujours le fleuron non publié de quelqu'un qui collecte des données d'évaluation.

Comment l'utiliser concrètement

API hébergée. Le point d'accès Z.ai est compatible OpenAI. Dirigez votre client existant vers https://api.z.ai/api/paas/v4/ et définissez le modèle sur glm-5.3-flash. Notre guide de l'API GLM-5.3-Flash explique l'authentification, la charge utile d'entrée d'image et le paramètre d'effort de raisonnement.

Fournisseurs tiers. OpenRouter le propose sous le nom z-ai/glm-5.3-flash. Il est également disponible sur Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten, et io.net. Les prix varient entre les revendeurs, parfois de manière significative.

Agents de codage. Flash est inclus dans le Plan de Codage GLM et disposerait d'un quota utilisable trois fois supérieur à celui de GLM-5.3, ce qui est la raison pratique pour laquelle un abonné changerait. La documentation de Z.ai indique également que les appels en heures creuses consomment la moitié des points standards.

Auto-hébergé. Les poids sont sous licence MIT et sur Hugging Face. vLLM, SGLang, TokenSpeed et KTransformers le supportent tous, et des quantifications GGUF existent pour les configurations plus petites.

Faut-il l'utiliser ?

Utilisez GLM-5.3-Flash si vous avez besoin de la compréhension d'images ou de vidéos dans le même appel que votre texte, si votre coût par jeton est la contrainte que vous optimisez, ou si vous voulez des poids ouverts que vous pouvez auto-héberger sous une licence permissive.

Préférez GLM-5.3 si vous avez besoin des derniers points de qualité de raisonnement, ou si le débit de génération est plus important pour vous que le prix. Notre comparaison côte à côte des deux détaille la décision, et ce qu'est GLM-5.3 couvre le modèle de base selon ses propres termes.

Quel que soit votre choix, l'échange n'est qu'un changement d'ID de modèle sur une ligne via un point d'accès compatible OpenAI, ce qui facilite le test des deux par rapport à votre propre charge de travail plutôt que de faire confiance à un tableau de benchmarks. C'est la bonne façon de trancher.

Tester correctement un échange de modèle signifie envoyer de vraies requêtes et vérifier de vraies réponses, y compris les réponses multimodales qui sont difficiles à créer manuellement avec curl. Apidog vous permet de sauvegarder ces appels comme une collection réutilisable avec des assertions, de sorte que lorsque vous passez de GLM-5.3 à Flash, vous pouvez confirmer que la forme de la réponse n'a pas changé au lieu de le découvrir en production.

FAQ

GLM-5.3-Flash est-il gratuit ? Non, plus maintenant. La semaine gratuite d'Ox Alpha a pris fin lorsque le modèle a été officiellement annoncé. Une réduction de lancement de 50 % est en cours jusqu'au 9 septembre 2026, après quoi les tarifs habituels s'appliqueront.

Est-il plus rapide que GLM-5.3 ? Non. Il génère environ 49 jetons par seconde contre 86 pour GLM-5.3. Cependant, il commence à répondre plus tôt, avec 1,52 seconde pour le premier jeton.

Peut-il vraiment gérer un million de jetons de contexte ? La fenêtre configurée est de 1 048 576 jetons, confirmée dans la configuration du modèle et par Artificial Analysis. Notez qu'OpenRouter indique un chiffre plus élevé de 1 310 720 ; considérez cela comme une liste côté fournisseur plutôt que comme une spécification de modèle.

Accepte-t-il la vidéo ? La documentation de Z.ai liste les entrées texte, image, vidéo et fichier. Le support vidéo est plus récent et moins largement utilisé que l'entrée d'image, alors validez-le avec vos propres médias avant d'en dépendre.

Sous quelle licence sont les poids ? MIT, avec les poids publiés à zai-org/GLM-5.3-Flash sur Hugging Face.

Pratiquez le Design-first d'API dans Apidog

Découvrez une manière plus simple de créer et utiliser des API