Z.ai lance le modèle d'IA GLM-5.3-Flash, affirmant qu'il surpasse le GLM-5.2 dans tous les tests de performance pour un dixième du prix, et qu'il se rapproche de Claude Opus 4.8
Z.ai a présenté GLM-5.3-Flash, le premier modèle multimodal natif de sa série GLM-5. Le modèle compte au total 320 milliards de paramètres, dont 18 milliards de paramètres actifs. Z.ai affirme qu’il surpasse le GLM-5.2 sur l’ensemble des benchmarks et des charges de travail réelles, pour un dixième du prix. L’entreprise indique également qu’il se rapproche de Claude Opus 4.8 sur les benchmarks de codage et d’agentique.
Z.ai est une entreprise chinoise spécialisée dans l'intelligence artificielle (AI) ; son produit phare est la famille de grands modèles de langage GLM (General Language Model) à poids ouverts. Anciennement connue sous le nom de Zhipu AI hors de Chine jusqu’en 2025, elle est la première grande entreprise chinoise spécialisée dans les LLM à avoir réalisé une introduction en bourse, à la Bourse de Hong Kong en janvier 2026. Avec une capitalisation boursière de 62 milliards de dollars américains en août 2026, elle est la société cotée en bourse spécialisée exclusivement dans l’IA la plus valorisée de Chine.
Récemment, Z.ai a présenté GLM-5.3-Flash, le premier modèle multimodal natif de sa série GLM-5. Le modèle compte au total 320 milliards de paramètres, dont 18 milliards de paramètres actifs. Z.ai affirme qu’il surpasse le GLM-5.2 sur l’ensemble des benchmarks et des charges de travail réelles, pour un dixième du prix. L’entreprise indique également qu’il se rapproche de Claude Opus 4.8 sur les benchmarks de codage et d’agentique.
S'appuyant sur ces performances annoncées, le GLM-5.3-Flash combine l'attention clairsemée et l'attention linéaire au sein d'une architecture hybride. Z.ai explique que cette conception réduit les coûts de traitement des contextes longs tout en conservant des capacités précises dans ce domaine. Le modèle utilise également les « Manifold-Constrained Hyper-Connections » (mHC) pour améliorer l'efficacité de la mise à l'échelle. Son pré-entraînement a été réalisé à partir d'un corpus multimodal de 30 000 milliards de tokens.
Pour les contextes d’un million de tokens, Z.ai a introduit IndexPool afin de réduire la latence de l’indexeur et la surcharge mémoire. Cette technique compresse quatre vecteurs-clés de l’indexeur en un seul grâce à un regroupement pondéré. Avant sa sortie, Z.ai a testé le modèle de manière anonyme sous le nom d’Ox Alpha sur OpenCode et OpenRouter afin de recueillir les retours des utilisateurs, et celui-ci est rapidement devenu le modèle le plus populaire de la semaine. Les poids du modèle GLM-5.3-Flash sont accessibles au public sur HuggingFace.
Voici la présentation de GLM-5.3-Flash :
GLM-5.3-Flash : Intelligence frontière, coût Flash
Nous présentons GLM-5.3-Flash, le premier modèle multimodal natif de la série GLM-5. Avec un total de 320 milliards de paramètres et seulement 18 milliards de paramètres actifs, il surpasse GLM-5.2 sur l’ensemble des benchmarks et des charges de travail réelles pour un dixième du prix, tout en se rapprochant de Claude Opus 4.8 sur les benchmarks de codage et d’agentique.
GLM-5.3-Flash s’appuie sur un modèle de base nouvellement entraîné, dont l’architecture et la méthode d’entraînement ont été repensées pour privilégier les capacités et l’efficacité. Pour la première fois dans la série GLM, nous introduisons une architecture hybride combinant l’attention clairsemée et l’attention linéaire, ce qui réduit considérablement les coûts de traitement des contextes longs tout en préservant des capacités précises dans ce domaine. Le modèle adopte également les hyper-connexions contraintes par manifold (mHC) afin d’améliorer encore l’efficacité de la mise à l’échelle. Associées à notre dernier corpus de pré-entraînement multimodal de 30 T de tokens, ces modifications permettent à GLM-5.3-Flash d’offrir davantage d’intelligence avec moins de ressources de calcul.
Avant sa sortie, nous avons testé GLM-5.3-Flash de manière anonyme sous le nom « ox-alpha » sur OpenCode et OpenRouter afin de recueillir les retours des utilisateurs. Il est rapidement devenu le modèle le plus populaire de la semaine — l’ensemble de ce trafic ayant été traité sur des puces d’IA chinoises.
Des performances compétitives à un coût « flash »
GLM-5.3-Flash repousse la frontière de Pareto de l’Artificial Analysis Intelligence Index v4.1.1, avec un score de 57 pour seulement 0,045 $ par tâche (prix réduit) — un niveau d’intelligence qui n’était auparavant accessible qu’à un coût environ 10 fois supérieur. Cela en fait un choix par défaut très compétitif pour un large éventail de charges de travail.
Sur six benchmarks de codage et d’agentique, GLM-5.3-Flash surpasse systématiquement GLM-5.2, souvent de manière significative — 63,4 contre 46,2 sur DeepSWE v1.1 et 48,8 contre 26,2 sur AutomationBench — tout en se rapprochant globalement de Claude Opus 4.8.
Ce constat se vérifie également lors de notre évaluation interne en matière de codage : sur Z.ai Code Bench v1.0, GLM-5.3-Flash surpasse clairement GLM-5.2 à tous les niveaux d’effort, et à effort maximal, il se rapproche presque de Claude Opus 4.8 (29,0 contre 29,5).
Une architecture pour une efficacité extrême
Par rapport à la série GLM-4.5, GLM-5.3-Flash est spécialement conçu pour une inférence à très faible coût. Malgré un nombre total de paramètres similaire (320 milliards contre 355 milliards), il réduit de près de moitié à la fois le nombre de paramètres activés (18 milliards contre 32 milliards) et le nombre de couches (45 contre 92).
Afin de minimiser les coûts d’attention dans les scénarios à contexte long, nous utilisons une architecture hybride combinant l’attention linéaire et l’attention clairsemée. L’attention linéaire capture les dépendances locales grâce à la modélisation d’état, tandis que l’attention clairsemée récupère le contexte global pertinent via un indexeur léger. Pour réduire davantage la latence et la surcharge mémoire de l’indexeur pour une longueur de contexte de 1 million de tokens, nous introduisons IndexPool, qui compresse quatre vecteurs-clés de l’indexeur en un seul grâce à un regroupement pondéré.
Pour illustrer l’efficacité de notre architecture, nous comparons le coût de calcul par token et la taille du cache KV de GLM-5.3-Flash à ceux de GLM-5.3 et de deux modèles ouverts récents : DeepSeek-V4-Flash et Kimi-K3. Afin de garantir une comparaison équitable entre différentes échelles, nous calculons le coût de calcul de l’attention par tête et par couche, ainsi que la taille moyenne du cache KV par couche (BF16). Par rapport à GLM-5.3, GLM-5.3-Flash utilise 3,0 fois moins de calcul d’attention et un cache KV 4,4 fois plus petit. GLM-5.3-Flash présente le calcul d’attention le plus faible parmi tous les modèles comparés. La taille du cache KV reste toutefois légèrement supérieure à celle de Kimi-K3 et de DeepSeek-V4-Flash, ce qui laisse une marge d’amélioration.
Les améliorations apportées à l’architecture globale, associées à un corpus de pré-entraînement optimisé, permettent à GLM-5.3-Flash de produire davantage d’intelligence avec moins de calculs.
Le tableau ci-dessous compare GLM-5.3-Flash-Base à nos modèles de base précédents et à DeepSeek-V4-Flash-Base. GLM-5.3-Flash-Base surpasse globalement GLM-4.5-Base et reste compétitif face à GLM-5-Base dans la plupart des benchmarks.
L'intelligence visuelle dans la boucle de programmation
La programmation visuelle ne se limite pas au traitement d'images. Elle repousse les limites de ce que la programmation peut accomplir. Pour des tâches telles que le développement front-end, le développement de jeux vidéo et la simulation 3D, le résultat final n'est pas uniquement du code, mais une interface, une interaction ou un univers découvert par l'utilisateur. De nombreuses défaillances n'apparaissent qu'au moment du rendu, de l'interaction ou des tests de jeu. La CUA étend encore davantage la programmation au-delà des systèmes programmables pour englober des environnements visibles et interactifs. La vision doit donc être intégrée de manière native au modèle, afin de lui permettre de décider quand observer et utiliser le retour visuel pour guider les actions suivantes.
Nous avons développé des pipelines de synthèse de données pour le codage visuel, en mettant l’accent sur l’auto-évaluation visuelle et l’amélioration en temps de test. Les trajectoires qui en résultent exigent que le modèle interagisse avec les environnements, inspecte ses propres résultats et les affine de manière itérative. Pour le codage front-end, nous avons également exploré l’apprentissage par renforcement avec retour d’information de l’environnement et renforcé davantage l’évaluation de l’interface graphique grâce à une vérification basée sur des agents, ancrée dans les flux réels des utilisateurs. Cela étend la validation au-delà de la correction fonctionnelle pour englober le produit rendu et interactif.
Le code permet au modèle de construire et de modifier le monde. La vision lui permet d’entrer dans le monde que les gens voient et utilisent. La clé réside dans la boucle fermée entre la génération et le retour visuel : le modèle peut afficher le résultat de sa génération, inspecter ce que les utilisateurs verraient réellement, identifier les problèmes visuels et réviser l’artefact sous-jacent en conséquence. Cela s’applique non seulement aux interfaces et aux jeux, mais aussi aux résultats visuellement structurés tels que les présentations. Dans l’exemple ci-dessous, GLM-5.3-Flash détecte des problèmes de mise en page dans une diapositive générée et affine la composition grâce à une auto-vérification visuelle.
Au-delà du codage — Votre partenaire au travail
Les capacités de codage constituent une base importante pour le travail intellectuel intelligent, tandis que l’intelligence visuelle étend ces capacités à un éventail plus large de tâches professionnelles. Une part substantielle des activités professionnelles consiste à interpréter des informations hétérogènes, tant visuelles que structurées, notamment des documents, des feuilles de calcul, des présentations, des tableaux de bord, des interfaces et des supports de réunion.
L’intelligence visuelle étend les capacités du modèle au-delà des environnements centrés sur le code en lui permettant de raisonner conjointement sur le contexte textuel, visuel et structurel. Plutôt que d’exiger des utilisateurs qu’ils traduisent explicitement leur environnement de travail en instructions textuelles, le modèle peut interpréter directement les éléments associés à une tâche et identifier les informations pertinentes. Il peut également évaluer ses propres résultats par rapport au contexte visuel et au résultat escompté, ce qui permet une auto-vérification et un affinement plus efficaces — y compris des jugements plus pertinents sur la qualité de la présentation et l’esthétique.
Déploiement à grande échelle sur des puces d’IA chinoises
Au cours de la semaine dernière, nous avons déployé GLM-5.3-Flash sur un cluster à grande échelle de puces d’IA chinoises, soutenu par une interconnexion à haut débit et une pile de déploiement optimisée pour le matériel sous-jacent.
Pour pallier les capacités de calcul et de mémoire relativement limitées de chaque puce, nous avons développé un moteur d’inférence dédié à cette architecture, basé sur SGLang. Il convient de noter que cet effort a été accéléré par notre agent d’infrastructure alimenté par GLM-5.3, qui a aidé les ingénieurs à développer et optimiser les noyaux, à diagnostiquer les goulots d’étranglement de performance et à améliorer la pile de déploiement — créant ainsi une boucle de rétroaction dans laquelle le modèle a contribué à optimiser le système chargé de le déployer.
Ces puces sont principalement limitées par leur capacité mémoire et leur bande passante, en particulier lorsqu’elles prennent en charge des longueurs de contexte pouvant atteindre un million de tokens. Cela nécessite une optimisation intensive de la mémoire, notamment des techniques de « compute-for-bandwidth » et de « communication-for-bandwidth » adaptées à l’architecture sous-jacente. Notre pile combine le parallélisme tensoriel intra-nœud pour l’attention linéaire et la tête LM, ReplaySSM, la quantification W8A8, la quantification hybride en cache INT8/FP8/BF16 et le Layer Split.
À l’échelle du cluster, notre architecture désagrégée Encode–Prefill–Decode (EPD), prête pour la production, sépare l’encodage multimodal, le préremplissage des prompts et le décodage token par token en pools de travailleurs planifiés de manière indépendante et évolutifs, permettant ainsi un service efficace et fiable.
Par rapport à notre modèle de référence initial sur le même matériel, nous avons obtenu une amélioration de 3× des performances de service de bout en bout, atteignant une efficacité matérielle et un coût par token comparables à ceux des GPU NVIDIA grand public. Cela démontre que les puces chinoises peuvent prendre en charge l’inférence de modèles de pointe de manière efficace et économique à grande échelle.
Conclusion
GLM-5.3-Flash démontre que l’intelligence de pointe ne doit pas nécessairement impliquer des coûts de pointe. Ce résultat n’est pas le fruit d’une astuce isolée, mais de la collaboration de trois niveaux : une architecture offrant des capacités accrues avec moins de puissance de calcul, un corpus de pré-entraînement multimodal plus riche, et une infrastructure conçue conjointement avec le matériel d’inférence. Nous étendons désormais cette approche à des modèles plus volumineux : GLM-5.3-Flash repousse les limites du rapport coût-performance, et les enseignements tirés de sa conception façonnent déjà notre prochain modèle de pointe.
Source : Annonce de GLM-5.3-Flash
Et vous ?
Pensez-vous que cette annonce est crédible ou pertinente ?
Quel est votre avis sur le sujet ?
Voir aussi :
Le dernier modèle GLM 5.3 du laboratoire d'IA chinois Z.ai est si performant pour détecter et exploiter les failles de sécurité que l'entreprise va reporter de deux semaines sa publication
GLM-5 contre Claude Opus 4.5 : 744 milliards de paramètres, -1 sur l'index d'hallucination, 10x moins cher. La startup chinoise Zhipu AI mise sur l'open source pour défier l'establishment américain
GLM 5.2, l'un des modèles d'IA chinois dont Sam Altman souhaite l'interdiction, a sauvé Hugging Face, la plus grande base de données mondiale de modèles d'IA, d'une catastrophe dont OpenAI est responsable














Pensez-vous que cette annonce est crédible ou pertinente ?
Répondre avec citation
Partager