GLM-5.3 retarde ses poids après un bond en cybersécurité

Z.ai a lancé GLM-5.3 le 14 août 2026, mais retarde ses poids téléchargeables d’environ deux semaines pour renforcer la sécurité. Le modèle affiche des résultats solides en cyber et en raisonnement, avec un écart selon les benchmarks.

Z.ai a lancé GLM-5.3 le 14 août 2026, mais a choisi de retarder la publication de ses poids téléchargeables jusqu’autour du 28 août. L’enjeu est simple : le modèle chinois affiche des gains notables en cybersécurité et en raisonnement, mais la société dit vouloir durcir les garde-fous avant de le rendre pleinement disponible. À ce stade, c’est la première fois que Z.ai décale ainsi un poids GLM. Et ce n’est pas le genre de cadeau qu’on déballe sans mode d’emploi.

Un modèle plus fort, mais pas sur tous les terrains

GLM-5.3 repose sur la même base que GLM-5.2 ; les progrès viennent donc du post-training, c’est-à-dire de l’entraînement après le modèle de base, avec davantage d’environnements, plus de tâches et plus de calcul. Selon Z.ai, cette phase d’un mois a fait monter le score du modèle à 84,5 % sur CyberGym, devant les 83,8 % attribués à Anthropic Mythos 5 et les 83,6 % de GPT-5.6 Sol sur le même test.

La lecture change dès qu’on passe de la détection de failles à l’exploitation. Sur ExploitBench, GLM-5.3 tombe à 54,4 %, loin des 78,0 % rapportés pour Mythos 5. Sur ExploitGym, il complète 105 tâches avec un budget normalisé de deux heures et 130 sur six heures, contre 181 et 247 pour Mythos 5. Le message est clair : la progression est réelle, mais elle ne se traduit pas partout avec la même intensité.

Pourquoi Z.ai retient les poids

La société dit avoir ajouté volontairement des travaux de découverte de vulnérabilités, puis avoir vu le modèle passer de la recherche de failles isolées à la planification de chaînes d’exploitation complètes. Dans ce contexte, elle limite l’accès aux fonctions les plus sensibles et maintient GLM-5.3 via le plan payant GLM Coding Plan, ZCode et des environnements contrôlés pour certains partenaires sécurité, en attendant la publication des poids.

Cette prudence s’explique aussi par le précédent américain. Anthropic a réservé Mythos 5 à des partenaires privés vérifiés, en expliquant que cette capacité « carries the greatest potential for misuse in security ». Z.ai adopte une logique proche, même si l’entreprise souligne qu’une fois les poids publics, elle ne pourra plus contrôler les modifications ni les usages du modèle. C’est le petit détail qui change tout, et qui empêche les labos de dormir vraiment.

Les chiffres qui comptent vraiment

Au-delà des benchmarks, Z.ai a aussi publié un registre de vulnérabilités : 2 436 découvertes sur 269 projets open source au 14 août 2026, dont 107 critiques et 990 jugées élevées. Seules 53 ont été divulguées à ce stade, tandis que 2 383 restent sous embargo. Les logiciels touchés incluent le noyau Linux, Redis, WebKit et FreeBSD, avec une faille la plus ancienne introduite en 1981 et un âge moyen de 26,6 ans avant découverte.

Ces éléments restent toutefois à prendre avec prudence. Les scores cyber et le Code Bench interne proviennent de Z.ai, dans sa propre configuration, sans réplication indépendante. L’évaluateur Artificial Analysis n’avait pas encore intégré le modèle au 14 août, puis l’a noté le 18 août à 60 sur son Intelligence Index, soit au niveau de Moonshot Kimi K3 et trois points derrière Claude Opus 5, leader à 63.

Un bon score, une facture encore contenue

Sur ce terrain, GLM-5.3 a aussi un angle marché. Artificial Analysis indique un coût total de 1 238,50 dollars pour son évaluation sur l’API de Z.ai, avec 1,40 dollar par million de tokens d’entrée et 4,40 dollars par million de tokens de sortie. À score égal avec Kimi K3 sur l’index, il apparaît moins cher à l’usage que son rival de Moonshot, même si ce dernier reste open weights alors que GLM-5.3 est encore propriétaire. Pour les clients API, c’est le genre d’écart qui pèse vite sur la facture mensuelle.

Reste la suite : Z.ai prévoit la disponibilité des poids après durcissement de sécurité, avec accès immédiat par API pour les abonnés du GLM Coding Plan et activation du mode thinking requise pour certaines applications existantes. Le modèle gagne en crédibilité technique, mais il arrive aussi dans un moment où les acteurs sérieux de l’IA commencent à traiter la cybersécurité comme une fonction à part entière, et non comme un simple benchmark de plus.

Points clés

  • GLM-5.3 a été lancé le 14 août 2026 par Z.ai.
  • Les poids téléchargeables sont retardés d’environ deux semaines.
  • CyberGym : 84,5 % selon Z.ai.
  • Artificial Analysis a noté GLM-5.3 à 60 le 18 août 2026.
  • Z.ai liste 2 436 vulnérabilités sur 269 projets open source.
  • Claude Opus 5 reste devant avec 63 sur l’Index.

En chiffres

  • 84,5 % — score CyberGym de GLM-5.3, selon Z.ai, août 2026.
  • 54,4 % — score ExploitBench de GLM-5.3, selon Z.ai, août 2026.
  • 60 — Intelligence Index d’Artificial Analysis, 18 août 2026.
  • 2 436 — vulnérabilités listées par Z.ai au 14 août 2026.
  • 1 238,50 dollars — coût d’évaluation sur l’API Z.ai, selon Artificial Analysis.

À lire