GLM-5.3 muscle le code et surprend en cybersécurité
Z.ai dévoile GLM-5.3, bâti sur le même modèle de base que GLM-5.2. Les gains viennent du post-training, avec un bond sur certains tests de code et une montée inattendue en cybersécurité.
Z.ai a publié GLM-5.3, une nouvelle version de son modèle de langage qui reprend le même socle de 743 milliards de paramètres que GLM-5.2. Les progrès viennent donc du post-training, avec davantage d’environnements de tâche, plus de types d’environnements et un entraînement plus long. Résultat : le modèle gagne nettement sur le code, mais aussi sur la cybersécurité, où les gains ont dépassé les attentes de l’éditeur. Les poids ne sont pas encore publics, mais le modèle est déjà accessible via l’API Z.ai, le GLM Coding Plan et ZCode.
Le code monte d’un cran, surtout quand les tâches s’étirent
Sur les benchmarks liés au développement logiciel, GLM-5.3 progresse surtout quand les tâches demandent de tenir la distance. Terminal-Bench 3.0 passe de 4,6 à 28,3, DeepSWE v1.1 de 46,2 à 66,9, et Agents’ Last Exam en mode CLI de 23,8 à 28,5. Sur GDPval-AA v2, qui couvre 44 professions, Z.ai annonce un score de 1 769. L’éditeur dit aussi que son test interne Z.ai Code Bench affiche une amélioration de 50 % par rapport à GLM-5.2, avec 31,4 % à environ 50 000 tokens de sortie par tâche. Claude Opus 4.8 est donné à 29,5 % à 120 000 tokens, tandis que Claude Fable 5 reste devant à 39,5 % au maximum d’effort. Les comparaisons restent à lire avec prudence : elles sont toutes rapportées par Z.ai, avec leurs réglages de benchmark, de contexte et d’échantillonnage. Bref, le modèle sait mieux tenir un terminal, ce qui n’est jamais anodin quand il faut enchaîner les étapes sans se perdre en route.
Quand la cybersécurité profite de l’effet boule de neige
Z.ai décrit le gain en cybersécurité comme inattendu. L’équipe dit avoir ajouté des données de découverte de vulnérabilités en espérant surtout améliorer le raisonnement sur un bug isolé ; la montée en échelle a fini par produire des plans plus cohérents sur des chaînes d’exploitation complètes. CyberGym grimpe ainsi de 77,2 % à 84,5 %, devant Mythos 5 à 83,8 % et GPT-5.6 Sol à 83,6 %. ExploitBench bondit de 24,4 % à 54,4 %, même si Mythos 5 reste nettement au-dessus à 78,0 %. Sur ExploitGym, GLM-5.3 complète 105 tâches en deux heures et 130 en six heures, contre 29 et 39 pour GLM-5.2 ; Mythos 5 atteint 181 et 247 sur les mêmes durées. Le schéma est clair : plus le benchmark s’approche d’une chaîne d’exploitation réaliste, plus l’écart se creuse avec GLM-5.2, mais sans rattraper les meilleurs modèles fermés.
Qui peut l’utiliser, et qui devrait attendre ?
À ce stade, GLM-5.3 est partiellement déployable. Les startups et les équipes d’ingénierie de taille intermédiaire peuvent déjà l’essayer via l’API ou le Coding Plan. Les entreprises soumises à des règles de résidence des données ou de revue fournisseur auront plutôt intérêt à attendre la publication des poids, prévue environ deux semaines après le lancement, une fois les évaluations de sécurité et le durcissement terminés. Les éditeurs d’outils de sécurité, les MSSP, mais aussi les acteurs du cloud et les équipes qui maintiennent des moteurs de navigateur, des piles réseau ou des noyaux système, sont les premiers à surveiller cette version. Dans les usages, Z.ai vise surtout les refontes à l’échelle d’un dépôt, les agents CLI de longue durée, la gestion d’incidents en CI, la recherche de vulnérabilités en boîte blanche, le tri des crashs et la relecture de code sécurisé.
Points clés
- GLM-5.3 repose sur le même base model que GLM-5.2.
- Terminal-Bench 3.0 passe de 4,6 à 28,3.
- CyberGym atteint 84,5 % selon Z.ai.
- Les poids sont annoncés pour environ deux semaines plus tard.
- Z.ai dit publier après évaluation de sécurité et durcissement.
- Les usages visés vont des agents CLI à l’audit de code.
En chiffres
- 743 milliards de paramètres — socle commun à GLM-5.2 et GLM-5.3, selon Z.ai.
- 28,3 — score de Terminal-Bench 3.0 pour GLM-5.3, contre 4,6 pour GLM-5.2.
- 84,5 % — résultat de CyberGym pour GLM-5.3, selon l’annonce de Z.ai.
- 54,4 % — score d’ExploitBench pour GLM-5.3, contre 24,4 % auparavant.
- 2 semaines — délai annoncé avant la publication des poids.