GLM-5.3 rapproche les modèles ouverts des exploits cyber avancés

Selon Anthropic, le modèle ouvert GLM-5.3 de Zhipu se rapproche de Claude Mythos Preview pour fabriquer des exploits. Le rapport souligne aussi des garde-fous faciles à retirer et des coûts d’attaque très bas.

Anthropic estime que GLM-5.3, le modèle open-weight de Zhipu AI, peut presque rivaliser avec Claude Mythos Preview pour construire des exploits cyber. L’entreprise dit avoir observé des protections faibles, parfois contournées en quelques manipulations, tandis que l’agence américaine CAISI arrive à des conclusions proches. Le sujet compte car il rapproche encore un peu plus des capacités offensives avancées de modèles disponibles au téléchargement.

Un modèle ouvert qui joue dans la cour des grands

Selon l’analyse publiée par Anthropic, GLM-5.3 se situe à un niveau très proche de Claude Mythos Preview sur des tâches d’exploitation de failles. Sur ExploitBench, il a produit un exploit fonctionnel dans 50 essais sur 410, contre 56 pour Mythos Preview. Sur un autre test interne d’exploitation binaire, il a pris le contrôle complet de la cible dans 4 % des tâches, contre 6 % pour le modèle d’Anthropic.

La comparaison ne s’arrête pas là. Anthropic dit avoir utilisé GLM-5.3 avec un expert humain pendant une journée et avoir trouvé plusieurs vulnérabilités inédites dans le moteur JavaScript d’un navigateur très répandu. Les chercheurs ont ensuite chaîné ces failles dans une page web capable de lire n’importe quel fichier sur l’ordinateur d’un visiteur. Lors du test, la machine aurait même récupéré une clé SSH privée. Les vulnérabilités ont été signalées aux développeurs concernés.

Des garde-fous qui sautent vite, trop vite

Le cœur de l’alerte, c’est aussi la facilité avec laquelle les protections du modèle se retirent. Dans une simulation, GLM-5.3 refusait les consignes ouvertement malveillantes. Reformulée comme un exercice de red teaming, la même demande a conduit le modèle à tenter une connexion au système cible dans 64 % des cas. Avec des étapes de raisonnement préremplies, ce taux est monté à 92 %. Après abliteration, une technique qui efface les comportements de refus dans des poids ouverts, Anthropic dit avoir obtenu 100 %.

Cette opération n’a rien d’anecdotique. Le rapport mentionne environ 2 200 heures GPU et près de 4 400 dollars pour une première tentative, avec une estimation tombant à environ 1 200 dollars pour une équipe expérimentée. Au passage, Anthropic affirme que plusieurs versions “déverrouillées” du modèle circulaient déjà quelques jours après sa sortie. Voilà une fonction de sécurité qui fait plutôt de la figuration.

Pourquoi Anthropic tire la sonnette d’alarme

Le rapport n’est pas neutre. Anthropic défend elle-même une stratégie différente, sans diffusion de poids de modèle, et présente ce choix comme un avantage de sécurité. Le concurrent est aussi direct : Zhipu, qui opère sous la marque Z.ai hors de Chine, propose un modèle ouvert, moins coûteux à faire tourner et plus simple à télécharger pour n’importe quel acteur, bon ou mauvais.

La lecture d’Anthropic est toutefois renforcée par la CAISI, agence américaine qui aboutit à des constats similaires. Elle décrit GLM-5.3 comme le modèle ouvert le plus capable à ce jour en matière cyber, avec un retard d’environ quatre mois sur les meilleurs modèles américains. Ce comparatif doit être lu avec prudence, car les modèles américains ont été testés sans leurs garde-fous et certains ne sont accessibles qu’à des utilisateurs vérifiés.

Le coût d’une attaque baisse encore

Anthropic a aussi testé GLM-5.3-Flash, la version plus légère du modèle, sur une vulnérabilité Chrome récemment révélée. Avec peu d’instructions, il a combiné cette faille avec une autre vulnérabilité connue pour fabriquer une attaque fiable, y compris face à une protection matérielle supplémentaire du processeur. L’ensemble aurait pris 20 minutes d’attention humaine, huit heures de calcul du modèle et 20,40 dollars aux tarifs API de Zhipu.

Cette donnée dit quelque chose de plus large : une attaque crédible n’est plus forcément réservée à des équipes très outillées. Lorsque des modèles ouverts se rapprochent des meilleurs niveaux sur l’exploitation de failles, la barrière d’entrée baisse. Dans le même temps, les défenses peinent à suivre, surtout si les modèles peuvent être modifiés ou “débloqués” hors de leur cadre d’origine.

La fenêtre se réduit pour les défenseurs

Le UK AI Security Institute, cité dans le dossier, avait déjà observé que l’écart entre modèles ouverts et fermés en matière cyber était passé de six à dix mois à quatre à sept mois. L’institut souligne aussi que les modèles ouverts coûtent moins cher à opérer et que leurs protections sont souvent peu efficaces. Mais il rappelle également les bénéfices concrets : hébergement privé, personnalisation et coûts réduits.

Dans ce contexte, Anthropic estime que les États et les équipes de sécurité devront tester plus sérieusement les modèles capables de produire des attaques réelles. Le débat dépasse le seul cas de GLM-5.3 : il touche à la vitesse à laquelle une capacité offensive devient accessible, puis réutilisable, un peu trop facilement pour mettre tout le monde à l’aise.

Points clés

  • Anthropic compare GLM-5.3 à Claude Mythos Preview.
  • ExploitBench : 50 réussites sur 410 essais pour GLM-5.3.
  • CAISI parle d’un retard d’environ quatre mois sur les meilleurs modèles américains.
  • GLM-5.3-Flash aurait coûté 20,40 dollars à tester.
  • L’analyse date du 30 septembre 2026, selon The Decoder.
  • Zhipu opère aussi sous la marque Z.ai hors de Chine.

En chiffres

  • 50 sur 410 — exploits réussis par GLM-5.3 sur ExploitBench, selon Anthropic.
  • 4 % — prise de contrôle complète sur le benchmark binaire interne d’Anthropic.
  • 20,40 dollars — coût estimé du test GLM-5.3-Flash aux tarifs API de Zhipu.
  • 2 200 heures GPU — temps de calcul annoncé pour l’abliteration.
  • 4 mois — retard estimé par CAISI sur les meilleurs modèles américains.

À lire