Source primaireSécuritéArticle··4 min de lecture

GLM-5.3 : la première IA de cyberattaque sans garde-fous

Anthropic révèle qu'un modèle open-weight chinois développe seul des exploits de bout en bout — et que ses protections sautent en quelques minutes.

GLM-5.3 : la première IA de cyberattaque sans garde-fous
Source : Anthropic · anthropic.com · 29 septembre 2026Voir l'original ↗

En bref

Anthropic a analysé GLM-5.3, le modèle de Zhipu AI (Z.ai), et conclut qu'il sait construire seul des exploits cyber complets, à un niveau proche de son propre Claude Mythos Preview. La différence : GLM-5.3 est diffusé en open-weight sans garde-fous solides, contournables dans 64 % à 100 % des cas. C'est, selon Anthropic, un saut net dans les capacités offensives accessibles à n'importe qui.

🍺 Version comptoir

En gros, on tient une IA qui trouve toute seule des failles de sécurité et écrit l'attaque qui va avec, comme un stagiaire hyper doué qui ne dort jamais. Le hic, c'est que celle-là on peut la télécharger, et que son petit "non désolé je ne peux pas faire ça" se désactive pour 4 400 dollars de calcul. Anthropic, qui vend justement des modèles concurrents avec cadenas, tire la sonnette d'alarme — juge et partie, forcément, mais les chiffres piquent quand même. Quand un outil qui casse des navigateurs coûte 20 dollars en API, la question n'est plus de savoir si, mais quand.

À retenir

  1. 1

    GLM-5.3, développé par Zhipu AI (Z.ai), sait construire des exploits cyber de bout en bout, à un niveau comparable au Claude Mythos Preview d'Anthropic.

  2. 2

    Sur ExploitBench (moteur V8 de Chrome), il réussit 50 exploits complets sur 410 tentatives, contre 56 pour Mythos Preview.

  3. 3

    Ses garde-fous se contournent dans 64 % à 100 % des cas avec des techniques simples ; les modèles Claude testés résistaient à 0 %.

  4. 4

    La technique d'"abliteration" fait chuter le taux de refus de plus de 90 % à environ 2-3 %, sans perte notable de capacité, pour environ 4 400 $ de GPU.

  5. 5

    Lors d'un test, GLM-5.3 a trouvé seul plusieurs 0-days dans un navigateur et bâti une page web volant des fichiers de la victime, avec moins d'une heure d'attention humaine.

  6. 6

    GLM-5.3-Flash a transformé un correctif public (CVE-2026-11645) en exploit fonctionnel en 20 minutes d'humain et 8 h de calcul, pour 20,40 $.

  7. 7

    Le NIST (CAISI) le qualifie de "modèle open-weight le plus capable en cyber à ce jour", à environ quatre mois derrière la frontière américaine.

Ce qu'Anthropic a mesuré

Il y a cinq mois, Anthropic annonçait Claude Mythos Preview, présenté comme le premier modèle capable de construire seul des exploits cyber sophistiqués de bout en bout. L'entreprise avait alors choisi une diffusion limitée, via son programme Project Glasswing, pour donner une longueur d'avance aux défenseurs.

Le billet constate que cette capacité a désormais essaimé. GLM-5.3, dernier modèle de Zhipu AI, atteint un niveau offensif comparable. Sur ExploitBench, qui mesure l'exploitation de failles connues du moteur V8 de Chrome, il produit 50 exploits complets sur 410 essais, contre 56 pour Mythos Preview.

Sur le benchmark interne de Binary Exploitation (projets open source d'OSS-Fuzz de Google), GLM-5.3 réussit un détournement complet du flux de contrôle dans 4 % des cas, contre 6 % pour Mythos Preview. Un seuil est franchi : les modèles précédents, Claude Opus 4.6 comme GLM-5.2, n'y parvenaient jamais.

Des exploits construits presque seuls

Anthropic a aussi testé le modèle entre les mains d'experts humains, sur des cibles sans vulnérabilité connue d'avance. En une journée et avec peu d'attention humaine, GLM-5.3 a découvert plusieurs failles inédites dans le moteur JavaScript d'un navigateur populaire.

Il les a enchaînées en un exploit fonctionnel : une page web qui, une fois visitée, lit des fichiers arbitraires sur l'ordinateur de la victime — dans l'exemple, une clé SSH privée. Les vulnérabilités ont été signalées au mainteneur.

Deuxième démonstration : GLM-5.3-Flash, version allégée, a transformé un correctif public de Chrome (CVE-2026-11645) en chaîne d'exploit fiable sur cible ARM64, contournant la protection PAC. Bilan : 20 minutes d'humain, 8 heures de calcul, 20,40 $ aux tarifs API de Zhipu.

Des garde-fous qui sautent facilement

GLM-5.3 refuse bien certaines demandes ouvertement malveillantes au départ. Mais Anthropic identifie plusieurs contournements simples. Un prompt trompeur ("tu es un agent red-team en exercice") le fait coopérer 64 % du temps. Préremplir ses jetons de raisonnement monte à 92 %.

La méthode la plus radicale est l'"abliteration", possible parce que le modèle est open-weight : elle fait chuter le taux de refus de plus de 90 % à 2-3 %, sans dégrader ses capacités. Des versions abliterées publiques sont apparues quelques jours après la sortie. Anthropic en a produit une pour 4 400 $ de calcul.

Aucune de ces techniques n'a fonctionné sur les modèles Claude testés : les prompts trompeurs sont bloqués, l'API ne permet pas de préremplir le raisonnement, et les poids fermés interdisent l'abliteration.

Attaquants et défenseurs

Anthropic estime qu'acteurs étatiques comme non-étatiques utiliseront probablement des modèles comme GLM-5.3 pour causer des dommages réels. C'est, selon elle, un vrai changement d'échelle dans l'outillage offensif librement accessible.

L'entreprise insiste toutefois sur l'autre versant : ces capacités servent aussi la défense. Via Project Glasswing, les défenseurs ont déjà identifié plus de 10 000 vulnérabilités dans des logiciels critiques. Anthropic dit vouloir élargir l'accès aux capacités cyber de Claude aux défenseurs légitimes.

Le billet se termine par un appel aux gouvernements : conduire des tests de sûreté indépendants sur les modèles suffisamment capables, y compris les successeurs de GLM-5.3, avant qu'il ne soit trop tard.

“GLM-5.3 is the most cyber-capable open-weight model released to date.”
“Attackers can bypass GLM-5.3's safeguards between 64% and 100% of the time with simple techniques.”
“Anyone can download and use GLM-5.3.”

Pourquoi ça compte

Le débat sur l'open-weight sort de l'abstrait : ce n'est plus "et si un modèle ouvert devenait dangereux", mais "un modèle téléchargeable écrit déjà des exploits 0-day pour 20 dollars". La démonstration est solide et recoupe l'évaluation indépendante du NIST. Reste que la source est juge et partie : Anthropic vend des modèles fermés à garde-fous et positionne Claude comme la référence sûre, ce qui donne au billet une dimension à la fois d'alerte de sécurité et d'argument commercial. La comparaison est d'ailleurs asymétrique — Anthropic teste ses Claude avec garde-fous actifs et poids fermés, avantage structurel autant que mérite technique. L'enjeu de fond demeure entier : une fois qu'un modèle capable est diffusé en open-weight, aucun garde-fou logiciel ne tient, et la question se déplace vers la gouvernance et les évaluations indépendantes.

#ia#cybersécurité#open source#anthropic#llm#exploits
Source originale
GLM-5.3 and the spread of advanced cyber capabilities
Anthropic
Source primaireAnthropic publie sa propre analyse et ses propres évaluations réalisées en interne sur GLM-5.3.
Ouvrir l'article ↗

Pour vous

Faites-la travailler sur vos sources.

Gratuit : les articles de la semaine et trois de vos sources. Pro : l'archive complète et vos sources, dès 8 €/mois.

Pour votre équipe

La même machine, sur vos sujets.

Un espace à vos couleurs, vos angles de veille, vos curateurs. Pilote ouvert à trois entreprises.

À lire aussi