GLM-5.3 open-weight, cyber et coding
- GLM-5.3 est publié en open-weight par Z.ai ; tous ses progrès sur GLM-5.2 proviennent du post-entraînement, la base du modèle restant identique.
- Le modèle revendique une amélioration de 50 % en codage sur le référentiel interne Z.ai Code Bench et le premier rang open-source sur Terminal Bench 3.0.
- Des capacités offensives en cybersécurité ont émergé plus vite que prévu : GLM-5.3 triple les scores de GLM-5.2 sur ExploitGym et atteint 84,5 sur CyberGym.
Le laboratoire Z.ai a rendu public GLM-5.3, une version en accès libre (open-weight) de son modèle de langage, dont tous les progrès par rapport à GLM-5.2 proviennent exclusivement du post-entraînement — la base paramétrique demeurant identique. Deux axes de progression dominent l'annonce : un bond significatif en programmation et l'apparition, jugée plus rapide qu'anticipé par l'équipe elle-même, de capacités offensives en cybersécurité.
Un gain de 50 % en codage, selon Z.ai
Sur le référentiel interne Z.ai Code Bench, GLM-5.3 enregistre une amélioration de 50 % face à son prédécesseur immédiat. L'équipe revendique également le statut de meilleur modèle open-source sur Terminal Bench 3.0 — où il obtient 28,3 contre 4,6 pour GLM-5.2 — ainsi que sur Agents' Last Exam (ALE-CLI). Sur ce dernier, GLM-5.3 atteint 28,5, devançant tous les modèles open-weight du tableau comparatif fourni, bien qu'il reste légèrement en retrait de GPT-5.6 Sol (28,6). Ces chiffres sont issus des propres évaluations de Z.ai et n'ont pas été vérifiés de façon indépendante dans le cadre de cette publication. Pour une perspective plus large sur l'état de l'art en codage par agent, les fondamentaux du génie logiciel restent structurants pour les agents IA, comme le rappelle une analyse récente.
Des capacités cyber qui ont dépassé les prévisions de l'équipe
Le point le plus notable — et le plus sensible — de cette publication réside dans les performances offensives du modèle. Z.ai reconnaît explicitement que les capacités en cybersécurité se sont développées " plus vite que prévu " à mesure que le post-entraînement progressait. GLM-5.3 revendique la première place sur CyberGym (84,5) pour la découverte de vulnérabilités, devant Kimi K3 (80,0), DeepSeek-V4 Pro-0813 (83,3) et Claude Opus 4.8 (78,1). Sur ExploitGym, sous un budget de deux heures, GLM-5.3 atteint un score de 105, soit plus du triple de GLM-5.2 (29). À six heures, l'écart se creuse encore : 130 contre 39. Ces résultats placent le modèle en position compétitive face aux systèmes commerciaux, même si Fable 5 (181 / 247) et GPT-5.6 Sol (216 / 293) restent devant sur ce même benchmark. L'émergence non planifiée de telles aptitudes dans un modèle désormais distribuable librement soulève des questions de sécurité que la source ne tranche pas. La traçabilité des agents IA fait précisément l'objet de travaux visant à mieux encadrer ce type de capacités.
Tableau comparatif des benchmarks
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro-0813 | Qwen3.8-Max | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 88,2 | 81,0 | 88,3 | 87,9 | 86,6 | 85,0 | 88,0 | 88,8 |
| Terminal Bench 3.0 | 28,3 | 4,6 | 17,4 | — | — | 21,1 | 33,7 | 34,6 |
| DeepSWE (v1.1) | 66,9 | 46,2 | 67,5 | 62,7 | 56,6 | 58,0 | 69,7 | 72,7 |
| NL2Repo | 58,0 | 48,9 | 58,0 | 61,1 | 55,9 | 69,7 | — | — |
| ProgramBench (Almost Solved) | 19,0 | 9,5 | 17,5 | — | 10,5 | 15,5 | 33,0 | 23,0 |
| FrontierSWE | 78,1 | 67,5 | — | — | — | 66,5 | 88,2 | — |
| SWE-Marathon (v1.1) | 42,5 | 19,4 | 48,1 | — | — | 48,8 | 33,1 | 42,5 |
| PostTrainBench | 39,8 | 31,7 | 32,0 | — | — | 32,9 | 41,8 | 36,2 |
| CyberGym | 84,5 | 77,2 | 80,0 | 83,3 | 78,5 | 78,1 | 83,8 | 83,6 |
| ExploitGym (2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | — | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54,4 | 24,4 | 32,2 | — | 28,8 | 40,0 | 78,0 | 76,5 |
| Toolathlon Verified | 73,0 | 59,9 | 76,5 | 74,1 | 72,5 | 76,2 | 74,7 | 74,9 |
| AutomationBench (v1.0.6) | 48,2 | 26,2 | 46,7 | 43,2 | 39,8 | 41,0 | 46,2 | 45,8 |
| Agents' Last Exam (ALE-CLI) | 28,5 | 23,8 | 27,6 | 25,7 | 27,0 | 25,7 | 23,8 | 28,6 |
| HLE w/ Tools | 62,5 | 54,7 | 59,8 | 60,0 | 56,2 | 57,9 | 63,9 | 64,5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
Déploiement local et paramètres de contrôle
GLM-5.3 est compatible avec plusieurs environnements d'inférence, dont SGLang, vLLM, Transformers, KTransformers et Unsloth, ainsi qu'avec la plateforme Ascend NPU via vLLM-Ascend, xLLM et SGLang. Le modèle expose un paramètre reasoning_effort à trois niveaux (low, high, max) pour moduler le budget de réflexion ; la valeur par défaut est max. Pour les scénarios conversationnels, le paramètre clear_thinking doit être passé explicitement à true, sa valeur par défaut étant false.
La mise à disposition en open-weight d'un modèle dont les aptitudes offensives en cybersécurité ont surpris ses propres concepteurs illustre la tension croissante entre ouverture scientifique et maîtrise des risques — un dilemme que la communauté de la recherche en IA n'a pas encore résolu. D'autres modèles open-weight repoussent simultanément les limites du codage, rendant cette dynamique d'autant plus difficile à contenir.
Sujets
Organisations
Événements
More in Intelligence Artificielle
→
Intelligence Artificielle
OCaml : l'exploit avant le correctif
Intelligence Artificielle
Racter, l'ancêtre de l'IA générative
Intelligence Artificielle
Agents IA : découvertes mathématiques
Intelligence Artificielle
Conduct AI : garde-fous open source
Intelligence Artificielle
Headlong, l'agent IA en pensée continue
Intelligence Artificielle
L'IA régie par des lois, non des murs