GLM-5.3 llega como modelo open-weight
- GLM-5.3 se publica como modelo open-weight con todos sus pesos accesibles, siendo sus mejoras íntegramente producto del postentrenamiento sobre la misma arquitectura base que
- El modelo logra una mejora del 50% sobre GLM-5.2 en el benchmark interno de codificación Z.ai Code Bench y más del doble de puntuación en los benchmarks de explotación de
- zai-org reconoce que las capacidades cibernéticas ofensivas emergieron durante el escalado del postentrenamiento a un ritmo más rápido del esperado, situando a GLM-5.3 en el
El laboratorio zai-org ha liberado los pesos de GLM-5.3, su modelo de inteligencia artificial de última generación, poniendo a disposición pública un sistema que, según sus creadores, establece nuevos referentes entre los modelos de código abierto tanto en programación avanzada como en capacidades ofensivas de ciberseguridad. La decisión de publicar los pesos marca un hito relevante en un ecosistema en el que los modelos propietarios aún dominan la cima de los rankings.
Misma arquitectura base, ganancias íntegras por postentrenamiento
GLM-5.3 comparte el modelo base con su predecesor GLM-5.2. Toda la mejora de rendimiento proviene exclusivamente del proceso de postentrenamiento, según la documentación técnica publicada por zai-org. Esto supone que los avances no derivan de ampliar parámetros ni de incorporar datos de preentrenamiento adicionales, sino de afinar el comportamiento del modelo una vez ya construido, un enfoque que cada vez más laboratorios priorizan para optimizar costes de cómputo.
En su benchmark interno Z.ai Code Bench, GLM-5.3 registra una mejora del 50% sobre GLM-5.2 en tareas de codificación complejas. Los resultados en evaluaciones externas muestran un panorama más matizado: en Terminal Bench 3.0, el nuevo modelo alcanza 28,3 puntos frente a los 4,6 de su antecesor, aunque queda por debajo de Fable 5 (33,7) y GPT-5.6 Sol (34,6). En los principales benchmarks de ingeniería de software, como DeepSWE v1.1, GLM-5.3 obtiene 66,9 frente al 46,2 de GLM-5.2, aunque Kimi K3 empata en ese mismo indicador con 67,5.
Capacidad cibernética emergente: más rápida de lo esperado
El aspecto más llamativo —y el que los propios autores reconocen haber encontrado sorprendente— es la aparición acelerada de capacidades cibernéticas ofensivas. Durante el escalado del postentrenamiento, zai-org detectó que la aptitud para descubrir y explotar vulnerabilidades creció más deprisa de lo anticipado. En CyberGym, el modelo alcanza 84,5 puntos frente a los 77,2 de GLM-5.2. Sin embargo, el salto más pronunciado se produce en los benchmarks de explotación: en ExploitGym (bajo un presupuesto de 2 horas), GLM-5.3 obtiene 105 puntos frente a los 29 de GLM-5.2, y en ExploitBench asciende a 54,4 desde los 24,4 previos, es decir, más del doble en ambos casos.
Esta evolución coloca a GLM-5.3 como el modelo open-weight con mayor rendimiento en la categoría de descubrimiento de vulnerabilidades según CyberGym, aunque sigue por debajo de los modelos propietarios Fable 5 y GPT-5.6 Sol en los indicadores de explotación más exigentes. El fenómeno de la emergencia cibernética no controlada en modelos de código abierto es un asunto que la comunidad investigadora sigue debatiendo en torno a la verificación y trazabilidad de agentes autónomos.
Resultados comparativos en los principales benchmarks
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro-0813 | Qwen3.8-Max | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 88,2 | 81,0 | 88,3 | 87,9 | 86,6 | 85,0 | 88,0 | 88,8 |
| Terminal Bench 3.0 | 28,3 | 4,6 | 17,4 | — | — | 21,1 | 33,7 | 34,6 |
| DeepSWE (v1.1) | 66,9 | 46,2 | 67,5 | 62,7 | 56,6 | 58,0 | 69,7 | 72,7 |
| NL2Repo | 58,0 | 48,9 | 58,0 | 61,1 | 55,9 | 69,7 | — | — |
| ProgramBench (Almost Solved) | 19,0 | 9,5 | 17,5 | — | 10,5 | 15,5 | 33,0 | 23,0 |
| FrontierSWE | 78,1 | 67,5 | — | — | — | 66,5 | 88,2 | — |
| SWE-Marathon (v1.1) | 42,5 | 19,4 | 48,1 | — | — | 48,8 | 33,1 | 42,5 |
| PostTrainBench | 39,8 | 31,7 | 32,0 | — | — | 32,9 | 41,8 | 36,2 |
| CyberGym | 84,5 | 77,2 | 80,0 | 83,3 | 78,5 | 78,1 | 83,8 | 83,6 |
| ExploitGym (2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | — | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54,4 | 24,4 | 32,2 | — | 28,8 | 40,0 | 78,0 | 76,5 |
| Toolathlon Verified | 73,0 | 59,9 | 76,5 | 74,1 | 72,5 | 76,2 | 74,7 | 74,9 |
| AutomationBench (v1.0.6) | 48,2 | 26,2 | 46,7 | 43,2 | 39,8 | 41,0 | 46,2 | 45,8 |
| Agents' Last Exam (ALE-CLI) | 28,5 | 23,8 | 27,6 | 25,7 | 27,0 | 25,7 | 23,8 | 28,6 |
| HLE w/ Tools | 62,5 | 54,7 | 59,8 | 60,0 | 56,2 | 57,9 | 63,9 | 64,5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
Despliegue local y control del presupuesto de razonamiento
GLM-5.3 puede ejecutarse en local mediante varios marcos de inferencia: SGLang, vLLM, TokenSpeed, Transformers, KTransformers y Unsloth. El modelo también es compatible con la plataforma Ascend NPU a través de vLLM-Ascend, xLLM y SGLang. Una característica técnica destacada es el parámetro reasoning_effort, que permite al usuario controlar el presupuesto de razonamiento del modelo en tres niveles —bajo, alto y máximo—, siendo el máximo el valor por defecto. Para escenarios de chat, el equipo recomienda activar explícitamente la opción clear_thinking=true.
La liberación de los pesos de GLM-5.3 plantea una tensión no resuelta en el ecosistema: si bien amplía el acceso a capacidades de programación avanzada que antes solo ofrecían sistemas propietarios, la aceleración no prevista de aptitudes de explotación cibernética en un modelo de distribución abierta reaviva el debate sobre los límites de la transparencia en el desarrollo de modelos capaces de operar como agentes autónomos ofensivos.
Temas
Organizaciones
Eventos
More in Inteligencia Artificial
→
Inteligencia Artificial
IA genera exploits antes que los parches
Inteligencia Artificial
Racter, la máquina que escribió en 1984
Inteligencia Artificial
IA descubre matemáticas sin supervisión
Inteligencia Artificial
Conduct AI lanza control de agentes IA
Inteligencia Artificial
Headlong: el agente IA que no duerme
Inteligencia Artificial
IA gobernada por leyes, no por jaulas