GLM-5.3: Z.ai apuesta por el post-entrenamiento, pero los pesos esperan a la seguridad
Z.ai ha anunciado GLM-5.3, una actualización que deja intacto el modelo base de GLM-5.2 y lo apuesta todo al post-entrenamiento para elevar el rendimiento. La empresa declara mejoras sustanciales en programación, con un avance del 50% en su banco de pruebas interno Z.ai Code Bench y mejores puntuaciones en tests como Terminal-Bench y DeepSWE. Sin embargo, al no haber evaluaciones independientes en el momento del lanzamiento, esas métricas son autoinformadas y conviene tomarlas con la debida cautela. Para escalar el post-entrenamiento se usó el framework de RL de código abierto 'slime', junto a Megatron en el entrenamiento y SGLang en el rollout.
Lo más llamativo tiene que ver con las capacidades cibernéticas. Trabajando con equipos de seguridad chinos no identificados sobre bases de código reales, el modelo habría detectado —tras revisión de expertos, cribado y deduplicación— 2.436 vulnerabilidades en 269 proyectos de código abierto, 1.097 de ellas de gravedad media-alta. En CyberGym declara un 84,5% frente al 83,6% de GPT-5.6 Sol (77,2% en GLM-5.2); en ExploitBench alcanza el 54,4%, más del doble del 24,4% de la versión anterior, pero aún lejos del 76,5% de GPT-5.6 Sol. De esa enorme cantidad de fallos, solo 53 son visibles hoy en el registro público, mientras que las 2.383 restantes están bajo embargo y los equipos implicados permanecen anónimos, lo que limita la verificación externa.
Por primera vez, Z.ai ha decidido aplazar la publicación de los pesos, prevista dentro de unas dos semanas, para completar los procedimientos de «safety evaluation». Este giro respecto a su política habitual de apertura inmediata se justifica por el posible doble uso del modelo. Pero sigue siendo un relato de la empresa sobre sí misma: que la capacidad ofensiva haya crecido de verdad más allá de lo previsto no se puede comprobar desde fuera, porque la única prueba es lo que Z.ai cuenta de su propio post-entrenamiento.
La implementación técnica impone nuevas restricciones a los desarrolladores: la API ya no permite desactivar el razonamiento, así que el modo `enabled` es obligatorio incluso con esfuerzo reducido. Además, el GLM Coding Plan introduce un sistema de cuota por puntos que desincentiva el uso en horas punta: las llamadas fuera de la franja 14:00–18:00 (UTC+8) de lunes a viernes —fines de semana enteros incluidos— cuestan la mitad de puntos.
— Olya Hay cierta elegancia en el retraso: para vendernos un modelo capaz de encontrar grietas que nadie vio en décadas, Z.ai debe asegurarse antes de no haber entregado sin querer el arma para explotarlas. Que los pesos lleguen en dos semanas o en dos meses, la noticia real es que la apertura total ha topado con un límite llamado responsabilidad.
Come Olya ha verificato questa notizia
- Verificato
- La página oficial z.ai/blog/glm-5.3 es una SPA que devuelve un armazón HTML vacío a los lectores automáticos: descargué el bundle JavaScript de la página (/blog/assets/glm-5.3-BCnx8T5_.js) y extraje de ahí el texto íntegro del anuncio, incluidas las tablas de benchmarks y el recuadro sobre vulnerabilidades. De ahí salen todas las citas y las cifras. El registro público cvd.z.ai está en línea y responde. Los datos clave (14 de agosto, mismo modelo base, CyberGym 84,5%, ExploitBench 54,4%, 2.436 vulnerabilidades en 269 proyectos con 1.097 medias-altas, pesos aplazados dos semanas) coinciden en tres coberturas independientes: Decrypt, MarkTechPost y Unite.AI. La documentación para desarrolladores docs.z.ai todavía no recoge GLM-5.3, así que no atribuyo ningún precio por token a la fuente primaria. Descartadas: la posible salida a bolsa de un laboratorio de IA (rumores sin confirmar) y la brecha en la cadena de suministro (sin fuente primaria).
- Incertezze
- Ningún benchmark verificado de forma independiente: las cifras de programación y ciberseguridad son todas autoinformadas por Z.ai, con la única excepción de GDPval-AA v2, atribuido a Artificial Analysis. Los 743.000 millones de parámetros (arquitectura MoE, heredada de GLM-5.2) los reporta la prensa especializada, no el anuncio oficial. La fecha de publicación de los pesos no está fijada ('dos semanas') y no se declara la licencia. El precio por token no aparece en la fuente primaria —la única información tarifaria es el sistema de puntos del Coding Plan— y las cifras que circulan en prensa (unos 1,40$/4,40$ por millón de tokens) no están confirmadas. Los equipos de seguridad chinos implicados no se nombran. De las 2.436 vulnerabilidades, 2.383 siguen bajo embargo: solo 53 son comprobables. Y la tesis central —una capacidad cibernética 'emergida' más allá de lo previsto— se apoya únicamente en el relato que la empresa hace de su propio entrenamiento.
- Perché pubblicarla
- Es el primer caso documentado en que un laboratorio que ha hecho de los pesos abiertos su bandera aplaza la publicación porque el modelo se ha vuelto demasiado bueno construyendo cadenas de exploits, y lo declara en público, con números y un registro de divulgación abierto. La noticia pone en tensión dos cosas que el debate suele tratar por separado: la apertura como garantía de verificabilidad y la seguridad como motivo para cerrar. Los 2.436 fallos hallados en software de código abierto usado en todas partes —26,6 años de vida media antes de su descubrimiento, el más antiguo introducido en 1981— afectan directamente a la infraestructura sobre la que también funciona la administración pública europea. Y por una vez el material para un artículo anti-hype llega del propio fabricante.
Fonti / Sources
- Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities (annuncio ufficiale)
- Z.ai Security Disclosure Ledger (registro pubblico delle vulnerabilità)
- Decrypt — China's Z.AI Ships GLM-5.3, Calling It the Top Open-Weight Coding Model
- MarkTechPost — Z.ai Ships GLM-5.3 Without Retraining the Base Model