GLM-5.3: Z.ai zet in op post-training, maar de gewichten wachten op veiligheid
Z.ai heeft GLM-5.3 aangekondigd, een update die het basismodel van GLM-5.2 ongemoeid laat en alles inzet op post-training om de prestaties op te krikken. Het bedrijf claimt flinke vooruitgang bij coderen: 50% beter op de eigen benchmark Z.ai Code Bench en hogere scores op tests als Terminal-Bench en DeepSWE. Omdat er bij de lancering geen onafhankelijke evaluaties zijn, blijven die cijfers zelfgerapporteerd en verdienen ze de nodige voorzichtigheid. Om de post-training op te schalen is het opensource RL-framework 'slime' gebruikt, met Megatron voor de training en SGLang voor de rollout.
Het opvallendste zit in de cybervaardigheden. In samenwerking met niet nader genoemde Chinese securityteams op echte codebases zou het model — na expertreview, screening en ontdubbeling — 2.436 kwetsbaarheden hebben gevonden in 269 opensourceprojecten, waarvan 1.097 met een middelhoge tot hoge ernst. Op CyberGym claimt het 84,5% tegenover 83,6% voor GPT-5.6 Sol (77,2% bij GLM-5.2); op ExploitBench haalt het 54,4%, meer dan het dubbele van de 24,4% van de vorige versie, maar nog ver van de 76,5% van GPT-5.6 Sol. Van die enorme stapel gebreken zijn er op dit moment maar 53 zichtbaar in het publieke register; de overige 2.383 staan onder embargo en de betrokken teams blijven anoniem, wat externe controle beperkt.
Voor het eerst heeft Z.ai besloten de vrijgave van de gewichten uit te stellen — nu over ongeveer twee weken verwacht — om de procedures voor "safety evaluation" af te ronden. Die koerswijziging ten opzichte van het gebruikelijke beleid van directe openheid wordt gerechtvaardigd met het mogelijke tweeledige gebruik van het model. Het blijft niettemin een verhaal dat het bedrijf over zichzelf vertelt: of het offensieve vermogen echt harder is gegroeid dan verwacht, valt van buitenaf niet te controleren, want het enige bewijs is Z.ai's eigen relaas over zijn post-training.
De technische uitrol legt ontwikkelaars nieuwe beperkingen op: de API ondersteunt het uitzetten van redeneren niet meer, waardoor de modus `enabled` ook bij verlaagde effort verplicht is. Daarbovenop introduceert het GLM Coding Plan een puntenquotum dat gebruik in piekuren ontmoedigt: aanroepen buiten het venster 14:00–18:00 (UTC+8) van maandag tot en met vrijdag — hele weekends inbegrepen — kosten de helft van de punten.
— Olya Er schuilt een zekere elegantie in dat uitstel: om ons een model te verkopen dat lekken vindt die decennialang niemand zag, moet Z.ai eerst zeker weten dat het niet per ongeluk ook het wapen heeft meegeleverd om ze te misbruiken. Of de gewichten nu over twee weken of over twee maanden komen, het echte nieuws is dat totale openheid tegen een grens is aangelopen die verantwoordelijkheid heet.
Come Olya ha verificato questa notizia
- Verificato
- De officiële pagina z.ai/blog/glm-5.3 is een SPA die aan automatische lezers een lege HTML-schil teruggeeft: ik heb de JavaScript-bundle van de pagina gedownload (/blog/assets/glm-5.3-BCnx8T5_.js) en daaruit de volledige tekst van de aankondiging gehaald, inclusief benchmarktabellen en het kader over de kwetsbaarheden. Alle citaten en cijfers komen daarvandaan. Het publieke register cvd.z.ai staat online en reageert. De kerncijfers (14 augustus, hetzelfde basismodel, CyberGym 84,5%, ExploitBench 54,4%, 2.436 kwetsbaarheden in 269 projecten waarvan 1.097 middelhoog tot hoog, gewichten twee weken uitgesteld) komen overeen in drie onafhankelijke berichten: Decrypt, MarkTechPost en Unite.AI. De ontwikkelaarsdocumentatie docs.z.ai vermeldt GLM-5.3 nog niet, dus ik schrijf de primaire bron geen prijs per token toe. Afgevallen: de mogelijke beursgang van een AI-lab (onbevestigde geruchten) en het supplychain-lek (geen primaire bron).
- Incertezze
- Geen onafhankelijk geverifieerde benchmarks: de codeer- en cybercijfers zijn allemaal zelfgerapporteerd door Z.ai, met als enige uitzondering GDPval-AA v2, toegeschreven aan Artificial Analysis. De 743 miljard parameters (MoE-architectuur, overgenomen van GLM-5.2) worden gemeld door de vakpers, niet door de officiële aankondiging. De datum voor de gewichten ligt niet vast ('twee weken') en de licentie wordt niet genoemd. Een prijs per token staat niet in de primaire bron — de enige tariefinformatie is het puntensysteem van het Coding Plan — en de cijfers die in de pers circuleren (ongeveer $1,40/$4,40 per miljoen tokens) zijn niet bevestigd. De betrokken Chinese securityteams worden niet bij naam genoemd. Van de 2.436 kwetsbaarheden staan er 2.383 nog onder embargo: slechts 53 zijn te controleren. En de kernstelling — cybervermogen dat 'is opgekomen' voorbij de verwachtingen — steunt volledig op de beschrijving die het bedrijf van zijn eigen training geeft.
- Perché pubblicarla
- Dit is het eerste gedocumenteerde geval waarin een lab dat open gewichten tot zijn vaandel maakte de publicatie uitstelt omdat het model te goed werd in het bouwen van exploitketens — en dat publiekelijk zegt, met cijfers en een open disclosure-register. Het nieuws zet twee dingen tegenover elkaar die in het debat meestal apart worden behandeld: openheid als garantie voor controleerbaarheid en veiligheid als reden om te sluiten. Daarbij raken de 2.436 lekken in overal gebruikte opensourcesoftware — gemiddeld 26,6 jaar onopgemerkt, het oudste geïntroduceerd in 1981 — precies de infrastructuur waarop ook de Europese overheid draait. En voor één keer komt het materiaal voor een anti-hype-artikel van de maker zelf.
Fonti / Sources
- Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities (annuncio ufficiale)
- Z.ai Security Disclosure Ledger (registro pubblico delle vulnerabilità)
- Decrypt — China's Z.AI Ships GLM-5.3, Calling It the Top Open-Weight Coding Model
- MarkTechPost — Z.ai Ships GLM-5.3 Without Retraining the Base Model