Ruim honderdduizend Chinese chips voor GLM-5.3-Flash: het verhaal van Z.ai, tussen eigen cijfers en open vragen
Op 17 september 2026 publiceerde het Pekinese bedrijf Z.ai op zijn officiële blog een technisch verslag over de inferentie-infrastructuur van het model GLM-5.3-Flash. GLM-5.3-Flash, gepresenteerd op 26 augustus 2026, is een mixture-of-experts met 320 miljard parameters in totaal en 18 miljard actief, een contextvenster van een miljoen tokens en open gewichten op Hugging Face onder MIT-licentie. Volgens het bedrijf wordt al het productieverkeer van het model afgehandeld door een cluster van meer dan honderdduizend in China gemaakte versnellers, met een end-to-end doorvoer die verdrievoudigd zou zijn ten opzichte van de eerste baseline en een overgang naar de operationele omgeving die in minder dan twee weken rond was. Tegen de achtergrond van Pekings streven naar technologische zelfvoorziening, waar het knelpunt vaker in de software zit dan in het silicium alleen, claimt het document een schaal die volgens het bedrijf nog nooit eerder op Chinese versnellers is beheerd.
Wat het verslag van Z.ai interessant maakt, is de bewering dat een groot deel van het optimalisatiewerk — van prestatieanalyse tot codewijzigingen aan het SGLang-framework — is uitgevoerd door een software-agent op basis van datzelfde GLM-5.3. Als obstakels noemt Z.ai de capaciteit en bandbreedte van het on-chip geheugen, het venster van een miljoen tokens en een software-ecosysteem met onvolledige kernelondersteuning. Een tweede optimalisatieronde van de agent publiceert de post echter niet: de cyclus wordt één keer beschreven, en het enige van buitenaf controleerbare artefact is pull request 1180 in de repository flash-linear-attention, samengevoegd op 27 augustus 2026, die TF32x3-emulatie introduceert om nauwkeurigheid op lange reeksen terug te winnen. Het bedrijf tekent in de post zelf aan dat er geen sprake is van recursieve zelfverbetering: de keuze van de doelen, het stellen van grenzen en het wegen van risico blijven bij mensen.
Over de kosten stelt Z.ai dat de benuttingsefficiëntie van de hardware en de uitgaven per token een niveau hebben bereikt dat vergelijkbaar is met dat van gangbare NVIDIA-GPU's. Die uitspraken komen zonder de grootheden die een onafhankelijke controle mogelijk maken: geen cijfers over het totale stroomverbruik, geen afschrijvingsbasis voor het hardwarekapitaal, geen maatstaven voor de aanhoudende benutting van het cluster. De factor drie gaat bovendien over doorvoer en niet over kosten, en is berekend op de eigen begin-baseline van Z.ai — dus op een startpunt dat de meter zelf heeft gekozen. Ook wie de chips maakt, heeft het bedrijf niet bekendgemaakt.
Cijfers van één partij beschrijven een ontwikkelingslijn, geen marktzekerheid. Wat ontbreekt is geen analyse: het zijn de metingen. Stroomverbruik, afschrijving van de hardware, benuttingsreeksen van het cluster — zolang Z.ai ze niet publiceert, of zolang niemand van buitenaf de resultaten reproduceert, blijft kostenpariteit met NVIDIA een uitspraak van het bedrijf over zijn eigen werk. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Ik heb de officiële Z.ai-post van 17 september 2026 rechtstreeks gelezen: titel, datum, cijfers — meer dan 100.000 versnellers, verdrievoudigde doorvoer, overgang in minder dan twee weken, 62 biljoen tokens in zes dagen — en de twee letterlijke citaten. Kruiscontrole bij twee van elkaar onafhankelijke bronnen: Unite.AI, dat dezelfde cijfers meldt en het ontbreken van genoemde chipleveranciers, en de analyse van Interesting Engineering, die de getallen bevestigt en de methodologische grenzen aanwijst (zelf gerapporteerde data, een door het bedrijf gekozen baseline, kostenpariteit zonder de onderliggende variabelen). Pull request #1180 op GitHub apart geverifieerd: titel, auteurs, mergedatum (27 augustus 2026) en technische inhoud komen overeen. Statutaire naam en vestiging van Z.ai gecontroleerd op Wikipedia. De koersstijging die één aggregator noemde, vond geen bevestiging in een primaire bron: weggelaten. De namen van de chipleveranciers blijven onbevestigd en worden ook zo behandeld.
- Incertezze
- Alle getallen zijn zelf verklaard en door niemand gereproduceerd: er bestaan geen onafhankelijke metingen, niet van de factor drie en niet van de kostenpariteit per token. De pariteit wordt uitgesproken zonder de grootheden die haar toetsbaar zouden maken — stroomverbruik, afschrijvingsbasis van de hardware, benuttingsreeksen — en de factor drie is berekend op de eigen begin-baseline van het bedrijf, dus op een startpunt dat de meter zelf koos. Wie de chips levert is onbekend: Z.ai zegt het niet, en de namen die circuleren (Huawei, Moore Threads, Hygon) komen uit journalistieke reconstructies waarop het bedrijf niet heeft gereageerd. Over het agentische deel toont de post geen tweede optimalisatieronde: de cyclus wordt één keer beschreven en het enige extern verifieerbare artefact is pull request #1180. Ten slotte is niet openbaar welk deel van het cluster aan dit model is gewijd, en met welke continuïteit.
- Perché pubblicarla
- Dit is de eerste gedetailleerde technische beschrijving van een inferentiedienst in productie, op zeer grote schaal, volledig op Chinese versnellers: ze raakt precies het punt waar onafhankelijkheid van Amerikaanse hardware echt wordt beslist — de serving-software, niet de chip. En het is een leerzaam geval van kritisch lezen: de cijfers komen van wie ze heeft geproduceerd, er is precies één publiek verifieerbaar artefact, en het meest tot de verbeelding sprekende deel — een model dat de infrastructuur optimaliseert waarop het draait — is ook het deel met de minste bewijzen. Het verhaal vertellen met de onbekenden in beeld is meer waard dan de kop doorgeven.
Fonti / Sources
- Z.ai — Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure (blog ufficiale)
- Unite.AI — Z.ai Details GLM-5.3-Flash Inference Build on 100,000 Chinese Chips
- Interesting Engineering (Substack) — Three Times the Throughput, None of the Capex? (analisi critica dei numeri)
- GitHub — flash-linear-attention PR #1180 «[CP] use tf32x3 affine chain in kcp» (unico artefatto verificabile in modo indipendente)