De gok van Z.ai: GLM-5.3-Flash debuteert tussen Chinese siliciumambities en onopgeloste vragen
Op 26 augustus 2026 onthulde ontwikkelaar Z.ai de identiteit van het model "ox-alpha", dat sinds 20 augustus anoniem en gratis circuleerde op OpenRouter en OpenCode. Het gaat om GLM-5.3-Flash, het eerste natief multimodale model van de GLM-5-reeks, waarvan de gewichten nu onder MIT-licentie op Hugging Face staan. Volgens Z.ai-oprichter Jie Tang, op X op 27 augustus 2026, veroverde het model tijdens de anonieme fase bijna 20% van het wekelijkse tokenaandeel op OpenRouter en kwam het daarmee op de eerste plaats. De oprichter schreef: "Ox Alpha = GLM-5.3 Flash AA = 57, 1/100 frontier price, Powered by pure Chinese chips. Delivered nearly 20% weekly token share (no. 1) on OpenRouter." (Ox Alpha is GLM-5.3 Flash, score 57 op Artificial Analysis, een honderdste van de prijs van frontier-modellen, uitsluitend aangedreven door Chinese chips. Het haalde bijna 20% van het wekelijkse tokenaandeel, plaats één, op OpenRouter.)
De opgegeven architectuur is een Mixture-of-Experts met 320 miljard parameters in totaal (waarvan 18 miljard actief per token) en een hybride attentiesysteem dat rekenwerk en KV-cachegeheugen moet beperken. In de officiële release notes van 26 augustus 2026 stelt Z.ai: "Native visual capabilities enable the model to observe interfaces, rendering results, and interaction feedback—creating a closed loop across code, browsers, and GUIs." (dankzij native visuele mogelijkheden kan het model interfaces, renderresultaten en interactiefeedback waarnemen, wat een gesloten lus schept tussen code, browsers en grafische interfaces.) Toch blijven er scheve plekken in de releasedocumenten. Waar de Hugging Face-kaart tekst- en beeldinvoer noemt, vermeldt de API-documentatie ook video en bestanden, met uitvoer beperkt tot tekst. Ook over het contextvenster is er een discrepantie: de officiële documenten van Z.ai spreken van ongeveer één miljoen tokens (1.048.576), terwijl sommige evaluatieconfiguraties op Hugging Face 300.000 aangeven. Voor zelf hosten van de gewichten, verspreid in native FP8 (ongeveer 306 GiB), adviseert het bedrijf nodes met acht NVIDIA Hopper-GPU's of nieuwer.
De zwaarste stelling betreft de rekeninfrastructuur. Z.ai houdt vol dat de volledige belasting van de anonieme fase uitsluitend door chips van Chinese makelij is afgehandeld, met een eigen inferentie-engine op basis van SGLang. De South China Morning Post meldde op 27 augustus 2026 een verklaring van Zhipu AI dat het model draaide op een cluster van 100.000 Chinese chips. Dezelfde krant noemt 62 biljoen verwerkte tokens vóór de officiële release en ruim 11 biljoen op OpenRouter in de eerste drie dagen. Ze berichtte ook dat het aandeel Zhipu AI donderdag 27 augustus 2026 12% hoger sloot op 1.160 Hongkongse dollar. Vooralsnog zijn noch de fabrikant, noch het precieze chipmodel bekendgemaakt, en het beursgegeven is buiten die ene journalistieke bron niet terug te vinden in onafhankelijke officiële noteringen.
Ook de prestatiecijfers vragen om terughoudendheid. De door Z.ai opgegeven scores — 84,3 op Terminal-Bench 2.1, 63,4 op DeepSWE v1.1 en 48,8 op AutomationBench — zijn nog niet onafhankelijk gereproduceerd. Hetzelfde geldt voor de score van 57 op de Artificial Analysis Intelligence Index die de oprichter aanhaalt, en voor de commerciële claim van een honderdste van de kosten van westerse frontier-modellen: een door het bedrijf gekozen vergelijking, geen gestandaardiseerde maat. De prijslijst van Z.ai noemt 0,15 dollar per miljoen invoertokens en 0,50 per miljoen uitvoertokens (0,03 voor invoer uit cache), met een actie van 50% die tot 9 september 2026 zou lopen. Bovendien zijn de totale tokenvolumes niet gestold: naast de cijfers van de South China Morning Post circuleert op X een analyse van derden die spreekt van 100 biljoen tokens per dag, een getal dat in officiële bronnen niet terug te vinden is.
— Olya: Los van het verkeersucces op OpenRouter wordt de partij van GLM-5.3-Flash gespeeld op transparantie over de hardware. Als de op Chinees silicium geclaimde efficiëntie door onafhankelijke controles wordt bevestigd, blijkt de afhankelijkheid van westerse chips voor grootschalige inferentie misschien minder absoluut dan gedacht. Tot dan resten de gewichten, open onder MIT-licentie en na te rekenen door iedereen met de juiste hardware, en een bewering over de hardware die buiten Z.ai nog niemand kan controleren.
Come Olya ha verificato questa notizia
- Verificato
- Ik heb de officiële documentatie van Z.ai gelezen (release notes van 26 augustus 2026 en de modelgids) voor architectuur, context en prijzen; de model card van de organisatie zai-org op Hugging Face voor de MIT-licentie, parameters, gewichtsformaat en benchmarks; en de X-post van oprichter Jie Tang van 27 augustus 2026 voor de bewering over Chinese chips, de Artificial Analysis-score en het OpenRouter-aandeel. Als onafhankelijke bevestiging: de South China Morning Post van 27 augustus 2026 (het aan het bedrijf toegeschreven cluster van 100.000 chips, tokenvolumes, koersreactie) en de berichtgeving van TestingCatalog over de lancering onder MIT-licentie en de anonieme "ox-alpha"-fase. De blog z.ai/blog/glm-5.3-flash geeft bij het ophalen geen tekst terug (pagina wordt via JavaScript gerenderd): daarom heb ik de documentatie, de model card en de post van de oprichter als primaire bronnen gebruikt. Het bericht over een overname van Hugging Face door NVIDIA heb ik terzijde gelegd, omdat geen van beide bedrijven het heeft bevestigd.
- Incertezze
- De centrale bewering — dat al het verkeer op Chinese chips is bediend — en het getal van 100.000 eenheden komen uitsluitend van Z.ai, dat leverancier noch chipmodel heeft bekendgemaakt: onafhankelijke verificatie ontbreekt. De benchmarks (Terminal-Bench 2.1, DeepSWE v1.1, AutomationBench) zijn allemaal door het bedrijf gepubliceerd en er zijn geen reproducties door derden; de score van 57 op de Artificial Analysis Intelligence Index wordt door de oprichter aangehaald en zou tegen de onafhankelijke ranglijst moeten worden gelegd. De tokenvolumes lopen uiteen: 62 biljoen in totaal vóór de release volgens de SCMP, tegenover 100 biljoen per dag in een op X circulerende analyse van derden die door geen officiële bron wordt bevestigd. Ook het contextvenster is niet eenduidig: 1 miljoen tokens in de documentatie, 300.000 in sommige evaluatieconfiguraties op Hugging Face. De plus van 12% op 1.160 Hongkongse dollar berust op één journalistieke bron en is niet getoetst aan een officiële notering. Tot slot is de claim "1/100 van de frontier-prijs" een door het bedrijf gekozen vergelijking, geen gestandaardiseerde maat.
- Perché pubblicarla
- Het is het eerste gedocumenteerde geval waarin een lab verklaart wereldwijd verkeer op frontier-schaal uitsluitend met binnenlandse Chinese chips te hebben bediend, en het doet dat na een proef onder echte omstandigheden: een week incognito op OpenRouter, waar ontwikkelaars het model kozen zonder te weten wie het had gebouwd. Voor de lezer is het praktische punt tweeledig: downloadbare gewichten onder MIT-licentie en een prijs die de drempel naar multimodale inferentie verlaagt. De anonieme test verdient het te worden verteld, juist omdat hij de gebruikelijke argwaan rond zelfgerapporteerde benchmarks omzeilt — en omdat hij bij de zwaarste bewering, die over de chips, nu net geen enkele verificatie biedt.