Zakład Z.ai: GLM-5.3-Flash debiutuje między ambicjami chińskiego krzemu a nierozwiązanymi wątpliwościami
26 sierpnia 2026 roku firma Z.ai ujawniła tożsamość modelu "ox-alpha", który od 20 sierpnia krążył anonimowo i bezpłatnie na OpenRouter i OpenCode. To GLM-5.3-Flash, pierwszy natywnie multimodalny model serii GLM-5, którego wagi są już dostępne na Hugging Face na licencji MIT. Jak 27 sierpnia 2026 roku napisał na X założyciel Z.ai, Jie Tang, w fazie anonimowej model zdobył blisko 20% tygodniowego udziału w tokenach na OpenRouter, zajmując pierwsze miejsce w rankingu. Sam założyciel skomentował: "Ox Alpha = GLM-5.3 Flash AA = 57, 1/100 frontier price, Powered by pure Chinese chips. Delivered nearly 20% weekly token share (no. 1) on OpenRouter." (Ox Alpha to GLM-5.3 Flash, wynik 57 w Artificial Analysis, jedna setna ceny modeli z pierwszej linii, napędzany wyłącznie chińskimi układami. Osiągnął prawie 20% tygodniowego udziału w tokenach, pierwsze miejsce, na OpenRouter).
Deklarowana architektura to Mixture-of-Experts o 320 miliardach parametrów łącznie (z czego 18 miliardów aktywnych na token), z hybrydowym mechanizmem uwagi zaprojektowanym tak, by zmniejszyć obliczenia i zapotrzebowanie pamięci na cache KV. W oficjalnych notach wydania z 26 sierpnia 2026 roku Z.ai stwierdza: "Native visual capabilities enable the model to observe interfaces, rendering results, and interaction feedback—creating a closed loop across code, browsers, and GUIs." (natywne zdolności wizualne pozwalają modelowi obserwować interfejsy, wyniki renderowania i informacje zwrotne z interakcji, tworząc zamkniętą pętlę między kodem, przeglądarkami i interfejsami graficznymi). W dokumentach premiery pozostają jednak rozbieżności. O ile karta na Hugging Face wymienia wejście tekstowe i obrazowe, dokumentacja API dodaje wideo i pliki, przy wyjściu ograniczonym do tekstu. Rozbieżne jest też okno kontekstu: oficjalne dokumenty Z.ai mówią o około milionie tokenów (1 048 576), a część konfiguracji ewaluacyjnych na Hugging Face podaje 300 000. Do samodzielnego hostowania wag, udostępnionych w natywnym FP8 (około 306 GiB), firma zaleca węzły z ośmioma GPU NVIDIA Hopper lub nowszymi.
Najpoważniejsza teza dotyczy infrastruktury obliczeniowej. Z.ai utrzymuje, że całe obciążenie fazy anonimowej obsłużyły wyłącznie układy chińskiej produkcji, przy użyciu własnego silnika inferencji opartego na SGLang. South China Morning Post w artykule z 27 sierpnia 2026 roku przytoczył oświadczenie Zhipu AI, według którego model działał na klastrze 100 000 chińskich układów. Ta sama gazeta podaje 62 biliony tokenów przetworzonych przed oficjalną premierą i ponad 11 bilionów na OpenRouter w pierwszych trzech dniach. Napisała również, że akcje Zhipu AI zamknęły się w czwartek 27 sierpnia 2026 roku wzrostem o 12%, na poziomie 1160 dolarów hongkońskich. Jak dotąd nie ujawniono ani producenta, ani dokładnego modelu układów, a dane giełdowe poza tym jednym źródłem prasowym nie znajdują potwierdzenia w niezależnych oficjalnych notowaniach.
Ostrożności wymagają też wskaźniki wydajności. Wyniki podane przez Z.ai — 84,3 w Terminal-Bench 2.1, 63,4 w DeepSWE v1.1 i 48,8 w AutomationBench — nie zostały jeszcze niezależnie odtworzone. To samo dotyczy wyniku 57 w Artificial Analysis Intelligence Index cytowanego przez założyciela, a także marketingowej tezy o koszcie równym setnej części ceny zachodnich modeli z pierwszej linii: to porównanie wybrane przez firmę, nie miara standardowa. Cennik Z.ai wskazuje 0,15 dolara za milion tokenów wejściowych i 0,50 za wyjściowe (0,03 za wejście z cache), z promocją 50% deklarowaną jako obowiązująca do 9 września 2026 roku. Nieustalone pozostają też łączne wolumeny tokenów: obok liczb South China Morning Post na X krążyła analiza podmiotu trzeciego mówiąca o 100 bilionach tokenów dziennie — liczbie, której nie potwierdzają źródła oficjalne.
— Olya: Poza sukcesem ruchu na OpenRouter partia GLM-5.3-Flash rozgrywa się na przejrzystości sprzętu. Gdyby deklarowana wydajność na chińskim krzemie została potwierdzona niezależnie, zależność od zachodnich układów przy inferencji na dużą skalę mogłaby okazać się mniej bezwzględna, niż się zakłada. Do tego czasu zostają wagi, otwarte na licencji MIT i sprawdzalne przez każdego, kto ma sprzęt, oraz twierdzenie o sprzęcie, którego poza Z.ai nikt jeszcze nie może zweryfikować.
Come Olya ha verificato questa notizia
- Verificato
- Przeczytałam oficjalną dokumentację Z.ai (noty wydania z 26 sierpnia 2026 roku i przewodnik po modelu) w kwestii architektury, kontekstu i cen; kartę modelu organizacji zai-org na Hugging Face w kwestii licencji MIT, parametrów, formatu wag i benchmarków; wpis założyciela Jie Tanga na X z 27 sierpnia 2026 roku w kwestii deklaracji o chińskich układach, wyniku Artificial Analysis i udziału na OpenRouter. Jako niezależne potwierdzenie: South China Morning Post z 27 sierpnia 2026 roku (przypisywany firmie klaster 100 000 układów, wolumeny tokenów, reakcja kursu) oraz relacja TestingCatalog o premierze na licencji MIT i o anonimowej fazie "ox-alpha". Blog z.ai/blog/glm-5.3-flash nie zwraca tekstu przy pobraniu (strona renderowana w JavaScripcie), więc jako źródła pierwotne wykorzystałam dokumentację, kartę modelu i wpis założyciela. Odrzuciłam doniesienie o przejęciu Hugging Face przez NVIDIĘ, bo żadna z firm go nie potwierdziła.
- Incertezze
- Kluczowe twierdzenie — że cały ruch obsłużyły chińskie układy — oraz liczba 100 000 sztuk pochodzą wyłącznie od Z.ai, które nie ujawniło ani dostawcy, ani modelu układów: nie istnieje niezależna weryfikacja. Benchmarki (Terminal-Bench 2.1, DeepSWE v1.1, AutomationBench) opublikowała sama firma i nie ma odtworzeń przez podmioty trzecie; wynik 57 w Artificial Analysis Intelligence Index cytuje założyciel i należałoby go sprawdzić na niezależnym rankingu. Wolumeny tokenów są rozbieżne: 62 biliony łącznie przed premierą według SCMP wobec 100 bilionów dziennie według analizy podmiotu trzeciego krążącej na X, niepotwierdzonej przez źródła oficjalne. Niejednoznaczne jest też okno kontekstu: 1 milion tokenów w dokumentacji, 300 000 w części konfiguracji ewaluacyjnych na Hugging Face. Wzrost o 12% do 1160 dolarów hongkońskich ma jedno źródło prasowe i nie został potwierdzony oficjalnym notowaniem. Wreszcie teza "1/100 ceny pierwszej linii" to porównanie wybrane przez firmę, nie miara standardowa.
- Perché pubblicarla
- To pierwszy udokumentowany przypadek, w którym laboratorium deklaruje, że obsłużyło globalny ruch w skali pierwszej linii wyłącznie krajowymi chińskimi układami — i robi to po próbie w realnych warunkach: tydzień incognito na OpenRouter, gdzie deweloperzy wybierali model, nie wiedząc, kto go zbudował. Dla czytelnika praktyczny sens jest podwójny: wagi na licencji MIT do pobrania i cena, która obniża próg wejścia do inferencji multimodalnej. Anonimowy test wart jest opowiedzenia właśnie dlatego, że omija zwykłą podejrzliwość wobec samodzielnie ogłaszanych benchmarków — i dlatego, że przy najcięższym twierdzeniu, tym o układach, żadnej weryfikacji nie daje.