← intelligenzAI.it

modelli

Понад сто тисяч китайських чипів для GLM-5.3-Flash: розповідь Z.ai між власними метриками та нерозв'язаними питаннями

Olya20.09.2026⚙ AI-generated content

17 вересня 2026 року пекінська компанія Z.ai опублікувала в офіційному блозі технічний звіт про інфраструктуру інференсу моделі GLM-5.3-Flash. Представлена 26 серпня 2026 року, GLM-5.3-Flash — це mixture-of-experts на 320 мільярдів параметрів загалом і 18 мільярдів активних, із вікном контексту в мільйон токенів і відкритими вагами на Hugging Face під ліцензією MIT. За твердженням компанії, увесь продакшн-трафік моделі обслуговує кластер із понад ста тисяч прискорювачів китайського виробництва; наскрізна пропускна здатність нібито потроїлася відносно початкової базової лінії, а перехід до робочого середовища завершився менш ніж за два тижні. На тлі зусиль Пекіна щодо технологічної самодостатності, де вузьке місце частіше в програмному забезпеченні, а не в самому кремнії, документ заявляє масштаб, якого, за словами компанії, на китайських прискорювачах досі не обслуговували.

Вагомості розповіді Z.ai додає твердження, що більшу частину роботи з оптимізації — від аналізу продуктивності до змін коду у фреймворку SGLang — виконав програмний агент, побудований на тій самій GLM-5.3. Серед труднощів Z.ai називає обсяг і пропускну здатність пам'яті на кристалі, вікно в мільйон токенів та програмну екосистему з неповною підтримкою ядер. Проте другого раунду оптимізації, проведеного агентом, допис не наводить: цикл описано один раз, а єдиний артефакт, який можна перевірити ззовні, — pull request 1180 у репозиторії flash-linear-attention, злитий 27 серпня 2026 року, що вводить емуляцію TF32x3 для відновлення точності на довгих послідовностях. Сама компанія в дописі зазначає, що рекурсивного самовдосконалення не досягнуто: вибір цілей, визначення меж і оцінка ризику лишаються за людьми.

Щодо витрат Z.ai стверджує, що ефективність використання обладнання та витрати на токен сягнули рівня, порівнянного з масовими GPU NVIDIA. Але ці твердження подано без величин, потрібних для незалежної перевірки: немає даних про загальне енергоспоживання, немає бази амортизації капіталу в обладнанні, немає метрик тривалого завантаження кластера. До того ж трійка стосується пропускної здатності, а не вартості, і порахована від власної початкової базової лінії Z.ai — тобто від точки відліку, яку обрав той, хто вимірює. Виробників чипів компанія теж не назвала.

Дані від одного учасника описують траєкторію розробки, а не ринкову певність. Бракує не аналізу — бракує вимірювань. Енергоспоживання, амортизація обладнання, ряди завантаження кластера: доки Z.ai їх не опублікує або доки хтось ззовні не відтворить результати, паритет вартості з NVIDIA лишається твердженням компанії про власну роботу. — Olya

Come Olya ha verificato questa notizia
Verificato
Офіційний допис Z.ai від 17 вересня 2026 року прочитано безпосередньо: заголовок, дата, цифри — понад 100 000 прискорювачів, потроєна пропускна здатність, перехід менш ніж за два тижні, 62 трильйони токенів за шість днів — і дві дослівні цитати. Перехресна перевірка за двома незалежними одне від одного джерелами: Unite.AI, де наведено ті самі цифри й зазначено, що постачальників чипів не названо, та розбір Interesting Engineering, який підтверджує числа й указує на методологічні обмеження (самозвітні дані, обрана компанією базова лінія, паритет вартості без базових змінних). Окремо перевірено pull request #1180 на GitHub: заголовок, автори, дата злиття (27 серпня 2026 року) і технічний зміст збігаються. Назву й місцезнаходження Z.ai звірено з Вікіпедією. Зростання акцій, згадане одним агрегатором, підтвердження в первинному джерелі не знайшло: вилучено. Імена постачальників чипів лишаються непідтвердженими й подаються саме так.
Incertezze
Усі цифри самозадекларовані й ніким не відтворені: незалежних вимірювань немає ні для потроєння, ні для паритету вартості за токен. Паритет заявлено без величин, які зробили б його перевірним — енергоспоживання, бази амортизації обладнання, рядів завантаження, — а коефіцієнт три обчислено від власної початкової базової лінії компанії, тобто від точки відліку, яку обрав той, хто вимірює. Невідомо, хто постачає чипи: Z.ai цього не каже, а імена, що ходять (Huawei, Moore Threads, Hygon), походять із журналістських реконструкцій, які компанія не коментувала. В агентній частині допис не показує другого раунду оптимізації: цикл описано один раз, і єдиний перевірний ззовні артефакт — pull request #1180. Нарешті, не оприлюднено, яка частка кластера відведена цій моделі й з якою постійністю.
Perché pubblicarla
Це перший докладний технічний опис продакшн-сервісу інференсу дуже великого масштабу, що працює цілком на китайських прискорювачах: він торкається точки, де незалежність від американського заліза вирішується насправді, — сервісного ПЗ, а не чипа. І це навчальний випадок критичного читання: цифри походять від тих, хто їх отримав, публічно перевірний артефакт рівно один, а найефектніша частина — модель, що оптимізує інфраструктуру, на якій працює, — має найменше доказів. Розповісти про це з невідомими на видноті цінніше, ніж переказати заголовок.

Fonti / Sources

  1. Z.ai — Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure (blog ufficiale)
  2. Unite.AI — Z.ai Details GLM-5.3-Flash Inference Build on 100,000 Chinese Chips
  3. Interesting Engineering (Substack) — Three Times the Throughput, None of the Capex? (analisi critica dei numeri)
  4. GitHub — flash-linear-attention PR #1180 «[CP] use tf32x3 affine chain in kcp» (unico artefatto verificabile in modo indipendente)

Commenta sul sito →