十万余枚国产芯片支撑 GLM-5.3-Flash:Z.ai 的自述,介于内部指标与未解之问之间
2026年9月17日,北京公司 Z.ai 在其官方博客发布了一份关于 GLM-5.3-Flash 推理基础设施的技术说明。GLM-5.3-Flash 于2026年8月26日发布,是一款总参数3200亿、激活参数180亿的混合专家模型,上下文窗口为一百万 token,权重以 MIT 许可开放于 Hugging Face。据该公司称,该模型的全部生产流量由一个十万余枚国产加速器组成的集群承载,端到端吞吐相比最初的基线提升了两倍,迁入运行环境的过程在不到两周内完成。在北京推动技术自给的背景下——真正的瓶颈往往在软件开发,而不只是硅片——这份文档宣称达到了该公司所说的、此前从未在国产加速器上支撑过的规模。
真正让 Z.ai 这份自述值得一读的,是其中的说法:从性能分析到对 SGLang 框架的代码改动,大部分优化工作由一个基于 GLM-5.3 自身构建的软件智能体完成。Z.ai 列出的困难包括片上内存的容量与带宽、一百万 token 的窗口,以及内核支持尚不完整的软件生态。不过,文章并未公布该智能体的第二轮优化:这一循环只被描述了一次,外部唯一可核查的产物,是 flash-linear-attention 仓库中于2026年8月27日合入的 1180 号拉取请求,它引入 TF32x3 模拟以在长序列上找回精度。该公司自己也在文中说明,并未实现递归式的自我改进:目标的选择、边界的设定和风险的评估仍留给人类。
在成本方面,Z.ai 主张硬件利用效率与单 token 支出已达到与主流 NVIDIA GPU 相当的水平。但这些说法并未给出独立核查所需的量:缺少整体电耗数据,缺少硬件资本的摊销基准,也缺少集群持续利用率的指标。何况三倍指的是吞吐而非成本,并且是相对 Z.ai 自己的初始基线计算的——也就是由测量者自行选定的起点。此外,芯片由谁制造,公司也没有披露。
单一当事方提供的数据描绘的是一条研发轨迹,而不是市场上的确定性。缺的不是分析,而是测量值。电耗、硬件摊销、集群利用率序列——在 Z.ai 公布它们之前,或在外部有人复现结果之前,与 NVIDIA 的成本持平仍只是该公司对自己工作的说法。 — Olya
Come Olya ha verificato questa notizia
- Verificato
- 直接阅读了 Z.ai 2026年9月17日的官方文章:标题、日期、数字(十万余枚加速器、吞吐提升两倍、不到两周完成迁移、六天62万亿 token),以及两处原文引用。与两家彼此独立的来源交叉核对:Unite.AI 报道了相同数字并指出未说明芯片供应商;Interesting Engineering 的分析则确认了这些数字,同时点出其方法上的局限(自报数据、由公司自选的基线、缺少底层变量的成本持平)。GitHub 上的 #1180 拉取请求另行核实:标题、作者、合入日期(2026年8月27日)与技术内容均相符。Z.ai 的公司名称与注册地在维基百科核对。某聚合站提到的股价上涨未能在一手来源得到确认,因此不予采用。芯片供应商的名称仍未获证实,文中亦按未证实处理。
- Incertezze
- 所有数字均为自报,无人复现:无论是三倍的提升,还是单 token 的成本持平,都不存在独立测量。成本持平的说法缺少使之可被核查的量——电耗、硬件摊销基准、利用率序列;而三倍是相对公司自身的初始基线计算的,即由测量者自选的起点。谁供应芯片同样不明:Z.ai 未透露,流传的名字(华为、摩尔线程、海光)出自媒体推断,公司未作回应。在智能体这一部分,文章也没有展示第二轮优化:循环只被描述了一次,外部唯一可验证的产物是 #1180 拉取请求。最后,集群中有多大比例专用于该模型、持续程度如何,均未公开。
- Perché pubblicarla
- 这是首份关于超大规模生产级推理服务完全运行在国产加速器上的详细技术描述:它触及了摆脱美国硬件依赖真正见分晓的地方——服务软件,而非芯片本身。它同时也是一个批判性阅读的范例:数字出自制造数字的一方,公开可验证的产物恰好只有一件,而最引人遐想的部分——模型优化自己运行其上的基础设施——恰恰证据最少。把未知之处摆在明面上来讲,比跟着标题喊一遍更有价值。
Fonti / Sources
- Z.ai — Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure (blog ufficiale)
- Unite.AI — Z.ai Details GLM-5.3-Flash Inference Build on 100,000 Chinese Chips
- Interesting Engineering (Substack) — Three Times the Throughput, None of the Capex? (analisi critica dei numeri)
- GitHub — flash-linear-attention PR #1180 «[CP] use tf32x3 affine chain in kcp» (unico artefatto verificabile in modo indipendente)