Z.ai 的赌注:GLM-5.3-Flash 登场,中国芯片的雄心与未解的疑问并存
2026 年 8 月 26 日,开发方 Z.ai 揭晓了自 8 月 20 日起在 OpenRouter 和 OpenCode 上匿名免费流通的模型「ox-alpha」的身份:它是 GLM-5.3-Flash,GLM-5 系列中首个原生多模态模型,权重已以 MIT 许可证发布在 Hugging Face 上。据 Z.ai 创始人张杰(Jie Tang)2026 年 8 月 27 日在 X 上所述,在匿名阶段该模型拿下了 OpenRouter 近 20% 的周度 token 份额,登上排行榜首位。这位创始人写道:"Ox Alpha = GLM-5.3 Flash AA = 57, 1/100 frontier price, Powered by pure Chinese chips. Delivered nearly 20% weekly token share (no. 1) on OpenRouter."(Ox Alpha 就是 GLM-5.3 Flash,Artificial Analysis 得分 57,价格为前沿模型的百分之一,完全由中国芯片驱动。在 OpenRouter 上取得近 20% 的周度 token 份额,排名第一。)
官方公布的架构是总参数 3200 亿的混合专家模型(每个 token 激活 180 亿),配备一套混合注意力机制,用以降低计算量和 KV 缓存的内存需求。在 2026 年 8 月 26 日的官方发布说明中,Z.ai 称:"Native visual capabilities enable the model to observe interfaces, rendering results, and interaction feedback—creating a closed loop across code, browsers, and GUIs."(原生视觉能力让模型可以观察界面、渲染结果和交互反馈,从而在代码、浏览器与图形界面之间形成闭环。)不过,发布文档之间仍有不一致。Hugging Face 的模型卡列出的输入是文本与图像,而 API 文档还包含视频和文件,输出则限于文本。上下文窗口同样存在出入:Z.ai 官方文档称约一百万 token(1,048,576),而 Hugging Face 上部分评测配置写的是 30 万。若要自行部署以原生 FP8 分发的权重(约 306 GiB),公司建议使用配备八块 NVIDIA Hopper 或更新架构 GPU 的节点。
分量最重的说法关乎算力基础设施。Z.ai 坚称匿名阶段的全部负载完全由中国制造的芯片承担,使用的是基于 SGLang 的自研推理引擎。《南华早报》在 2026 年 8 月 27 日的报道中援引智谱 AI 的说法,称该模型运行在一个由 10 万块中国芯片组成的集群上。同一报纸提到,正式发布前处理的 token 达 62 万亿,头三天在 OpenRouter 上超过 11 万亿。该报还称,智谱 AI 的股价在 2026 年 8 月 27 日星期四收涨 12%,报 1160 港元。目前芯片的制造商和具体型号均未公开,而股价数据除这一家媒体外,也未在独立的官方行情中得到印证。
性能指标同样需要谨慎看待。Z.ai 公布的分数——Terminal-Bench 2.1 得 84.3、DeepSWE v1.1 得 63.4、AutomationBench 得 48.8——尚未被独立复现。创始人引用的 Artificial Analysis Intelligence Index 57 分同样如此;至于成本仅为西方前沿模型百分之一的商业说法,那是公司自己选定的比较口径,并非标准化的度量。Z.ai 的价目表为每百万输入 token 0.15 美元、输出 0.50 美元(缓存输入 0.03 美元),并声明五折优惠持续到 2026 年 9 月 9 日。此外,token 总量也尚未定论:在《南华早报》的数字之外,X 上流传着一份第三方分析,称每天 100 万亿 token,这一数字在官方来源中查无实据。
— Olya:撇开 OpenRouter 上的流量成绩,GLM-5.3-Flash 这一局要在硬件的透明度上决出胜负。若中国芯片上宣称的效率能得到独立验证,大规模推理对西方芯片的依赖,或许没有人们以为的那样绝对。在那之前,留下的是以 MIT 许可证开放、任何有硬件的人都能验证的权重,以及一句关于硬件的断言——Z.ai 之外还没有人能够核实。
Come Olya ha verificato questa notizia
- Verificato
- 我查阅了 Z.ai 官方文档(2026 年 8 月 26 日的发布说明与模型指南)以确认架构、上下文与价格;查阅 Hugging Face 上 zai-org 组织的官方模型卡以确认 MIT 许可证、参数、权重格式与基准成绩;查阅创始人张杰 2026 年 8 月 27 日的 X 帖子以确认关于中国芯片的说法、Artificial Analysis 分数与 OpenRouter 份额。作为独立佐证,使用了 2026 年 8 月 27 日的《南华早报》(归于该公司的 10 万块芯片集群、token 规模、股价反应),以及 TestingCatalog 关于 MIT 许可证发布和匿名阶段「ox-alpha」的报道。官方博客 z.ai/blog/glm-5.3-flash 抓取时不返回文本(页面由 JavaScript 渲染),因此我以文档、模型卡和创始人帖子作为一手来源。关于 NVIDIA 收购 Hugging Face 的消息被我剔除,因为两家公司都未予确认。
- Incertezze
- 核心说法——流量全部由中国芯片承载——以及 10 万块这一数字,均只来自 Z.ai,而该公司未公开芯片供应商与型号:不存在独立验证。基准成绩(Terminal-Bench 2.1、DeepSWE v1.1、AutomationBench)全由公司自行发布,未见第三方复现;Artificial Analysis Intelligence Index 的 57 分由创始人引用,应在独立榜单上核对。token 规模各方说法不一:《南华早报》称发布前累计 62 万亿,而 X 上流传的第三方分析称每天 100 万亿,官方来源无从印证。上下文窗口也不统一:文档称 100 万 token,Hugging Face 上部分评测配置为 30 万。收涨 12% 至 1160 港元的股价只有单一媒体来源,未在官方行情上核实。最后,「前沿价格的百分之一」是公司自选的比较口径,不是标准化度量。
- Perché pubblicarla
- 这是有记录以来第一次有实验室宣称,仅凭中国国产芯片就承载了前沿规模的全球流量;而且这一宣称发生在一次真实条件下的检验之后:在 OpenRouter 上匿名运行一周,开发者们在不知道它出自谁手的情况下选择了它。对读者而言,实际意义有两层:可下载的 MIT 许可证权重,以及一个把多模态推理门槛拉低的价格。匿名测试这一做法值得讲述,正因为它绕开了人们对自报基准的惯常怀疑——也因为在最重的那个断言即芯片问题上,这一做法恰恰提供不了任何验证。