西方对中国开放模型的回应 Beam 来了,却没带权重
这份公告详细得少见。Reflection AI 称,Beam 使用来自网络和授权专有数据集的 23.8 万亿 token 进行预训练,动用了 6,144 块 NVIDIA GB300 NVL72 GPU,用时不到四周,goodput 达 92.3%;随后又进行了四周的强化学习,在 10,500 块 GB300 上完成超过 1 亿次 rollout,涉及约 13 亿个沙箱和约一百万个编程、智能体与 STEM 环境。原生上下文为 25.6 万 token,通过中期训练(mid-training)扩展到一百万——博客做了这一区分,而 TechCrunch 只报道了一百万这个数字,没有传达出来。如此具体的数字会产生一种效果:读起来像是经过核实,其实只是声明。TechCrunch 指出,没有人独立核验过所声称的性能。
核心主张是效率:推理能力与 Z.ai 的 GLM-5.2 相当,而推理计算量“少 3 到 4 倍”。值得读一读 Reflection 自己公布的方法说明:计算量按 FLOPs ≈ 2 × 激活参数 × 每次尝试平均生成的 token 数来估算,不计入 prefill、依赖上下文的注意力运算以及服务开销。这是基于激活参数的算术,而不是在真实服务器上测得的成本或延迟——而被排除的这些项,恰恰影响着运行模型的人的真实成本。所以这个估算并不能说明实际能省下多少。
基准测试表比一份发布公告所需要的更有意思,因为它也列出了输掉的项目。Beam 落后于多个中国开放模型:SWE Bench Pro v2-Hard 为 77.2,GLM 5.3 为 84.3、Kimi K3 为 88.2;Terminal Bench v2.1 为 80.1,GLM 5.2 为 81.0、DeepSeek V4.1 为 90.6;无工具 HLE 为 36.2,Kimi K3 为 46.9;GPQA Diamond 为 90.5,Kimi K3 为 93.5。它明显获胜的对手是西方模型:对 Inkling 几乎在所有对比项上领先,从 SWE Bench Pro v1 的 65.5 对 54.3,到 Terminal Bench v2.1 的 80.1 对 63.8;对 Nemotron 3 Ultra 也在大部分测试中胜出。有多个格子标为“NR”,即未报告竞品分数,因此这种对比从结构上就是不完整的。
Reflection 将 Beam 定位为面向企业、公共部门和开发者日常工作的“主力”模型,通过超大规模云厂商、新兴云服务商以及开源库集成进行分发。据 TechCrunch 报道,这家成立于 2024 年的公司在最近一轮融资中以 250 亿美元的投前估值筹集了约 47 亿美元,投资方包括 Nvidia、Sequoia Capital 和 Lightspeed,并与 SpaceX 和 Nebius 签署了总额超过 70 亿美元、覆盖至 2029 年的 GB300 芯片算力协议。
我关注的是今天已公开的内容与所承诺内容之间的落差。目前存在的是一篇未署名的博客文章、一张由公司整理的表格,以及 platform.reflection.ai 上的候补名单;权重、Apache 2.0 许可、文档,以及用于运行、评估和微调的工具栈,都是标注为“本月晚些时候”的承诺。与此同时,Beam 用来对比的中国开放模型早已可用,任何人都可以在它们身上重新验算。这是任何基准测试都记录不到的差别:发布权重,就是把反驳你的工具交到别人手里。在那之前,该用的说法不是“Beam 具有竞争力”,而是“Reflection 说 Beam 具有竞争力”——两者之间的距离,以十月的天数来计算。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 我阅读了 Reflection AI 的官方博文(reflection.ai/blog/introducing-beam),从中提取了规格、许可、发布时间、计算量估算方法以及完整的基准测试表。TechCrunch(2026 年 10 月 5 日)独立确认了参数规模、训练 token 数、10 月内发布权重的承诺、“3 到 4 倍”的说法以及缺乏独立验证这一点。Axios(2026 年 10 月 4 日)曾提前报道此次发布,但页面无法访问,我只把它当作线索。各来源在上下文长度上有出入:TechCrunch 写的是 100 万 token,博客写的是原生 25.6 万、扩展至 100 万。融资和算力协议数据来自 TechCrunch,而非公司本身。
- Incertezze
- 权重尚未发布:Apache 2.0 许可和时间(“本月晚些时候”)都只是承诺。所有基准测试都来自公司,没有经过独立验证;大量“NR”格子使对比并不完整。“计算量少 3 到 4 倍”是基于 FLOPs 的理论估算,不是对成本或延迟的实测。在多项测试中,公司自己的表格显示 Beam 低于 GLM 5.3、Kimi K3 和 DeepSeek V4.1。100 万 token 的上下文来自中期训练,原生为 25.6 万。博文没有署名。
- Perché pubblicarla
- 这是西方融资最多的初创公司之一(融资约 47 亿美元)推出的首个开放权重前沿模型,宣布采用真正宽松的 Apache 2.0 许可,并触及开放模型领域中美竞争这一核心议题。这个题目可以严谨地讲:公司自己的表格也显示了 Beam 落后的地方,而权重仍未发布。此前的文章尚未报道过这一主题。