公告与仓库之间:K2 Horizon 面临的开源检验
2026年9月3日,Institute of Foundation Models(IFM)宣布发布 K2 Horizon 家族。该机构由穆罕默德·本·扎耶德人工智能大学于2025年5月创立,业务分布在阿布扎比、硅谷和巴黎。此次发布的是六款采用 Apache 2.0 许可的模型,规模分别为9亿、37亿、70亿、320亿,以及激活参数40亿的360亿(MoVA 变体),还有每 token 激活230亿的3750亿。官方技术规格给出3750亿模型的原生上下文窗口为 512K token(524,288);而一家行业媒体对同一模型报出的是 131,072。这一出入没有得到澄清。在独立性能评测方面,Artificial Analysis 在自家的 Intelligence Index 上给3750亿模型打了38分,而同等规模开放权重模型的中位数为22分。
不过真正悬而未决的,是这次发布是否完整。在通过 PR Newswire 发出的声明中,该机构称交付内容涵盖六个变体的权重、源代码、训练数据和方法论。IFM 创始人、MBZUAI 校长 Eric Xing 强调了这一取向:「开源远不止于开放权重。当其他人能够看到数据、遵循方法、复现结果并加以改进时,科学才真正运转。」尽管如此,查看该组织在 Hugging Face 上的仓库可以看到模型权重,数据集却只有一个,是收录评测来源的「eval-360-sources」。3750亿模型的 model card 本身也承认了时间上的先后,写明:「我们已发布最终检查点;中间检查点连同数据和训练代码将会发布。」训练数据集与训练代码目前并未公开,这使得发布时宣称的完全可复现承诺无法核实。IFM 未就这一出入公开回应,训练数据的公开时间表也不得而知。
这些模型可与 vLLM 和 SGLang 集成,并可通过 Compass、Cerebras、AWS、Nebius 等推理合作伙伴使用,其中也有值得注意的技术方案。据声明,360亿的 MoVA 变体采用 Mixture of Value Attention 架构和扩散蒸馏技术,宣称提速三倍——这些数据未经独立验证。训练所用的 token 总量和投入的算力规模仍未披露。官方网站 ifm.ai 拒绝自动化请求(HTTP 403):该机构博客的正文未能直接读取,本文引述的其表态来自 PR Newswire 上的声明和 model card。
宣称已经超越「只开放权重」的做法,是一个有野心的动作。但只要训练数据和原始配方仍停留在未来时态的承诺里,公告与科学证明之间的距离就依然需要从头补上。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 我读了该机构在 PR Newswire 上的官方声明(日期、模型规模、许可、合作伙伴、Eric Xing 的表述),以及 Hugging Face 上旗舰模型的官方 model card——后者才是真正发布出来的产物:参数、上下文窗口、基准测试表格,以及关于数据和代码那句未来时的话,都出自其中。随后我核对了 IFM 组织在 Hugging Face 上的仓库列表:唯一存在的数据集是「eval-360-sources」,而非训练数据。作为独立佐证,我使用了 Artificial Analysis(Intelligence Index 38,上下文 524,000,2026年9月3日),以及报道同一次发布、创始人引语和合作伙伴的两家媒体 Middle East AI News 和 TBreak。ifm.ai/k2/ 与 ifm.ai/blog/k2/ 页面,以及 AIwire/HPCwire 的报道均返回 HTTP 403,未直接查阅。
- Incertezze
- 主要的未决之处,是声明与官方 model card 之间的落差:前者把训练数据和代码说成已是本次发布的一部分,后者则把它们放到将来。核验时 Hugging Face 上没有任何训练数据集,只有一个评测来源仓库。IFM 未就此公开回应,也没有已知的时间表。ifm.ai 拒绝自动化请求(HTTP 403),因此官方博客正文未能直接阅读:本文引述的该机构表态来自其 PR Newswire 声明和 model card。上下文长度存在互相冲突的数据:model card 写的是 512K token,一家媒体对同一模型给出的是 131,072。除 Intelligence Index 外,所有基准分数均为自行公布,尚无独立复现。训练 token 数量、成本与算力投入均未公开。
- Perché pubblicarla
- 这不是又一次权重发布:公开宣称的承诺(「开源远不止于开放权重」)与实际发布的内容之间存在可查证的分歧,而且正是一手材料 model card 本身推翻了新闻稿的措辞。公告与产物之间的这种落差,在照搬新闻稿的报道里看不到,而任何人在 Hugging Face 上点两下就能核实。此外,这是迄今宣称完全可复现的最大开放模型,又出自一个非西方的国家级主体:对必须在《人工智能法案》下挑选可审计模型的欧洲读者来说,这两点都很重要。