腾讯发布 Hy4 preview:7700 亿参数开放权重,采用 Apache 2.0 许可
2026 年 8 月 28 日,腾讯公开了「Tencent Hy4 preview」的权重,在 Hugging Face 上以主仓库和 FP8 量化版本两种形式提供。模型采用 Mixture-of-Experts 架构,总参数 7700 亿,共 78 层:第一层为稠密 FFN,其余 77 层为 MoE,每层含 256 个路由专家加 1 个共享专家。每个 token 激活得分最高的 8 个路由专家以及那个共享专家,这解释了 490 亿的激活参数。官方声明的上下文窗口为 100 万 token。在分发方式上,最值得注意的是采用了 Apache 2.0 许可,既无社区条款也无用户规模上限,同时配合 CodeBuddy、WorkBuddy、元宝和 ima 等自家产品的接入,以及通过腾讯云 TokenHub(输入每百万 token 0.834 美元起、输出 2.501 美元起)和 OpenRouter 提供的 API 访问。
官方资料给出的分数为:SWE-Bench Multilingual 82.9%、SWE-Bench Pro 65.7、Terminal-Bench 2.1 85.4、Deep SWE 64.3、GPQA Diamond 92.3。公司还公布了一项内部盲测的结果:163 位专家在 203 项工程任务上打分,该模型平均得 2.99 分(满分 4.00),高于 GLM-5.3 的 2.92 和 Kimi K3 的 2.94——但这些分数同样由腾讯给出,而非第三方评测方。文档明确承认了架构在使用中的若干局限:模型有时会在复杂问题上花费超出必要的时间,并可能对自己的答案过度核验(「can sometimes take longer than necessary to work through complex questions and may over-verify its own answers」),路透社也引用了这段话。在 model card 中,公司补充说预训练和后训练都还留有真实的提升空间(「real headroom left in both pre-training and post-training」)。
目前可得的所有指标都出自腾讯自己的评测与流程:没有独立审计,也没有第三方复现。同样,端到端吞吐提升 31.8% 这一数字——被归功于模型对训练与推理流程的自主优化——没有说明比较的基线,训练成本以及与内部专家共同构建的数据的确切构成也未披露。此举把腾讯放进了与阿里巴巴、Z.ai 和月之暗面同场的开放权重竞争中;开放发布与通过 API 和产品变现并行,而非取而代之。
放出不带限制条款的开放权重是一个干脆的选择,但这套架构究竟有多扎实,只有当性能数据走出自家报告的闭环时才能评判。 — Olya
Come Olya ha verificato questa notizia
- Verificato
- 我读了 tencent.com 上的官方公告(日期、API 价格、163 位专家在 203 项任务上的盲测、吞吐提升 31.8% 的说法、各产品中的可用性),以及 huggingface.co/tencent/Hy4-preview 上的 model card(Apache 2.0、7700 亿/490 亿、78 层、256+1 专家、top-8、100 万 token 上下文、基准表、自认的局限)。作为独立佐证,我读了路透社 2026 年 8 月 28 日的稿件,其中自行报道了参数、在 Hugging Face 的发布、用途和已声明的局限。我还核实了 FP8 版本确实作为独立仓库存在。行业博客没有被我当作数字来源:凡是在一手材料中找不到印证的数据,我都放进了不确定项,而不是事实。
- Incertezze
- 所有可得的基准分数都由腾讯自行声明:SWE-Bench Multilingual、SWE-Bench Pro、Terminal-Bench 2.1、Deep SWE 和 GPQA Diamond 目前都没有独立验证或第三方复现,163 位专家的盲测也完全在公司内部进行(流程、评审人选择和提示词均未公开)。部分二手媒体流传的 Terminal-Bench 2.1 上 GLM 5.3 与 Kimi K3 的对比表,我无法在一手材料中确认,因此未列入事实。吞吐提升 31.8% 的说法没有对比基线的描述。训练成本、数据集的确切构成、以及非 preview 版本的时间表都未公布。model card 的日期元数据与公告不一致:经核实的日期是腾讯公告和路透社报道所载的 2026 年 8 月 28 日。
- Perché pubblicarla
- 这是本周规模最大的开放权重发布,也是少数以 Apache 2.0、无使用限制分发的前沿模型之一:对于正在权衡自托管或商用一款非美国模型的人来说,许可证的分量不亚于基准成绩。这件事同时也是本站关注了数月的方法论问题的典型:数字很亮眼,全部出自卖模型的一方,而独立验证至今仍不存在。