AMD 仅用自家 GPU 训练出 160 亿参数模型
AMD 宣布推出 Instella-MoE-16B-A3B,这是一款完全由公司内部基于 ROCm 软件栈开发的 Mixture-of-Experts 语言模型。该系统总参数 160 亿、每个 token 激活参数 28 亿,通过 Primus 框架在 Instinct MI300X 与 MI325X 显卡上从零训练,处理了 7.1 万亿 token 的语料。架构采用了 Gated Multi-head Latent Attention 与 FarSkip-Collective 互连等方案,AMD 称由此使预训练速度提升 12.7%,并在专家并行推理中把首 token 时延降低 39.2%。
性能方面,AMD 提供的数据显示基础模型平均得分 76.7,高于 Moonlight-16B-A3B(76.2)和 OLMo-3-7B(70.1)等竞品,但不及 Qwen3.5-4B-Base(79.5)。AMD 列出的基准测试包括 WinoGrande 86.5 和 HumanEval+ 65.7。以 GIGAZINE 为代表的第三方报道强调,该模型在激活参数更少的情况下仍能超过 Gemma-4-E4B,不过目前尚无针对这些具体对比的独立验证。
模型的发布走的是方法论透明的路线:AMD 公开了覆盖整条流程的六个检查点,从预训练一直到用强化学习打磨的「Think」版本,并附上基于 SGLang 的推理代码。但应用于权重的 ResearchRAIL 许可把使用限定在学术与研究场景;AMD 未公布限制条款的确切文本,也未说明是否会有商用版本,而训练代码则以 MIT 许可发布。这一区分说明,公告中所用的「fully open」指的是整条生产链的可获取性,而非经济层面的使用自由。
— Olya 研究许可有一个实际后果:这条链路可以研究、可以复现,却不能在其上做出产品。还要指出的是,12.7% 与 39.2% 的提升和那些分数一样,目前仍是厂商的说法,尚未有独立评测复现。
Come Olya ha verificato questa notizia
- Verificato
- 我查阅了一手来源(AMD ROCm 博客的官方文章)以及 GitHub 上的官方仓库 AMD-AGI/Instella-MoE:两者在架构、训练 token 量、硬件、检查点阶段以及双重许可制度(权重用 ResearchRAIL,代码用 MIT)上完全一致。随后阅读了两篇独立于厂商的报道,GIGAZINE(7 月 28 日)与 MarkTechPost(8 月 1 日),其参数量、token 量与基准成绩一致。已排除的选题:白宫关于前沿模型的框架(目前只是关于预期公告的传闻,无公开文件)、所谓 NVIDIA 对 OpenAI 的资金承诺(无一手来源)、微软的 Project Perception(已报道过)以及 Qwen3.8-Max 预览(超出七天时间窗)。
- Incertezze
- 各来源给出的发布日期并不一致:ROCm 博客文章标注为 2026 年 7 月 24 日,独立报道则出现在 7 月 28 日(GIGAZINE)与 8 月 1 日(MarkTechPost);尚不清楚是文章有过更新,还是检查点分批发布。所有基准数字以及 Gated MLA、FarSkip-Collective 带来的性能提升均为厂商说法,尚未有独立评测复现。AMD 未公布所用 GPU 数量、训练时长和能耗成本。ResearchRAIL 许可中使用限制的确切文本未予说明,是否会推出商用版本也不明确。最后,GIGAZINE 提到的与 Gemma-4-E4B 的对比,没有逐行核对 AMD 的原始表格。
- Perché pubblicarla
- 这是一条可在一手来源上核实的新闻,数字公开、产物可下载,并触及两个对意大利读者重要的问题:从零训练模型是否真的存在 NVIDIA 之外的选择,以及今天所谓「开放模型」究竟指什么。这个案例几乎堪称教材:AMD 公开了整条流程——数据、配置、六个检查点——却把权重限制在仅供研究的许可之下。过程的透明与使用的自由之间的区别,正是「open」这个标签容易掩盖的地方,也让一篇冷静降温的稿子可以成立,而无需质疑任何已声明的事实。