IBM Granite 4.2 的原生推理:稠密架构与自报数字之间
2026年8月25日,IBM Research 发布了新的 Granite 4.2 模型系列,权重以 Apache 2.0 许可提供,Hugging Face 上的文档写明「fully open for commercial and research use」。在整体倒向大规模 Mixture-of-Experts 系统的行业环境中,这个项目选择了稠密结构,分为 30 亿、80 亿和 300 亿参数三档。在 30B 版本中,decoder-only 架构采用 Grouped Query Attention(32 个注意力头、8 个 KV 头)、RoPE 位置编码和 SwiGLU 激活,原生支持 128K token 的上下文;技术博客称,凭借第五个预训练阶段,这一窗口可扩展到 512K。据 IBM 称,从零开始的训练分五个阶段,用了约 15 万亿 token。
最主要的变化在于模型能在给出答案之前生成推理链,并配有 thinking / non-thinking 开关,以及一个介于两者之间的「low-effort」模式,对简单问题分配较少的推理预算。后训练结合了 Group Relative Policy Optimization(GRPO)算法与 RLHF 对齐,而针对智能体式流程的强化学习阶段——聚焦软件工程和终端使用——只用在 8B 和 30B 两档上。同时发布的还有 4.7 亿参数的语音模型 Granite Speech 5.0 Turbo CTC,IBM 声称其 RTFx 约为 12,600,而 Open ASR Leaderboard 此前的领先者约为 6,000。据 IBM 称,训练跑在 CoreWeave 提供的 NVIDIA GB200 NVL72 集群上。
IBM 公布的性能给 30B 模型的分数是:SWE-Bench Verified 57.00,AIME25 与 HMMT Feb25 均为 89.17,GPQA 66.41。这些都是发表在公司文档中的内部测量,目前缺少审计与独立验证,因此无法由第三方确认这些分数确实可以复现。官方文档还显示 AIME25 与 HMMT Feb25 的结果完全一致却未加说明,而与竞品模型的对比则交给了一张没有对应数字的图表,无法在一手来源上核验。
在整个行业追逐 Mixture-of-Experts 规模的时候发布带宽松许可的稠密模型,意味着有意去接住那些必须面对真实硬件限制的人。纸面上宣称的效率与企业环境中的实际表现之间的差距,要靠最初的落地集成来衡量。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 我用 WebFetch 打开了 IBM Research 2026年8月25日的官方公告:其中确认了三种规模、Apache 2.0 许可、稠密架构、多阶段 RL 流程以及语音模型。又与 Hugging Face 上的官方模型卡 granite-4.2-30b(架构、上下文、语言、基准表)和 IBM 技术博客(三档规模的数字、15 万亿 token、thinking 与 low-effort 模式)相互印证。MarkTechPost 与 The Decoder 的独立报道给出相同数值:SWE-Bench Verified 57.00,以及上下文与许可。初步检索中出现的 Mamba 混合架构说法已被排除:IBM 的资料明确说是稠密的 decoder-only transformer,混合架构属于 Granite 4.0。日期方面以一手来源为准,是 8 月 25 日而非 26 日。
- Incertezze
- 所有分数都是 IBM 自报:核实时没有发现 SWE-Bench Verified、Terminal-Bench 2.1 或 RULER 上的独立复现。IBM 博客上的对比图没有以文字形式给出竞品模型的数字,因此对比无法在一手来源上核验。30B 在 AIME25 与 HMMT Feb25 上数值相同(都是 89.17),这一点在两份 IBM 文档中都能看到,但没有解释。关于上下文,两份 IBM 资料的措辞不同——原生 128K、可扩展到 512K——生产环境中究竟支持哪一个窗口并不清楚。本代未见任何 ISO 42001 认证的说法。「一秒转写三小时音频」是声称的吞吐量指标,不是独立测试。
- Perché pubblicarla
- 这是本周唯一一次权重真正可下载、许可真正宽松且没有附加条件条款的发布:任何人都可以不经许可把它投入生产。这种逆势的选择——30 亿到 300 亿参数、单台硬件就能跑的稠密模型,对照近几周动辄数千亿参数的 MoE——直接关系到那些因成本或数据约束而必须自己跑模型的人。而自报数字与缺乏独立验证之间的落差,正是值得在新闻稿抢先开口之前告诉读者的地方。