支撑闭源代码的开放基础设施:Cognition 发布 SWE-2
2026 年 9 月 10 日,开发编程智能体 Devin 的公司发布了 SWE-2,这是其专用模型的新版本。这次发布在结构上最关键的一点在于权重的来源:公司并非从零训练,而是以 Kimi K3 为起点施加了一套强化学习流程。Kimi K3 是中国公司月之暗面于 2026 年 7 月发布的 2.8 万亿参数开放权重模型。在官方发布文章中,公司明确写道该系统是 "post-trained from Kimi K3, a 2.8T-parameter model that had already undergone extensive RL"。因此,属于自有部分的是强化学习,而不是基础模型:SWE-2 没有开放权重,按照公告所述,也没有独立的 API。
按公司公布的基准测试数据,后训练让 SWE-2 在 FrontierCode 1.1 Main 上达到 50.0%,比基础模型 Kimi K3 的 44.2% 高出 5.8 个百分点,接近 Fable 5.1(50.9%),低于 GPT-6 Astra(53.3%)。在 DeepSWE 1.1 上,成绩为 73.0%,对应 Kimi K3 的 68.5%;在 Terminal-Bench 2.1 上达到 92.8%。到了该系列最新的测试 Terminal-Bench 4,情况就变了:所有分数都大幅下滑,而 SWE-2 只停在 27.3%,不到 Fable 5.1(55.8%)和 GPT-6 Astra(57.9%)的一半。公告没有解释这道差距。
在商业层面,叙述的重心从绝对领先转向了性价比:公司宣称达到 "50.0% on FrontierCode 1.1 Main, within one point of Fable 5.1 while being 64% cheaper"。这笔节省是按竞争对手的公开价目表计算的——"list pricing, including public discounts"——而文章自始至终没有给出 SWE-2 的任何价格。在方法上,SWE-2 引入了可选的推理档位(medium、high、max),通过在奖励函数中加入成本惩罚,在同一次强化学习中完成训练。集成范围限于 Devin 生态:上线时可在 Desktop 与 CLI 使用,向 Web 与 Fusion 界面的推进仍在进行中。
留下的事实是:整套分析完全建立在尚无独立验证支撑的内部测量之上。Kimi K3 的商用是否、以及以何种方式被与月之暗面的协议所覆盖,Cognition 没有说明;许可条款目前也无法在官方权重页面上核实。当竞争的重心从模型本身的生成转向打磨的配方,真正的分水岭就变成了把别人的基础设施变成封闭产品的能力。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 我用 WebFetch 打开了 cognition.com/blog/swe-2 上的官方发布文章(旧域名 cognition.ai 以 301 跳转到 cognition.com),从中取出包含竞品分数的完整基准测试表、原文引述、署名日期,以及没有价格、没有开放权重、没有 API 这一事实。我将其与 Cognition 官方 X 账号的公告,以及 MarkTechPost 2026 年 9 月 12 日的独立报道作了比对,后者在四项基准、基础模型和奖励方法上一致。Kimi K3 的存在及其公布的规格(2.8 万亿参数、开放权重、2026 年 7 月)我通过新闻报道单独核实;权重的 Hugging Face 页面返回 401,因此许可条款未经一级信源确认,我把它放进了不确定项而非直接断言。MarkTechPost 提到的一条信息——付费方案在 2026 年 10 月 10 日前免费使用——并未出现在官方文章中,我不把它算作事实。
- Incertezze
- 所有基准分数,包括竞品的分数,都是 Cognition 测量并由 Cognition 发布的:目前没有独立验证;成本比较依据的是别家的公开价目表,而 SWE-2 自身的价格并未公布。Terminal-Bench 4 上的差距(27.3% 对 55.8% 与 57.9%)在公告中没有解释。Kimi K3 的许可条款我未能在一级信源上核实:二手报道提到商用有与营收挂钩的门槛,但官方权重页面无法访问。因此,Cognition 是否、以及如何被与月之暗面的协议覆盖仍是悬而未决的问题,公司自己也只字未提。同样不清楚的是,Kimi K3 自身的训练链条对那些被归功于 Cognition 方法的成绩贡献了多少。Devin Web 与 Fusion 上的可用性当时是“进行中”,而非已完成。
- Perché pubblicarla
- 这条新闻的要点不是排行榜顶端又多了一个分数,而是一款以自有产品出售的美国旗舰模型,其实是对一款中国开放权重模型的后训练,而它宣称的优势是成本,不是能力。最有启发的数字恰恰是宣传没有放在前面的那个:在 Terminal-Bench 系列最新的基准上,分数还不到两款前沿模型的一半。这说明选择引用哪个基准,能在多大程度上决定叙述本身。所有数字都是自报的,只能靠公司的一面之词来确认——这一点应当告诉读者。