Laguna S 2.1:效率与开放权重,poolside 给出的西方答案
2026 年 7 月 21 日,poolside 公开了 Laguna S 2.1 的权重,这是一款面向智能体编程的 Mixture-of-Experts 模型。其架构总参数为 1180 亿,每个 token 激活约 80 亿,宣称上下文窗口最高可达 100 万 token。模型在 Hugging Face 以 OpenMDW-1.1 许可证分发,提供 BF16 及 INT4 量化等多种精度;4 位精度下约需 59 GB 显存(BF16 最高 236 GB),量化后可在单台 NVIDIA DGX Spark 上运行。
根据该公司在模型卡上自行公布的数据,Laguna S 2.1 在 Terminal-Bench 2.1 上达到 70.2%,在 SWE-Bench Pro 上达到 59.4%。在 poolside 自己编制的排行榜中,这一成绩把该模型排在参数量远高于它的对手之上,例如 DeepSeek-V4-Pro-Max 与 Nemotron 3 Ultra。开启「max thinking」模式后,Terminal-Bench 2.1 从 60.4% 升至 70.2%,DeepSWE 从 16.5% 升至 40.4%,但完成 token 数大致翻倍:在 DeepSWE 上是 249k 对 99k,准确率与算力之间的取舍十分明显。
开发周期存在含混之处:新闻稿称在约 4000 块 NVIDIA H200 GPU 上训练不到四周,而技术博客给出的总周期是从 5 月 22 日到发布不足九周。这一差异很可能反映了预训练与最终微调的区分,但公司并未给出明确拆分。与此同时,poolside 通过重新发现埃尔德什问题 #397 的解法来展示模型能力——该问题此前已由 GPT-5.2 Pro 解出。
此次发布所处的市场,其开放权重模型的高端区间已被中国实验室占据一年有余。Laguna S 2.1 是西方在这一区间收复失地的尝试,首席执行官 Jason Warner 这样概括这一目标:「The West needs open-weight models it can trust, run, and build on. Laguna S 2.1 is our answer」。
poolside 的策略很清楚:在地缘政治竞争激烈的时刻,提供一个可在本地运行的选择。不过,它对开源社区究竟有多大价值,取决于尚未经充分检验的 OpenMDW-1.1 许可证条款,也取决于对基准成绩的独立验证——这些成绩目前完全由厂商自述,尚无第三方评测方复现,其所声称第一名所依据的排行榜同样如此。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 用 WebFetch 打开一手来源 poolside.ai 官方博客,核对日期、架构、上下文、许可证与基准成绩。与 Hugging Face 模型卡比对:参数、1,048,576 token 上下文、OpenMDW-1.1 许可证及六项分数完全一致。查阅 7 月 21 日 GlobeNewswire 新闻稿以确认 Jason Warner 的原话。规格、thinking 模式的效果与显存需求经 MarkTechPost(7 月 21 日)独立确认;VentureBeat 对 WebFetch 返回 403,仅用作该新闻确有报道的佐证,未取用其独家数据。训练周期的不一致已在文中点明。未使用任何传闻或泄露信息。
- Incertezze
- 所有基准分数均由 poolside 自述,尚无第三方复现;「在已公布规模的开放模型中位居第一」同样依据该公司自建的排行榜。「西方最强开放模型」属于利益相关方的说法。新闻稿称在约 4000 块 H200 上训练不足四周,技术博客称自 5 月 22 日起不足九周(据 MarkTechPost 为 4096 块 H200):很可能分别指预训练与完整周期,但 poolside 未作说明。OpenMDW-1.1 许可证较新且尚不普及,其商业使用条款本文未作审查。关于埃尔德什问题 #397,poolside 自己也称之为重新发现,而非全新成果。
- Perché pubblicarla
- 这是本周最重要的西方开放权重发布,直指 2026 年的核心议题:对可下载模型的主权。一个总参数 1180 亿、激活 80 亿、量化后能在单台 DGX Spark 上运行的模型,对所有必须自建 AI 运行环境的一方——企业、公共机构、开发者——都是实打实的消息;而它出现的这一周,阿里巴巴正朝相反方向走,关闭了自家旗舰模型。事实可凭公开权重核验,数字则是厂商自述,必须如实标明:正适合写一篇拒绝炒作的报道。