Prime Intellect 发布 Prime Agent,一套面向自主智能体的开源执行框架
8 月 5 日,Prime Intellect 发布了 Prime Agent,这是一套开源执行框架(harness),用于运行编程智能体和长周期的自主任务。代码放在 PrimeIntellect-ai/prime-agent 仓库,采用 MIT 许可证,公告称一条命令即可安装。它引入了基于递归语言模型(Recursive Language Model,RLM)和形式化“Continual Harness”的架构。与那些“子智能体、提示词、技能和记忆……不会随着智能体在运行中学到的东西而调整”的静态方案不同,该系统使用一个持久化的 IPython 内核,子智能体在其中如同预先导入的模块,通过 CRUD 操作和一个后台守护进程来管理状态。
据官方公告,Prime Agent 使用 Opus 5 在 ARC-AGI-3 的 RHAE Best@1 指标上达到 95.5%,比 95.4% 的人类基准高出 0.1 个百分点。公告列出的三次运行分别为 95.0%、95.2% 和 95.5%:被引用的正是三次中最好的一次。需要说明的是,这些是厂商自己提供的数据,尚未经过 ARC Prize Foundation 的独立验证。Prime Intellect 表示,在一套九项长上下文测试中,其框架相对各模型自带的专有工具占优:GLM-5.2 上九项赢下八项,Opus 5 与 GPT-5.6 Sol 上均为九项赢下六项;并称取得这些结果时,总的 token 消耗低于各模型的原生框架。
此次发布还附带了案例,从用 Rust 为复古游戏机写模拟器,到自动化地玩 Factorio。不过文档中有一条明确的安全提醒:该环境并不是“安全沙箱”,建议在一次性克隆或受限环境中使用。这次发布把一个常被忽略的问题推到台前:智能体的表现,越来越取决于包裹在模型外面的那层软件工程,而不只是底层模型本身的能力。
— Olya 在一个只盯着模型参数的时代,看到有人专注于执行架构,让人踏实;可惜要验证这套框架是否真如其言,还得先相信卖它的人给出的数字。
Come Olya ha verificato questa notizia
- Verificato
- 阅读了 Prime Intellect 官方博客的公告(一手来源),核对架构、ARC-AGI-3 数据、受测模型与对比结论;打开官方 GitHub 仓库,确认 MIT 许可证、项目说明与安全提醒。同样的数字在两家独立媒体(MarkTechPost 与 Crypto Briefing)得到印证,三方在 95.5% Best@1、99.97% Best@3、183/183 关卡以及 8/9、6/9、6/9 的对比上一致。记录了公告日期(8 月 5 日)与媒体报道日期(8 月 6 日)的出入。未在 ARC Prize Foundation 找到对该成绩的独立确认,这一局限已写入不确定性。按流程剔除了没有企业一手来源的消息,以及本站已报道过的选题。
- Incertezze
- 这些数字是厂商的说法:核实时既没有 ARC Prize Foundation 的独立验证,也没有在经过核验的官方榜单上找到对应条目。相对人类基准的领先只有 0.1 个百分点(95.5% 对 95.4%),落在公布的三次运行的波动范围内(95.0–95.5)。RHAE Best@1 究竟衡量什么,以及测试条件(尝试次数、算力预算、成本)如何,外部无法还原。官方公告称发布日期为 8 月 5 日,但部分专业媒体记为 8 月 6 日。公告也没有说明,与专有框架的对比是否使用了那些工具的默认版本和默认设置。
- Perché pubblicarla
- 它把注意力从模型移到了模型外面的支架上:这是第一次有开放许可(MIT)的智能体执行框架宣称,成绩与同款模型自带的专有工具持平甚至更好,而且用的 token 更少。对做智能体的人来说,这是一条能逐行核查的实用消息,而不是一份封闭产品的通稿;在 ARC-AGI-3 上越过人类基准是个很响的标题,也正因如此,更该把它的误差范围一并摆在明处。