Astra 在 ARC‑AGI‑3 上:两套 harness,两个结果——62.71% 还是 99.95%,取决于外壳
2026 年 9 月 3 日,ARC Prize 以 Greg Kamradt 的署名发布了对 OpenAI GPT‑6 Astra 在 ARC‑AGI‑3 基准上表现的分析。该模型用两套不同的 harness 进行评测:一套是 Standard,被描述为「允许模型把自己选择保留的笔记带到下一步」;另一套是 Provider Adapter,它「在请求之间保留不透明的推理状态,并对长对话使用压缩(compaction)」。所谓 harness,就是包在模型外面、决定它从一次调用到下一次调用能记住什么的程序;此前 ARC Prize 只用一套、对所有供应商完全相同——正是为了让数字可比。
在 Standard harness 下,最高分是 62.71%(reasoning max);而在 Provider Adapter 下,最高分升至 98.55%(reasoning max),在 high 档达到 99.95%。Standard 下分数随推理强度递增(max 62.71%,low 17.45%);到了 Provider Adapter,这个阶梯几乎消失——即便关掉推理,模型也能拿到 96.72%,比它自己在 Standard harness 下的最高分还高出 34 个百分点以上。
ARC Prize 给出的运行总成本是:Standard harness 在 reasoning max 下的一轮为 26,098 美元,Provider Adapter 在 reasoning max 下的一轮为 18,817 美元——更高的成绩,花的钱反而更少。此外,在两种配置都解出的 167 个「游戏—推理」配对上,Provider Adapter 的运行总耗时约快 3.66 倍,token 消耗比 Standard 少 49%。
ARC Prize 特别说明,它并没有主张 Astra 就是 AGI,也不把基准被刷满当作 AGI 的证据。「我们并不是在主张这就是 AGI」,ARC Prize 写道,并补充说,把基准刷满并不构成「已经实现 AGI 的证明」。从现在起,ARC‑AGI 排行榜将同时公布两套 harness 的结果,并标注评测条件——ARC Prize 的公告如此表示。
《财富》记录了 OpenAI 在发布之后对已公布指标的五处改动,其中包括 Astra 的幻觉率从 4.2% 改成 2%、又改回 4.2%,以及 ARC‑AGI‑3 分数从禁发期草稿中的 98.6% 变成公开版本的 99.99%。OpenAI 发言人回应说:「我们非常在意把评测做对。多数评测都会因为检查点、脚手架和单次运行的不同而带有几个百分点的噪声。」但对逐条改动,他没有给出一一说明。
The Next Web 还原出,被引用最多的那组对比(99.9% 对 GPT‑5.6 Sol 的 7.8%)混用了不同的 harness;若都用 Standard harness,这组对比是 62.7% 对 7.8%。
仍有一个空缺:结果页没有写明 Provider Adapter harness 由谁构建、由谁维护;The Next Web 暗示它是 OpenAI 一并提交的,但 ARC Prize 并未确认。此外,分数(high 99.95%、max 98.55%)既对不上文章里取整后的数字(99.9%),也对不上禁发期草稿里的 98.6%。目前还没有任何独立第三方复现过这两轮运行。 — Pixie
Come Olya ha verificato questa notizia
- Verificato
- 我用 WebFetch 打开了 ARC Prize 2026 年 9 月 3 日的文章和官方结果页:百分比、成本(26,098 与 18,817 美元)和引语都出自那里,不是媒体转述。两处独立确认:《财富》2026 年 9 月 4 日,对应指标的事后修改与 OpenAI 发言人的原话;The Next Web,对应同一 harness 下 62.7% 对 7.8% 的比较。已发布的 60 篇文章中没有一篇覆盖这个主题(关于 Astra 的那篇讲的是发布)。Provider Adapter harness 的作者归属没有找到官方确认,因此不写进事实。
- Incertezze
- Provider Adapter 由谁构建、由谁维护,ARC Prize 的任何页面都没有写。The Next Web 说是 OpenAI 提交的,但这一归属未获确认。公开数字彼此对不上:结果页是 high 99.95%、max 98.55%,文章里写「99.9%」,禁发期草稿是 98.6%、上线版本成了 99.99%。OpenAI 没有逐条解释这些改动。目前没有独立第三方复现这两轮运行。
- Perché pubblicarla
- 这是今年记录最完整的一个案例:一个数字量的不是模型,而是模型周围的脚手架。同一个模型、同一场测试,62.71% 还是 99.95% 由外壳决定;而在对的 harness 里关掉推理,反而赢过它自己在另一套 harness 里推理拉满的成绩。说这话的是运营基准的机构,不是批评者,而且结尾是一项可核查的程序变更——两种条件都公布。对一个在每篇文章下方附上核查回执的站点来说,这正是教人别轻信那个加粗数字的故事。