xAI 的 Grok 4.7:宣称的能力、不变的价格,与独立测评结果的对照
2026 年 9 月 21 日,xAI 发布 Grok 4.7,称其为“我们在编程和知识工作上最强的模型”,并强调该模型建立在更大的基础模型之上,经过更长的强化学习周期训练,并被设计为能更好地核查自身输出(来源:x.ai/news/grok-4-7 的官方公告)。价格与 Grok 4.6 持平:输入每百万 token 2 美元,输出每百万 token 6 美元;Grok 4.7 Fast 以两倍价格换取两倍速度,但据 The Decoder 报道,它只能通过 Cursor 和 Grok Build 使用,而非公开 API。
xAI 的文档列出了自报的基准成绩,包括 CursorBench 4.0(46.3%)、DeepSWE v1.1(71.0%)、EEBench(64.0%)和 Terminal‑Bench 4.0(38.0%)。然而 Artificial Analysis 的独立测评给出的数字更低:在 Terminal‑Bench 4.0 上,该模型的成功率只有 26%,比 xAI 公布的数值低约 12 个百分点。若把模型与 xAI 自家的 Grok Build harness 搭配,Artificial Analysis 测得 33%(Grok 4.6 为 18%),该组合在 Coding Agent Index 中位列第四,排在 GPT‑6 Astra 之后——但这是与单独测试不同的一套配置。此外,在 Artificial Analysis Intelligence Index v4.3.2 上,该模型得 46 分,落后于 Claude Fable 5.1 和 GPT‑6(来源:Artificial Analysis;The Decoder)。两个数值之间的差距没有得到解释:公告中未说明 effort 设置、尝试次数和所用的 harness。
独立分析中另一个值得注意的数字,是 Intelligence Index 上每项任务的 token 消耗:Grok 4.7(xhigh)每项任务约用 81,000 个输出 token,而 Grok 4.6(high)为 36,000 个,GPT‑6 Astra(max)为 27,000 个。在 token 单价相同的前提下,这意味着单任务成本高于此前版本——不过该数据基于 Intelligence Index 的任务测得,并不会自动适用于其他使用场景。
总之,xAI 押注的是有竞争力的 token 单价,但独立证据表明,它在性能和单任务成本上的优势并没有那么明确。由于缺少基准条件、上下文窗口和 harness 配置的细节,很难完整评估 Grok 4.7 相对竞争对手究竟多出了什么。 — Pixie
Come Olya ha verificato questa notizia
- Verificato
- 查阅了 x.ai/news/grok-4-7 的官方公告:核对 2026 年 9 月 21 日的日期、每百万 token 2/6 美元的价格、自报基准成绩清单(含 Terminal-Bench 4.0 的 38.0%)以及引用的两句话。查阅了 Artificial Analysis 9 月 21 日的独立测评报告:核对 Intelligence Index 46 分、单独测试下 Terminal-Bench 4.0 的 26%、搭配 Grok Build 的 33%、Coding Agent Index 第四名、每项任务 81,000 个输出 token 对 36,000 与 27,000。核实了第三家独立来源(The Decoder),其数字一致,并补充了 Fast 版本的细节。仅在聚合站点看到的上下文窗口数据未能在一手来源得到确认,因此排除在事实之外。
- Incertezze
- xAI 公布的 Terminal-Bench 4.0 成绩 38.0% 与 Artificial Analysis 测得的 26% 之间的差距成因不明:公告未说明 harness、effort 设置和尝试次数,Artificial Analysis 也未解释这一差异。居中的 33% 适用于与 Grok Build 的组合,即另一套配置。官方公告未给出上下文窗口:50 万 token 的说法流传于第三方聚合站点,一手来源并未确认。公告中的所有基准成绩均为自报,除 Artificial Analysis 重新测算的部分外,未经第三方复现。每项任务 81,000 个 token 是在 Intelligence Index 上测得的,无法自动换算为其他场景的成本。
- Perché pubblicarla
- 在同一份公告里,能把厂商自报的数字与独立评测方在同一基准上重做的同一项测量摆在一起,并不多见:38% 对 26%,中间还有一个取决于 harness 的 33%。但对读者更有用的是另一件事:token 单价原地不动,每项任务的 token 消耗却比上一版本翻了三倍,达到一个标价更贵的竞品的三倍。这是一个具体的例子——一个模型的价格,并不能只看价目表;而且可以用公开且标明出处的数字加以核验。