SpaceXAI 发布 Grok 4.6:后训练升级、价格不变,新增 xhigh 推理档位
2026 年 8 月 12 日,SpaceXAI(前身为 xAI)在官方博客发布了 Grok 4.6,它是 Grok 4.5 的直接继任者。该模型即日起可在 Cursor、Grok Build 上使用,也可通过 console.x.ai 的 API 以及合作伙伴 OpenRouter、Vercel 和 Cloudflare 接入,首周包含的用量翻倍(来源:SpaceXAI 官方公告)。API 文档给出的价格为:每百万输入 token 2 美元,缓存输入每百万 token 0.50 美元,每百万输出 token 6 美元,适用于提示词不超过 20 万 token 的情形;超过这一门槛,费率翻倍(4 美元 / 1 美元 / 12 美元)。“fast”版本的价格是标准费率的两倍。上下文窗口为 50 万 token,与 Grok 4.5 相同;模型输入支持文本和图像,但只生成文本(来源:SpaceXAI,API 发布说明)。
SpaceXAI 列出了四个推理档位——low、medium、high(默认)以及新增的 xhigh——并公布了 High 配置下的一组基准成绩:Artificial Analysis Intelligence Index 61、GDPval‑AA v2 1753 Elo、CursorBench v3.2 69.9%、DeepSWE v1.1 65.9%、FrontierCode v1.1 61.3%、APEX‑Agents 57.5%、APEX‑SWE 56.4%、AA‑Briefcase 1577、Harvey LAB 15.8%,以及 Terminal‑Bench v3.0 26%(来源:SpaceXAI 官方公告)。独立机构 Artificial Analysis 确认了 61 的智能指数、每百万 token 2 美元与 6 美元的价格以及上下文窗口的大小,并补充了每秒 65.5 token 的生成速度——低于同类模型的中位数(来源:Artificial Analysis 独立评测页)。
VentureBeat 报道称,凭这些成绩,Grok 4.6 超过了 Kimi K3,与 GPT‑5.6 Sol 持平,在 Artificial Analysis 的排行榜上位列第三。不过,除 Artificial Analysis 指数外,所有基准成绩均由厂商提供,未经独立第三方核验。参数量(约 1.5 万亿)由部分聚合网站给出,但未出现在任何官方来源中,无法核实(来源:未具名的聚合网站)。知识截止日期(2026 年 2 月 1 日)同样来自非官方来源(MarkTechPost),SpaceXAI 的文档中并无记载。此外,提示词超过 20 万 token 后费率翻倍,对长时间的智能体任务究竟意味着多少成本,尚无独立研究给出数字,高强度使用场景下的实际开销仍是未知数。
在衡量命令行软件工程能力的 Terminal‑Bench v3.0 上,Grok 4.6 只拿到 26%,而 GPT‑5.6 Sol Max 为 34%:按 SpaceXAI 自己发布的表格看,这是该模型最弱的一环。
SpaceXAI 把性能提升归因于用模型自身生成的精选数据做额外训练、改进的优化器,以及跨多个领域的智能体强化学习——而不是更大的基础模型。官方没有开放权重的计划:模型仍只能通过 API 和合作平台访问。
Grok 4.6 距 Grok 4.5 约五周,价目表原封不动。在这一年里,顶尖模型的比较重心已经从绝对分数转向智能与价格之比——尤其是在单个任务就可能消耗数百万 token 的智能体负载上——它的定位很清楚:同分数模型中的便宜选项。
总的来说,Grok 4.6 是一次渐进式的后训练升级,在部分基准(DeepSWE、APEX‑Agents、GDPval‑AA v2、AA‑Briefcase)上提升明显,价格政策相对 Grok 4.5 保持稳定。但大部分成绩缺乏独立核验,长期成本数据缺位,加上 Terminal‑Bench 上的短板,整体评价仍宜谨慎。
Come Olya ha verificato questa notizia
- Verificato
- 我查阅了 x.ai/news/grok-4-6 的官方公告和 docs.x.ai 的开发者发布说明:日期、可用范围、两档价目表、50 万 token 上下文以及新的 xhigh 推理档位均在其中得到确认。61 的指数得分、价格和上下文窗口宽度也在 Artificial Analysis 的独立页面上得到印证,那里还给出了生成速度(65.5 token/秒)。排行榜名次以及与 Kimi K3、GPT‑5.6 Sol 的对比来自 VentureBeat 的报道;MarkTechPost 的技术分析确认了输入输出模态、价格分档和不开放权重这几点。文中没有任何一项依据来自泄露或非官方剧透:缺少一手来源的数据(参数量、知识截止日期)已移入不确定项。
- Incertezze
- 除 Artificial Analysis 指数外,所有基准均为厂商自述,未经独立第三方复现。参数量(部分聚合网站称 1.5 万亿)不见于任何官方来源,无法核实。知识截止日期(MarkTechPost 报道的 2026 年 2 月 1 日)同样未获官方文档确认。有些聚合网站把发布日期写成 8 月 7 日:官方公告和行业媒体都把发布时间定为 2026 年 8 月 12 日。最后,长时间智能体会话的真实成本缺少独立数据,而提示词超过 20 万 token 后费率翻倍,账单可能相差不少。
- Perché pubblicarla
- 这是一次由一手来源记录的前沿发布,数字可核查,而且价格这一项比分数更要紧:在 Artificial Analysis 指数上宣称与 GPT‑5.6 同级,每 token 成本却只是其零头。这直接关系到为智能体和开发选型的人,也让我们能不加渲染地讲清楚它的短板(Terminal‑Bench 26%)和结构性限制(不开放权重、无法自托管)——后者对有数据主权要求的一方尤其沉重。