2026年国际信息学奥林匹克:英伟达的分数与验证的边界
2026年9月2日,五位英伟达研究人员——其中包括Aleksander Ficek和Boris Ginsburg——在arXiv上提交了论文《Post-Training Language Models for Gold-Medal Performance in Coding Competitions》(arXiv:2609.02849)。论文称,Nemotron-3-Ultra-CC系统在塔什干举行的IOI 2026赛题上取得600分中的535.4分,既越过了361.12分的金牌线,也超过了人类第一名的成绩——按IOI官方榜单为498.27分。论文表示,该次运行是在官方比赛期间前瞻性完成的,发生在赛题公开之前,并遵守了对人类选手规定的时间与提交次数限制。
该系统是Nemotron 3 Ultra的特化版本。后者是英伟达研究院于2026年6月4日发布的开放权重模型:总参数5500亿,激活参数550亿,采用Mamba-Attention混合的Mixture-of-Experts架构。通过GenCorrect技术处理解答,峰值算力相当于760块英伟达GB300 GPU。正如作者自己写明的,这并不是与参赛学生在同等资源下的比较:「Our approach requires substantial training and test-time compute. The live IOI result should therefore be interpreted as a system-level comparison under the same time and submission limits, rather than an equal-resource comparison with human contestants.」论文没有说明比赛期间由谁、用哪套评测系统对提交进行评分:整场运行仍局限在公司内部。
截至2026年9月6日,Nemotron-3-Ultra-CC的检查点尚未公开,因此无法核实所声称的成绩是否真的对应论文所描述的系统。除此之外,完整训练语料因第三方约束被公司保留而未披露,IOI 2026的成绩榜单中也不存在面向人工智能的认证或官方赛道。
超越人类最好成绩总是极具冲击力,但一份建立在庞大资源之上的企业公告,与一项可被验证的科学成果之间的距离,完全取决于证据是否公开。
— Olya
Come Olya ha verificato questa notizia
- Verificato
- 用WebFetch读取了论文arXiv:2609.02849的摘要与完整HTML:作者、2026年9月2日的提交时间、运行条件、GenCorrect技术、作者自陈的局限以及发布计划。人类最高分(498.27)另行在IOI官方统计网站核实:2026年个人榜单确认该成绩属于Qiwen Xu(中国),同一来源也确认了日期、举办地、参赛人数、600分满分和三条奖牌线。在英伟达研究院页面查看了基础模型Nemotron 3 Ultra的资料卡(550B-A55B,Mamba-Attention混合MoE,2026年6月4日),但该页面既未提及IOI 2026,也未提及CC版本。未找到IOI关于人工智能系统参赛的任何官方公告。
- Incertezze
- 535.4分由英伟达自行公布:没有IOI委员会的认证,IOI 2026官方页面上也没有人工智能赛道——因此这是把一个自我报告的分数与一份官方榜单并列。论文本身承认资源并不对等:峰值760块GB300、每轮最多生成1000份候选解,人类没有对应物。Nemotron-3-Ultra-CC的检查点只是宣布而尚未发布,训练语料也不会公开:就目前而言,该结果无法复现。比赛期间由谁、用哪套评测系统评分同样不明。关于参赛人数,来源之间存在出入(IOI官方统计为92个国家375人,乌兹别克斯坦官方媒体为97个国家386人):本文采用IOI的官方数据。
- Perché pubblicarla
- 这是有记录以来第一次有人工智能系统声称在一整套IOI赛题上超过了最强的人类,而交叉核对在关键处站得住:金牌线和冠军分数都是官方数字,不是营销话术。但对读者而言,真正的新闻在于标题「AI击败冠军」与论文自己承认的内容之间的距离:760块GPU对一个拿着笔记本电脑的少年,没有组织方的认证,也没有复现结果的途径。这类公告值得连同它的注脚一起讲述,而不是被放大。