据雷峰网报道,NVIDIA于9月9日公布Nemotron 3 Ultra在2026年IMO使用的整套数学推理系统,最终获得30/42分,超过当届29分金牌线,并开源两个数学专家checkpoint、SFT与RL训练数据、推理代码、训练配方、比赛提交证明以及200道Nemotron-IMO-Bench。比赛过程中,模型仅用自然语言写证明,没有调用Lean等形式化证明器,也没有借助外部工具或联网检索。
两天后的9月11日,陶哲轩、Peter Scholze、Maryna Viazovska等25位菲尔兹奖得主联合发声,批评AI数学成果发布越来越快,而证明检查、方法梳理和复现没有足够时间展开。NVIDIA此次把模型、数据、推理流程和计算成本一并留下,使一个IMO金牌级结果可被还原成具体系统变量。
系统技术起点不是反复采样同一个Nemotron 3 Ultra,而是先训练两个行为不同的数学专家。SFT数据加入大量证明修改、验证和再次验证轨迹,使模型能接手半成品或局部错误的证明并沿原路线继续修。RL专家根据成功和失败轨迹调整生成分布,提高能闭合证明的思路权重,压低反复进入死路的选择。通用版、SFT和RL三份checkpoint形成不同解题偏好,降低候选之间的相关性。
首轮每道题生成384份证明,系统将其放入持续更新的搜索池。证明经验证后分为直接通过、方向可用但需修补、路线价值较低三类;高评分证明被保留,验证器指出的问题送回模型修改。自然语言证明没有连续可微目标函数,验证器批改意见承担方向信号。每轮重新产生候选,与之前路线在全局证明池竞争;高评价路线继续获得算力,无法解决关键漏洞则逐渐失去扩展机会。
验证环节是更明显的瓶颈。系统设置高接受门槛,两个专家反复检查同一份证明,全部通过才接受,以较高误拒率换取更低错误接受率。但SFT、RL和通用版共享同一个Nemotron 3 Ultra底座,拥有相似的知识结构和推理习惯。错误来自随机疏忽时,多次检查可降低风险;错误来自共同盲区时,增加检查次数效果减弱。论文中一份列置换对称性错误证明存在可构造反例,三个checkpoint均未识别关键漏洞。第6题中,系统继续计算得到的新证明未获内部验证放行,人工复核却认为其中相当部分正确,可拿部分分数。Verifier因此同时存在错误放过和有价值证明被压制两类偏差。
开源内容包括两个专家checkpoint、SFT与RL数据、推理代码、RL recipe、提交证明和200道Nemotron-IMO-Bench。外部团队可以改变checkpoint组合、sampling budget、verifier threshold和refinement深度,观察成绩变化,但完整重跑30分仍是另一回事。550B级模型、TB级显存以及数千个GB200 GPU小时构成高硬件门槛;NVIDIA官方文档写明,Nemotron 3 Ultra通用版部分中间teacher和MOPD checkpoint尚未开放。8张B200显卡与1464小时的长考成本,仍将多数高校实验室挡在门外。