据量子位报道,OpenAI的GPT-6 Astra已攻破FrontierMath Tier 4中此前唯一一道未被AI成功解出的题目。Epoch AI据此判定,这一研究级数学测试的Tier 4已经饱和。OpenAI公布Astra在Tier 4的成绩为97.6%。
Epoch AI所说的“全部解出”,并非单一模型在单次测试中拿到100%。其统计口径是把不同模型、不同时间的尝试累积起来,只要Tier 4每道题都至少有过一次成功解答,即视为该层级已被刷穿。Astra解出的正是此前一直没有AI攻破的那道题。按报道说法,Astra也可能在某次测试中出错,但它答对的那道题此前从未被其他模型解出。
FrontierMath最早于2024年11月7日发布。其设计目的,是避免数学基准过快被AI刷穿。当时GSM8K、MATH等传统数学基准已难拉开头部模型差距,Epoch AI联合60多位数学家,重新设计了一批此前未公开的原创题,参与者包括陶哲轩、Timothy Gowers、Richard Borcherds等菲尔兹奖得主。陶哲轩曾称其中一些研究级题目“极其困难”,并判断最难的Tier 3可能还能让AI卡上几年。首轮测试中,领先模型正确率不到2%。
最初,FrontierMath核心题库有300道题,分为Tier 1、Tier 2和Tier 3。Tier 1接近高难度本科题和数学奥赛,但允许使用更高级工具;Tier 2达到高年级研究生难度;Tier 3接近博士生早期遇到的探索性研究问题。随着推理模型出现,前三层逐渐不够用,Epoch AI在2025年增加Tier 4。Tier 4大多由数学教授和博士后设计,设计者围绕自己的研究方向进行数周短期研究,再把成果压缩成可自动验证的问题。最初收录50道,覆盖分析、数论、组合数学、拓扑、代数几何等方向。
2025年7月11日Tier 4推出时,榜上最高成绩只有约5%。发布之初,所有模型历次测试加起来也只解出3道题,且这些解答还依赖一些正确但未被充分论证的假设。Epoch AI曾在官网公开样题页面写道,其中一些题可能几十年都不会被AI解决。此后,OpenAI在测试中发现FrontierMath里的错误比预期更多。Epoch AI启动独立审计,先用GPT-5.5和Claude Opus 4.7筛查疑点,再交给数学家逐题复核。2026年6月,v2版本推出,Tier 4修正12道题、移除7道题,留下43题。
修订后,模型成绩继续上升。GPT-5.6 Sol达到83.0%,Claude Fable 5达到90.2%,GPT-6 Astra则达到97.6%,并补上了此前唯一一道从未被AI解出的题。出题人、马凯特大学数学副教授Jay Pantone表示,以往AI都会找数值捷径,而这一次,AI的解法和自己相当接近。他还说,在GPT-6 Astra近期集中解决数学问题的情况下,自己已经很难惊讶。
不过,Tier 4饱和并不意味着数学已经被AI解决。FrontierMath项目已开始转向下一阶段:除Tiers 1至4外,还增加了真正的Open Problems,以及把Erdős开放问题形式化进Lean的FrontierMath Erdős。前者直接拿尚未被数学界解决的研究问题考模型,后者要求AI写出能通过形式化验证的完整证明。报道称,Astra在FrontierMath Erdős的68道问题里只解决了2道。