据The Verge报道,OpenAI本周突然向数学界发布近400项由AI生成的数学结果,分散在700多篇手稿中,覆盖组合学、几何学多个分支、数论、理论计算机科学、代数、拓扑学、概率与统计力学以及数学物理等领域。三十多位数学家接受采访时用“令人震惊”“压倒性”“前所未有”“超现实”“纯粹疯了”等词形容这批成果,并一致认为,仅理解OpenAI发布了什么就可能需要数年,更不用说思考数学家在这场变化中的位置。
由于规模庞大,OpenAI还发布了如何浏览其GitHub仓库的指南。发布后数小时乃至数天,多数受访数学家表示仍在消化内容;有几人说,仅仅读完约40页的目录和摘要就花了近一小时。康涅狄格大学数学教授阿尔瓦罗·洛萨诺-罗夫莱多对The Verge说:“仅仅浏览整个摘要列表就令人不堪重负。”
数百篇手稿中夹杂着Lean形式化内容。Lean是一种编程语言和证明助手,可让结果通过计算得到验证。这类形式化在评估OpenAI此前的数学主张时发挥过作用,即使研究者不完全理解论证,也能对逻辑正确性有一定信心。但每个结果的验证程度差异很大。OpenAI在GitHub上承认,这些结果处于“不同的验证阶段”,“许多,但并非全部手稿已被形式化”。截至报道写作时,合集内不到一半手稿似乎已有形式化描述。OpenAI称,719篇手稿中只有300项主要结果已被形式化,约占42%,并称“将在获得更多形式化后更新仓库”。
多名数学家向The Verge抱怨形式化不足,尤其是考虑到结果数量如此之多。他们强调,即使结果附有Lean代码,评估也不是瞬间完成。研究者必须检查形式化是否真的证明了结果所声称的内容,这同样耗时。几名翻阅论文的人说,即使提供了计算机可验证的证明,质量也不一致,其所验证的命题并不总能与手稿中的主张完全对应。
伦敦帝国理工学院数学教授凯文·巴扎德说,他在自己从事的代数数论领域找到大量定理,但只有约六项立即“脱颖而出”。这些定理中几乎没有一项似乎在Lean中得到形式化验证。他说:“因此,我要么必须阅读可能不正确的垃圾内容,要么等别人去读,要么等有人将其形式化,然后才能确定这些结果是否正确。”他的担忧得到许多其他研究者呼应。
巴扎德并非唯一担心AI“垃圾内容”的人。这个说法指低质量、常有错误、由AI生成的内容,近年越来越多出现在网上和现实中,包括学术论文。和在其他领域一样,数学家告诉The Verge,他们近年来看到用ChatGPT和Claude等工具生成的材料大幅增加。其中许多内容令人困惑、难以阅读,对主题理解甚少,在引用其他研究者时尤其粗糙。OpenAI此前的数学文稿曾因草率,尤其是归属糟糕或缺失,受到专家广泛批评。
在惊叹、兴奋和对规模的不确定之外,还有一种深层焦虑:这一切意味着什么,接下来会发生什么。许多人担心,OpenAI不会等待那么久才继续前进,或发布更多内容。有数学家对The Verge形容,如果AI现在消失,就像外星人来过地球又离开,他们未来10年都会研究这些内容,试图理解一切。一些人的职业生涯一夜之间被打乱,学术界必须在OpenAI继续前进的同时,从低质内容中分辨出真正解答。