《麻省理工科技评论》10月2日刊发文章认为,当前大语言模型并不具备科学家所认可的推理能力。文章以2016年AlphaGo在首尔击败李世石时的第37手为例指出,机器的创造性选择背后是显式搜索与推理,而非单纯直觉;今天的大模型依赖下一词预测和思维链,缺少独立推理机制。
2016年3月,在首尔举行的围棋比赛第二局中,AlphaGo下出第37手。这步棋一度被一些解说者视为程序故障,但AlphaGo最终以4比1战胜李世石。李世石赛后说,他原以为AlphaGo基于概率计算,只是一台机器,看到这步棋后改变了想法,认为AlphaGo有创造性。
文章回顾,1997年深蓝击败国际象棋世界冠军卡斯帕罗夫,靠的是每名棋手向前看六到八步、每秒评估2亿个棋局,并使用人类硬编码规则。围棋复杂得多,一颗棋子的价值取决于远处棋组和领地如何展开,计算哪怕一小部分可能结果,超级计算机也要花费数十亿年。为取胜,AlphaGo必须一眼判断谁领先,甚至发明人类没想到的着法。
许多叙述把第37手描绘成纯粹机器直觉的闪现,文章认为这是误解。第37手实际来自AlphaGo的推理能力,而今天AI缺少这种能力。如果希望未来AI在科学和医学等领域产生可信结果和真正新颖的见解,就需要让它们具备真正的推理能力。
AlphaGo由两个系统组成。策略网络训练来猜测强大人类棋手会怎么下,这个直觉部分认为第37手没什么特别,专家人类下出它的概率约为万分之一。让AlphaGo选择它的是搜索机制:超越眼前合理性,权衡未来后果,显式构建并搜索有数千分支的博弈树,每个分支代表一种可能未来。
卡尼曼的理论区分两种思维:系统1快速、凭直觉、不费力;系统2缓慢、逐步、审慎。AlphaGo提供机器类比:网络提供预感,搜索提供审慎,用后续着法和应对检验预感。直觉不会单独选择第37手,蛮力搜索也难以从众多可能着法中筛选。
这与今天的大模型不同。大语言模型反复挑选下一个词元,相当于系统1:快速、联想,擅长模式补全。ChatGPT问世后,该领域意识到语言流畅不足以真正有用,于是采用思维链:生成中间步骤,分解问题,传递部分结果,影响后续推理。进步在数学和编程中尤其真实,但与AlphaGo搜索不同,这没有引入独立的推理机制,中间推理仍由同一个下一词预测过程产生,只是迭代更久。
文章列出三个缺陷。第一,模型通常不维持显式、持久且可检查的认知状态,没有公开账本列出假设、信心、证据和未决问题,并随新信息修正。第二,缺少知道什么与如何操作知识的清晰分离,知识与推理纠缠在神经网络权重中,没有独立、显式表示的信念。第三,思维链看似审慎,但研究已证明,这些聊天机器人常事后编造:通过一条路径得到答案,却报告另一条。在医学、工程和科研等高风险应用中,系统得出什么结论以及如何得出同样重要。