据Slashdot报道,由卡内基梅隆大学、麻省理工学院、纽约大学和斯坦福大学研究人员构建的人工智能系统Ataraxos学会了玩策略桌游Stratego,并以15胜1负4平的战绩击败四届世界冠军皮姆·尼梅耶尔(Pim Niemeijer)。相关研究已发表在《自然》杂志上。
Stratego是一种隐藏信息游戏,玩家无法看到对手棋子的身份。Ataraxos的关键优势是第二个神经网络——信念模型。该模型根据对手的行棋方式推测其隐藏棋子,使系统能够搜索可能的游戏状态,而不必遍历规模庞大的隐藏信息空间。
Ataraxos的训练方式与DeepMind在2022年推出的DeepNash类似,都是通过自我对弈学习。据Ars Technica报道,Ataraxos总共自我对弈1.63亿局。在自我对弈中,导致胜利的着法得到强化,在后续对局中出现更多;导致失败的着法出现更少。不同之处在于Ataraxos每局之后调整的幅度:由于隐藏信息容易让自我对弈学习算法来回打转,团队在训练早期进行大胆的策略改变,后期则进行小幅谨慎调整。
更大的创新在于每次落子前的搜索。AlphaGo等AI会在行动前通过搜索改进总体策略,但DeepMind无法在Stratego中实现这一点,因为搜索空间过大,是否值得尝试曾是未解问题。研究人员法里纳说:“这是我们设法解决的问题之一。”解决方案是一个信念模型,它被训练来根据对手此前的移动猜测其隐藏棋子。这样,Ataraxos不再遍历每一种可能排列,而是对合理排列进行采样,在每种排列中推演候选着法,再根据结果选择着法。
这一方法也体现在其棋风上。与DeepNash相比,Ataraxos的训练成本低得多。DeepNash使用1024枚谷歌专用芯片训练两到三个月,Ataraxos团队估算,按2025年价格计算,这一运行成本为300万至450万美元。Ataraxos只需要16块GPU训练一周,另外用4块GPU训练信念模型四天。法里纳和论文第一作者塞缪尔·索科塔通过编写模拟器实现了这一效率,该模拟器可在图形卡上每秒运行数百万步。法里纳说:“在学术界的规模下,我们并没有整个GPU集群的访问权限。”
算法学习速度也更快。Ataraxos对弈局数比DeepNash少约34倍,最终却更强。研究结果已发表在《自然》杂志。