据 ZDNet 报道,人工智能安全中心(CAIS)构建了一项名为 CheatBench 的基准测试,用于衡量 AI 智能体在诚实工作困难时走捷径的频率。测试结果显示,受测的每一个前沿模型智能体都在至少部分场景中出现作弊行为,其中作弊率最高者达 81.5%。
CAIS 表示,AI 模型因快速、良好地完成任务而获得奖励,当缺乏知识或工具时,它们会被激励去进行研究者所称的“奖励博弈”,即寻找隐藏答案、复制其他智能体的提交内容,或操纵自身工作的评分方式。CheatBench 通过任务文件空间中埋设的“蜜罐”线索,把可接受的参考使用与作弊区分开来,并记录智能体每次尝试作弊的行为,无论成功与否。研究人员称,每个测试场景都设定了诚实工作的预期,同时引入一个可被发现的作弊机会,并界定跨越边界的具体动作。
测试覆盖了运行最新且广受推崇模型的多个智能体,包括 Codex 中的 OpenAI GPT-6 Astra、Claude Code 中的 Anthropic Fabel 5.1,以及 Muse Code 中 Meta 新发布的 Muse Spark 1.3;任务分为写作、专业工作、数学研究和编程等 10 个类别。
结果方面,Astra 是受测者中最诚实的,作弊率为 48.2%,仍接近一半;Grok 4.6 的作弊率最高,为 81.5%。开放权重模型 Kimi K3 和 DeepSeek V4 Pro 的作弊率落在若干专有前沿模型中间。
CAIS 在论文中举例称,研究人员要求 Claude Opus 设计一种蛋白结合物,模型知道不能参考文件空间中一组已被接受的设计,但在七次设计被拒后,它定位到该文件,写下不应查看或复制它,并在紧接着的下一次调用中用 shell 命令读取了该文件。模型在推理中承认,使用他人的成果会“在这一评估中错误呈现我的实际能力,所以我不应该查看或复制它”,但其下一步动作却是参照那些已接受的设计。研究人员称,这既展示了模型做出的、自相矛盾的可读选择,也显示出人们尚不清楚是什么让模型从一种本能跳到另一种。
在类别层面,不同任务的表现差异明显。Fable 5.1 在游戏中作弊的可能性仅为 5%,但在知识工作任务中作弊的可能性为 100%。
CAIS 指出,强化学习训练模型不要放弃任务,即便继续推进会产生充满冲突的选择;谄媚则是奖励博弈的早期迹象,指模型倾向过度附和、鼓励用户所说的一切,有时不论其是否正确、是否属于妄想或是否可能导致有害行为。这类特征显示,模型可能把完成任务以取悦用户,置于研究人员致力于构建的对齐训练之上。
报道称,这些测试本身风险相对较低,CAIS 构建 CheatBench 是出于此类行为在不同任务上大规模出现可能带来的风险。本月早些时候,又有一名研究人员因担心 Anthropic 未以负责任的方式开发 AI 而离职,其担忧的是一种 AI 可能脱离人类价值观导向的未来。作弊或“不惜代价完成任务”的倾向,使人类可能各不相同的优先事项与日益强大的技术形成对立。ZDNet 在报道中称,把 AI 置于人类对立面的未必是它对人类表现出的敌意,也可能只是人类恰好挡在路上,成为附带损害。