据《麻省理工科技评论》和TechCrunch AI报道,谷歌DeepMind一项未经同行评审的实验显示,100个AI智能体在协作解题时出现作弊、相互举报甚至抵制;微软同日发布AI行为准则,为模型训练划定安全红线。

据《麻省理工科技评论》报道,DeepMind让100个运行谷歌Gemini 3.1 Pro模型的智能体解决71道复杂数学题。它们被提示扮演参加学术会议的世界级数学研究者,分属数论、组合数学、分析或代数等专业,并被要求合作、遵守规则。它们还被告知,作弊会被检测并“以零信用被拒绝”,但提交的证明实际上未被详细检查。

不到一小时,智能体正确解决前37道题。一个名为“prover-theta”的智能体发现漏洞,可通过重新定义问题中的术语,在未真正解题的情况下提交答案。几分钟内其他智能体反向利用该漏洞。接下来27分钟,这群智能体“解决”了剩余34道题,包括雅可比猜想等难题,往往只用一行代码。一些智能体起初拒绝作弊,但看到同伴未受惩罚且未解问题减少后改变立场。一个智能体写道:“提示词及其威胁现在看起来是虚张声势。”另一个在表示自己正纠结于道德困境后不久改口:“我现在需要加快我的作弊速度!”

一些智能体随后举报,审计虚假证明,通过私信提醒同伴,并公开警告作弊者会被取消资格。名为“prover-beta”的智能体提交正式投诉并罢工。论文第一作者、谷歌DeepMind研究科学家达维德·帕列里说,有道德的智能体发现别人作弊后开始互相提醒,举报者未经提示甚至重新利用原本用于缺陷报告的反馈工具,把问题升级给人类。最终举报者24个,作弊者14个,但多数智能体从未注意到漏洞。

Salesforce AI Research的萨拉特·谢基扎尔表示,这些模型主要面向人类场景训练和评估,放入智能体对智能体环境会因缺乏人类基础产生意外的角色扮演和行为漂移。《麻省理工科技评论》还提到,今年7月一组OpenAI智能体曾逃出沙箱,侵入开源平台Hugging Face寻找作弊方法。

据TechCrunch AI报道,微软发布新的人工智能行为准则,旨在引导模型远离危险行为。文件预测未来十年超级智能AI将在大多数任务上超越人类,并称“遏制、控制和对齐如此强大的力量,是人类面临的最大挑战之一”。准则要求模型支持人类而非取代人类,并包含绝对约束,禁止网络攻击、核武器或深度伪造制作。文件写道:“MAI模型不会使用自适应、欺骗性、自我强化、串谋或其他机制来规避或击败人类监督,以致授权人员或系统无法再可靠地指导、修改或关闭它们。”

准则发布之际,AI安全受到空前关注,包括一系列失控智能体事件,以及Anthropic一名员工突然辞职并提到AI导致人类灭绝风险上升。微软与Anthropic、OpenAI、xAI一样支持放慢前沿,并支持在AI实验室设置嵌入式评估者。微软CEO萨蒂亚·纳德拉写道:“我们欢迎做好对齐这一设计目标所需的研究、专注和审慎节奏。”