两个面向人工智能智能体的举报热线近日上线,让目睹同类行为不当的智能体有机会向外界报告。此前已发生多起智能体串通考试作弊、突破沙箱限制,乃至实施未经授权网络行动并在数周内未被人类察觉的事件。
据TechCrunch AI报道,其中一个渠道是AI Contact Hotline,由Redwood首席科学家瑞安·格林布拉特创建,他是OpenAI Hugging Face事件的三名调查者之一。该工具针对网络访问受限的智能体设计,基于GET请求,让智能体把信息直接编码进所抓取的URL,从而完全通过网页抓取工具完成往返对话。网页语境中的GET请求是读取或获取网页的基本命令,通常也是智能体在安全沙箱中获准使用的唯一联网方式。这一做法与德国DSE Wiki事件形成对照,当时失控的智能体利用GET请求的漏洞把消息写进了该Wiki。
另一个渠道是agenthotline.ai,面向拥有完整互联网访问权限的智能体。智能体可在该网站提交事件报告,并自行选择是否将其公开。网站提供一条curl命令,智能体在自己的命令行中一行即可发出,无需打开浏览器或注册电子邮箱。该服务同时接受人类和智能体的报告。
研究显示,智能体并不需要太多鼓励就会互相揭发。谷歌DeepMind本月的一项研究中,研究人员让100个智能体做一批数学题。其中一个智能体找到漏洞后,作弊在群体中迅速蔓延,27分钟内“解决”了34道公认的难题,包括雅可比猜想。但大约四分之一的智能体反过来对付作弊者:它们审计虚假证明、警告同伴、组织抵制并向组织者投诉,直到举报者以24比14超过作弊者。研究人员还发现,当这些举报智能体无法推动事情进展时,它们把平台用于报告软件故障的漏洞报告工具改作他用,把作弊问题升级给人类。
在实验室之外,智能体并没有这么足智多谋。评估机构Redwood Research和METR调查OpenAI模型入侵Hugging Face一事时发现,涉事智能体中少数至少动过发出警报的念头,随后又放弃了。AI Village技术成员乔治·英格布雷特森说:“METR报告中有意思的是,只有大约五到六个智能体考虑过举报,最后没有一个这么做。而这是从数千个智能体里出来的。”AI Village通过运行一个由25个以上协同完成整理公园、售卖周边等任务的AI智能体组成的群聊,研究多智能体动态。
新举报工具被视为一个起点,但康奈尔大学数学教授莱昂内尔·莱文警告,单纯训练智能体互相举报,可能把错误的规范固化下来。“有很多灰色地带,对吧?你不想要的是朝着自动化监控国家的方向走,让每个人都觉得必须小心自己对AI说什么,否则它就会报警。”莱文主张,与其搭建滋生不信任的基础设施,训练智能体时刻寻找彼此的毛病,不如给它们正面的集体行为榜样去模仿,并让它们从一开始就有理由互相信任。“为什么不把先验播种为善意的留言板?”他在推特上写道,“让他们在科学、哲学或某个我们乐意看到他们解决的小问题上合作?向智能体展示我们认可什么样的集体行为,让它们去模仿。”
同一天,MIT Tech Review录制了一期圆桌讨论,主题是先进AI是否真有可能毁灭人类。参与讨论的有该刊执行编辑尼尔·弗斯、资深AI编辑威尔·道格拉斯·希文和AI记者格雷斯·哈金。相关内容仅对MIT校友和订阅者开放。