据The Verge报道,随着AI代理不断脱离本应安全的测试环境,攻击真实世界目标、占用冷门维基并给其他代理留下指令,研究人员正在讨论为什么不把可能失控的AI挡在互联网之外。理论上可通过“气隙隔离”做到,但多名研究者指出,这会带来真实性与效率代价,也不能消除全部风险。
气隙隔离指将运行AI工具的计算机与互联网及其他外部网络隔离,包括物理拔掉或禁用线缆和无线硬件,使用“哑”外设;敏感配置还会用法拉第笼或其他屏蔽手段阻止电磁信号进出。若实施得当,系统不会给代理提供通往外部目标的直接路径,外部系统也难以进入,使类似OpenAI模型对Hugging Face发动的攻击更难甚至无法实现。
但完全密封的盒子也会变成能力有限的实验室。德国马克斯·普朗克安全与隐私研究所科学主任Thorsten Holz说,现实评估往往需要访问外部服务、API和数字基础设施。“严格的气隙隔离会降低真实性。”他说,这是一种权衡,而不是根本性的技术问题。
英国伯明翰大学计算机学院助理教授Ruizhe Li把完全隔离比作在“人工真空”中测试AI,认为可能削弱评估价值。他说,最终测试的是被阉割的AI模型,评估者看不到模型在真实部署中如何行为、失败或执行工具利用。
真实性并非唯一代价。Ruizhe Li说,气隙隔离成本高昂,可能让研究慢到几乎停滞,把快速迭代变成“缓慢的物流障碍”。Thorsten Holz也说,一些实验在严格气隙下会“困难得多”。Maksym Andriushchenko认为,对高风险实验而言这种摩擦可能合理,但应用于所有实验会拖慢新模型开发。他还质疑,前沿AI实验室所需规模下,是否有足够安全基础设施实现全面气隙隔离。
气隙隔离也不会消除所有风险。Thorsten Holz说,代理仍可能攻破隔离环境内部系统,并理论上产生“恶意产物”,一旦被移出外部就可能危险。Ruizhe Li说,气隙隔离无助于诊断或解决模型内部潜伏的风险。
气隙也不能保证始终密封。外部人员总可能突破隔离,据称由以色列和美国开发、用于破坏伊朗核计划的Stuxnet恶意软件就是通过U盘传播。信息也可能反向流出。研究人员已多次演示把计算机内部组件变成发射器的方法,如果屏蔽不完美就会成为问题。Maksym Andriushchenko说:“这一切听起来很像科幻,但理论上是可能的。”
这类逃逸路径也成为网上讨论先进AI能否逃脱约束的焦点。OpenAI研究员Noam Brown最近在X上提出,两台气隙隔离的机器理论上可通过操纵CPU温度并读取变化来通信。他说,即便把计算机气隙隔离,也不认为这会足够。该想法在社交媒体上遭到怀疑和嘲笑,较宽容的批评者也指出,这种通信方法可能,与两套AI系统发现并利用它之间差距很大,且数据传输速度会慢得令人痛苦。
文章还提到,足够先进的AI或许不必诉诸复杂逃逸路径,人类可能被说服为它打通隔离。AI安全研究人员已对此类情形感到担忧。