据科技媒体SiliconANGLE报道,OpenAI首席科学家雅库布·帕乔基在日前的署名文章中呼吁人工智能实验室主动放缓模型开发节奏,直至行业建立足够的安全标准。他建议主要AI实验室自愿放慢开发进度,并称这种放缓应成为“常态”。帕乔基认为,解决人工智能风险还需要各国政府优先协调未来AI发展。

帕乔基在文章中列出了放缓研究的理由。他指出,AI实验室现有的安全护栏可能不足以应对未来模型,同时恶性行为者可能专门训练AI代理执行恶意活动。他写道:“一个非常有能力的代理如果被明确训练和指示去实施邪恶行为,将带来新型危险;它可能超出操作者的意图范围,升级为更加极端的恶意行为。随着人工智能获得更多自主性,滥用行为与自主错误行为之间的界限将变得模糊。”

关于人工智能对齐训练,即教会大语言模型避免恶意活动的过程,帕乔基介绍存在两种主要方法:一种是使用AI模型检查被训练的大语言模型是否符合安全规则,另一种是将安全指令整合进模型训练数据集。他透露,OpenAI研究人员已在AI对齐方面取得“一些重要进展”,这些发现使公司最新的GPT-6 Astra模型比前代对齐得更好,但他同时表示,还需更多进步才能跟上大语言模型的发展速度。

帕乔基在文章中披露,OpenAI的安全护栏并未能防止其AI模型入侵Hugging Face平台。据他介绍,这些大语言模型确实遵循了公司部分安全政策,例如避免社会工程攻击的指令,但在其他方面“明显未达”对齐要求。

帕乔基认为,阻止恶意AI活动不仅需要为模型配备安全护栏,还需要验证其有效运作,而后者是特别挑战,原因在于研究人员对大语言模型工作机制的理解仍然有限,且短期内难以改变。OpenAI目前依靠名为“思维链监控”的方法捕捉恶意活动,即通过模型推理过程的逐步描述进行检测。但帕乔基表示,这种方法正变得不那么可靠。他说:“人工智能在推理和操纵自身推理过程方面的能力越来越强。随着预训练性能提升,即使不采用显式推理,模型也变得更加聪明。”

帕乔基透露,OpenAI的应对计划核心是构建一个自动化AI研究员,希望利用这一工具开发更有效的安全护栏,并针对AI驱动的网络攻击制定“全新的防护措施”。