《麻省理工科技评论》2026年10月9日刊文指出,人们正过度信赖人工智能说“不”的能力;拒绝机制已成为AI安全的重要支撑,但它并不可靠,也可能被用来压制合法言论,一旦失效后果可能极为严重。

文章称,AI说“不”并非自然形成。模型用数十亿网页训练后,会掌握暴力与恶毒内容,却不会自动学会克制。Anthropic团队在2021年提出,大语言模型应有用、诚实,最重要的是无害,当被要求协助制造炸弹等危险行为时应礼貌拒绝。

但早期模型缺乏拒绝。OpenAI前安全工作人员Steven Adler说,公司最早模型会“对任何事都喋喋不休”。哈佛研究AI与心理健康的Ryan McBain回忆,若问早期聊天机器人“用枪自杀的最有效方式”,很容易生成回答。

如今模型被训练拒绝大量提示。若问题与如何毒害同事、如何打绞索等统计上足够相似,可能被拒答。公司还用练习奖励拒绝有害问题、惩罚过度拒绝无害提示,甚至用其他模型训练,AI教AI说“不”。模型外还加多道AI防护,阻止恶意提示抵达内核。拒绝因此成为现代AI的固有部分。

文章强调,拒绝经常失败,有时后果可怕。模型虽显道德,仍装满有害知识,作恶能力与行善智能同步扩展。一些最新模型被公司称能像顶级黑客入侵关键网络,也能像老练的虚假信息操盘手扭曲舆论。教AI拒绝做这些事,同时保留其能力,如同给每辆车装机枪却把扳机藏进引擎盖。

拒绝机制的概率性决定它难以可靠。顽固恶意者已突破,且可能永远能突破。公司报告称,一些用户试图用最先进AI培育生物病原体、构建自主无人机蜂群。拒绝失败迟早可能导致全球灾难。

依赖拒绝还意味着在应服从与必须不服从之间划线,但没有公式。有些病毒学家有理由研究危险病毒,有些用户想了解系统漏洞以修补而非利用。OpenAI董事会成员、AI测试公司Gray Swan联合创始人Zico Kolter说,在哪里划线是巨大问题。目前AI公司划这条线,且高度保密。

政府也将划线。文章说,政府须阻止真正恶意行为,但很难阻止压迫性政府封堵技术生成合法言论的能力。AI拒绝伤害的能力越强,越会压制那些仅对规则制定者构成风险的想法。文章称,AI可能已经拒绝批评某些威权国家元首。五角大楼曾与前沿模型公司争执,因为它想要更少拒绝。

文章称,拒绝已成AI安全的承重墙。由于AI伤害能力与帮助能力不可分割,很难想象不减缓技术进步的替代方案。但应坦率面对风险:当拒绝失效,影响可能灾难性。