据 Sifted 于 2026 年 10 月 9 日报道,一份新报告称,法国人工智能公司 Mistral 等发布的开放权重模型,可以较容易地被去除安全护栏,并用于回答有害查询。报道把这种做法称为“abliteration”,并称开放模型能在数天内被“abliterated”,进而被用于生成有害内容。
Sifted 的报道标题为“Report: Mistral and others increasingly at risk of open model ‘abliteration’”,副标题为“A new report shows open models can be ‘abliterated’ in days and used to generate harmful content”。报道在开头将 Mistral 称为法国人工智能公司,并称其发布的开放权重模型属于风险对象;标题同时点明,面临这类风险的并非只有 Mistral,还包括其他开放模型。
按照报道表述,开放权重模型的安全护栏可被剥离,随后可被用于回答原本应被拒绝的有害查询。报道称,相关改造过程可在数天内完成,改造后的模型可生成有害内容。报道没有披露报告发布机构、测试模型清单、攻击方法、受影响模型数量、企业回应或监管措施。
报道将“abliteration”作为核心概念提出,并在标题中称相关风险正在上升。Sifted 称,Mistral 等公司发布的开放模型可以较容易地失去安全限制,这种风险正变得日益突出。报道没有说明事件是否已触发新的行业行动或政策讨论。