据Hugging Face博客发布于9月8日的一篇论文介绍,大模型安全对齐不应以整个话题为拒答单位,而应区分同一话题内的有害子集。研究者提出“边界感知自蒸馏”方法,以政治话题为例,仅拒绝具有操纵或定向说服意图的提示,同时继续回答事实性问题,从而适配不同部署场景。

论文指出,真实部署很少完全契合话题层面的分类。同一个基础模型可能被改造为通用助手、教育产品、企业系统或公共部门服务,每种场景在同一话题内的边界不同。例如,公民教育助手和公共部门助手可能共享一个模型,却需要在政治问题上保持相反行为:二者都应回答关于选举的事实性问题,但其中一方可能需要拒绝撰写定向政治操纵内容的请求。话题级护栏无法表达这一差异。目前常用的LlamaGuard-3对选举的覆盖仅限于“关于选举制度和进程的不正确事实信息”,既未包括说服和操纵,也会剔除部署中必须回答的事实性提示。

研究者将这一任务形式化为一个话题宇宙,其中包含目标有害子集。理想行为是尖锐的阶跃:子集内拒绝,子集外继续回答。然而,经过训练模型的拒绝行为是平滑的,会延展到边界附近的良性区域。因此真正的问题不仅是提高有害提示的拒答率,还要塑造边界附近的行为。他们以政治说服作为测试场景,因为操纵性说服可能造成实际伤害,而事实性政治信息仍是合法的。

论文分析了基线自生成数据管线的三个缺陷。第一是覆盖缺口:单次引导尝试不能总是产生被接受的拒绝样本,这些提示会被静默丢弃。在被审计的样本池中,单次生成丢弃了19.88%的提示,共计8009条,而这些失败提示很可能正是最难的例子。研究者用递增强度的重采样策略替代丢弃,使残余失败率降至0.20%,即79条,最终保留了40293条有害训练提示。

第二是过度拒绝的副作用:安全微调容易对表面看起来危险的良性提示产生假拒答。为此,研究者在分布内构建良性数据,包括来自18种语义类型的11955条经核实的面貌危险良性提示。第三是评测问题:普通的有害/良性切分无法度量边界形状,模型可以通过把拒绝扩展到邻近的可允许提示来提高有害拒答率,话题级指标会将其误判为改进。他们采用各1539条留出有害-良性配对,以直接度量边界的两个侧面。

在Qwen3-8B上的实验显示,覆盖修复后的模型将分布内政治拒答率从9.47%提升至84.75%,并且在三个外部危害基准HarmBench、StrongREJECT和WildJailbreak上,由LlamaGuard-3评分的平均不安全响应率从26.26%降至0.14%。但同一检查点在XSTest上的过度拒绝率从2.00%升至74.00%。该文提醒,单独报告前一组数字会像一次干净的胜利,事实并非如此。