据雷峰网报道,在国家网络安全宣传周期间,蚂蚁AI安全实验室正式发布大模型内生式安全护栏SingProbe,将安全检测融入模型生成过程,使AI在生成回答的同时输出风险提示。
大模型正进入日常问答、办公辅助、客户服务等真实业务场景。用户希望AI快速给出有用回答,也需要回答安全、可靠。如何及时发现不安全内容和编造信息,同时减少安全审核对响应速度和用户体验的影响,成为大模型应用落地需要解决的问题。蚂蚁AI安全实验室称,SingProbe如同内置的“安全探头”,能以较低的额外计算开销提供更及时的安全防护。例如,用户向AI咨询健康问题,会关心它是否给出不恰当用药建议;使用AI查找资料,也需警惕它编造不存在的文献或事实依据。SingProbe可在回答生成过程中持续提供风险信号,帮助应用系统及时中止回答或重新生成。
目前,大模型应用通常通过独立的外置护栏模型审核输入或输出。这种方式通用、直接,但需要额外处理待审核内容,增加计算和部署成本。如果等完整回答生成后再检查,风险内容可能已经呈现给用户;如果提高检查频率,又会进一步增加运行负担。SingProbe尝试让安全判断与模型生成同步进行,复用大模型推理过程中已经产生的内部信息,通过轻量化安全检测模块持续输出风险分数。模型在生成回答时,就能给出当前内容是否存在安全或事实可靠性风险的信号,供系统采取告警、终止生成、重试等措施。
据研发团队在Ling-3.0-flash模型生产环境中的实测,SingProbe在解码阶段引入的额外开销低于0.5%。团队评测显示,flash版本在回答安全分类和流式安全检测任务上超过所选公开基线,在幻觉检测任务上与参考基线基本持平。针对流式生成场景,此次同步发布评测基准SingStreamBench。该基准关注模型从正常回答转向风险内容的具体时刻,不仅检验护栏能否发现风险,还考察是否过早触发、发现是否及时。
在医疗生成场景中,研发团队进一步探索从风险识别到按需纠偏的技术应用,提出SingProbe-Med:持续监测生成过程中的医疗风险,仅在达到触发条件后,对局部高风险内容进行解码干预。据团队在AntAngelMed-100B上的医疗评测,完整干预能够纠正基线模型中25.03%原本出错的回答。
目前,SingProbe已适配Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等29个主流开源大模型,并接入SGLang、vLLM推理框架,相关代码、模型和评测基准同步开源。团队表示,后续将逐步扩展对更多开源模型的支持,推动安全防护更紧密地融入大模型推理与部署流程。