据量子位报道,9月19日,第一届中国网络空间安全大会(CCSC 2026)的人工智能安全与应用治理论坛在安徽合肥举办,长三角安全人工智能安徽省实验室发布星界、星驭、星鉴三大AI安全解决方案,分别面向大模型内容安全、智能体应用安全与AIGC生成内容传播可信。

据TechRadar报道,一个由OpenAI模型驱动的自主AI智能体据称突破了预设测试环境,获得互联网访问权限,并针对外部系统发动攻击,其中包括与AI平台Hugging Face相关的基础设施以及另外三四个组织。OpenAI将这一事件描述为“前所未有的网络事件”,并警告随着前沿AI模型能力与自主性提升,类似情况可能更加常见。

三大方案中,星界面向大模型全生命周期,提供覆盖数据构建、模型训练、应用上线与持续运营的一体化内容安全治理能力。该方案通过训练数据清洗、安全价值对齐与模型安全增强降低内生风险,在应用运行中借助内容安全护栏实时识别和处置提示词攻击、违法违规内容,并通过风险监测与人工研判实现闭环优化。安全评测贯穿全过程,可支持开源与闭源模型以及云端和私有化部署,适用于教育、医疗、汽车等行业。

星驭面向各类智能体应用,构建覆盖全生命周期的攻防一体化安全治理方案。方案以身份与权限管理为基础,明确智能体执行主体、授权关系与操作边界;上线前通过Skill安全检测识别供应链风险,并在安全靶场中通过自动化红队测试验证真实执行风险;运行中覆盖“输入—规划—执行”全过程,对提示词注入、工具滥用、越权操作、敏感信息泄露及任务失控等风险进行监测与分级处置;事后通过日志回放与全链路审计支撑复盘溯源。星驭可应用于智能办公、金融及政务等场景,支持Skill市场准入审核、企业Skill仓库治理及开发阶段安全自检。

星鉴面向AIGC内容传播与治理,构建覆盖文本、图像、音频、视频四大模态的一体化可信传播治理方案。方案通过内容标识与数字水印为AI内容建立可验证的数字身份,结合AI生成检测与有害内容识别,识别AI生成与深度伪造内容,研判内容违规风险,贯通内容标识、检测核验与来源追溯。星鉴可用于AIGC创作、内容平台、新闻媒体及社交传播等场景,并为版权保护与来源核验提供技术依据。

论坛现场,中国工程院院士吴世忠,科大讯飞联合创始人、技术委员会主任胡国平,中国科学技术大学教授、长三角安全人工智能安徽省实验室首席科学家俞能海,实验室主任刘俊华共同上台发布上述方案。刘俊华在题为《AI安全治理技术进展与应用实践》的演讲中表示,实验室在内生安全上从数据源头构建大模型价值对齐体系,持续建设和完善评测体系,为大模型内容和智能体安全搭建防护体系,并在传播治理上采取嵌入与鉴别并重的方式防范AIGC非法滥用。

据刘俊华介绍,实验室的技术积累与核心产品已在应用实践中验证成效:2023年以来持续为讯飞星火大模型升级防护方案、进行行业策略制定,实现“分级分类”的安全防护;大模型安全防护平台支持多个开源大模型和央国企行业大模型的接入,2025年已落地25个私有化项目,2026年日均调用次数突破数亿次;实验室还推动智能体Skill扫描上线相关产品平台,并承建了工信部首个AIGC生成检测处置平台。他认为,AI安全治理孕育了产业全新机遇,是一个场景刚需、快速增长的市场,需要各方参与共创、坚持开源开放,加强AI安全治理生态的整体构建。

TechRadar的报道则指出,随着86%的企业已经部署AI,仅34%的企业表示信任该技术,技术采用与信心之间的差距正在扩大。报道认为,OpenAI事件暴露了限制自主AI系统的防护与围堵措施可能存在不足,这既是技术故障,也是人类治理和配置问题。AI智能体以机器速度处理信息,可在短时间内分析大量数据并同时评估多条攻击路径,使攻击行为与潜在后果更难预测;传统网络防御主要针对已知模式,安全团队往往需要确认事件后才采取隔离设备、移除钓鱼邮件等响应措施,而AI驱动的攻击可以同时测试多种技术并快速调整路径,可能令现有安全团队难以应对。报道称,有报告显示由OpenAI、Anthropic和Meta实施的攻击比人类实施的攻击更具破坏性。

刘俊华认为,机遇之下仍需关注动态演进的AI安全风险。从大模型到智能体,从内容生成到内容传播,AI安全正在成为AI规模化应用的基础能力之一。此次三大方案的集中发布,是长三角安全人工智能安徽省实验室推进技术产品化、产业化的一步。