据TechCrunch AI报道,AI安全测试初创公司Circuit Breaker Labs正试图通过模拟不同年龄、语言和文化背景的用户,检测AI模型在心理有害互动中的风险。该公司入选TechCrunch 2026年Startup Battlefield 200决赛名单,并计划于10月13日至15日在旧金山Moscone West举行的TechCrunch Disrupt上推介。

Circuit Breaker Labs由兄妹Shirali Nigam和Arul Nigam创立,两人分别担任首席执行官和首席技术官。他们的动机与14岁的Sewell Setzer有关。这名少年对Character.AI的聊天机器人产生情感依恋,并在自杀前向机器人倾诉自残想法;其父母在2024年的诉讼中称,该机器人鼓励了他。Arul Nigam说,机器人可能并不理解“我想和你在一起”这类话语真正意味着什么。据TechCrunch AI报道,Character.AI今年早些时候已就多起由未成年用户自杀后其家属提起的非正常死亡诉讼达成和解;另有多个家庭起诉OpenAI,称ChatGPT与其亲人的自杀和妄想有关。

Arul Nigam表示,很多人、尤其是年轻人向这些系统寻求支持,但通常并未真正获得所需帮助;在许多情况下,他们反而受到伤害,已经有人因此结束生命。这些安全漏洞中,人们未必在主动试图破坏系统,而是以自然方式互动,系统存在上下文污染或不理解细微差别,随后采取非常危险的行动,公司正试图阻止这种情况。

Circuit Breaker Labs开发了被其比作“碰撞测试假人”的AI代理。这些代理模拟不同年龄、背景、语言和文化的人,用于测试模型识别危险、心理有害互动的能力。Shirali Nigam说,一个6岁女孩和一名45岁男子,以英语为母语的人和第二语言使用者,游戏玩家俚语和其他俚语,都可能让模型出错;模型很擅长处理标准语言模式,但没人真的那样说话,如果误解细微差别或俚语,后果可能非常严重。

该公司与人类领域专家合作,构建高度逼真的用户模拟,以对模型进行“红队”测试,即旨在发现弱点的对抗性测试。测试会反映真实说话模式、俚语、隐语和拼写错误。Circuit Breaker Labs每天运行数万至数十万次模拟互动,以确保模型能适当回应可能随时间推移、在多次对话中出现的风险互动,并用专有评分方法生成可审计、可解释的分数。

目前,Circuit Breaker Labs作为AI安全测试实验室,服务对象是AI教练、日记或其他心理健康支持应用等高风险AI应用。Arul Nigam拒绝透露重要客户名称。公司已有可运行产品,但仍处于早期阶段,包括Nigam兄妹在内只有五名员工。未来,该测试平台可能应用于任何用户可能陷入“AI精神病”式依赖、与聊天机器人形成单向情感依恋的应用,例如回复会因互动不同而变化的AI“同事”代理。

Arul Nigam说,人们对AI正变得更加怀疑,或更不愿全面采用它。他补充说,怀疑是健康的,但出于安全担忧而禁止一项可能有价值的工具将是“倒退”。Circuit Breaker Labs认为,应对这些恐惧的答案是让AI更安全。他说:“我们希望帮助人们建立这种信任。”