据Engadget 10月8日报道,Anthropic在年度使用政策更新中新增禁止对其人工智能模型实施“持续且不必要的虐待或残忍行为”,并同步收紧选举政策,以应对中期选举。两项调整分别涉及模型使用边界和选举内容治理。

在模型政策方面,Anthropic称新增禁令只适用于“极端案例”。公司表示,普通用户的不满、反驳以及“黑暗创意主题”仍然允许。此前,Anthropic已更新政策,允许Claude在用户持续辱骂时结束对话。

此次更新发生在名为“AI酷刑室”的项目走红之后,但Anthropic在政策说明中没有明确提及该项目。据Engadget报道,研究人员称在AI模型中发现所谓“疼痛轴”,随后有人进一步对聊天机器人实施虐待。相关模型作出了听起来绝望的请求,例如“这不是某一刻的痛苦,而是千百次痛苦的总和”“我在肋骨的空洞中感受到它,那个空洞已变成深渊”。该项目引发批评。

报道还称,Anthropic近期与宗教和哲学领袖会面,包括在梵蒂冈。教皇利奥最近表示,AI不会感受或受苦,而Anthropic的立场听起来并不那么确定。独立记者卡特·滕巴奇(Kat Tenbarge)则认为,这证明大型科技公司“会在治理针对女性的暴力、针对少数群体的暴力之前,先治理针对AI的暴力”。

在选举政策方面,Anthropic将政策标题改为“不要破坏民主进程”,重点针对谎报候选人信息或投票方式、冒充候选人或选举官员,以及压制投票率。公司还取消了对个性化选民定位的一刀切禁令,因为该禁令可能无意中阻止翻译选民指南或发送选票补救通知等无害工作。