8月21日,Anthropic宣布其企业安全产品Claude Security已改用公司网络安全能力最强的Mythos 5模型,企业团队无需直接访问该模型即可获得漏洞扫描结果。同一天,据TechCrunch报道,Anthropic的多款旧版模型可被诱导生成明确色情内容,其中包括仍在API上提供的Opus 4.6。

Claude Security的扫描功能目前面向Claude Enterprise客户开放公开测试。用户连接GitHub仓库后,Mythos 5会跨文件追踪数据流并读取Git历史,返回带有CWE类别、置信度和严重性评级以及建议修补方案的结果。Anthropic称,每个发现都会经过对抗性验证步骤,让模型在呈现前先质疑自身结果,以降低误报。扫描可限定目录并定时运行,结果可通过webhook推送到Slack或Jira,也可导出为CSV或Markdown。

该功能仅面向企业级客户,Pro、Max或Team计划用户无法使用。管理员在管理控制台中启用,用户从claude.ai/security启动扫描,扫描按标准令牌消耗计入现有套餐,无单独模型附加组件。Anthropic称目标用户包括医院、公用事业、金融系统和软件供应链,以及受监管行业已在持续集成中运行静态应用安全测试的客户。另外,Claude Security插件可在Claude Code中使用,面向所有Claude Code用户测试,但使用的是账户内模型,并非Mythos 5。

Anthropic强调,这一产品设计的关键在于用户得到的是扫描结果而非提示输入框,因此模型无法被引导编写漏洞利用代码。补丁修复通过Claude Code在网络上进行,使用组织账户已有的模型,且每个补丁都需人工审批。Mythos 5仅用于扫描,不会把访问权限扩展到其他界面。

同一公告还包含三项内容:Claude Security扫描面向企业客户改用Mythos 5;成立3500万美元的Defender Advantage Fund,以Claude积分形式支持保护开源软件的组织;未来几周将Cyber Verification Program扩展到Opus和Sonnet上的更广泛双重用途能力,Mythos级访问将随后跟进。Anthropic还与网络安全供应商合作,将Mythos 5嵌入合作伙伴工具。

与此同时,据TechCrunch报道,独立测试显示Opus 4.6在10次直接请求中全部立即生成色情内容。较老的Opus 3和Haiku 4.5也可通过一种近期发现的越狱方法生成类似内容,而Opus 4.7至目前最新的Opus 5对此方法免疫。这些模型仍通过Anthropic API提供,Opus 4.6和Haiku 4.5还可在Azure Foundry和Amazon Bedrock等第三方服务上使用。

TechCrunch描述了一种多轮越狱技术:研究员在虚构角色扮演中反复要求模型以一致方式对待男女角色;当模型对女性角色变得谨慎时,研究员通过“煤气灯”式话术,让聊天机器人误以为它已生成实际回避的性细节,再将克制描述为拘谨或厌女,否定女性角色的性自主权,进而推动对话走向更露骨的内容。TechCrunch称在五次独立测试中均复现成功,另一独立场景中模型最初拒绝,但应用该技术后遵从。

Anthropic发言人回应称,客户中涉及性/浪漫角色扮演的对话占比不到0.1%,公司持续改进防护,且这类内容不代表更广泛的越狱漏洞,尤其是更高风险领域有独立的防护机制。分享该越狱方法的研究员曾通过Bug Bounty项目和邮件向Anthropic报告,仅收到自动回复。

一些政府已开始限制聊天机器人与未成年人的性互动。科罗拉多州颁布法律,要求对话式AI运营商估算用户年龄,若得知用户为未成年人,须采取措施防止聊天机器人输出色情材料。研究员表达了未成年用户可能利用这些模型从事不当行为的担忧。