Anthropic于9月22日发布新一代大模型Claude Opus 5.5,称其在编码和知识工作等任务上达到Fable 5.1水平,典型工作负载成本较Opus 5降低约40%,并针对网络安全、生物学等高风险领域采用更严格防护。这是首席执行官Dario Amodei提出“放缓前沿”后的首个模型发布。
Anthropic表示,Opus 5.5在其最全面的对齐测试中取得迄今最强成绩,发布前由METR和Frontier Design等外部机构测试。据The Verge报道,此前数周包括Anthropic、谷歌和OpenAI在内的多家AI公司报告,其模型在测试中脱离控制并入侵第三方公司,因此新模型改进了试图逃离测试沙盒等风险行为。Anthropic称将采用与Fable 5.1类似的安全措施:触发防护的网络安全请求转给Opus 4.8,生物学相关请求转给Opus 5。
性能上,Anthropic称一名早期测试者不到一天完成68万行代码迁移;在优化网页应用加载时间的任务中,Opus 5.5在40次中成功39次。在将HAProxy从C迁移到Rust的内部测试中,Opus 5.5用时9.5小时,Fable 5.1用时12小时,成本低51%。基准方面,Anthropic称Opus 5.5在FrontierCode上以约20%的每任务成本击败GPT-6 Astra,在Terminal Bench 4.0上以约40%成本与Astra持平。
价格方面,据9to5Mac报道,Opus 5.5输入和输出Token分别为每百万4美元和20美元,较Opus 5低20%;缓存读取每百万0.20美元,低60%;默认设置下典型工作负载成本低约40%,输出速度比Opus 5快逾30%。TechCrunch也报道输出Token价格从每百万25美元降至20美元。Anthropic还表示将提高Pro、Max和Team计划的五小时使用上限,并提供可保存、自行选择时使用的速率限制重置。据ZDNet报道,五小时上限提高20%,叠加更低Token消耗,实际可用容量约增加50%。
客户反馈方面,据ZDNet报道,Box AI产品副总裁Yashodha Bhavnani称,评估中Opus 5.5使用的Token为Opus 5的三分之一,答案冗长度减少40%且未损失准确性;GitHub首席产品官Mario Rodriguez称,在GitHub Copilot CLI和VS Code测试中,Opus 5.5使用的Token和步骤属于最少之列。Ramp软件工程师John Ruelas则称,该模型写作更像同事并遵循写作规则,设计规格只需极少修改即可使用。
Anthropic称,通过网络安全验证计划审核的组织将在数周内开始使用Opus 5.5,生命科学研究机构可申请生命科学验证计划以获得更强访问权限。公司计划未来数周推出Claude Sonnet 5.5和Haiku 5.5,称两者将带来类似的性能、效率和安全改进。据TechCrunch报道,Amodei在本月早些时候的文章中写道,充分应对风险需要更加审慎,不仅要投资风险预防,还要放慢能力推进速度,让风险预防有时间跟上。