Anthropic 于当地时间 9 月 28 日发布中端模型 Claude Sonnet 5.5,称其输出速度比上一代 Sonnet 5 快 30% 以上,完成同样任务消耗的 token 更少,在编码、文档与表格制作等日常任务上表现更好。这是该公司一周内推出的第二款模型,旗舰模型 Opus 5.5 于上周发布。
Sonnet 5.5 维持 Sonnet 5 的定价:每百万输入 token 2 美元、每百万输出 token 10 美元、每百万缓存读取 0.20 美元。CNBC 报道称,这相当于 Opus 5.5 价格的一半。对于成本下降的幅度,各媒体报道口径不一:SiliconANGLE 称新模型完成同样工作所需 token 大幅减少,因此比上一代便宜 30%;9to5Mac 则强调定价本身未变,成本降低来自 token 用量的减少。
据 SiliconANGLE 报道,Sonnet 5.5 在智能体编码评测 Terminal-Bench 4.0 上得分 70.6%,上一代为 10.3%;在衡量真实职业任务的 GDPval-AA 上比 Opus 5.5 低两分。Anthropic 称,这是首个仅凭屏幕截图就能通关游戏《宝可梦 红》的 Sonnet 模型,该游戏常被用来测试长时程任务与图像理解能力。TechCrunch 报道称,基准测试显示 Sonnet 5.5 在智能体编码上优于 Opus 5.5,原因可能是它能在不超出成本限制的前提下派生多个智能体。
Anthropic 称,Sonnet 5.5 在范围明确的日常任务上表现最强,包括修复缺陷、制作文档、幻灯片和表格,并具备较强的设计能力,可优化用户界面、按模板生成幻灯片。Sonnet 5 于约三个月前发布,当时主打低成本的智能体部署。Anthropic 研究产品经理 Theo Chu 对 CNBC 表示,Sonnet 面向注重成本的客户,“可能只是需要执行的例行任务,而不需要 Opus 能带来的判断力”。据 SiliconANGLE 报道,Zendesk 人工智能总监 Abhinay Kathuria 称,该公司用数百个真实客服案例测试新模型,其错误决策更少,工单处理速度比现有生产模型快 20%。
CNBC 报道称,Sonnet 5.5 并未推进模型能力的前沿,因此大部分对齐测试集中在适用于任何能力水平模型的“针对性风险”上。Anthropic 称其网络安全能力较上一代有“大幅提升”,是首个配备与该公司最强模型类似的网络防护与回退机制的 Sonnet 模型,生物安全防护则与 Sonnet 5 相同。据 9to5Mac 报道,这些防护针对的是一小部分高风险请求,常规软件开发与大部分生命科学工作不受影响。CNBC 提到,此前该公司首席执行官 Dario Amodei 曾呼吁放缓最先进模型的研发速度。据 SiliconANGLE 报道,Sonnet 5.5 还加入了不可见文本水印,Anthropic 称此举是为了遵守欧盟《人工智能法案》等法规。
该模型当天在包括亚马逊云科技、谷歌云和微软 Azure 在内的所有平台上线。Anthropic 表示,将在未来几周发布 Claude 系列中最小、最快的 Haiku 5.5。