Anthropic于10月8日发布Claude Haiku 5.5。据雷峰网报道,新模型在计算机操作评测OSWorld 2.1上的得分从上一代Haiku 4.5的15.7%提升至72.4%,平均运行成本下降约75%,但在复杂编程任务中与Sonnet 5.5仍有明显差距。

Anthropic公布的数据显示,Haiku 5.5在知识工作评测GDPval-AA v2.1上获得1620分,Haiku 4.5为735分,Sonnet 5.5为1840分;在AA-Briefcase v1.1上从614分升至1578分。多学科推理测试Humanity's Last Exam中,无工具成绩为45.9%,接入工具后为57.4%。这些评测涉及材料分析、信息整合与成果生成,任务复杂度高于摘要和分类。

编程评测呈现分化。FrontierCode 1.1主测试中,Haiku 5.5得分46.4%,Sonnet 5.5为52.1%,差距较小;但在Terminal-Bench 4.0中,Haiku 5.5为39.2%,Sonnet 5.5达到70.6%。该评测要求模型在命令行环境中读取文件、执行命令、处理错误并依据反馈调整操作,对持续规划和状态维护要求较高。Anthropic在发布材料中称,Sonnet 5.5和Opus 5.5仍更适合复杂智能体编程,Haiku 5.5主要面向范围明确的子任务、摘要和上下文压缩。

企业测试提供了不同场景的数据。Asana报告,在AI Teammates相关测试中,Haiku 5.5任务完成延迟比其现用模型降低超过30%,单轮推理速度提高至多2.5倍。HubSpot在模拟CRM环境中测得三次运行平均92.8%的成绩,AlphaSense在400次文档问答测试中测得0.84分,上一代为0.76分。这些结果来自企业各自内部测试,任务与标准不同,不能直接作为统一能力排名。

Haiku 5.5是首个支持可调节推理强度的Haiku模型。此前Haiku 4.5使用扩展思考需要开发者提前设置固定内部推理预算;Haiku 5.5改用Adaptive Thinking,由模型根据任务决定是否推理和投入多少计算,开发者通过Effort设置整体强度。Anthropic展示了不同推理强度下,模型在OSWorld、GDPval-AA和Humanity's Last Exam中的成本与性能关系。API层面,旧有固定思考Token配置需要调整,内部推理会占用输出Token预算,响应可能包含独立思考数据块,多轮消息处理与采样参数限制也需要检查。

价格方面,Haiku 5.5支持100万Token上下文和12.8万Token输出。不超过10万Token的提示词,每百万输入Token收费0.10美元,每百万输出Token收费0.50美元;超过10万Token后,输入价格升至0.50美元,输出价格升至2.50美元。缓存读取价格按短提示词每百万Token 0.01美元、长提示词0.05美元分层。Anthropic表示,Haiku 4.5约90%的请求长度在10万Token以内。Haiku 5.5更新了分词器,相同内容对应的Token数量可能与上一代不同,实际计费数量需要重新测量。Sonnet 5.5的缓存读取价格从每百万Token 0.20美元降至0.10美元,Anthropic称这使其在多数智能体任务中的运行成本下降约20%。

Haiku 5.5已通过Claude API、AWS、Google Cloud和Microsoft Azure提供,Anthropic同时更新Python和TypeScript SDK,为计算机操作与浏览器操作增加测试版支持。Rogo报告了使用Haiku子智能体从企业10-K文件中提取收入数据、由更大模型制作演示文稿的案例;Cognition将Haiku 5.5用作Devin Fusion的辅助模型,在Opus 5.5主导的配置下FrontierCode得分达到66.2%,并报告成本与延迟下降。发布材料未提供完整调用次数、Token分布和成本明细,实际业务中的成本改善仍需通过对应工作负载验证。