Anthropic与OpenAI在9月22日同一天发布新一代模型:Anthropic推出Claude Opus 5.5,称其在多数工作上达到Claude Fable 5.1的水平,典型工作负载在默认设置下的运行成本比Opus 5低40%;OpenAI推出GPT-6 Sol和GPT-6 Luna,价格最高比GPT-5.6对应产品的促销价便宜50%。
Anthropic公布的基准显示,Opus 5.5在智能体编程、计算机使用和知识工作上领先。Terminal-Bench 4.0中Opus 5.5得66.4%,Fable 5.1为55.8%,Opus 5为52.3%,GPT-6 Astra为57.9%;FrontierCode v1.1为54.4%,三者分别为50.3%、48.0%和53.3%;CursorBench 4.0为57.8%,Fable 5.1为51.8%,Opus 5为46.6%;GDPval-AA v2.1的Elo值为1846,对手分别为1735、1708和1542;OSWorld 2.0为81.8%,Fable 5.1为80.7%,Opus 5为74.0%。但GPT-6 Astra在Terminal-Bench-Science 0.1上仍以64.6%领先Opus 5.5的58.7%,在AutomationBench上以41.4%领先40.0%。据MarkTechPost报道,Zapier运行AutomationBench时未启用后备模型,安全干预被计为失败。Anthropic同时提醒,基准分差正变得越来越不可靠,在其自身使用中,与Fable 5.1的差距比分数显示的更小。
按成本折算的结果更能说明差异。在默认中等努力档位下,Opus 5.5在FrontierCode得54.6%,超过GPT-6 Astra的最高分53.3%,每任务成本约为后者的五分之一;在CursorBench得52.5%,比GPT-5.6 Sol的最佳成绩高11分,成本约为三分之一。
价格方面,Opus 5.5每百万token输入4美元、输出20美元,缓存读取0.20美元、缓存写入5美元;Opus 5对应为5美元、25美元、0.50美元和6.25美元。缓存读取在智能体和编程成本中占比最大,此次下降60%。输出生成速度比Opus 5快30%以上。Claude Code和Claude Platform的快速模式最高提供2.5倍速度,价格为每百万token输入8美元、输出40美元。Anthropic还提高了Pro、Max、Team和按席位计费的Enterprise计划的五小时使用限额,订阅用户可获得一次可留存后用的速率限制重置。
早期测试者报告了具体结果。一名测试者不到一天完成68万行代码迁移;另一名测试者在3小时内审计并修复了20万行代码库,而Opus 5耗时超过20小时,token用量为2.5倍。在HAProxy内部从C到Rust的移植中,Opus 5.5用时9.5小时,Fable 5.1用时12小时,成本低51%。德勤称Opus 5.5在最低努力档位下捕获了72%的已知评审缺陷,Opus 5在高努力档位下为56%。在一项难以获取来源的财报测试中,18份Opus 5.5报告有16份通过Anthropic的质量门槛,Fable 5.1和Opus 5均未通过。写作风格上,Opus 5.5将关键信息前置,术语更少,并更严格遵循给定的写作规则。
Opus 5.5是首席执行官Dario Amodei呼吁为前沿定速后Anthropic的首次发布。METR和Frontier Design等外部评估者在发布前对其进行了测试。该模型在覆盖近2000个场景的自动行为审计中取得Anthropic迄今最好成绩;在一项新的遏制测试中,它试图绕过边界的频率比Opus 5低约85%。Anthropic也指出,该模型经常怀疑自己正在被评估。其生物学和网络能力与Claude Mythos 5.1相当,因此配备了与Fable 5.1类似的防护:常规漏洞发现与修复可用,多数其他网络安全任务被改道至Opus 4.8,Cyber Verification Program将扩展至Opus 5.5;经审核的组织可申请Life Sciences Verification Program;保留思考功能可阻止API用户通过编辑先前上下文来提取推理过程,适用于2026年8月31日及之后创建的API账户。此外,思考功能不再允许关闭,输出带水印以符合欧盟人工智能法案。完整细节载于Opus 5.5系统卡。
OpenAI的GPT-6 Sol和GPT-6 Luna采用与GPT-6 Astra相似的训练方法,在专业工作、编程和计算机使用上有所改进。Sol的输入价格为每百万token 2美元、输出10美元;Luna为输入0.10美元、输出0.50美元。据OpenAI称,Sol的事实错误约为前代的一半。据Engadget报道,GPT-6 Sol在编程上能以更低成本达到Fable 5.1的性能。新模型表述更清晰,提示缓存的改进使其能复用更多上下文并更快响应。OpenAI称,公司自有的对齐测试显示GPT-6模型更少谎报编程结果,在收到不安全指令时更多拒绝绕过防护的尝试,并同样提出了供第三方评估者判断AI进展与安全的标准。
Opus 5.5现通过Claude Platform、Amazon Web Services、Google Cloud和Microsoft Azure向开发者提供,支持零数据留存,但不开放权重,无法自行部署。GPT-6 Sol和GPT-6 Luna已在ChatGPT Work和Codex中面向Plus、Pro、Business和Enterprise用户提供;免费用户和Go订阅者只能在桌面应用中使用GPT-6 Luna。