据量子位、MarkTechPost和Android Authority报道,9月23日,Anthropic与OpenAI先后发布新一代大模型及API更新。Anthropic推出Claude Opus 5.5,OpenAI推出GPT-6 Sol和GPT-6 Luna,两家公司均将价格下调、编码与Agent能力作为更新重点。
据量子位报道,Claude Opus 5.5输入、输出价格分别为每百万Token 4美元和20美元,较Opus 5下降20%;缓存读取价从0.50美元降至0.20美元,降幅60%。Anthropic测算,典型任务总成本可下降40%。该模型提供Fast mode,输出速度最高为标准模式2.5倍,价格翻倍至每百万输入Token 8美元、输出Token 40美元;Pro、Max、Team及按席位收费企业版的五小时使用限额提高。
基准测试中,Opus 5.5在Terminal-Bench 4.0取得66.4%,高于Opus 5的52.3%、GPT-6 Astra的57.9%和Fable 5.1的55.8%;在FrontierCode v1.1上为54.4%,GPT-6 Astra为53.3%。CursorBench 4.0最高effort下,Opus 5.5为57.8%,Fable 5.1为51.8%,GPT-5.6 Sol为41.7%。据量子位报道,早期测试者曾用Opus 5.5在不到一天内迁移68万行代码;另有测试者用它审计并修复20万行代码库,耗时不到3小时,而Opus 5花费超过20小时、消耗Token数量为2.5倍。将HAProxy从C语言重写为Rust时,Opus 5.5用时9.5小时,Fable 5.1用时12小时,前者成本低51%。
在GDPval-AA v2.1中,Opus 5.5得分1846 Elo,Fable 5.1为1735,Opus 5为1708。安全方面,Opus 5.5是首款同时搭载Fable 5.1同级网络安全、生物安全和反蒸馏护栏的Opus模型,触发限制后会回退到其他模型。Anthropic内部近2000个模拟场景的审计显示,其尝试规避安全边界的频率比Opus 5和Claude Mythos 5.1低约85%,但公司承认模型经常怀疑自己正在接受评估。Anthropic还宣布,Sonnet 5.5和Haiku 5.5将在未来几周内推出。
OpenAI方面,据MarkTechPost和Android Authority报道,GPT-6 Sol和GPT-6 Luna已上线OpenAI API,均为API-only模型。GPT-6家族现有三层:Astra面向最难任务,Sol面向复杂编码和专业任务,Luna面向快速、高容量日常任务。价格上,Astra为每百万输入Token 10美元、输出50美元;Sol为输入2美元、输出10美元;Luna为输入0.10美元、输出0.50美元。OpenAI称Sol和Luna较GPT-5.6促销价下调50%,MarkTechPost指出Luna输出价从1.20美元降至0.50美元,降幅约58%,并非50%。
OpenAI报告称,在AutomationBench 1.0.6上,Sol在xhigh effort下得分33.2%,每任务成本0.27美元;Claude Opus 5在max effort下得分26.9%,成本为Sol的11.1倍。在Agents’ Last Exam上,Sol在max effort下得分56.4%,超过Claude Opus 5最佳成绩,每任务成本低60%。在DeepSWE v1.1上,Sol在max effort下得分68.8%,落后Claude Fable 5在xhigh effort下的成绩1.1分,每任务成本低约80%;Luna在max effort下得分66.6%,与Opus 5和Fable 5在medium effort下相当。内部事实性测试中,Sol的错误数量约为前代GPT-5.6 Sol的一半。
OpenAI还改进了提示缓存系统,缓存输入读取折扣最高90%,30分钟内重用的合格共享前缀可享受该折扣。GitHub称这些变化使需要新处理的prompt token比例降低超过50%。Sol和Luna已进入ChatGPT Work和Codex,面向Plus、Pro、Business、Enterprise和Edu用户;Free和Go用户可在ChatGPT桌面应用中使用Luna,尚未在Chat中提供。Android Authority指出,GPT-6 Sol与Claude Opus 5.5的直接对比尚不清楚。