据爱范儿报道,2026年9月23日,OpenAI 与 Anthropic 先后发布新一代主力模型。OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna,API 价格降至上一代约一半;Anthropic 发布 Claude 5.5 家族首款 Claude Opus 5.5,称多数任务达到 Fable 5.1 水平,典型任务成本比 Opus 5 降低 40%,输出速度提高超过 30%。两家公司把竞争焦点进一步推向单位任务成本。

OpenAI 的定价最受关注。Luna 每百万 Token 输入 0.1 美元、输出 0.5 美元。DeepSeek V4.1 Flash 闲时缓存未命中输入为每百万 Token 1 元、输出 4 元,高峰时段升至 2 元和 8 元。按普通新请求计算,Luna 已更便宜,也没有峰谷定价带来的成本波动。DeepSeek 仍保有缓存命中输入每百万 Token 0.02 元的低价,V4.1 Flash 支持 100 万 Token 上下文及图文理解、工具调用和思考模式。OpenAI 将降价归因于推理基础设施和缓存效率改善。CEO Sam Altman 称,真正重要的指标是完成一项任务要花多少钱。

在基准测试中,GPT-6 Sol 的竞争力集中在专业工作和 Agent 任务。AutomationBench 中,Sol 以 xhigh 推理强度取得 33.2%,高于 Claude Opus 5 最大推理强度的 26.9%,单项任务成本只有后者的 9%。DeepSWE v1.1 中,Sol 最大推理强度得分 68.8%,距 Claude Fable 5 的 69.9% 只差 1.1 个百分点,成本约低 80%,DeepSeek V4.1 Flash 得分为 74.2%。Luna 得 66.6%,任务成本分别比 Claude Opus 5 和 Fable 5 中等推理强度低 93% 和 96%。OpenAI 称,Sol 事实错误数量约为 GPT-5.6 Sol 的一半;Luna 以约 1% 的成本追平 GPT-5.6 Sol。GPT-6 Sol 和 Luna 即日起登陆 ChatGPT Work 与 Codex,API 用户可通过 gpt-6-sol 和 gpt-6-luna 调用。

Anthropic 的 Claude Opus 5.5 把升级重点放在长时间编程 Agent 和知识工作。在 Terminal-Bench 4.0 中,Opus 5.5 得分为 66.4%,高于 GPT-6 Astra 的 57.9% 和 Opus 5 的 52.3%;OSWorld 2.0 从 74.0% 提高到 81.8%,但 AutomationBench 中得到 40.0%,略低于 GPT-6 Astra 的 41.4%。长任务测试中,早期测试者用 Opus 5.5 在一天内完成涉及 68 万行代码的迁移;另一项 20 万行代码库审计不到三小时,而 Opus 5 完成同类任务超过 20 小时,token 消耗约为前者的 2.5 倍。Opus 5.5 与 Fable 5.1 把 HAProxy 从 C 语言重写为 Rust,前者用时 9.5 小时,后者用时 12 小时,前者成本低 51%。

价格方面,Opus 5.5 的 API 输入和输出价格分别为每百万 token 4 美元和 20 美元,比 Opus 5 低 20%;缓存读取价格从 0.50 美元降至 0.20 美元,降幅 60%。它提供最高 2.5 倍速度的 Fast mode,支持 100 万 token 上下文和 12.8 万 token 最大输出。Opus 5.5 已上线 Claude、Claude Code 和 Claude Platform,同时登陆 AWS、Google Cloud 与 Microsoft Azure,并成为 Claude 付费计划的默认模型。Anthropic 将 Pro、Max 和 Team 计划的五小时使用限额提高 20%,更低价格还会让同一额度下的可用时长增加约 25%。安全方面,Opus 5.5 是 Anthropic 提出放慢前沿竞赛节奏后发布的第一款模型,发布前 Frontier Design 和 METR 等外部机构参与评估,官方称其尝试突破限制边界的频率较 Opus 5 和 Claude Mythos 5.1 低约 85%,但承认现有评估仍无法覆盖真实部署中的所有风险。