据 MarkTechPost 10月4日报道,Anthropic、OpenAI 和 Google DeepMind 在30天内相继推出四款前沿模型。Claude Fable 5.1 于9月1日发布,GPT-6 Astra 于9月3日发布,GPT-6.1 Sol 和 Gemini 4 Argon 在9月最后几天落地。基准分数多有重叠,但价格、访问规则和每任务成本差异明显。

OpenAI 于9月28日取消 GPT-6.1 Astra,因其未通过内部范围和授权测试;GPT-6 Astra 仍是 OpenAI 当前顶级模型。Astra 与 Fable 5.1 标价为每百万 token 输入10美元、输出50美元,Sol 和 Argon 为五分之一,Argon 为介绍价,之后翻倍。Astra 可通过 OpenAI API、ChatGPT 和 Codex 使用,Sol 可通过 OpenAI API、ChatGPT Work 和 Codex 使用,Argon 仅限 Fairwind Program,Fable 5.1 进入 Claude API、Bedrock、Google Cloud 和 Microsoft Foundry。缓存输入价格方面,Astra 为每百万 token 1美元,Fable 5.1 为0.25美元,Sol 和 Argon 介绍价均为0.10美元。Astra 超过272K长提示后为输入20美元、输出75美元,Sol 为输入翻倍、输出1.5倍,Argon 未披露,Fable 5.1 在最高1M范围内保持平坦。Astra 和 Sol 上下文窗口为1.05M,Fable 5.1 为1M,Argon 未披露;Argon 最大输出为1M,其余三款为128K。四款均未开放权重。

基准测试没有单一模型全面领先。据 Google DeepMind 发布的对比,Argon 在知识工作与长期编码上领先,Astra 在前沿软件工程和计算机使用上领先,未入阵容的 Opus 5.5 领跑 Terminal-Bench 4.0。DeepSWE v1.1 上,Argon、Astra、Fable 5.1 分别为77.9%、74.1%、67.4%;FrontierSWE v2 上为55.0%、65.5%、56.3%;Terminal-Bench 4.0 上为57.4%、58.2%、57.9%;OSWorld-2.0 上 Astra 为72.6%,Argon 为69.2%。GPT-6.1 Sol 不在 Google 表格中,OpenAI 称其在 DeepSWE v1.1 上与 Astra 匹敌,成本约五分之一;在 OSWorld 2.0 离线集上与 Astra 相差2.1分,每任务成本约七分之一;在 Terminal-Bench Science 0.1 上 Astra 以68.1%领先。OpenAI 推荐 Astra 用于最难研究。

独立信号给出不同侧重。Artificial Analysis 的 Intelligence Index 中,Astra 得61分,Fable 5.1 高5分;其编码智能体指数中,Fable 5.1 在 Claude Code 得70分,Astra 为67分;Argon 在 Intelligence Index 上与 Astra 持平。ARC-AGI-2 上,Astra 为95%,Fable 5.1 为90%。

每任务成本继续分化。Artificial Analysis 称,Fable 5.1 每任务9.18美元,Astra 为4.72美元,在标价相同时相差约1.9倍,差距来自 token 数量;Anthropic 指出其较新分词器对相同文本生成约30%更多 token。Artificial Analysis 报告,Argon 使用介绍价时以 Astra 每任务成本的60%达到相同 Intelligence Index;OpenAI 报告,在 Terminal-Bench Science 上 Sol 每任务5.47美元,Astra 为23.80美元。缓存可反转智能体排名:在200K token 缓存上下文、未计输出 token 时,Astra 每步0.20美元、100步20美元,Fable 5.1 每步0.05美元、100步5美元,Sol 和 Argon 介绍价均为每步0.02美元、100步2美元。Astra 的200K上下文低于其272K长提示阈值,缓存密集循环中 Fable 5.1 读取上下文的费率为 Astra 的四分之一。MarkTechPost 建议用户先在自己的轨迹上测量,再依据每任务数字选择。