2026年9月3日,Anthropic发布Claude 5.1,推出Fable 5.1和Mythos 5.1两个版本。据雷峰网报道,这两个版本共用同一套底层模型,但Anthropic将能力开放范围拆分开来:Fable面向通用编码、知识工作和Agent任务,Mythos面向经过验证的网络安全与生命科学研究场景,允许调用更深入的工具与专业任务。这一分化标志着Anthropic将模型“智力”与“执行权限”物理剥离。

报道称,在Ramp的一次测试中,Fable 5.1无人值守运行38小时,中途识别出实验中的标签伪影,重新处理数据,并行启动6组实验,再根据返回结果继续修改后续方案。38小时的数字本身没有太多技术含义,关键在于模型没有沿初始计划机械执行,而是在实验条件发生变化后修改已有判断,再继续推进任务。这关系到长时Agent的状态一致性问题:执行时间拉长后,上下文中的旧信息可能已经失效,单纯扩大上下文窗口不能自动处理历史信息的有效期。Claude 5.1的任务执行需要建立基于外部事实的状态失效机制,当某个前置状态失效时,依赖它的任务、结论和中间产物也要同步重新评估。

报道进一步分析,模型生成代码或实验结果后,不能立刻把这些内容写入长期状态。编译器、单元测试、运行时跟踪或实际实验等外部信号可以验证结果,减少因模型自我检查带来的关联性错误。Ramp实验里,模型发现标签伪影后,建立在旧数据上的结果被判定失效,需要重新处理。通过验证的状态得以保存,任务中断时可从可信检查点继续执行。

Fable 5.1与Mythos 5.1的差异化,也体现了能力与执行权限的分离。据雷峰网报道,模型内部具备理解某类任务的能力,但能否调用还取决于任务类型、访问资格和工具范围。在网络安全场景中,Fable可参与软件漏洞发现,而渗透测试、漏洞利用生成或深度二进制分析需求会进入更严格的执行路径,经过验证的研究人员才能访问Mythos的能力范围。长时Agent的任务性质会在执行过程中变化,权限判断不能只在开始时进行,系统需要持续读取任务状态、历史动作和资源请求,做增量式风险评估。这种能力路由不同于简单的允许或拒绝,也解释了为什么执行轨迹会变得重要。

科研任务方面,Anthropic展示了蛋白设计、金星地形重建和GPU内核优化等案例。Claude并不替代领域模型,而是编排多个专业工具完成一条工作流。以蛋白设计为例,Mythos先理解研究目标,调用蛋白设计与结构工具生成候选方案,再根据计算结果筛选并进入实验验证。由于科研工具往往不会立即返回结果,Agent需要异步执行,在等待期间继续处理其他任务;多个实验并发时需要调度,结果还需要绑定数据版本、模型版本和代码提交等来源信息,防止多组实验结果互相混淆。