Meta Superintelligence Labs于9月3日发布编码模型Muse Spark 1.3。这是该公司五个月内第四个Muse Spark版本,重点面向长程智能体任务,而非单轮生成。据Meta发布公告,该模型已在Muse Code和Meta模型API中提供,开发者可立即在生产环境调用,但无法自托管,权重未开放,最高推理模式仍需通过进一步安全测试后才能使用。
Meta在公告中表示,Muse Spark 1.3在多个智能体框架上训练,使其行为能够跨环境泛化。该模型设计为在单条长线程内承载多项工作流,面对开放式目标时能从杂乱且冲突的信息源中自行收集上下文,并弥补计划中的缺口。协作能力方面,Muse Spark 1.3会在提示语模糊时提出澄清问题,在卡住时请用户介入,并在执行重要操作前请求确认。在长任务运行中,它还能适应用户偏好,例如选择频繁更新状态或静默后台执行。Meta称,该模型对自身局限的判断也更准确,会标记障碍而不是虚构结果。
编码效率方面,Meta称Muse Spark 1.3使用了更多长程编码任务进行训练。相较1.2版本,Meta工程师内部比较显示,它减少了不必要的交互轮次,输出更简洁,代码风格更干净:工具调用次数减少约20%,token消耗减少约25%。对智能体工作负载而言,这直接意味着更少的往返次数和更少的计费token。
在基准测试中,Meta公布的数据显示,Muse Spark 1.3在DeepSWE v1.1上得分75.4,超过Claude Opus 5的74.0和GPT-5.6 Sol的72.7。在SWE-Atlas Codebase QnA上得分59.4,在Terminal-Bench 2.1上以88.8与GPT-5.6 Sol持平,Claude Opus 5为86.7。长上下文检索是差距最大的部分:Muse Spark 1.3在MRCR v2上得分为98.5(256K至512K上下文)和98.1(512K至1M上下文),而GPT-5.6 Sol在这两项上分别为91.5和73.8。
需要注意的是,Meta的测试成绩区分了mode。在OSWorld 2.0上,Muse Spark 1.3的max模式得分66.9,xhigh模式为57.2;GDPval-AA v2 Elo分别为1,754和1,709;JobBench为64.9和61.2;DeepSearchQA两者均为89.4。由于1.2版本是在xhigh模式下评估,部分代际提升源于推理模式的变化。第三方评测机构Artificial Analysis对当前可用的xhigh版本给出的智能指数为61,而预览版max模式为62,xhigh版本与GPT-5.6 Sol(max)和Grok 4.6(high)持平,落后于Claude Opus 5(max,63)和Claude Fable 5.1(max,66)。Artificial Analysis还测得xhigh版本在Tau3-Bench Banking上为47%,max版本为52%,这是该评测中记录的最高分数。
定价方面,Muse Spark 1.3与1.2版本一致,输入每百万token 1.25美元,输出每百万token 4.25美元,贡献者层级为每百万token 0.10美元输入、0.20美元输出。模型权重保持封闭,但Meta路线图中列出了开源权重版本。该模型支持100万token上下文窗口。