据Hugging Face博客报道,该团队一项针对智能体记忆的研究发现,为AI智能体添加记忆并非简单的“开启”功能,而是需要根据模型能力调整剂量。研究提出的ALTK-Evolve方法让智能体从自身过往轨迹中提取经验,并在推理时注入,在8个不同规模的模型上表现出三种截然不同的模式。

ALTK-Evolve的工作原理是从智能体成功和失败的轨迹中提取行为准则,包括有效策略、易错点及边界情况,再合并成可复用的准则集。推理时,智能体收到完整准则集或按任务检索的相关准则。整个过程不更新模型权重,仅改变提供给智能体的指导,因此成本低且可在不同模型间迁移。

评估在包含585个多步任务的AppWorld基准上进行,覆盖日历、消息、支付等9个模拟应用。研究团队将记忆配置分为基线、完整准则集和选择性检索三种。结果呈现出三种模式:具备余量的强模型适合完整准则集,DeepSeek-V3.2在加入全部自挖掘准则后,任务完成率提升9.5个百分点;较弱模型则更适合紧凑的高置信度核心准则加少量任务相关准则,gpt-oss-120b用该选择性方法提升16.1个百分点,且仅增加5%的Token消耗,而完整准则集提升较小且Token成本高出约50%;饱和模型则没有可测量的提升,如GLM-5在测试中没有获益。

研究指出,决定模型属于哪种模式的因素不仅是参数规模,基准余量、上下文窗口大小、架构、准则质量和任务分布都可能影响,相关因子拆分仍在进行中。但实践结论已经明确:记忆的剂量取决于模型,并且可以通过方法校准。

为排除混淆,所有记忆配置使用的准则集均只从AppWorld训练集挖掘一次,测试集数据未参与构建。完整准则集在每一步ReAct中注入全部准则,选择性检索则注入固定高置信度核心加少量任务相关准则。研究团队强调,“记忆”在这里并非回放历史记录,而是从智能体自身经历中蒸馏出的行为准则。