据 MarkTechPost 9月13日报道,AWS Samples 面向自主云编码代理的设计指南指出,长时间运行的代理会因上下文溢出、目标丢失和无法长期维持状态而失效,解决关键不在模型,而在管理模型之外一切的 harness。该报道称,压缩、记忆策略、上下文预算和待办状态是把浅层工具调用循环变成深度代理的机制,并考察了 LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 Amazon Bedrock AgentCore 的实现与阈值。
报道称,扩大上下文窗口并未按预期解决问题。Chroma 的 Context Rot 报告评估了包括 GPT-4.1、Claude 4、Gemini 2.5 和 Qwen3 在内的 18 个 LLM,发现输入长度增长后,即使简单检索任务的表现也越来越不可靠。Anthropic 的上下文工程指南解释,注意力会为 n 个 token 创建 n² 个成对关系,每个新增 token 都消耗有限注意力预算,上下文因此是收益递减的资源。Manus 报告称,一个典型任务约需 50 次工具调用,输入与输出 token 比例接近 100:1;原始指令会漂移到窗口中部,而那里正是召回退化的位置。该报道据此认为,目标丢失不只是模型缺陷,也是未管理上下文在足够长任务上的预期结果。
在上下文预算与卸载方面,Deep Agents 给出两条阈值规则:工具响应超过 20000 token 时写入文件系统,并替换为文件路径和前 10 行预览;会话上下文超过模型窗口 85% 时,较早的写入和编辑工具调用因完整文件内容已在磁盘上,被截断为指针。只有卸载无空间后,harness 才回退到摘要。Claude Code 的自动记忆上限为前 200 行或 25KB;MCP 工具 schema 默认延迟加载,只列出工具名,完整 schema 按需通过工具搜索加载;压缩后重新读取超过 5000 token 的文件会返回路径引用。Claude Code 文档的模拟显示,一个研究子代理读取 6100 token 文件,向父代理返回 420 token 结果。Anthropic 指南称,每个子代理可能消耗数万 token 探索,但返回常为 1000 至 2000 token 的摘要。AWS AgentCore 让协调器并行生成 3 个浏览器子代理,每个在独立 MicroVM 中运行,分析子代理只接收结构化发现;AWS 称预期运行 4 至 6 分钟,顺序处理最多慢 3 倍。
当卸载不足以腾出空间时,harness 转向压缩。该报道称,压缩是把接近窗口限制的对话总结后,用摘要重新开启新上下文,这也是目标丢失最常发生之处,因为有损摘要可能丢掉关键约束。Claude Code 的压缩提示保留架构决策、未解决 bug 和实现细节,丢弃冗余工具输出;压缩后重新读取最多 5 个最近修改文件,重载匹配规则,并重新注入技能正文,每个技能上限 5000 token,总上限 25000 token。其文档明确早期详细指令可能丢失,因此持久规则应放在项目根目录的 CLAUDE.md,从磁盘重新注入。用户可用 /compact focus on the auth bug fix 引导,或用 /autocompact 移动触发点。Deep Agents 把目标保留做成结构化摘要,设有 session intent、artifacts created 和 next steps 字段;LangChain 团队在强制摘要实验显示改进后加入这些字段。完整原始记录写入文件系统,被摘要掉的事实之后可用 read_file 恢复。该报道还提到,压缩已进入 API 层。