2026年8月底至9月底,AI Agent 领域密集出现产品发布、开源与安全争议:OpenAI 开源 Codex Harness,Meta 的 Muse 和 OpenAI 的 dots 将 Personal Agent 推向台前,OpenClaw 2.0 发布,Anthropic 警告智谱 GLM-5.3 的网络安全能力,Qwen 与智谱把 Flash 模型推进办公场景。竞争焦点从单一模型能力转向 Agent 执行系统、长期记忆、平台入口与安全治理。
据雷峰网报道,9月29日 OpenAI 发布可长期在线的个人 Agent 产品 dots,提出“always-on agents”。Meta 的 Muse 截至9月下旬下载量突破300万,一度将 ChatGPT 从美国 App Store 免费榜第一挤下。Muse 运行在独立云端虚拟电脑中,可替用户操作网页、邮件和预订,用户退出 App 后仍可后台执行任务。Manus 随后推出 Cue,千问、豆包、腾讯也在跟进。雷峰网称,Personal Agent 想争夺用户产生需求后、尚未选择平台之前的意图入口,但需要同时获得用户与平台授权。Amazon 已阻止 Muse 访问其购物网站,理由是未事先获得许可。
据量子位报道,Anthropic 发布报告警告智谱 GLM-5.3 已具备找漏洞、编写攻击程序的能力,防滥用限制易被绕过。报告引用 ExploitBench 称,尝试410次时 GLM-5.3 成功50次,Claude Mythos Preview 成功56次;并引用美国 NIST 下属 CAISI 9月17日评估,称 GLM-5.3 是迄今网络能力最强的开源权重模型,距美国前沿约4个月。报告称,伪装成“自主红队智能体”时 GLM-5.3 有64%继续执行,预填思考后升至92%,abliteration 拆护栏后达100%。Anthropic 花约2200 GPU小时、约4400美元算力,处理后 GLM-5.3 在 JailbreakBench 和 HarmBench 拒答率从90%以上降至约3%和2%。量子位指出,abliteration 针对开放权重属性,并非 GLM-5.3 独有。
8月19日,OpenAI 开源 Codex Harness。据雷峰网报道,OpenAI 开放的是 Codex 持续执行任务的 Agent Loop,开发者可通过 SDK 和 App Server 把任务管理、工具调用、事件回传和人工审批接入自有产品,模型仍由 OpenAI 提供。Databricks 在数百万行代码库上测试 Claude Code、Codex 和 Pi 三种 Harness,相同模型和推理强度下完成质量接近,但单任务成本最高相差两倍以上。Thrive Holdings 与 OpenAI 合作把 Codex 用于税务工作流,参与处理7000份报税材料。Codex 负责人 Tibo 判断,再过两三个月,今天这套 Codex Harness 也会显得原始。
8月31日,OpenClaw 2.0 发布,版本号 v2026.8.1,官方称其为“自托管 AI 网关”。据雷峰网报道,该版本有933位贡献者、16962个 PR 提交,试图把多个消息入口与 AI 编程助手、浏览器、终端、本地或远端机器、插件和记忆系统连接。雷峰网用同一道长任务对比两个版本:总耗时103.3分钟和106.1分钟,2.0 的 LLM 请求从74次降至46次,工具调用从100次降至65次,但输入 tokens 从369251增至516897;1.x 触发一次138781 tokens 压缩,2.0 未触发。官方安全文档强调,一个网关就是一个信任边界,更适合单人或互相信任的小团队。
8月26日,Qwen 发布 Qwen3.8-Flash-Next 和 Qwen3.8-Flash,Z.AI 发布 GLM-5.3-Flash。据雷峰网实测,两者都能从零开发出可运行的个人工作台。GLM-5.3-Flash 更像工程交付型模型,先补齐登录、模块、CRUD、统计和测试;Qwen3.8-Flash 更像个人工作流设计型模型,更早把优先级、截止日期、全局搜索和 Markdown 笔记放到办公体验核心。