据雷峰网等媒体报道,人工智能学者吴恩达团队于 7 月 23 日在美国开源的桌面 Agent OpenWorker,上线一周后即遭到社区质疑,暴露出多模型兼容、数据流向和权限控制等尚未解决的问题。与此同时,阿里、智谱、DeepSeek 近期发布的大模型在 Agent 场景实测中呈现能力与成本、安全与效率的矛盾。这些评测共同显示,AI Agent 要成为普通人的数字员工,仍面临产品化鸿沟。
OpenWorker 是一款运行在桌面端的 Agent 工作台,由吴恩达与 Rohit Prasad 发布,最大卖点是“模型无关”和“本地优先”。它把模型路由、工具调用、权限审批和自动化任务组装成可安装的开源产品,用户可接入 OpenAI、Gemini、Ollama 等模型,也能连接 Slack、GitHub、Jira 等办公工具。据雷峰网报道,GitHub 上的反馈主要集中在三个方面:API 兼容不等于开箱即用,有用户接入自建 OpenAI-compatible 接口或本地 Ollama 时出现模型无法加载;“本地优先”并未清晰说明不同数据在何种配置下发送给哪些服务;部分配置文件可能在用户尚未信任工作区时就启动外部服务进程,权限审批没有覆盖全部执行路径。
国产模型的 Agent 实测同样喜忧参半。据雷峰网报道,阿里 8 月 14 日开源的 Qwen3.8-27B 性能强劲,标准部署下 vLLM 和 SGLang 平均吞吐超过 40 token/s,3bit 至 6bit 量化在文本任务中质量保持满分。但在 DeepSeek Harness 上接入 Agent 后,跑通 9 个任务消耗约 1399 万 token、耗时约 6 小时 17 分钟,其中生成 3D 网站单题就烧掉约 1153 万 token,复杂任务拆分过重、单步目标过大和上下文反复回灌导致大量空转。
智谱 8 月 13 日发布的 GLM 5.3 在同一驾驶游戏开发测试中,比 GLM 5.2 快约 15 分钟,光影、路灯、HUD 等细节更接近真实体验。但据雷峰网报道,其官方强调的网络安全能力增强带来了“过度防御”问题:在自动化工具链中频繁触发拒绝判断,导致开发流程中断。有用户反馈,5.3 写出的文案“全是黑话”,即使修改提示词也难改善。
DeepSeek 开放 V4 多模态权重后,代码显示其视觉链路并非简单添加看图模块,而是把视觉 Token 直接接入长上下文 Attention、MoE 路由和 Agent 推理,并用 Aligner 将视觉特征压缩九分之一。然而,据雷峰网分析,这种设计在视觉 Agent 中会放大计算成本:每轮观察环境都需要重新编码和 prefill,相邻截图大部分像素未变却无法跳过,可能导致大量重复计算。
在应用层,Lovart 的更新展示了另一种思路。据爱范儿报道,Lovart 推出灵感采集插件、Skill 技能市场和一键分层导出 PSD 等功能,把灵感收集、生成、后期接入同一工作流,减少设计师在不同软件间的搬运和等待。其逻辑是让 AI 适应设计师,而非要求人适应工具。