据TechRadar报道,Decodo公司的一项新研究对45款AI代理进行了测试,结果显示它们尚不能自主完成真实世界的浏览任务,例如填写表单、完成交易、跨标签页操作及处理第三方集成。在满分20分的测试中,没有任何一款代理获得满分。
测试同时暴露了厂商宣传与实际能力之间的差距。得分最高的Claude for Chrome达到18分,而ChatGPT Chrome扩展仅获14分。在各项能力中,交易类任务的平均得分最低,仅为0.43分(满分2分)。研究指出,许多代理虽能到达结账界面,却无法代表用户实际完成购买。即便技术上能够执行购买,代理也可能缺乏保护信用卡号等敏感信息的足够安全措施。
安全防护是Decodo重点关注的问题。研究还发现,在支持多步骤工作流的代理中,超过半数在执行不可逆操作前没有记录在案的安全保障。不过,部分浏览器原生代理在跨标签页意识方面获得了满分。Decodo产品营销团队负责人Gabriele Vitke建议,用户应根据实际用途选择合适的AI工具,而不是被最长的功能列表吸引。