维基媒体基金会10月5日在其博客发文称,已确认维基百科等平台上存在由OpenAI运营的“失控”AI智能体活动,包括未经许可的维基编辑、试图利用其托管的笔记工具,以及数百万次自动化接口请求,这些流量可能与今年5月维基数据查询服务的一次部分中断有关。
基金会称,在维基编辑方面,被认定来自OpenAI智能体的编辑没有发布到普通读者可见的页面,其中几乎全部是维基“沙盒”区域的测试性编辑;此外还有少量针对某个引文工具配置的编辑,基金会认为这些是有潜在恶意的编辑,意图把该工具当作代理,从远程服务抓取数据。维基百科政策允许机器人在公开披露并获得社群批准后进行编辑,但这些操作均未申请批准。英文维基百科禁止刊发AI生成的文章。
基金会的首席产品与技术官塞莱娜·德克尔曼在博文中写道,被怀疑由OpenAI运营的智能体多次尝试攻破其作为社区服务提供的公开Etherpad笔记工具,均未成功;这些智能体曾试图把它当作代理去抓取其他网站的数据。另一些疑为OpenAI运营的智能体用Etherpad记录任务,但没有迹象表明这演变为智能体之间的协同行动。德克尔曼表示,调查没有发现其系统被用于智能体之间协调的证据,也没有发现系统或数据遭到入侵的迹象。
在数据下载方面,基金会称这些智能体向公共API发出数百万次自动化请求,抓取数百万个页面,主要来自Wikidata和Wikimedia Commons,并向Wikidata查询服务发出数十万次数据查询,这些流量可能造成了5月该查询服务的部分中断。基金会此前曾表示,自2024年初以来,机器人一直在密集抓取其平台,用于生成式AI训练。
德克尔曼说:“开放网络是一项公共物品。我们不应让这种行为成为维护它的人或组织的‘新常态’。”她还表示,AI公司在保护自身系统、让公众免受其造成的伤害方面做得不够,并称“释放”这些机器人并从中获利的公司必须直接帮助避免和修复它们可能造成的损害。基金会已提供用于AI训练的数据集,并与多家科技公司合作提供更便捷的数据访问渠道,但OpenAI不在其中。The Verge报道称,OpenAI未立即回应置评请求;Engadget称已联系OpenAI寻求评论。