美国科技媒体404 Media的一项调查显示,亚马逊正在大量购入珍稀图书,将其拆解、扫描后用作人工智能模型训练数据,图书本身在过程中被销毁。调查人员与一名书商合作,在一本珍稀图书中暗藏追踪器,最终追踪到该书被送往位于内华达州拉斯维加斯的一座亚马逊仓库。
这座仓库被称为VGT3,门上标识是一只恐龙爪持书籍的图案。据404 Media报道,在仓库工作的亚马逊员工称,他们的工作就是接收大批量纸质书,然后切掉装订以便更快扫描,书籍在此过程中被毁。报道还提到,过去一年左右,书商们一直怀疑人工智能公司批量购入珍稀图书,在扫描后将其销毁,但此前难以证实。
亚马逊在给404 Media的声明中表示,“亚马逊通过商业渠道购买书籍,以帮助开发和改善客户使用的产品和服务”。亚马逊没有直接回应404 Media关于AI训练的具体发现。Ars Technica报道称,亚马逊拒绝就调查结果发表评论,仅提供了与404 Media相同的声明。
报道分析认为,科技公司需要海量文本训练大语言模型,互联网上的数据已基本被摄取殆尽,绝版或网上找不到的珍稀图书成为新数据来源。这些文本尤其有价值,因为2022年前出版的内容不可能由大语言模型生成。若模型用AI生成文本训练,可能导致“模型崩溃”,即输出质量下降。