据The Verge报道,纽约时报对OpenAI和微软诉讼中近日解封的法庭文件显示,两家公司自己的文档曾警告,其AI内容策略正在启动一个会同时损害模型性能和整个网络的“末日循环”,并将为训练模型抓取数据描述为“人类历史上最大规模的劳工盗窃”。这些文件还称相关做法对“合理使用”理念构成“彻底嘲弄”。
文件中最引人注目的表述之一来自微软应用科学总监布伦特·赫克特。微软发言人亚历克斯·豪雷克对The Verge表示,这些评论反映一名员工的个人观点,不是法律分析,不代表公司看法。在另一份法庭文件中,微软AI数据战略与运营总经理乔丹·乌斯丹将赫克特的角色描述为对抗性的,称他持有关于AI数据生态应如何运作的“不同、学术和前瞻性”观点,受雇于微软是为了带来不对称、未来主义和学术视角,并不代表微软对其关于AI可能影响内容创作者的理论观点发言。
这份纽约时报提交的92页文件还引用微软的萨蒂亚·纳德拉、OpenAI的萨姆·奥尔特曼及其他OpenAI员工的表述。文件称,纳德拉承认聊天机器人基本取代了搜索,使人们不再需要直接访问信息来源。一份微软内部文件写道,其AI内容策略已启动一个“末日循环”,会同时伤害模型性能和整个网络;该文件称,一个终端产品威胁其关键供应商的经济基础极不寻常,但这正是其大语言模型业务在“内容供应链”上造成的情况。
文件还显示,OpenAI联合创始人格雷格·布罗克曼更关注商业AI可能带来的“天文数字”收入。关于付费墙,纳德拉后来被引述说“任何被付费墙保护的内容都应该获得授权”,但一名OpenAI代表承认,他“不知道”有任何检测或从训练数据中移除付费墙内容的努力。
内部讨论似乎也显示OpenAI清楚ChatGPT会“逐字”复制受版权保护材料。尽管公司承认“防止记忆”对“减少版权侵权”很重要,员工承认GPT-4“记住了大量数据,因此会极其擅长复述”。文件随后引用多个例子,称ChatGPT在回答查询时直接输出纽约时报、Mercury News、Denver Post、LifeHacker和Eurogamer文章中的长段文字。
微软知道大规模抓取互联网内容会被如何看待,并承认“几乎没有人打算让自己创作的内容以这种方式被使用,也没有因此获得补偿”。OpenAI政策总监杰克·克拉克认为,公司在“创造替代那些定义社会‘文化’之人劳动的系统”。内部文件将ChatGPT描述为“现代报摊”。文件还引用OpenAI的尼克·特利说,一旦用户从聊天机器人获得答案,就“没有充分理由”点击来源链接。
微软还被引述承认,“大语言模型是一种会摧毁自身供应链的产品”,因为在许多情况下它会替代自身训练数据。OpenAI自己的媒体和经济专家将纽约时报等网站推荐流量下降直接归因于Google AI Overviews等AI摘要,并推测搜索推荐流量可能下降多达60%。