在美国《纽约时报》2023年对微软和OpenAI提起的版权诉讼中,新近解封的法庭文件显示,微软应用科学总监布伦特·赫克特曾在一份2023年1月备忘录中把AI抓取称为“人类历史上最大的劳动窃取”。这些内部言论将AI训练数据的获取方式推向版权争议中心。
据TechRadar报道,赫克特称相关抓取是“规模空前的惊人窃取”,并警告生成式AI可能扰乱那些在不知情下提供训练数据的人的就业。微软内部研究发现,与Bing相比,Copilot可能使《纽约时报》的点击量减少多达93%。赫克特提出“末日循环”理论,认为大型语言模型可能摧毁自身内容供应链的基础。
TechRadar还报道,微软首席执行官萨蒂亚·纳德拉承认,如果早知道OpenAI抓取付费墙后的数据,他会行使权利,要求OpenAI排除这些受保护数据并重新训练模型。诉讼称,OpenAI在材料进入大型数据集前移除版权声明,以便模型不向用户重新生成这些声明。该案指控OpenAI中期训练数据集包含来自《纽约时报》、《每日新闻》和调查报道中心的超过9.1万件作品。
据Engadget报道,新解封文件显示,微软和OpenAI多名高管曾把AI训练视为对新闻业的“生存威胁”。OpenAI高管尼克·特利称,AI产品对出版商构成“生存威胁”。文件还显示,OpenAI及其合作方绕过付费墙获取训练内容,并通过抓取数百万份文档、抹除版权声明来构建训练数据集。这起诉讼最初由《纽约时报》与五名作家提起,他们指控大型科技公司未经许可或补偿,抓取并利用其数百万篇报道训练大型语言模型。
Engadget报道称,已有数起类似诉讼的判决偏向AI公司,但法官指出,裁决是因为围绕AI使用的法律尚未确定。《纽约时报》诉讼被视为判断AI公司能否依据“合理使用”原则获取这些数据的关键案件。微软发言人亚历克斯·豪雷克对《纽约时报》表示,微软立场已写在法庭文件中,这些变革性使用符合版权法,Copilot也不是出版商新闻的替代品。文件中的其他评论同样尖锐:一名员工向OpenAI总裁格雷格·布罗克曼报告新的付费墙破解方法时,布罗克曼回复“啊不错”;一份2023年微软内部文件写道,全球数百万人很快会把大型模型“吸走”他们所有作品视为规模空前的惊人窃取;赫克特还称大型AI模型是“摧毁自身供应链的产品”;一名OpenAI软件工程师在2023年告诉同事,“无论我们把链接展示得多醒目,用户都不会点击”;特利也确认,AI产品对新闻业“大体上是替代性的”。
据TechRadar报道,特朗普政府近期站在OpenAI等AI开发者一边。美国政府的一份利益声明称:“在误解合理使用原则的情况下限制大语言模型开发,将阻碍这种创造性和科学进步,同时妨碍美国的繁荣和经济流动性。”这场公开争论可能持续数年,数百家其他出版物也可能受到未经请求的AI抓取影响,这些抓取被用于训练竞争性聊天机器人。