据TechRadar报道,一项针对近1.9万篇学术摘要的研究显示,自2022年底AI写作工具普及后,AI相关词汇的使用频率急剧上升,AI模型还能通过自我改写消除常见的检测特征,使改写后的文本在人工审核通过后以作者真名发表。研究认为,AI正在改变“人类写作”的定义。
这项研究由计算语言学家、HumanizeMy.ai创始人Fırat Mıhcı分享。研究分析了2019年至2026年间三个学术领域的18989篇摘要,对比了2022年末前后词汇频率的变化。结果显示,计算语言学领域AI相关词汇的使用量从每万词1.9次升至14.0次,约为原来的七倍;神经科学领域从每万词1.7次升至8.7次,接近五倍。数学领域的增幅很小,从0.9次升至1.3次,研究人员将其作为对照组,认为该变化在统计上与零变化无法区分。
研究还追踪了“delve”等典型AI相关词汇。2024年,“delve”出现在2.75%的受访摘要中,而到不完整的2026年数据中,这一比例降至0.12%。研究称,一个AI模型可以重写另一个AI模型的原始草稿,使检测特征变得不明显,一旦人工编辑批准改写稿,文章就会以真实姓名发表,而不是被标记为机器生成。
Mıhcı表示,这项研究旨在揭示当前学术出版界AI检测方法的盲区。他认为,这一模式会形成循环:AI用语逐渐被当作普通人类词汇接受。基于早期写作样本训练的检测工具,可能错误地标记那些自然语言风格越来越接近AI文本的真实作者;而基于新论文训练的AI工具,则可能将受AI影响的写作吸收为正常基线,使未来的AI文本更难被发现。
研究指出,编辑和出版商在审阅这些摘要时,没有迹象表明措辞带有机器生成的痕迹。但研究并未声称所有包含这些词汇的摘要都由AI撰写,而是认为AI相关语言已经进入已发表文献,使得基于词汇的检测方法随时间推移越来越不可靠。由于2026年样本尚不完整,“delve”等词出现的下降幅度可能随数据补充而调整。
Mıhcı说:“AI只需要让改写后的输出被当作人类作品接受一次。此后,伪装就变成了答案的一部分。”如果AI风格的措辞不断在无人察觉的情况下进入已发表记录,那么用来定义人类写作的基线本身也可能会持续移动。