据 TechCrunch AI 10月1日报道,营销公司 Graphite 的一项研究显示,尽管各前沿模型实验室已经减少了破折号、“delve”等早期 AI 写作特征,大语言模型在生成文章时仍会留下大量可识别的词语和句式。Graphite 在 AI 内容中识别出至少 1.3 万个出现频率达到人类内容两倍以上的短语,并将其定义为“破绽”。
研究设计上,Graphite 以 ChatGPT 发布前发表的 1 万篇文章作为人类写作对照组,然后让不同 AI 模型根据摘要重写这些文章,以减少原始内容偏差。研究人员将人类样本与各模型样本匹配,比较特定词语和短语出现频率,以及句子构造的总体模式。
Graphite 首席 AI 官 Greg Druck 告诉 TechCrunch,Claude 系列模型随着版本更新正接近人类词汇分布,而 GPT 系列模型则离人类分布更远。Graphite 还发现,虽然单个特征会变化,但 AI 写作“破绽”总量基本保持稳定。Druck 说,模型移除了最知名的特征,其他特征又会出现,而且每个模型版本都有自己的特征。
具体到 Claude Opus 5.5,Graphite 称其最大标志词是“dependable”,出现频率是人类的 23 倍。该模型虽然减少了“不是 X,而是 Y”的句式,但仍倾向于说某事物“不仅是 X,还是 Y”。它尤其喜欢解释事情为何重要,“this matters”出现频率是人类的 116 倍,“why X matters”则是人类的 92 倍。
OpenAI 的 Astra 有另一组提示。它会描述所谈内容的“另一个维度”,并用“may provide”或“can provide”来弱化对某种好处的断言。Graphite 称,Astra 最大特征是“纠正性框架”,即把话题定义为“not simply X”,或以“rather than relying on X”作为替代方案。这些表达在 Astra 生成的文本中比人类写作常见 100 倍以上。
破折号的变化受到关注。在 Graphite 的样本中,Opus 5.5 使用破折号的频率比 Opus 5 低 99%;Astra 比人类样本低 88%;Gemini 3.1 Pro 几乎完全从写作中消除了破折号。
不过,各实验室对更像人类写作的追求并未让所有特征消失。Anthropic 在发布 Opus 5.5 时称,该模型“比先前模型沟通更自然”,早期用户认为其写作更清晰、更容易跟随。OpenAI 在发布 GPT-6 版本的 Sol 和 Luna 时也作出类似表述,称用户可以预期更清晰、更少术语、更少奇怪短语。
Druck 对实验室能否完全消除这些特征持怀疑态度。他说,自己的一般假设是,实验室对这些特征的控制能力低于外界预期;这些是拥有数十亿参数的巨型模型,能运行的测试数量有限,一些东西会漏过去。