据 MarkTechPost 2026年10月10日报道,Sakana AI 发布 TMLR 研究论文《Beyond Imitation》,提出以错误检测评估 LLM 辅助同行评审,并公布 Contradiction Benchmark 与 Multi-Layered Review(MLR)系统。论文报告,MLR 在 4 次评审条件下检出 73.43% 的核心主张错误,而表现最好的基线系统 AgentReview 为 14.81%。
该研究围绕一个更具体的问题:AI 审稿人能否发现被植入论文中的错误。团队构建的 Contradiction Benchmark 从 ACL、AISTATS、CVPR、ICML 2025 和 NeurIPS 2024 收集 257 篇 CC 许可论文,由 Gemini 2.5 Pro 建立每篇论文的主张、证据和方法知识图谱,以节点与主要主张的距离定义严重性,距离 0 触及核心主张。GPT-4.1 再按距离重写 1 个节点为矛盾,生成 1,164 个数据点。o3 裁判对每篇评审评分 10 次,在干净论文上达到 99.9% 准确率,在人工确认的捕获上灵敏度为 86.8%,因此论文称报告分数可能偏保守。
MLR 使用 3 个代理,基于现成 Claude 模型。附录代理(Claude Haiku 3.5)总结附录中的实验和实现细节;文献综述代理(Claude Sonnet 4)可选,用网络搜索将论文置于先前工作中;评审代理(Claude Sonnet 4)运行受 Keshav 三遍法启发的三遍提示链:第一遍写高层提纲,第二遍细读并标记弱点、假设和缺口,第三遍合并各代理输出为优势、弱点、问题、建议、评分和待办清单。PDF 直接传入,图表和公式得以保留。系统无需 GPU 和微调,每篇评审约 0.47 美元,使用 189,062 个输入 token,约为 AI Reviewer 403,654 个输入 token 的一半。单提示变体成本降低约三分之二,但在基准子集上检测下降约 3.5 个百分点。
基准测试中,MLR 在所有基线上领先。4 次评审时,它检出 73.43% 的距离 0 矛盾,整体检出率 40.95%。单次 MLR 评审仍检出 60.79%。消融实验显示,将 LLM-Review 内部的 GPT-4.1 换成 Claude Sonnet 4,距离 0 检出率从 14.56% 升至 35.40%;MLR 的设计在单次评审上再增加约 25 个百分点。准确率随节点距离增大而下降,支持了严重性评分。在 WithdrarXiv-Check 的 211 篇真实撤稿论文上,增益缩小:MLR 的相似匹配为 26.07%,精确匹配为 16.11%,最强基线分别为 18.48% 和 9.00%。
与人类评审对比,MLR 在评分上大体一致。在 ICLR 2025 投稿上,MLR 预测评分与人类评分的皮尔逊相关系数为 0.586,人类之间参考值为 0.742;在 ICML 2025 上,AI Reviewer 以 0.439 略高于 MLR 的 0.429。关注点上不一致:MLR 强调有效性和实验,人类更看重清晰度和新颖性。作者将此描述为互补视角,而非替代。系统仍会受隐藏提示注入影响,在真实撤稿论文上的精确匹配表现也较弱。