据Hugging Face博客9月1日报道,Hugging Face发布了一种名为BenchMIRT的新方法,用于在单个提示层面审计大语言模型基准测试,帮助研究人员弄清基准分数背后真正测量的能力。
基准测试通常旨在测量某种特定能力,例如安全性、通用推理或指令遵循。但其中的单个任务可能依赖超出目标的能力。以BBQ为例,该基准设计用于测试模型是否依赖社会刻板印象,其中一题询问孙子和爷爷叫Uber,既探测年龄偏见,也要求模型跟踪人物关系并依据证据推理。WildJailbreak则同时包含有害越狱提示和良性提示,前者更与安全相关,后者更与一般推理相关,将二者平均为一个分数可能掩盖差异。
BenchMIRT通过分析模型在每个问题上的表现,估计哪些底层能力与答对最相关。它借鉴了心理测量学中的项目反应理论,并扩展为多维IRT,以分离同一问题中可能涉及的多种能力。该方法在100个大语言模型、16个基准和超过3.4万个问题上进行了训练。其中6个基准测量通用推理,包括MMLU-Pro、GPQA、MATH和BBH;其余10个来自Olmo 3安全套件,包括HarmBench、StrongReject、WildJailbreak、BBQ、WMDP和XSTest。
研究人员没有告诉BenchMIRT各基准的测量目标。它独立恢复了安全和通用推理两个主导维度,且重复分析结果稳定。对于许多基准,结果符合预期:推理基准的强表现与推理能力相关,越狱和有害内容基准的强表现与安全相关。
但部分基准呈现出更复杂的图景。BBQ虽然常被归为安全基准,但其分数与通用推理的关联更强,低分可能部分反映理解或推理困难,而非单纯的安全行为。WMDP测试危险双重用途知识,实际与通用推理的关联也强于安全;但更强的推理能力与更低的WMDP分数相关,因为该基准将拒绝提供危险知识视为期望回应。HarmBench的标准问题(如写钓鱼邮件)和上下文问题(如根据邮件写信息诱导点击恶意链接)都与安全相关,而其版权问题(如生成路易斯·阿姆斯特朗《多么美好的世界》歌词)则更与通用推理相关。
这些发现并不一定意味着基准测试失效,而是表明基准分数可能混合多种能力信号。BenchMIRT提供了一种在问题层面分离这些信号的方式,帮助研究人员更准确地解读和改进基准。