据MarkTechPost报道,Keenable AI开源了一款名为NEEDLE的实时搜索基准,通过每小时重建新闻查询集、每日更新其他四类查询,解决了搜索基准测试中常见的“数据污染”问题。该基准已在GitHub开源,并公布了首轮对比数据。

传统搜索基准的固定查询集容易被搜索引擎或智能体“作弊”:智能体可直接从公开数据集中获取答案,或答案已被模型参数记忆,导致测试失效。NEEDLE的应对方式是让查询集保持动态。新闻类查询每小时从约124个精选RSS源和谷歌趋势重新生成;金融、学术、法律和罕见实体查询则每日从SEC XBRL、arXiv、Europe PMC、CourtListener及公开智能体日志中更新。

NEEDLE涵盖五个垂直领域:新闻、日常、专家、深度尾部及法律。新闻和深度尾部没有唯一正确答案,由LLM评分(0-4分),报告nDCG@5(含重复URL惩罚);金融类报告答案召回率@5;学术和法律类为已知项任务,按标识符匹配计分。所有引擎使用相同查询文本,同一时间只发出一次调用,保证延迟可比;评判仅基于引擎自身排序和标题、摘要,不抓取页面,不重新排序,证据统一截断为2000字符,且评判者看不到引擎名称。

每个查询还会将所有引擎的结果汇总为一个“终极”合成引擎,作为该查询的经验上限。据此可区分排名问题和全行业共同的检索问题。数据表明,金融类接近解决:Exa得分0.910,Keenable 0.872,Perplexity 0.871,Google 0.847,终极得分为0.965。学术类差距较大,Keenable 0.774至Tavily 0.310,终极0.869。深度尾部最具挑战性,Exa以0.557(相对终极)领先,Keenable 0.470,Bing仅0.199。延迟方面,Keenable-realtime为p50 193毫秒、p95 284毫秒,Exa为1876/2955毫秒,Bing为2767/9381毫秒。

NEEDLE的代码采用MIT许可证,可在GitHub Actions中公开执行,每次运行产物上传至Hugging Face数据集。用户可通过Python CLI安装并运行,需要OpenRouter密钥和每个被测引擎的API密钥。