据MarkTechPost于2026年9月19日报道,Linkup研究团队发布开源学习型稀疏嵌入模型SPARSEUP,以149M参数的ModernBERT为骨干,采用Apache 2.0许可,在BEIR-13上的平均nDCG@10为56.4。团队称这是其已知的、参数低于150M的公开词汇表稀疏编码器中表现最强的一个,权重已上传至Hugging Face。
SPARSEUP可通过Transformers或Sentence Transformers加载,需设置trust_remote_code=True。该模型出现时,LightOn已发布DenseOn和LateOn,公开了数据、训练配方、一个密集模型和一个延迟交互模型。SPARSEUP填补其中的稀疏模型空缺,使用同一骨干家族和微调数据,便于三种检索方式并排比较。
训练从LateOn-unsupervised检查点开始,该检查点没有MLM头,团队重新接入ModernBERT原有的MLM头。微调使用LightOn的微调混合数据,仅采用对比学习;每条查询从50个候选中抽取7个难负例,并使用批内负例。训练没有跨编码器蒸馏,可在单张H100上完成。
针对普通SPLADE在该骨干上产生大量停用词的问题,Linkup做了三处修改。编码器计算log(1 + ReLU(x - 15))进行logit平移,以缓解ModernBERT的MLM logits偏高导致log饱和和初始化词袋过密。按位置取top-k,每个输入token在最大池化前只保留12个最强词汇表维度。大小写折叠把heat、Heat、Ġheat和ĠHeat等BPE id合并为一个并保留最大权重,输出维度从约5万降至约3.4万。查询和文档分别使用[Q]和[D]前缀,评分采用点积,评测最大长度查询为128个token、文档为512个token。
在BEIR-13的nDCG@10上,据模型卡,SPARSEUP为56.4,高于opensearch-neural-sparse-encoding-doc-v3-gte的54.6、ModernBERT-VT的52.4和splade-v3的51.7。LACONIC-1B以58.7分领先,但属于10亿参数的不同规模级别。在固定骨干和数据的受控比较中,LateOn得分58.9,DenseOn得分57.9,SPARSEUP为56.4;SPARSEUP使用近似Seismic搜索,LightOn报告的是精确搜索。
SPARSEUP在ArguAna和Touché上获胜,并在HotpotQA上超过DenseOn,但在更多语义型数据集上落后,FiQA差距最大,DBPedia也是弱项。在去污染BEIR上,它与DenseOn的差距缩小到0.17分。Linkup提醒,去污染后的NQ和MS MARCO分别只有21条和46条查询,结果存在噪声。
在MS MARCO上,SPARSEUP平均每条查询有47个非零词项,每篇文档有190个;SPLADE-v3平均为25个和170个。使用Seismic倒排索引时,单线程下每查询约380微秒可达到相对精确搜索超过97%的召回率。Linkup表示,扩大向量规模可能再增加1到2个BEIR分数,但团队选择保持稀疏。