据MarkTechPost报道,Perplexity Research与turbopuffer发布了pplx-embed-v2-context-9b-preview,这是一款面向RAG管道的上下文嵌入模型预览版。其关键变化在于训练信号:模型不再只学习检索单个“黄金段落”,而是学习检索答案以及验证答案所需的上下文。

该模型可作为自托管预览版部署,权重已在Hugging Face上以MIT许可证提供。加载需要transformers>=5.4.0,并设置trust_remote_code=True。它尚未上线Perplexity API。模型卡指出,权重和接口可能发生变化,且不保证向后兼容。

据该报道,RAG系统将长文档切分为文本块,一个文本块往往依赖文档其他地方出现的实体、标题或定义。上下文模型通过“后分块”缓解这一问题:先一次编码整篇文档,再按文本块池化。但传统训练通常为每个查询标记一个黄金文本块,其他文本块都被视为负样本,包括那些使答案可验证的句子。Perplexity还列出三个问题:二元标签信号粗略;LLM标注成本随数据集规模线性增长;标签与某一种分块策略绑定。

新模型的训练教师是Perplexity的查询感知上下文压缩模型。它同时读取查询和文档,为每个token打分。文本块相关性为该文本块内前n个token得分的均值。软目标是在正样本文档的文本块上做温度缩放的softmax,其他文档中的文本块得分为零。蒸馏损失采用前向KL散度。文档损失使用InfoNCE,文档得分取其最佳文本块,灵感来自ColBERT的MaxSim。每个批次随机采样一种分块策略,文本块之间由学习到的<|chunk_sep|> token分隔,并进行均值池化。教师模型只在训练时运行,因此推理不增加延迟或存储。

模型从内部9B ColBERT检索模型出发,经线性投影输出2048维。Matryoshka训练还支持1024维。量化感知训练可生成原生int8嵌入。此次发布是多个检查点的模型汤。训练使用约430个数据集,覆盖50多种语言,未使用ConTEB数据。

报道提到,其交互式解释器给出context-bench的规模:2,099个查询、38,894篇文档、2,458,072个句子级文本块,进行穷尽排序。Perplexity在K=10时报告了pplx-embed-v2-context-9b-preview与voyage-context-4的对比;Voyage数值由Perplexity图表中的数值减去其所述14.4和5.0个百分点的差距推算,其他Voyage指标只出现在图表中。存储方面,上下文嵌入与普通文本块索引一样,每个文本块存一个向量,成本取决于向量大小。Perplexity报告称,在其文本块检索套件上,1024维int8(1KB)略优于2048维float32(8KB)的voyage-context-4。分块大小敏感性方面,64至512个token时,平均nDCG@10从81.0%降至79.9%;该敏感性为Perplexity报告的74个MTEB任务上的均值。