据MarkTechPost于2026年10月8日报道,Perplexity AI发布了pplx-embed-v2-late系列ColBERT式多模态嵌入模型,提供0.6B和9B两种规模,二者可检索文本、图像和渲染后的PDF页面,并共享同一嵌入空间。模型已在Hugging Face以MIT许可证开放,允许商业使用,Perplexity托管的API端点仍在计划中、尚未上线。

Perplexity将0.6B模型定位为轻量查询编码器,可在笔记本、边缘设备或小型GPU上本地运行;9B模型用于构建文档索引,面向数据中心或高显存GPU。0.6B总参数594M,图像活跃参数约340M,基于Qwen3.5-0.8B并裁剪至12个文本层;9B总参数9B,Hugging Face页面列为8B,活跃参数7.4B,基于Qwen3.5。两者均输出每token 128维向量。按bf16估算,权重内存分别约1.2GB和16至18GB。模型卡显示需CUDA GPU,并依赖sentence-transformers >= 6.0.0与transformers >= 5.4.0。

Perplexity公布的成绩显示,9B模型在MADQA智能体PDF问答上取得92.4%准确率,为所列最高,超过Mixedbread retriever的88.9%,但低于Mixedbread Agentic Search的93.4%;0.6B为90.1%。在72项领域文本任务上,9B的nDCG@10为81.3%,领先所有被测模型1.6个百分点;0.6B为78.0%。Q2D-Web的Recall@1000为73.6%和74.8%,均高于此前最佳的69.3%。ViDoRe v3图像检索nDCG@10为62.3%和65.2%,0.6B落后nemotron-colembed-v2-8b 1.2个百分点,但该基准由腾讯EVIE领先。ViDoRe v3 Markdown为61.2%和64.7%,0.6B为最弱成绩,仍高于所有外部被测模型。BrowseComp+上9B为64.0%,为最低,仍比下一名ColBERT模型高4.9个百分点;Perplexity称其最大差距为领先最佳稠密模型8.7个百分点。

限制方面,模型为每个token存储一个向量,索引体积会随文档长度增长;单次输入不能混合文本和图像;所有分数为自报,技术报告尚未发布。图像检索仍是明显缺口,Gemini Embedding 2在MIRACL-Vision上超过9B,并在PPLX-Q2I上领先2个百分点。尺寸混用方面,用0.6B查询9B索引在ViDoRe v3图像检索上得分63.5%,高于0.6B同时用于索引和查询的62.3%,查询成本相同。Perplexity称,用0.6B查询9B索引,可在文本任务上以0.6B查询成本恢复约一半的9B质量差距。

技术路线上,pplx-embed-v2-late为每个token保留128维向量,并用MaxSim评分:每个查询token找到最佳文档token,再将这些最大值求和。页面以图像编码,无需OCR步骤。Perplexity用LEAF式token级训练从18B教师模型蒸馏出两个模型,形成共享嵌入空间。其每token 128维的向量宽度,比对手的2048至4096维窄16至32倍。

与其他模型相比,NVIDIA nemotron-colembed-vl-8b-v2约为8.8B,每token 4096维;TopK topk-embed-v1为0.8B和2B开放版本,每token 2048维;Google Gemini Embedding 2可处理文本、图像、视频、音频和PDF,向量维度128至3072,使用专有API。Perplexity称两个尺寸共享嵌入空间,MIT许可允许商业使用;NVIDIA模型采用CC-BY-NC-4.0,TopK小模型为Apache 2.0。建议用例包括PDF、幻灯片和扫描报告的视觉文档搜索,云端9B建索引、设备端0.6B查询的低延迟搜索,以及大型PDF或网页集合的智能体RAG。