据MarkTechPost 10月1日报道,Cohere发布Embed 5嵌入模型家族,面向企业搜索、检索增强生成(RAG)和智能体检索,分为追求检索质量的Embed 5 Pro与侧重查询延迟和成本的Embed 5 Fast两档。两档模型均已在Cohere API、Model Vault、Microsoft Foundry和Amazon SageMaker上正式可用,私有VPC或本地部署可通过vLLM运行。
Cohere模型文档显示,两档模型的API ID分别为embed-v5.0-pro和embed-v5.0-fast,输出维度可选2048、1536、1024、768、512或256,默认2048,向量格式可选float、int8或binary。文本输入定价上,Pro为每百万token 0.12美元,Fast为0.08美元;图像输入两档均为每百万token 0.40美元。两档均接受文本、图像以及文本与图像融合输入,支持100多种语言,最大可读取128K token。Embed 5可以直接嵌入页面图像,也能将图像与其元数据融合成单一向量,这对扫描页、幻灯片、示意图和图表等文本提取容易丢失信息的场景尤为重要。
关键设计是Pro与Fast共享同一嵌入空间,可用一个模型建索引,用另一个模型查询。Cohere在40个开发数据集上测试了所有语料与查询组合,以Pro加Pro归一化为100,Pro索引配Fast查询得分为98.4,全Fast配置为96.6。Cohere推荐用Pro建索引、用Fast查询,但两边必须使用相同的输出维度。这一拆分针对智能体工作负载:一个智能体每项任务可能发起数十次搜索,查询延迟会累积。Cohere团队称,Fast每秒处理377.3个文档,Pro为159.7个。
在ViDoRe V3上,Embed 5 Pro平均得分85.8,比Embed 4提升8.8分,Fast平均84.5。Voyage 4 Large得83.7,Gemini Embedding 2得83.2,OpenAI text-embedding-3-large得75.5。在Cohere的解析PDF测试集上,Pro以84.8领先Voyage 4 Large的83.6。金融领域表现最强:Pro在FinanceBench、FinQA和ViDoRe V3 Finance上分别得80.1、90.0和85.0,均列第一,Fast在三项中均列第二。多语言结果则有好有坏:Pro在欧洲语言平均分上以77领先,但在Cohere自己的结果表中,Gemini Embedding 2在另外10种语言中的9种上超过Pro,包括日语、阿拉伯语、印地语和泰卢固语。
上述多数数字使用Cohere新提出的RCP-nDCG@10指标。该指标对固定候选集重新排序,因此更多衡量重排序质量,而非第一阶段检索质量。Cohere公开了评估代码,但独立复现仍待进行。存储方面,Embed 5采用Matryoshka表示学习和低精度输出:2048维float32向量需8KB,1024维int8向量需1KB,256维binary向量需32字节。在1亿个分块上,原始存储可从约819GB降至3.2GB。Cohere推荐将1024维int8作为默认选择,称其质量接近全精度。