据MarkTechPost报道,Cohere于2026年8月27日发布了Parse 5文档解析模型(parse-v5.0),这是一个面向企业大规模文档摄取的2.3B参数视觉语言模型。该模型可将PDF、PPT或JPEG页面作为base64编码的数据URI输入,并返回包含阅读顺序文本、HTML表格、列表、表单键值对、图片描述及边界框坐标的Markdown。模型基于Cohere Labs的North-Micro-Vision-Instruct架构,上下文窗口为8192个token,占用约4.6GB,且没有前置的独立OCR阶段。

Cohere将Parse API定价为每1000页1.5美元,并强调其在价格性能比而非峰值准确率上的定位。该模型已通过Cohere Parse API、Microsoft Foundry、AWS SageMaker以及单租户Model Vault提供,无需等待名单或研究许可。Cohere瞄准金融、保险、医疗健康、生命科学、公共部门、电信、能源和制造等文档密集型行业,应用场景包括RAG摄取、智能文档处理、理赔和发票流水线、合同与备案检索,以及为智能体提供文档上下文。

关于基准测试,Cohere报告Parse的ParseBench得分为79.2,超过Mistral OCR 4(74.5)、Azure Document Intelligence(74.3)和Databricks AI Parse(72.4)。但该分数为厂商自报,且仅计算了ParseBench五个维度中的三个:表格、内容忠实度和语义格式化,省略了图表和视觉锚定——这两个维度通常是最难的部分。在LlamaIndex公共排行榜上,Mistral OCR 4和Databricks AI Parse的完整五维得分均为60.68,Azure Document Intelligence(Layout)为59.64,而Cohere Parse尚未上榜,当前榜首为LlamaParse Agentic的84.88。因此,79.2是一个自报子集分数,并非排行榜名次。

在部署成本方面,Model Vault上Parse 5的Medium实例为每小时4美元或每月2500美元,XL实例为每小时7美元或每月4300美元。按每页0.0015美元的API价格计算,Medium实例在每月约167万页时达到盈亏平衡,XL实例约为287万页。低于该用量时,按量计费更划算;高于该用量时,专用容量仅在价格上就有优势,更不用说数据驻留需求——这通常是企业转向Model Vault的真正原因。