据MarkTechPost报道,Jina AI(Elastic旗下)发布jina-ocr-v1,一个端到端视觉文档解析模型。它可接收PDF、扫描件、表格、图表或发票,一次处理返回干净Markdown;总参数3.4B,每token约570M解码参数激活,检查点内置投机解码头,目标是在NVIDIA L4等低预算GPU上部署。技术报告列出OmniDocBench v1.6得分91.14,olmOCR-Bench得分83.4。

模型在DeepSeek-OCR基础上后训练。DeepEncoder约380M参数,串联SAM、16倍卷积压缩器和CLIP-L,把1024×1024页面视图从4096个patch压缩为256个视觉token;动态分辨率模式最多增加9个局部tile,每个100 token,单页视觉token上限1156。解码器为DeepSeek-3B-MoE,12层,64个路由专家和2个共享专家,Top-6路由每token激活约570M参数,位置限制32768。输出为Markdown,表格用HTML,公式用LaTeX。

FastMTP投机解码利用OCR输出接近确定且局部结构化的特点。FastMTP头用1个密集草稿块递归执行K=3步,草稿参数量不随深度增长;解码器贪心验证草稿,接受与自身选择匹配的最长前缀,再自行提交1个token,若3个草稿全匹配则额外token作为奖励。Jina AI称提交文本始终等同普通贪心解码,因此加速无损;K=3时平均每步提交2.73个token。

后训练结合指令对齐、退化页面鲁棒性微调和GRPO。奖励项为确定性代码,对照参考转录评分,覆盖内容、公式、表格、结构有效性、单元测试、重复和格式;各项相乘并分别评分,部分正确页面可获部分分数。结构、单元测试和格式项下限0.2,表格项下限0.1,重复项无下限。因自然页面公式和表格奖励样本少,Jina AI构建JinaOCRSynth合成页面,并配olmOCR-Bench风格单元测试;草稿头最后针对冻结的最终验证器训练。

基准显示模型并非精度领先。PaddleOCR-VL-1.6在OmniDocBench得分96.34,HunyuanOCR-1.5为94.74,高于jina-ocr-v1的91.14;chandra-ocr-2在olmOCR-Bench为85.8,dots.mocr为83.9,高于jina-ocr-v1的83.4。不过后训练使其在olmOCR-Bench比DeepSeek-OCR主干提高7.4分。吞吐是主要结果:1块A100 40GB、并发32时,它每秒解析2.57页,为Jina AI测量的14个系统中最高,olmOCR-2为1.22页,chandra-ocr-2为0.38页。在NVIDIA L4、batch size 1时,eager解码从每秒42.7 token升至83.1 token,加速1.95倍,接受率57.6%;使用CUDA graphs时基线为每秒158.3 token,K=1最佳,为185.6 token,提升1.17倍。

最快使用途径是Jina Reader:向r.jina.ai发送URL并带X-Respond-With: jina-ocr-v1头,Reader抓取页面或PDF、运行模型并返回Markdown;X-Page头可转录长文档中的1页。Jina AI还托管OpenAI兼容端点,并提供演示。自托管权重和自定义代码在同一仓库发布,需用trust_remote_code=True加载。FastMTP要求vLLM 0.21或更高版本,并进行一次register()调用;Transformers路径只运行MoE解码器,忽略草稿权重。模型开放权重约6.8GB(BF16),采用CC BY-NC 4.0许可,商业使用需联系Jina AI。