据Hugging Face博客7月16日发布的文章,三个月前开源并发表论文的OCR模型DharmaOCR,在巴西葡萄牙语文字识别任务上继续优于新发布的Mistral OCR4和Unlimited-OCR。作者认为,这一优势来自领域专精而非更新架构或更大参数规模。
DharmaOCR的训练分为两个阶段。第一阶段是有监督微调,使用大量不同来源、格式和复杂度的葡萄牙语文件,让模型权重集中适配巴西葡萄牙语的词汇、句法和文档结构。第二阶段采用直接偏好优化(DPO),模型不再仅学习正确转录,而是从多个输出结果的比较中学习,推理时更稳定地选择更优提取结果,从而降低重复或无意义输出,缩短推理时间并降低推理成本。
博客文章指出,两个阶段缺一不可。微调建立了领域能力,DPO保证该能力在容易失败的条件下仍然成立。在面向葡萄牙语的评估基准上,DharmaOCR获得最高提取质量分和最低退化率。
文中解释,每个基于生成模型的OCR系统都是概率性的,转录错误无法消除,区别只在错误数量与类型。模型结构和参数量决定能力上限,训练决定这些参数如何分配。多语言模型或通用模型需要将参数分摊到多个领域,而DharmaOCR将所有参数集中用于巴西葡萄牙语。作者称,这种集中是领域专用模型相对于广义模型的“结构性优势”。
文章同时承认,Mistral OCR4和Unlimited-OCR代表了真正的技术进步,新训练技术、新数据集和多语言评估中的强结果提高了竞争标准。但在将两者与DharmaOCR对比测试后,作者表示,当初促使DharmaOCR设计的两个缺口——复杂文档的提取质量和生产条件下的稳定性——尚未被新模型填补。DharmaOCR从一开始就不打算成为其他语言的最佳选择,作为交换,它把网络可用的全部参数都用于巴西葡萄牙语。