据MarkTechPost报道,Datalab于2026年10月2日发布OmniExtractBench,一个面向结构化文档提取的开放基准,用620份文档测试系统按JSON schema从PDF填充字段的准确度,并由确定性评分器解释每项评分。Datalab称,供应商各自发布的提取排行榜难以比较或审计,新基准试图提供共享标尺。

每个任务给系统一份PDF和JSON schema,系统返回JSON,逐值对照金标准评分。代码在GitHub,数据在Hugging Face以CC BY 4.0发布。评分器可从PyPI安装,包名omni-extract-bench,版本v0.1.7,要求Python 3.11及以上,仅依赖SciPy,采用Apache 2.0许可。重跑供应商系统需自己的API密钥和付费额度。

Datalab列出既有基准的四个问题:文档和评分可能偏向构建基准的供应商;不透明工具会使低分源于工具故障而非模型弱;评分不清晰使读者无法判断低分原因;文档多样性窄,有些套件只有密集表格,另一些只有干净、未扫描文件。

620份文档来自4个现有基准。监管申报表格最大,有88份;128份为单页;33份超过100页,占全部页数40%。来源包括LlamaIndex的ExtractBench 329份,Datalab合成202份,micro1的LongExtractBench 47份,Extend的LongArray-Extract 42份。Datalab合成套件是第二大来源。

评分器把预测与金标准JSON扁平化为地址,即指向单值的路径,先归一化值,使不同日期格式可匹配。表格按位置比较时,漏一行会使后续行错位;Datalab称,在缺少首行的100行表格上,位置比较得0%,OmniExtractBench得99%。它改用基于内容的匈牙利算法配对,并增加裁决层:matched、misread、unfound、fabricated、invented_item、invented_field分别对应一致、误读、漏检、虚构、虚增行项和未声明字段。准确率为matched值除以所有裁决,精确率为matched值除以预测值,召回率为matched值除以金标准值。空字符串、None和空白算遗漏并剔除,但“NA”或“-”仍是真实答案,防止用空白可选字段换取免费匹配;测试中填充空值字段增加0个裁决。

Datalab在完整语料上评分10个系统配置。其准确模式以93.85准确率领先;Datalab平衡模式93.48与Reducto deep_extract v2的93.47打平。精确率与召回率显示不同失败方式:Datalab两种模式和Reducto两项指标相差0.6个百分点以内;GPT 5.6-sol精确率95.11、召回率84.99,因unfound损失11.88%,Gemini和Claude同样偏向漏检但较轻;LlamaExtract召回率93.13、精确率86.57,因fabricated损失9.03%,Extend因invented items损失4.01%;Mistral OCR 4.1和Azure Content Understanding两项指标均落后。

使用时可通过uv pip install omni-extract-bench安装,并运行oeb score --pred pred.json --gt gold.json --schema schema.json --verdicts。安装[benchmark]扩展后运行oeb benchmark,可重跑供应商系统。