据MarkTechPost 9月10日报道,LandingAI已发布第二代智能体文档提取产品ADE Gen2,并称其已全面可用。该版本围绕DPT-3模型家族重建文档智能栈,将文档从Gen1的扁平文本块列表改为树状结构,按返回字符而非页数计价,并把每个答案回溯到页面上具体的行或词。

LandingAI将此次发布归纳为可负担性、面向智能体输出和原子级定位三个主题。开发者可在ADE playground免费开始;企业可在美国或欧盟云、AWS、Azure或Google Cloud上的自有VPC中运行,也可部署在Snowflake内或包括气隙环境在内的本地环境。

Gen2把解析拆成两个模型。DPT-3 Verity以确定性方式转录数字生成文档,为每个词返回边界框和置信度,面向高容量文本、表格和简单表单字段。DPT-3 Pro先读取页面布局再读文字,识别从表格、图形到页边注、签名等块类型,并按阅读顺序返回,可处理扫描页、手写、非拉丁文字和LaTeX数学公式。LandingAI称Verity消耗的积分约为Pro的40%,并计划在2026年秋季实现两者自动路由。

计价变化是重点。DPT-2每页固定3个积分;DPT-3的消耗由页面部分和输出字符部分组成。优先层中,Pro每页1个积分,每1000个输出字符加0.5个积分;Verity每页0.3个积分,每1000个输出字符加0.2个积分。标准层两项费率减半。以12页Pro解析返回48120个字符为例,优先层为36.1个积分,标准层约为一半。总积分向上取整到0.1,响应元数据会报告计算输入。

优先层用于有人或智能体等待的场景,标准层异步运行,价格为0.5倍,适合可容忍数分钟到数小时的流水线。同步调用始终按优先层计费,playground也运行在优先层。LandingAI预计混合工作负载可降低成本25%至80%,并称标准层使用Verity时每页解析成本低于1美分。这些是厂商数据,字符部分计费意味着字符密集页面可能比过去更贵。

Parse v2返回按阅读顺序排列的markdown、metadata和structure三个顶层字段。structure是文档节点,子节点为页,页的子节点为块,块类型包括text、table、table_cell、figure、marginalia、attestation、logo、card和scan_code。每个块带有形如type-index的语义ID,该ID在一次响应内稳定但跨重新解析不稳定,并带有页码、markdown范围和归一化边界框。表格默认以HTML输出以保留合并单元格。

原子级定位是最具实际影响的能力。每个叶块都带有atomic_grounding数组:DPT-3 Pro每个视觉行一条,DPT-3 Verity每个词一条。Verity为每个词附加0到1的置信度,取该词中最低的字符级分数,便于把不确定转录转交复核。表格单元格也带有边界框,但Pro不提供单元格级原子定位。Extract V2从该定位生成引用,使提取字段可追溯到特定页面的特定词,支持按坐标进行PII脱敏、文档差异比较和审阅界面。LandingAI提醒,Gen1客户端代码无法在Gen2端点上运行,迁移是必要步骤。