AI / Technology
ExtractBench:把企业文档抽取同时按值、完整性、证据和成本来评测
企业文档抽取不只是“读对一个值”。作者要评的是:给定文档和 schema,系统能否输出 schema 合法的 JSON,且每个值都能指回来源页和框。
企业抽取真正难的地方
现实任务通常不是从固定表格里找几个答案,而是按用户给定的 schema,从整份文档里抽结构化结果,还要保留来源证据。
难点不只在 OCR。长列表会被截断,稀疏事实容易漏,密集表单容易填错,跨页续表和大表格还会把“读到了值”变成“组装错了结构”。
只看准确率的做法会漏掉完整性和可追溯性
很多旧基准只比较值对不对,没把来源页或框算进去。这样即使系统少抽了一整段记录,也可能只在总分上被部分掩盖。
作者特别指出,部分完整率会掩盖 F1 错误:系统可以输出一个合法数组,但少掉三分之一的行。
基准输入和输出都被严格定义
任务很简单地说就是:给定文档和 schema,输出 schema-valid JSON。
但作者把输出要求再加了一层:每个值都要带 source page 和 bounding box,文档缺失某字段时必须输出 null。
评测不只看值,还看证据和成本
ExtractBench 报告 value F1、word-level F1、page-level F1,并同时记录成本。
value F1 用来评估值准确性,grounding 则看输出是不是指向了正确来源;对 human-verified boxes,还会额外检查字段是否正确指向来源。
这些证据,能把结论推到哪一步
ExtractBench 是一个面向 schema-guided enterprise document extraction 的基准,作者声称它同时评估 value accuracy、record completeness、grounding 和 measured cost。
基准规模为 4,869 页、370 份文档、8 个业务领域、67 类文档类型。
任务要求系统给定文档和 schema,输出 schema-valid JSON,并为每个值提供 source page 和 bounding box 作为 evidence。
摘要层面的结论缺少方差、统计显著性和完整实验协议。
两条实现视角:产品解释和研究跟进
Product interpretation:如果你的系统要进企业流程,优先级不应只是“值对不对”,还要看能否返回页级和框级证据,因为审计和人工复核都依赖它。
Research follow-up:若要继续做研究,最值得追的不是单一总分,而是长文档完整性、跨页表格、扫描件/手写输入,以及 grounding 质量之间的分解关系。
研究附录术语、来源与待验证问题
论文证据
ExtractBench 是一个面向 schema-guided enterprise document extraction 的基准,作者声称它同时评估 value accuracy、record completeness、grounding 和 measured cost。
摘要与方法段(arXiv HTML full text;Paper section 3/4)
基准规模为 4,869 页、370 份文档、8 个业务领域、67 类文档类型。
摘要、方法段与 Table 4(arXiv metadata;Paper section 3/6)
任务要求系统给定文档和 schema,输出 schema-valid JSON,并为每个值提供 source page 和 bounding box 作为 evidence。
Paper section 3/4
评测使用 value F1、word-level grounding F1、page-level grounding F1,并记录 cost。
Paper section 4
作者将 14 个系统统一在相同 document–schema 对上评估,未做 benchmark-specific tuning。
Paper section 4
摘要称商业 VLM 在短文档上表现较好,但在长文档上常截断记录列表;coding agents 准确率更高但成本更高。
摘要(arXiv metadata)
摘要称 LlamaExtract Agentic Plus 在三项指标上排名第一。
摘要(arXiv metadata)
Section 5 报告专用 API/系统中,LlamaExtract Agentic Plus 在 1.0/3.1/8.1 ¢/page 时分别达到 86.8%/89.5%/95.6% F1。
Paper section 5
能力边界与局限
- 摘要层面的结论缺少方差、统计显著性和完整实验协议。
- 不少系统默认不返回 evidence,因此 grounding 指标会被压低或记为 0。
- word-level grounding F1 仍低于 50%,说明可追溯定位依然薄弱。
- 长文档与大表格场景下常见提前停止或整条记录丢弃,主要是 recall 问题。
- 仅凭当前证据无法确认所有基线的训练设置、价格口径和外部复现情况。
和其他方案放在一起看
还不能确定的地方
“首个”基准是作者声称,尚未见正文外证据确认。
摘要只给出作者主张,没有外部对照或系统综述。
查阅正文相关讨论与近邻工作综述,或检索同类基准发布时间线。
LlamaExtract Agentic Plus 的完整成本口径和实验设置不清楚。
当前证据只给出部分 cost/F1 数值,没有完整 protocol。
查看正文表格、附录和成本计算说明。
“排名第一”缺少与其他系统的完整数值对照。
摘要未给出全部 baseline 的分项结果。
读取全文主结果表和各 challenge 分表。
grounding 的 page-level 与 word-level 差距表明仅有页面证据仍可能不足,但具体边界不明。
当前材料没有给出每个系统的细粒度误差分析。
检查 word/page 两级 grounding 的对照表和案例分析。
商业 VLM、coding agents 与专用 API 的相对优势可能随任务分布变化。
当前结论主要来自该基准的数据分布与 2026 年 6–7 月可用系统。
在不同文档域、长度和表格结构上复现实验。
术语表
- schema-guided extraction
- 按用户定义的字段结构,从文档里抽出结构化结果。
- grounding
- 抽出来的值能否指回原文中的具体来源位置。
- value F1
- 衡量抽取出来的值有多准确,通常把精确率和召回率合在一起看。
- record completeness
- 一整条记录是否被完整抽出,是否漏行或少字段。
- bounding box
- 页面上某个文本片段的矩形位置,用来标出证据。
- coding agent
- 通过写代码、调用工具、检查结果并反复修正来完成抽取的系统。
- VLM
- 视觉语言模型,直接从图像和文字联合生成输出。
- specialized API
- 面向文档抽取的专用接口,通常自带版面处理和 schema 引导。
参考来源
来源追踪
摘要: 首次同时评估 value accuracy、record completeness、grounding 和 measured cost 的基准 arXiv metadata
摘要: 规模为 4,869 页、370 份文档、8 个业务领域、67 类文档类型 arXiv metadata
第 3 节: 任务要求输出 schema-valid JSON,并附 source page 与 bounding box Paper section 3
第 4 节: 统一报告 value F1、word-level grounding F1、page-level grounding F1 和 cost Paper section 4
第 4 节: 评估 14 个系统,使用相同 document–schema 对,且不做 benchmark-specific tuning Paper section 4
第 5 节: LlamaExtract Agentic Plus 在 1.0/3.1/8.1 ¢/page 时分别达到 86.8%/89.5%/95.6% F1 Paper section 5
第 6 节: 挑战切片包含任务、感知、结构、长度和业务领域,并用于分层标注 Paper section 6
第 7 节: 证据构建结合真实文档、合成长列表和扫描表单等多条管线 Paper section 7
关于这篇论文的三个关键问题
ExtractBench:把企业文档抽取同时按值、完整性、证据和成本来评测 解决了什么问题?
现实任务通常不是从固定表格里找几个答案,而是按用户给定的 schema,从整份文档里抽结构化结果,还要保留来源证据。
ExtractBench:把企业文档抽取同时按值、完整性、证据和成本来评测 的核心结论有哪些证据?
ExtractBench 是一个面向 schema-guided enterprise document extraction 的基准,作者声称它同时评估 value accuracy、record completeness、grounding 和 measured cost。 摘要与方法段(arXiv HTML full text;Paper section 3/4)
阅读 ExtractBench:把企业文档抽取同时按值、完整性、证据和成本来评测 时最需要注意什么局限?
不少系统默认不返回 evidence,因此 grounding 指标会被压低或记为 0。