返回报告库

AI / Technology

ExtractBench:把企业文档抽取同时按值、完整性、证据和成本来评测

企业文档抽取不只是“读对一个值”。作者要评的是:给定文档和 schema,系统能否输出 schema 合法的 JSON,且每个值都能指回来源页和框。

企业抽取真正难的地方

企业抽取为什么难

现实任务通常不是从固定表格里找几个答案,而是按用户给定的 schema,从整份文档里抽结构化结果,还要保留来源证据。

难点不只在 OCR。长列表会被截断,稀疏事实容易漏,密集表单容易填错,跨页续表和大表格还会把“读到了值”变成“组装错了结构”。

只看准确率的做法会漏掉完整性和可追溯性

旧评估为什么不够

很多旧基准只比较值对不对,没把来源页或框算进去。这样即使系统少抽了一整段记录,也可能只在总分上被部分掩盖。

作者特别指出,部分完整率会掩盖 F1 错误:系统可以输出一个合法数组,但少掉三分之一的行。

基准输入和输出都被严格定义

ExtractBench 的任务定义

任务很简单地说就是:给定文档和 schema,输出 schema-valid JSON。

但作者把输出要求再加了一层:每个值都要带 source page 和 bounding box,文档缺失某字段时必须输出 null。

评测不只看值,还看证据和成本

ExtractBench 的标注与分层

ExtractBench 报告 value F1、word-level F1、page-level F1,并同时记录成本。

value F1 用来评估值准确性,grounding 则看输出是不是指向了正确来源;对 human-verified boxes,还会额外检查字段是否正确指向来源。

这些证据,能把结论推到哪一步

三类系统的权衡

ExtractBench 是一个面向 schema-guided enterprise document extraction 的基准,作者声称它同时评估 value accuracy、record completeness、grounding 和 measured cost。

基准规模为 4,869 页、370 份文档、8 个业务领域、67 类文档类型。

任务要求系统给定文档和 schema,输出 schema-valid JSON,并为每个值提供 source page 和 bounding box 作为 evidence。

摘要层面的结论缺少方差、统计显著性和完整实验协议。

两条实现视角:产品解释和研究跟进

对产品意味着什么

Product interpretation:如果你的系统要进企业流程,优先级不应只是“值对不对”,还要看能否返回页级和框级证据,因为审计和人工复核都依赖它。

Research follow-up:若要继续做研究,最值得追的不是单一总分,而是长文档完整性、跨页表格、扫描件/手写输入,以及 grounding 质量之间的分解关系。

研究附录术语、来源与待验证问题

论文证据

高可信

ExtractBench 是一个面向 schema-guided enterprise document extraction 的基准,作者声称它同时评估 value accuracy、record completeness、grounding 和 measured cost。

摘要与方法段(arXiv HTML full text;Paper section 3/4)

高可信

基准规模为 4,869 页、370 份文档、8 个业务领域、67 类文档类型。

摘要、方法段与 Table 4(arXiv metadata;Paper section 3/6)

高可信

任务要求系统给定文档和 schema,输出 schema-valid JSON,并为每个值提供 source page 和 bounding box 作为 evidence。

Paper section 3/4

高可信

评测使用 value F1、word-level grounding F1、page-level grounding F1,并记录 cost。

Paper section 4

高可信

作者将 14 个系统统一在相同 document–schema 对上评估,未做 benchmark-specific tuning。

Paper section 4

中可信

摘要称商业 VLM 在短文档上表现较好,但在长文档上常截断记录列表;coding agents 准确率更高但成本更高。

摘要(arXiv metadata)

中可信

摘要称 LlamaExtract Agentic Plus 在三项指标上排名第一。

摘要(arXiv metadata)

高可信

Section 5 报告专用 API/系统中,LlamaExtract Agentic Plus 在 1.0/3.1/8.1 ¢/page 时分别达到 86.8%/89.5%/95.6% F1。

Paper section 5

能力边界与局限

  • 摘要层面的结论缺少方差、统计显著性和完整实验协议。
  • 不少系统默认不返回 evidence,因此 grounding 指标会被压低或记为 0。
  • word-level grounding F1 仍低于 50%,说明可追溯定位依然薄弱。
  • 长文档与大表格场景下常见提前停止或整条记录丢弃,主要是 recall 问题。
  • 仅凭当前证据无法确认所有基线的训练设置、价格口径和外部复现情况。

和其他方案放在一起看

方案类型优势限制判断
商业 VLM方法家族低成本区间可用,短文档表现较好。长文档中常截断记录列表;不少配置不返回 evidence,grounding 弱。适合低成本短文档抽取,不适合需要强证据追踪的长文档。
coding agents方法家族准确率更高,摘要称可达到 87–94% F1。成本超过 15 ¢/page。质量更强,但成本明显更高。
专用抽取 API / LlamaExtract Agentic Plus专用系统在 section 5 的报告中,LlamaExtract Agentic Plus 以 1.0/3.1/8.1 ¢/page 达到 86.8%/89.5%/95.6% F1,并在整体性能上最强。word-level grounding F1 仍低于 50%;不同 challenge 上的完整分项数值未在此处给出。在质量—成本之间更平衡,但证据定位仍不够强。

还不能确定的地方

“首个”基准是作者声称,尚未见正文外证据确认。

摘要只给出作者主张,没有外部对照或系统综述。

查阅正文相关讨论与近邻工作综述,或检索同类基准发布时间线。

LlamaExtract Agentic Plus 的完整成本口径和实验设置不清楚。

当前证据只给出部分 cost/F1 数值,没有完整 protocol。

查看正文表格、附录和成本计算说明。

“排名第一”缺少与其他系统的完整数值对照。

摘要未给出全部 baseline 的分项结果。

读取全文主结果表和各 challenge 分表。

grounding 的 page-level 与 word-level 差距表明仅有页面证据仍可能不足,但具体边界不明。

当前材料没有给出每个系统的细粒度误差分析。

检查 word/page 两级 grounding 的对照表和案例分析。

商业 VLM、coding agents 与专用 API 的相对优势可能随任务分布变化。

当前结论主要来自该基准的数据分布与 2026 年 6–7 月可用系统。

在不同文档域、长度和表格结构上复现实验。

术语表

schema-guided extraction
按用户定义的字段结构,从文档里抽出结构化结果。
grounding
抽出来的值能否指回原文中的具体来源位置。
value F1
衡量抽取出来的值有多准确,通常把精确率和召回率合在一起看。
record completeness
一整条记录是否被完整抽出,是否漏行或少字段。
bounding box
页面上某个文本片段的矩形位置,用来标出证据。
coding agent
通过写代码、调用工具、检查结果并反复修正来完成抽取的系统。
VLM
视觉语言模型,直接从图像和文字联合生成输出。
specialized API
面向文档抽取的专用接口,通常自带版面处理和 schema 引导。

参考来源

来源追踪

摘要: 首次同时评估 value accuracy、record completeness、grounding 和 measured cost 的基准 arXiv metadata

摘要: 规模为 4,869 页、370 份文档、8 个业务领域、67 类文档类型 arXiv metadata

第 3 节: 任务要求输出 schema-valid JSON,并附 source page 与 bounding box Paper section 3

第 4 节: 统一报告 value F1、word-level grounding F1、page-level grounding F1 和 cost Paper section 4

第 4 节: 评估 14 个系统,使用相同 document–schema 对,且不做 benchmark-specific tuning Paper section 4

第 5 节: LlamaExtract Agentic Plus 在 1.0/3.1/8.1 ¢/page 时分别达到 86.8%/89.5%/95.6% F1 Paper section 5

第 6 节: 挑战切片包含任务、感知、结构、长度和业务领域,并用于分层标注 Paper section 6

第 7 节: 证据构建结合真实文档、合成长列表和扫描表单等多条管线 Paper section 7

关于这篇论文的三个关键问题

ExtractBench:把企业文档抽取同时按值、完整性、证据和成本来评测 解决了什么问题?

现实任务通常不是从固定表格里找几个答案,而是按用户给定的 schema,从整份文档里抽结构化结果,还要保留来源证据。

ExtractBench:把企业文档抽取同时按值、完整性、证据和成本来评测 的核心结论有哪些证据?

ExtractBench 是一个面向 schema-guided enterprise document extraction 的基准,作者声称它同时评估 value accuracy、record completeness、grounding 和 measured cost。 摘要与方法段(arXiv HTML full text;Paper section 3/4)

阅读 ExtractBench:把企业文档抽取同时按值、完整性、证据和成本来评测 时最需要注意什么局限?

不少系统默认不返回 evidence,因此 grounding 指标会被压低或记为 0。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro