PDF 表格抽取如何验收:合并表头、跨页续表与单元格证据映射

PDF 表格中的文字全部识别正确,仍可能因列错位、合并表头丢失或跨页拼接错误而生成错误数据。本文把表格抽取拆为区域、网格、表头路径和证据映射,结合构造的质量检验表说明如何保存结构、连接续页、区分空白与零值,并用面向业务字段的验收方法决定哪些结果能够自动进入下游。

一份质量检验表同时列出甲、乙两个批次的检验数和合格数。如果四个数字都被识别出来,却被接到了错误批次上,字符准确率可以很好,计算结果仍然错误。PDF 表格抽取应验证“哪个值属于哪一行、哪一列、哪组表头”,而不只是能否导出电子表格。以下提出可实施的结构验收方法,所有数据均为构造示例。

把表格识别拆成四种不同的问题

第一种问题是找到表格区域,避免把标题、页脚或旁边正文当成数据。第二种是识别行、列和跨行跨列单元格。第三种是理解表头角色,例如上层“甲批次”下分别有“检验数”和“合格数”。第四种是把识别到的文字放回正确单元格,并保存原页位置。前一层出错,会影响后面许多字段。

Microsoft 的 Table Transformer 项目分别处理表格检测与结构识别,数据标注也覆盖行列、空白单元格和表头等结构。[1] 这说明表格是一种二维结构对象,而不是按阅读顺序拼接的字符串。项目基准表现不能直接作为企业扫描表单的正确率保证,尤其是材料版式、语言和成像条件不同时。

本文建议把区域定位、结构恢复、文字识别和业务映射的错误分开记录。这样才能决定改进扫描质量、换解析方式、调整结构模型,还是修正字段定义。仅增加大模型提示词,无法稳定解决已经被前置解析删除的表头关系。

保留结构中间层,再生成业务字段

中间层至少保留文件及版本、页码、表格编号、单元格编号、起止行列、原始文本和原页坐标。坐标要写明使用像素还是页面坐标、原点与缩放关系,旋转或裁剪后仍能还原到原件。对于跨页表格,一个逻辑字段可以对应多处证据,而不应强行压成一个页码。

合并单元格应显式记录覆盖范围,不要立即复制成多个独立值。多层表头则展开成有序路径,例如“甲批次/合格数”,而非只保留最后一层“合格数”。如果存在行分组,也保留分组名称与作用范围。先保存这些关系,再通过经过确认的映射规则生成业务字段。

空白单元格至少可能表示原文留空、延续上方分组、未适用,或者识别失败。只有版式和业务约定共同支持时才能继承上方标签,数字区不能一律向下填充。原文的横线也不是天然的零值;无法确定其含义时保留原符号与未决状态。

大模型结构化输出入库前的校验仍然必要。本篇增加的是更早的一层:证明字段来自正确的二维位置与表头路径。一个符合 JSON Schema 的对象,可以完整保留错误的列归属,格式校验无法替代这种来源检查。

构造示例:字符都对,两个批次仍然被交换

假设原表只有一个检验项目“尺寸”,列顺序为甲批次检验数100、甲批次合格数98、乙批次检验数80、乙批次合格数72。甲批次和乙批次各自跨两列,下一层表头重复出现“检验数、合格数”。正确结果应是甲批次合格比例98%,乙批次90%。这些数字只用于说明错误机制。

如果解析器丢掉上层批次表头,只得到两组同名字段,下游可能将第二组分配给甲批次。100、98、80、72没有一个字符错,数量关系也仍然合理,却把两个批次的结论对调。甚至整表总检验数180、总合格数170仍然一致,单靠总数对账不能发现错误。

验收应检查每个数字的复合标识:项目、批次、度量名称和单位,并追溯对应单元格。对关键字段,参考标注应同时给出值和归属,不要只保存一个无位置的答案集合。复核界面需要并排显示原表区域与候选字段,让审核者能直接看到列是否偏移。

若上层表头被裁掉,系统可以识别四个数字,但不能自行恢复批次名称。合格处理是报告表头证据缺失并请求原页或转人工,不是根据数值大小猜哪个批次更早。通过拒绝无依据映射来阻止错误进入下游,也是验收的一部分。

跨页续表先证明连续,再移除重复表头

续页拼接应考虑原文表号、续表标记、列数量与相对位置、表头路径、单位、上下页内容以及行标识。没有一种线索单独足以证明连续:同一文件内可能存在多张同版式表格,下一页也可能开始一个新批次或新单位。本文建议把这些线索记录成拼接依据,存在冲突时停止自动合并。

只有确认上下页属于同一逻辑表,才识别并去除续页重复表头。重复表头应保留其来源记录,不能从证据链中删除。若上一页末行在下一页继续,需要判断是否是同一项目的文本续行;不能因为第一列为空就总是合并,原文也可能真的缺少项目名称。

页尾“本页小计”、表末“总计”和真实明细应有不同角色。先按角色分离,再决定是否进入下游计算;把小计当明细会重复累加。页脚注释若规定单位、排除范围或特殊含义,应关联到受影响区域,而非混入最后一行的数值字段。

构造反例:第一页单位为毫米,第二页采用相同列名但单位为厘米。如果只按列名拼接,数值会被当成同一口径。即使允许按明确规则换算,也必须保存原单位、换算规则和来源,不能在抽取时静默归一化后丢失证据。

解析路线要按错误类型选择

数字原生 PDF 可以先利用嵌入文字与位置;扫描件则通常需要光学字符识别,即 OCR,获取文字候选。两类文件都可能需要版面和表格结构识别。嵌入文本不一定按可见阅读顺序排列,OCR 有文字也不代表行列已经恢复,因此应以同一标注集比较完整输出,而非只看文本是否可复制。

Docling 文档提供表格结构识别与单元格匹配选项,并说明在多列被错误合并时,调整匹配方式可能改善输出。[3] 这提供了可测试的诊断方向,不意味着关闭某选项就普遍更好。固定实际版本与配置,只改变待验证因素,再检查其他版式是否退化。

基于图像的模型可辅助识别复杂表头和异常区域,但应返回可核对的位置与关系;不要让第二个模型只阅读已经错位的线性文本,再把两次一致当作独立验证。保留原图、可见表线、坐标和不同解析结果,有助于揭露同源错误。

成本上,可先处理清晰且规则的表格,把结构冲突、低清晰度和关键字段缺失的部分送入更昂贵的识别或人工复核。分流条件应由已标注错误分析确定,而不是把模型自报置信度直接当成业务放行概率。

用结构指标与业务字段指标共同验收

GriTS 研究以矩阵形式比较预测表格和参考表格,为结构识别评估提供了方法。[2] 工程团队可以利用结构指标定位整体质量,但还需单独考察关键字段的值、表头路径、单位与来源是否共同正确。高平均分可能掩盖一个影响整列的表头错误,不能仅据平均指标允许自动入库。

建议至少报告四项:应抽取表格的检出情况;关键单元格归属正确比例;约定关键字段全部正确的整表比例;自动放行中被发现的错误比例。每项都写清分母,漏检表格不能从整表成功统计中消失。人工未覆盖的结果也不能直接视为已验证正确。

测试材料应按扫描与原生、单层与多层表头、跨页与单页、规则与不规则合并单元格分层。训练或调参所见的同模板近重复文件与独立验收文件分开,避免只测熟悉版式。参考标注允许明确的结构等价,但必须事先规定等价关系,不能在看到结果后为了提分随意改标准。

建立小型反例集:交换两组上层表头,结果的批次归属应随之变化;删去上层表头,应进入待审;插入续页重复表头,不应新增业务明细;移除一页,不能仍宣称整表完整;加入小计行,不应重复求和。这些是建议的验收动作,本文没有运行模型或给出实测成绩。

交付应包含可回到原件的结果包

一份可维护的交付包应同时包含原文件版本、解析配置、结构中间层、业务映射规则、校验状态和异常清单。人工修订需要记录改了哪个单元格、依据是什么,以及哪些下游字段受影响;后续换模型或重跑时,不能无提示地覆盖已确认修订。

当目标系统只接收平面表时,可以导出最终字段,但完整结构与证据另行保存,并通过稳定编号关联。批量上线前先确认审核工时和积压处理能力:如果大量复杂表都只能靠人工,应该缩小自动化范围或改善输入,而不是把待审条目隐藏在一份看似成功的 Excel 里。

PDF 表格抽取的目标不是复刻一个好看的表格,而是让每条业务事实保留正确归属和可查证来源。将二维结构、字段含义和自动放行条件共同验收,才有可能把文档变成可靠的数据输入。

参考资料

  1. [1] Microsoft: Table Transformer / PubTables-1M official repository
  2. [2] Smock et al.: GriTS: Grid table similarity metric for table structure recognition (2022; revised 2023)
  3. [3] Docling: Advanced options — table structure and cell matching (accessed 2026-10-06)
返回洞察
鲁ICP备2024109755号-2
可拖动移动。右键、长按或按 Shift+F10 可选择停靠位置。