HeadlinesBriefing favicon HeadlinesBriefing.com

PDF中的表格用于RAG:保留网格

Towards Data Science •
×

你需要的数字位于表格中,位于某一行和某一列的交叉点。将PDF压平为文本后,这个交叉点就消失了:标签出现在一个位置,数值出现在另一个位置,模型只能猜测。表格是天真解析悄然丢失答案的地方。本文是《企业文档智能》系列的补充内容,该系列通过四个核心模块构建企业级RAG系统。它将碎片化内容整合为一个连贯的治理,解释表格为何会破坏管道以及应如何应对。刚接触该系列?系列中的每篇文章都位于Towards Data Science作者页面上的Angela Shi和Kezhan Shi的作者页。标准RAG管道读取PDF,将其分割为文本块,对这些块进行嵌入,并检索最匹配的内容。当答案位于表格单元格内时,标准管道开始产生幻觉数字,而且通常在审计师打开源文档之前 никто不会注意到。PDF中的表格在数据意义上不是一个表格,而是页面上绘制的一组矩形,文本定位在单元格中,通常没有显式的行或列标记。解析器必须从空间几何中重建网格。当它未能成功时,三个问题会同时发生:行和列的结构丢失,表头通常只出现在多页表格的第一页,行级引用纪律崩溃。正确的做法不是在文本层面更好地处理表格,而是尽可能早地将它们恢复为原生的结构化形式,并将其视为数据。同一张表格可以在管道中以四种不同的结构层级存在,选择正确的层级是在任何操作执行前的首要设计决策。