HeadlinesBriefing favicon HeadlinesBriefing.com

RAGのためのPDFの表格:グリッドを保持する

Towards Data Science •
×

あなたが必要とする数字は、表の行と列の交点にあります。PDFをテキストに平坦化すると、その交点が失われます:ラベルは一方に、値はもう一方にあり、モデルは推測を余儀なくされます。表格は naive パースが答えを静かに失う場所です。この記事は、Enterprise Document Intelligence シリーズのボーナス記事で、4つのブロックからエンタープライズ RAG システムを構築します。これは、断片を統合し、表格がパイプラインを壊す理由とそれに代わる対処法を一貫して説明します。シリーズに初めて触れる方へ?シリーズのすべての記事は、Towards Data Science の著者ページにある Angela Shi と Kezhan Shi の著者ページに掲載されています。標準的な RAG パイプラインは、PDF を読み込み、テキストのチャンクに分割し、それらのチャンクを埋め込み、最も類似したチャンクを取得します。答えが表のセル内にあるとき、標準パイプラインは数字の幻覚を開始し、しばしば誰も気づかず、監査人がソースドキュメントを開くまで気づかれません。PDF の表格は、データの意味での表格ではありません:ページ上に描かれた長方形の集合で、テキストがセルに配置されており、しばしば明示的な行または列のマーカーがありません。パーサーは、空間的な幾何学からグリッドを再構築しなければなりません。それが成功しないとき、3 つのことが同時に起こります:行と列の構造が失われ、ヘッダーは多ページ表格の最初のページのみにあることが多く、行レベルの引用規律が崩れます。正しいアプローチは、テキストとして表格をよりよく扱うことではなく、できるだけ早くそれらをネイティブな構造化形式に戻し、データとして扱うことです。同じ表格は、パイプラインにおいて 4 つの異なる構造レベルで存在でき、どの操作を実行する前に、適切なレベルを選ぶことが最初の設計決定となります。