HeadlinesBriefing favicon HeadlinesBriefing.com

Таблицы в PDF для RAG: Сохраняйте Сетку

Towards Data Science •
×

Необходимое вам число находится в таблице, на пересечении строки и столбца. При преобразовании PDF в текст это пересечение теряется: метка оказывается в одном месте, значение — в другом, и модель остаётся гадать. Таблицы — это место, где наивный парсинг незаметно теряет ответ. Эта статья является бонусом в серии Корпоративная Интеллектуальная Обработка Документов, которая строит корпоративную систему RAG из четырёх кирпичей. Она объединяет фрагменты в единое связное изложение того, почему таблицы ломают пайплайн и что делать вместо этого. Новичок в серии? Каждая статья серии расположена на страницах авторов Towards Data Science Анжелы Ши и Кэчжана Ши. Стандартный пайплайн RAG читает PDF, разбивает его на текстовые фрагменты, внедряет эти фрагменты и извлекает наилучшее совпадение. В момент, когда ответ находится внутри ячейки таблицы, стандартный пайплайн RAG начинает галлюцинировать числа, и часто никто не замечает этого до тех пор, пока аудитор не откроет исходный документ. Таблица в PDF не является таблицей в смысле данных; это набор прямоугольников, нарисованных на странице, с текстом, расположенным в ячейках, часто без явных маркеров строк или столбцов. Парсер должен восстановить сетку из пространственной геометрии. Когда он этого не достигает, одновременно происходят три вещи: теряется структура строк и столбцов, заголовок часто находится только на первой странице многостраничной таблицы, и нарушается дисциплина ссылки на уровне строк. Правильный подход — не лучше обрабатывать таблицы как текст, а как можно раньше восстанавливать их в их естественной структурированной форме и рассматривать их как данные. Одна и та же таблица может существовать в пайплайне на четырёх разных уровнях структуры, и выбор правильного уровня является первым проектным решением перед выполнением любой операции.