HeadlinesBriefing favicon HeadlinesBriefing.com

Tablas en PDFs para RAG: Mantén la Cuadrícula

Towards Data Science •
×

El número que necesitas está en una tabla, en la intersección de una fila y una columna. Al aplanar el PDF a texto, esa intersección se pierde: la etiqueta termina en un lugar, el valor en otro, y el modelo queda adivinando. Las tablas son donde el análisis ingenuo pierde silenciosamente la respuesta.

Este artículo es un bonus en la serie Inteligencia de Documentos Empresariales, que construye un sistema RAG empresarial desde cuatro bloques. Consolidamos fragmentos en un tratamiento coherente de por qué las tablas rompen el pipeline y qué hacer en su lugar. ¿Nuevo en la serie? Cada artículo se encuentra en las páginas de autor de Towards Data Science de Angela Shi y Kezhan Shi. El pipeline estándar de RAG lee un PDF, lo divide en fragmentos de texto, incrusta esos fragmentos y recupera la coincidencia más cercana.

En el momento en que la respuesta vive dentro de una celda de tabla, el pipeline estándar comienza a alucinar números, y a menudo nadie se da cuenta hasta que un auditor abre el documento fuente. Una tabla en un PDF no es una tabla en el sentido de datos; es un conjunto de rectángulos dibujados en una página, con texto posicionado en celdas, a menudo sin marcadores explícitos de fila o columna. El analizador tiene que reconstruir la cuadrícula a partir de la geometría espacial.

Cuando no lo logra, tres cosas fallan al mismo tiempo: se pierde la estructura de filas y columnas, el encabezado suele estar solo en la primera página de una tabla de varias páginas, y se rompe la disciplina de citación a nivel de línea. El movimiento correcto no es manejar mejor las tablas como texto, sino restaurarlas a su forma estructurada nativa lo antes posible y tratarlas como datos. La misma tabla puede existir en el pipeline en cuatro niveles diferentes de estructura, y elegir el nivel correcto es la primera decisión de diseño antes de que se ejecute cualquier operación.