HeadlinesBriefing favicon HeadlinesBriefing.com

RAG multi-doc para PDFs sin metadatos comunes

Towards Data Science •
×

La construcción de un sistema de recuperación que supere un único documento suele requerir un índice con campos compartidos. Sin embargo, muchas carpetas contienen archivos no relacionados sin metadatos comunes. Pregunte qué columna comparten. No hay cliente, monto ni fecha efectiva que signifique lo mismo en todos ellos. Cuando los documentos carecen de columnas compartidas, la indexación tradicional falla. La preparación se reduce entonces a dos artefactos: una línea de resumen por archivo más el índice de cada uno. Esto elimina la compleja asignación de esquemas.

La arquitectura depende de un enrutador en lugar de un lector para generar resúmenes. La recuperación se dirige en dos niveles, seleccionando archivos relevantes antes de que cualquier contenido completo ingrese al prompt. Este método de esquema anidado garantiza precisión sin saturar las ventanas de contexto. El marco pertenece a una serie sobre inteligencia documental empresarial diseñada para archivos no estructurados.

La validación utiliza una carpeta de 63 PDFs públicos que suman 4,211 páginas, incluyendo controles de seguridad de NIST, artículos de aprendizaje automático e informes de mercado. El enrutamiento filtra archivos irrelevantes antes de comenzar la lectura. Aunque las listas planas de archivos eventualmente dejan de escalar, esta navegación proporciona una base sólida para manejar colecciones diversas.

Entidades Clave: Empresas: NIST, Banco Mundial, arXiv