HeadlinesBriefing favicon HeadlinesBriefing.com

RAG multi-doc pour PDF sans métadonnées communes

Towards Data Science •
×

La création d'un système de récupération dépassant un seul document nécessite généralement un index avec des champs partagés. Pourtant, de nombreux dossiers contiennent des fichiers non liés sans métadonnées communes. Demandez quelle colonne ils partagent. Aucun client, montant ou date d'effet ne signifie la même chose pour tous. Lorsque les documents manquent de colonnes partagées, l'indexation traditionnelle échoue. La préparation se réduit alors à deux artefacts : une ligne de résumé par fichier plus la table des matières propre à chaque fichier. Cela élimine le mappage de schéma complexe.

L'architecture repose sur un routeur plutôt qu'un lecteur pour générer des résumés. La récupération s'enracine sur deux niveaux, sélectionnant les fichiers pertinents avant qu'aucun contenu complet n'entre dans le prompt. Cette méthode de plan imbriqué garantit la précision sans submerger les fenêtres de contexte. Le cadre fait partie d'une série sur l'intelligence documentaire d'entreprise conçue pour les archives non structurées.

La validation utilise un dossier de 63 PDF publics totalisant 4 211 pages, incluant les contrôles de sécurité de NIST, des articles sur l'apprentissage automatique et des rapports de marché. Le routage filtre les fichiers non pertinents avant la lecture. Bien que les listes de fichiers plats cessent finalement de passer à l'échelle, cette navigation fournit une base robuste pour gérer des collections diverses.

Entités clés : Entreprises : NIST, Banque mondiale, arXiv