HeadlinesBriefing favicon HeadlinesBriefing.com

RAG multi-doc para PDFs sem metadados comuns

Towards Data Science •
×

A construção de um sistema de recuperação que vá além de um único documento geralmente requer um índice com campos compartilhados. No entanto, muitas pastas contêm arquivos não relacionados sem metadados comuns. Pergunte qual coluna eles compartilham. Não há cliente, valor ou data de vigência que signifique o mesmo em todos eles. Quando os documentos não possuem colunas compartilhadas, a indexação tradicional falha. O preparo se reduz então a dois artefatos: uma linha de resumo por arquivo mais a tabela de conteúdos própria de cada arquivo. Isso elimina o mapeamento complexo de esquemas.

A arquitetura depende de um roteador em vez de um leitor para gerar resumos. A recuperação direciona-se em dois níveis, selecionando arquivos relevantes antes que qualquer conteúdo completo entre no prompt. Este método de esboço aninhado garante precisão sem sobrecarregar as janelas de contexto. O framework pertence a uma série sobre inteligência documental corporativa projetada para arquivos não estruturados.

A validação usa uma pasta de 63 PDFs públicos totalizando 4.211 páginas, incluindo controles de segurança da NIST, artigos de aprendizado de máquina e relatórios de mercado. O roteamento filtra arquivos irrelevantes antes da leitura começar. Embora listas planas de arquivos eventualmente deixem de escalar, essa navegação fornece uma base robusta para lidar com coleções diversas.

Entidades Chave: Empresas: NIST, Banco Mundial, arXiv