HeadlinesBriefing favicon HeadlinesBriefing.com

Quebre seu pipeline RAG antes dos usuários

Towards Data Science •
×

A geração aumentada por recuperação (RAG) responde a perguntas usando um corpus de documentos. A avaliação típica envia uma pergunta bem escrita para um corpus organizado e verifica se o recuperador retorna a passagem correta. As coleções de produção raramente permanecem organizadas: páginas antigas permanecem após mudanças de política, os usuários digitam erros como "warehuse", o OCR pode ler "SSO" como "SS0", e tabelas se dividem entre páginas. Cada problema pode enviar o recuperador para a passagem errada, dando ao modelo de linguagem um contexto incorreto.

Um pequeno recuperador com injeção de falhas—adicionando problemas deliberadamente—testa a resposta do sistema. Adicionei uma página de política desatualizada, uma troca de caractere de OCR, um erro de digitação na consulta e uma tabela dividida. O pipeline de brinquedo usa 4 documentos curtos e uma função de pontuação que divide consultas e documentos em tokens minúsculos, dando 1 ponto por token correspondente. A pontuação mais alta vence.

Documentos desatualizados se contradizem: a política de devolução mudou de 60 dias para 30 dias em 2026, mas a ingestão adicionou a nova página sem remover a antiga. Ambos pontuam igualmente, então a ordem da lista retorna a política de 2024. Um desempate por recência corrige isso.

Erros de OCR escondem palavras correspondentes: "Enterprise" se torna "Enterpr1se" e "SSO" se torna "SS0". Todos os documentos empatam em 0, retornando a política de devolução. Uma função de normalização corrige substituições conhecidas de OCR antes da tokenização.

Entidades-chave: Pessoas: Sara Nóbrega