HeadlinesBriefing favicon HeadlinesBriefing.com

Rompe tu propio pipeline RAG antes que los usuarios

Towards Data Science •
×

La generación aumentada por recuperación (RAG) responde preguntas utilizando un corpus de documentos. La evaluación típica envía una pregunta bien redactada a un corpus ordenado y comprueba si el recuperador devuelve el pasaje correcto. Las colecciones de producción rara vez se mantienen ordenadas: las páginas antiguas permanecen después de los cambios de política, los usuarios escriben errores tipográficos como "warehuse", el OCR puede leer "SSO" como "SS0" y las tablas se dividen entre páginas. Cada problema puede enviar al recuperador al pasaje equivocado, dando al modelo de lenguaje un contexto incorrecto.

Un recuperador pequeño con inyección de fallos—añadiendo problemas deliberadamente—prueba la respuesta del sistema. Añadí una página de política obsoleta, un intercambio de caracteres OCR, un error tipográfico en la consulta y una tabla dividida. El pipeline de juguete utiliza 4 documentos cortos y una función de puntuación que divide las consultas y los documentos en tokens en minúsculas, dando 1 punto por cada token coincidente. La puntuación más alta gana.

Los documentos obsoletos se contradicen: la política de devoluciones cambió de 60 días a 30 días en 2026, pero la ingesta añadió la nueva página sin eliminar la antigua. Ambos puntúan igual, por lo que el orden de la lista devuelve la política de 2024. Un desempate por recencia soluciona esto.

Los errores de OCR ocultan palabras coincidentes: "Enterprise" se convierte en "Enterpr1se" y "SSO" se convierte en "SS0". Todos los documentos empatan a 0, devolviendo la política de devoluciones. Una función de normalización corrige las sustituciones de OCR conocidas antes de la tokenización.

Entidades clave: Personas: Sara Nóbrega