HeadlinesBriefing favicon HeadlinesBriefing.com

Evita el sobre-diseño de RAG: Comienza simple

Hacker News •
×

La mayoría de los equipos sobrediseñan su pila de RAG saltando a embeddings y bases de datos vectoriales, cuando los usuarios simplemente quieren encontrar documentos específicos. Antes de elegir una arquitectura, considera cinco factores clave: frescura de datos, características del corpus, patrones de consulta, escala y capacidades del equipo.

Comienza con BM25 y búsqueda de texto completo (Elasticsearch, Postgres). Este enfoque no tiene complejidad de ML, no tiene costo por consulta, responde en menos de 10ms y es fácil de depurar. Maneja muchos casos de uso eficazmente sin estrategias de chunking o sobrecarga de evaluación. La principal limitación es la falta de sinónimos y el fracaso en consultas semánticas.

Para consultas basadas en palabras clave con coincidencias exactas y terminología propietaria, BM25 es ideal. Cuando los usuarios escriben consultas conversacionales, usa un LLM para reescribirlas en búsquedas de palabras clave limpias. Esto cuesta alrededor de $0.001 por consulta y permite iteraciones rápidas mediante ajustes del prompt del sistema.

Con embeddings, resultados deficientes requieren reembebir todo el corpus y pruebas de regresión. Con la reescritura de consultas, soluciona problemas ajustando el prompt del sistema y prueba inmediatamente. Comienza simple y solo avanza cuando tengas datos que demuestren que necesitas más complejidad.