HeadlinesBriefing favicon HeadlinesBriefing.com

Evite a sobreengenharia RAG: Comece simples

Hacker News •
×

A maioria das equipes sobreengenha sua pilha RAG saltando diretamente para embeddings e bancos de dados vetoriais, quando os usuários simplesmente querem encontrar documentos específicos. Antes de escolher uma arquitetura, considere cinco fatores-chave: frescor dos dados, características do corpus, padrões de consulta, escala e capacidades da equipe.

Comece com BM25 e busca de texto completo (Elasticsearch, Postgres). Essa abordagem não tem complexidade de ML, não custa nada por consulta, roda em menos de 10ms e é fácil de depurar. Ela lida com muitos casos de uso efetivamente sem estratégias de chunking ou overhead de avaliação. A principal limitação é a falta de sinônimos e falhar em consultas semânticas.

Para consultas pesadas em palavras-chave com correspondências exatas e terminologia proprietária, BM25 é ideal. Quando os usuários escrevem consultas conversacionais, use um LLM para reescrevê-las em buscas de palavras-chave limpas. Isso custa cerca de $0,001 por consulta e permite iterações rápidas via ajustes do prompt do sistema.

Com embeddings, resultados ruins exigem reembadir todo o corpus e testes de regressão. Com reescrita de consultas, corrija problemas ajustando o prompt do sistema e teste imediatamente. Comece simples e avance apenas quando tiver dados comprovando que você precisa de mais complexidade.