HeadlinesBriefing favicon HeadlinesBriefing.com

Hancurkan Pipeline RAG Anda Sebelum Pengguna

Towards Data Science •
×

Retrieval-augmented generation (RAG) menjawab pertanyaan menggunakan korpus dokumen. Evaluasi tipikal mengirim pertanyaan yang ditulis dengan baik ke korpus yang rapi dan memeriksa apakah retriever mengembalikan bagian yang benar. Koleksi produksi jarang tetap rapi: halaman lama tetap ada setelah perubahan kebijakan, pengguna mengetik salah ketik seperti "warehuse", OCR mungkin membaca "SSO" sebagai "SS0", dan tabel terbagi di seluruh halaman. Setiap masalah dapat mengirim retriever ke bagian yang salah, memberikan model bahasa konteks yang salah.

Retriever kecil dengan injeksi kesalahan—sengaja menambahkan masalah—menguji respons sistem. Saya menambahkan halaman kebijakan usang, pertukaran karakter OCR, salah ketik kueri, dan tabel terbagi. Pipeline mainan menggunakan 4 dokumen pendek dan fungsi penilaian yang membagi kueri dan dokumen menjadi token huruf kecil, memberikan 1 poin per token yang cocok. Skor tertinggi menang.

Dokumen usang bertentangan: kebijakan pengembalian berubah dari 60 hari menjadi 30 hari pada 2026, tetapi pengambilan data menambahkan halaman baru tanpa menghapus yang lama. Keduanya mendapat skor sama, sehingga urutan daftar mengembalikan kebijakan 2024. Tiebreaker kebaruan memperbaiki ini.

Kesalahan OCR menyembunyikan kata yang cocok: "Enterprise" menjadi "Enterpr1se" dan "SSO" menjadi "SS0". Semua dokumen seri di 0, mengembalikan kebijakan pengembalian. Fungsi normalisasi mengoreksi substitusi OCR yang diketahui sebelum tokenisasi.

Entitas Kunci: Orang: Sara Nóbrega