HeadlinesBriefing favicon HeadlinesBriefing.com

الجداول في ملفات PDF لـ RAG: احتفظ بالشبكة

Towards Data Science •
×

الرقم الذي تحتاجه موجود في جدول، عند تقاطع صف وعمود. عند تسطيح PDF إلى نص، يضيع هذا التقاطع: ينتهي التسمية في مكان، والقيمة في مكان آخر، ويظل النموذج يتخمين. الجداول هي المكان الذي يفقد فيه التحليل الساذج الإجابة بصمت. هذه المقالة مكافأة في سلسلة ذكاء المستندات المؤسسية، التي تبني نظام RAG مؤسساتي من أربع لبنات. إنها تجمع الأجزاء في معالجة متماسكة توضح لماذا تكسر الجداول الأنبوب وماذا نفعل بدلاً من ذلك. جديد في السلسلة؟ كل مقال في السلسلة موجود على صفحات مؤلف Towards Data Science لأنجيلا شي وكيزهان شي. يقرأ pipeline RAG القياسي PDF، ويقسمه إلى قطع نصية، ويضمّن تلك القطع، ويسترجع أقرب تطابق. في اللحظة التي يعيش فيها الجواب داخل خلية جدول، يبدأ pipeline RAG القياسي في الهلوسة بالأرقام، وغالبًا لا يلاحظ أحد ذلك حتى يفتح مدقق المستند المصدر. الجدول في ملف PDF ليس جدولًا في sentido البيانات؛ بل هو مجموعة من المستطيلات المرسومة على صفحة، مع نص موضع في الخلايا، غالبًا دون علامات صريحة للصف أو العمود. يجب على المحلل إعادة بناء الشبكة من الهندسة المكانية. عندما لا ينجح في ذلك، تسير ثلاثة أشياء خاطئة في آنٍ واحد: تُفقد بنية الصف والعمود، ويكون العنوان غالبًا فقط على الصفحة الأولى من جدول متعدد الصفحات، وتتفكك انضباط الاقتباس على مستوى السطر. الخطوة الصحيحة ليست التعامل مع الجداول بشكل أفضل كنص، بل استعادتها إلى شكلها الهيكلي الأصلي في أقرب وقت ممكن ومعاملتها كبيانات. يمكن للجدول نفسه أن يوجد في pipeline في أربعة مستويات مختلفة من الهيكل، واختيار المستوى الصحيح هو أول قرار تصميم قبل تشغيل أي عملية.