HeadlinesBriefing favicon HeadlinesBriefing.com

RAG के लिए PDF में टेबल: ग्रिड बनाए रखें

Towards Data Science •
×

आपको जो संख्या चाहिए वह एक टेबल में होती है, एक पंक्ति और एक स्तंभ के प्रतिच्छेद बिंदु पर। PDF को टेक्स्ट में flatten करने से वह प्रतिच्छेद बिंदु खो जाता है: लेबल एक जगह पर होता है, मूल्य दूसरे जगह पर, और मॉडल अनुमान लगाने के लिए छोड़ दिया जाता है। टेबल वह जगह है जहां naive पार्सिंग चुपचाप जवाब खो देती है। यह लेख Enterprise Document Intelligence श्रृंखला का एक बोनस है, जो चार ईंटों से एक उद्यम RAG प्रणाली बनाता है। यह टुकड़ों को एक संगत उपचार में एकत्रित करता है कि टेबल पाइपलाइन क्यों तोड़ देती हैं और इसके बजाय क्या करना चाहिए। श्रृंखला में नए हैं? श्रृंखला का हर लेख Towards Data Science के लेखक पृष्ठों पर Angela Shi और Kezhan Shi के लेखक पृष्ठों पर स्थित है। मानक RAG पाइपलाइन एक PDF पढ़ती है, उसे टेक्स्ट के टुकड़ों में तोड़ देती है, उन टुकड़ों को एम्बेड करती है, और सबसे निकटतम मिलान को पुनः प्राप्त करती है। जब जवाब एक टेबल सेल के भीतर रहता है, तो मानक पाइपलाइन संख्याओं का幻觉 (हलूसिनेशन) शुरू कर देती है, और अक्सर कोई भी तब तक नोटिस नहीं करता जब तक कि एक लेखा परीक्षक स्रोत दस्तावेज़ नहीं खोलता। PDF में एक टेबल डेटा意义上 की टेबल नहीं होती है; यह एक पृष्ठ पर खींचे गए आयतों का एक सेट होता है, जिसमें टेक्स्ट सेल में स्थित होता है, अक्सर स्पष्ट पंक्ति या स्तंभ चिह्नों के बिना। पार्सर को स्थानिक ज्यामिति से ग्रिड का पुनर्निर्माण करना पड़ता है। जब यह सफल नहीं होता है, तो एक साथ तीन चीजें गलत हो जाती हैं: पंक्ति और स्तंभ की संरचना खो जाती है, शीर्षक अक्सर एक बहु-पृष्ठ टेबल के पहले पृष्ठ पर ही होता है, और पंक्ति-स्तर उद्धरण अनुशासन टूट जाता है। सही कदम टेक्स्ट के रूप में टेबल को बेहतर तरीके से संभालना नहीं है, बल्कि उन्हें जितनी जल्दी हो सके उनके मूल संरचित रूप में बहाल करना है और उन्हें डेटा के रूप में व्यवहार करना है। एक ही टेबल पाइपलाइन में चार अलग-अलग संरचना स्तरों पर मौजूद हो सकती है, और सही स्तर चुनना किसी भी ऑपरेशन चलने से पहले का पहला डिज़ाइन निर्णय होता है।