HeadlinesBriefing favicon HeadlinesBriefing.com

RAG-এর জন্য PDF-এ টেবিল: গ্রিডটি রাখুন

Towards Data Science •
×

আপনার প্রয়োজনীয় সংখ্যা একটি টেবিলে অবস্থিত থাকে, একটি সারি এবং একটি কলামের 교차点ে। PDFকে টেক্সটে flatten করলে সেই 교차点 forsvinder: লেবেল একটি জায়গায় থাকে, মান অন্য জায়গায়, এবং মডেল অনুমান लगाने के लिए छोड़ दिया जाता है। টেবিল হল nơi naive পার্সিং চুপচাপ উত্তর হারিয়ে দেয়। এই নিবন্ধটি Enterprise Document Intelligence সিরিজের একটি বোনাস, যা চারটি bricks থেকে একটি উদ্যোগ RAG সিস্টেম তৈরি করে। এটি টুকরা টুকরাকে একটি সামঞ্জস্যপূর্ণ উপचारে একত্রিত করে যা ব্যাখ্যা করে টেবিল কেন পাইপলাইন ভাঙে এবং इसके পরিবর্তে কি করা উচিত। সিরিজে নতুন আছেন? সিরিজের প্রতিটি নিবন্ধ Towards Data Science লেখক পৃষ্ঠগুলে Angela Shi এবং Kezhan Shi-র লেখক পৃষ্ঠে অবস্থিত है। স্ট্যান্ডার্ড RAG পাইপলাইন একটি PDF পড়ে, তা টেক্সটের টুকরোতে ভাগ করে, সেই টুকরোদের এম্বেড করে এবং সবচেয়ে কাছের মিল খুঁজে পায়। যখন উত্তর একটি টেবিল সেলের ভিতরে থাকে, তখন স্ট্যান্ডার্ড পাইপলাইন সংখ্যার হালুসিনেশন শুরু করে, এবং প্রায়শই কোনো אחד तब तक নোটিশ नहीं करता जब तक कि一个 オडिटर সোর্স ডকুমেন্ট খুলে না। PDF-এ একটি টেবিল ডেটা意义上の টেবিল নয়; এটি একটি পৃষ্ঠায় আঁকা আয়তের সেট, যার মধ্যে টেক্সট সেলে অবস্থিত থাকে, প্রায়শই স্পষ্ট সারি বা কলাম চিহ্নের ausenciaে। পার্সারকে স্থানিক জ্যামিতি থেকে গ্রিডের পুনর্নির্মাণ করতে হয়। যখন এটি সফল হয় না, তখন একসাথে তিনটি ভুল ঘটে: সারি এবং কলামের গঠন হার যায়, হেডার প্রায়শই একটি মাল্টিপেজ টেবিলের প্রথম পৃষ্ঠায়ই থাকে, এবং লাইন-স্তর উদ্ধৃতি শাসন ভাঙে। সঠিক ধাপটি টেক্সট হিসেবে টেবিলকে ভালোভাবে হ্যান্ডল করা নয়, বরং যত তাড়াতাড়ি সম্ভব তাদের মৌলিক স্ট্রাকচার্ড রূপে পুনরুদ্ধার করা এবং তাদের ডেটা হিসেবে ব্যবহার করা। একই টেবিল পাইপলাইনে চারটি ভিন্ন গঠন স্তরে থাকতে পারে, এবং সঠিক স্তর বেছে নেওয়া কোনো অপারেশন চালানোর আগে প্রথম ডিজাইন সিদ্ধান্ত।