HeadlinesBriefing HeadlinesBriefing.com

Papero দ্রুত ওপেন-সোর্স PDF টেক্সট API

Hacker News •
×

Papero একটি দ্রুত, ওপেন-সোর্স PDF টেক্সট এক্সট্র্যাকশন API যা আপনার ফাইল কখনও সংরক্ষণ করে না। এটি ডকুমেন্ট স্ট্রাকচার—পড়ার ক্রম, টেবিল, সূত্র, চিত্র এবং ব্লক অবস্থান—ভারী স্ট্যাক ছাড়াই বের করে। এটি শুধু CPU-তে চলে, ML মডেল ছাড়া, এবং আপনার ব্রাউজার, Python বা API হিসাবে কাজ করে।

PDF থেকে স্ট্রাকচার পাওয়া—যেমন কলাম ক্রম, টেবিল সনাক্তকরণ এবং সূত্র স্বীকৃতি—আউটপুটকে RAG, সার্চ এবং LLM-এর জন্য ব্যবহারযোগ্য করে তোলে। Papero সরল জ্যামিতি ব্যবহার করে, ল্যাপটপ CPU-তে দ্রুত থাকে। এটি দুই ও তিন কলাম পড়ার ক্রম, বাস্তব টেবিল (রুল্ড, বর্ডারলেস, LaTeX booktabs), LaTeX আউটপুট সহ সূত্র এবং প্রতিটি ব্লকের বাউন্ডিং বক্স পরিচালনা করে।

দ্রুত শুরু: `pip install papero-extract` এবং `from papero_extract import extract`। ব্রাউজার অ্যাপ আপনাকে PDF লোড করতে এবং আপনার ফাইল মেশিন ছাড়াই এক্সপোর্ট করতে দেয়। অপশনের মধ্যে রয়েছে OCR, ইমেজ এক্সট্র্যাকশন এবং RAG ডেটাসেটের জন্য ব্যাচ প্রসেসিং। CLI কমান্ড Markdown, JSON, CSV, HTML এবং আরও অনেক কিছুতে এক্সট্র্যাকশন সমর্থন করে।

Papero OCR-এর মাধ্যমে স্ক্যান করা পৃষ্ঠাও পরিচালনা করে, অদৃশ্য সাদা টেক্সট বাদ দেয় এবং Apache Tika-এর মাধ্যমে DOCX/PPTX/XLSX/EPUB/HTML পড়ে। এতে ব্যাচ প্রসেসিংয়ের জন্য একটি বিশ্বস্ততা রিপোর্ট অন্তর্ভুক্ত রয়েছে, যা দেখায় কোন ডকুমেন্ট পর্যালোচনার প্রয়োজন।

উৎস: Hacker News · সারাংশ: HeadlinesBriefing