HeadlinesBriefing HeadlinesBriefing.com

Papero तेज़ ओपन-सोर्स PDF टेक्स्ट API

Hacker News •
×

Papero एक तेज़, ओपन-सोर्स PDF टेक्स्ट निष्कर्षण API है जो आपकी फ़ाइलों को कभी संग्रहीत नहीं करता। यह दस्तावेज़ संरचना—पढ़ने का क्रम, तालिकाएँ, सूत्र, आंकड़े और ब्लॉक स्थितियाँ—बिना भारी स्टैक के निकालता है। यह केवल CPU पर चलता है, बिना ML मॉडल के, और आपके ब्राउज़र, Python या API के रूप में काम करता है।

PDF से संरचना प्राप्त करना—जैसे कॉलम क्रम, तालिका पहचान और सूत्र पहचान—आउटपुट को RAG, खोज और LLM के लिए उपयोगी बनाता है। Papero सादा ज्यामिति का उपयोग करता है, लैपटॉप CPU पर तेज़ रहता है। यह दो और तीन कॉलम पढ़ने का क्रम, वास्तविक तालिकाएँ (रूल्ड, बॉर्डरलेस, LaTeX booktabs), LaTeX आउटपुट के साथ सूत्र और प्रत्येक ब्लॉक का बाउंडिंग बॉक्स संभालता है।

त्वरित प्रारंभ: `pip install papero-extract` और `from papero_extract import extract`। ब्राउज़र ऐप आपको PDF लोड करने और निर्यात करने देता है बिना आपकी फ़ाइल को आपकी मशीन से बाहर जाने दिए। विकल्पों में OCR, छवि निष्कर्षण और RAG डेटासेट के लिए बैच प्रोसेसिंग शामिल है। CLI कमांड Markdown, JSON, CSV, HTML और अधिक में निष्कर्षण का समर्थन करते हैं।

Papero OCR के माध्यम से स्कैन किए गए पृष्ठों को भी संभालता है, अदृश्य सफेद टेक्स्ट को हटाता है, और Apache Tika के माध्यम से DOCX/PPTX/XLSX/EPUB/HTML पढ़ता है। इसमें बैच प्रोसेसिंग के लिए एक निष्ठा रिपोर्ट शामिल है, जो दिखाती है कि किन दस्तावेज़ों की समीक्षा की आवश्यकता है।

स्रोत: Hacker News · HeadlinesBriefing द्वारा सारांशित