Papero هي واجهة برمجة تطبيقات سريعة مفتوحة المصدر لاستخراج النص من PDF لا تخزن ملفاتك أبدًا. تستخرج بنية المستند—ترتيب القراءة، الجداول، الصيغ، الأشكال، ومواضع الكتل—بدون مجموعة تقنية ثقيلة. تعمل فقط على CPU، بدون نماذج ML، وتعمل في متصفحك أو Python أو كواجهة API.
الحصول على البنية من PDF—مثل ترتيب الأعمدة، كشف الجداول، والتعرف على الصيغ—يجعل المخرجات قابلة للاستخدام في RAG والبحث وLLM. يستخدم Papero الهندسة البسيطة، ويبقى سريعًا على CPU لابتوب. يعالج ترتيب قراءة عمودين وثلاثة أعمدة، جداول حقيقية (بحدود، بدون حدود، LaTeX booktabs)، صيغ مع مخرجات LaTeX، والمربع المحيط لكل كتلة.
بداية سريعة: `pip install papero-extract` و `from papero_extract import extract`. يتيح لك تطبيق المتصفح تحميل PDF وتصديره دون مغادرة ملفك لجهازك. تشمل الخيارات OCR، استخراج الصور، والمعالجة المجمعة لمجموعات بيانات RAG. تدعم أوامر CLI الاستخراج إلى Markdown وJSON وCSV وHTML والمزيد.
يعالج Papero أيضًا الصفحات الممسوحة ضوئيًا عبر OCR، ويتجاهل النص الأبيض غير المرئي، ويقرأ DOCX/PPTX/XLSX/EPUB/HTML عبر Apache Tika. يتضمن تقرير دقة للمعالجة المجمعة، يوضح المستندات التي تحتاج إلى مراجعة.
المصدر: Hacker News · لخّصه HeadlinesBriefing