Lightweight PDF parser with layout, tables, formulas and bounding boxes
🇬🇧 English
Papero is a fast, open-source PDF text extraction API that never stores your files. It extracts document structure—reading order, tables, formulas, figures, and block positions—without a heavyweight stack. It runs on CPU only, with no ML models, and works in your browser, Python, or as an API.
Getting structure from a PDF—like column order, table detection, and formula recognition—makes output usable for RAG, search, and LLMs. Papero uses plain geometry, staying fast on a laptop CPU. It handles two- and three-column reading order, real tables (ruled, borderless, LaTeX booktabs), formulas with LaTeX output, and every block's bounding box.
Quick start: `pip install papero-extract` and `from papero_extract import extract`. The browser app lets you load a PDF and export without your file leaving your machine. Options include OCR, image extraction, and batch processing for RAG datasets. CLI commands support extraction to Markdown, JSON, CSV, HTML, and more.
Papero also handles scanned pages via OCR, drops invisible white text, and reads DOCX/PPTX/XLSX/EPUB/HTML through Apache Tika. It includes a fidelity report for batch processing, showing which documents need review.
🇸🇦 العربية
Papero: واجهة برمجة تطبيقات سريعة مفتوحة المصدر لاستخراج النص من PDF
Papero هي واجهة برمجة تطبيقات سريعة مفتوحة المصدر لاستخراج النص من PDF لا تخزن ملفاتك أبدًا. تستخرج بنية المستند—ترتيب القراءة، الجداول، الصيغ، الأشكال، ومواضع الكتل—بدون مجموعة تقنية ثقيلة. تعمل فقط على CPU، بدون نماذج ML، وتعمل في متصفحك أو Python أو كواجهة API.
الحصول على البنية من PDF—مثل ترتيب الأعمدة، كشف الجداول، والتعرف على الصيغ—يجعل المخرجات قابلة للاستخدام في RAG والبحث وLLM. يستخدم Papero الهندسة البسيطة، ويبقى سريعًا على CPU لابتوب. يعالج ترتيب قراءة عمودين وثلاثة أعمدة، جداول حقيقية (بحدود، بدون حدود، LaTeX booktabs)، صيغ مع مخرجات LaTeX، والمربع المحيط لكل كتلة.
بداية سريعة: `pip install papero-extract` و `from papero_extract import extract`. يتيح لك تطبيق المتصفح تحميل PDF وتصديره دون مغادرة ملفك لجهازك. تشمل الخيارات OCR، استخراج الصور، والمعالجة المجمعة لمجموعات بيانات RAG. تدعم أوامر CLI الاستخراج إلى Markdown وJSON وCSV وHTML والمزيد.
يعالج Papero أيضًا الصفحات الممسوحة ضوئيًا عبر OCR، ويتجاهل النص الأبيض غير المرئي، ويقرأ DOCX/PPTX/XLSX/EPUB/HTML عبر Apache Tika. يتضمن تقرير دقة للمعالجة المجمعة، يوضح المستندات التي تحتاج إلى مراجعة.
كيف يستخرج Papero بنية PDF بدون نماذج ML؟
يستخدم Papero الهندسة البسيطة لتحليل تخطيط PDF، وتحديد ترتيب القراءة وحدود الجداول ومواضع الصيغ من خلال قواعد مكانية بدلاً من التعلم الآلي. هذا يبقيه سريعًا على CPU لابتوب ويتجنب الحاجة إلى GPU أو تبعيات ثقيلة.
🇧🇩 বাংলা
Papero: দ্রুত ওপেন-সোর্স PDF টেক্সট এক্সট্র্যাকশন API
Papero একটি দ্রুত, ওপেন-সোর্স PDF টেক্সট এক্সট্র্যাকশন API যা আপনার ফাইল কখনও সংরক্ষণ করে না। এটি ডকুমেন্ট স্ট্রাকচার—পড়ার ক্রম, টেবিল, সূত্র, চিত্র এবং ব্লক অবস্থান—ভারী স্ট্যাক ছাড়াই বের করে। এটি শুধু CPU-তে চলে, ML মডেল ছাড়া, এবং আপনার ব্রাউজার, Python বা API হিসাবে কাজ করে।
PDF থেকে স্ট্রাকচার পাওয়া—যেমন কলাম ক্রম, টেবিল সনাক্তকরণ এবং সূত্র স্বীকৃতি—আউটপুটকে RAG, সার্চ এবং LLM-এর জন্য ব্যবহারযোগ্য করে তোলে। Papero সরল জ্যামিতি ব্যবহার করে, ল্যাপটপ CPU-তে দ্রুত থাকে। এটি দুই ও তিন কলাম পড়ার ক্রম, বাস্তব টেবিল (রুল্ড, বর্ডারলেস, LaTeX booktabs), LaTeX আউটপুট সহ সূত্র এবং প্রতিটি ব্লকের বাউন্ডিং বক্স পরিচালনা করে।
দ্রুত শুরু: `pip install papero-extract` এবং `from papero_extract import extract`। ব্রাউজার অ্যাপ আপনাকে PDF লোড করতে এবং আপনার ফাইল মেশিন ছাড়াই এক্সপোর্ট করতে দেয়। অপশনের মধ্যে রয়েছে OCR, ইমেজ এক্সট্র্যাকশন এবং RAG ডেটাসেটের জন্য ব্যাচ প্রসেসিং। CLI কমান্ড Markdown, JSON, CSV, HTML এবং আরও অনেক কিছুতে এক্সট্র্যাকশন সমর্থন করে।
Papero OCR-এর মাধ্যমে স্ক্যান করা পৃষ্ঠাও পরিচালনা করে, অদৃশ্য সাদা টেক্সট বাদ দেয় এবং Apache Tika-এর মাধ্যমে DOCX/PPTX/XLSX/EPUB/HTML পড়ে। এতে ব্যাচ প্রসেসিংয়ের জন্য একটি বিশ্বস্ততা রিপোর্ট অন্তর্ভুক্ত রয়েছে, যা দেখায় কোন ডকুমেন্ট পর্যালোচনার প্রয়োজন।
Papero কীভাবে ML মডেল ছাড়া PDF স্ট্রাকচার বের করে?
Papero PDF লেআউট বিশ্লেষণ করতে সরল জ্যামিতি ব্যবহার করে, মেশিন লার্নিংয়ের পরিবর্তে স্থানিক নিয়মের মাধ্যমে পড়ার ক্রম, টেবিল সীমানা এবং সূত্র অবস্থান নির্ধারণ করে। এটি ল্যাপটপ CPU-তে দ্রুত রাখে এবং GPU বা ভারী নির্ভরতার প্রয়োজন এড়ায়।
🇩🇪 Deutsch
Papero: Schnelle Open-Source-PDF-Text-Extraktion-API
Papero ist eine schnelle Open-Source-PDF-Text-Extraktion-API, die Ihre Dateien niemals speichert. Sie extrahiert die Dokumentstruktur—Lesereihenfolge, Tabellen, Formeln, Abbildungen und Blockpositionen—ohne einen schweren Stack. Sie läuft nur auf der CPU, ohne ML-Modelle, und funktioniert in Ihrem Browser, Python oder als API.
Das Abrufen der Struktur aus einem PDF—wie Spaltenreihenfolge, Tabellenerkennung und Formelerkennung—macht die Ausgabe für RAG, Suche und LLMs nutzbar. Papero verwendet einfache Geometrie und bleibt auf einer Laptop-CPU schnell. Es verarbeitet die Lesereihenfolge von zwei und drei Spalten, echte Tabellen (mit Linien, ohne Linien, LaTeX booktabs), Formeln mit LaTeX-Ausgabe und den Begrenzungsrahmen jedes Blocks.
Schnellstart: `pip install papero-extract` und `from papero_extract import extract`. Die Browser-App ermöglicht es Ihnen, ein PDF zu laden und zu exportieren, ohne dass Ihre Datei Ihren Rechner verlässt. Zu den Optionen gehören OCR, Bildextraktion und Batch-Verarbeitung für RAG-Datensätze. CLI-Befehle unterstützen die Extraktion in Markdown, JSON, CSV, HTML und mehr.
Papero verarbeitet auch gescannte Seiten über OCR, verwirft unsichtbaren weißen Text und liest DOCX/PPTX/XLSX/EPUB/HTML über Apache Tika. Es enthält einen Treuebericht für die Batch-Verarbeitung, der zeigt, welche Dokumente überprüft werden müssen.
Wie extrahiert Papero PDF-Struktur ohne ML-Modelle?
Papero verwendet einfache Geometrie, um das PDF-Layout zu analysieren, und bestimmt Lesereihenfolge, Tabellengrenzen und Formelpositionen durch räumliche Regeln anstelle von maschinellem Lernen. Dies hält es schnell auf einer Laptop-CPU und vermeidet die Notwendigkeit von GPU oder schweren Abhängigkeiten.
🇪🇸 Español
Papero: API rápida de extracción de texto PDF de código abierto
Papero es una API rápida de extracción de texto PDF de código abierto que nunca almacena sus archivos. Extrae la estructura del documento—orden de lectura, tablas, fórmulas, figuras y posiciones de bloques—sin una pila pesada. Funciona solo en CPU, sin modelos ML, y funciona en su navegador, Python o como API.
Obtener estructura de un PDF—como orden de columnas, detección de tablas y reconocimiento de fórmulas—hace que la salida sea utilizable para RAG, búsqueda y LLM. Papero usa geometría simple, manteniéndose rápido en una CPU de laptop. Maneja orden de lectura de dos y tres columnas, tablas reales (con bordes, sin bordes, LaTeX booktabs), fórmulas con salida LaTeX y el cuadro delimitador de cada bloque.
Inicio rápido: `pip install papero-extract` y `from papero_extract import extract`. La aplicación de navegador le permite cargar un PDF y exportar sin que su archivo salga de su máquina. Las opciones incluyen OCR, extracción de imágenes y procesamiento por lotes para conjuntos de datos RAG. Los comandos CLI admiten extracción a Markdown, JSON, CSV, HTML y más.
Papero también maneja páginas escaneadas a través de OCR, elimina texto blanco invisible y lee DOCX/PPTX/XLSX/EPUB/HTML a través de Apache Tika. Incluye un informe de fidelidad para procesamiento por lotes, que muestra qué documentos necesitan revisión.
¿Cómo extrae Papero la estructura del PDF sin modelos ML?
Papero usa geometría simple para analizar el diseño del PDF, determinando el orden de lectura, los límites de las tablas y las posiciones de las fórmulas mediante reglas espaciales en lugar de aprendizaje automático. Esto lo mantiene rápido en una CPU de laptop y evita la necesidad de GPU o dependencias pesadas.
🇫🇷 Français
Papero : API rapide d'extraction de texte PDF open-source
Papero est une API rapide d'extraction de texte PDF open-source qui ne stocke jamais vos fichiers. Elle extrait la structure du document—ordre de lecture, tableaux, formules, figures et positions des blocs—sans une pile lourde. Elle fonctionne uniquement sur CPU, sans modèles ML, et fonctionne dans votre navigateur, Python ou en tant qu'API.
Obtenir la structure d'un PDF—comme l'ordre des colonnes, la détection des tableaux et la reconnaissance des formules—rend la sortie utilisable pour RAG, la recherche et les LLM. Papero utilise la géométrie simple, restant rapide sur un CPU d'ordinateur portable. Il gère l'ordre de lecture à deux et trois colonnes, les tableaux réels (avec bordures, sans bordures, LaTeX booktabs), les formules avec sortie LaTeX et la boîte englobante de chaque bloc.
Démarrage rapide : `pip install papero-extract` et `from papero_extract import extract`. L'application navigateur vous permet de charger un PDF et d'exporter sans que votre fichier ne quitte votre machine. Les options incluent OCR, extraction d'images et traitement par lots pour les ensembles de données RAG. Les commandes CLI prennent en charge l'extraction vers Markdown, JSON, CSV, HTML et plus.
Papero gère également les pages scannées via OCR, supprime le texte blanc invisible et lit DOCX/PPTX/XLSX/EPUB/HTML via Apache Tika. Il inclut un rapport de fidélité pour le traitement par lots, montrant quels documents nécessitent une révision.
Comment Papero extrait-il la structure PDF sans modèles ML ?
Papero utilise la géométrie simple pour analyser la mise en page PDF, déterminant l'ordre de lecture, les limites des tableaux et les positions des formules via des règles spatiales plutôt que l'apprentissage automatique. Cela le maintient rapide sur un CPU d'ordinateur portable et évite le besoin de GPU ou de dépendances lourdes.
🇮🇳 हिन्दी
Papero: तेज़ ओपन-सोर्स PDF टेक्स्ट निष्कर्षण API
Papero एक तेज़, ओपन-सोर्स PDF टेक्स्ट निष्कर्षण API है जो आपकी फ़ाइलों को कभी संग्रहीत नहीं करता। यह दस्तावेज़ संरचना—पढ़ने का क्रम, तालिकाएँ, सूत्र, आंकड़े और ब्लॉक स्थितियाँ—बिना भारी स्टैक के निकालता है। यह केवल CPU पर चलता है, बिना ML मॉडल के, और आपके ब्राउज़र, Python या API के रूप में काम करता है।
PDF से संरचना प्राप्त करना—जैसे कॉलम क्रम, तालिका पहचान और सूत्र पहचान—आउटपुट को RAG, खोज और LLM के लिए उपयोगी बनाता है। Papero सादा ज्यामिति का उपयोग करता है, लैपटॉप CPU पर तेज़ रहता है। यह दो और तीन कॉलम पढ़ने का क्रम, वास्तविक तालिकाएँ (रूल्ड, बॉर्डरलेस, LaTeX booktabs), LaTeX आउटपुट के साथ सूत्र और प्रत्येक ब्लॉक का बाउंडिंग बॉक्स संभालता है।
त्वरित प्रारंभ: `pip install papero-extract` और `from papero_extract import extract`। ब्राउज़र ऐप आपको PDF लोड करने और निर्यात करने देता है बिना आपकी फ़ाइल को आपकी मशीन से बाहर जाने दिए। विकल्पों में OCR, छवि निष्कर्षण और RAG डेटासेट के लिए बैच प्रोसेसिंग शामिल है। CLI कमांड Markdown, JSON, CSV, HTML और अधिक में निष्कर्षण का समर्थन करते हैं।
Papero OCR के माध्यम से स्कैन किए गए पृष्ठों को भी संभालता है, अदृश्य सफेद टेक्स्ट को हटाता है, और Apache Tika के माध्यम से DOCX/PPTX/XLSX/EPUB/HTML पढ़ता है। इसमें बैच प्रोसेसिंग के लिए एक निष्ठा रिपोर्ट शामिल है, जो दिखाती है कि किन दस्तावेज़ों की समीक्षा की आवश्यकता है।
Papero बिना ML मॉडल के PDF संरचना कैसे निकालता है?
Papero PDF लेआउट का विश्लेषण करने के लिए सादा ज्यामिति का उपयोग करता है, मशीन लर्निंग के बजाय स्थानिक नियमों के माध्यम से पढ़ने का क्रम, तालिका सीमाएँ और सूत्र स्थितियाँ निर्धारित करता है। यह इसे लैपटॉप CPU पर तेज़ रखता है और GPU या भारी निर्भरता की आवश्यकता से बचाता है।
🇮🇩 Bahasa Indonesia
Papero: API Ekstraksi Teks PDF Cepat Sumber Terbuka
Papero adalah API ekstraksi teks PDF cepat sumber terbuka yang tidak pernah menyimpan file Anda. Ia mengekstrak struktur dokumen—urutan baca, tabel, rumus, gambar, dan posisi blok—tanpa tumpukan berat. Ia berjalan hanya di CPU, tanpa model ML, dan bekerja di browser, Python, atau sebagai API.
Mendapatkan struktur dari PDF—seperti urutan kolom, deteksi tabel, dan pengenalan rumus—membuat keluaran dapat digunakan untuk RAG, pencarian, dan LLM. Papero menggunakan geometri sederhana, tetap cepat di CPU laptop. Ia menangani urutan baca dua dan tiga kolom, tabel nyata (bergaris, tanpa garis, LaTeX booktabs), rumus dengan keluaran LaTeX, dan kotak pembatas setiap blok.
Mulai cepat: `pip install papero-extract` dan `from papero_extract import extract`. Aplikasi browser memungkinkan Anda memuat PDF dan mengekspor tanpa file Anda meninggalkan mesin Anda. Opsi termasuk OCR, ekstraksi gambar, dan pemrosesan batch untuk dataset RAG. Perintah CLI mendukung ekstraksi ke Markdown, JSON, CSV, HTML, dan lainnya.
Papero juga menangani halaman yang dipindai melalui OCR, membuang teks putih yang tidak terlihat, dan membaca DOCX/PPTX/XLSX/EPUB/HTML melalui Apache Tika. Ini termasuk laporan fidelitas untuk pemrosesan batch, menunjukkan dokumen mana yang perlu ditinjau.
Bagaimana Papero mengekstrak struktur PDF tanpa model ML?
Papero menggunakan geometri sederhana untuk menganalisis tata letak PDF, menentukan urutan baca, batas tabel, dan posisi rumus melalui aturan spasial daripada pembelajaran mesin. Ini membuatnya tetap cepat di CPU laptop dan menghindari kebutuhan GPU atau dependensi berat.
🇯🇵 日本語
Papero:高速オープンソースPDFテキスト抽出API
Paperoは高速なオープンソースPDFテキスト抽出APIで、ファイルを決して保存しません。ドキュメント構造—読み順、テーブル、数式、図、ブロック位置—を重いスタックなしで抽出します。CPUのみで動作し、MLモデルは不要で、ブラウザ、Python、またはAPIとして動作します。
PDFから構造を取得する—列順、テーブル検出、数式認識など—により、出力をRAG、検索、LLMで使用可能にします。Paperoは単純な幾何学を使用し、ラップトップCPU上で高速を維持します。2列および3列の読み順、実際のテーブル(罫線あり、罫線なし、LaTeX booktabs)、LaTeX出力付き数式、各ブロックのバウンディングボックスを処理します。
クイックスタート:`pip install papero-extract` および `from papero_extract import extract`。ブラウザアプリを使用すると、PDFを読み込んでエクスポートでき、ファイルはマシンから離れません。オプションには、OCR、画像抽出、RAGデータセットのバッチ処理が含まれます。CLIコマンドは、Markdown、JSON、CSV、HTMLなどへの抽出をサポートします。
PaperoはOCRを介してスキャンされたページも処理し、不可視の白いテキストを削除し、Apache Tikaを介してDOCX/PPTX/XLSX/EPUB/HTMLを読み取ります。バッチ処理用の忠実度レポートが含まれており、どのドキュメントをレビューする必要があるかを示します。
PaperoはMLモデルなしでどのようにPDF構造を抽出しますか?
Paperoは単純な幾何学を使用してPDFレイアウトを分析し、機械学習ではなく空間ルールを通じて読み順、テーブル境界、数式位置を決定します。これによりラップトップCPU上で高速を維持し、GPUや重い依存関係の必要性を回避します。
🇧🇷 Português
Papero: API rápida de extração de texto PDF de código aberto
Papero é uma API rápida de extração de texto PDF de código aberto que nunca armazena seus arquivos. Ela extrai a estrutura do documento—ordem de leitura, tabelas, fórmulas, figuras e posições de blocos—sem uma pilha pesada. Funciona apenas em CPU, sem modelos ML, e funciona no seu navegador, Python ou como API.
Obter estrutura de um PDF—como ordem de colunas, detecção de tabelas e reconhecimento de fórmulas—torna a saída utilizável para RAG, pesquisa e LLMs. Papero usa geometria simples, mantendo-se rápido em uma CPU de laptop. Ele lida com ordem de leitura de duas e três colunas, tabelas reais (com bordas, sem bordas, LaTeX booktabs), fórmulas com saída LaTeX e a caixa delimitadora de cada bloco.
Início rápido: `pip install papero-extract` e `from papero_extract import extract`. O aplicativo de navegador permite carregar um PDF e exportar sem que seu arquivo saia da sua máquina. As opções incluem OCR, extração de imagens e processamento em lote para conjuntos de dados RAG. Os comandos CLI suportam extração para Markdown, JSON, CSV, HTML e mais.
Papero também lida com páginas digitalizadas via OCR, remove texto branco invisível e lê DOCX/PPTX/XLSX/EPUB/HTML através do Apache Tika. Inclui um relatório de fidelidade para processamento em lote, mostrando quais documentos precisam de revisão.
Como o Papero extrai estrutura PDF sem modelos ML?
Papero usa geometria simples para analisar o layout do PDF, determinando ordem de leitura, limites de tabelas e posições de fórmulas através de regras espaciais em vez de aprendizado de máquina. Isso o mantém rápido em uma CPU de laptop e evita a necessidade de GPU ou dependências pesadas.
🇷🇺 Русский
Papero: Быстрый API с открытым исходным кодом для извлечения текста из PDF
Papero — это быстрый API с открытым исходным кодом для извлечения текста из PDF, который никогда не хранит ваши файлы. Он извлекает структуру документа — порядок чтения, таблицы, формулы, рисунки и позиции блоков — без тяжелого стека. Он работает только на CPU, без ML-моделей, и работает в вашем браузере, Python или как API.
Получение структуры из PDF — например, порядка столбцов, обнаружения таблиц и распознавания формул — делает вывод полезным для RAG, поиска и LLM. Papero использует простую геометрию, оставаясь быстрым на CPU ноутбука. Он обрабатывает порядок чтения двух и трех столбцов, реальные таблицы (с рамками, без рамок, LaTeX booktabs), формулы с выводом LaTeX и ограничивающую рамку каждого блока.
Быстрый старт: `pip install papero-extract` и `from papero_extract import extract`. Приложение в браузере позволяет загрузить PDF и экспортировать, не покидая вашу машину. Опции включают OCR, извлечение изображений и пакетную обработку для наборов данных RAG. Команды CLI поддерживают извлечение в Markdown, JSON, CSV, HTML и другое.
Papero также обрабатывает отсканированные страницы через OCR, удаляет невидимый белый текст и читает DOCX/PPTX/XLSX/EPUB/HTML через Apache Tika. Он включает отчет о точности для пакетной обработки, показывающий, какие документы нуждаются в проверке.
Как Papero извлекает структуру PDF без ML-моделей?
Papero использует простую геометрию для анализа макета PDF, определяя порядок чтения, границы таблиц и позиции формул с помощью пространственных правил, а не машинного обучения. Это сохраняет его быстрым на CPU ноутбука и избегает необходимости в GPU или тяжелых зависимостях.
🇨🇳 简体中文
Papero:快速开源PDF文本提取API
Papero是一款快速、开源的PDF文本提取API,从不存储您的文件。它提取文档结构——阅读顺序、表格、公式、图形和块位置——无需重型技术栈。它仅运行在CPU上,无需ML模型,可在浏览器、Python或API中使用。
从PDF中获取结构——如列顺序、表格检测和公式识别——使输出可用于RAG、搜索和LLM。Papero使用纯几何方法,在笔记本电脑CPU上保持快速。它处理两列和三列阅读顺序、真实表格(带边框、无边框、LaTeX booktabs)、带LaTeX输出的公式以及每个块的边界框。
快速开始:`pip install papero-extract` 和 `from papero_extract import extract`。浏览器应用允许您加载PDF并导出,文件不会离开您的机器。选项包括OCR、图像提取和RAG数据集的批处理。CLI命令支持提取为Markdown、JSON、CSV、HTML等格式。
Papero还通过OCR处理扫描页面,丢弃不可见的白色文本,并通过Apache Tika读取DOCX/PPTX/XLSX/EPUB/HTML。它包含批处理的保真度报告,显示哪些文档需要审查。
Papero如何在没有ML模型的情况下提取PDF结构?
Papero使用纯几何方法分析PDF布局,通过空间规则而非机器学习来确定阅读顺序、表格边界和公式位置。这使其在笔记本电脑CPU上保持快速,并避免了对GPU或重型依赖的需求。