Papero ist eine schnelle Open-Source-PDF-Text-Extraktion-API, die Ihre Dateien niemals speichert. Sie extrahiert die Dokumentstruktur—Lesereihenfolge, Tabellen, Formeln, Abbildungen und Blockpositionen—ohne einen schweren Stack. Sie läuft nur auf der CPU, ohne ML-Modelle, und funktioniert in Ihrem Browser, Python oder als API.
Das Abrufen der Struktur aus einem PDF—wie Spaltenreihenfolge, Tabellenerkennung und Formelerkennung—macht die Ausgabe für RAG, Suche und LLMs nutzbar. Papero verwendet einfache Geometrie und bleibt auf einer Laptop-CPU schnell. Es verarbeitet die Lesereihenfolge von zwei und drei Spalten, echte Tabellen (mit Linien, ohne Linien, LaTeX booktabs), Formeln mit LaTeX-Ausgabe und den Begrenzungsrahmen jedes Blocks.
Schnellstart: `pip install papero-extract` und `from papero_extract import extract`. Die Browser-App ermöglicht es Ihnen, ein PDF zu laden und zu exportieren, ohne dass Ihre Datei Ihren Rechner verlässt. Zu den Optionen gehören OCR, Bildextraktion und Batch-Verarbeitung für RAG-Datensätze. CLI-Befehle unterstützen die Extraktion in Markdown, JSON, CSV, HTML und mehr.
Papero verarbeitet auch gescannte Seiten über OCR, verwirft unsichtbaren weißen Text und liest DOCX/PPTX/XLSX/EPUB/HTML über Apache Tika. Es enthält einen Treuebericht für die Batch-Verarbeitung, der zeigt, welche Dokumente überprüft werden müssen.
Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing