HeadlinesBriefing HeadlinesBriefing.com

Papero API rapide extraction PDF open-source

Hacker News •
×

Papero est une API rapide d'extraction de texte PDF open-source qui ne stocke jamais vos fichiers. Elle extrait la structure du document—ordre de lecture, tableaux, formules, figures et positions des blocs—sans une pile lourde. Elle fonctionne uniquement sur CPU, sans modèles ML, et fonctionne dans votre navigateur, Python ou en tant qu'API.

Obtenir la structure d'un PDF—comme l'ordre des colonnes, la détection des tableaux et la reconnaissance des formules—rend la sortie utilisable pour RAG, la recherche et les LLM. Papero utilise la géométrie simple, restant rapide sur un CPU d'ordinateur portable. Il gère l'ordre de lecture à deux et trois colonnes, les tableaux réels (avec bordures, sans bordures, LaTeX booktabs), les formules avec sortie LaTeX et la boîte englobante de chaque bloc.

Démarrage rapide : `pip install papero-extract` et `from papero_extract import extract`. L'application navigateur vous permet de charger un PDF et d'exporter sans que votre fichier ne quitte votre machine. Les options incluent OCR, extraction d'images et traitement par lots pour les ensembles de données RAG. Les commandes CLI prennent en charge l'extraction vers Markdown, JSON, CSV, HTML et plus.

Papero gère également les pages scannées via OCR, supprime le texte blanc invisible et lit DOCX/PPTX/XLSX/EPUB/HTML via Apache Tika. Il inclut un rapport de fidélité pour le traitement par lots, montrant quels documents nécessitent une révision.

Source: Hacker News · Résumé par HeadlinesBriefing