HeadlinesBriefing HeadlinesBriefing.com

Papero API rápida extracción PDF código abierto

Hacker News •
×

Papero es una API rápida de extracción de texto PDF de código abierto que nunca almacena sus archivos. Extrae la estructura del documento—orden de lectura, tablas, fórmulas, figuras y posiciones de bloques—sin una pila pesada. Funciona solo en CPU, sin modelos ML, y funciona en su navegador, Python o como API.

Obtener estructura de un PDF—como orden de columnas, detección de tablas y reconocimiento de fórmulas—hace que la salida sea utilizable para RAG, búsqueda y LLM. Papero usa geometría simple, manteniéndose rápido en una CPU de laptop. Maneja orden de lectura de dos y tres columnas, tablas reales (con bordes, sin bordes, LaTeX booktabs), fórmulas con salida LaTeX y el cuadro delimitador de cada bloque.

Inicio rápido: `pip install papero-extract` y `from papero_extract import extract`. La aplicación de navegador le permite cargar un PDF y exportar sin que su archivo salga de su máquina. Las opciones incluyen OCR, extracción de imágenes y procesamiento por lotes para conjuntos de datos RAG. Los comandos CLI admiten extracción a Markdown, JSON, CSV, HTML y más.

Papero también maneja páginas escaneadas a través de OCR, elimina texto blanco invisible y lee DOCX/PPTX/XLSX/EPUB/HTML a través de Apache Tika. Incluye un informe de fidelidad para procesamiento por lotes, que muestra qué documentos necesitan revisión.

Fuente: Hacker News · Resumido por HeadlinesBriefing