Papero es una API rápida de extracción de texto PDF de código abierto que nunca almacena sus archivos. Extrae la estructura del documento—orden de lectura, tablas, fórmulas, figuras y posiciones de bloques—sin una pila pesada. Funciona solo en CPU, sin modelos ML, y funciona en su navegador, Python o como API.
Obtener estructura de un PDF—como orden de columnas, detección de tablas y reconocimiento de fórmulas—hace que la salida sea utilizable para RAG, búsqueda y LLM. Papero usa geometría simple, manteniéndose rápido en una CPU de laptop. Maneja orden de lectura de dos y tres columnas, tablas reales (con bordes, sin bordes, LaTeX booktabs), fórmulas con salida LaTeX y el cuadro delimitador de cada bloque.
Inicio rápido: `pip install papero-extract` y `from papero_extract import extract`. La aplicación de navegador le permite cargar un PDF y exportar sin que su archivo salga de su máquina. Las opciones incluyen OCR, extracción de imágenes y procesamiento por lotes para conjuntos de datos RAG. Los comandos CLI admiten extracción a Markdown, JSON, CSV, HTML y más.
Papero también maneja páginas escaneadas a través de OCR, elimina texto blanco invisible y lee DOCX/PPTX/XLSX/EPUB/HTML a través de Apache Tika. Incluye un informe de fidelidad para procesamiento por lotes, que muestra qué documentos necesitan revisión.
Fuente: Hacker News · Resumido por HeadlinesBriefing