HeadlinesBriefing HeadlinesBriefing.com

Papero API rápida extração PDF código aberto

Hacker News •
×

Papero é uma API rápida de extração de texto PDF de código aberto que nunca armazena seus arquivos. Ela extrai a estrutura do documento—ordem de leitura, tabelas, fórmulas, figuras e posições de blocos—sem uma pilha pesada. Funciona apenas em CPU, sem modelos ML, e funciona no seu navegador, Python ou como API.

Obter estrutura de um PDF—como ordem de colunas, detecção de tabelas e reconhecimento de fórmulas—torna a saída utilizável para RAG, pesquisa e LLMs. Papero usa geometria simples, mantendo-se rápido em uma CPU de laptop. Ele lida com ordem de leitura de duas e três colunas, tabelas reais (com bordas, sem bordas, LaTeX booktabs), fórmulas com saída LaTeX e a caixa delimitadora de cada bloco.

Início rápido: `pip install papero-extract` e `from papero_extract import extract`. O aplicativo de navegador permite carregar um PDF e exportar sem que seu arquivo saia da sua máquina. As opções incluem OCR, extração de imagens e processamento em lote para conjuntos de dados RAG. Os comandos CLI suportam extração para Markdown, JSON, CSV, HTML e mais.

Papero também lida com páginas digitalizadas via OCR, remove texto branco invisível e lê DOCX/PPTX/XLSX/EPUB/HTML através do Apache Tika. Inclui um relatório de fidelidade para processamento em lote, mostrando quais documentos precisam de revisão.

Fonte: Hacker News · Resumido por HeadlinesBriefing