HeadlinesBriefing HeadlinesBriefing.com

Papero快速开源PDF文本提取API

Hacker News •
×

Papero是一款快速、开源的PDF文本提取API,从不存储您的文件。它提取文档结构——阅读顺序、表格、公式、图形和块位置——无需重型技术栈。它仅运行在CPU上,无需ML模型,可在浏览器、Python或API中使用。

从PDF中获取结构——如列顺序、表格检测和公式识别——使输出可用于RAG、搜索和LLM。Papero使用纯几何方法,在笔记本电脑CPU上保持快速。它处理两列和三列阅读顺序、真实表格(带边框、无边框、LaTeX booktabs)、带LaTeX输出的公式以及每个块的边界框。

快速开始:`pip install papero-extract` 和 `from papero_extract import extract`。浏览器应用允许您加载PDF并导出,文件不会离开您的机器。选项包括OCR、图像提取和RAG数据集的批处理。CLI命令支持提取为Markdown、JSON、CSV、HTML等格式。

Papero还通过OCR处理扫描页面,丢弃不可见的白色文本,并通过Apache Tika读取DOCX/PPTX/XLSX/EPUB/HTML。它包含批处理的保真度报告,显示哪些文档需要审查。

来源: Hacker News · 由HeadlinesBriefing整理摘要