HeadlinesBriefing HeadlinesBriefing.com

Papero быстрый API извлечения PDF с открытым кодом

Hacker News •
×

Papero — это быстрый API с открытым исходным кодом для извлечения текста из PDF, который никогда не хранит ваши файлы. Он извлекает структуру документа — порядок чтения, таблицы, формулы, рисунки и позиции блоков — без тяжелого стека. Он работает только на CPU, без ML-моделей, и работает в вашем браузере, Python или как API.

Получение структуры из PDF — например, порядка столбцов, обнаружения таблиц и распознавания формул — делает вывод полезным для RAG, поиска и LLM. Papero использует простую геометрию, оставаясь быстрым на CPU ноутбука. Он обрабатывает порядок чтения двух и трех столбцов, реальные таблицы (с рамками, без рамок, LaTeX booktabs), формулы с выводом LaTeX и ограничивающую рамку каждого блока.

Быстрый старт: `pip install papero-extract` и `from papero_extract import extract`. Приложение в браузере позволяет загрузить PDF и экспортировать, не покидая вашу машину. Опции включают OCR, извлечение изображений и пакетную обработку для наборов данных RAG. Команды CLI поддерживают извлечение в Markdown, JSON, CSV, HTML и другое.

Papero также обрабатывает отсканированные страницы через OCR, удаляет невидимый белый текст и читает DOCX/PPTX/XLSX/EPUB/HTML через Apache Tika. Он включает отчет о точности для пакетной обработки, показывающий, какие документы нуждаются в проверке.

Источник: Hacker News · Сводку подготовил HeadlinesBriefing