Paperoは高速なオープンソースPDFテキスト抽出APIで、ファイルを決して保存しません。ドキュメント構造—読み順、テーブル、数式、図、ブロック位置—を重いスタックなしで抽出します。CPUのみで動作し、MLモデルは不要で、ブラウザ、Python、またはAPIとして動作します。
PDFから構造を取得する—列順、テーブル検出、数式認識など—により、出力をRAG、検索、LLMで使用可能にします。Paperoは単純な幾何学を使用し、ラップトップCPU上で高速を維持します。2列および3列の読み順、実際のテーブル(罫線あり、罫線なし、LaTeX booktabs)、LaTeX出力付き数式、各ブロックのバウンディングボックスを処理します。
クイックスタート:`pip install papero-extract` および `from papero_extract import extract`。ブラウザアプリを使用すると、PDFを読み込んでエクスポートでき、ファイルはマシンから離れません。オプションには、OCR、画像抽出、RAGデータセットのバッチ処理が含まれます。CLIコマンドは、Markdown、JSON、CSV、HTMLなどへの抽出をサポートします。
PaperoはOCRを介してスキャンされたページも処理し、不可視の白いテキストを削除し、Apache Tikaを介してDOCX/PPTX/XLSX/EPUB/HTMLを読み取ります。バッチ処理用の忠実度レポートが含まれており、どのドキュメントをレビューする必要があるかを示します。
出典: Hacker News · 要約:HeadlinesBriefing