HeadlinesBriefing HeadlinesBriefing.com

Papero API ekstraksi PDF cepat sumber terbuka

Hacker News •
×

Papero adalah API ekstraksi teks PDF cepat sumber terbuka yang tidak pernah menyimpan file Anda. Ia mengekstrak struktur dokumen—urutan baca, tabel, rumus, gambar, dan posisi blok—tanpa tumpukan berat. Ia berjalan hanya di CPU, tanpa model ML, dan bekerja di browser, Python, atau sebagai API.

Mendapatkan struktur dari PDF—seperti urutan kolom, deteksi tabel, dan pengenalan rumus—membuat keluaran dapat digunakan untuk RAG, pencarian, dan LLM. Papero menggunakan geometri sederhana, tetap cepat di CPU laptop. Ia menangani urutan baca dua dan tiga kolom, tabel nyata (bergaris, tanpa garis, LaTeX booktabs), rumus dengan keluaran LaTeX, dan kotak pembatas setiap blok.

Mulai cepat: `pip install papero-extract` dan `from papero_extract import extract`. Aplikasi browser memungkinkan Anda memuat PDF dan mengekspor tanpa file Anda meninggalkan mesin Anda. Opsi termasuk OCR, ekstraksi gambar, dan pemrosesan batch untuk dataset RAG. Perintah CLI mendukung ekstraksi ke Markdown, JSON, CSV, HTML, dan lainnya.

Papero juga menangani halaman yang dipindai melalui OCR, membuang teks putih yang tidak terlihat, dan membaca DOCX/PPTX/XLSX/EPUB/HTML melalui Apache Tika. Ini termasuk laporan fidelitas untuk pemrosesan batch, menunjukkan dokumen mana yang perlu ditinjau.

Sumber: Hacker News · Diringkas oleh HeadlinesBriefing