HeadlinesBriefing favicon HeadlinesBriefing.com

Tabel dalam PDF untuk RAG: Pertahankan Grade

Towards Data Science •
×

Angka yang Anda butuhkan berada di dalam tabel, pada persimpangan suatu baris dan suatu kolom. Meratakan PDF menjadi teks menghilangkan persimpangan itu: label berada di satu tempat, nilai berada di tempat lain, dan model ditinggalkan untuk menebak. Tabel adalah tempat tempat parsing naif kehilangan jawaban dengan diam dalam RAG.

Artikel ini adalah bonus dari seri Enterprise Document Intelligence, yang membangun sistem RAG perusahaan dari empat batu bata. Ia menggabungkan fragmen menjadi satu penanganan koheren mengapa tabel memutuskan pipeline dan apa yang harus dilakukan sebagai gantinya. Baru dalam seri? Setiap artikel dalam seri berada di halaman penulis Towards Science Data Angela Shi dan Kezhan Shi.

Pipeline RAG standar membaca PDF, membaginya menjadi potongan teks, meng-embed potongan-potongan tersebut, dan mengambil yang paling cocok. Saat jawaban berada di dalam sel tabel, pipeline RAG standar mulai menghalucinasi angka, dan sering kali tidak ada yang menyadarinya sampai seorang auditor membuka dokumen sumber. Tabel dalam PDF bukanlah tabel dalam arti data; ini adalah sekumpulan persegi panjang yang digambar di sebuah halaman, dengan teks yang ditempatkan di sel-sel, sering kali tanpa penanda baris atau kolom yang eksplisit.

Parser harus merekonstruksi grade dari geometri spasial. Ketika ia tidak berhasil, tiga hal terjadi sekaligus: struktur baris dan kolom hilang, header sering kali hanya ada di halaman pertama tabel multi-halaman, dan disiplin kutipan pada tingkat baris rusak. Langkah yang tepat bukanlah menangani tabel lebih baik sebagai teks, tetapi mengembalikan mereka ke bentuk struktural alami secepat mungkin dan memperlakukan mereka sebagai data.

Sama sekali tabel dapat berada dalam pipeline pada empat tingkat struktur yang berbeda, dan memilih tingkat yang tepat adalah keputusan desain pertama sebelum suatu operasi dijalankan.