HeadlinesBriefing favicon HeadlinesBriefing.com

LensVLM: Mengompresi konteks panjang sebagai gambar

Hacker News •
×

Lens VLM adalah model bahasa visual (VLM) 9B yang memindai gambar teks yang dikompresi, kemudian secara selektif hanya memperluas halaman yang relevan ke bentuk tidak terkompresi melalui alat yang dipelajari.

Makalah: Lens VLM: Ekspansi Konteks Selektif untuk Representasi Visual Teks yang Dikompresi. Kode: https://github.com/apple-aiml-research/ml-lensvlm. Lisensi: Semua file model ML di repositori ini, termasuk modifikasi Apple pada model Qwen, disediakan berdasarkan ketentuan Lisensi Model Penelitian Pembelajaran Mesin Apple. Kode sumber yang menyertai model ini didistribusikan secara terpisah dan disediakan berdasarkan ketentuan Lisensi Kode Contoh Apple.

Penggunaan: Instal kode Lens VLM dan jalankan inferensi. Untuk dokumen kustom, gunakan demo dengan opsi kompresi: 5x, 10x, 15x. Lihat README repositori untuk persiapan data dan evaluasi.

Kutipan: @article{xie2026lensvlm, title={Lens VLM: Ekspansi Konteks Selektif untuk Representasi Visual Teks yang Dikompresi}, author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal={arXiv preprint arXiv:2605.07019}, year={2026}}