HeadlinesBriefing favicon HeadlinesBriefing.com

LensVLM: Сжатие длинного контекста в изображения

Hacker News •
×

Lens VLM — это визуально-языковая модель (VLM) размером 9B, которая сканирует сжатые изображения текста, а затем выборочно расширяет только релевантные страницы до их несжатой формы с помощью обученных инструментов.

Статья: Lens VLM: Выборочное расширение контекста для сжатого визуального представления текста. Код: https://github.com/apple-aiml-research/ml-lensvlm. Лицензия: Все файлы модели ML в этом репозитории, включая модификации Apple модели Qwen, предоставляются в соответствии с условиями лицензии Apple Machine Learning Research Model License. Исходный код, сопровождающий эту модель, распространяется отдельно и предоставляется в соответствии с условиями лицензии Apple Sample Code License.

Использование: Установите код Lens VLM и запустите вывод. Для пользовательского документа используйте демонстрацию с опциями сжатия: 5x, 10x, 15x. См. README репозитория для подготовки данных и оценки.

Цитирование: @article{xie2026lensvlm, title={Lens VLM: Выборочное расширение контекста для сжатого визуального представления текста}, author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal={arXiv preprint arXiv:2605.07019}, year={2026}}