HeadlinesBriefing favicon HeadlinesBriefing.com

LensVLM: Compresión de contexto largo como imágenes

Hacker News •
×

Lens VLM es un modelo de lenguaje visual (VLM) de 9B que escanea imágenes comprimidas de texto, luego expande selectivamente solo las páginas relevantes a su forma descomprimida mediante herramientas aprendidas.

Artículo: Lens VLM: Expansión selectiva de contexto para representación visual comprimida de texto. Código: https://github.com/apple-aiml-research/ml-lensvlm. Licencia: Todos los archivos de modelo ML en este repositorio, incluidas las modificaciones de Apple al modelo Qwen, se proporcionan bajo los términos de la Licencia de Modelo de Investigación de Aprendizaje Automático de Apple. El código fuente que acompaña a este modelo se distribuye por separado y se proporciona bajo los términos de la Licencia de Código de Ejemplo de Apple.

Uso: Instale el código de Lens VLM y ejecute la inferencia. Para un documento personalizado, use la demostración con opciones de compresión: 5x, 10x, 15x. Consulte el README del repositorio para la preparación de datos y evaluación.

Citación: @article{xie2026lensvlm, title={Lens VLM: Expansión selectiva de contexto para representación visual comprimida de texto}, author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal={arXiv preprint arXiv:2605.07019}, year={2026}}