HeadlinesBriefing favicon HeadlinesBriefing.com

LensVLM: Comprimindo contexto longo como imagens

Hacker News •
×

Lens VLM é um modelo de linguagem visual (VLM) de 9B que escaneia imagens comprimidas de texto e, em seguida, expande seletivamente apenas as páginas relevantes para sua forma descomprimida por meio de ferramentas aprendidas.

Artigo: Lens VLM: Expansão seletiva de contexto para representação visual comprimida de texto. Código: https://github.com/apple-aiml-research/ml-lensvlm. Licença: Todos os arquivos de modelo ML neste repositório, incluindo as modificações da Apple no modelo Qwen, são fornecidos sob os termos da Licença de Modelo de Pesquisa de Aprendizado de Máquina da Apple. O código-fonte que acompanha este modelo é distribuído separadamente e é fornecido sob os termos da Licença de Código de Exemplo da Apple.

Uso: Instale o código Lens VLM e execute a inferência. Para um documento personalizado, use a demonstração com opções de compressão: 5x, 10x, 15x. Consulte o README do repositório para preparação de dados e avaliação.

Citação: @article{xie2026lensvlm, title={Lens VLM: Expansão seletiva de contexto para representação visual comprimida de texto}, author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal={arXiv preprint arXiv:2605.07019}, year={2026}}