HeadlinesBriefing favicon HeadlinesBriefing.com

LensVLM : Compression du contexte long en images

Hacker News •
×

Lens VLM est un modèle de langage visuel (VLM) de 9B qui scanne des images compressées de texte, puis étend sélectivement uniquement les pages pertinentes à leur forme décompressée via des outils appris.

Article : Lens VLM : Expansion sélective du contexte pour la représentation visuelle compressée du texte. Code : https://github.com/apple-aiml-research/ml-lensvlm. Licence : Tous les fichiers de modèle ML de ce dépôt, y compris les modifications d'Apple au modèle Qwen, sont fournis sous les termes de la licence de modèle de recherche en apprentissage automatique d'Apple. Le code source accompagnant ce modèle est distribué séparément et est fourni sous les termes de la licence de code d'exemple d'Apple.

Utilisation : Installez le code Lens VLM et exécutez l'inférence. Pour un document personnalisé, utilisez la démo avec les options de compression : 5x, 10x, 15x. Consultez le README du dépôt pour la préparation des données et l'évaluation.

Citation : @article{xie2026lensvlm, title={Lens VLM : Expansion sélective du contexte pour la représentation visuelle compressée du texte}, author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal={arXiv preprint arXiv:2605.07019}, year={2026}}