HeadlinesBriefing favicon HeadlinesBriefing.com

LensVLM: Komprimierung langer Kontexte als Bilder

Hacker News •
×

Lens VLM ist ein 9B visuelles Sprachmodell (VLM), das komprimierte Bilder von Text scannt und dann nur die relevanten Seiten über erlernte Werkzeuge selektiv in ihre unkomprimierte Form erweitert.

Paper: Lens VLM: Selektive Kontexterweiterung für komprimierte visuelle Darstellung von Text. Code: https://github.com/apple-aiml-research/ml-lensvlm. Lizenz: Alle ML-Modelldateien in diesem Repository, einschließlich Apples Modifikationen am Qwen-Modell, werden unter den Bedingungen der Apple Machine Learning Research Model License bereitgestellt. Der Quellcode, der dieses Modell begleitet, wird separat verteilt und unter den Bedingungen der Apple Sample Code License bereitgestellt.

Verwendung: Installieren Sie den Lens VLM-Code und führen Sie die Inferenz aus. Für ein benutzerdefiniertes Dokument verwenden Sie die Demo mit Komprimierungsoptionen: 5x, 10x, 15x. Siehe das Repository-README für Datenvorbereitung und Bewertung.

Zitation: @article{xie2026lensvlm, title={Lens VLM: Selektive Kontexterweiterung für komprimierte visuelle Darstellung von Text}, author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal={arXiv preprint arXiv:2605.07019}, year={2026}}