HeadlinesBriefing favicon HeadlinesBriefing.com

LensVLM:长上下文压缩为图像

Hacker News •
×

Lens VLM是一种9B视觉语言模型(VLM),它扫描文本的压缩图像,然后通过学习的工具选择性地仅将相关页面扩展为其未压缩形式。

论文:Lens VLM:文本压缩视觉表示的选择性上下文扩展。代码:https://github.com/apple-aiml-research/ml-lensvlm。许可证:此仓库中的所有ML模型文件,包括Apple对Qwen模型的修改,均根据Apple机器学习研究模型许可证的条款提供。伴随此模型的源代码单独分发,并根据Apple示例代码许可证的条款提供。

使用:安装Lens VLM代码并运行推理。对于自定义文档,使用带有压缩选项的演示:5x10x15x。有关数据准备和评估,请参阅仓库README。

引用:@article{xie2026lensvlm, title={Lens VLM:文本压缩视觉表示的选择性上下文扩展}, author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal={arXiv预印本 arXiv:2605.07019}, year={2026}}