HeadlinesBriefing favicon HeadlinesBriefing.com

LensVLM: 長いコンテキストを画像として圧縮

Hacker News •
×

Lens VLMは9Bのビジョン言語モデル(VLM)で、テキストの圧縮画像をスキャンし、学習されたツールを介して関連するページのみを非圧縮形式に選択的に展開します。

論文:Lens VLM: テキストの圧縮視覚表現のための選択的コンテキスト拡張。コード:https://github.com/apple-aiml-research/ml-lensvlm。ライセンス:このリポジトリ内のすべてのMLモデルファイル(Qwenモデルに対するAppleの変更を含む)は、Apple Machine Learning Research Model Licenseの条件に基づいて提供されます。このモデルに付属するソースコードは別途配布され、Apple Sample Code Licenseの条件に基づいて提供されます。

使用方法:Lens VLMコードをインストールして推論を実行します。カスタムドキュメントの場合は、圧縮オプション(5x10x15x)を使用したデモを使用します。データの準備と評価については、リポジトリのREADMEを参照してください。

引用:@article{xie2026lensvlm, title={Lens VLM: テキストの圧縮視覚表現のための選択的コンテキスト拡張}, author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal={arXivプレプリント arXiv:2605.07019}, year={2026}}