HeadlinesBriefing favicon HeadlinesBriefing.com

LensVLM: लंबे संदर्भ को छवियों के रूप में संपीड़ित करना

Hacker News •
×

Lens VLM एक 9B विज़न लैंग्वेज मॉडल (VLM) है जो टेक्स्ट की संपीड़ित छवियों को स्कैन करता है, फिर सीखे गए उपकरणों के माध्यम से केवल प्रासंगिक पृष्ठों को उनके असंपीड़ित रूप में चुनिंदा रूप से विस्तारित करता है।

पेपर: Lens VLM: टेक्स्ट के संपीड़ित दृश्य प्रतिनिधित्व के लिए चयनात्मक संदर्भ विस्तार। कोड: https://github.com/apple-aiml-research/ml-lensvlm। लाइसेंस: इस रिपॉजिटरी में सभी ML मॉडल फ़ाइलें, जिसमें Qwen मॉडल में Apple के संशोधन शामिल हैं, Apple मशीन लर्निंग रिसर्च मॉडल लाइसेंस की शर्तों के तहत प्रदान की जाती हैं। इस मॉडल के साथ आने वाला स्रोत कोड अलग से वितरित किया जाता है और Apple सैंपल कोड लाइसेंस की शर्तों के तहत प्रदान किया जाता है।

उपयोग: Lens VLM कोड स्थापित करें और अनुमान चलाएं। कस्टम दस्तावेज़ के लिए, संपीड़न विकल्पों के साथ डेमो का उपयोग करें: 5x, 10x, 15x। डेटा तैयारी और मूल्यांकन के लिए रिपॉजिटरी README देखें।

उद्धरण: @article{xie2026lensvlm, title={Lens VLM: टेक्स्ट के संपीड़ित दृश्य प्रतिनिधित्व के लिए चयनात्मक संदर्भ विस्तार}, author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal={arXiv प्रीप्रिंट arXiv:2605.07019}, year={2026}}