HeadlinesBriefing favicon HeadlinesBriefing.com

LensVLM: ضغط السياق الطويل كصور

Hacker News •
×

Lens VLM هو نموذج لغة بصرية (VLM) بحجم 9B يقوم بمسح الصور المضغوطة للنص، ثم يوسع بشكل انتقائي فقط الصفحات ذات الصلة إلى شكلها غير المضغوط عبر أدوات مُتعلمة.

الورقة: Lens VLM: توسيع السياق الانتقائي للتمثيل البصري المضغوط للنص. الكود: https://github.com/apple-aiml-research/ml-lensvlm. الترخيص: جميع ملفات نموذج التعلم الآلي في هذا المستودع، بما في ذلك تعديلات Apple على نموذج Qwen، مقدمة بموجب شروط ترخيص نموذج أبحاث التعلم الآلي من Apple. يتم توزيع الكود المصدري المصاحب لهذا النموذج بشكل منفصل ويتم توفيره بموجب شروط ترخيص كود العينة من Apple.

الاستخدام: قم بتثبيت كود Lens VLM وتشغيل الاستدلال. لمستند مخصص، استخدم العرض التوضيحي مع خيارات الضغط: 5x، 10x، 15x. راجع README المستودع لإعداد البيانات والتقييم.

الاستشهاد: @article{xie2026lensvlm, title={Lens VLM: توسيع السياق الانتقائي للتمثيل البصري المضغوط للنص}, author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal={arXiv preprint arXiv:2605.07019}, year={2026}}