HeadlinesBriefing favicon HeadlinesBriefing.com

LensVLM: দীর্ঘ প্রসঙ্গকে ছবি হিসেবে সংকুচিত করা

Hacker News •
×

Lens VLM একটি 9B ভিশন ল্যাঙ্গুয়েজ মডেল (VLM) যা টেক্সটের সংকুচিত ছবি স্ক্যান করে, তারপর শেখা টুলের মাধ্যমে শুধুমাত্র প্রাসঙ্গিক পৃষ্ঠাগুলিকে তাদের অ-সংকুচিত আকারে নির্বাচনীভাবে সম্প্রসারিত করে।

পেপার: Lens VLM: টেক্সটের সংকুচিত ভিজ্যুয়াল উপস্থাপনার জন্য নির্বাচনী প্রসঙ্গ সম্প্রসারণ। কোড: https://github.com/apple-aiml-research/ml-lensvlm। লাইসেন্স: এই রিপোজিটরির সমস্ত ML মডেল ফাইল, যার মধ্যে Qwen মডেলের Apple-এর পরিবর্তনগুলি রয়েছে, Apple মেশিন লার্নিং রিসার্চ মডেল লাইসেন্সের শর্তাবলীর অধীনে সরবরাহ করা হয়েছে। এই মডেলের সাথে থাকা সোর্স কোড পৃথকভাবে বিতরণ করা হয় এবং Apple স্যাম্পল কোড লাইসেন্সের শর্তাবলীর অধীনে সরবরাহ করা হয়।

ব্যবহার: Lens VLM কোড ইনস্টল করুন এবং ইনফারেন্স চালান। কাস্টম ডকুমেন্টের জন্য, কম্প্রেশন অপশন সহ ডেমো ব্যবহার করুন: 5x, 10x, 15x। ডেটা প্রস্তুতি এবং মূল্যায়নের জন্য রিপোজিটরি README দেখুন।

উদ্ধৃতি: @article{xie2026lensvlm, title={Lens VLM: টেক্সটের সংকুচিত ভিজ্যুয়াল উপস্থাপনার জন্য নির্বাচনী প্রসঙ্গ সম্প্রসারণ}, author={Xie, Roy and Friedman, Dan and Yu, Donghan and Pan, Bowen and Fifty, Christopher and Kim, Jang-Hyun and Du, Xianzhi and Gan, Zhe and Rathod, Vivek and Dhingra, Bhuwan}, journal={arXiv প্রিপ্রিন্ট arXiv:2605.07019}, year={2026}}