HeadlinesBriefing HeadlinesBriefing.com

UniEvo-VL নিজে-নিজে পুনর্বিন্যাস বাড়ায় মল্টিমোডাল মডেল

Hacker News •
×

আধুনিক মল্টিমোডাল মডেলগুলি জেনারেশন এবং আচরণকে একটি একীভূত ব্যবস্থায় একীকৃত করে, যা তাদের নিজের দ্বারা তৈরি করা ফিডব্যাক থেকে শিখতে সক্ষম করে। আমরা UniEvo-VL প্রস্তাবনা করি, একটি স্ব-বিকাশী ফ্রেমওয়ার্ক যা পরীক্ষার সময়ে স্ব-নির্ণয়কে প্রাধান্যপূর্ণ তথ্য হিসেবে ব্যবহার করে। এটি একটি আলাদা, কখনও কখনও বড় শিক্ষক মডেলের ওপর নয় নির্ভর করে, বরং একক মল্টিমোডাল মডেলটি ভিন্ন প্রসঙ্গের সাথে শিক্ষক ও শিক্ষার্থী হিসেবে কাজ করে। শিক্ষার্থী কেবল মূল প্রশ্ন দেখে, আপডেটেড শিক্ষক প্রাধান্যপূর্ণ নিঃস্বার্থ প্রতিক্রিয়ার সাথে শর্ত দেয়। প্রশিক্ষণ মূলত শিক্ষার্থীর নমুনা পথে তাদের ডিনোইজ ডিফিউজন বিতরণের মধ্যে অবস্থা-ভিত্তিক পার্থক্য কমাতে লক্ষ্য রাখে। পরীক্ষাগুলি দেখায় যে UniEvo-VL প্রতিধ্বনি তথ্যের সংবেদনশীলতা বজায় রেখে ছবি জেনারেশন ক্ষমতা বাড়ায়। খুলা Qwen-image-2512-এর ভিত্তিতে, আমরা Gen Eval-এ 0.747 থেকে 0.808 পর্যন্ত এবং Gen Eval2 Soft-TIFA-এ 32.97 থেকে 35.53 পর্যন্ত পারফরম্যান্স উন্নতি দেখি। আরও সম্পন্ন বাহ্যিক সমালোচকদের, যেমন GPT5.6-Luna, ব্যবহার করে চেষ্টার মধ্যে দেখায় যে শক্তিশালী ন্যায়সঙ্গত দক্ষতা সম্পন্ন মল্টিমোডাল মডেলগুলি একটি উচ্চ নিজে-বিকাশী ছাত্র প্রত্যাশা করতে পারে। মিশ্র টেক্সট রেন্ডারিং ফলাফলগুলি ইঙ্গিত দেয় যে নিজে-সংশোধনগুলি বিভিন্ন কাজের মধ্যে সমানভাবে হতে পারে না। এই গবেষণাটি মল্টিমোডাল মডেল ব্যবহার করার সময় ব্যবহারকারীর অভিজ্ঞতা উন্নত করার জন্য করা হয়েছে, বাহ্যিক নিয়ন্ত্রণ বা দিকনির্দেশনা ছাড়া। এটি বর্তমানে জনপ্রিয় রিকর্সিভ স্ব-সংশোধন গবেষণার দিকনির্দেশনায় প্রকাশ করে।

উৎস: Hacker News · সারাংশ: HeadlinesBriefing