HeadlinesBriefing favicon HeadlinesBriefing.com

টার্নারি LLM-এর জন্য 1.58-বিট বাধা ভাঙা

Hacker News •
×

টার্নারি লার্জ ল্যাঙ্গুয়েজ মডেল (LLM) প্রতিটি ওজনকে তিনটি প্রতীকের {-1,0,+1} মধ্যে একটি হিসেবে সংরক্ষণ করে, তাই একটি টার্নারি মডেলের খরচ প্রচলিতভাবে তথ্য-তাত্ত্বিক log₂ 3 ≈ 1.585 বিট প্রতি ওজনের সাপেক্ষে নির্ধারিত হয়। প্রধান ডিপ্লয়মেন্ট ফরম্যাট পাঁচটি টার্নারি ওজনকে একটি বাইটে প্যাক করে (পাঁচ-ট্রিট প্যাকিং), এবং অনুশীলনে ব্যবহৃত দুইয়ের ঘাত গ্রুপ আকারের কারণে এটি 1.625 বিট প্রতি ওজনে রাউন্ড আপ হয়।

এই কার্যকর স্টোরেজ বিট-প্রস্থ তিনটি প্রতীককে সমান সম্ভাব্য হিসেবে বিবেচনা করে। আমরা 29টি টার্নারি LLM মডেলের প্রকৃত প্রতীক বিতরণ পরিমাপ করি এবং দেখতে পাই যে শূন্য সমস্ত ওজনের 51.5% পর্যন্ত। এই আবিষ্কার দ্বারা অনুপ্রাণিত হয়ে, আমরা BITCOS প্রবর্তন করি, একটি সরল বিতরণ-অভিযোজিত লেআউট যা একটি ঘন উপস্থিতি বিটম্যাপ এবং একটি সংকুচিত চিহ্ন ভেক্টর নিয়ে গঠিত, এবং মডেলের ওজনে শূন্য ঘনত্ব z দেওয়া হলে প্রতি ওজন উপাদানে 2 - z বিট খরচ হয়।

BITCOS 29টি পরীক্ষিত মডেলের মধ্যে 26টিতে পাঁচ-ট্রিট প্যাকিংয়ের চেয়ে বেশি কম্প্যাক্টভাবে ওজন সংরক্ষণ করে, এবং তাদের মধ্যে সবচেয়ে স্পার্সে 1.485 বিট প্রতি ওজনে পৌঁছায়। BITCOS আধুনিক প্রসেসর এবং GPU-তে দক্ষ আনপ্যাকিংয়ের জন্য উপযুক্ত, এবং আমরা AVX-512, AVX2 এবং Intel Xe2 GPU-এর জন্য অপ্টিমাইজড আনপ্যাকিং সিকোয়েন্স উপস্থাপন করি।

প্রোডাকশন স্টেট-অফ-দ্য-আর্ট টার্নারি ম্যাট্রিক্স-ভেক্টর গুণন কার্নেলের বিরুদ্ধে পরিমাপ করা, বাস্তব-বিশ্বের টার্নারি মডেলগুলি যে শূন্য ঘনত্ব প্রদর্শন করে, আমাদের প্রস্তাবিত লেআউটের সাথে অর্জিত লাভ 1.28× পর্যন্ত। অবশেষে, আমরা 5টি ভিন্ন প্ল্যাটফর্মে এন্ড-টু-এন্ড LLM ইনফারেন্স ফলাফল চিত্রিত করি যেখানে ডিকোড থ্রুপুট CPU-তে 1.18× এবং GPU-তে 1.27× পর্যন্ত উন্নত হয়।

মূল সত্তা: কোম্পানি: Intel | ব্যক্তি: Evangelos Georganas