HeadlinesBriefing favicon HeadlinesBriefing.com

Cache-to-Cache: LLM-এর মধ্যে সরাসরি সিম্যান্টিক যোগাযোগ

Hacker News •
×

মাল্টি-LLM সিস্টেমগুলি আরও ভাল পারফরম্যান্সের জন্য বিভিন্ন মডেল একত্রিত করে, কিন্তু বিদ্যমান ডিজাইনগুলি টেক্সটের মাধ্যমে যোগাযোগ করতে বাধ্য করে, সমৃদ্ধ সিম্যান্টিক্স হারায় এবং টোকেন-বাই-টোকেন লেটেন্সি ঘটায়। LLM কি টেক্সটের বাইরে যোগাযোগ করতে পারে? Oracle পরীক্ষাগুলি দেখায় যে KV-Cache সিম্যান্টিক্স সমৃদ্ধ করলে ক্যাশ আকার না বাড়িয়েই প্রতিক্রিয়ার গুণমান উন্নত হয়।

তাই, Cache-to-Cache (C2C) প্রস্তাব করা হয়েছে: LLM-এর মধ্যে সরাসরি সিম্যান্টিক যোগাযোগের জন্য একটি নতুন প্যারাডাইম। C2C একটি নিউরাল নেটওয়ার্ক ব্যবহার করে সোর্স মডেলের KV-cache প্রজেক্ট করে এবং টার্গেট মডেলের সাথে ফিউজ করে, সরাসরি সিম্যান্টিক ট্রান্সফার সক্ষম করে। একটি শেখার যোগ্য গেটিং মেকানিজম সেই টার্গেট লেয়ারগুলি নির্বাচন করে যেগুলি ক্যাশ যোগাযোগ থেকে উপকৃত হয়।

টেক্সট যোগাযোগের তুলনায়, C2C উভয় মডেলের গভীর, বিশেষায়িত সিম্যান্টিক্স ব্যবহার করে এবং স্পষ্ট মধ্যবর্তী টেক্সট জেনারেশন এড়ায়। পরীক্ষাগুলি দেখায় যে C2C পৃথক মডেলের তুলনায় 6.4-14.2% বেশি গড় নির্ভুলতা অর্জন করে, টেক্সট যোগাযোগের চেয়ে প্রায় 3.1-5.4% ভাল পারফর্ম করে এবং লেটেন্সিতে গড়ে 2.5x গতি প্রদান করে। কোড প্রদত্ত URL-এ উপলব্ধ।

মূল সত্তা: ব্যক্তি: Tianyu Fu