HeadlinesBriefing favicon HeadlinesBriefing.com

Cache-to-Cache: تواصل دلالي مباشر بين نماذج LLM

Hacker News •
×

تجمع أنظمة LLM المتعددة نماذج متنوعة لتحقيق أداء أفضل، لكن التصاميم الحالية تفرض التواصل عبر النص، مما يفقد الدلالات الغنية ويتسبب في زمن استجابة لكل رمز. هل يمكن لنماذج LLM التواصل خارج النص؟ تُظهر تجارب Oracle أن إثراء دلالات KV-Cache يحسّن جودة الاستجابة دون زيادة حجم الذاكرة المؤقتة.

لذلك، يُقترح Cache-to-Cache (C2C): نموذج جديد للتواصل الدلالي المباشر بين نماذج LLM. يستخدم C2C شبكة عصبية لإسقاط ودمج KV-cache للنموذج المصدر مع النموذج الهدف، مما يتيح نقلًا دلاليًا مباشرًا. تختار آلية بوابات قابلة للتعلم الطبقات الهدف التي تستفيد من تواصل الذاكرة المؤقتة.

بالمقارنة مع التواصل النصي، يستفيد C2C من دلالات عميقة ومتخصصة من كلا النموذجين مع تجنب توليد نص وسيط صريح. تُظهر التجارب أن C2C يحقق دقة متوسطة أعلى بنسبة 6.4-14.2% من النماذج الفردية، ويتفوق على التواصل النصي بنحو 3.1-5.4%، ويوفر تسريعًا متوسطًا 2.5x في زمن الاستجابة. الكود متاح على الرابط المقدم.

الكيانات الرئيسية: الأشخاص: Tianyu Fu

الأسئلة الشائعة: ما هو Cache-to-Cache (C2C)؟

C2C هو نموذج للتواصل الدلالي المباشر بين نماذج LLM عبر إسقاط ودمج KV-caches، متجنبًا توليد النص ومحسّنًا الدقة وزمن الاستجابة.

سؤال شائع: ما هو Cache-to-Cache (C2C)؟

إجابة شائعة: C2C هو نموذج للتواصل الدلالي المباشر بين نماذج LLM عبر إسقاط ودمج KV-caches، متجنبًا توليد النص ومحسّنًا الدقة وزمن الاستجابة.