HeadlinesBriefing favicon HeadlinesBriefing.com

Cache-to-Cache : Communication sémantique directe entre LLM

Hacker News •
×

Les systèmes multi-LLM combinent divers modèles pour de meilleures performances, mais les conceptions existantes imposent une communication par texte, perdant une sémantique riche et entraînant une latence token par token. Les LLM peuvent-ils communiquer au-delà du texte ? Des expériences Oracle montrent qu'enrichir la sémantique du KV-Cache améliore la qualité des réponses sans augmenter la taille du cache.

Ainsi, Cache-to-Cache (C2C) est proposé : un nouveau paradigme pour la communication sémantique directe entre LLM. C2C utilise un réseau de neurones pour projeter et fusionner le KV-cache du modèle source avec celui du modèle cible, permettant un transfert sémantique direct. Un mécanisme de portes apprenable sélectionne les couches cibles qui bénéficient de la communication de cache.

Comparé à la communication textuelle, C2C utilise une sémantique profonde et spécialisée des deux modèles tout en évitant la génération explicite de texte intermédiaire. Les expériences montrent que C2C atteint une précision moyenne 6,4-14,2 % supérieure aux modèles individuels, surpasse la communication textuelle d'environ 3,1-5,4 %, et offre une accélération moyenne de 2,5x en latence. Le code est disponible à l'URL fournie.

Entités clés : Personnes : Tianyu Fu

FAQ : Qu'est-ce que Cache-to-Cache (C2C) ?

C2C est un paradigme pour la communication sémantique directe entre LLM en projetant et fusionnant les KV-caches, évitant la génération de texte et améliorant la précision et la latence.

Question FAQ : Qu'est-ce que Cache-to-Cache (C2C) ?

Réponse FAQ : C2C est un paradigme pour la communication sémantique directe entre LLM en projetant et fusionnant les KV-caches, évitant la génération de texte et améliorant la précision et la latence.