HeadlinesBriefing favicon HeadlinesBriefing.com

Cache-to-Cache: Comunicación semántica directa entre LLM

Hacker News •
×

Los sistemas multi-LLM combinan diversos modelos para obtener un mejor rendimiento, pero los diseños existentes fuerzan la comunicación a través de texto, perdiendo semántica rica e incurriendo en latencia token por token. ¿Pueden los LLM comunicarse más allá del texto? Experimentos Oracle muestran que enriquecer la semántica del KV-Cache mejora la calidad de la respuesta sin aumentar el tamaño del caché.

Así, se propone Cache-to-Cache (C2C): un nuevo paradigma para la comunicación semántica directa entre LLM. C2C utiliza una red neuronal para proyectar y fusionar el KV-cache del modelo fuente con el del modelo objetivo, permitiendo una transferencia semántica directa. Un mecanismo de compuerta aprendible selecciona las capas objetivo que se benefician de la comunicación de caché.

En comparación con la comunicación por texto, C2C utiliza semántica profunda y especializada de ambos modelos mientras evita la generación explícita de texto intermedio. Los experimentos muestran que C2C logra una precisión promedio 6.4-14.2% mayor que los modelos individuales, supera la comunicación por texto en aproximadamente 3.1-5.4%, y ofrece una aceleración promedio de 2.5x en latencia. El código está disponible en la URL proporcionada.

Entidades clave: Personas: Tianyu Fu