HeadlinesBriefing favicon HeadlinesBriefing.com

Cache-to-Cache: Comunicação semântica direta entre LLMs

Hacker News •
×

Sistemas multi-LLM combinam diversos modelos para melhor desempenho, mas os designs existentes forçam a comunicação por texto, perdendo semântica rica e incorrendo em latência token a token. Os LLMs podem se comunicar além do texto? Experimentos Oracle mostram que enriquecer a semântica do KV-Cache melhora a qualidade da resposta sem aumentar o tamanho do cache.

Assim, Cache-to-Cache (C2C) é proposto: um novo paradigma para comunicação semântica direta entre LLMs. O C2C usa uma rede neural para projetar e fundir o KV-cache do modelo de origem com o do modelo de destino, permitindo transferência semântica direta. Um mecanismo de gating aprendível seleciona as camadas de destino que se beneficiam da comunicação de cache.

Comparado à comunicação por texto, o C2C utiliza semântica profunda e especializada de ambos os modelos enquanto evita a geração explícita de texto intermediário. Experimentos mostram que o C2C alcança precisão média 6,4-14,2% maior que modelos individuais, supera a comunicação por texto em aproximadamente 3,1-5,4%, e oferece um ganho médio de 2,5x em latência. O código está disponível na URL fornecida.

Entidades-chave: Pessoas: Tianyu Fu