HeadlinesBriefing favicon HeadlinesBriefing.com

Cache-to-Cache: Direkte semantische Kommunikation zwischen LLMs

Hacker News •
×

Multi-LLM-Systeme kombinieren verschiedene Modelle für bessere Leistung, aber bestehende Designs erzwingen Kommunikation über Text, verlieren reichhaltige Semantik und verursachen Token-für-Token-Latenz. Können LLMs jenseits von Text kommunizieren? Oracle-Experimente zeigen, dass die Anreicherung der KV-Cache-Semantik die Antwortqualität verbessert, ohne die Cache-Größe zu erhöhen.

Daher wird Cache-to-Cache (C2C) vorgeschlagen: ein neues Paradigma für direkte semantische Kommunikation zwischen LLMs. C2C verwendet ein neuronales Netzwerk, um den KV-Cache des Quellmodells zu projizieren und mit dem des Zielmodells zu fusionieren, was einen direkten semantischen Transfer ermöglicht. Ein lernbarer Gating-Mechanismus wählt Zielschichten aus, die von der Cache-Kommunikation profitieren.

Im Vergleich zur Textkommunikation nutzt C2C tiefe, spezialisierte Semantik beider Modelle und vermeidet die explizite Generierung von Zwischentext. Experimente zeigen, dass C2C eine um 6,4-14,2% höhere durchschnittliche Genauigkeit als einzelne Modelle erreicht, die Textkommunikation um etwa 3,1-5,4% übertrifft und eine durchschnittliche 2,5-fache Beschleunigung der Latenz liefert. Der Code ist unter der angegebenen URL verfügbar.

Schlüsselentitäten: Personen: Tianyu Fu