HeadlinesBriefing favicon HeadlinesBriefing.com

Cache-to-Cache: Прямая семантическая коммуникация между LLM

Hacker News •
×

Мульти-LLM системы объединяют различные модели для лучшей производительности, но существующие решения вынуждают общаться через текст, теряя богатую семантику и создавая задержку токен за токеном. Могут ли LLM общаться вне текста? Эксперименты Oracle показывают, что обогащение семантики KV-Cache улучшает качество ответа без увеличения размера кэша.

Таким образом, предлагается Cache-to-Cache (C2C): новая парадигма прямой семантической коммуникации между LLM. C2C использует нейронную сеть для проецирования и объединения KV-кэша исходной модели с KV-кэшем целевой модели, обеспечивая прямую семантическую передачу. Обучаемый механизм гейтинга выбирает целевые слои, которые выигрывают от коммуникации через кэш.

По сравнению с текстовой коммуникацией, C2C использует глубокую, специализированную семантику обеих моделей, избегая явной генерации промежуточного текста. Эксперименты показывают, что C2C достигает средней точности на 6,4-14,2% выше, чем отдельные модели, превосходит текстовую коммуникацию примерно на 3,1-5,4% и обеспечивает среднее ускорение 2,5x по задержке. Код доступен по предоставленному URL.

Ключевые сущности: Люди: Tianyu Fu