HeadlinesBriefing favicon HeadlinesBriefing.com

Cache-to-Cache: Komunikasi Semantik Langsung Antar LLM

Hacker News •
×

Sistem multi-LLM menggabungkan berbagai model untuk performa lebih baik, tetapi desain yang ada memaksa komunikasi melalui teks, kehilangan semantik yang kaya dan menimbulkan latensi token demi token. Dapatkah LLM berkomunikasi di luar teks? Eksperimen Oracle menunjukkan bahwa memperkaya semantik KV-Cache meningkatkan kualitas respons tanpa menambah ukuran cache.

Dengan demikian, Cache-to-Cache (C2C) diusulkan: paradigma baru untuk komunikasi semantik langsung antar LLM. C2C menggunakan jaringan saraf untuk memproyeksikan dan menggabungkan KV-cache model sumber dengan model target, memungkinkan transfer semantik langsung. Mekanisme gating yang dapat dipelajari memilih lapisan target yang mendapat manfaat dari komunikasi cache.

Dibandingkan dengan komunikasi teks, C2C memanfaatkan semantik mendalam dan terspesialisasi dari kedua model sekaligus menghindari generasi teks perantara yang eksplisit. Eksperimen menunjukkan C2C mencapai akurasi rata-rata 6,4-14,2% lebih tinggi daripada model individual, mengungguli komunikasi teks sekitar 3,1-5,4%, dan memberikan percepatan rata-rata 2,5x dalam latensi. Kode tersedia di URL yang disediakan.

Entitas Kunci: Orang: Tianyu Fu