HeadlinesBriefing favicon HeadlinesBriefing.com

LLM Parameter Tak Terbatas: Bobot dari Data Langsung

Hacker News •
×

Hukum penskalaan menyatakan bahwa model bahasa menjadi lebih mampu dengan lebih banyak parameter dan data pelatihan. Arsitektur Mixture-of-Experts (MoE) telah mengikuti hukum-hukum ini untuk mencapai hasil yang luar biasa, hanya mengaktifkan sebagian kecil dari bank parameter tersimpan yang sangat besar per token.

Keberhasilan itu dibangun di atas data pra-pelatihan statis. Model yang diterapkan menghadapi dunia yang berbeda, di mana banyak data yang akan membuatnya lebih berguna tidak ada dalam set pelatihannya melainkan dalam interaksi langsung yang sedang ditanganinya, seperti fakta yang diberikan pengguna atau koreksi yang mereka berikan. Model konvensional tidak dapat belajar dari data ini, karena bobotnya dibekukan setelah pelatihan. Sebaliknya, pengetahuan dan perilaku yang diberikan saat runtime ditempatkan dalam prompt dan dibuang setelah permintaan berakhir.

Kami bertanya bagaimana sebuah arsitektur dapat belajar dari interaksi langsung dengan menuliskannya ke dalam bobotnya. Terinspirasi oleh MoE, kami mengusulkan LLM Parameter Tak Terbatas. Sebuah hypernetwork ringkas mengubah data runtime menjadi modulasi peringkat rendah dari jaringan dasar bersama, sehingga bobot feed-forward dihasilkan dari data langsung alih-alih disimpan dalam bank tetap. Di mana generator bobot sebelumnya membaca konteks sekali dan membeku, kami membawa keyakinan Bayesian atas kode laten generator dan memperbaruinya secara online.

Jejak penyimpanan tetap tetap, namun bobot yang dapat dikompilasi model secara efektif tak terbatas. Membawa pengetahuan runtime dalam bobot alih-alih prompt diamortisasi dalam komputasi, membebaskan jendela konteks, bertahan antar giliran, dan dapat menggeneralisasi lebih baik. Kami menetapkan protokol evaluasi yang menguji ini terhadap pembelajaran dalam konteks dan pengambilan.

Entitas Kunci: Orang: Jinli Hu