HeadlinesBriefing favicon HeadlinesBriefing.com

LLM à Paramètres Infinis : Poids issus de Données en Direct

Hacker News •
×

Les lois d'échelle stipulent qu'un modèle de langage devient plus performant avec plus de paramètres et de données d'entraînement. Les architectures Mixture-of-Experts (MoE) ont exploité ces lois pour obtenir des résultats remarquables, en n'activant qu'une fraction d'une énorme banque de paramètres stockés par token.

Ce succès repose sur des données de pré-entraînement statiques. Un modèle déployé fait face à un monde différent, où une grande partie des données qui le rendraient plus utile ne se trouve pas dans son ensemble d'entraînement mais dans l'interaction en direct qu'il traite actuellement, comme des faits fournis par un utilisateur ou des corrections qu'il apporte. Un modèle conventionnel ne peut pas apprendre de ces données, car ses poids sont figés après l'entraînement. Au lieu de cela, les connaissances et les comportements fournis au moment de l'exécution sont placés dans le prompt et jetés une fois la requête terminée.

Nous nous demandons comment une architecture pourrait apprendre de l'interaction en direct en l'écrivant dans ses poids. En nous inspirant de MoE, nous proposons le LLM à Paramètres Infinis. Un hyperréseau compact transforme les données d'exécution en une modulation de bas rang d'un réseau de base partagé, de sorte que les poids feed-forward sont générés à partir de données en direct plutôt que stockés dans une banque fixe. Là où les générateurs de poids antérieurs lisent le contexte une fois et se figent, nous portons une croyance bayésienne sur le code latent du générateur et la mettons à jour en ligne.

L'empreinte stockée reste fixe, mais les poids que le modèle peut compiler sont effectivement infinis. Porter les connaissances d'exécution dans les poids plutôt que dans le prompt est amorti en calcul, libère la fenêtre de contexte, persiste entre les tours et peut mieux généraliser. Nous spécifions un protocole d'évaluation testant cela contre l'apprentissage en contexte et la récupération.

Entités clés : Personnes : Jinli Hu

FAQ : Qu'est-ce que le LLM à Paramètres Infinis ?

C'est une architecture proposée où un hyperréseau compact transforme les données d'exécution en direct en une modulation de bas rang d'un réseau de base partagé, générant des poids feed-forward à partir de données en direct plutôt que de les stocker dans une banque fixe.

FAQ Q : Qu'est-ce que le LLM à Paramètres Infinis ?

FAQ R : C'est une architecture proposée où un hyperréseau compact transforme les données d'exécution en direct en une modulation de bas rang d'un réseau de base partagé, générant des poids feed-forward à partir de données en direct plutôt que de les stocker dans une banque fixe.