Auteurs : Rulin Shao, Shannon Zejiang Shen, Junjie Oscar Yin, Yuetai Li, Minheng Wang, Hamish Ivison, Radha Poovendran, Nathan Lambert, Teng Xiao, Mike Lewis, Wen-tau Yih, Luke Zettlemoyer, Pang Wei Koh. Nous introduisons les Modèles de Langage Contextuels (CLMs), des modèles de langage qui gèrent nativement leur propre contexte. Nous implémentons cela en traitant le contexte comme un fichier et en permettant au modèle d'effectuer des mises à jour sans restriction sur ce fichier. Cela permet au modèle d'apprendre ce qui est le plus important à maintenir dans le contexte, et s'étend naturellement aux systèmes multi-agents où les contextes de plusieurs agents coexistent en tant que fichiers.
Construire des CLMs en zero-shot avec des modèles existants surpasse les stratégies de gestion de contexte de pointe (SOTA) sur une variété de tâches : 11,4% de précision en plus avec 21,5% de FLOPs en moins sur Browse Comp-Plus, 5% de scores plus élevés avec 59% de FLOPs en moins sur Edge Bench 12 heures, et 65% d'amélioration supplémentaire avec le même calcul sur une tâche d'essaim multi-dépôts de 24 heures. De plus, en déplaçant la gestion du contexte du contrôle externe vers le comportement intrinsèque du modèle, les CLMs permettent naturellement à la fois l'apprentissage en contexte et paramétrique des stratégies de gestion de contexte.
Nous montrons que les CLMs peuvent être orientés avec des instructions en langage naturel évoluées via une boucle d'optimisation de compétences standard, améliorant la précision sur les données retenues jusqu'à 35,9 points sur une tâche de gestion de contexte tout en réduisant le calcul. Nous introduisons également une méthode d'apprentissage par renforcement en ligne pour les CLMs, améliorant les performances de Qwen3.5-9B sur Browse Comp-Plus de 47,6% tout en utilisant 12% de FLOPs en moins. Enfin, nous co-concevons Suffix Cache Reuse pour le service des CLMs, réduisant encore le calcul côté serveur de 35% par rapport à SGLang standard à performance équivalente.
Entités Clés : Personnes : Rulin Shao, Shannon Zejiang Shen, Junjie Oscar Yin, Yuetai Li, Minheng Wang, Hamish Ivison, Radha Poovendran, Nathan Lambert, Teng Xiao, Mike Lewis, Wen-tau Yih, Luke Zettlemoyer, Pang Wei Koh
FAQ : Que sont les Modèles de Langage Contextuels (CLMs) ?
Les Modèles de Langage Contextuels (CLMs) sont des modèles de langage qui gèrent nativement leur propre contexte en le traitant comme un fichier avec des capacités de mise à jour sans restriction, permettant au modèle d'apprendre quoi maintenir dans le contexte et s'étendant aux systèmes multi-agents.
Source: Hacker News · Résumé par HeadlinesBriefing