Autores: Rulin Shao, Shannon Zejiang Shen, Junjie Oscar Yin, Yuetai Li, Minheng Wang, Hamish Ivison, Radha Poovendran, Nathan Lambert, Teng Xiao, Mike Lewis, Wen-tau Yih, Luke Zettlemoyer, Pang Wei Koh. Presentamos los Modelos de Lenguaje de Contexto (CLMs), modelos de lenguaje que gestionan nativamente su propio contexto. Implementamos esto tratando el contexto como un archivo y permitiendo que el modelo realice actualizaciones sin restricciones a este archivo. Esto permite que el modelo aprenda qué es más importante mantener en el contexto, y se extiende naturalmente a sistemas multiagente donde los contextos de múltiples agentes coexisten como archivos.
Construir CLMs con modelos existentes de forma zero-shot supera las estrategias de gestión de contexto de última generación en una variedad de tareas: 11.4% más de precisión con 21.5% menos FLOPs en Browse Comp-Plus, 5% más de puntuación con 59% menos FLOPs en Edge Bench de 12 horas, y 65% más de mejora con el mismo cómputo en una tarea de enjambre multi-repositorio de 24 horas. Además, al trasladar la gestión del contexto del control externo al comportamiento intrínseco del modelo, los CLMs permiten naturalmente tanto el aprendizaje en contexto como paramétrico de estrategias de gestión de contexto.
Mostramos que los CLMs pueden ser dirigidos con instrucciones en lenguaje natural evolucionadas a través de un bucle de optimización de habilidades estándar, mejorando la precisión en datos no vistos hasta en 35.9 puntos en una tarea de gestión de contexto mientras se reduce el cómputo. También introducimos un método de aprendizaje por refuerzo en línea para CLMs, mejorando el rendimiento de Qwen3.5-9B en Browse Comp-Plus en un 47.6% mientras se usan 12% menos FLOPs. Finalmente, co-diseñamos Suffix Cache Reuse para el servicio de CLMs, reduciendo aún más el cómputo del servidor en un 35% en comparación con SGLang estándar con rendimiento equivalente.
Entidades Clave: Personas: Rulin Shao, Shannon Zejiang Shen, Junjie Oscar Yin, Yuetai Li, Minheng Wang, Hamish Ivison, Radha Poovendran, Nathan Lambert, Teng Xiao, Mike Lewis, Wen-tau Yih, Luke Zettlemoyer, Pang Wei Koh
Fuente: Hacker News · Resumido por HeadlinesBriefing