HeadlinesBriefing favicon HeadlinesBriefing.com

Dream-RSI permet l'auto-amélioration récursive de l'IA

Hacker News •
×

Auteurs : Tong Zheng, Xidong Wu, Zheng Zhang, Zhankui He, Chaoyi Zhang, Benjamin Coleman, Ruoqiao Wei, Di Bai, Haolin Liu, Rui Liu, Xue Wang, Yue Zhuan, Wang-Cheng Kang, Renkai Xiang, Heng Huang, Xinwu Cheng, Yunsong Guo

Dream-RSI introduit un cadre pour une auto-amélioration récursive évolutif dans les agents d'IA autonomes. Le système résout le goulot d'étranglement de l'exploration en rendant l'historique de découverte explicite et programmable via une couche d'orchestration légère. La clé insight utilise l'historique accumulé de découverte comme simulateur de relecture sur l'espace de recherche réalisé. En effectuant des rêves dans ce simulateur de relecture historique, Dream-RSI assure un retour d'expérience immédiat, à faible coût, hors politique, pour évaluer et affiner les politiques d'exploration sans évaluations en ligne coûteuses. La politique améliorée est redéployée en ligne pour pousser davantage la découverte, en expandant continuellement le pool de simulateurs dans une boucle d'auto-amélioration. Dans l'ingénierie algorithmique, l'optimisation mathématique et l'ingénierie de noyaux GPU, Dream-RSI obtient une qualité de découverte compétitive ou améliorée tout en réduisant considérablement le coût de découverte dans plusieurs paramètres. La soumission provient de Tong Zheng et est disponible en tant que PDF et version HTML expérimentale.