HeadlinesBriefing favicon HeadlinesBriefing.com

Dream-RSI ermöglicht rekursive KI-Selbstverbesserung

Hacker News •
×

Autoren: Tong Zheng, Xidong Wu, Zheng Zhang, Zhankui He, Chaoyi Zhang, Benjamin Coleman, Ruoqiao Wei, Di Bai, Haolin Liu, Rui Liu, Xue Wang, Yue Zhuan, Wang-Cheng Kang, Renkai Xiang, Heng Huang, Xinwu Cheng, Yunsong Guo

Dream-RSI führt einen Rahmen für skalierbare rekursive Selbstverbesserung in autonomen KI-Agenten ein. Das System löst das Explorationsflascenseckel durch, indem es die Entdeckungshistorie explizit und programmierbar durch eine leichte Orchestrierungsebene macht. Die wichtigste Erkenntnis nutzt die akkumulierte Entdeckungshistorie als Wiedergabesimulator über den realisierten Suchraum. Durch das Träumen in diesem historischen Wiedergabesimulator sichert Dream-RSI unverzügliche, kostengünstige Off-Policy-Rückmeldung, um Explore-Policies zu bewerten und zu verfeinern, ohne teure Online-Bewertungen. Die verbesserte Policy wird online erneut bereitgestellt, um weitere Entdeckungen zu fördern und kontinuierlich die Simulator-Pools in einer selbstverbessernden Schleife zu erweitern. In der Algorithmus-Ingenieurwesen, mathematischer Optimierung und GPU-Kernel-Ingenieurwesen erreicht Dream-RSI konkurrenzfähige oder verbesserte Entdeckungsqualität bei deutlich geringeren Entdeckungskosten in mehreren Szenarien. Die Einreichung stammt von Tong Zheng und ist als PDF und experimentelle HTML-Version verfügbar.