HeadlinesBriefing favicon HeadlinesBriefing.com

RL for LLMs:马太效应与永不放弃

Hacker News •
×

这篇博客文章讨论了一篇关于LLM强化学习后训练的论文,介绍了马太效应,并提出“永不放弃”来解决它。作者以交互方式呈现,论文和代码中有更深入的技术细节。

每一位强化学习实践者都见过评估曲线上升,就像Olmo 3.1 RL-Zero Math训练期间的AIME 2025一样。但这意味着什么?将30道AIME题目根据初始pass@32按难度分级,我们发现简单问题大幅提升,而难题(初始pass@32=0)几乎不提升。取平均值掩盖了这一点:收益来自较简单的问题。这就是马太效应。

我们在使用Deepcoder和Deep SWE的代码强化学习和智能体强化学习中也看到类似现象。收益与初始能力成正比。我们将此与网络科学和经济学中的马太效应联系起来:“富者愈富”。LLM强化学习中的马太效应:强化学习提升性能与初始能力成正比——简单任务变得更容易,困难任务依然困难。

原因?不仅仅是GRPO。如果k个样本中没有正确答案,就没有梯度。一个解决办法:采样更多完成(更大的k)。我们在GSM8k platinum上用Qwen 2.5 0.5B Instruct进行测试,改变k。

FAQ:LLM强化学习中的马太效应是什么?

LLM强化学习中的马太效应描述了强化学习如何根据模型的初始能力成比例地提升任务表现——使简单任务更容易,而困难任务往往依然困难。

FAQ Q:LLM强化学习中的马太效应是什么?

FAQ A:LLM强化学习中的马太效应描述了强化学习如何根据模型的初始能力成比例地提升任务表现——使简单任务更容易,而困难任务往往依然困难。