HeadlinesBriefing favicon HeadlinesBriefing.com

LLMのためのRL:マタイ効果と決して諦めないこと

Hacker News •
×

このブログ記事は、LLMのRLポストトレーニングに関する論文を議論し、マタイ効果を紹介し、それを解決するための「決して諦めない」を提案します。著者はインタラクティブに提示し、論文とコードに詳細な技術的詳細があります。

すべてのRL実践者は、Olmo 3.1 RL-Zero Mathのトレーニング中のAIME 2025のように、評価曲線が上昇するのを見てきました。しかし、それは何を意味するのでしょうか?30のAIME問題を初期pass@32に基づいて難易度レベルに分割すると、簡単な問題は劇的に改善しますが、難しい問題(初期pass@32=0)はほとんど改善しません。平均化はこれを隠していました:利益はより簡単な問題から来ています。これがマタイ効果です。

DeepcoderとDeep SWEを使用したコードRLとエージェントRLでも同様のことが見られます。利益は初期能力に比例します。これをネットワーク科学と経済学のマタイ効果に結び付けます:「金持ちはさらに金持ちになる」。LLMのためのRLにおけるマタイ効果:RLは初期能力に比例してパフォーマンスを改善します—簡単なタスクは簡単になり、難しいタスクは難しいままです。

原因は?GRPOだけではありません。kサンプルに正解がない場合、勾配はありません。1つの修正:より多くの完了をサンプリングする(より大きなk)。GSM8k platinumでQwen 2.5 0.5B Instructを使用して、kを変化させてテストします。

FAQ:LLMのためのRLにおけるマタイ効果とは何ですか?

LLMのためのRLにおけるマタイ効果は、RLがモデルの初期能力に比例してタスクのパフォーマンスを改善する方法を説明します—簡単なタスクを簡単にし、難しいタスクはしばしば難しいままです。

FAQ Q:LLMのためのRLにおけるマタイ効果とは何ですか?

FAQ A:LLMのためのRLにおけるマタイ効果は、RLがモデルの初期能力に比例してタスクのパフォーマンスを改善する方法を説明します—簡単なタスクを簡単にし、難しいタスクはしばしば難しいままです。