HeadlinesBriefing favicon HeadlinesBriefing.com

RL untuk LLM: Efek Matius dan Jangan Pernah Menyerah

Hacker News •
×

Posting blog ini membahas makalah tentang pasca-pelatihan RL untuk LLM, memperkenalkan Efek Matius dan mengusulkan 'Jangan Pernah Menyerah' untuk mengatasinya. Penulis menyajikan secara interaktif, dengan detail teknis yang lebih dalam di makalah dan kode.

Setiap praktisi RL telah melihat kurva evaluasi naik, seperti AIME 2025 selama pelatihan Olmo 3.1 RL-Zero Math. Tapi apa artinya? Memecah 30 pertanyaan AIME menjadi tingkat kesulitan berdasarkan pass@32 awal, kami menemukan bahwa masalah mudah meningkat drastis, sementara masalah sulit (pass@32 awal=0) hampir tidak meningkat. Rata-rata menyembunyikan ini: keuntungan berasal dari masalah yang lebih mudah. Ini adalah Efek Matius.

Kami melihat hal serupa dalam RL kode dan RL agentik menggunakan Deepcoder dan Deep SWE. Keuntungan sebanding dengan kompetensi awal. Kami menghubungkan ini dengan Efek Matius dalam ilmu jaringan dan ekonomi: 'yang kaya semakin kaya'. Efek Matius dalam RL untuk LLM: RL meningkatkan kinerja sebanding dengan kompetensi awal—tugas mudah menjadi lebih mudah, tugas sulit tetap sulit.

Penyebab? Bukan hanya GRPO. Jika tidak ada jawaban benar dalam k sampel, tidak ada gradien. Salah satu perbaikan: sampel lebih banyak penyelesaian (k lebih besar). Kami menguji dengan Qwen 2.5 0.5B Instruct pada GSM8k platinum, memvariasikan k.