HeadlinesBriefing HeadlinesBriefing.com

Pro Ver: Kredit Halus dalam RL Agen dengan Menargetkan Keputusan Penting

Hacker News •
×

Optimasi Kebijakan Relatif Grup (GRPO) telah menjadi pendekatan yang menjanjikan untuk melatih agen model bahasa besar. Namun, pemberian keuntungan tingkat trajektori secara seragam ke semua token kebijakan gagal membedakan keputusan yang penting dari yang kurang relevan, mengaburkan keputusan antara mana yang berkontribusi pada kesuksesan.

Kami memperkenalkan Pro Ver, sebuah kerangka kerja yang menargetkan keputusan yang berpotensi penting untuk penugasan kredit yang terperinci dalam pembelajaran penguatan agen. Diberikan grup peluncuran, seorang hakim agen membandingkan trajektori yang berhasil dan gagal untuk mengusulkan segmen yang berpotensi bertanggung jawab atas hasil yang berbeda. Alih-alih langsung mempercayai penilaian hakim, Pro Ver memverifikasi segmen yang diusulkan dengan memperkirakan keuntungannya dari perbedaan dalam tingkat keberhasilan terminal antara kelanjutan kebijakan saat ini yang diambil sampel sebelum dan sesudah segmen.

Perkiraan positif kemudian dimasukkan ke dalam keuntungan GRPO dari token kebijakan dalam segmen yang diusulkan. Dengan menggunakan penilaian model hanya untuk memilih tempat memverifikasi, Pro Ver mendasarkan kredit lokal pada hasil yang diamati tanpa mengevaluasi secara menyeluruh setiap keadaan antara. Di ALFWorld, Web Shop, dan Search QA, Pro Ver mencapai kinerja rata-rata terkuat pada kedua skala model, dengan peningkatan relatif terhadap GRPO sebesar 9,91% dan 7,12% untuk Qwen3.5-2B dan Qwen3.5-4B, masing-masing.

Entitas Kunci: Orang: Dongwon Jung

Sumber: Hacker News · Diringkas oleh HeadlinesBriefing