HeadlinesBriefing HeadlinesBriefing.com

Pro Ver: Feinkörnige Kreditzuweisung in agentischem RL durch Schlüsselentscheidungen

Hacker News •
×

Die Gruppenrelative Politikoptimierung (GRPO) ist zu einem vielversprechenden Ansatz zum Trainieren von großen Sprachmodell-Agenten geworden. Ihre gleichmäßige Zuweisung von Trajektorien-Vorteilen an alle Politik-Token unterscheidet jedoch nicht zwischen folgenreichen und weniger relevanten Entscheidungen und verschleiert, welche Zwischenentscheidungen zum Erfolg beigetragen haben.

Wir stellen Pro Ver vor, ein Framework, das potenziell entscheidende Entscheidungen für die feinkörnige Kreditzuweisung im agentischen Verstärkungslernen anvisiert. Bei einer gegebenen Rollout-Gruppe vergleicht ein agentischer Richter erfolgreiche und fehlgeschlagene Trajektorien, um ein Segment vorzuschlagen, das möglicherweise für ihre unterschiedlichen Ergebnisse verantwortlich ist. Anstatt der Bewertung des Richters direkt zu vertrauen, verifiziert Pro Ver das vorgeschlagene Segment, indem es seinen Vorteil aus der Differenz der terminalen Erfolgsraten zwischen vor und nach dem Segment abgetasteten Fortsetzungen der aktuellen Politik schätzt.

Positive Schätzungen werden dann in die GRPO-Vorteile der Politik-Token innerhalb des vorgeschlagenen Segments eingebaut. Indem Modellurteil nur verwendet wird, um auszuwählen, wo verifiziert werden soll, verankert Pro Ver lokalen Kredit in beobachteten Ergebnissen, ohne jeden Zwischenzustand erschöpfend zu bewerten. Auf ALFWorld, Web Shop und Search QA erzielt Pro Ver die stärkste durchschnittliche Leistung auf beiden Modellskalen mit relativen Verbesserungen gegenüber GRPO von 9,91 % und 7,12 % für Qwen3.5-2B bzw. Qwen3.5-4B.

Wichtige Entitäten: Personen: Dongwon Jung

Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing