HeadlinesBriefing favicon HeadlinesBriefing.com

GRPO entrena modelos de lenguaje pequeños

Towards Data Science •
×

Un modelo de lenguaje puede escribir 'dejeme verificar eso aún' y aún equivocarse en la multiplicación. Incluso puede escribir 'espera, reconsideremos,' y aterrizar en una respuesta incorrecta diferente. Ninguna de estas oraciones es evidencia de pensamiento.

Si el objetivo es resolver el problema, solo cuenta el número al final. Deep Seek's R1-Zero llamó considerablemente la atención al aprendizaje por refuerzo sin una etapa preliminar de ajuste fino supervisado. Sus investigadores informaron comportamientos como volver a un enfoque y gastar más tokens en problemas difíciles.

En contraste, Deep Seek-R1 utilizó una tubería de entrenamiento más amplia, incluyendo datos de cold-start, por lo que no deberíamos tratar los dos procesos de entrenamiento como intercambiables. Lo que más me interesa del Group Relative Policy Optimization, o GRPO como la mayoría de nosotros lo conocemos, es cuán poca retroalimentación necesita el setup básico. Un modelo puede generar varias intentos a una pregunta, recibir una puntuación para cada uno, y usar las diferencias para ajustar su comportamiento.

Incluso podemos verificar la respuesta final sin escribir la solución que queremos que imite. Combinado con técnicas que reducen la memoria de entrenamiento, esto hace que los experimentos de razonamiento más pequeños sean más accesibles. Eso deja dos cosas dignas de entender antes de elegir un modelo o una GPU: cómo esas puntuaciones guían una actualización, y qué sucede cuando la regla de puntuación recompensa lo incorrecto.

Un ejemplo simple de aritmética ayuda a explicar ambos. Considere cuatro respuestas posibles a la misma pregunta y cómo una función de recompensa puntuaría cada una. Un problema con una respuesta que podemos verificar: Una tienda tiene 6 cajas con 8 artículos en cada caja.

Vende 6 artículos. ¿Cuántos artículos quedan? La respuesta es 42. Una expresión de Python puede verificarlo. Ahora, esa simple verificación nos da algo valioso: una forma independiente de puntuar la respuesta final.

No necesitamos otro modelo de lenguaje para decidir si la respuesta suena convincente. En un conjunto de datos de entrenamiento, la pregunta va al modelo mientras la respuesta esperada se queda con el verificador. El modelo genera una respuesta, el verificador la puntúa, y el algoritmo de entrenamiento usa esa puntuación para ajustar el comportamiento del modelo.

Fácil. Por lo tanto, podemos usar pares de preguntas y respuestas sin proporcionar soluciones trabajadas como objetivos de entrenamiento supervisado. Esta es la atractivo del aprendizaje por refuerzo con recompensas verificables: la retroalimentación puede venir de verificar un resultado.

Para un sistema de inventario real, la aritmética ordinaria sigue siendo la solución sensata. El modelo de lenguaje sería una calculadora cara con opiniones. Aquí, el ejemplo hace que el mecanismo de aprendizaje sea fácil inspeccionar.

Esto también muestra donde nuestro verificador falla, porque verificar que el entero final es correcto no nos dice si el razonamiento detrás de él tiene sentido. GRPO fue introducido en el trabajo Deep Seek Math como una alternativa a los requisitos de memoria de la entrenamientos PPO convencional. Las implementaciones comunes de actor-critic PPO entrenan un estimador de valor, a menudo llamado critic, junto con la política.

Ese estimador provee una base para juzgar el resultado de una acción. GRPO obtiene su baseline de un grupo de respuestas muestreadas para el mismo prompt. En lugar de preguntar a un critic separado para estimar el modelo应该做得多好,它将几次实际尝试的好坏进行比较。想象 el modelo produce estas cuatro respuestas: Intento Respuesta final Premio de corrección 1 42 1, 2 24 0, 3 42 1, 4 48 0.

El promedio de recompensa del grupo es 0.5. Los intentos 1 y 3 realizaron mejor que ese promedio; los intentos 2 y 4 realizaron peor. La formulación original de recompensa basada en resultados estandariza esa comparación: [Ai=ri−rˉσr+ϵ].

Esto indica que los intentos 1 y 3 tienen recompensas estandarizadas superiores a 0, mientras que los intentos 2 y 4 tienen recompensas estandarizadas inferiores a 0. De esta manera, GRPO utiliza una grupo de respuestas的比较来指导模型更新,而无需外部 critic。.