HeadlinesBriefing favicon HeadlinesBriefing.com

Los LLM no son solo predictores de la siguiente palabra

Hacker News •
×

Estrictamente hablando, la afirmación de que "los LLM son predictores de la siguiente palabra" no es incorrecta, pero es incompleta. Es una buena aproximación de orden cero y se basa en algo real: los modelos de lenguaje basados en transformadores emiten tokens de manera autorregresiva. Durante el preentrenamiento, el modelo toma repetidamente algunos tokens anteriores, observa el token que realmente les siguió y hace que ese token sea más probable de ser muestreado a continuación.

El punto clave es que cada token siguiente real proviene de una secuencia existente en los datos de entrenamiento. Probablemente sea justo decir que el modelo base también se comporta como un predictor de la siguiente palabra. Pero los LLM que usamos no son solo modelos base. Han sido post-entrenados, y una parte clave del post-entrenamiento moderno es el aprendizaje por refuerzo con recompensas verificables (RLVR). Durante el preentrenamiento, el modelo aprende solo de secuencias que ya existen en los datos de entrenamiento. Durante RLVR, el modelo explora generando nuevas secuencias y aprendiendo de sus resultados.

Una analogía con el ajedrez hace que esta distinción sea más fácil de ver. El primer sistema se entrena en una gran base de datos de partidas de grandes maestros y predice el movimiento que un gran maestro probablemente haría a continuación. El segundo es un motor de ajedrez idealizado que ha explorado todos los juegos posibles y elige el movimiento que conduce a la mayor probabilidad de ganar. Llamar al segundo sistema un "predictor del siguiente movimiento" sería extraño.

Otras técnicas de post-entrenamiento también importan. El aprendizaje por refuerzo con retroalimentación humana (RLHF) desplaza el modelo hacia simular un asistente útil. RLVR va más allá: permite que un LLM explore y aprenda de sus propias secuencias generadas.

Preguntas frecuentes: ¿Por qué es incompleto decir que los LLM son solo predictores de la siguiente palabra?

Aunque los LLM emiten tokens de manera autorregresiva, el post-entrenamiento con RLVR les permite aprender de nuevas secuencias generadas por exploración, no solo de datos existentes. Esto los hace más como tomadores de decisiones que optimizan recompensas que simples predictores.