HeadlinesBriefing favicon HeadlinesBriefing.com

Les LLM ne sont pas de simples prédicteurs de prochain jeton

Hacker News •
×

À strictement parler, l'affirmation selon laquelle « les LLM sont des prédicteurs de prochain jeton » n'est pas fausse, mais elle est incomplète. C'est une bonne approximation d'ordre zéro, et elle repose sur quelque chose de réel : les modèles de langage basés sur les transformeurs émettent des jetons de manière autorégressive. Pendant le pré-entraînement, le modèle prend à plusieurs reprises certains jetons précédents, observe le jeton qui les a réellement suivis, et rend ce jeton plus susceptible d'être échantillonné ensuite.

Le point crucial est que chaque jeton suivant réel provient d'une séquence existante dans les données d'entraînement. Il est probablement juste de dire que le modèle de base se comporte également comme un prédicteur de prochain jeton. Mais les LLM que nous utilisons ne sont pas de simples modèles de base. Ils sont post-entraînés, et une partie clé du post-entraînement moderne est l'apprentissage par renforcement avec récompenses vérifiables (RLVR). Pendant le pré-entraînement, le modèle n'apprend qu'à partir de séquences qui existent déjà dans les données d'entraînement. Pendant RLVR, le modèle explore en générant de nouvelles séquences et en apprenant de leurs résultats.

Une analogie avec les échecs rend cette distinction plus facile à voir. Le premier système est entraîné sur une grande base de données de parties de grands maîtres et prédit le coup qu'un grand maître jouerait probablement ensuite. Le second est un moteur d'échecs idéalisé qui a exploré toutes les parties possibles et choisit le coup qui mène à la plus haute probabilité de gagner. Appeler le second système un « prédicteur de prochain coup » serait étrange.

D'autres techniques de post-entraînement comptent aussi. L'apprentissage par renforcement à partir de feedback humain (RLHF) déplace le modèle vers la simulation d'un assistant utile. RLVR va plus loin : il permet à un LLM d'explorer et d'apprendre de ses propres séquences générées.

FAQ : Pourquoi est-il incomplet de dire que les LLM sont de simples prédicteurs de prochain jeton ?

Bien que les LLM émettent des jetons de manière autorégressive, le post-entraînement avec RLVR leur permet d'apprendre de nouvelles séquences générées par exploration, pas seulement des données existantes. Cela les rend plus comme des décideurs optimisant des récompenses que de simples prédicteurs.