HeadlinesBriefing favicon HeadlinesBriefing.com

Architecture RLT: Raisonnement Illimité

Hacker News •
×

Le Transformeur Récurrent en Boucle (RLT) introduit un encodeur causal associé à un décodeur récurrent qui préserve son état caché final et son cache d'attention à fenêtre glissante par couches à travers chaque token. Cette architecture fusionne le raisonnement latent avec une profondeur temporelle illimitée, permettant la co-conception modèle-matériel et modèle-algorithme RL. Un encodeur parallèle gère le traitement par lots de tokens connus tandis que le décodeur étend le calcul latent continu à mesure que les séquences s'allongent.

Trois principes fondamentaux guident la conception : une profondeur de raisonnement qui croît avec la longueur de la séquence, un travail matériel en parallèle autour d'un cœur récurrent, et une unique transition de l'échantillonnage au replay RL. Le système réutilise les poids et la mémoire avec des points de contrôle, maintenant le calcul de référence sans réinitialisation d'état aux limites de service. Les formulations mathématiques définissent l'état caché comme H_t = (s_t, C_t^D), où la sortie récurrente et le KV du décodeur se propagent vers l'avant à travers les fusions.

Un mécanisme d'attention à fenêtre glissante conserve les clés et valeurs récentes, avec prompt et réponse partageant une transition d'état complète. Les configurations comportent 48 couches d'encodeur et 48 de décodeur avec des poids d'attention et FFN partagés, où chaque token traverse 48t blocs de décodeur. La conception prend en charge une profondeur infinie comme un chemin temporel extensible plutôt qu'un calcul infini par token, bien que les gains de raisonnement réalisés et l'efficacité matérielle restent à l'étude.