HeadlinesBriefing favicon HeadlinesBriefing.com

Arquitectura RLT: Razonamiento Ilimitado

Hacker News •
×

El Transformer Recurrente en Bucle (RLT) introduce un codificador causal emparejado con un decodificador recurrente que preserva su estado oculto final y la caché de atención de ventana deslizante por capas a través de cada token. Esta arquitectura fusiona el razonamiento latente con profundidad temporal ilimitada, permitiendo el co-diseño de modelo-hardware y modelo-algoritmo RL. Un codificador paralelo maneja el procesamiento por lotes de tokens conocidos mientras el decodificador extiende la computación latente continua a medida que crecen las secuencias.

Tres principios fundamentales guían el diseño: profundidad de razonamiento que crece con la longitud de la secuencia, trabajo de hardware en paralelo alrededor de un núcleo recurrente, y una única transición del muestreo al replay RL. El sistema reutiliza pesos y memoria con puntos de control, manteniendo la computación de referencia sin reinicio de estado en los límites de servicio. Las formulaciones matemáticas definen el estado oculto como H_t = (s_t, C_t^D), donde la salida recurrente y el KV del decodificador se propagan hacia adelante a través de fusiones.

Un mecanismo de atención de ventana deslizante retiene claves y valores recientes, con prompt y respuesta compartiendo una transición de estado completa. Las configuraciones presentan 48 capas de codificador y 48 de decodificador con pesos de atención y FFN compartidos, donde cada token atraviesa 48t bloques de decodificador. El diseño soporta profundidad infinita como una ruta temporal extensible en lugar de computación infinita por token, aunque las ganancias de razonamiento realizadas y la eficiencia de hardware permanecen bajo investigación.