HeadlinesBriefing favicon HeadlinesBriefing.com

Arquitetura RLT: Raciocínio Ilimitado

Hacker News •
×

O Transformer Recorrente em Loop (RLT) introduz um codificador causal emparelhado com um decodificador recorrente que preserva seu estado oculto final e cache de atenção de janela deslizante por camadas em cada token. Esta arquitetura funde raciocínio latente com profundidade temporal ilimitada, permitindo co-design de modelo-hardware e modelo-algoritmo RL. Um codificador paralelo lida com processamento em lote de tokens conhecidos enquanto o decodificador estende computação latente contínua à medida que as sequências crescem.

Três princípios fundamentais guiam o design: profundidade de raciocínio que cresce com o comprimento da sequência, trabalho de hardware em paralelo em torno de um núcleo recorrente, e uma única transição da amostragem para replay RL. O sistema reutiliza pesos e memória com checkpointing, mantendo computação de referência sem reinicialização de estado nos limites de serviço. Formulações matemáticas definem o estado oculto como H_t = (s_t, C_t^D), onde a saída recorrente e o KV do decodificador propagam para frente através de fusões.

Um mecanismo de atenção de janela deslizante retém chaves e valores recentes, com prompt e resposta compartilhando uma transição de estado completa. Configurações apresentam 48 camadas de codificador e 48 de decodificador com pesos de atenção e FFN compartilhados, onde cada token percorre 48t blocos de decodificador. O design suporta profundidade infinita como um caminho temporal extensível em vez de computação infinita por token, embora ganhos de raciocínio realizados e eficiência de hardware permaneçam sob investigação.