HeadlinesBriefing favicon HeadlinesBriefing.com

Архитектура RLT: неограниченное рассуждение

Hacker News •
×

Рекуррентный зацикленный трансформер (RLT) вводит причинный энкодер, объединенный с рекуррентным декодером, который сохраняет свое конечное скрытое состояние и поколоночный кэш внимания скользящего окна через каждый токен. Эта архитектура объединяет латентное рассуждение с неограниченной временной глубиной, позволяя совместное проектирование модель-аппаратное обеспечение и модель-алгоритм RL. Параллельный энкодер обрабатывает пакетизацию известных токенов, в то время как декодер расширяет непрерывное латентное вычисление по мере роста последовательностей. Три основных принципа направляют проектирование: глубина рассуждения, растущая с длиной последовательности, параллельная работа оборудования вокруг рекуррентного ядра, и единственный переход от сэмплирования к реплею RL. Система повторно использует веса и память с чекпоинтами, поддерживая эталонное вычисление без сброса состояния на границах обслуживания. Математические формулировки определяют скрытое состояние как H_t = (s_t, C_t^D), где рекуррентный выход и KV декодера передаются вперед через слияния. Механизм внимания скользящего окна сохраняет недавние ключи и значения, при этом промпт и ответ делят один полный переход состояния. Конфигурации включают 48 слоев энкодера и 48 слоев декодера с общими весами внимания и FFN, где каждый токен проходит через 48t блоков декодера. Проектирование поддерживает бесконечную глубину как расширяемый временной путь, а не бесконечное вычисление на токен, хотя реализованные приросты рассуждения и эффективность оборудования остаются под исследованием.