HeadlinesBriefing favicon HeadlinesBriefing.com

LLM с бесконечными параметрами: веса из живых данных

Hacker News •
×

Законы масштабирования утверждают, что языковая модель становится более способной с увеличением числа параметров и объёма обучающих данных. Архитектуры смеси экспертов (MoE) использовали эти законы для достижения выдающихся результатов, активируя лишь часть огромного банка сохранённых параметров на каждый токен.

Этот успех основан на статических данных предварительного обучения. Развёрнутая модель сталкивается с другим миром, где большая часть данных, которые сделали бы её полезнее, находится не в обучающем наборе, а в живом взаимодействии, которое она обрабатывает в данный момент, например факты, предоставленные пользователем, или внесённые им исправления. Обычная модель не может учиться на этих данных, поскольку её веса заморожены после обучения. Вместо этого знания и поведение, предоставленные во время выполнения, помещаются в промпт и отбрасываются после завершения запроса.

Мы задаёмся вопросом, как архитектура могла бы учиться на живом взаимодействии, записывая его в свои веса. Вдохновляясь MoE, мы предлагаем LLM с бесконечными параметрами. Компактная гиперсеть превращает данные времени выполнения в низкоранговую модуляцию общей базовой сети, так что веса прямого распространения генерируются из живых данных, а не хранятся в фиксированном банке. Там, где предыдущие генераторы весов читают контекст один раз и замораживаются, мы несём байесовское убеждение о латентном коде генератора и обновляем его онлайн.

Сохранённый объём остаётся фиксированным, однако веса, которые модель может скомпилировать, фактически бесконечны. Перенос знаний времени выполнения в веса, а не в промпт, амортизируется по вычислениям, освобождает окно контекста, сохраняется между ходами и может лучше обобщать. Мы определяем протокол оценки, проверяющий это в сравнении с обучением в контексте и извлечением.

Ключевые сущности: Люди: Jinli Hu