HeadlinesBriefing favicon HeadlinesBriefing.com

Математическая модель трансформерных схем

Hacker News •
×

В этой статье представлены первые шаги к обратному проектированию трансформеров языковых моделей с помощью механической интерпретируемости. По мере масштабирования моделей таких как GPT-3, LaMDA, Codex, Meena и Gopher, их открытость создаёт риски неожиданного вредного поведения. Механическая интерпретируемость стремится к обратному проектированию детальных вычислений, аналогично обратному проектированию бинарных файлов в исходный код, что потенциально может предоставить систематические подходы к проблемам безопасности.

Авторы изучают трансформеры внимания только с двумя или менее слоями, в отличие от 96 слоёв GPT-3, чередующих блоки внимания и MLP. Путем концептуализации операций трансформера в математически эквивалентной модели, они получают значительное понимание внутренних операций. Ключевые результаты включают: трансформеры нулевого слоя моделируют статистику биграмм, доступную непосредственно из весов; модели с одним слоем являются ансамблями биграммных и "skip-trigram" моделей (последовательности как "A… B C") с непосредственно доступными таблицами; и определённые "индукционные головы" объясняют обучение в контексте в малых моделях, развиваясь только в моделях с как минимум двумя слоями внимания.

Фреймворк включает такие понятия, как виртуальные веса, остаточный поток как канал коммуникации, независимые аддитивные головы внимания, приёмы расширения пути и анализ схем QK/OV. Хотя эта первая статья ещё не применена к более крупным моделям, будущие работы показывают, что фреймворк и индукционные головы остаются частично актуальными для более крупных моделей, хотя полное обратное проектирование остаётся отдалённым.

Ключевые сущности: Компании: GPT-3, LaMDA, Codex, Meena, Gopher

Часто задаваемые вопросы: Что такое индукционные головы и почему они важны?

Индукционные головы — это определённые головы внимания, которые объясняют обучение в контексте в малых трансформерах. Они развиваются только в моделях с как минимум двумя слоями внимания, что предполагает механическую основу того, как трансформеры учатся копировать и завершать шаблоны из контекста.

FAQ Q: Что такое индукционные головы и почему они важны?

FAQ A: Индукционные головы — это определённые головы внимания, которые объясняют обучение в контексте в малых трансформерах. Они развиваются только в моделях с как минимум двумя слоями внимания, что предполагает механическую основу того, как трансформеры учатся копировать и завершать шаблоны из контекста.