HeadlinesBriefing favicon HeadlinesBriefing.com

Перепараметризация: снижение дисперсии градиентов

Towards Data Science •
×

Приём перепараметризации — это то, что делает вариационные автоэнкодеры (VAE) обучаемыми с помощью стандартного стохастического градиентного спуска. Он работает, перемещая случайность вне графа вычислений и превращая неуклюжий градиент ожидания в обычную производную по цепному правилу. VAE — это генеративная модель. Кодировщик отображает входные данные x на распределение над латентной переменной z, а декодировщик отображает выборочную z обратно в реконструкцию x. То, что делает её обучаемой, — это её целевая функция, ELBO (Evidence Lower Bound), то есть управляемая замена истинной вероятности данных, состоящая из реконструктивного члена и члена, регуляризующего латентное распределение к простому априорному. Обучение VAE включает максимизацию этого ELBO с помощью градиентного спуска, и для этого необходимо вычислить градиент ожидания; точнее, необходимо вычислить градиент ожидаемого качества реконструкции по отношению к случайно выбранным латентным переменным z. В этой статье рассматривается эта проблема, два основных семейства оценщиков градиентов, используемых для её решения, и почему путевые градиенты, полученные через перепараметризацию, имеют значительно более низкую дисперсию по сравнению с альтернативой. Оценщик градиента с низкой дисперсией — это не просто теоретическое удобство. На практике это напрямую приводит к более стабильным кривым обучения, меньшим резким колебаниям функции потерь, более быстрой сходимости и лучшим конечным моделям. Это особенно критично для сложных моделей, таких как VAE, байесовские нейронные сети и агенты обучения с подкреплением непрерывного управления, где обучающий сигнал может быть слишком шумным, чтобы быть полезным. Проблема: градиенты ожиданий — почему сэмплирование ломает обратное распространение. Если мы хотим оптимизировать относительно θ. Если θ появлялся только внутри f, это была бы стандартная задача обратного распространения. Сложность в том, что θ параметризует распределение, из которого выбирается z — сам процесс сэмплирования зависит от θ — поэтому мы не можем просто продвинуть градиент через фиксированный граф вычислений. Монте-карловские оценки L(θ) просты (выбираем выборки, усредняем f(z)), но монте-карловские оценки θ L(θ) не являются автоматическими, потому что дифференцирование через операцию сэмплирования не определено хорошо. Есть два общих способа выйти из этого: оценщик функции скоринга (REINFORCE) и путевой/перепараметризационный оценщик. Оба несмещённы. Они сильно отличаются по дисперсии. Оценщик функции скоринга (REINFORCE): гибкий, но высокодисперсный. Классический трюк здесь — логарифмическое тождество производной: Подставляя это в градиент ожидания, получаем что теперь снова является ожиданием, поэтому его можно оценить, сэмплируя z ~ p_θ и усредняя f(z)·∂log p_θ(z)/∂θ. Это оценщик, стоящий за REINFORCE в обучении с подкреплением градиента политики, и он действительно универсален. Он работает для дискретного z и не требует перепараметризации распределения. Ключевые сущности: Компании: Towards Data Science. FAQ Q: Что такое приём перепараметризации и почему он снижает дисперсию градиентов? FAQ A: Приём перепараметризации перемещает случайность вне графа вычислений, превращая градиент ожидания в обычную производную по цепному правилу. Это позволяет получать путевые градиенты с значительно более низкой дисперсией по сравнению с оценщиками функции скоринга, такими как REINFORCE, что приводит к более стабильному обучению и более быстрой сходимости для моделей, таких как VAE и агенты обучения с подкреплением непрерывного управления.