HeadlinesBriefing HeadlinesBriefing.com

Автоэнкодеры против PCA: линейный побеждает

Towards Data Science •
×

Теоретическое преимущество, не выдержавшее контакта с реальным бенчмарком. Теоретический случай для автоэнкодеров ясен: обучите сеть только на нормальных данных, и она научится хорошо восстанавливать нормальные паттерны. В отличие от PCA, который может улавливать только линейные зависимости, автоэнкодер может изучать нелинейные — поэтому он должен обнаруживать аномалии, нарушающие нелинейную структуру. Я построил два эксперимента — один легкий случай, и другой, намеренно разработанный как лучший шанс автоэнкодера — и измерил, проявляется ли теоретическое преимущество на самом деле.

Настройка: синтетические данные, обученные только на нормальных образцах, оцененные на зарезервированной смеси нормальных и аномальных образцов. Сравнивались три метода: автоэнкодер (MLPRegressor с 3-мерным узким местом), ошибка реконструкции PCA (также уменьшенная до 3 компонентов) и Isolation Forest. Эксперимент 1: нормальные данные из гауссовских кластеров, аномалии со смещенным средним и более высокой дисперсией. PCA сравнялся или превзошел автоэнкодер — 0.885 F1 для обоих, обнаруживая каждую аномалию (полнота = 1.0). Isolation Forest показал 0.870.

Эксперимент 2: подстройка теста в пользу автоэнкодера. Я построил аномалии, специально невидимые для линейного метода: нормальные данные, где два признака следуют нелинейной зависимости (y = sin(3x) + шум), и аномалии, которые сохраняют тот же индивидуальный диапазон, но нарушают зависимость между ними. Это близко к наилучшему сценарию для автоэнкодера.

Ключевые сущности: Компании: Towards Data Science

FAQ В: Почему PCA сравнялся с автоэнкодером даже в тесте нелинейного обнаружения аномалий?

FAQ О: Потому что в Эксперименте 1 аномалия смещения среднего является линейным явлением, поэтому PCA не имел структурного недостатка. В Эксперименте 2, хотя автоэнкодер теоретически был предпочтительнее для нелинейных зависимостей, разделение ошибки реконструкции было все еще достаточно большим, чтобы точность линейного метода не имела большого значения.

Источник: Towards Data Science · Сводку подготовил HeadlinesBriefing