Un avantage théorique qui n'a pas survécu au contact d'un benchmark réel. Le cas théorique des autoencodeurs est clair : entraîner le réseau uniquement sur des données normales, et il apprend à bien reconstruire les motifs normaux. Contrairement à l'ACP, qui ne peut capturer que des relations linéaires, un autoencodeur peut apprendre des relations non linéaires — il devrait donc détecter les anomalies qui violent une structure non linéaire. J'ai construit deux expériences — un cas facile, et un autre délibérément conçu pour être la meilleure chance de l'autoencodeur — et mesuré si l'avantage théorique se manifeste réellement.
Configuration : données synthétiques, entraînées uniquement sur des échantillons normaux, évaluées sur un mélange réservé d'échantillons normaux et anormaux. Trois méthodes comparées : un autoencodeur (MLPRegressor avec un goulot d'étranglement 3 dimensions), l'erreur de reconstruction ACP (également réduite à 3 composantes), et Isolation Forest. Expérience 1 : données normales de clusters gaussiens, anomalies avec moyenne décalée et variance plus élevée. L'ACP a égalé ou battu l'autoencodeur — 0.885 F1 pour les deux, détectant chaque anomalie (rappel = 1.0). Isolation Forest est arrivé à 0.870.
Expérience 2 : truquer le test en faveur de l'autoencodeur. J'ai construit des anomalies spécifiquement invisibles pour une méthode linéaire : des données normales où deux caractéristiques suivent une relation non linéaire (y = sin(3x) + bruit), et des anomalies qui conservent la même plage individuelle mais violent la relation entre elles. C'est proche d'un scénario optimal pour l'autoencodeur.
Entités clés : Entreprises : Towards Data Science
FAQ Q : Pourquoi l'ACP a-t-elle égalé l'autoencodeur même dans le test de détection d'anomalies non linéaires ?
FAQ R : Parce que dans l'Expérience 1, l'anomalie de décalage de moyenne est un phénomène linéaire, donc l'ACP n'avait aucun désavantage structurel. Dans l'Expérience 2, même si l'autoencodeur était théoriquement favorisé pour les relations non linéaires, la séparation de l'erreur de reconstruction était encore suffisamment grande pour que la précision de la méthode linéaire n'ait pas beaucoup d'importance.
Source: Towards Data Science · Résumé par HeadlinesBriefing