Nur wenige Entscheidungen im Design neuronaler Netze haben so viele Überarbeitungen angezogen wie die Wahl der Aktivierungsfunktion. Es ist der Punkt, an dem der Vergleich mit der Biologie am wörtlichsten ist und entscheidet, was es bedeutet, dass ein künstliches Neuron feuert. Die frühe Antwort begünstigte die biologische Ähnlichkeit: Warren Mc Culloch und Walter Pitts schlugen 1943 das erste formale Neuronmodell vor, und Frank Rosenblatts Perzeptron fügte 1957 anpassbare Gewichte hinzu. Die Sigmoidfunktion mit ihrer glatten, sättigenden Kurve wurde als Spiegelung des abgestuften neuronalen Feuerns angesehen, und biologische Plausibilität diente sowohl als Designprinzip als auch als Prestigequelle.
In den frühen 2010er Jahren verdrängte die Rectified Linear Unit (ReLU) das Sigmoid, weil sie tiefe Netzwerke trainierbar machte, wo das Sigmoid es nicht konnte. Die Ableitung des Sigmoids führt dazu, dass Gradienten durch Rückpropagation verschwinden, da das Produkt kleiner Ableitungen mit jeder Schicht schrumpft. ReLU löste dies, indem es Sättigung vermied und so ein effektives Training tieferer Netzwerke ermöglichte.
Die ReLU-Revolution zeigte, dass die Aktivierungsfunktion nie eine feste biologische Verpflichtung war, sondern eine Arbeitshypothese, die unter empirischem Druck überarbeitet wurde. Der Wechsel von biologischer Inspiration zu pragmatischer Leistung stellt in Frage, wie viel Gewicht die Biologie im Design neuronaler Netze tatsächlich hatte.
Quelle: Towards Data Science · Zusammengefasst von HeadlinesBriefing