ニューラルネットワーク設計において、活性化関数の選択ほど多くの修正を引き付けた決定はほとんどありません。それは生物学との比較が最も文字通りに行われる場所であり、人工ニューロンが発火する意味を決定します。初期の答えは生物学的類似性を支持しました:Warren Mc CullochとWalter Pittsは1943年に最初の形式的なニューロンモデルを提案し、Frank Rosenblattの1957年のパーセプトロンは調整可能な重みを追加しました。滑らかで飽和する曲線を持つシグモイド関数は、段階的なニューロン発火を反映すると見なされ、生物学的妥当性は設計原理と名声の両方の源として機能しました。
2010年代の初めに、整流線形ユニット(ReLU)がシグモイドに取って代わりました。なぜなら、シグモイドができなかった深層ネットワークを訓練可能にしたからです。シグモイドの導関数は、逆伝播を通じて勾配を消失させます。小さな導関数の積が層ごとに縮小するからです。ReLUは飽和を避けることでこれを解決し、より深いネットワークの効果的な訓練を可能にしました。
ReLU革命は、活性化関数が決して固定された生物学的コミットメントではなく、経験的圧力の下で修正される作業仮説であることを明らかにしました。生物学的インスピレーションから実用的パフォーマンスへの移行は、ニューラルネットワーク設計において生物学がどれだけの重みを持っていたかに疑問を投げかけます。
出典: Towards Data Science · 要約:HeadlinesBriefing