Немногие решения в проектировании нейронных сетей привлекли столько пересмотров, как выбор функции активации. Это то место, где сравнение с биологией наиболее буквально, определяя, что означает для искусственного нейрона срабатывать. Ранний ответ отдавал предпочтение биологическому сходству: Warren Mc Culloch и Walter Pitts предложили первую формальную модель нейрона в 1943 году, а перцептрон Frank Rosenblatt в 1957 году добавил регулируемые веса. Сигмоидальная функция с ее гладкой насыщающейся кривой считалась отражающей градуированное нейронное возбуждение, и биологическая правдоподобность служила как принципом проектирования, так и источником престижа.
В начале 2010-х годов выпрямленная линейная единица (ReLU) вытеснила сигмоиду, потому что она сделала глубокие сети обучаемыми там, где сигмоида не могла. Производная сигмоиды вызывает исчезновение градиентов при обратном распространении, так как произведение малых производных сжимается с каждым слоем. ReLU решил эту проблему, избегая насыщения, что позволило эффективно обучать более глубокие сети.
Революция ReLU показала, что функция активации никогда не была фиксированным биологическим обязательством, а рабочей гипотезой, пересматриваемой под эмпирическим давлением. Переход от биологического вдохновения к прагматической производительности ставит под сомнение, какой вес биология на самом деле имела в проектировании нейронных сетей.
Источник: Towards Data Science · Сводку подготовил HeadlinesBriefing