Pocas decisiones en el diseño de redes neuronales han atraído tanta revisión como la elección de la función de activación. Es donde la comparación con la biología es más literal, decidiendo qué significa que una neurona artificial se dispare. La respuesta temprana favoreció la semejanza biológica: Warren Mc Culloch y Walter Pitts propusieron el primer modelo formal de neurona en 1943, y el perceptrón de Frank Rosenblatt en 1957 agregó pesos ajustables. La función sigmoide, con su curva suave y saturante, se consideró un reflejo del disparo neuronal graduado, y la plausibilidad biológica sirvió tanto como principio de diseño como fuente de prestigio.
A principios de la década de 2010, la Unidad Lineal Rectificada (ReLU) desplazó a la sigmoide porque hizo entrenables las redes profundas donde la sigmoide no pudo. La derivada de la sigmoide causa que los gradientes se desvanezcan a través de la retropropagación, ya que el producto de derivadas pequeñas se reduce con cada capa. ReLU resolvió esto evitando la saturación, permitiendo el entrenamiento efectivo de redes más profundas.
La revolución ReLU reveló que la función de activación nunca fue un compromiso biológico fijo, sino una hipótesis de trabajo revisada bajo presión empírica. El cambio de la inspiración biológica al rendimiento pragmático cuestiona cuánto peso tuvo realmente la biología en el diseño de redes neuronales.
Fuente: Towards Data Science · Resumido por HeadlinesBriefing