Композиция линейных отображений снова линейна. Если между слоями нет нелинейности, хоть сто слоёв схлопнутся в одну матрицу. Активация \(\sigma\) ломает эту линейность и позволяет приближать сложные функции.
Сигмоида
Диапазон \((0,1)\). На краях производная почти ноль — классическая проблема затухающих градиентов.
Гиперболический тангенс
Центрирован около нуля, поэтому часто удобнее сигмоиды во скрытых слоях старых сетей.
ReLU и родственники
ReLU дешёвая и хорошо проводит градиент при \(z>0\). Цена — «мёртвые» нейроны, которые всегда выдают ноль. Leaky ReLU оставляет тонкий отрицательный ток.
GELU и Swish
В трансформерах чаще встречаются гладкие активации:
\(\Phi\) — функция распределения стандартного нормального закона. GELU можно читать как «пропускать \(z\) с вероятностью, зависящей от величины \(z\)».
Softmax
Для \(K\) классов вектор логитов \(\mathbf{z}\) превращают в распределение:
Якобиан softmax красиво записывается через диагональ и внешнее произведение: