Лекция 04

Что именно минимизирует сеть

Обучение — это поиск параметров \(\theta\), которые делают среднюю ошибку на данных маленькой. Формально решают задачу эмпирического риска:

$$\hat{\theta} = \arg\min_\theta \frac{1}{n}\sum_{i=1}^{n} \ell\!\left(f_\theta(\mathbf{x}_i), y_i\right) + \lambda\,\Omega(\theta)$$

\(\ell\) — функция потерь на одном примере, \(\Omega\) — штраф за сложность модели, \(\lambda\) — сила регуляризации.

Среднеквадратичная ошибка

Для регрессии чаще всего

$$\ell_{\mathrm{MSE}}(\hat{y},y)=\frac{1}{2}(\hat{y}-y)^2, \qquad \frac{\partial \ell_{\mathrm{MSE}}}{\partial\hat{y}}=\hat{y}-y$$

Множитель \(1/2\) ставят ради удобной производной. Если предполагать гауссов шум \(y=\hat{y}+\varepsilon\), \(\varepsilon\sim\mathcal{N}(0,\sigma^2)\), максимум правдоподобия совпадает с минимумом MSE.

Кросс-энтропия

Для классификации с истинным распределением \(\mathbf{y}\) (обычно one-hot) и предсказанием \(\mathbf{p}\):

$$\ell_{\mathrm{CE}}(\mathbf{p},\mathbf{y}) = -\sum_{k=1}^{K} y_k\log p_k$$

Если \(K=2\) и \(p=\sigma(z)\), получается бинарная логистическая потеря:

$$\ell = -y\log\sigma(z) - (1-y)\log(1-\sigma(z)) = \log(1+e^{-(2y-1)z})$$

Пара softmax + кросс-энтропия даёт особенно простой градиент по логитам:

$$\frac{\partial \ell_{\mathrm{CE}}}{\partial z_k} = p_k - y_k$$

Hinge и другие запасные варианты

$$\ell_{\mathrm{hinge}}(z,y)=\max(0,1-yz), \qquad \ell_{\mathrm{Huber}}(\delta)=\begin{cases} \tfrac12 r^2, & |r|\le\delta \\ \delta(|r|-\tfrac12\delta), & |r|>\delta \end{cases}$$

Hinge связана с SVM. Huber устойчивее к выбросам, чем чистый квадрат.

Регуляризация

Два классических штрафа:

$$\Omega_{L2}(\theta)=\frac12\|\theta\|_2^2, \qquad \Omega_{L1}(\theta)=\|\theta\|_1$$

\(L2\) (weight decay) тянет веса к нулю гладко. \(L1\) поощряет разреженность. Dropout можно смотреть как стохастическую регуляризацию: на прямом ходе нейрон оставляют с вероятностью \(p\), иначе обнуляют и на тесте масштабируют активации на \(p\).

Точность классификации и функция потерь — разные вещи. Сеть оптимизирует \(\ell\), а accuracy лишь дискретная метрика. Поэтому «лосс падает, а точность стоит» — нормальная ситуация на плато.

KL и связь с кросс-энтропией

$$D_{\mathrm{KL}}(y\|p)=\sum_k y_k\log\frac{y_k}{p_k} = H(y,p)-H(y)$$

Энтропия истинных меток \(H(y)\) не зависит от модели, поэтому минимизация KL и кросс-энтропии совпадают.