Обучение — это поиск параметров \(\theta\), которые делают среднюю ошибку на данных маленькой. Формально решают задачу эмпирического риска:
\(\ell\) — функция потерь на одном примере, \(\Omega\) — штраф за сложность модели, \(\lambda\) — сила регуляризации.
Среднеквадратичная ошибка
Для регрессии чаще всего
Множитель \(1/2\) ставят ради удобной производной. Если предполагать гауссов шум \(y=\hat{y}+\varepsilon\), \(\varepsilon\sim\mathcal{N}(0,\sigma^2)\), максимум правдоподобия совпадает с минимумом MSE.
Кросс-энтропия
Для классификации с истинным распределением \(\mathbf{y}\) (обычно one-hot) и предсказанием \(\mathbf{p}\):
Если \(K=2\) и \(p=\sigma(z)\), получается бинарная логистическая потеря:
Пара softmax + кросс-энтропия даёт особенно простой градиент по логитам:
Hinge и другие запасные варианты
Hinge связана с SVM. Huber устойчивее к выбросам, чем чистый квадрат.
Регуляризация
Два классических штрафа:
\(L2\) (weight decay) тянет веса к нулю гладко. \(L1\) поощряет разреженность. Dropout можно смотреть как стохастическую регуляризацию: на прямом ходе нейрон оставляют с вероятностью \(p\), иначе обнуляют и на тесте масштабируют активации на \(p\).
KL и связь с кросс-энтропией
Энтропия истинных меток \(H(y)\) не зависит от модели, поэтому минимизация KL и кросс-энтропии совпадают.