Справочник

Короткий словарь курса

Термины, которые встречаются на страницах. Формулы специально повторены в сжатом виде.

Активация

Поэлементная нелинейность после линейного слоя, например \(\operatorname{ReLU}(z)=\max(0,z)\).

Батч / мини-пакет

Несколько примеров, которые сеть обрабатывает за один прямой и обратный ход. Оценка градиента усредняется по пакету.

Вес и смещение

Обучаемые параметры аффинного слоя: \(\mathbf{z}=W\mathbf{a}+\mathbf{b}\).

Градиент

Вектор частных производных \(\nabla_\theta\mathcal{L}\). Указывает, куда функция растёт быстрее всего.

Дропаут

Случайное обнуление активаций на обучении. Снижает созависимость нейронов.

Логит

Сырой выход сети до softmax или сигмоиды. Не вероятность, а «уровень уверенности» в логарифмической шкале.

Нормализация

Приведение активаций к удобному масштабу: batch norm, layer norm, RMSNorm.

Обобщение

Способность модели работать на данных, которых не было в обучении. Против переобучения ставят регуляризацию и раннюю остановку.

Переобучение

Сеть запоминает выборку, лосс на обучении мал, на тесте велик.

Прямой ход

Вычисление \(\hat{y}=f_\theta(x)\) от входа к выходу.

Обратный ход

Вычисление \(\nabla_\theta\mathcal{L}\) цепным правилом от выхода к параметрам.

Скорость обучения

Скаляр \(\eta\) в шаге \(\theta\leftarrow\theta-\eta g\). Главный гиперпараметр оптимизации.

Функция потерь

Число, которое нужно уменьшить: MSE, кросс-энтропия, hinge и другие.

Эпоха

Один полный проход по обучающей выборке.

Эмбеддинг

Векторное представление дискретного объекта (слова, токена, пользователя).

Если хочется одной формулы на память, держите эту: \(\theta \leftarrow \theta - \eta\nabla_\theta\frac1n\sum_i\ell(f_\theta(x_i),y_i)\). Остальной курс — расшифровка каждого символа.