Термины, которые встречаются на страницах. Формулы специально повторены в сжатом виде.
Активация
Поэлементная нелинейность после линейного слоя, например \(\operatorname{ReLU}(z)=\max(0,z)\).
Батч / мини-пакет
Несколько примеров, которые сеть обрабатывает за один прямой и обратный ход. Оценка градиента усредняется по пакету.
Вес и смещение
Обучаемые параметры аффинного слоя: \(\mathbf{z}=W\mathbf{a}+\mathbf{b}\).
Градиент
Вектор частных производных \(\nabla_\theta\mathcal{L}\). Указывает, куда функция растёт быстрее всего.
Дропаут
Случайное обнуление активаций на обучении. Снижает созависимость нейронов.
Логит
Сырой выход сети до softmax или сигмоиды. Не вероятность, а «уровень уверенности» в логарифмической шкале.
Нормализация
Приведение активаций к удобному масштабу: batch norm, layer norm, RMSNorm.
Обобщение
Способность модели работать на данных, которых не было в обучении. Против переобучения ставят регуляризацию и раннюю остановку.
Переобучение
Сеть запоминает выборку, лосс на обучении мал, на тесте велик.
Прямой ход
Вычисление \(\hat{y}=f_\theta(x)\) от входа к выходу.
Обратный ход
Вычисление \(\nabla_\theta\mathcal{L}\) цепным правилом от выхода к параметрам.
Скорость обучения
Скаляр \(\eta\) в шаге \(\theta\leftarrow\theta-\eta g\). Главный гиперпараметр оптимизации.
Функция потерь
Число, которое нужно уменьшить: MSE, кросс-энтропия, hinge и другие.
Эпоха
Один полный проход по обучающей выборке.
Эмбеддинг
Векторное представление дискретного объекта (слова, токена, пользователя).