Открытый мини-курс · 8 лекций
Как думает нейронная сеть: от суммы весов до внимания
Короткий информационный курс о том, из каких формул собирается современный искусственный интеллект. Без библиотек и кода — только идеи, графы и математика.
Зачем этот курс
Нейронная сеть — это не магия и не «чёрный ящик с нейронами мозга». Это композиция простых функций: скалярное произведение, нелинейность, усреднение ошибки и шаг по градиенту. Если понять эти четыре действия, дальше читаются и свертки, и трансформеры.
Базовая модель одного нейрона выглядит так:
Вектор \(\mathbf{x}\) — признаки примера, \(\mathbf{w}\) — обучаемые веса, \(b\) — смещение, \(\sigma\) — функция активации. Сеть из многих нейронов — это просто много таких преобразований, сложенных слоями.
Программа
Восемь коротких лекций. Можно читать по порядку или прыгать к нужной теме.
Перцептрон
Линейный классификатор, разделяющая гиперплоскость и почему одного нейрона мало.
Активации
Сигмоида, tanh, ReLU, GELU и softmax: зачем сети нелинейность.
Прямой ход
Многослойный перцептрон в матричной записи и проход сигнала вперёд.
Функции потерь
MSE, кросс-энтропия, регуляризация и что именно минимизирует обучение.
Обратное распространение
Цепное правило, локальные градиенты и почему backprop эффективен.
Оптимизация
Градиентный спуск, momentum, RMSProp и Adam.
Архитектуры
Свёртки, рекуррентные сети и внимание трансформера.
Словарь
Короткие определения терминов, которые встречаются в лекциях.
Главная формула обучения
Все лекции сходятся к одному обновлению параметров: