Лекция 01

Перцептрон и линейная модель

Схема одного нейрона: входы, сумматор, активация, выход
Один нейрон собирает взвешенную сумму входов и пропускает её через нелинейность.

Исторически первым вычислительным «нейроном» считают модель Маккаллока — Питтса (1943) и перцептрон Розенблатта (1958). Оба описывают одно и то же: признаки умножаются на веса, складываются, затем сравниваются с порогом.

Линейный предиктор

Пусть пример задан вектором \(\mathbf{x} \in \mathbb{R}^d\). Перцептрон хранит веса \(\mathbf{w} \in \mathbb{R}^d\) и смещение \(b \in \mathbb{R}\):

$$f(\mathbf{x}) = \mathbf{w}^\top \mathbf{x} + b = \sum_{i=1}^{d} w_i x_i + b$$

Геометрически уравнение \( \mathbf{w}^\top \mathbf{x} + b = 0 \) задаёт гиперплоскость. Знак \(f(\mathbf{x})\) говорит, по какую сторону от плоскости лежит точка.

Правило решения

Классический перцептрон выдаёт метку класса через функцию знака:

$$\hat{y} = \operatorname{sign}(f(\mathbf{x})) = \begin{cases} +1, & f(\mathbf{x}) \ge 0 \\ -1, & f(\mathbf{x}) < 0 \end{cases}$$

Правило обучения Розенблатта простое. Если пример \((\mathbf{x}, y)\) классифицирован верно, веса не трогают. Если ошибка, веса сдвигают в сторону правильного класса:

$$\mathbf{w} \leftarrow \mathbf{w} + \eta \, y \, \mathbf{x}, \qquad b \leftarrow b + \eta \, y$$

Здесь \(\eta > 0\) — скорость обучения, \(y \in \{+1,-1\}\). Теорема о сходимости перцептрона утверждает: если классы линейно разделимы, алгоритм найдёт разделяющую плоскость за конечное число шагов.

Вероятностный взгляд

Современные сети почти не используют \(\operatorname{sign}\). Удобнее логистическая регрессия: та же линейная форма, но выход — вероятность класса

$$p(y=1\mid\mathbf{x}) = \sigma(\mathbf{w}^\top\mathbf{x}+b), \qquad \sigma(z)=\frac{1}{1+e^{-z}}$$

Логит \(z\) можно читать как логарифм отношения шансов:

$$\log\frac{p}{1-p} = \mathbf{w}^\top\mathbf{x}+b$$
Один перцептрон не решает задачу XOR: точки классов нельзя разделить прямой. Именно поэтому нужны скрытые слои и нелинейные активации.

Норма и отступ

Расстояние от точки до разделяющей плоскости равно

$$\operatorname{dist}(\mathbf{x}) = \frac{|\mathbf{w}^\top\mathbf{x}+b|}{\|\mathbf{w}\|_2}$$

Метод опорных векторов максимизирует минимальный отступ. Нейронные сети обычно не оптимизируют отступ напрямую, но идея та же: уверенные предсказания лежат далеко от границы.