Слой за слоем

Раздел 01 · Устройство

Один нейрон

Всё, что делает нейрон: умножает входы на веса, складывает, прибавляет смещение и пропускает результат через изгиб. Подвигайте ползунки — схема и ответ пересчитываются мгновенно.

0.70
1.20
-0.40
0.80
0.20
-1.50
0.10
z = 0.00
после активации
0.00

Как читать схему

Толщина = вес

Розовая связь усиливает сигнал, синяя — гасит. Чем толще линия, тем сильнее вход влияет на ответ. Поставьте вес в ноль — связь исчезнет, и вход перестанет что-либо значить.

z = x₁·w₁ + x₂·w₂ + x₃·w₃ + b  →  y = f(z)

Смещение b сдвигает порог срабатывания. Без него нейрон обязан проходить через ноль и теряет свободу: он умеет только наклонять границу, но не двигать её.

Реальная сеть — это тысячи таких блоков, соединённых в слои. Ответ первого слоя становится входом второго, и так до самого конца.

Изгиб

Четыре способа согнуть прямую

Наведите на график — увидите значение функции в точке. Красная точка показывает, где сейчас находится ваш нейрон со стенда выше.

ReLU выигрывает в глубоких сетях: производная равна единице на всей правой половине, поэтому градиент не затухает при прохождении через десятки слоёв.

Обучение

Спуск
с горы
в тумане

Ошибка модели — это ландшафт: по горизонтали значение веса, по вертикали величина ошибки. Задача — попасть в низину. Градиент подсказывает направление ближайшего склона, а скорость обучения решает, какой длины делать шаг.

0.20

Скорость обучения η = 0.20 — шаги короткие и аккуратные.

шаг 1

Прямой проход

Данные идут через сеть, на выходе получается предсказание.

шаг 2

Ошибка

Сравниваем предсказание с правильным ответом и получаем одно число — потерю.

шаг 3

Обратный проход

По цепному правилу считаем, насколько каждый вес виноват в этой ошибке.

шаг 4

Обновление

Сдвигаем веса против градиента и повторяем всё заново — миллионы раз.

Дальше — целые архитектуры

Раздел 02 →