AlphaZero: объяснение, часть 3. Как это учится [Свёрточные нейронные сети]
Prof Mihai Nica
0:00 / 0:00
AlphaZero: объяснение, часть 3. Как это учится [Свёрточные нейронные сети]
6 326 просмотров · 2 мес. назад
Prof Mihai Nica
18 тыс. подписчиков
6 326 просмотров · 2 мес. назад
Как AlphaZero использует нейронные сети для игры? Как она учится стратегиям на основе собственной игры? Я объясняю это на примере интерактивного ИИ для игры в «Соедини четыре», который я создал с помощью пакета Python Marimo.
Ссылка на интерактивный блокнот для CNN Explorer:
https://molab.marimo.io/notebooks/nb_...
Ссылка на предыдущие 2 видео из моей серии «Объяснение AlphaZero»:
Ссылка на часть 1, где алгоритм UCB объясняется более подробно:
• AlphaZero Explained 1: How it Solves "Expl... и блокнот Marimo UCB https://molab.marimo.io/notebooks/nb_...
Часть 2, где мы строим деревья для просмотра нескольких ходов вперед [поиск по дереву Монте-Карло]
• AlphaZero Explained 2: How it Looks Into t...
и блокнот Marimo MCTS https://molab.marimo.io/notebooks/nb_...
Главы:
0:00 Введение в AlphaZero и Connect 4
0:47 Как AlphaZero использует нейронные сети
2:09 Процесс обучения: обучение с подкреплением против обучения с учителем
4:28 Цикл обучения с использованием бутстрапа
5:51 Поиск по дереву Монте-Карло (MCTS) и экспертная функция
8:33 Формула PUCT (Predictor/Polynomial Upper Confidence Tree)
9:45 Интерактивная демонстрация на Python/Marimo: MCTS против нейронной сети
12:39 Результаты обучения и показатели производительности
15:44 Визуализация сверточной нейронной сети (CNN)
17:13 Плоскости признаков и 3D-представление данных
20:13 Как работают свертки: параметры и фильтры
24:04 Интерпретация весов и активаций нейронов
28:18 Объяснение нелинейности ReLU
30:08 Обновления для повышения производительности мирового класса