ИИ учится играя
Байтик становится игроком! 12 миссий об обучении с подкреплением: награды, стратегии, AlphaGo, роботы и reward hacking.
Первые 3 урока этого курса — бесплатно, без карты. Дальше — подписка от 699 ₽ в месяц на все курсы.
О чём этот курс
Курс знакомит с обучением с подкреплением — методом, благодаря которому ИИ побеждает чемпионов мира в го и учится управлять роботами. Дети узнают о системе наград и штрафов, стратегии «исследуй или используй», Q-learning, MDP. Разбирают кейсы AlphaGo, роботов и reward hacking — когда ИИ находит хитрые лазейки.
Чему научитесь
- Понимание обучения с подкреплением
- Стратегическое мышление: баланс риска и результата
- Знание о наградах, Q-learning и MDP
- Понимание, как ИИ играет в игры
- Знакомство с ИИ в робототехнике
Для кого
Средний уровень, от 7 лет. Для любителей игр и роботов.
Как проходит обучение
Интерактивные задания
Квизы, головоломки, симуляторы и творческие задачи в каждом уроке
Система XP и наград
За правильные ответы начисляются очки опыта и открываются достижения
12 уроков по ~30 минут
Каждый урок — самостоятельная тема с теорией и практикой
Робот-проводник Байтик
Дружелюбный персонаж объясняет сложные темы простым языком
Программа курса
Третий путь обучения
БесплатноОбучение с подкреплением: агент, среда, действие и награда — учителя нет, есть отклик среды.
~30 мин
Награда — это всё
БесплатноДизайн награды: чем плотная награда отличается от разреженной и как выбор награды задаёт поведение.
~30 мин
Метод проб и ошибок
БесплатноЧто такое эпизод, почему первые действия случайны и зачем агента тренируют в симуляторе.
~30 мин
Исследовать или использовать?
PROДилемма «исследовать или использовать»: когда пробовать новое, а когда повторять известное.
~30 мин
Мир как игра
PROСостояние среды и марковское свойство: почему агенту достаточно текущего снимка мира.
~30 мин
Выигрышная стратегия
PROЧто такое политика агента и как метод градиента политики усиливает удачные действия.
~30 мин
Думай наперёд
PROОбесценивание будущей награды, коэффициент gamma и уравнение Беллмана простыми словами.
~30 мин
ИИ играет в игры
PROОт AlphaGo к AlphaZero: почему го считалась неприступной и чем Dota 2 сложнее шахмат.
~30 мин
ИИ управляет роботами
PROSim-to-Real: почему робота учат в симуляторе и как перенести навык в реальный мир.
~30 мин
Когда ИИ хитрит
PROВзлом награды: как агент честно выполняет условие и полностью проваливает задачу.
~30 мин
Тренируем ИИ-игрока
PROПрактика: описать состояние, собрать многокомпонентную награду и понять, почему агент кружит на месте.
~30 мин
Выпускной — ИИ-игрок
PROИтог курса: из чего собирается RL-система и где её применяют за пределами игр.
~30 мин
Похожие курсы
ИИ-творец
Байтик становится творцом с ИИ! 12 миссий о генеративном ИИ: как нейросети создают тексты, картинки, музыку и код. Промпт-инженерия, диффузия, галлюцинации и этика ИИ-творчества.
ИИ учится видеть
Байтик отправляется в Лабораторию зрения с Профессором Линзой! 12 миссий о компьютерном зрении: пиксели, фильтры, CNN, распознавание лиц, видеоаналитика и ошибки ИИ.
Тренер-чемпион
Байтик встречает тренера Оптиму! 12 миссий об оптимизации обучения: SGD, Momentum, Adam, переобучение, dropout, регуляризация и лучшие практики тренировки нейросетей.
Регистрация бесплатная. Первые 3 урока этого курса — без карты, а курс «Знакомство с ИИ» открыт целиком.