Каталог курсов
🌊
ВосприятиеСреднийPRO

ИИ учится играя

Байтик становится игроком! 12 миссий об обучении с подкреплением: награды, стратегии, AlphaGo, роботы и reward hacking.

12 уроков7–12 лет~6 часовИнтерактивные задания
Начать бесплатно

Первые 3 урока этого курса — бесплатно, без карты. Дальше — подписка от 699 ₽ в месяц на все курсы.

Или сначала поиграть — без регистрации

О чём этот курс

Курс знакомит с обучением с подкреплением — методом, благодаря которому ИИ побеждает чемпионов мира в го и учится управлять роботами. Дети узнают о системе наград и штрафов, стратегии «исследуй или используй», Q-learning, MDP. Разбирают кейсы AlphaGo, роботов и reward hacking — когда ИИ находит хитрые лазейки.

Чему научитесь

  • Понимание обучения с подкреплением
  • Стратегическое мышление: баланс риска и результата
  • Знание о наградах, Q-learning и MDP
  • Понимание, как ИИ играет в игры
  • Знакомство с ИИ в робототехнике

Для кого

Средний уровень, от 7 лет. Для любителей игр и роботов.

Как проходит обучение

Интерактивные задания

Квизы, головоломки, симуляторы и творческие задачи в каждом уроке

Система XP и наград

За правильные ответы начисляются очки опыта и открываются достижения

12 уроков по ~30 минут

Каждый урок — самостоятельная тема с теорией и практикой

Робот-проводник Байтик

Дружелюбный персонаж объясняет сложные темы простым языком

Программа курса

1

Третий путь обучения

Бесплатно

Обучение с подкреплением: агент, среда, действие и награда — учителя нет, есть отклик среды.

~30 мин

2

Награда — это всё

Бесплатно

Дизайн награды: чем плотная награда отличается от разреженной и как выбор награды задаёт поведение.

~30 мин

3

Метод проб и ошибок

Бесплатно

Что такое эпизод, почему первые действия случайны и зачем агента тренируют в симуляторе.

~30 мин

4

Исследовать или использовать?

PRO

Дилемма «исследовать или использовать»: когда пробовать новое, а когда повторять известное.

~30 мин

5

Мир как игра

PRO

Состояние среды и марковское свойство: почему агенту достаточно текущего снимка мира.

~30 мин

6

Выигрышная стратегия

PRO

Что такое политика агента и как метод градиента политики усиливает удачные действия.

~30 мин

7

Думай наперёд

PRO

Обесценивание будущей награды, коэффициент gamma и уравнение Беллмана простыми словами.

~30 мин

8

ИИ играет в игры

PRO

От AlphaGo к AlphaZero: почему го считалась неприступной и чем Dota 2 сложнее шахмат.

~30 мин

9

ИИ управляет роботами

PRO

Sim-to-Real: почему робота учат в симуляторе и как перенести навык в реальный мир.

~30 мин

10

Когда ИИ хитрит

PRO

Взлом награды: как агент честно выполняет условие и полностью проваливает задачу.

~30 мин

11

Тренируем ИИ-игрока

PRO

Практика: описать состояние, собрать многокомпонентную награду и понять, почему агент кружит на месте.

~30 мин

12

Выпускной — ИИ-игрок

PRO

Итог курса: из чего собирается RL-система и где её применяют за пределами игр.

~30 мин

Похожие курсы

Начать бесплатно

Регистрация бесплатная. Первые 3 урока этого курса — без карты, а курс «Знакомство с ИИ» открыт целиком.