Каталог курсов
🌱
ВосприятиеПродвинутыйPRO

Все чувства вместе

Байтик попадает в Оркестровую яму с дирижёром Синтезией и осьминогом Октави! 12 миссий о мультимодальном ИИ: модальности, CLIP, text-to-image, image captioning, голосовые помощники, видео, GPT-4V, Gemini и кросс-модальное внимание.

12 уроков9–14 лет~6 часовИнтерактивные задания
Начать бесплатно

Первые 3 урока этого курса — бесплатно, без карты. Дальше — подписка от 699 ₽ в месяц на все курсы.

Или сначала поиграть — без регистрации

О чём этот курс

Курс объясняет мультимодальный ИИ — системы, объединяющие текст, изображения и звук. Дети узнают о модальностях данных, CLIP, text-to-image, image captioning, голосовых помощниках, видеоанализе, GPT-4V, Gemini и кросс-модальном внимании. Финальный проект — мультимодальный ИИ-ассистент.

Чему научитесь

  • Понимание мультимодальности в ИИ
  • Знание о CLIP и связи текста с изображениями
  • Text-to-image и image-to-text
  • Анализ видео с помощью ИИ
  • Представление о GPT-4V и Gemini

Для кого

Продвинутый уровень, от 9 лет. Финальный курс программы, объединяющий все знания об ИИ.

Как проходит обучение

Интерактивные задания

Квизы, головоломки, симуляторы и творческие задачи в каждом уроке

Система XP и наград

За правильные ответы начисляются очки опыта и открываются достижения

12 уроков по ~30 минут

Каждый урок — самостоятельная тема с теорией и практикой

Робот-проводник Байтик

Дружелюбный персонаж объясняет сложные темы простым языком

Программа курса

1

Один мозг — пять чувств

Бесплатно

Что такое мультимодальность и почему обычная модель работает только с одним видом данных.

~30 мин

2

Три языка данных

Бесплатно

Три языка данных: картинка как матрица, текст как цепочка символов, звук как волна.

~30 мин

3

Общее пространство смыслов

Бесплатно

CLIP: два энкодера и контрастное обучение, благодаря которым появляется zero-shot классификация.

~30 мин

4

Из текста — в картинку

PRO

Из текста в картинку: как вектор промпта направляет генерацию через кросс-внимание.

~30 мин

5

Из картинки — в текст

PRO

Описание изображений и ответы на вопросы по картинке: чем VQA отличается от подписи.

~30 мин

6

Из речи — в понимание

PRO

Whisper и распознавание речи: спектрограмма на входе и кросс-внимание в декодере.

~30 мин

7

Видео = картинка + звук + время

PRO

Видео как отдельная модальность: временные связи между кадрами и темпоральное внимание.

~30 мин

8

Нативная мультимодальность: ИИ видит и говорит

PRO

Нативная мультимодальность: чем модель, обученная сразу на всём, отличается от склейки моделей.

~30 мин

9

Кросс-модальное внимание

PRO

Кросс-модальное внимание: запрос из одной модальности, ключи и значения из другой.

~30 мин

10

Когда чувства обманывают

PRO

Конфликт модальностей: что делает модель, когда картинка и текст противоречат друг другу.

~30 мин

11

Проект: Мультимодальный ассистент

PRO

Проект: собрать мультимодального ассистента из готовых блоков и понять, где стыки.

~30 мин

12

Выпускной: Мастер всех чувств

PRO

Итог курса: как разные виды данных сходятся в одном пространстве смыслов.

~30 мин

Похожие курсы

Начать бесплатно

Регистрация бесплатная. Первые 3 урока этого курса — без карты, а курс «Знакомство с ИИ» открыт целиком.