Все чувства вместе
Байтик попадает в Оркестровую яму с дирижёром Синтезией и осьминогом Октави! 12 миссий о мультимодальном ИИ: модальности, CLIP, text-to-image, image captioning, голосовые помощники, видео, GPT-4V, Gemini и кросс-модальное внимание.
Первые 3 урока этого курса — бесплатно, без карты. Дальше — подписка от 699 ₽ в месяц на все курсы.
О чём этот курс
Курс объясняет мультимодальный ИИ — системы, объединяющие текст, изображения и звук. Дети узнают о модальностях данных, CLIP, text-to-image, image captioning, голосовых помощниках, видеоанализе, GPT-4V, Gemini и кросс-модальном внимании. Финальный проект — мультимодальный ИИ-ассистент.
Чему научитесь
- Понимание мультимодальности в ИИ
- Знание о CLIP и связи текста с изображениями
- Text-to-image и image-to-text
- Анализ видео с помощью ИИ
- Представление о GPT-4V и Gemini
Для кого
Продвинутый уровень, от 9 лет. Финальный курс программы, объединяющий все знания об ИИ.
Как проходит обучение
Интерактивные задания
Квизы, головоломки, симуляторы и творческие задачи в каждом уроке
Система XP и наград
За правильные ответы начисляются очки опыта и открываются достижения
12 уроков по ~30 минут
Каждый урок — самостоятельная тема с теорией и практикой
Робот-проводник Байтик
Дружелюбный персонаж объясняет сложные темы простым языком
Программа курса
Один мозг — пять чувств
БесплатноЧто такое мультимодальность и почему обычная модель работает только с одним видом данных.
~30 мин
Три языка данных
БесплатноТри языка данных: картинка как матрица, текст как цепочка символов, звук как волна.
~30 мин
Общее пространство смыслов
БесплатноCLIP: два энкодера и контрастное обучение, благодаря которым появляется zero-shot классификация.
~30 мин
Из текста — в картинку
PROИз текста в картинку: как вектор промпта направляет генерацию через кросс-внимание.
~30 мин
Из картинки — в текст
PROОписание изображений и ответы на вопросы по картинке: чем VQA отличается от подписи.
~30 мин
Из речи — в понимание
PROWhisper и распознавание речи: спектрограмма на входе и кросс-внимание в декодере.
~30 мин
Видео = картинка + звук + время
PROВидео как отдельная модальность: временные связи между кадрами и темпоральное внимание.
~30 мин
Нативная мультимодальность: ИИ видит и говорит
PROНативная мультимодальность: чем модель, обученная сразу на всём, отличается от склейки моделей.
~30 мин
Кросс-модальное внимание
PROКросс-модальное внимание: запрос из одной модальности, ключи и значения из другой.
~30 мин
Когда чувства обманывают
PROКонфликт модальностей: что делает модель, когда картинка и текст противоречат друг другу.
~30 мин
Проект: Мультимодальный ассистент
PROПроект: собрать мультимодального ассистента из готовых блоков и понять, где стыки.
~30 мин
Выпускной: Мастер всех чувств
PROИтог курса: как разные виды данных сходятся в одном пространстве смыслов.
~30 мин
Похожие курсы
ИИ получает тело
Байтик встречает Профессора Гиро! 12 миссий о робототехнике: сенсоры, моторы, планирование движения, беспилотники, дроны, подводные роботы, хирургические роботы и этика.
Секрет внимания
Байтик попадает в Детективное агентство связей! 12 миссий о трансформерах: self-attention, Query-Key-Value, multi-head attention, позиционное кодирование, энкодеры (BERT), декодеры (GPT) и Vision Transformer.
Фабрика нового
Байтик попадает на Фабрику нового с изобретателем Генезисом и хамелеоном Латентом! 12 миссий о генеративных моделях: GAN, VAE, диффузия, латентное пространство, Stable Diffusion и создание изображений из шума.
Регистрация бесплатная. Первые 3 урока этого курса — без карты, а курс «Знакомство с ИИ» открыт целиком.