Мировые модели: как роботы учатся представлять будущее
MartinHanderPhD
0:00 / 0:00
Мировые модели: как роботы учатся представлять будущее
45 просмотров · 4 дня назад
MartinHanderPhD
200 подписчиков
45 просмотров · 4 дня назад
Имитационное обучение и модели «зрение-язык-действие» позволяют роботам копировать увиденное. Но в динамичном, непредсказуемом мире копирования недостаточно. Роботам необходимо предсказывать, что произойдет дальше. В этом подробном исследовании мы рассмотрим модели мира: внутренние симуляции физики в латентном пространстве и то, как они могут поддерживать пространственный интеллект.
Вы узнаете:
• Почему стратегии прямого наблюдения и анализа действий усугубляют ошибки при сдвиге распределения
• Почему фотореалистичные генераторы видео все еще могут нарушать физические ограничения
• Что такое модель мира: оценка скрытых состояний, модели переходов и цели обучения
• Мечтатель и обучение в воображении
• JEPA против генеративных моделей: когда предсказание в пространстве признаков помогает и где оно неэффективно (концепция ЛеКуна, V-JEPA 2)
• Пространственный интеллект: 3D-занятость, постоянство объекта, объектно-ориентированная динамика и интуитивная физика
• Планирование с помощью воображения: CEM, модель прогнозирующего управления, TD-MPC2
• Адаптация от симуляции к реальности, неопределенность и риск эксплуатации модели
⏱️ Главы
00:00 Робот, который не может воображать
00:57 Знание того, что произойдет дальше
01:47 Глава 1: Пределы прямого отображения
02:36 Клонирование поведения и усугубление ошибок
03:32 Нет причинно-следственной связи, нет инерция
04:30 Почему одного языка недостаточно
05:22 Пиксельная симуляция против семантического понимания
06:11 Изучают ли видеомодели физические законы?
06:58 Глава 2: Что такое модель мира?
07:46 Оценка скрытого состояния
08:33 Модель перехода
09:24 Обучение модели скрытого мира
10:13 Сновидения: обучение в воображении
11:03 Проблема прогнозирования пикселей
11:51 JEPA: архитектура прогнозирования с совместным встраиванием
12:47 Архитектура ЛеКуна для автономного интеллекта
13:34 V-JEPA 2: планирование робота без предварительного обучения
14:28 Глава 3: Пространственный интеллект
15:15 3D-модели мира занятости
16:05 Постоянство объекта и окклюзия
17:00 Динамика, ориентированная на объект
17:47 Интуитивная физика
18:43 Вывод массы и трения
19:33 Модели основы мира: Genie 3 и Cosmos
20:22 Глава 4: Планирование с помощью воображения
21:15 Планирование, обусловленное целью, в скрытом пространстве
22:07 Перекрестная энтропия метод
22:58 Модель прогнозирующего управления
23:43 Планирование + полученные значения (TD-MPC2)
24:33 Переход от симуляции к реальности с помощью моделей мира
25:17 Неопределенность и использование модели
26:08 Модели мира и VLA
26:52 Краткий обзор
📚 Статьи и ссылки
• Крейк (1943): Природа объяснения
• Росс, Гордон и Багнелл (2011): Сведение обучения имитации и структурированного прогнозирования к онлайн-обучению без сожалений (DAgger)
• Ха и Шмидхубер (2018): Модели мира
• Хафнер и др. (2019): Изучение скрытой динамики для планирования на основе пикселей (PlaNet / RSSM)
• Хафнер и др. (2023): Освоение различных областей с помощью моделей мира (DreamerV3)
• Ву и др. (2022): DayDreamer: Мировые модели для физического обучения роботов
• LeCun (2022): Путь к автономному машинному интеллекту
• Assran et al. (2023): Самостоятельное обучение на основе изображений с использованием архитектуры прогнозирования с совместным встраиванием (I-JEPA)
• Bardes et al. (2024): Переосмысление прогнозирования признаков для обучения визуальным представлениям из видео (V-JEPA)
• Meta FAIR (2025): V-JEPA 2: Самостоятельно обучаемые видеомодели позволяют понимать, прогнозировать и планировать
• Kang et al. (2024): Насколько генерация видео отличается от мировой модели: перспектива физических законов
• Motamed et al. (препринт 2025; WACV 2026): Понимают ли генеративные видеомодели физические принципы? (Physics-IQ)
• Zheng et al. (2023): OccWorld: Изучение 3D-модели мира занятости для автономного вождения
• Батталья и др. (2016): Сети взаимодействия для изучения объектов, отношений и физики
• Батталья, Хамрик и Тенебаум (2013): Моделирование как двигатель понимания физической сцены
• Санчес-Гонсалес и др. (2020): Обучение моделированию сложной физики с помощью графовых сетей
• Байяржон (1987): Постоянство объекта у младенцев в возрасте 3,5 и 4,5 месяцев
• Хансен и др. (2023): TD-MPC2: Масштабируемые, надежные модели мира для непрерывного управления
• Чуа и др. (2018): Глубокое обучение с подкреплением в нескольких испытаниях с использованием вероятностных динамических моделей (PETS)
• Google DeepMind (2025): Genie 3: Новый рубеж для моделей мира
• NVIDIA (2025): Платформа моделей Cosmos World Foundation для физического ИИ
👍 Если это помогло, поставьте лайк видео и подпишитесь, чтобы получать больше подробных обзоров ИИ и машинного обучения.
💬 Где бы вы использовали прогнозирование в пространстве признаков, и где помогло бы сгенерированное видео? Расскажите мне в комментариях.
#WorldModels #PhysicalAI #Robotics #SpatialIntelligence #MachineLearning #AI #DeepLearning