Перейти к содержимому

Мировые модели: как роботы учатся представлять будущее

MartinHanderPhD

0:00 / 0:00

Мировые модели: как роботы учатся представлять будущее

45 просмотров · 4 дня назад
MartinHanderPhD
200 подписчиков
45 просмотров · 4 дня назад
Имитационное обучение и модели «зрение-язык-действие» позволяют роботам копировать увиденное. Но в динамичном, непредсказуемом мире копирования недостаточно. Роботам необходимо предсказывать, что произойдет дальше. В этом подробном исследовании мы рассмотрим модели мира: внутренние симуляции физики в латентном пространстве и то, как они могут поддерживать пространственный интеллект. Вы узнаете: • Почему стратегии прямого наблюдения и анализа действий усугубляют ошибки при сдвиге распределения • Почему фотореалистичные генераторы видео все еще могут нарушать физические ограничения • Что такое модель мира: оценка скрытых состояний, модели переходов и цели обучения • Мечтатель и обучение в воображении • JEPA против генеративных моделей: когда предсказание в пространстве признаков помогает и где оно неэффективно (концепция ЛеКуна, V-JEPA 2) • Пространственный интеллект: 3D-занятость, постоянство объекта, объектно-ориентированная динамика и интуитивная физика • Планирование с помощью воображения: CEM, модель прогнозирующего управления, TD-MPC2 • Адаптация от симуляции к реальности, неопределенность и риск эксплуатации модели ⏱️ Главы 00:00 Робот, который не может воображать 00:57 Знание того, что произойдет дальше 01:47 Глава 1: Пределы прямого отображения 02:36 Клонирование поведения и усугубление ошибок 03:32 Нет причинно-следственной связи, нет инерция 04:30 Почему одного языка недостаточно 05:22 Пиксельная симуляция против семантического понимания 06:11 Изучают ли видеомодели физические законы? 06:58 Глава 2: Что такое модель мира? 07:46 Оценка скрытого состояния 08:33 Модель перехода 09:24 Обучение модели скрытого мира 10:13 Сновидения: обучение в воображении 11:03 Проблема прогнозирования пикселей 11:51 JEPA: архитектура прогнозирования с совместным встраиванием 12:47 Архитектура ЛеКуна для автономного интеллекта 13:34 V-JEPA 2: планирование робота без предварительного обучения 14:28 Глава 3: Пространственный интеллект 15:15 3D-модели мира занятости 16:05 Постоянство объекта и окклюзия 17:00 Динамика, ориентированная на объект 17:47 Интуитивная физика 18:43 Вывод массы и трения 19:33 Модели основы мира: Genie 3 и Cosmos 20:22 Глава 4: Планирование с помощью воображения 21:15 Планирование, обусловленное целью, в скрытом пространстве 22:07 Перекрестная энтропия метод 22:58 Модель прогнозирующего управления 23:43 Планирование + полученные значения (TD-MPC2) 24:33 Переход от симуляции к реальности с помощью моделей мира 25:17 Неопределенность и использование модели 26:08 Модели мира и VLA 26:52 Краткий обзор 📚 Статьи и ссылки • Крейк (1943): Природа объяснения • Росс, Гордон и Багнелл (2011): Сведение обучения имитации и структурированного прогнозирования к онлайн-обучению без сожалений (DAgger) • Ха и Шмидхубер (2018): Модели мира • Хафнер и др. (2019): Изучение скрытой динамики для планирования на основе пикселей (PlaNet / RSSM) • Хафнер и др. (2023): Освоение различных областей с помощью моделей мира (DreamerV3) • Ву и др. (2022): DayDreamer: Мировые модели для физического обучения роботов • LeCun (2022): Путь к автономному машинному интеллекту • Assran et al. (2023): Самостоятельное обучение на основе изображений с использованием архитектуры прогнозирования с совместным встраиванием (I-JEPA) • Bardes et al. (2024): Переосмысление прогнозирования признаков для обучения визуальным представлениям из видео (V-JEPA) • Meta FAIR (2025): V-JEPA 2: Самостоятельно обучаемые видеомодели позволяют понимать, прогнозировать и планировать • Kang et al. (2024): Насколько генерация видео отличается от мировой модели: перспектива физических законов • Motamed et al. (препринт 2025; WACV 2026): Понимают ли генеративные видеомодели физические принципы? (Physics-IQ) • Zheng et al. (2023): OccWorld: Изучение 3D-модели мира занятости для автономного вождения • Батталья и др. (2016): Сети взаимодействия для изучения объектов, отношений и физики • Батталья, Хамрик и Тенебаум (2013): Моделирование как двигатель понимания физической сцены • Санчес-Гонсалес и др. (2020): Обучение моделированию сложной физики с помощью графовых сетей • Байяржон (1987): Постоянство объекта у младенцев в возрасте 3,5 и 4,5 месяцев • Хансен и др. (2023): TD-MPC2: Масштабируемые, надежные модели мира для непрерывного управления • Чуа и др. (2018): Глубокое обучение с подкреплением в нескольких испытаниях с использованием вероятностных динамических моделей (PETS) • Google DeepMind (2025): Genie 3: Новый рубеж для моделей мира • NVIDIA (2025): Платформа моделей Cosmos World Foundation для физического ИИ 👍 Если это помогло, поставьте лайк видео и подпишитесь, чтобы получать больше подробных обзоров ИИ и машинного обучения. 💬 Где бы вы использовали прогнозирование в пространстве признаков, и где помогло бы сгенерированное видео? Расскажите мне в комментариях. #WorldModels #PhysicalAI #Robotics #SpatialIntelligence #MachineLearning #AI #DeepLearning