Перейти к содержимому

Как модели мира и пространственный интеллект создают роботов нового поколения

MartinHanderPhD

0:00 / 0:00

Как модели мира и пространственный интеллект создают роботов нового поколения

44 просмотра · 2 дн. назад
MartinHanderPhD
200 подписчиков
44 просмотра · 2 дн. назад
Языковые и визуально-языковые модели могут интерпретировать слова и изображения, но для физических действий также необходимы надежные оценки глубины, массы и трения. Для безопасного и гибкого действия в реальном мире роботам необходимы пространственный интеллект и модели мира: внутренние симуляции, которые предсказывают, что произойдет до того, как робот что-либо схватит, толкнет или переместит. Вы узнаете: • Парадокс Моравека: почему шахматы и программирование проще для ИИ, чем наливание воды в стакан • Почему 2D-изображение теряет глубину и почему модели зрения и языка «могут видеть, но не воспринимать» • Что такое модели мира: кодирование состояний, модели переходов, множественные возможные варианты будущего и обучение в воображении (Dreamer, DayDreamer, V-JEPA 2) • Пространственный интеллект: NeRF, 3D-гауссово разбрызгивание, карты занятости вокселей и 4D-отслеживание объектов • Возможности, выбор захвата и рычаг, и как VoxPoser обосновывает язык в 3D • От VLM к VLA: RT-2, π0.5, Figure Helix и Gemini Robotics 1.5 • Сложные проблемы: задержка в реальном времени и физические галлюцинации ⏱️ Главы 00:00 Робот, который думает, прежде чем коснуться 00:48 Имитация против воображения 01:37 Глава 1: Парадокс Моравека 02:23 Почему повседневные физические задачи сложны 03:11 Почему 2D-изображение теряет глубину 03:59 Модели мира могут видеть, но не воспринимать 04:45 Почему чистые модели мира терпят неудачу в физическом мире 05:35 Глава 2: Что такое модель мира? 06:23 Модель перехода 07:10 Изучение физической причинности 07:56 Обучение модели мира 08:41 Прогнозирование множества возможных вариантов будущего 09:28 Обучение во сне 10:16 Мечтатель и дневной мечтатель 11:01 V-JEPA 2 11:49 Глава 3: Пространственный интеллект 12:36 От пикселей к 3D и 4D 13:22 Нейронные поля излучения 14:08 3D гауссово разбрызгивание 14:54 Карты занятости вокселей 15:41 4D сцены и постоянство объектов 16:26 Возможности 17:13 Выбор захвата и рычаг 18:02 VoxPoser 18:50 Глава 4: От VLM к VLA 19:32 От инструкции к плану 20:19 От траектории к суставу углы 21:06 π0.5, Helix & Gemini Robotics 21:49 Обобщение на новые инструменты и места 22:35 Задача: бюджет задержки в реальном времени 23:21 Физические галлюцинации и неопределенность 24:04 Пространственный интеллект и физический ИИ 24:51 Краткий обзор 📚 Статьи и ссылки • Моравек (1988): Дети разума: будущее робототехники и человеческого интеллекта • Гибсон (1979): Экологический подход к визуальному восприятию (аффордансы) • Фу и др. (2024): BLINK: Мультимодальные большие языковые модели могут видеть, но не воспринимать • Хафнер и др. (2025): Освоение разнообразных задач управления с помощью моделей мира (DreamerV3, Nature) • Ву и др. (2022): DayDreamer: Модели мира для обучения физических роботов • Meta (2025): V-JEPA 2: Самостоятельно обучаемые видеомодели позволяют понимать, прогнозировать и планировать • Mildenhall et al. (2020): NeRF: Представление сцен в виде нейронных полей излучения для синтеза изображения • Kerbl et al. (2023): 3D-гауссово сплэттинг для рендеринга полей излучения в реальном времени • Huang et al. (2023): VoxPoser: Композитные 3D-карты значений для роботизированного манипулирования с помощью языковых моделей • Brohan et al. (2023): RT-2: Модели «зрение-язык-действие» переносят знания из интернета в управление роботами • Физический интеллект (2025): π0.5: модель «зрение-язык-действие» с обобщением для открытого мира • Figure (2025): Helix: модель «зрение-язык-действие» для управления гуманоидными роботами-универсалами • Google DeepMind (2025): Gemini Robotics 1.5: расширение границ роботов-универсалов с помощью передового воплощенного рассуждения, мышления и переноса движений • Motamed et al. (2025): Учатся ли генеративные видеомодели физическим принципам, просматривая видео? (Physics-IQ) • Google DeepMind (2025): Genie 3: новый рубеж для моделей мира • World Labs (2025): Marble: мультимодальная модель мира 👍 Если это помогло, поставьте лайк видео и подпишитесь, чтобы получать больше подробных обзоров по ИИ и машинному обучению. 💬 Какую домашнюю задачу вы бы доверили роботу в первую очередь? Расскажите в комментариях. #WorldModels #SpatialIntelligence #PhysicalAI #Robotics #MachineLearning #AI #DeepLearning