Как модели мира и пространственный интеллект создают роботов нового поколения
MartinHanderPhD
0:00 / 0:00
Как модели мира и пространственный интеллект создают роботов нового поколения
44 просмотра · 2 дн. назад
MartinHanderPhD
200 подписчиков
44 просмотра · 2 дн. назад
Языковые и визуально-языковые модели могут интерпретировать слова и изображения, но для физических действий также необходимы надежные оценки глубины, массы и трения. Для безопасного и гибкого действия в реальном мире роботам необходимы пространственный интеллект и модели мира: внутренние симуляции, которые предсказывают, что произойдет до того, как робот что-либо схватит, толкнет или переместит.
Вы узнаете:
• Парадокс Моравека: почему шахматы и программирование проще для ИИ, чем наливание воды в стакан
• Почему 2D-изображение теряет глубину и почему модели зрения и языка «могут видеть, но не воспринимать»
• Что такое модели мира: кодирование состояний, модели переходов, множественные возможные варианты будущего и обучение в воображении (Dreamer, DayDreamer, V-JEPA 2)
• Пространственный интеллект: NeRF, 3D-гауссово разбрызгивание, карты занятости вокселей и 4D-отслеживание объектов
• Возможности, выбор захвата и рычаг, и как VoxPoser обосновывает язык в 3D
• От VLM к VLA: RT-2, π0.5, Figure Helix и Gemini Robotics 1.5
• Сложные проблемы: задержка в реальном времени и физические галлюцинации
⏱️ Главы
00:00 Робот, который думает, прежде чем коснуться
00:48 Имитация против воображения
01:37 Глава 1: Парадокс Моравека
02:23 Почему повседневные физические задачи сложны
03:11 Почему 2D-изображение теряет глубину
03:59 Модели мира могут видеть, но не воспринимать
04:45 Почему чистые модели мира терпят неудачу в физическом мире
05:35 Глава 2: Что такое модель мира?
06:23 Модель перехода
07:10 Изучение физической причинности
07:56 Обучение модели мира
08:41 Прогнозирование множества возможных вариантов будущего
09:28 Обучение во сне
10:16 Мечтатель и дневной мечтатель
11:01 V-JEPA 2
11:49 Глава 3: Пространственный интеллект
12:36 От пикселей к 3D и 4D
13:22 Нейронные поля излучения
14:08 3D гауссово разбрызгивание
14:54 Карты занятости вокселей
15:41 4D сцены и постоянство объектов
16:26 Возможности
17:13 Выбор захвата и рычаг
18:02 VoxPoser
18:50 Глава 4: От VLM к VLA
19:32 От инструкции к плану
20:19 От траектории к суставу углы
21:06 π0.5, Helix & Gemini Robotics
21:49 Обобщение на новые инструменты и места
22:35 Задача: бюджет задержки в реальном времени
23:21 Физические галлюцинации и неопределенность
24:04 Пространственный интеллект и физический ИИ
24:51 Краткий обзор
📚 Статьи и ссылки
• Моравек (1988): Дети разума: будущее робототехники и человеческого интеллекта
• Гибсон (1979): Экологический подход к визуальному восприятию (аффордансы)
• Фу и др. (2024): BLINK: Мультимодальные большие языковые модели могут видеть, но не воспринимать
• Хафнер и др. (2025): Освоение разнообразных задач управления с помощью моделей мира (DreamerV3, Nature)
• Ву и др. (2022): DayDreamer: Модели мира для обучения физических роботов
• Meta (2025): V-JEPA 2: Самостоятельно обучаемые видеомодели позволяют понимать, прогнозировать и планировать
• Mildenhall et al. (2020): NeRF: Представление сцен в виде нейронных полей излучения для синтеза изображения
• Kerbl et al. (2023): 3D-гауссово сплэттинг для рендеринга полей излучения в реальном времени
• Huang et al. (2023): VoxPoser: Композитные 3D-карты значений для роботизированного манипулирования с помощью языковых моделей
• Brohan et al. (2023): RT-2: Модели «зрение-язык-действие» переносят знания из интернета в управление роботами
• Физический интеллект (2025): π0.5: модель «зрение-язык-действие» с обобщением для открытого мира
• Figure (2025): Helix: модель «зрение-язык-действие» для управления гуманоидными роботами-универсалами
• Google DeepMind (2025): Gemini Robotics 1.5: расширение границ роботов-универсалов с помощью передового воплощенного рассуждения, мышления и переноса движений
• Motamed et al. (2025): Учатся ли генеративные видеомодели физическим принципам, просматривая видео? (Physics-IQ)
• Google DeepMind (2025): Genie 3: новый рубеж для моделей мира
• World Labs (2025): Marble: мультимодальная модель мира
👍 Если это помогло, поставьте лайк видео и подпишитесь, чтобы получать больше подробных обзоров по ИИ и машинному обучению. 💬 Какую домашнюю задачу вы бы доверили роботу в первую очередь? Расскажите в комментариях.
#WorldModels #SpatialIntelligence #PhysicalAI #Robotics #MachineLearning #AI #DeepLearning