Перейти к содержимому

Обзор Atlas от World Labs — ИИ, который строит 3D-миры! Новая модель пространственного интеллекта

Yevgeniy Kovalenko

0:00 / 0:00

Обзор Atlas от World Labs — ИИ, который строит 3D-миры! Новая модель пространственного интеллекта

1 833 просмотра · 6 дней назад
Yevgeniy Kovalenko
8,12 тыс. подписчиков
1 833 просмотра · 6 дней назад
1 сентября 2026 года компания World Labs представила Atlas — новую модель пространственного интеллекта, которая должна стать основой следующего поколения технологий компании. В отличие от обычных языковых, графических и видеомоделей, Atlas обучена одновременно работать с текстом, изображениями, видео и 3D-пространством. В этом видео разбираем, что такое World Labs Atlas, кто стоит за созданием модели и почему именно пространственный интеллект может стать следующим большим направлением развития искусственного интеллекта. World Labs была основана Фей-Фей Ли — одной из наиболее известных исследовательниц в области компьютерного зрения, создательницей ImageNet и бывшим главным научным сотрудником Google Cloud. Вместе с ней компанию основали специалисты в области компьютерного зрения и компьютерной графики Джастин Джонсон, Бен Милденхолл и Кристоф Ласснер. Компания привлекла значительное финансирование, а среди её инвесторов — Andreessen Horowitz, NVIDIA, AMD и Autodesk. Первым коммерческим продуктом World Labs стала Marble — система генерации устойчивых 3D-миров из текста, изображения или видео. Atlas представляет следующий этап этой технологии. Главная особенность Atlas — пространственный контекст. Модель не просто анализирует последовательность изображений или кадров. Каждый входной элемент связывается с определённой позицией в трёхмерном пространстве. Благодаря этому Atlas способна формировать внутреннее представление о том, где находятся объекты, как они расположены относительно друг друга и как должна выглядеть сцена с нового ракурса. В видео подробно разбираем четыре ключевых направления применения Atlas. Первое — генерация с точным управлением камерой. Камера становится полноценным геометрическим параметром модели. Atlas может учитывать положение и движение камеры и генерировать визуально согласованную сцену на протяжении длительного видео. Особенно интересно то, что модель способна получить одну фотографию и самостоятельно достроить невидимые части окружающего пространства. Второе направление — пространственная реконструкция. Atlas может восстанавливать 3D-сцену по одной или нескольким фотографиям, создавая облака точек и 3D Gaussian Splat. Чем больше реальных изображений получает модель, тем точнее становится реконструкция. При этом World Labs заявляет о конкурентоспособности Atlas даже по сравнению со специализированными моделями, созданными исключительно для 3D-реконструкции. Третье направление — симуляция пространства и времени. Atlas позволяет получать эффект bullet time из материала, снятого всего несколькими обычными телефонами или экшн-камерами. Для робототехники это особенно интересно: реальное помещение можно реконструировать по видео, а затем симулировать движение робота внутри этого пространства, включая генерацию изображения и данных глубины с точки зрения его камер. Такой подход потенциально позволяет создавать синтетические данные для обучения роботов. В уже отснятой сцене можно менять положение объектов, освещение и фон, получая большое количество вариантов без необходимости каждый раз проводить новую съёмку в реальном мире. Четвёртое направление — генерация изображений. Это не основная задача Atlas, однако модель способна следовать сложным текстовым инструкциям, генерировать изображения, работать с текстом внутри изображения и создавать 360-градусные панорамы. Отдельно разбираем архитектуру Atlas. World Labs описывает её как мультимодальный авторегрессивный диффузионный трансформер. Это своеобразный гибрид, объединяющий свойства авторегрессивных моделей, диффузионных систем и пространственного моделирования. Важнейшая составляющая здесь — именно пространственный контекст. Обычная языковая модель работает прежде всего с последовательностью токенов, а видеомодель — с последовательностью кадров. Atlas пытается представить окружающую среду как пространственно организованный мир, в котором объекты имеют определённое положение и взаимосвязи. Также рассмотрим результаты тестирования. В слепых сравнениях на следование заданной траектории камеры Atlas получила предпочтение людей в 75% сравнений с MiniMax H3, в 81% — с Gemini Omni Flash, в 93% — с FLUX 3 и в 94% — с Seedance 2.5. На задачах 3D-реконструкции World Labs также сообщает о более низкой средней ошибке по сравнению с лучшим специализированным конкурентом. ✔️ Вы можете поддержать этот канал и его развитие: ✅Поддержи наш ИИ движ:    / @yevgeniykovalenko   ✅ Поддержите видео лайком, подпишитесь на канал и нажмите на колокольчик, чтобы не пропускать новые ролики. Удачи! ✔️ Cсылки из видео: ✅ https://www.worldlabs.ai/blog/atlas ✅ https://form.typeform.com/to/zHFR4r3A ✅    • Google Genie 3 или Project Genie: ИИ генер...   #WorldLabs #Atlas #SpatialIntelligence #ПространственныйИнтеллект #AI #ИИ #ИскусственныйИнтеллект #3D #3DWorlds #ComputerVision #Robotics #GenerativeAI #AIResearch #WorldModel #Нейросети