Обзор Atlas от World Labs — ИИ, который строит 3D-миры! Новая модель пространственного интеллекта
Yevgeniy Kovalenko
0:00 / 0:00
Обзор Atlas от World Labs — ИИ, который строит 3D-миры! Новая модель пространственного интеллекта
1 833 просмотра · 6 дней назад
Yevgeniy Kovalenko
8,12 тыс. подписчиков
1 833 просмотра · 6 дней назад
1 сентября 2026 года компания World Labs представила Atlas — новую модель пространственного интеллекта, которая должна стать основой следующего поколения технологий компании. В отличие от обычных языковых, графических и видеомоделей, Atlas обучена одновременно работать с текстом, изображениями, видео и 3D-пространством.
В этом видео разбираем, что такое World Labs Atlas, кто стоит за созданием модели и почему именно пространственный интеллект может стать следующим большим направлением развития искусственного интеллекта.
World Labs была основана Фей-Фей Ли — одной из наиболее известных исследовательниц в области компьютерного зрения, создательницей ImageNet и бывшим главным научным сотрудником Google Cloud. Вместе с ней компанию основали специалисты в области компьютерного зрения и компьютерной графики Джастин Джонсон, Бен Милденхолл и Кристоф Ласснер. Компания привлекла значительное финансирование, а среди её инвесторов — Andreessen Horowitz, NVIDIA, AMD и Autodesk.
Первым коммерческим продуктом World Labs стала Marble — система генерации устойчивых 3D-миров из текста, изображения или видео. Atlas представляет следующий этап этой технологии.
Главная особенность Atlas — пространственный контекст. Модель не просто анализирует последовательность изображений или кадров. Каждый входной элемент связывается с определённой позицией в трёхмерном пространстве. Благодаря этому Atlas способна формировать внутреннее представление о том, где находятся объекты, как они расположены относительно друг друга и как должна выглядеть сцена с нового ракурса.
В видео подробно разбираем четыре ключевых направления применения Atlas.
Первое — генерация с точным управлением камерой. Камера становится полноценным геометрическим параметром модели. Atlas может учитывать положение и движение камеры и генерировать визуально согласованную сцену на протяжении длительного видео. Особенно интересно то, что модель способна получить одну фотографию и самостоятельно достроить невидимые части окружающего пространства.
Второе направление — пространственная реконструкция. Atlas может восстанавливать 3D-сцену по одной или нескольким фотографиям, создавая облака точек и 3D Gaussian Splat. Чем больше реальных изображений получает модель, тем точнее становится реконструкция. При этом World Labs заявляет о конкурентоспособности Atlas даже по сравнению со специализированными моделями, созданными исключительно для 3D-реконструкции.
Третье направление — симуляция пространства и времени. Atlas позволяет получать эффект bullet time из материала, снятого всего несколькими обычными телефонами или экшн-камерами. Для робототехники это особенно интересно: реальное помещение можно реконструировать по видео, а затем симулировать движение робота внутри этого пространства, включая генерацию изображения и данных глубины с точки зрения его камер.
Такой подход потенциально позволяет создавать синтетические данные для обучения роботов. В уже отснятой сцене можно менять положение объектов, освещение и фон, получая большое количество вариантов без необходимости каждый раз проводить новую съёмку в реальном мире.
Четвёртое направление — генерация изображений. Это не основная задача Atlas, однако модель способна следовать сложным текстовым инструкциям, генерировать изображения, работать с текстом внутри изображения и создавать 360-градусные панорамы.
Отдельно разбираем архитектуру Atlas. World Labs описывает её как мультимодальный авторегрессивный диффузионный трансформер. Это своеобразный гибрид, объединяющий свойства авторегрессивных моделей, диффузионных систем и пространственного моделирования.
Важнейшая составляющая здесь — именно пространственный контекст. Обычная языковая модель работает прежде всего с последовательностью токенов, а видеомодель — с последовательностью кадров. Atlas пытается представить окружающую среду как пространственно организованный мир, в котором объекты имеют определённое положение и взаимосвязи.
Также рассмотрим результаты тестирования. В слепых сравнениях на следование заданной траектории камеры Atlas получила предпочтение людей в 75% сравнений с MiniMax H3, в 81% — с Gemini Omni Flash, в 93% — с FLUX 3 и в 94% — с Seedance 2.5. На задачах 3D-реконструкции World Labs также сообщает о более низкой средней ошибке по сравнению с лучшим специализированным конкурентом.
✔️ Вы можете поддержать этот канал и его развитие:
✅Поддержи наш ИИ движ:
/ @yevgeniykovalenko
✅ Поддержите видео лайком, подпишитесь на канал и нажмите на колокольчик, чтобы не пропускать новые ролики. Удачи!
✔️ Cсылки из видео:
✅ https://www.worldlabs.ai/blog/atlas
✅ https://form.typeform.com/to/zHFR4r3A
✅ • Google Genie 3 или Project Genie: ИИ генер...
#WorldLabs #Atlas #SpatialIntelligence #ПространственныйИнтеллект #AI #ИИ #ИскусственныйИнтеллект #3D #3DWorlds #ComputerVision #Robotics #GenerativeAI #AIResearch #WorldModel #Нейросети