Перейти к содержимому

Думаете, вы разбираетесь в диффузионных моделях для генерации видео по тексту?

Neural Breakdown with AVB

0:00 / 0:00

Думаете, вы разбираетесь в диффузионных моделях для генерации видео по тексту?

9 330 просмотров · 1 год назад
Neural Breakdown with AVB
35,2 тыс. подписчиков
9 330 просмотров · 1 год назад
Генеративный ИИ на основе диффузии видео — это следующий рубеж для ИИ. В этом видео мы обсуждаем проблему, вызовы, решения и основополагающие работы в этой области, такие как Imagen от Google, Make-a-video от Meta, модель скрытой диффузии видео (LDM) от Nvidia и SORA от OpenAI. Попутно мы обсуждаем основные концепции моделей диффузии изображений, такие как прямая и обратная диффузия, UNet, свертка и диффузионные трансформеры. Это видео призвано дать краткий обзор всех основных концепций в этой области — надеюсь, оно окажется полезным для более глубокого изучения. Поддержите меня на Patreon по ссылке https://ko-fi.com/neuralavb! Поддержите нас на Patreon, чтобы получить доступ к слайдам и видеоматериалам! patreon.com/NeuralBreakdownwithAVB Похожие видео: Что такое модели условной диффузии изображений?    • Text to Image Diffusion AI Model from scra...   Что такое латентное пространство?    • Visualizing the Latent Space: This video w...   Как LLM-модели генерируют изображения? (Ответ не в диффузии)    • If LLMs are text models, how do they gener...   Плейлист «Трансформеры и внимание»    • Everything Language Processing and LLMs!   Посетите наш Patreon для полного доступа к коду и другим документам/анимациям:   / neuralbreakdownwithavb   #generativeai #deeplearning #ai Полезные статьи: Video Diffusion Models: https://arxiv.org/abs/2204.03458 Imagen: https://imagen.research.google/video/ Make A Video: https://makeavideo.studio/ Video LDM: https://research.nvidia.com/labs/toro... CogVideoX: https://arxiv.org/abs/2408.06072 Статья OpenAI SORA: https://openai.com/index/sora/ Полезная статья: https://lilianweng.github.io/posts/20... Обзорные статьи: https://arxiv.org/abs/2310.10647 и https://arxiv.org/abs/2405.03150 Временные метки: 0:00 - Введение 0:39 - Условные модели диффузии текста в изображение 2:16 - Проблемы с видеомоделями диффузии 3:43 - VDM (2022) 4:50 - Факторизованная 3D Unet модели 5:46 - Мета Сделайте видео 7:28 – Видео Google Imagen 8:07 — Нвидиа Видео ЛДМ 9:36 - OpenAI СОРА