Думаете, вы разбираетесь в диффузионных моделях для генерации видео по тексту?
Neural Breakdown with AVB
0:00 / 0:00
Думаете, вы разбираетесь в диффузионных моделях для генерации видео по тексту?
9 330 просмотров · 1 год назад
Neural Breakdown with AVB
35,2 тыс. подписчиков
9 330 просмотров · 1 год назад
Генеративный ИИ на основе диффузии видео — это следующий рубеж для ИИ. В этом видео мы обсуждаем проблему, вызовы, решения и основополагающие работы в этой области, такие как Imagen от Google, Make-a-video от Meta, модель скрытой диффузии видео (LDM) от Nvidia и SORA от OpenAI. Попутно мы обсуждаем основные концепции моделей диффузии изображений, такие как прямая и обратная диффузия, UNet, свертка и диффузионные трансформеры. Это видео призвано дать краткий обзор всех основных концепций в этой области — надеюсь, оно окажется полезным для более глубокого изучения.
Поддержите меня на Patreon по ссылке https://ko-fi.com/neuralavb!
Поддержите нас на Patreon, чтобы получить доступ к слайдам и видеоматериалам!
patreon.com/NeuralBreakdownwithAVB
Похожие видео:
Что такое модели условной диффузии изображений?
• Text to Image Diffusion AI Model from scra...
Что такое латентное пространство?
• Visualizing the Latent Space: This video w...
Как LLM-модели генерируют изображения? (Ответ не в диффузии)
• If LLMs are text models, how do they gener...
Плейлист «Трансформеры и внимание»
• Everything Language Processing and LLMs!
Посетите наш Patreon для полного доступа к коду и другим документам/анимациям:
/ neuralbreakdownwithavb
#generativeai #deeplearning #ai
Полезные статьи:
Video Diffusion Models: https://arxiv.org/abs/2204.03458
Imagen: https://imagen.research.google/video/
Make A Video: https://makeavideo.studio/
Video LDM: https://research.nvidia.com/labs/toro...
CogVideoX: https://arxiv.org/abs/2408.06072
Статья OpenAI SORA: https://openai.com/index/sora/
Полезная статья: https://lilianweng.github.io/posts/20...
Обзорные статьи: https://arxiv.org/abs/2310.10647 и https://arxiv.org/abs/2405.03150
Временные метки:
0:00 - Введение
0:39 - Условные модели диффузии текста в изображение
2:16 - Проблемы с видеомоделями диффузии
3:43 - VDM (2022)
4:50 - Факторизованная 3D Unet модели
5:46 - Мета Сделайте видео
7:28 – Видео Google Imagen
8:07 — Нвидиа Видео ЛДМ
9:36 - OpenAI СОРА