与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?
卫诗婕_漫谈Light the Star
0:00 / 0:00
与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?
630 просмотров · 3 дня назад
卫诗婕_漫谈Light the Star
320 подписчиков
630 просмотров · 3 дня назад
从语言大模型,到多模态至全模态模型,再到走向世界模型…
世界正在经历什么?
本期节目我邀请了加拿大外籍院士、智象未来 Hidream的创始人梅涛,还原视频生成模型的技术发展史。
梅涛院士是全球首篇文生视频论文的作者,也是最早探索文生视频的人。
2026 年 5 月 20 日,Google I/O 大会上,Pichai 发布了 Gemini Omni —— Google 第一个原生「any-to-any」的全模态模型:文本、图像、视频、语音都在同一个 Transformer 里原生流动,不再是几个模型拼接——这与梅涛一直以来的主张不谋而合。
与此同时,OpenAI 悄悄砍掉了 Sora 项目,更多聚焦 Coding——硅谷正在做减法。
但中国一侧的多模态战场却没有收敛,从多模态、全模态到世界模型,多模的架构层面正在发生一轮新的分化:DIT、UIT、Omni 各自赌不同的路。
梅涛,作为最懂视频模型的人之一,正是选择从底层架构下场的创业者,他致力于打造「视频界的 Anthropic」。
我们从他的中科大、微软亚研院岁月,一路聊到这场世界模型的创业之旅。梅涛的模型世界观可以用一句话精炼,那就是:
“”图片是入口,视频是过程,世界模型是终局。语言、视频、具身,终将汇聚。“”
这期的信息量极大,但技术门槛较高,不过,其中穿插着大量生动比喻,跟随下来,也能对当下的AI 趋势进行一场深入的了解。推荐。