# 64: 让奶牛猫跳洗澡舞，与阿里通义薄列峰聊多模态共识中的变量是什么？| AI 大爆炸

晚点聊 LateTalk · 2024-03-27

<https://latetalk.podhood.com/0eb166fb-1c65-406d-affb-fe4fb8345be5>

本期《晚点聊》邀请阿里通义实验室XR实验室负责人薄列峰，聊其以“数字人”为主线的多模态研究——包括让奶牛猫跳洗澡舞的Animate Anyone、一键换装的Outfit Anyone，以及用一段语音驱动蒙娜丽莎开口说话/唱歌的EMO；他的核心判断是多模态是大模型发展的必然方向，但“世界模型”如何实现仍是最大变量。面对Sora，薄列峰认为其60秒高质视频确实震撼，但视频生成和世界模型远未解决，业界对世界模型的定义也无共识；相比谷歌、字节的视频平台积累，他提示OpenAI可能还用仿真数据，数据问题仍有挖掘空间。他解释EMO与旧Talking head方法的区别：它不只对口型，语音会同时控制表情、眼睛、头颈和上半身，且是zero shot，任意照片加音频即可生成，这得益于大模型的容量。节目还复盘了他的跨领域经历：07年博士毕业时深度学习尚非主流，在Amazon Go用深度学习解决实际视觉问题后确认其效果最好，并由此理解AI与硬件结合；他认为机器人等物理世界AI进化慢，硬件自由度与能耗是长期瓶颈。他也讲了Animate Anyone接入通义千问后的用户启发：宠物跳舞比真人跳舞更受欢迎，上传狗的人比猫更多，团队为此优化了骨骼检测；现阶段免费开放更重视用户反馈与模型能力迭代，而非成本。最后他提出世界模型的未来变量：应能模拟因果而非统计关系，是否必须3D化、是否需要能主动与物理世界交互的实体智能体，都还是开放问题。

## Questions this episode answers

### 奶牛猫跳洗澡舞的视频是阿里自己做的吗？

薄列峰说，小金毛和奶牛猫跳洗澡舞的视频都是用户创作的，不是阿里官方制作的。系统最初主要针对人物，后来用户上传宠物照片发现也能运行；狗对系统挑战性相对小，团队近期优化了猫狗的骨骼检测和照片接受率，提高了成功率。

[26:53](https://latetalk.podhood.com/0eb166fb-1c65-406d-affb-fe4fb8345be5?t=1613000)

### EMO 和之前让照片说话的 Talking head 方法有什么不同？

薄列峰说，之前的 Talking head 方法不是大模型，EMO 则继承了大模型优势：模型参数远高于 3D 面部模型的上千个参数，能容纳更丰富的运动与情感；EMO 是 Zero Shot，给一张照片和一段音频就能直接生成视频，过程轻量；输出更生动自然。

[20:26](https://latetalk.podhood.com/0eb166fb-1c65-406d-affb-fe4fb8345be5?t=1226000)

### Sora 发布后，视频生成从业者是什么反应？

薄列峰说，从业者看到 Sora 后恐惧无济于事，更多是“为什么不是我，而是 OpenAI 做出来的”；也存在担心，一家大模型做得好，其他公司就面临挑战。但视频生成尚未彻底解决，世界模型也还有距离，因此他看到更多机遇。

[6:38](https://latetalk.podhood.com/0eb166fb-1c65-406d-affb-fe4fb8345be5?t=398000)

### 多模态共识中的变量是什么？

薄列峰说，多模态是大模型发展的必然趋势，但世界模型仍是早期阶段，存在不确定性：世界模型应能模拟因果关系，而当前视频生成更多是模拟统计关系；是否采用 3D 化或实体模型、如何让智能体主动与世界交互，都还是开放问题。

[42:31](https://latetalk.podhood.com/0eb166fb-1c65-406d-affb-fe4fb8345be5?t=2551000)

## Key moments

- **[0:00] 开场**
- **[1:51] 多模态与数字人**
  - [3:04] 薄列峰：通义XR实验室核心方向是数字人，天然是多模态问题——声音、文字、视觉形象是三个模态
- **[3:17] Sora 冲击**
  - [5:50] 薄列峰：Sora能直接生成60秒高画质视频，运动质量和画质都非常高，让视频生成从业者感到震撼
  - [6:38] Q: 看到Sora，视频生成从业者是恐惧多还是兴奋多？A: 薄列峰称恐惧无济于事，更多是‘为什么不是我做的’
- **[7:56] 世界模型**
  - [8:08] 薄列峰：世界模型应能仿真物理世界的运作规律，包括因果关系，而不只是模拟观察者记录到的视频
- **[9:05] 竞争与数据**
  - [9:34] Q: Sora对Pika、Runway等创业公司的冲击有多大？A: 薄列峰称有挑战也有加速机遇，取决于人才质量和数据规模
  - [10:54] Q: 面对Sora，拥有YouTube/TikTok的大厂数据优势还在吗？A: 薄列峰称视频数据有多渠道，OpenAI可能用了仿真数据
- **[12:34] 阿里多模态**
  - [12:53] 薄列峰：人工智能回归到人的自然能力，语音、表情、动作、文字天然构成多模态，多模态是大模型发展的必然趋势
- **[13:52] 技术主线**
  - [14:23] 薄列峰：XR实验室将数字人工作分为两层——数字资产生成和数字人技能生成，技能涵盖表情、动作、交互
  - [16:45] 薄列峰：Animate Anyone用骨骼动作序列作为Prompt，驱动任意形象——真人、卡通、兵马俑甚至猫狗
- **[18:18] EMO**
  - [18:37] 薄列峰：EMO不只是对口型，语音驱动的是整个面部表情、眼睛、眉毛、头部甚至上半身的运动
  - [19:34] Q: EMO需要动作序列吗？A: 薄列峰称不需要，只用一段音频加一张照片就能生成自然的说话视频，是zero shot
  - [20:47] 薄列峰：旧Talking head方法不是大模型，EMO继承了大模型的容量和数据优势，能表达更复杂的情感
  - [22:46] 薄列峰：EMO收到的反馈集中在自然度和真实性，生成效果与之前方法相比是数量级的提升
- **[23:59] 产品与用户**
  - [24:33] 薄列峰：当技术突破到一定阶段，再去做帮助用户的功能或产品是水到渠成的事
  - [26:22] 薄列峰：最初Animate Anyone没有猫狗跳舞，是用户上传宠物后发现了新玩法，奶牛猫和小金毛都是用户创作
  - [27:13] 薄列峰：上传狗的人比猫多，因一开始系统未对宠物优化、狗对系统挑战更小；近期已提升猫狗骨架检测和接受率
  - [28:15] 程曼祺分享：用通义千问全民舞王免费用，但为把猫P成人形用了醒图付费功能，最后只成功两只猫
  - [29:24] 薄列峰：优化猫狗跳舞不是简单的产品微调，而是基础算法对运动理解的提升，属于XR实验室主线工作
  - [30:33] Q: 免费开放全民舞王的推理成本怎么算？A: 薄列峰称现阶段更关注技术发展和用户体验，成本不是主要考虑
- **[31:46] 职业经历**
  - [33:15] 薄列峰引用07年前后的玩笑：‘深度学习效果比其它方法高了一个点，但多了很多参数’
  - [33:52] 薄列峰：2010年深度学习在语音识别上把误差降低30%，引发语音界震撼，两年后图像识别也取得大进展
  - [34:42] 薄列峰：在Amazon Go解决实际视觉问题时，发现深度学习效果最好，还要权衡硬件部署与端侧成本
  - [37:17] Q: XR实验室需要什么样的人才？A: 薄列峰称背景只是起点，需要持续学习，多样化团队能相互激发成长
- **[38:27] 物理世界**
  - [38:51] Q: 为什么物理世界的AI进化比虚拟世界慢？A: 薄列峰称虚拟世界有互联网文本图片视频数据海洋，物理世界受硬件制约
  - [40:10] 薄列峰预测：硬件在未来仍是机器人发展的大瓶颈，能耗与自由度要达到生物水平还有相当距离
- **[42:09] 世界模型变量**
  - [42:31] 薄列峰：多模态大方向确定，但世界模型如何实现是最大变量，包括因果建模和是否需要3D实体模型
  - [43:45] 薄列峰：视频生成目前更多是模拟统计关系而非因果关系，所以Sora会生成不符合物理规律的内容
  - [44:38] 薄列峰：世界模型是否需要3D实体模型仍是变量，物理世界的物体有物质存在，不只是图像像素
  - [46:51] Q: 有实体模型的世界模型输入什么数据？A: 薄列峰称真正有实体是让机器人主动与物理世界交互并学习
  - [48:56] 薄列峰：世界模型未来有两个方向——生成看似真实的虚拟世界，或制造能和物理世界像人一样交互的物理智能体

## Speakers

- **曼祺** (host)
- **薄列峰** (guest)

## Topics

AI模型团队动态

## Mentioned

OpenAI (company), Pika (company), Runway (company), 特斯拉 (company), 阿里 (company), Amazon Go (product), Animate Anyone (product), CLIP (product), ChatGPT (product), Diffusion Model (product), EMO (product), GAN (product), GPT (product), Sora (product), 通义千问 (product)

## Transcript

### 开场

毛巾羽毛小哑哑 ， 水温刚刚好 ， 泼泼水来搓泡泡 。 今天真是美妙 ， 大声唱个牛牛哑 ， 我爱洗洗澡 。

**曼祺** [0:13]
欢迎收听本期的 《 晚点聊 》， 今天的主播是曼琪 。 相信年初至今很多人都已经被这首歌洗脑了 ， 从小红书到 TikTok， 跳洗澡舞的奶牛猫和大金毛一路从中国火到了海外 。

这背后就是阿里巴巴通义实验室 XR 实验室的视频生成项目 Animate Anyone， 只需要一张正面站立的 2D 照片 ， 就可以在通义千问全民舞王这个应用上， 让你自己或者是你家的小猫小狗舞动起来 。

XR 实验室近期另一个引起讨论的成果是 EMO，Emote Potrait Alive， 它可以只靠一段语音就驱动一张静态的头像图片动起来 ， 比如让蒙娜丽莎诗朗诵 ， 让小李子唱一段 rap。

本期我们就很高兴地邀请到了通义实验室 XR 实验室的负责人薄列峰薄老师 。

**薄列峰** [0:57]
大家好 ， 今天很高兴能和大家来分享在这个大模型和多模态领域的一些进展和一些思考 。

**曼祺** [1:05]
嗯 ， 我补充介绍一下， 薄老师之前是学术和业界的经历非常丰富 ， 那他刚好是在深度学习崛起之前其实就进入了这个领域 。

因为您是 07 年就获得了西安电子科技大学的博士 ， 然后之后您是在芝加哥还有华盛顿大学都从事博士后研究 ， 然后在英特尔 、 在亚马逊的无人超市 ，Amazon Go 项目担任首席应用科学家 。

那现在您是在阿里 ， 我觉得这个经历刚好是又涉及到有硬件的部分 ，有软件的部分 ， 然后有这个深度学习崛起前后的一个差异 。

所以我们这次可能会先从一些行业的热点 ， 包括阿里现在多模态的一些进展开始聊 ， 那后面可能也会涉及到一些您自己的个人的职业经历 ，以及您觉得在整个求学和职业的过程中看到的一些技术趋势的变化 。

那先从今年初到现在非常火的这个视频生成和大模型的进展开始聊 。 您可以跟我们的听众简单地描述一下， 您会怎么定义自己现在的主要工作内容和探索方向吗 ？

### 多模态与数字人

**曼祺** [2:02]
比如说我们怎么理解多模态了 。

**薄列峰** [2:04]
哎 ， 好的 。 目前呢我是在领导通义实验室 CLIP， 那么我们的核心方向简单来讲就是来做数字人这样的一个方向 。

那么数字人呢 ， 天然的它就是一个多模态的这样的一个问题 ， 比如说今天呢我们和大家来去分享我们的观点 ， 那当我们面对面的时候 ， 我们能听到声音的信号 ， 我们也能把声音的信号呢转换成文本这样的一个表达 ， 同时呢我们也能看到对方的这样的一个表情 。

那典型的像声音 、 文字 ， 还有视觉的形象部分 ， 那就是三个模态 。 所以这典型的它就是一个多模态的问题 。

那么典型的当大家指多模态大模型的时候 ， 包括像文生图的这样的大模型 ， 文生视频的这样的大模型 ， 都在多模态这样的一个范畴 。

当然了 ， 大模型或者说多模态这样的一个问题 ， 它也不只是文文到图文到视频 。 那在我们特别说我们最近推出的这个 EMO 框架下， 那我们做的就是语音到视频 ， 那它也是从语音模态到视频模态 ，也是一个典型的多模态的问题 。

### Sora 冲击

**曼祺** [3:17]
嗯 ， 您春节的时候怎么看这个 Sora 的 ， 可能也许也可以叫横空出世吧 ， 就是它突然好像业界觉得会是一个比较大的进展啊 ， 就这个速度大家有预料到吗 ？

**薄列峰** [3:27]
对 ， 首先来讲 ， 大家如果看整个发展的脉络 ， 那么实际我们如果从第一代的 GPT，GPT-1 开始 ， 它实际已经是好几年前的事情了 。

它再迭代到 GPT-2，GPT-3， 到后面的这个 ChatGPT， 包括 GPT-4，以及 OpenAI 现在提到的他们正在研发的 GPT-5， 它实际上是经历了多个版本 ， 同时也跨越了多年这样的一个周期 。

那么在 2022 年， 这个文生图呢也变得非常的受领域的关注 。 那实际上如果说图片生成这件事来在视觉领域拉长周期再去看的话 ， 它也是一个很有历史的一个事情 。

包括早期的图片生成 ， 大家从噪声去生成图片 ， 用 GAN 这样的方法 ， 已经做了相当的工作 ， 包括说 GAN 的方法在人脸的生成啊 ，在几年前呢也实际上也获得了一个非常好的效果 ， 包括一些表情的控制等等。

到后面大家发现 ， 哎 ，Diffusion Model 它具有一个更好的推广性 ， 特别是在更多数据的时候 ， 它展示了一个非常好的这样的一个鲁棒性和它的稳健性 。

那再结合另一个领域如火如荼发展的这个像 CLIP 的啊这样的一个方向啊 ，也就是说把文本和图片的这种 embedding 啊能找到一个关联 ， 就是把这两个方法结合 ， 实际上就可以做文生图这样的一个工作 。

所以相当于说整个的图片生成 ， 它其实也有它的一个演进的模式和它演进的历史 。 那当看到就是文生图能做到这么好的结果的时候 ， 大家会觉得文生视频它是在未来几年要去到来的一个事情 。

实际上在 23 年各种文生视频的研究也是 ， 我如果看学术论文 ， 实际有不少的这方面的论文 ， 包括说是像 Meta 的 ， 像谷歌的等等 ， 实际在 23 年都有类似的成果发布 ， 当然也包括国内的公司 ，也包括从图片生成视频 ， 包括像一些创业公司 ， 像 Pika、Runway 等等 ， 就是它确实来讲在 23 年展现的结果上还是表现出了明显的限制 。

包括说这个视频呢只有 4 秒钟 ， 视频呢其实它运动的这个范畴呢比较受限 ， 同时呢画面可能出现不连续 ， 出现一些模糊啊等等不自然的这样的一些瑕疵 。

所以就是说整个呢大家是能看到这个领域的高速发展 ， 包括大家的一些投入 ，但是呢我觉得 Sora 它出现之后直接产生 60 秒的视频 ， 同时呢它的这种视频的 quality， 包括它运动的 quality， 包括它画面的 quality， 运动的质量 ， 画质各方面都是非常高 。

我觉得在这么短的周期里 ，因为这个对比像 OpenAI 就发布这个 DALL·E 3 的时间周期啊 ， 实际也不是特别长 。

那么在这么短的周期呢 Sora 能达到这样的一个结果 ， 我觉得对视频生成这块的从业者大家还是觉得非常的震撼 。

**曼祺** [6:30]
您刚才说视频生成的从业者看到 Sora 之后是很震撼的 ， 这个震撼里面是恐惧的成分多一点 ， 还是兴奋的成分多一点 ？

**薄列峰** [6:38]
对从业者而言 ， 恐惧是无济于事的 。 我觉得更多的是为什么这个不是我做出来的 ，而是我再一次是 OpenAI 做出来的这样的一个心情 。

如果说是否存在一些担心的情绪 ， 我觉得确实也是存在的 。 那因为整个特别是大模型的这样的一个高速发展 ， 它确实存在说就是一家大模型做得好 ， 那其他其实就面临挑战 。

嗯 ，但是呢我觉得整个的发展 ， 包括说大家如果去看像文生文 ， 比如说 GPT 系列的发展 ， 呃 ， 我个人在这上面可能能看到更多的机会 。

因为整个来讲 ，是否说视频生成已经被彻底解决 ， 还是说整个的包括提到的这个世界模型是否被解决啊 ， 我认为都还没有 。

特别是世界模型 ， 它其实还有相当的距离 。 那就包括说 OpenAI 自己的研究人员讲的时候 ，他也会提到说现在世界模型离这个还有一些距离 。

这个呢我自己在这方面也有些理解 ， 所以我觉得这个开始肯定有震惊 ， 就是略带些恐惧 ，但我觉得更多的还是看到这个领域的它的一个机遇 。

而且我觉得在这个领域 ， 就是在这个之上， 它其实有很多的这个可能性 。

### 世界模型

**曼祺** [7:56]
嗯 ， 可以给听众解释一下世界模型 。

**薄列峰** [7:59]
我觉得世界模型这个事是一个很 fancy 的词汇啊 ， 我们也在做一些工作 。 我不是说我们做大家提到的那个世界模型 。

举个例子 ， 像查尔玛 ， 大家知道跟元宇宙也一样的关系 。 那我们当时实际上也把整个分成人物场这样的一个表达 。

那人物场呢 ， 它在真实的物理世界它是可以去交互的等等。 所以我觉得世界模型今天大家怎么去定义它 ， 我觉得它的定义也是一个进化的过程 。

那从我的理解来看 ， 整个这个世界模型 ， 如果说我们以一个很严格的定义 ， 那它的世界模型应该能够去整个来去仿真我们的这个物理世界 。

那它可能不只是仿真我们物理世界所呈现给我们每个人的一个形式 ， 比如说视频 ，而且能够去仿真这个物理世界它的运作规律 ， 比如说因果关系等等。

那从这个角度去看 ， 我觉得目前 。 啊 ， 离就是更高阶段的世界模型 ，其实大家还都有相当的距离 。

**曼祺** [9:05]
对 ，因为您刚才也说到就是这个 Sora 出来之后， 确实对其他的公司会有一些挑战嘛 。 那因为阿里是一个很大的公司 ， 我相信它肯定是有资源在这些领域持续去探索的 。

### 竞争与数据

**曼祺** [9:15]
然后这个行业也有一些您刚才提到 ， 比如像 Pika、 像 Runway 这种体量更小些的创业公司 ， 这个是不是接下来对他们的冲击还是会挺大的 ？

还是说反过来 ， 反而是投资人会看到说这个方向其实能做出一个很好的成果 ， 那后面的人去去追它 ， 反而是可以更高效率的达到一个节点的 ？

**薄列峰** [9:34]
这样的模型出现的时候 ， 那对创业公司的一个挑战 ， 特别是如果创业公司现在所做的模型距离现在这个模型就是看起来啊还是有相当差距 。

那它的机遇是这样的 ， 就是说如果说视频生成方向只有一个玩家 ， 或者只有一个创业公司在做 ， 实际你可想而知它的进度肯定是非常慢的 。

那当你的同行呢在和你做相同领域的时候 ，他可能已经做了试错的一些阶段 ， 然后给你提供了一些参考等等。

所以这个本质呢 ， 它肯定会加速这个方向的一些发展 ， 这就是机遇 。 那这个机遇就在于说是否创业公司还有足够的人力资源 。

这个人力呢可能不是数量 ， 更多的是质量 ， 人才的质量是不是能跟得上， 然后呢数据的规模的问题能不能得到解决 ， 训练机器的资源能不能得到保障 。

如果这几个条件呢都是具备的 ， 那它可能就能抓住这个机遇 ， 然后呢迎头赶上， 成为呢第一梯队 ， 成为一个受益者 。

但相反呢 ， 如果这些啊比较缺乏 ， 那可能它就会掉队 ， 甚至是没有办法再去继续这个方向的事情 。

**曼祺** [10:43]
就是您刚才说到数据这个事 ，其实我觉得 Sora 对行业有一个冲击在于 ， 谷歌和字节都是有很多视频数据的 ，因为谷歌旗下有 YouTube， 然后字节的 TikTok、 抖音都是有很多数据的 。

但反而好像这个东西出来之后， 大家会怀疑说你的这个大的公司数据优势到底有多强 。

**薄列峰** [11:00]
第一个就关于数据 ， 我觉得大家都有各自特点的数据 。 同时呢像你提到的 OpenAI， 它实际上大家的关心中可能并不感觉它是一个数据非常充分的一个公司吧 。

但是呢它能去做这样的方向 ， 我觉得这里都有几个点啊 ， 就是像视频数据它有多种来源渠道 ，有一些就是公开的 ， 还有一些实际上就是 OpenAI 自己也提一些就是授权的数据 ， 还有一类数据实际这个呢他们一会提一会没提 ， 就是技术工作者推测他们应该是用到的 ， 那就是仿真的数据 。

这块呢因为我们也从事 3D 的方向 ， 对仿真引擎这块还是比较熟悉 ， 那整个这个领域实际上有 3D 模型之后， 它是比较容易仿真出多视角的数据 。

同时呢在仿真上整个的进展 ， 包括一些就是流体啊气体啊等等 ， 它都能去保管这样的数据 。 这样的数据呢它有它一定的缺点 ， 就是它的这个 photorealistic 就真实性上比实拍的会弱一些 ，但是呢数量就是比较好控制 ， 那么能够通过这个生成的方式来产生 。

所以从这个角度去看 ， 我觉得现在呢包括整个的技术文档在这一块讲的也不多 ， 所以整个数据我觉得里头可能还有一定 tricky 的事情是需要去挖掘 。

随着大家去复现 Sora 的这个热情越来越高 ， 更多的信息呢就是包括大家在尝试的过程中， 对这个数据更多的理解啊 ，也都逐渐的会去分享出来 ， 相互呢会做一些借鉴 。

### 阿里多模态

**曼祺** [12:34]
然后另一方面我觉得阿里也比较有意思的一点是 ，其实阿里虽然它可能没有像比如谷歌或者字节那么大的一个视频平台 ，但阿里在多模态的投入一直是挺多的啊 。

因为从就是这几年你看对外的进展也一直非常多 ， 就是你怎么看就不同的公司之间可能在这个多模态的优先级上是不太一样的 。

**薄列峰** [12:53]
刚才我也提到就包括我们是做数字 ， 那整个来讲我们对大模型 ， 包括整个 AI， 我们一直坚持从我们自己的角度 ，有我们自己的一些理解 。

那从这个角度去看 ， 就是我们把人工智能这件事回归到最自然的一个问题 。 那人工智能实际上它讲的是智能 ， 那如果我们要去借鉴 ， 那今天肯定是借鉴整个的全世界 、 全社会的这样的一个人。

那当我们回到对人的观察 ， 就像我刚才在开场时候提到的 ， 那么它有语音 ， 它有表情 ，有动作 ， 它有这个文字 ， 它能写文字 ， 那很天然的就是一个文本 、 语音 、 图像 、 视频这样的一个多模态数据 。

所以从对这个问题最根本性的理解出发 ， 我们一直认为这个多模态是大模型发展的必然趋势 ， 所以我们也一直在这方面投入去突破啊 ，也有我们自己有特色的成果 。

**曼祺** [13:52]
对 ， 这个正好可以展开讲一讲 ，因为阿里的 XR 实验室其实陆续有很多成果 。 你刚才有提到这个 Animate Anyone， 就是跳舞小包的那个 ， 然后还有包括你们做了可以一键换装的 Outfit Anyone， 还有最近非常火的就是你们让 Sora 里的那个女主角也可以开始开口说话唱歌 ， 包括让蒙娜丽莎可以诗朗诵的那个 EMO， 就是 Emote Potrait Alive。

### 技术主线

**曼祺** [14:14]
那你们做了这么多这些不同的项目和进展 ， 它背后有一个什么大的脉络或者主线吗 ？ 就你们关注的几个重要的问题是什么 ？

**薄列峰** [14:23]
对 ， 这个呢它回到原来的就是我提到的这个数字人这样的一个方向 。 那么首先呢我们对数字人整个的这个基本问题啊做了一些梳理 。

那从我个人的观点来理解这件事啊 ， 我把它分成两个层啊 ， 一个层我叫数字资产的生成 ， 另一个层呢我叫数字人技能的一个生成 。

这是我们的一个理解模式 。 那什么是数字资产 ？ 那资产它可以是一个图片 ， 它可以是 3D 的一个模型等等。 这样子呢它就给了这个人一个基础的一个外形的表达 。

但是呢我们今天去看一个人， 如果只看到他的外形 ， 显然他是不够的 。 因为比外形更核心的是人具备各种技能 。

那比如说人现在呢他能去走路 ，他能去讲话 ，他能去抓起一个水杯然后来喝水 ， 那人实际上是具备这样各种各样的技能 。

那这个技能呢我们也做了一个分类 ， 就包括大的分类能分为表情 、 分为动作 ， 还有像比如说人和物的交互等等。

所以我们有这样的一个分类的一个系列 。 那么在这个维度上去看 ， 首先呢技能这一块我们会定义说有这个像骨骼来去生成人物表情 、 语音来去生成人物表情 ， 甚至文字生成人物表情这样的一些基本问题 。

那顺着这个脉络来去研发的话 ， 首先呢就由我们呢在去年 12 月份的 Animate Anyone， 那它的核心是说我通过一个动作序列能够让一张人物图片能够动起来 ， 按照这个动作序列的这样的一个模式 。

那在这里头的技术创新呢我们基本上就是三个模块 。 第一个就是当有这个人物的参考的图片的时候 ， 我怎么保持人物外观的这样的一致性 。

那我们在这个 Animate Anyone 中是引入了 Reference AI 来去保证它的这个人物外观的一致性 。 另外呢就是动作序列实际更像是我们的控制条件 ， 或者说大家喜欢用的叫 Prompt 啊这样的一个词汇 ， 来去触发这个静止的图片 ， 让它来按照这个动作序列去动 。

那在这个里头呢就是我们通过动作序列 ， 我们实际是来控制动作 。 那这里头的特点就是在我们的整个人物视频生成中， 我们具备高度的可控性 。

那这个在实际应用中也是非常的重要 。 举个例子 ， 像开始你提到的就是比如说小猫小狗唱洗澡歌 ， 对吧 ， 跳这个洗澡舞 。

那这个洗澡的这个舞蹈本身呢就是我们是可以从人的身上去提取动作序列 。 最后呢我们的驱动的对象可以是小猫小狗 ， 然后再加这个动作序列 ， 我们就能把它转移到很有趣的一个玩法上 。

那么第三个点呢就是当这个人物就是我们一开始 target 的人物 ， 结果呢大家就是也上传小猫小狗 ， 发现它也 work， 然后我们是要有一个动作一致性的这样的一个模拟 。

这里头我们有一个时间的一个 Temple 的模组 ， 就是基于这个 Transformer 架构 。 所以整体上就几大模块呢就是保证来达到我们的一个目标 ， 给定一个动作序列 ， 骨骼的序列我们能够去驱动一个形象 。

那这个形象呢可以是真人， 可以是卡通 ， 可以是兵马俑 ， 甚至可以是小猫小狗这样的一个框架 。 那这里头就完成了说就是我的整个的相当于我的控制信号 ， 或者我的 Prompt， 或者我的 Condition， 然后呢是骨骼序列 。

那这个完成之后， 像我刚才说的各种技能的定义 ， 那我们再思考说语音 ， 我们把这个推广到语音上， 然后就得到了我们 EMO 这样的一个版本 。

所以整个呢在这一块就还是对借鉴人， 然后呢把它来系统化 ， 然后呢来看就是我们在这一块不是去做一个单点的创新 ，而是能够去做一个一系列的一些工作能够把这个问题推向到一个新的高度 。

**曼祺** [18:18]
所以因为 EMO 口型是可以完全对上的吗 ？ 相当于它这个口型是根据语音来的 ， 对吧 ？ 你有一段语音 ， 它就会自然而然的对应到那个口型上 。

### EMO

**薄列峰** [18:27]
对 ， 就是这个 EMO 我解释一下， 就是可能大家讲到语音驱动 ， 大家就是会讲到对口型 。 实际呢它是一个 Multi-Model 对口型的一个过程 。

那从 EMO 的角度 ， 我更愿意把它讲成是人物讲话的一个 Model， 或者说语音来去生这个人物讲话的这样一个视频 。

那为什么这么说呢 ？ 举个例子 ， 像我现在讲话的过程中， 那我不光是嘴在动 ， 我面部的表情我是笑的 ， 对吧 ？

我是悲伤的还是我是什么 ？ 我眼睛是睁的还是闭的 ？ 我的头是怎么动的等等。 所以在 EMO 的 Framework 中， 整个声音它去驱动 ， 或者说它去控制的不仅仅是嘴型 ， 包括面部的表情 、 眼睛的动作 、 眉毛 ， 包括头 。

就我们现在的版本呢还是一个相当大头照或者上半身这样的一个版本 。 那实际上就声音它控制了整个上半身或者大头照的运动 ， 就不只是嘴型 。

**曼祺** [19:26]
对 ， 就所以还有表情 ， 还有你的身体的摇摆 ， 对吧 ？ 这个都是就是用语音这个单一控制条件就可以了 ， 就它这里面是不用动作序列的 。

**薄列峰** [19:34]
对 ，在我们的方法里不需要 。

**曼祺** [19:36]
OK， 那我觉得还是非常生动的啊 。 因为你们这个项目的 GitHub 的那个网上也有很多案例嘛 ， 包括奥黛丽 · 赫本的 《 蒙娜丽莎 》 的 ， 对 ， 我看了很多 。

就它确实是整个面部 ， 或者说上半身吧 ， 包括你脖子 ， 然后你的肩的这种运动都是很生动很自然的一个状态 。

**薄列峰** [19:52]
对 。

**曼祺** [19:52]
这个成果发布之后有什么业界的反馈吗 ？ 比如说有同行来问 ， 就说你们这是怎么做的吗 ？ 或者说大家会觉得这个事是一个比较难的事 ， 比较好玩的事 ，有比较多创新 ， 还是很多人觉得啊这个我看到阿里做了 ， 我们也可以做 ？

**薄列峰** [20:05]
实际上呢我们是把我们的 Technical Report 是放到了 Archive 上， 所以整个我们方法的这个技术的部分是对公众是可视的 。

这是一个我想说的 。 那第二就是大家怎么来去对这件事情有什么样的一个结果 ，有什么样一个感知 。 首先来讲 ，因为这个领域我也做了一些年 。

首先呢像讲话的 Talking head 啊 ，有人这么讲 ， 对吧 ， 这个方向 。 那它有各种各样的方法都在去做 。 那之前的方法呢我个人总结一条啊 ， 就是它不是大模型 。

我们的方法呢可能是继承了大模型的一些优势 。

**曼祺** [20:43]
嗯 ， 就是大模型和不是大模型的核心区别是什么 ？

**薄列峰** [20:47]
我觉得今天就如果要回到这个问题 ， 当大家任何讲到大模型的时候 ， 大家都会讲到所谓的 Scaling Law， 对吧 ？

我有很多的数据 ， 那我能去模仿更丰富的东西 。 我觉得今天就是讲话这件事 ， 它是一个非常复杂的这样的一件事情 。

那整体上呢它的运动 ， 如果我们去看这个面部 ， 实际上比较精确的 3D 模型 ， 它的面部是上千个参数 ， 即使上千个参数它也是不够的 。

那么在这个大模型的这个世界 ， 它的参数是远远比这个高的 。 而且呢它还融入了很多其他的 ， 包括运动的特点等等。

因为在我们训练完之后， 我们不光是能够驱动它讲话 ，而且我们是 Zero Shot。Zero Shot 是什么意思 ？ 就是你给一段音频再给一张照片 ， 我们就可以让这张照片去讲那段音频 。

那么它是一个非常轻量级的一个技术 ， 这也是大模型的魅力所在 。 所以呢是和不是大模型 ， 第一它 offer 的这个生动性 ， 就是它输出表达的是非常的生动啊 。

因为它能够把很多情感的东西都能容纳进来 ， 它有足够的这样的一个复杂度来去容纳这些东西 。

那之前的一些可能不是大模型的方法 ， 它在整个人的表达的复杂度上， 实际上可能是做了一些简化的 。 它在这个表达的复杂度上做了简化 。

那大模型呢在这张图啊没有简化 ， 这是其一 。 那其二呢通过我们的技术 ， 实际我们就可以把图片和声音都作为 Condition 输出进去了 。

也正是因为大模型它大的容量和在大量的数据上的一个训练 ， 这样子的话 ， 它实际能够适应说你把不同的声音 、 不同的照片你输入到这个模型 ， 它都能给你产生一个非常不错的结果 。

所以这是它和相对强模型的两个优势 。 然后呢再关于大家的反馈 ， 我觉得整个呢对效果的反馈都还是非常的正面 。

那首先这个我觉得就是我们自己其实在论文里也有对我们的表现力测度 ， 就是和以前的方法做过对比 。

它是一个数量级的提升 。 如果看大家的这样的一个反馈 ， 就是我觉得最多的关注点就是它的自然度 ， 它今天的真实性 。

那也就是说看到我们生成的这个讲话的视频 ， 它非常少的啊 ， 就仔细看也能找到一些瑕疵 。 但就生动性而言 ， 那它本身来讲就是和以前的方法比 ，也是一个数量级上的一个提升 。

比如说这个照片的这个主角在唱歌的时候 ，他甚至眼睛闭着 ， 对吧 ？ 而且还有这种比较 Enjoy 的这种表情啊等等 ， 都是和这个歌曲的这种基调啊也有一个很好的 match。

**曼祺** [23:32]
对 。

**薄列峰** [23:33]
包括像一些 choir 的讲话的时候 ， 那它实际上它不光是说它有表情 ，而是说它的表情本身和语言的内容也有一定的匹配 。

**曼祺** [23:43]
是 ， 我们到时候会在那个 Shownotes 里传一些视频 ，因为我们这么讲可能大家感觉不到 ， 就你可能要去看 。 因为它有的是让它比如说唱一个比较悠扬的歌曲 ，有的可能是让它唱一段 K-pop， 确实它这个整个人的表情 ， 它跟这个音乐的风格 ， 跟它要讲的内容的风格都是非常匹配的 。

### 产品与用户

**曼祺** [23:59]
我们到时候会放一些视频在这个链接里面 。 然后我发现阿里做多模态 ， 就你们这个 XR 实验室的很多成果的一个特点 ， 就是它不仅是在学术上有影响力 ，而且它已经是造成了某种病毒式的产品的传播 。

就比如说这个跳洗澡舞的小猫 ，其实春节前后我看小红书然后 TikTok 上面都有很多很多大家做的视频 ，因为它背后是 Animate Anyone 嘛 。

就这个东西是一开始就想好的 ， 我这个产品和我的技术是同步去推的 ， 还是后面比如说通义那边的产品觉得哇这个东西很好 ， 我可以放到通义千问里面作为一个小的功能 。

**薄列峰** [24:33]
从一开始我们肯定觉得这是一个非常值得研究的方向 ， 同时呢这个方向的进展也会对整个产品也有帮助 ，也能用到大家的日常生活 ， 对大家的方方面面去助力 。

所以整个就是我们把这个方向先看明白 ， 然后呢我们就是因为现在有很多要做的技术突破 ， 然后我们就去做这个技术突破 。

当技术突破到达了一定的阶段之后， 那再去做一些实际上帮助大家的一些功能或者产品 ， 它也是水到渠成的事情 。

**曼祺** [25:07]
明白 ， 所以它是一个交集 ， 对吧 ？ 就是你们的技术主线和它刚好又可以有一些应用的一个交集啊 。

**薄列峰** [25:14]
对 ， 就是因为最近 Sora 比较火嘛 ， 就 Sora 发布 ， 那它实际上目前来讲就它没有对所有的公众开放 ， 它还是对少量的人群去开放 。

比如说它向一些创作者 ， 它向一些影视从业者去做一些开放 ， 包括呢它也向大家去展示这个 。 实际上就当他们的研究者接受采访的时候 ，他们也提到就说自己还是非常想看在现在的阶段 ， 大家对他们这样一个产品的一个反馈是什么 。

包括大家提到说哎这个东西可能的用途在哪等等 ， 这些呢其实也能为他们下一阶段的这个工作 ， 包括一些优先级啊来提供一些帮助 。

那从整个这个角度去看 ， 就当我们定义的问题足够宽广的时候 ， 它的应用其实是方方面面的 。

所以在这个方向上， 我们会判断说这个东西足够的宽广 ，以我们这个视频为例 。 然后呢就是在后面去找这些啊 ，因为就比较水到渠成 。

当然当我们把技术推出来 ， 当我们把包括说全面推出来之后， 那我们从反馈和从大家的交流中其实我们也获得了更多的启发 。

**曼祺** [26:19]
嗯 ， 比如说获得了什么启发呀 ？

**薄列峰** [26:22]
举个例子就是如果看我们初始的 Animate Anyone， 我们放了这个 ， 就是我们有真人， 我们有卡通 ，但那个时候我们其实并没有猫和狗来跳舞 。

那就是当我们把这个放出来之后呢 ， 实际那有的体验者使用者 ， 那他就会把一个小猫小狗把它的来视角推演 ， 做成一个人的形状输入进来 ， 然后呢系统就结束了 ， 同时也输出了一段非常有意思的视频 。

那从这个角度去看 ， 实际上它就是应用功能的一个扩展 。

**曼祺** [26:53]
哎 ， 所以那个奶牛猫最开始是用户上传的吗 ？ 不是阿里自己做的 ？

**薄列峰** [26:58]
小金毛啊 ， 奶牛猫都是用户的创作 。

**曼祺** [27:02]
哦 ， 这个挺有意思的 。 嗯 ， 我听说的一个数据啊 ， 向您求证一下， 就是说大家开始用宠物去玩这个东西之后， 上传狗的人是比上传猫的人多的 ，是真的吗 ？

**薄列峰** [27:13]
就是说我们的系统整个来讲 ，因为我们在一开始就是对人来做的 ， 所以并没有对狗和猫做专门的优化 。

然后呢大家就是在上传狗和猫 ， 就是狗呢可能对我们的系统挑战性稍微少一些 ， 所以就是会有这样的一个感受 。

那其实我们最近呢对整个系统也做了优化 ，也就是说对猫和狗的情况呢 ， 我们对这个骨骼的整个检测啊 ， 包括驱动的话也做了一些优化 ， 包括在这个狗和猫的照片的接受率上啊等等都有大幅的提升 。

**曼祺** [27:48]
对 ，因为我也可以分享一下， 就是我用这个产品的过程 。 因为我过年的时候我也用了 ， 然后想让自己的猫去给人拜年嘛 。

然后在整个过程中间 ， 我并没有给阿里的通义千问付钱 ，但是我有一个付费环节 ， 就是我要把这个猫 P 的像一个人。

我就去用了自结的一个 P 图工具叫醒图 ， 它里面有高级功能是需要付费的 。 我这个环节花了钱 ，但即使如此我也只 P 成功了两只猫 ， 就是我后来还想给别人 P 嘛 ， 就没有 P 成功 。

我觉得这个商业化的过程也挺有意思的啊 ， 就是你们目前是免费的啊 。

**薄列峰** [28:19]
是的 ， 所以刚才就有提到说对我们而言更多的是落地 ， 就是在落地的这个过程中也会发现说这个猫和狗是大家比较愿意来去做的 。

因为这个呢其实简单想逻辑也还比较清晰 ，因为猫和狗要去跳科目三 ， 要去跳洗澡歌它是不可能的 ， 它只能通过这样的一个技术手段来去实现 。

从我们开始说哎这个是对人形的用 ， 包括大家应该知道兵马俑跳舞等等。 那么到后面说哎大家是上传这个宠物 ， 就是我们也会发现说确实在猫的通过率上低一些 ， 所以我们也尽快的来去优化 ， 来满足大家这样的一个需求 。

那实际在最近几天呢 ， 就是我们的新功能也上线了 ， 如果再是猫的话成功率会高 。

**曼祺** [29:06]
嗯 ， 当你们去做这种优化 ， 我理解它是一些微调的工作啊 ， 就是让你的模型对宠物的接受度更高 。

这个也是 XR 实验室团队的人去做吗 ？ 还是说这个是通义产品的人自己去做就可以了 ？ 就是它会需要占用你们的一些精力吗 ？

以及你怎么看这种在产品上的投入了 ？

**薄列峰** [29:24]
实际是这样子 ， 就是我做的是基础算法 ， 那对这一块做的还不够好 ， 主要还是我们在这一块的一个关注的盲点 。

那当意识到这个问题的时候 ， 我们还是想把我们的算法去做一个提升 。

**曼祺** [29:38]
所以就您觉得这个工作 ， 它不是我刚才叙述的那个 ， 就是我一个产品的优化 ，其实还是一个基础模型能力的提升 ， 算法的提升 ， 然后才让你最后的体验有一个提升 ， 对吧 ？

就还是在你们的主线上的工作 。

**薄列峰** [29:51]
是的 ， 就是我认为其实这里头不光是主线的工作 ，而且是对运动这件事情的理解 。 那如果我们来看整个这个物理世界 ， 那能动的包括动物是典型能动的 ， 像人猫狗对吧 ， 就是这样的一个动态的这样的一个类别 。

所以这里头呢其实也涉及到对整个运动的一个理解 。 嗯 ， 所以我们就是更愿意把它看成是一个更加宽泛的对运动理解这样一个工作 。

**曼祺** [30:23]
嗯 ， 你们现在这个功能的它的推理成本是怎样的呀 ？ 因为你们是免费的开放嘛 ， 那其实用的人越多 ， 阿里消耗的资源也越多嘛 。

就你们会怎么考虑这个事情了 ？

**薄列峰** [30:33]
我们会觉得就是说整个技术的发展和大家来去体验它是密不可分的 。 就还是回到我刚才讲的 ， 就是我们还是在现阶段更加关注对这样的一个科学问题的理解 。

那其他的都是我们现在不是主要考虑的一个方面 。

**曼祺** [30:52]
阿里也有钱对吧 ？ 我看阿里最近投大模型也投的力度挺大的 。

**薄列峰** [30:56]
如果说是大模型和这一块基础研究的投入 ， 那肯定是需要一定的投入才能去解决这个问题的 。 如果去类比行业的公司 ， 比如 OpenAI 大家都知道 ， 就是 OpenAI 的 CEO 他就是到处去融资的能力是非常强的 。

**曼祺** [31:12]
你们的 EMO 这个功能会上通义千问吗 ？ 就到时候比如说会给一般用户开放 ， 我自己上传一张照片 ， 然后上传一段音频它就可以动起来 ， 会有这个计划吗 ？

**薄列峰** [31:24]
EMO 这一块我们目前还是专心的来去优化它整个的这个模型 ，其他相关事项就还没有在讨论的日程上 。

目前来讲 ， 整个我来去判断它是一个相当有潜力的这样的一个方向 。 那我们有一些不错的进展 ，也还有很多需要去解决的问题 ， 去把它推向另一个高度 。

嗯 ， 这是我们的优先级 。

### 职业经历

**曼祺** [31:46]
我们接下来可以时间线往回溯一点 ， 就是想和您聊聊职业经历还有选择 ， 您是怎么走到这个领域的 ？

因为您是 07 年就博士毕业了嘛 ，其实相当于当时就是博士期间就是在做学术了 。 然后那个时候深度学习方法可能还不是 AI 领域非常主流的方法 ， 它是 11 年、12 年之后才崛起的 。

那这中间我看您也做过计算机视觉 ， 做过自然语言处理 ， 包括在 Amazon Go 的时候 ，其实你们做了很多 AI 和硬件结合的东西 。

就是你是怎么逐渐来到多模态的了 ？

**薄列峰** [32:16]
对 ， 首先来讲就是团队这个问题的理解 ，其实在一开始啊 ， 当我们去做的时候 ， 我们讲 Computer Vision， 计算机视觉对吧 ？

那计算机视觉它就借鉴了人类的很多视觉 。 那当我们沿着这个思路去考虑呢 ， 它也包括说就是人它可能不光是视觉的部分 ， 它也有声音的部分 ， 它也有等等。

所以就是思考多模态这件事倒是比较自然的一个事情 。 那再回到说这些工作 ， 当然了就是这不代表说在一开始 ， 比如说在博士后期间 ，在亚马逊期间我们就是多模态的工作 ，但这件事的思考我觉得也从没停止过 。

那如果看这个阶段的工作呢 ， 实际我最早的背景是机器学习 。 那当 06、07 年大家讲深度学习的时候 ， 那个时候深度学习其实还是在非常小的数据集上去做的 。

大家就是有时候会开玩笑说哎深度学习效果非常好啊 ， 就在会议里讲深度学习效果非常好 ， 比其他方法高了一个点 ，但是多了很多参数 。

哈哈哈 ， 这个呢是一个比较讽刺的一个说法 ， 就是当大家去看说因为深度学习的那个阶段 ， 就是 07、08 年大学 ， 就是我的结果比你好 ， 我在结果上能够比对 ，但大家其实在那个阶段对它还是有相当多的一个 ， 亦或你说是怀疑 ， 亦或是信心不足吧 。

所以就会有这样的一些啊玩笑 。 那随着它快速的发展 ， 实际上在 10 年呢它在语音上取得了突破 ， 就是整个呢在语音识别上呢它的误差呢和传统方法相比降低了 30% 啊 ， 引起了语音界广泛的关注 ， 可以说是非常的震撼 。

它迅速的就在语音上获得了推广 。 那这个时候呢大家就在思考说哎是不是说在图像上深度学习是不是应该它也会获得结果 。

大家的想法是图像是二维的 ， 比语音复杂 ， 包括视频是更多维 。 就是两年之后呢这个深度学习呢在图像识别上啊又获得了很大的进展 ， 那引起了非常多的一些关注啊 。

那大家从怀疑呢走到另一个阶段 ， 就是怎么用这个工具去把 AI 这件事情做得更好 。 那我的背景实际上就是在这个时期我也在做这个学习 ， 就包括说特征学习啊方方面面等等 ， 就是对深度学习也有接触 。

但在这个阶段呢整个来讲就是可能也在探索一些和深度学习并行的方法 。 它的好处是说理解了其他方法 ， 同时也理解了深度学习 。

那么当在亚马逊的时候再去解决这样一个非常实际的一个视觉问题 ， 那也就是说就是我们可以推测到整个大家在这个店里的一些购买行为嘛 ， 是一个挺大的一个系统 。

那在这个时候呢首先呢我们需要有一个很高的精度 ， 那我们就借助各种工具 ， 那最后发现深度学习的效果还是最好的 。

然后呢提到和硬件的结合的这一块 ， 包括说整个它的成本 ， 如果我要把这个东西部署 ， 成本更加降低 ， 需要是不是升级在端上啊等等各种方案的讨论 。

那么再考虑到说对整个环境 ， 整个在商店里这样一个物理空间 ， 整个的一个感知的话 ， 就如果考虑这个感知的话 ， 那包括说我其实是需要我的传感设备能有一个全空间的感知能力 。

那所以我的硬件应该是怎么来排布的等一些问题 。 所以这里头呢是我们对这样的一个端对端的这样的一个问题有一个很好的理解 ， 就是从它传感器获取数据的阶段到后面算法的优化等等的整个过程 。

所以就是说在这一块呢对这个实际的物理上的就是比较依赖于传感器这样的一个系统 ，也有一些自己的理解 。

那么再到后来呢就是我也来去管理的这个像 AI 来源 ， 那同时也是接触像语音 、 文字 ， 还有包括图像 、 视频 。

所以也比较自然的就是对整个多模态这一块比较感兴趣 。 现在当然我们的效果是有了质的飞跃啊 ， 那回想到最初数字人的这个结果的话 ， 那实际上还是有很多限制的 。

所以啊也能感受到说随着深度学习的发展 ， 随着大模型的发展 ， 技术呢所能获得的效果 ， 包括它能所能推动的效果的上限 ， 都产生了非常多的质的飞跃 。

**曼祺** [36:33]
您觉得过去这些经历 ， 哪些对您现在的工作是有比较多启发的 ？ 包括你和别人讨论的时候 ，因为团队里肯定有人是不同的背景嘛 ， 比如说你自己的这个背景 ， 可能你会觉得你想用哪些东西的时候 ， 你会关注到一些别人不会关注到的点 。

**薄列峰** [36:47]
当大家去看一个问题 ， 不同的人有不同的理解 ， 那这里头能够带入多少自己的理解 ， 特别是自己的且是正确的理解是非常关键 。

那今天呢就是身处大模型多模态高速发展的这样的一个环境中， 就是很多人他能提供观点 ，但这个观点是不是就是来自于自己最深入的理解 ， 我觉得还是很关键的 。

**曼祺** [37:12]
你们团队现在需要什么样的人啊 ？ 就比如说你觉得你们还缺什么类型的人吗 ？

**薄列峰** [37:17]
我觉得我们整个人员的组成还是比较多样化的 ， 像我们叫 XR 实验室嘛 ， 我们有 3D 的同学们有视觉的 ， 我们的同学呢也在理解像语音啊文字这样的信号 ， 这样的一些输入 。

我觉得今天特别是随着 ChatGPT 的发展 ， 那大家其实对语言这样一个事情啊 ，其实都或多或少啊 ， 大家都在加强自身的理解 ， 就是语言啊你可以看成它是文生文等等等等 ， 包括语音这些的理解 。

所以我觉得就是背景它是一个起点 ， 就是任何背景它要做好这件事 ， 它是一个持续学习的一个过程 。

然后呢一个多样化的团队能够去相互 motivate， 相互去成长 ，因为大家有相互自己更加专业性的一个方面 。 所以对人才我的观点一向就是它有一个基础 ， 它有一个基点 ， 然后呢它肯定是需要不停的去成长 ， 这才是它的一个核心 。

**曼祺** [38:12]
在技术上， 你们和达摩苑的什么实验室合作会比较多 ， 或者说交流的比较多吧 ？

**薄列峰** [38:17]
整个来讲大家交流都还是比较多的 ， 特别是在多模态这个方向 ， 大家在各自的领域都有各自的特点 ， 像语音啊语言我们都有非常多的交流 。

### 物理世界

**曼祺** [38:27]
嗯 ， 然后您之前的经历里面 ，其实我觉得当时在 Amazon Go 做这个无人超市 ， 我觉得是比较特别的一个 ，因为它是和物理世界交互比较多的 。

那像数字人， 包括大语言模型 ， 包括现在特别火的像 ChatGPT、Sora 这些 ， 它都是更聚焦在虚拟世界的 。 然后我之前的一个感觉是物理世界的 AI 进化是要比虚拟世界要慢非常多 。

你觉得这个领域接下来会有什么变化吗 ？ 它是一个拐点快到的时刻吗 ？ 比如说最近我们也看到很多做机器人的公司 ， 主要是在欧美啊获得了比较大的资源 ，有很多人去投他们 。

**薄列峰** [39:02]
就是以现在整个技术发展的节奏 ， 特别像大模型 ， 它依赖于大量的数据 。 那么回到这个问题本身 ， 实际上也可以理解说 ， 或者刚才提的一个相对比较虚拟的这块发展比较快 ，因为它的整个的数据的积累是比较多的 ， 比如说互联网上它有大量的文本 ， 可以说互联网是一个文本的海洋 。

那么今天的互联网不只是文本的海洋 ，也是图片的海洋 ，也是视频的海洋 。 所以整个呢可以理解就是它的这个特色实际上跟大模型是非常匹配的 。

那实际呢有了这些数据 ，不光是说整个你的一个生成的能力 ， 那包括你对这个图片的这个理解能力 。

那今天呢其实当大家谈到多模态的时候 ， 大家也会把图生文叫多模态 ， 实际上它可能更多的也会偏向一个理解这样的一个方面 ， 像图片到文字这样的一个理解 ， 大家也能看到今天它的理解能力实际也到达了一个相当高的水准 。

包括说你发一个实物 ， 它可以给你推测出做这个实物的过程 ， 这个东西如果和之前去比 ， 还是一个非常明显的一个进步 。

所以整个呢这一块都在一个高速的发展 。 那回到这个物理世界 ， 我觉得就是说物理世界今年它的一个限制是在很多情况下它需要语音硬件 。

那比如说刚才你提到机器人， 就是我个人的观点会认为硬件是机器人发展非常大的一个约束 ，在过去和目前甚至是在未来 。

啊 ， 那这个硬件如果我们去看我们人类 ， 就是我们其实耗能是非常低的 ， 我们在一个就是非常低的耗能 ， 通过补充食物 ， 然后我们能够去做各种各样的运动去来支撑 。

那今天整个能量的消耗实际是一个相对啊在不那么高的能量消耗下是一个事情嘛 。 那去看今天的硬件 ， 它实际上需要非常比较耗电 ， 相当的耗电 。

然后呢这是一个方面 ， 对能源的消耗 。 另一个方面就是今天的硬件 ， 它的自由度它也会受限 。 举个例子 ， 如果我们去看我们的人， 看我们的一个手 ， 那整个手上的关节能动的部分 ， 包括肌肉呢 ， 它其实有相当多的自由度 。

就像我刚才去提的这个人， 它的面部 ， 就当我们看到现在即使是人形机器人， 我们去讲话的时候 ， 那它整个面部都是很僵硬的 。

所以呢就是说硬件的发展 ， 包括硬件参数的自由度 ， 它目前的就我个人的观点还是比较多的一个挑战 。 那要把这个硬件的水准能够达到生物界的生物这样的一个水准 ， 就是我自己还会预测这个还是有一个相当的距离 。

这是说就是我们完全的手臂去有一个人形机器人， 它甚至能够到达一个微妙微肖的人。 那即使我们去看像特斯拉的一些人形机器人， 我觉得它不在这个阶段 。

我觉得这块整个理解 ， 包括整个决策系统 ， 它的发展实际上在大模型时代是超前于它在硬件上的发展 。

所以我会认为说在这一块 ， 特别像各种复杂的机器人， 如果有个大的飞跃 ， 那么硬件还是相当重要的 。

### 世界模型变量

**曼祺** [42:09]
嗯 ， 对 ， 最后一个问题可能想问一个比较大的一个趋势啊 ，因为之前我们也反复讨论到 ，其实多模态本身是一个比较自然而然就能想到的方向 ， 然后它也是一个大家认为非常重要的未来有前进 ， 这是一个共识 。

那你觉得在这个确定的大方向中 ，在多模态非常重要的这个共识中间 ，有什么值得被关注的可能的变量和不确定性吗 ？

**薄列峰** [42:31]
就我觉得在这个多模态发展的过程中， 我觉得如果说是一个生成或者一个 simulation， 包括说 Word 的 simulation， 你比如说像 Sora， 那实际从我的角度看 ， 它是一个观察者的角色 ，因为它生成的是视频 。

那今天如果去看视频 ， 那实际上就是你可以认为啊 ， 我们的眼睛其实就是一个摄像机 ， 那我们去看我们的物理世界 ， 去记录这个物理世界 ， 那就产生了这个视频 。

那今天的这个摄像机去记录物理世界等等 ， 它都在产生这样的一个视频 。 所以从生成的这样的一个角度去考虑它 ， 我觉得确定性还是比较多的 。

我个人会认为说整个呢大模型 ， 包括说多模态在这个领域呢会有持续的一个发展和持续的一个结果 。 那么这里头不确定的因素 ， 我会觉得可能还是会回到就是说整个世界模型 Word modeling 这样的一个机制 ， 或者就是有的呢它叫 general world model。

那就说世界模型 ， 我个人认为这里头还有相当多的不确定性 。 那不确定性来自于几个方面 ， 第一个方面 ， 从我自己的认知里 ， 我觉得世界模型还是要有能力去模拟因果 。

那么纯粹的一个观察者的角度 ， 从文字来去生成视频 ， 目前的框架来看 ， 我觉得更多的还是对统计关系的一个模拟 ，而非是直接去模拟这个因果关系 。

所以我们也会看到生成的视频 ，有的时候呢它是不符合物理规律的 ， 它和物理规律呢有时候是冲突的 。

那么因果关系的 modeling 大家也在提 ，但它是一个非常复杂的一个过程 。 对于我们人在这个物理世界啊去执行因果其实非常的简单 。

举个例子 ， 我拿着一个笔 ， 我去把这个笔推一下， 它会倒掉 ， 它倒的方式啊等等。 那如果我们看这个笔为什么倒了 ， 那是因为我推了它 ， 这个因果呢也非常的清晰 。

那所以就整个在物理世界中是否因果的 modeling， 如果因果的 modeling 是一个核心 ， 怎么有一个高效的模拟机制 ， 这个呢我觉得大家还在寻求技术的手段 。

那第二个呢我会认为是 ， 如果我们要去做世界模型 ， 那世界模型就是到底它需不需要一个 3D 化的这样的一个模型 ， 我个人觉得这还是一个变量所在 。

为什么呢 ？ 因为如果我们看我们自己的这个物理世界 ， 那每一个物体 、 每一个人 ，他是有实实在在的物质的存在啊 ，有这样的一个物质的模型 。

那么就是说这样的一个物质化的模型啊 ， 如果我们看这个模型啊 ， 它确实不是 image 上的 pixel。

**曼祺** [45:09]
它确实不是什么 ？

**薄列峰** [45:10]
就它不是图像上的那么一个 pixel， 就是一个像素点 。

**曼祺** [45:14]
哦 ，不是一个 pixel。 嗯 。

**薄列峰** [45:17]
就图像上的一个像素点 ， 它是在我们今天电脑上的一个 LED 的一个点 。 但是你如果看物理世界上的一个物体 ， 比如说你的影子对不对 ， 那它是有真正的物质存在的 。

它成像的我们这个大脑里头 ， 它实际是有光照在它的上面 ， 对吧 ， 它做了成像 。 那今天如果没有光啊 ， 就是把光去掉 ， 那我们的眼睛能看到的就是黑暗的一片物理世界 ， 对吧 。

所以这也是我刚才说的 ， 视频这个实际上多多少少如果视频生成更多的还是从观察者的角度 。

那么就是一个可以要去思考的问题 ， 就是说我如果没有这个物理世界的每一个物体的显示表达 ， 我是否能够去找到一个路径 ， 能去做通用的世界模型 ， 就是包括有因果 ， 包括能模拟物体之间的物理上的关系 ， 同时以一个几乎不出错的一个概率 。

这个呢我个人觉得也是要去思考和突破的变量 。 那今天可能大家会从没有这样的一个实体的物体的模型出发去做工作啊 ，有的可能会从有这样的一个实体模型的思路去做工作 。

真正在这个方向上生出 ， 我觉得也还需要时间来去让我们把这件事看得更清楚 。

**曼祺** [46:32]
有实体模型的方法是什么方法了 ？ 这个可能描述起来有点抽象 ，因为没有实体 ， 那我理解就是我的输入的数据就是视频或者图片类的数据 ， 对吧 ？

它其实就是您刚说的就是像素 ， 就是二维矩阵什么之类的东西 。 那您说的有实体的那个模型 ， 那它应该输入什么数据了 ？

还是它都不是现在这个流程了 ？

**薄列峰** [46:51]
这是很好的问题啊 。 我觉得今天即使所谓有实体的模型 ， 它其实也是一个假话 。 比如说在我比较熟知的 3D 视觉里 ， 那它对物体的表达会有几何的形状 ，不只是它的这个纹理的点等等。

它可能也不能称之为有实体的模型 ，因为呢它也是对实体的一个几何的简化的在计算技术 。 那我说的有实体的模型 ， 那可能今天就需要我们真正去做出一个机器人 ，并且它能够去跟物理世界交互 ，并且它能在这个和物理世界的交互的过程中去做学习 ， 然后呢最终呢它能像我们的人一样去完成和物理世界的交互等等这样的工作 。

啊 ，不是以一个 passive 的为由 ， 是一个主动的为由 ， 从主动的方式 ， 从自己的这整个角度去规划的这样的一个事情 。

**曼祺** [47:43]
所以您设想的这个方法里面 ， 它的这个数据其实是一种表达这个机器在和世界交互的行为的数据 。

**薄列峰** [47:52]
对 ， 就是用比如说机器人， 当然我刚才提到现在机器人的就是各种精度其实还不够 ， 那可以理解为我可能是用一个机器人， 就像我们今天真人一样去和世界交互 ， 通过这个交互完成了整个物理规律 ， 包括物理世界 ， 包括各种各样的学习 。

**曼祺** [48:08]
对 ， 这个东西我觉得那确实可能是很下一步的东西 。 我不知道现在大家怎么去标定一个机器人的行为啊 ， 它可能是关节的自由度或者什么之类的一组东西给它弄出来 ，但那个显然就像您说的是一个非常简化的东西啊 ， 它肯定是精度不够的 。

这个问题挺有意思的 。

**薄列峰** [48:24]
所以它是变量 ，但是我们要向下一步去进化 。

**曼祺** [48:28]
就您觉得在世界模型怎么实现上是有一个很多的不确定性和可以探索的空间的 。

**薄列峰** [48:33]
对 ， 我觉得还是非常早期的阶段 。

**曼祺** [48:35]
对 ， 我就想说那这个事讨论的再科幻一点的话 ， 那人类如果实现世界模型 ， 那是你可以怎么样生成一个世界吗 ？

你可以干嘛了 ？

**薄列峰** [48:44]
对 ， 这个我倒认为两个角度 ， 就世界模型你去 create 一个世界 ， 就不代表说我们就有一个方式来去和这个世界交互 ， 这个可能是两个方向 。

比如说现在的视频生成 ， 那我其实是能 create 非常真实的一个世界的 ， 一个看似具备各种物理元素的虚拟世界 ，但是呢我们并没有一个有实体的 ， 比如说机器人的智能体 ， 对吧 ， 可以在这个虚拟世界中去交互 。

那么这是一个方向 ， 它其实更多的是在视觉上的创造等等 ， 当然也包括交互 。 那另一个方向呢是我去能做出一个物理性的智能体 ， 它今天其实更像刚才提到机器人， 它今天能够跟物理世界以一个人一样的方式去交互 ， 它不只是说今天就是经过我们自己的学习能跟人一样去做交互 ， 它甚至能像人一样就从婴儿 ， 从它的出生阶段去成长到更成熟的阶

段 ， 甚至能像这样子去学习 。在这个过程可能我才会认为它就是更接近于我们物理世界 ， 包括我们生物的这样的一个成长的过程 ， 包括是我们生物和物理世界交互的一个过程 。

所以就是两个观点 。 所以我也在开始提到说世界模型其实还是非常宽泛的一个方向啊 ， 就是到底要去向哪个方向去做 ， 包括说我是以仿真的方式做 ， 还是我就是有一个实体的智能体 。

我有一个实体的智能体 ， 我它的学习知识呢是我通过比如说从互联网上学到的 ， 对吧 ， 然后再灌输到它的脑海里 ， 还是说我就是要 build 一个实际的智能体 ， 它的学习过程甚至跟人不一样 ，但它学得更快 ， 更加的主动这样的一些交互 。

我觉得这些呢都还有非常多的 open question 和非常多的基础的有意思的问题来留给我们来去解决 ， 来去探索 。

**曼祺** [50:35]
嗯 ， 好 ， 今天非常谢谢薄老师的时间 ， 然后我们从最近的一些热点 ， 包括阿里在多模态上的一些进展 ， 比如说像 Animate Anyone， 还有最近引起很多讨论的 EMO 开始聊 ， 然后后面我们也聊到了关于这个多模态整个技术 ， 包括更远的世界模型 ， 未来可能会有什么样的实现方法 ， 可能会给人类带来一些什么样的变化 。

这期节目仍然是 AI 大爆炸系列中的一期 ， 感兴趣的听众可以留言和我们讨论 。 谢谢大家 ， 再见 。

**薄列峰** [51:05]
非常高兴和大家来分享我们的一些工作 ， 谢谢大家 ， 拜拜

。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
