开场0:00
世界模型最关键的两点就是 : 它对物理的模拟和它的 action 控制能力 。 这两点直接决定了它能不能预测出一个很好的未来 。
OpenAI 的话 ,他们 Sora team 重组到 robotics lab 下了 , 所以我感觉今年也是比较竞争激烈 。
就是现在这个循环里有三个部分 : 通用的 Agent、policy、 然后世界模型 。 大家都在往泛化性方面去推 , 所以说到未来某个点 , 我觉得可能就发生在今年 。
一旦它的误差累计到一个可接受的程度 , 整个循环就会变得越来越简单 , 就相当于是可以实现自进化 。
欢迎收听 《 晚点聊 》, 我是曼祺 。 今天的嘉宾是刚刚从港科大博士毕业的一位年轻研究者 , 高深远 。他从去年开始在英伟达实习 , 接下来马上会正式加入英伟达的具身智能实验室 GEAR LAB。
这次我们聊了深远 2024 年以来一直专注的方向 : 世界模型 。 前 1 个多小时, 我们展开了整个世界模型的图景 : 它的分类 、 它是为了解决什么问题 、 它的现状 、 瓶颈和未来方向 ,以及各主要公司的思路 。Solo 里有一些图示可以帮助理解 。
后一部分我们聊了 GEAR LAB 在世界模型上的一些实践 , 尤其是去年到今年, 他们陆续发布的世界模型 DreamDojo, 深远也是这个工作的联合一作 ,以及被认为有可能会取代 VLA 的 DreamZero。
我们聊了这些模型的研发历程和具体的创新点 ,也延展聊了世界模型可能的竞争情况 。 这期又有非常多的干货 , 我们一起深度学习吧 。
今天非常高兴邀请到了一位很年轻的 AI 研究者 , 高深远 。 正好是我们前段时间 《 具身季报 》 里讨论到的一个成果 , 就是英伟达去年发的 DreamDojo 的联合一作 。
深远你可以和我们的听友简单地打一个招呼 , 简单地自我介绍一下 。
感谢曼祺的邀请 。 大家好 , 我是向肯尼大学 final year 的 PhD, 我叫高深远 , 同时现在也是 Nvidia GEAR LAB 的成员 。
我自己的话 , 主要研究兴趣就是构造各种各样的世界模型 , 之前有从自动驾驶的世界模型开始做起 ,也做过这种游戏的世界模型 。
从去年开始的话 , 更关注机器人世界模型的构建以及它的应用 。
世界模型2:19
对 , 这次请深远来聊也是想聊我很久以来就想自己学习弄清楚的一个话题 , 就是世界模型 。 因为这个词也比较大 , 我觉得它算是 AI 领域一个典型的 buzzword, 就是你刚刚自己也说了好多领域 , 比如做游戏的 、 做智驾的 、 做具身的 , 可能都会提到这个 。
我觉得我们可以在第一部分先给大家一些世界模型的一个整体的图景 。 比如说你自己作为研究这个方向的人, 你会怎么来给世界模型分类 ?
现在好像很多不同的东西都装在这个大的概念里 。
对对对 , 这是一个很好的问题 。 我自己从两年前开始做世界模型 , 今年我感觉这个词尤其地受大家关注 。
现在有很多不同的 domain 都在说自己在做世界模型 , 我从上往下拆解 , 最 high level 的话 , 可能就是一部分人, 比如说他是这种决策背景的 ,他做的世界模型可能就是他有个 model 去模拟这个 world, 或者说模拟这个环境 , 所以说它叫世界模型 。
但另一部分人, 比如说他有个 model,他有 world knowledge,他就说他这是一个世界模型 。 第二个代表的可能就是现在做这些机模的 , 就是多模态大模型的 ,他们会说自己做世界模型 。
我感觉也合理 , 就是说相当于是他们有个模型 , 然后它有多模态的输入输出 , 你可以让它回答各种各样的问题 。
相当于是比如说你用各种维基百科上的问题问它 , 它基本上都知道 , 相当于是它有个 world knowledge, 它就是世界模型 。
但做决策的话 , 可能大家更关注的世界模型 , 它是这样一个 formulation, 就是它是一个预测未来状态的一个模型 , 同时这个预测未来状态的过程是受一个条件控制的 , 这个条件控制一般都是 action。
简单来说 , 它会根据过去的历史预测未来 , 同时这个预测的未来是根据你要做的 action 所决定的 。在这个方面的话 , 可能又要分个几个派别 。
可能世界模型这个词为什么热门起来 , 我感觉主要是因为这种视频生成技术的发展 。 最具有代表性的就是 Sora, 它 release 的时候有个 blog 说什么 video generation as world simulator。
相当于是你可以这么理解 , 就是它有个 model, 你可以用不同的 text 去 control 它 , 这个 text 也可以理解为一种 action, 就是对这个世界的一个编辑 , 对这个世界的一个干预 。
相当于是你根据你不同的文本的干预 , 它会得到一个未来的一个画面 , 未来的一个视频 。 假如说你给它的是一些 real world 的场景的话 , 它生成的画面也比较真 , 符合物理规律 , 所以说它是个世界的模拟器 , 我感觉这是没有问题的 。
所以说很多做 video gen 的 , 它就是说自己在做世界模型 , 我感觉这也 make sense, 就是它能够自圆其说 。 但是真正对决策有用的话 , 你光在 text 这种层面去 control 这个未来是不够的 ,因为你文本只是一些用于编辑 , 可能用于用户交互的 。
当你真正去做决策的时候 , 你输出的是比如说机器人输出的是 action, 游戏里的这种角色的话 , 它输出的也是一些动作 , 比如说技能什么的 。
像自驾的话 , 它就输出的是自车的这种轨迹 。 所以说一个对决策有用的世界模型来说的话 , 它应该是接收这种 action 轨迹的输入的 。
我想先补充问一下, 就是你刚刚说的这个 action 的话 ,其实你讲的几种不同的 , 大家都可能把它算成 action。 比如说你给它一个文本的指令 , 这也是 ; 它是车的轨迹 ,也是 ; 机器人的一个动作 ,也是 。
这个 action 它如果解释得更详细来说的话 , 就是它比如说从 AI 或者计算机科学的角度来说 , 你会怎么去描述它 ?
Action 就是对世界的一个干预 , 就是比如说你看到一个世界的状态 , 它可以是个画面 , 或者说其他的一个表示 。 你这个 action 给进去之后, 它对这个世界会产生一些影响 。
我感觉这些都可以是 action, 就比如说你文本告诉它 : 我要天上有个鸟飞过来这种 。
这个动作的主体是什么 ? 比如说我感觉在你刚说的这几种情形里 , 这个主体就不一样 。 如果是车和机器人的话 , 我理解这个东西它就在那个世界里 , 它是这个世界里的一个主体 , 对吧 ?
但是比如说像视频生成模型 , 你如果把文本也算成一个动作的话 , 那个动作并不是那个视频里的一个主体价值的动作 , 那是比如说我是个用户 , 我有点像上帝的感觉 , 我希望这个视频接下来怎么样 , 我给了它一个动作 。
这两种是要区分吗 ? 还是都是一样的 ?
我感觉这个问题其实已经非常深度了 。 一般比如说构建决策这种智能体的话 , 一般都是只关心自身 , 比如说我们讨论具身智能的话 , 一般都只关心自己的 action。
因为你一个 policy 就是一个具身本体 , 它其实很难去凭自己的意志去改变别人。 但是对于一个世界模型来说的话 , 它其实是可以接受比如说对其他 agent 的一些编辑 , 就控制他们的 action。
比如说视频生成里的话 , 它比如说它编辑的是这个环境 。 因为我觉得做一个通用智能体的话 , 首先最通用的智能体肯定是它应该是对外界无法操控的 , 可以操控外界基本上是比如说你去做一些游戏 , 你才可以操控 。
但是比如说像我们人活在这个世界中的话 , 我们能控制的其实只是自己的 action。 所以说比如说对于具身智能来说的话 , 一个最有用的世界模型 , 它应该是只接受自己的这种 action 触发的 。
但是假如说你能控制第三方的 agent 的话 , 它其实也有一些好处 , 比如说你自动驾驶的 world model, 或者说其他什么 world model, 游戏的 world model, 假如说你能控制其他的东西的话 , 相当于是你可以构造一些奇怪的这种 case。
最终的话 , 像这种 multi-agent 或者说控制环境的这种 world model, 它也是会有用的 。 但是对于通用的这种具身智能体来说的话 , 目前直接的意义还没有那么大 。
这个虽然有点扯远了 ,但是你说的这个让我想到了一个更未来的情况 。 因为现在我们可能讨论具身智能 , 更多还是讨论你一个单独的机器人, 你到了比如说一个新的环境 , 你能不能适应这个环境 , 能不能干一些比较复杂的任务 。
但如果说未来真的像比如马斯克说的 , 世界上有 100 亿台机器人 ,因为机器人之间它其实跟人不一样 , 它可以直接联网 , 对吧 ?
它可以直接通信的 。 它怎么交互又会是一个更复杂的一个世界的系统 。 这个可能跟我们刚才说的问题已经有点远了 。
对 ,但我感觉你说的这个点很好 , 包括现在不是有车联网吗 ? 我之前也研究过一段时间这种 multi-agent 的这种感知 。
机器人 、 车这种游戏智能体跟人不一样的是 , 它其实是可以通信的 。 未来就是假如说从安全或者说从决策质量的角度考虑的话 , 肯定是能通信肯定是更好的 。
这是能超越人的一点 。 所以说确实就从长远来看的话 ,multi-agent 的这种 world model 确实更有必要的 。 但从通信角度来说 , 你不能假设你把你这个机器人部署在任何环境里 , 它都可以直接跟其他 agent 通信 。
所以说从通信的角度来说 , 一个自身的一个世界模型 , 它还是最通用的 , 就跟人一样 。
对 ,其实当年自动驾驶的时候 ,因为大家最关注的路线之争 , 后来最明显的肯定是 Waymo 和特斯拉之间这个路线之争 。
但是更早的时候 ,其实在中国当时也有一个车联网的风口 。 那会儿也有很多创业的项目 , 比如说在什么路上电灯的灯柱上装很多激光雷达之类的东西 , 就是你可以通过环境去给这个车一些信号 , 让它不是就完全靠我自己适应环境 , 我环境也能给我助力 , 就类似这种 。
但确实后来我觉得最主流的还是大家去发展这个车本身单独一个车的智能 。
对 , 国内我感觉有基建的这个优势 , 当时车联网 V2X 这个确实是很火 , 包括现在可能也还在推 。
所以我觉得它可能有个先后关系吧 。
对 , 从通信角度来说还是先开发自身的这种比较好 。
四种流派9:57
我们继续可以说回这个世界模型的分类 。 你刚才讲到它还可以按派别分 , 你可以继续说这个 。
对 , 按派别的话 ,其实我感觉用表征的来进行分类会比较明显 。 就是世界模型一个是 action, 还有一个这个 condition, 它要预测的东西就是世界的状态 。
这个世界的状态它又可以有多种表征 。 首先最抽象的就可能比如说你是用一些几何表示去表示这些物体的状态 , 或者说什么点 、 图去表示这个物体的结构 。
它的好处就是说它把这个世界表示得非常简单 , 你可以非常高效地进行模拟 ,因为你只需要模拟一些可能矩阵乘法就好了 。
另外你可能也不需要很多的 data 去学习这个表征 。 但它的问题就是说它的泛化性会没有那么好 , 就是相当于是你对不同的物体 , 比如说它不同的柔性物体还是什么物体 , 你可能需要专门去定义一个这种例子的表征 。
这个之外的话 , 可能是显示的 3D 表征 , 它可能比较代表性 , 就是像李飞飞老师的她那个 World Labs, 它就是相当于是把世界重建成这种 3D 的这种表示 , 无论是点云还是高斯 splatting, 或者说 occupancy 这种可能他们不太用 ,但是可能自驾利用的会比较多 。
就是相当于是你把世界重建出来 , 每个物体它的这个位置 、 坐标你都是知道的 。 有了这个 3D 表示之后, 相当于是你可以很好地去操控这个物体 , 比如说你对它做一些移动 , 做一些这种空间位置上的编辑 , 你都会非常容易 , 它的一致性也会非常好 ,因为你已经把它重建出来了 。
所以相当于是你在这个世界里绕来绕去 , 绝对坐标还是那个坐标 , 所以说不会有一些这种遗忘 , 或者说长程这种误差累积的一些问题 。
但它坏处就是说 ,因为它有一个显示重建的这一步 ,其实我们最终用的还是一个观测 , 我们基于观测去做决策 。
所以说这种 3D 表示它最终用于观测的时候 , 它还会有这种渲染的这一步 。 所以说为了得到这种观测 , 它其实是先重建 , 重建成显示 3D 表征 , 再把 3D 表征渲染成我们能看的 , 比如说是 2D 的 video 或者说画面 。
所以说这个多阶段的这个步骤的话 , 就导致它可能就没法很好地去做这种 data driven。 首先它做这些 3D 表征 , 它需要有一些 3D 的标注才能去学这些表征 。
另外就是它不是按了 TRN 的优化的 , 所以说它受限的还是这个数据的瓶颈 。 另外就是像 Yann LeCun 他比较推的就是影空间的这种表征 , 比较有代表性的就是 JPA, 它主打的就是我不需要有显示的 3D 表征 , 可能也不是用例子这种去进行表征 , 同时也不是用 video 去作为表征 。
它就是它学一个表征空间 , 这个表征空间它会比 video 视频更加紧致 , 会更容易预测 , 就是你预测它需要更少的计算量 , 同时它是一些 high level 的一些语义信息 , 就是它跟决策是更加直接相关的 。
我感觉也合理 , 就是说有一个他很喜欢举的例子 , 反正我也借鉴一下, 就是比如说你去做决策的时候 ,其实比如说你在街上走的时候 , 你是没法精准地预测比如说每个行人的这个脸 ,而且预测出每个行人的脸 ,因为你都不认识 ,而且预测出每个行人的脸 , 对你的决策来说其实也没有什么用 , 你只需要知道那边大概模糊有一个人就行了 。
包括你到一个新的房间的时候 , 你也不可能一下子把这个房间所有的信息都预测出来 , 包括所有东西的位置都预测出来 , 你只是知道大概的一个布局 ,其实已经足够你去做决策了 。
所以它就是想把所有跟决策相关的压缩到一个影空间上, 然后在这个影空间上去做这个世界模型的预测 。
我感觉也有好处 ,但是可能有一些不太方便的 , 就是相当于是你首先要构建这么一个空间 , 影空间 , 这个影空间同时它需要跟其他的一些决策模型接起来才能用 。
所以说这个怎么去衡量 、 怎么去评测 ,以及怎么去用它 ,其实会带来更多的这种阻碍的 。 我自己比较相信的就是纯预测 video, 就是用 video 去做这个世界模型的这个表征空间 , 就是你 video 进 video 出 , 最终看到的也是 video, 它是端到端的 ,也是直接可以用这种互联网视频去作为 data 去训练的 。其实本质上来说的话 , 预测 video 其实它也不一定要求你把每个精准的
像素都预测出来 , 它只是作为一个监督 。 而且其实我们已经看到现在像这种 coding agent 的 , 包括这些 LLM, 它的预测能力肯定是比人要强的 。
所以说比如说 Yann LeCun 他的担忧可能是 , 比如说我们人做决策的时候 , 可能没法把每个像素都预测出来 ,但是可能现在的 model, 尤其是这种 video model 的话 , 它就有这个能力去把这些细节预测出来 。
而且这些细节预测它也是一个采样 , 它不是一个确定性的 , 所以说它也没有会损害这个模型决策的能力 ,其实也不冲突 。
你以重建的目标去做一个世界模型 ,其实跟决策有用性 , 包括效率 ,其实也不是很冲突 。 所以简单来说 , 最抽象的就是比如说用例子去表示 , 或者说用显示 3D 去表示 , 或者说用一个影空间去表示 。
现在最 data driven, 我个人认为最 promise 的就是用这种视觉 , 就是 video 画面去表示 world state。 我感觉这样可以分成四个主要的 world model 的派别 , 大家共同目的都是用 action control 这个预测 , 去做 decision。
视频路线15:33
你自己最相信的这个方向上面 ,是不是包括你们自己做的 DreamDojo 似的 ,Google 的那个 Genie 系列应该也是 。
对 ,因为你基于 video 的 model, 你可以很好的这种数据驱动的方式把它 scale up, 就是相当于是现在从视频出发的话 , 你本身对这个世界已经有很好的理解了 。
我觉得通往 AGI, 包括这种具身智能 , 它的思路肯定就是说你从一些数据非常多的一些 domain 开始 , 往数据比较稀缺的一些这种 domain 去做对齐 。
唯一两个目前最有代表性的数据丰富的这种空间 , 一个是语言空间 , 一个就是视频空间 。 比如说像机器人数据的话 , 比如说它有这个 action data, 它可能就是相对视频来说 , 它是一个比较稀缺的一个 domain。
所以说从视频开始去接入这个 action, 去做机器人的这个世界模型是比较合理的 。 假如说你要构造一个新的一个表征空间 , 去做世界模型的话 , 它可能就没有那么 make sense, 它可能会有一些效率上的优势 ,但是它其实跟现在的这些语言和视频的这种机模型 , 它其实就很难去直接的应用 , 直接的去接起来 , 直接去利用它们很强的这个泛化能力 。
前面提到说李飞飞世界模型那个公司 ,他们做了 Marble, 你觉得那个方式它有一个劣势 ,是它不是端到端的 。 我想补充问一下乐坤他们做的 , 就 AMI 乐坤提的 JPA 这个方式 , 它是端到端的吗 ?
我构建一个影空间 ,是不是也可以做端到端的训练 ?
对 , 它可能是端到端的 , 具体技术细节肯定大家都不知道 ,但是我觉得从他们之前的研究的脉络来看的话 , 它是一个端到端的 。
但他们有个问题就是说 ,他们要切换到一个新的影空间 , 这个影空间它不是现在的所有的这种 , 比如说 GPT、Gemini 这些模型能够直接读懂的 ,也不是现在这种 , 比如说 Sora 或者其他这种视频模型能够直接读懂的 。
反正这是我个人观点 , 假如说他们构造一个新的影空间之后的话 , 想利用其他基座模型的能力 ,他们希望把其他基座模型再往他们构造这个新的影空间上去做对齐 。
但我觉得目前来看的话 , 现在的这些语言和视频这两个表征去 , 比如说通往 AGI 已经是比较足够了 。
你觉得它那个路线至少有一个局限 , 或者说有一个限制能看见 , 就是它不能很好的受益于现在整个行业的技术的进展和红利 。
我感觉也是有希望的 , 就是他们相当于有个更高效的 , 更适合决策的一个空间 。 但是问题就在于就是说他们这个空间构造出来 , 比如说它预测出一个影空间 , 这个影空间你直接给语言模型看 , 语言模型接不上 ; 你给视频模型看 , 视频模型也接不上 。
对 , 基本上是这么一个情况 。
像在英伟达的 GearLab 的话 ,因为你说你是比较看好视频生成这个方法去实现世界模型嘛 ,在 GearLab 你们是大家都比较看好这个方向 , 还是你们也是好多不同的方向 , 就看研究员自己的兴趣 。
对 , 首先就是应该是看大家的兴趣 ,其实各种有希望的路线我们都会尝试的 。 从我的角度来看的话 , 视频首先它是一个数据非常富足的一个模态 , 它跟文本一样 , 它有很强的这种 scalability。
另外就是其实从比如说现在的技术 , 包括现在的计算 , 比如说芯片的优化来看的话 , 视觉预测它并不是一个就可能之前大家认为是会很慢的一个问题 , 它的效率也会被得到解决 。
但是影空间可能也有它的优势 , 相当于是你会更加高效 , 对于机器人来说 , 尤其是比如说你这种要部署在真机上的话 , 你可能这个效率也是一个很大的一个关心点 。
但不管怎么样 , 你学习影空间还是说你就在视频空间 , 它这个数据的来源肯定还是视频 。 你构造影空间肯定也是从视频数据中学得一个影空间 , 它一切的来源都是那个视频 。
为何火热19:36
你提到大概两三年前你开始研究世界模型这个方向 , 明显感到从去年到今年这个领域变得更火热了 , 你觉得这个是为什么呀 ?
大家看到世界模型的价值是什么 ? 用它来干嘛 ?
可能有多方面因素吧 , 最大的因素可能就是这种生成模型的发展 , 比如说尤其是 Sora, 相当于是现在的这种视频生成模型 , 它有很强的生成能力 。
有了这个生成能力之后的话 , 大家发现从一开始啥都模拟不了 , 到现在模拟这种非常高质量 、 非常逼真的这种物理规律都有可能了 。
这是大家开始关注世界模型的一个方面 。 另一方面就是数据 , 尤其是具身智能这几年火热起来之后的话 ,有很多这种数据供应商 , 包括开源数据集 。
之前相当于是比如说你要做具身智能的话 , 大家可能更关注去你去 train 一个这种决策模型 , 决策模型的话它可能只是去模仿一些这种专家轨迹 , 你就可以去得到一个决策模型 。
但世界模型它的目的是做一个世界的模拟器 , 所以说它更加吃数据 。 它不仅要有专家轨迹的数据去训练世界模型 , 还有这种差的轨迹数据 , 它也要世界模型也需要去训练 , 它才能得到一个没有这种 bias、 没有这种偏好的这种 action 的模拟 。
所以说这是之前大家数据不够的情况下, 可能得到一个 policy 是比较合理的 ,但是构造一个世界模型 , 你是得不到一个有效的一个反馈的 。
这是第二点 , 就是数据 。 第三点就是这几年这个 policy 它逐步发展之后的话 , 它已经达到一定的水平了 。
之前就比如说大家是训一些非常简单的 policy, 然后是在一个比如说实验室里去做一些简单一些任务 。 这个时候你其实也用不着世界模型 , 世界模型它其实是为了帮助 policy 做泛化 , 无论是场景的泛化还是这种 task action 的泛化 。
但你这个 policy 水平还比较低的时候 ,其实世界模型其实很难用起来 ,因为首先你世界模型没有很多 data 去得到一个非常公正的一个 action 的模拟 。
自进化循环21:42
这里的 policy 是指什么呀 ?
比如说 VLA 它就是一种 policy, 世界模型和 policy 的关系是这样的 , 世界模型它是 action 输入 , 你给它过去的 state, 它预测未来的这个世界状态 ,policy 可以跟世界模型互相交互 , 世界模型可以把它预测的这个状态给到 policy,policy 可以再做 action, 这个 action 你可以给世界模型 , 世界模型把下一个时刻的这个观测模拟出来 , 下一个时刻的观测模拟出来之后又可以给 policy,policy 再输出下一个时刻的这个 action。policy 的输出是
世界模型的输入 , 世界模型的输出是 policy 下一个时刻的输入 。
Policy 是一个模型是吗 ? 可以这么理解吗 ?
对 ,policy 可以是各种各样的模型 。
世界模型要部署到具身机器人上吗 ?
世界模型你可以部署到机器人上, 你也可以部署在云端 。
部署到云端然后把状态传给它对吧 ?
对对对 。
所以世界模型其实在大小上的限制比 policy 要更宽泛对吧 ? 你说比如 VLA 就要尽量做得小一点 ,因为你是要跑在端侧的 ,而世界模型可以在端侧 ,也可以在云端 。
VLA 你也可以部署到云端 , 这其实就是看你部署环境的这个问题 。 假如说你有一个比如说你网络很好 , 你就可以全部在云端 。
相当于 policy 到一定水平之后的话 , 它输出的这个 action 就不会那么乱了 。 假如说输出的这个 action 没有那么乱之后的话 , 你这个 world model 它需要模拟的 action 也会在一个比较窄的一个分布里面 。
所以说对 world model 来说 , 它需要模拟的这个分布更窄了 , 它就更容易模拟 , 就更容易提供更可靠的反馈 , 它就能够具备对 policy 进行优化的一些条件 。
总的来说的话 , 我感觉就是尤其是视频生成技术 , 视频数据 , 包括这个不同分布的 action 数据 。 第三点就是说现在 policy 达到一定水平之后的话 , 一方面它输出的 action 的分布比较可控了 , 另一方面就是要提升它的泛化能力的话 , 这个时候世界模型介入是一个比较好的点 。
说到这个我正好补充问一个我可能自己之前没搞清楚的事儿 ,因为这次 GearLab 发了 DreamDojo、DreamZero 这一系列的进展之后 ,其实国内有很多一些文章会写你们提了一个新的范式 , 就是世界动作模型 WAM, 大家会去把这个和 VLA 做对比 ,他们俩是对等的吗 ?WAM 它是一个策略还是一个世界模型 ?
这个也可以做一个分类 , 我们做了 DreamDojo、DreamZero 两个工作 , 你可以简单称这两个都是世界模型 ,但它们在功能上其实是有点不一样的 。WAM 的话相当于是它输入是一个 text, 就是你把当前是什么任务告诉它 , 它会预测未来的视频以及未来的这个 action。
这边叫 WAM 其实是想就是说 W 是 word,action 是它的那个决策出来的 action。WAM 其实严谨来说它不是一个 word simulator, 它其实是个 policy, 它跟 VLA 是同样的一个功能的定位 ,但它跟 VLA 不同的是 , 它不仅把 action 输出来 , 它还会把未来的 world state 输出来 。
所以说它也可以起到一个这种世界模型的作用 。 为什么呢 ? 因为最开始说世界模型的这个 action 它表征也可以是多个模态的 , 你可以是机器人轨迹 , 或者说比如说自动驾驶汽车的轨迹 , 你也可以是比如说是一个文本 , 这个文本它就是一个 instruction。
人做决策的时候其实是有很多的这种 action space 的 , 比如说你一开始去做规划的时候 , 你肯定不是想你最终这个手怎么动了 , 你肯定是想一些步骤 , 比如说先拿这个 , 举起这个 , 放下这个 。
这个其实是相当于是 high level planning, 它是在文本空间可以完成的一个决策 。 所以说假如说你把文本也当作一种 action 的话 ,WAM 它就是一个 world model, 它接收的是 text, 就文本的这种 action, 它模拟的也是这个文本 action, 它对应的这个未来的这个世界的状态 。
所以从这个意义上来说的话 ,WAM 它也是世界模型 。
所以它输出的那个世界的状态是一个文本的方式来表达的 , 所以它是又输出了这个机器人的轨迹和动作 , 同时还输出了状态 , 输出了世界的状态 。
这个其实是个组合词 ,WAM 它又是 world model, 它又有个 action, 它输出未来的状态也是视频 , 它同时会输出这个 action。
相比 world model 的话 , 它多了 action 预测的这个功能 ,以及它输入的这个 action 是一个文本的空间 。 相比 VLA 的话 , 它多了一个视频预测的功能 ,有点像它既具备在 high level action planning 下这个 world model 的功能 ,也具备 VLA 的功能 ,但平时我们会把它用作一个 policy。
所以它相当于有点是合二为一的那个意思对吧 ? 这个也是我想问的 , 就是你说你平时把它用作一个 policy, 所以它如果要放在一个机器人上去用的时候 , 它除了自己本身就输出了一个多模态的世界状态之外, 我还要用另外一个世界模型再去给它那个状态吗 ?
如果你把它作为一个策略来用的话 。
对 , 我感觉你完全理解了 , 就是 world action model 相当于是它可以做一个 policy 来用 , 你可以把它这个 action 去接给 DreamDojo 或者其他的各种这种大家常识意义上的这个 world model。world model 相当于是你给它 action, 它可以把未来的状态给你 。
所以说有了这个功能之后会有什么好处呢 ? 相当于是你执行你这个 action 之前 , 你不需要跟世界进行交互 , 你就能得到你不同 action 的这个它的后果 。
本来的话没有一个世界模型的话 , 就是必须得在现实生活中做了这个动作 , 我们才能知道它的后果 。
有了世界模型的话相当于是它能替代世界 , 我们用它去模拟各种 action 带来的后果 , 相当于是我们在真正做这个 action 之前就得到它的后果 。
所以说这个好处就是说你可以在你真正做之前 , 你先做一个 social, 可能人脑中也在发生这个事情 ,但是可能人脑会发生得很快 , 所以说几乎没感觉到 。
但实际上就是说 , 比如说你在做步骤规划的时候 , 你先用这个 DreamZero world action model, 你可以去做一个步骤上的搜索 , 相当于是每个文本的步骤它都会把这个未来的这个状态告诉你了 , 你从这边做一个选择 , 就是哪个可能是让你完成这个任务最佳的 。
你确定这个子任务之后, 同时你也得到了这个 action 的轨迹 ,但这个 action 轨迹它可能还有一些优化的空间 , 比如说你怎么去接近这个东西的速度 , 包括你怎么去抓这个东西 , 它的角度和力度 。
这个 low level 的这种 action 你又可以去给到这个 DreamDojo, 或者说其他这种更偏决策意义上的这种世界模型 , 它输入就真的是机器人的轨迹 , 它输出的是这个 world state。
相当于是你又可以用这个去做一个优化 , 做一个搜索 , 去做出最终的决策 。
核心价值28:26
对 , 这个本来也是我刚刚想追问的 ,因为你前面讲的三个点 , 一个视频生成的模型的发展 , 一个数据 , 还有一个就是策略变得更复杂 。
我觉得它是带来了说为什么最近这两年世界模型的进展比较快 , 所以做的人更多 , 它更火了 。
还有一个其实我想问的问题 , 就是它长远长期来说 , 肯定这个方向是有一个 , 比如大家老早就觉得我们应该这么做 , 这么做有价值才研究世界模型 。
你刚刚其实说了 , 就是因为它好像还是一个仿生的大的思路 , 还是模仿这个人的这种 , 或者说动物吧 ,在环境中的一个反应的方式 , 觉得我提前给一个预测会更高效 , 会让它真的能自主的去泛化对吧 ?
对 , 就是更泛化 , 更安全 。 你人其实就是比如说你闭着眼睛想想我要做什么 , 你其实能想出你要做了这个之后会变成什么样的 。
没有世界模型的话 , 所有的决策都是先不管后果 , 反正我做了就做了 。 但是有了一个世界模型的话 , 相当于是你可以在做之前你就知道它的这个后果 , 可以让你的决策更加安全 。
这其实只是一个最基本的功能 ,其实还有其他很多功能 , 比如说你可以有个世界模型之后的话 , 你可以拿它用来做评测 , 比如说你有个世界模型它能够替代真实世界 。
现在这个具身其实最大的一个问题就是评测很难 ,而且很不公平 。 很难是因为你每次都要征集部署 , 你有个人看着它 , 那个人下班了 , 你没法去测你这个模型了 。
相当于是它是受物理限制的 。 另外就是假如说你这个模型很烂的话 , 你测出来比如说它把这个盘子打碎了 , 它就打碎在那里了 。
还有一个就是不公平的问题 , 就是因为大家都只能在自己的这个房间里去测 , 比如说别人发现你一个模型过来了 。
首先现实世界里你永远没法把一个场景摆到一模一样的一个位置 , 比如说你上午测这个模型 , 下午测这个模型 , 光照不一样 , 你摆的这个位置肯定也不一样 , 包括这个机器人动一下, 它这个传感器可能有些不准了 , 校准不准了 。
所以说所有的比较永远都是不公平的 。 所以就是没有世界模型之前的话 , 评测就是一个是不高效 , 另一个就是不公平 。
但有一个世界模型的话好处就是说 , 首先你可以在世界模型里去做这个评测 ,因为世界模型它代表的就是这个世界 , 就是你 policy 跟世界模型交互 , 你就能知道这个 policy 它是怎样一个表现了 。
另一个就是说世界模型你是非常容易把这个场景重置到一个一模一样的状态的 , 你只要把那个状态告诉它 , 比如说这个状态你存在电脑上, 一模一样就能够重置好 , 这个比较就是完全公平的了 。
相当于就是拿算力去换这些高效性和公平性 。 另外就是说你还能用世界模型去做这个数据工程 , 就是别混同世界模型 。
像 DreamDojo 里它有一个比较有意思的例子 , 就是我们把世界模型做到实时之后的话 , 你可以直接去遥操这个世界模型里的机器人。
之前数据采集就比如说是我要去遥控一个真的机器人, 把这个机器人它的这个 action 录下来 , 我才有这样一个训练轨迹去训我的这个 policy。
但是假如说我有个世界模型 , 世界模型里有个机器人, 当然这个机器人是假的 , 它是跑在一个虚拟环境里的 , 你只需要去遥操这个世界模型里的这个机器人, 你就能得到这些数据 。
这个遥操的过程中间我是要带个传感器吗 ?
对 , 设备可能还是需要的 , 你本来怎么去遥操一个机器人, 你就怎么去用同样的设备 。 但好处就是说你不需要真的有那个机器人了 。
这是节省成本的一个地方 。 如果你说跟遥操设备一样的话 , 当然我感觉这设备肯定很能简化 ,因为那种最完整的遥操设备 , 你可能你的那个手臂的构型都是和那个机器人是要同构的 。
有很多现在已经简化到手套了 。
对对对 , 这个随着硬件的发展 , 遥操设备也会越来越简单吧 , 就是当这个硬件跟这个人越来越像之后 。
另一个就是现在 policy 进一步提升的话 , 它可能需要一些这种干预的数据 。 假如说你有个 policy, 你有个世界模型 , 你有遥操设备的话 , 你可以对跑在这个世界模型里的 policy 去做一个干预 , 得到这些纠正回来的轨迹去提升这个 policy。
这个世界模型非常 promising, 就是除了 policy 评测 , 数据生成 , 包括我说的就是你部署的时候 , 你做一个想象式的这种搜索 , 你还可以做这个强化学习 , 就是世界模型相当于是一个虚拟的世界 , 你在这个虚拟的世界里失败 , 它其实是非常安全 , 相当于是你可以做这种自我进化 。
比如说像 QQ 农场这种 , 就是相当于是它在一个世界模型里跑 , 你晚上睡觉 , 它晚上过了一天 , 这个东西都长出来了 。
像有个世界模型的话 , 它也是这样 , 就是现在这个机器人, 比如说它没法像大语言模型这样进化 , 或者说像 AlphaGo 这样进化 , 它最大的问题就是它会被这个物理时间限制住了 , 就一天 24 个小时 。
包括人还有上班下班 。 但是假如说你有个世界模型的话 , 你在这个里面去跑仿真 , 跑强化学习的话 , 它是可以突破物理时间限制的 。
首先你算力越快的话 , 你每天这个迭代的轮数越多 , 假如说你卡更多的话 , 它可以构造的这个环境也会更多 。
假如说世界模型它真的跟现实世界没有任何 gap 的话 , 你就可以把这个东西在比如说机器人上你去跑一个月 , 可能会涌现一些东西出来 。
当然现在还远远没有到那个阶段 ,但是我感觉这是未来一个比较 promising 的点 。
哈萨比斯就是他之前上那个 Google 的官方的博客的时候 ,他有讲过他觉得世界模型就 Genie 那个系列 ,以及他们有一个配合的东西叫 SIMA, 都是 DeepMind 搞的 。他觉得这个东西一个非常有前景的应用 , 就是我在这个模拟的世界里面去做实验 , 去搞科学发现 ,他觉得可以大大加速什么可控核聚变之类这种大家认为很难的一些科研的成果 , 这是他讲到的其中一个价值 。
不过这里也有一个问题 , 这个我之前也跟人讨论过 , 就是一个机身诞生机的问题 。 如果说世界模型能达到你刚刚说的那种程度的时候 , 我就感觉 AGI 可能都已经实现了吧 , 你可能才能模拟一个真的很像世界的世界 。
如果能达到这个水平的话 , 那是不是按你说具身智能应该在你之前就实现了 ?
对 , 我感觉你问的这两个问题都非常好 。 首先那个哈萨比斯说 , 反正我是很相信他那一套的 ,他的这个想法跟我现在的想法是非常像的 , 就是他有一个世界模型是在 Video Space,他有个通用的智能体叫 SIMA,他也其实是类似于一个 VLM 的架构 , 相当于是他们两个可以合成一个这种自我进化的一个 loop。
包括你说的第二个问题 , 就是我刚刚说就是现在还远远没有达到那个阶段 ,但是并不意味着就是我们得达到那个阶段 , 我们才可以去构造这个循环 。
它是一个循环上升的过程 , 就是现在的状况就是说我们的世界模型可能跟这种通用的 Agent 还没法完美的连起来 ,因为他们各自的这个泛化能力还没到 。
现在这个循环里有三个部分 , 一个是就是你有一个连接这个循环的一个很强的一个 , 比如说 VLM, 它的作用就是说它去定义我现在这个 Agent 要做什么 task,以及这个 world model 预测出来之后的话 , 它要去评判各种的这个 world state 是不是好 。
这个现在像 Gemini 这种基座模型 , 它其实是已经能达到一定的这个水平了 。 你把这个做什么任务去告诉这个 Agent 之后的话 , 这个 Agent 它可以做一些这种 action, 这个 action 去给这个 world model,world model 去想象未来 , 再去给这个通用的这个 Agent 去做这个评测 , 这个 loop 转起来之后的话 , 就相当于是可以实现自进化 。
现在的问题就是说这三个模型之间 , 它的泛化能力会导致一定的这个级联误差 , 就是我的这个通用的这个 Agent 它没有足够好的泛化性去提供很好的这个 reward 这个反馈 , 这个 policy 它没有足够的泛化能力去在各种场景下去做一个比较可靠的一个 action 的预测或者说 proposal。
世界模型它没法很好的在各种环境下预测出都非常逼真的这个未来 ,但是已经看到一些迹象就是说大家都在往这个泛化性方面去推 。
所以说到未来某个点 , 我觉得可能就发生在今年吧 , 就是一旦这个东西连接起来之后的话 , 这个循环一旦比如说它的误差累计到一个可接受的程度 , 一旦达到那个点的话 , 你的 policy 就会开始提升 , 整个循环就会变得越来越简单 。其实你这个 policy 一旦它变好之后的话 , 相当于是它对各种各样的场景它有更好的这个决策能力 、 泛化能力 ,
这也就意味着它可以自动的去新的这些场景里去采集一些 data 了 。 之前比如说我很难去采集更多的 data,是因为就是说我这个 policy 比如说我把它放到一个新的房间里 , 它就乱动 , 它就把东西都打坏了 , 甚至把自己的机械臂都打坏了 。
但是假如说你这个 policy 一旦到一定水平之后的话 , 它就可以在这个新的环境里它去自己的去采一些 data, 这个 data 可能是很差的 ,但没有关系 , 就是它已经在一个比较可接受的一个范围内去动了 , 这些 data 又可以去给 world model。
另外因为这些 data 是 policy 自己产生的 , 所以说它是一个自动化的 , 自动化的 data 去给世界模型之后的话 , 世界模型它有更多的 data 去学习这个物理规律以及它的这个 action 的这个控制能力 。
世界模型最关键的两点就是它对这个物理的模拟和它这个 action 控制能力 , 这两点直接决定了它能不能预测出一个很好的未来 ,以及这个未来是不是能够提供一个精准的反馈 。
总之来说就是 policy 自动的去采集更多的 data 之后的话 , 世界模型有更多的 data 去提升这两个点 , 这两个点又可以通过强化学习的方式去提升 policy。
我前面也说到就是 policy 更加提升之后的话 ,policy 越强 , 它输出的这个 action 分布其实就会越窄 , 之后的话它输出的这个就越来越合理 , 拿杯子就是拿杯子 , 比如说干什么就是干什么 , 它不会输出一些完全很抖动 、 很不合理的这些动作 。
这个对 world model 来说其实是个比较好的一个趋势 , 就是它一旦就是输出的这个 action distribution 越来越窄的话 , 你这个 world model 它实际上需要去模拟的这个 distribution 其实也是越来越窄了 。
本来你 world model 所有各种各样不合理的 action 它都要模拟才能得到一个好的 feedback, 现在是它只要聚焦在这些 policy 可能输出的这个动作空间里 , 它就够了 。
所以说对 world model 来说 , 它的压力是会越来越小 , 它压力越来越小 , 它的这个模拟能力也会更好学 , 更好学之后它的提供的 feedback 又会更准 , 对 policy 优化又更有利 , 你的 policy 又会更强 , 输出的这个 action 又会更加合理 , 又几乎不会做一些错的 action 了 。
所以说你 world model 最终只需要纠正 policy, 或者说只需要模拟 policy 很少的一些错误 , 它就能提供一个比较好的一个 feedback。 总之来说就是现在没法连起来 , 就是大家这个误差累积 , 泛化能力不够 , 导致误差累积可能还存在一些问题 , 导致只能在一些简单的 task 上去做 。
但是一旦这个循环连接起来之后的话 , 整个循环其实会变得越来越简单 、 越来越自动 , 它会呈一个飞速的一个上升 。
就你刚刚描述的是一个策略 、 世界模型 , 还有通用 Agent, 就是反正三个要素它们泛化到一定程度 , 循环跑通之后就会进入一个更快的自进化的过程 。
你刚才还说你觉得今年某个时间 ,26 年某个时间就会发生 , 你们现在已经 4 月份了吗 ? 你们是看到什么迹象了吗 ?
觉得它今年就会发生 ?
其实我感觉很多 paper, 就很多文章也在说这个事情 。
那发生了之后会怎么样了 ? 我怎么感觉这个 AI 的发展速度就越来越无法控制了 。
对 , 现在我感觉其实在一些简单的任务上, 至少我觉得已经是有信心把这个连起来了 。 首先简单任务上它会直接解决 , 这个 policy 越来越强之后的话 , 它也可以去更多的任务上去自动的去收集这个数据 。
这也是我可能对构造一个新的表征空间没有那么觉得没有那么必要的一个问题吧 。 因为现在就是智能 Agent 比如说你基于 VLM,world model 基于 video,policy 比如说像 Genie Zero 它基于这种 video backbone 有很好的泛化能力 。
你现在只要你这三个组件你都基于一些 data rich 最数据丰富的一些表征出发的话 , 它就很容易接起来 。
你会发现就是首先智能 Agent 跟这个 policy 它的这个交互是语言 ,policy 跟世界模型的交互是 action, 世界模型跟智能 Agent 的交互是 video, 这三个其实都是一个比较相对来说比较富足的一个模态 。
所以就是这三个你去提升它的泛化能力的话 , 可以很好利用现在机模的一些功能 。 我感觉是比较 promising。
谷歌现在就你刚说的那个循环 , 我能看到比如它的世界模型是 Genie, 它的 Agent 是 SIMA。在英伟达如果去对应一下的话 , 这个 loop 里的三个要素 , 你可以讲你公开发的成果都是一些什么 ?
英伟达的话我感觉就是主要 Cosmos 那边在负责做机模 , 相当于是他们那边会做 VLM 和这种视频的 foundation model。他们这些可能没有那么决策 , 主要是说就是他们可能不是直接比如说有个 action 的一个控制 , 我们还需要通过 post training 去得到这些 action 的输入输出 。
那 Cosmos 是相当于 Gemini 在做的事情 。
对 , 就是 Google DeepMind 他们研究风格其实你可以发现就是说他们很喜欢从游戏出发 。 像 Genie 3 的话 , 它其实也是这个键盘控制 , 理论上来说它这套 pipeline 可以同样都能用到机器人上 ,但是我感觉 DeepMind 它风格就是想从游戏开始验证 。
我感觉这也合理 , 就是游戏的 data 你是无限造 , 就是机器人的 data 你从造 data 就产生这个 data 的阶段来说的话 , 它就是受物理时间限制的 ,但游戏 data 就是你从造 data 这个阶段 , 它就是不受这个物理时间限制的 , 包括它验证起来也更方便 。
其实我刚想问的是 , 就 DreamDojo 它是相当于是 SIMA 吗 ? 还是 Genie 3? 它相当于 Genie 3。
SIMA 的话相当于是一个任何一个 policy。
那机器人是 SIMA?
或者说机器人的这个 policy 是 SIMA, 它控制的是游戏里的 Agent, 我们的 policy 是物理世界的 policy, 比如说 VLA, 或者说 DreamZero, 它控制的是机器人。
你们的那个具身这个语境里的那个世界模型就是 DreamDojo, 你们具身领域的那个策略是 DreamZero, 机器人你可以理解 , 你可以说它就是那个 Agent。
这个 Agent 相当于是起到一个就是连接这个 loop 循环的一个作用 , 就是它是一个我觉得就是它是一个 Gemini 那种 VLM。
它输出的是给文本 。
对 , 给文本 , 或者说去给这个 world state 去打分 。 假如说我这个 world state 是 video 的话 , 相当于是你可以直接用现有的机模去用 。
我觉得它这样对应应该是更清楚 , 它相当于那个人脑子里那个想法 , 对吧 ? 就你要干一个什么事之前 , 你肯定是有一个比较高级的规划 。
未来瓶颈43:07
你觉得现在整个就是世界模型的这个探索中间比较大的瓶颈是什么样 ? 就大家都想去突破的一些问题是什么 ?
其实很多吧 , 就是首先就是我感觉这个还是一个非常早期的一个阶段 。 对 ,其实我觉得可以这样总结 , 就是我感觉现在我感觉最值得做的是三个方向 , 第一个是它的泛化能力 , 第二个是它的这个长程的这个稳定性 , 就是你交互多轮之后, 这是 3D 世界模型的优势 , 就是你怎么交互它这个场景永远是坐标永远是不变的 ,但是生成式世界模型就会有
这个问题 , 就是它交互多轮之后就会有误差累积 。 第三点是它这个效率 ,其实后面两点我感觉还好 , 第一点泛化性我感觉是最重要 ,是决定这个世界模型能够应用的这个上限的 。
泛化性又包含两个 , 一个是就是刚刚也说了 , 就是物理理解的这个泛化性 , 另一个是这个动作控制精准性的这个泛化性 。
具体指的什么意思呢 ? 就是物理理解的这个泛化性就比较好解释 , 就是相当于是你见到一个新的场景 , 一个新的任务 , 新的物体 , 你怎么去依旧能够模拟它 。
这其实也是 DreamDojo 主要在解决的问题 。 现在我们的这个 robot 的 data, 它基本上都是比如说在我们实验室里采的 , 可能只见过一些就是我们买的这些玩具 , 比如说给它一个新的这些抹布 , 或者说你要让它倒个水瓶 。
假如说我们机器人数据里没有这个 data 的话 , 这个世界模型就不知道这个水 , 或者说这个纸质的这个东西 , 它是怎样一个东西 , 它的这个物理就很差 。
假如说这个物理很差的话 , 你把这个世界预测出来其实也没有什么意思 。 它抓个抹布像抓个实体一样 , 它模拟的越差的话 , 相当于是你很难得到很好的一个反馈 。
所以这是物理模拟 , 我们希望就是说我们的世界模型能够模拟更加 , 甚至它没见过 , 就是在机器人 data 里没有覆盖住的这些场景以及这些物体 。
假如说一旦它能模拟这些场景和物体的话 , 相当于是它也能在这些场景和物体下去给 policy 反馈了 ,policy 也能在这些场景和物体下去得到进步 。
否则你这个 policy 只能你见过的这些物体和场景下去接受 world model 反馈 , 相当于是还是没有提升 policy 的泛化能力 。
另一个就是 action 的这个泛化能力 , 这个是什么意思呢 ? 就是说你世界模型它要尽可能去公平的模拟所有的 action, 导致这个的问题原因是就是前两年大家都在研究这个 policy, 所以说大家积累的 data 都是这种专家数据 。
给 VLA 用的 data, 对吧 ?
对 , 给 VLA 用的 data。 所以说它就有个问题就是说所有的 data 都是对的 , 就是你抓个东西就是抓那个东西 , 它都干成功了 。
这对世界模型来说是个什么问题呢 ? 就是这对 policy 来说是合理的 , 就是你 policy 应该给它专家数据 , 让它去做对的事情 ,但世界模型它是一个世界模拟器 , 世界模拟器它对这个动作不应该有一个这种偏好 。
对 , 就你前面说的 , 它也得有失败的那些情况 , 它也得学 , 对吧 ? 它也得训练 。
对 , 就你给它一个抖的 , 它就是得抖 ; 你给它一个丝滑的 , 它就是得丝滑 。 对 , 假如说因为现在所有都是专家数据 , 所以说现在世界模型主要见过的 training data, 它也是这种专家数据 , 所以说它就会有个情况就是说它没法泛化到这些差的这种 action。
它给它一个差的 action, 比如说它本来抓这个东西抓偏了 ,但是因为它没见过抓偏的这种 data, 所以说它怎么控制它 , 它都是抓上去的 。
这样的话你就是其实没有得到一个反馈 , 就相当于是你无论是抓偏还是抓对 , 你把这个 action 给世界模型 , 它都给你生成一个抓对的 。
对 , 所以说这样就没有得到一个区分度的反馈 。 不过这个也比较好解决 , 就是首先来说这个不是最终的一个瓶颈 ,因为现在 policy 已经达到一定水平了 , 就我刚刚一直在说的 , 它一定具备了一些自动采集的能力 , 就是你可以比如说你用 policy 自动的让它去做一些东西 , 它采集这些数据 , 这个数据就是 policy 可能会输出的一些动作 。
世界模型要有用的话 , 它并不是需要模拟整个动作空间 , 它只需要模拟 policy 可能输出的这个动作空间就好了 。
对 ,policy 越好的话 , 这个空间就越窄 。 所以说比如说最终你这个 policy 很强的话 ,其实世界模型它可能接收到的输入也都是这种几乎是专家数据了 。
对 , 所以说就是模拟这个其实也会越来越简单 。 对 ,但是现阶段要跟 policy 接上的话 ,因为 policy 还比较差 , 所以说你这个世界模型应该比较无偏的去模拟一些 , 就是公正的去模拟一些不同的这种 action。
对 ,DreamDojo 的话相当于是用人类 data, 人类 data 因为有很多这种随便的动作 , 所以说它就包含了一个更大的这种 action 的分布 。
所以说你通过这个人类 data, 你也可以去让 world model 见过更多的这种 action, 让它去模拟一些失败的这种 action 的时候 ,也能够更加的控制力 ,也更加精准 。
对 , 总之就是控制力的泛化和这个物理模拟的这个泛化 , 这两点的泛化都能让这个模型的这个预测 ,以及它预测跟你输入这个 action 的这个对应性更加精准 。
更加精准之后的话 , 它给的反馈也更加精准 , 相当于是也能更好的去提升 policy。
那你说这三个方向就是要研究的方向 , 泛化我理解其实就是你前面说的 , 靠那个循环 , 它如果接在一起之后, 这里面的几个要素就是 policy 和世界模型都能提升 , 对吧 ?
对 。
你后面还提了两个方向 , 一个是长程的就比较复杂的那种任务 , 还有一个是效率 。 这两个事是它在就比如优先级上, 它是在泛化的后面吗 ?
就比如它可能是后面慢慢自然就能解决的 , 还是一个什么情况 ? 以及大家业界有什么努力 ?
对 , 我感觉这两点就是好处就是说它跟现在这种视频生成的需求可能是对齐的 。 视频生成现在不是大家要去生成电影了吗 ?
开始 , 所以说大家会解决这个误差累积 , 包括这个效率的这个问题 。 对 , 这两个我感觉就是不是限制 policy 提升的一个主要的一个瓶颈 。
不过长程也是很重要的 , 就相当于是现在可能大家关注的都是一些短程的任务 , 就比如说对应可能 1.5 秒的瞬时的决策 , 让 world model 去模拟一下, 就给个反馈了 。
但最终机器人通用机器人要做的 , 它都是那些很长程的任务 。 假如说你有个世界模型 , 它能够有长程的这个模拟 , 包括它有一个记忆功能的话 , 它对这种长程 policy 的训练也是有帮助的 。
对 ,但现在可能没有到那个阶段 。
你可以举个长程任务的典型的例子吗 ? 你可以举个比较难的例子 。
就有很多需要长程的 , 一个是长程的稳定性 , 一个是长程的这个记忆 。 对 , 就比如说你把一个东西放到一个柜子里 , 你关上了 , 待会你又拿出来 。
就假如说你没有一个记忆的话 , 就是你关上之后完全忘了这个东西在这个房间里的哪里 , 或者说你再打开那个门的时候 , 那个东西就不在了 。
现在这些世界模型 , 包括 DreamDojo, 它就是它没有这种长程的记忆 。 就比如说你把一个东西放到一个柜子里 , 让这个世界模型去生成 , 你把这个东西合上了 , 打开的时候那个东西在不在完全是一个随机猜的了 。
这对 policy 决策来说是个很灾难的东西 , 就是因为它得不到一个可靠的一个世界的预测 ,也就意味着说它得不到一个可靠的一个反馈 , 相当于是它得到的这个反馈都是一些 random 的一些信号 。
因为很多人认为未来家庭服务肯定是具身最大的一个场景 。 那如果说机器人要真的像一个人类的管家 , 或者说一个真人那样 , 比如说我知道家里的某个碗 , 比如给小孩用的这个碗 , 它是放在柜子里的什么地方的 ,而且我一直都知道 , 就离这种能力会有多远 。
包括比如说我拆快递 , 我要用某个剪刀 , 我剪那个吃的东西 , 我可能用是另一个剪刀 , 它放在不同的地方 ,因为对我们自己来说肯定我都知道放在哪 。
我偶尔会忘 ,但我大概也能找到 。 这种机器人什么时候能掌握了 ? 它可能是跨越好长时间的这种记忆 , 还是说这不要靠机器人自己的记忆来解决 ,而是我把家里的很多信息接收 。
这个可能具身的 research 可能没有那么关注 ,是因为这个其实跟这种大模型的 , 比如说像 Gemini 或者说 Claude, 它这种技术是共通的 。
首先这个东西可能在文本空间中会更合理 , 就是你不用视频去做 ,因为视频的话它容易度特别高 , 所以说你要记这些东西会很复杂 。
像这些抽象的这种位置 , 或者大概的位置 , 你用一个文本 , 或者说你构造这种大语言模型 , 它的 context 都很长 , 所以说我感觉就不是很大的一个问题 。
具身它更关注什么呢 ? 具身更关注就是具体在做一个任务的时候 , 你已经确定你现在这个任务是什么了 , 你要怎么去把它变成一个成功率很高的这个 action。
这个是这种像做 robotics 的人可能会现在会更加关注的 。
在你说的这三分钟之外, 我自己有个比较好奇的问题 , 就是世界模型现在怎么来做测评 ,以及这个领域有没有一些比较公认的 benchmark?
因为你前面说到就世界模型有一个价值 , 就是去测评具身智能的模型 , 对吧 ? 那另一方面怎么来测世界模型 ?
这个其实是世界模型最大的一个痛点 , 就是你去读论文的话 , 你会发现就是说所有的论文它自己都搞一个 benchmark 去测 , 就是它可能比较的也是只有个别几个模型 。
为什么会有这个问题呢 ? 我感觉其实最主要的问题就是世界模型没法 zero shot, 或者说世界模型它输入不是有个 action, 受这个 action 控制去预测未来的 state, 这个 action 它肯定是跟你用的这个机器人绑定的 。
就比如说你用宇树的机器人, 它是多少个自由度 , 你比如说你用星海图的机器人, 它是多少个自由度 , 它都是不一样的 。
对 , 所以说你一个世界模型它就对应一个这个机器人本体 。 为什么像大语言模型 , 或者说视频生成模型 ,其他这种模型它都能够有个公开的这种 benchmark 很好去比较 ,是因为就是首先世界模型都是 zero shot, 另外就是它的这个输入输出空间天然就是统一的 。
就语言模型的话 , 它输入输出都是语言 , 就是这个没有任何的 gap, 相当于是你把任何一个语言模型你强行问它问题 , 它输出的都是语言这个空间 。
像视频生成的话 , 相当于是你就是用文本给它 , 你让它输出这个视频 ,也是天然就是统一的 , 就是没有任何的 gap。
对 ,但是放到机器人里头的话 , 问题就是说大家都在用不同的机器人, 不同的这个 action space, 所以说什么时候能有个公平的 benchmark 呢 ?
就要么就是说我有个世界模型 , 它所有的机器人, 或者说很多机器人它都能 zero shot, 就是它各种机器人的 action space 它接进来 , 它都能够就直接控制这个世界模型 , 大家都能直接去用来测 ; 要么就是说所有的 research 团队 , 或者说所有的大家都收敛到一个机器人了 , 这样的话也就不存在这个每个人都在用不同 action space 的一个问题了 。
所以就是要么就是你有个很强的世界模型 , 它所有的 action space 它都掌握了 , 要么就是所有的人都开始用同一个机器人了 。
不过那个我感觉到那个阶段的话 , 已经是世界模型很强的一个阶段 。 对 , 所以现在大家就还是就是为了比较的话 , 就是自己会把不同的世界模型训练成自己机器人本体的那个 action space, 去做一个评测 。
所以就是跟大语言模型的问题就是说大家要评测世界模型 , 必须把其他比如说其他团队的世界模型拿过来自己再去 train 一遍 , 这个代价就是比较高 。
所以说大家只能比有限的世界模型在有限的这个 benchmark 上, 大语言模型相当于是你直接拿过来就调 API, 你就直接能测了 。
所以说你可以测一个超级大的表 。
那大家业界怎么评估 ? 如果都在做就是这种机器人世界决策模型的话 , 谁做得好 ?
就没有一个直接的一个评估了 , 就指标上其实没法看 , 大家基本都是拿过来自己试一下 。 一个是这个 action space 不同 , 另一个就是它观测的这个也不同 。
就是比如说你大家都用宇树的机器人,action space 是一样的 ,但你训出来的世界模型可能也是不一样 , 就是因为比如说有的人把 camera 装在这 ,有的人比如说把这个宇树的头拔掉 , 然后装个脖子上装个这种相机 。
对 , 就是它这个相机不一样 ,其实也是很影响这个世界模型的这个就是 zero shot 的能力 。
这你说到这个我想到一个问题 , 就是我觉得世界模型领域的创业 , 那可能对投资人来说就更难判断了 。
哪怕你是搞这个研究的 , 你也比较难判断别人做怎么样 , 对吧 ? 那何况你还不是专门搞这个 。
所以就是现在我感觉还是一个比较早期吧 , 就是相当于是你只能试有限的一些模型 , 你大概有个感觉 , 就是哪些组可能做出来的是比较好的 。
各家布局55:28
那你可以讲讲就是业界认为做的还比较好的吗 ? 你自己的感觉吧 。
首先学界有很多组在做 ,因为就是我感觉这个还是一个比较早期的阶段 , 所以说有很多这种 research 的问题可以让学界的高校去做 。其实大厂的话比较旗帜鲜明的做世界模型 , 首先就是 Nvidia, 另外比如说 LeCoun 的这个 AMI 叫 ARMI, 对 , 它们是做影空间的这个世界模型 。
对 , 它其实也是为了决策 ,但它们其实现阶段主要是为了做一个新的表征 。 像李飞飞老师他们做的那个 World Labs, 它们可能更多是为了去做游戏 , 就是它们用显示的 3D 表征去做游戏是有优势的 , 包括做自驾可能也是有优势的 。
对 ,但是对这种机器人来说的话 , 可能还是 video 会更好 。 另一个我其实就之前也关注很多的 , 就是英国有个自动驾驶公司叫 WAVE, 做了一系列叫 Gaia 的世界模型 , 有个大佬叫那个 Anthony Wu 好像 , 反正他加入了一个大 lab 叫 General Intuition,他们也是做游戏的世界模型 , 就是它们的 story 是就是疫情期间大家都在家玩游戏 , 攒了很多游戏数据 。
就游戏它是可以突破这个时间限制的 , 就物理时间限制 , 所以说游戏数据它攒得很快 。 同时我们人就是在创作这些游戏的时候 ,其实也加入了很多这种 3D 的这种知识 , 它对训练一个决策智能体来说的话 ,其实也是有用的 。
我们团队之前也做过一个工作叫 NaturalGen, 就是相当于是我们把我们这个机器人的 VLA, 我们去训练一个游戏的一个 VLA, 游戏的一个 policy 也非常的有用 。
对 , 所以说反过来也是一样 , 就是说你在游戏里学到的这些决策知识 ,其实跟你在现实生活中去做决策可能也是很像的 。
对 , 所以说你在游戏里 , 首先它 data 它是突破这个物理限制的 , 就是它造 data 会比机器人攒这个 data 更容易 。
你在这个游戏里去做世界模型 , 去做 policy 的这个验证的话 , 可能也是个比较不错的路线 。 对 ,不过它们目前没有什么公开的模型放出来 ,但是我感觉它们那个公司的这个脉络和布局 , 我感觉是我个人也是比较喜欢的 。
对 , 最牛逼的 ,而且我自己最想也很愿意 follow 的就是 Google DeepMind, 对 , 就是它们 Genie 3, 包括 SIMA, 就是它们就很典型 , 就是所有的东西都往基模上去 align, 就是比如说你 Agent 就往它们的 Gemini 上去对齐 , 你 VLA 也可以往 Gemini 上去对齐 , 包括你世界模型就从它们的 VEO, 就 VEO 相当于是 DeepMind 的 Sora, 就是它们最好的这个视频模型 , 你永远都是把 action 数据 , 决策数据去往这些大的 , 就是
data rich 的这些两个模态上去对齐 , 继承这些模态它很好的这个泛化能力 , 去形成一个这种自我进化的一个 loop,在游戏里先验证 。
我感觉这是它们的思路 。 对 。
OpenAI 和 Anthropic 在去探索这个世界模型和 Agent 和 policy 的自进化上是做了些什么工作吗 ?Anthropic 可能比较少 , 我不知道 OpenAI 有没有 。
Anthropic 比较少 ,OpenAI 的话它们 Sora team 不是解散了吗 ? 也不叫解散 , 它们 Sora team 重组到 robotics lab 下了 , 所以我感觉今年也是比较竞争激烈 。
你可以看到就是它们 Sora 团队就是业务停了 ,但是合并到那个 robotics 组了 。
OpenAI 的 robotics 现在有多少人 ? 它算是一个大力投入的方向 , 还是只是试一试 , 比如说可能有人想做就去做 ?
就它们很早期有就 robotics 有很多 demo 出来 , 从我知道的一些信息来看的话 ,GPT 成为它们主线之后, 可能就没有那么推 ,但感觉最近好像又在 seriously 搞这个事情了 。
对 , 就是尤其是把 Sora 重组过去之后的话 , 我觉得它们可能是要在世界模型上去做出一些东西出来 。
你觉得 Anthropic 不做这个方向会是一个 miss 吗 ? 还是无所谓了 , 它反正把自己聚焦的那块搞得足够强就可以了 ?
现在 OpenAI 压力也挺大的 。
对 , 首先不会 miss 吧 , 就是我感觉你能统治整个比如说虚拟世界的这种 Agent 已经是很强了 。 首先做这种 robotics, 或者说往大了说叫 physical AGI, 就是你去做一个通用的智能体 , 我感觉有两种路线 , 一种就是你现在就可以去碰机器人, 碰 robot data, 相当于是我做 robot 的世界模型 , 我做 robot 的 policy。
对 , 这可能是现在大多数浮出来的 startup, 包括比如说像我们大家都在做的 。 另一种路线就是说我觉得像国内的自己 ARMI, 包括 Anthropic, 我不知道会不会 , 假如说它们投入 robotics 的话 , 可能也是这种思路 , 就是我首先得有个很强的这种 Agent, 它看各种图 , 就是它解决各种虚拟的 task。
这个虚拟 task 其实也包含多模态了 , 已经包含了就是像图 , 像文本 , 视频这种 , 就是刚刚说的两个最 data rich 的模态其实也已经包含了 。
所以说它们的路线可能就是相当于是我先搞一个很强的基模 , 它们其实也可以叫自己一个世界模型 ,因为它有很多 word knowledge。
假如说你把这种文本作为 action 的话 , 它其实也能做出我刚刚说的像这种 text action condition 下这种 word model 这种效果 , 就是做具身解决 physical AGI 有两种路线 , 一种就是现在就开始碰 robot data, 另一种就是我先把这个基模解决了 , 基模解决之后我有很强的表征 , 解决 robot 它就是最后一步的事情 。
我感觉这两个两条路线都 make sense, 就是我们为什么要用 DreamZero 去做这种 policy, 去改变之前 VLA 的这个格局 ,其实我们发现就是说这种视觉模态跟 action 其实有很强的这个对齐功能的 。
所以说假如说你这些基模像 Anthropic 或者说 AMI, 或者说像自结它们去推进这种基模的进展 , 最终再去 solve 这个 robotics 的话 , 我感觉也是有可能的 。
在你最看好的这种做 physical AI 里的世界模型的这个路线去 , 这种 video based 的这个路线里面 , 你觉得谁是最有可能做成的呀 ?
这个问题有一个背景 , 就我之前就是具身季报那一期跟 Arfis 就 Peter 陈哲聊 , 就是他觉得如果在这个路线上, 那谁能把这个视频生成模型做好就很关键 。
然后他说这个东西可能会非常吃数据和算力 , 至少目前来看 , 真的把这个事做的暂时领先的 Google, 自结 , 还有快手 ,其实都是有很多视频数据的公司 。
虽然我不知道它们是不是直接能用 , 可能有一些合规的问题 。
对 , 首先就是做好世界模型 , 尤其是视频的这种世界模型 , 你的基座模型肯定得足够强 。 另外就是现在其实我感觉做视频生成的基模其实也有点分叉了 , 就是现在开始做电影级别的生成了 , 电影级别相当于是你可以把这些分镜也做进去 , 比如说可能像快手这些 , 我具体细节不知道 , 就是我大概的感觉就是可能它们做的这个视频基模可能就
, 当然它们也可以学到非常通用的物理规律 ,但是它们这个接下来它们调整的这个 distribution 是不是对这个 robotics 决策非常具体的这个方向有用 , 我觉得其实也不一定 。
对 , 就是假如说你去做这个电影级别的生成的话 ,但总之来说就是我感觉赢家还是就是这种你得有个很强的一个基座模型 。
像 NV 的话 , 它可能就是推这个开源路线 , 所以说就是像 startup 就可以用这些开源的模型直接去做 。
加入 GEAR1:02:44
OK, 前面是聊了就是世界模型的一些大的脉络 , 中间有一些地方我们也进入了细节 。 那接下来可以展开聊聊就是你们最近的成果 , 就是前面其实也反复提到的 DreamDojo、DreamZero 等等。
我也看了下就是你之前发的那些论文 , 从 24 年到 26 年其实你一直都陆续有一些世界模型的成果在释放 。
更早的时候是在上海 AI Lab 做那个 GenAD, 那时候自动驾驶领域有关的 , 到最近这一两年都是和具身相关的 。
你可以自己讲讲就是你自己的大概研究的变化吧 , 到了 DreamDojo、DreamZero 这块是主要在关注和解决一些什么问题 。
我可能是大概 23 年下半年开始做这个世界模型 , 一开始在自动驾驶世界模型做 。 说来话长 , 就是一开始是做这个 multi-agent 感知 ,也是当时比如说车联网 VTX 比较热门 , 那会儿就是 diffusion 就是这种图片生成发展很快 。
对 ,multi-agent 它最大的问题就是说大部分 data 都是 single-agent 的 , 所以说你 multi-agent 的 data 很稀缺 。 我当时就开始用这种图片生成的技术去做这种 multi-agent 的数据生成 。
后来特斯拉它出了一个世界模型 , 当时就是想就是既然都是用生成的技术去做这种自动驾驶的数据生成 , 那为什么我不去做这个世界模型呢 ?
从通用性角度来说 , 一开始也说了就是还是单个 agent 它决策模型 , 包括它的这个世界模型更加的通用 。
对 , 所以说当时就是觉得做这个通用的单 agent 的这种自驾的世界模型 , 它会更加的有意思 。 当时学界的问题就是说大家都是在用一个公开的一个数据集 , 它可能就是 5 个小时吧 , 只是在新加坡采集的那种 。
你基于这个数据集的话 , 它其实就没法去很好的去模拟比如说其他城市其他场景的这个世界模型 。 但世界模型尤其是 video world model, 它的精髓就在于它可以吃下所有的这些视频 , 同时它可以就是完全靠数据驱动的方式去提升它的这个泛化能力 。
所以说就是当时我们就比较大胆 , 就是从 YouTube 上去搞了一批数据 , 整个开源社区里应该是第一个去做这个事情 , 就是用一个互联网的自动驾驶的视频数据去训练一个世界模型 。
做了一个 GenAD, 主要搞了这个视频数据 , 就训出了一个比较泛化的一个世界模型 。 后面第二个工作是那个 Vista,Vista 就是基于那个视频数据集 , 想怎么把它这个物理的这个质量以及它这个 action control 的这个模态做得更加丰满 。
总之就是世界模型它的我最关注的点就是一个是它生成的这个质量 , 另一个就是它这个 control 的精准度以及它的这个各种各样的模态 , 这是 Vista 在推的 。
后来我发现在学界继续做这个自动驾驶世界模型没有特别大的意思 。 工业界的话 , 它们有很多这种高质量的视频 , 假如说我在学界继续做的话 , 就是我得从 YouTube 上去搞这些数据 , 它其实就是一个天然的劣势 。
我尤其是像 GenAD、Vista,有很多要解决这个怎么处理这个 YouTube 视频的这个问题 , 比如说怎么这个视频下下来 , 我怎么去处理 , 怎么去给它比如说标上一个 action label,但对车企来说这些都不是问题 。
但首先就是我们这个还是比较大胆的 , 就是第一个从 YouTube 上去搞这个视频 , 搞这个数据去 train 这个世界模型 。
当时可能业界都还没有开始做 , 假如说业界它知道世界模型很有用 , 很 promising 的话 , 它做这个事情是更加简单的 。
我这里是指车企 。
但特斯拉那个世界模型是在你们之前发的 , 对吧 ? 它算是业界做的比较早 。
对 , 特斯拉是非常有前瞻性的 , 包括那个端到端什么的 , 就自动驾驶吧 , 我感觉整个学术界其实都是走在特斯拉后面的 。
你加入 GearLab 是 25 年 。
对 , 我其实 24 年跟它们聊过 ,25 年决定去的 。
你加入的那个一个背景就是整个 GearLab 当时也比较看重世界模型 。
对 ,而且就是包括之前很多研究方向比较契合吧 , 就是我之前有个工作叫 Add a Word,是用 Latent action, 它们 Joe Zhang、Sun Yang Ye 就是它们也搞了一个这种 Latent action 去 train 一个这种 policy。
我当时想的是就是比如说一个 Latent action 的一个 policy 是不是能跟一个 Latent action 的一个 world model 接起来 。
你可以稍微解释一下 Latent action 就是潜在动作 , 或者叫隐式动作 。
对 , 隐式动作 。 总之就是 Gene Fan 还有 Joe 的 research 这种 taste 或者说 style, 我感觉跟我比较 match。 对 , 当时也很想跟它们合作 。
那它们是看到论文就是它们就来找你了 , 还是你们之前就有过什么接触了 ?
是这样的 , 就是我 24 年的时候开会就找过 Gene Fan,但当时我是博二 , 博二的话还是想自己多发一些这种一作的这种 paper,不太想直接参加这种大的 project, 大的项目 。
对 , 所以说就没去 。 后来又是开会 , 又碰到了宇可 ,因为我今年也毕业了 , 所以说就是对这种工业界的机会也会更加的向往 。
对 , 就是从去年开始又去 intern 了 , 第一次面试过了 , 所以说第二次申请就没有面试 。
你说的开会就是开学术会议的意思 。
对 , 就第一次是在西雅图 , 第二次是在新加坡 。 我当时开会本来是去玩的 , 反正也没想就是要去找 intern,在那边逛那种论文海报的时候 , 看到了宇可 , 就回去给她发 email 说能不能第二天聊一下 。
她对我的 background 好像也比较感兴趣 , 就聊了一下 。 我说我去年其实已经过了面试 , 那就比较好 , 就直接继续合作了 。
那具体到你们这次发的这些成果 ,DreamDojo、DreamZero, 比如说是谁发起的 , 我们这个 GearLab 的人一起来做的这个 , 后来就具体做的时候 , 你是想解决什么问题 ,以及提出了一些什么新的东西 , 可以整个描述一下 。
Gear 的话是有一个 , 一个是做 policy 一条主线 , 就是 group 的 N1、N2 这种 , 另一个就是 group 的 Dreams,其实是一开始相当于是 Joe 发起的 。
对 , 之前做了一个 DreamGen 一个 paper, 就是相当于是也是用 video model 去做 backbone, 去做一个 policy。 我感觉这个顺序是这样的 , 就是你先用 video model 去做一个 word action model, 它会有比较好的泛化性 , 这个我觉得可能 2 到 3 年内能达到一个比较成熟的一个架构和训练方式 。
这个好了之后的话 , 相当于是你有一个 policy 有个很好的一个起点了 , 它泛化性也比较好了 。 这个后面的话还有一种 world model, 就是这种 DreamDojo 这种 action condition 的 world model, 就是它可以提供一个虚拟的环境 , 给 policy 提供一个这种自我进化的一个这种循环一个环境 。
对 , 这个成熟可能会更远 , 就可能需要可能 5 年的这种周期吧 , 可能会真正的去成为一个大的一个爆点 。 我自己因为之前做自驾和做游戏的这种 world model 都属于第二类 ,其实我也比较想看到就是第二类能够这种赋能什么 , 就是我对这个会更加感兴趣 。
那结合你前面说的 , 就是你说的这个环境 , 就是世界模型作为环境 , 或者说作为那个世界模拟器的这一部分 , 和 agent 和策略 , 这三个你觉得今年它们就能碰到一起 , 开始加速自进化 。
为什么这个爆点是 5 年后啊 ? 我感觉今年不就爆了吗 ? 自进化不会带来很多变化吗 ?
我感觉这个故事已经大概可以感觉比较 promising 了 ,但是现在这个我感觉这个 action condition 的 world model, 包括这个 reward model 吧 , 你怎么让它能够在任何的场景下都能够去很好的去模拟 , 去泛化 , 我感觉这个其实是需要首先是等待这个数据 , 另外就是等待这个视频基座模型的这个进步 。
所以你前面描述的那个循环 , 就是你觉得今年它是能初步的跑通 , 你们作为业内人能看到这个迹象 ,但是可能要真的变得特别有用 , 更多的人感受到 , 你觉得是需要更长时间 。
这可能就是你单个任务上, 可能能够比较好 。 对 , 就是单个任务上先跑通 , 相当于是把这个理论上的这个路线走通 , 后面可以连起来 , 去让它更多任务 , 对 , 更多场景 。
那你可以具体说 , 你就说你做的这个是动作控制的这个世界模型 , 你说你是做这个方向的 , 那你是进去之前 Gear 就在做这个 , 还是你去了之后相当于就有一个新的方向 。
因为我觉得这个会很有用 , 就是现在就比如说大家都在做一个 policy, 当然这个还有很多可以提升的 。
对 ,但 policy 之后是什么呢 ? 就是你得有一个世界模拟器 。
那相当于就是它们想做这个方向 , 看到你也在做这个 , 它们也在想这个 , 就把你招进去了 , 你就和它们的同事一起弄 。
对 , 我感觉这也是个比较好的时间点开始做这个事情 。 对 , 相当于是你 policy 已经达到一定水平了 , 你可以用 world model 去跟它接起来去做一些事情 。
因为就经过前面的讨论 , 我大概已经理解就是说 DreamDojo 是一个世界模型 , 就更靠模拟器的那个世界模型 ,DreamZero 是一个类似于把 VLA 改进了的一个策略 ,但是它里面也有世界状态 , 对吧 ?
你们把那个东西叫世界动作模型 ,是这么一个关系 。 那你可以就是再补充讲讲 , 就比如说 DreamDojo 是什么 , 比如说它输入的是什么 , 它输出的是什么 , 它现在能达到什么效果 。
对 ,DreamDojo 现在就是我们想做一个比较通用的这种世界模型的这种 pretrain。 对 , 就是相当于是我有一个预训练好的一个世界模型 , 我开源出去给大家 , 大家有一个新的一个机器人, 都能够很快的去接上我们这个世界模型 , 微调一下之后就能用起来 。
我们主要想突破的点就是它能相比之前只在单个 data set 上, 或者说有限物体有限场景下去训练出来的世界模型 , 我们能不能从人类的视频中去迁移一些这种泛化能力过来给我们的世界模型 。
对 , 就是所以说主要的这个工作内容就是怎么去让人类这种 ego-centric 的这种 video, 它这种广泛的场景和动作的这个物体的交互 , 这些知识能够迁移到我们这个世界模型上, 同时当它变成一个具体机器人的一个世界模型的时候 , 它这些泛化能力还能够得到保持 。
对 , 反正我们实验分析也证明了就是说我们这个模型它在这些新的场景和这种没有见过的物体下 ,因为人类视频中有这些数据 ,但是机器人数据中很少有这种数据 。
所以说我们把人类视频中的这些新场景和新物体迁移过来之后的话 , 它有一个比较好的一个泛化能力 , 相当于是给后面世界模型的研发提供了一个更好的一个出发点 。
另外就是还有一个进步就是我们把这个模型做到了实时 。 就之前的这个世界模型 , 要么就是它能实时 ,但是它泛化能力几乎一点都没有 , 要么就是它可能有一点泛化能力 ,但是它的这个实时性很差 。
这个其实就是很有用 , 就是首先就是你可以玩它 , 就是你可以连上遥操设备 , 你可以几乎实时的去控制它 。
对 , 另外就是你有个实时的世界模型之后的话 , 你在 policy 部署的时候 , 你可以去更快的去得到这个 , 相当于是你通过预测去得到每个 action 的后果 , 你可以在就是在部署的时候 , 你去通过世界模型去做一个搜索 , 可以去提升这个模型的这个性能 。
人类数据1:14:12
就你说的这两个进展 , 第一个你说就是可以把 ego-centric, 我理解就是第一视角的视频 , 可以把那些视频可以把它迁移到机器人上, 这个事它之前的难点在于哪 ?
就是 human ego-centric data 可能之前就是量没有那么多吧 , 相当于是我们自己去攒了很大一个数据集 ,因为这个泛化能力其实你要到一定量你才能展示出来 。
比如说我有 10 小时的这个机器人数据 , 比如说我指望它从 10 小时的人类数据中去得到一些迁移 , 那可能这个迁移效果是很微弱的 。
对 ,因为首先有个这个本体这个构型的一个 gap 在 。 另外就是这个 10 小时人类数据里包含的这个物体的这个多样性可能也比较局限 ,但当你这个比如说你这个人类数据很多了之后, 首先它物体包括包含的这个物理规律也很多 , 它可能会需要去模拟这个很好的去预测这个人类视频的话 , 你应该这个模型需要去理解一些更通用的一些 knowledge。
所以说它可能能更好的迁移到这个机器人上 。
所以这个事的难点主要就是之前数据不够是吗 ? 并不是方法是问题 。
对 , 数据不够 ,也没有人做这个事情 。
那你们这一次因为是用了大概接近 4.5 万小时的数据 , 这个 4.5 万小时定到这个量级 , 比如说是怎么知道这样可能就能看到效果 , 还是说就试到这时候就看到效果了 ?
以及你们说你们是攒了一些吗 ? 那你们是怎么获得的 ? 你们是找人带着摄像头自己去拍自己的这种第一人称的视频吗 ?
4.4 万个小时的这个数据 , 越多肯定是越好 。 我们为什么停在这个点 , 就是首先我们方法上发现 , 就是说从我们内部验证发现这个方法是通的 , 知道这个方法通了之后的话 , 我们首先假设我们不知道用户或者说开源设计会在怎样的场景下测试 , 所以说我们就尽可能引入更多的数据进来 。
就是你引入数据越多的话 , 它覆盖的这个场景就越广 。 所以说这个数量级就是我们当时我们 train 训练我们最后一版模型的时候 ,有的这个数据 , 所有的数据都用上了 , 就是这么多 。
但是其实也没有很好的去调它的分布 , 所以说我感觉假如说调它的分布的话 , 可能这个迁移能力会更好 。
对 , 反正这都是一些局限没有做的 。
在做就是这个量级的数据的过程中间 , 处理数据难吗 ?
World model 有个好处 , 就是刚刚说 policy 它是要用专家数据训练 ,但是 world model 它可以吃下任何数据 , 你即使对数据不做任何分布上的处理的话 , 你用它去训练世界模型都是合理的 。
对 , 就我们这个数据很 diverse, 就是它这个人去做一些各种各样的任务 , 我们这个数据其实也可以用来去 train policy。
就是我们还有另外一个很好的工作叫这个 ego scale, 就是它其实也是基于这批数据去做的 ,但是你会发现它用的数据可能就是没有那么多个小时 ,也做了一些 filtering, 一方面是有质量上的问题 , 另一方面就是你做一个 policy 的话 , 你希望你这个 model 可能还是尽可能是不能把所有的数据都喂给这个 policy,因为 policy 它需要学的是最优的一个决策过程 ,但世界模型的话 , 它学的是一个你各种各样动
作下你对这个世界的一个模拟 , 一个仿真 。 所以说你任何在这个现实世界里能够发生的这个数据喂给它都是对的 。
对 , 所以说就 world model 它对这个数据的质量 , 包括标注 ,其实没有什么高的要求 , 就是它只需要有 action 就好了 。
那什么时候可以用就是第三人称的视频数据来训世界模型了 ? 因为那个量就很大了 ,而且那会非常有多样性 , 它现在不能这么做的卡在哪 ?
对 , 这是个很好的问题 。 首先就是我觉得不是不能做 , 就是是可以做的 。 就是你第三人称视频它其实也在学习这个物理规律 , 只不过就是它可能跟最终的这个要用的那个视角可能差的比较大 。
我们这个模型其实是这样的 , 就是首先我们是从 NV 的这个视频的基座模型开始 , 就 Cosmos 出发 , 去做人类视频的预训练 , 再去做机器人的这个微调 。
但是因为我们是从 Cosmos 出发的 , 所以说其实在我们的人类视频预训练之前 , 你可以理解为还有一个预训练阶段 ,在这个预训练阶段它其实是有这种第三人称视频的 。
就是 Cosmos 预训练好了之后, 我们再拿 ego-centric video 去预训练 , 再去 robot data 上去微调 。Cosmos 那个预训练阶段它其实是包含了这个第三人称视角很多这种数据的 。
我们发现就是说假如说把 Cosmos 那个预训练阶段拿掉 , 就简单来说就是我们不用它们的这个预训练权重 , 直接开始我们的预训练的话 , 效果会差 。
对 , 所以说其实也说明就是说第三人称的这个数据放在第一个预训练阶段是有用的 。
那你觉得第三人称的数据视频放在第二个阶段会有必要这么干吗 ?
我感觉可以试 , 就是首先我们没有尝试过 , 我感觉就是看怎样能够让它迁移的这个物理知识最多 ,以及它不要遗忘一些更通用的一些知识 。
因为在你们第二个那个 , 就你们说的那个预训练阶段 , 就在 Cosmos 上又预训练的那个阶段 , 我理解它中间有一个需要解决的核心的问题 , 就是那个视频里的动作要迁移到机器人的那个结构上, 对吧 ?
对 , 这其实就不太合理 。 对 , 就你很难抽那个动作 。
对 , 那个第三人称的视频它能不能做这个迁移 , 如果你找到一个方法能做的话 , 我觉得它有一个好处是比较显然的 , 就是你的数据量肯定就能扩得非常大 , 就至少你可以先把互联网上已经有的数据可以先训一遍 。
只不过它有没有必要 , 还是说我在前面那个阶段 , 就 Cosmos 那个阶段我训了我就不用了 ?
我感觉首先从我直觉上来说的话 , 把第三人称那个并成一个阶段 ,是甚至就是我说的 Cosmos 那个阶段和我们这个预训练阶段并在一起 , 应该是会有一种办法让它会变得更好的 。
像 VLA 训练其实也是这样 , 就是之前比如说大家只用机器人数据去预训练 VLA, 现在也有些很多工作就是会用一些视觉问答数据去一起去预训练 。
也就是说就是它不仅让这个 VLA 去预测这种 action, 它同时也让它回答一些这种视觉问题 , 就比如说这个图片的这个标题是什么 , 它们是放在一个阶段里的 。
对 , 当然可能需要一些调 ,但是它们是放在一个阶段里的 。 所以说就是说你把这些通用的这些任务 , 通用的这些比如说视角 , 你放在一个阶段里去做一起训练的话 , 它是对这个整个模型整体的这个 general knowledge 的保持能力是有帮助的 。
我们没把它放在一个阶段里 , 首先就是主要是计算量的问题 , 假如说我们有足够的资源 , 我们完全可以这么去试 。
那我感觉应该也会有人试 。
对 , 另外就是作为一个 research 的 paper 的话 ,其实主要就是我们定一个合理的一个研究问题 , 一个实验的设计 , 用一个令人有说服力的方式把这个问题给解决 。
对 , 所以说就是没有去继续去用更多的资源去搞这个事情 。
我还有个想问的 , 就是因为你们用的是 Latent action 嘛 , 就是在这个 DreamDojo 里面 , 所以它就不用打动作标签 , 这个事是就是它在实现上有难度吗 ?
就是在现在它是一个很主流的方法 , 还是一个比较新的方法 ?
这个我感觉我应该是也是推这个方向的一个人之一 。 对 , 我觉得是这样 , 就是 DreamDojo 之前我之前还有个工作叫 AdaWorld,其实 DreamDojo 其实直白上来说的话 , 就是把 AdaWorld 的验证好的一些比较简单的想法 , 到机器人和这个人的 data 上去 scale up。
就 AdaWorld 其实做的也是类似的一个事情 , 就是我怎么比如说有很多没有标签的这个数据 , 我用 Latent action 去表示它们的 action, 我去 pretrain 一个 world model。
当时 AdaWorld 的那个工作是我是在很多的游戏视频上去做这个事情 , 当时没法去买数据 ,也没有很多这种资源 , 我就自己搞了 1000 多个游戏在那边乱跑 , 就不停的给我源源不断的生成数据 , 去用 Latent action 去抽 。
说到这个 Latent action, 它有什么性质呢 ? 就是说相当于是你可以用一种非常简单的方式 , 对所有这种没有标签的数据打上一个 action 标签 ,而且你不用考虑它是什么本体什么视角 , 它非常简单粗暴 , 它也非常符合就是你有多少 video 你就能用 Latent action 去给多少 video 打上这个标签 。
所以说它不会损失任何 video data 的这个 scalability。 对 ,但以后这个是不是值得继续研究 , 我感觉这包括作为这个方向的推动者之一吧 , 就是我感觉也打上个问号 , 就是因为现在有很多 data 大家都在提供很高精度的这种 label, 包括这个具身最终是不是一个跨本体的问题 ,其实也不一定 。
就是比如说大家最终做的越来越像人的话 , 无论是外观还是动力学上做的越来越像人的话 , 那你其实最终只需要得到一个人的一个 policy 就好了 。
所以说你是不是需要用 Latent action 表示 , 还是说你需要用人的这个比如说手的这个表示去表示它的这个 action? 对 ,其实我感觉都是值得探索的 。Latent action 就是它用最不用动脑子的方式 , 它可以用上所有没有标注的 video, 自然的不用考虑这个跨本体的一个问题 。
但假如说你有所有的数据它都有 label, 同时呢可能你这个跨本体不是一个非常大的一个痛点的话 , 我感觉 Latent action 可能就没有必要 。
对 , 就是这么一个东西 。
就是不说这个跨本体是不是一个痛点 , 我想到跨本体它是一个对动物和人来说 , 我感觉是一个比较自然的 , 比较符合反正我们的这种行动直觉的感觉 。
就是你看过 《 冰与火之歌 》 吗 ? 就里面那个布兰他不是就是异形者吗 ? 就是他可以进到狼的身体里 , 它也可以进到那个乌鸦的身体里 。其实我觉得乔治 · 马丁写的这个 《Skin Changer》, 它就很符合人想象中人能做到的事 ,其实它就是跨本体的 。
而且就真实世界中, 虽然我觉得没有人真的比如说进到狼的身体或者熊的身体 ,但有一个现象是可以观察到的 , 就有些人他因为某种原因 , 比如失去双臂之后 ,其实他用脚也可以做很精细的操作 , 就正常人做不到 ,但是有些人他因为用不了手他就能做到 。
就我感觉人是本身就有这种去适应一个新的构型的能力的 , 或者说动物吧 , 动物可能也有 。
对对对 , 就 Latent action 它是这样的 , 它是一个有噪声的 action 表示 , 就它不能很好的去描述每个具体的本体 ,但是它相比所有的本体来说的话 , 它都是一个比较好的一个媒介 , 就是你从它开始映射跟一个新的本体来说 , 一般来说是最近的 。
所以说就刚刚你说的那个例子 , 就比如说人失去双手 , 或者说人不知道哪天起来突然变成一个狼 , 对 , 就是我们可能也需要适应一下 。
但是假如说我们有一个 Latent action 作为一个这种先验的话 , 从 Latent action 出发 , 它可能是到各种各样不同 action 这个 space, 一个比较自然的一个出发点 , 或者说比较居中的一个出发点 。
但假如说你最终训练 data 到它都有 high quality 的这种 data 标注 ,以及这个 high quality 的 data 标注跟你最终要用的这个机器人本体 , 它本身就没有特别大的 gap 的话 , 你就没有必要到 Latent action 去绕一圈 。
对 , 就是差不多是这样一种感觉 。
但我感觉肯定是没有好 , 没有它更有效率 , 更省事 ,以及你能用的数据就更多 。
你说没有 Latent action 吗 ?
没有那个标签好 , 就不需要那个标签 , 我不是能用的数据就更多 。
是这样 ,但是现在有标签的数据的增长规模也达到了一个令人惊叹的一个速度 , 我觉得 。
是因为打标签很便宜吗 ?
对 , 就是你现在其实之前大家采机器人数据 , 比如说都是刻意去采 , 就是比如说我是一个实验室 , 我这个房间我搞个桌子 , 我去摆一些东西 , 我采完重置 , 采完重置 , 一天采个 100 条这样 , 自然素材的模式是这样的 。
但以后这个素材的形式肯定会变 , 就是之前我不知道哪里也看到 , 就是比如说家居 , 就是你做了这些事情的时候 , 你就可以采 data, 包括我们这些人类视频 , 就是相当于是它自己就来干活 , 它同时就把这个 data 给采了 ,而且只要它带一些外设的话 , 你就能记录一些比较高精度的 label。
对 , 就是之前素材的过程就是相当于是它本身不是在工作 , 它采集数据就是工作 ,但后面的采集就是在工作中采数据 。在工作中采数据的话 , 只要你带一些便携的这种外设的话 , 首先它不影响本来的工作 。
它也是自带标签的 。
对 , 另外就是这个数据积累会非常快 。
而且合成数据也可以自带标签 。
对 。
为什么那个就是 DreamDojo 对应的这个数据集 DreamDojo HV 还没有开放到开源社区 ? 你们接下来会有这个计划吗 ?
这个会开的吧 , 就是但是因为就是我们可能还想基于这个做一些其他的 research。
就是你们先做了其他的 research 之后再开源 。
对 , 应该会随着后面的 project 再开 。 对 。
还有一个我自己比较好奇的问题 , 就你们这次 DreamDojo 这个本体用的是傅立叶的 GR1。
对 。
就本体选择上大家现在是怎么考虑的 ? 因为我之前了解可能 G1 就是宇树的 G1, 还是最主流被用的最多的 。
你们这次是怎么想的 ?
这个其实没有什么特别的考量吧 , 就是因为就是首先我们自己之前内部有一些傅立叶 GR1 的 data, 对 ,在这个基础上去构造这个测试集是更加方便的 。
因为我问这个问题好奇的一点是说 , 就是其实就你刚才也说到了嘛 ,有一种可能就是以后本体可能会变得比较统一 , 我觉得这也是一个很好的技术或者说商业上的机会 。
那可能第一步就是你比如说大家在研究机构里面很多人会去用某一个本体 , 我就想知道研究机构去选的时候都是因为一些什么因素 。
首先就是考虑比如说各种本体的故障率 , 另外就是它易用性 ,以及大家的这个就是有多少人在用 , 就是是不是它是一个就是很受欢迎的一个本体 。
第三点就是跟比如说跟我们一些 cross embodiment data 它的这个接近程度可能也是一个比较关注的点 。 就比如说我们人类数据 , 那可能最好它就是一个灵巧手的一个本体 。
对 。
所以你们这次选这个 GR1 是因为 GR1 有灵巧手吗 ? 还是因为你刚刚说那几个因素 , 你觉得它都还可以 , 都比较好 ?
选 GR1 主要原因就是我们本身就有一些内部的 data set,在 GR1 上构建这个评测集会比较容易 。 对 , 就是并不是因为它多好 。
评测与展望1:28:41
关于就 DreamDojo 评估的方式 , 你们这个就如前面所说也没有什么公开的 benchmark, 所以你们是自己做了 6 个 benchmark。
对对 。
就你可以讲讲就是你们在评你们自己的这个进展的时候 , 就这个 DreamDojo 这个世界模型 , 你们主要是考察它的哪些能力 , 所以构建了这几个 benchmark。
首先这个世界模型目的是为了得到一个更加精准的反馈 , 得到更加精准的反馈的话 , 主要是体现在两方面 , 一个是这个预测未来的这个真实度 , 物理的合理性 , 第二个就是它被各种 action 的这个控制能力 。
对 , 我们评测主要也是从这两个维度开始的 。 对 , 相当于是把数据加上去之前 , 我们先内部用 GR1 去搞了一些这种内部的数据集 , 初步看到一些牵引能力之后的话 , 我们又用了一个开源的这种 egocentric 的 data set, 就是叫 egodex。
对 , 就是它主要是有很多种这种物体 , 我们也对应这个映射去做了一个这种对应的测试集 ,也看到了一些这种牵引能力 。
有了这两个信息之后的话 , 我们就加这个人类数据了 ,在更多的环境里 , 更多的不同的物体 , 让人类去采这些数据 。
就简单来说就是我们自己先内部数据验证 , 用开源数据集去验证它这个更多物体下它这个牵引能力依旧是成立的 。在这之后就是直接加数据 。
虽然我们是用这个 GR1 去作为主要的这个测试本体 ,但是我们最终目的是为了做一个通用的一个预训练权重给整个社区 。
对 。
所以它是跨本体的 , 对吧 ? 就别的本体上它应该也有效果 。
对 , 我们也提供了其他本体的这个实验结果 , 就是其他本体也能用 。 这就是 Latent action 的好处吧 , 就是比如说你是人类视频中学习 ,但是你比如说你这种牵引到一个假爪上, 可能也是有牵引能力的 。
我看就你们这个测试里面有很多都是关于泛化的测试嘛 , 就是这个 out of distribution, 就分布外的数据它能否去完成一些任务 。
我想问一下这个分布外是它的范围指的是什么 ? 因为你最开始有一个比如 Cosmos 的视频模型的积木 , 对吧 ?
那个里面按理说它应该是见过很多东西的 。 就它如果遇到一个情景连 Cosmos 都数据分布里都没有的话 , 它能做到吗 ?
问题是这样的 , 就是假如说你把一个积木你变成一个 action 控制的世界模型之后的话 , 它可能会损失很多这种能力 , 损失很多泛化能力 。
所以说就是我们有那个 human pretrain, 加上 Latent action 的话 , 它相当于是它更适合一个 action control 的一个世界模型在新环境下去做泛化 。
这个新环境对它是新到什么程度 ? 就比如它是在哪个阶段没见过的 , 对它就叫新环境 。
新环境其实指的就是我机器人 data 里没有见过的环境叫新环境 。 假如说把 Cosmos 也算上了 , 这三阶段 , 就是 Cosmos 训练 , 我们人类 data 训练 , 机器人 data 训练 , 我们机器人 data 里没见过新物体和新环境 , 我们就叫它是分布外 。
那你们测过它人类数据里没见过的新环境它能做吗 ? 比如它成功率或者它表现是怎样的 ?
首先我们这个人类的数据非常多 , 就是我们那个 44k 小时的这个人类数据 , 它覆盖了很多的物体 。
基本上我觉得就是我们测试集里的物体应该至少在这个数据集里都会出现过 , 或者说类似的物体 。
就其实事情是这样的 , 你像大语言模型 , 包括这种视频生成模型 , 发展到最后其实已经不存在什么分布内分布外了 。
就是一开始机器学习或者人工智能 , 可能大家比如说去解决什么分布内分布外的问题 ,但是当你发现就是你把整个互联网视频都训练进来之后的话 ,其实所有的问题它都是比如说在分布内做差值 , 它不是一个做分布外的一个事情了 。
就是一开始比如说大家会设计很多人工的一些方式 , 比如说去解决一些分布外的一些问题 。 对 ,但是通过 scaling law 之后, 可能就是所有的问题都变成了分布内的问题 。
就是最终 AGI 可能也就是这样 , 所有的问题都变成见过的问题 。 对 , 就是这样就解决了 。 对 , 所以对机器人来说它是分布外 ,但是对人类互联网视频来说的话 , 可能最终所有的物体和所有的场景它都是分布内 。
总体来说就是我们发现就是通过人类视频数据训练 , 对于机器人数据分布外的这些场景来说的话 , 它是有很好的这个泛化性的提升的 。
那你们最后这个东西是用成功率它来做一个 , 比如考察它的什么成功率稳定性这种之类的 ?
我们也会在下游上, 就是你有个世界模型之后, 你可以给 policy 提供反馈嘛 , 给 policy 能够提供反馈的话 , 相当于是你可以用 policy 的这个成功率去表示你这个世界模型的这个可靠性 。
对 , 反正我们也是有实验的 , 就是相当于是你有 policy, 你也可以用世界模型去选出更好的一个 action, 让 policy 去执行 。
如果直接看世界模型的反馈好不好 ?
就还是得跟一个 policy 一起来看 , 就是单独有个世界模型你其实做不了什么东西 。 就是世界模型它是对世界的一个模拟嘛 , 你真正要做这个机器人决策的话 , 它还是得有一个东西去出这个 action。
对 , 现在大家做法一般就是你有一个比较好的一个 policy 了 , 你用这个 policy 里你它出一些 action, 你让世界模型给它去选一个最好的 action, 这是一个最简单的用法吧 。
假如说这个世界模型它好足够好的话 , 它应该每次都能选到最好的那个 action。 对 , 假如说这个世界模型很差的话 , 那相当于是它每次都在做一个随机选择 , 那样这个 policy 其实加上一个世界模型和不加一个世界模型都差不多的成功率 。
就相当于说控制变量 , 就是你加了这个它的世界模型的反馈之后, 它的那个策略的成功率啊 , 各方面的指标应该提升 。
对对对 , 就世界模型最终的目的还是去为了提升 policy。 对 , 所以说看世界模型它的这个反馈是不是好的话 , 最终还是得跟一个 policy 结合在一起看 。
但你也可以有些中间的指标 , 就比如说你看它这个是不是跟随了你这个输入的这个 action, 包括你看它这个输出的这个未来是不是足够的真实 , 这些其实跟它这个反馈准不准直接相关的 。
对 , 所以说我们平时迭代世界模型也可以直接看这两个指标 。
你们接下来准备继续怎么去发展 DreamDojo? 可以先讲讲就现在有什么问题 , 接下来怎么去优化 。
特别细节的我就不讲了 。 从长远来看的话 , 就是我刚刚说的把那个循环建起来 , 就我感觉这是很 promising 的 。
就我感觉有两拨人吧 , 一拨人就觉得世界模型完全没有必要 , 就是我只要做 policy, 就一直做 policy 做到底 , 我有个很好的 policy 就够了 。
对 ,但是我自己觉得就是说有个世界模型的话 , 你可以做很多事情 。 从长远来看 , 我感觉最激动人心的就是你把一个自我进化的一个循环给做起来 , 就是你有个 policy, 你有个 agent 去提出一些任务和给这个 world state 进行打分 ,有个世界模型把这个 policy 到打分的这个循环给接上, 就是 policy 把 action 给世界模型 , 世界模型预测出未来 , 给这个 agent 去打分 。
对 , 这个自进化接上的话 , 相当于是你就突破了这个物理时间的这个限制吧 。 对 , 现在大家这个 physical AI 解决起来很麻烦 ,因为就是不像这种 language agent 一样 , 或者说像 AlphaGo 一样 , 它是有个虚拟世界 。
就是现在的具身智能还没有一个可以供这种具身的 policy, 像 LLM agent 那样去迭代的一个虚拟世界 。 但是后面假如说能有这样一个虚拟世界的话 , 就突破了这个 7 天 24 小时的这个限制 , 就是你可以其他的 agent 一样 , 虚拟的 agent 一样 ,也去迭代 ,也去进化 。
那你们这个优化大思路的话 , 就是会需要你们这个方向和 GearLab 里面做策略的那个团队非常紧密的合作 , 对吧 ?
对 。
就和 DreamZero 那边 。
对对 。
你们实际上人是不是也是交叉的 ?
对 , 本来也就比较小的一个 team。 对 ,不过最终什么 policy 放到我这个 loop 里来都是可以的 , 理论上来说的话 。
就理论上来说 SIMA 也可以放进来 , 就比如 Google 自己搞的一些什么 , 或者甚至什么 VLA 其实也可以放进来 。
对 , 就它们的接口是足够通用的模态 , 就 action、 文本和 video 嘛 。 对 , 只要这三个对齐的话 ,其实都是能接的 。
你刚说比较相信就是我纯做策略就可以做得很好 , 这一派的代表的公司或者说人是什么 ?
他们的思想可能也在改变吧 。 之前我看那个 ,
那个反正在采访里是这么说的 , 我感觉他们想的主要原因是就是他们觉得就是你做一个 policy, 做一个世界模型比做一个 policy 要难得多 。
你 policy 刚刚说的就是它需要的 data 是这个专家数据嘛 , 像世界模型的话 , 你不仅要模拟专家数据的这个未来 , 你还要去模拟其他这种 action 的未来 。
对 ,但我觉得就是有个问题就是说你世界模型要真正能够开始帮助 policy 的话 , 它并不需要完美 , 它是一个循环上升的一个过程 。
对 , 所以说就是我觉得就这不是一个很大的 concern。 就是世界模型它即使很 noise, 它泛化性还不够好 ,在某些 case 下它已经能够足够去提升这个 policy 了 , 随着两个模型都在提升的话 , 最终这个误差累积 , 包括它的这个反馈的准确性都会越来越好 。
如果你相信的这条路变得更主流的话 , 你觉得具身智能的创业公司 , 或者也有一些公司是专门做世界模型的这种创业公司 , 它有多大的几率能参与推动和贡献这个事情了 ?
因为听起来我觉得世界模型挺耗资源的 。 首先你处理就是视频类的数据本身就比较吃算力 , 那是不是只有大公司才更有机会去做这个事 ?
首先我感觉也没有那么让人绝望 。 首先现在数据的供应商很多 , 价格也都会通过竞争打下来 , 所以可以想象就是未来大家所有人都会有很多 data。
另外就是 GPU 和模型的这个效率也都会持续发展嘛 , 所以说最终这个也会变成一个大家都能做的事情 。
当然最终肯定还是会有几家单独胜出 , 像现在这种 LLM 的这种局面一样 , 就是可能就几家了 。 对 ,但是我觉得就是大家都是可以参与的 。
对 , 包括这个 loop 里就是其实有很多个 component, 很多个组件 , 怎么去设计一个很好的一个提供 reward 的 agent, 或者说怎么去设计一个这种就比较泛化的这种 policy 和世界模型 , 就是这个你都可以在一个合理的一个实验 setup 下去验证 。
就是你可以有自己的专长的 domain, 就比如说家居或者说其他什么的 。 对 ,在这个里面把这个 loop 构建起来 ,因为其实都是有 scaling law 的嘛 , 就是无论是 data 和 model size, 就是比如说先用基于这个 data scaling law 你去在一些小规模上去验证通 。
假如说你验证这个通是最快的话 , 我感觉你后面假如说有足够的信心把这个推到底的话 ,也是可以有很大的胜算 。
因为就是 Cosmos, 英伟达自己有一个视频生成模型 , 你们用 GEAR 那个来做训练 。 如果说这个环节是分开的 , 就是你基于一个别人做的视频生成模型 , 就先做人类数据 , 然后再做机器人数据 , 这个流程的话 , 就你自己不掌握那个视频生成模型 , 你觉得对你们的效果影响会大吗 ?
对 , 我感觉这个会有影响 。 对 , 就是相当于是你假如说你这个模型你是自己掌握的话 , 你对它的这个训练的 , 比如说它预训练的分布 , 像 NV 的 Cosmos, 它可能对机器人和自驾 , 它是天生是有一个倾向的 , 就是它会推这个 physical AI, 所以说它对机器人和自驾视频模拟的都会更好一点 。
对 , 另外的话就是假如说你有一些内部的支持的话 , 可能你继续去训练它 , 就 infra 上可能会有更多的支持吧 。
对 , 我刚这个问题其实是想到说 , 就按照你们这个流程 , 理论上来说创业公司也可以不做就 Cosmos 那一步 , 它就做你们后面做的那些事 。
那个成本就肯定比你整个链条都做会 , 我觉得可能会大幅降低 ,因为前面 Cosmos 那个部分是成本回返高的 ,但这样可能会影响它的竞争力 。
如果说 OpenAI、Google 都往这个方向投的比较多资源的话 。
对 , 就是它们会有一个延迟吧 , 就假如说不能直接去 access 到一些最强的一些预训练模型的话 。
你觉得现在 DreamDojo 的这个速度会是个问题吗 ? 我不确定 , 应该是 DreamZero 才会是个问题 。
我感觉都不是问题 。 对 , 就是首先就是你还有很多工程优化可以做 。 对 , 另外就是 video model 的速度优化跟 video model 的主线是一样的 , 就是不仅是 robotics 的这些人在推动这个事情 , 还有就是像做视频生成的这些 , 这个领域本身大家都在推动这个事情 。
有点像这种 , 比如说你之前做 LLM 大语言模型 , 就相当于整个领域都是在提升它的 , 比如说这个 context 长度和它的这个速度 。
对 , 所以说就是这是整个领域的痛点 , 所以说就是你这个跟整个领域的前进方向是一致的 。 对 , 所以说就是不是特别令人担心的一点吧 , 我觉得 。
接下来你自己就是想重点去探索和研究的方向会是什么样 ? 你博士毕业之后你的计划是去英伟达什么 ?
对对对 。
OK, 你可以讲讲你觉得不涉及到你们比较机密的信息的 ,但是对业界比较有价值的这种 。
我可以讲讲我为什么想这么选吗 ? 就是我感觉工业界它喜欢做一些就是比较已经看到这种成功迹象的一些路线 , 去把它用更大的规模去做出来 。
对 , 学校的话可能是做一些这种原创性的探索 ,但现在给我的感觉就是已经进入了这种有很多很成熟的技术路线可以选择 , 已经进入了这种规模化的阶段 。其实我感觉就是包括整个人工智能 , 包括深度学习 , 它其实就是通往 AGI 其实是有很多路线的 。
就是最关键的可能就是数据 , 算力 , 你有一个正确的这种训练的目标 ,以及你有一个目标一致的团队 。
对 ,但是具体怎么去做这个事情 , 需不需要 world model 设置这个问题 , 它反正都可能达到这个 physical AGI。 所以就是可能不需要很多原创性的探索了 ,在现在这个阶段 。
所以说我感觉就是现在去工业界是个比较好的 timing, 这是我做这个选择的一个原因 。
你接下来自己想去探索的具体方向是什么样 ? 你可以说比如说未来一年吧 , 比如说从现在到 27 年年终的话 。
今年世界模型很火嘛 , 对 , 世界模型机器人的话分两个 , 一个是这个 world action model, 一个是这种 DreamDojo 这种 action condition 的 world model。
我自己一直在做这种 action condition 的 world model, 我其实更希望就是能看到就是这个东西最终能够去 enable 什么东西 , 就是它能够去做出怎样的应用 。
对 , 从最终目标来看的话 , 我感觉就是要实现一个自我进化的一个循环 。 对 , 这个是我最终想做到的 。其实主要的 bottleneck 就是各个组件的这个泛化性 , 就是只要它们的泛化性足够达到某个临界点了 , 它才能在新的任务下去提升 。
就是大家现在都还做单个任务嘛 , 就是因为单个任务不用考虑泛化性的问题 ,但这个其实是不是大家用这些积模的初衷 。
就大家用积模的初衷肯定是想借鉴这个语言模型以及视频模型它的泛化能力 。在单个任务上其实你自己去从头去训练一个模型 ,也可以把这个 pipeline 做通 。
但是你既然用了这个语言模型 、 视频模型 , 从这些模态出发的话 , 你最终它们最强的点应该就是它们的泛化能力 。
对 , 所以说最终世界模型 , 包括 world action model, 它其实应该推向这个更多的这个 task。 对 , 就是泛化能力要持续解决 。
对 , 我感觉这也是一个现在所有的 , 主要就是推这些 upper bound 吧 , 就是所有的 efficiency 这些计算效率 , 我感觉现在都不是 concern, 就是这种都会被解决 。
就是整个领域的这个大家都在关心的问题 , 包括 video generation 领域都在关心的问题 。 对 , 像我们的话可能就是更关注这个世界模型和这个 world action model 它的这个泛化能力的推进 。
OK, 那今天非常谢谢深远做客 《 晚点聊 》 分享了他在世界模型 , 尤其是动作控制的世界模型 , 就 DreamDojo 这种成果的路线上的一路的研究的经历 , 然后加入 Gear 的过程 , 包括他们在这做的一些进展 。
我觉得今天就给我自己比较大的一个收获 , 就是其实因为我之前也看 Genie 3 还有 SIMA 2 的这些成果 , 包括哈萨比斯觉得这个东西未来怎么去加速科学发现什么的 ,但可能会比较模糊 。
我觉得你今天说的这个 , 就是这三个要素 , 策略 , 加世界模型 , 加一个中间做连接和评判的 agent, 这三者这个 loop 形成之后, 会带来一个比较大的变化 ,是描述得非常清楚又很令人期待的一个未来的进展 。
虽然我现在比较难想象这个东西真的实现之后,AI 到底要发展成什么程度了 , 就感觉要桌脚踩油脚原地飞升了 。
我觉得今年可以好好期待一下 ,也许今年是一个苗头 , 之后我们可以看到它更多的变化 。 那今天非常谢谢深远 , 各位拜拜 。
谢谢麦琪 , 拜拜 。
本期连点呈现推荐第 157 期我和 Peter 陈哲聊的 26 年 Q1 的具身季报 。在这期季报里 , 陈哲列出了一季度的 top 5 重要进展 ,其中一项就是英伟达的一系列成果 , 包括 DreamDojo、DreamZero, 还有 Eagle、 还有 EagleSkill 等。
同时也推荐 157 我自己录制的 2025 年年末 AI 回顾 。在具身的那一部分讨论模型进展时, 我当时简单地介绍了 DeepMind 的 GEAR 和 SIMA 的进展 。
这些成果和想法我们在这期节目里都有涉及 , 这次录制也解决了我自己之前的一些疑惑 , 让我对英伟达 Gear Lab 以及 Google DeepMind 的思路都有了更清楚的了解 。
简单来总结的话 ,DreamZero、EagleSkill, 还有 Google 的 SIMA 都是策略式 policy 模型 , 它是直接让一个主体去产生动作 action 的那个模型 。
这个主体可以是虚拟世界的一个角色 ,也可以是物理世界的一个机器人。 以前更主流的策略模型的架构是 VLA 模型 。DreamZero 这个工作之所以很受关注 , 就是因为它引入和初步验证了以视频为 background 的思路 , 就是以视频生成作为基础来做机器人的策略 。
而 DreamDojo 和 Genie 这类模型则是一个更靠近世界模拟器的世界模型 , 它提供的是一个环境 , 它的主要目标是预测这个世界下一刻的状态 , 来为更好的 policy 服务 。
深远描绘了一个很有意思的洞察 , 就是在现在 , 就是现在有一个由世界模型和 policy 以及连接二者的 agent 组成的循环 。
如果以人类来类比的话 , 大脑的任务规划和思考就是 agent, 人脑去控制身体的部分是 policy,而我们生活的环境就是世界模型 。
这三者的关系如果更直接来表达 ,policy 策略模型它输出的动作是世界模型的一部分的输入 ,而世界模型的输出又是 policy 模型下一刻的输入 。agent 则一方面给虚拟角色或机器人规划任务 , 它是以文本的方式把这些任务输入给了策略模型 , 同时它也会评估世界模型对未来状态的策略是否准确 。
这个评估可能是一个分数值 ,也可以是一个文本的信息 , 它会进一步用来优化策略模型 。 具体的关系大家可以去看 show notes 里的那张图示 。
由于目前这三种模型的泛化性都不是很好 , 这个循环并没有转起来 ,但深远认为这是接下来一些团队 , 包括他自己 , 会去努力推动的方向 。
我们可以一起看一看这个循环是否会跑起来 ,以及多久能跑起来 。 如果这种自进化真的实现 , 那我们可以突破物理时空的限制 , 做很多实验和训练 , 它可能会是一个非常大的变化 。
今天我们先 mark 一下, 未来再见 。 本期节目就到这里 , 感谢收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。
你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 推荐更多你想听的主题和嘉宾 。 你可以从小宇宙 、 苹果 podcast 等渠道关注 《 晚点聊 LateTalk》,也欢迎关注我们的公众号 《 晚点 LatePost》。
下期再见
。




