晚点晚点聊 LateTalk2026年6月29日· 1:53:50

170: 与陈哲的「具身季报 26Q2」:世界模型大风不停,和不想被贴标签的人

本期《晚点聊》中,主持人程曼祺与Alphaist创始合伙人陈哲盘点2026年第二季度具身智能五大进展,核心判断是世界模型与灵巧手取得显著突破,人形机器人正从演示走向真实场景。陈哲认为北京亦庄人形马拉松中荣耀机器人事业部夺冠,证明有高端制造经验的大厂能快速拿出有竞争力的产品,成绩从去年半马2小时40分提升到今年自主导航约50分钟;Figure AI连续直播100多小时、分拣13万包裹,展示物流是适合人形机器人的好场景,但遥操作与远程接管仍是部署常态。在灵巧手方面,ICRA上以舞肌为代表的中国高自由度直驱灵巧手获得关注,陈哲认为直驱方案长期仍看好,而Optimus等大厂继续跟从绳驱路线。世界模型方面,英伟达Cosmos 3成为首个全开源Omni model,采用Mixture of Transformers融合自回归与扩散架构,能直接生成动作,带动创投热潮;Physical Intelligence的Pi 0.7在VLA上接入轻量世界模型,Generalist的Gen-1以50万小时无本体数据从头预训练,拒绝被VLA或世界模型标签定义。针对OpenAI Robotics团队官宣,陈哲表示其算力投入在具身领域已属天花板,并讨论了大厂入场节奏、宇树IPO后的估值锚点,以及中国创业者在长期不确定性与商业化之间的张力。

  1. 0:00总览
  2. 7:17马拉松
  3. 14:55物流
  4. 21:19落地
  5. 28:55数据
  6. 34:48灵巧手
  7. 43:03操作
  8. 53:32驱动
  9. 1:02:57世界模型
  10. 1:19:55模型
  11. 1:28:40大厂
  12. 1:37:56展望

PodHood 提供支持

文字稿

总览0:00

陈哲0:07

Cosmos 3 是这个季度世界模型的一个标杆 ,因为它算是市场上第一个提出了全开源的 Omni model。

更底层的问题是 : 我们到底有什么原因来说明 , 很多年以后, 所谓的这个 embodied AI 的 model 不是由 Anthropic、OpenAI 或者是 Google 这样的通用模型的大厂来提供的 ?

如果 Omni model 这个路线被最终证明是有效和有用的 , 那是不是机器人的所有的空间的理解 、 对动作的预测 , 可以被融合到一个更大的通用模型里面去 ?

曼祺0:51

从 Gen-1 目前的公开信息来看 , 能看出来 Generalist 对世界模型的思路是什么 。

陈哲0:56

他们其实是比较排斥把自己定义成 " 世界模型 " 或者说 VOA 这样的标签的 。Peter Florence 专门写过一篇文章 , 大意就是说 ,他们的做法既不是把动作粘贴到 VOM 上面变成 VOA,也不是一个世界模型 。

本质上, 谁能够更快地提供可靠 、 稳定 、 廉价的灵巧手的供给 , 就能更快地成为这个行业的实时的标准 。

也就是 , 更多的算法跟软件会围绕着你的硬件的架构去设计 。

曼祺1:37

欢迎收听 《 晚点聊 》, 我是曼祺 。 这期是 《 具身季报 》 系列的第二期 , 我继续邀请 Alphaist 的创始合伙人陈哲 (Peter) 来和我们分享最新的具身智能动态和行业趋势总结 。

最近有意思的一件事是 , 关于这个领域的称呼在悄然变化 : 更多人开始使用 " 物理 AI" 这个词 , 世界模型也继续风头强劲 。

这也正是我们第一季度讨论的 TOP 5 主题之一 。 本期季报依然按照第二季度 TOP 5 的进展和事件展开 , 包括 : 人形机器人马拉松 、Figure 的物流分拣直播 、 灵巧手和灵巧操作进展 、 英伟达的世界模型 Cosmos 3,以及世界模型创投热 。

最后一点是全球领先的具身模型进展 , 包括 Generalist 的 GEN-1 和 Pi 0.7。 下面我们正式进入节目吧 。

今天这一期是 《 晚点聊 》《 具身季报 》 的第二期 , 依然邀请了 Alphaist 的创始合伙人陈哲 (Peter) 来做客我们的节目 。

上一季度的季报之后, 评论区有很多留言是希望 Peter 能常驻和返场 , 之后我们也会和 Peter 继续这个系列 。Peter, 你可以和我们的听友简单打个招呼 。

陈哲2:51

大家好 , 很高兴回来 。

曼祺2:53

OK, 那我们还是总结一下这一季度的最重要的 TOP 5 的进展 , 里面既有一些行业事件 ,也有一些技术成果 。Peter, 你可以说一下第二季度你觉得具身智能领域 , 或者说现在大家也喜欢用另一个词 , 叫 " 物理 AI" 领域 , 你比较关注的 5 个重要的事是什么 ?

陈哲3:10

我觉得 Q2 比较明显的是世界模型和灵巧手取得的一些显著的突破 , 同时人形机器人第一次大规模走进了普通人的视野 。

那么总结 Q2 具身智能 TOP 5 的进展 , 我个人会这么排序 : 第一件事情是北京亦庄人形马拉松比赛 ,有 100 多个人形机器人参加了全场的比赛 ; 最终取得马拉松冠军的是手机厂商荣耀的机身事业部 。

这件事情传达的是大厂可以把人形机器人这件事情做好 ,并且在未来的一段时间内 , 可能会变成整个市场非常重要的一股力量 。

那么第二件事情是 Figure 连续几天直播人形机器人做包裹分拣的这个展示 , 这算是人形机器人在工业场景的价值第一次向全球的大众进行普及和教育的一个过程 。

那么第三件事情是灵巧手和灵巧操作取得的爆发跟进展 , 尤其是今年在维也纳 ICARA 会议上 ,以舞肌为代表的公司发布了新一代的高自由度灵巧手 ,以及多家具身智能创业公司用高自由度灵巧手做出了精细操作的基座模型 , 让灵巧手成为了下一个竞争的一个战场 。

那么第四件事情 ,在 6 月 1 号的时候 , 英伟达发布了他们最新的 Cosmos 3 的世界模型 , 让世界模型从一个概念真正变成了一个产品和范式的标杆 ,也成为了这个季度创业最火的风口 。

那么最后一个给我留下深刻印象的事情 ,是 VOA 这个路线的进一步的迭代 , 包括像 Physical Intelligent 推出了 Pi 0.7,Generalist 推出了 Gen-1, 都是让 VOA 的能力和叙事得到进一步的衍生 ,也开始出现了跟世界模型融合的迹象 。

曼祺4:58

OK, 那我们在展开聊这 5 个进展之前 , 正好可以先回顾一下上一个季度的结尾 , 我们当时讨论了对未来的一些展望 。

你列了这个季度或者说更长期你认为可能会出现的一些现象 。 第一点你当时提到的是看世界模型能否拿出超出 VOA 的进展 。

首先可以先快速地回答一下, 你觉得这一季度算实现了吗 ?

陈哲5:22

上个季度当我们提到世界模型的时候 , 是一个从研究上 、 概念上非常有创新的一种思路 , 或者说我们见到了一些实验室级的早期的样品 。

曼祺5:33

而且当时我们展开聊的其实是世界动作模型这样一个世界模型大的范畴里的一个分类吧 , 可以这么说 。

陈哲5:40

对 , 比如说当时我们提到的英伟达的 DreamDojo, 实际上是英伟达的 GEAR Lab 内部一个比较小规模的实验室作品 , 当时用的视频模型还是开源的这个 Wan。

但是到了 6 月份 , 英伟达发布的 Cosmos 3 实际上是一个更加产品级的 ,也是更加大规模的预训练的一个模型 。

我认为实际上是把世界模型这个概念从实验室拉到了工业级 , 就是可以被调用 、 可以被部署的一个状态 。

曼祺6:08

对 ,其实从它的发布也能看出来 ,因为它是一次有三个版本 ,有 Super、Nano 还有 Edge, 它其实就是去针对你不同的部署环境的 , 这个我们后面可以展开 。

那回到那个问题 , 你觉得它能说世界模型拿出超出 VOA 的进展吗 ?

陈哲6:21

我觉得经典的 VOA 模型架构的优势和劣势其实已经比较明显了 。 世界模型的长处是对于环境的预测跟建模 , 实际上以 Cosmos 3 为代表 , 我们看到了一个统一架构的世界模型可能对 VOA 能力带来的潜在的提升 ,以及我们也见到了领先的 VOA 模型正在用不同的方法连接或者缝制世界模型的能力进入他们体系里面 。

所以说与其是世界模型颠覆了 VOA 或者超越了 VOA,不如说世界模型给现有的缩塔模型带来了一种更新的能力和思路 。

曼祺7:00

然后你当时说另外两个你期待的事 ,也觉得大概率会发生的事 ,其实就是灵巧手 、 灵巧操作的更多成果 ,以及你觉得马拉松这个第二届这一次比赛 , 会让大家整个观感从之前的噱头和搞笑走向一个更加严肃的竞争 。

那回到 TOP 5 的话 , 第一件事就是我们上一次季报录制不久之后的 4 月 9 号在北京举行的人形机器人的马拉松 。

马拉松7:17

曼祺7:24

前面你也提到就是这一次的前三都是荣耀机器人事业部的机器人闪电 , 对 , 它就是冠军 、 亚军 、 季军都是这个机器人。

首先想问一下, 这事会让你或者其他从业者感到有点意外吗 ?

陈哲7:39

亦庄马拉松比赛我当天也去了现场 。 这场比赛开始之前 ,其实夺冠的三大热门就是宇树 、 北人和荣耀 , 所以市场对荣耀机器人的实力是有所预见的 。

曼祺7:52

为什么在比赛开始之前 , 业界就认为荣耀 、 宇树 , 还有北人 ( 就是北京人形机器人创新中心 ) 这三个参赛方是热门 ?

陈哲8:01

因为去年北人的天空机器人就是上一届的冠军 , 那么他们作为卫冕冠军 , 为了这一年的比赛也是做了蛮多的准备 。

宇树则是去年没有自己官方参赛 ,而今年是它第一次正式参加比赛 。 那么作为人形机器人目前运动控制的全球标杆 , 大家对于宇树的性能跟表现都有非常高的期待 。

宇树在赛前也发布过一些测试的视频 ,也展现了他们非常强的实力 ,在测试场中跑出了 10 米每秒的成绩 。

荣耀机器人事业部大概是在两年前开始成立 , 然后团队也有接近一两百人 ,并且从行业里面也招揽了一群在人形机器人上面很有经验的工程师跟行业的专家 。

所以他们为了这场比赛的投入和研发的成本是相当高的 , 可能从量级来讲是显著高于另外两家公司 。

那这笔钱用来干了什么呢 ? 能够让它去定制为比赛需要的大力矩的电机 ,并且也能够设计一套非常精密的液冷的机构 。

那在比赛现场遇到一个非常明显的情况 , 我们在直播的视频里面也可以看到 ,其他公司的机身在长时间高速跑动下面会出现电机过热 ,不得不休息 。

因为荣耀设计了一套更好的液冷机制 , 让整个比赛电机的温度都能控制在一个比较低的水平 。

而这件事情是让他们的闪电机器人能够在整个马拉松比赛里面都保持相当高的速度和一致性 , 很重要的一个原因 。

曼祺9:33

其实荣耀夺冠它有一个我觉得是跟未来的行业走向相关的一个问题 , 就是也有人认为今年对于那些常规本体的公司来说 , 比较重要的一个坎就是能不能 IPO, 上市到一个相对资源各方面都比较安全和充裕的状态 。

如果做不到这一点的话 , 可能接下来一年, 比如说 27 年, 像荣耀这种资源比较多的大型中端厂商 , 包括手机中端 ,也包括汽车这样的中端厂商 ,他们的机器人 、 他们的本体可能就会进入市场了 。

而且这些公司在更大规模的制造 , 还有可靠性一致性上都是更有经验的 。 你怎么看这个想法 ?

陈哲10:10

我觉得这次马拉松比赛其实是证明了一个有高端制造经验和很强的组织能力的团队 ,在足够的资源和人才密度下 ,是可以快速地拿出非常有竞争力的人形机器人产品的 。

曼祺10:24

就是比较侧重于硬件那块的产品 , 对吧 ?

陈哲10:26

对 ,但是从运控 、 导航等其他的能力和算法来讲的话 , 大厂的水位也不差 。 至少对于单纯追求性能的马拉松比赛而言 , 荣耀的能力是不差的 。

我觉得这个事情隐含的含义是 , 拥有像荣耀这样组织能力和人才能力和资金能力的大厂在中国还是蛮多的 。

像小米 、 小鹏 、 理想等电动车厂商 、 手机厂商也已经开始严肃地投入人形机器人这场游戏 。 所以我认为人形机器人作为一个高端制造业 , 加上一个复杂算法 、 复杂软件系统的一个系统工程 , 正在从单一技术的创业公司视角演变成一个系统性工程 、 系统性作战能力的一个体系 。

那荣耀这次在马拉松这项比赛里面的成功 ,其实是向我们预示了未来这个市场的竞争格局可能会是怎样 。

曼祺11:21

以及我有一个赛制的小问题 , 就是因为它冠军 、 亚军 、 季军都是荣耀的机器人, 所以今年是我一个机器人厂商可以派好多机器人出去 。

陈哲11:30

是的 , 这也是我说的荣耀相比于另外两个竞争对手 ,在参赛的资源上面是非常宽裕的 。

曼祺11:38

所以北人和宇树都只派了一个 ?

陈哲11:40

如果我没有记错的话 ,其他公司应该是派了两三个队伍 ,但是荣耀有 10 支队伍参赛 。

曼祺11:45

这没有上限的吗 ? 这不约束一下的吗 ?

陈哲11:48

它的比赛首先分为遥控和自主导航 , 然后在遥控和自主导航两个赛制里面各有几支队伍参加 。

所以按照今天的赛制 ,因为荣耀有足够多的资源 ,也带了足够多的机型去参加两项比赛 , 所以在两项比赛里面他们都取得了冠军 。

曼祺12:05

这次也可以展示出具体的成绩的变化 ,因为 25 年那一次冠军是天空 ,其实就是北人的团队嘛 。 当时这个半马是两个小时 40 分钟跑完的 , 然后第二名就是到松岩动力 , 已经和这个成绩差了很多了 ,是 3 个小时 37 分钟 , 差了一个小时 。

然后这一次就是在自主导航这个类别里面 , 冠军 、 亚军 、 季军 , 荣耀的这三个机器人成绩都是在 50 分钟左右 ,而且咬得很紧 。

以及上次那两个都是遥控嘛 , 然后现在这个是自主导航 。 你怎么来评价这个进步速度 ?

陈哲12:37

首先我认为这个进步速度是非常快的 ,在一年左右的时间 , 成绩提高了三倍多 。在这么长的距离下 ,在多个机器人参加比赛的前提下, 能实现相当高程度的可靠性跟一致性 , 相比于去年的比赛 , 很多机型还非常磕磕绊绊的 , 到今年能够比较顺利地完成全场的比赛 。

我们看到在机器人的硬件层面 、 控制层面和自主导航层面都有非常快的进步 。 我觉得另外一点反映的意义是 , 如果大家严肃地去优化这个问题 , 我们投入相应的资源 , 很多问题在今天的技术架构下面是可以解的 。

那么可能更大的问题是 , 之前没有一个对人形机器人 locomotion 性能极限的要求 , 所以我们不会去为了比如说像马拉松这种长达一个多小时 、 比拼最高速度的环境里面进行整个硬件和系统优化的这种需求 。

曼祺13:35

但是以马拉松这种形式来说 , 它确实创造了一个需求 ,但这个需求不是个市场化的需求 。 这个也是大家关于这一类比赛性质或者表演性质的一些展示的长久的疑问 , 就是它有什么用 ?

我把它优化特别厉害 , 然后呢 ?

陈哲13:48

我认为马拉松作为一种极限的运动性能的测试 , 本质上是人形机器人技术的练兵场 。

曼祺13:56

是个 benchmark, 可以这么说吗 ?

陈哲13:58

是的 , 就像 F1 赛车从来不是为了卖车 ,而是不同的汽车公司展示他们最新的技术 ,在突破技术边界上可以做出的各种能力的突破和新技术的尝试 。

而这里面很多技术会逐渐地引入到量产车或者量产的产品上面 。 一个人形机器人想顺利地完成 20 多公里的半马比赛 , 它需要有非常好的全身运控能力 ,有处理应急场景和各种地面的不规则的这种障碍物 ,以及需要非常长时间无故障运营 。

同时也需要解决供电 、 散热以及一系列的系统层面的问题 。 实际上马拉松比赛是创造了一种极端的测试环境 。

当我们能够熟练地知道人形机器人各种能力的边界的时候 , 我们在量产的时候其实是有大量的系统的经验 、 设计经验是可以利用的 。

物流14:55

曼祺14:55

那我们接下来来讨论你说的第二个进展 , 就是 Figure AI 的直播的展示 。 它这也是一个展示 ,但是它和马拉松不一样的是 , 它是在一个真实的物流产线上 。

具体我可以先介绍一下这个直播 , 它是从 5 月 13 号开始的 , 然后是有三台 Figure AI 连续直播了 100 多个小时 。

它这里的分拣包裹的这个任务 , 具体来说就是站在流水线旁 , 然后包裹每来一个 , 你把它翻一个面 , 你把标签翻到正面 。

具体大家可以去看我 show notes 里贴的图 , 还有视频的链接 。 然后这 100 多个小时, 它一共是分拣了 13 万个包裹 , 差不多是 3 秒钟一个 。

而且中间它也是和真人有对比的 , 就有真人也在做一些类似的工作 , 它有一些节拍 , 然后这个成功率上的对比 。

你可以讲讲就是你把它列到 TOP 5 里面是为什么 ?

陈哲15:44

Figure 这次做的包裹检选的这个工作 , 无论是从观赏效果上, 还是从实际的工艺价值上, 都算是一次 0 到 1 的突破 。

因为我们很长时间在讨论人形机器人到底可以做什么样的工作 ,在什么场景下可以有效地替代人。 我觉得物流的包裹分选本身就是非常合适的一个场景 , 需要有一定的泛化性和通用操作能力 。

而且这个工作本身是一个连续性的 、 长时间的 , 非常不适合一个人类长时间工作的一个场景 。 那么 Figure 是全世界第一个公司把这样一个场景通过直播的方式向全世界的大众观众得到了展示 。

我觉得这里面的示范意义非常明显 。

曼祺16:29

我看的这个直播的片段里面 ,其实这个机器人都是没动的 , 它都是站在一个相对固定的位置 ,但它用的是全的人形 , 就它是带双足双臂的这种 。

你觉得这是一种冗余吗 ? 其实它只需要用到它的操作能力 。

陈哲16:43

我们可以展开讲一下这个场景 。在快递包裹的这个分拣过程中, 包裹是由这种传送带快速地投递过来的 。

的确在绝大部分情况下, 我们只需要双手的一个拿起或者说翻面这样一个动作就可以了 。 这是为什么 Figure 在整个环境中是固定在这里的 。在现实情况下会有很多意外会发生 , 比如说这个传送带速度过快 , 这个物体过轻 , 或这个物体是一个球形的或者滑动的物体 。

曼祺17:08

它有可能掉出来 。

陈哲17:09

它有可能掉出来 。 那一旦它滑动出来或它掉到地上, 实际上我们在直播里面是看到一两个片段 , 这个物体是从这个台面滑落到地面的 。

那当各种这种意外情况出现的时候 ,其实一个真人是知道怎么去处理这些 corner case 的 。

曼祺17:24

那它在这个直播里它还没有做到 , 对吧 ? 机器人没有的 。

陈哲17:27

目前还没有做到 。 但是我想说明的是 , 这个场景为什么需要一个人形机器人, 或者说最好是一个人形机器人去做 。

因为当这种意外情况真正出现的时候 ,其实只有人形机器人, 加上我们今天的这种具身模型 , 通用泛化的能力 , 才可能解决这种你无法去穷尽的长尾问题 。

所以这也回到另外一个问题 , 就是有些朋友可能会关注同样的问题 ,是不是四五年前就有同样的机器视觉加工业手臂的公司就试图把这个问题解决了 。

曼祺17:59

对 , 这本来也是我想问的 。其实中国邮政四五年前就在陆续地和好多中国的机器人公司合作 , 就是你说的这种方案 。

陈哲18:06

这个具体的问题其实之前一直没有解决 。

曼祺18:08

所以以前也都是 demo 偏多 ,是吗 ?

陈哲18:11

没有真正工业落地 。 之前传统机械臂的方案 , 用运动控制加深度学习图像识别 , 加上一个工业手臂的方法来做这个问题 ,其实是很难把这个问题解决好的 。

我们在解决一个什么问题呢 ? 是当一个快递包裹被快速地运过来的时候 , 我们希望把这个包裹有二维码的那一面 ,有条形码那面能够快速地被扫描 。

那快递包裹往往是一个软体的包裹 , 贴在上面的二维码实际上是非常容易被遮挡 , 或者是有各种形变的 。

如果是一个人来操作这个事情 ,他会用双手来进行灵巧操作 ,他会把二维码翻面展平 。 这两个动作在四五年前技术战下面基本上是无解的 。

曼祺18:57

那它可能对你末端夹具的灵巧精巧程度要求也挺高 。

陈哲19:01

对 , 这是为什么我们看到不管是 Figure 还是星动纪元的展示里面都用到了一个灵巧手 。 这个动作就像我说的 , 可能用传统的四五年前想要解决这个问题的公司 , 基本上还是在用吸盘 , 甚至都没有用夹爪 。

因为吸盘在当时的技术战下是一个更通用的解决方案 ,但实际上你基本上没有见过吸盘方案是两手操作的 , 它只能进行简单的 pick and place。

曼祺19:25

那它这个是不是也有一些就是场景难度的区别 , 比如说在有一些物流上, 它的包裹可能标准化更强 。

陈哲19:34

当然 。

曼祺19:35

以及它柔性包裹比较少 , 它都是一些刚性的什么纸盒子之类的 。

陈哲19:39

当然 , 当然 。 包括像我之前投资的海柔 , 包括像已经上市的极致佳 , 这些在仓储物流自动化领域的机器人公司 , 实际上都是在解决一些标准化的物流场景 。

但实际上为什么到今天 , 物流也是一个人形机器人非常大的 、 非常有价值的场景 ,是因为在这些标准化的包裹 、 标准化的纸箱之外, 还有大量非标的包裹和检选的需求没有得到解决 。

曼祺20:08

比如说像电商仓 , 我觉得就是一个比较典型的场景 ,因为有些电商仓它的商品的类型是非常多样的 。

陈哲20:16

对 。

曼祺20:17

然后它柔性也比较强 。

陈哲20:18

有拣货的需求 ,有打包的需求 ,也有像快递这种分拣的需求 。其实 Figure 和星动纪元选择这个场景是非常聪明的 ,因为它真的是一个老的技术战和非人形 , 就是非双臂加灵巧手的方案 , 很难流畅解决的一个问题 。

就像我们之前看 Pi 和 DINA 做一些叠衣服的这个 demo 的场景下 ,其实 deformable 材料的操作是非常适合今天的具身模型去解决的问题 。

曼祺20:50

Deformable 的意思是 ?

陈哲20:52

就是可以形变的 , 可以变形的材料 , 比如说一些软体 , 比如说一些纺织物 , 比如说一些塑料袋 。 因为你没法用一个简单的固体模型去建模它的空间几何和操作的操作点 , 实际上它就必须需要有一个有一定泛化能力 、 有一定理解能力的模型 、 适应性能力的模型去做这种灵巧的操作 。

曼祺21:18

那回到 Figure AI 这一次的直播 ,有一个争议是在直播中它出现了一些片段 ,是这个人形机器人有一些扶头的动作 , 然后又会有人说这是不是遥操的 。

落地21:19

曼祺21:31

而 Figure AI 官方是说这个直播用的是他们 Helix 02 这个模型自主完成的 。

陈哲21:37

我觉得遥操根本不是这个问题的争议点 ,因为我相信所有的人形机器人在真正进入这种部署场景之前 , 都有长时间的遥操作来收集数据和纠正动作的一个过程 。

哪怕这里面有相当的时间 ,有一部分时间是需要人类介入 、 人类干预 , 我觉得也不能削弱这件事情本身的意义 。

曼祺22:00

而且你说到这个 , 我想到一个事儿了 , 就是有可能在未来它真的进入工业长期部署的状态之下 ,也会有点类似于自动驾驶的一种什么情况了 , 就是我后台可能有一个真人在管着 , 比如说竖台这种机器人 ,因为它中间可能会出现一些情况是需要人去接管 。

陈哲22:18

当然 , 远程接管对于 Robotaxi 系统来说已经是一个市场上的 norm。 我们在看 Waymo 和国内其他的 Robotaxi 公司的时候 , 我们都会去衡量它的 。

曼祺22:31

接管效率 。

陈哲22:32

接管效率 。

曼祺22:32

你一个人可以盯多少台 , 对吧 ?

陈哲22:34

对 。 我认为同样的事情对于一个全自主运营的人形机器人来说 , 一定也会是这样 。

曼祺22:40

但这又涉及到一个问题 , 我觉得你在工业和物流场景 、 生产场景 , 你可以有一个人在后台盯着 。 如果你要真的进家庭场景 , 它有一个隐私的问题 , 对吧 ?

那是不是对这个机器人的全自主能力要求又更高了 ?

陈哲22:55

你可以这么说 , 这也是为什么人形机器人真正进入家庭场景的难度 , 从隐私的角度 、 从数据分布的角度 , 都会比单纯的工业场景更大 。

这也是为什么我认为 Figure 找到的这个物流分选的这个场景 , 实际上是一个非常好的场景 。 我们如果看历史上真正成功的 B2B 机器人, 基本上它们都在这种有大规模的部署量 、 有足够高的吞吐率 ,以及有比较一致性的作业的环境和作业的需求 。

那么之前刚才提到极致佳 、 像海柔 、 像 Kiva Systems 这些非常成功的 to B 的机器人 ,其实都是在仓储自动化领域 。

我们也看到了一些人形机器人公司想要在一些工业场景里面做一些落地跟示范 。 如果你仔细去看那些场景的话呢 , 你会去发现有些在工业场景落地的人形机器人, 实际上是在做一些专用机器人 、 专用机械臂已经可以做的事情 。

本质上就是一些非常精准的上下料和工具的定位操作的过程 。 但是对于 Figure 展示的这个场景 , 我认为在之前的机器视觉加工业 B 时代并没有得到很好的解决 。

曼祺24:09

之前去年和今年, 宇树还有一些其他机器人公司两次上春晚 ,是让中国大众对人形机器人有了一个比较多的认知 , 然后也掀起一个热潮 。

你觉得 Figure AI 这次直播海外出圈吗 ? 它有一个向大众普及的这种作用吗 ?

陈哲24:24

我觉得在 Twitter 上面的反响还是蛮高的 。 同时期发生的那几天前 ,在美国的达人秀上也出现了一个很有意思的表演 , 是一个来自四川成都的舞者吴雨霏和八台宇树的激望机器人进行一段现场的舞蹈表演 ,也获得评委跟观众热烈的这个响应和全票晋级的待遇 。

那这个视频出来过后呢 ,也掀起了全网非常热烈的讨论 。 实际上它跟 Figure 的展示一样 , 都是让美国的普通百姓通过一种非常直观的方式看到了人形机器人怎么开始进入工业和商业的这种场景 。

之前可能很多人在 YouTube 上面 、 在 Twitter 上面是看到过中国春晚的机器人表演 , 还有很多人怀疑说这是不是 AI 生成的 , 这是不是录制了很多遍的 ,而不是现场直播的 。

曼祺25:23

然后就是我们说回国内啊 ,因为刚才也提到就是说星动纪元其实也有在物流上的一些新的合作宣布 ,是和中国邮政 。其实他们去年 11 月他们就发过邮政包裹分拣的 demo。

你觉得像国内的这种进展 , 它目前离真的落地大概是一个什么样的距离 ?

陈哲25:40

我觉得从技术成熟度来讲 , 已经到了相当成熟的一个阶段 。 我获得信息是星动纪元在快递分选这个场景里面 ,不光是在中国邮政 ,也在顺丰也做了长时间的测试跟训练 ,他们已经能够实现人形机器人的全自主的这个分包 、 翻面 、 扫描等一系列这样的工序 。

这也是我觉得中国公司在人形机器人在物流工业场景的落地的实际进展 , 完全并不亚于美国公司的一个很好的体现 。

曼祺26:14

像这种场景 , 它一旦放出来之后, 就我觉得场景方有这种需求的时候 ,是不是会有很多公司去试啊 ?

就除了星动纪元这个我们已经看到它自己宣布了的这个合作之外, 你知道还有什么公司在物流上投入会比较多的吗 ?

陈哲26:29

具体有哪些公司会选择这个场景我不确定 ,但是我能知道的 , 这是一个好的 PMF, 这是一个适合双臂人形机器人 、 适合一个有一定泛化和智能能力的具身模型去做的一个场景 ,以及也需要灵巧手的一个配合 。

所以拥有这几个综合能力的团队一定是不少的 。

曼祺26:51

像你以前投过的海柔 、 海 X、YZ 这些更早成立的公司 ,他们在物流这个场景其实是深耕比较久的 。 你觉得他们可以往这个方向去拓展吗 ?

陈哲27:00

当然我觉得是可以的 。 这其实也回到了 to B 科技公司一个很底层的问题 ,其实有很少的技术本身是具有垄断性 。

那更关键的是 , 你的产品或者系统要嵌入一个更大的运营体系里面 , 比如说在这个情况是快递 , 或者说是仓库的这个物流自动化 , 那你在里面有哪些跟行业相关的认知经验 ,以及跟客户系统的这种耦合 , 我觉得都会变成 to B 的技术公司非常重要的门槛跟壁垒 。

所以呢 , 我认为在上个范式里面已经取得一定成功的 to B 机器人公司 , 都有机会把人形机器人和具身智能大脑这些能力跟技术应用到一些还未被解决的场景当中 。

曼祺27:53

像宇皮公司现在有一个劣势 ,是就是融资上还是会差一些 ? 因为他们好像没有什么新的那么强的噱头去融资 , 当然他们有很多收入是已经有一定体量了 。

陈哲28:04

上一波的 to B 机器人公司基本上都已经进入 IPO 或者 pre-IPO 的阶段 。 虽然他们在一级市场讲具身的概念 , 可能大家觉得它是一家老公司 ,但实际上当它真正 IPO 过后, 它可以获得的资源和能力 ,有可能是远远大于今天在一级市场的公司的 。

比如说像之前做送餐机器人的普渡 ,他们现在已经是商业情节里面非常头部的一家公司 。 那么包括像极致佳 、 像海柔 ,他们在仓储自动化里面把一些可以被自动化解决的场景都已经通过他们的移动机器人得到解决了 。

那么在仓库里面我们还是有大量的员工的 , 我们在物业里面也还是有大量的清洁工 ,有大量的物业人员的 。

那么对于那些今天的简单自动化还没有覆盖的场景 ,其实对于这些 to B 的机器人公司来说 , 都是一个很好的延展 。

曼祺28:54

嗯 , 然后关于整个人形的进展 , 我们上一次还聊了一个细分的趋势 , 就是把 locomotion 就是运动控制能力和 manipulation 精细操作结合起来 , 就是全身的运动控制 。其实前面也讲到就是比如说包裹分拣这个任务 ,在一些 core case 的情况下, 就是需要全身的控制能力 。

数据28:55

曼祺29:12

我自己观察到一个变化 , 就是我发现有公司 , 新的公司 , 它专门就是做这个 , 新成立的 , 比如说李洪洋老师做的这个元测未来 。

陈哲29:21

对 , 我觉得整个具身市场过去两三年的确主要是在关注操作智能的问题 。 之前我们说到机器人的 locomotion 能力 , 就是它的运动能力的时候 , 我们可能自然地觉得它是一个小脑的能力 , 它跟我们在解决比如说大脑的这种认知决策和操作的能力是没有直接关系的 。

但是随着 local manipulation 技术的逐渐成熟 , 我们现在发现我们是有机会用一个更一统的架构来同时训练你的移动跟操作能力 。

那么在这个前提下面 , 那些真正拥有很强的运动控制能力的团队的价值就会得到放大 。 那这个季度我们不光看到了很多新的创业公司的出现 , 我也看到了在数据采集方面一个明显的趋势 , 就是有越来越多的公司在收集全身运控的数据 。

曼祺30:18

全身运控的数据 , 你可以把之前比如大家在采什么数据讲讲吧 , 就比如和之前的区别是什么 ?

陈哲30:23

我可以讲一下素材的这个范式的这个演进 ,因为我们知道具身智能整体的瓶颈其实就是在数据 。 那么每个周期模型范式的迭代其实就是数据范式的变化 。

我们通过看素材公司在做什么 , 我们也可以提前预判这个行业未来会朝哪里走 。 那么回到两年前 , 当时最火的方向是 Aloha 这个方向 , 本质上是一种真机遥操做素材的方式 。

曼祺30:49

Aloha 是一个轻型的臂 , 可以这么说吗 ?

陈哲30:52

对 。

曼祺30:52

真机遥操轻型的双臂多采集 ?

陈哲30:55

其实经典的 Aloha 方案其实涉及四个机械臂 ,由人去操作两个机械臂去影响直接控制另外两个机械臂 ,因为人是直接操作那两个机械臂的 。

曼祺31:08

所以它构型是完全一样 ?

陈哲31:09

它是同构的 。 我们在遥控的那个手臂上做的所有的动作 , 可以被另外一个手臂所克隆复制 。 所以这是大约两年前的素材的主要的方案 。

曼祺31:20

这个方案就是当时在斯坦福的那个 Thunderboties 的另一个联唱 ,Tony Zhao 提的是吗 ?

陈哲31:26

对 ,Tony 跟子鹏在 23 年发表的工作 。 然后到了去年左右出现了这个 Omni 的方案 , 就是驰成他们做的这个用人去手持一个两指的夹爪 , 然后是一种无本体数据采集的方案 。

曼祺31:42

所以它的好处就是它成本更低 ?

陈哲31:44

对 , 它不需要真机 , 实际上一个素材的人员拿着两个夹爪就可以在很多真实场景里面进行素材 。 然后到了去年底的时候呢 , 大家也开始引入这个 ego-centric 第一视角的一个视频 , 往往它会带一个头环或者是一个头戴摄像头 , 然后去收集很多第一视角的操作视频 。

这个方案呢 , 最主要的好处是它的多样性是暴涨的 , 它可以被应用在非常广泛的场景里面去进行素材 ,而且对人去操作一些任务来说 ,有尽量少的干扰 。

曼祺32:17

Ego-centric 这个方案 , 它需要配合手套还是不一定要配合手套 ?

陈哲32:21

嗯 ,不一定需要配合手套 。 它核心的特点是第一视角视频 。 那么在这个基础上, 我可以是 ego-centric 的视频加上两个 Omni 的夹爪 ,也可以是 ego-centric 的视频加上素材的灵巧手的手套 ,也可以是空手 。

曼祺32:42

所以它的量和多样性都会多很多 ?

陈哲32:44

是的 , 可能到了去年年底的时候 , 随着英伟达的这个 Sonic 全身动捕的这个工作的出现 , 我们看到越来越多的团队有办法去通过动捕的方式去给人形机器人做大范围的数据采集 , 然后也可以把人的各种动作啊 、 舞蹈啊更快地迁移到人形机器人上 。

这也是为什么我们到了今年看到了更多的想要做全身动捕 ,以及从全身动捕的基础上开始去做 local manipulation 工作的这个尝试 。

曼祺33:16

英伟达做这个全身动捕的方案 Sonic, 它和以前我们有时候看一些电影纪录片里面会展示特效的动捕 , 就在人身上打很多点 , 那个区别是什么 ?

陈哲33:26

本质上是你有一些大概的骨骼点 , 然后你可能是有外部的 camera, 你要把这些骨骼点映射到一个人形机器人上, 就是你怎么做 retarget。

就 Sonic 它是个开源的一个技术站嘛 ,因为它做得特别好 , 又很简单 , 所以大家就可以很快地迁移上去 。

然后这里面很大的原因也是因为宇树做好了 。 宇树做好不光是硬件做好 ,是开源的市场里面有很多人围绕着宇树的激望去做了它相应的参数的这种优化 。

所以当我们捕捉到一个人的运动骨骼信息的时候 , 这个人的这个运动信息可以很快地迁移到宇树激望上面 。

曼祺34:04

嗯 , 所以算法上是和英伟达的这个 Sonic 的开源的成果相关 , 然后硬件上是宇树的硬件本体本身更成熟了 。

今年大家更多的能做一些全身运动控制的探索 。

陈哲34:17

对 , 或者我们从研究员的角度 ,他们一定是想去做一些更新 、 更有探索性的 、 更终极的方案的 。 这是为什么我们不光看到了很多以 local manipulation 为目的的全身素材 、 全身动捕的这种方案 , 我们也看到了很多公司开始去想办法去采集灵巧手的数据 , 无论是通过手套 、 外骨骼 , 还是用其他的一些方法 。

本质上我们今天开始采集的数据 , 可能就会转换成三个月 、 六个月以后模型方面的一些突破 。

曼祺34:47

嗯 , 那正好进入第三个主题 , 就是灵巧手和灵巧操作 。 因为你刚刚也去维也纳参加了 ICRA,ICRA 就是 ICRA,是国际机器人与自动化大会 。

灵巧手34:48

曼祺34:59

这次 5G 也是在 ICRA 上有比较多的展示 。 你可以讲讲第二季度灵巧手有哪些变化 , 包括在 ICRA 上得到的一些最新的反馈和讨论是什么 ?

陈哲35:10

我觉得这次 ICRA 的会议有非常多中国的厂商去参展 , 尤其是在灵巧手的领域 。 那么以五季为代表 ,他们发布了新的一代的直驱灵巧手 。

那么也有一些其他的公司 , 像欣诺 、 像临界点 ,也发布了他们新一代的高自由度灵巧手的产品 , 获得全场很多关注 。

曼祺35:31

灵心巧手和 XPAR 也去了是吗 ?

陈哲35:33

XPAR 没有发布新的灵巧手产品 , 灵心巧手是去了的 。

曼祺35:37

星动纪元有在 ICRA 上发手吗 ?

陈哲35:40

有 , 星动纪元的高自由度的灵巧手也发了 。

曼祺35:43

对 ,在这种做本体和智能都做的公司里 ,他们是自己做灵巧手 ?

陈哲35:47

对 。

曼祺35:48

嗯 ,他们那个邮政的合作也是用了自己的灵巧手 ,他们那个是叫 XHAND?

陈哲35:52

对 , 应该是一个中自由度的手 ,但是他们在 ICRA 上面发的是 21 自由度的旗舰的这个高自由度的手 。

曼祺35:59

那就高自由度了 。

陈哲36:00

对 , 实际上在 ICRA 发布灵巧手的公司是蛮多的 。 那我认为在所有公司里面 , 五机发布的二代手是显著获得了更多的这个关注跟认可 。其实今年 ICRA 的情况跟 25 年很像 ,25 年 ICRA 给大家留下最大的印象就是 XPAR 发布了它的高自由度灵巧手 。

那么这届 ICRA 可能对大家来说留下最深的印象是五机的这个二代手 。

曼祺36:26

你可以讲一下五机二代手的一些基本情况吗 ? 比如说上次节目我们聊到 XPAR 的手是 22 个自由度 ,是 5 万美元左右的售价 , 然后当时很多全球前沿的具身相关研究室是在用 , 或者说在等他们的手的 。

陈哲36:42

对 , 五机的这个二代手也是 20 个自由度 。

曼祺36:46

20 个自由度 。

陈哲36:47

对 ,有些灵巧手它可能标称有比较高的自由度 ,但实际上它有些自由度里面并没有这个动力 。

曼祺36:55

那它是靠别的关节带动那个关节是吗 ?

陈哲36:57

对 , 一般我们说灵巧手的自由度里面会分为主动自由度跟被动自由度 。 那有些可能是属于被动自由度 , 比如说它可能有更高的自由度 ,但实际上那个自由度并不能主动地控制 , 它会被别的关节牵扯的时候会拿过去 。

所以其实对于高自由度灵巧手 ,在 20 个自由度左右 , 基本上可以实现我们人类掌内需要的各种操作 。 它也是一个工程上的 trade off。

本质上全自由度灵巧手取决你的技术方案是直驱还是绳驱 , 你的工程实现的难度可能不一样 。 那对全自由度的直驱灵巧手而言 , 基本上就是在每个自由度上面都有一个电机 。

曼祺37:35

因为你说这次 ICRA 上五机的手大家比较关注嘛 , 它是展示了一些什么能力获得了关注 ?

陈哲37:40

其实五机跟 XPAR 可能是在全球市场上做直驱高自由度灵巧手最领先的两家公司 。 那么他们去年发布的一代手在市场上也取得很好的这个反响 ,但是有非常多的工程问题没有得到解决 , 比如说有比较严重的散热问题 ,以及它的一代手当时的结构是没有反驱的能力 ,也就是说关节不能很自由地反向的这种掰动 , 导致的问题就是在一些强冲击的环境下面它是容易

损坏的 ,以及它关节对于力的响应和控制不会那么灵敏 。 那么这次发布的二代手在没有增加重量的基础上实现了更好的反驱性能 ,也大大地改善了散热的问题 。

所以我发现在现场他们的展台会有非常多的观众 , 会自己上手去尝试 , 去感受这个手的这个灵巧性和反驱性 。

那这一点其实对于很多研究人员来说是非常有优势的 。

曼祺38:37

有吸引力 。

陈哲38:37

对 ,而且如果你把五机的手跟 XPAR 的手 side by side 一举看的话 , 你会发现五机的手大概只有 XPAR 可能一半的体积的样子 。

所以从模拟一个真人手掌的大小而言 , 五机的优势是非常明显的 。 我觉得基本上高自由度手 , 除了五机跟欣诺 , 就是绳驱混合方案的手之外, 我觉得在高自由度手上面体积都比一个成年人的手可能大 1.5 倍到 2 倍左右 。

那这带来的问题其实是非常多的 , 它意味着很多你在人手上面可以完成的操作 , 如果你通过人去学习这个策略 , 你是没有办法在一个体积比较肥大的手上面去实现的 。

曼祺39:20

他们这次有展示什么比较炫技的功能吗 ? 研究人员去看这个东西 ,他怎么看到门道了 ? 他怎么看到我是否是我需要的东西 ?

陈哲39:28

主要是看这个手的体积 、 灵活度 、 反驱性和它的这个机械性能 ,其实就跟我们看宇树的这个机器人的特点一样 , 就是大家实际上需要一个好的硬件载体 , 这样他们可以在这个硬件载体上面可以完成非常多的控制的这个工作 。

曼祺39:45

那我觉得跟这两个公司定位有一些差异有关 。其实我们上次讨论过 , 就是黎帆他们重新来做 XPAR 这个公司 , 长期来说它有一个更大的目标 , 应该是想做通用的具身智能 , 从手来切入 。

所以他们可能自己软件啊 、 算法这方面做得也比较多 , 包括他们也提了一个三层模型的架构 , 所以它会去展示 , 比如说我组装一个风车 , 或者我两个手削苹果这种动作吧 。

然后五机它是不是更类似于你上次提到的 , 你觉得灵巧手里面有一个宇树 G1 这样的机会和生态位 , 就是说我成为大量前沿研究的一种基础设施 ?

陈哲40:20

对 , 我觉得为什么这次 ICRA 五机的手获得了比较积极的反响 ,也是因为它主要是一个学术会议 。 这也是过去一两年我跟很多海外的研究人员获得的一个认知 , 就是大家在完成了以夹爪为核心的这种 VLA 的研究过后 ,其实大家发现硬件的限制导致很多更复杂的任务是无法完成的 。

灵巧手并不是一个新的领域 , 可能在全世界已经发展了三四十年的时间 ,但是直到今天也没有一些特别成熟或者特别便易的硬件方案 , 让全世界的研究员可以在这个基础上做快速的研究跟试错 。

我觉得五机今天的公司定位是比较像宇树的 ,是专注于把一个低成本 、 高可靠性 、 稳定的一个硬件设备做到足够的可靠耐用 , 然后让大家可以在这个基础上去做大量的研究跟实验 。

这也是为什么在过去一两个月我们看到非常多无论是美国的还是中国的创业公司 ,他们都发布了基于五机灵巧手的灵巧操作的这种模型或者工作的进展 。

曼祺41:28

现在高自由度灵巧手整个全球的市场规模是怎样的 ?

陈哲41:32

我们首先来解释一下灵巧手今天市场格局 , 它分为低自由度手和高自由度手 。 低自由度的手无论是第三方公司 , 像灵巧手或者是强脑中公司生产的 , 还是像智源等其他公司自产的 , 这个低自由度手的今天市场规模一年大概有小几万只 , 跟人形机器人的数量基本上是成正比的 。

曼祺41:54

你知道这个市场目前来说卖得最多的是谁吗 ?

陈哲41:58

我觉得灵巧手应该是大的 ,但是之前还有一家鹰石 , 鹰石就是做连杆的 , 那个量也大 ,因为那个很多最早做残疾人这个市场都做 。在低自由度灵巧手的市场上面 ,其实是有蛮多已经有相当出货量的公司的 , 包括像鹰石 、 灵巧手 、 强脑 、 奥义等一系列的中国的公司 ,也包括智源拆分的临界点 。

低自由度灵巧手今天很大的场景实际上是配合着人形机器人的销售 , 无论是表演的场景 , 还是一些简单的这种抓取 、pick and place 这种场景 , 这是一块市场 。

那么在高自由度灵巧手里面 ,以 XPAR 和五机这种公司为代表 , 主要就是面向全球的灵巧手操作的科研市场 。

那么这个市场的目前的出货量还是比较小的 ,因为实际上可能在去年 XPAR 真正量产之前 ,在市场上几乎可以说没有能够买得到的量产的高自由度灵巧手 。

虽然高自由度灵巧手今天出货量还比较小 , 头部在几千只的水平 ,但因为技术含量高 , 对算法和数据都有影响力 ,也是大家竞争的焦点 。

曼祺43:03

嗯 , 那刚才说是灵巧手这块的一些进展 , 然后在灵巧操作的模型上有一些什么进展 ? 就是更偏软件或者说系统的那一部分 。

操作43:03

陈哲43:13

在今年 5 月份的时候 ,Genesis 是发布了他们用定制的这个五机手做了灵巧操作的模型 。

曼祺43:19

嗯 , 你可以稍微说一下这个公司 ,因为之前没有聊到过 Genesis。

陈哲43:23

Genesis 是 24 年成立 , 然后一开始是在做这个机器人的这种仿真环境方面的工作 。在一年多以前开始专注到了灵巧操作和机器人全站系统开发的这个定位上 。

我认为他们 5 月份发布这个工作 , 代表了目前市场上使用高自由度灵巧手进行这种操作的一个 sort out 的一个表现 。他们公开说采集了大概 20 万小时的数据 , 我相信应该有相当一部分是这种 ego-centric 数据 , 那也有一些应该是通过遥操作或者说这种素材手套的方式获得的灵巧手操作这种真机数据 。其实通过他们 demo 我们可以看到 ,他们用五机的这个灵巧手其实是实现了一些非常灵

巧的一些操作 , 比如说旋转魔方 , 包括处理一些食物 、 烹饪 , 包括弹钢琴等一系列相对灵巧性的这种操作 。

曼祺44:14

他们展示做菜的那个能力 , 它整个步骤还挺长的 ,有 20 个步骤 ,有个完整的菜 、 备菜 , 然后烹饪 。

你觉得这是一种什么思路 ?

陈哲44:23

我觉得灵巧手操作的模型今天还在一个行业比较早期的阶段 。 今天的很多灵巧手的操作其实比较像两年前我们用 Aloha 进行这种真机遥操的这种类比 。

什么意思呢 ? 如果我们有比较高质量的人类完成某一个任务的这种数据 , 无论是通过动捕的手套 、 外骨骼 , 还是用其他的一些方式 , 那么当我们采集了足够的数据量的时候 , 我们是有很高的执行度和可靠性 , 把这个动作得到重现 , 就是我们所谓的 behavior cloning, 行为克隆 。

因为之前市场上完全没有高自由度灵巧手的供给 , 所以今天很多进行模型研究的公司还在属于比较初级的获得真机数据的这样一个阶段 。

那么可能之后随着无论是 ego-centric 的 video 技术的提升 , 或者是一些更轻便的类似于 Yumi 的方法 , 可以让用户更快捷地采集一个高保真度的手部操作的数据 。

那么那个时候我们有可能会训练出一些更加泛化和更加通用的灵巧手操作模型 。 那么今天呢 , 我看到像 Genesis 或者说很多其他的做灵巧手操作的公司 , 我觉得今天的技术范式还比较像两年前我们做 Aloha 进行一些 behavior cloning。

曼祺45:47

就是克隆人的行为 。

陈哲45:48

对 。

曼祺45:49

所以它有可能换一个任务 , 甚至我环境变得稍微多一点 ,也许成功率就会有比较明显的变化 。

陈哲45:55

有可能的 。 如果我们拿 Generalist 这种在夹爪操作上面已经做到比较通用 、 比较泛化的公司来做做对比 , 我认为 Generalist 已经找到了一个采集几十万小时无本体数据的方法 , 通过 Yumi 这种方法 。

我认为在高自由度灵巧手操作上面 , 目前市场上还没有特别清晰的方法如何获得足够高保真的数据来驱动一个灵巧手操作 。

那么这里面是不是纯粹的 ego-centric video only 就可以解决 , 还是说我们像当年的 G1 跳舞一样 , 我们用一个非常好的仿真 Isaac Thing 去解决 , 或者是我们有些非常好的动捕的设备 , 无论是手套 、 机电手环 , 还是别的一些外置的外骨骼设备 。

我觉得这点还没有特别清晰的共识 ,但是我们知道的是 , 只有当数据的问题得到充分的解决和释放的时候 , 我们才有可能训练出一个非常泛化和通用的灵巧手操作模型 ,而行业的趋势是快速地推动朝这个方向去发展的 。

曼祺47:03

OK, 那我接下来这个问题就是延伸你刚刚说的这个点 , 就是这个灵巧手的数据的收集的问题 。

因为数据是 AI 进展的三要素之一 , 那作为一个这么重要的资产 , 你觉得它最后数据会在哪呢 ? 会在第三方公司这吗 ?

有很多做手的公司可能是第三方的公司 , 就相对于我直接做一个完整的人形机器人本体的公司 。其实这个问题它还可以等价于一个问题 , 就是灵巧操作这个能力最后是什么样的公司能更快更好地做出来 ?

是比如说我直接就在做灵巧手这个硬件的公司 , 我能软硬一体结合迭代得更快 , 还是我本身做一个整个具身大脑或者具身大脑小脑融合的这么一个统一的模型的公司 ?

陈哲47:44

其实你第一个问题问的是数据会是谁提供 , 对吧 ? 第二个是这个智能是谁提供 。

曼祺47:50

对 ,因为数据可能跟智能就很相关了嘛 , 它是连着的 。 或者你可以反推 , 对有的公司来说 , 如果智能是它的必争之地的话 , 那它那个数据肯定它就得自己掌握 。

陈哲47:59

我们观察到一个现象 , 就是在真机遥操的 Aloha 时代和 Yumi 的这种无本体素材时代 ,其实已经诞生了非常多的数据采集公司 。他们开始服务各种具身智能的大厂或者是创业公司 。

曼祺48:16

比如说简池就是个单独的公司 。

陈哲48:18

对 , 比如说美国也有类似的一些这样的公司 , 中国也有些 。

曼祺48:23

还有光轮也是 , 对吧 ?

陈哲48:25

对 ,以 Yumi 为例 ,其实它对于执行器硬件的依赖或者说限制是比较低的 ,因为本质上是一个比较简单的平行夹爪 。

但是对于高自由度灵巧手的数据而言 , 如果你不控制这个手的本身的这个结构跟设计 , 你作为一家第三方公司进行素材的时候 , 可能就会非常受限于你具体想要映射的本体的这个形态跟结构 。

因为很多在自由度啊 ,在关节上面的特征 , 它并不是非常容易 transfer 或者说非常容易 retarget 的 。

曼祺48:58

就是说如果我作为一个第三方的数据采集公司 , 我服务了 ABC 三个客户 , 可能我就不能用一套方案 、 一套数据去给这三个人。

我要给这三个分别有一些定制的东西 。

陈哲49:09

我觉得主要是因为今天灵巧手的硬件结构还没有完全收敛 。 你作为数据公司 , 你想要采集灵巧手相关的数据 , 那最简单的问题就是你按照哪一个手的构型 、 哪一个手的自由度去采集数据 。

比如像我们刚才说的 ,有些公司可能是 22 个自由度 ,有些是 20 个自由度 ,有些公司 21 个自由度 , 就意味着他们在每一个手指上面自由度的设计和结构都是不一样的 。

曼祺49:37

所以其实因为我刚才说数据在哪 , 我想的是两种可能 , 就是要么是灵巧手的公司有可能自己做 , 又有一种可能是本体厂商它把灵巧手的硬件也自研了 , 然后它也自己去采这个数 。

你现在其实说的是第三种可能 , 就是有一种专门就是做数据采集的公司 , 可能手它也不自己在造 , 对吧 ?

它也可能来自于客户 , 来自于数据需求方 , 或者来自于它自己去采买一些设备 。 你说的是这种可能 , 你觉得这比较难存在 ?

陈哲50:01

不确定 ,因为数据服务商这个生态位是存在的 。在 LLM 时代 ,在大语言模型时代是有独立的数据服务公司的 。

曼祺50:09

对 , 具身目前也有 。

陈哲50:10

但是未来如果大量的是灵巧手操作的数据 ,是不是也会依然存在 ? 或者是说是不是他们也需要跟灵巧手公司建立非常深入的耦合或者是绑定 , 可能就很难一概而论 。

曼祺50:22

嗯嗯 , 那在我说的那两种可能 , 你更倾向那种可能会发生吗 ? 就是说是本体厂商有动力来自研手 , 然后也获得它的数据了 , 还是说这个手的公司它慢慢从手切入 , 然后它可以做更多 ?

就除了硬件之外, 它也有更多数据软件的东西 。

陈哲50:39

我觉得这点逻辑是这样子的 , 跟灵巧手相关的数据其实受灵巧手本身的结构构型 、 电机的选型和传感器的选型依赖度非常高 。

所以这些数据目前看来是高度依赖灵巧手本身的 。 也就是说如果你是灵巧手的厂商 , 那么你自己去设计一套数据采集的这种设备和标准是很 make sense 的 。

第三方公司其实很难把这件事情直接做好 。 那可能更关键的是 , 长期来看 , 灵巧手公司和人形的本体公司之间的关系会是什么样子 ?

曼祺51:12

或者就叫人形公司吧 ,因为那些人可能也会做大脑 , 对吧 ? 就是大脑和本体一起做的那种公司 。

陈哲51:18

对 , 就目前看来 , 人形公司大概率最终会是个全站的公司 。

曼祺51:21

对 , 全站人形公司 。

陈哲51:23

如果它是全站的公司的话 , 大概率本体 、 大脑跟灵巧手他们都想自己做 。 那核心的挑战就是说 ,是不是还拥有一个广泛的 、 非常大的第三方灵巧手厂商的一个位子 ?

我觉得这个可能是更关键问题 。 如果这个位子存在 , 那么很可能大量的数据是由这些独立的灵巧手公司去提供的 。

如果这个位子不存在 , 这些数据就应该由人形本体厂商去提供 。

曼祺51:50

我刚才本来想找一个以前的类比 , 然后我发现灵巧手还挺难找类比的 。 它既是传感器又是个执行器 。

陈哲51:57

而且它对于数据的形态跟标准要求还是蛮高的 。 我举个例子 , 如果我们看激光雷达的情况 , 实际上很多厂商的算法是并不依赖于具体的激光雷达的这个型号的 , 或者说配置的 , 或者说不同激光雷达采集的点云数据都能够通过一个管线被训练到一个更大的模型里面去 。

所以我们看到激光雷达公司并没有在数据上面有很高的画一圈 。 但是在灵巧手上面 , 我觉得不太一样的一个地方就是 , 它的数据维度和数据的格式其实跟它的硬件设计和方案设计是有很大的关系的 。

而今天市场上也没有特别成熟的方案 。 然后我们也知道灵巧手的工程复杂度是非常高的 。 马斯克一直在说这个灵巧手可能占了他们整个公司 50% 的工程的这个投入 。

导致的问题就是 , 很多公司其实并没有能力真正做出一个 sort out 的灵巧手在他们的本体上面 。 那如果这个情况发生的话 , 那是不是一个第三方的公司实际上是有一个更好的位子 , 可以采集更多的数据 , 然后服务更多的本体厂商 ?

我们如果用智驾来做比较的话 , 除了像魏小李 、 特斯拉这样的头部公司有全站能力 , 那还是有大量的公司会去采购英伟达或者地平线的方案 。

那英伟达和地平线 ,他们也会提供自己一套完整的自动驾驶方案 ,也涉及到数据的清洗 、 采集 、 标注 、 训练 。

所以我们在讨论可能长期来看灵巧手跟人形本体的关系 , 可能会是一个长期博弈 、 长期共存的一个关系 。

驱动53:32

曼祺53:32

嗯 , 然后关于灵巧手还有一个话题也是上次就讨论到了 , 我觉得以后也会持续出现 , 就是神驱和直驱的这种不同方案的选择 。

你也提到在 eCar 上还有一家中国公司 , 就是希罗未来 ,他们就是做混合方案的 。 然后 Optimus Q2 其实也有一个进展 , 就是 Optimus 第三代 Gen 3,他们也陆续披露了一些技术上的细节 , 就包括它手部是一个 22 自由度的灵巧手 , 然后它依然还是用了神驱的方案 。

陈哲54:02

对 , 这次 eCar 另外一个比较重要的发布 , 就是希罗未来的这个 Flex 2 的混合方案的灵巧手 。

曼祺54:09

嗯 , 希罗未来这家公司是什么背景 ?

陈哲54:11

希罗未来是一个拥有自研的这个电钢和机器人关节核心零部件的另一家公司 。 然后呢 ,他们在这个技术上也做出了他们的两代的这个灵巧手方案 , 尤其是在今年 eCar 发布的 , 是一款非常创新的混合驱动方案的高自由度灵巧手 。

它的混合方案体现在大量需要重载的能力 。 它的重载的能力是通过在前臂里面的电机 , 通过神驱的方式实现的 。

曼祺54:38

重载就是什么 ? 握吗 ? 抓 ?

陈哲54:40

对 , 抓握的这种能力 , 就比较大的这个力量 。 因为电机可以放在前臂 , 空间会更大一些 。 那么他们在掌心内也有这种微型的电机 , 可以提供指节上面的比较灵巧的这个操作的能力 。

曼祺54:53

所以指节上是直驱的 。

陈哲54:55

对 , 所以它叫自己是一种混合方案 , 是一种神驱加直驱的一种方案 。

曼祺55:00

那所以别的厂商展示是从腕部开始展示的 , 那它的产品是从小臂这开始展示的 。

陈哲55:06

所以呢 , 这种方案从原理上讲呢 ,是有可能拥有神驱和直驱的两重的这个优势的 。

曼祺55:14

那原理上也拥有两重劣势 ,是吗 ?

陈哲55:17

我觉得可能这个涉及到神驱的一个更大的问题 , 就是神驱的本身的劣势在什么地方 ? 为什么到今天我们也没有看到广泛的高自由度的灵巧手以神驱这种方法进行真正的出货 ?

我觉得希诺的这个混合方案呢 ,在试图解决纯神驱方案面临的一些问题 , 就是纯神驱方案为了实现高自由度 , 它可能需要非常多的这个剑身穿过一个很狭小的腕部的空间 , 才能够实现充分的自由度 。其实它的组装跟维修都是非常头疼的问题 。

那么通过一个混合方案 , 你可以把部分的这个剑身换成掌心内的电机 , 这样你只需要更少的这个剑身通过这个腕部的空间 ,而有一些自由度是在掌心内的电机去实现的 。

曼祺56:02

那它的双重优势就是它的 , 比如说抓握的力量是更大了 , 然后同时它又没有之前那么复杂 , 就混合了直驱之后 。

陈哲56:10

对 ,因为你的电机是可以放在前臂这个位子 , 就有些更大的电机 , 就没有更多的体积跟散热的限制过后, 你可以放到前臂这个位子 。

我们如果去思考人手的真实的结构 , 我们手的这个抓握力大量的是由我们的前臂肌肉实现的 ,但是我们在掌心也有些小的肌肉去可以控制一些细微的动作 。

曼祺56:34

哦 , 你说到这我还想到一个公司 , 就是那个 Origin Flow。

陈哲56:38

对 , 就做机电的一家公司 。

曼祺56:40

对 ,他们那个机电的数据采集就是做的一个臂环手环 , 它是套在你的手上的 , 然后它通过机电信号的方式采集到一些你手部操作的数据 。

陈哲56:49

对 ,其实用机电来控制灵巧手 , 或者说用机电来捕捉人手的数据并不是一个新的想法 。 十几年前在加拿大滑铁卢就有一家公司推出了一个产品 Mio 手环 , 就是专门做机电控制 。

那包括像杭州的强脑 ,他们也有一些机电控制这个低自由度灵巧手的这种尝试 。 所以这个呢 ,并不是一个新的技术 。

那为什么最近大家对这个问题更加的关注 ,是因为随着算法的这个进步 , 我们对于采集大量的数据进行数据训练和做这个 fitting 的能力是有了显著的提升 。

所以大家会非常好奇 , 通过新的这个机电的方法 , 能不能也比较好的 、 比较高精准的去还原手上每个关节的这个位子跟操作 ,以及对力的这个反应 。

曼祺57:40

嗯 , 那可以说过就是这个混合方案的这个情况 。 它如果是整个带一个前臂的话 , 它和就它的下游厂商 , 就那做整个全站的人形机器人的公司 , 它的合作方式是怎样 ?

陈哲57:53

我觉得对于绝大部分需要涉及到前臂神驱的方案 ,因为在 eCar 上面也有一家公司 , 嗯 , 原生科技 ,他们的神驱方案是不带前臂的 ,他们把所有的神驱的方案做到了手掌里面 。

当然这是另外一个话题 。 所有需要做带前臂的神驱方案 , 最大的问题就是你需要跟本体厂商有更深入的耦合跟集成 。

它不能像一个比较标准的手掌的一个产品 , 比较快的可以切换 。 比如说你看宇树或者智源 ,他们的人形机器人是不带那个手掌的 , 所以你是可以快速的切换到其他一些公司的这个灵巧手产品 。

但是对于一个需要前臂集成的一个灵巧手公司来讲的话 , 商业上讲可能更需要跟本体厂商做更深入的这个集成跟定制 。

这也是为什么我们看到了希罗未来在过去一段时间也拿到了国内非常多大厂占头的这个投资 , 实际上也是因为基本上所有的大厂在做人形机器人研究的时候 , 灵巧手上面都采用了类似特斯拉的这个神驱方案 。

曼祺58:56

嗯 , 我看理想 、 京东投资过它 。

陈哲59:00

嗯 , 我其实跟国内很多大厂的研究人员聊过 ,其实对中国所有的大厂而言 , 选择 follow 特斯拉的这个神驱路线是一个比较直接的一个选择 ,因为本身他们对本体会有一个控制 。

同时因为特斯拉还在做这个方向 , 所以让大家去选择一个不同的方向 ,其实对于很多工程师来说也是一个巨大的风险 ,不愿意承担 。

曼祺59:23

是因为他们是大公司是吗 ? 因为有向上汇报的压力 , 所以具体的负责人就不想承担这个风险 。

陈哲59:29

可以这么说 , 就是万一特斯拉是对的 , 你要去试一个新的方向 , 那谁来承担这个错误的责任呢 ?

曼祺59:36

其实上一次聊 , 你是自己是更看好直驱这个方向的 ,但是你现在从大公司的一些动作和他们的投资来看 , 好像很多大厂是在继续做神驱这个方向 。

陈哲59:45

我觉得对于一个独立的灵巧手公司来讲的话 , 我觉得做全直驱方案 , 做成一个不依靠前臂 , 可能是唯一或者更好的路线 。

因为如果你是一个需要深入定制前臂的方案 , 大概率你会变成大厂的一个定制公司 , 你很难独立做成一家标准化的产品公司 。

曼祺1:00:04

你说到这我又想到一个点啊 , 那如果说这个公司它在美国的一个生态里 , 先不考虑美国制造业行不行的问题 , 它如果是一个美国的公司 , 它在一个和大厂深度合作的位置上 ,其实它也有一个退出路径 , 就是它可能会被大公司收购 。

不过我不知道这个在国内好不好发生 。其实之前智驾的时候倒是有一些公司是被大公司收购 。

陈哲1:00:25

嗯 ,但是收购价格都不是很好 。

曼祺1:00:27

嗯 , 对 , 就是说它是不是一个价格合适的退出 。 对 , 这可能是个问题啊 。

陈哲1:00:31

对 , 你到底是因为经营不下去了被收购 , 还是因为你发展的非常好被收购 , 我觉得这个差别还是非常大的 。

曼祺1:00:37

嗯 , 所以这个季度的这些灵巧手的进展之后, 你对神驱和直驱的偏好还是没有变化的 ? 你还是觉得直驱是一个目前来看潜力更大的方向 ?

陈哲1:00:48

嗯 , 我觉得这个判断应该是有所加强 ,因为实际上我们看现在灵巧手的研究上的最新的一些进展跟突破 , 还是由全直驱手来实现的 , 无论是舞技还是下巴的手 , 本质上谁能够更快的提供可靠 、 稳定 、 廉价的灵巧手的供给 , 就能更快的成为这个行业的实时的标准 。

也就是更多的算法跟软件会围绕着你的硬件的架构去设计 。

曼祺1:01:17

那这两类目前看起来它的下游是分开的 , 就直驱的这些新的公司的手 ,他们更多是面向研究市场的 ,在做一些前沿的灵巧操作模型的研究 。

然后神驱这套方案 , 就 Optimus 这个方案 , 好像是面向更多产业方 。 虽然产业方什么时候上量 , 可能是很久以后才会发生的事 。

陈哲1:01:35

对 , 我觉得之所以会出现这个差异 , 最底层的原因还是因为 Optimus 还没有公开的放弃神驱方案 。 本质上马斯克是一个非常相信第一性原理的人, 所以呢 ,他是认为一个神驱的方向更接近于人类的这种生物的这个特征 , 所以他认为是一个更好的方向 ,以及他给工程团队也提出了很高的要求去努力 , 希望努力实现这个神驱手的这个量产 。

但事实的情况是 , 我们看到它的这个 V3 的手其实是一直是在 delay 的 , 什么时候可以规模化的生产 , 我们还未知 。

然后我们也听到不同的声音说 Optimus 也在尝试替代的方案 , 可能是一个直驱的方案 , 可能是一个混合的方案 。

但是我们可以理解 , 就是工程方案的探索是需要一些时间的 , 一个大的方案的调整也需要很长的过程 。 那对于国内的绝大部分大厂的一线工程师而言 , 选择一个 follow 策略 ,不仅是在灵巧手上面 ,在很多其他的技术路线上面 , 比如说本体的算法的构型 , 那采取跟海外大厂 follow 的策略 , 我觉得本身也是一个更保险 、 更稳妥的方案 。

那因为今天灵巧手的研究还在一个非常早期的阶段 , 我们很难说今天产业界选择的神驱方案一定就是一个真正能够量产 、 能够规模化的方向 。

世界模型1:02:57

曼祺1:02:57

OK, 那我们进入世界模型 ,4 和 5 世界模型和 VLA, 正好这两大块都是和智能能力直接相关的 ,也就是大家讨论的更偏具身智能模型的那一部分 。

我们可以先说世界模型 , 上期我们聊了世界模型之后, 可以更加明显的看到 , 世界模型现在成了一个非常火热的创业风口 ,在国内出现了很多新的公司 ,而且主要就是服务具身 Robotics 或者说物理 AI 的这些创业公司 。

有一些今年才成立的公司 , 已经非常快的成长为 10 亿美元估值的独角兽了 , 然后好几个创始人都非常年轻 。

可以先来聊聊就你在这个方向列的 , 你觉得最重要的一个进展是英伟达的 Cosmos 3, 你可以简单先介绍一下这是一个什么样的成果 。

陈哲1:03:41

我认为 Cosmos 3 是这一个季度世界模型的一个标杆 ,因为它算是这个市场上第一个提出了一个全开源的 Omni model。

曼祺1:03:52

Omni 是指大一统的意思 , 混合的意思 ?

陈哲1:03:55

全能的意思 。

曼祺1:03:56

全能 , 嗯 。

陈哲1:03:56

它这个模型是可以原生的处理不同的 input 的模态 , 包括了文本 、 图像 、 视频 、 声音 、 动作 ,也可以输出刚才提到的这各种模态 。

那这个可能是在行业第一次这么实现 。 然后从英伟达自己的定义 , 它认为 Cosmos 3 是一个全能的 world model, 可以被用来做不同的预测或者说生成的这个任务 ,也可以像一个正常的 VOA、VOM, 或者说像一个 VOA 一样去输出文字 、 图片 , 或者说对机器人的这个操作 。

曼祺1:04:30

它在技术上有一个比较重要的突破 , 叫 MOT,Mixture of Transformers。 它是两个 Transformer 的结构 , 一个是自回归的 Transformer,是用来做 reasoning 推理的 , 另一个是 diffusion 的 Transformer,是用来做生成的 。

就你跟一些研究人员的交流来看 , 你觉得这新架构的反响怎么样 ,以及它有些什么 concern 的反向的一些声音吗 ?

陈哲1:04:51

我觉得从概念上讲 , 应该是一个非常理想的概念 ,因为很长时间我们发现 , 我们做语言模型研究的和做这个图片 、 视频生成研究的模型 ,其实是两套不同的架构 。

曼祺1:05:04

后面那个是扩散模型用的比较多 。

陈哲1:05:06

对 , 本质上就是一个模型是更善于处理离散的这个信号 , 比如说文字离散的这个 token, 一个更善于处理连续的信号 , 就 diffusion 更善于处理连续的序列 、 图片 、 视频这样的信号 。

那么很长时间这两个模型其实是孤立的 。 那在 Cosmos 3 里面 ,其实是用了一个非常巧妙的分工和统一的一个架构 , 本质上就是自回归模型是一个独立的 Transformer, 这个 diffusion model 也是个独立的 Transformer,但是它们中间有 shared 的这个 attention 机制 , 这样让它们的一些状态可以相互之间的影响 。

所以呢 , 相当于是把两种很不一样的模态的这个模型可以缝制到了一起 。

曼祺1:05:52

而且它是统一了理解和生成 ,其实这个是之前大家就一直在探索和想做到的嘛 。 它能把它实现是有什么蹊跷吗 ?

还是说现在虽然它在结构上给它实现了 ,但可能效果上还没有那么好 ?

陈哲1:06:06

其实刚才说的就是它的架构原理是一个 Mixture of Transformers 的架构 , 所以相当于是一个 input 会被两个管线在动态的进行这个调节跟处理 。

这也是为什么这个模型本身是一个比较庞大的一个模型 。 我觉得从架构的原理上讲 , 这是很创新的 。

曼祺1:06:26

它是在 Cosmos 3 上才实现了这个全能这种统一是吗 ? 就是和之前比如说和 2 和 1 它的区别是什么 ?

陈哲1:06:35

其实没有独立的 Cosmos 2 这样一个品牌 , 就是 Cosmos 最早发布的时候应该是在 25 年 CES, 然后在去年和今年初它有一个迭代 , 就是把它的这几个模块迭代到 2.0 的版本 。Cosmos 3 是这是新出来的这个品牌 , 之前其实是几个独立的模型 ,有一个独立的 predict 的模型 、transfer 模型和 reason 模型 。

那这次相当于是把这几个模型缝制到了一个统一的架构里面去 。

曼祺1:07:02

其实我以前对 Cosmos 的理解 , 我觉得它是个视频生成模型 。

陈哲1:07:07

对 。

曼祺1:07:07

但是到 Cosmos 3 的话 , 好像就不能简单的说它是个视频生成模型了 。

陈哲1:07:12

它包含了一个视频生成模型 。

曼祺1:07:13

因为它其实也能直接生成动作 。

陈哲1:07:16

对 。

曼祺1:07:16

对吧 ? 直接生成动作理论上它应该就是能给机器人用的 ,因为机器人就是要生成动作轨迹嘛 。

陈哲1:07:22

对 , 所以在 Cosmos 3 之前 ,其实是有一个 Cosmos policy 这样一个子的模型 , 实际上是用之前的这个 Cosmos 模型加上了一个动作的 head, 这样它就可以直接输出机器人的这个操作 。

但这一次实际上是把大家统一起来了 。 可能在英伟达的这个 scope 里面 , 它是一个更大的 picture, 就是 Cosmos 3 实际上是为英伟达的这个芯片和算力的平台进行优化的 。

同时英伟达也想推广它的一套机器人的开发的这个套件 。

曼祺1:07:52

嗯 , 它这个应该也可以用在自动驾驶 , 对吧 ?

陈哲1:07:55

对 ,因为它是一个通用的世界模型 , 只是这个世界模型可以输出不同的模态 , 这就为什么它是一个 Omni model, 就是它可以输入所有的模态 ,也可以输出所有的模态 , 只是在不同的组合下面 , 它这两个 Transformer 的激活程度和 active 程度是不一样的 。

那在有些模态里面 , 可能只需要那个 auto regressive 的那个 Transformer 被 active 就可以输出了 。 比如说假设这是一个图片到文本的任务 , 可能这个就够了 。

但是如果它是一个文本图片到动作和视频的任务 , 那么它就需要激活下面那个 diffusion 这个 model。 那从这个思路来讲 , 我觉得它是开拓了一个很好的 Omni model 的一个思路 。

我相信可能其他的大公司 , 包括中国的大厂 , 可能之后也会开发出类似的思路出来 。

曼祺1:08:45

也会跟进这个 。

陈哲1:08:46

对 ,因为从原理上讲 , 我觉得它还是一个比较优美 、 比较理想的一个架构 。

曼祺1:08:51

那正好从 Cosmos 3 你可以进一步聊到近期整个非常火的世界模型 , 应该算一个大的创业投资的风口 。 我们可以缩小一下范围啊 , 就是我们就聊和 Robotics 相关的世界模型 。其实哪怕收缩到这个领域 , 它也有很多东西都被叫做世界模型 ,但它可能不太一样 。

你会怎么来分类啊 ?

陈哲1:09:12

对 , 世界模型的定义非常的多 。 我用那个 6 月份英伟达写的那篇的一个世界模型的官方综述里面的分类 , 它其实分成了三种 。

最底层的是叫 Video World Model, 那这里面的代表可能就是 Google 的 Vue、 阿里的这个 One。 它们本质上的底座是一个视频生成模型 , 就是根据一些条件或者描述 , 我可以生成这个视频 ,也就是对未来状态的一个预估 。

曼祺1:09:42

对 , 它们自己是把 Cosmos 3 也放在这个分类里面 。

陈哲1:09:45

因为 Cosmos 3 是一个万能的模型 。

曼祺1:09:47

Video World Models。

陈哲1:09:48

对 , 然后在这个基础上呢 , 下一种概念呢叫做 Action Conditioned World Model。Action Conditioned 指的是它的前提是基于你的这个动作的 , 或者说给定的一个动作 , 你可以在给定动作条件下的 。

曼祺1:10:05

世界模型 。

陈哲1:10:06

世界模型 。

曼祺1:10:06

嗯 , 就说我加支一个动作到这个状态里 , 然后预测世界的下一个状态 。

陈哲1:10:11

对 ,而且这里面动作可具体是指的就是物理世界的动作 。

曼祺1:10:15

嗯 ,因为我看他们是把 DreamDojo 还有 Genie 这些 , 还有 GEPA 他们都是算在这个类别里的 。 因为我之前和 DreamDojo 的一座 , 就 Gear Lab 的一个研究员高深演员聊过 。

那我理解他描述 DreamDojo,其实它是一个世界仿真器 。

陈哲1:10:30

它是一个世界仿真器 ,但是这个世界仿真器的 input 是你的动作 , 就是你想干什么 , 你想对这个动作产生什么样的变化 。

而这个世界模型训练的过程中 ,是会基于它的这种 ground truth, 或者说它训练的这个原材料里面 ,其实就包含了一种真实的物理变化 , 会对这个环境带来什么样的影响 。

它是在记录很多这种变化 。

曼祺1:10:55

对 , 它当时跟我说的 action 的类型还挺多的 , 就是它会把比如说我的一段文字指令 , 它认为那也可以被视为一种 action。

不过在具身领域 , 可能更多还是机器人的动作是一个 action, 对吧 ?

陈哲1:11:07

对 , 我们一般说这个 action 是指的机器人的这个 action,但是你一个文字可能也是对环境的一个影响 。 所以从这个角度来讲 , 我觉得一个纯粹的 Video World Model 以生成视频为目的的 model 和一个 Action Conditioned World Model 可能相似之处都是你有某一种 input, 只是你这个 input 到底是一个文本的描述 , 还是一个物理的动作 。

比如说我朝前走 、 朝后走 , 我去拿这个东西 , 或者我去改变某一个环境 。 比如说 Genie, 如果你把 Genie 也当做一个 Action Conditioned World Model 来讲的话 , 那就是人在这个空间里面的移动的指令 ,是对这个 World Model 生成的一个 condition。

曼祺1:11:44

然后英伟达分的这个第三类是 ?

陈哲1:11:46

这个 World Action Model,WAM。

曼祺1:11:49

嗯 , 哦对 , 这个图我待会也会贴到 show notes 里面啊 。WAM, 就是现在特别火的这个方向啊 。

陈哲1:11:54

对 , 核心就是我们通过这个模型来生成机器人的这个动作 , 那可能它同时也能够生成这个未来的这个这个图像或者视频 。

曼祺1:12:03

就是它既生成了未来世界的状态 ,也生成了机器人的动作 。

陈哲1:12:07

对 , 所以它更是一个 policy。 所以不管是像 DreamZero 啊 , 像蚂蚁的这个 Limbo VA, 都是属于这样的一个定义 。

曼祺1:12:16

嗯 。

陈哲1:12:17

对 , 所以在具身领域 ,因为我们更关注的还是机器人该怎么去响应和操作 。

曼祺1:12:23

所以 WAM 是最火的 。

陈哲1:12:25

对 ,是我们目前最关注的一个方向 。

曼祺1:12:26

嗯 ,因为它是直接用在机器人上的 , 它作为一个策略 , 对吧 ?

陈哲1:12:29

对 ,但你也可以想象就为什么 Cosmos 3 从这个概念的提出是很有意思的一个想法 。其实我跟一些北美的实验室专门做 LAM 的同学聊过 , 从他们角度其实不太理解为什么我们会发明 VLA 和 World Model 这两个对立的概念 。

曼祺1:12:46

他们认为这是一个东西 。

陈哲1:12:48

或者说他们的想象中最好的模型就应该是个 Omni model。

曼祺1:12:52

就是 Cosmos 3 这个方向 。

陈哲1:12:53

对 , 所以我认为 Cosmos 3 可能在一定程度上代表了大家对这种模型的一种终极的思考 , 就是它作为一种智能的模型 , 它就应该 take 不同的模态和可以输出不同的模态 。

因为从今天的 Cosmos 的角度 , 它实际上就是对外的展示 , 它就是一个模型 , 它只是内部有了一套 mixture 的机制来共享一些状态和不同的这个 pipeline。

但是从输入端和输出端的角度来看 , 它就是一个整体的模型 。

曼祺1:13:23

就你刚才说你跟一些做 LLM 的人聊 ,他们认为这两个东西被对立起来 ,他觉得很费解 , 对吧 ? 其实这也 cue 到了你前面在说 , 就是比如说像 Gen-1 还有 Pi 0.7,他们可能都是融合了一些 VLA 和世界模型的 。

就是你觉得本身他们的叙事也不是谁替代谁的这么一个关系 , 对吧 ?

陈哲1:13:43

对 , 或者我们回到本质来看 , 今天的 VLA 其实是更擅长的是生成这个指令 , 生成这个动作 ,而 World Model 本质上作为一个以视频为 backbone 的一个模型 , 它更擅长的是对状态的一个预测 。

那这两种能力如果我们有一个巧妙的方式结合到一起 , 那从终极的性能来讲肯定是更好的 。

曼祺1:14:05

你怎么看现在这块的创业和投融资的一个热潮 ? 我感觉这次的转化好快 , 就是 DreamZero 或者说这一类的成果吧 , 就是去年底 , 对吧 ?

然后马上就有一些新的公司 ,以及它们的估值和融资额都成长的挺快 。 我们可以先盘一下, 你知道现在有哪些大的世界模型吧 ?

不一定是特别具体到比如做 WAM 或者什么这种方向 , 就说自己在做世界模型的投资市场上有哪些公司 。

我可以先说我知道的 , 你可以补充一下可以吗 ?

陈哲1:14:35

好的 。

曼祺1:14:35

我觉得最近比较火的 , 就刚才我们提到比如像 Genesis 似的 ,LibreAI 其实也是 , 对吧 ? 它们也都是具身智能的公司 , 还有一个公司叫流行空间 Manifold, 还有逆矩阵 , 还有模式星空 。

我说的这是我知道的一些可能跑得比较快的 。 我之前也和就其他投资人聊 , 应该就是 4 月初的时候吧 , 就跟我说那会儿已经有人整理出 49 个实现模型公司了 。

还有一个成立比较久的极佳世界 , 这个应该是目前估值最高的 , 这家是 23 年就成立的 。 然后我刚才说的那些基本上都是在 25 年以及 26 年成立的 , 这都是中国的公司 。

然后海外的公司其实我们上季度聊到过一次 , 就是在 GDC 期间宣布融了 4.5 亿美元的 Rhonda AI, 它之前是水下了一年的状态 。

然后我们聊完没多久 , 我知道就是英伟达 Gear Lab DreamZero 的这个团队的 leader 周章 , 这是一个韩国人, 就他的名字我不一定发的对 ,他也出来创业了 ,但是他是在美国成立的新的公司 。

就海外也有一些新的公司出来 ,也就这几个月的事 。 你还有啥补充吗 ?

陈哲1:15:37

对 , 我觉得可能具体的公司很难列全 ,因为就像刚才提到的 ,World Model 其实是一个蛮大的概念 , 可能太多的公司都可以贴上这样一个名字了 。

所以我很难具体看每一家公司到底是不是做纯粹的 World Model, 还是说它做的事情跟 World Model 有多大的相关性 。

但是我可以说的是 ,World Model 为什么是一个这么大的一个变化或者是一个冲击啊 , 本质上还是因为我们看到了 VLA 这种方法 , 就是一个 Video Language Model 加上这个动作的这个序列 ,以这个路径迭代下来的方法 ,其实遇到了一定的性能的瓶颈 。

那由视频生成的这个路线来做这个机器人 policy 的方法 ,其实早在 23 年就有工作去尝试 , 包括我上次访谈里面也说到的 ,其实字节做的 GR1 和 GR2 两个工作 ,也是在 Video Action Model 里面一个比较早期的尝试 。

但是因为之前 VLA 可以更快的给出一个 60 分的答案 。

曼祺1:16:39

嗯 。

陈哲1:16:40

而且这里面的典型代表就是以 Pi 0 的发布为例 , 本身也是一个开源的 ,也是代表了当时市场的缩大 , 所以有很多团队去快速的跟进 。

曼祺1:16:48

嗯 ,Pi 0 是 24 年 10 月底发的 。

陈哲1:16:51

对 ,因为 VLA 的这个方法 , 如果我抽象来讲的话 , 它本质上是一种行为克隆 , 就是我们把一段文字和图片的描述和一段机器人运动的这个信号进行了某一种联系 。

如果我人去反复的试教了这样一个动作 , 那么我们一定能够建立某一种联系 , 让 VLA 可以输出类似的这个机器人关节的信号 。

但是这个路线的泛化性的局限是非常明显的 。 视频生成这个路线 , 我们可以用到更大量的 、 更海量的数据的这个 know-how, 这里面也包含了大量的物理的这些先验的知识 。

所以这个路线从原理上讲 , 本身就是很有吸引力的一个路线 。 但是在 23 年, 我们最早开始做这方面尝试的时候 , 你是没有一个很好的视频生成模型的 , 你也没有一个像 One 这样就是被预训练好的 、 比较好的开源的这个模型 。

你也没有一些 , 比如说像我们后面搞出来的这个 diffusion policy, 用 diffusion 方法去生成这个连续性的关节序列 ,也没有那个 flow matching 这样的方法 , 可以生成一些比较好的这个关节的这个办法 。

这些东西可能都在 24 年、25 年才逐渐成熟的 。 所以 World Action Model 的很多基础的 recipe 三年前就有了 ,但是它的能力是到了 25 年底 、26 年初的时候才逐渐得到释放 。

包括从我自己来看 , 为什么我会觉得这个事情非常的兴奋 ,因为我们看今天所有的视频生成模型 , 比如说可灵 , 比如说 Seedance, 比如说 Veo3, 已经达到一个很高的水平 , 就是它对物理的理解 , 对于常识的理解 , 已经到了很好的一个状态 。

那我用它来做机器人的预测和这个策略 , 理论上就可以得到很好的效果 。 所以我认为这一系列要素的出现 ,是让这个概念在 26 年突然爆火的一个原因 。

曼祺1:18:41

如果说这个技术进展让你感到很兴奋 ,是偏开心的这种心情 , 那你看到现在这么多公司融这么多钱 , 作为投资人你是什么心情啊 ?

陈哲1:18:51

我觉得本质上是因为大家在大模型里面赚了一些钱 , 所以赚了钱的人就会把更多的钱投进去 ,以及没有赚到钱的人也会在这一波把钱投进去 。

曼祺1:19:00

嗯 , 赚了钱的人继续投 , 没赚钱的人补票 。

陈哲1:19:03

对 。

曼祺1:19:04

然后以及具身是个很大的方向 , 出现新的技术刺激就会有人投 。

陈哲1:19:08

对 , 我觉得底层是有这样的一个要素啊 。 然后这也是为什么在非常短的时间 , 这个估值能够上涨这么大的一个一个诱因 。

但是从更长的角度来讲 , 我觉得第一就是在具身这个领域 ,不管是硬件还是模型 ,其实中国公司都有非常好的资源跟能力 , 这也是一个长期战略的方向 。

那国家在这方面有非常多的这个支持跟战略的投入 。 那对于立志要成为这个领域世界级公司的创业公司来说 , 这应该是个非常好的发展机遇 。

那我认为对投资来说 , 大家也是看到这样的一个机会 。 这个到底是不是像当年电动车浪潮一样 , 对吧 ?

有可能有 100 多家公司分别成立去做电动车 ,I don't know,但是一波大浪肯定是有大量的人才跟资金的涌入 。 所以我觉得这波其实也反映了这波变化来的有多么的剧烈 。

曼祺1:19:55

嗯 , 那最后我们讨论的一个 TOP 5 的进展 , 就是在当前火热的世界模型趋势下, 反衬的好像有点过时的 VLA。

模型1:19:55

曼祺1:20:03

你提到了两个具体的进展 , 这个都是 4 月初到 4 月中旬出现的 , 一个是 Physical Intelligence 的 Pi 0.7 的发布 , 还有一个是 Generalist 的 Gen-1 的发布 。

陈哲1:20:16

对 ,其实我觉得给它们是不是贴上 VLA 的标签 , 可能都不是最重要的 。 我提到它们呢 , 我认为它们是现有的模型公司 ,在这个季度里面其实取得的蛮有启发性和蛮有创新性的这个突破 。

曼祺1:20:31

嗯 , 那可以分开来讲 , 比如说 Pi 0.7, 你看到了一些启发是什么 ?

陈哲1:20:35

首先我觉得 Pi 是一家非常创新和稳步迭代的公司 ,其实从 0.5、0.6 到 0.7, 每一版本的迭代都非常明显 。 那么到了 0.7 这一点 , 如果让我一句话去总结它跟之前的版本最大的区别是什么 , 我可以说是在一个传统的 VLA 的基础上, 接上了一个轻量的世界模型 。

然后这个轻量的世界模型可以提供对未来任务的图像的预测 , 然后用这个预测来影响生成的这个模型去生成相应的动作 。

曼祺1:21:06

它这个轻量的预测指的是 , 比如说我现在的手指动到这个位置 , 假如说我要去拿这个杯子 , 我指动到这个位置的时候 , 它就能预测我 。

陈哲1:21:15

未来 , 未来几帧这个应该是什么样子 , 它就会生成 。

曼祺1:21:18

然后这个物体的 , 比如和我之间的位置关系啊 , 或者说它的形变什么的之类的 。

陈哲1:21:22

对 , 然后由我判断的可能未来一段时间的这个结果的图像 。

曼祺1:21:27

嗯 。

陈哲1:21:27

然后我用那个图像来 guide 你的这个动作的生成 。

曼祺1:21:31

动作的生成 。

陈哲1:21:31

相当于就是一个很轻量的 、 带有一定预测性的未来的一个子目标图 , 反馈到了这个 VLA 的这个生成的这个过程 。

曼祺1:21:41

这好像还挺符合人自己的直觉的 ,因为人干很多事 , 我觉得你是大概能想象到它能怎么样 ,但可能你执行的没有那么精确的时候 ,有一类动作是比较明显的 , 就是你会脑补一下的 。

就是你要扔一个东西的时候 , 比如说你要扔一个纸团到一个有点距离的垃圾桶里的时候 , 你会脑补一下这个轨迹 。

陈哲1:21:58

对 , 我觉得讲的挺好的 , 就是我们的脑补 , 就是说我们用什么样的力 、 什么样的角度可能会导致什么样的结果 。

所以我们会根据我们的脑补去调整我们的角度跟力 。 那回到 Pi 0.7 呢 , 我觉得 Pi 一直在引领 VLA 研究的这个前沿 , 包括我们上次季报的时候提到 , 它其实是在 0.6 的时候提出了一些新的能力 , 包括类似像一个长时间 agent 规划的一个能力 。

它有用了一种文本记录的方法 , 把今天的状态进行了一个持续性的存储 , 然后可以根据之前观测到的状态来规划我具体执行的动作 。

那很多小的这种改进 ,在 Pi 的每一个版本里面 , 我们觉得都是在那个时间点非常创新或者非常引领这个行业的 。

曼祺1:22:46

嗯 , 那然后可以聊一下 Generalist Gen-1 的这个进展 。 我自己的体感啊 , 我觉得大家就国内的这些从业者里面 , 对 Generalist Gen-1 的这个讨论度是更高的 , 就是相比于其他的一些模型 。

陈哲1:23:00

对 , 它引起更多的关注 。 我觉得有几点是取得了显著的突破的 。 第一个是它把大家觉得比较慢的 VLA 模型的执行速度能够显著提高 ,不再是慢悠悠的去执行一个任务 。

第二个呢 ,在一些比较复杂的长程任务里面 , 它们宣称的实现了这个非常高的这个准确度 。 它有几个任务应该是从百分之六十几的平均成功率提到了百分之九十九 。

这个数字的提升 ,其实反映了它们模型这种任务能力的显著的一个跨越 。 我觉得还有一点就是大家非常关注这个 Gen-1 的工作是 , 实际上它们是自己采集了 50 万小时的真实世界的交互数据 , 是一种 UMItype 的无本体数据的采集 , 是一个非常高效的方法 。

同时呢 , 它们用它们的 50 万小时数据 ,在没有一个 pre-trained 的 VLA 的基础上, 相当于自己训练了一个断断断的模型 。

我觉得这点其实体现了团队对它们自己技术路线的高度自信和它的模型其实有比较强的这个 scaling 的能力 , 让它可以用上这么多数据 。

而且它们在它们的报告里面也清晰的展示了在不同的数据量级 , 可能 1 万小时 、 几万小时到 50 万小时的这种数据规模上, 它的泛化性和能力都能得到显著的提升 。

曼祺1:24:20

这其实在展现 scaling law 是否在这个上面有效 。

陈哲1:24:24

对的 , 或者从 Generalist 的自己的 claim 来讲 , 它们一直是宣称它们是找到了这个 scaling law 的这个钥匙的 。

曼祺1:24:33

你刚才说它就是没有在这个 VLM 上微调 , 展现了这个团队非常有自信 ,是因为这个做法很罕见是吗 ?

陈哲1:24:40

我觉得在研究界大家容易出现路径依赖 , 尤其是当有些方法证明有一定成效的时候 。 那典型来讲 , 可能国内的很多模型团队因为这个 Pi 的开源 , 所以很多团队会在 Pi 的这个基础上做大量的这个后训练和这个微调的工作 。

而且大家喜欢拿它作为一个 benchmark 来证明说我比 Pi 0.5 可能增加了多少多少的性能 。 那这一方面也说明 Pi 在制定这个行业标准或者引领这个行业标准上面的影响力 ,但另外一点也是说明要独立开创一个新的技术方案 , 投入这么大的这个数据量去采集训练 ,是需要相当大的勇气跟决心的 。

曼祺1:25:22

嗯 , 所以对同为美国公司的 Generalist 和 Pi 来说 ,Generalist 肯定是不屑去跟别人的 , 那相互之间都不屑去 follow 对方 。

陈哲1:25:31

我觉得这是我对美国创投生态的整体的一个观察 , 就是我觉得美国的创投环境或者创业环境整体上是非常奖励创新的 。

你很难见到两三个团队讲一模一样的故事 , 很多团队还是想方设法的在技术上面 、 在路线上面找到一些差异化的这个方式 。

那投资人也会也会奖励第一个做这件事情的人。 本质上美国的巨头公司是非常多的 , 非常活跃的 ,而且巨头本身也有大量的创新业务 ,有自己的这种前沿的实验室 , 很多很好的工作本来就是像 Google 啊 , 像 Meta 啊 , 像像 Amazon 这样的一些公司推动的 。

曼祺1:26:08

包括像我们讨论区上就会提到很多英伟达 。

陈哲1:26:10

是的 , 所以在美国做一个硬科技的创业公司 , 我认为市场的惯性和投资人的认知里面 , 就是如果你不能做出非常有差异性的 、 有创新性的事情 , 你是很难获得加速度 , 你很难获得市场的认可 , 你很难获得投资的认可 , 你也很难被 acquisition,而被大企业收购本来就是美国很多硬科技创业很正常的一个 exit。

所以我会发现美国有一些 ,而且这个不只限于具身领域 , 可能在很多别的领域 , 你会觉得有些公司可能是为了创新在创新 ,因为在美国本身大企业的创新就是很有效的 , 就是很有竞争力的 。

如果你只是做一些更便宜的或者是同样的东西 , 你在美国市场是很难得到客户的认可和获得产品的溢价 。

曼祺1:27:00

回到 Gen-1 的这个具体进展 ,因为前面提到 Pi 0.7, 它是在里面其实是加了一个轻量的世界模型的 。 从 Gen-1 目前的公开信息来看 , 能看出来 Generalist 的这个团队对世界模型的思路是什么吗 ?

陈哲1:27:14

公开的信息来看 ,他们其实是比较排斥把自己定义成世界模型或者说 VLA 这样的标签的 。Peter Florence 专门写过一篇文章 ,他的大意就是说他们的做法既不是把动作粘贴到 VLM 上面变成 VLA,也不是一个世界模型 ,而是他们的模型是完全按照物理交互的原生的数据去训练的 。

这是为什么他们采集的这几十万小时的数据可以直接用来训练一个 Transformer 的 network,而不需要依赖比如说 VLM 或者是一个 video generation model 作为它的 backbone。

曼祺1:27:54

所以它是一个它自己的方法 ,因为它也从来没开源过 , 所以外面不仅并不知道细节 。

陈哲1:27:59

具体的细节不知道 ,但是同样的思路 ,因为因为他们这群人从 Google 出来嘛 ,其实同样的思路在最早的 Google 的这个开山的那个工作 , 就是 RT1 里面其实是是展示过的 。

曼祺1:28:10

嗯 ,其实 RT2 就是 VLA 这个风潮的一个起点 。

陈哲1:28:14

但是在 RT2 出来之前的 RT1 其实就是训练了一个中等 size 的 Transformer model, 然后它的 input 是文字描述和一些动作的这个图片和一些关节的序列 , 然后它的 output 就是根据了这些文字的描述 , 我可以在线关节的这个 output。

而当时那个模型的 backbone 就是一个独立训练的 Transformer model。

大厂1:28:40

曼祺1:28:40

正好聊到了 RT1、RT2, 比较有意思的是 ,其实这个季度 Gemini Robotics 他们其实也发了新的模型 ,4 月的时候就是叫 ER1.6,但你没有把它排到你觉得比较重要的 TOP 5 的进展里面 。

你怎么看现在整个 Google 或者说 Gemini Robotics 在这块的成果和影响力 ?

陈哲1:29:01

Google 的 Gemini Robotics 还是一个比较大的部门 ,其实在推进的研究是比较多的 。 那么最近公开的 ER1.6 的这个模型 ,其实它的全称是叫做 embodied reasoning 1.6。

你可以想象它是一种更好的 VLM model, 它并不能直接输出机器人的控制或者 policy。

曼祺1:29:21

就它不是一个策略模型 ,不是直接用在机器人上 。

陈哲1:29:24

对 , 它的这个相当于 VLM 上面是提供了更多对于空间和任务的理解和 reason 的能力 。 实际上就是可以更好的通过这个图片 、 通过这个视频视觉 , 可以更好的对物理的一些环境或者一些条件进行描述和推理 。

曼祺1:29:41

它其实背后是 Google 做了整个具身的一个生态上的思路 , 就是他们想做这个领域的安卓 。 所以 ER1.6 发的时候 ,他也说了一些合作的情况 ,其中一个载体就是落在波士顿动力的四足机器人 Spot 这个狗上 。

然后他还提到的合作方有一个就是你上次说到的 Eptronic, 你说当时他们其实和 Google 开发也是有一些 delay 的 。 还有一个公司就是司令的人形机器人 Agile One, 就看起来它是想做这个 Robotics 的安卓 。

你觉得这个思路现在有市场吗 ?

陈哲1:30:15

我觉得 Google 肯定都是想做一个偏大脑或者偏这个 API、 偏这个软件的这个位子 。其实我觉得 ER1.6 这个工作就是在说明他们希望发挥他们在语言模型方面的优势 , 然后增加一些高层空间的这种推理跟理解 , 然后把它封装成一种可以被调用的产品被大家使用 。

实际上如果你去看 ER1.6 的这个报告 , 它作为的对比是直接跟 Gemini Flash 3.0 的模型去做对比的 。

曼祺1:30:45

哦 , 它是和通用模型做对比的 。

陈哲1:30:47

是的 , 它就是一个通用模型 , 只是这个通用模型训练了更多对物理环境的理解 。 那么你刚才提到的波士顿动力那个合作工业巡检的这个工作是一个很典型的工工作场景 。

波士顿动力的 Spot 机器狗 , 目前出货量我之前知道出货量应该是有几千只 , 真正用到了工业的巡检 ,也就是一些比较复杂的油漆填的这种场景 , 然后机器狗需要上下楼梯 , 需要进一些比较复杂的地形 , 然后它在这种油漆设备里面主要的目的就是去检查这些各种传统的这种阀和这种 panel 上面的这些数字 。

曼祺1:31:23

仪表盘上的数 。

陈哲1:31:24

仪表盘上的数字 。

曼祺1:31:25

所以波士顿动力的这个狗就是它既负责读这些数 , 然后它也会去检查有没有一些异常值 。

陈哲1:31:31

所以我觉得 ER1.6 实际上是一个通用模型 ,但是增加了对空间的这个理解能力 。 这也代表了这种大厂对于这个问题的一个思路或者态度 。

如果它可以用通用的模型把这个问题解决 , 那么最终可能它就真的只需要训练一个 omni model 来解决所有的事情 。

曼祺1:31:51

那你觉得这让对小公司是意味着什么了 ? 那现在看起来好像它和很多中小创业公司是有挺多合作的啊 。

陈哲1:31:57

比如说以它现在这个合作这几家公司 , 相对来说还是偏这个机器人本体和硬件公司 , 所以他们之间其实是有天然的这个契合度的 。

我觉得可能更底层的问题或者更底层的问题是 , 我们到底有什么原因来说明很多年以后所谓的这个 embodied AI 的 model 不是由 Anthropic、OpenAI 或者是 Google 这样的这个通用模型的大厂来提供的 。

如果 omni model 这个路线被最终证明是有效和有用的 , 那是不是机器人的所有的空间的理解 、 对动作的预测可以被融合到一个更大的通用模型里面去 ?

曼祺1:32:37

呃 ,因为这个问题时常被讨论啊 , 就比如说有一种马上想到的反方的观点 , 就是认为就这种模型在形成的过程中间 , 它是需要大量的硬件参与的 , 需要这些硬件去收集数据 。

而很多通用的模型公司它就不做这一部分的事 , 或者它非常不擅长 。

陈哲1:32:56

可能今天的确不擅长 ,因为没有为这个事情优化 ,但实际上我们也知道大模型公司是花了几十亿 、 百亿美金在做各种语料跟数据的标注的 , 只是主要是文本跟图片数据 。

曼祺1:33:10

哦 , 你说到这个就是 OpenAI 确实在 5 月底的时候更加正式的官宣了他们 Robotics team。 当时 Sam Altman 是发了一个 Twitter,他里面讲了几个关键词 , 一个是说他们在寻找顶尖的全栈人才 ,他后面列了一堆 , 就包括硬件 , 然后有系统 ,有机器学习等等 ,他们要做对社会有用的集成 。

这是一个关键词 。 第二个关键词是场景 ,他提到了短期的场景是来制造给他们自己用的 infrastructure, 应该指的就是 AI 算力的一些基础设施 。

然后长期来说 , 这个愿景就是挺普罗大众的 , 就是我要做一个每个人可能都会用上的机器人。 以及他还提到了一些技术演进的线索 , 就提到这个团队的 leader 是 Arditya Ramesh, 然后他过去一年都在领导这个团队 , 慢慢在过去一年里演变成了 OpenAI Robotics。

这个人我稍微看了下他的背景 ,他是呃 DALL·E 的作者 ,而且他是本科毕业就进了 OpenAI 的 ,他并没有就是读博士什么的 , 纽约大学的 。

陈哲1:34:13

对 , 我知道的情况是 OpenAI 的 Robotics 团队就是基于他们之前做 DALL·E、 做 Sora, 就是做这个图片视频生成的团队来建立的 , 或者说这个是他们一个技术的基础 。其实 OpenAI 呃内部对 Sora 的一个定位 , 或者说对 Sora 的一个解释 , 一直认为它就是一个世界模型 。

曼祺1:34:36

他们最开始发说就是这样说的 。

陈哲1:34:37

是的 。

曼祺1:34:38

而且这里我再补充说一点 , 就是这个人就 Ramesh,他之前带领的这个团队 ,他们在内部的他这个名字在推特上写的是 World Simulation Research, 世界仿真研究 。

陈哲1:34:48

对 , 所以我觉得 OpenAI Robotics 在今天这么高调的成立 , 实际上就是看到了这一系列技术的这个拐点或者是突破 。

曼祺1:34:58

你觉得它会在这个上面投入多少 ? 因为之前一段时间 Anthropic、Claude Code、Claude Cowork 这些非常强势的增长 , 我觉得给 OpenAI 还是有比较大的压力的 。

所以有一段时间看起来它把 Sora 2 也关掉了嘛 ,有一种收缩和重新聚焦的趋势 。 那在第二季度它又宣布了 Robotics 这个新的团队要正式开始扩招更多的人, 实际上它真的会把它当一个重点吗 ?

陈哲1:35:24

我想分享我一个观察 ,其实今天哪怕最大的 embodied AI 的研究团队 ,他们真正涉及到的算力和模型的规模 , 相比于旗舰的视频生成模型 , 更不用说旗舰的语言模型来讲 , 都是一个非常小的一个量级 。

曼祺1:35:43

比如说呃 Gen-1 说它是 50 万小时的数据 。

陈哲1:35:47

不是数据量的区别 ,而是它真正用到的算力 。 我以 Cosmos 3 为例 , 我认为 Cosmos 3 应该已经代表了今天 embodied AI 在训练模型上面投入的最高算力的预算 , 大概就是在万卡级别的水平 。

这已经是今天整个具身研究算力的天花板了 。 所以以这个标准来看的话 ,其实对于 OpenAI 或者对 Anthropic 这种头部的 LLM 公司来讲的话 , 都不是特别大的呃算力预算 。

曼祺1:36:17

你的意思就是说它也不需要把它作为一个特别大的重点 , 已经比大部分具身团队投入的多了 。

陈哲1:36:23

对 , 或者同样可能一个类比的比较就是蚂蚁的凌波团队 ,也应该凌波 VA 也就是在万卡级左右的水平 。

曼祺1:36:32

我还有一个问题 , 就是它现在想做全栈的这种形式 。

陈哲1:36:35

因为机器人研究不能离开硬件 , 我觉得说白了研究今天还在很早期 ,因为研究在很早期你脱离了硬件 , 你的研究东西很难得到验证 , 所以你一定要跟硬件走得近 , 你的研究才会高效 。

我知道的就是 OpenAI 会是一个灵巧手的一个特别大的一个投入和研究的这个方向 , 就它都要进这个市场了 , 它不可能再去搞假抓 。

曼祺1:36:58

你觉得 OpenAI 的这个动作接下来会带来什么连锁反应啊 ?

陈哲1:37:01

我认为 OpenAI 能够在这个时间点高调的重启机器人这个业务 ,其实也是说明他们看到了技术上面的成熟度和跟自己这个核心模型能力的这种相关性 。

因为我们知道他们在 4 月份的时候其实是关闭了这个 Sora 的消费级产品的这个接口 。

曼祺1:37:18

Sora app。

陈哲1:37:18

对 ,但是实际上 Robotics 的核心的很多成员就是从 Sora 团队过去的 。 因为本身 Sora 一开始的一个目标就是想做一个呃世界模型 , 或者说具有这个世界模拟的这样的一个能力 。

所以我认为 OpenAI 在这个领域的投入呃应该会跟我们关注到的这个世界模型这个路线是比较相似的 ,有相关性的 。

然后考虑到他们是一个有相当大算力 , 同时也能够吸引一些非常顶级的这个研究员的一个环境 , 我还是很期待它在未来一段时间在这个领域可以拿出一些行业梭哈的进展的 。

曼祺1:37:56

嗯 , 那最后就是我们来聊一下前面 TOP 5 进展没有涉及的一些变化 , 一些重要的事件 , 包括资本市场还有商业落地的一个很重要的事 , 显然是宇树 IPO。

展望1:37:56

曼祺1:38:07

当然我们上一次已经就讨论它招股书的一些情况 , 包括宇树的一些发展历程 , 它特殊的一个行业里的位置 。在二季度它是正式科创板 IPO 过会了 , 接下来我们马上就会看到它登陆科创板 。

头部公司前面这一批上了之后, 你觉得后面公司会怎么样 ?

陈哲1:38:26

我觉得宇树的上市对于具身行业的发展跟投资应该都是一个标志性的活动 。 本质上它给今天所有的头部的具身公司制定了一个估值的锚点 ,其他的具身公司都会以这个作为一个呃估值的基准 。

通用型的机器人一定会有非常大的公司 ,因为人形机器人本来就是一个非常通用 、 非常 general 的一个产品 , 所以它这里面长出特别大的家伙的可能性是更大的 。

但是因为人形机器人今天在物理上面还是有蛮多的限制的 , 比如说功率密度 、 电机的密度 、 电池的密度 、 重量 、 体积等一系列的限制 。

哪怕人形机器人长期普及过后, 我们可能也会异化出不同的人形机器人, 服务不同场景 。 我们可能依然会有小型的机器人在娱乐 、 表演甚至科研这种场景里面 , 我们可能有大型的机器人在一些可能需要重载 、 需要搬运 , 或者说一些比较大 payload 的低速 payload 的场景 。

我觉得人形机器人未来产生一定的分化 。 所以不一定是一个嗯 winner take all 的这种状态 ,但是大脑是有可能的 。

曼祺1:39:34

就是你刚说的 , 如果 omni 模型这个路线成立的话 。

陈哲1:39:38

如果有一个超级的模型的能力显著的比别人更高 ,其实这件事情我们在 Anthropic 身上其实已经看到一个非常强的端倪 。

它可能不是 winner take all,但至少是个寡头化的一个现象 。 然后它其实反映的更底层的问题是什么呢 ? 就是大脑作为一个智能产品 , 我觉得智能就一定是两极化的 , 要么就是我追求最好的智能 , 要么就是我追求一个 OK 的智能 。

如果是两极化的这种假设的话 , 本身模型又是一个边际成本很低 , 可以被开源共享的一个产品 , 那我觉得长期来看 , 智能的模型大概率就会分为高水平的开源模型和一个顶级水平的闭源模型 。

那如果这个格局对于语言模型是这样子的 , 我认为对具身模型很有可能终局也是这个样子 。

曼祺1:40:29

高水平的开源模型 , 顶级水平的闭源模型 。

陈哲1:40:33

然后没有其他模型生存的空间 。 就如果一个闭源模型的能力超不过梭哈的开源模型 , 它就没有存在的价值 。

曼祺1:40:41

那谁在提供高水平的开源模型 ? 是 Google、 英伟达这种想做生态的大公司 ?

陈哲1:40:48

我觉得很可能是的 。 那在语言模型里面 , 目前不就是千问 、DeepSeek 这样的公司在提供吗 ? 我们跟一些模型公司创业者去讨论的时候 ,其实有一个终极问题我觉得是挺难回答的 。

曼祺1:41:00

你说的是大语言模型的创业公司的创始人, 还是具身这个模型 ?

陈哲1:41:04

具身 。 但我觉得是同一个问题 , 就是如果你做一个模型的创业公司 , 你怎么回答两个竞争的问题 ?

第一个是你如何跟一个最好的开源模型竞争 ,which 大概率是由像英伟达这样公司提供的 ,因为它的商业模式不依赖于模型的变现 , 它的商业模式是在算力的变现 , 所以它可以把模型开源出去 。

那第二个问题是 , 你怎么跟寡头化的最头部的私有模型去竞争 ? 那这个供给大概率会来自于谷歌 、 来自于阿里 、 来自于字节 、 来自于 Anthropic。

曼祺1:41:41

你有听到过创始人给你比较有说服力的答案吗 ?

陈哲1:41:45

嗯 , 这个问题在当年 Anthropic 创业的时候也被投资人反复问到过 ,但是 Anthropic 成为了 Anthropic。

曼祺1:41:53

你的意思是 Anthropic 当年刚起步的时候也不见得能回答这个问题 ?

陈哲1:41:57

是的 。

曼祺1:41:57

所以开始能不能回答不是很关键 。

陈哲1:41:59

对 ,OpenAI 可能也很难回答一开始的时候 。

曼祺1:42:02

但他们成立的时候 , 它并不像具身智能模型一样面临一群大语言模型公司 。

陈哲1:42:08

客观地说 , 我认为今天具身智能创业和投资的热潮跟上一波语言模型创业公司的成功和热潮是有关系的 。

我们已经有几家大语言模型创业公司成功上市 , 还有更多的公司在 pipeline 上给投资人也创造了丰厚的收益 。

所以是很合理的去推断我们在具身模型里面可能也有同样的这种创业或者投资的机会 。 但创业的挑战是 , 如果所有人都这么想的话 , 那这个市场一定会出现过度竞争跟过度投资的状态 , 那可能最终的赢家还是比较稀缺的 。

投资回报的预期或者创业成功的预期会被大大的压缩 。

曼祺1:42:46

嗯 , 宇树作为中国第一家要上市的具身智能公司 , 它其实已经盈利很多年了 ,但大部分别的公司还不是这种情况 , 还是个在前期探索的情况 。

然后行业里一个反复被讨论的问题也是说接下来这个商业化和落地的节奏会怎么去推进 。其实前面我们列的 TOP 5 进展里面有一些跟这个是相关的 , 比如说新动季元在尤震的这样一个合作 。

如果更广泛来说的话 , 你关于落地节奏这个季度有什么新的想法吗 ?

陈哲1:43:15

我对于落地节奏这个事情呢 , 我觉得可能要从两个维度来看 , 一个是中美的差异 , 一个是硬件公司和模型公司的一个差异 。

那我以美国的这些领先的公司为例来看的话 ,其实无论是 OpenAI 还是今天的 Physical Intelligence,他们都符合了一个典型的美国前沿领域创新公司的一个 pattern, 就是一群非常聪明的 、 非常有想法 、 有愿景的一群人才或者科学家在一起 , 对一个有巨大潜力且长期不确定的方向进行持续的投入 。

那么美国的创投环境也提供了早期比较好的一个孵化的一个阶段啊 , 包括 OpenAI 可能从 15 年成立到 22 年底 ChatGPT 出来之前 ,其实一直没有非常明显的商业化或者产品化的一个进展 。

但这件事情并不妨碍 OpenAI 吸收大量的人才跟资源去实现这个目的 。 那么今天我们同样看到的 Physical Intelligence 可能也在做同样的事情 ,他们不断的在发布 , 甚至开源他们的领先的模型 ,在引领这个行业的进展 。

但是从落地来讲的话 ,so far 也没有看到特别清晰的什么时候它也可以真正的达到商业化或者落地的这个阶段 。

曼祺1:44:28

你说美国这些公司 。

陈哲1:44:30

美国这些公司 , 基本上所有的美国公司现在都有这个问题 。

曼祺1:44:33

除了 Figure AI 好像说这个会多一点 。

陈哲1:44:35

Figure AI 现在也没有任何一单确切的真正被验证的这种这种落地的收入 。

曼祺1:44:41

但至少它会去对外就是展示一个我要落地的这么一个姿态吧 , 我觉得 。

陈哲1:44:47

对 , 我觉得姿态跟事实还是挺不一样的 。

曼祺1:44:50

所以你觉得国内的公司难道是已经事实了吗 ? 大家不是姿态了已经 。

陈哲1:44:54

我觉得国内本质上是大家对这种特别长期的不确定性的这种探索的容忍度非常差 , 所以你一定更需要做出这样的姿态 ,而且最好是个事实 。

我认为在中国今天的挑战是 , 如果我跳出来说我做一家公司 , 我明确的告诉投资人 10 年之内我绝对不做商业化 , 我绝对不做落地 , 那它的问题是你怎么获得足够的资源和吸引足够的人才和在资本上有很好的这个反响 ,以及甚至可能未来对接二级市场的这种最终阻力 , 你怎么解决这几方面的挑战 。

曼祺1:45:27

我想到一个方法 , 就是你是梁文峰王 。

陈哲1:45:31

对啊 , 所以我 。

曼祺1:45:32

你很有钱 。

陈哲1:45:33

所以我一直觉得 DeepSeek 是一家非常稀缺也是非常不一样的公司 , 就是当你自己足够成功 , 你对这个事情有足够的信仰 。

而且客观来讲 ,OpenAI 包括 DeepMind 本来就是一群 billionaire 的尝试和投资 ,OpenAI 本来就是一个非盈利性的公司 , 至少在开始的很长一段时间 , 商业化和盈利性本来就不是这样公司的一个目标 。

所以我觉得今天可能更大的一个分歧是在于我们认为具身智能的整个研究和行业的发展到底到了什么阶段 。

如果今天我开了天眼 , 我告诉大家这个事情像当年的自动驾驶 , 至少需要 10 年甚至 15 年的过程才能实现规模的商业化 , 且不说盈利 , 对吧 ?Waymo 实现了商业化 ,但 Waymo 还没有盈利 。

如果告诉大家需要 15 年才能够盈利 , 还有没有人愿意在这个领域进行创业和投资 ? 如果我们对这个事情的判断是它 5 年之内就可以实现商业化和盈利 , 那么可能就会有不同的人会愿意 , 或者更多的人愿意对这个事情进行投资跟这个创业 。

所以呃 , 一个很底层的问题是 , 大家对这个周期的判断可能是有差异的 。

曼祺1:46:44

你目前来说你对这个事的判断 , 它是这个时间是在缩短的 , 还是在还是在变长 , 还是没有太明显的变化 ?

陈哲1:46:51

相比于去年, 我觉得这个周期肯定是在缩短的 。 本质上这是一个足够重要的问题 , 它在整个社会 ,在整个市场上聚集了大量的资源跟资金和人才 , 包括我们看到了为什么会有世界模型等一系列技术的快速的发展 , 就是因为它的一些基础的要素在快速的成熟 。

然后因为它在可能相关的一领域 , 比如说在语言模型领域的进展 , 大量的这个能力 、 算力 、 数据能够迁移到具身这个领域里面来 , 所以实际上是事实加速了具身领域的发展的 。

这是为什么我们这次提到今年的这个季度的这个进展 , 我们把 Figure 和这个新动季元 、 人形机器人做快递分拣这个事情单独来说 ,是因为我们至少看到了在这样一个场景里面 , 嗯 , 一个通用型的人形机器人用新的这个算法技术站是可以更好的解决这个问题 ,是有实际落地的可能性的 。

曼祺1:47:51

最后可以来展望一下下一个季度 , 或者说下一段时间行业里的一些变化 。 我们开始也回顾了上次我们聊的三件事的展望 , 基本上第二季度在持续的发生 。

那再往后看的话 , 你会看到什么新的东西 ?

陈哲1:48:06

有一件事情是我最近在反复思考 , 我认为会变得更加主流的 , 就是人形机器人作为一种形态和载体 , 可能在未来一两个季度 , 嗯 , 会有更多的人形机器人的产品在一些具体的场景得到落地跟商业化 ,以及有更多的公司进入这个市场 , 宣布它人形机器人产品的这种呃计划或者路线 。

曼祺1:48:29

你说的更多公司不一定是创业公司 , 你指中外的一些大公司是吗 ?

陈哲1:48:34

对 , 当然他们从宣布计划到发布产品 , 我认为至少可能有一年到一年半的这个时间 。

曼祺1:48:42

这个时间判断 , 我觉得大家也是会有一些分歧啊 , 比如说我跟有一些具身的创业者聊 , 我觉得他们会把这个时间表判断得更紧迫 , 就他们可能认为大厂会更快下场 , 类似于像理想 , 它虽然是 26 年年初前后宣布的这个事情 ,但实际上他们内部应该已经做了一段时间 , 包括你说的荣耀 ,其实他们也已经有两年的时间了 。

陈哲1:49:03

对 ,但是还不是所有的大厂 。 我的设想可能就是未来一个季度或两个季度 , 或者未来 6 个月是进入这个游戏的最后的窗口 。

因为如果你不在 26 年启动和进入这个市场的话 , 那么等到 27 年、28 年真正人形机器人开始广泛落地的时候 , 你就没有生位了 。

曼祺1:49:21

其实特别大的终端厂商 , 就手机和汽车 , 我感觉国内的啊 , 至少很多主流的都多少布局了一点啊 。

然后有一个大公司 , 就是字节 、 腾讯这种 , 阿里这种大的互联网公司 , 我指的是人形的全站的这个方向上 ,他们可能会有什么动作 ?

陈哲1:49:38

我觉得对大厂来说 , 可能更好的对标就是像 Pi 和 Anthropic 这样的公司的方式跟模式 。

曼祺1:49:45

就还是偏一个智能能力的基础 。

陈哲1:49:48

嗯 ,是因为他们太擅长做模型这件事情 , 就模型的商业模式和模型能力 ,其实跟他们本身的能力是高度相关的 。

这也是为什么今天国内的大语言模型里面 , 包括像字节 、 包括像阿里都是非常领先的 。 我觉得在中国做具身智能创业有一个悖论 , 或者有一个尴尬的地方 , 就是除了我们刚才强调的 , 你很难在中国做一家 10 年没有商业化 、10 年没有收入的公司 。在另外一点 , 可能投资人或者中国的资本市场也更难容忍一家公司不是一个全站公司 , 或者说有具有大量的能力是

依附于其他客户的 。

曼祺1:50:29

合作伙伴 。

陈哲1:50:30

对 , 这样导致的一个条件是 ,which 我们也看到了正在发生的 , 就是所有的具身大脑公司都在宣布他们在做机器人本体 。

曼祺1:50:41

嗯 , 那你这么说 , 前段时间我采访徐华哲 ,他就是非常非主流的想法了 。他的一个想法就是 ,他认为不应该所有事都在公司 in-house 来做 , 这事应该交给生态 。

陈哲1:50:53

我认为这个事情可能是对的 , 这个事情可能也是个非常美国式的想法 。

曼祺1:50:59

他肯定也是觉得智能的能力更优先 , 相比于商业化 。

陈哲1:51:04

我觉得站在他创业的角度 , 如果你能在任何一件事情做到行业的最好 , 你才有意义 。

曼祺1:51:10

如果说你不做全站的话 。

陈哲1:51:12

如果你不做全站的话 , 所以或者说你做全站的太密 、 太晚 , 就你没有特别好的生位去做全站的话 , 那你就在你的细分的领域里面做到行业的最好 ,是有价值的 。

我觉得最终的大赢家大概率还是有全站公司的机会 , 就是苹果 、 小米 、 华为这样的公司在具身时代也会存在 。

但是很有意思的一个地方是 , 今天你会发现市值最大的几家公司其实不是全站公司 , 比如说英伟达不是个全站公司 , 比如说 Anthropic 或者 OpenAI 最终上市了 , 它可能也不能叫个叫一家全站公司 。

所以到底全站是终局还是垂直一体是终局 , 我觉得这个可能长期都会反复地背 , 它实际上是一种博弈跟竞争的关系 。

但是在中国的市场下面 , 我觉得对创业公司比较难的一点是 , 你很难说你 10 年没有收入 。 第二 , 你很难说我只做一个大脑公司 , 或者只做一个本体公司 , 包括很多投资人对宇树的一个 challenge, 就是宇树只是一家硬件公司 , 宇树并没有 AI,并没有并没有模型 。

嗯 , 我其实不太认可这个 challenge,但是市场的确会有很多人会拿这个东西去去去攻击宇树 。

曼祺1:52:23

这是个很好的例子 , 就相当于宇树在某一个环节你做到强如宇树 , 还是会受到你不是全站的一个挑战啊 。

陈哲1:52:31

对 , 如果假设宇树未来就一直是一家硬件公司 , 那我认为它也是一家很赚钱的硬件公司 。 它能不能形成形成垄断可能是第二个问题 ,但是我不觉得有有什么原因它不能长出它的软件或者 AI 的那一块 。

如果公司从战略 、 从方向上真的想去做这件事情的话 。

曼祺1:52:48

嗯 ,OK, 那今天非常感谢 Peter 再次做客 , 晚点聊分享了 2026 年第二季度他观察到的具身领域的一些新的变化 。

这次节目的最后我们也就是展望了接下来可能会发生什么 。 那在第三季度 、 第四季度的节目里面 , 我们可以再会来聊聊这些进展是否有印证 。

大家拜拜 。

陈哲1:53:10

拜拜 。

曼祺1:53:13

本期节目就到这里 , 感谢收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 推荐更多你想听的主题和嘉宾 。 你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk,也欢迎关注我们的公众号晚点 LatePost。

下期再见