晚点晚点聊 LateTalk2026年4月2日· 2:06:07

157: 与陈哲的「具身季报 26Q1」:宇树招股书、人形再思考、英伟达世界模型、高自由度灵巧手

陈哲(Alphaist Partners创始合伙人)与程曼祺在本期《晚点聊》盘点2026年Q1具身进展——宇树春晚表演、Sharpa灵巧手、英伟达DreamZero/DreamDojo、银河通用人形打网球、波士顿动力电动Atlas——并断言前沿正从VLA转向世界模型和触觉操作。陈哲认为,世界模型以视频生成为底层、取代以文本为核心的VLA,理论天花板更高,但算力消耗极大,注定大厂主导;英伟达EgoScale数据框架用2万小时自中心数据补全金字塔中段。灵巧手则是创业公司机会:Sharpa的System2/System1/System0架构把触觉引入高频控制,有望成为类似G1的全球科研默认选择。他评价宇树G1以63%毛利和5,500台出货定义科研市场,人形占收入过半,但研发投入仅9,000多万元,智能大概率长期跟随;Optimus Gen3延期,绳驱灵巧手量产和1万台年目标仍激进;波士顿动力Atlas用模块化电机和左右腿互换突破人体限制。对双足价值,他用Stretch对比说明人形在动态重心和占地上反而更优,银河通用网球则拓宽了实时交互的想象。他还判断,从云端到车载再到机器人,英伟达统治力递减,地平线、地瓜已主导量产机器人芯片;中国估值超100亿元的具身公司超20家,宇树上市是高质量公司而非泡沫,但市场仍需吸收。

  1. 0:00开场
  2. 4:48Q1 进展
  3. 10:37宇树春晚
  4. 20:13宇树科研
  5. 28:22人形价值
  6. 39:45Atlas与Optimus
  7. 48:57Figure与美国
  8. 57:58灵巧手
  9. 1:14:30世界模型
  10. 1:27:18数据框架
  11. 1:43:42算力芯片
  12. 1:53:59上市展望

PodHood 提供支持

文字稿

开场0:00

陈哲0:04

我就从去年开始基本上 。 所有我接触到的研究人员 ,他们的共识都会围绕着 " 灵巧手 "。

曼祺0:10

世界模型不是吗 ?

陈哲0:11

世界模型也是 ,但是世界模型很有可能是一个大厂主导的研究方向 。

英伟达定义的这个 " 世界动作模型 ", 底层是脱离了以文本为核心和动作克隆为核心的 VLA 的这种控制的范式 。

宇树既往已经发布了 20 个月 , 为什么到今天也没有另外一家公司真正去 challenge 它现在的位置 ?

曼祺0:37

很多人认为双足其实没有那么大的价值 ,不是个优先级特别高的东西 。

陈哲0:41

我很长时间也是这样的想法 。

我认为宇树的成功跟大疆的成功类似的地方 , 都是这是一个创始人真正非常热爱和笃定的方向 。 它不是因为这有巨大的商业机会和前景去做的事情 。

它在经营方面这种谨慎是深入它的基金的 。 就是它如果不是这样的人, 不是这样的创始人, 它也活不到这一天 。

曼祺1:08

活不到具身智能的热潮到来 。

陈哲1:10

活不到具身智能的到来 , 对 。

曼祺1:14

欢迎收听 《 晚点聊 》, 我是曼祺 。 这期节目是我们第一期具身智能季报 , 邀请了我很喜欢的一位投资人,Alphaist Partners 的创始合伙人陈哲 Peter。

过去 7 年,Peter 在五源专注投资机器人和硬件科技 , 投资过海柔 、 松灵 、 本末 、 地瓜等公司 。在去年创立 Alphaist 之后 ,他想放开手去寻找更多 Alpha Founders。

我对这类创始人的理解是 : 哪怕不被认同 ,他们也极其笃定自己的判断是可以定义规则或打破规则的人 。在跨学科 、 高复杂度 、 需要开拓精神的具身智能领域 , 就有不少这样的创始人, 也需要更多这样的创始人。

这期节目我们从本季度的进展着手 ,Peter 分享了 3 月中旬去 GTC 与全球从业者的交流 , 同时也带到了过去两年具身智能的发展 。在讨论人形机器人的部分 , 我们盘点了中美几家头部公司 , 如宇树 、 银河 、 特斯拉 Optimus、Figure 的近期进展 ,以及那些在智能能力或数据上给行业带来启发的公司 , 如 Pi、Sunday 和 Generalist。

接着我们重点讨论了当前具身智能的两个前沿研究方向 : 灵巧手和世界模型 。在灵巧手部分 , 我们重点聊了 Sharpa 的进展和 Optimus 绳驱方案的争议 。在世界模型上, 英伟达近期连续发布 DreamZero、DreamDojo 和 EgoScale 数据框架 , 提出 WAM 世界动作模型 , 这被不少人视为比 VLA 天花板更高的方向 。Alphaist 也有自己的播客 , 就叫 《The Alphaist》, 这期节目也会在 《The Alphaist》 串台播出 。

之后的季报里 , 我和 Peter 还会邀请更多从业者一起分享 。 下面我们正式进入本期节目吧 。 嗨 ,Peter, 你可以和我们的听友简单打个招呼 , 自我介绍一下 。

陈哲3:05

嗯 , 大家好 , 我是 Alphaist 的陈哲 Peter。 呃 , 我自己是工程师背景出身 , 嗯 , 早年在谷歌和黑莓做过产品跟这个技术 , 然后回国之后呢 , 一直在五源资本做早期的科技投资 , 主要就是关注嗯机器人 、 自动驾驶和 AI 的方向 。

嗯 , 之前也投过蛮多的机器人公司 , 嗯 ,在 24 年底的时候呢 , 成立了一支新的美元基金 , 叫 Alphaist Partners,是专门关注早期的 AI 跟机器人领域的机会 。

曼祺3:32

这次串台之后, 我也想之后每一个季度都能邀请陈哲来和我们一起分享一下关于具身领域的一些季度观察 。

之后的节目里面 , 我们可能也会邀请一些其他的嘉宾 , 比如说一些公司的创始人, 或者是一些研究员 、 一些从业者 。

然后我非常想邀请陈哲来聊这个节目 ,因为我们俩第一次见面的时候 , 基本上我想了解的就是跟硬件科技相关的 、 跟机器人相关的公司 。

我觉得你都非常熟悉 , 你对这些创始人 、 对这些公司的历史也都非常了解 。 而且你自己因为以前做工程师嘛 , 所以呃技术和产品的一些洞察呃也非常犀利 , 所以就想请你多多分享一下 。

陈哲4:11

好 , 谢谢曼祺 。 我是对这个领域一直非常关注 , 所以也是把自己的兴趣做成一个职业 。

曼祺4:17

这个过程中间 , 我觉得可以大胆的讲一些观点和判断 ,因为很多东西肯定最后也不一定都是对的 。

有的可能会被证实 ,有的可能会被证伪 。 呃 ,因为这一次是我们第一次录这个季报 , 然后所以除了讲 Q1 的进展之外, 有需要的地方 , 我们也可以带到过去两年的一些情况 。

然后 Peter 这边和美国和中国的从业者都有很多交流 , 所以我们的讨论范围会覆盖全球的进展 。 正好呃你也是刚从美国参加 GTC 回国 ,也刚刚更新了一圈美国的最新情况 。

那结合你了解的一些最新的信息和观察 , 如果要给 2026 年一季度的具身领域列出一个 Top 5 的进展或者说事件 , 你会是选哪几个 ?

Q1 进展4:48

陈哲4:57

首先 , 整个机器人和具身领域在过去几个月时间的变化可以说是突飞猛进 , 飞速发展 。 如果让我自己来排前五的这个研究 , 可能这是我很强的一个主观选择 ,并不代表纯学术上的研究突破或者是成就 ,而是站在一个呃长期关注机器人技术的投资人, 从市场跟商业的角度综合的一个分析 。

我觉得第一个应该是宇树春晚的这个表演 , 嗯 ,20 多台宇树的这个基望机器人在春晚的这个功夫表演 , 我觉得这个是代表了今天在这个本体跟运控上面 , 中国的这个最高水平 。

第二件事情我觉得要说的是沙帕的灵巧手在 CES 这个 demo,有一个长程的自主组装风车的这样一个一个展示 , 让大家看到了嗯目前灵巧手全球范围内的这个梭哈的水平 。

曼祺5:50

我可以介绍一下这个背景啊 , 就是沙帕尔的创始人其实就是核赛的三个创始人, 嗯 , 就是李一帆 、 呃孙凯 , 还有 。

陈哲5:57

尚少卿 。

曼祺5:58

对 , 就他们三个一起弄了一个新的公司 , 然后这个是做具身的一个公司 。

陈哲6:02

第三个我觉得是世界模型在 Q1 的进展 , 那这里面的代表作品就是英伟达发布的这个 DreamZero 和 DreamDojo 的的两个工作 。

世界模型用在机器人领域的尝试 , 我觉得最最早工作是源自于字节在 24 年底发布的 GR2,是第一次将这个互联网级别的视频内容运用到一个语言模型的这个预训练的过程中, 然后嗯直接生成了动作和操作的效果 。

实际上是当时还看是在 VUA 之外的嗯一个很创新的一个尝试 。 到了今年应该算是嗯有更多的公司嗯包括英伟达在这个世界模型上面嗯在视频生成模型的路径上面做了更多的迭代跟优化 , 产生出了更好的效果 。

曼祺6:44

嗯 , 就你说的这个从 GR2 到 DreamZero 的这个进展 , 它就是从视频里面学 , 然后去生成动作 , 生成机器人的轨迹 。

陈哲6:53

对 , 核心来理解就是用视频生成的方式 ,而不是用文本生成的方式 。 我们理解 VOA 它的 backbone 还是一个语言模型 , 我们是在一个多模态的语言模型的基础上增加了这个动作的这个输出 , 所以它是从 VOM 演进到了 VOA。

嗯 ,但是世界模型的底层是一个视频生成模型 , 实际上它也对应了我们理解世界的另外一个范式 , 就是用视频的范式 。

所以这个会是我我认为嗯 Q1 另外一个比较重要的工作 。 第四个工作呢 , 呃是我自己的一个一个偏好 , 我认为是今年嗯春节过后呃银河通用发布的机器人打网球的这样一个 demo。

我觉得是第一次让大家看到了人形机器人可以在一个我们认为比较高速和需要及时反馈的系统上能够取得这样好的一个表现 。

对 , 可能今天离商业化还比较远 ,但是它让大家看到了我们是有可能在今天的硬件和算力基础上实现这样实时的一个任务 , 所以打开了我们对人形机器人落地的很多想象力 。

然后最后一点呢 ,也是今年 CES 波士顿动力呃宣布的这个全新的量产的这个电动的 Atlas。 波士顿动力作为人形机器人研究的鼻祖 ,其实对于人形机器人的困难场景和落地价值是有非常长期深入的研究的 。

而这一次电动 Atlas 的出现 , 反映了他们对于人形机器人应该怎么进入工业场景 , 怎么进入落地的一些非常创新的思考 , 我觉得也给行业开了一个新的思路 。

同时呢 , 我认为他们作为代表 , 可能美国或者整个西方阵营在人形机器人里面最快量产和最快落地的一个代表 ,也能够反映出就是他们未来在研究和落地方面的一些思路跟思考 。

曼祺8:39

哎 ,在它量产这个电动版之前 , 它是液压的是吗 ? 但我记得它老早之前宣布过它要变成电动的 。

陈哲8:45

波士顿动力在液压这个方向上面是走了非常长的时间 。 呃 , 我们最早看到的 Atlas 的一些很惊艳的动作都是用液压版做的 ,但是大概在两年前 ,他们已经发布跟量产了呃电动版的 Atlas。

曼祺8:57

哦 , 所以这个是一个新的版本 。

陈哲8:58

这个是全新的版本 。 嗯 , 这个等会我们可以展开说 , 就这个版本的特点还是非常鲜明的 。 它用了非常模块化的电机方案 , 它的主要的 actuator 应该只有两种 , 全身是可以 360 度快速的这个旋转 ,而且可以非常快速的切换呃左右腿的这种结构 。

所以我觉得这些都是它非常嗯非常有创新的地方 。

曼祺9:20

嗯 ,OK,因为你刚讲的这几个进展 , 刚好是涵盖现在我们会去观察具身的几个关键的要素 , 或者说模块 。

这个包括本体 、 硬件 、 灵巧手这种关键的零部件 , 然后还有大脑 、 小脑 ,以及最后它是一个软硬件整体系统的整合 。

我们可以一个一个展开来聊 。 你刚说这几个事里面 , 包括宇树的春晚表演 , 然后银河通用和清华一起做的这个打网球的 demo, 还有波士顿 Atlas, 都是和人形机器人相关的 。

我们可以先从宇树开始吧 , 我觉得这也是大家可能最熟悉以及说最关注的一个公司 ,而且它最近有新闻嘛 , 就是它上市招股书已经披露了 , 可以看到一些财务的情况 。

嗯 ,其实宇树去年也上了春晚 ,而且这两次从大众层面都是很火的 。 我自己有一个比较有意思的观察 , 就是去年它上了春晚之后, 我跟一些从业者聊 , 我觉得很多做机器人的人对当时那个表演是不以为然的 , 就是觉得也没有很厉害 。

包括它那个转手卷什么的 ,其实也不是真的手在转 , 它是有一个机械装置是连着这个手卷 , 然后它抛出去就肯定会回收回来 。

然后这一次表演之后 ,因为我最近也跟一些创始人聊嘛 , 我觉得大家就业内的认可度会高了很多 。

就你可以讲讲就是它真正的这个门道是什么 , 它的进展在哪啊 ?

陈哲10:37

嗯 , 首先机器人的运控在 25 年经历了非常快的发展 。 宇树这次春晚的用到的所有的这些呃技术跟控制的这种技巧 ,其实背后的论文基本上都是在 25 年可能年中甚至下半年才发布的工作 。

宇树春晚10:37

陈哲10:56

那正好宇树把所有的工作在春晚这样一个舞台上面得到了集中的展现 , 所以给了大家一个非常惊艳的一个效果 。

核心就是有了更好的呃动捕和模仿学习的这种能力 。 呃 , 我们可以很快的把一个真人的动作翻译到一个人形机器人上 ,并且有了更好的呃强化学习训练的工具 , 让它在虚拟的环境里面可以把这些呃粗糙的呃动捕获得的数据转换成更加稳定的 policy, 执行在机器人上 。

曼祺11:27

所以它的动作会更像人。

陈哲11:29

对 , 都是人通过呃动捕或者是这种遥操度的方式先录制下来 , 然后再在仿真器里面不断的这种呃强化学习的迭代 , 让它变得更加稳定 , 更加的鲁棒 , 然后最终能够很好的迁移到宇树基望的这个本体上 。

曼祺11:45

对 ,因为它传统武术动作它有一些招式嘛 , 包括那种垫步什么的 , 我觉得还挺细致的 。

陈哲11:50

对 ,其实本质上就反映了宇树基望作为一款产品 , 呃它的基电能力 、 绝对的性能和一致性上很强的这个优势 。其实我看今年春晚我觉得最关键的是一致性 。

嗯 , 台上应该是有二十几个人形机器人, 二十几个人形机器人同时做一个复杂的动作 , 包括这种弹射啊 、 大回环 、 连续的翻滚 , 最终实现非常高的一致性 。

这不仅是精心的打磨调参一辆机器 ,而是需要确保在需要确保在 20 多辆这种量产级的机器上面都能够实现一致性的反应 ,而它们每台机器在环境中受到的干扰都是不一样的 。

所以这个对于硬件的这种质量的控制 , 包括这个运控算法的稳定性 , 我觉得都有很高的要求 。

嗯 , 我觉得这件事情可能是宇树 so far 相比所有公司来说最大的一个优势 。其实好多年前波士顿动力展示的一些视频里面 ,他们的机器人也可以做一些看起来非常像真人做的动作 。

那现在的宇树展示的这种成果和以前像波士顿动力当时做的什么跑酷啊 、 什么空翻啊有什么区别 ?

那个年代波士顿动力的呃跑酷的效果基本上都是用传统的控制算法 , 像 MCP 这些方法做出来的 。

所以他们有一群非常有经验的老专家来调这种经典的这种运控算法 。 但是现在这些嗯这些底层的这种控制的 policy 都是用强化学习 、 用仿真 、 用断断断的方法训练出来的 , 所以从原理上面就非常不一样 。

我们对于环境的扰动性的适应度是比当年的波士顿动力是要强非常多的 。 嗯 , 同时另外一点 , 波士顿动力当时拍的这些跑酷的视频其实也是精心剪辑和有大量失败的 。

曼祺13:33

嗯 ,而且你刚刚说到这个 , 我就突然想到 , 确实它没有展示过 , 比如说几十个波士顿动力机器人一起在完成一个动作的这种视频 。

陈哲13:42

实际上当年的技术在液压时代的波士顿动力 , 哪怕是单台机器要完成一个长距的跑酷动作 , 我认为它的成功成功率也不是很高 。

嗯 , 机器是经常摔的 。 嗯 , 所以宇树这次的表现 , 二十几台机器在台上实时的高度一致动作 , 我觉得它的难度或者说对可靠性的要求是高出许多量级的 。

嗯 , 这是一点 。 第二点呢 , 最近这一年的嗯大量的跑酷和舞蹈动作已经开始增加了这个嗯视觉的这种反馈或者说定位的能力 。

嗯 , 包括这次上台的这些嗯激光 , 嗯其实是每台头顶上都顶着一个激光雷达 。 嗯 , 它应该是有初步的这个呃箭图定位的这个能力 。

曼祺14:28

你前面说的是它有进展的部分 , 另一方面现在有哪些对人形机器人的表现的夸大的想象 , 就是由这种大众表演带来的 , 可能大家认为它已经能做到什么程度 , 实际上还达不到 。

陈哲14:40

我我觉得也是挺挺明显的 ,因为因为今天我们所有的这些舞蹈或者说这种呃表演的动作 , 本质上还是一个事先编排好的固定的一个舞蹈动作 。

那这些机器人如果受到了特别大的这种呃干扰或者说影响 , 它是很难有自主决策的能力 。 同时因为这些表演都是呃呃全身或者下肢的这种运动 , 我们没有任何涉及到这个上肢或者说操作方面的能力 。

那今天具身的大量的研究工作其实是围绕着操作或者说围绕着呃对于复杂任务的这种接触或者说理解来来进行的 。

那这点宇树目前还没有做太多这方面的工作 。

曼祺15:20

我觉得正好可以把宇树的情况展开聊聊 ,因为他们最近披露了招股书 , 可以看到一些财务的信息 , 包括它不同产品的收入构成 。

你自己看他们的招股书的话 , 你觉得有哪些值得注意的点 ?

陈哲15:32

嗯 , 我觉得他们的人形的业务在快速的增长 , 可能从 23 年他们发布第一款人形机器人 H1,24 年发布 G1, 可能那一年 24 年还是 G1 销售的早期 。

那去年基本上人形机器人都是以 G1 为主 , 然后人形机器人的占比也在快速的增加 ,也显示出这个公司未来会会以人形机器人为核心 , 然后四足机器人可能长期来看可能就是一个更小的一个份额 。

曼祺15:57

对 , 它人形确实长得很快 ,因为 23 年的时候人形占它自己的收入的比例只有不到 2%, 然后到 24 年的话是到 27% 了 , 到 25 年的前三季度就已经超过 50% 到 51% 了 。

陈哲16:10

我一直觉得很多机器人公司都是都是供给驱动的 , 就整个市场无论是专家还是还是爱好者 , 对机器人的期待和想象都是很多的 。

很多时候真的受限于供给 , 你没有这个产品出来的时候 , 这个产产品不够稳定 ,不能量产的时候 , 你是没有收入的 。

只要你有了这样的好的供给 、 好的产品 , 那你的你的销量自然会来 。 那无论是在科研还是在这种表演还是在工业的市场 , 宇树其实反映了这样一个特点 。

曼祺16:37

嗯 , 我觉得在早期是这样 , 至少它现在科研的这个场景的需求就是很旺盛的 。

陈哲16:42

今天的确人形机器人就是在早期 , 就不管大家对吧怎么在吹 , 怎么在在唱响 ,但今天本身就在一个非常早期的一个阶段 。

曼祺16:50

然后另外就是我觉得就我自己看它招股书啊 , 我觉得让我印象比较深的是它毛利特别高 。 它人形的毛利有超过 60%,63% 左右吧 , 就是 25 年最新的数据啊 。

这个在软硬一体的产品里面应该算是非常高的毛利 。 为什么 ?

陈哲17:05

我觉得主要还是因为今天人形本身就不是一个真正的商业场景 , 就像我们说的 , 人形绝大部分场景还是卖给科研市场 。

那在科研市场 60% 的毛利可能是很低的 ,因为科研市场的规模和量是比较小的 ,而且很多客户的订单也是比较比较分散的 。

那传统很多科研教具市场拥有七八十的毛利 , 我觉得是非常正常的一个事情 。 可能对于宇树来说 , 今天的定价可能一部分是市场缺乏竞争的原因 , 一部分也是因为科研市场对于价格的敏感度没有这么高 。

本身这也是一个今天可能也就是 10 亿人民币左右的市场 。

曼祺17:40

你说到这个话 , 我想到像当年激光雷达早期的时候 , 那确实毛利非常高 , 就是在它还主要是给 L4 的公司作为一种研发设备的时候 。

陈哲17:48

因为你卖便宜了 , 嗯 , 就像 Sharpa 灵巧手一样 , 它卖 5 万美元一只 , 你卖便宜了 , 你的销量也不会因为价格便宜会有两三倍的增长 。

它今天并不是一个充分弹性的定价市场 , 嗯 , 它的客户的数量是明确的 , 需求也是明确的 。 所以在这样的呃背景下面 , 它的定价其实是由它的相对竞争力决定的 。

那可能更大的问题是 , 宇树基望已经发布了 20 个月 , 为什么到今天也没有另外一家公司真正去 challenge 它现在的位置 ?

曼祺18:18

那你觉得是为什么了 ? 对 ,7 万就是它的那个当时号称 9.9 万起售的那个小的人形机器人, 大概一米二 、 一米三左右的 。

陈哲18:26

呃 , 我觉得几个原因吧 。 我觉得首先基望是一个定义非常成功的产品 , 嗯 ,其实基望从定义来讲就是一个面向科技市场的产品 。

宇树的第一款人形机器人是 H1, 呃 , 如果你看它的构型 , 你可以把它想象成把一个大的四足狗站起来的效果 。

曼祺18:44

对 , 王兴兴自己也是这么说的 。 我们应该是 23 年的时候去采过它 , 然后当时问它人形是怎么研发的嘛 , 就 H1 怎么研发的 , 它说一共只用了三个半人, 有三个工程师 , 然后加它自己半个 。他们说就是让一个狗站起来 , 它觉得没有很难啊 。

陈哲18:58

因为当时它并不相信人形机器人, 或者说当时它并不想做人形机器人 ,其实很长时间如果你去看 , 可能 21 年或者 22 年的时候 , 它其实公开表达过它并不想做人形机器人 ,但也是因为随着市场 , 随着科研市场的成熟 , 市场有了对人形机器人的需求 。

那么在当时那个背景下面 , 它把一个成熟的四足机器人站起来 ,其实是在当时是一个非常快速 ,也是一个简单的解决方案 。

曼祺19:22

然后到 G1 的变化是什么 ?

陈哲19:23

G1 是宇树第一台真正为科研市场正向设计的机器人。 最典型的一个特点就是它的身高从 H1 的一米八左右降到了一米三左右 。

就大家不要小看这个高度上的可能的缩小 , 更关键的是就随着它高度的缩小 , 它的质量也大幅下降 。

缩小的质量对于电机的功率密度 , 对于整个运动性的表现 , 包括电池的表现都有非常大的帮助 。

而为什么可以缩小 ,是因为如果它的目的是面向科技市场 , 从做人形研究的角度 , 一个一米三左右的小人形机器人可以做的研究 , 跟一个一米八的全尺寸的人形可以做研究 , 基本上没有什么区别 。

本身这个产品是为了这个场景去正向设计的 , 这也是为什么在这个场景里面 , 宇树的切入跟定位呃如此的好 , 嗯 , 让更多的公司其实很难去 follow 它在这个场景里面的一个定义 。

宇树科研20:13

曼祺20:17

就是因为它一上来就把这个场景满足的太好了 , 别的公司可能会觉得我跑去跟它竞争没有差异化了什么 。

陈哲20:24

回到一个更宏观的问题 , 我觉得投资人自始至终都不喜欢宇树做科技这个市场 。

曼祺20:30

朱啸虎就公开表达过这个想法啊 ,他觉得这不是一个持续的市场 。

陈哲20:34

我觉得看大家怎么理解王兴兴和宇树这家公司 。 我是 19 年见到王兴兴的 , 我在他们杭州的办公室见到王兴兴的时候 ,他当时正在调它当时非常早的一个机器狗 , 应该是莱卡狗还是 A0 狗 , 非常早期 。

那那个时候整个公司可能一年能够卖十几二十只机器狗 , 嗯 , 一年可能有 1,000 万人民币的收入 ,而且是盈利的 。

公司可能不到 10 个人或者十来个人。 宇树为什么是一家盈利的公司 ? 是因为它不得不盈利 。 如果它不盈利的话 , 我在 19 年已经见不到它了 。

曼祺21:05

因为它从来就不是受投资人喜欢的公司 。

陈哲21:08

是的 , 这也是很多硬件公司经历过的发展历程 。 嗯 , 你必须卖一个大家愿意花钱去买的东西 。 那王兴兴当时很喜欢做四足机器人 ,不断迭代它的产品 , 然后卖给当时想要买它的人 。在那个时候就是研究院跟高校 。

嗯 ,但这个市场自始至终不是一个很大的市场 , 就是全球就这么多大学研究院 , 每个学校可能买几台机器人, 你的总的存量就这么大 。

所以如果你告诉投资人你你的主要市场只有 10 亿左右的规模 , 且你不知道人形机器人或者主式机器人什么时候可以快速的走向工业跟或者商业的应用 , 那投资人是很难下手去投这个项目的 。

这就是为什么哪怕宇树定义了一个非常好的面向科研市场的 G1, 如果我是另外一家人形机器人的投资人, 我听到我的公司要进入科技市场跟宇树竞争 , 我也觉得它是一个很糟糕的战略方向 , 或者很糟糕的市场选择 。

曼祺22:07

所以这也部分解释了为什么 G1 推出 20 个月还是没有竞争对手 。

陈哲22:12

当然是有些公司也在做小人形 ,但我认为从产品的一致性 、 稳定性来讲还是有巨大差别的 。 就有一件事情我们肯定要要理解 , 就是对于硬件公司来说 , 它的硬件的设计 , 嗯 , 供应链的打磨 , 核心零部件的稳定性是要是需要长期的验证跟测试的 。

就是今天你很容易做出一个跟 G1 一样 , 甚至超越 G1 的呃一两台样机 ,但是你要实现像 G1 这种上千甚至上万台的呃可靠的生产 , 嗯 , 你是需要经历宇树之前所经历的这样一个过程的 。其实宇树在生产 G1 之前 , 它的呃四足机器人已经是销售了几万台了 , 每台机器人上面有至少 12 个电机 。

那宇树是真正完成过百万台电电机的设计 、 生产和量产的过程的 。 那这个在硬件和供应链方面的门槛 , 对于所有新进入人形机器人的公司来说 , 都是需要跨越的一个坎 。

曼祺23:08

而且涉及到硬件的话 , 它这个坎可能就是你需要付出的时间成本是很难被压缩的是吧 ?

陈哲23:14

是的 , 这是这就是为什么你会看到很多大模型公司 , 可能他们的领先又是只有 3-6 个月 ,但是硬件的公司又是可能是 12 甚至 24 个月 。

我认为宇树的成功跟大疆的成功类似的地方都是 , 这是一个创始人真正非常热爱和笃定的方向 。 它不是因为这有巨大的商业机会和前景去做的事情 。

事实上我那天其实聊了一个前辈 ,他在 17 年见过王兴兴 ,也来融资 。 当时他就问王兴兴你这个事情到底能做什么 , 王兴兴说不上来 ,他也应该说不上来 。

曼祺23:50

对 ,因为宇树确实成绩的比较久 ,他 16 年就开始创业了嘛 。他自己做这件事情 ,他研究生的时候开始做 , 那就更早了 。

嗯 , 那你觉得宇树下一个阶段它要靠什么去发展呢 ? 因为就像你说的 , 我觉得不管是宇树自己还是外界对它的期待 , 肯定未来是要进入更广大的市场的 , 包括他们可能也不会止步于说我把硬件 、 把本体 、 把运控做得很好 。

因为现在大家明显看到更大的机会是在于机器人的智能 ,是大脑和小脑结合的部分 。

陈哲24:20

我觉得宇树做得好 , 或者王兴兴做得好的好的一个地方是 , 它是一个非常极致和专注的创始人 。在公司发展的这么多年的历史上 ,其实它对于怎么做好一个硬件本体的专注和极致的追求 , 我觉得是没有变的 。

这也是为什么嗯 , 很长时间 , 包括到今天我们看宇树的财报 ,在过去几年时间 , 嗯 , 宇树并没有花太多的精力跟资金去做跟 AI 或者是跟模型相关的工作 。

曼祺24:48

对 , 我可以说一个数字 , 就是它 25 年的研发费用是 9,000 多万 , 前三季度的 。

陈哲24:53

那这个可能比我们知道的非常多的机器人公司的研发投入都要小非常多 。 它在经营方面这么谨慎 , 我觉得是是深入它的基因的 。

就是它如果不是这样的人, 不是这样的创始人, 它也活不到这一天 , 活不到具身智能热潮到来 , 活不到具身智能的到来 。

对 , 嗯嗯 ,但是你看你看这次招股书 ,他们要募资 40 个亿 , 嗯 , 里面计划就 20 个亿会投入这个大脑的这个研究 ,而且他们的工作也在积极的做开源 。

应该是最近发布的一个是 VLA 的工作 , 一个是世界模型的工作 。 我觉得从从研究的前沿性来讲的话 , 只能说是跟随了目前市场主流发展的水平 。

但是我对他们在这方面长期能够取得很多成就跟突破还是还是很有期待的 。

曼祺25:38

那你觉得它如果取得不了这方面的成就和突破 , 可能是哪出了一些问题了 ? 比如说我自己的一个观察啊 ,在很多新成立的这一批具身智能公司里面 , 就是做 AI 的人还是比较有话语权的 。

比如说至少联创里可能有一个是 AI 背景的 。 对 ,但是宇树现在的核心管理层里好像没有特别靠这种 AI 和深度学习背景的人。

陈哲25:59

对 , 宇树还是一个王兴兴为绝对核心的公司 , 嗯 , 它也没有一个在 AI 或者在算法领域可以独当一面的这个合伙人。

我觉得跟公司的基因和它的思考方式也非常相关 。其实我心里想的一个问题是 , 嗯 ,是不是一定要有这样一个人才能做好大脑的部分 , 还是说也不一定 ?

我我自己的判断 , 我觉得宇树在大脑或者在智能这个角度上会长期采取跟随策略 。

曼祺26:26

你觉得这样对它的竞争力是够的吗 ?

陈哲26:29

我觉得是够的 。

曼祺26:30

嗯 , 为什么了 ?

陈哲26:32

具身智能模型价值的体现是离不开本体的 。 我觉得对宇树来说 , 嗯 , 可能更关键的是真正占据人人形机器人全球范围内呃科研市场的事实标准 。

所以所有的我们看到的最新的人形机器人的研究 , 都是基于它的硬件进行的这种呃不管是开源还是闭源的研究 。

只要这个事情能够长期持续 , 嗯 , 我认为它的这种生态位是很难被替代的 。 就哪怕有更好的公司 , 哪怕更好的公司推出了嗯推出了非常优秀的闭源的具身模型 , 我觉得宇树也会也会连带受益 。

但是同时宇树自己和行业的更多玩家会持续的在宇树的这个硬件基础上推出嗯高性能的开源模型 。

那这些模型跟宇树硬件的这种耦合和绑定 , 我认为会成为宇树就是未来很多年非常持续的一个优势 。

曼祺27:27

宇树之前自己发过新闻 , 说他们 25 年实际人形机器人的出货是 5,500 多台 , 然后后来他们又说 26 年他们希望人形机器人出货预计能到 1-2 万台 , 那相当于是翻了之前的两到三倍 。

嗯 , 你你觉得这个能做到吗 ?

陈哲27:42

我觉得应该能做到 。 我觉得这个这种增长看起来都是非常线性的预测 。 嗯 , 就有可能比这更多 。

你的意思是 ? 对 , 看市场的爆发情况 。 对 , 最近有一家专注于人形机器人租赁的公司 , 擎天租 。

曼祺27:56

哦 , 擎天租 , 对 , 我看到那个新闻了啊 。

陈哲27:58

对 , 那它意味着什么呢 ? 它给你它给我的信号就是 , 随着春晚的爆火 , 随着这个 G1 的这种表现力或者表演力的这种成熟 , 至少在未来一两年会有非常广泛和持续的嗯表演和租赁的需求 。

如果你用这个市场去看的话 , 我觉得一两一两万一年的销量是远远没问题的 , 可能会更大受限于宇树愿意在这个产品上面投入的产能 。

人形价值28:22

曼祺28:22

那接下来可以聊聊你前面提到另一个进展 , 就是你说的银河通用打网球的这个进展 。其实你列进来我是有点意外的 ,因为印象中我感觉机器人老早就能干这些事 , 什么打乒乓球 、 打网球 ,而且有一些创业公司就是专门做那种打网球的机器人的 , 就是和真人陪练的这种 。

当然他们并不是用人形来做的 , 就是你从银河它用人形机器人来打网球这个事情上, 你看到的这种技术趋势是什么 ?

陈哲28:46

就是因为我们之前看过很多打网球的机器人, 我们其实非常能够理解一个实时的网球机器人的技术复杂度 。

曼祺28:55

你就说你们看过这种创业项目 ?

陈哲28:57

对 , 我看过很多这样的项目 , 嗯 , 就是一个轮式机器人专门做嗯做网球的 。 网球的球速是很快的 , 网球的球速可以甚至高达 100 公里每小时 。

所以你在这么小的一个球场上, 你只有非常短的时间进行这个嗯轨迹的这种预判和实时的响应 。 实时的球的运动其实对于任何形态的机器人来说 , 都是一个非常大的一个问题 。

哪怕对于轮式机器人来说 , 都是非常难实时处理的 。 那对于一个更加复杂的人形机器人, 要实现这个球路的识别 、 判断 ,以及在完成整个挥拍 、 挥击球的这样一个动作 , 我觉得这个难度以 2026 年初的整个技术战来说 , 还是非常复杂的一个工程 。

曼祺29:42

对 , 它是一个双足的机器人, 就完全人形的这种机器人去做的 。

陈哲29:46

对 ,而且它真的是实现了一个实时的感知决策 , 包括这种全身控制的这种闭环 。

曼祺29:52

它这个确实和你跳舞和打武术不一样 ,因为你这个球过来 , 你肯定每次都是不同的判断啊 , 你不可能说是你编排好的在那打球 。

陈哲30:00

对 , 所以这件事情我觉得可能学术上的成就还好 ,因为我知道他们大概是怎么做的 。他们他们在春节期间租了一个蛮大的这个网球场 , 然后有非常多的这种动捕的设备 , 嗯 , 采集了很多数据 ,也对模型进行了嗯反复的这种强化学习的训练 。

我觉得从技术上讲的突破点还好 , 嗯 , 是一个比较复杂的系统工程 ,也体现出了公司在这件事情的执行力 。

对我来说更大的一个启发是 , 我们之前其实很难想象人形机器人已经可以完成这样的任务 。 嗯 , 当这个事情出来的时候 , 我记得应该是 Andrew Compassion 在 X 上面还在回复 , 说这不可能是真机做出来的效果 , 肯定是肯定是 AI 生成的 , 肯定是 CG 那种 。

对 , 嗯 ,他是这么回复的 。 嗯 , 我觉得我第一次看到的时候 , 我会有也也有这样的感觉 。 所以对我来说 , 我认为他们这个精心打造的 demo,其实拓宽了我们对人形机器人能力的想象 。

曼祺30:58

嗯 , 就说在现在已经有的这些技术上, 我通过组合和一些工程的优化 , 我能做到什么程度 ?

陈哲31:05

其实这个如果要类比的话 , 我也在想银河的打网球是一个很好的 demo。其实在 1 月份跟 3 月份 , 呃 ,Figure 也发也也发布了非常好的这种呃全身运控的这种 demo, 你也看得出来整个动作的丝滑性 , 呃 , 自然度是非常高的 。

呃 ,但是背后你也很明显的看到各种整个视频是被公司精心的编排和和录制和剪辑过的 。 嗯 , 它不是 CG 生成的 , 它的确是真机自主执行的 ,但是你看得出来它为了实现这样一个效果 , 实际上是做了非常多的专门进行的训练 。

但是至少对于大众市场来讲 , 它是在打开我们对人形机器人的理解和想象 。 我我认为这些工作在 Q1 都是蛮有意义的一个 milestone。

曼祺31:51

因为这些都是很具体的一些场景啊 , 那它能迁移到别的任务上吗 ? 就它接下来会有什么应用上的价值吗 ?

陈哲31:59

网球那个具体场景有点 tricky,因为因为它大概率不是用它板载的算力和视觉来进行的这个球路的处理 。

它在网球场上实际上是有这种外部的这种摄像头 , 才能实现比较高的帧率 ,而且也不是 on device 的算力 。

曼祺32:14

嗯 ,不是在端侧的算力 。

陈哲32:16

嗯 , 对 ,但是计算机科学反复的经验就是只要这件事情可以做 , 人类一定可以想到优化的方法 , 让它在更小的算力 、 更少的资源上面可以实现 。

所以对我们来说能不能做是最关键的 , 怎么去优化其实是第二步的 。

曼祺32:30

那如果总结一下, 就是包括像宇树 、 像银河 、 中国这些做全人形机器人的公司 , 就是我指它有双足形态的人形机器人的公司 , 像还有智原啦 、 魔法原子啦这些 , 你觉得他们在 Q1 的表现和进展怎么样 ?

陈哲32:43

我觉得整体都是超过预期的 。 我觉得整个行业的速度在加快 。 嗯 ,有更多的公司应该是应该是智原在去年底还是今年初的时候 , 呃 ,也发布了嗯全身运控的这个新的这个工作 。

嗯 , 包括英伟达也发布了呃 Sonic 这个全身运控的这个新的框架 。 我觉得整体来看 , 嗯 , 可能在 24 年和 25 年, 嗯 ,locomotion 和 manipulation 或者说上肢的这个操作和下肢的运动还是两个很独立的体系 。

但是到了今年开始 , 随着人形机器人硬件的成熟 , 随着数据的进一步增加 , 我们现在开始有了用一个统一的模型进行全身运控和操作的这种可能性 。

我觉得这个事情现在是刚刚出现了个端倪 , 那对未来 12 个月我觉得它的加速度 , 嗯 , 它的复利可能会不断的 compound。

嗯 , 所以我很难想象 , 我很难想象到 27 年春晚的时候 , 我们能看到什么样的人形机器人的表演 。

曼祺33:48

可以期待一下啊 。 哦 , 这个总结挺好 , 就是说之前操作和运控是独立的 , 分开的 , 然后现在是会用一个模型去控制整个身体的运动 , 然后把它结合起来 。

陈哲33:59

对 , 几家公司都在做同样的工作 , 包括这个 Figure, 包括说智原 , 包括说英伟达 , 嗯 , 我们都看到大家都在朝这个方向去努力 。

我觉得对行业来说 , 只要这个范式被建立了 , 会有更多人去迭代和去这种改进 。

曼祺34:14

那这有个老生常谈的问题啊 , 就是很多人认为双足其实没有那么大的价值 ,不是个优先级特别高的东西 , 就是对把机器人用起来 。

陈哲34:21

我很长时间也是这样的想法 。

曼祺34:23

哦 , 那你什么时候开始改变想法的 ?

陈哲34:25

我觉得我最近这个季度我的我觉得我受的冲击还是挺大的 。

曼祺34:28

那你可以讲讲为什么 , 就是你具体是怎么变的啊 ?

陈哲34:31

我觉得整个机器人行业都是一个供给高度受限的行业 。 当一个机器人真正实现某一种能力 , 当一个机器人真正稳定的交付某一种能力的时候 , 它可以做的事情或者它可以创造的价值会得到一个快速的释放 。

那很长时间我也觉得可能人形机器人它带来的复杂 、 带来的困难度 , 相比它带来的好处是很有限的 。

本质上我是在放大人形机器人的困难 。 比如说我们我们会说在仓库场景 ,在工厂场景 , 我们要的就是两只手 , 我们不需要两条腿 , 我们用轮子就能解决在工厂环境里面的移动搬运 。

我最近看了几部嗯波士顿动力的访谈 , 里面有几段对话其实对我启发还是挺大的 。 很多很多老生常谈的观点是认为整个世界是为是为人类去设计的 。

嗯 , 所以呃 , 人形机器人一定是一个最通用 、 最高效的呃这个形态 ,因为它意味着一个形态可以适配非常多的环境 。

但是可能对于一些地面本身已经比较平整 、 嗯 , 比较结构化的环境里面 , 嗯 , 似乎轮式机器人也可以完全实现类似的通过性 。

就我们没有必要真正要两两条腿 。 但是我告诉你一个很有意思的现象 , 今天一个人形机器人如果在一个结构化的环境里面移动 , 假设我们运动的问题得到了充分的解决 , 它在一个结构环境里面稳定的移动 , 它大概只需要 40*60 厘米的空间 。

而且因为它的腿或者说身体有非常多的自由度 ,其实它可以下探和上触非常高的这个空间范围 。 嗯 , 我们要实现同样的事情 , 假设我们希望像人形机器人一样可以搬运一个 10 公斤或者 20 公斤的箱子 , 今天的很多全尺寸的人形机器人基本上已经可以实现这个功能 。

而且它可以从从地面的高度一直搬到比如说像波士顿动力大概是 2 米左右的高度 , 它实际上最高今天新的形态最高可以触达 2 米 3 的高度 。OK, 这是今天人形机器人的现状 。

如果我们要做同样的事情 , 轮式机器人, 你要知道其实它的复杂度完全不比人形低 。

曼祺36:47

轮式底盘一般要多大呀 ? 要占多少面积啊 ?

陈哲36:49

肯定比这个大 , 肯定比 40-60 厘米大 。

曼祺36:52

因为你刚说的 40-60, 那差不多就是两个苹果电脑摆在一起的这个面积 。

陈哲36:57

对 , 就是就是我们就是我们人站立的面积 , 这是我们需要的最小面积 。 如果是一个比较窄的空间或者是一个过道 , 它其实只需要很少的面积就可以过 。

但是你知道轮式机器人最大问题是什么吗 ? 轮式机器人最大问题是重心问题 。 嗯 , 我举一个例子 , 就是波士顿动力除了做这个 Atlas,他们还有一个项目叫 Stretch, 嗯 , 是一个复合机器人, 巨大的一个 AGV 的底盘 , 上面加了一只巨大的单臂手臂 , 然后这样的一个结构呢 , 它可以从一个集装箱或者从一个货架里面拿下来 , 大概 20 公斤左右 , 可能 25 公斤的一个箱子 。

那为了拿一个箱子 , 整个 Stretch 这样一个复合机器人的重量大概在一吨左右 。

曼祺37:37

因为它升得很高的时候 , 它得让下面很重 , 对吧 ?

陈哲37:41

对 , 这样它可能就翻了 。 嗯 , 对 ,但是你想想人的这种结构 , 我们是可以非常动态的调节我们的呃重心和我们的姿态 , 来实现同样取放 20 公斤箱子的目的 。

而今天可能一个全尺寸的人形机器人, 哪怕比较重的一个人形机器人, 可能也就是七八十公斤 。 那相比一个可能一吨的 Stretch 或者 800 公斤的 Stretch,是十倍的重量差别 。

曼祺38:05

哎 , 这个挺有意思 。 越说越觉得就是生物界是非常神奇的 。

陈哲38:09

我再讲一个我最新的一个认知 , 嗯 , 就是如果我们想做一个 , 我们想做一个在空间里面移动性非常好的轮式机器人 ,其实最理想的方案是做成四轮四转 。

曼祺38:23

四轮四转 。

陈哲38:24

对 , 嗯 , 可能都不是两个叉扈轮 , 可能是四轮四转就非常的自由 。 那四轮四转如果你都是主动电机 , 可能你就需要 8 个电机 。

如果你你你要像人形机器人这样在适配不同的高度 , 你可能还需要好几个电机 ,有一些升降的这种结构 。

曼祺38:41

所以你刚刚讲的几个点啊 , 一个就是说在同样的表现性能上 ,其实轮式不一定比做人形简单 , 就复杂度上 。

陈哲38:51

成本也不一定比人形低 。 如果我需要更多或者相同数量的电机 , 且更高的质量 ,因为我的底座如果更重了 , 我所有的成本都会增加 。

我需要更大功率的电机 , 我需要更大功率的电池 , 它都会快速的增加你的成本 。

曼祺39:05

所以复杂度和成本不一定比人形低 。 而另一方面 , 如果就是人形的这种形态 , 它能在技术上实现的比较好的话 , 它可能能打开很多我们可能之前没有想过的 ,因为有了这个供给而可以去做的事 。

就它的场景是可能是可以打开的 。

陈哲39:21

而且我觉得 Atlas 这个新版本的 Atlas 其实给了我们很多信号 , 就是人形机器人也不一定真的非要一定像人。

它可以做一个超人, 它可以超越人的某些结构 ,因为人体这种结构之所以进化成这个样子 ,也是大自然非常偶然的 。

曼祺39:38

嗯 , 那正好可以展开讲一讲 ,因为前面你提到的第五个进展也是 Atlas 这个新的电动版 , 它什么地方是像人同时还超越人了 ?

Atlas与Optimus39:45

陈哲39:45

新版的 Atlas 我觉得有有几点嗯值得关注的地方 。 嗯 , 第一个呢 , 嗯 , 它用了非常模块化的设计 , 就有点像协作臂跟工业机械臂的区别 。

以前工业机械臂每一个关节都有专门定制的这个电机和减速机 , 是一个非常复杂的一种串联结构 。

但是到了协作臂 , 我们可能就把协作协作手臂上的电机简化成非常少的这种标准化的电机 。 那么在 Atlas 这件事情上面 ,其实他们利用了相似的这种逻辑 , 就是他们没有那么多非常复杂的电机的结构和选型 , 整个机器人都用很简单的旋转电机 , 嗯 , 通过电机的性能的冗余实现了的多功能化 。在手臂上 ,在大腿上 ,在小腿上 。

嗯 , 那它的好处是从生产和组装的角度 , 它的难度会非常低 。 而且它还有一点是 , 它没有受限于人体本身的一些物理限制 , 比如说它的头部跟躯干都是可以做 360 度的完整的这个旋转 。

那这件事情在真人身上是做不到的 。

曼祺40:54

这么接着 。

陈哲40:55

对 , 头可以转可以转的很准确 。 对 ,但它的它带来的好处是非常显著的 。 就我们如果一个人从面向北面要转到面向南面 , 我们这个动作可能需要三四步的转身 , 我们的腿和身体都需要联合进行好多步的动作 。

但对它来说 ,其实就是腰部的电机 360 度旋转就完了 。

曼祺41:19

哦 , 所以它就它下面其实左腿右腿都是无所谓的 , 对吧 ? 它转过来之后它就它甚至不分 , 它甚至不分左腿右腿 。

嗯 , 它的左右腿是可以互换的 。 嗯 , 嗯 , 左右手应该也是一样 。 所以它有一套高度模块化的结构 ,不光在场景里面的适应度更高 ,在生产组装的时候难度也会降低 。

同时在现场如果遇到了故障进行替换的时候 , 成本也降低 。 而这件事情为什么我会专门提到波士顿动力 , 我认为这个跟美国今天的这个整个制造业和整个这个产业发展的现状是非常相关的 。

美国是非常缺熟练的这种技术工人。 嗯 , 所以要把它设计得更尽量简单 , 简单容简单易装配 。

陈哲42:03

对 , 通过性能的冗余结构的简化来解决安装和维修的问题 。

曼祺42:09

那正好可以进入我们下一个话题 ,因为我们前面讲的都是中国的一些公司 , 然后你也正好讲到了一些你关于就是人形这个形态必要性的新的认知 。

你刚刚也去美国和很多美国的从业者去聊过 , 可以讲讲美国的这些比较热点的人形机器人公司的一些进展 。

我觉得首先你可以说一下, 就是在业界大家比较关注的美国这块的公司是哪些 ?

陈哲42:29

嗯 , 我觉得可能最多关注的肯定是特斯拉的 Optimus, 然后以及融了嗯最多资金也是估值目前最高的这个 Figure AI。

当然传统一点的公司 , 包括像波士顿动力 , 还有一些可能更长尾的公司 , 像这个挪威的这个 One X, 嗯 , 德克萨斯州的这个 Electronic,Apollo 机器人, 嗯 , 都算是目前在美国市场上还在活跃的人形机器人的公司 。

但可能最关注的 , 最被市场关注的还是 Optimus 跟 Figure。

曼祺42:56

那像大家也经常提及的 Pi、Sunday、Generalist,他们不算是做全人形的公司 , 对吧 ?

陈哲43:02

他们还算是以模型为核心的公司 。

曼祺43:04

就以智能的部分为核心的公司 。

陈哲43:06

对 , 我觉得 Sunday 是一个以模型跟数据为主 、 轻硬件的一个公司 。

曼祺43:10

好 , 那我们可以从 Optimus 开始讲 , 这个我觉得也是做这件事情在美国可以说是新一轮风潮的这个先驱者 。

嗯 ,其实也激激发了中国的一批公司的创业嘛 。 然后就是前阵子马斯克自己是在采访里说过 , 说 Optimus 的第三代就是 Gen3, 它是已经设计定型了 。

但是我们这边从中国供应链了解的情况是 , 它本来要在 4 月发布亮相 , 然后这事可能又延期了 , 应该至少得延到 6 月下旬吧 。

量产的时间可能也会延 , 之前的计划应该是在今年的 10 月份 , 现在有可能会延到明年 。

陈哲43:44

对 , 之前我听说的是 , 嗯 , 可能最早的计划是要今年 3 月份或者 Q1 要发布 , 对吧 ? 感觉这个就已经拖了又拖了 。

对 , 感觉这计划一直在 delay 的 。 嗯 , 嗯 , 我觉得是符合预期吧 , 就是就是伊朗的很多工作可能从嗯 , 我们这个行业就有一句话说 "Elon is alwaysright," 但是他的 "timing is always wrong."

你可能得增加很长的时间 。 我觉得对 Jim3 来说 , 我获得的信息也是 ,不管是在硬件还是在软件方面 , 遇到的挑战还是蛮大的 。

嗯 , 嗯 , 硬件方面具体来说 ,在手方面遇到的挑战比较大 ,因为他们在做一个非常非常有野心的这个高自由度的神驱方案 。

我觉得这个方案在量产跟可靠性上遇到了巨大的挑战 。 但是另外一点呢 , 就是嗯 , 伊朗对于今年 Optimus V3 的量产或者出货量也给了非常高的预期 , 嗯 , 至少也是万台左右这样的一个预期 。

曼祺44:41

一万台的意思 。

陈哲44:42

呵呵 , 至少一万台 。

曼祺44:44

这感觉怎么好像又比他之前说的缩水了 。

陈哲44:46

可能是在缩水吧 。 如果我记得可能在 25 年的时候 , 当时就说要实现一万台 , 对吧 ? 可能 26 年已经是 10 万台或者百万台了 。

但考虑到现在已经进入了 4 月份 , 甚至一万台的量也是非常有挑战的 。

曼祺44:59

你刚说他的手是一个高自由度的神驱的方案 , 这个其实之前我们也和一些供应链的人聊 , 就是特斯拉这边其实他们也在 ,他们也在考虑就是电机的方案 , 或者说他们给某些这种供应商他是提了类似的需求的 。

陈哲45:13

嗯 , 你说的电机应该是指的嗯直驱为主的方案 ,因为神驱神驱里面也会有电机 , 只是把电机放在了前臂这个位置 。

现在的神驱方案是是把大量的电机放到了这个前臂这个地方 , 嗯 ,不是在掌心里面 。 嗯 ,但是像 Sharpa 这样的 , 像 Sharpa 这样的直驱方案 ,是把电机直接放到了嗯每个指节关节这个地方 。

嗯 , 我觉得这是这是两个嗯完全不同的设计的这个理念跟逻辑 。 伊朗选择神驱方案是认为它是一个更仿生 、 更第一性的方案 。

曼祺45:45

是因为他人是这样的是吗 ?

陈哲45:46

对 , 就是神是就是人手上的筋之类的这种东西 。 对 , 这个肌肉肌腱人是这样子的 。 所以为了实现呃非常仿人的这种灵巧性 , 嗯 , 伊朗认为神驱方案是是必须的一个方案 。

但是神驱方案带来的问题是非常多的 , 这也是为什么在过去可能一年左右的时间 , 嗯 , 陆陆续续我听到了蛮多的反馈 , 就是在这条路线上还是遇到了巨大的挑战 。

组装一只高自由度的灵巧手 , 意味着你需要在手腕和手掌这样的空间里面 , 可能需要嗯插入 40 多根不同的这种电绳 , 然后你要解决他们在一致性 、 他们在拢变 、 他们在可靠性方面各种问题 。

然后当任何一只电绳出现了这种松动 , 或者说你需要替换或者损坏的时候 , 你的再组装和维修也是非常大的一个挑战 。

曼祺46:40

嗯 , 这听着有点像就是你手受伤了 , 要给你搞个外科手术的那种 。

陈哲46:44

对 , 感觉所以我跟挺复杂的啊 。 所以我跟一些朋友交流 ,他给我反问了一个很有意思的问题 , 我们都说伊朗选择神驱灵巧手 ,是因为他认为这是一个更第一性的选择 , 更加仿生的选择 。

但是我的朋友其实反问我一个问题 , 说你既然已经用了电机 , 你就不是肌肉 , 你从何而来第一性的第一性的类比 ?

因为人的肌肉 、 人的组织是可以再生的 。 嗯 , 如果我们有肌肉的损伤 、 有拉伤 , 通过一段时间的恢复跟训练 , 它是可以自己康复的 。

但是对于电绳或者电机或者齿轮而言 , 它的磨损就是不可逆的 。 同时肌肉具有非常高的能量密度 、 力矩密度 ,但是对电机来说 , 嗯 ,不论是体积还是能量密度来讲 , 跟肌肉都有巨大的差别 。

所以你用一个不是肌肉的东西去模仿肌肉的表现 , 然后你预期它没有同样的性能 , 这个本身就并不符合第一性 。

曼祺47:46

那如果工程师有这些想法的话 ,他们在 Optimus 内部 ,他可以怎么反馈到马斯克那儿吗 ?

陈哲47:52

我觉得在这件事情上面 , 就跟伊朗当时做自动驾驶选择纯视觉方案和端到端 , 伊朗都是非常强势和固执的 。

所以这是对我来说也是一个作为一个行业的观察者来说 ,也是一个非常纠结和困惑的地方 。 伊朗历史上在很多长期的技术路线的选择和判断上面都被证明是对的 ,而且是 against 了基本上市场上所有人的声音 。在 Autopilot 内部 ,在 1617 年他们刚开始做的时候 ,其实所有人也不相信伊朗对于纯视觉或者端到端的一些前沿性的 vision, 实际上是通过过去几年逐渐的工程和技术的努力 ,

才把这样的愿景给实现 。 所以灵巧手会不会遇到同样的事情 , 我今天也是说不准 ,但是我的确看到了神驱灵巧手至少在 26 年量产 1 万台 , 可能会遇到的巨大的挑战跟问题 。

曼祺48:46

对 , 我我觉得这是一个之后可以去观察的点 , 就是 Optimus 的灵巧手的技术的构成会不会有变化 , 它会不会在现在这个方案上去选另一条路 。

嗯 , 嗯 , 然后另一个你刚才提到的公司 , 就说融资最多 、 估值最高的是 Figure, 然后我之前和很多中国具身的创业者交流 , 我觉得大家对 Figure 的态度是比较复杂的 。

Figure与美国48:57

曼祺49:09

一方面觉得它好像时不时的释放一些挺不错的成果 , 然后一方面又觉得这公司的风格非常浮夸 。

陈哲49:15

啊 , 这公司的确是非常浮夸 。 我觉得他们他们应该值得奖励一个奖励一个奥斯卡最佳影视特效奖 。 我觉得可能跟 Brett 作为一个创业者的经历有关系 。

嗯 , 创始人, 嗯 , 就他是一个很善于跟投资人传达这种愿景和故事的一个呃创始人。

曼祺49:34

他创立 Figure 之前是干嘛的 ?

陈哲49:36

呃 ,在 Figure 之前 ,他做了另外一家公司叫 Archer, 是一家呃飞行汽车公司 , 或者说 Evoto 公司 。

曼祺49:44

垂直起降飞行器啊 。

陈哲49:45

那个公司我没有记错的话应该是 21 年上市的 , 然后没有多久他就离开了这家公司 , 然后成立了 Figure。 嗯 , 然后在之前他也卖过他的第一家创业公司 。

所以 Brett 的特点是能够不断的找到下一个创业的这种热点 , 然后也能够吸引一群对他的愿景和能力呃呃有所认可的投资人。

而且至少历史来看 ,他要么快速的把公司卖掉 , 或者把公司带上市 。 所以这是嗯 , 这是他一贯给给市场留下的这种印象 。

曼祺50:19

嗯 , 所以他是一个有愿景 , 然后又连续成功退出过的创业者 。

陈哲50:24

对 ,但你也可以说他做的很多事情是为了快速的把公司卖掉 , 或者说呃快速让公司上市 。 因为事实上他就从 Archer 这家公司退出了 ,而 Evoto 今天还在行业的非常早期 。

嗯 , 我其实听说他们今年还是去年他又成立一家新的公司 ,而且也投入了蛮多资金去做 , 是一个智能硬件公司 。

我认为这一系列的背景都是大家对于 Brett 这个人作为一个创始人的许多的诟病 , 嗯 , 就是他是否真的有足够的专注度和韧性 。

曼祺50:57

为什么以前大家对马斯克没有这样的诟病 ?

陈哲50:59

因为马斯克把很多事情做成了呀 , 或者或者在马斯克把特斯拉做成 , 或者把 SpaceX 做成之前 , 大家可能也区分不了他跟一个骗子的区别啊 。

曼祺51:08

对 , 那应该这样说 ,其实早期可能马斯克也受到很多质疑 。

陈哲51:12

对 。

曼祺51:12

只不过随着他把一些事一步一步给做成之后, 这些声音变淡了 。

陈哲51:17

嗯 , 对 , 所以 Brett 到底是不是这样的创始人, 我觉得市场今天是有很多争议的 。 但是从结果来看呢 , 我觉得 23 年 Brett 成立 Figure 的时候 ,是在一个高度质疑的声音中呃诞生的 。他自己并不真正的了解机器人行业 , 早年的很多成员 , 包括从波士顿动力和从嗯其他地方吸引的这种机器人或者硬件的这种人才 , 很多也在公司成立的一两年过后陆续离开了公司 。

但是不可否认 , 整个行业发展速度是非常快的 。 所以我的感受是在过去一两年的时间 ,Figure 是吸引了非常多优秀的无论是硬件还是软件的人才嗯加入公司 , 然后也的确给出了很 solid 的结果 。

我们看到他过去发布的这几款新的这个人形机器人, 包括他展示出来的这种全身运控的这种这种展示 , 我觉得体现了他们在这个领域里面是非常有干货的 。

曼祺52:12

因为他们其实是一个硬件和模型都做的公司啊 。

陈哲52:15

对 。

曼祺52:15

就模型这块他们的业内评价如何呀 ?

陈哲52:18

他们是比较早的在业界宣布了他们那个 Helix 嗯 AI, 一个双层以及三层构架的嗯公司 , 嗯 , 实现了嗯一个统一的从一个低频到中频 , 再到一个高频的整个全身运控的这样一套算法的框架 。

嗯 , 我觉得从展示出来的效果和我从内部同学听到的这种表现来讲的话 , 嗯 ,他们的能力在市场上还是非常领先的 。

当然可能也是因为除了 Optimus 之外, 美国并没有太多真正从事这个全尺寸人形或者复杂人形硬件和模型的公司 。

嗯 , 所以在这一点上, 我觉得他们是代表了可能美国目前市场的最高水平 。

曼祺52:59

因为其实你看他在这个领域也融了很多次 , 对吧 ? 美国看起来也有资金愿意支持这个方向 。

陈哲53:04

对 。

曼祺53:04

为什么美国这样的公司很少啊 ? 而对比国内 ,其实国内有好多好多具身智能公司 ,25 年下半年还不断的在涌现新的公司 。

陈哲53:12

这跟美国整个制造业的衰退 、 整个机器人供应链或者整个硬件供应链的衰退是密切相关的 。

曼祺53:18

就是他支持不了那么多创业公司出现 。

陈哲53:20

对 , 这也是为什么中国大家开玩笑 , 几百万的成本可能就可以传出一台人形机器人 ,但这件事情你很难想象在美国能够做到 。

实际上 Figure 之所以要融这么多钱 , 呃 , 我觉得另外一面可能也是体现了这个美国制造的这种国家战略或者国家意志 ,是希望通过重点的扶持一些头部的企业 , 呃 , 能够带动呃所谓的这美国制造业的回流 , 或者这种美国制造业的复兴 。

因为大量的大量的供应商和零部件厂商或者零部件的这个产业在美国已经不复存在了 。 嗯 , 所以对于 Figure 来说 , 如果他们想完全本土生产这个人形机器人 ,其实需要多大量的前期投入的 。

这个事情呢 ,也是我们看到的目前美国社会的主流的一个趋势 , 或者说战略上的一个选择 。

曼祺54:10

哦 , 那另一个我觉得美国政府可能会扶持的就是波士顿动力 ,而且说实话也已经扶持很久了 。 这个公司成立老早了 ,92 年就成立了 。

陈哲54:17

对 。

曼祺54:18

都 30 多年了 ,其实他一直也没有大规模商业化 ,也没有赚很多钱 ,但是也一直存在着吧 。 当然中间就他背后好几个公司就是收购 , 然后买卖过 。

嗯 , 呃 , 前面其实是讲到就波士顿动力在自己的新的电动 Atlas 的硬件上的一些进展 。他其实 QQ 还有一个进展 , 就是他们也在模型在智能这一块是找了一些合作方 , 就是 Google 啊 。

嗯 , 这个可以呃展开讲讲 , 就是他们最近有什么新的变化吗 ?

陈哲54:49

对 , 这个东西其实呃很不奇怪 ,因为其实我们知道在一两年前 , 呃 DeepMind 呃一开始是跟呃德克萨斯州的这个 Aptronik 这家呃人形机器人公司合作 。

当时他们的产品是一个叫 Apollo 的嗯全尺寸人形机器人。 那事实上我听到这段合作是非常失败的 , 本质上就是呃 Apollo 呃这个产品的硬件的可靠性 , 嗯 , 包括精度 , 包括呃一致性都有巨大的挑战 。Google 的研究员在花很多时间让这个机器能够用上 ,而不是在做呃真正有效的研究 。

我觉得 Google 选择波士顿动力进行这样的合作 , 呃 , 我觉得是非常明智的一个选择 。

曼祺55:31

Google 为什么不自己来做全人形的机器人啊 ? 你之前在 Google 其实也是做硬件相关 , 对吧 ? 你做过 Google Glass 这些啊 。

陈哲55:39

我觉得 Google 包括 Meta 这些公司互联网公司完全没有做硬件的基因和能力 ,因为做硬件是一个非常复杂的非常复杂的系统工程 ,而且它需要整个产业链的配合 。

曼祺55:49

那这是不是也分不同类型的硬件了 ? 比如说 Meta 的眼镜好像做的还不错 ,是不是跟这个硬件的复杂度也是有关系 ?

陈哲55:55

我不觉得 Meta 的眼镜做的很不错 。Meta 眼镜是在巨大的亏损和补贴下实现的 。

曼祺55:59

所以他只是卖的不错 。

陈哲56:00

事实情况就是 Reality Lab,Reality Lab 累计应该是亏损是几百亿美金 。 过去的 10 年, 就是从从 Oculus 被收购到 Reality Lab 被降级 , 嗯 , 这 10 年期间 Meta 应该是亏损了上百数百亿美金 。

嗯 ,Meta Ribbon 的确是卖的很好 ,399 美元 ,299 美元 ,但是实际上一个正常的 Ribbon 的墨镜就应该卖这个价格 。Ribbon 是有百分之九十几的毛利的 , 那对于对于 Meta Ribbon 那个智能眼镜来说 , 它基本上是按照它的成本价 , 甚至是补贴的在卖 。

那你可以想象每副眼镜它到底要给 Ribbon 转移多少的这个费用 。 我觉得这个我觉得眼镜 business 对于 Meta 来说是一个挺失败的生意 ,其实这可能是有点扯远了 。

曼祺56:44

呃 , 这一次 Google 和波士顿动力的这个合作 ,他们要怎么去解决生产制造的问题啊 ? 因为我觉得他应该也不会想让中国公司来特别深度参与这个事情 , 对吧 ?

陈哲56:55

波士顿动力现在主要的股东是现代汽车 。 嗯 , 呃 , 所以在在生产制造 ,在供应链上面其实是有蛮多这个现代作为一个汽车汽车公司的这种呃帮助跟这种资源 。

实际上他们的很多生产组装 , 包括这个前期的测试 , 都是在现代的工厂里面做的 。 哦 , 就是所谓美国的盟友 。

曼祺57:16

你说到这个 , 我觉得美国有一个方法 ,他现在不是让日本和韩国这些就是有制造能力的盟友都要去美国本土投资吗 ?

陈哲57:23

对 。

曼祺57:24

他其实可以用这种方式 ,他可以去补足 , 比如说在机器人在这种比较复杂的硬件本体上的制造能力 。 你觉得这有希望 , 这是条路吗 ?

陈哲57:33

我觉得这是条路 ,但就意味着其实这跟电动汽车的封锁一样 , 就意味着可能同样的东西在美国做 , 你就是要付出两到三倍的成本 。

那这个这个成本可能长期要被美国社会所承担 。 那这个是不是客户是不是消费者愿意接纳的 ?

曼祺57:51

刚才讲的这些公司是跟制造环节比较相关的 , 就是他们会涉足本体的一些公司 , 包括 Optimus、Figure、 波士顿动力等等 。在美国还有一些具身的公司啊 ,他就是我们前面提到像 Pi 这种 ,他是比较专注在模型方面的 。

灵巧手57:58

曼祺58:05

嗯 , 这个其实也被很多中国的从业者认为是标杆 , 比如说 Pi 0.6 它最新的模型 , 还有 Sunday 和 Generalist 的数据采集的方案 。

这些公司有什么新进展 , 你觉得是值得在 QE 去关注到的吗 ?

陈哲58:20

我我觉得 Pi,Pi 除了去年发布这个 0.6 的工作 ,其实 Q1 在持续的发布一些很有影响力或者很有很有创意的工作 , 比如说他们在他们 Q1 有发布过呃怎么解决这个呃长续记忆问题的这种这种思路 ,其实有点像 OpenClaw 的方式 , 就通过一个呃通过通过一个文本的方式能够长期记录他现在的状态 ,以及对他现今天的状态进行不断的反思 , 来增强他在常识操作这种一致性跟

稳定性 。他们也有也有一些对于增肌强化和一些呃复杂场景呃在最终这个执行端 ,在在在这个这个动作端进行这种在线强化学习的这种新的思路跟框架 。

嗯 , 我看整个 Q1 Pi 发布的工作还是很能够代表整个市场在 cross embodiment 和 dynamic 的这种环境的这种适应性的工作 。

我觉得这点 Pi 还是全球范围来看还是最领先的 。

曼祺59:25

嗯 , 你刚说第一点就是它类似于像 OpenClaw 这样给它加一些长时间的记忆 , 它是在系统层的 , 对吧 ? 它是外挂在模型外面的 。

陈哲59:34

对 。

曼祺59:34

我觉得这个其实中国很多从业者也注意到了 , 就所以现在行业里也有一种表达 , 我他们会把这个事情表达成就是呃具身的模型其实本质上是物理世界的一个 agent, 一个 physical agent。

虚拟世界的 agent 其实它现在已已经不只是模型了嘛 , 它有编排层 , 然后有 skills, 然后有工具 ,有记忆啊 。

就具身现在行业现在也会讨论这个事情 , 就说除了具身基础模型之外, 你的这个系统整个要怎么去组织 , 然后让它能在一个复杂的环境里去完成任务 。

陈哲1:00:06

对 ,其实回答到你模型架构的这个问题 ,Saba 这次在 CES 嗯有一个分享 ,其实提出了一个三层架构的一个逻辑 。

嗯 , 我认为今天提出多层架构逻辑的公司有好多个 , 包括像刚才提到的这个 Helix,他们也有一个三层架构 ,Figure 那个网络 , 就 Saba 的这个三层构架分为 System2、System1、System0。

那 System2 是一个很低频的 ,但是很高维的语言层的一个规划 。

曼祺1:00:38

嗯 , 低频就是慢的意思 , 对不对 ? 我理解 。

陈哲1:00:40

低频 , 对 , 就快系统 。

曼祺1:00:41

慢系统 , 快系统的那个有点是接近那个意思啊 。

陈哲1:00:44

就是就是快慢系统 ,因为之前 System2、System1 是一个快慢系统 , 就是一个双系统 。其实 Saba 是引入了第三个系统叫 System0。

曼祺1:00:52

嗯 , 那你可以先把那个最上面那一层说完 , 就它是比较宏观一些规划的东西 。

陈哲1:00:55

对 , 就是 System2 是一个比较宏观的 System。System2 的 input 是以文本为主 , 所以那对于下面一层这个 System1, 它 take 的是它看到的视频或者图像的信息 ,以及机器人现在的状态和我文本描述的这个任务 , 比如说我要去哪个地方做一件什么事情 , 那它输出什么呢 ?System1 输出的就是我手臂或者说关节的具体的这种这种动作 ,但是它这个动作是一个很粗糙的动作 , 可能比如

说今天的 VOA 可能输出的就是手臂关节大概的这种这种呃力矩的信息和夹爪的开合的这样的信息 。

那在 Saba 那个架构里面 , 它有一个新的 System0, 它的 input 是触觉信息 ,以及从 System1 传达下来的一个粗略的运动轨迹 。

那当你有一个粗略的运动轨迹和一个触觉的这个 input 的时候 , 你就可以实现很多具体动作的闭环控制 。

曼祺1:01:58

它没有摸到一个东西之前 , 它的触觉信息是来自于什么呢 ? 是来自于对这个东西的预判的吗 ?

陈哲1:02:04

没有 , 就当你摸到它过后, 你该做什么 , 你该做什么 , 这是这个模型要解决问题 。

曼祺1:02:10

所以它其实在那个就系统 1 的时候 , 它可能就已经接触到这个东西了 。

陈哲1:02:14

对 ,但是位置不太准 , 位置是错的 , 或者说这样子接触嗯并不能准确把它拿起来 。 嗯 , 然后这个时候呃 System0 就开始介入 。

嗯 , 然后 System0 的目的就是根据我现在已有的呃触达的接触的这个信息和我的意图 , 我的任务的意图 , 我应该具体的每个手指每个关节应该做什么 。

这是这个最最低层的 ,也是最高频的模型需要解决的 。

曼祺1:02:42

因为其实对人来说 ,他看到一个杯子 , 比如说这有一个瓷杯 , 这有一个易拉罐 , 对吧 ? 我其实大概能判断它的材质 、 摩擦和重量 。

陈哲1:02:51

对 ,但是你你没有触觉 , 你不知道干什么 。其实其实我们用人的 , 我们用人的生理结构来类比 , 就是大脑 、 小脑和末端 。

嗯 , 神经 , 对 , 反应 ,因为你有很多应激反应 。 当你被被碰到的时候 , 你会遇到一个很烫的东西 , 你会你会躲开 。

嗯 , 你遇到一个粗糙的东西或者是一个软的东西 , 你会有不同的末梢神经的反应 。 实际上它这个架构是在嗯模拟人的这样的分层的一个体系 。

曼祺1:03:16

嗯 ,其实我刚想说的是说 , 就是它有了这个架构之后, 它是不是以后通过比如比如说它真真实使用起来 , 或者它强化学习 rerout 的数据来学习 ,其实也能做到像一个比较成熟的人, 大概可以预判我怎么去精细操作 。

因为人如果你有比较多生活经验之后, 你看到一个东西 ,其实你不用实际摸到它 , 你已经对它大概要怎么精细操作是有一个预判的 。

陈哲1:03:39

这就是可能就会涉到这个世世界模型的这种脑补跟预测的能力 。 这的确就是大脑 , 大脑本身在产生的这个运动轨迹 , 或者说这个控制轨迹应该产生的方向 。

但是你之所以可以把它准确的拿起来 , 还是因为你的手上是有是有触觉的 。

曼祺1:03:57

对 , 之前有一些这种实验 , 就把人的这个手指的这个神经末梢的一些感觉给屏蔽之后, 一些看起来很简单的工作你就做不了了 。

陈哲1:04:08

是的 , 换句话说 , 如果把你眼睛遮住 , 你也可以完成很多任务 。 所以触觉对于我们最终这个任务的实现是非常重要的 。

而今天的 VOA 也好 , 世界模型也好 , 今天的整个训练范式基本上可以说是完全没有触觉信号的 。

曼祺1:04:23

嗯 , 所以 Saba 你觉得这是一个很好的进展 。

陈哲1:04:26

它展示了就是当触觉引入到一个就是高自由度的一个末端执行器 , 嗯 , 灵巧手这样的产品的时候 , 我们是怎么样可以去完成一些之前其实你很难想象可以完成的任务 。

曼祺1:04:39

这次你去美国的话 , 据你所知有哪些公司和机构和学校在用 Saba 的手做一些研发 ,以及他们比如说看到了一些什么 ?

因为有了这个就是新的触觉的信息之后, 新的成果呀 。

陈哲1:04:54

首先呃 , 这个感受可能从去年年中, 包括去年下半年开始 , 这个感受就非常强烈 。 嗯 , 如果我们看具身智能或者机器人前沿领域的研究 , 如果我们退回四五年, 我们大概在做四组嗯运控的一些研究 。

那么在一两年前 , 我们在广泛研究 VOA 以及两指的夹爪 , 或者像 Umi 这种结构的一些灵巧操作 。 那包括在可能过去一年, 嗯 , 整个人形的 locomotion 的问题也初步得到解决了 。

所以如果你是一个研究具身智能领域的世界前沿的研究研究人员 , 你今天应该研究什么 ? 就下一个 , 什么是下一个你值得研究的方向 ?

我就从去年开始 , 基本上所有我接触到的研究人员 ,他们的共识都会围绕着灵巧手 。

曼祺1:05:43

灵巧手 , 世界模型不是吗 ? 世界模型也是 。

陈哲1:05:45

世界模型也是 ,但是世界模型很有可能是一个大厂主导的研究方向 。 嗯 ,因为它的 。

曼祺1:05:51

因为伟达最近有很多发布 。

陈哲1:05:52

世界模型的 backbone 是视频生成模型 , 实际上今天有能力还在牌桌上做视频生成模型的 , 都已经是绝对大厂了 。

视频生成模型本身的挑战就是它对于算力的消耗 , 对资源的消耗是指数级增加的 。 它的计算量是远远大于这个文字模型的 。

嗯 , 这也是你为什么看到 Sora OpenAI 几天前刚刚宣布他们要停止这个 Sora 的这个这个产品的工作 。 以谷歌为例 ,其实在在视频生成模型每每天的投入 , 研发的投入 , 算法的投入是巨巨大的 。

这个对于任何创业公司来说是一个很难想象的一个量级 。

曼祺1:06:28

对 ,OpenAI 难道也是吗 ?OpenAI 这么多钱 ,是因为它想聚焦一些 。

陈哲1:06:32

我觉得它是 。

曼祺1:06:33

去和 Anthropic 去竞争去吧 。

陈哲1:06:35

我觉得今天今天 agent 跟 coding 是一个非常明确的这种需求 。 嗯 , 我觉得这一点 OpenAI 是落后的 。 但是可能更大的问题是 , 的确视频生成是一个非常消耗资源 , 且如果你没有明确的下游的消费和变现的场景 , 对于公司来说就是一个巨大的持续投入 。

就为什么你从全世界范围来看 , 今天可能真正做最好的视频生成模型是字节的 Seedance,是谷歌的 Veo, 嗯 ,是 Grok 的 Imagine, 快手的科灵 ,其实这些都是全世界可能最大的互联网公司 。

曼祺1:07:07

嗯 , 那可以把就是你说的研究员在做的这个灵巧手的这个事说完啊 。 那他们现在主要用哪些公司的手了 ?

这听起来也是一个创业机会 。

陈哲1:07:15

对 , 嗯 ,其实 Saba 的手 , 嗯 , 正式的发布应该是在 25 年的 5 月份 , 亚特兰大的这个 ECON 2025 的这个会议上面 。

嗯 , 我正好也参加了那场会议 , 嗯 ,也是现场第一次体验了这个手的这个效果 。 嗯 , 的确是非常惊艳 。

嗯 , 嗯 ,但实际上可能在过去一年, 过去一年海外研究人员用的最多的手应该是心动机源的那只中自由度的 、 十二自由度的手 。

只是在过去的三四个月 , 随着这个 Saba 的这个手提供给了海外这些研究员 , 可能大家开始也也用上了 Saba。

曼祺1:07:51

心动机源那个是 12 个自由度 ,Saba 这个是 22 个自由度 , 那就是跟人手一样 , 人手是 22 个 , 人手不算手腕的话是 22 个自由度啊 。

陈哲1:07:59

对 ,其实你要做一些复杂的复杂的操作 , 自由度少了是是完成不了的 。 包括像今年初这个英伟达发布的这个 EgoScale, 嗯 ,其实可以很好的映射到这个 Saba 的这个高自由度这个手上面 。

曼祺1:08:13

它 5 万美元一只 , 美国学校这么有钱买得起吗 ?

陈哲1:08:17

很多是补贴的 。

曼祺1:08:18

是因为也是想让自己成为这种研究的一个基础环节 。

陈哲1:08:23

对 , 我觉得我觉得可能未来 12 个月吧 , 或者未来 18 个月 , 嗯 , 我觉得市场上的玩家可能会在谁是灵巧操作和灵巧手研究里面的这种行业标准 , 就是默认的这个选择会有很激烈的一个竞争 。

曼祺1:08:41

就类似于 G1 的这种位置 。

陈哲1:08:43

对 , 今天你做人形研究 , 如果你不用机器人, 你发一篇 paper, 别人都很难去复现你的工作 。 如果灵巧手出现一个类似的产品 , 它也会成为全球研究人员就是默认的选择 。

嗯 , 那它意味着什么呢 ? 意味着这个手一定是足够的可靠 ,有足够高的自由度 , 能够完成我们期望的各种复杂的这种嗯操作跟研究 ,有比较低的成本 ,以及有比较完善的传感器和开发的这种环境和能力 。

曼祺1:09:17

我觉得 Saba 的目标肯定是要大于这个 。 就是今天我跟李帆稍微聊了一下, 我说最近有很多从业者都说你们的手很厉害 , 我说我们可能会录到一个节目 , 会讲讲到这个事情 。他说他觉得最重要的还是 AI 能力 。

陈哲1:09:31

我非常理解 ,因为因为他们的目标还是要做一家通用机器人公司 ,他们的目标不是一个灵巧手公司 。 但是我认为这里面可能有个巨大的被低估的机会 。

我觉得灵巧手灵巧手可能是一个巨大的机会 。 这里面的一个 lesson 是什么呢 ? 就是宇树成功的路径 。在 20 年的时候 ,20 年的时候 ,因为 19 年 MIT MiniCita 的论文的开源 , 让整个市场瞬间出现了非常多的做四足机器人的公司 。

曼祺1:10:02

嗯 , 你可以稍微解释一下 MiniCita 那个东西开源了什么 ?

陈哲1:10:05

嗯 , 嗯 , 实际上在 MiniCita 开源之前 , 市场上有很多家做四足机器人的公司和技术方案 , 嗯 ,有液压的 ,有更复杂的 、 更高成本的电机的方案 。

而 MiniCita 当时比较典型的一个工作 , 它引入了一个准直驱的 QDD 电机 , 一个很很经典的结构 ,以及完整的开源的这个控制的算法 , 让国内很多非常业余的团队就可以快速的搭建一个呃四足机器人。

所以就催生了整个生态的快速繁荣 。 市场上迅速的出现了非常多的创业公司 , 小米开始做铁蛋 , 小鹏收购了一家四足机器人公司 , 成立了鹏行机器人, 还有别的一些互联网的创业者纷纷进入这个市场 , 开始做四足机器人。

我记得当时小鹏的机器人公司 21 年第一笔融资就是 1 亿美金 ,5 亿美金的估值 。 同时期的宇树还是一个不被人注意的公司 。

但是为什么宇树走得最远 , 走到今天 ? 所以王欣欣是一个非常本分 、 非常专注的人 ,他就想做四足机器人 ,他就想把四足机器人做好 。

这群科学家需要一个便宜的 、 好用的硬件 ,也是因为王欣欣的本分和坚持 ,他没有投任何钱去搞什么 AI, 去搞什么 C 端的量产 。

那今天可能对于灵巧手来说 , 我认为市场是存在一个寄望的位置的 。 但是你需要非常的克制和专注 , 把这样一个产品做好 , 你才能够变成全世界所有想要研究和解决灵巧手问题的研究员的首选的方案 。

曼祺1:11:45

对 ,因为灵巧手背后其实是灵巧操作嘛 ,其实是具身智能里非常关键的一环 。

陈哲1:11:49

非常重点的研究的一个方向 。 如果作为一家灵巧手公司 , 你过早的去谈灵巧手的这种商业的闭环 ,而不足够的开放 , 嗯 , 跟整个科研市场去合作 、 去公证 , 那你可能会错失这样一个机会 。

对我来说就非常像小鹏机器人在 21 年想去实现它这个机器码量产的这样一个尝试 。

曼祺1:12:13

机器码死去的记忆开始攻击我 , 我都快忘了这个事了 。

陈哲1:12:16

对 ,但是他们当时推过 。 但是这个 story 是非常的像 。其实本质上什么呢 ? 机器码机器码的失败 , 本质上是因为在那个时间点 , 四足机器人并没有到一个商业化的台面 , 还在一个非常需要研发和投入的一个阶段 。

曼祺1:12:31

哦 ,其实你说到小鹏 , 我们刚才在聊中国的人形机器人公司的时候 , 没有说到小鹏 。 小鹏也是一个做就是双足的全人形的机器人公司 。

陈哲1:12:40

客观的说 , 我觉得中国的车厂做人形实力都是不弱的 。 但是呢 , 从绝对的这个创新性和突破性来讲的话 , 我觉得可能对于车厂来说 , 它的战略还是一个快速的 follow。

嗯 ,以及他们在路线上 ,其实很多还是很想借鉴这个特斯拉的这个路线 。

曼祺1:12:57

那过完中美两边的公司 , 你有一个什么整体的感受 ? 就美国和中国现在具身的发展情况 。

陈哲1:13:03

你有什么感受 ?

曼祺1:13:04

我的感受就是 , 首先这个行业一直会有一个说法 , 就是说美国和中国的具身是在同一起跑线上的 。 而不像大模型 ,其实中国在最开始的时候显然是落后美国至少半代吧 。

一个是这个事它是否是成立的 , 然后另一个我觉得比较明显的感受 ,其实刚才我们也反复讨论过的 , 这个呃机器人, 或者说通用机器人, 是一个非常跨领域的一个很综合的东西 。

就它有软件 ,有硬件 ,有系统 ,有工程 ,有供应链等等等等。 我我觉得美国发展这个事 , 它确实先天上在硬件供应链上是有短板的 , 对他们来说也是个很大的挑战啊 。

陈哲1:13:40

我觉得我我个人感受是 ,不像大模型 , 我们可能是一个追赶的一个阶段 。 我觉得在具身 , 我们真的有可能是一个领先的一个状态 。

因为首先在在具身相关的这种复杂的硬件产品上, 无论是机器人本体还是灵巧手 , 我认为中国的公司都是都是领先世界的 。

再到了大脑这一层 , 我觉得今天美国这些公司以 Pi 为代表的公司 ,在顶尖的人才 ,在算力和数据方面还是有明显优势的 。

但是随着随着具身大脑跟硬件的进一步的耦合 , 无论是在手的维度还是在本体的维度 , 如果未来具身智能的研究大量的跟人形机器人的形态 , 或者说一个非常复杂的这个硬件载体进行耦合的话 , 那我认为中国的优势只会放大 。

世界模型1:14:30

曼祺1:14:30

我觉得这里面有一个变量 , 正好是我们等会儿接下来要讨论的一个话题 , 就是世界模型的进展 。 因为你刚才也提到 , 就是说现在的 , 比如说像英伟达做的这个世界模型的路线 , 它其实是以视频生成模型为一个基础的 , 它对算力的消耗是非常大的 。

然后中国的公司普遍来说 , 算力资源同级别的公司是比美国差一个数量级 , 比如说大厂可能相比美国大厂差一个数量级 , 然后创业公司也是更少啊 。

我我觉得这可能对中国来说是一个挑战 ,因为它现在很早期嘛 , 你不知道未来还要做什么啊 。在这些未来还要做的事情上, 中国的探索程度会怎么样啊 ?

陈哲1:15:07

首先我觉得世界模型跟 Voa 可能是代表了嗯具身大脑研究的两个主旋律 。 因为 Voa 以文字为 backbone,其实代表了人类用语言去沟通和描述的和推理的能力 。

而世界模型它以视频为 backbone,其实是代表了人类的视觉智能 。

曼祺1:15:28

你觉得这两个是互斥的吗 ?

陈哲1:15:29

它们俩是互补的 , 或者说人类的智能是既离不开语言 ,也离不开视觉 。 嗯 , 人类如果损失了文字或者视觉中任何一个模态 , 人类的智能它也会有 ,但会大大的局限 。

对机器人来说 , 我觉得世界模型这个路径本来就是人类智能中非常重要的视觉理解和泛化能力 , 用一种更巧妙的方法运用在机器人的大脑上 。

曼祺1:15:56

那我觉得正好就可以展开讲一讲最近世界模型的进展啊 。其实一个比较受一些关注的 , 就是英伟达从去年底到它在 GTC 上又反复去说的 WAM,他们这个叫世界动作模型 。

可以先稍微聊一下怎么理解世界模型 ,因为这在目前是一个比较宽泛的概念 。

陈哲1:16:15

其实世界模型不是一个新的概念 , 让我来定义世界模型 。 我们有一个基于现在的观测 , 可以预测未来会发生什么事情的这样一个模型 , 叫做世界模型 。

世界模型这个概念其实已经应用到了非常多不同的场景 , 比如说在自动驾驶 ,在特斯拉的嗯这个嗯分享里面 ,他们也提到他们有一套世界模型用于自动驾驶的仿真和模拟 。在 OpenAI 推出 Sora 的时候 , 没有说自己是一个视频生成模型 ,Sora 的定义从来就是一个世界模型 。

曼祺1:16:44

对 , 当时它刚推出的时候 , 大家就在讨论这件事情 。

陈哲1:16:48

嗯 ,因为 Sora 让大家感觉到模型似乎有了对物理规律的理解的能力 。 像 NoCoin 它搞的这套体系也是一套世界模型 ,但是它认为在它的那个架构里面 ,其实物理世界有更多可以显性表达的规则去描述 , 嗯 ,有一些物理的这种 intrinsic 的信息 。

所以大家在面对世界模型这个概念的时候 , 基于自己的出发方向 ,有不同的这个解读跟理解 。 那么在机器人这个场景里面 , 最直接的就是通过视频生成的方式 , 或者说通过脑补的方式 , 我们可以预测物理环境会因为我们的动作产生什么样的变化 , 所以它可以用来进行动作的仿真 , 可以用作呃策略的生成 。

所以这是我们认为世界模型相比于 Voa 是一个新的技术范式 , 或者说是一种新的模态的补充 。

曼祺1:17:45

那具体到英伟达做的这两个工作 ,DreamZero 还有 DreamDojo, 它是在这个方法下做了具体的什么贡献 ?

陈哲1:17:54

DreamDojo 可以想象成一个基于视频的世界模型的一个仿真器 。 我可以基于我现在的图像预测和渲染未来这个世界的样子 , 所以它是一个像一个仿真器这样一个存在 。

而 DreamZero 呢 , 嗯 , 它是可以基于视频的生成的方式 , 可以把我现在的任务和现有的这种环境 , 嗯 , 输出成作为机器人它需要去执行的这个策略和动作 。

英伟达定义的这个世界动作模型 , 它不再是一个基于描述和观测直接输出一个对应的动作序列的一个方式 ,而是通过脑补建立一个因果的推理 , 然后在这个过程中生成我们对于机器人应该采取什么样的动作来符合这个世界的规律的一套方法 。

这其实都是脱离了以文本为核心和动作克隆为核心的这个 Voa 的这种控制的范式 。 如果我们类比人类的智能 , 文字代表的这种推理和思考的过程 , 实际上是一个更低频的 、 更复杂的一种推理思考的过程 。

而视频代表的智能是更加应激的 、 更加更加实时的 、 更加与环境互动的一种能力 。 嗯 , 我觉得这两个能力在未来的通用机器人里面都是不可或缺的 。

曼祺1:19:12

那我有个比较模糊的理解啊 , 那它是不是相比于之前 Voa, 它就有了一个时间感 ? 因为 Voa 如果我直接从就是一个视频 , 或者说一个图像 , 我到一个动作 , 它一帧一帧之间 , 它是理解不了这个前因后果的 。

陈哲1:19:27

呃 , 我觉得这个描述挺对的 。 为什么 Voa 是一个作为一个运动生成模型 , 是一个非常受限的模型 ? 因为本质上它的底层作为 token 的描述 , 它实际上是描描描述了一个静态的状态 , 就是它的 input 是静态的图片和我文字对于语义的描述 。

那它为什么可以生成一串的动作序列呢 ? 是因为我们在训练 Voa 的时候 , 我们往往是先拿一个 Voa 的 backbone, 我们已经训练了它对文字和图片的理解能力 , 同时在这个场景里面 , 我们粘贴上一段关节的这个动作信息 , 所以它是强行的在一个文字和图片的描述映射了一段动作序列 。

简单的说 , 它是一种带有描述的行为克隆 。 这也是为什么我们在 Voa 的范式里面 ,在一个摇抽屉场景里面 , 我们到桌面去反复去叠一件衣服 ,因为这个衣服的不同的折痕会通过图片的方式记录下来 ,以及它跟我对应的关节动作之间建立某一种映射 。

曼祺1:20:26

因为你刚才讲那个区别的时候 , 我就想到之前我们做的另一期节目 ,是在讲具身智能的测评 , 然后那期的嘉宾是高阳和范浩强 。

高阳是千寻的联创 , 范浩强是元零零基的联创 。 当时元零零基出了一个测评的平台 , 叫 RoboChallenge, 然后里面有一个 Table 30 的任务 ,其中有一个任务非常刁钻 ,是扫二维码 , 然后他就跟我说所有的模型都做不了 ,因为扫二维码不是说这个动作是你这么对着它就能完成整个任务的 。

陈哲1:20:52

对 。

曼祺1:20:53

你得就是这个画面变了 , 你知道你扫上了 。他说就如果你不给它加点外挂的话 , 它都是做不了的 。

陈哲1:20:59

我觉得第一 ,Voa 是可以增加外挂的 , 就像我们 Agent 今天也是可以增加外挂的 ,但可能更关键的问题是 ,Voa 本身并没有在预测未来会发生什么 , 它是在建立某一种映射 , 就是当你看到这样一个图片和这样一个文字描述的时候 , 我就应该产生这样一个关节序列 。

这是为什么它的 generization 非常差 。 有的时候你把蓝色的杯子换成了红色 , 或你把左边的杯子换到了右边 , 它可能就会失效 ,因为在它想要克隆的行为里面 , 这些这些样本分布并不存在 , 所以它就会失效 。

但是世界模型的一大优势是 , 它是基于广泛的视频数据来进行训练的 ,而我们在视频数据数据中可能可以见到的 ,但也不是保证的数据分布是更广的 。

那如果我们能学到这么多广泛的数据分布中动作的规律 , 那我们用它来做无论是运动的仿真验证 , 还是运动 policy 的生成 , 理论上它就更更高的上限 。

曼祺1:22:01

就 Google 这一季度在做什么呀 ? 因为 Google 当年其实 RT2 它是 Voa 的提出者嘛 。 那如果说现在大家的重点重心变成了英伟达提的这个新的 WAM 动作世界模型 , 它可能能弥补很多以前 Voa 的缺陷 ,Google 有什么新的进展吗 ?

陈哲1:22:20

就是 Google 在拼命的搞视频生成模型 , 这是这是我们知道的 。 或者我想说另外一个事情 , 就是至少我知道的 Gemini Robotics 的研究方向 ,其实跟 Pi 的重复度是非常高的 。他们拿出来的结果在去年 10 月份还是夏天的时候 , 拿出来的 Gemini 1.5 的结果也是非常好的 。在当时其实相比同时期的 Pi 是有明显优势的 。

但如果你仔细去看 , 它为什么会获得很好的优势 , 一个非常重要的是它有一个更好的基座模型 , 它用了 Gemini 做基座模型 , 嗯 ,Pi 用的是开源的 Polygama, 是一个明显小得多 、 要弱得多的一个开源模型 。

我们在国内的非常多的具身智能公司看到的一个现象是 , 如果你换一个更好的预训练的语言模型 , 你什么别的事情都不用做 , 你最终模型的效果就会变得更好 。

所以对于一个比较清晰的研究范式 , 比较清晰的研究方向 , 比如说像 Voa, 那对于 Google 来说 , 它是有非常明显的后发优势的 。

嗯 ,因为它可以训练出更好的基座模型 , 可以直接受益于它的 Voa 模型 。 如果它也可以训练出一个更好的视频模型 ,of course, 它也可以非常受益于它的 world action model。

曼祺1:23:32

嗯 , 就如果他认为这是一个值得投入的方向了 。

陈哲1:23:35

是的 , 所以我不会觉得很奇怪 ,他们会是一个后来局上的玩家 。

曼祺1:23:39

英伟达的这个世界模型的新方法 , 它现在有什么不成熟的地方 ? 比如说我看到它的速度是很慢的 , 就 DreamZero 它跑在机器人上是 7Hz。

陈哲1:23:48

我觉得速度问题都是可以解的 。 我觉得计算机科学的核心本质就是我们先找到路 , 只要有路 , 我们总可以总可以做优化 。

就像就像 Kimi, 对吧 ,DeepSeek 可以做这个推理的这种优化 , 极致的算力优化是好做的 ,但是路径的探索是难的 。其实如果你看 GPT-3,GPT-3.5 刚出来的时候 , 它的 token 生成速度也很慢 ,但是今天我们可能生成速度已经相比当时可能有 100 倍 、1,000 倍的增加 。

嗯 , 我觉得视频模型因为今天还在非常早期 , 嗯 , 推理速度比较慢 , 我觉得是符合预期的 。

我觉得更关键的是 , 具身智能过去几年其实一直有一个特点 , 就是我们实际上是高度受益于今天大语言模型 , 或者说这个 VOM 相关研究这种进展的 , 就是因为我们有了更好的 VOM, 所以我们可以训练出更好的 Voa。

因为我们有了更好的视频生成模型 , 所以我们可以训练出更好的世界模型 。 也就是意味着这些新兴领域在基座模型上面的性能的提升 , 是一个外部力量来决定的 。

曼祺1:24:50

嗯 , 具身行业的外部力量决定 。

陈哲1:24:52

嗯 , 对 , 所以今天 world model 在今天的基座模型的水平遇到的挑战 , 可能没法靠自己力量去解决 。 那视频生成模型有没有可能达到一个绝对完美 , 或者说真正完全遵守物理的定律 、 空间的一致性 、 长时序的稳定 ?

我觉得随着时间的进展 , 我还是很有信心的 。 我们也看到了在图片 、 在视频领域过去这段时间 , 过去几年非常快速的这个变化 。

但是即便世界模型到了一个完美的状态 , 就是我们闭着眼睛可以脑补出未来 30 秒钟所有可以发生的事情 , 那触觉的信息依然是缺失的 。

因为视频这个模态里面自然就没有触觉这样一个一个信号 。 所以未来在这个世界模型之后, 我们怎么把触觉的信号融合进去 , 或者说增强进去 , 我觉得会是未来研究的很重要的一点 。

曼祺1:25:48

我觉得这正好补充的就是你前面说的 , 你觉得呃 , 触觉能加到手和世界模型是两个很重要的方向的另一个原因 。

而且这件事我觉得它就得靠具身行业自己来解决了 , 对吧 ?

陈哲1:25:59

对 。

曼祺1:25:59

它不能靠那些机模厂商去解决了 ,因为大家可能之前也没有积累 , 或者说起跑线是一样 。

陈哲1:26:05

或者这恰恰是我看到很多创业公司在做的事情 , 就他们知道自己可能是很难去训练一个超大的 Voa 的 ,他也很难自己预训练一个超大的世界模型 。

但是我可能可以解决灵巧手操作问题 , 机模没办法帮我解决这问题 , 我可能会解决触觉跟一个末端执行器结合的问题 。

因为触觉不只是在灵巧手上, 触觉也可以用在夹爪上, 可以用在 Sunday 这种 gripper 上面 。 嗯 , 那这些信息之前都是没有的 。

曼祺1:26:31

我觉得这个观察挺好的 , 虽然现在可能这个在业界不算一个很容易被观察到的现象 ,因为因为大公司做这个的可能会相对少一点 。

陈哲1:26:40

大公司喜欢有 scale 的事情 , 大家过于笃信 scaling law, 所以大家都想找一个能够 scale 的方法 ,which 我我认为这个原则也是对的 。

就为什么为什么世界模型大家这么期待 ? 王欣欣在今年的 GTC 的分享上面 , 她也专门提到了从宇树的立场来看 ,他们可能是更看好世界模型这样一个路线 , 就是因为它的理论天花板是更高的 。

就我们知道 , 如果你没有视觉 , 你读再多的文字 , 你也不能理解和描述自然界的很多现象 。 但是哪怕你是个文盲 , 你不懂任何的文字 , 你不会说话 , 你也可以很好的在世界上生存 。

数据框架1:27:18

曼祺1:27:18

英伟达它提的这个 DreamDojo、DreamZero 的同时, 它也讲了一个新的数据框架 , 就是这个 EgoScale, 说是用超过 2 万小时的自我中心的人类数据去打破了之前灵巧操作迁移的一个规模的瓶颈 。其实那个东西它有点像 RT1 一样 , 它训练了一个小模型 ,但是那套方法是可以用到 Voa,也可以用到世界模型上 。

陈哲1:27:40

就都可以用 。

曼祺1:27:40

都可以用 ,因为它都是整个数据金字塔的一个构成环节 。 嗯 , 如果我们思考这个数据金字塔 , 就是最精准的 、 最高效的数据 , 肯定是机器人直接的遥操数据 ,因为它准确的反映了一个任务机器人的每个关节 、 每个这个电机应该反应的状态 。

然后在这个基础上才是一些类机器人架构 , 比如说像 Umi 这种在末端的执行器 , 它模拟了这个这个夹爪的这个特质 , 或者说像 Dex Umi, 它是在末端模仿了一个灵巧手的一个机械结构 ,但是它在手臂 、 在视角 、 在别的自由度上面 , 它是开放的 , 它并不约束于机器人这个硬件条件 。

而 EgoCentric 则是更低一层的 、 更广泛的第一视角的操纵数据 , 然后再下面才是广泛的互联网的 YouTube 的数据 , 那些可能都不是人在操作 , 它可能是各种物理的现象 。

所以英伟达提的这个 EgoScale 的数据 , 它甚至都没有配合手套 , 它就是一个 。

陈哲1:28:44

它是配合手套 。EgoScale 那个论文用的是 Manus 的手套 , 那个素材的手套 。 然后它采集了那个数据过后呢 , 它可以把这个 policy 应用到一个灵巧手上面去 ,因为它本身是无指的这个操作 。

但是它作为一个嗯 , 预训练的数据 , 它是用在 Voa 上面还是用在 world model 上面 , 我觉得都是可以的 。 嗯 , 它并不受限于它具体用什么方法去做预训练 。

曼祺1:29:09

所以可以说它其实是同时提了两个东西 , 它这个数据是一个可以结构的 , 可以用在不同模型方法上的 , 然后同时它也提了一个模型的新的进展 、 新的想法 。

陈哲1:29:20

嗯 , 可以这么说 , 或者或者 EgoScale data 的重视度在过去半年是急剧升温的 。 嗯 ,因为大家找到了更高效的嗯 , 把第一视角数据训练进无论是 Voa 还是 world model 这样的一些方法 , 实际上大家发现为了实现运动的足够的泛化性 , 我们是需要在各个维度上面都有更多的这种多样化的数据进来 。

那以前无论是遥操嗯还是 Umi 这种方法 ,其他的数据的多样性是不够的 。 我们要引入这个 EgoScale 的方法 , 主要还是为了增加数据的多样性 。其实直接用互联网视频数据不是最多样吗 ?

这就是为什么数据金字塔 , 数据金字塔里面有这个数据质量这个概念 。 很大的问题就是 ,even 你是第一视角的视频 , 人的关节和手掌的自由度 , 甚至上半身的自由度和我们视野的自由度是非常开放的 。

而今天机器人是没有这么大的自由度 , 所以你通过第一视角的视频学到的动作 ,并不一定能够真正的 transfer 到一个机器人上面 。

这中间的 domain gap 非常大 ,有很多动作 , 手腕的动作 、 手指动作 , 你是根本学不过去的 。 当然硬件越来越 flexible, 硬件越来越强大 ,是能够降低这个 gap 的 。

这是为什么我们要开发高自由度灵巧手 ,而不是低自由度灵巧手 。 但是无论你再好的灵巧手 , 机器人的上肢 , 你跟人的这种自由度来讲还是有巨大的差距的 。

所以 EgoCentric 的 video 会比第三视角的 YouTube 视频 , 甚至是没有人出现的视频来讲是更好的 。 但是它离一个 Umi 的数据 , 或者说一个遥操作的数据来讲 , 它的精度 , 它的这个呃 , 数据质量还是有很大差距 。

曼祺1:31:06

嗯 , 所以这个金字塔如果遥操在最上面 , 然后互联网的视频数据在最下面的话 , 就是越靠近金字塔顶尖 , 就是越贵 , 数量越少 ,但是质量越高 , 然后越往下就是反过来 。

陈哲1:31:16

对 , 所以 EgoScale 的数据可能是比 YouTube 的数据要难获得一点 ,但是它的数量还是非常庞大的 。 你只需要带一个第一视角的这个摄像头 , 可能有 , 可能有 , 可能也没有数据手套 。

你如果有数据手套 , 你有手指的具体的动作 , 你没有你也可以去学 。

曼祺1:31:33

这个金字塔里全部都是真实数据 。

陈哲1:31:35

也可以包含仿真数据 。 仿真数据 , 仿真数据有两种 。 仿真数据第一种是完全虚拟环境里面建模 , 你有各种准确的参数 , 或者说你用纯生成的方法生成的这种数据 , 它可能介于 EgoScale、EgoCentric 和 Umi 数据中间的一种一种质量 。

它也可以是真实数据的 augmentation。

曼祺1:31:58

嗯 , 就把它扩增了 。

陈哲1:31:59

嗯 , 比如说你把 Umi 的数据进行了扩增 , 它也是一种仿真数据 。 所以仿真是一个是是一种手段 。

曼祺1:32:06

你觉得像英伟达 , 包括还有很多其他公司啊 , 像 Generalist 去年 10 月也发了这个数据上的一些新的解决方案 , 这些新的方案是不是意味着现在数据这个瓶颈其实基本上已经解决了 ?

对具身智能来说 。

陈哲1:32:20

我不这么认为 。 我我觉得不是数据问题解决了 ,而是大家看到了可能可以怎么去解决数据问题 。

曼祺1:32:27

哦 , 所以现在是看到可能性的那个阶段 。

陈哲1:32:29

说到 Sunday, 我觉得 Sunday 对行业是有巨大的促进作用的 。 我认识 Tony 跟 Tristan 也有相当一段时间 。 嗯 , 我很佩服这样的创业者 ,是因为他们真的能够 ,他们真的能够推出这个世界上并没有的非常巧妙 ,但是事后你又觉得非常合理的一些创新和这种设计 。Tristan 当年在斯坦福的时候就在做这个 Umi 这个方案 ,Umi 本质上是他当时参与的工作 , 然后被 Generalist 进行了改良 , 然

后广泛的进行了数据的采集 。 而 Sunday 在这个基础上进一步的把两指的 Umi 扩增到了三指 。

曼祺1:33:03

嗯 ,其实 Umi 就是人去手持一个夹具去做一些动作 。

陈哲1:33:09

同构的夹具 ,因为你一旦是异构 , 你必然就有 domain transfer 的损失 。 所以它是一个同构的夹具 ,而且它是三指的 ,也带这个触觉和反馈 。

通过增加这么一指的自由度 ,其实大量的动作 , 可能夹具很难去做的动作 , 通过 Sunday 那个 gripper 三指就可以做了 。

曼祺1:33:28

对 , 它这个同构就是和它自己的机器人本体同构 。 嗯 , 就是它的采数的那个东西是一个三指的 , 然后它自己的机器人上也是一个三指的末端 。

陈哲1:33:37

对 , 那个那个东西他们是迭代了非常多版本 , 才收敛到今天这个形态 ,以及在这个形态上 ,他们是可以开始去比较低成本的去采集大量的数据 。

曼祺1:33:46

这个也是很多现在中国公司在做的事情 。

陈哲1:33:49

我觉得中国公司的好处就是 , 只要有人把路线指明了 , 我们的 follow 的速度是非常快的 。 但是即便在过去 6 个月 ,Umi 的方案 , 包括类似 Sunday 的方案开始快速出现 ,但是他们数据的 scale 和数据的清晰和准确的标注还需要很长的时间 。

我不觉得这个嗯 , 会很快的达到数据饱和 。其实今年国内的很多具身智能的公司的目标都是实现百万小时的真实数据的采集 , 通过类似 Umi 的方法 ,但我认为这个还是需要一段时间去真正获得这么大量级的数据 。

曼祺1:34:20

你觉得百万小时数据可能是有挑战的什么 ? 因为百万得是有效的 , 对吧 ?

陈哲1:34:24

对 , 百万有效的数据 。 因为你还需要清晰 , 你还需要标注 。 但是这个东西就哪怕你有了百万小时的数据 ,是不是它就足够了 ?

我觉得我今天还没有这样的一个结论 。

曼祺1:34:34

除了英伟达最近的这些成果之外, 世界模型在整个业界还有什么新的进展 ? 比如说像 Google 的 Genie 3、Sigma 2 这些 , 你想讲一讲吗 ?

陈哲1:34:43

不太是跟机器人相关 。 我觉得 Google 的 Genie 3, 包括自己的 Seedance 这些生成模型 , 或者说仿真器 , 我觉得都是都是间接的会受益这个机器人这个这个领域 。

这里面具体的一个细节什么呢 ? 就是比如说 Genie 3, 它是一个高度基于 diffusion 的一种生成的一个网络 , 它是追求这种视觉上的 high fidelity, 视觉上的 appealing,但是它对于物理界物理环境的遵从就会很弱 。

那这个东西对于我们训练物理的这种交互来讲 , 就是就是很不好的 。 包括 Seedance 也是 , 就 Seedance 为了更好的视觉效果 , 它会突出各种艺术的风格或者视觉上的表现力 , 它也不是为物理的动作去优化的 。

然后回答你刚才那个问题 , 你说如果世界模型未来需要很多的算力 ,是不是中国公司有可能在这个维度上落后 ?

那我给你分享个特别有意思的信息 , 今天基本上世界上绝大部分 , 如果不是所有的世界模型 , 机器人视觉模型 , 它的基座模型都是基于 Ali 开源的 Wan 2.1 或者 2.2 的基座 。

曼祺1:35:51

所以英伟达他们有自己训一个 ?

陈哲1:35:52

是的 ,他们用的是 Wan 2.1。

曼祺1:35:54

所以像英伟达这种其实挺有钱的公司 , 它也没自己训 , 主要是觉得这很麻烦是吗 ? 没必要 。

陈哲1:35:59

我觉得今天还是没必要 。 我觉得今天还是在一个研制阶段 , 研究阶段 。 对 , 你说未来它会被自己训 , 我觉得是有可能的 。

但是对他们来说 ,Wan 2.1 或者 2.2 是他们可以访问到的 , 被广泛调试过的一个开源的视频视频生成模型 。

但是这里面的诟病是非常多的 。 如果你问我世界模型今天遇到的挑战 , 我问了很多研究员 ,他们给我的反馈都是 Wan 2.1 还是 2.2 是根本不适合机器人视频生成的 。

曼祺1:36:28

嗯 , 它可能最开始的目的也不是为了这个 。

陈哲1:36:30

不是为这个 。

曼祺1:36:30

只是说你能找到的开源的就是这个 。

陈哲1:36:32

最好的 , 然后之后就没有开源了 。 所以这可能是另外一个很有意思的问题 , 就是整个市场视频生成模型的算力资源消耗太大了 ,以至于今天头部的公司都不愿意继续开源的工作 , 至少现象是这个样子 。

曼祺1:36:46

因为他觉得就是我花了很多资源 , 好不容易做的事情 , 我不想直接就贡献出去了是吗 ?

陈哲1:36:52

我我可能也是因为这个商业化在一个比较早期 。 我觉得从竞争逻辑来讲 , 只要我不是第一名 , 我我的开源策略是可以降低头部公司领先的这个溢价和优势的 。

就像 DeepSeek, 包括 Kimi 这些公司选择开源策略一样 , 就开源对于 follower 来讲是一个很好的策略 , 反正你的闭源模型是很难收到钱的 ,因为你不是最领先的 。

所以我觉得未来随着视频生成技术的成熟 , 我相信还会有厂商选择继续开源 。

曼祺1:37:19

嗯 , 对 , 那回到刚才那个问题啊 , 就是你说如果大家现在的基座用的都是 Ali 的开源的视频生成模型 , 那这和就我刚说的这个问题 , 会不会说在世界模型的竞争阶段 , 中国公司因为算力会相对少 , 会处于一些弱势 ?

那我觉得还是有可能 ,因为你说的是现在的状态啊 。

陈哲1:37:38

有可能 ,但是如果如果是世界模型高度依赖于 Sorta 的视频生成模型 , 至少我没有觉得自己的资源会比 Google 少太多 。

曼祺1:37:47

这还涉及到另一个问题啊 , 分工的问题 。其实你看你刚才描述的这个状态 , 像 Ali 它的模型被很多具身公司来用 , 对吧 ?

但具身公司自己会觉得没有必要 , 或者说他们没有资源去训一个基座的视频生成模型 。 那最后这些创业公司 , 它的发展就其实还挺受限于就是那些做视频生成模型的公司的 。

有一种可能就是字节可以自己把这个事干了 ,而且字节确实也在干啊 。

陈哲1:38:13

一直是所有模型公司都会面临的一个问题 。 不管你做什么模态的模型 , 你都可以说可能长期来看 , 一个独立的模型公司 , 所有的大模型也好 , 视频模型也好 , 语音模型也好的公司 , 都竞争不过最有资源的大厂 。

因为大厂的 unified model 可以把所有事情给做了 , 或者说它有足够的资源把这个研究给做下去 。 我觉得这个问题是一直存在的 。

当然如果你问 Google 的人, 可能他们真的是非常相信这一点的 。

曼祺1:38:41

你说非常相信大厂最后会把这些都做了 。

陈哲1:38:43

对 , 没有人会做得过他们 。 这有可能最终就是大模型时代的一个终局 。 但即便这个事情发生 , 我认为对于真正想要落地的具身智能公司和通用机器人公司来说 ,也也有足够多的事情要做 。

曼祺1:38:57

嗯 , 就是它在那个之上还是有很多空间 , 很多工作需要他们自己去做的 。

陈哲1:39:02

对 , 当然这个边界可能会越来越越模糊 。 它不像并不像 iOS 跟 Android, 对吧 ? 这个边界非常清晰 , 就什么事情你做 , 什么事情我做 , 操作系统 。

但是它还是有边界的 ,因为因为你在可能长期来看 , 你在具体场景里面的 know-how 和数据还是最有价值的资资产 。

这些东西并不是每个大厂都会拥有 。

曼祺1:39:22

像英伟达提的这个新的方向 ,有什么新的创业机会吗 ? 我看美国最近也有新的公司出来 ,也有融钱很多的啊 。

陈哲1:39:29

对 , 我正好在 GTC 的时候看到了那个呃 , 宣布那个 4.5 亿融资的 Rhoda AI 的这个团队 ,他们就是一个以世界模型为创业方向的一个创业团队 。

曼祺1:39:41

那他们作为创业公司 ,他们要自己去做世界模型的视频生成的那一部分吗 ? 还是他也用一个开源的模型来做那部分 ?

陈哲1:39:48

这个具体的细节他没有跟我讲 ,但我听起来哪怕他们用了开源的生成模型 ,他们也自己采集了非常多的可能是 EgoCentric 的 data。

曼祺1:39:57

嗯 , 就是他有自己的数据 。

陈哲1:39:59

嗯 ,他他是做 continue training,他做再训练 , 就有些基座可能已经训练好了 。其实就像 VOA 一样 , 已经有些预训好了 , 预预训练好的模型 , 比如像 Clip 模型 , 你是没有必要自己重新训的 。

你可以在这个基础上再把很多你自己的数据加进去进行再训练 。

曼祺1:40:16

中国现在有这样的新公司吗 ? 就是它可能不是以 VOA 为主的 , 它是以世界模型这个方式去探索具身智能模型 。

陈哲1:40:23

呃 ,是有一些的 , 像那个嗯 , 积家科技 ,他们宣称自己在做这个世界模型这个方 approach。

曼祺1:40:29

黄冠创立的 。 嗯 ,他以前是地平线 , 后来在后来在建制啊 。

陈哲1:40:33

对 ,但我真的不是很熟他们到底做的怎么样 ,因为这个现在是世界模型的 metrics benchmark 应该是非常 vague 的 。

曼祺1:40:41

也是个很新的方向 , 就从作为创业方向来说 。

陈哲1:40:43

对 , 创业方向是个新方向 。 但是这次呢 , 我觉得这次我明显能够感受到大家看到了视频生成模型竞争的挑战 , 这个是显著是比 VOA 这个路线的这个陡峭度是更高的 。

所以很多团队也在思考 , 就怎么怎么去面对这样一个新的技术范式 。

曼祺1:41:00

就是大家认为它理论上空间肯定更高 ,但同时也肯定更难 。

陈哲1:41:04

嗯 , 肯定更难 。 而且看起来至少今天看起来特别大厂友好 。

曼祺1:41:09

它这个难除了就是你刚说它需要的算力资源特别多之外, 还有什么别的地方难吗 ?

陈哲1:41:14

其实其实就是在这个地方 , 数据跟算力消耗都很大 。 因为你想训练 , 你想训练一个好的视频生成模型 , 你就需要有足够多的足够多的非常丰富的这个 diverse 的视频数据 。

曼祺1:41:25

就哪怕我是基于一个已经开源的模型去做再训练 ,也是你采集 , 你采集数据也是巨量的 , 你采集数据也是巨量的 。

我其实之前跟一个国内的大模型创业公司做多模态模型的负责人其实聊过 ,他们之前也也在做 ,也在做视频生成模型 , 这个工作继续下去压力非常大 。他说我把几个 petabyte 的数据呃 , 就是拷贝一次 , 可能就是几十万人民币的账单 , 我什么都没有做 。

就这个的消耗量跟你处理几个 TB 的 token 不是同样的这个代价 。 嗯 , 那另一方面 , 大厂它虽然看起来有很多互联网内容 ,但是从合规的角度是不是也不能直接用了 ?

比如说之前我跟 Google 的人聊 ,他们说 Google 其实内部想用 Google 的数据 , 甚至有的时候感觉比一个外面的创业公司还麻烦啊 。

它有很多合规的流程 , 很多法务的问题 。

陈哲1:42:16

但是我发现的一个 coincident, 就是今天最好的三个视频生成模型 , 就是拥有 YouTube 的 Google, 拥有快手的 Kling 和拥有 TikTok 的 Seedance。其实更关键的是 , 所有这些好的算法架构训练的这些 recipe 是靠海量的实验和算力堆砌出来的 。

我觉得这是今天所有具身研究的创业公司遇到的一个很大挑战 。 我没有那么多的算力怎么办 ? 哪怕我有几万小时几十万小时的数据 , 我也清洗好标注好了 ,但是我为了训练出那个模型 , 为了训练出 Pi 0.6, 我是要做很多尝试的 。

我的 recipe 是怎么出来的 , 这是需要算力去去去去去去测试的 。 很多公司实际上是缺这个资源 。

曼祺1:43:02

对 ,其实是缺实验 , 对吧 ? 缺实验数量和实验规模 。

陈哲1:43:05

都是反复的实验 。

曼祺1:43:06

嗯 , 这个都是要靠 GPU 来支持的 。

陈哲1:43:08

对 。

曼祺1:43:09

前面其实我们就聊了这些内容啊 , 包括对中国公司的盘点 , 美国公司的盘点 , 已经涵盖了你提到的这五个你最关注的进展 。

然后后面我觉得是想就是来总结一下 ,其实具身领域很重要的一些基础设施和商业进展的话题 , 一个就是算力 。

呃 ,其实一般业界我觉得讨论算力是比较少的 , 就相对于大模型的人对算力的讨论 , 尤其是端侧的算力 。

就刚才我们说的是训练模型的算力提到了一些 , 端侧的算力现在在具身是一个什么情况 ? 就比如说机器人上的主芯片 , 大家会用哪家公司了 ?

算力芯片1:43:42

陈哲1:43:42

目前看来 , 如果是实时推理 ,在人形机器人上面做实时推理的话 , 大概率他们最默认的选择是英伟达的英伟达的车载芯片 。

曼祺1:43:53

是英伟达的车载芯片 , 都不是 Jetson 这个系列吗 ? 因为英伟达有一个机器人系列 。

陈哲1:43:57

不是 ,不是 Jetson。Jetson 算力不够 ,Orin 系列甚至更高的这个 Sword 系列 。 因为核心的原因是呃 , 今天需要的算力还是很高的 。

大家我觉得 Jetson 的定位是比较尴尬的 , 就 Jetson 算力没有那么大 。 而且而且你就这么想 , 你这个逻辑其实特别好好好想 , 今天那些做端到端自动驾驶的公司 , 想把一个模型实时的压到一个 Orin 上面去 , 已经要费九牛二虎之力了 。

那具身 VOA 也好 , 世界模型也好 , 它的模型的复杂度不会比一个自动驾驶模型低 。 所以今天完全没有到要节省算力的一个阶段 。

我在一个一两百瓦的功耗内 , 我能够拿到最好的算力 , 就是一个自动驾驶的芯片 。

曼祺1:44:40

所以英伟达依然是这个领域的基础设施方 。

陈哲1:44:43

是的 。

曼祺1:44:44

没有什么其他公司吗 ? 像高通这些不做这个 。

陈哲1:44:47

呃 , 目前看来其实除了我看到的 , 可能除了那个英伟达之外, 国内很多公司其实是在跟地平线合作 。

曼祺1:44:56

地平线啊 , 对 ,因为哦对 , 国内也有些之前做自动驾驶芯片创业的公司 。

陈哲1:45:01

对 ,因为呃 , 自动驾驶你从量产的自动驾驶来看 , 可能 40% 是英伟达 ,40% 是地平线 , 可能其他厂商还有 20% 的市占率 。

那很自然的 , 很多人会把车载的这个芯片也用到人形机身上面 。

曼祺1:45:17

所以这个机会也可以属于华为 。

陈哲1:45:19

也可以 。 华为在自动驾驶高阶自动驾驶里面还是有相当的市场份额的 ,但它的挑战可能也是大厂的优先级的问题 ,因为它有制裁的限制嘛 。

它大量的芯片产能还是优先供给给这个云上的芯片以及手机端的芯片 。 那对于车载的芯片 , 我我的理解优先级是不够的 。

曼祺1:45:40

嗯 , 那机器人优先级可能就更低了 。

陈哲1:45:42

这也是英伟达遇到的问题 。 英伟达在云端 GPU 是完全统治压倒性的地位 ,但是到了车载 , 它就已经不是一个完全统治的地位 。

曼祺1:45:52

对 ,因为其实高通在车载也做的挺激进的 。

陈哲1:45:55

对 。

曼祺1:45:55

就高通一直讲这个舱价议题 , 然后更低成本更高性价比的方案 。

陈哲1:45:59

嗯 ,是的 。 然后再到了机器人, 我觉得英伟达的优势可能就会进一步的被削弱 。 嗯 ,因为真正量产的机器人是很考验成本功耗的一系列抉择的 。

那今天可能具身机器人还没有到规模化量产的阶段 ,但是如果我们看其他的商用的机器人, 家用的机器人, 扫地机器人 、 无人机 , 没有人在用 Jetson 的方案做做量产的产品 , 意味着这个市场是开放给中国的其他的其他的公司的 。

曼祺1:46:27

那像这个市场现在主要是哪些玩家啊 ? 就已经大规模量产的家用机器人。

陈哲1:46:32

最大的就是地平线 、 地瓜 。

曼祺1:46:33

地平线和地瓜 。

陈哲1:46:35

嗯 , 或者说最大的就是地瓜 。 地瓜是地平线财富的公司嘛 。

曼祺1:46:39

对 ,因为地瓜算是它孵化的一个公司 。

陈哲1:46:41

就是就是做这个市场的 , 就是可量产的商用机器人 、 消费机器人的算力 。 然后可能还有一些更低端的 , 像全智 、 瑞星微 、 传统的 ARM 的芯片 、MCU 芯片 。

英伟达在这里面基本上是完全没有没有市场份额 。

曼祺1:46:56

所以从云端到车载再到机器人, 英伟达的统治力是越来越弱 。

陈哲1:47:01

我对这个问题的总结 , 这是一个典型的创新者窘境 , 就是它在云端太赚钱了 。 这个问题就跟当年 Intel 一样 ,Intel 在 PC 端在服务器端太赚钱了 , 它是不愿意做一个便宜很多的手机芯片的 。

当年 05 年的时候 , 乔布斯去找 Intel, 希望给他们做 iPhone 的芯片 ,Intel 是拒绝了的 , 然后最后才诞生了 ARM 这样的公司的机会 。

那我认为今天可能地平线或者地瓜其实面临是同样的问题 。 英伟达因为在云端太赚钱了 ,其实车载或者机器人的这种方向在公司内部完全不是重点 。

曼祺1:47:35

哦 , 还有一个玩家特斯拉 。

陈哲1:47:36

特斯拉特斯拉其实就验证了一件事情 , 伊朗非常明确的表达了未来自动驾驶的汽车 、 量产的汽车和 Optimus 的机器人会用同一款芯片 。

嗯 , 从架构 、 从算力 、 从能耗等一系列的考虑 , 它会为同一款这个芯片进行优化 。

曼祺1:47:55

所以呃 , 它的这个选择其实也印证了说 , 就是从车载到机器人是有一个很好的技术栈和场景的延续性 。

陈哲1:48:03

所以这也意味着国产的自动驾驶芯片的领先的公司 , 大概率在具身时代也是一个强有力的竞争对手 。

智能车时代能够自己量产芯片的公司 , 包括小鹏 、 华为 、 理想 、 小米等一系列公司 ,在具身智能时代也会是很有利的算力的呃解决方案 。

曼祺1:48:25

那我感觉这之后应该会是一个很激烈的竞争 。 你刚才已经说了好多公司了 , 一般来说芯片市场我觉得它到一个比较成熟的阶段 , 应该不会有这么多供应商吧 。

陈哲1:48:35

呃 , 历史来看 , 或者你可以说的更直接一点 , 历史来看 , 一个复杂芯片基本上只有两个供应商 。

曼祺1:48:40

嗯 ,而且是二八分的 。

陈哲1:48:42

对 。

曼祺1:48:42

第一名 80% 左右 , 第二名 20% 左右 。

陈哲1:48:44

对 , 所以大概率未来的具身机器人或者人形机器人会经历一个非常激烈的淘汰赛 。

曼祺1:48:51

嗯 , 这个事情虽然没有发生 , 我觉得未来几年可以可以一直去观察啊 。

陈哲1:48:55

对 , 或者这么说 , 就是我觉得这可能对任何创业者跟投资投资来说 , 它既是巨大的机会 ,也是一个巨大的挑战 。

就是人形机器人很有可能是一个高度收敛的赛道 , 它是一个通用的单一架构的一个一个机器人。 如果这个东西足够好的话 , 你的你的产量 , 你的规模应该是巨大的 。

那就意味着赢家会高度收敛 。其实智智能手机之所以这么收敛 , 就是因为人的手就长这个样子 。在 iPhone 发明之前 , 功能机是非常多样的 ,因为为了不同的需求 , 你可以创造出不同的功能机 , 就跟现在的 feature robot 一样 。

我们把今天的很多 robot 叫做 feature robot, 扫地的 、 搬运的 、 工业的 ,但是一旦通用机器人形成过后, 大概率它是一个高度集中的市场 。

曼祺1:49:41

但是汽车就没有这么集中啊 。

陈哲1:49:43

汽车还是很集中的 ,因为它有地方产业 ,有地方产业保护 ,有有政府补贴 ,有就业等一系列的考虑 。 实际上如果你看全世界的汽车工业已经高度集中了 , 美国就只有三个汽车公司 , 日本只有三家 ,是韩国只有一家两家 , 欧洲也是三家啊 。

对 , 所以你从这个角度来讲 , 从商业公司的边界来讲 , 已经非常集中了 。 但是汽车明显会更加集中 。

曼祺1:50:09

你就说比现在 。

陈哲1:50:10

未来会更加集中 ,因为随着 AI 和自动驾驶的普及 , 作为软硬一体的一个载体 , 它的门槛和优势会进一步放大 。

它的复杂度越高 , 它的门槛越高 , 它的这种软硬件的复利越高 , 它一定集中度高 。 所以我认为智能汽车或者自动驾驶汽车未来一定是高度集中的状态 。

那同理 , 人形机器人作为未来人类技术的起达成者 , 它的集中度一定会非常高 ,不应该出现那么多的人形机器人。

当然可能在不同场景 , 我们有一米八的 ,有一米二的 , 对吧 ,有男的有女的 , 可能会有 ,但是它的集中度应该也是非常高的 。

曼祺1:50:47

那对创业公司来说 , 更稳健的路是不是去做 feature robot? 有一些这种特别场景的机器人, 也许也不会被通用的机器人取代 , 对吧 ?

陈哲1:50:56

今天我们来说很有意思一个事情 , 今天一些成功的年轻创业者就是在做 feature robot。 汪涛就是做了无人机 。

曼祺1:51:02

是 ,是 , 无人机也是一个 robot。

陈哲1:51:05

这个石头就是做了扫地机 。 呃 , 可能还有些公司做了割草机 , 做了仓储机器人。

曼祺1:51:12

泳池机器人。

陈哲1:51:13

泳池机器人。 其实今天的很多年轻创业者就是以这样的行动来来实现他的创业 。

曼祺1:51:22

那还有一个相关的问题 , 你觉得做 feature robot 的公司 , 它有没有可能进化成一个做通用机器人的公司了 ?

陈哲1:51:28

我觉得是有的 ,但是这个对人对对组织会有巨大的挑战跟冲击 。 就像就像你相不相信一个家电公司或者一个传统制造业的公司能不能把一个机器人产品或者是一个复杂产品做好 , 你对整个公司的组织文化 、 基因是有巨大的冲击跟挑战 。

曼祺1:51:47

我其实想到一个例子 ,其实就是苹果嘛 。 那苹果最开始是个电脑公司 ,不是所有的电脑公司都完成了苹果后面做的那些事情 , 对吧 ?

陈哲1:51:57

但首先电脑就是一个多任务的产品 , 且电脑就有非常重的软件跟算法的成分 。

曼祺1:52:02

但是无人机和割草机其实我觉得它也也是一个比较复杂的软硬结合的产品 。

陈哲1:52:08

但是它是个单任务产品 。 我觉得单任务跟多任务产品很不一样 。 或者更好的一个问题是什么呢 ?

最早做计算器的公司是惠普和德州仪器 ,但是他们没有进化成一个家用 PC 公司 , 虽然计算器已经卖到了千家万户 。

曼祺1:52:24

惠普没有吗 ? 惠普不算吗 ?

陈哲1:52:27

不算 。 它它是一个 IBM 兼容 PC 的一个组装组装厂商 。 它并没有真正的引领这个个人电脑的这个革命 。 个人电脑是由是由是由苹果和和 IBM PC 带起来的 。

曼祺1:52:38

对 ,因为我在想 , 就是未来真的摘得通用机器人桂冠的公司 , 它到底是一开始就做通用机器人的 , 还是它有可能是类似于比如说像大疆 、 像一个扫地机公司 , 就像 Zima Blue 里面那个机器人最开始是个泳池机器人, 后来它变成了一个人。

陈哲1:52:56

我认为最终能够摘得这个桂冠的公司 , 应该是积累和建设了相关能力的公司 。 如果 Sharpa 有一天做成了一个通用机器人公司 , 我不会觉得奇怪 。

机器人公司很大的一部分是它的光机电结构 、 精密工程 、 量产 , 这些东西都是 Sharpa 这个团队在过去十年被验证和打磨出来的能力 。

所以对于通用机器人的成功来说 , 可能他们已经拥有了 50% 的 recipe,他们需要补另外的 50%。 那可能大疆也会成功 ,因为大疆也跟 Sharpa 这个团队一样 ,是拥有这一系列的生产 、 设计和开发的能力 ,但是他们缺的 50% 能不能补上, 那就非常看团队的学习能力和迭代能力 。

曼祺1:53:44

那另一方面就是强于智能 , 它也要去补其他的东西 ,也有可能补上 。

陈哲1:53:49

有可能更难 。

曼祺1:53:51

哦 , 那我大概知道你的偏好是什么啊 。 哈哈 , 嗯啊 , 那最后我觉得是聊聊这个一季度的资本市场的一些变化 。

上市展望1:53:59

曼祺1:54:00

今年一季度肯定有一个已经发端而且明确的会贯穿一年的现象 , 就是中国具身智能公司的上市潮 , 宇树已经提交了招股书 , 然后我也知道很多公司也已经交了啊 。

首先就关于这个上市潮 , 你觉得它整体上会带来一些什么影响 ?

陈哲1:54:18

我觉得非常清晰的是 , 机器人是未来中国可能未来十年呃一个国家级的战略级的发展主线 , 无论是机器人的一年技术 , 还是这个软件或者算法的这个大脑的一些技术 。

我认为宇树的上市应该会开启有全球竞争力的中国公司的这种发展的一个新的阶段 。 所以从市场来讲 , 我觉得是很利好这些创业公司和投资人的 。

曼祺1:54:43

你觉得是利好创业公司 ? 我觉得它有一方面可能会利好啊 , 就是比如说整个二级的行情非常好 , 这会利好 。

但另一方面资源感觉会向头部集中, 也有这个可能性 。

陈哲1:54:53

但头部集中不是坏事情啊 , 就像电动车一样 , 对吧 ? 你头部集中 。

曼祺1:54:57

对 , 我觉得对整个行业不是坏事情 。 我说对其他创业公司啊 。

陈哲1:55:00

或者这么说 , 如果对创业公司来说 , 呃 , 创业成功的财富效应本来是驱动很多人进入这个市场进行创业和投资的呃原生的动力 。

所以有成功的这种标杆企业 , 我觉得会会吸引更多的人才跟资本进入这个领域 。 我最近我跟很多比如说清华 、 北大 、 呃交大 、 复旦的这些最聪明的这些年轻人和学生的交流 , 我感觉可能有一大半的人都在搞具身智能 。

这个可能跟过去两三年一半的聪明的脑袋都在搞 AI 是相似的 。 我觉得至少这个比 12 年的时候中国最好的脑袋都在想怎么提高广告转化率要好吧 。

曼祺1:55:40

对 , 这是一种想法 。 嗯 。

陈哲1:55:41

嗯 , 我觉得从整个国家的发展阶段 , 或者说科技发展的节奏来看 , 今天第一到了中国企业和中国学者可以引领世界发展前沿的这个时间了 。

我们从一个追赶者要进入创新原创的这样一个节奏 , 我觉得是第一个 。 第二个 , 从具身本身发展的时间点上, 相应的很多要素也成立了 , 大模型技术的成熟 , 对吧 ?

这个生成技术的成熟 , 甚至 AI 的算力 , 甚至数据中心这些技术设施的成熟 , 都是让具身技术的发展到了这样一个临界点上 。

所以更多的资源和脑力朝这些可能会有突破 、 有产出的方向聚集 , 我觉得不是坏事情 。 就我自己作为一个投资人, 作为一个非常相信 Alpha 投资理论的风险投资人, 我肯定是非常提防泡沫和这种市场这种 hype 的 。

这可能是我作为投资人这么多年的本能 。 但是你如果站在一个国家宏观的发展和战略的角度来讲 , 这就是通过引领世界的一个绝好的机遇 。

我们已经有了电动车的基础 , 我们已经有了 AI 的基础 , 我们也有了半导体和算力的突破 。 为什么我们不能在具身或者说通用机器人这件事情上面真正领先全世界呢 ?

那这个的奖励如此诱人, 所以无论资本市场也好 , 还是我去清华 、 北大也好 , 我觉得大家都是你能看到一个巨大的能量在在积累 。

曼祺1:57:17

所以你觉得宇树上市会把这个热潮再往前推一推 ?

陈哲1:57:21

对 ,而且从我个人角度 , 我觉得宇树是一个呃商业质量非常好的公司 。 嗯 , 它不是一个泡沫公司啊 , 它不是一个概念公司 , 它是一个有真实的用户价值 ,有真实的收入 ,也是一个经营很高效的公司 。

我觉得它的上市至少比非常多其他的具身公司的上市是更有代表性的 。

曼祺1:57:43

对 ,因为现在其实有很多公司去就启动这个流程啊 , 我觉得也有一种可能是有可能发生的 , 就是监管可能不会让这么多具身智能的公司或者机器人的公司都上市 , 它会有一些同质化 。

但如果有一些公司就是有的上成了 ,有的没上成 , 我觉得接下来可能对一级市场的投资 , 对创业热情也是会有影响的 。

陈哲1:58:06

肯定的 , 就是我觉得很多投资人的目的还是希望公司能够顺利推出上市啊 。 如果你知道它没有上市的预期 , 那很多人的确就不会投资了 。

曼祺1:58:16

对 , 所以我觉得接下来还是有挺多不确定性的 , 就这一年的这个资本市场会怎么变化啊 。

陈哲1:58:21

我觉得可能更关键的还是发展的速度 。其实我们类比 AI 经历的这么多个寒冬和周期 , 市场是容易对技术的短期变化有过高的预期的 。

虽然我们做做机器人的研究和投资这么多年, 我们其实是见过科技周期的这种冷热的 ,但是今天具身的这波浪潮的确是非常的狂热 。

那肯定在未来一段时间 , 这个市场预期会有调整 。 我觉得这个可能比短期能不能上市 , 可能对于市场的冲击和调整可能会更大 。

曼祺1:58:52

你觉得现在如此多的钱涌向这个创业公司 , 涌向一级市场 , 这种现象什么时候可能会相对的平息下去 , 或者说结束 ?

陈哲1:59:02

我很难判断市场的情绪 , 尤其是同行们的情绪 。

曼祺1:59:05

那现在这种情形超出你的预料吗 ?

陈哲1:59:08

肯定是超出我预料的 。 我做一个统计 , 我觉得中国中国到今天估值超过 100 亿人民币或者 15 亿美金的人形或者具身智能的公司应该已经超过 20 家了 。

同样我们做内比 ,在大模型最狂热的时候 ,23 年、24 年的时候 ,其实估值超过 100 亿人民币的大模型公司也就是四五家 。

我们 clearly 看到今天大模型是有非常明确的商业化和行业应用的这种机会的 。 我们从 Anthropic、 从 OpenAI 的收入 , 我们可以看到大家在快速的拥抱和利用这样的新的技术 。

那具身底真的落地还需要很长时间 。 我们最头部的宇树也就是 2 亿美金多的收入 ,但实际上这个市场现在充斥了 20 家估值超过百亿的公司 。

我觉得这肯定是需要需要一些时间去吸收和淘汰的 。

曼祺1:59:59

嗯 , 那最后做下总结和展望 , 就是接下来一个季度到半年, 或者说你确定你比较确定会发生的事情是什么 ?

陈哲2:00:06

我觉得几点吧 , 呃 ,因为世界模型在快速的变成行业研究的一个热点 , 那么无论是中国的公司还是美国的公司 ,有谁能够在世界模型这个基础上拿出显著超越派现在 VOA 技术路线的这种 demo 或者结果 , 我觉得这个可能是值得期待的 。

第二个也是刚才提到灵巧手的这一点 , 随着更多的研究人员拿着带有触觉信号的高自由度的灵巧手 , 那在未来的一两个季度 , 会不会有更多灵巧操作的这种成果会出现 ,也是很值得期待的 。

还有一个很有意思的事情 , 我觉得可能会在会在未来一个月发生的 , 嗯 , 就是北京亦庄的人形机器人比赛 。

为什么这个很有意思呢 ? 因为去年这个比赛举办的时候 , 很多人还觉得这是一个很搞笑的噱头 , 可能只有几家公司参赛 。

但是今天我得到的信息 , 可能全中国所有的有头有脸的人形机器人公司都在不遗余力的嗯备战这样的一个比赛 。

嗯 , 我认为这样一个高密度 、 高竞争性的活动 , 就像汽车工业里面的 F1 大赛一样 , 会催生很多前沿技术和方案的这种这种迸发和突破 。

曼祺2:01:24

对 , 然后它可能后面又下放到比如说更量产的版本 。 对 ,F1 是有这个逻辑的啊 。

陈哲2:01:30

是的 , 我我认为我认为可能未来人形机器人的运动会就是机器人领域里面的 F1, 更快 、 更好 、 更远 。

曼祺2:01:40

哦 , 我之前没有从这个角度想 , 可能之前在比较早期的时候 , 大家更多是一个看笑话的心态 。

陈哲2:01:45

大家觉得是一个政绩工程 ,但是我我认为很多人形公司其实在春晚过后是憋着一个劲的 , 大家都想证明自己并不输于宇树 , 或者在某些领域有超越宇树的能力 。

那么像这样一个开放的公平的运动比赛 , 实际上是体现大家对于技术的这种极致追求的一个很好的土壤 。

而且它作为一个民众可以理解 、 可以欣赏的一个活动 , 我觉得它的表演意义跟它的宣传意义两者都是非常重要的 。

曼祺2:02:17

那最后一个问题 , 我想请你分享一个此时此刻你觉得很重要 ,但是你还不知道答案的问题 。

陈哲2:02:23

人形是不是未来通用机器人的最优解 , 还是未来的通用机器人会扩散出非常多的形态和工作方式 ?

曼祺2:02:31

你现在倾向于人形是最优解 ?

陈哲2:02:33

我觉得我对这个问题还是没有答案 。 我之前有很多质疑 ,但我觉得我今天没有答案 。

曼祺2:02:37

哦 , 所以你之前是更倾向于认同于第二种 , 就是未来会有很多不同形态的机器人的方案 ?

陈哲2:02:43

对 , 就像我们有汽车 、 有飞机 ,有轮船一样 , 人形只是其中的一部分 。 对 ,但是现在你觉得这个答案更模糊了 ?

我觉得更模糊了 。 对我自己来说可能更模糊了 。 见证过机器人这几十年的发展历史 , 我不是一个简单的或者盲目的技术乐观主义者 ,因为我们知道这个事情很难做 ,但是我们也非常理解技术的突破是非线性的 。

嗯 , 当它过一个临界点的时候 , 它可能真的进入一种正向加速的这种环境 。 所以我们能不能突破那个临界点 , 还是那个临界点因为物理的限制 , 对吧 ?

因为因为机械结构 ,因为电机结构 ,因为这个能能量结构的一系列的限制 , 我们永远达不到那一点 。

我觉得这个到今天我还是没有特别清晰的答案 。 我能够看到的是 , 整个世界 、 整个国家的资源 、 脑力 、 算力在涌向这样一个市场 ,在试图解决这个市场最难的问题 。

所以我很难我很难打包票说这个问题可能五年、 十年以后都不能得到解决 。 所以我觉得我今天可能感觉更加模糊了 。

曼祺2:03:46

我们可以把这个问题记下来啊 。 我们之后一个是下一个季度可以看有什么新的问题 , 另外就是可以回顾一下之前的一些问题的答案有没有变化 , 想法有没有变化 。

陈哲2:03:56

这个可能也跟大模型的发展有关系 , 就是我觉得从 ChatGPT 开始到今天 , 可能大模型已经经历了三四年的发展 。

那大家对于 AGI 什么时候到来 ,AGI 还有多远 , 这件事情本身也是一个一个起伏震荡的一个过程 。 但是大家最终可能变得越来越理性或者越来越乐观 。

我觉得可能对于通用机器人 、 对人形机器人来说 ,也会经历同样的一个过程 。

曼祺2:04:20

那今天非常感谢陈哲做客 《 晚点聊 》, 分享了一季度他认为的最重要的五个具身智能行业的进展或者说事件 。

我们也一一拆开去聊了这些进展 , 这里面包括人形机器人的一些进展 , 比如说宇树的表演 , 然后银河通用用全人形的机器人做的网球的这个 demo, 包括中国的公司 ,也包括美国的公司 。

比如说我们也讲到了像 Optimus 遇到的一些挑战 , 呃 ,Figure 在美国的进展 。 然后我觉得很重要的一点也是我们讲了世界模型 , 这个可能是现在大家讨论很热的 , 对 VLA 的替代或者说进化 , 这里面也出现了一些新的创业公司 , 比如说呃 ,在水下一年之后, 一亮相就融了 4.5 亿美元的 Rhoda AI, 中国也出现了一些这样的创业公司 。

然后对我自己来说 , 我觉得有很多额外输入的是关于灵巧手的这一部分 , 它可能未来有一个存在于像本体 G1 的这样的一个机会 。

而且灵巧手 、 灵巧操作 、 触觉的输入 ,也对模型 、 对硬件的进展都有很多新的变化 。 嗯 ,而最后我们也稍微聊了一下可能马上就会看到的具身智能的上市潮 。

那今天节目就到这里 , 各位拜拜 。

本期节目就到这里 , 欢迎收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 欢迎推荐更多你想听的主题和嘉宾 。

你可以从小宇宙 、 苹果 Podcast 等渠道关注 《 晚点聊 LateTalk》,也欢迎关注我们的公众号 《 晚点 LatePost》。 下期再见