开场0:00
大家好 , 欢迎收听本期的 《 晚点聊 》。 本期节目是 AI 大爆炸系列 , 今天我们很高兴地邀请到了逐际动力的联合创始人陈华来录制我们的节目 。
我们的话题是关于刚刚在 GTC 上被英伟达创始人黄仁勋又点了一把火的通用机器人。 黄仁勋说 , 构建通用人形机器人的基本模型 ,是我们今天可以在 AI 领域解决的最令人兴奋的问题之一 。
成立于 2022 年的逐际是中国已经做出人形机器人的公司 , 陈华也是这个领域非常资深的从业者 。 陈华 , 你可以和我们的听众打一个招呼 , 你可以简单自我介绍一下 。
好的好的 。 大家好 , 我叫陈华 , 然后我 2012 年是获得了浙江大学竺可桢学院的本科学位 , 然后具体的专业是自动化和控制 。
然后本科毕业之后就去美国在俄亥俄州立大学攻读博士学位 , 然后 2018 年拿到了博士学位 。 那个专业或者这个叫系是这个电气与计算机工程系 。
之后就 2019 年回国 , 然后一直在从事机器人和运动控制相关的研发工作 , 然后在 2022 年也一起这个联合创立了逐际动力这个公司 。
所以你是 90 后是吗 ? 因为你 12 年就 ——
我正好 90 年 。
很年轻啊 。 我们可以先聊一下最近行业的一些进展 。 你自己就是有看那个 GTC 的大会上的一些分享 、 演讲 、 论坛什么的吗 ?
GTC 与小脑1:20
就比如说你会比较关注里面的一些什么东西啊 ?
我会觉得是这样 , 就是在最近 , 尤其是现在这个阶段啊 , 可能小脑的这个能力的实现已经暂时是不太能赶得上, 或者稍微落后于大脑和硬件的这个发展 。
所以我会更关注这部分的东西 。
比如说里面什么具体的内容啊 ? 比如说哪个公司或者哪个人做的分享你是印象比较深的 ?
我觉得是这样 , 就是最近这些像 Figure 它展示出来的一些东西 , 然后还有之前在学术界比较出名的这些叫 Diffusion Policy、Aloha 这些东西 ,其实都是偏关注小脑的部分 。
这部分其实是我比较关注和觉得最 excited 的点吧 。
小脑我理解的就是运动协调 , 对吧 ?
对 , 你可以理解成就是怎么执行一个已经被大脑指定的一个任务 , 从物理层面 。 因为大脑还是并不涉及物理层面的 , 就是机器 , 就大脑可能更关注于我要干什么事 。
而小脑其实是通过这个算法也好 , 这些代码也好 , 去实现这个硬件机器人真的能完成这件事 。 大家其实可以从偏技术或者构成的角度去看这个事情 。
从这个角度来说 ,其实机器人或者人形机器人主要分为硬件和软件两个大部分 。 然后硬件部分呢 ,其实最近大家看到从去年开始 , 甚至从前年开始 , 就是有非常多的公司逐渐地开始做人形机器人, 也能很快地做出一个人形机器人。
这个主要的原因是因为硬件的方案的逐渐成熟 , 从电机或者这种驱动器层面 , 然后一直到整机的这个结合的层面 。
我会认为是逐渐从学术或者技术的探索 , 到一个大家公认某一种方案就已经可以完成这件事 , 然后进入到一个工程化的阶段了 。
然后软件层面呢 , 主要可以被分为就是大脑部分和小脑部分 。 这个大脑部分就是我们从 2022 年底出来出现的这个 ChatGPT 或者相对这些推理能力相关的东西 。
然后从 2022 年开始到现在 ,其实我觉得是一个爆发式的出现啊 。 然后大家也都被 ChatGPT 或 GPT 这些非常强大的功能去震撼 。
然后我会觉得这个由于 ChatGPT 的出现 , 这个大脑功能是急速发展 , 然后也进入一个相对稳定的这个发展的阶段 。
然后另外一部分其实就是小脑 , 小脑部分更算是在大脑已经确定了我要完成哪些事之后, 去跟硬件相结合 , 去真正地在物理层面完成这些事 。
那在小脑这部分 ,其实大家可以再把这个功能或者它具体要做的事再分解一下 ,其实就是对这个人形机器人和通用机器人主要分为两部分 。
一部分是操作功能 , 另外一部分是移动功能 , 这也是上半身和下半身 。 然后移动功能在去年其实大家也都逐渐有一些展示 , 然后今年可能最近一些其实更让大家激动的是一个操作功能这方面的一些新的进展 , 或者一些新的 demo。
好的 , 你这个想法我觉得可能会跟一般人不太一样 。 因为不是从业者或者比较关注这个领域的一般人会认为大脑的进展大家觉得哇这个是很厉害的 。
因为大家会觉得大脑好像是一种更高级的智能的体现啊 。
对对对 。
你刚刚说其实是小脑的进展让你感觉更兴奋啊 。
对对对 。 我觉得我这个观点可能主要是因为从我的理解中, 大语言模型和 ChatGPT 这些的出现 , 让大家看到了 , 或者至少让我看到了 , 大脑已经远超我们至少当时我预期的发展了 。
然后现在这种大模型的这种推理能力 ,在大脑层面已经到了一个可以完成很多事情的阶段 , 或者帮人推理的阶段 。
而缺乏的 , 或者我的感觉是目前没有真正的让这件事能完成的 ,其实是怎么把大脑层面的指令转化成真正物理层面的实现 。
Diffusion Policy5:12
你刚才提到了几个项目是你觉得在这个方向有进展的 , 对吧 ? 你提到了 Aloha, 还有那个 Figure AI。 这个可以展开讲一讲吗 ?
就这些主要还是偏那个操作部分的嘛 。 我觉得就是 Diffusion Policy 这些其实是生成式的模型 , 用生成式的模型去做操作这个任务 。
操作我可以理解成主要和手相关的 , 对吧 ?
机械臂和手 , 对 。 也取决于这个具体的硬件到底是不是有灵巧手 , 或者只是一个简单的假爪 。
那他们用了什么以前没有用过的方法吗 ? 因为其实机械臂变得更智能这件事情可能也已经有好多年了啊 。
对对对 。
可能 2016 年之后大概也有很多这方面的工作嘛 。
对 , 从传统一些的机械臂就是在我觉得主要的一个让大家觉得很激动 , 或者看到了一些相对未来的东西 ,是它能力的泛化性 。
就是因为机械臂最早还是在一个非常非常固定的场景 , 然后完成一个非常非常具体的任务 。 而且这个任务其实是单一的重复 , 这是最早的一些机械臂的应用 , 或者机械臂要完成的功能嘛 。
然后逐渐的拓展是要么任务的这个种类变得复杂 , 要么环境变得更复杂 , 甚至会有一些跟人类的交互这些东西 。
然后基于生成式模型或者 Diffusion Policy 这些 , 机械臂操作的这个能力 , 我觉得是从利用了 Diffusion Policy 这种生成式模型 , 它处理叫 Multi-Model 这个能力 , 然后增加了它的泛化性 。
然后比如说我试教 , 可能只需要很少的数据量的完成任务的这个试教 , 然后它就可以在没有见过的一些场景 , 或者没有见过的一些任务中去依然能很高效或者高成功率的去完成这些事 。
我想问一个比较小白的问题啊 , 就是 Diffusion Policy 和 Diffusion 的区别是什么 ? 因为 Diffusion 可能大家更熟悉一些 , 就是它是扩散模型 , 它是比如说这个图片可能最开始它的噪点比较多 , 对吧 ?
然后我一个 D 向的过程 , 我让它生成一个更清晰的完整的图片 。 那这个东西它用在这个机器人的操作上, 它是一个什么样的原理和流程 ?
还是说这两个东西就不是一个东西啊 ?
原理上我的理解是一个东西 , 底层的原理都是一个东西 。 然后它只是把 Diffusion Model 这个生成式模型是用在了机器人上 。其实图像从我的理解只是一个状态嘛 , 就是它的状态是由每个像素和 RGB 就是颜色信息去描述的 。
而机械臂操作其实你也可以定义它自己对应的状态 。
所以它是说先有的是一个比较模糊的动作状态 , 然后慢慢它会生成一个很精确的动作的状态 ,是这个意思吗 ?
就是一个 Diffusion Policy 那个文章中啊 , 它的一个展示的状态是这样 , 就是它会用一个摄像头看到的机械臂和它需要操作的物体作为输入 , 然后它会生成一段轨迹 , 这个轨迹就是我的机械臂的这个末端执行器 , 它需要跟踪或者为了完成这个任务需要行进的一段轨迹 。
然后这个轨迹的生成是通过一开始是一堆噪点 , 然后逐渐通过 Diffusion Policy Backward 这个反向的过程 , 然后收敛到一条比较明确的轨迹 ,是这个过程 。
当然图像只是在操作中的一个输入 ,因为操作的过程中你还有一些机械臂的未知的关节的角度啊 , 关节的速度 , 还有末端执行器的未知这些输入 。
这个精度现在能到多少啊 ? 它能用到一些实际的场景中了吗 ? 因为有些工业场景或者说一些什么场景 , 它对精度的要求还是挺高的啊 。
对 ,但是我的理解是这些生成式模型目前能完成的事其实挺精确的 ,因为任务的要求并不是特别高精度的这些任务 ,而是更重要的是通过反馈 ,因为它本质上是一个实时的图像和实时的这个机械臂的关节和这个信息的反馈嘛 。
通过这个反馈的机制去尽量的让这个动作更精准一些 。 然后我们看到的很多 demo 里 , 就像 Figure 发出来的 , 还有一些之前 Diffusion Policy 相关发出来的一些展示 ,其实它可以做拧瓶盖啊 , 然后洗盘子这种 ,其实相对已经足够精确 ,但是跟传统机械臂肯定不太一样了 。
我觉得关注点是不太一样 。
其实拧瓶盖和洗盘子对传统机械臂应该来说是挺难的事吧 ? 我理解是比较难的吧 。
我的理解是这样 , 就是如果这个盘子永远放在那个地方 , 就是环境一模一样 , 然后它的动作一模一样 , 那我觉得传统机械臂或者传统的这些方法也是能完成的 。
但是最近这些非常新鲜的这个技术 , 这种生成式模型的 ,其实是我可以有一定的泛化能力 。 就是说盘子可以不一样 , 我盘子放的位置也可以不一样 ,但是它依然可以完成这件事 。
对对对 。 我刚刚说的难我就是指的像人那样洗盘子 。
对对对 。其实我觉得就是最近基于生成式模型的这些方案或者思路 , 主要就是在强调一些泛化性的东西 , 或者在这个泛化性的这个维度上有一些突破 。
Transformer 八子9:47
其实关于这次 GTC 大会我有一个发现啊 , 就是一方面黄仁勋和英伟达他们是非常看好机器人和具身智能的 , 然后另一方面就是今年有一个最重磅的活动嘛 , 就是黄仁勋他找来了当年在谷歌写 Transformer 那篇论文 , 就是 《Attention is All You Need》 那不是八个作者吗 ?
他跟这八个人做了一个对谈 , 然后这整个对谈中间他们几乎就没有聊机器人, 也没有聊具身智能 , 然后甚至都没怎么聊到硬件啊 。
你觉得这是为什么 ?
我只能猜测啊 。
我的感觉是这样 , 就是因为最近也有相对多的一些人在说人形基础模型或者通用基础模型对机器人的这件事啊 ,但是这个具体的基础模型到底应该是什么 , 或者它应该完成的任务是什么 ,其实我觉得大家并没有一个非常明确的共识 。
就是不同的人或者不同的团队 , 根据他们之前 , 我觉得主要是因为之前的一些经验啊 , 对这件事的认知是不太一样的 , 或者对这件事的理解是不太一样的 。
通过我对这件事的角度的理解是 , 我觉得黄教主黄仁勋和这些之前在 Learning 方面做出一些贡献的人 ,他们应该会更关注一个真正的 end to end 的端到端的一个事情 。
然后就是从最上层所有的 reasoning 都会加在一起 , 然后一直到最终要完成任务的这件事 。 所以他们可能会更关注这种算法层面也好 , 或者这种架构这种层面的事情 。
因为我之前主要在做机器人相关 , 就是跟硬件打交道会比较多嘛 。 我的感觉是跟硬件相耦合的这部分 , 可能是我更期待它能完成的事吧 。
你说这个角度也有启发 , 就是你说可能觉得比较直接的原因啊 , 就跟这些人的背景有关 。他们还都是偏软件偏算法的人嘛 。
所以其实我对这个问题我自己大概有一个比较简单的理解 , 就是搞过机器人的 、 搞过 AI 和硬件结合的人 ,在整个 AI 人才里面 , 我觉得他人数相对少 ,因为他其实算是一个交叉学科 , 对吧 ?
对对对 。 我也是有类似的感觉 。 然后有这些算法和硬件相互都有一些涉及的人, 可能至少我个人对跟硬件打交道这部分的事情可能会更关注一些 。
对 ,因为其实他们那个对谈主要就两部分嘛 。 第一部分是在回顾当年 Transformer 是怎么诞生的 , 那本来这个也是一个更底层的 , 然后偏纯软的一个成果 。
然后另一部分是在聊他们这些人现在在做什么 ,因为除了有一个人是在 OpenAI 之外 ,其他七个人都在自己创业 。
那为什么没有聊到机器人 ? 一个很简单的原因就是因为所有人创业都没有做机器人这个方向啊 。 就是他们他们都在干别的啊 。
我的感觉是这样 , 就是我刚刚最早也提到 , 就机器人可能分成软件和硬件部分 , 然后软件部分尤其是大脑部分 ,其实可能从某个角度来说 , 它是独立于机器人的 。
就是它是可以单独做成一块 ,并不需要跟硬件打太多交道的一部分 。 然后这部分的进展其实最近也有很多这种就尝试把大语言模型或者大模型或者 ChatGPT 这些东西和机器人相结合的部分嘛 ,但是它并不是可以独立于硬件去做 , 所以可能这也是一个潜在的角度吧 。
求学与启蒙12:56
那正好这个也可以进入到我们下一个话题啊 , 就是聊聊你自己学这个机器人的过程 , 包括你后来是怎么觉得这个领域是有一个创业机会的 。
所以你最开始对机器人这个事就是有一个印象 , 或者觉得这可能是我可以从事的方向 ,是在什么时候啊 ?
我觉得大概是在读博期间吧 。 但是因为我一直学的是控制自动化相关的东西 , 这个其实从根源上来说就跟机器人有很多的结合嘛 。
然后在读博期间 , 尤其是 2016、17 年左右的时候 , 这个波士顿动力当时就是会有很多很多放出来的一些 , 当时看非常非常令人惊讶 ,其实现在看也是非常非常牛的一些 demo。
然后当时他们也会有一些出来分享的 , 就会大概说一下他们怎么去完成这些事 , 尤其是在运动控制或者算法层面 。
波士顿动力当时也会有内部一些他们的 research scientist, 就研究科学家 , 对研究科学家去分享一些他们大概的思路 。 然后当时会发现他们用的其实跟我博士期间的课题是非常相关的方案 , 就是我当时可能做的偏理论一些 , 然后他们其实更关注一些数值计算的相关的东西 ,其实就是最优控制和模型学控制这个方法 。
像当时他们发出来一些当时的四足机器人 Spot 在各种环境地形下走 , 还有 Atlas, 尤其是他们的人形机器人, 波士顿动力的人形机器人 Atlas 做各种当时看非常动态 , 然后非常令人感到很激动的这种空翻啊这些动作 ,他们底层的都是模型学控制 。
然后这个东西也是我当时博士期间主要在做的一些事嘛 , 就是当时看到了这个可能性 。
就是当时波士顿动力展现的那些东西 ,是不是按照你之前说的那个分类 , 它更多是运动能力而不是操作能力的部分 ?
对的 。 我觉得主要也是这样 , 就是操作和英文叫 Local Motion,其实就是足式的运动 , 尤其是足式的运动 , 这两个其实从底层来说是非常共通的 ,但是在具体的这个硬件上其实分成了两条线 , 就是操作是操作 , 然后运动控制或者足式机器人的运动控制是足式机器人的运动控制 ,但是底层他们是非常相同的 。
那它有一个成熟的先后的关系吗 ? 比如说波士顿动力的时候 , 至少它当时展现的 demo 可能在运动能力上你看起来已经是有比较惊人的表现 , 那操作这个是说要更晚才大家看到有一个更大的进展或者更好的表现吗 ?
我的感觉是这样 , 就是在就当时来看 , 可能发展的阶段不同 , 然后从原理上来说难度也稍微有一些不同 。
就是大家会认为足式机器人的这种高动态的运动是相比于操作 ,因为操作是一个固定机做的 , 它会有一个机械臂会固定在一个地方 , 这个固定这件事其实就让机械臂的运动控制这件事变得相对简单了 。
而足式机器人其实就是一个比较稍微专业一点的词叫欠驱动的一个系统 。
欠是欠入的欠吗 ?
是缺乏的那个欠 。
哦 , 欠 。 欠驱动 。
对 , 欠驱动的系统 。 对对对 。 然后欠驱动这个特性会让足式机器人的控制变得相对复杂一些 , 只是从运动控制的这个角度来看的话 。
欠驱动是什么意思啊 ?
就是对一个机械臂 , 如果这个机械臂有 6 个自由度 , 或者无论它有几个自由度 , 它每一个自由度都有一个单独的驱动单元 , 就是电机也好或者其他的也好 , 所以它是可以完全的驱动每一个自由度的 。
而对足式机器人来说 ,其实你能驱动的就是每个关节嘛 。 而但是由于足式机器人它并不是固定在一个具体的地方 , 所以它还有 6 个自由度 , 这 6 个自由度是身体的这个位置和姿态 ,而这 6 个自由度是没有办法通过直接控制某一个电机或者某几个电机去控制的 , 它是一个间接的控制 , 它是需要这个足式机器人和环境发生交互 , 然后通过这个环境的交互
力去影响这个身体的运动 。 我不知道我说的清楚不 。
因为机械臂 , 比如说你可以把它固定在一个位置 , 对吧 ? 然后你刚刚说的那个机械臂上的自由度 , 它都是就那些关节 , 反正它都是腾空的 , 就是它周围没有别的东西在影响它 , 大概是这个样子吧 。
然后如果你是脚上的那些自由度的话 , 你可能比如说你是踩着地的 , 或者你上面支撑着别的东西 。
类似 ,但是我想想 , 我可能再尝试解释一下, 就是假设我有一个三个自由度机械臂 , 然后我只需要控制这个机械臂最终这个末端的空间中的位置 , 只是看位置的话 , 那空间中位置其实也只有三个坐标 , 对吧 ?
所以我是明确会有一个一一对应的关系的 。 但是足式机器人不一样 ,因为你有 6 个是需要通过间接的去控制 ,其实是直接和间接的一个关系 , 就是由于这个间接是需要通过你控制它能控制的部分 , 然后跟环境进行交互 , 就会有这样一个多出来的东西 。
所以结论上其实是就足式比操作要难 , 或者说它做到某一个程度是更难的 ?
在运动控制层面 , 足式会比操作要复杂 。 然后因为机械臂操作其实从比较早 , 可能 10 年左右或者 15 年左右 ,其实就已经进入了不单纯是运动控制的这个研究 ,因为还涉及很多视觉啊 、 感知啊相关 , 然后从这个抓取的或者操作的角度跟环境或者跟物体的交互 , 那部分是更复杂的一些东西 。
但是只单纯看运动控制的话 , 我的理解足式机器人是会比传统的机械臂要稍微复杂一点的 。
你刚才说就是你在读博的期间 , 你看到波士顿动力做的一些事和你做的事方法很像嘛 。 就如果概括总结一下的话 , 你博士时候研究的那个问题是什么呀 ?
就是它是一个什么方向 ?
叫做混杂系统的最优控制 。
OK, 可以用那个一般人能听懂的话再翻译一遍 , 中一中 。
我想想看怎么说 ,因为那个是一个比较偏理论一些的东西啊 。 就是我们日常的很多东西都可以被一个系统描述 , 就是比如说一个物体受到力的时候它怎么运动 , 比如说一个质点 , 一个点它受到一个力它会怎么运动 , 这个事可以被一个系统或者被一个常微分方程描述 。
然后这个常微分方程描述的是一个连续的过程 , 就一般商位技术人就会写成 X 的导数等于一个方程这种东西 , 或者牛顿力学嘛 , 就是加速度乘以质量等于力这个过程 , 然后它的状态是连续的位置和速度 , 这两个是连续的 。
但是混杂系统就是除了这个连续的状态之外, 它还会有一些离散的状态 。 然后足式机器人的运动本质其实就是一个混杂系统 ,因为它涉及一些比如说我的脚到底是触地还是不触地 , 就是跟地面或者跟环境有没有接触 , 那这个接触其实是个离散的变量 , 然后这个离散的变量其实是会影响整个机器人的运动的这个物理规律的 。
所以简单理解就是足式机器人的优化 ?
对 。 足式机器人运动控制 , 你可以把它抽象成一个混杂系统最优控制问题 。 所以这两个底层是一样的 , 所以当时我看到了一些可能性 。
对 。
了解 。 您当时博士的时候的导师就是逐际的创始人张巍什么 ?
对对对 。
所以这个题是你自己想要去做这个问题 , 还是就比如说你当时怎么和张巍教授交流 , 就你们为什么觉得这是一个比较好的方向吧 ?
我觉得是有些传承的因素在里面的 。 因为张老师他博士期间和他一直的做的可能就是在混杂系统控制相关的一些工作 , 然后我们当时可能主要是对混杂系统最优控制做了一些小的进展或者小的问题吧 。
硬件与创业20:08
那除了就是你看到波士顿动力这个进展 ,因为它更多是就像你说的它是偏运动的嘛 , 那其实整个人形机器人或者说通用机器人它还需要一些别的东西 , 还有哪些别的技术的进展让你觉得到你后面创业或者说来做这个事还是到了一个更成熟的状态 ?
就是我在读博期间可能主要是这一个事 ,因为偏算法 , 然后很相关一些 。 然后另外一些进展我觉得是可能在 18、19 年左右 , 就是那个硬件方面的一些进展也是对这件事有一个比较大的促进作用 , 主要是麻省理工学院的这个硬件的方案提出了一种算是比较新颖的电机设计或者驱动器设计的方案 , 就是关节单元的设计的方案 。
然后这些方案其实现在我们能看到的 ,不能说绝大部分 ,但是就是有很多的人形机器人其实都在继续沿用这个方案 , 这个也是为硬件的这个提供了一个我觉得是非常好 , 然后非常低成本 , 然后也容易做出来 ,并且性能很好的一个方案 。
然后当时这个我觉得也是对这个足式机器人的发展 , 尤其在 20 年左右可能四足机器人有一波发展嘛 , 这个也是由于麻省理工学院这波这个方案和他们把这个方案开源了 , 所以对整个的行业也是一个推动作用 。
还有一些就是感知视觉这些相关的 , 那些是一直在持续推进嘛 。
嗯 ,MIT 开源的那个方案 , 就是它里面的硬件 , 你刚刚说的它的一些特性啊 , 就结果上它是比如成本更低 , 然后更容易制造等等 , 它实际上它背后的这个技术上的变化是什么呀 ?
因为当时我理解是他们在学校里嘛 ,其实关注的点是如何做一个高动态的四足机器人, 当然涉及硬件和控制相配合了 ,但从硬件的角度如何设计高动态 ,其实就是需要这个关节或者这个驱动单元要有特别高的力透明度 , 这是当时的一个特点 。
然后他们通过做这种叫行星减速器 , 使用这个思路去做了一个这个关节单元 , 然后这个关节单元就是有非常高的力透明度 , 意思就是不需要添加额外的传感器就能做到很精准的力控 , 然后质量也相对轻 , 这件事就让四足机器人完成高动态运动这件事成为了一个也不能说成为可能 ,但是会变得相对简单 。
是因为它用了一种新的物理结构 , 还是用了什么新材料 , 还是怎么怎么做成的 ?
我会这么理解 , 就是我觉得他们是以这个任务为目标 , 然后找到了一个最合适的方案 。 当然这些方案肯定是都存在在世界上的 , 只是之前没有把这两件事联系在一起 。
所以那个东西可能以前没有用在四足机器人里面 , 它可能用在一个什么别的地方 ?
对对对 。 然后也没有一个从相对理论和可解释的角度去说为什么要用在四足机器人上 ,他们当时也是给了一套这个偏相对严谨的解释吧 。
其实你刚才回顾了就是 15、16 年左右 , 然后到 20 年左右你看到的一些这个行业的技术变化 , 然后逐际创业是在 2022 年嘛 。
对对对 。
就是当时为什么在那个时间点你觉得是一个创业的机会 ?
我觉得还是从硬件的角度和从功能的算法或者运动控制这些角度进入了一个相对成熟的阶段 , 就是只是说硬件和运动控制这两部分 。
我想问一下就是 2022 年来做一个新的机器人公司 , 你觉得当时的市场环境怎么样 ? 我主要指有融资这些啊 , 就你们当时获得资源会比较容易吗 ?
还是那会儿可能已经不是在一个投资的高峰 ?
我的感觉是当时由于大环境的影响可能并不是那么好了 , 就跟之前相比啊 。 但是机器人, 尤其是足式机器人, 这个还是最受关注的这一小部分 。
所以整体来看 , 就是整体的大环境相对并不是那么好 ,但是机器人这个领域还是 OK 的 。
因为中国其实有很多大的公司在做机器人, 包括小鹏 、 小米 、 腾讯 , 甚至字节 AI Lab 那边他们也在做嘛 。
就是你觉得你比较倾向于在创业公司里做这个事是为什么呀 ? 或者如果你比较客观的来说 , 你觉得就比如在这种不同的团队工作是什么感觉 ?
因为你肯定认识很多从业者是在大公司的 , 你们这个圈子反正都比较小嘛 。
我觉得是这样 , 就是从我的理解上来说 , 人形机器人或者足式机器人其实是一个技术快速发展 , 然后也是很前沿的一件事 。
比如说现在这个时间点 , 我们去问下面这个问题啊 , 就是人形机器人真的所有的技术都已经成熟或者都已经 ready 了吗 ?
我觉得可能这个答案我至少不敢说是 , 所以还是需要很多前沿探索的 。 然后我觉得做人形机器人这件事就是在技术探索的过程中需要跟需求或者市场做一些这种双向的这个 match。
所以从这个角度来说 , 我会觉得在创业公司或者用创业的思路去做这件事会相对就自由度会高一些 。
然后也有选择我到底是继续在技术的角度 , 甚至学术的角度去做突破 , 还是我需要尽快的把现有的一些技术给落地成产品 , 这些选择我觉得在创业团队是足够的这个自由的 ,是可以很高动态的变化的 。
因为这个整个环境的变化其实我的感觉是在过去的这一年多的时间里 , 整个的变化是非常非常巨大的 。
因为现在做大模型的创业的话 ,其实有一个讨论的议题就是大公司做大模型的资源和创业公司做大模型资源之间的资源量上的差异 。
因为大模型我觉得各个大公司还是投了非常大的精力的 。 然后具体到通用机器人这个领域 ,是不是大公司的资源和你们创业公司资源也没有那么大的区别啊 ?
因为据我所知可能大公司很多还是在 AI lab 这种 , 就像你刚刚说的 , 它可能不是要直接去匹配一个非常实际的需求 , 它是在那样一个环境里去做 。
其实我个人感觉是对做机器人这件事来说 , 一个资源相对大的部分是硬件 。 当硬件相对的就是方案相对成熟 ,并且也可以相对低成本的把它做出来的时候 ,其实大公司和创业公司的这种资源上的这个区别的影响就不是那么大了 。
所以早期会有一些影响是吗 ? 就是在硬件成本比较高的时候 ?
我觉得是早期是会 。 对对对 。 或者说硬件方案甚至都不是那么确定的时候 , 我觉得是会影响的 。
因为做机器人嘛 , 你总需要做一个硬件出来的 。 那做这样一个硬件如果没有一些大家相对公认的一些技术方案 , 或者相对成熟的一些技术方案的话 , 你需要做自己继续去做探索 。
这个过程我觉得还是需要很多资源去尝试去做的 。
我看逐际现在是做了三个产品嘛 , 就你们虽然是一个创业公司 ,但你们已经做了三个机器人了 , 包括人形机器人这个叫 CL-1, 还有一个四轮足产品叫 W1, 还有一个是点式双足机器人 P1。
产品与热潮26:31
就是你们这是一开始就规划的这个产品路线图吗 ? 以及就是为什么要做三个了 ?
我们其实一直的内心最终极的目标都是人形机器人。 但是我们的感觉是这样 , 就是人形机器人这个事情就像刚刚我简单提到就是是不是真的现在已经 ready 了 , 我觉得还不能说是 。
所以这个路线或者这个最终的目标点是不变的 。 然后我们更关注的可能从产品的角度啊 , 或者从这种商业化探索的角度 ,是在这个过程中我们哪些技术觉得已经足够成熟了 , 然后去做商业化或者产品化的一些探索 。
这个是为什么会有四轮足 , 会有点足的这两个的原因 。
你们的人形机器人是 2023 年发的是吗 ?
对对对 。
所以这个不是因为蹭热点是吗 ? 是因为你们本来的计划可能就是要 23 年才能发人形机器人 ?
对的对的 。 具体的 concrete 可能没有具体到 23 年几月份这种东西 ,但是是在整个的这个路线图里的 。
对 ,因为确实就去年的一个现象是大家会觉得突然好像就是出现了很多人形机器人。
对对对 。
那再早一点 , 中国其实也有一些做人形机器人的公司 ,但大家好像都觉得也没有那么认真啊 。 就比如说小米是有做的 。
对对对 。
但是那个就看起来也比较奇怪吧 , 反正 。 然后小鹏也有做 ,他们好像都是在模仿特斯拉 , 反正给人这种感觉 。
另外还有像比如说优必选也做嘛 ,不过它那个其实有很多是用在一些教育或者偏娱乐的场景的 , 好像也不是现在大家理解这种人形机器人。
确实 23 年的时候你会看到非常多的人形机器人出来啊 。
对 , 我觉得这个 Elon Musk 绝大部分是因为他 。 这是我个人的一个理解 , 就是因为他是在 22 年的国庆 , 我印象中 10 月 1 号或者 9 月底 , 就是他说这件事是听到 ,但是在 9 月份其实真正的当时应该也没有 , 我印象中是没有一个非常好的东西 ,但是他至少推出了这个东西 。
然后我觉得他的这个东西还是影响了很多 。 因为在那之前 , 我的印象中国内对 , 就是优必选是在做人形机器人的 , 就是大全尺寸的 , 我说真正的这种并不是那种小的教育的相关的这个产品 ,而是这种大全尺寸的 。
优必选也是有的 ,在之前 。 那他们当时技术或者这种参考的是本田的那个 ASIMO 嘛 。 对 , 然后我觉得人形机器人在去年的这个爆发 ,Elon Musk 是起到了至关重要的作用 。
你 2022 年看到特斯拉那边把 Optimus 的这个叫样机吧或者什么东西 , 反正它终于放出来了 , 你当时是什么感觉啊 ?
实话是觉得并不是那么的 impressive, 这是心里话 , 这是心里话啊 。
实话是就这是吧 ?
因为我们对它还是有期待的嘛 , 就是至少希望它能完成一些我们当时看至少技术上是明确能做到一些事 ,并且它把这件事做出来了 。
比如说当时我们会很期待它能走一走 , 或者走得相对好一些这些 。 但是他们的发展速度也是极快的 , 就是从 22 年的 10 月份到去年发出来的一些视频或者一些结果是已经非常非常不错了 。
你对它 demo 里做的什么动作感觉比较让你印象深刻啊 ? 就后面的一些 。
首先从我偏技术的角度去看特斯拉的这个人形机器人, 我会觉得它并不特别强调动态性 。 就它发出来的这些行走的视频啊 ,其实并不强调它能跑多快 、 跳多高这些事 ,而是可能一个比较重要或者大家关注的点是走得多么像人。
然后它还有一些操作 , 还有一些这个当然硬件和算法相结合的就是触觉传感 , 然后加上一些操作的东西 。
就去年这些我觉得还都挺让人感到就有至少很大的进步 , 然后也觉得是一个比较 impressive 的东西 。
走得像人这件事重要吗 ?
我心里话是觉得可能并不是那么重要 , 除非我们找到了一个非常坚定的理由 。 但是走得非常像人这件事 , 我觉得也是展示了一个技术的实力 , 只是可能关注的点不一样而已 。
就像我刚刚说就是 MIT 当时去做那些事 ,其实我的理解是他们的目的就是做一个超高动态的一个四足机器人, 然后所有的算法或者设计 , 然后最终展示出来也都是这个机器人能完成非常高动态的空翻啊 , 跑得特别快啊 , 当时啊 ,18、19 年左右 。
所以只是目标的不同吧 , 我的感觉是 。
我觉得未来人形机器人就是你要能适应为人类设计的所有环境 , 这个肯定是重要的 。
没错没错 。
但是具体你到这个姿态上是不是非常像人, 好像也不知道重不重要啊 , 可能也没有那么必要吧 。
对对对 , 我个人也是这么感觉 。 或者说我个人现在没有一个坚定的原因或者理由去相信像人这件事很重要吧 。
可能随着发展会发现有些原因或者一些因素是需要做这件事的 。 比如说如果我们从这是可能比较长远的东西 , 就真的需要这个人形机器人去起到很多陪伴或者情感上的和人的交互 , 那可能像人这件事就相对重要到那个时候 。
但是目前这个时间点 , 我觉得可能还有一些更重要的事情要先被解决 , 然后再去考虑其他的 。
落地与强化31:43
我们可以从星辰大海再往回拉一点啊 , 就是你们现在说人形机器人是你们长远的目标吧 , 那你们已经在用的我理解就是有客户的一些产品啊 , 应该是你们的四足机器人 、 四轮足的产品 , 还有你们的点式双足机器人。
你可以解释一下, 比如说这些形态它都是对应什么场景吗 ? 就它现在可以用来做什么了 ?
我觉得四轮足机器人主要其实最核心的点是它的能量效率和地形适应能力的一个平衡 。 因为从地形适应能力的角度来说 , 四足机器人可能已经可以足够完成很多任务了 。
但是为什么需要加轮子 , 或者为什么要做一个轮足机器人 ,其实是为了平衡这个能量效率或者这种整个任务完成的效率 。
因为很多的场景和地形其实我并不需要用足走的这个形式去做 。 所以我们的目标的场景可能是一些比如说像举些例子啊 , 比如说这种大范围或者大尺度的这种工厂巡检呀 , 或者这种就是可能稍微再稍微远一点 , 就是这种叫快递 delivery 这些相关的东西 。
这任务中有一大部分是需要高能量效率去完成 , 就是不可避免的有一部分是需要处理地形 。 这个是我们四轮足的潜在的目标的一些场景 。
你刚才描述的这个四轮足机器人的特点 , 我觉得有些像增程式的那个感觉 。 就电动车里面增程式是就你要用油的时候你就可以用油嘛 , 然后你要用电的时候就可以用电 。
就相当于你是可以根据场景切换形态的 。
对对对 , 可以这么理解 。 因为在比如说长距离的这种平地的 ,其实你并不需要用走这个能量其实并不高效的这种方式去处理嘛 。
然后有楼梯或者有坡或者干嘛的时候你就可以走 , 对吧 ?
对对对 ,有些非常规或者一些非结构化或者离散的地形的时候 , 需要通过这个迈步的方式去处理 , 那就通过迈步的方式去处理 。
所以是一个平衡啊 。
接下来我们可以讲讲你们的双足机器人。 它现在主要是用来做什么的 ?
点足机器人对吧 ? 我们的点足机器人现在目前可能主要面向的是偏科研的一些用户 。
可以先解释一下点式双足啊 。 双足是比较直观吧 , 那就两个脚嘛 。 点式双足可以解释一下这个形态啊 。
它也是两个脚 ,但是它没有脚掌和脚踝这部分 , 它跟地面的接触就是一个点接触 ,是这样一个形态 。 然后我们目前可能主要的一个目标的群体是做科研的群体 。
然后我们的理解是这样 , 就是点式双足机器人是做双足机器人的一个最基本和最小的平台 , 尤其是最近一些强化学习或者这种先进的这些算法的验证平台 , 这是一个最核心最基础的一个平台 , 然后也是最简单的一个平台 。
所以从这个角度去考虑这个事情 。
我看你们最近有发一些 demo 嘛 , 就你们把你们的点式双足机器人带到深圳的应该是什么森林里面什么 。
对对对 。
然后反正有坡 , 然后这个地形非常不平坦 。 你从各个角度去踹它 , 去推它 , 然后它的这个平衡性都非常好 。
就这个是以前做不到现在才能做到的吗 ? 它是一些什么技术导致现在可以做到了 ?
主要是强化学习在这个运动控制这个问题中的应用 。
那这个也是用了比较久了吧 ? 因为强化学习出现倒是挺久了啊 。
但是在机器人的运动控制中其实也就是最近一年左右的一个爆发吧 , 或者大家逐渐开始考虑这件事是在最近一年 。
把强化学习这种方法用到机器人的控制里面 , 就这个进展和 Transformer 的那个进展是有关系还是没关系啊 ?
就这些进展是不同的条件吗 ? 还是中间有什么联系啊 ?
我个人的感觉是其实相对独立 ,但是像 Transformer 或者大语言模型 ChatGPT 这种 , 它展示出来的这个能力是让人们去意识到用学习或者数据驱动的方式做运动控制是可能 , 然后去开始大家逐渐尝试这件事 。
所以是一个非常非常间接 ,但是我觉得是会有底层的影响的一个事情 。 但是具体的技术发展从我角度来说我觉得相对独立 。
就是它在技术路线上它是不同的线去演进的 ,但这个关系可能就是整个 AI 领域的人都信仰充值了 , 对吧 ?
对对对 , 我觉得可以这么说 。
就大家就觉得可能以前一些觉得想想就觉得没有必要去试的方法 , 大家也会愿意更多去尝试一下 。
对 , 然后我觉得另外一个角度或者另外一个因素是这种计算资源的这种发展 。 因为大模型其实需要很多算力 , 然后这个过程中其实英伟达我觉得也是在迭代发展的 。
就是我做这件事需要这么多算力 , 那目前没有 , 可能就会有一些人去开发相关的这种芯片 , 或者去推动这件事的进步 , 然后去阶梯式的往上发展 。
然后这些发展其实为这个强化学习在机器人中的应用做好了准备吧 。 因为很多年前强化学习这件事其实已经被提很久了 。
我在博士期间也做过一些相关的探索 , 偏理论一些 ,但是当时其实的一个感觉就是其实计算资源是不够的 , 所以它也很难在这个实际的场景中去应用 。
但是随着广义 AI 的这些发展 , 我觉得计算资源也是得到了一个提升 , 所以让这件事变得可能了 。 这是另外一个角度 。
因为你们同时做了三个产品嘛 , 就是我观察到一个点 , 就中国的很多做通用机器人的公司 , 或者说它的产品序列里有人形机器人 、 通用机器人公司 , 它往往也是有别的形态的机器人的 。
中美与波士顿36:45
那其实很多国外的一些创业公司可能它就只是在做人形机器人。 就为什么会有这个差别啊 ? 以及为什么不集中精力只做人形机器人了 ?
这个好像是一个更直接更简单的选择 , 对吧 ? 因为创业公司的资源都是比较有限的 。
我个人的理解是这样 , 就是国外对一件事的时间的 , 就是可以允许它做很长时间 , 然后开始爆发 。
像 OpenAI 其实 15 年就成立了 , 然后它的爆发之前其实当然业内是很清楚它的一些发展 ,但是从公众的角度可能一直都是比较默默无闻的状态了 。
我觉得这个可能就是海外和国内一些 mindset 的不同吧 。 然后在国内我觉得我们去做这些事主要是因为我们也是想 , 就是刚刚说嘛 , 就在技术推进的过程中去用一些我们认为比较成熟的技术去做一些商业化或者产品的一些探索和尝试 。
这么说起来 ,OpenAI 更早的时候他们也有一个机器人的项目 , 当时他们有一个 demo 是用那个灵巧手可以玩魔方的 , 单手玩魔方 。
对对对 。
然后后来反而他们好像就不怎么做了 。 然后我看去年有一次 Ilya 接受一个访谈的时候 ,他就说这个机器人太难做了 。
对 ,他觉得他们比如说搞数据啊 , 干什么都很难 , 然后设计硬件都很难 。 所以他们后来就那个项目没有再往后去推 ,他们还是集中主要的精力在做大语言模型这块啊 。
所以就是对 OpenAI 来说做机器人都非常难 。
但他们最近投了一些机器人公司 。 我觉得主要的区别或者一个角度的区别是这种数据的获得的难易程度 。
因为偏 learning 学习相关的或者数据驱动的 ,其实数据的数量和质量是个非常重要的一个部分嘛 。 然后对大语言模型或者图像这些数据其实量是巨大的 ,由于互联网这些东西 。
然后在这些巨大数量 ,而且是相对低成本能得到的或者容易得到的 ,在这里面筛选出一些高质量的数据 , 这件事相对简单 。
但是对机器人来说 ,因为它有一些物理和硬件的 , 需要在物理层面和硬件层面去做交互 , 你才能得到这些数据 。
就是如何 scale 这个机器人的数据是个我觉得现在大家也很多人在关注这个问题 。
你刚刚也说到 OpenAI 投资了一些公司嘛 , 比如说他们最近投了一个公司叫 Physical Intelligence, 简称是叫 Pi 啊 。 然后这个公司就是它更聚焦 , 它说它只做机器人的大脑 ,其实就是只偏软件的部分嘛 , 它不做涉及到身体硬件的那部分 。
然后我也发现这个好像也是一个中美区别 , 就比如说你可能在美国有一个只做大脑的公司 ,但是国内好像大家讲的都是要软硬一体 , 就是觉得只做大脑好像不太可行 。
这个是为什么呀 ?
我觉得可能有几个角度啊 , 这是我个人的一些理解 。 就是一个可能角度是在中国做硬件是相对简单的 ,而在海外, 尤其美国做硬件这件事其实是相对复杂的 。
是的是的 。
由于一些供应链和其他的一些成本 , 甚至也可能是一个比较大的因素啊 。 然后另外一个角度就是我觉得做大脑这件事或者做软件这件事其实分成几个阶段 。
一个是当这个硬件并没有成熟到一定层级的时候 , 可能不是那么恰当 ,但是我觉得可能可以参考一个类比就是手机啊 。
就是当我们都没有手机或者没有智能手机这种硬件的情况下, 我去做一个智能手机的操作系统这件事 , 明确的就是一个非常长周期 ,而且你是锚定了最终的就是或者未来的一件事 。
然后另外一个就是当这个所有硬件足够成熟到这个 , 比如说大家都公认一些东西的时候 , 或者成熟到一定阶段的时候 , 当在上面做一些 APP 或者应用这些东西 。
所以这是两个阶段 。 然后我的理解是 Pi 或者 Physical Intelligence 这个公司其实在尝试做机器人的操作系统 , 甚至更底层的一些事情 ,而这个事情一定是会相对长周期一些的 。
我觉得在海外可能这件事也的确是可以承担这种长周期的一件事 ,但国内可能还是需要一些比较快的反馈 。
就是需要一个阶段性就有阶段性的成果 , 这样你可能才好获得更多资源啊 。
对对对 。
其实中国这个人形机器人领域还有一个比较有意思的现象 , 就是和大模型对比来看啊 ,其实大模型的话我觉得美国是先于中国火起来的 。
因为像比如 Jasper 这些公司 , 比如 Creator.ai, 包括 Midjourney, 那可能在 23 年之前就已经出现 , 就已经比较受关注 。 而通用机器人它是反过来的 。
通用机器人我的感觉是中国是先比美国热度高起来 ,因为其实 23 年中国就出现了很多这个领域的新公司 , 或者说有一些以前已经成立的公司 , 然后它也开始做人形机器人。
那美国可能是到今年的话 , 你会感觉到这个新公司的成立啊 , 融资都变得更热了 。 为什么它会有这种对比啊 ?
我的理解可能还是偏硬件角度的原因啊 。 因为其实美国像在 Elon Musk 说这件事之前 , 或者真正推动这件事之前 ,其实美国也有一些人形机器人公司 , 比如说 Agility Robotics,他们其实很早就开始做人形的硬件 , 然后也其实相对早的有这个东西 。
然后波士顿动力也是有 ,但是波士顿动力那个方案是不太一样 ,但是也会做相对这些东西啊 。 然后从去年开始 , 我觉得还是由于硬件的做出来这件事的难易程度 , 让国内啊在去年有很多公司可以做出这个人形机器人的硬件 。
对 , 你们也是在深圳对吧 ? 深圳也是中国这个供应链比较发达的地方 。
对 。
你们是因为这个原因所以总部才选在深圳的吗 ?
可能因为我和张磊回国之后一直也都在深圳嘛 , 所以这可能也是一个原因 。 然后比如说英伟达也说到了嘛 , 就是应该是迪士尼给他们做的一个小的那个机器人 ,其实用的一些关节都是国内公司的关节 。
中国公司的 。
对对对 , 所以这些硬件其实可能供应链都是从中国出去的 , 所以在海外做这些硬件还是比较长周期和复杂的一件事 。
对 , 你刚才也提到就是在这一轮热潮之前 , 美国已经有一些公司嘛 。 然后我想到一个关于波士顿的让我非常吃惊的事 , 波士顿动力 , 就是我们去年应该是写一个稿在讲字节做机器人。
它大概有一个信息是说字节的有一个管理层对此发表评论 , 就说我们不能做像波士顿动力那样 30 年都没有收益的事情 。
然后我当时还在想 , 这人是说错了吗 ? 波士顿动力有 30 年吗 ? 是个这么老的公司吗 ? 后来我去查了一下, 这个公司居然是 92 年成立 。
对对对 , 波士顿动力是 92 年 。
就是它真的有 30 年啊 。 就你很难想象一个中国公司做了 30 年, 然后它其实到现在它也不赚钱嘛 , 对吧 ?
对对对 ,因为我们对波士顿动力关注还是挺多的 。 从我的理解来说 ,其实波士顿动力在可能 20 年之前 , 它更像是一个研究所或者研究机构 。
这可能是由于它创始人的这些背景和理念导致的 。 就是在机器人或者足式机器人的爆发这波之前 ,其实他们更像是一个研究机构 ,他们并没有特别推一些产品化或者商业化的事情 ,因为放出来的都是各种特别 fancy 的 demo, 对吧 ?
然后他们的人形机器人至少到目前为止都是液压驱动的 , 这件事其实约等于不可能产品化 ,但是它的目的就是为了炫技 , 对吧 ?
打引号的炫技啊 ,并不是那种贬义的炫技 , 就是褒义的炫技嘛 。 所以所有的行为来说更像是一个研究所或者研究机构 ,而不是一个商业化的公司 。
当然这个也在发生变化 。
液压的好处就是它的 。
力大 。
对 , 还有力度 , 爆发力什么的 , 对吧 ?
对对对 ,但是成本啊 , 或者这个可靠性啊 ,其实都不太好 ,而且效率也应该不太高 。
对 , 我觉得它某种意义上都有点那种蒸汽朋克的感觉了 。 就你现在在看它 , 就它有些地方看起来非常是上一个时代的那种感觉啊 。
所以他们的人形机器人, 至少 Atlas 液压版本的人形机器人, 我的理解就从来就没有想过把它变成一个产品去卖 , 只是为了推动技术的发展 。
你们研究过在 20 年之前波士顿动力的经费都是从哪来的吗 ?
这个其实 Mark Rueberg 可能在一些采访中其实也说过 , 然后他们其实在 92 年成立之后的很长一段时间 , 可能到 05 年左右 ,因为他们的各种各样的机器人也是 05 年左右放出来的嘛 。
就是大家会发现有一些从 92 年到可能 00 年到 05 年某个时间节点的时候 ,他们是以做项目为生 , 就是做各种各样的奇奇怪怪的项目 。
后面你像 Alphabet、Google 好像拥有了它一段时间 , 然后现在是现代嘛 , 然后软银好像也拥有过一段时间 , 这些应该也都会为它提供一些资金 。
你觉得波士顿动力它算是起了大早赶了晚集吗 ? 它怎么现在好像在新的这一波人形机器人的热潮里面 , 已经不是在聚光灯的中心了 ?
我觉得是 ,但是不得不承认它为整个技术的推动在某个阶段是做了一个巨大的推动的作用 。 如果没有他们 , 我这只是我的一个臆想或者一个感觉 , 就是如果没有波士顿动力 , 可能 Elon Musk 也不会这么早的做人形机器人。
如果他不是这么早的做人形机器人, 可能这件事或者至少会推迟发生吧 。
你觉得波士顿动力它从技术 、 从它的机器人的能力上来说 , 它主要的欠缺是什么呀 ? 是不是他们太关注硬件了 , 它软件部分的算法部分 , 包括和 AI 结合这部分走得比较慢 ?
我觉得并不慢啊 , 首先 。 我觉得波士顿动力至少在人形机器人这件事上, 至少到目前来看 ,他们对传统的液压的这种硬件方案的执着是一个比较大的影响 。
然后在过去的一段时间内 , 可能他们对 model base, 就是基于模型的或者模型预测控制的这种控制思路 , 或者算法的这个框架的执着也是有一定影响的 。
当然他们最近也开始用一些学习相关的东西 ,也这个是的确会有一些影响的 , 对 。
你说的这个我觉得其实是技术或者说科技商业历史上会比较有意思的一个现象 , 它可能重复出现过 。
就是当你做一件事特别早的时候 , 你用的可能是上一个时代的技术栈 , 然后后面有些新的技术栈 , 它其实是可以达到相似的效果 ,以更低的成本 、 更好的规模化的可能性 , 或者说最后的性能也会更好 。
但是因为你之前在那个老的技术栈上, 你已经积累的太久了 , 你可能没有那么快 , 没有那么灵敏就能转到新的技术栈上 。
对 , 我感觉是至少从表现上来说 ,他们是有一点点这种感觉的 。
你们不担心现在处于波士顿当年的那种风险吗 ? 就你们觉得现在的技术路线 , 它就是未来实现人形机器人的一个比较确定的大方向 , 只是做迭代而不是一个全新的革新了吗 ?
这么说吧 , 就是我的感觉是 , 首先就这一波的发展是急速的 , 然后也是非常快的在往前推进的 。
这个跟波士顿动力当年的处境是不太一样的 ,因为他们用模型预测控制或者相对的东西其实用了很久 ,5 年左右吧 , 至少应该是有的 ,但是现在可能 5 个月都已经是非常长的一段时间了 。
然后另外一个角度是在当年啊 , 比如说 16 年或者到 20 年左右这个区间内 , 除了波士顿动力 , 全世界其他的地方可能并不太知道该怎么做 。
就是某种意义上它是垄断 , 就打引号的垄断了 ,是垄断了这个技术方案 。 当然它会往外说一些 , 然后大家逐渐开始 。
但是目前我觉得现在这个阶段 , 可能是由于大家开源的思想 , 还有一些分享的思想 , 所有的信息都是瞬间就可以被所有人知道的 。
这件事我觉得是一个非常好的事情 , 对整个行业的发展都是有巨大推动作用 , 就不太会有这种在某一个一条技术路线上走得太久 , 然后被卡住 , 或者就是上个世纪时代的这种状态 。
所以你觉得大概率我们沿着现在这个方向往前走 , 就是可以实现通用机器人或者通用智能体的目标是吗 ?
目前我的理解是 , 这个是目前看来最有可能的一个路径 。 然后由于现在这个行业的蓬勃发展嘛 , 我觉得是一旦有了新的让大家觉得更好的或者更合理的这个路径的话 , 我觉得大家也会非常快的去调整 。
我的感觉是不太会有之前的那种状态了 ,因为现在信息其实非常的透明 , 就是相对技术发展的信息 。
从你 2012 年读博士到现在 , 差不多也有十几年的时间嘛 。
变与不变48:55
对 。
然后在机器人这个方向 ,有哪些事是你开始觉得比较怀疑的 , 然后后来变得越来越确定的事 ?
我觉得一个就是人形机器人这种发展速度 , 或者推进的这种可能性的 。 然后另外一个对我个人来说 , 可能是基于数据或者基于学习的这个方法的 , 就是也是它能完成事情的 , 或者能推进的这个速度吧 。
就之前我觉得大家都是会有怀疑的 , 尤其是我可能之前也更偏向波士顿动力那种思路啊 。 但是我觉得我们只能逐渐变得很快 , 这可能也是创业团队的一个优势了 。
我们上一次节目和阿里的博烈峰老师 , 就是他通义实验室 ,他是做多模态的 , 就跟你们不是个领域 ,但他讲了一个段子挺有意思的 。
因为他年纪比较长啊 , 就他 07 年就已经博士毕业了 。他说 06、07 年大家去开会讲深度学习 , 就说深度学习的效果比其他方法好了一个点 ,但多了很多参数 。
就那会儿大家就会揶揄说这东西好像也没有那么有用啊 。
明白明白 。
对 , 确实他可能是从一个比较怀疑 , 然后到大家慢慢变得更确定的一个过程 。
对 , 我觉得这个过程中其实就刚刚可能也简单提到 , 就是 ChatGPT 展示出来的这个 mind blowing 或者这种让人 wow 的这个效果 ,是客观上和隐式的推进了整个的发展 。
我觉得是有这个状态的 。
你刚才说的是就是更有信心的部分嘛 , 那你觉得有什么部分是进展不如你的预期了 ? 你觉得发展的速度不如你想象中快的 ?
我可能有一个小点 , 就是硬件上这种革命性的发展 , 我会觉得可能 , 或者我会期待会有这种新的东西的出现吧 。
你觉得硬件上除了这种革命性的发展你没有看到之外, 那有什么比这个层级稍微弱一点的 , 你觉得还不错的一些进展吗 ?
我感觉目前可能还没有 ,但是从各种各样的信息渠道 , 就是大家现在对灵巧手的这个关注度 , 可能是一个不远的将来会有一些比较大的发展的一个点 。
这是我的感觉 。 因为人形机器人可能手的确是大家想象中最终那个人形机器人一个非常重要的部分 ,但是目前我的感觉是还没有到一个基点 , 或者一个完全不同的点吧 。
我会期待这件事的发展 。
我之前跟有一个人交流 ,他说灵巧手是具身智能皇冠上的宝珠 , 大概就这种话吧 。 然后他们那个逻辑挺有意思的 , 大概就是他们研究了这个人类进化的过程 , 语言肯定是人类智能产生或者说进化过程中一个非常重要的节点 。
那还有一个很重要的节点就是人开始直立行走 。 那直立行走重要并不是因为直立行走本身 ,而是因为直立行走解放了人的双手 , 可以让手去干很多东西 , 比如说慢慢的你会造工具 , 会做很多别的事啊 。
我觉得这种想法还挺有意思的 。
没错没错 , 我也有类似的感觉 。 我的感觉是就是目前的这个发展阶段啊 ,在操作这件事上, 如果只是关注于夹爪这些东西 , 当然是可以完成很大一部分 。
有些学者也会说就是可能用两只夹爪就能做到 95% 的事了 ,但是这个一定不是最终的形态 。 那这最终的形态是什么样 , 然后在到这个最终形态中, 我觉得灵巧手可能的确是一个 ,但是这是不是真的是人手这个形态 , 可能是个问号 。
但是至少这个技术的发展是一个 , 尤其是灵巧手这个硬件或者这个技术上, 可能材料啊 , 然后新型的驱动方式啊 , 甚至一些其他的这个结构啊 , 或者就材料包括这种传感这些和这个硬件的结构上的东西 , 可能都是需要有一些革命性的发展才会让我们到最终那个状态吧 。
我的感觉是这样 。
瓶颈与未来52:26
刚才我们聊到瓶颈 , 你第一反应是硬件上的一些东西吗 ?
不能叫瓶颈吧 , 就是我可能更期待有一些这个新型的东西 。
我明白啊 , 就是有比较大的突破空间的 。 你刚刚说到硬件这个东西 , 对吧 ? 然后一般聊到通用机器人或者具身智能 , 大家也会说像算力或者数据 , 尤其是数据啊 , 可能也是比较难搞定的部分 。
你觉得现在这些方面相比于比如说一年或者两年前 , 它的进展是怎样的 ? 算力和数据 。
算力我觉得由于广义的 AI 或者人工智能的发展 , 我觉得并不是一个特别大的瓶颈 。 我会这么理解 , 或者说为了完成一些事 , 我觉得目前算力肯定是够的 , 只是我们能不能弄到那些卡的一个原因 。
就是现在如果卡都可以给我们用了 , 我觉得肯定是够的 。 然后数据这个角度 , 我的理解是其实对机器人来说 , 数据和硬件是强耦合的 。
对 , 如果我要做一些比较精确的操作 , 或者非常非常有意思的操作 , 如果我没有一个非常好的硬件去收集数据 , 那我就是没有这些数据 。
对 , 所以我觉得这两件事是耦合的 。
仿真能在多大程度上增加数据量或者帮助解决这个问题啊 ? 还是说仿真现在其实它能获得的数据 ,有一些什么失真啊 , 或者各种别的问题其实不太好用了 ?
我的感觉是就把仿真器做到足够的精确 ,是可以有一些帮助的 。 但是一样就是最终仿真还是要做迁移到实际的硬件上, 如果这两个东西有比较大的区别 。
比如说尤其是在操作过程中啊 , 这个区别就是你硬件就是物理上不可能得到这些数据的话 , 我觉得还是会有一个比较大的 gap。
我的意思就是比如说触觉这些事 , 我觉得仿真可能目前来说是比较难仿的 ,因为你甚至不知道真到底是什么 ,因为我没有一个硬件去得到真这件事 。
那触觉在数据上该怎么表达呀 ? 就它在计算机里是一串什么东西了 ?
好问题 。 我的感觉是还是跟硬件相关啊 ,但是目前有的一些触觉传感器 ,其实是个矩阵 , 你可以认为是个矩阵 , 就是会把接触的面分成很多很多小格 , 然后每一格上每一个点上是一个比如说力的信号啊 , 或者其他的信号 。
但是这个还是受限于硬件嘛 ,因为现在的硬件是只能采到这些数据 , 所以大家会用这种方式去记录这个触觉的信息 。
对 , 你说到这个我想到一个点 , 就是其实是在人类语言中, 触觉也是被表达的比较少的一个东西 。 就其实很多触觉它是没有专门的词汇去描述某一种触觉或者触感的 。
对 ,但是在人的操作或者人在日常生活中 ,其实触觉是个非常重要的事情 , 就是对完成很多很多稍微精细一点的任务的时候 。
这个挺有意思 。 我想再补充问一下那个算力的事啊 , 就你刚刚说算力其实总量应该是够的嘛 。
我这个理解的是训练的算力啊 , 那如果比如说在机器人的端侧 , 它肯定也是要放进去一个嵌入式的芯片 , 就像手机上有芯片 , 电脑上有芯片 。
像这些领域的芯片 , 现在大家都用的是什么类型的芯片啊 ? 或者说用的是哪个公司的 ? 还是说这个领域其实是非常分散的 , 就没有说哪个公司非常主导的 ?
我觉得分两部分可能 。 从我直观上第一感觉是分两部分 。 第一部分是运动相关的 ,其实我们的经验是并不需要特别特别强大的芯片 , 甚至 CPU 就可以 。
但是我觉得跟操作相关 , 或者甚至跟视觉相关的 , 目前我知道的是大家还是用英伟达的会多一些 , 这些算力可能要求会稍微高一些 。
如果大家想象中都是用神经网络去做这件事的话 ,其实本质上只是对神经网络的一个推断了 。
所以在那个机器人上会放一个英伟达的算力去处理视觉感知这些的任务是吗 ?
据我所知是的 。
那大家一般用英伟达的什么芯片啊 ? 是显卡就可以吗 ? 消费级也可以吗 ? 还是需要更贵的 ? 就它大概现在是个什么样的成本了 ?
据我所知在端侧 ,因为只需要做推断嘛 , 或者推理嘛 , 所以一些应该是叫 Jetson 系列就可以 。
对 ,他们有一个 Jetson 系列 。
对对对 。
所以在这个领域其实英伟达也是比较有优势的是吗 ?
我觉得是 。
比如高通它不做这种东西吗 ?AMD 不做吗 ?
据我所知好像没有太多人用这两家的 。 那还有一点就是因为最近也会有一些大家尝试把大模型和机器人结合嘛 。
如果真的要把这件事做的话 , 我知道的是在大模型这部分还是需要一些比较强一点的算力的 。 因为目前还没有一个真正意义上一个人形机器人可以完成移动加操作加大模型 , 真的就一个事 , 一个 video, 比如说一个视频 , 把这个整个流程都跑通 。
像 Figure 也是站在那站着对吧 , 然后也不是独立的一个人形机器人去把整个事跑通的 。 所以就目前是没有一个这样的东西的 。
然后从大模型的角度 , 我知道的是可能一些消费级的 , 比如说 4090 这些级别的显卡是需要的 。 当然应该还是有更专业的 ,但是那些更专业的可能更贵一些 。
那我觉得英伟达还是挺厉害的 , 相当于他们又在培育一个新兴市场 ,而且也没有什么别的人在这个阶段就跑来跟他竞争 , 或者说竞争者比较少吧 。
对 , 我觉得 GTC 可能黄仁勋可能也是在规划或者在谋划这些事 。
我们今天也聊到机器人是个交叉学科嘛 。 我也观察到一个现象 , 就是现在的很多公司 ,不管中外的公司 ,其实都是一些不同背景的人在一起出发去攻这个山头 。
就像爬西马那亚 ,有的人是从北坡爬 ,有的人是从南坡去爬的 。 那有的团队可能是软件或者算法能力更强 ,有的是它的硬件机械的部分更强 , 然后有的是你刚刚说的 , 比如上半身的一些能力它更强 ,有的可能是移动运动的这些能力更强 。
你觉得最后是什么背景的人有可能变成这个事情的更主导的角色呀 ?
我觉得从机器人这件事来说 , 目前的感觉还是硬件加上一些相对不是那么 AI 的算法的人会比较重要 。
就像我们现在就人形机器人有一些已经开始尝试把大模型 load 到 , 就是大模型跟人形机器人相配合嘛 。
但是这件事其实并不需要我有一个团队去做大模型 ,而我只需要用就可以 。 从我的背景可能就会觉得物理和算法的交界这部分 , 或者软和硬的交界这部分的人是会比较主导的 。
当然这件事就像您说的 , 这个是个非常多学科交叉的 , 我觉得最终这个团队肯定是每一部分都得懂 , 就有懂每一部分的人的 。
也许我们这期的标题可以叫 《 站在软硬之间 》 之类的 。 你刚说的那个不是那么 AI 的算法指的是什么 ?
就是不是做大模型的 ,而是会用就可以 。 就类似吧 , 这是举例啊 。
然后他还要懂比较多的 , 比如说控制啊 , 什么自动化这些东西 , 对吧 ?
我的感觉是这样 , 就是到偏未来或者就相对发展成熟的时候 , 这个团队里需要有不同的人。 但是最核心的可能是软硬结合的这些人去主导整个的这个技术的角度 。
比如说我需要把大模型和这个人形机器人相结合 ,但是比如说用大模型或者用这种逻辑推理这部分 ,其实可能不需要对具体的这个机器人运动这些有特别深的了解 ,但是需要做这种桥梁的这个作用 。
因为机器人毕竟还是个要做出实物并且展示才有说服力的东西 , 它并不是一个虚幻的东西 , 它是一个实际的东西 。
最后一个问题可能比较科幻啊 , 我们可以聊得畅想一点 。 就是你觉得什么科幻作品或者电影里的图景是比较符合你对人形机器人普及之后的想象的 ?
科幻与 AGI59:26
当然也有可能你觉得所有的这种作品都有一些 bug 啊 , 你自己可以描述一下你觉得未来是怎么样的 。
我觉得现在我期望能看到的未来 , 就不考虑电影本身的这些故事上的东西 , 我觉得是我机器人就 I Robot 那个场景 , 或者那个电影一开始的那个场景 ,是我期望能看到 , 或者我觉得未来一段时间我们真的能看到的一个场景吧 。
就是每一家会有一个机器人做服务 , 然后在一些比较公众的这些场合 , 或者这些公共的这个服务的地方 ,也会有很多机器人去跟人一起去生活 , 一起去工作这个状态 。
因为像 I Robot 里面最后那个机器人是叛变嘛 。
对 。
跟你说的这个比较类似的一个作品 , 那是个游戏 , 就是底特律变人。 那里面也是每个家庭有服务的机器人, 然后但机器人后来它自己产生一些意识 , 然后机器人里面有两派 ,有的可能是比较支持人类的 ,有的是比较反对人类的 。
你觉得这种经常被科幻作家或者内容创作者去探讨的这种话题 ,在技术上实际上有可能性吗 ? 还是这只是大家为了追求故事戏剧性所设想的一些看起来不太靠谱的东西 ?
从电影的表达肯定是偏戏剧性啊 。 然后我觉得这个也是目前 AGI 发展的一个问题 , 或者大家在思考的一个问题吧 。
因为我们也会经常关注这个 , 比如说 OpenAI 的这些发展 。 根据我对这些东西的了解 , 至少目前我看到的是没有 。
但是它最终会不会变成 , 我其实也不是那么确定 。 我觉得可能性还是有的 。
就你目前看 , 就是即使人形机器人变得比较普及之后, 也不太可能会有这种情况 , 对吧 ?
我觉得是这样 , 就是刚刚说的这种东西其实本质上是大脑层面的事 。 就是不管底层是不是人形机器人, 如果真的有一个 AGI, 它有自主意识 , 它想做一些事 ,其实它不需要依托人形机器人这个实体去做很多事 。
单纯从人形机器人的角度来说 , 就是我觉得这两个事是独立的两件事了 。 这可能更重要的是 AGI 的发展 。
然后从现在的 AGI 的发展 , 我只能说我可能并不是那么乐观 ,但是也不那么悲观 。 我觉得这个可能是全世界就广义 AI 或者人工智能领域的学者都会很关注的一个点吧 。
因为像 OpenAI 的那个 CEO Sam 和 Ilya 他们就在各种各样的采访 , 或者在各种各样的场合也会被问到类似的问题嘛 。
然后他们偶尔也会放出一些 , 比如说 AGI,GPT-5 可能就逐渐已经成为 AGI 这种 。 但是 AGI 和自主意识之间这些到底有多大区别 , 然后到底还需要多久 , 或者这种技术路径到底是不是真的能 , 我觉得全世界的学者可能都想回答这个问题 。
对 , 所以我暂时没有答案 。 因为我可能对这个东西了解的也不是那么多 。
你觉得我们有生之年会等到这个答案吗 ?
你说 AGI 有自主意识这件事 , 还是它会叛变这件事 ?
有自主意识吧 , 我指的是这个 。 就它有或者没有 。
有一定程度的 , 我觉得是可以的 ,是会有答案的 。 但是是不是它真的就是完全的自主这件事 , 我不知道 。
对 , 我觉得一定程度的这种所谓的自主意识是有可能的 。
好 , 今天非常谢谢陈华来参加 《 晚点聊 》 的节目 , 给我们分享了很多他在机器人这个方向的求学的创业的经历 ,以及他对整个领域的技术观察 , 还有一些趋势的洞察 。
这期节目仍然是 《AI 大爆炸 》 系列中的一期 。 对这个话题感兴趣的听众 , 欢迎给我们留言 ,也可以推荐新的你们想听的公司和技术方向 。
谢谢大家 。
谢谢谢谢 。
拜拜 。
拜拜拜拜
。






