# 86: We, Robot-2，清华叉院/星海图许华哲看“Optimus”的门道

晚点聊 LateTalk · 2024-10-27

<https://latetalk.podhood.com/388fb233-0aa6-46dc-86ae-dd5aed2f4d5f>

许华哲（清华大学交叉信息研究院助理教授、具身智能公司星海图联合创始人）在《晚点聊》中从特斯拉We, Robot发布会的人形机器人Optimus谈起，阐释遥操作为何重要，并拆解通用具身智能当前的算法进展与创业选择。他认为这次丝滑的遥操作既是远程运力转移的实用价值，也为机器人提供高质量训练数据；从遥操到自主仍需海量数据和模型迭代。节目中他梳理了伯克利AI Research的强化学习传统、2019年ETH让机器狗爬山的标志性工作，以及自己用改进的PPO算法（BPPO）让机器狗在软垫上真实环境学习；他还区分了强化学习、模仿学习与多模态大模型的不同作用。关于形态，星海图选择轮式人形而非双足，是为了聚焦操作能力，因为操作才能改变物理世界、产生经济价值；灵巧手难度不亚于做好整个人形机器人，所以公司现阶段“力出一孔”做移动操作的本体、遥操作和智能。他也讨论了世界模型的定义争议（Sora为何不是、具备动作输入的视频预测才是）、触觉这一被忽视的模态，以及通用机器人面对的数据、模型两大瓶颈；他给出5年工厂大量部署、10年进入家庭的预期，并提醒机器人普及可能让人丧失部分决策权利。

## Questions this episode answers

### 为什么说Sora不是世界模型？世界模型到底是什么？

许华哲说，世界模型是根据当前状态和动作预测未来会发生什么的模型；Sora没有动作、不可控，所以不是世界模型，而YX这类把当前帧和动作作为输入的视频预测模型才是。他认为世界模型是通用机器人的组成部分之一，但具体怎么做仍有分歧。

[34:34](https://latetalk.podhood.com/388fb233-0aa6-46dc-86ae-dd5aed2f4d5f?t=2074000)

### 人形机器人的遥操作有哪几种方式？

许华哲介绍三种遥操作方式：一是从视频里检测人动作再映射到机器人；二是戴VR设备用手柄或手部动作控制；三是用与机器人同构的专用设备，像斯坦福Aloha那样逐关节映射。同构设备能保证动作可达，数据采集效率高。

[7:52](https://latetalk.podhood.com/388fb233-0aa6-46dc-86ae-dd5aed2f4d5f?t=472000)

### 怎么快速判断一个人形机器人的水平？

许华哲说有两个简单指标：机器人走路时，周围工作人员越少越好；机器人操作时，工作人员离它越近越好。距离越近说明人们相信它不会发狂伤人或碰倒东西，反之说明技术还不成熟，人只能躲远点。

[6:46](https://latetalk.podhood.com/388fb233-0aa6-46dc-86ae-dd5aed2f4d5f?t=406000)

### 人形机器人从遥操作到自主行动，中间还差什么？

许华哲认为，从遥操作到机器人自主行动差的是数据量和模型：通用机器人需要海量、覆盖各种任务的数据，目前积累远远不够；同时具身智能还没找到像GPT那样能吞下足够多数据、压缩足够多信息的模型，需要数据和模型同步迭代。

[11:48](https://latetalk.podhood.com/388fb233-0aa6-46dc-86ae-dd5aed2f4d5f?t=708000)

## Key moments

- **[0:00] 开场与求学**
  - [2:10] 许华哲本科大三到多伦多大学交换，被初执教鞭的 Sonia Fidler 免去期末考试并拉进AI科研项目，从此走上人工智能研究道路
- **[4:50] 发布会与遥操作**
  - [5:40] 许华哲认为丝滑遥操作有重大意义：既实现远程劳动力转移，也能获得高质量数据，让机器人系统走向进化
  - [6:46] 许华哲提供判断机器人质量的两个trick：行走时周围工作人员越少越好，操作时人类离机器人越近越好
  - [7:51] 许华哲介绍遥操作三种常见方式：视频映射、VR设备、与机器人同构的专用遥操设备；斯坦福Aloha用了第三种
  - [10:01] 许华哲：从遥操作到机器人自主行动，需要海量数据和更好的模型，模型迭代与数据积累同时发生
  - [12:47] 许华哲回忆2017/18年AI顶会上马斯克狂吹明年实现自动驾驶，特斯拉自动驾驶负责人Andrej Karpathy坐在旁边脸都绿了
- **[14:56] 伯克利往事**
  - [14:56] 伯克利AI Research由多个核心教授组成虚体机构，鼓励不同老师和博士自由合作，很适合机器人这种交叉领域
  - [20:28] Q: 斯坦福、伯克利、MIT谁的机器人最强？许华哲：没有绝对强弱，美国顶尖高校靠学术不近亲繁殖实现约5年一轮的人才轮动
- **[21:40] 强化学习**
  - [21:41] 许华哲认为ETH 2019年让机器狗在仿真里爬山的论文是标志性工作，让强化学习真正部署到机器人上
  - [23:37] 许华哲团队把强化学习算法PPO改进为BPPO，让机器狗直接在真实软垫上学会走路，不需回仿真重训
  - [25:20] 许华哲解释算法与架构的区别：PPO是算法，Transformer是架构；强化学习两大范式是值学习（Q学习）和策略学习
  - [28:31] 许华哲：目前还没有真正有巨大效果的具身大模型，谁能做出有效的‘具身大模型’将是下一个重要进展
- **[29:23] 模仿学习与大模型**
  - [29:44] 许华哲：模仿学习是手把手教学，靠大量数据获得能力；强化学习靠稀疏奖励，适合探索难以手把手教的动作
  - [30:47] 许华哲：多模态大模型负责推理和长任务拆分，机器人需要做的只是具体执行动作
  - [32:54] 许华哲：目前具身智能公司普遍自己做强化学习和模仿学习，多模态大模型一般与GPT等外部模型合作
  - [34:11] 许华哲：世界模型是笼统概念，最早看到David Ha 2018年的论文；根据当前状态和动作推断未来都算世界模型
- **[34:12] 世界模型**
  - [35:24] Q: 为什么Sora不是世界模型？许华哲：Sora没有动作输入、不可控；YX视频模型输入当前帧和动作，所以是世界模型
  - [36:52] 许华哲用包饺子项目解释世界模型：输入饺子当前形状和操作，预测操作后形状，本质上就是一个神经网络动力学模型
  - [38:04] 许华哲：通用机器人一定需要世界模型作为组成部分，但目前定义各异，抽象到什么层次也是未知的
- **[39:14] 触觉研究**
  - [39:14] 许华哲：触觉是常被忽略的模态，人最大器官是皮肤；触觉缺失患者很难抓东西，机器人也该有触摸世界的能力
  - [41:00] 许华哲区分触觉与力控传感：力控感知关节/肌肉受力，触觉关注指尖纹理和皮肤接触；触觉有操作、探索、反馈三种用途
- **[42:29] 机器人形态**
  - [42:29] 许华哲解释星海图选轮式人形而非双足：轮式在不上台阶场景几乎覆盖足式能力且更好控制，让公司聚焦操作
  - [45:28] 许华哲：做一台特别好的灵巧手难度可能高于做整台人形机器人，因为20多个小自由度需要微型电机和精细控制
  - [47:53] 许华哲：星海图现阶段力出一孔，把移动操作的本体、遥操作和智能都在轮式人形机器人上做好
- **[48:19] 未来时间表**
  - [48:19] Marvin Minsky 1970年预测3-8年后出现通用智能体；许华哲认为新技术到来时总有人高估，大模型也经历了预期回落
  - [49:26] 许华哲在清华姚班本科课堂做AGI到来时间投票，从2023年开始统计，今年学生预期比去年更悲观了一点点
  - [50:27] 许华哲：星海图准备打持久战，相信5-10年内机器人在相当多场景部署并产生价值，更远才走进千家万户
  - [51:05] 许华哲：这次不会像70年代拖那么久，已有无人超市demo和工厂拧螺丝创造价值；未来5年工厂重复劳动大多将由机器人完成
- **[52:03] 数据与瓶颈**
  - [53:22] 许华哲：机器人最大变数是数据，因为没有铺开所以没有海量数据；当前正确采集方法仍在探索，行业没有按条计费标准
  - [53:47] 许华哲：星海图获取数据靠量产本体卖给高校实验室共享数据、请人采集、自研三条路；企业之间不会共享数据
  - [55:19] 许华哲：第二个变数是是否存在像GPT一样能吃掉海量数据的通用具身智能模型，目前这件事是未知的
- **[55:38] 模型路线**
  - [56:37] 许华哲：行业对机器人逻辑/语言/动作是否同一个模型没有共识；他更相信VLA端到端是最终方案，落地时先用分层方案
  - [57:39] 许华哲介绍星海图空间智能引擎：感知加世界模型构建3D内脑，既做模拟器也做部署时机器人的输入
  - [58:26] 许华哲：实现通用具身智能未必需要新范式，可以沿用大模型范式并把它做小；大模型今天仍是一种低效方式
- **[58:54] 社会影响**
  - [59:07] 许华哲：机器人普及后纯体力任务可被取代，普通人可能没事干、拿到免费钱，但也会失去生活里很多决策权
  - [1:00:01] 许华哲：'大家会发现自己丧失了很多权利，这个权利是不经意之间丧失的'
  - [1:03:29] 许华哲：要对机器人普及做防范而非悲观，因为像美团外卖小哥被困于算法一样，机器人部署必然带来社会结构变化和人的异化

## Speakers

- **许华哲** (guest)

## Topics

AI模型团队动态

## Mentioned

ETH (company), Meta (company), OpenAI (company), 伯克利 (company), 宇树 (company), 斯坦福 (company), 星海图 (company), 特斯拉 (company), 美团 (company), 英伟达 (company), Aloha (product), GPT (product), Optimus (product), Sora (product), YX (product)

## Transcript

### 开场与求学

**Host** [0:08]
大家好 ， 欢迎收听本期的 《 晚点聊 》。 今天的节目还是和特斯拉近期的 We,Robot 发布会有关 ， 上一期我们主要是和侯晓迪聊了这场发布会的自动驾驶的一些情况 。

这次我们也会从这场发布会开始 ，但聊的是发布会的另一个 " 主角 "， 就是人形机器人 。在特斯拉具体这个产品是 Optimus。

那今天我们很高兴邀请到的嘉宾是清华叉院的助理教授 、 机器人领域的研究者许华哲 ， 来和我们分享 。

许老师现在也是清华 Embodied AI Lab，也就是具身智能实验室的负责人， 同时他也在去年参与创立了一家具身机器人的创业公司 ， 叫星海图 。

许老师可以和我们的听友打个招呼 ，也简单地自我介绍一下 。

**许华哲** [0:50]
哈喽 ， 大家好 ， 我叫许华哲 ， 目前在清华叉院做这个助理教授 ， 然后同时也是星海图的联创 。 我的主要的研究和工作方向呢 ， 就是这个人形机器人， 尤其是里面的操作部分 。

**Host** [1:03]
嗯 ， 我们可以先聊一些你自己的经历啊 ，因为我觉得这样后面可能到一些具体的时间阶段 、 发展过程的时候 ， 我可以再展开聊一聊 。

**许华哲** [1:11]
好的好的 。 我是清华电子系的本科 ， 然后是在伯克利读的人工智能的博士 。

**Host** [1:18]
你是哪一级的 ？

**许华哲** [1:19]
我是 2012 级的 ， 就是 2012 年入学 ，2016 年去伯克利读的博士 ， 然后 2021 年毕业 ， 然后在斯坦福 2021 年开始做了一年， 博后 2022 年离开斯坦福这个 Stanford Vision & Learning Lab。

我自己这条路径其实也比较随机啦 ， 最初选择这个清华电子系其实比较理想化的原因是当时觉得以后要去做芯片 。

**Host** [1:45]
啊 ， 对 。

**许华哲** [1:46]
因为这个卡脖子嘛 ， 那个时候就觉得 ， 哎 ， 做芯片很酷 ， 然后很有意思 ， 所以就选择电子系 。

因为电子系其实一部分做 5G 啊 、 通讯 ， 然后一部分做芯片 ， 当然也有机器学习 ，也有视觉 ， 这是我上了大学以后才知道的 。

然后到了大学以后呢 ， 就发现我自己的个人兴趣还是更在这个能动的 、 好玩的这些事情 。 所以我这几段经历中间还有几个小的经历 ，其实对我影响反而更大 。

一个是我大三的时候去多伦多大学做了一个学期的交换 ， 那个学期交换有一位叫做 Sonia Fidler 的老师 ， 正好她也是当时第一年去多伦多大学当助理教授 ， 所以她对我非常上心 ，因为她当时还没有学生 。

我作为一个本科生 ，在她那个课上面是这个作业做得最好的本科生 ， 她就说 ："OK， 那我给你期末考试的 project 什么全免了 ， 你来跟我做科研吧 。"

就这样我接触了这个人工智能方面的科研 ，因为她说你只要跟我做科研 ， 然后这个科研项目就直接拿到这个课上， 然后那个 50% 的分就直接给你满分 。其实如果看到我的那个背景 ，其实我还有一个管理学的辅修 ，其实当时我还没有太想好 。

我不是那种就从小就想当科学家那种 ， 我当时还在想 ， 哎 ， 我要不要以后去创业 ， 要不要以后去搞金融 ， 所以我修了一个这个辅修学位 。

但是当时做了人工智能科研以后， 我发现 ， 哎 ， 这个东西非常符合我的追求 ， 就是做一些很酷 、 能动 、 好玩的事情啊 ， 然后这样子走上了这个人工智能的道路 。

然后到了伯克利 ， 就是跟着我的导师去做一些 ， 就第一个项目其实是自动驾驶 ， 非常巧 。 但是自动驾驶做完之后呢 ， 我自己其实对自动驾驶的兴趣没有那么高 ， 我反而觉得 ， 哎 ， 自动驾驶如果再把它扩展一下， 对 ， 扩展一下， 或者再抽象一下， 它应该是一个能决策的智能体 ，而这个东西可以是游戏里的 ，也可以是机器人。

就这样我就走上了这个做机器人的这样的一个路 。

**Host** [3:32]
你是从斯坦福之后就直接回国 ， 回到清华了是吗 ？

**许华哲** [3:35]
对对对 ， 我从斯坦福 2022 年出站以后就回到清华叉院啊 ，是 7 月份离开斯坦福 ， 然后 9 月份加入清华的 。

**Host** [3:43]
就你当时没有想过去工业界或者直接创业之类的 ？

**许华哲** [3:46]
其实有过的 ， 我是在伯克利博士第五年的时候找的工作 ， 然后斯坦福那个属于是 gap year 的一个博后 。 所以当时我其实主要聊了创业和教职 ，其实我没太想过去工业界工作这个选项 ，因为总觉得还是想要自己搞点好玩的事情 。

所以当时找了几个朋友聊过创业 ， 比如说我有一个清华热能系的本科好朋友 ，他去印度创业了 ， 然后我也跟他聊过 ，他应该想要把中国的这种招聘软件的模式投放到印度去做创业 ， 我跟他当时也聊得蛮深入的 。

然后还有一个 MIT 的师兄 ，也是我的高中的师兄 ，他做了一个人工智能制药的公司 ， 然后也跟我有深入的聊过 。

然后另一个就是找教职嘛 ，但教职的话 ， 我主要找的还是亚洲的这个教职 ，因为我觉得长期来说发展 ， 包括创业也都是找的亚洲的 ，因为我觉得长期发展我是希望离中国近一些 ， 或者就在中国 。

所以大概是这样的一个找工作的历程 。

**Host** [4:41]
嗯 ， 然后后面我们聊到一些相关话题的时候 ， 可以根据这个经历我们再做一些展开啊 。 所以许老师非常年轻 ， 那应该是 93 年左右的 ，93、94 的 ， 对吧 ？

**许华哲** [4:50]
是的 ，93。

### 发布会与遥操作

**Host** [4:50]
嗯 ， 那我们回到这个发布会啊 ， 就是近期这个 We,Robot 的发布会 ，其实开完之后大家自动驾驶行业的人是比较失望的 ，因为觉得车这块它其实基本上没有说什么 ， 就无人出租车 。

但是机器人大家认为会是这个发布会的一个亮点 。 然后您可以讲讲您看这个发布会时有什么感受 ， 作为从业者的话 。

**许华哲** [5:08]
我觉得看这个发布会首先很 Elon Musk， 对吧 ，他整个气氛非常嗨 ， 非常有意思 。 我印象最深的就是第一个机器人蹦迪嘛 ， 一群机器人在那个塔上面 ， 然后在那蹦迪 。

我觉得这个事情首先很有创造力 ， 对吧 ， 就是说 ， 哎 ， 让机器人去做一些很好玩 、 很能带动气氛的事 。

但从一个反面呢 ， 就是感觉到机器人现在最主要的应用还是表演 ， 对吧 ， 就是它并没有给我们带来太多的能力上的突破 。

那说到能力 ， 它展示了一个什么样的能力呢 ？ 就是它可以在那个吧台给大家这个调酒 ， 对吧 ， 递酒杯 。

这件事情是非常丝滑 ， 虽然后续有人说是这个遥操作的 ， 我倒是比较乐观地去看待这件事情吧 。

就是说首先能够那么丝滑的遥操作这件事本身 ， 就是有重大意义的 ，因为遥操作意味着你可以做运力转移 ， 就是说人完全可以在另外一个国家 、 另外一个州 、 另外一个省然后去控制一个远程的机器人帮我做事情 。

这件事情本身是有价值的 ，因为不同地方的劳动力的这个分布不同嘛 。 然后第二个 ， 遥操作意味着数据质量 ， 这样丝滑遥操作相当于我能拿到这样丝滑的数据 ，而数据大家众所周知 ， 现在的人工智能都是数据驱动的 ，有了这样的数据才有可能有智能 。

所以如果大家期待过高 ， 那可能会觉得 ， 哎呀 ， 这个好像没啥意思 。 但如果大家去想这个技术发展一步一步走 ， 这个绝对是非常重要的一步 ， 这个事情要做好了 ， 我才有高质量数据 ， 才能做到大家想象的那个智能那一步 。

然后还有就是 ， 我觉得特斯拉在行走上面确实走得也是相当不错 ，不过还没有达到特别自信的程度 。

因为基本上判断一个机器人好不好 ， 我有两个很简单的小 trick 可以判断 ， 就是一个机器人在那走的时候 ， 周围到底围了几个人类 ， 就工作人员人类 ， 这个数量越少 ， 代表这个机器人质量越高 。

一个机器人在操作的时候 ， 它周围的人类离这个机器人的远近 ， 这个机器人离人他俩的距离越小 ， 说明这个机器人越 work 越好用 。

如果这个机器人和人离得很远 ， 人躲得远远的 ， 说明他还很担心这个机器人会发狂 ， 会打到他或者怎么样 。

所以距离和人数是很好的判断这个机器人质量的两个指标 。

**Host** [7:21]
对 ，他这一次其实就整个发布会的流程 ，他最开始这个机器人量像是走了一点的 ，但是没有特别多走的镜头 。

然后后面就是你说开始跳舞了 ， 跳舞这个一般大家都认为是提前编程好的 。

**许华哲** [7:33]
嗯 ，是的 ， 肯定是编程好的 。

**Host** [7:35]
然后再往后就是互动 ， 就是您说的 ， 我觉得也是大家争议最多的一个点 ， 就是遥操这个点 。 顺着遥操 ， 我也有个比较好奇的问题 ， 就是你们自己星海图啊 ， 就是有一个比较特别的遥操的尝试 ， 就是你们在做一种遥操的硬件 。

您可以讲一下这个它是解决一个什么东西吗 ？

**许华哲** [7:52]
遥操这件事情其实是一个大的概念 ， 这个概念下面你有无数种方式可以控制这个机器人， 对吧 ， 典型的有这个我从视频里面 ， 比如给人录一段视频 ， 然后来检测人的动作 ， 然后把它映射到机器人上， 这是一种 。

那另一种呢 ， 就 VR 设备 ， 我带着这个 Quest 或者是 Vision Pro， 拿着两个小手柄 ， 然后或者是直接检测我的手去做遥操 。

然后第三种就是您刚说的 ， 就是去有一套硬件设备 ， 然后去像穿一个机甲或者抱着一个傀儡一样 ， 对吧 ， 去控制那个机器人。

然后这三种各有各的好处 ， 各有各的坏处吧 。 我说的第一种成本最低 ， 只需要算法 ， 那它成本低的带来什么 ？

精度会相对差 。 为什么 ？ 因为首先看到的人可能是 2D 的 ， 你要转到 3D。 第二 ， 人和机器人的这个构型可能不同 。

然后 VR 的话呢 ， 可能稍微好一点 ，因为毕竟这个动作捕捉 VR 是更准确的 ，但它仍然有问题 。 为什么呢 ？VR 是直接控它的末端 ，也就是说我机械臂可能是 6 轴 ， 可能是 7 轴 ， 对吧 ， 那我的末端怎么动 ？

我还要解算我的胳膊该怎么动才能使得它末端达到 。 那这个过程第一可能会计算一些耗时对吧 ， 第二呢 ， 可能我的手如果拿着 VR 这手柄乱动 ， 动得很远 ， 机器人根本达不到那 ， 那这个机器人就卡住了 ， 就不知道该怎么做 。

那第三种就是这种同构的嘛 ， 同构的 ， 那我拿着这种像一个小机甲一样的东西 ，因为它们两个长得很像 ，也就是说我做这个映射不是把它末端映射到机器人上 ，而是把它每一个关节上面的这个自由度都去映射过来 。

那这样的一个结构呢 ， 就保证了我这边怎么动 ， 那边就会一模一样的怎么动 ，而且一定是可以动到的地方 。

这样的话 ， 我的数据采集效率是要高很多的 。 当然这并不是我们的一个原创 ，在很知名的一个工作 Aloha 对吧 ， 就是来自斯坦福的一个工作 ，他们就已经做了这样的一个事情 。他们做的是什么呢 ？

是双臂的这样的一个工作 。 那我们进一步的把它拓展到一个全身 ， 就相当于一个人形机器人， 可以像环太平洋一样靠着一个机甲啊 ， 然后去做这个控制 。

**Host** [9:47]
走路也可以 ？

**许华哲** [9:47]
因为我们的这个人形机器人是一个轮式人形 ， 所以走路的话还是相对来说比较容易控制的 。

**Host** [9:53]
明白 ， 所以你们目前的这个同构的 ， 它主要还是操作上的一些 。

**许华哲** [9:57]
对 ， 包括腰 ， 腰的转动 ， 然后往下蹲 ， 往上站这样子等等。

**Host** [10:02]
明白 。 然后你刚说的这三种遥操的方式 ， 就第一种的话 ， 我理解就是它可以不用这个人和机器人是实时去控制它的 ， 对吧 ， 就是那个视频可以是提前拍好的 ， 然后你让它去看就行了 。

然后第二种和第三种 ， 它是需要你跟它是要在时间上是保持一致的吗 ？

**许华哲** [10:19]
对 ， 就是遥操这块 ，他们肯定是要尽量实现 。 它有一个小的实验啊 ，但是大致上的时间是一致的 ， 相当于我戴着 VR 眼镜 ， 我眼睛里看到的东西应该是机器人眼前的东西 ， 然后我就以为这个是我自己在的这个世界 ， 然后我去拿着一个手柄 ，有点像一个 VR， 只不过这个 VR 是另一个实体 ，也就是那个机器人。

**Host** [10:41]
嗯 ， 那这个东西它过渡到下一阶段是怎么去过渡啊 ？ 因为往后来说的话 ， 那肯定我们是需要机器人自己能去做各种操作 ，而不是实时有一个人在帮它去动嘛 。

**许华哲** [10:52]
嗯 ，是的 ， 就是遥操作其实更多的是就像我刚说的 ， 一方面是运力的这个转移 ，在人工智能或者具身智能还没有完全发展到位的时候 ， 它肯定是起到了一定的价值 。

第二呢 ， 更重要的是它提供数据 ， 这样的数据是可以放到这个具身智能的模型里面 ， 让模型学到你是怎么动的 ， 然后这个模型呢 ， 就可以去刚刚 ， 哎 ， 你比如遥操作倒了杯水 ， 那下次它学到了这件事以后， 它就不需要你遥操作了 ， 它自己就可以主动的倒一杯水 。

**Host** [11:22]
嗯 ， 所以总结一下 ，有一个是研发上的作用 ， 就是获得数据 ， 帮这个系统去进化 ， 还有一个就是实用上的一个作用 ， 就是比如说我一个孟加拉的人可能能干美国工厂的事 ，是吧 ？

**许华哲** [11:34]
具体哪的人咱就不说了 ，但是就是 A 地方的人可以干 B 地方的事 。

**Host** [11:38]
然后从这个就是现在普遍是遥操的这样一个状态 ， 到它能自主行动 ， 目前中间差的比较多的是什么呀 ？

差什么能过渡到那个阶段 ？

**许华哲** [11:48]
差的就是一个数据量嘛 ， 就是说现在特定任务 ， 然后单一任务都可以采出很多数据 ，其实都可以做了 。

但是我们想要的是通用的机器人嘛 ， 通用机器人那肯定需要海量的数据 ， 各种各样任务上面的数据 。

那很显然机器人作为一个新兴的这个啊 ， 虽然它有很久了 ，但是真正我们觉得它要去靠智能服务人类 ，其实还没有多久 ， 对吧 ， 那它积累这个数据还需要很长时间 。

这是第一 。 第二就是模型本身也还有待探索 ， 比如说我们可以看到大模型的发展 ，也不是一上来大家就发现 ， 哦 ，GPT 是那个正确的方法 ， 或者 Llama 是正确的方法 。

最开始大家也探索了很多 ， 哦 ， 我能不能用小模型 ， 可不可以用 BERT， 可不可以用各种各样的结构 ， 然后最后发现 ， 哦 ， 这种结构它最好 。

为什么好呢 ？ 它可以吃足够多的数据 ， 压缩足够多的信息 。 我觉得具身智能也是需要这样的一个过程 ， 就是数据的积累和模型的迭代同时发生 ， 然后逐渐找到那个具身智能里面的这个 GPT， 就可以达到一个很好的效果了 。

**Host** [12:47]
你觉得在现在这个行业还很早期的一个阶段 ， 然后马斯克他比如说这个发布会 ， 包括他之前的很多表态 ， 会把大家对这个事情的期待拉的比较高 ， 你觉得整体上来说这个对行业是好还是坏 ，是什么影响 ？

**许华哲** [13:01]
我觉得对行业来说是好事吧 ，是好事 。 业内人士可能会有点气 ，但是有点气 ， 生气 ， 生气 。 但是对于整个社会来说 ，是相当于让更多的资源 ， 让更多关注投到这个领域 ， 然后大家会发展得更快 ， 这是它的一种营销 ， 我觉得 。

**Host** [13:18]
生气的点是 ？

**许华哲** [13:19]
生气的点是这个我自己经历过 。 我在 2017 年、18 年的时候 ，在一次人工智能的顶会上面 ，他们非常厉害 ， 请到了 Elon Musk 就去做一个这个演讲 ， 然后当时 Andrej Karpathy， 就李飞飞那个学生 ， 还是在特斯拉当这个自动驾驶的头 ， 然后他们两个坐在那 ， 然后 Elon Musk 就说 ， 啊 ， 明年我们的这个自动驾驶就搞出来了 ， 就已经要上路了 ， 然后就反正一顿狂吹 。

当时我就能看到那个 Andrej Karpathy，他在旁边脸都绿了 ， 就是说 ， 啊哈 ， 什么时候听说的 ， 我怎么不知道 ， 就是这种状态嘛 。

然后过了一年以后 ，他根本没有做出来嘛 ，但他有很多进展 ，他仍然是世界最领先的 ，而且直到今天他也没做出来 ， 对吧 ， 就完全的自动驾驶 ， 或者说他承诺的 Robotaxi。

但是这样子其实他给自动驾驶拉了很多热度 ， 拉了很多吸引力 ， 然后最好的人， 最多的钱 ， 最多的关注 ， 最多的曝光 ， 这些都来了以后， 哎 ， 你发现这个领域真的比原来预期的 ， 比如说你预期 20 年， 现在真的变成 10 年就能解决的事情了 。

但 Elon Musk 就习惯性的会多说一点 ， 先把饼画的足够大 。

**Host** [14:22]
对 ，他最早从 2016 年就开始说 ， 还有一年我们就要实现全部人驾驶 。

**许华哲** [14:27]
这就是我说为什么业内的人可能会有一点气 ，因为真正干这活的人会知道肯定做不出来 ， 所以他会觉得 ， 哎呀 ，他在瞎说什么 。

然后其他的友商或者是这个业内的竞争者 ， 或者是研究者也会觉得 ， 你把期望拉这么高 ， 我们无论做什么大家都不满意 。

学术圈更是大家都说的比较这个有一说一 ， 学术最重要的就是诚实 ， 对吧 ， 学术诚实 ， 学术政治 。

但他这个作为商业的老板嘛 ，他就随便说说 ，但又有那么多人买账 ， 我也没办法 。

### 伯克利往事

**Host** [14:56]
那接下来我们可以把这个时空视野都拉得更大一些 ， 聊一聊整个机器人行业当前发展的一些进展啊 ， 一个就是想结合你自己的求学经历聊一下， 就是你比较确定进入机器人这个方向大概是在什么阶段 ，以及当时是看到了一些什么变化 ， 让你有这样一个选择 。

**许华哲** [15:12]
机器人其实我从博二开始就在做这件事了 ， 就第一个项目是就 2017 年，2016 年是做了一个自动驾驶的项目 。其实那个项目做完了以后， 立刻有很多自动驾驶的创业者联系到我 ， 就问我要不要加入 ， 包括小迪 。

当时我记得我们在伯克利的那个鼓乐飘香吃了顿饭 ， 然后他就说 ， 哎呀 ， 我要这个创业 ， 然后 。

**Host** [15:32]
什么飘香 ？

**许华哲** [15:33]
伯克利的一家川菜馆 。

**Host** [15:35]
比较知名是吗 ？

**许华哲** [15:36]
也不能说知名吧 ，也算是知名的比较难吃的一家川菜馆 ，但是因为离学校比较近 ， 所以大家经常去吃 ， 相当于盒饭吧 。

然后我们在那吃了顿饭 ， 问我和我的师兄要不要一起聊聊啊什么之类的 。 那个时候我才博一嘛 ， 我还是想做一些五年后我毕业的时候更好玩的事情 。

所以在那个项目之后呢 ， 我就去 ， 当时还有一个东西很火 ， 叫 AlphaGo， 或者叫做强化学习 。 所以我当时跟 Trevor，也就我的导师也聊 ， 就说我其实对这个决策这块更感兴趣 ， 就是能动的 ，因为计算机视觉很多时候是生成图 ， 或者检测一个 ， 哎 ， 小猫小狗这样子 ， 它是一个偏静态的这样的一个任务 。

我是觉得 ， 哎 ， 这个能动 ， 就自动驾驶让我觉得能动的东西更好玩 ，但是我想做的 scope 比自动驾驶更大一点 ， 或者更未来一点 ， 所以我就选择做这个强化学习 。

强化学习最开始那个时候还跟机器人很难结合 ， 我们都是在模拟器里面打游戏 ， 比如超级玛丽啊 ， 星际争霸这些我都自己我也都玩过 ， 然后也都让强化学习智能体玩过 。

然后还有就是机器人的仿真 ， 就是那种电脑里的机器人， 然后让它去动 。 直到博四的时候 ， 到博四的时候我觉得 ， 哎 ， 这个强化学习算法也相对成熟了一些 ， 然后开始去往这个真机上面去部署 ， 或者在往真机上面去尝试 。

当时也是正好去现在的 Meta， 当时叫 Facebook， 跟着 Roberto 的一个相当于企业导师吧 ， 然后去做一些机器人控制和触觉相关的事情 。

**Host** [17:01]
Meta 的机器人也是在这个 Fair 这个机构下面吗 ？

**许华哲** [17:05]
对 ，Meta 在 Fair 下面 ， 当时有好几个机器人的小组啊 ，但是现在好像只剩下一个了吧 。 我不太了解近况了 ，但是总之就是这机器人在 Meta 的这个比重还是降低了一些 。

**Host** [17:17]
嗯 ， 我想更多问一下就伯克利当时一个情况 ，因为我看你是在这个叫伯克利 AI Research， 对吧 ？ 那它是有一个比较明确的方向 ， 还是说其实里面是很多 AI 的方向都在里面 ？

比如说您自己的话 ， 当时应该算是视觉方向为主是吗 ？

**许华哲** [17:32]
伯克利 AI Research 是伯克利的几个比较核心的教授们一起成立的一个类似于一个中心这样的一个机构 ， 然后它是一个虚体机构 ， 就它没有一个说我真的在盖一个楼 ， 然后这个叫伯克利 AI Research。其实我们还在原来的计算机器的那个楼里面 ，但是大家会更鼓励一起合作 ， 更鼓励一起讨论 ， 然后也都坐在一起 。其实方向的话还是跟每个课题组方向有关的 ， 就我所在的那个

课题组 ，Trevor 他是主要做视觉以及做一些这个决策啊 。他自己当时没有把这东西叫做强化学习 ，也没有叫做机器人 ，他起的名字叫 Actionable AI， 就是可动的啊 。

**Host** [18:13]
Actionable AI。

**许华哲** [18:14]
对 ， 当然这个名字没有火起来 ，其实各种大佬都在推自己的概念 ， 这几个概念其实做的事情有点像 ， 就 Embodied AI， 具身智能这个词可能名起的比较好 ， 所以最后成了这个领域的定性的一个名字 。

所以当时我自己是 Trevor 的学生 ， 同时也跟 Sergey Levine 还有 Peter Abbeel 经常合作 ， 然后也合作了很多篇论文 ， 这样子的一个情况 。

**Host** [18:37]
嗯 ，OE 之后大家有更多在关注强化学习吗 ？ 伯克利应该算是强化学习的比较早的一个重镇 ， 比如说你们在选这种研究方向的时候是呃 ， 怎么怎么去考虑的 ？

**许华哲** [18:46]
这个其实就是伯克利自己天然带的 ， 第一有几个强化学习很厉害的人， 也有几个视觉很厉害的人， 所以伯克利是一个很适合做这种机器人的 ，因为机器人本来就是强化学习 、 视觉 ， 然后可能语言都需要有一些 。

**Host** [19:02]
它是比较交叉的 ， 比较综合的 。

**许华哲** [19:03]
是的 ，是的 。 然后这里面的几个 ， 比如说像 Peter 和 Sergey 就是最开始做强化学习做的很多 ， 然后 Peter 可能更偏这个硬件一点 ， 然后 Sergey 可能在仿真里面做算法多一点 。

然后像有 Anca 是做这种机器人交互的 ， 这种就很未来了 ， 就机器人现在还刚能倒一个水 ， 它就已经去做交互了 。

然后像 Trevor、Jitendra、Alyosha 是做这个视觉的 ， 然后大家选择方向的时候其实会很大的被这群人影响 ， 就是说我想找一找他们中间共同能找到的最有意思的事情 ， 然后去做 。

举个例子 ，不是我自己的例子 ， 就是有一篇 paper 叫做 Visual Motor Learning，是现在 Stanford 的一个助理教授 Chalcey Finn 的一个工作 ，其实那就是 Trevor、Sergey、Peter 他们三个人一起带着 Chalcey 发的一个论文 。

这个就是你单搞强化学习你做不出来 ， 你单搞视觉也做不出来 ， 就必须要在伯克利这种非常自己向下， 然后就是随便合作 。

你是我的学生 ，但你可以跟任何一个老师去搞一搞 ， 只有在这种氛围下才能做出这种东西 。

**Host** [20:03]
我想问一下你刚提到这些老师 ，他们平均一年有多少博士生啊 ？

**许华哲** [20:07]
一年少的就一个 ， 多的两到三个吧 。

**Host** [20:10]
那师生比是对学生来说还是非常好的一个状态 ， 对吧 ？ 就他没有那么多学生 。

**许华哲** [20:15]
啊 ，是的 ，是的 。 因为美国的博士生要给学校交的钱也比较多的嘛 ， 国内是限制名额嘛 ， 然后国外是没有名额限制 ，但你总要盘算一下你的经费 ， 对吧 ？

所以一般也就是一年两三个这样子 。

**Host** [20:27]
啊 ， 我有个好奇的问题啊 ， 斯坦福 、MIT 和伯克利谁的机器人比较强 ？

**许华哲** [20:32]
我觉得这个没有严格意义上的强弱吧 ，因为伯克利这一波的这个教授们很多都是斯坦福毕业的 ， 比如 Sergey 是斯坦福的 PhD， 然后 Peter 也是斯坦福的 PhD， 然后 Trevor 是从 MIT 跳过来的 ，因为他有一个很好的习惯 ， 叫做学术不近亲繁殖 。

你是伯克利毕业的 ， 你最好别在伯克利找教职 ， 我大概率也不会给你伯克利的这个教职的岗位 ， 所以逼着你去别的学校当老师 。

这样的话你就会发现它有个代际差 ， 就是比如 Peter 的博士导师是谁呢 ？ 吴文达 ， 大家都知道他 Machine Learning 大佬 ， 对吧 ？

像这样子就是说你在 Peter 之前那一代 Machine Learning 当然是 Stanford 做的最好了 ， 或者是做的非常好 ，但是他的学生们呢 ，他带出来那些很牛的学生留不下来 ， 所以他就来了伯克利 ， 或者去了 MIT。

那这五年可能就是伯克利很好 ，但是他们的学生 ， 比如 Sergey 的学生 Chalcey， 比如 Alyosha 和 Trevor 的学生 Deepak，他们分别去了 CMU 和斯坦福 ， 然后， 哎 ， 再过五年他们好像又有一点下滑的趋势 ，因为他们最好的学生又去了其他学校 ， 所以他这个是每五年他就换一下的 。

**Host** [21:34]
就是有一个轮动 ， 然后在不同的 ， 当然是都是比较顶尖的高校之间会有一个流转 ， 对吧 ？

**许华哲** [21:39]
对 ， 对 ，是的 。

### 强化学习

**Host** [21:40]
嗯 ， 那你自己在这个领域看到比较大的进展是在什么时候呀 ？ 我指通用具身机器人。

**许华哲** [21:47]
首先人形机器人一直是一个大家都很感兴趣的领域 ，其实机器人这一波大家最想看到还是算法上面的进展 。

就是说机器人 ASIMO 早就做出来了 ， 对吧 ？

**Host** [21:57]
嗯 ， 本田的那个 ASIMO。

**许华哲** [21:59]
日本的那个 。 然后当时也能跑 ，也能做很多事 ，但是真正这一波大家看到 ， 我自己觉得哈 ，2019 年 ETH 的让机械狗爬山的那篇论文 ，是很大程度上改变了大家对机器人的一个看法 。

就发现 ， 哎 ， 好像强化学习这个东西真的能部署到机器人上， 使得一个机器人做以前的控制论或者机器人控制方法无法做的事情 。

举个例子 ， 就他那个狗可以在各种各样不同的地面上走 ，有冰面 ， 比如草地 ， 比如说凹凸不平等等等等。

这个事情在以前怎么做呢 ？ 我都可以 ， 每一种都可以 ，但我每一种地面要用一种不同的方法去做 。 也就相当于我这个 PhD 可能我整个 PhD 就做机器人过草地这件事 ， 然后下一个 PhD 来做机器人走冰面这件事 ， 然后突然发现有一天这些东西被一个算法解决了 ， 这个东西叫强化学习 ， 然后再做 Sim-to-real， 从仿真到现实的迁移 。

那这个时候大家就发现 ， 哦 ，Learning 真的给机器人带来新的生机 ， 或者学习算法给机器人带来新的生机 。

这时候大家就开始去想 ，OK， 好像我该去真的挑战那个科幻里面的这个机器人了 。 所以那个时候很多人其实比特斯拉更早 ，在学术圈更早就开始做很多事情 ， 比如李飞飞 ， 她下学也是我清华同届的一个好朋友 ， 她博士期间一直在写仿真 ， 写模拟器 。其实李飞飞组里面就一直在就说 Vision 既然已经大成了 ， 我是不是该做下一件事了 ， 那可能就是具

身智能 ， 对吧 ？ 比如说伯克利啊 ， 大家发现这个强化学习已经有一些眉目了 ， 那我是不是就该把它部署到机器人上了 。

这些事情其实是早于更多的人看到 ， 哎 ， 比如特斯拉发布啊这件事了 。

**Host** [23:37]
这样也合理 ，其实这个可能也是特斯拉比较关注到这个领域的原因之一 ， 对吧 ？ 他肯定也是看到了技术上的一些变化 。

我看到你之前自己就是在一席的演讲上演示过一个你做过的算是一个小的项目吧 ， 就是让这个机器狗在软的床垫上学会走路 ， 这个也是一个类似的把强化学习放到机器狗上的这么一个尝试是吗 ？

**许华哲** [23:58]
嗯 ，是的 。 那个项目就跟我刚刚说的这个 ETH 的不同是什么呢 ？ 就是那个事情我们在做这个现实世界强化学习 ， 就 ETH 他们包括那一系列的工作 ， 包括 CMU 啊等等 ， 包括赵行老师做的 ，他们做的一件事叫 Sim-to-real。

我在仿真里面训好这个狗 ， 然后这个狗仿真里面的地面你可以调它摩擦系数啊 ， 调它这个平整度啊等等 ， 各种各样纹理 ， 然后训好了以后发现 ， 哎 ， 它到现实中就很 work， 就可以走 。

但是如果现实中有一个让它不 work 的东西 ， 那它就还是不行 。

**Host** [24:29]
它要再回那个仿真环境去学啊 。

**许华哲** [24:31]
没错 。 然后我们那个工作呢 ，其实相当于是说 ， 哎 ， 你在现实中遇到一个你不 work 的 ， 我能不能用你现实中这个数据让你调整它 ， 就不需要再回仿真里面再训了 ，在现实中就可以适应了 。

**Host** [24:42]
这个其实比较接近于一般人想象中的生物自然学习的那个状态 。

**许华哲** [24:48]
没错 ， 没错 。 这个是我们组一个非常重要的方向 ， 我自己也非常感兴趣 ，但它离落地还比较远 ，因为它有各种各样的问题 ， 比如它需要很多的数据 ， 然后带来一些安全性的问题 。

然后第二就是如果不是一个狗 ，而是我要抓取一个东西 ， 比如它把东西碰到地上了 ， 该怎么复位等等 ， 这样的问题其实都还是蛮难解决的 。

但是我一直觉得它最终总要有一个在现实世界再进一步的强化学习的过程 ， 就像一个小狗学会怎么握手一样 。

**Host** [25:17]
嗯 ， 那你们是用了什么新的技术和方法 ， 使它可以不在仿真环境里 ，而在这个真实的环境里就学到一些这种能力了 ？

**许华哲** [25:25]
就我们改进了一个原来的这个强化学习算法叫 PPO， 然后 PPO 我们改进成了这个 BPPO， 就是 Behavioral， 这个可能就比较技术了 。

这套东西我们又进一步的去做了一些这种集成学习 ， 这个过程使得它学习效率非常高 ， 可以用现实中的这个数据 ， 然后可以去做这个更新 。

**Host** [25:45]
简单来说 ， 不同类型的强化学习就是架构略有不同的一些神经网络是吗 ？

**许华哲** [25:50]
其实不是 。 就强化学习它主要还是算法 ， 然后它里面用的东西是神经网络 ， 然后这些算法其实是一些 ， 就比如说强化学习里面的这个 Q 学习啊 ， 它就是说我要判断这个世界每个位置的值 ， 比如说我在这个地方跟你握握手 ， 你会给我一颗糖 ， 这个我就觉得很好 ， 比如加 5 分 。

然后我在这如果就拍你一下， 然后你就揍我一顿 ， 那我这就减 5 分 。Q 学习就是学这样的一个值 。 还有一种就说 ， 哎 ， 我直接学策略 ， 就我在这我去跟你握握手 ， 然后你给我一颗糖 ， 这过程我不去算分到底是怎么样的 ， 我只是发现 OK， 你给了我一颗糖 ， 所以我就调整我的动作 ， 越来越想跟你握手 ， 越来越想给你一些好的东西 ， 就直

接调整我的控制 。 这就是强化学习最典型的两个范式 ， 一个叫基于值的强化学习 ， 一个叫做基于策略的强化学习 。

然后在这两个算法的框架下， 会有更多的这种细节的算法的改进 ， 所以大概是这样的一个算法的发展过程 。

**Host** [26:50]
就是你们业内在说算法和神经网络的时候 ， 它这个区别是什么 ？

**许华哲** [26:54]
神经网络大家一般叫它 Architecture， 叫它架构 ， 或者叫它结构 。 然后算法一般是我用这个结构来做的那些 ， 比如我的损失函数是什么样 ，是什么 ， 比如说我这个地方是应该用它的平均值 ， 用它高阶 Moment， 还是应该用它的什么方差 ， 这些数学上面的这些东西叫做算法 ， 我们一般定义成算法 。

对 ， 这些算法可能对任意结构都适用 ，但是我可能要找到一个最优的结构 ， 是一层的神经网络还是五层的 ， 还是十层的 ，是 Transformer 还是 ResNet， 这个就是结构 ，他们两个是共同决定了一个方法好不好 。

**Host** [27:30]
嗯 ， 所以就是 Transformer 这个架构 ， 它也可以用强化学习的算法 。

**许华哲** [27:34]
啊 ， 没错 ， 没错 ，是的 。

**Host** [27:36]
那是 OE 其实就是这样一个结合 。

**许华哲** [27:38]
没错 ， 没错 。 对 ，OE 其实就是一个很大的模型 ， 或者叫很好的一个结构 ， 然后它用到了强化学习算法 。

**Host** [27:44]
那现在用在机器人上的这个强化学习 ， 它一般用的是什么架构 ？

**许华哲** [27:49]
用在机器人上看是小模型还是大模型了 。 小模型的话 ，其实大家还是普遍用的就是很简单的 ， 就卷积神经网络 ， 然后或者多层感知机这样子的东西 。

如果是大模型的话 ， 一般还是这个 Transformer 啊 ， 当然最近也有一些工作用这种 Diffusion 加 Transformer 也能训这个强化学习 。

**Host** [28:06]
现阶段小模型在机器人上和大模型在机器人上， 它分别是解决机器人的什么问题啊 ， 或者说就是要做什么事啊 ？

**许华哲** [28:15]
小模型的话 ， 当然它更专注 ， 对吧 ？ 它可能可以做几件事 。 大模型我们期望它更通用 ， 它可以把所有的事情都融到一个模型里面 。

所以目前来说 ， 大多数部署的应用的都是小模型 ，但大模型给了我们一个希望 ， 就像 GPT-4 一样 ， 就是可以给我们带来一个就说 ， 哎 ，是不是有一天这个东西既能洗碗 ， 又能做饭 ， 又能洗衣服 ， 什么东西都能做 ， 都融到一个大模型里面 。

**Host** [28:39]
所以目前实践中是用小模型比较多 ， 比如说你们当时做的这个在床垫上学习怎么走路 。

**许华哲** [28:44]
这些都是小模型的 ，因为大模型到目前为止还没有一个真正能够看到特别大的效果的具身大模型 。

**Host** [28:52]
然后具身大模型是大家都在探索的一个方向 。

**许华哲** [28:55]
是的 。

**Host** [28:55]
也可以理解成为其实下一个阶段 ， 如果谁先能做出来 ， 谁会有比较大的进展或者优势是吗 ？

**许华哲** [29:01]
这个做出来可能要看怎么定义 ， 就是探索有可能你做出来了 ，但是这东西发现没什么用 ， 或者效果只有一些很小的提升 ， 那就是一篇论文嘛 ， 然后也不能说它不好 ，因为你做了足够的探索 。

如果你做出来真的找到了像 GPT 一样那个信号 ， 那确实就很厉害了 ， 就让人觉得 ， 哎 ， 我这个机器人好像突然能力又上了一个台阶 。

### 模仿学习与大模型

**Host** [29:23]
除了我们刚才说这个强化学习之外， 你觉得这些年还有哪些技术上的进展 ， 让我们能实现这个通用机器人的希望是越来越大了 ？

**许华哲** [29:33]
嗯 ， 一个很重要的是模仿学习嘛 。 模仿学习就前面咱们谈遥操作的时候 ， 你问了就是遥操作怎么样变成一个智能机器人嘛 ， 那这个地方的算法其实就叫做模仿学习 。

模仿学习是指让机器人通过数据的手段 ， 然后去模仿这个数据是怎么做的 ， 然后它把它内化成自己的这个网络参数 。

当遇到这个场景的时候 ， 它可以知道该怎么样去做 ， 这是一个模仿学习的这个框架 。 然后第三个 ， 那肯定是大模型 。

大模型本身 ， 或者叫原生多模态大模型 ， 这肯定是非常重要的 ，因为它有这个推理的能力 ， 或者它有这个理解世界的能力 。

那么机器人以前有一个领域叫做 Long Horizon Manipulation， 或者叫 Long Horizon Task，是什么意思呢 ？ 就是我这个事情任务步骤特别多 ， 先开冰箱门 ， 把东西拿出来 ， 再关冰箱门 ， 对吧 ？

切了 ， 再 ， 然后这些步骤现在都可以靠多模态大模型来告诉你 ， 第一步干什么 ， 第二步干什么 。 然后真正机器人需要做的可能只是具体把这个事真的做了 ，因为这部分还做得不好 。

我觉得这些都是非常有趣的进展吧 。

**Host** [30:35]
嗯 ， 你刚说三个强化学习 、 模仿学习 ， 还有大模型 。 但是这个大模型其实不是我们一般理解的 ChatGPT 背后的这个大语言模型 ， 对吧 ？

**许华哲** [30:43]
GPT-4V 那种感觉的 。

**Host** [30:45]
多模态的大模型 。

**许华哲** [30:46]
嗯 。

**Host** [30:47]
如果总结一下， 强化学习 、 模仿学习 ， 还有多模态大模型 ， 它们分别都是侧重于解决机器人的什么问题 ， 区别是什么 ？

**许华哲** [30:56]
就是它是不同的学习方法嘛 。 强化学习就像是我们训练一只狗一样 ， 你不会手把手教它说 ， 哎 ， 这样是握手 ， 然后这样是坐下， 更多的是你一直喊坐 ， 坐 ， 坐 ， 直到它有一天突然坐下了 ， 然后你 ， 哎 ， 开始给它饭吃 。

这个时候它又发现 ， 哦 ， 坐等于真的坐下， 等于吃饭 ， 这个过程就是一个强化学习的过程 。

**Host** [31:16]
嗯 ， 就它是有反馈激励什么的 ， 让你学会这个 。

**许华哲** [31:19]
对 ， 它的反馈一般就是好或者不好 。 然后模仿学习就相当于我真的手把手去教 ， 比如说我要跳舞 ， 然后我这动作不到位 ， 然后真的有一位老师把我的手抬高一点 ， 把我的腿岔开大一点等等 ， 那这个是模仿学习 。

它的监督信号更 Dense， 对吧 ？ 更稠密一点 。 然后像强化学习 ， 它的监督信号更稀疏一点 ，但这两种都是很有价值的 。

为什么呢 ？ 因为模仿学习可以靠大量的数据获得能力 ， 别人手把手教我嘛 ， 我就学得会 。 那强化学习呢 ， 更适合去探索那些很难被手把手教的事情 ， 比如说我们前面提到狗在不同的地面上跑 ， 这件事很少有人会拽着这个狗的腿 ， 然后告诉它你要这样跑 ， 对吧 ？

或者我要打棒球 ， 我要打网球 ， 手上要转笔 ， 这些事情你很难手把手教它怎么去做 ，因为我自己也描述不清楚我转笔到底怎么转的 。

那这些事情可能强化学习更擅长探索 。 然后大模型更多是对整个宏观语义的一个理解和对任务的拆分 。

**Host** [32:18]
哦 ， 你刚说到这个点 ， 我想到一个 ， 就是其实有很多操作的东西 ， 你用这个模仿学习是可以去手把手教它的 ，但比如说像足势的行走 ，因为它是非稳态的 ， 然后你就其实你人也很难一步一步的就奔跑啊 、 走路跳这种东西 ， 这个是比较适合强化学习的是吧 ？

就什么 Locomotion 这种有强化学习 。

**许华哲** [32:35]
呃 ， 对 ，但操作里面其实也有很多非稳态的 ， 比如兰州拉面 、 印度泡饼 ， 都是非稳态的 ， 只不过就是操作因为里面的东西太多了 ， 然后我很容易找出一大票东西就全是稳态的 ， 或者要准静态的 。

**Host** [32:49]
而且也是有用的 ， 可以先教它这些 。

**许华哲** [32:51]
对对对 ，是的 。 但其实还有很多很多东西是非稳态的 。

**Host** [32:54]
我想补充问一下， 就之前你说的三个比较主要的进展 ， 强化学习 、 模仿学习 ， 还有多模态的大模型 ，在目前这个阶段 ， 就是对做具身智能机器人的公司来说 ， 这三个东西是都是要自己做 ， 还是说其实大家做前面两个 ， 就是强化学习和模仿学习比较多 ， 后面其实用一些开源的多模态大模型就可以 ？

**许华哲** [33:14]
相对来说肯定是前两个更重要一些 ， 就是对具身的公司来说 。 然后多模态大模型这个地方 ， 一般来说还是去合作 ， 就是去找到一个合作方 ， 然后一起做可能会更合适一点 。

**Host** [33:26]
那是不是也因为具身的这些公司普遍的融资的资源没有那些做基础大模型的公司多啊 ？ 因为其实你做一个多模态的大模型 ， 应该要算力 、 数据量会非常大 ， 钱也会非常多 。

**许华哲** [33:37]
而且带来的增量没有很大吧 ， 就是自己训一个大模型 。 那我为什么不钓一下月之暗面呢 ？

**Host** [33:44]
所以你们现在用的是谁啊 ？

**许华哲** [33:45]
在研发阶段我们就用 GPT 嘛 ，但未来我们应该会找国产的大模型去合作 。

**Host** [33:50]
你们试过了吗 ？ 比如说国产的 ， 你们有自己测过 ， 你们觉得哪个会对你们的这个工作来说是更好用的吗 ？

**许华哲** [33:56]
对 ， 我们这个其实试的大家都还 OK，因为我们现在任务还相对来说比较简单嘛 ， 就是什么把杯子放到什么盘子上面这种任务 ， 就基本上多模态大模型都可以做 。

未来如果有更复杂的任务 ， 就可能会能看出一些差距 。

**Host** [34:12]
除了你刚才提到的这些三个进展啊 ， 我看您之前的一些演讲和分享 ， 你也提到了比较有意思的几个探索方向 ， 一个是这个世界模型 。

### 世界模型

**Host** [34:22]
之前我们聊 Robotaxi 的时候 ， 我们也聊到了世界模型 ，因为这个在自动驾驶领域现在也是非常热的 。 你会怎么去解释这个世界模型了 ？

包括为什么其实一般大家认为 Sora 这种 ， 它并不是一个世界模型 。

**许华哲** [34:34]
世界模型其实是一个非常笼统的概念了 。 我不知道最早的世界模型在什么时候提出 ，但我第一次看到世界模型这件事 ，是在这个 Google 的一个 Researcher 叫 David Ha，他在他的论文里面 ， 那篇论文名字就叫 World Models。

然后之后可能大家会听这个 Yann LeCun 提 。

**Host** [34:50]
这是哪一年啊 ？ 你说 Google。

**许华哲** [34:52]
我现在可以看一下，18 年， 它的 Archive 是 1803， 所以 18 年是我第一次接触到这个名词吧 。 然后世界模型其实有很多很多的概念或者定义 ， 就比如说我投篮里面的物理定律是世界模型 ， 我知道我的饭放在这 ， 一天之后它可能会馊了 ， 这也是世界模型 。

就是我根据我当前的状态 ， 然后以及我将要做的事情 、 将要做的动作 ， 然后推断出未来会发生什么 ， 这都可以算是一种世界模型 。

所以世界模型有非常非常多种类 ， 即使在人的大脑里面也是一个很复杂的系统 。 那为什么刚刚说 Sora 不是 ？

因为 Sora 里面没有动作 ，Sora 是一个视频预测模型 ， 它的不同在于它不可控 ， 就是说 ， 哎 ， 我当前这帧是这样 ， 然后我预测这个人会往前走 ，但是并没有任何人控制它 ， 那它为什么不往后退呢 ？

它为什么不往左转呢 ？ 但如果你有一个 ， 哎 ， 动作 ， 那它就是一个世界模型了 。 对 ， 比如说最近那个 YX 的这个世界模型 ， 那它就是一个世界模型 ， 它也是一个视频预测 ，但只不过它的输入是当前的帧和这个当前的动作 ， 然后机器人会干什么 ， 比如机器人左转它就看到左边 ， 让机器人抬手就能看到它的手 ， 这样子的一个世界模型 。

我想世界模型是非常非常重要的 ， 我们每时每刻都有一个微小的世界模型在运转 ， 比如说我桌子上现在有一瓶水 ， 然后我的脑子里几乎可以显现出来 ， 如果你在这戳它一下， 它掉下来 ， 它会有一个下降的这个过程 ， 如果反应足够快 ， 我可以用手把它接起来 。

**Host** [36:16]
我们之前和那个也是博客领域以前的教授马毅也聊到过这个 。 嗯 ，他就说其实就你没有学过牛顿的物理定律 ，但是你对这个东西其实是见过的 ， 你只要一推下来 ， 你就知道它大概一个加速度什么 ， 你会去接它 。

**许华哲** [36:28]
嗯 ， 没错 ， 这个叫直觉物理嘛 ， 就大家对这个世界其实不停地在往前去模拟个半秒 、 一秒这样子的一个时间 ， 这是在短时间我要做这个物理上面的控制 ， 如果长时间我也会想战略上面 ， 对吧 ？

我要经营一家公司 ， 如果我做了这些事 ， 这个公司会怎么样 ？ 不做这些事 ， 这个公司会怎么样 ？ 这都是某种意义上的世界模型 。

所以世界模型在我们的这个决策中是非常重要的 。

**Host** [36:53]
你之前也分享过一个研究 ，是让机械臂学会自己揉面团 、 包饺子 ， 这个过程人不停地去给它捣乱 ， 机器人也能完成这个任务 。

当时你说这里面就用到了世界模型 ， 可以结合这个例子更直观地描述一下世界模型吗 ？

**许华哲** [37:08]
我觉得饺子就比较直观地可以让大家明白 ， 哎 ， 这个世界模型就是预测这个面团怎么动嘛 ， 这样大家一下就知道 ， 哦 ，有一个面团在这 ， 我戳它一下， 它变扁了 ， 这个就是我当时学到一个世界模型 。

世界模型并没有什么了不起的 ， 就是预测一个未来 。

**Host** [37:24]
具体在你们当时做的这个饺子的这个项目里面 ， 这个所谓的世界模型 ， 它就真的是一个模型 ， 它就是个 Model， 对吧 ？

所以它具体到技术上， 它就是一个 。

**许华哲** [37:33]
是一个神经网络 。

**Host** [37:34]
是个神经网络 。

**许华哲** [37:34]
嗯 ， 它输入的是当前的饺子的形状 ， 然后当前我对它做什么操作 ， 然后输出是做完这个操作以后， 它猜的饺子会变成什么样 。

**Host** [37:43]
所以我可以理解成它是一个很局限的 ， 就是关于这个橡皮泥或者饺子的状态的一个世界模型 。

**许华哲** [37:50]
对 ， 它不是通用世界模型 ， 可能更窄一点的我们可以叫它动力学模型 。 嗯 ，但动力学模型也是世界模型的一部分或者一种 ， 世界模型可能包含了所有的动力学啊 、 逻辑上面的 、 数学上面的 ， 可能都算是世界模型 。

**Host** [38:04]
就如果我们要实现通用机器人， 这个是一定需要的是吗 ？

**许华哲** [38:07]
我认为它一定是组成部分之一 。

**Host** [38:09]
但实际上现在大家并不知道怎么做这个 ， 可以这么说吗 ？ 或者说比较模糊 。

**许华哲** [38:14]
对 ， 大家对世界模型连定义都是各有各的定义嘛 。 有的人是用视频预测 ， 像我们刚说的 ，有的人可能是要在三维世界去做这个世界模型 ， 就比如说我用的这个点云 ， 然后去学这个世界模型 。

那有的人可能认为这个世界模型应该是在一个影空间去做 ， 就我不应该把这些像素啊什么预测像素没有意义 ， 我要预测的是这个瓶子掉落这件事 ， 或者是这个瓶子在这个位置出现这件事 ， 那我没有必要去花那么大的算力去预测它每个像素 ， 包括这个水倒的时候这里面的水到底怎么流的 ， 这些对我来说都不重要 。

那我的世界模型势必要做一些抽象 ， 那这个抽象到什么层次是比较好的 ， 都是未知的 。

**Host** [38:53]
洛坤是不是就是你说的最后一种这种想法 ？

**许华哲** [38:56]
首先他非常支持世界模型啊 ，他认为强化学习这个不怎么靠谱 ，他觉得世界模型是一切 ，因为强化学习本质上是一种无模型的方法 ， 它相当于我做的事情都是基于反应的 ，但他认为只有有了世界模型才能真正地达到这个通用的自动机器 ，Cosmos Machine 也好 ， 或者叫做 AGI 也好 。

### 触觉研究

**Host** [39:14]
你当时还提到一个比较有意思的点 ，是你们做的一个比较细的东西 ，因为我们刚刚讲的可能是一些大的框架嘛 ， 然后就具体到这个机器人， 如果简单来说 ， 它可能就是你有几个部分 ， 包括感知环境 ， 对吧 ？

然后你大概有一个决策的过程 ， 然后你去做这个行动 ， 然后在感知这一块 ， 你当时有提到是触觉这个点啊 ，因为视觉可能是大家做比较多的 ， 触觉是比较少的 ， 然后你们做了一个触觉传感器 ， 你可以讲讲这个过程吗 ？

为什么关注到这个方向 ， 它为什么是比较重要的 ？

**许华哲** [39:41]
触觉是一个往往被忽略的 ， 或者之前经常被忽略的一个模态 ，但是对人来说触觉是不可或缺的 。 人身上最大的器官就是我们的皮肤 ， 我们无时无刻不感觉到这个世界在跟我们接触 。其实之前的研究者们有去研究过一些病例 ，在这些患者里面呢 ，有一些人是触觉缺失的 ， 你会发现他们抓东西是很难的 ， 很难把一个东西提起来 。

为什么呢 ？ 因为缺少触觉 ， 我不知道我到底有没有抓紧它 ，有没有抓牢它 。 但是他后来又去找了一个非常资深的这个患者 ，他是可以抓牢的 ，因为他说 ， 哦 ， 抓东西很简单 ， 就是首先拿过来 ， 然后首先拇指要放在这 ， 然后另一只手指再放在这 ， 确定这个姿势以后我们把它拿起来 ， 你看 ，不用触觉也可以把它拿起来 ， 就很像机器人， 就我凭纯

视觉 ， 只要我这个控制得足够精细 ， 我仍然可以做这件事 。

**Host** [40:37]
我觉得人类真的太神奇了 ， 这个学习和适应的能力非常强啊 。

**许华哲** [40:41]
是的 ， 人是有非常好的天然优势的 ， 就是我们有无感 ，但机器人目前如果你只有一感 ，但也可以做 ， 那它就难呗 。

那我如果有无感 ， 那它就简单嘛 。 这件事其实是做触觉最主要的一个动机 ， 就让机器人也有摸这个世界的能力 ， 从而可以使得它更高效地去做这个物体的操作 。

**Host** [41:00]
触觉和大家讲的比较多的力控传感器的区别是什么 ？

**许华哲** [41:04]
触觉其实有两种啊 ， 就我拿起一杯水的时候 ， 或者我做一个力量训练的时候 ， 我其实有两种触觉 ， 一种叫做我的胳膊上， 比如我每个关节 、 每个肌肉 ， 我每个手指的这个关节都在感受到一个力 ， 这是一种触觉 ， 这可能更像是刚刚说的这种力传感 。

另一个就是我手指上我可以摸到 ， 哎 ， 它是凹凸不平的 ， 我可以感受到我这个皮在被揪着 ， 对吧 ？

那这可能是我们更关 ， 就是现在我们这些传感器在做的事情 ， 就是摸到东西的这个纹理和指尖的这种接触到皮肤的这个力 ，是我们更关注的一个触觉 。

**Host** [41:37]
我们之前就能看到一些这个机械臂 ， 它可以比如说包生鸡蛋啊 ， 给葡萄皮穿针 ， 这个是靠之前的力控就能做到吗 ？

还是他们实际上也是用了一些触觉传感器才能做到这么精细 ？ 还有手术机器人也是非常精细的 。

**许华哲** [41:51]
这个更多的还是去展示它的这个精确性 ，而不是去做这个触觉 。 触觉它其实最主要有三种用途 ， 第一个叫做操作 ， 就我要去拿一个东西 ， 我要去转笔 ， 我要去剥鸡蛋什么之类 ， 这个地方触觉会有一些作用 。

然后第二个叫探索 ， 就我要去试试看这个东西是冷的热的呀 ， 我放上去疼不疼啊 ， 这个环境安不安全啊等等 ， 这个探索是另外一个作用 。

第三种叫反馈 ， 就别人， 哎 ， 拍拍你 ， 抱抱你 ， 你知道 ， 哎 ， 这个人对我很好 ， 这个人给你一巴掌 ， 你知道这个人对我很差 ， 这个也是触觉 ， 这是触觉最主要三个用处 。

它在机器人上应该是都有用的 ， 尤其在人形机器人上 ，因为人能做这三件事嘛 。

### 机器人形态

**Host** [42:29]
然后刚才我们讲的不同 ， 更多是一些软件和算法上的 ， 就到硬件上的话 ， 现在看大家的实践也是不同的 ， 比如说像你们 ， 还有我们之前采访过的英合通用 ， 就王赫他们那边 ， 你们做的都是仿人形的机器人， 就是这个腿它并不是双腿的形式 ， 然后另外有一些公司可能他们就觉得腿很重要 。

为什么大家现在在这个形态上 、 构型上会有不一样的选择 ，以及之后可能会怎么发展 ？

**许华哲** [42:54]
我觉得这个是场景和任务的选择吧 ， 就是说有没有腿 ， 当然就是它有利有弊嘛 ， 比如说足势 ， 我们先说它好处嘛 ，因为这是别人做的事情 。

嗯 ， 足势的好处是什么呢 ？ 它像一个人一样 ， 基本人能去的地方 ， 理论上足势都可以去 ， 对吧 ？ 它可以上山 ， 可以走楼梯等等。

但是足势的问题是什么呢 ？ 第一 ， 本身把这么多公司能够真的稳定地走 、 稳定地跑的公司本来就不多 ，在一个全尺寸人形上面的 ， 当然矮矮的那种还是很容易做到 。

**Host** [43:27]
其实特斯拉也做不到 。 我们之前写的一个文章 ， 就是我们也聊了一些特斯拉的人或者接触过的人 ，其实 Optimus 现在也是走 500 米就要摔的这个状态 。

**许华哲** [43:35]
嗯 ，是啊 ，是啊 ， 所以本身这个技术上有巨大的挑战 ， 然后其次它带来的那个收益的场景比现在展示的这些还要更难 ， 对吧 ？

我真的要去越过一座山 ， 真正爬山的时候 ， 那可不是要看那个山的角度 、 复杂度 ， 我觉得很难做到的 。

第二就是它有一部分场景可以被四足取代 ， 就是我为什么一定要人形足势呢 ？ 我四足就狗 ， 对吧 ？

可不可以做一部分事情 ， 这个也是一个问号 。 我想一定有一部分任务可以靠狗就可以完成了 ， 比如我要巡检 ， 我要巡逻 ， 那我没必要去人形啊 ， 我狗上面放一个什么摄像头就可以了嘛 。

那为什么我们选择轮式呢 ？ 轮式第一它好控制 ， 第二它这个在不去上下台阶的这个场景里面 ， 它几乎所有足势的概念里能做的事 ， 轮式都能做 ， 且没有任何难度 ， 这样可以让我们最快地聚焦于我们最想解决的事情 ，也就是操作这件事 。

为什么 ？ 因为只有有了操作能力 ， 它才能对这个物理世界产生影响 ， 产生改变 。 你能对物理世界产生影响和改变 ， 才有可能服务人类或者提供无论你叫它运力也好啊 ， 劳动力也好啊 ， 或者是产生经济价值也好 。

光是走路 ， 你只能巡逻 ， 你只能看一看 。

**Host** [44:51]
嗯 ， 你们觉得操作是更重要的一个价值 ， 对吧 ？

**许华哲** [44:53]
那当然 ，因为如果我不需要操作的话 ， 我有很多种方式可以四处看一看 ， 我有无人机 ， 然后我有四足机器人， 我甚至可以搞一个这种大家看动物世界应该都看过 ， 搞一个什么大象的粪便做成一个小机器人在那趴着都可以在那观察一天 。

**Host** [45:09]
嗯 ， 甚至你摄像头不得够密的话 ， 你靠摄像头转也能到处看 。

**许华哲** [45:13]
对 ， 我们真正想做的是什么 ？ 我们真正想做的是 ， 哦 ， 我看到这有坏人了 ， 我去驱赶它 ， 发现这个地方灯没关 ， 我去给它按一把给它关了 ， 那这地方真正做不到的是什么 ？

是操作 。 所以我们希望最快地去做那个最核心的事情 。

**Host** [45:28]
为什么你们现在没有做灵巧手啊 ？ 灵巧手对操作有多重要 ？

**许华哲** [45:32]
其实灵巧手这件事要划分两头 ， 就是说我在清华的实验室里面 ， 灵巧手其实做的是非常多的 ， 我们在灵巧手算法上面有非常多的积累 ，在硬件上面也做了自己的灵巧手本体和灵巧手遥操作的硬件 。

然后星海图这边呢 ， 为什么还没有开始做 ？ 因为我们作为一个公司嘛 ， 还是希望力出一孔 ， 就是把一件事情先做到最好 ， 做到足够漂亮 ， 然后我们会逐渐扩展我们的这个版图 ，而不会是我一上来就做所有的东西 。

因为这里面有一个我不知道算不算信息差 ， 就是做一台特别好的灵巧手的难度 ， 可能是高于做一个人形机器人的难度的 。

**Host** [46:10]
嗯 ， 你可以展开说一下 。

**许华哲** [46:12]
因为灵巧手上面的自由度也非常高 ， 它可能有 21 个手指自由度 ， 加上 6 个这种手腕自由度 ， 那这样的一个自由度 ， 整个这个人形机器人全身可能也就是二十几个自由度 ， 很多机器人。

这个自由度代表什么 ？ 自由度代表第一 ， 每一个自由度就说明这个地方可动可控 ， 对吧 ？ 可动可控需要什么 ？ 需要电机 ， 需要有驱动它的东西 。

同样的手上可能要 20 个电机 ， 身上可能要 20 个电机 ， 那当然都很难 。 手上身上各自难点是什么呢 ？

身上可能需要这个东西性能比较好 ， 它载重比较大 ， 这个比较重要 。 那手上需要什么 ？ 需要它非常小 。

嗯 ，因为有很多灵巧手 ， 包括我之前用过的 Leap Hand、Elego Hand， 包括各个家的这个手 ，有很多特别大 。 特别大的问题是啥 ？

我用不了剪刀 ， 当然剪刀只是个例子哈 ， 手塞不进那个窟窿眼里 ， 我的手指比人粗四五倍 。

**Host** [47:03]
就是它和人类的环境是不适配的 。

**许华哲** [47:05]
没错 ，但是也有一些公司说 ，OK， 我的手跟人手基本上一样 ，但它只有 6 个自由度 ， 它完全没有人手的这个能力 。

我想让它给我弹个钢琴曲 ，6 个自由度就这 5 个嘛 ， 然后它拇指还可以这样 。

**Host** [47:17]
那有点像猫爪的感觉 。

**许华哲** [47:19]
对 ， 它其实就是一个拇指夹爪 ， 你可以这样理解它 。 那其实在电机层面就很难 ，因为你要做小的电机其实是非常非常困难的一件事 ，是需要硬件上面 、 研发上面很努力去做的 。

然后第二个 ， 高自由度意味着难控制 ， 就比如说我要转笔 ， 如果我要转笔 ， 我每个手指都在动 ，但我也不知道到底怎么动的 ， 反正我就转成了 。

那这样子的事情 ， 控制难度可能不亚于你让一个机器人翻个跟头 。 那在这种情况下， 一个创业公司是不适合同时做两个这么有挑战的事情的 。

所以我们当然只能一件事一件事地去做嘛 。

**Host** [47:54]
所以你们现阶段力出一孔 ， 集中精力做的那件事总结一下是 ？

**许华哲** [47:58]
移动操作这件事 ， 它的本体 ， 它的遥操作 ， 它的智能 ， 都在我们的这个移动人形机器人上面先把它做好 。

**Host** [48:07]
明白 ， 那其实要做的工作已经很不少了 。

**许华哲** [48:09]
是的 ， 对于一个创业公司肯定已经很多了 。 如果我是 Google， 那我可以搞三个小组 ， 然后每个小组做一个部分 ，但是毕竟我们不是 Google。

**Host** [48:19]
嗯 ， 就你之前举过一个人们高估技术发展的例子 ， 那个还挺有意思 ， 就是你说这个 Marvin Minskey 曾经说 3-8 年后通用智能体就会出现 ， 这是他 1970 年的时候说的话 。

### 未来时间表

**Host** [48:29]
你觉得为什么现在可能不会再重演这种过度乐观的情形了 ？

**许华哲** [48:34]
我觉得是这样的 ， 就是当一个新技术到来的时候 ， 会有一群人高估它 ， 无论是大佬还是普通人。

因为 Marvin Minskey 那个时代 ，他确实是当时的技术大爆炸 ，他发现 ， 哎 ， 好像这个计算机能给我解到数学题了 ， 这个计算机能给我解到这个逻辑推理题了 ，他肯定是觉得 ， 那这个东西再往后外延一下， 它能解数学题 ， 那它不就是能做很多人类能做的事 ， 那 AGI 不就快来了吗 ？

但后来发现 ， 哦 ， 它过了 10 年仍然还是只能解那几道数学题 。 同样的 ，在 2022 年 GPT 刚到来的时候 ， 会有一群人跳出来说 ， 啊 ， 这不就是 AGI 吗 ？AGI 在 2025 年的时候它就会来了 。

但在今天我们首先承认大模型是非常了不起 ， 非常强 ，但应该现在没有人再认为它是 AGI 了 ，因为我们肉眼可见的 ， 它有很多自己的问题 ，有很多待解决的 、 待提升的能力 。

我在我自己的课上面 ，其实每年都会做一个小的调查 ， 就或者一个小的投票 ， 就问你觉得未来是 2 年、5 年、10 年、20 年还是 50 年， 或者更远 ，AGI 会到来 。

**Host** [49:38]
你从哪一年开始统计的 ？

**许华哲** [49:40]
啊 ， 我其实也刚回来两年 。

**Host** [49:41]
23 年开始是吗 ？

**许华哲** [49:42]
啊 ， 对对对 ，是 23 年开始 。

**Host** [49:44]
啊 ， 所以大家的答案是 ？

**许华哲** [49:45]
目前还看不出来规律 ，但是能明显感觉到今年大家的预期比去年低了 ， 就去年更乐观 ， 然后今年还是比较乐观 ，但是整体是往悲观走了一点点 。

**Host** [49:57]
你这个班上是研究生还是本科生 ？

**许华哲** [49:59]
就摇班的本科生 。 然后这个其实一定程度上可以感受到 ， 就是那个技术刚到来的时候 ， 所有人都特别乐观啊 ， 觉得哦 ， 要来了 。

然后等这个技术成熟成熟以后， 大家就会趋向一个平稳 ， 趋向一个走低一点点 。 如果长时间没有新的东西 ， 就会越来越低 ， 像一个指数衰减一样 ， 直到下一个东西爆发嘛 。

**Host** [50:17]
但是你们在这个时间点开始创业 ，其实创业还是投入很大的一个决策嘛 。 所以我觉得你肯定是相信它 ， 比如说至少未来 5-10 年吧 ， 肯定会是有很大的进展 。

**许华哲** [50:27]
没错 ， 就是经典的那句叫做大家总是低估这个 10 年的科技变化 ， 高估了一两年的科技进展 。

我觉得也是一样的 ， 就是我们做这个创业绝对不是说我们今年创业然后明年要上市 ， 或者是明年这个东西就千家万户去部署下去 ， 那是不可能的 。

所以我们是做好了打持久战的准备的 ， 我们要随着这个时代一起迭代 ， 然后我们相信在一个比较长的时间范围 ，5-10 年范围内 ， 它会有相当多的这个部署 ，在相当多的场景里面可以产生价值 。

然后可能在更远的时间线上面 ， 我们是可以真正走进千家万户 ， 成为我们未来想象的那样的机器人的时代 。

**Host** [51:05]
就是它不可能像 70 年代那样 delay 那么久了是吗 ？

**许华哲** [51:09]
嗯 ， 我认为不会 ，因为现在已经肉眼可见的 ， 它可以做一些事情了 。 大家看到那些无人超市的 demo 了 ， 包括在工厂里面 ， 它已经开始可以做一些拧螺丝啊什么之类的这些事情 。

那这些事情已经告诉我们 ， 它再糟也已经能带来价值了 ， 只不过这个东西我们希望让它做到足够大嘛 。

**Host** [51:28]
嗯 ， 你们设想中 5-10 年之后， 机器人是一个什么样的普及的状态 ，以及它和我们的生活是怎么结合的 ？

**许华哲** [51:34]
我觉得 5 年的时候应该就会有 demo 的机器人在家里面可以做一些事情了 ，但是应该还没有真正意义上的就说大家会去像买 iPhone 一样买它 。

然后我觉得 5 年的时候应该在很多的工厂里面 ， 现在现有的比如说还需要人力去做的这个场景里面 ， 应该已经被绝大多数变成机器人了 ，因为那些都是一些重复 ， 没什么这个附加值的事情可以让机器人去做 ， 然后人类可以去寻找一些更有意义或者自己更想做的事去做嘛 。

### 数据与瓶颈

**Host** [52:03]
那在我们这个现在到那个未来之间 ， 你觉得它可能的变数或者说挑战是什么样 ？ 如果哪些瓶颈突破不了的话 ， 可能就会拖慢这个速度 。

**许华哲** [52:12]
我觉得第一个变数就是数据这件事嘛 ，因为机器人其实跟大模型什么的最主要的一个区别是它没有数据 ， 就它的数据是很少的 。

大模型我可以用互联网上的所有数据 ，因为我每天在网上发表的东西 ， 做的对话都变成了它的训练数据 ，但机器人因为它没有铺开 ， 所以它没有那样海量的数据 。

**Host** [52:32]
你们当年做博士研究的时候 ， 包括你们现在 ， 你们的数据都主要是从什么地方获得的 ？

**许华哲** [52:38]
当年的话肯定还是自己采一点点 ， 然后以及一些数据集 。

**Host** [52:43]
这个自己采都是要付钱雇人来做的是吗 ？

**许华哲** [52:45]
雇 ， 就自己嘛 。

**Host** [52:46]
自己带着设备自己做 ， 同学什么的 。

**许华哲** [52:48]
对 ， 就自己采 ， 就是自己论文的几个作者 ， 然后轮流采集 。

**Host** [52:52]
那在公司的话 ， 那就可能就是你需要一些经费去做这个事情了 ， 对吧 ？

**许华哲** [52:56]
对 ，在公司的话我们会请一些同学花钱 ， 然后雇他们来采集这样子 。

**Host** [53:02]
你们现在能透露比如说采一个有效的数据 ， 就说行业里吧 ， 大概是一个什么成本水平吗 ？

**许华哲** [53:07]
这个其实还没有一个明确的定价吧 ， 我们现在也没有说到按条计费的这样的一个程度 ，因为现在正确的采集方法甚至都还在探索之中嘛 。

**Host** [53:17]
就可能每家的方法很不一样 ， 就成本的波动也会比较大 ， 对吧 ？

**许华哲** [53:21]
是的 。

**Host** [53:22]
你说这有可能是个挑战 ， 就没有那么多数据 。 那你们解决的方式是 ， 比如我看有的公司在探索仿真 ， 然后有的可能是我现在就开始量产 ， 量产多少台 ， 然后我去收集真实的数据 。

你们大概会怎么去获得更多数据啊 ？

**许华哲** [53:35]
我们其实都在做 ， 我们三条路 。 第一 ， 量产 ， 我们其实从一开始就定好了要自研本体 ， 然后要量产本体 ， 然后这个本体我们现在已经对外卖了很多本体了 。

当然现在这个阶段可能更多是高校 、 实验室这种研究机构 ， 我们会跟他们形成一种合作 ， 就一部分用户也是我们的这个合作方嘛 ，他们那边的数据会跟我们一起共享 ， 这是一种 。

**Host** [53:59]
会共享数据吗 ？

**许华哲** [54:01]
啊 ， 会啊 ，因为他们都是科研的用户 ，他们其实不在乎数据共享 ， 大家会希望一起能把这个事情做起来是最好的 ， 只有企业之间才不会共享数据 。

**Host** [54:11]
比如说你如果卖给一个美国的高校 ， 对吧 ， 那美国的高校的数据也能回传给中国公司吗 ？

**许华哲** [54:17]
这个是可以的呀 ， 就是只要不侵犯美国那边的法律就好了 。

**Host** [54:22]
OK。

**许华哲** [54:22]
或者是它可以做成一个开源数据集的形式 ， 开源给全世界 ， 然后我们也拿到 ， 这也可以的 。 我们有一部分用户是愿意跟我们去做这个合作的 。

**Host** [54:31]
因为据我所知的话 ， 像宇树它其实在这个科研市场 ， 它算是市占率应该很高的嘛 ，但它应该卖的都是就卖一个硬件啊 。

**许华哲** [54:40]
是的 ，但是因为宇树是用强化学习的嘛 ， 就是那些 local motion 很多都是强化学习嘛 ， 然后强化学习对数据的要求没有那么高 ， 就是强化学习它更多的是有一个好的仿真 ， 然后在里面去做训练嘛 。其实宇树应该也从学术界开源的这些算法里面吸收了非常多东西 ， 作为它自己公司的宝贵的知识库吧 。

我觉得宇树有很好一点 ， 就是它的狗很便宜 ， 就是虽然它卖给科研用户的时候 ， 还是会比卖给消费者要贵一些嘛 ，但是相对来说还是比美国的或者欧洲的一些狗啊什么的要便宜一些 。

**Host** [55:13]
你刚说第一个比较大的变数 ， 或者说可能的瓶颈是数据啊 ， 还有些什么别的挑战 ？

**许华哲** [55:19]
然后第二个就是我有没有这个好的模型嘛 ， 可以支持这样的数据的 ， 就假设我有了这些数据 ， 那我的模型到底有没有 ， 存不存在一个模型可以像 GPT 一样 ， 真的把这些数据都吃下去 ， 然后成为一个非常强的通用的这个具身智能模型 ， 这件事其实也是未知的 。

**Host** [55:38]
你认为在具身智能这个领域里 ， 它之后机器人的比如说逻辑思维 、 它的语言交互能力 、 它的动作都是一个模型 ， 还是它会是不同的模型啊 ？

### 模型路线

**许华哲** [55:48]
这件事情其实有很多种看法 ， 就是之前 。

**Host** [55:53]
就行业里没有共识是吗 ？

**许华哲** [55:54]
对 ， 我觉得行业里是没有共识 。 之前 Dieter Fox 就是英伟达的一个科学家 ，也是在 Udebt 的一个教授 ，他自己说 ， 哎 ， 我这个有很多种可能性 ， 就大模型在上， 然后给出下面该怎么做 ， 然后底下是一个具身模型 ， 然后去做执行 。

另一种叫做大模型在上面 ， 然后去吐出来一个中间产物 ， 这中间产物可能已经把这个世界分得七七八八了 ， 标上号啊等等 ， 就给一些更细致的信息 ， 然后底下具身模型去做这个动作 。

然后第三种就是现在大家常说的 VLA 这种端到端模型 ， 像 RT2 这种 ， 就它可能是语言和图像一起输入 ， 然后它直接出动 。

**Host** [56:33]
对 ，V 就是视觉语言 ，language， 然后 action， 对吧 ？

**许华哲** [56:36]
是的 。

**Host** [56:37]
你比较 prefer 哪一种 ？

**许华哲** [56:39]
我自己还是比较相信 VLA 是最终的一个解决方案 ， 就全端到端 ，但我觉得就是落地的时候未必 ， 就是有很多事情可能在 VLA 还没有真正意义上可以落地的时候 ， 我完全可以先用大模型和一个具身模型去做一些事情 ，但是最终来说 ， 我觉得可能一个模型应该是可以做所有事情 。

**Host** [57:01]
因为星海图现在的具身智能 ， 就软件这部分你们是分了两部分嘛 ， 一个就是具身的模型 ， 一个是你叫智能空间引擎 。

**许华哲** [57:09]
空间智能 。

**Host** [57:09]
哦 ， 空间智能引擎 。 那这两个东西的话 ， 前面那个就是你说的可能一个大模型加具身模型的结合 ？

**许华哲** [57:16]
我们其实也在探索这种纯端到端的 ， 就因为大模型跟这个具身模型结合这件事 ，其实我们现在已经有一个还不错的一个框架了 ， 这件事情也在推进 ， 然后同时我们内部也在做一个很大的端到端的具身模型这样一件事情 ， 应该会看到比较好的效果 。

**Host** [57:35]
那你们的这个空间智能引擎就类似于世界模型是吗 ？

**许华哲** [57:39]
对 ， 空间智能其实是感知加世界模型的一个结合吧 ， 就是当我们眼睛看到这个世界的时候 ， 我们某种意义上其实是读到了这个世界的 3D 信息 ，而不是 2D 的 。

就比如我知道这些东西离我的远近 ， 对吧 ， 我眼前的东西离我远近 ， 然后当我知道这些三维信息的时候 ， 再加上我们刚刚聊到的世界模型 ， 它可能整体构建了这样的一个空间智能的体系 ， 然后这样的一个体系 ， 第一可以创建成一个模拟器 ， 变成机器人的内脑在里面去做 ， 然后另一个就是在部署的时候 ， 它可以作为机器人的输入 ， 去帮助机器人做更好的

决策 。

**Host** [58:14]
你觉得如果要实现通用具身智能机器人， 我们一定得在大模型之外找到一个新的 ， 就比如说我不用学那么大的数据 ， 就能学到有用的东西的这种新的范式吗 ？

因为这也是有一派人的观点 。

**许华哲** [58:28]
我觉得这未必吧 ， 另一种可能性是我们就用大模型的范式 ， 然后再跟大模型一起把这个模型搞小 。

因为我觉得大模型即使在今天 ， 就大模型也仍然是一种非常低效的方式 ， 它应该是有一种比大模型更高效的结构存在的 ，但是这并不耽误我们先简单粗暴的把好用的东西用起来 ， 然后再想一想怎么样把它变得更好更优 。

### 社会影响

**Host** [58:54]
然后我最后想问的就是说 ， 如果我们真的到了你们设想的这个 5 年、10 年后的未来 ， 就是机器人可能进入了工厂 ，也进入了我们的生活 ， 那普通人的生活会有什么变化 ，以及我们可以提前做一些什么准备 ？

**许华哲** [59:07]
我觉得普通人生活其实会有非常大的变化 ， 就比如说我真的机器人铺开了以后， 大家会发现现在纯体力的这些任务可能都可以被机器人取代 ， 会出现这个可能大家发现自己没事干了 ， 可能会相对来说过得有点没有意义感 。

因为现在我无论做什么 ， 我都会觉得 ， 哎 ， 我起码完成了一件事情 ， 然后我的这个是比较有意义的 。

那未来可能大家会发现 ， 哎 ， 好像不再需要我完成任何事情了 ， 我就免费的可以拿到很多的 。 因为毕竟机器人如果部署了 ， 这个社会资源还是会变得更多嘛 ， 就像我们之前讨论的 ， 大家会得到一些免费的钱 。

**Host** [59:46]
对 ， 我们昨天在讨论之前 Sam Altman 搞的 UBI， 就是免费发钱的这个活动 。

**许华哲** [59:51]
嗯 ，是的 。 那如果大家都有这个免费发钱 ， 大家就会发现 ， 哎呦 ， 那我不如就躺一躺啊 ， 用这个钱去吃吃喝喝 ， 然后等到下一波免费发钱我接着过下去 。

然后我觉得更主要的一点是 ， 大家会发现自己丧失了很多权利 ， 这个权利是不经意之间丧失的 ， 就你会发现机器人在帮我们做很多事情 ，以至于我们已经没有资格去决策生活中很多的东西了 。

比如说我想要点一份外卖 ， 然后机器人就说 ， 哎 ， 今天是这个健康 day， 你必须要吃健康餐 ， 它决定这样对你来说更好 ， 它觉得这样对你来说更健康 。

那我今天就想吃炸鸡 ， 那可能不知不觉你已经失去了在健康日吃炸鸡的权利 。 这样的事情 ， 如果这些东西进入到我们的这个银行系统 ， 进入到公司的管理系统 ， 你会发现 ， 哎 ， 我的老板好像也变成了一个机器人， 或者说我的对接的人也成了一个机器人， 那我可能很多事情本来我可以偷偷的做一些什么操作 ， 对吧 ， 现在都要按照机器人定的这个最

正确的事情去做 ， 那我其实是丧失了原有我的优势 。

**Host** [1:00:55]
其实有些事情不需要这个通用机器人出现 ， 已经在发生了 。 比如说像金融的信用评价体系里面 ， 现在本来就有很多算法 。

**许华哲** [1:01:03]
嗯 ，是的 ，是的 。 信用评价体系它是一个 metric， 这个 metric 它毕竟是一个客观被动的 ， 所以我只要搞清楚了它 ， 然后我去绕开它 ， 我就还能活得还 OK。

但是机器人现在逐渐有了一些主观性 ， 或者是叫做 ， 哎 ， 我主动做一些判断 ， 比如你问它什么是好的什么坏 ， 它也能告诉你 ， 对吧 ， 那这个时候我们是不是要限制它一下 ？

**Host** [1:01:26]
你看了最近尤尔 · 赫拉利出的那个新书 《 智人之上 》 吗 ？

**许华哲** [1:01:30]
啊 ， 没有 。

**Host** [1:01:30]
它在里面讨论了很多问题 ， 跟你刚刚说的是很相关的 。

**许华哲** [1:01:34]
哦 ，OK，OK。

**Host** [1:01:35]
就是大概它里面设想了很多场景 ， 比如说以后可能每个人的行为你都可以给它去算一个分 ， 比如说我今天在外面 ， 我让老人坐位 ， 我可能给你加一个分 ， 然后但你表现得很糟糕 ， 比如说你大学时期的一场聚会上， 你怎么扰民什么的 ， 给你减个分 。

然后如果你设想一个未来监控非常发达的体系 ， 这种数据都可以被收集和分析 ， 来判断你这个人对社会的影响 ， 甚至潜在的这个犯罪的倾向等等等等 ， 你一个很久以前的本来应该在小范围里的行为 ， 可能就会影响你之后找工作干嘛干嘛的很多事 。

它就设想一个这种比较极端的场景吧 。

**许华哲** [1:02:12]
没错 ， 就这个我想到两个作品 ， 一个叫做 《 黑镜 》，《 黑镜 》 里面我记得 。

**Host** [1:02:17]
对 ，有一集就是这个 。

**许华哲** [1:02:18]
对 ， 就是说大家每个人都有一个分 ， 为了分这个人类都疯狂了 ， 然后大家活得都变样了 ， 对吧 ， 为了那个分而活着 。

然后另一个叫做更宏观一点 ， 叫 《 基地 》，《 基地 》 那个里面最后发现统治人类的那个家伙其实是机器人， 对吧 ，但是在那个里面有阿西莫夫三定律 ， 机器人不能害人， 对吧 ， 然后它里面还有个第零定律 ， 叫机器人一定要服务人类整体 。

最后机器人得出的结论是 ， 人类是个太糟糕的生物了 ， 我必须要成为他们的统治者才能避免它自我毁灭 。

**Host** [1:02:49]
这个也是那本书里讨论到的一个问题 ， 就是在哲学上大家也讨论这个问题 ， 就是一致性 ， 你的目标和你的手段之间 ， 你怎样给它保持一致性 。

大家关于机器人的很多担心就在于 ， 你给机器人设定一个目标了 ， 对吧 ，但它可能会以一种你想象不到的方式 ， 让你付出你想象不到的代价 ，在形式上看起来实现了那个目标 。

**许华哲** [1:03:12]
嗯 ， 没错 。

**Host** [1:03:13]
但其实这不是人想要的啊 。

**许华哲** [1:03:14]
嗯 ， 这也可能是 OpenAI 现在除了 Sam Altman 以外， 大家都走了的原因 ，因为那群人要对齐嘛 ， 对齐就是那个一致性 。

**Host** [1:03:23]
所以你设想的这个未来是比较悲观的啊 ， 还是说你觉得我们应该多想提前想想这种事情 ， 去防范这些东西 ？

**许华哲** [1:03:29]
我觉得是要防范的 ， 我不认为这是一种很悲观的 ，而是一种必然发生的事情 。 就像前阵子有那个被困在算法里的这个外卖小哥 ， 这样的一个文章 ，有美团当然很方便啊 ， 每个人都享受到了这个 ， 所以任何一件看起来很好的事情 ， 都会带来社会的这个结构变化 ， 然后就会带来这样子的对人的异化也好啊 ， 或者是对人的这个算法的对它的改变也

好 。 所以连一个美团都可以做到这样的事情 ， 那如果机器人大规模的部署 ， 一定是比这个算法带来的影响大得多得多 ， 所以我们还是要小心嘛 。

**Host** [1:04:06]
嗯 ， 今天非常感谢许老师来做和我们的晚点聊 ， 和我们分享了看 We, Robot 发布会的一些感受 ，以及我们后面花了更多的时间来充分的聊目前人形机器人， 或者叫通用具身智能机器人这个领域的一些进展 ， 哪些技术变化导致了我们现在可能有更大的希望实现这个想法 ，以及机器人真的普及之后， 我们的社会可能发生什么变化 ， 我们提前可以做些什么

准备 。 那今天节目就到这里 ， 各位再见 ， 拜拜 。

**许华哲** [1:04:33]
好 ， 拜拜 。

**Host** [1:04:35]
本期节目就到这里 ， 欢迎收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 ， 欢迎在评论区分享想法 ， 这也会成为我们节目的一部分 ， 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 ， 欢迎推荐更多你想听的主题和嘉宾 。

你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk，也欢迎关注我们的公众号晚点 LatePost。 下期再见

。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
