# 96: 和楼天城聊 Robotaxi：学习人类优秀司机，让我绝望

晚点聊 LateTalk · 2024-12-25

<https://latetalk.podhood.com/07814764-3a2a-445f-b38f-075415f35a55>

楼天城在小马智行这次访谈中系统阐述了Robotaxi过去5年的技术变革：L4必须从“Learning by Watching”（模仿学习）转向“Learning by Practicing”（实践学习），以世界模型作为车端模型的训练环境。他提出多个反直觉判断：模仿学习最多只能“像人”，但人类对AI司机的双标要求使像人永远达不到L4；越是优秀的人类司机，越依赖超越传感器数据的经验与直觉，模仿其行为反而是“反向优化”；世界上不存在MPI（接管里程）为1000公里的L2产品，因为那要求人一个月接管一次且始终保持专注，违背人性。小马5年前因此彻底放弃模仿学习，转向生成式数据和闭环训练，从零追赶，前两年“没有任何进展”，承受了巨大压力；他强调决定自动驾驶能力上限的不是车载模型，而是世界模型这一“工厂”的精度。世界模型包括数据生成器、驾驶行为评估体系、高真实性仿真和数据挖掘引擎，其中交互模拟和细粒度指标是核心竞争力。楼天城还明确L2+与L4是两件事：L2以低成本辅助人为目标，用模仿学习没有问题，但无法跨越安全与人性的门槛，做得越好，距离L4反而越远。商业化上，他预计1-2年内可实现成本更优的千台级无人车队运营并转正毛利，净利则要到5万台；而特斯拉如果继续坚持Learning by Watching，转向实践学习仍需时间。

## Questions this episode answers

### 什么是Learning by Watching和Learning by Practicing？小马智行为什么选择后者？

Learning by Watching是模仿人类驾驶数据，Learning by Practicing是在虚拟环境（世界模型）中自我训练、演进。楼天城认为模仿学习学不到驾驶员怎么想、又是开环训练，无法达到L4，所以小马智行转向了Learning by Practicing。

[11:13](https://latetalk.podhood.com/07814764-3a2a-445f-b38f-075415f35a55?t=673000)

### 小马智行的“世界模型”是什么？包含哪几部分？

楼天城说世界模型是训练车端模型的“工厂”，包含四类东西：数据生成器、驾驶行为评估体系、高真实性仿真和数据挖掘工具。它的精度决定了车端模型的上限。

[42:20](https://latetalk.podhood.com/07814764-3a2a-445f-b38f-075415f35a55?t=2540000)

### 为什么楼天城认为模仿学习（Learning by Watching）永远无法做到L4？

楼天城认为模仿学习最多只能做到“像人”，但人对AI司机是双标的，不接受机器的多样性；它也学不到驾驶员“怎么想”，没有闭环训练，学优秀司机甚至可能反向优化，因此无法满足L4要求。

[13:46](https://latetalk.podhood.com/07814764-3a2a-445f-b38f-075415f35a55?t=826000)

### 为什么楼天城说世界上不存在MPI等于1000的L2产品？

楼天城解释，MPI等于1000意味着大概就是一个月才需要接管一次，这种低频下驾驶员无法保持注意力，所以是反人性的，不可能作为L2产品存在。因此MPI无法从几百跨到十万，中间卡在1000。

[14:27](https://latetalk.podhood.com/07814764-3a2a-445f-b38f-075415f35a55?t=867000)

## Key moments

- **[0:00] 开场**
- **[2:53] 行业冰点**
  - [2:53] 楼天城：2019年后L4公司最重要的技术进展外界无法感知，从无人化demo到无人化运营走过5年，这是市场预冷的根本原因
  - [5:12] 楼天城：从无人化demo到运营5年间技术指标有千倍提升——从几百公里接管一次到十万公里级别接管一次，但视频展示不出来
  - [6:18] 楼天城：MPI这类冰冷数字外界甚至内部都不一定有认识，APP能打到无人车才成为可感知的感性产品
  - [8:23] Q: 特斯拉FSD和Robotaxi计划对L4市场回温有影响吗？楼天城：目前更多是对马斯克个人的认可，要等特斯拉真正能做对
- **[10:53] 模仿学习**
  - [11:13] 楼天城：小马5年前从Learning by Watching彻底转向Learning by Practicing——一个靠模仿人类数据，一个靠虚拟环境中自我训练演进
  - [12:17] 楼天城：模仿学习学不到驾驶员怎么想，因为收集的数据里根本没有“怎么想”，超高位到低位学习只会overfit到浅层特征
  - [13:56] 楼天城：“世界上不存在一个MPI等于1000的L2产品”，因为一个月接管一次的产品反人性，驾驶员无法保持attention
  - [16:16] 楼天城：人对人类驾驶员和AI驾驶员是双标的——接受人的多样、不接受机器的多样，所以AI“像人”也不满足要求
  - [18:35] 楼天城：模仿学习不是闭环训练，人司机靠眼睛耳朵和经验开车，越优秀的司机越依赖传感器外的信息，学他们反而会反向优化
  - [19:07] 楼天城：越是优秀的人类司机，AI模仿其驾驶越差——优秀判断依赖超越传感器的经验，开环模仿是反向优化
- **[21:30] 实践学习**
  - [21:52] 楼天城：学游泳看多少遍视频都不如下水；Practicing的闭环训练是绝望后发现的出路，各家公司差不多同时意识到方向
  - [22:53] 楼天城用AlphaGo类比：先学人类棋谱再强化，甚至不如从零开始强化；小时候学的33定式已被AlphaZero颠覆
  - [24:10] 楼天城：从Learning by Watching转向Practicing后追了接近两年没有任何进展，对内对外都拿不出结果，压力巨大；很多公司撑不住这两年
  - [26:37] 楼天城：转型时抛弃了真实数据多样性优势，转向生成式数据；生成能力本身成为关键，生成式数据是世界模型的任务之一
  - [28:32] 楼天城：世界模型的另一关键是指标体系——定义“什么叫开得好”需要大量主观判断和标注来学习
  - [29:57] Q: 为什么叫世界模型而不叫基础模型？楼天城：Waymo叫Foundation Model，世界模型是车端模型的训练环境，不是一个模型
- **[34:29] L2与L4**
  - [34:40] 楼天城：L2和L4的目标不同——L2为使用者提供便利，L4是减少或取代人力；安全指标上L2约50-300公里接管一次，L4要10万级以上
  - [35:45] 楼天城：L2公司用Learning by Watching没有问题，见效快且符合规模效应；L4选Practicing是因为模仿学习不work
  - [37:06] 楼天城：“L2做得越好距离L4越远”——即使完美模仿人类优秀驾驶，也会因双标和非闭环永远跨不过L4的坎
  - [38:38] 楼天城用短跑/长跑比喻L2与L4：普通人强身健体可同时提高，但专业运动员不可能兼顾；过了分界点才明白这是两件事
  - [39:40] 楼天城：L2和L4前期基础架构可共享，但人类驾驶数据无法共享；L2提示接管的场景正是L4的主要任务，二者没有overlap
  - [41:48] 楼天城：小马同时做L2和L4，因为都做过以后才能理解两个方向的分界点
- **[42:06] 世界模型**
  - [43:03] 楼天城拆解小马世界模型四部分：数据生成器、驾驶行为评估体系、高真实性仿真、数据挖掘/训练引擎
  - [44:23] 楼天城：驾驶评估要区分安全与安全感；指标要做细到per scenario/per context，否则会被测试噪声淹没，这是核心竞争力
  - [46:15] 楼天城：世界模型中交互行为模拟最难也最关键；高峰期表现不好，一定是交互模拟没做好
  - [48:18] 行业观点：端到端后Top Coder不再重要 vs 楼天城：Learning by Practicing仍需要全面工程师，难点是具体问题分析实践，本质是给自己做强化学习
  - [49:58] 楼天城：换用半固态激光雷达AT28后雨天信号质量下降，需要用生成数据补偿，已花两年弥补但还要继续
  - [52:40] 楼天城预测：世界模型的终极状态是zero at fault——车不再因自身错误发生事故，别人撞你躲不开，这按十年计
- **[53:27] 商业化与规模**
  - [54:21] 楼天城预测：千台Robotaxi可做到毛利转正，净利要到5万台规模；毛利转正后是否快速追净利是策略权衡
- **[55:42] 路线之争**
  - [55:49] Q: 特斯拉来做Robotaxi会怎么做？楼天城：Learning by Watching不会work，现在转向Practicing也还要走很长时间，先看它有没有DMV license
  - [57:09] 楼天城：Robotaxi普及不会取代L2私家车——L4性价比低，两者是不同产品形态，更长期是自驾与司机共享的平衡
  - [59:10] 孟歆暴论：能做出L5的应是做L2的公司 vs 楼天城：L5不一定会收敛；从L2到L4的1000怎么越过还不知道，还要摒弃Learning by Watching
  - [1:01:22] 楼天城：L2系统做到一次无保护左转大家觉得好厉害，L4有一次做不到就会被喷；两者的评价理念差距太大
  - [1:02:14] 楼天城：我看自己的车有时不理解AI司机的行为，但不敢轻易断定它错了——就像看AlphaGo下棋，它可能有更高智慧
- **[1:02:36] 运营与竞争**
  - [1:03:10] 楼天城：L4的挑战是极端场景而不是日常习惯；全世界“发疯”的驾驶行为模式一样，中美都一样
  - [1:05:09] 楼天城：远程值守只给建议不接管，1:30的人车比没有障碍；人过多盯着反而会因误操作增加危险性
  - [1:07:04] 楼天城：新玩家进入Robotaxi影响不大，关键是先把市场做大；所有玩家加起来能占出行市场1%已经很不错
- **[1:07:41] 创业感悟**
  - [1:08:30] 楼天城：做自动驾驶的初心是信念——AI能超越人；Robotaxi不会靠低价打市场，而应靠更安全、更一致的体验
  - [1:10:18] 楼天城：“大部分不能坚持不是因为太苦，而是因为受到了诱惑”；过去8年没有能和自动驾驶相提并论的诱惑，大模型也不算
  - [1:11:11] 楼天城：MiniMax做的是L4应用——大模型应用将来会经历所有自动驾驶经历过的事，ChatGPT辅助工具价值不好justify，会像L2一样同质化竞争
  - [1:12:25] 楼天城：高管团队稳定的关键是共同信任和信念的长期积累，不是短期能打造的
  - [1:15:25] 楼天城谈低谷期带团队：外界5年看不到L4进展，内部要设可感知里程碑，如安全员从主驾挪到副驾，成本没降但让团队感到前进
- **[1:16:56] 模拟世界**
  - [1:17:13] 楼天城：“我不怀疑、我坚信这个世界是模拟的”；量子纠缠和光速有限很难不用模拟解释
  - [1:20:10] 楼天城：不是因为西班牙掌握最好战术而拿世界杯，而是因为拿了冠军大家才认为这套战术最好；过程好坏由结果定义
  - [1:22:44] 楼天城：超越人类司机后发现安全的关键是帮助其他车辆减少事故——及时打灯、提前预兆、做decisive行为
  - [1:23:41] 楼天城：创业要在商业化节奏和商业化意义之间平衡；过早商业化和一定要做最有价值的商业化都是极端
  - [1:25:28] 楼天城：小马接下来最大风险是scaling——能否稳步把车辆数量增到预期；做不好会让公司发展受限但不是失败
  - [1:26:03] 楼天城：Waymo最近56亿美元融资夸张到以为多看了个0；评价Robotaxi公司要看合理成本结构下的运营规模
- **[1:27:18] 尾声**

## Speakers

- **曼祺** (host)
- **楼天城** (guest)

## Topics

模型自进化

## Mentioned

MiniMax (company), Uber (company), Waymo (company), 小马智行 (company), 滴滴 (company), 特斯拉 (company), 百度 (company), 高德 (company), AlphaGo (product), AlphaZero (product), ChatGPT (product)

## Transcript

### 开场

**曼祺** [0:08]
大家好 ， 欢迎收听本期的 《 晚点 Leute》。 今天的主播是曼琪 。 本期节目我们访谈了小马智行的联合创始人兼 CTO 楼天城 。2022 年年中， 我们在 Robotaxi，也就是 L4 级别的无人出租车的市场低点 ， 报道过小马智行 。

那时文章的标题是 " 市场不相信自动驾驶了 ，但他们还信 "。 转眼到今年， 整个 Robotaxi 领域的市场水温明显回暖 。4 月 ， 百度萝卜快跑在武汉出圈 ，而在大洋彼岸的旧金山到今年 8 月时，Waymo 无人车队的日均总单量也超过了当地的出租车 。

当然这个还并没有算网约车的情况 。 甚至是在特斯拉和 Waymo 长久的路线竞争中， 强弱对比也在发生微妙的变化 。

一件有意思的事是 ， 今年 10 月 ， 马斯克开了 Robotaxi 的发布会 ， 这之后 Uber 的股价大涨 10%。 而一个月后， 当市场传出 Waymo 可能会进入迈阿密 ，Uber 的股价则跳水了 10%。

这个时刻 ， 我们再次访谈了刚刚完成 IPO 的楼天城 。他完整描述了小马过去 5 年的 L4 的技术变革 。

如果用一句话来总结 ， 就是从 Learning by Watching 到 Learning by Practicing。 围绕这个技术路线的转变 ， 楼天城解释了很多他看起来和别人不一样的技术洞察 ， 甚至是一些反直觉的判断 。

比如他提到 ，Learning by Watching 最多只能 " 像人 "，但像人永远做不到 L4。 而且越是优秀的人类司机 ， 自动驾驶系统学起来越是一个反向优化 ，有可能越学越差 。

从运营的角度 ，他也提到 MPI，也就是接管里程为 1000 公里的 L2 产品其实不存在 ，因为它反人性 。 我们还聊到了在一个经历过高开低走 、 又从低谷逐渐反弹的行业里创业 8 年， 是一种怎样的体验 。其实这种过山车一样的走势 ，是很多技术方向尚不完全收敛就开始出现创业热潮的前沿科技领域的共性 ， 比如今天的大模型 。

下面我们就正式进入本期节目吧 。

今天很高兴邀请小马智行的 CTO 楼天城来录制我们的播客 。 首先先恭喜小马的 IPO。

**楼天城** [2:20]
谢谢谢谢 。

**曼祺** [2:20]
对 ， 然后从上市这个事情 ， 我觉得也可以看到其实整个 L4 级别的无人出租车的市场水温在变化 。

因为你们这次 IPO 也是超目了 ， 你们融了比预计更多的钱 ，其实市场是相对热情的 。 那上一次我们做比较长的采访是在 2022 年， 我觉得那个时候是市场信心在最低谷的一个状态 。

所以那篇文章后来我们的标题也是叫 《 市场不相信自动驾驶了 ，但他们还信 》。 对 ，他们指的是你们 。

所以你可以讲一下这个变化是怎么发生的吗 ？ 从市场不信 ， 到现在好像大家又开始比较期待 Robotaxi 的一些变化 。

### 行业冰点

**楼天城** [2:53]
我觉得这其实也是我非常想分享的一件事 。 我也仔细思考了这件事情 ，其实从 2020 年到 2023 年这 4 年时间吧 ，L4 领域其实我觉得遭遇的就是说市场不信 ， 你刚刚教的 ， 对吧 ？

其实也是预冷的一种状态 。 我一直在思考这最核心原因是什么 。其实就是说从 2019 年时间点之后呢 ， 就是 L4 公司 ， 比如就是 Pony， 我们最重要的技术进展没有办法被外界感知了 。

什么意思呢 ？ 我就先举个最简单的例子 ， 就是说像 Pony 有过一个我们车辆驾驶的一个宣传视频 ， 对吧 ？

宣传我们车在各种场景之下开启 。其实那个视频就是 19 年拍摄的 。 意思就是说从拍视频角度啊 ， 我 2020 年到 2023 年， 哪怕到 24 年， 这 5 年其实我拍不出一个比 19 年更好的视频 。

因为确实没有了 ，因为 19 年视频已经挺好的了 。 然后呢 ，其实还有外部感受 ， 就是显然就在今年上半年吧 ， 就董哲棣有过一个北京晚高峰的一个 racing 大家的一个报告 ， 对吧 ？

那个报告说起来其实就是说我们所有的不同的车辆在北京晚高峰自动驾驶一个小时 。 但如果从这个角度出发呢 ，其实啊 ， 我们 19 年的车以一定的高的概率也能做到 。其实 19 年是我们基本可以做到一个 ， 当然没有这么做啊 ，其实做一个无人化 demo 的状态 。

就从无人化 demo 到一个无人化运营的状态 ， 这两个之间 ，其实 L4 公司要走过 5 年的时间 。 但这 5 年之间确实外界啊没办法真正感受到它的进展 。

所以当对一个行业 ， 对吧 ， 对一个领域 ，5 年没法感受进展的时候 ， 它预冷这是非常正常的 。 所以这也可能也是行业的特点 。

就它随着真正 ， 对吧 ， 就是说包括百度 ， 包括我们 ， 包括 Waymo， 对吧 ，在一定规模的无人车辆运营之后， 才能被重新感受到 。

我觉得这个其实应该是它最根本的原因 。

**曼祺** [4:31]
嗯 ， 所以去年到今年又开始变热 ，其实核心的关键就是有了一定规模的无人化的运营 。

**楼天城** [4:38]
对 ， 就大家终于走出了一个比无人化 demo 再上一个台阶的东西 ， 那就是应该说常态化的规模化的无人化运营 。

它的表现形式就是说你到那个地方就能自己拿 APP 打到车 ， 那么这是它最值得表现的形式 。 那么这是一个可外界感知的东西 ， 所以又重新得到了关注 。

**曼祺** [4:55]
嗯 ，其实今年 Robotaxi 在中国六七月份的时候特别火 ，也就是你刚刚说的这个事情 ，在武汉被很多人看见了 。

**楼天城** [5:02]
对对对 ，是 。

**曼祺** [5:04]
那为什么从 demo 到运营 ， 就是你说其实可能在技术上它不能那么直观的被感受到变化 ，但这事却要走 5 年了 。

**楼天城** [5:12]
不不不 ， 首先就是非常大的变化 。 技术其实应该有至少千倍以上的一个指标提升 。 你 1000 倍是非常大的指标啊 ， 那千倍就至少百倍到千倍这样提升 。

技术这个非常大的指标 ， 所以它是需要走 5 年时间 。 百倍千倍 ， 我们指的什么意思呢 ？ 指的是比如说我们车辆 ， 比如说从这个几百公里 ， 可能就需要一次接管 ， 或者需要一次就是说可能危险性的接管 ， 到可能要到 10 万级别 。

那么这个千倍 ，但是几百其实这个数并不少啊 。 就是一般我相信对自动驾驶很关注的很有热情的人， 也不会说是做几百公里的车 ， 对吧 ？

所以其实这个也是 by nature 它外部就不容易感受出来 ， 对吧 ？ 我们拍个视频可能拍一个小时也就几十公里 ， 那么在几百面前和几百和几十万面前 ， 再拍一个几十公里的视频来说是没有本质区别的 。

**曼祺** [5:59]
因为我记得最早就 16 年、17 年、18 年的时候 ， 大家还会经常去看一看 DMV 的数据 ， 就是加州车辆管理局 ，因为那个会儿基本上所有的主流的公司都会在加州去测嘛 。

它其实主要的一个指标就是你刚刚说的这个接管数据 。 为什么后面这个接管数据它确实在变好 ，但是好像市场也不买账了 。

**楼天城** [6:18]
因为一个指标是个冰冷冷的数字 ， 直接的直观的体验才是人的感受 。 我觉得这个我非常理解 ， 应该是就是说这种感性的认知 ， 我觉得才是给大家最强的感受 。

而这种数字其实理性 ， 如果你刚关注我刚才说的之前 5 年， 我每年的数字也在不断增长 。 就你别说外部 ， 就连内部 ， 我都需要不断的就是让公司意识到这个指标增长 ， 最终会展现它真正的意义 。

而单纯一个冰冷的指标 ， 别说外部 ， 内部也不一定有很好的认识 。

**曼祺** [6:45]
所以最近发生的变化就是从一个冰冷的数字变成了 。

**楼天城** [6:50]
感性的方式的 ， 一个感性的方式 ， 可能 APP 打车能打到一辆无人的车了 。 哇 ， 这个感受其实这它是一个产品了 。

**曼祺** [6:56]
好 ， 那我们就可以讲讲这 5 年这个变化都是怎么发生的 。 一方面肯定是有你刚才说的技术上的百倍的进展 ， 然后另一方面就是在运营和商业化和规模化上肯定会有些变化 ， 对吧 ？

**楼天城** [7:09]
啊 ， 这个话题非常大 ， 我可能要不我还主动说技术方面 ，因为我感觉这可能是我更有可能那个能 crush 更深的地方 。

**曼祺** [7:16]
OK。

**楼天城** [7:16]
但首先我觉得就度过这 5 年， 其实是我觉得本身就是 L4 中最大的挑战 。 这 5 年其实就是我觉得刚好跟我之前可能在一些分享中想的话题就是 ， 就世界模型的逻辑 。其实我们世界模型的的之旅也是从 5 年前开始的 。

**曼祺** [7:32]
那就是差不多 19 年到 20 年开始 。

**楼天城** [7:34]
啊 ， 对 ， 差不多也就那时候开始的 。

**曼祺** [7:36]
嗯 ， 对 ， 我们之后可以展开 ，因为我们上一次其实也有聊到过 ， 我觉得是世界模型的雏形 ， 就是 22 年的那次采访 。

**楼天城** [7:44]
啊 ， 对 ， 那时候其实应该说已经终于进入正轨的一个状态了 。

**曼祺** [7:47]
嗯 。

**楼天城** [7:48]
但是现在应该说已经有信心它通过它达到很高的段 。 但其实你刚刚说的这 5 年其实本质吧 ， 我觉得技术最大其实应该说是重构了整个技术的这个整个的做法 ， 然后呢 ， 使得突破了之前可能 19 年突破不了的一些这个门槛 ， 然后达到了现在比如说能够做到规模化的无人化的运营的这样一个技术的能力 。

**曼祺** [8:08]
我这里补充问一个啊 ，因为你刚才说这个无人化的运营 ， 比如说 Waymo， 包括你们自己 ， 包括百度的这个无人化的运营是关键 。

那像特斯拉 FSD 在今年初的这个超预期的表现 ， 包括特斯拉自己也说要做 Robotaxi， 这个对市场水温的回升是有影响吗 ？

**楼天城** [8:23]
首先我觉得对这个市场的价值 ， 我觉得有更深的理解 。 因为其实就这个市场 ， 对吧 ， 就是最终的这个我们也叫这个整个市场的这一个 Temp，其实大家我相信是有很好的一个 justification 认知吧 。

这点我觉得还是 ，但是我觉得我们也期待吧 ，Tesla 也能有更多的就非对外就感性感受到的一些东西啊 。

但现在我觉得更多还是停留在我可能我们对伊隆个人的 predictive 的一个认可 。

**曼祺** [8:49]
你说的这个感性的认知是指 Robotaxi 上它特斯拉让外界 。

**楼天城** [8:53]
对 ， 什么时候我能做作对啊 ， 什么时候能做你做对 。

**曼祺** [8:55]
我明白 ，因为你说那个 L2+ 的话 ， 就是辅助驾驶放在量产车上的 ，其实很多人他是有很多感受的嘛 ，因为特斯拉的车主毕竟是非常多的 。

**楼天城** [9:05]
啊 ， 这个就是我觉得在市场上可能有不同的认知 。 我的认知我觉得就这么多年我们也做了各种东西 ， 这次认知 L2 还有 L4 之间的这个关系 ， 我之前好像我记得在有些展会表达过他们俩之间的关系 。

这个如果其实我们也可以深入探讨 ，但我觉得至少在我这边呢 ， 可能并没有什么相关性 。

**曼祺** [9:25]
就是我发现我们之前聊有一次的一点是 ，其实你之前对这个无人化运营的判断 ， 就可能大概是百辆车这种级别吧 。

你觉得这件事可能是在 2024 年发生 ，但实际上它是更早发生的 。

**楼天城** [9:38]
对 ， 确实啊 。

**曼祺** [9:39]
它 23 年就发生了 。

**楼天城** [9:40]
今年不是 24 年吗 ？

**曼祺** [9:41]
今年是 24 年， 但是去年不是已经开始就是有把这个安全员拿掉的这种测试了吗 ？

**楼天城** [9:47]
但没到百辆 。 我觉得就是今年夏天百度它在武汉大概是 400 辆嘛 ， 然后 Waymo 今天大概是 800 到 1000 辆 。

**曼祺** [9:55]
嗯 ， 所以跟你之前的这个预测也挺符合的 。

**楼天城** [9:58]
符合符合 。

**曼祺** [9:59]
哎 ， 你现在方便透露一下小马现在是一个什么级别的这种就是完全没有安全员的 ？

**楼天城** [10:04]
我们也是百级别 ，但是当然我们有另外一些考虑 。其实我们会希望在成本上做得更好之后再进一步扩大 ，但是百还是有的 。

**曼祺** [10:12]
明白 ， 就说你们现在可能限制你们这个规模扩大节奏和速度的一个原因是你要把车的成本做得更低 ， 对吧 ？

**楼天城** [10:18]
对 ， 这也是思路不同吧 。 就是因为我们是初创公司嘛 ， 百度 Waymo 相对其实它有更多的一个资本的支持 。 所以对我们来说 ， 我们可能希望刚刚如你所说嘛 ， 把车辆成本做下来 ， 把运营的收入做上去之后再扩大 。

就是这个结构上我觉得作为初创公司会有略有不同 。 嗯 ，但整个思路和这个技术的这种要求 ， 或者是这种大概的这个路线上， 我觉得其实是没有差异的 。

**曼祺** [10:39]
那我们接下来可以把这个时间线往回拨啊 ， 就是说从这 5 年的开始开始讲 ，也就是说你从完全重构这个技术的这个过程 ， 然后我听下来的话 ， 我觉得你们要讲的这个技术肯定也不是端到端 ， 或者跟它也不太一样 ， 对吧 ？

### 模仿学习

**曼祺** [10:53]
因为你觉得 L4 和 L2 这是两个东西 。 你可以先讲讲就是 19 年到 20 年的时候 ， 当时是遇到了什么瓶颈 ， 或者说当时发生了什么 ， 要开始重构这个技术啊 。

**楼天城** [11:03]
啊 ， 首先这个技术路线和 L2、L4 这是两个比较型的话题啊 。 我们先说技术路线啊 ， 然后 L2、L4 跟它有关系 ，其实很接近 ，但是略有不同 。

我们先说技术路线 ，其实那个叫做 Learning by Watching 和 Learning by Practicing 的差别 。 就是说一个是靠做 ， 我用一个词叫做模仿 ， 就一个靠收集数据来模仿 ， 一个是通过在一个虚拟环境 ， 我们后来就叫做世界模型了 ， 虚拟环境中进行自我训练 、 自我演进 。

这是两种不同的做法的思路 。 你说那个 19 年，5 年前时间点 ， 就是说我们开始在那个之前 ， 我们做的也是基于模仿的 。

我当时意识到了就是说做模仿最终是做不到 L4， 或者是有非常明确的问题的 。 所以我们彻底换了方法 ， 就叫 Learning by Practicing 的方式来做这个 。

就是说这是一个整个应该说技术的路径的一个切换 ，其实就发生在那个时候 。

**曼祺** [11:53]
所以 L2 是 Learning by Watching， 就是通过看 。

**楼天城** [11:56]
不完全是 ， 这个可能还有更复杂的解释 ，但是就先抛开 L2、L4 用什么的话 ， 这个路线本身是这样 。 我觉得依模仿学习 ， 刚刚你提到端到端的思路啊 ， 就算做到端到端 ， 就是把所有传感器的输入 ， 可能会包括一些车辆动力学或者地图的信息作为输入 ， 输出就是那个车辆怎么开嘛 ， 我们叫 trajectory 啊 。

就是这个东西它有两个很严重的问题 ， 可能三个吧 。 第一个其实是它没法学习驾驶是怎么想的 ， 它只知道驾驶是一个复杂的行为 ， 就不仅仅只有说是我车开的路径 ， 真正驾驶这个 task， 它需要包括的是很多中间的结果 ， 比如说我驾驶的 intention， 我的一些 decision，以及一些潜移默化的习惯 pattern。

也就是说对同样的一个驾驶的行为 ， 它可能背后有成千上万的不同的一种可能性 。 就是说如果单纯模仿是没法学到自动驾驶车辆它是怎么想的这件事情的 。

首先为什么学不到 ，是因为模仿数据里根本就没有这个数据啊 。 嗯 ， 就是因为我从我收集的这些数据 ， 我只能知道怎么开的 ， 我不会有人告诉我怎么想的啊 。

就算我找标注员 ， 说实在的 ， 标注员他也不知道那个人怎么想 。 就其实这是一个 ， 就是数据本身是不存在的 。

然后呢 ， 从学习角度说啊 ， 就从网络上， 这句话可能是真正做 learning 的人会理解什么意思 。 就是说从个超高维度到一个低维度的学习的话 ， 很容易 likely 你只能学习表层的 feature， 就是很容易你的网络结构就 overfit 到一些非常浅层的 feature 上 。

所以其实这样的超高维到低维的东西 ， 你没法做到 reasoning 和 deep understanding。 而这个点就是说你可能会造成一种情况 ， 就是你最后学习过程中呢 ， 可能对吧 ，1 万帧 ，9999 帧都是一样的 ，但是有一帧是不一样的 ，但那一帧的失效就会导致非常严重的 diversion， 会导致一些驾驶的问题 。

所以这个就是说叫知其然不知其所以然嘛 ， 就怎么想不就这个意思嘛 。 所以这个其实是模仿学习永远没法做到的 ， 就是怎么想这件事情 。

开始的时候呢 ， 我们觉得不知道怎么想也行吧 ， 我们就这么做了 。 但是就是 19 年的时间点意识到不行 ， 这个还是是不能这么做的 。

**曼祺** [13:53]
你是在一个什么指标上卡住了吗 ？ 当时 。

**楼天城** [13:56]
其实就是这个 MPI， 就要说到 L2 的时候啊 ， 就世界上不存在一个 MPI 等于 1000 的 L2 产品啊 。 这个其实也是上次我记得有次采访中我说的很关键的一个 topic 啊 ，其实就是 MPI。

这个卡住是个极限的卡住 ， 这是一个整个思路理念的卡住 ， 到今天为止我们都没有突破的 。

**曼祺** [14:15]
对 ， 可以和听友解释一下 MPI 啊 ， 可能有的人不知道什么意思 。

**楼天城** [14:19]
对 ， 就是说平均呢 ， 多少里程需要一次接管 ， 叫就是 miles per intervention， 就是在车辆还没有完全成熟的时候呢 ， 就是今天的很多 L2 产品 ， 对吧 ，有些时候还需要人工司机的介入的 。

所以这个时候呢 ， 我们把大概需要多少里程接管一次称为 miles per intervention， 表示它的一个安全性 。 那刚才我为什么说不会到 1000 呢 ？

我给个概念啊 ， 就是正常大家开车一天 ， 比如说开 30 公里的话呢 ，1000 大概就是一个月一次啊 。 就是如果一个 L2 产品是一个月需要你接管一次的 ， 那么我反问就是你真的能接管得了吗 ？

就你开了 29 天你都觉得都是开的挺好的 ， 第三天突然发生一件事情 ， 就那个时候你就是你真的确定驾驶员他到时候他能够真正的 attention 能在上面 ， 这个是做不到的 ， 就千万是根本做不到 。

所以就是在运营方面可能很多 ， 这就是如果你 MPI 没做到 1000 的时候 ， 你可能没有遇到这个问题 ， 还 OK 啊 。

但你真接近 1000 的时候 ， 你会发现 MPI1000 是个不存在的东西 ， 它不是不可预约 ， 它可预约 。 作者 MPI 很容易出现在小于 100 的和大于 10 万的 ， 它很难在中间状态出现 。

因为在运营角度来说 ， 所有的运营人员 ， 比如说我们的车主 ，是做不到这样一个 MPI 的 。 就这是符合人性 ， 就一个人如果他长期用都觉得不用接管 ， 一周都不用接管 ， 就他可能就再也不会接管了 ，因为他没办法达到一个 attention， 就在这么低频的状态下能够控制车 。

**曼祺** [15:39]
OK。

**楼天城** [15:40]
对 ， 我多踏出去 ， 就是说当时你因为你遇到瓶颈 ， 这个问的很好 ， 就是瓶颈 。 然后刚才我说还有一个 ， 就是刚才说的模仿学习的一个限制啊 ， 现在回头看当时还有一个很重要的理由 ， 就是这个理由其实也很重要 ， 这也是后来理解 ， 就是说我用更通俗话来讲 ， 就是双标 。

嗯 ， 对人类驾驶员出事故和 AI 驾驶员出事故是双标的 。 人接受人是多样的 ，但人不接受机器的多样 。

我先拿 ChatGPT 举个例子啊 ， 就是你知道 ChatGPT 其实做了很多数据标注 ， 数据标注干什么用呢 ？ 其实它表面上它是说在帮助模型学习理解一些符合人类期望的语言 ，但其实它是为了消除很多偏见 ， 或者不正确说话 ， 或者是一些就是人们认为作为 AI 的 Chatbot 不应该出现的言辞 。

就有些话 AIbot 是不能说的 。 这个事情是比如说一些可能带有歧视或者严重的偏见 ， 就是这种语言其实我们都不接受 ，但是这些话在人类中是出现过的 。

所以就是说人是接受人类是多样的 ，但人不接受机器的多样 。

**曼祺** [16:38]
那如果在驾驶行为上它是一个什么标签 ？

**楼天城** [16:41]
好 ， 就那就是说如果真有个人他当时驾驶过程中由于严重的身体异常 ， 严重的身体问题出现一个失去驾驶能力 ， 人会突然间发生一些事情 ， 人就失去驾驶能力 。

这个时候车会发生一些不可理喻的事 ， 发生一些不非常不安全的事情 。 但是这时候人接受 ， 如果人由于驾驶员身体异常 ，但人不接受机器 ， 人会要求 AI 有一个冗余系统 。

我们经常会提这个话题 ， 对吧 ，但其实人开车是没有冗余系统的 ， 对个人 ，但大家是接受这件事情 。

你感觉明白吗 ？ 就是说 。

**曼祺** [17:11]
我明白 。

**楼天城** [17:12]
然后还有一些 ， 比如说鬼探头的时候 ， 对吧 ， 我们对于一些突然窜出来的物体 ， 或者对一些比如别人闯红灯是一些无责的场景的时候 ， 我们会接受人其实是按一个分布的方式反应来刹车 ， 人尽力了 ， 对吧 。

有些时候实在就是别人闯红灯过来了 ， 你可以说是你就让速不让道 ， 人是大家接受这个行为的 。

但大家对 AI 是有更高要求的 ， 就大家不接受 AI 这个行为 。 所以我为什么说这个问题是这样的 ， 就是说 AI 被视为一个冰冷冷的机器的时候啊 ， 就是说如果它真的做到了 ， 真的它完美的模仿了人， 它是不满足人类要求的 。

**曼祺** [17:46]
而你觉得 Learning by Watching 就是它最多最多只能做到像人 ？

**楼天城** [17:51]
它的极限就是做到像人。 而这个像人这件事情 ， 它的最大问题就是就算像人， 它是不满足人对 AI 的要求的 。

**曼祺** [17:59]
嗯 ，不满足人对一个无人司机的要求 。

**楼天城** [18:02]
对 ， 所以有时候我会在一个场合说 ， 比如说我们说安全 ，AI 要是人的 10 倍 ，但这只是一个量化 ，因为 10 倍是个比较值 ，是个不小的数字 ， 给人一种感觉 。

但它的本质其实是因为人的根本要求是双标的 ， 它不接受机器的多样性 。 而不做多样性的时候 ， 刚好能达到 10 倍 。

所以 10 倍不是一个说直接是 ， 比如说从保险或者事故损失的指标 ，而是从这个地方来的 。 因为有人会说这是一个真正做过的人， 就是我发现这件事情之后， 我就彻底放弃这点啊 。

就是有人会说我像优秀司机学是不是就可以了 。

**曼祺** [18:33]
嗯 ， 现在很多车企就是这么说的啊 。

**楼天城** [18:35]
那我说它的问题是什么 ？ 这个问题这么说 ， 可能它们还没有意识到问题 ， 意识到之后不知道它会有多绝望 。

但是我先说我的绝望 ， 就是模仿学习不是一个闭环训练过程 。 嗯 ，也就是说人类司机是通过他们的眼睛 、 耳朵 ， 对吧 ， 眼观又老听八方来开车的 。

它不是看传感器数据开车的 。 这个到底意味着什么问题呢 ？ 就是说如果它是看着传感器数据 ， 它可能不会这么开车 。

它是依赖很多它的一些特有的经验 ， 一些超视距的信息 ， 一些传感器没法得到的信息 ， 来做了很多的判断 ， 使得它今天它能够在当下这个时刻这么开车 。

如果你让人司机来看着那个传感器的数据开车 ，他会做出不同的决定 。 而这个时候越优秀的司机 ， 这个偏差越大 ，因为他越优秀 ，他越有经验 ，他越有更好的判断 ，但他这个判断是基于了一些他超越了传感器的数据能力来做的判断 。

所以这个时候就你没法闭环之后， 你会犯一些错误 ， 比如说你可能没有能力对很远做一些把握 ， 车辆的操作使得你学它你会非常差 ，因为如果它在做了 ， 它也不会那么做 。

所以就是因为你失去了闭环能力 ，而闭环训练是可以的 。其实我正是因为这件事情 ， 我坚信就是说训练需要有闭环的训练能力 ， 所以才走到了世界模型 。

我借着这个 share 的心路历程啊 ，但其实本质是闭环这个东西是源于这一点的 。其实是我真正对于学优秀司机绝望之后， 才发现其实闭环才是出路 。

**曼祺** [20:00]
对 ， 所以过程中间你们肯定是学了一段时间优秀司机 ，但是你发现这个不 work，不能把这个 MPI 再往上提升的很多 ， 对吧 ？

**楼天城** [20:08]
甚至是下降的 ，因为它优秀 ， 所以它用了很多 ， 就是你不敢跟它学啊 。

**曼祺** [20:13]
所以是个反向优化 。

**楼天城** [20:15]
是个反向的问题 ， 对 ， 这个其实是最后一点啊 。 刚刚本来想说两点 ， 我现在第三点其实就是这个闭环训练的意义 。

但是 MPI 回到这个点啊 ， 就是说其实当时因为你问的是某指标上不去 ， 我觉得是 MPI 的上不去 ，但实际上的话 ，其实后来有了一个回到这个问题本身 ， 它其实是那个怎么想就知其所以然的根本 。

就是本质是因为我没法知其所以然 ， 所以我的真正车辆能力上不去 。 但 MPI 最终会受运营的限制 ， 或者换了这么说 ， 限制 MPI 上不去有两个原因 ， 技术和运营 。

我解决了技术 ，但没有解决运营 ， 所以今天还是上不去 ，但技术没解决就 OK。

**曼祺** [20:49]
所以你也不同意马斯克说的有一句话 ， 对吧 ？ 他经常用的一个说法就是说这个人就是靠看见就能开车 ，但实际上人不是靠看见就能开车 ， 你觉得 ？

**楼天城** [20:58]
不不不 ， 首先看见这个是个未定的概念 。其实他的说法有个问题 ， 如果他是狭义的说法我不同意啊 ，但广义不一定啊 。

就是人如果看着车上那些摄像头拍的视频看 ， 那人也不一定能开得好 。 就人看是靠眼睛看的 ，是眼睛看 ， 人眼啊 。

**曼祺** [21:14]
就摄像头不等于人眼 ， 对吧 ？

**楼天城** [21:16]
啊 ， 对 。

**曼祺** [21:17]
也有一些就是你说的嘛 ， 就是他开车的时候是结合经验 ， 甚至你说那种老司机可能你叫什么第六感或者直觉也行 ， 就他开得越多 ，他这种能力越强 。

**楼天城** [21:26]
对 ，而且比如人的味觉器官在耳朵里啊 ， 那个味觉器官也在作用 ，其实是很关键的 。

### 实践学习

**曼祺** [21:30]
1920 年你们发现你靠之前那种 Learning by Watching 你不能再继续往上了 ， 那你怎么找到这个新的路了 ？ 你后面说的那个路线 Learning by Practice 这个是 。

**楼天城** [21:41]
The Practicing 首先就是说故事从闭环说起嘛 ，其实 Practicing 闭环这两个是有直接的相关的嘛 。 就是说我需要能够让它自己去学习自己走得好不好 ， 让它自己能够 Practice。

学游泳是很好的概念 ， 对吧 ？ 学游泳的时候你看多少遍游泳的视频 ， 都不如下水自己试试吧 ，是吧 ， 管用的呀 。

就是当时也是 ， 就是从这个角度 ，其实本质上也是从解决问题角度出发的 ， 就是说这 Learning by Watching 根本问题在哪 ， 对吧 ？

然后就刚刚说了三个问题嘛 ， 对吧 ， 就是学不了就不能知其所以然 ，以及的话没有闭环 ，以及刚刚说的就是有一个这个就能力 ， 就是说只模仿人是不够的这个问题 。其实你是从这些问题出发 ， 然后重新思考这个思路啊 ，但本身啊 ， 就强化学习 ，Reinforcement Learning with Human Feedback 这个东西并不是个新的 concept， 就是强化学习也是一个很多年的东西 。

我相信对方肯定也了解过强化学习这个概念 。

**曼祺** [22:31]
那当时你们就找到这个第二个方法 ，是你们自己想出来的 ， 还是比如说像 Waymo 这些行业里的一些其他公司也有类似的尝试 ？

**楼天城** [22:39]
从我的感受来说 ，其实各家大概刚好都在那个时候意识到这件事情 。其实就是说这个方向值得尝试 ， 是一个行业偏共识的东西 ，但有没有决心真正开始尝试 ， 可能是真正的时间点上的处境 。

就是因为我对这个方法绝望了 ， 所以那个方法尝试我就等于是不再尝试 ， 我必须走的路了 ， 我就去走了 。

但是这个想法 ， 就这是一个尝试的方向 ，其实应该是很早的一点 。 然后这里刚好我举一个例子啊 ， 这也是最近我在跟很多观众的例子 ，其实这个方向不知道究竟是这样 ， 就 AlphaZero 在 AlphaGo 基本上做了什么 ， 这个不知道你了解吗 ？

**曼祺** [23:13]
它应该是做了一个自博弈吧 ， 就是它 AlphaGo 以前学的是现成的棋谱 ， 人类有的棋谱 ，AlphaZero 是自己下棋 。

**楼天城** [23:21]
对 ， 就从零开始 ，Zero 就是指的 Zero Human Inference 嘛 。 嗯 ， 对 ，其实 AlphaGo 也做了强化学习啊 ，但是其实这是更可怕 ， 就是发现从人类棋谱学练之后再强化 ， 甚至不如从零开始强化好 。

因为我个人下围棋 ，AlphaZero 出现之后， 我小时候学的定式都被颠覆了 ， 比如最著名的 33 定式是被颠覆的 ，33 定式从来就不这么下了 ， 就我小时候学 33 定式 ， 后来 AlphaZero 之后大家都不怎么下了 。

嗯 ， 通过一个自强化来超越自己 ，其实有些有例子的 ，其实 AlphaZero 就是这样 。

**曼祺** [23:51]
嗯 ， 对 ， 所以那个想法可能在 2016 年、17 年的时候就有了 ， 对吧 ？

**楼天城** [23:55]
对 ，但是呢 ， 就真正开始付诸实践 ， 开始大规模投入 。 前面说的都是些很理性的东西 ， 我说两句感性的东西啊 ， 就是说新开始这样一个新的方向 ， 它是从很低的起点开始的 ， 等于是我先做了三年 Learning by Watching， 已经达到了一个水平 ， 虽然不是那么高 ，但也还 OK。

那么我 Learning by Practice 是从零开始追上来 ， 这个追的过程是非常痛苦的 。其实我们追了接近两年时间啊 ， 嗯 ， 这两年是没有任何进展的 。

就这个别说对外， 我连对内都没有进展 ， 对吧 ？ 说实在的 ， 我们工作同事怎么跟他家人 、 跟他亲友解释 ， 我都不会 。

对 ，但是我就只能不断告诉他们说 ， 这是正确方向 ， 我应该这么做 。 那时候这两年承受的压力是巨大的 。其实我觉得可能有些伙伴 ，有些公司啊 ，他们后来没有尝试下去 ， 可能是这两年都撑不住啊 。

**曼祺** [24:38]
嗯 ， 它跟你比如说做互联网创业 ， 你做个 APP， 你放出去就能看到增长曲线什么 ， 这个很不一样 。

它是个很长周期反馈的东西 ， 对吧 ？

**楼天城** [24:46]
所以之间受的压力是非常大的 。

**曼祺** [24:48]
嗯 ， 所以你自己在这两年， 用两年去做这个新的路线 ， 去赶上以前的这个水平 ， 这个过程中间你自己是没有犹豫过的 ， 没有摇摆过的 ， 你一直都相信这个就是正确的方向 。

**楼天城** [24:58]
啊 ， 这我一直相信 。 当然我觉得有个运气啊 ，但这个幸运说回来也不是一个好的 。 故事是疫情的时候相对比较 slow， 所以呢 ， 可能大家心态相对会晚一些 。

**曼祺** [25:09]
你说的 slow 是指的 ？

**楼天城** [25:11]
就是那个时候 ，因为反正也没有这么多 exposure 嘛 ， 没有这么多对外的东西的时候呢 ， 相当于心态相对平静一些 。

说个不太恰当的比喻啊 ， 如果那时候我们登陆二级市场了 ， 可能我这么做压力会更大 。

**曼祺** [25:23]
那这么回头说的话 ，因为 21 年其实你们有想过上市嘛 ， 就当时想 spike 上市 ，但那次是没有成功的 。 就你回头看 ， 你觉得这反而是个更好的安排是吗 ？

**楼天城** [25:35]
我就不说什么天意这样的话了 ， 我觉得对吧 ， 就是我有时候会说这个 ， 就在竞赛圈有个说法嘛 ， 就当年的迷失可能是为了今天更好的相遇 。

**曼祺** [25:45]
竞赛圈还有这么文艺的说法啊 。 啊 ， 那回到就你这两年很痛苦的这个追的过程啊 ， 你们是中间做了哪些关键的决策 ， 包括是怎么最后做到一个还比较好的效果的 ？

**楼天城** [25:56]
嗯 ， 我觉得东西很多 ，但我竟然是比较就容易理解 highlight 点啊 。 大家看这里说的这个路线啊 ， 这还没有涉及 L2、L4 的问题啊 。

嗯 ， 首先第一其实是数据 ，其实在那一时间点 ，poning 数据也不少了 ， 我们几百万公里数据其实也挺多的 。

但是就这个数据来源这件事情被彻底颠覆了 ， 就等于是我要首先放弃我所谓的数据的多样性 。

因为如果你回到 189 年的时候 ， 我经常会说中国的数据很多样性 ，但是在那一时刻 ， 基本上我要放弃掉我之前说的那些优势 ， 就是开始用这种生成式数据的逻辑 。

但生成式数据不表示说不使用真实数据啊 ，但是生成能力本身就是关键了 。 就数据量本身就没那么关键了 ， 就是坚持走生成式的这个数据其实是很重要的一个 。

生成式数据本身就是世界模型的任务之一啊 。 我觉得今天这过程它慢慢可能世界模型都已经基本都 touch 到了 。

就生成数据 ， 就这个其实是很重要的 。 而且生成数据会给人一个错觉啊 ， 比如你会觉得生成数据短 ， 那靠生成的比靠实际收集的会不会一些长尾场景覆盖不了啊 ， 或者它 coverage 啊 ， 或者什么的 ，其实不是这样的 ， 就是那都是你没做好 。

如果做得好的话 ， 它的覆盖率 ， 它的 consistency 远超过实际路数产集数据的 ，但这个需要一个时间 ， 就是需要彻底从数据的跟数据的关系上发生这个改变 。

**曼祺** [27:07]
这做好没做好的差别在哪儿 ？

**楼天城** [27:10]
比如说真不真实吧 ， 比如说这个 join interaction， 就是指路上的一些 ， 比如说交互 。 就这个其实我觉得有些场景奇怪 ， 就是说就是自己车怎么开 ， 跟别人的行为是相关的 ， 就别人不是固定行为 ，但这个交互要非常合理 ，因为就它要符合在真实路上的情况 。

如果做得好的话呢 ， 你就会觉得在里面训练跟在实路上一个感觉 ， 做得不好发现那个对吧 ， 实际上别人跟你交互这个样子 ， 到真实路上不是这个样子 ， 然后就各种发生交互的问题 。

**曼祺** [27:37]
嗯 ， 那你们是靠什么方法把这个生成的数据做得真实 、 做得好了 ？

**楼天城** [27:41]
我们专门训练了这个 ， 本身生成也是非常复杂的 network， 是一个 new network。

**曼祺** [27:47]
这也是一个模型 。

**楼天城** [27:49]
我们专门训练了一个还真的挺大的一个模型 ， 虽然不是今天大语言模型那个 size 啊 ， 还真的挺大的一个模型 ， 专门做这种交互 。

然后生成中还有那个覆盖长尾场景 ， 就是说你不能生成一些太难 ， 就是根本不可能发生的事情 ，但你要能生成一些它还是有可能真实发生的 。

这个真实度的把握其实是一个整体发生事情的概率分布 ，以及我们刚刚提到那个 ， 比如人不是双标嘛 ， 就对于人对 AI 究竟接受什么样的场景 ， 这些的理解 ， 就是类似类似可能这样的工作啊 。

**曼祺** [28:17]
所以它这个里面还是要带一些你们对这个东西的主观的判断的 ， 对吧 ？

**楼天城** [28:21]
对 ，其实不是对车怎么开的判断 ，是对世界怎么样的判断 。 嗯 ， 对 ， 就是它的重要性不是说车怎么开 ， 车怎么开是 AI 自己的事 ，但是我要告诉它世界是什么样子的 ， 这个判断还是在的 。

就是还有一个 metrics， 就是什么叫开得好 ， 这个也是就是当年构建世界模型另一个很重要的 。Layer 2 啊 ， 刚才说了一个 ， 还有一个就是什么叫开得好 ， 这个东西也是需要很多主观判断 ， 需要很多标注来学习 ， 需要主观判断 ，其实是这样一个过程 。

**曼祺** [28:47]
那你们最开始怎么去搭建这个认知了 ？ 就比如说你现在突然说让人去抽象一个世界的判断 ， 好像挺难的啊 ， 就完全没有头绪 。

**楼天城** [28:56]
啊 ， 这段我们是从 funding 做起的 ， 这是很早年的技术 ， 就是通过一个收集的实际场景 ， 把它扩展成各种做一些改变 ， 变成一些跟它很类似但又不同且很合理的场景 。

然后就会遇到 ， 比如说当 funding 之后 ，其他物体跟我们这车之间的行为之间的互动 ， 就会然后就开始考怎么去互动 ， 就是其实也从这一步步做起来的 。

你如果回到我们 20 年讲的 ， 为什么能够在讲 funding 讲互动 ， 那个其实就是 generative data 的那个起源的两个东西 。

嗯 ， 然后今天肯定做得更复杂的东西啊 ，但那时候其实起源这个其实相对好理解 ，因为这可能就是如果现在我们说要做这个 ， 肯定这两个是最初的挑战啊 。

**曼祺** [29:32]
嗯 ，因为我们上次聊的时候 ，其实你说过就是 2020 年开始做这个东西 ， 你当时不是把它叫世界模型 ， 你是叫一个尺子 ， 就大概它能去评估你这个车子开的道理好不好 。

**楼天城** [29:43]
那我接着是把世界模型最后一个说完 ， 就是说那时候确实不叫 ， 原因是因为它首先啊 ， 世界模型这个词是因为我故意跟 Waymo 不想撞一个词而换的词 ，但本质它这个词非常容易误解 ， 甚至我觉得可能已经被误解了 。

**曼祺** [29:57]
啊 ，Waymo 那个叫 ？

**楼天城** [29:58]
啊 ， 世界模型本身 ，Foundation Model。

**曼祺** [30:00]
哦 ，Waymo 叫 Foundation Model。 嗯 。

**楼天城** [30:02]
对对对 ， 然后世界模型本身它是车上车载模型的训练环境 ， 它是个环境 ， 就它不是一个模型 ，也不是训练这个环节 ， 它是整个训练环境叫世界模型 。

嗯 ， 就是之前刚刚说 ， 就是当年说那个尺子 ， 就是那个 metrics，是它的一个刚刚说嘛 ， 什么叫好 ， 生成部分是之前说的 funding。

嗯 ，但是还多了一点 ， 就是后来你就是有它自我演进这个引擎 ，是后来补充掉世界模型的关键 。 这个东西其实不是第一天做好的 ， 第一天的时候其实有很多人为的东西 ， 后来它慢慢做的自动化 ， 然后变成他们的自己 。

这引擎就是说能让一个 AI 司机嘛 ，在里面能够自我演进 、 自我学习这件事情 ，在一个非常少的人类监督 ， 或者最好的人类可以不监督情况下来做 ， 这件事情是当时 20 年没有的东西 。

**曼祺** [30:46]
22 年也没有是吗 ？

**楼天城** [30:47]
对 ，22 年严格的讲 ， 那时候需要很多人为介入啊 。 嗯 ，但这个事我稍微说的不用那么玄幻啊 ，其实让自己变强 ， 或者说对啊 ， 这个话最早我说的概念在公司内很多人不认可 。

后来我突然说的就是说 ， 很多人其实一生也很少经历强化学习 ， 就是我一生教育可能前几年都在做模仿学习 ， 只有在某一个特定时候我才意识到原来人可以通过强化学习提升自己 。

**曼祺** [31:11]
你自己什么时候意识到的 ？

**楼天城** [31:12]
高二高三吧 ， 那个时候就是人可以通过强化来让自己变强 ，不是通过模仿 。 这个想法并不常见 ，但是本质上一个车如何学习其实不用那么复杂 ， 向未来自己学习就可以 。

就如果你能追上未来的自己 ，其实就会变得非常强 。 就是说我通过一个虚拟环境去模拟 ， 我会通过未来就可以反来判断我当下的决定对不对 ， 至少有个好的 sense， 然后让我当下的决定尽可能被未来自己认可 ， 就是它的学习方式 ， 就叫向未来自己学习 ，其实就是这个意思 。在这个车的驾驶任务

**曼祺** [31:43]
里面 ， 这个未来只是指未来几秒的意思 ，不需要一个很长的未来 。

**楼天城** [31:47]
对 ， 就是我今天这个决策 ，在这个未来可能 5-10 秒就会知道我的决策对不对 ，但是我在做的决策我不知道啊 。

但是其实我在这个环境世界模型中我是可以知道 ，因为我可以模拟 5-10 秒我就知道对不对 。 嗯 ，但所以要做的事其实就是让未来的自己 5-10 秒后的你能够认可 5-10 秒之前你的决策 。

它是个训练环境 ， 它是个车单模型的 factory。

**曼祺** [32:08]
车单模型的工厂 ， 对吧 ？

**楼天城** [32:10]
对 ， 工厂 。

**曼祺** [32:10]
那这五年的话 ，其实对你们来说 ， 你们的主要的这个技术上的进化是在这个 factory 的部分 ，而不是在 product 的部分吗 ？

**楼天城** [32:18]
对 ， 没错 。 这是为什么啊 ， 就是为什么大家会有人说喂 ， 你是不是用端到端的 ， 或者这样的问题 ， 然后呢 ， 它会给大家一种错觉 ， 好像各家公司都差不多 ， 对吧 ？

大家都用端到端了 ，其实就真正驾驶技术差别在于这个 factory 的精度 ，而不在于车载模型的能力 ， 或者这么理解 ， 就是这个 factory 本身决定了车载模型的上限 。

就是从生产角度啊 ， 一个模具的精度是它生产出零件的上限嘛 ， 对吧 ？ 嗯 ， 所以其实 factory 的能力其实上限 ，而今天的学习能力其实还可以 。

所以基本车载模型通过一定学习能够接近 factory 的那个上限 ，而 factory 本身能力才是关键 。

**曼祺** [32:54]
那当你们这个生产工厂的精度提高了 ， 它的能力变强了 ， 你们车段模型的实际上的变化是什么样 ？

这五年 。

**楼天城** [33:01]
啊 ， 实际上的变化 ， 首先最直接的 ， 我们事故率的降低非常明显啊 ， 今天已经刚刚说的 10 倍人类司机这个也做到了 。10 倍只是一个好表达 ，因为我不想踏出那个双标的话题太多 ，其实是解决那个双标的问题啊 。

首先这是最直白的表示啊 ， 然后它对于什么叫开得好应该有更好的理解了 。

**曼祺** [33:19]
嗯 ， 那这是从结果上， 那它实际上比如它在架构上， 它是需要有一些大的重构和变化 ， 还是其实不需要了 ， 我只车端的 。

**楼天城** [33:26]
这个呢也是不断学习的 ，不断演进的 ， 这个是有的 ，但这个我之所以少提 ，也就是各家之间差别并不明显 。

**曼祺** [33:34]
各家之间你指的是 Robotaxi 的各家公司 ， 还是把 。

**楼天城** [33:38]
Robotaxi。

**曼祺** [33:39]
OK， 就只算 Robotaxi 之间各家公司不明显是吗 ？

**楼天城** [33:42]
啊 ，不明显 ，因为这个结构相对也不是秘密 ， 大家可以学习 ，而且且好的东西也就可以反转给你分享 ，在这方面 。

然后且今天的算力就是说 ，因为用世界模型训练其实不需要特别多算力 ，其实算力也不是瓶颈 ， 所以其实这方面跟上是很快的 。

**曼祺** [33:57]
所以你们的这个 Robotaxi 公司之间有共识的这个方向 ，并不是 L2+ 的这个端到端的这个方向是吗 ？ 比如说特斯拉就会说端到端这个范式其实是需要很多算力和云服务的 。

**楼天城** [34:09]
对 ，是的 ， 就是说 Learning by Watching 数据量和算力是关键 ，Learning by Practicing 我觉得是那个 factory 的精度是关键 ， 就世界模型精度是关键 。

这也是为什么 Robotaxi 公司很少说自己数据多 。 嗯 ， 就是我已经很多年没有对外说过我们数据多多少百度也不能说了呗 。

嗯 ， 就是因为可能潜移默化中技术的关键不在这 ， 所以我们就很少说起了 。

### L2与L4

**曼祺** [34:29]
嗯 ， 那回到我刚才那个问题 ， 就是说其实 L4 的和 L2+ 的是不一样的 ， 对吧 ？ 这就到了你说的那个可能更复杂的问题了 ， 就是技术路线的区别 ， 对和 L2、L4 的区别 。

**楼天城** [34:40]
那在这之前我首先声明 ， 就是说并没有谁做了错误的决定啊 ，因为目标不一样 。 目标不一样的事不一定要放在一起 ，但我先解释目标啊 ， 就是 L2 来说 ， 它的价值本身是为了使用者提供便利 ， 把提供帮助来产生价值 。L4 其实说更简单是减少相应人力投入产生价值 ，是取代产生价值 ， 所以它们价值本身的 justification 都不一样啊 。

但是说目标的不同 ， 对吧 ， 就是 L2 对于成本和应用范围是很敏感的 ， 要扩很多城市它的成本 ，其实 L4 对于成本和应用范围是又 flexible 的 ， 如果能做成 ， 它的 margin 空间是很大的 ， 且它不需要特别大的范围 ，其实这方面不是它的优化目标 。

而反方向安全性就是 ， 就安全性刚刚说嘛 ，不做到 10 倍 ， 我可能连牌照都没有啊 。 但是 L2 其实我觉得做到一个 ， 就我今天了解大概大部分车的 L2 公司呢 ， 就是 MPCI 啊 ， 如果不接管可能发生很危险的情况 ， 这大概是 50-300 左右吧 ， 大概这样一个范围 。

而说的 L4 公司大概是千倍这个啊 ， 就是几十万 ， 至少 10 万级别以上 。 所以其实成本是一头 ， 真正安全指标是另一头 ， 这两个的目标差别是非常非常大的 ， 所以才导致了一些不同的判断 。

但这里很关键的一点就是 ， 为什么我突然把 Learning by Watching 拿出来 ，是因为其实 L2 公司使用 Learning by Watching 是没有问题的 。

就是说如果我做 ， 我也会这么做 。 为什么 ？ 首先它见效快 ，而且它说的这个见效快不一定是实际快 ，而是说就是没有特别大的变数 ， 我只要把该做的事做了 ， 就能达到一个 OK 的状态 。

这个我觉得如果能是事情能这样做成 ， 我觉得完全可以这么做 。 就是它的性能就是虽然刚刚说的 ， 比如 300 之类的 ， 这 300 公里接管一次的车没问题啊 ， 说实在真的 ， 对吧 ？

就是你一周接管一次嘛 ， 没什么问题啊 ， 就这车挺好用的 。 好像还有一点就是 ，因为它数据量是关键 ， 所以它也符合 L2 公司它的核心竞争力啊 。

就是我也希望的出现 ， 就是真正能发挥我特长的路线 ， 对吧 ？

**曼祺** [36:27]
嗯 ， 就是它有规模的效应 ， 对吧 ？ 我卖的车越多 ， 或者我服务的车越多 ， 我的数据越多 ， 我表现越好 。

**楼天城** [36:34]
对 ， 这样也可以利用我的优势 。 所以 L2 使用 Learning by Watching 是没有任何问题的 ， 没有任何错误 ， 甚至如果我做我也会这么做啊 ， 我就是这么做的其实啊 。

然后 Learning by Practicing 路线 ， 为什么 L4 选的是因为 Learning by Watching 它不 work， 它别无选择 ， 我只能用这条 。 这里就是说当然了 ，因为它要投入很多 engineering， 刚刚提到嘛 ， 就很多 ， 比如说跟着理解 ， 很多实现 ， 要很长时间的积累 ， 这些东西其实也算符合 AI 公司的核心竞争力吧 。

也是就是说不同公司的 strengths， 不同做法 ， 不同的事情 ， 不同目标 ，其实整个事情非常 consistent 的一点 ，以上都是我觉得非常和谐 、 很 argue 的部分 。

我记得我说过一句话 ， 当然前面被还是被放到标题啊 ，L2 做得越好距离 L4 越远 ， 对吧 ？ 当年挖的坑 ， 我现在可能得开始真正填这事情 。

还记得开门那个点 ， 就是一个符合人类驾驶的行为 ， 最终会成为 L4 的障碍 ， 就那个双标 。 就算我完美模仿了人类优秀的驾驶行为 ，也距离 L4 有很大的 gap，因为双标 ，因为那个信息非闭环 。

就因为这件事情 ， 所以为什么 L2 做得越好距离 L4 远 ，是这个原因 。 而且这个是上限的距离啊 ， 这不是距离 ，其实我做得越好 ， 我的上限距离 L4 越远啊 ， 就这个是没办法跳跃的 。

就不是说我距离越远 ， 距离越远可以通过不断的改进 ，但是我越好 ， 我的上限距离它越远 ， 那就是永远越不过去坎了 。

这是一个 ， 还有一个点就是为什么 L2 做得越好距离 L4 远 ， 还有一个刚刚说那个运营的那个问题 ， 就是我不能依靠车主实现一个 MPCI 等于 1000 的产品 ， 那我就没法从 100 跳到 10000，因为中间隔了 1000。

**曼祺** [37:59]
因为 MPI 的 1000 的产品就是个反人性的产品 ， 对吧 ？ 你认为它是个反人性的产品 。

**楼天城** [38:05]
对 ， 反人性 ， 就是一个月接管一次的东西 。 我你找车主做这个事 ， 那估计我都不肯做这车主啊 。

说实在的 ， 我做这车主 ， 我得反问你要给我多少钱 ， 我来给你做这车主的呀 。 都不是我给你填身份证 ， 要给我很多钱我才肯做 。

**曼祺** [38:18]
就是在你这个逻辑里面 ，L2 和 L4 的目标是不一样的 ，其实我们严格去看这个定义 ， 它是不一样的 。

我觉得这个很好理解 ，但为什么后面市场里 ， 我觉得对两个东西有很多的比较 ， 确实是因为有一些不管你说是投资人还是什么人 ，他会期待说我 L2 再往下发展 ， 我是不是反而是 。

**楼天城** [38:38]
我这里肯定不能点名啊 ，但我举个例子啊 ， 长跑和短跑 ， 对于普罗大众来说 ， 通过强身健体可以同时提高短跑长跑的水平 ， 对吧 ？

**曼祺** [38:46]
嗯 ，是吧 ？

**楼天城** [38:47]
一定程度 ， 对吧 ？ 我身体好 ， 练得多 ， 然后整个直接很 fit， 对吧 ？ 我其实长跑短跑都可以 ，但如果你想成为专业运动员的话 ， 这俩东西可不能随便同时选 。

**曼祺** [38:56]
嗯 ， 对 ， 它一个可能是要爆发力 ， 一个是要耐力之类的 。

**楼天城** [39:00]
耐力 ， 对啊 ， 你博尔特是很难拿长跑冠军的 ， 就这个就 very impossible， 或者说就是没有短跑太厉害了 ， 它是绝对顶尖的长跑运动员 ， 所以它长跑反而就不可能拿了 。

但是这不可能 ， 就是有没有越过这个真正到专业运动员的这个坎的问题 ， 就像一个 Y 字形 ， 基础是分叉的 ， 就是真正过了那个点的人会真正理解到这两个有这么大的差别 。

但在过点之前的时候 ， 我会觉得哎 ， 好像对吧 ， 提升强身健体就能够长跑短跑都可以提升 ， 对吧 ？

前期的就这两个事情 ， 托尼刚好也是一个 ， 就是如果这两个同时做 ， 如果都要一起做的话 ， 对吧 ？

首先是这样的 ， 就是说前期的时候一些基础架构 ， 一些基本的一些机器的 setup 啊 ， 一些训练环境啊 ， 这些东西其实是共享的 ， 这个是的 。

但到后面你会发现 ， 比如说人类司机驾驶数据 ， 这是没法共享的 。 然后呢 ， 还有一个很关键的点 ， 这里其实是没有走过的分界点的一个关键点 ， 这是是就是说 L2 和 L4 关注优化的场景是完全不同的 。

就是 L2 有很多时候它会主动提醒接管 ， 对吧 ？ 我相信可能你有机会用过 L2 系统 ， 它有些时候会提示请接管 ， 我也经常发现这种情况 。

这刚好就有边界 ， 就是提示可接管这件事情主要是 L2 说我不喊动 ， 我让人来接管 。 而这些场景如何处理是 L4 的主要任务 ， 所以就他们两个的主要任务刚好是没有 overlap 的 。

**曼祺** [40:15]
你自己开的这个 L2 功能的车是什么车啊 ？ 特斯拉吗 ？ 还是什么 ？ 哦 ， 特斯拉国内不能开啊 。

**楼天城** [40:20]
我在美国开的 。

**曼祺** [40:21]
你在美国开 ？ 所以 FSD 的最新版本 。

**楼天城** [40:24]
但特斯拉头铁它不接管 ， 更多是我在国内的时候有些国内的吧 ， 比如说这个新能源车厂 ，他们的车同时在我街上坐一坐 ， 包括我们其实有这样的 effort 的 ， 如果你也知道的 。

这刚刚我 touch 上就这两个之间嘛 ， 就是说可能没必要放在一起 ， 或者发展到后期 ， 我觉得可能更多大家会意识到这一点 。

嗯 ， 发展到一定程度就会意识到这两个东西其实是分道扬镳的 。 但是我刚刚也解释了 ， 就是哪怕终局状态 ， 这两个之间差距非常明显 。

当然有个更蠢的说法就是说 ， 我如果做一个把两个都做到 ， 我一个极低成本做到 L4， 那当然可以玩啊 ， 这是对的 。

但是这个投入说实在的 ， 世界上没有人同时拿过长跑短跑世界冠军的 ， 这个之前没有被验证过 。 而且我如果做到这个 ， 我觉得我更有资源去养两支团队 。

**曼祺** [41:02]
你们现在还是 L2 和 L4 都在做吗 ？

**楼天城** [41:05]
应该说包括这次 IPO 更多其实是 L4，但是本质这些 effort 我们都在进行啊 。其实我刚刚说的情况也是我做了之后的一个理解 。

**曼祺** [41:13]
你觉得做 L2 这件事情 ， 除了帮你们有更多的技术理解之外， 还是说它更多是来自于一个你要商业化的压力了 ？

**楼天城** [41:20]
首先本质它也是一个针对社会产生价值的产品 ， 这没有问题啊 。 只是说单做 L2 本身也不表示有问题 ， 当然可能它的价值的产生的方式不太相同 ， 对吧 ？

可能会使得发展阶段和公司发展路径不同 ， 这可能是不同 ，但本质做这个也不是一个有问题的决定啊 。

**曼祺** [41:38]
但是我会觉得就是说 ，因为你在创业的过程中间 ， 请你资源还是比较有限的嘛 。 你刚才也说和 Waymo 和百度比 ， 你们是一个创业公司 ， 那这种情况下为什么要两个都做了 ？

**楼天城** [41:48]
可能技术用两个都做了 ， 我可能才能很好的回答你这些问题 。

**曼祺** [41:51]
因为两个都做了 ， 所以你对两边东西的这个上限 ， 包括它的技术 ， 你会有一个更深刻的认知 ， 对吧 ？

你有一个对比的视角 。

**楼天城** [41:59]
或者说也许我自诩一下说我们至少都通过了那个分界点 ， 所以我知道了这个情况啊 。

### 世界模型

**曼祺** [42:06]
那你刚才说你专门用了世界模型这个词 ， 你是想绕开 Waymo 的一个容易产生误解的 foundation model 的这个词 。

**楼天城** [42:14]
啊 ，因为 foundation model 大家会说大语言模型的 foundation model 嘛 ， 所以这个词啊 ， 我不想叫 foundation model， 我不想叫基础模型 。

**曼祺** [42:20]
但世界模型这个词其实也挺容易产生混淆的 ， 比如说这个乐坤 ，他也经常讲什么他要搞世界模型 ， 对吧 ？

然后包括李飞飞 ，他今年创业之后 ，他的目标也是说要实现大世界模型 。 就是这些世界模型和你们的这个世界模型 ， 它不是同样的概念是吗 ？

**楼天城** [42:37]
你们有个生成式的技术是相通的 ， 它用来做的事是完全不同的 ，是那个什么 ， 就是它是个训练环境这件事情 ， 叫模型就非常容易混淆 ， 人人都有歧义 ， 对吧 ？

因为它本质是个训练环境 ，但是我也肯定也没找到另外一个好的方式来描述这件东西了 。 但其实训练环境最重要的真的是世界模型部分 ， 就是从技术上这个表述其实不一定有错 ，但是确实很容易让人误解 。

**曼祺** [42:59]
它现在其实是一组模型是吗 ？ 包括一组模型加上一些别的东西 。

**楼天城** [43:03]
哦 ， 那它是环境 ， 它是四类东西啊 ： 数据生成器 、 生成场景 、 生成传感器数据 ， 然后刚刚说的 metrics 评价体系 ， 就是驾驶行为的评估体系 ， 然后高真实性的仿真 ， 四就是一些比如说场景在线或者数据挖掘的这个工具 。

我觉得它包括四类 ， 四个东西 。

**曼祺** [43:21]
生成 、 评价 、 仿真和挖掘 ， 对吧 ？ 数据挖掘啊 。

**楼天城** [43:25]
挖掘和引擎吧 ， 反正就是帮助训练一些东西的 。 那最后应该叫引擎可能也比较好的 ， 反正就它是四类东西 。

这四类东西中可能只有那个生成一定是个模型 ，其他严格讲都不完全一定是模型的 。

**曼祺** [43:38]
因为你说 Waymo 有个可能类似的东西吧 ， 就这个在行业里是属于挺多人都在做的 ， 还是它也是一个比较独特的做法 ？

**楼天城** [43:45]
我没办法了解到 ， 就是说我可能只能公开信息啊 。Waymo 肯定 ，Waymo 在那做 ，而且而且很多年了 。

**曼祺** [43:50]
你们自己这个东西比较成熟是到什么状态啊 ？ 我觉得 22 年我们聊的时候 ， 可能聊的更多的是你刚刚说的这四个东西里的评价的那一部分 。

**楼天城** [43:58]
当时只缺最后那个引擎了 ，但是那个引擎呢 ， 我们通过一些人为的方式吧 ， 就比较手动的方式做很多这样的事情 。

我觉得也不一定算就没有啊 ，因为你这人去操作也不一定算不算引擎 。 所以那时候严格讲该有的东西有了 ，但是就是说更让它自动化或者更高效 、 更高的精度 ，也是现在这两年做的很多的事情 。

**曼祺** [44:17]
嗯 ，在这个世界模型里面 ， 比如说你们考虑的世界的维度和考虑的这个车开的好不好的维度都是些什么呀 ？

**楼天城** [44:23]
那这俩都挺重要的 。 那先说那个开好不好维度啊 ， 就是之前说的安全 、 舒适和效率 。其实舒适和效率其实相对比较好评价 ， 安全的很有意思点 ， 就是安全 、 安全感之间的差别 ， 这个我说可能难明白 ，但真做起来非常难 。

就是有时候不安全的感和不安全是两码事 ，其实就是对一个安全感的一个很好的模拟 ，其实是个非常难的事情 。

这是一个维度啊 。 还有一个其实是就是刚说指标 ， 我记得上次可能 22 年应该提及吧 ， 就是 per scenario 和 per context 的指标 ， 就指标做得很高的精度要特别细 ， 否则你会被很多测试中的噪声所淹没 。

指标体系的精度 ， 一定程度世界模型精度很大由它决定 。

**曼祺** [45:01]
嗯 ， 这个指标体系做细 ， 它前期可能有很多人工的部分 ， 后来它是越来越自动化是吗 ？

**楼天城** [45:07]
大致发生这样过程吧 ，但目标是为了很细粒度的指导一些真正模型训练的过程 。其实这个指标是公司核心竞争力啊 。

**曼祺** [45:15]
核心竞争力 ， 所以是不能讲得太细是吗 ？

**楼天城** [45:17]
我就不说具体怎么做 ，但这其实是核心竞争力 。

**曼祺** [45:20]
当然我觉得其实你整个思路还是分享得比较完整的呀 。 你是觉得就是说现在我们去公开对外讲这种东西也不太要紧是吗 ？

其实对手可能也不会说听见你讲了 ， 然后他就怎么做 ， 或者说他马上就能学会 。

**楼天城** [45:33]
Defining the details 吧 ， 我觉得 ，而且还有那个两年的问题啊 。

**曼祺** [45:36]
哦 ， 魔鬼在细节以及要时间 。

**楼天城** [45:38]
对 ，而且两年是就是说你可能很多事情坚持了一年半 ， 简直没有任何结果 ，但可能只要再坚持半年就可以 。

但是可能就在黎明前的黑暗那一时刻就放弃了 。

**曼祺** [45:49]
这个它既跟你的技术判断和你的对这个事的技术上有多相信有关 ， 另外我觉得它也是一个考验心力的东西啊 ， 理性和感性交叉的这个部分啊 。

**楼天城** [45:58]
是 ， 然后刚刚你只说了那个 metrics 呢做什么 ， 然后那个生成相关的其实就是刚刚说的那个交互行为模拟 ， 我觉得是最关键的 。

因为静态东西相对今天 ， 我觉得大部分生成工具 ， 我觉得因为生成工具不只有我们家做 ， 做一些静态东西应该很多家都做到了 ，而且效果确实还可以 。

但是交互的模拟其实挺难的 ， 就是用智能的方式模拟其他交通参与者 ， 然后让智能体跟我们自己车进行互动 。

但关键是它要真实 ， 做好才能变得真实变得复杂 。 或者这么说 ， 车辆高峰期的表现其实跟它直接相关 ， 如果有家车高峰期的表现不好 ， 那一定是这个没做好 。

**曼祺** [46:33]
就交通高峰期 ， 对吧 ？ 就是车上的各种什么人啊 ， 什么自行车 ， 最复杂最多的 。

**楼天城** [46:38]
就是交互 ， 对 。

**曼祺** [46:39]
哎 ，在你们的这个世界模型的这个里面 ， 用的比较多的一些技术 ， 它比如说可能像呃大语言模型 ， 它是一个 transformer 的架构 ， 对吧 ？

那像你们你们这个其实是用一些比如说更之前的 ，不需要参数那么大的神经网络也可以是吗 ？

**楼天城** [46:52]
呃 ， 首先 transformer 跟网络大小不一定有直接联系啊 ， 就是架构也在不断升级 。 就那个 AlphaZero 嘛 ， 就是围棋的那个胜负 ， 只要写些规则就完全去写好了 ，而且是 perfect 的 。

嗯 ， 就是一个东西很复杂 ，但描述它好坏不一定很复杂 。

**曼祺** [47:07]
我其实只是想问的是说你们 ， 比如说你们需要什么背景的人吧 ， 就他会什么技能 ，他可能能帮你们做好这个东西啊 。

**楼天城** [47:14]
In general 呃 ， 就是各非常全面的 engineering 吧 ， 就可能之前好像我 touch 过一嘴 ， 就是说 engineering 本身的这个关键 ， 可能也符合 AI 公司的核心竞争力吧 。

就是 AI 的东西也在不断的发生变化 ， 各种新的架构 、 新的做法 、 新的训练 ， 甚至包括一些新的这种完全不同的理念都在经常发生 。

所以整体我仍然觉得 engineering 是这个关键 。

**曼祺** [47:35]
Engineering 它指的是编程的能力 ， 还是算法的能力 ， 还是什么 ？

**楼天城** [47:39]
这几个不一定有这么大的区别啊 ， 这大概就是你说的这些啊 。 但是就真正 engineering 其实大家往往会看在自己某些方面 ，但刚你说的那些点基本上如果好的话都会挺好 。

**曼祺** [47:50]
我之前就是跟自动驾驶行业的人聊 ， 就有一个从业者 ， 我觉得他有个观点 ， 我可以讲一讲 ， 你可以听一听啊 。

就是他认为小马最开始是汇聚了一批非常顶尖的 top coder， 然后他觉得端到端这个范式来了之后， 当然你们可能也不是这个范式啊 ， 总之他觉得就是这个新的技术变化之后 ，他觉得呃 top coder 没有那么重要了 ， 重要的可能是数学好的 ， 或者他对这个架构更敏感的 ，有整体观念的人。

你怎么看这种想法 ？

**楼天城** [48:18]
这偏 learning by watching 的概念思路吧 。 如果我做 learning by watching， 我可能也会这么想 。 我觉得 learning by practicing 可能还是不是这样子的 。

这个难点是在于很多具体的问题需要真正去分析怎么做 ， 去想怎么做 ， 去尝试实践 。 就是它也没有标准答案嘛 。

啊 ， 本质上是那些人可能自己也在自己给自己做个强化学习的啊 ，其实需要一些很多这样的工作 。 所以我觉得人还是很相关的在这里面 。top coder 这个词 ， 首先谢谢他对早年的认可 ，但我觉得可能就是真正优秀的 engineer 吧 。

但后来我觉得我们也 diversify， 就各种其实全面的 engineer。

**曼祺** [48:52]
你们实际上投入了多少人和资源来做成这个事情 ， 做到一个或者说到现在这个状态吧 ？ 我指世界模型啊 ， 你们有计算过吗 ？

**楼天城** [49:01]
啊 ， 所有啊 ， 或者说啊 ， 所有软件的人都可以认为在做世界模型啊 。

**曼祺** [49:06]
那你们车端的人不是也是软件的人吗 ？

**楼天城** [49:08]
不是说有些人他就只做车端 ，他两边都做 ， 或者说他可能需要自己真正把世界模型可能提升精度 ， 然后在训练中好坏之后， 然后再反馈写世界模型哪里不对去做 ，并没有直接分 ， 就是不这么分工 。

比如小马从不会分什么叫啊 ，但回到比如说互联网公司 ， 你说分为做算法 、 做英文吧 ， 这么说吧 。

**曼祺** [49:29]
对 ， 做模型的 、 做算法的啊 。

**楼天城** [49:31]
我们从不这么分规控的问题 ， 感知问题这个还是有的 ，但是绝不会说做训练和做那个做架构的 ，不不不 ， 从不这么分 ， 就应该都会啊 。

**曼祺** [49:38]
你觉得你们现在这个世界模型 ， 或者说你们投入了最重点的精力去做的这个 factory 工厂的部分 ， 它还有什么不完善的要提升的地方 ？

**楼天城** [49:47]
那还是挺多的 ， 我想想哪些是方便方便 share 的 。 对啊 ，其实就是对传感器 ， 应该说更便宜的传感器 ， 它会带来一些实时信号质量的下降 。

像你应该知道我们最新一代车用的是那个 ， 用的是 AT28，是用的是半固态 ，不是用的不是机械 。

**曼祺** [50:03]
哦 ， 核塞的 。

**楼天城** [50:04]
它的是直接接 ， 对 ， 核塞的 ， 对 ， 就是它的那个啊 ， 这也被合法广告了 。 就它在比如说雨天 ， 它的可能质量肯定跟之前的机械的是有很大的差距的 。

所以这里其实真正做法是要通过这个 ， 比如说我们对这个传感器 ， 我们需要能够生成这样的这个什么问题 ，但这方面的把握其实并不是很 ， 这个我觉得应该说需要进一步把握好之后， 才能进一步用更更好用这些低成本的传感器 ， 应该是用的更好一些 。

就是我们做了很多工作 ， 我们至少做了两年时间把它 compensate 回来 ，但是我觉得还需要我们往前走 。 还有当然本身各种精度了 ， 比如刚刚说的 metrics 提升精度啊 ， 各种交付精度 。

我刚说几个是从 0 到 1 的啊 ， 一个是更好的模拟这些 ， 这个在极端极端天气下吧 ， 这些传感器的状态 ， 这种生成其实是一个那个点 。

还有一个我觉得其实有一个我因为它去做蒸馏 ， 就这个蒸馏 ， 此蒸馏可能非这个呃 ， 就大家说大语言模型那种这样的蒸馏啊 ， 就这个跟那个 L2L4 不是 L2 中的那个蒸馏 。

就是说首先我的 L2L4 我觉得就是叫就算没有蒸馏 ， 它也没法预约这个看 。 这个蒸馏其实就是像更大算力的自己学习嘛 。

就现在在本身我觉得某种程度上说接下来基本上很多任务是控制成本啊 ， 刚说的传感器是一个方面 ， 还有就是算力方面 ， 这个也是我们现在世界模型在是是这个引引擎在做的一件事 ， 就是把那个超大算力 ， 就是让它能够能够做蒸馏这件事情 ， 就是本质像更大算力自己学习 ，是这个逻辑 。

**曼祺** [51:26]
像更大算力自己学习是什么意思 ？

**楼天城** [51:29]
啊 ， 刚才不是说有个像未来自己学习吗 ？ 嗯 ， 像更大算力就是比如说对吧 ， 我当年做题的时候 ， 可能我做了三天做成这个样子 ， 我努力让自己三个小时就能做到三天做的事 。

通过这种不断的 ， 比如说你可以认为是推演或者是仿真 ， 能够知道自己如何蒸馏是正确的方向 。

**曼祺** [51:45]
你指的是说在一个使用算力相对小的情况下， 它去做到在算力相对大的情况下的那个类似的状态吗 ？

是这个意思吗 ？

**楼天城** [51:52]
对 ，而且它能够闭环制造效果 ， 它不是只是说那些模型效果 ， 它能够闭环制造 ， 对吧 ， 我究竟差多少啊 。

**曼祺** [51:59]
哎 ， 你反复说的这个闭环 ， 你说的这个闭环是什么意思呀 ？ 你你会怎么描述 ？

**楼天城** [52:03]
就 practicing，practicing， 就是我能够在里面真正开着开到那个状态 ， 就是我知道了我做了做这个变化之后， 对我的 consequent 究竟是什么 ，而不只是对我的决策是什么 。

开环的意思基本就指的是说 ， 我能够比如说我做了一个改变 ， 我知道我每一步的决策的变化是什么 ，但是我并不知道我这个决策变化之后对我带来的实际影响是什么 ， 比如说会开的多了些事故 ， 或者会我会开的更猛一些 ， 这这种实际的结果其实通过闭环达到的 。

我这一帧的输出会影响下一帧的输入 。

**曼祺** [52:30]
呃 ， 接下来这个世界模型它再往下发展会 ， 比如说你设想中啊 ， 它比较终极的状态它会是什么样的 ？

它能达到什么作用 ， 能实现什么 ？

**楼天城** [52:40]
我想过这个问题啊 ， 我觉得 ultimately zero at fault 的问题吧 ， 就是车不再发现由错误产生的问题 ， 至少不会遇到自己发生错误产生的一些 incident 的这样的问题 。

**曼祺** [52:52]
但是它也没有完全解决掉 incident， 对吧 ？ 就还是可能会有 。

**楼天城** [52:55]
是没办法的 ， 别人撞你是躲不开的 ，有些时候 。

**曼祺** [52:58]
除非路上都是这种车 。

**楼天城** [53:00]
这是很 drama 的状态 ， 我其实也不一定容易所想 ，但是这个这个很 drama， 这个可能都不是短时间的未来的 。

**曼祺** [53:07]
那你刚才说的那个 ， 就是它未来会不再因为错误产生事故 ， 这个事你觉得是多久以后的未来了 ？

**楼天城** [53:14]
啊 ， 这个未来我觉得也得按十年级吧 。

**曼祺** [53:17]
十年级 。

**楼天城** [53:17]
今天让我觉得达到一个能用 ， 比如大部分一定规模运营 ， 这个我前面提到了 ， 我觉得 OK， 这个有点属于探索 AI driver 的极限来考虑了 ， 我觉得需要一些时间 。

### 商业化与规模

**曼祺** [53:27]
那我们在接下来两三年会看到些什么 ？ 比如说你们之前其实预测过说你们觉得 26 年左右是呃 Robotaxi 可能要开始比较大规模商业化运营的状态 。

**楼天城** [53:37]
这可能要设定业务了 ， 这可能不是完全的那个技术 。 当然前面可能提到一个 ， 我们跟百度 Waymo 的一个策略上不同啊 ， 我们需要一个成本结构会更合理 、 更优的状态下再开始扩大数量 ，但这个两年肯定要做到 ， 我觉得甚至一年多也要做到一个更优的成本结构下的规模化运营 。

**曼祺** [53:55]
有更优的成本之后， 你们规模会到多少啊 ？

**楼天城** [53:58]
啊 ， 我觉得先到千 ， 然后下一步的话应该再会涉及 ， 应该说新一代的这个硬件车的平台 ， 然后到万到几万 ， 后面那个万到几万我觉得还要再花两三年啊 。

就这一代也是可以在基于现有的车 ， 只是把成本结构做好 ， 这个我觉得是一到两年的事情 。

**曼祺** [54:14]
你觉得到什么数量 ，其实 Robotaxi 的公司才会到一个盈利线啊 ？ 就最少你得是一个什么规模的车队 ？

**楼天城** [54:21]
算毛算毛利还算净利 。

**曼祺** [54:23]
啊 ， 都可以算啊 ， 可以先算毛利再算净利 。

**楼天城** [54:25]
毛毛毛利 ， 毛利我毛利我觉得千就可以 ， 净利我觉得要到 5 万 。 那千我觉得就是我说的一两年的任务 ， 就是其实一两年的那个 ， 我说的成本结构某种程度另一种表很好理解 ， 就是毛利嘛 ， 对吧 ？

或者说如果毛利正 ， 我真的就没有道理不加不再加规模了 ， 对吧 ？ 然后真正到净利的话 ， 我觉得需要这个应该是 5 万这个基点 。

**曼祺** [54:45]
净利到毛利中间的数量差别比较大 ，是因为你们研发投入这些特别多 。

**楼天城** [54:49]
而且要持续投入 ，而且要持而且要持续投入 。 而且说实在 ，其实毛利转正之后， 净利转正的时间点和整个发展速度之间是个平衡 。

**曼祺** [54:56]
因为你可以选择铺更多规模 ，不要那么快的去追求这个净利 ， 对吧 ？ 这看你的策略 。

**楼天城** [55:01]
对 ， 对 ， 这是这是这个策略 。其实我觉得就是整个 L4 行业有一个转折点是在什么时候了 ， 就是 21 年特斯拉开始卖的特别好的那个时候 ， 包括那一年他们自己也开了 AI Day， 然后他去讲他纯视觉感知上的一些东西 。在那之前 ， 我觉得大家是不怎么去比较 ， 就是特斯拉这个路线和 Waymo 路线的 。

但是后面这件事情就基本上成为了行业的一个就天天讲 、 月月讲 ， 然后一个非常老生常谈的话题 。 它最后其实还是一个商业化的问题吧 ， 就大家觉得你这事 Robotaxi 到底最后能不能赚钱 ， 会不会反而是像特斯拉这种做 L2+ 的 ， 我反而最后我把这个生意给挣到了 。

嗯 ， 我觉得不是二选一吧 ， 这两个都可以做得很好 。

**曼祺** [55:42]
那你觉得特斯拉要来做 Robotaxi， 它会怎么做了 ？ 它的做法和 Waymo 和你们会有什么本质的不同吗 ？

### 路线之争

**楼天城** [55:49]
啊 ， 那我觉得肯定不会 ，因为它是 Tesla， 它 learning by watching the work。 我觉得它如果继续坚持 learning by watching， 它将来有一天总会意识到 work 的 ，但也许今天已经 ，也许今天已经意识到了 ，因为我听一些某些更细的地方的 talk， 好像已经甚至已经意识到了啊 。

但 learning by practicing 这条路线走 ， 对吧 ？ 我们都走了 5 年、8 年， 呃 ， 它可能有虽然有更多资源 ，也许有更大的决心 。

如果有的话啊 ， 那它也要走 ，也我觉得也得走一段时间吧 。 我觉得就先从比如它有 DMV license 说起呗 。

**曼祺** [56:20]
哈哈哈 ， 嗯 ， 对 ， 它开这个发布会的时候 ， 确实它什么监管的事 、 运营的事 ， 它基本都没讲啊 ，但它展示了 20 辆车 。

**楼天城** [56:30]
但我觉得 ，但我觉得说不定从 positive side 可能它已经意识到了 。

**曼祺** [56:34]
你从它什么一些细的 talk 上， 你你你感觉到它有意识到 learning by watching 的局限 ？

**楼天城** [56:41]
因为比如说 XAI 做的很多的一些理念 ，其实就有这方面的理念 ，但它不是用来做自动驾驶啊 。 嗯 ， 它说的加一略加一略的逻辑嘛 ， 对吧 ？

其实就有一些 ， 就有一些要跳出人类模仿的这个的逻辑 ， 说不定它能意识到这一点 。

**曼祺** [56:56]
嗯 ， 你刚才说这个 Robotaxi 和这个 L2+ 的不是一个二选一 ， 可能不是一个替代的关系 ，但如果说未来就是这种无人出租车非常普及的话 ， 它对私家车这个生意会有冲击吗 ？

**楼天城** [57:09]
这是用户角度 ， 我刚刚只是说技术线角度 ，不会 ， 就是我可以我前面说了很多 ， 为什么一个 L2 的系统就做不到 L4， 那反观 L4 系统 ， 那很简单 ， 它的成本性价比很低 ， 就这件事情它都不能取代 L2 系统 ， 所以反向也不能取代 。

这是个产品形态问题 ， 如果一个产品被取代 ， 世界上有很多产可以被产取代的产品 ， 这个真不只是这两个 ， 这两个情况 ， 这个其实呃 ，其实就从价值角度吧 ，其实更多还是就将来这个就驾驶和这个 driver sharing 之间的这个平衡 ， 我觉得更可能是这更长期的一个状态 。

但 L2 基于私家车 ， 就如果私家车因此受损的话 ， 那 L2 会受到影响 ， 没错 ，但 L2L4 一样嘛 ，因为共享出行受损 ， 那 L4 一定有受到影响 ， 这两个其实是是平等的 。

当你说 L4 有天做到私家车 ， 那是另外一个 topic 啊 。

**曼祺** [57:54]
L4 做到私家车 ， 嗯 ， 对 ， 那可能就就是你说的 ， 你这个要看未来的成本吧 。

**楼天城** [57:59]
嗯 ， 我觉得可能对成本且你真的愿意接受吗 ？ 比如说你有私家车有 L4 的功能 ，但可能要你付个 6 万 、8 万 ， 你不知道愿不愿意付这个钱 ， 就这其实也是一个 ， 就是它带的价值是真正是不是用户所接受的一个问题 。

当然如果以前真降到两三万 ， 可能有人接受啊 。

**曼祺** [58:16]
哦 ， 特斯拉现在就是 6 万 ，其实 1 万美元嘛 ， 六七万吧 ， 差不多如果换算人民币 。 嗯 。

**楼天城** [58:23]
啊 ，不 ， 那是 Tesla。

**曼祺** [58:24]
你就说这个可能就没有那么普及 。

**楼天城** [58:27]
我我们做做 ， 我们做是做不到的 。 对 。

**曼祺** [58:29]
啊 ， 我最近和那个滴滴自动驾驶之前的 CMO 孟歆聊 ， 她有一个挺有意思的观点吧 ， 然后她自己也说这是暴论 。

她就说如果有人能把 L5 做出来 ，也就是真正的完全的不受任何环境限定的无人驾驶 ， 她觉得应该是做 L2 的公司 ，而不是做 L4 的公司 。

然后她大概的逻辑是说 ，因为 L2 是一种体验型的产品 ， 就类似于卖给消费者的智能手机 ， 然后它是要靠一代比一代强去往上卷的 ，不断卷这个体验的上限 。

但是 L4 面上的这个出租车市场 ， 它是一个效率型的产品 ， 过了安全效率的红线之后， 核心使命就是扩规模和降成本 ， 所以它不会去无限的卷这个体验的上限 。

你你怎么看这个想法 ？

**楼天城** [59:10]
啊 ， 首先我觉得这事本身都不一定存在啊 ， 最终不会 converge， 我觉得因为它们会有各个分别性价比好的方式存在 。

**曼祺** [59:19]
你的 point 就是说大家并不共享 L5 这个目标是吗 ？

**楼天城** [59:23]
L5 可能会是一个另一个方式存在吧 ， 这个话题可能得稍微远了一下 ，但我就我先正面回答这个点 ， 就是说就是技术发展作为一个新的技术来说 ， 它应该先考虑的其实是如何真正 take 已有技术的真正的优越性 ， 然后再考虑是通用性这一点 ，因为已有的优越性其实更难的 。

而这点事情上来说 ， 我觉得对啊 ， 就是也许我觉得是做 L29 或者他们没有意识到 ， 比如做到 L4 需要经历什么样的路 ， 需要重新起炉灶 ， 需要做什么 。

而 L5 我的也默认其实需要有 L4 的能力或者是 AI 驾驶员的 ， 就这个难度可能被低估 ， 这可能也是一个这样的因素啊 。

就是说你可能我低估了就更大范围扩展的这个这个的困难度 ，但是我觉得就是 Transformer 架构端到端之后， 这方面其实的 cost 在在逐步的下降 ， 所以这个其实反而是最新技术中给这个 Robotaxi 将来发展带来的便利 。

嗯 ， 就是通用性 ，其实通用性其实随着技术发展 ，其实这个的进步远比这个很多私家车它的自动驾驶安全性进步要大得多 。

**曼祺** [1:00:24]
就你觉得从 L4 到 L5， 它是一个主要要解决的是通用性泛化的问题 。

**楼天城** [1:00:29]
对 ， 这个其实这几年的进步是很明显的 。 但是你说从 L2 到 L4， 这这个安全的指标进步 ， 先不说别的 ， 它那个 1,000 怎么越过还不知道呢 。

而且还有就是它需要摒弃 learning by watching， 这个可不是一个小的 effort。

**曼祺** [1:00:42]
嗯 ，而且可能你公司越大越做这种决策会会更难 ， 就像比如创业公司 。

**楼天城** [1:00:48]
对啊 ， 这个一定程度需要要放弃自己所谓之前 show off 的擅长的东西啊 ， 这个其实是一个很大的挑战啊 。

或者我说可能因为吧 ， 就是我做 L4 时间久了之后， 我可能对 L4 的安全的 qualification 条件有更多的认知 ，但这也是我觉得对吧 ， 就做的不是很深的人可能这方面有一些误解 ， 就是觉得安全指标这样做的 ，但是其实差的非常远 。其实孟歆这个逻辑 ， 它并不是从技术上来的啊 ， 它它是从一个竞争 。

**曼祺** [1:01:14]
啊 ，fundamentally。

**楼天城** [1:01:14]
对 ， 它是从一个竞争进化的那个角度 。 啊 ， 明白 。 那另一位的像现现在就是从我从更感性的方式来说 ， 对吧 ？

我们看很多 L2 系统 ， 我们觉得是就是说它有些场景 work 一次 ， 哇 ， 比如说遇到一个什么呃 ， 我这这个既然说的无保护左转 ， 对吧 ？

之前说的一些什么 ramp， 或者之前说的一些城市内的一些夹塞的一些处理 ， 对吧 ？ 一些一些 run run about， 大家都是觉得哇 ， 能做一次好厉害啊 。

但是我怎么觉得 L4 就是说有一次做不到 ， 大家都会喷它 ， 这个理念差距太大了 。

**曼祺** [1:01:45]
啊 ，而且我觉得你作为一个 L4 公司的 CTO， 如果你对比其他的做 L2+ 的这种车企或者 CEO， 我觉得确实大家的叙述会不一样 。

比如他们有的时候会去给你描述一些他遇到的 corner case， 然后这个车处理的很好的案例 。 但其实你很早就说过 ， 你说你觉得就是靠你自己去做车 ， 你已经感受不到什么了 。

**楼天城** [1:02:06]
这个话可能上次因为还不一定到 ， 我还没说出这个话 ， 就是要正视能力的 ， 正正视人类能力的不足 。

就是我看 AlphaGo 下棋 ， 我看不懂 ， 我会不会觉得说是因为它下错了一样 。 今天我看我的车 ， 我有些不理解 ， 我不理解 AI 司机行为 ，有时候我不敢清楚它做错了 ， 可能是因为它更高 ， 它有更高的智慧 ， 它想到一些我没想到的东西 。

就是跟 AlphaGo 下棋那个其实应该很好的例子 ， 对吧 ？ 看 AlphaGo 下棋 ， 我可不敢轻易说它下错了 ， 虽然经常我经常看不懂 。

### 运营与竞争

**曼祺** [1:02:36]
嗯 ， 就你们在这个扩大运营范围这件事上， 你们遇到了什么一些技术的或者工程的问题吗 ？ 包括你们是怎么解决的 ？

**楼天城** [1:02:45]
这是过去式了 。 首先今天的运营范围其实主要限制是车数 ， 就是说因为我不可能把比如百辆车放在全北京的 ， 早就找不着了 。

对啊 ，因为我要保证在一个区域内 ， 大家打车能够一定时间内打到车 ， 所以其实车队规模其实是是真正的运营范围的关键 。

嗯 ， 我先解释这个问题 ，但是说扩大规模这个事情可能要那个下回去 ， 这可能是 L2 L4 另一个误区 ，但是这这个错误我们才知道这到底是什么判断错误啊 。

就是 L4 的挑战其实是极端场景 ，不是不是不是公共场景 ， 就是一些普遍的驾驶习惯不同 ，其实对它来说不算什么事 ，但它关注的其实是极端场景的 pattern 相不相同 。

极端场景中， 比如说我们说的一些就不是非常理性的一些驾驶行为 ，有些一些就是一些疯狂的行为 ，其实 creating things 就是 around the world share the same pattern， 就连中美都是一样的 。

两个区域大家平时日常驾驶行为可以很不同 ，但是发起风来是一样的 。

**曼祺** [1:03:38]
嗯 ， 发起风的这个解决方法 ，因为因为你车上没有人嘛 ， 所以就包括你的怎么把车拖走啊 ， 这种很多细枝末节的这种运营上的事 。

**楼天城** [1:03:47]
这这个确实有些运营上的那个不同的东西 ， 运营可能需要根据不同地域有一些不同的那个点啊 ， 特别是呃 ， 需要做很多人类司机的当 ， 就人类司机其实做了很多关于车的事情 ， 这些事情其实都需要另做 。

对 ， 这可能也是它的不同 。

**曼祺** [1:04:01]
就人类司机关于车做的各种事 ， 就除了开车以外的各种事啊 ， 你们现在是就百分之多少能靠机器 ， 靠系统自动化的去做 ？

**楼天城** [1:04:09]
啊 ， 我觉得就比较那个什么吧 ， 比较 heavy 的 ， 就这也有人车比的概念 ，但是现在你取决于非常低的比例了 ， 就是自动充电 ， 就你说这样的东西就插电枪嘛 ， 可能有时候需要人确认一下， 然后一些车辆自自检需要确认一下 ，但除此之外应该都还好 。

这个也花了些时间 ，但这个呢 ， 我没这么担忧的是因为这个其实有一些你有的经验啊 ，其实很多出租公司他们租车公司 ，他们天生就是车辆保有 ， 就是他们的主要的核心的这个竞争力 ，其实跟他们其实我们更多是通过合作来做的很多事情 。

**曼祺** [1:04:39]
那么通过合作的话 ， 出租车公司的这个车辆保有 ， 那它怎么做就是它自己的事了 ， 对吧 ？ 它有可能是派人去做 ， 或者它怎么去做都可能 。

**楼天城** [1:04:47]
它可做我们的车跟做其他车只要是一样的 ， 对它来说也是一个一样的生意嘛 ， 就是不要因为自动驾驶的套件给它造成那个额外的负担 ，其他就是一样的了 。

**曼祺** [1:04:56]
你觉得未来到什么时候是就远程是不需要人控制 ？

**楼天城** [1:05:00]
远程本来就不控制啊 ， 远程只是给些建议啊 ， 一般做到 1:30， 你就它什么时候要要你破事你再说 ， 它不烦你没事 ， 你就休休息就行 。

大概 1:30 我觉得是一个非常可 ， 就这个其实不太 worry。1:30 我觉得是是应该说正常的是该做就能做到 ， 然后 1:30 再往上涨 ， 我觉得从 margin of cost 上优化意义也有限了 。

**曼祺** [1:05:21]
从 1: 就你们现在 1:10，1:12 到 1:30， 你觉得这个东西中间没啥障碍 ， 对吧 ？

**楼天城** [1:05:26]
我觉得没有 ， 就很多东西的这个依赖性和自动化这个做好其实差不多了 。 那这就反过来就又是反直觉的 ， 刚好因为当初 L2 说 9 折 ，L4 反正就说过多 ， 比如说过多的人盯着这件事情是降低安全性的 ，因为盯着它会误操 ， 它会误操作 ，因为就是盯着的这个人 ，他的驾驶能力是不如那个 AI driver 的 ，他盯可能会帮倒忙 。

就是说他这种时候真要强势去控制 ，他一定不如那 likely 不如那个车做得好 ， 所以它会增加安全 ， 增加危险性 。

**曼祺** [1:05:58]
你们今年接触高德之后， 你觉得看到什么业务上的变化吗 ？

**楼天城** [1:06:02]
啊 ， 这是那个另一个合作方面 ， 刚开始刚说了一些 ， 比如车辆运营上的 ， 这个是获客方面 。 对 ， 这个其实我们也是啊 ， 再把做初创公司也是结合各家的那个真正做得好的地方 。

高德的一个好处其实就是说 ， 就是它解决那个车数跟区域的那个问题 ， 就是说我可以在一个很大区域也有很少的车 ，因为它不是每次都一定要派我的车 。

**曼祺** [1:06:21]
因为现在这个 L4 的 Robotaxi 市场变得更暖之后 ，其实我们也看到一些变化 ， 比如说有一个人事变动 ， 就之前本来担任滴滴集团 CTO， 同时是自动驾驶公司 CEO 的张博 ，他就不再担任集团 CTO 了 ，他是要全部的精力去做自动驾驶 。

然后我也看到他和滴滴自动驾驶团队的人说 ， 说他和陈维也反复讨论了很久 ，他觉得现在是一个非常好的 timing 去 all in 这件事情 。

我也知道中国其他的大科技公司里也有在筹划要做 Robotaxi 的 ， 就不是百度这些已经做了比较久的 ， 就能感觉到这个市场有更多有资源 ， 好像也挺有决心的人在加入 。

你觉得这个会对你们接下来有什么影响吗 ？ 包括对行业有什么影响 ？

**楼天城** [1:07:04]
嗯 ， 我觉得首先这么说吧 ， 行业我觉得这些玩家竞争还是小事吧 ， 我觉得更多的还是先把市场做起来 ， 就大家我们加起来能有 1% 已经很不错了 ， 说实在的 。

**曼祺** [1:07:17]
那你就说在出行市场里有 1% 是吧 ？

**楼天城** [1:07:19]
啊 ， 对啊 ， 对啊 ，是吧 ？ 对 ， 嗯 ， 我还没管将来跟私家车的竞争呢 。

**曼祺** [1:07:23]
像滴滴这种 ， 它本来就有一个运力网络 ， 它来做 Robotaxi， 和小和小马这样 ， 它其实你们最开始是不掌握这个运力网络的 ， 对吧 ？

你们是从小范围的车队开始做 ， 你觉得未来这两类公司会怎么怎么相遇啊 ？ 是什么关系 ？

**楼天城** [1:07:37]
哎 ， 这个这这个方面竞争方面要不我就不多过多 comment 了 。

### 创业感悟

**曼祺** [1:07:41]
哈哈哈 ， 最后就是想聊些那个你个人的一些情况 ， 还有就是创业的一些情况 。其实小马从最开始成立 2016 年底到现在也是有 8 年的时间了 ， 跟抗战的时间差不多啊 ， 当然你们现在应该还不算最终的胜利啊 。

然后你之前其实也短暂的创业过 ，是加入类似了知乎的一个美国的问答平台 ， 叫 Coral， 然后就看起来和自动驾驶是很不同的方向 。

就是你觉得从什么时候开始 ， 你是把自动驾驶作为自己非常长期的一个使命 ， 希望一一直做下去啊 ？

**楼天城** [1:08:13]
不 ， 很对 ， 例子例子举的挺好的 。 首先抗战 13 年， 不是 8 年， 这个已经教科书已经改了 ， 我记得 。

**曼祺** [1:08:19]
哦 ， 哈哈哈 。

**楼天城** [1:08:20]
嗯 ， 对 ， 我在我在 Coral 之前也在 Waymo 工作 ， 所以我在之前也在也在做自动驾驶 ， 所以其实应该说呃 ，也做做了挺多年了 。

从个人来说 ， 那个什么吧 ，其实是一种信念 ， 就是 AI 超越人的这个信念 。 那时候其实还没有 AlphaGo 的时代啊 ，但我觉得 AI 最终很多时候能够做到比人好 ， 就是这个理念其实是换到今天车上来 ， 我这理念是说 。

对 ， 我们经常会说成本低或者将来成本结构这些东西 ，有些人说的也挺多的 ，但本质上在那个维度 ， 我并不接受 AI 的这个整个做的 AI 司机的出行体验比人差 ， 我并不接受这一点 。

我觉得就是一个 AI 做 ， 它能它能提供更好的体验 ， 哪怕一个 fair 的价格 。 嗯 ， 就这个我是我是我不觉得就是将来 Robotaxi 是靠低价打市场的 ， 这个并不是 。

我觉得它能够在体验上做的比人好 ， 就更 consistent 的整个驾驶行为会好 ， 更安全 ， 这些都应该是它就是比人做的好的 。

**曼祺** [1:09:14]
嗯 ， 那速度上也能更快是吗 ？

**楼天城** [1:09:16]
今年董成币那个上面 ， 我们是我们比人司机还快啊 。

**曼祺** [1:09:19]
嗯 ， 对 ， 就各种效率的 、 安全的 、 舒适的平衡 。

**楼天城** [1:09:23]
对啊 ， 就整个整个驾驶上啊 ， 包括 consistent， 就是说我们就是你就你会你面对一个非常 consistent 的体验啊 。

**曼祺** [1:09:30]
我们上一次采访 2022 年的时候 ， 我我有问过说你心中自动驾驶 Robotaxi 的最大价值是什么 ？ 如果今天再问一次这个问题 ， 你会怎么回答 ？

**楼天城** [1:09:39]
还是那个吧 ， 真正颠覆就是 revolution that translation 嘛 ， 真正改变出行啊 ， 改变人和路这样的关系 。

**曼祺** [1:09:46]
这 8 年里你自己觉得最怀疑 、 最犹豫的阶段或者时刻是什么 ？

**楼天城** [1:09:52]
因为前面踏出世界模型这个事啊 ， 那个时候确实是很艰难的一段时候 ，但你真说怀疑也不算吧 。

**曼祺** [1:09:59]
所以有艰难的时候 ， 没有怀疑的时候 。

**楼天城** [1:10:01]
就是首先不断克服困难很正常 ， 所以也倒不是不犯不着为一些困难所怀疑啊 。 如果如果有一天我真怀疑 ， 或者真不是怀疑 ， 就是有些犹豫或迟疑的话 ， 我觉得往往 likely 不是因为遇到了很多困难的事情 ，而是因为有一些奇怪的诱惑啊 。

**曼祺** [1:10:18]
有一些奇怪的诱惑 。

**楼天城** [1:10:19]
对 ， 这个观点我一直这样说 ， 就是因为人不能坚持 ， 大部分人不能坚持 ，不是因为太艰苦了撑不住了 ，而是因为受到了其他诱惑 。

**曼祺** [1:10:27]
所以你过去 8 年里没有其他的诱惑 ？

**楼天城** [1:10:30]
没有诱惑足够大啊 ， 没有诱惑能够跟这个事情相提并论啊 。

**曼祺** [1:10:34]
你觉得大模型这种东西算诱惑吗 ？

**楼天城** [1:10:36]
嗯 ， 啊 ， 首先大就大语言模型 ， 真正的基础模型这些东西啊 ， 首先应该是叫大语言模型基础模型的 ， 然后大语言模型基础模型我觉得它很 fancy， 然后并且可能在算力或者上面 ， 它可能就短期影响力确实有它的影响 ，但它将来一旦走到应用的时候 ， 它会经历所有自动驾驶经历的事情 ， 就是我做公司做 L4 到今天所有事将来都会遇到啊 。

**曼祺** [1:10:59]
现在看起来有这个苗头 。

**楼天城** [1:11:01]
嗯 ， 甚至你不觉得 L4 是你也已经遇到了吗 ？ 我觉得 MiniMax 就是就是其实我觉得这公司不错的有点 ，但是不是说专门讲什么 ， 它做的是 L4 应用啊 。

**曼祺** [1:11:11]
它做的是 L4 的好处 。 怎么怎么理解 ？ 你你说 MiniMax 做的是 L4 应用 ， 这个你怎么理解 ？

**楼天城** [1:11:17]
对啊 ， 就是说 L4 本质就是你尝试做一个取代人的应用 ， 就大家愿意产生商业价值 ， 本质是你取代了他的一些资源 ， 这样你的价值就是取代这个人的价值 。

而如果你做的只是一个辅助工具 ， 比如帮你做人做得更好 ， 甚至包括我很喜欢的 Copilot， 本质就是一个辅助工具 ， 这辅助工具值多少钱 ， 这个是一个很大的 question mark 将来 。

**曼祺** [1:11:36]
那你觉得 ChatGPT 这种 Chatbot 就是面向提升你的效率 ， 或者帮你呃检索啊 ， 解答一些问题 ， 或者生成 ？

**楼天城** [1:11:44]
我觉得这个这个将来会遇到非常严重的 ，因为它门槛会降会低 ， 然后它同质化竞争且它的价值不好 justify， 最后它会遇到今天 L2 遇到的所有问题 。

**曼祺** [1:11:54]
哎 ， 你这个分类倒是挺有意思啊 ， 你从 L2 和 L4 的角度 ， 你你去分类这个大语言模型对应的一些应用啊 。

我观察到一个现象 ， 就是因为整个自动驾驶行业 ， 包括小马这个公司 ，其实是经历了很多起起伏伏的 ， 就在这种经历过从高光到被质疑的科技公司里面 ，其实核心人员流失是很常见的嘛 ， 然后你们的高管团队还是挺稳定的 ， 像这个王军浩 、 张琳 ， 对吧 ， 莫鲁伊赫 、 辛里 、 洪宇这些人也都还一直在公司啊 ， 这个是怎么做到的 ？

包括你也说中间其实有几年的时间 ， 你可能看不到特别明显的进展 ， 甚至内部都看不到很明显的进展 。

**楼天城** [1:12:31]
哎 ， 简单说这也是公司大家一起长期努力的结果啊 ， 就就就是大家大家共同相信一件事情吧 ， 就这不是说就这个不是有什么 sale bullet 做了之后就可以做到的 ， 这倒不是 ，其实长期努力的这个积累 ， 当然了 ， 呃 ， 包括我们这些人就是在工党 ，他在工作中吧 ， 包括工作前其实有些信任也是也是在其他事情中积累的 ， 就是信任这事也是个积累 ， 或者对一件

事情的信念也是个积累过程 ， 它不是瞬间产生的 。 所以就是说简单说就是持续在工作过程中吧 ， 就是共同建立这种互相这种信任 ， 然后对一些事情的共同的认可 ， 我觉得这是关键 。

包括那个刚刚说几位呢 ，有些也是在我之前近近代生涯中认识的 ， 近代生涯中本身也是个积累过程 ， 我也不是一年做到 ， 我也是十几年的十几年的时间见识了一些人。

**曼祺** [1:13:19]
就相当于你们在开始创业一起做这件事情之前 ， 你们本来就有一些信任 ， 然后同时在一起做这个事又更多过程中也是 。

**楼天城** [1:13:27]
对 ， 这是个积累过程啊 ， 那我不我不确定丢失是不是可以是不是可以一瞬间发生 ，但积累肯定是要是不断的做才能做到的 。

**曼祺** [1:13:35]
我也想听你就是讲讲 ， 就是这种经历过高光 、 低谷 、 成败 、 怀疑都经历过的情况下， 你对这些可能面临要下神坛的创业者或者公司 ， 你有什么想说的吗 ？

**楼天城** [1:13:46]
啊 ， 首先我不敢以这种方式跟他们说啊 ， 我只是说首先对内很重要 ， 就是说哪怕因为外部的看法 ，因为这么说 ， 嗯 ， 外部很可能会发生一些认知或者一些背景背景不同 ， 然后说的吧 ， 就是说那 5 年之间外界看不到 L4 进展 ， 对吧 ， 我刚才说的这个话题 ，但内部我觉得这事情还是不能这么发生的 。

我觉得我觉得对我来说不算是经验吧 ， 就我做这件事情就还是很关注内部 ， 就哪怕外部人都觉得看不到进展 ， 都会对自动驾驶对 L4 觉得不相信呢之类的 ，但我觉得在内部还是要全力去让大家真正明白这件事情 。

所以做的我觉得做的很重要的一点就是我们内部其实也设了很多重要的里程碑 milestone， 让朋友更加了解其实我们在 moving 在 moving forward， 就这是最直接的做法 ，但本质它想达到的效果就是对吧 ， 就让大家还知道 ， 就是说这个在内部我们还在真正 moving forward， 哪怕外部无法感知 ， 每个 milestone 就是要能够首先能够得到且也是明显的进展 ， 就两边都能啊 ， 就你不能够

定的 ， 就是说完全够不到 ， 那跟没定一样 ， 对吧 ， 只够得到 。其次的话呢 ，也能跟之前每一步之间还觉得是一个一步也是都是往前进 。

**曼祺** [1:14:52]
嗯 ， 那他这个其实还是挺考验你的一个技术判断力 ， 就是你你大概得知道这个路在哪 ， 方向在哪 ， 对吧 ， 包括你往这个方向做 ， 你大概这个阶段能取得一个什么结果 。

**楼天城** [1:15:04]
而且而且最好这个目标一旦到了年尾级别 ， 就要一个大家可感知的目标 ， 就是至少就是说呃 ，不能完全是理性 ， 得有一定的感性的感受 ， 就哪怕这个感受可能不一定能跟真正技术变化有直接的变化 ，但是直接对应 ， 比如说我们专门做过 ，有有一个中间我们有一个阶段 ，不知道你还印象就是在副驾做司机 。

**曼祺** [1:15:25]
就安全员到了副驾 。

**楼天城** [1:15:27]
对 ，有这么一个特别阶段啊 ， 当时说大家开玩笑 ， 我们当时在深圳开车 ，以为是从香港来的 ， 来的套牌车呢 ， 对吧 ， 嗯 ，但这个时候在的严格的讲放在副驾啊 ， 它能干些事啊 ，但是本质它的可感知性是很重要的 。

就是说本质首先成本没降低 ， 对吧 ， 还是一个人， 对吧 ， 没降低 。 你说那司机是偶尔能叭一下方向盘 ， 那是真的 ，但是说实在他能坐在后面啊 ， 你把后面装个刹车也真没啥本质区别 。

所以其实它的实际的技术的就从商业化上是没有任何的实际意义的 ，但它可感知 ， 就是我们会用这样的方向设计 ， 让大家觉得至少让觉得是可感知 ， 就是我们这确实没什么 tower voice。

**曼祺** [1:16:07]
这个过程中间其实你要协调很多东西 ， 对吧 ， 你说的这个动作其实它也要和政府部门和监管部门要去沟通 ， 我从主驾到副驾再到后排 ， 然后最后完全拿掉啊 。

**楼天城** [1:16:19]
啊 ， 这可能是后来者的一个也许是劣势 ，因为当下很多政策已经不再支持这些了 ， 就一步到位了 ，因为有人一步到位过 ，但可能会让后来者会迷茫 ，因为他这步跨太大之后他觉得跨不过去了 ， 就是一步跨太大不一定是好处 ， 就是中间这个 milestone 一旦变成不再是 milestone 的时候就会很艰难啊 ，因为他没法得到合适的 reward。

**曼祺** [1:16:41]
不过实际上现在这个市场 ， 当然我觉得接下来会有变化啊 ，但实际上现在的玩家的数量已经是挺少的了 ， 比较有限啊 。

**楼天城** [1:16:49]
是 ，但我仍然觉得原因是原因就是变变少的原因不是因为坚持不住 ，是因为大家受到了诱惑 。

### 模拟世界

**曼祺** [1:16:56]
我我们还想问一下就关于世界的一些想法 ， 这个我们之前有讨论过 ， 就你之前说过一个很有意思的观点 ， 就是你怀疑这个世界是模拟的 。

**楼天城** [1:17:05]
啊 ， 我不怀疑 ， 我坚信是这样的 。

**曼祺** [1:17:07]
你坚信这个世界是模拟的 。

**楼天城** [1:17:09]
对 。

**曼祺** [1:17:10]
OK，因为因为你上次说的是说你觉得假使有一个上帝或者造物主 ， 或者你就是那个造物主 ， 你就会这么来编程和渲染啊 。

**楼天城** [1:17:18]
对 ， 我花了很多时间来真正想 ， 就是在正来证伪它 ，因为我不想接受这件事情 ，但后来我找了半天发现可能它真的是真的 。

**曼祺** [1:17:25]
你从什么时候开始有这个想法了 ？

**楼天城** [1:17:28]
嗯 ， 大概本科吧 。

**曼祺** [1:17:31]
本科 ， 所以你高中就就领悟了强化学习是吧 ， 然后本科 。

**楼天城** [1:17:35]
啊 ，不不不 ， 强化学习啊 ， 对对对 ， 就这个啊 ， 强化学习 。 对 ， 我觉得就根本上很多 ， 比如说从混沌理论时代 ， 量子混沌纠缠这些东西 ， 实在是很难不用模拟方法解释啊 ， 当然还有光速有限 ， 这是一个非常明显的东西啊 。

**曼祺** [1:17:50]
那你觉得这个想法对你自己做很多人生的选择 ， 包括你做就是创业去理解这个自动驾驶技术 ， 你觉得会有什么影响吗 ？

**楼天城** [1:17:58]
呃 ， 还是倒没这么大 ，但是它是一个稍微稍微这个比较 niche 的一个 point 啊 ， 就究竟是向什么顺序有价值的 ， 那当然有些财务上的回报当然是有价值的 ，但是从科技发科学发展上， 问我们为什么会 value 一些事情 ，是因为预测这个词 ， 我意识到了其实能够预测预测后面发生什么事 ， 预测未来的东西 ， 我们人类是有价值 ， 这可能是关于人的 nature， 这是人真正求存的

本质 。 所以其实一个有价值的东西 ， 往往它能够做得很明显的东西 ， 它能被对未来做出预测 。

所以后来我慢慢进入很多当时当时还是传统的机器学习 ，其实跟这个深吃有关系 。

**曼祺** [1:18:36]
那其实在这个动力之下， 你你的你的目标可能有很多不同的可能性 ， 就比如说像马斯克的一些想法 ，他非常具象 ， 比如说他要去火星 ， 或者说我要变成我我希望人类变成一个星球文明 ， 这是个很具体的事 。

你说的这个东西要更它是一个更就是抽象出发 ， 然后它其实可以指向很多可能性 。

**楼天城** [1:18:54]
啊 ， 对 ，但我确实对有一点不同 ， 我可能也没有机会吧 ， 我可能也也个人也没法做这件事情 ， 没有机会对外表达这样的东西 ， 所以我可能也不会具象 ，但我觉得具象对对外的接受会好很多 ， 这个我认可 。

**曼祺** [1:19:06]
你觉得你是一个追求结果的人， 还是你更享受中间这个过程 ？

**楼天城** [1:19:11]
这个问题很好 ，其实我是追求结果中非常甚至有点偏执的一个追求结果的人。 但是这样的就说呃 ，不能老去想结果 ， 还是要关注过程 ，因为结果你是不能控制 ， 通过过程才能做好 ， 这都是对的啊 ，但是最终最终评估下好坏的其实是结果 。

嗯 ，其实其实呃在这里我觉得更多人其实也是这样觉得 ，他不愿意承认而已 ， 或者很多表面上注重过程的人其实啊 ，他们也是知道结果 ，他只是不愿承认 。

对 ， 所以我对结果这都是非常极致的 ， 或者有点偏执 ， 可能会认为我 。

**曼祺** [1:19:47]
你觉得这个极致和偏执表现在什么地方 ？

**楼天城** [1:19:49]
嗯 ， 甚至我会经常经常用结果的好坏来评价过程的好坏 ， 就是这个西班牙的传统足球 ， 对吧 ，在 2010 年的时候 ， 大家说是战术垄断 ， 就是当年是 2010 年前后啊 ，他拿了三个国际大赛的冠军 ， 就足球的话 ， 还有个人我还是个球迷 ， 对吧 ， 大家都说是因为西班牙掌握了传统足球 ， 所以才拿了世界冠军啊 ，他说传统足球是最好战术 ， 然后其实根本就

不是这样子的 。 就是说不是说因为西班牙掌握了最好的战术 ， 所以他拿了冠军 ，是因为他拿了冠军 ， 所以他的战术为大家认为是最好的战术 。

学生时代的我也这么认为 ， 就是不是说某个学生有个某个班里有个很好的学生 ，他的学习方法是最好的 ， 所以他拿了班里的第一 ，是因为他拿了第一 ， 所以大家把他的方法认为是最好的方法 ，而仅此而已 。

就他有一天不是第一的方法就不是最好方法了 。 包括刚才说的世界模型这个东西 ，不一定是因为我们掌握了世界模型这个最好的方法 ， 所以做到了 L4，而是因为做到了 L4， 所以我们的方法被大家认为是正确的方法 。

**曼祺** [1:20:45]
你觉得你特别清楚的认识到这个东西对你做很多事情 ， 包括做决策会有什么影响 ？

**楼天城** [1:20:50]
要关注过程 ，但不要去过度纠结于去 replicate 某些过程 ，因为它过程的好坏其实是由它结果而定的 。

**曼祺** [1:20:58]
那个前段时间我们也和 James 就是彭军小马的 CEO 有聊 ，他说你们整个就是小马创业的这个过程 ， 像是有一群人在爬一座山脉 ， 然后山脉是意味着你能看到这个最高峰 ，但是你达到最高峰的旅程 ， 它不是一路向上的 ，是上上下下， 然后可能再上的 。

一群人就是意味着不是说你自己有目标有信念就可以 ，而是这个核心团队是要有共识的 。 嗯 ， 如果是你的话 ， 你会去怎么形容这 8 年的这个过程 ？

**楼天城** [1:21:32]
他这个描述从进展上描述很像 。

**曼祺** [1:21:35]
那如果从另一个角度了 ， 你想到的是什么角度 ？

**楼天城** [1:21:38]
我我觉得稍微说的味度一点吧 ，其实可能是一个呃对 L4 认知和如何做之间的一个 spiral 的过程 。 就是就是说刚才我 CC 说的一些 ， 比如说认知过程 ，其实我觉得我并不我并没有任何觉得不这么想的人 ，他是有什么想错了或者什么东西 ， 只是因为他可能没走到那个地方 ，他不需要这个 ，他不需要这个认知 ， 然后有这认知就实现 ，其实这是一个对做一个事情的认知和实

践它的一个不断的 spiral 的过程 。 我会这么看这个点 。 嗯 ， 就是随着我的发展到一个阶段 ， 我发现啊 ， 原来 L4 是这个样子的啊 ， 当任何时间就自动驾驶是这个样子的 ， 然后我做到我再重新去思考如何做到这个东西 ， 这每步这是一个螺旋上升的 。

**曼祺** [1:22:26]
你觉得最近的一个比较大的螺旋上升是什么时候发生的什么事 ？

**楼天城** [1:22:30]
就是超越人类司机 ， 就老司机就是为什么开的好这个东西 ， 没有这个认知开始的时候 ，因为我也因为我也没比老司机开的好 ，但后来做到之后发现其实是那个就是帮助其他车辆降低事故 ， 降低减少错误是关键 。

这个认知可能也没到那个份上， 这个可能是估计也就 Waymo 会偶尔说这个话 ， 就是我们提升安全性的关键是帮助其他车辆减少事故 。

**曼祺** [1:22:53]
你们去做世界模型到什么程度 ， 你们有看到这个东西 ？

**楼天城** [1:22:56]
就表现真的跟很多就从统计上的人差不多的时候 ， 我们发现了很多我们里面发现的就是事故是由于别人错误导致的时候 ， 然后我们会开始会有个茫然觉得好 ， 这好像就不能再提升了 ，他发现不是的 ， 就是你的行为可以帮别人减少事故 。

嗯 ， 比如说及时打灯就是一个 ， 然后呢行为做的相对有些提前的预兆 ， 然后做一些 decisive 行为 ， 这些都是 。

嗯 ， 就你可以通过你的驾驶行为帮别人减少错误 ， 虽然这个错误将来都是别人的错误 ，但是你的做法是不一样的 。

**曼祺** [1:23:26]
哎 ，在你刚才说的这个螺旋上升里面啊 ， 就如果不说自动驾驶的技术本身 ， 你最近对就是创业这个事情 ， 或者说去实现一个很前沿的商业化落地这件事情 ， 你最近有一个新的这个认知的螺旋上升是什么时候什么事 ？

**楼天城** [1:23:41]
我想应该其实是商业化节奏和商业化意义的一个平衡 ， 就是说呃有两个极端都不好 ， 一个是过早的就是第一时间一定要商业化 ， 还一个是一定要做一个最有价值的商业化 ， 这两个其实都是都是特别极端 ， 这两个之间那个平衡可能才是一个这次健康发展的状态 ， 就是又要又要寻求一个合适的商业化 ，但商业化又要有足够的意义 ， 就不能走这两个

极端 ， 可能是我啊 ， 或者说在我创业前我肯定没这么想 ，而且中间我肯定偏执过很多一边 ，但后来我觉得再往前走 ，因为现在自动驾驶也在商业化了 ， 我觉得包括之后我们刚才评价大模型的商业化也是这个点 ， 我觉得这两个之间的平衡可能很重要 。

**曼祺** [1:24:23]
其实就是快和大之间的平衡 ， 对吧 ， 节奏上可能有的时候会偏向特别快 。

**楼天城** [1:24:28]
对对 ， 就就不不能不不能非不能非常极端的走一个 ， 这两个都很重要 。 嗯 ， 啊 ， 那这个大不一定 ， 这个大指的是有长远意义啊 ，不一定是那个 number wise 大 ，但是它需要有一个真正的长远意义来支撑 ，以及你要走的不能过等太久 ， 这两个点需要定 。

**曼祺** [1:24:45]
我感觉我听下来是你你你对这个技术的方向什么这些都是很有信心的啊 ， 基本上你觉得找到了一个你觉得可以一直往前延伸一段时间的路径 ， 对吧 ， 我就是技术上 。

**楼天城** [1:24:57]
啊 ， 首先谢谢这么说 ， 我觉得是 ，但是现在再把刚刚的话回来一点 ，其实不是这个顺序 ， 逻辑是差反过来了 ， 只是因为做到了这样 ， 我才觉得这是一个技术可延伸的路径 。

**曼祺** [1:25:09]
就从结果的角度你能看到下一个瓶颈可能会在哪吗 ？ 现在会有苗头吗 ？

**楼天城** [1:25:13]
嗯 ， 啊 ，likely 是一个现在我不能预知的 ， 我觉得现在可能降低成本本身我觉得是很重要的优先级 ， 所以这方面我觉得还好 ， 所以有可能有个不可预知的东西 。

**曼祺** [1:25:23]
所以你觉得接下来小马还有可能会导致它失败的因素和原因吗 ？

**楼天城** [1:25:28]
啊 ，不 ， 这个我觉得想犯错误还是可以很多错误可以犯的 ，但本质我觉得就是这个 scaling 吧 ， 就是上量这个过程能不能干到我们的预期 ， 能够稳步的把数量增上去可能是关键 。

如果这个做得不好 ， 我觉得对整个公司发展都是受限的 ，但不是说就失败吧 ，但至少是不满意的 。

**曼祺** [1:25:46]
因为接下来其实会有包括你们包括一些其他的这个 Robotaxi 的公司上市 ， 如果是从投资人或者说从这个外在的这种角度来看的话 ， 你觉得这一类公司核心要看它的什么什么竞争力 ， 或者说什么指标是能去反映大家的进度的 ？

**楼天城** [1:26:03]
我觉得就是其实 Waymo 我觉得现在实际上证明了 ， 首先 Waymo 它没有上市啊 ，但 Waymo 这次 Waymo 的融资额是一个非常夸张的数字 ，56 亿美元最近的概念 ， 就第一眼看我是以为其实以为是多以为自己多看了一个 0， 对啊 ， 然后这个就就它其实本质也是规模化 ，但这个规模化是有前提 ， 就是说一个主要成功人， 一个就是成本结构合理的一个规模化 ， 它的规模的上升 ， 这个我

觉得就是当下当下我觉得是行业的共识 ， 这应该是很最重要的指标 。

**曼祺** [1:26:34]
所以基本上我可以说就是看这个车队的数量运营范围 ， 这个是最直接最直观的 。

**楼天城** [1:26:40]
啊 ， 对啊 ，但 given 成本结构是一个合理的成本结构啊 ，但我们要求高一些 ， 百度要求低一些 ， 这都可以 ，但是我只说合都都合理啊 ，但只是刚那个高低可能是公司公司不同的属性的不同 ，但是我觉得是合理成本结构下运营的规模 ， 这可能就是它的最关键的点 。

**曼祺** [1:26:58]
你接下来一段时间你自己的核心目标会是什么 ？

**楼天城** [1:27:00]
啊 ， 首先这个 scaling， 你 scaling 本身也是一个那个从生产方式到管理方式不同到报复运营吧 ，其实就是 scaling，scaling 包括比如运营方面 ， 包括成本控制啊 ，也包括比如说这个他也包括一些牌照这些东西 ，但整个目标都是以 scaling 为主要的目标 。

**曼祺** [1:27:18]
OK， 今天非常感谢做客我们的节目 ， 我也很期待之后在国内在北京上海这些各大城市里面会出现越来越多的这种无人的出租车 ， 我们到时候可以看这个东西会怎么去改变交通 。

### 尾声

**楼天城** [1:27:31]
嗯 ， 好的 。

**曼祺** [1:27:32]
嗯 ， 好 ， 拜拜 。

**楼天城** [1:27:33]
谢谢 ， 再见 。

**曼祺** [1:27:33]
本期节目就到这里 ， 欢迎收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 ， 欢迎在评论区分享想法 ， 这也会成为我们节目的一部分 ， 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 ， 欢迎推荐更多你想听的主题和嘉宾 。

你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk，也欢迎关注我们的公众号晚点 LatePost， 下期再见

。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
