165: GEAR 高深远:世界模型、自进化循环、DreamDojo
2026年5月18日 · 1:49:03
本期嘉宾是即将加入英伟达具身智能实验室 GEAR 的研究者高深远,他与主播程曼祺系统梳理了世界模型的分类、瓶颈与未来,并详解了他参与研发的世界模型 DreamDojo 和世界动作模型 DreamZero。节目按世界状态表征将世界模型分为几何、显式3D、隐空间和视频四类,高深远最看好视频世界模型,因为数据丰富、可端到端训练、能继承互联网视频的泛化能力;世界模型的核心价值是服务策略——用于测评、生成数据和突破物理时间限制的强化学习,但当前难以横评,因为各家机器人本体和动作空间不同。DreamDojo 从4.4万小时人类第一人称视频中迁移泛化能力,用隐式动作(Latent action)免去动作标注,把视频预测做到实时,并自建6个 benchmark 评测物理模拟和动作控制能力;DreamZero 则是以视频为骨干的策略模型,被视作可能取代 VLA 的世界动作模型(WAM)。高深远描绘了由世界模型、策略模型和连接二者的 Agent 组成的自进化循环,认为今年可能初步跑通,未来5年或成爆点;他还对比了 DeepMind 的 Genie-SIMA 与 Nvidia 的 DreamDojo-DreamZero 等竞争格局,指出当前最大瓶颈是物理模拟和动作控制的泛化,以及长程稳定性和效率。此外他提到 OpenAI 的 Sora 团队已重组到 robotics lab,并认为通用基模路线(如 Anthropic、AMI)最终也可能解决具身问题。