在 晚点聊 LateTalk 中提及的产品。

170: 与陈哲的「具身季报 26Q2」:世界模型大风不停,和不想被贴标签的人
2026年6月29日 · 1:53:50
本期《晚点聊》中,主持人程曼祺与Alphaist创始合伙人陈哲盘点2026年第二季度具身智能五大进展,核心判断是世界模型与灵巧手取得显著突破,人形机器人正从演示走向真实场景。陈哲认为北京亦庄人形马拉松中荣耀机器人事业部夺冠,证明有高端制造经验的大厂能快速拿出有竞争力的产品,成绩从去年半马2小时40分提升到今年自主导航约50分钟;Figure AI连续直播100多小时、分拣13万包裹,展示物流是适合人形机器人的好场景,但遥操作与远程接管仍是部署常态。在灵巧手方面,ICRA上以舞肌为代表的中国高自由度直驱灵巧手获得关注,陈哲认为直驱方案长期仍看好,而Optimus等大厂继续跟从绳驱路线。世界模型方面,英伟达Cosmos 3成为首个全开源Omni model,采用Mixture of Transformers融合自回归与扩散架构,能直接生成动作,带动创投热潮;Physical Intelligence的Pi 0.7在VLA上接入轻量世界模型,Generalist的Gen-1以50万小时无本体数据从头预训练,拒绝被VLA或世界模型标签定义。针对OpenAI Robotics团队官宣,陈哲表示其算力投入在具身领域已属天花板,并讨论了大厂入场节奏、宇树IPO后的估值锚点,以及中国创业者在长期不确定性与商业化之间的张力。

165: GEAR 高深远:世界模型、自进化循环、DreamDojo
2026年5月18日 · 1:49:03
本期嘉宾是即将加入英伟达具身智能实验室 GEAR 的研究者高深远,他与主播程曼祺系统梳理了世界模型的分类、瓶颈与未来,并详解了他参与研发的世界模型 DreamDojo 和世界动作模型 DreamZero。节目按世界状态表征将世界模型分为几何、显式3D、隐空间和视频四类,高深远最看好视频世界模型,因为数据丰富、可端到端训练、能继承互联网视频的泛化能力;世界模型的核心价值是服务策略——用于测评、生成数据和突破物理时间限制的强化学习,但当前难以横评,因为各家机器人本体和动作空间不同。DreamDojo 从4.4万小时人类第一人称视频中迁移泛化能力,用隐式动作(Latent action)免去动作标注,把视频预测做到实时,并自建6个 benchmark 评测物理模拟和动作控制能力;DreamZero 则是以视频为骨干的策略模型,被视作可能取代 VLA 的世界动作模型(WAM)。高深远描绘了由世界模型、策略模型和连接二者的 Agent 组成的自进化循环,认为今年可能初步跑通,未来5年或成爆点;他还对比了 DeepMind 的 Genie-SIMA 与 Nvidia 的 DreamDojo-DreamZero 等竞争格局,指出当前最大瓶颈是物理模拟和动作控制的泛化,以及长程稳定性和效率。此外他提到 OpenAI 的 Sora 团队已重组到 robotics lab,并认为通用基模路线(如 Anthropic、AMI)最终也可能解决具身问题。
由 PodHood 提供支持