在 晚点聊 LateTalk 中提及的公司。

170: 与陈哲的「具身季报 26Q2」:世界模型大风不停,和不想被贴标签的人
2026年6月29日 · 1:53:50
本期《晚点聊》中,主持人程曼祺与Alphaist创始合伙人陈哲盘点2026年第二季度具身智能五大进展,核心判断是世界模型与灵巧手取得显著突破,人形机器人正从演示走向真实场景。陈哲认为北京亦庄人形马拉松中荣耀机器人事业部夺冠,证明有高端制造经验的大厂能快速拿出有竞争力的产品,成绩从去年半马2小时40分提升到今年自主导航约50分钟;Figure AI连续直播100多小时、分拣13万包裹,展示物流是适合人形机器人的好场景,但遥操作与远程接管仍是部署常态。在灵巧手方面,ICRA上以舞肌为代表的中国高自由度直驱灵巧手获得关注,陈哲认为直驱方案长期仍看好,而Optimus等大厂继续跟从绳驱路线。世界模型方面,英伟达Cosmos 3成为首个全开源Omni model,采用Mixture of Transformers融合自回归与扩散架构,能直接生成动作,带动创投热潮;Physical Intelligence的Pi 0.7在VLA上接入轻量世界模型,Generalist的Gen-1以50万小时无本体数据从头预训练,拒绝被VLA或世界模型标签定义。针对OpenAI Robotics团队官宣,陈哲表示其算力投入在具身领域已属天花板,并讨论了大厂入场节奏、宇树IPO后的估值锚点,以及中国创业者在长期不确定性与商业化之间的张力。

149: 具身模型哪家强?|与范浩强、高阳聊具身模型的测评、RoboChallenge,26 年具身展望
2026年1月25日 · 1:21:52
本期节目邀请原力灵机联创范浩强与千寻智能联创高阳,核心是讨论具身模型“哪家强”,并介绍由原力灵机与 Hugging Face 联合发起的 RoboChallenge 真机测评平台——用 Table 30 的 30 个桌面任务和每任务约 1000 条示例数据,让团队微调后远程提交,以平均成功率排名。最新结果显示,π0 在 Table 30 上平均成功率仅 20% 多,π0.5 翻倍至约 42%,千寻的 Spirit v1.5 更以超过 π0.5 的成绩登顶;平台上线两个多月已收到超 1 万次测试提交,覆盖国内外多家机构。两人对比了 Physical Intelligence 发起的 RoboArena(分布式 zero-shot 测评)与 RoboChallenge 的集中式 few-shot 思路,指出具身模型难以像 CV 一样统一测试,因为物理环境、物体、光照都有差异;而 Table 30 中的碎纸、插花、扫二维码等任务各考察不同能力,比如扫码任务暴露了单帧 VLA 模型没有记忆、分不清是否已扫码的局限。展望 2026 年,他们认为学习原理已收敛,Scaling Data 是行业主题;高阳团队 bet 仿真之外的人类视频、可穿戴、遥操作三类数据,认为仿真多样性难提升,原力灵机则以真机采集为主。关于落地,他们反问“机器人时代的 Coding 是什么”,并预计破圈时刻可能在三四年后出现。范浩强期待中国出现具身的 DeepSeek 时刻,高阳希望基础模型能达到 GPT-3 水平;节目还揭示了行业心照不宣的 demo 工程(cherry pick、遥操作、AIGC 等)以及测评可能被 hack 的方式与反制手段。

148: 它石智航陈亦伦:具身的三道曙光和第一道关卡
2026年1月16日 · 1:25:02
本期嘉宾是它石智航创始人、华为前自动驾驶首席科学家陈亦伦,他向晚点主持人程曼祺提出,具身智能已有三道曙光——强化学习解决运控、大模型做任务规划、端到端解决极端案例,但行业仍卡在第一道关卡:数据。他以当年华为用3万行代码替代200万行代码、2021年做出国内最早端到端自驾的经历说明,算法结构最终会归于简单,GPT最伟大的是“预测下一个token”的训练任务而非架构;三道关卡依次是数据、算法和后训练。具身数据应来自真实场景和真实动作,数据只有世界与人两个源头,他不看好仿真和视频数据,手套加第一视角摄像头比遥操更高效、成本更低,它石已采集约10万小时数据并预言2026年数据大爆发。他还区分了VLA与世界模型的不同用途——前者应对开放世界任务,后者应对与车辆行人交互——认为具身应有自己的基础模型而不是在LLM上长出头;他说端到端虽是行业人人都在说的主流方法,但关键是做出惊艳效果,并判断具身已到Scaling临界点,2027年会出现类似自驾2021年的时刻。落地方面,它石瞄准工业制造中的柔性线束装配;陈亦伦认为具身领域充满硬件、场景、本体、数据与算法的交替组合与协同优化,中国供应链和场景优势会让美国创业者不构成竞争对手。

112: 与千寻高阳聊具身:一个像机器人的人,怎么做像人的机器人
2025年4月29日 · 1:22:09
高阳(千寻智能联合创始人、清华叉院助理教授)直言具身智能必走端到端 VLA,并给出时间表:明年6月达L2,再一年半到两年达L3。他认为行业已从500个研究话题收敛到100个,这正是他选择创业的时刻——科学家能做的探索变少,工程化落地成为重心;千寻的配置是产业老炮韩峰涛加年轻科学家。他定义的L2是单场景多任务,为此机器人未必人形,但需双臂加轮式底盘,双足并不难;叠衣服是当前“智商测试”,难在理解乱态与泛化,而Figure 02展示了快慢系统的工程优势。数据方面,他提出具身Scaling Law,称做到GPT-3.5级需约100亿条有效互联网视频、1亿条遥操数据和数千万强化学习数据,而仿真数据因多样性有限不适用。他还解释为何要同时做大模型和本体——只做大脑缺乏跨具身肌肉记忆,只做本体则价值集中在大脑端;中国优势在于“修机器人快”,行业将在跑出L2/L3后收敛,当前瓶颈在AI而非硬件;商业化上现在应把技术做到GPT-4程度,L1场景已有人愿付十几万,L2会带来几何级数增长。个人层面,他回顾2016年与许华哲做端到端自动驾驶、伯克利归国经历,称自己从不熬夜、每天骑车31-33分钟,以COT式链条思考应对科研与创业。

65: 信仰充值的威力:与逐际动力谌骅聊聊 GTC 和人形机器人新进展 | AI 大爆炸
2024年4月2日 · 1:03:20
本期《晚点聊》邀请逐际动力联合创始人谌骅,他坚定断言人形机器人的“小脑”(运动执行)能力如今已落后于“大脑”和硬件,是AI大爆炸中最值得突破的环节。节目从近期热点切入:Figure AI获得OpenAI、微软、英伟达、贝佐斯6.75亿美元投资,Diffusion Policy等生成式模型提升了机械臂操作的泛化性,让机器人能像人一样洗盘子而不需精确摆放。谌骅回顾自己从博士研究混杂系统最优控制到2022年联合创业的历程,对比波士顿动力自1992年成立以来坚持液压路线,认为起步太早反而受老技术栈拖累,几乎不可能产品化。他也分析中美人形机器人创业差异:中国因供应链优势先火且倾向软硬一体,美国更允许长周期探索,因而有Physical Intelligence这类只做大脑的公司;逐际动力因此同时做人形CL-1、四轮足W1和点式双足P1,以平衡商业化与前沿探索。他还谈到强化学习在机器人运动控制中的爆发发生在最近一年,与Transformer没有直接关系,但大模型带来的“信仰充值”让大家相信数据驱动方法可行;硬件瓶颈和灵巧手是下一步关键,英伟达Jetson在端侧算力领先,而他对机器人“叛变”持谨慎乐观。
由 PodHood 提供支持