晚点聊 LateTalk 的嘉宾。

149: 具身模型哪家强?|与范浩强、高阳聊具身模型的测评、RoboChallenge,26 年具身展望
2026年1月25日 · 1:21:52
本期节目邀请原力灵机联创范浩强与千寻智能联创高阳,核心是讨论具身模型“哪家强”,并介绍由原力灵机与 Hugging Face 联合发起的 RoboChallenge 真机测评平台——用 Table 30 的 30 个桌面任务和每任务约 1000 条示例数据,让团队微调后远程提交,以平均成功率排名。最新结果显示,π0 在 Table 30 上平均成功率仅 20% 多,π0.5 翻倍至约 42%,千寻的 Spirit v1.5 更以超过 π0.5 的成绩登顶;平台上线两个多月已收到超 1 万次测试提交,覆盖国内外多家机构。两人对比了 Physical Intelligence 发起的 RoboArena(分布式 zero-shot 测评)与 RoboChallenge 的集中式 few-shot 思路,指出具身模型难以像 CV 一样统一测试,因为物理环境、物体、光照都有差异;而 Table 30 中的碎纸、插花、扫二维码等任务各考察不同能力,比如扫码任务暴露了单帧 VLA 模型没有记忆、分不清是否已扫码的局限。展望 2026 年,他们认为学习原理已收敛,Scaling Data 是行业主题;高阳团队 bet 仿真之外的人类视频、可穿戴、遥操作三类数据,认为仿真多样性难提升,原力灵机则以真机采集为主。关于落地,他们反问“机器人时代的 Coding 是什么”,并预计破圈时刻可能在三四年后出现。范浩强期待中国出现具身的 DeepSeek 时刻,高阳希望基础模型能达到 GPT-3 水平;节目还揭示了行业心照不宣的 demo 工程(cherry pick、遥操作、AIGC 等)以及测评可能被 hack 的方式与反制手段。

112: 与千寻高阳聊具身:一个像机器人的人,怎么做像人的机器人
2025年4月29日 · 1:22:09
高阳(千寻智能联合创始人、清华叉院助理教授)直言具身智能必走端到端 VLA,并给出时间表:明年6月达L2,再一年半到两年达L3。他认为行业已从500个研究话题收敛到100个,这正是他选择创业的时刻——科学家能做的探索变少,工程化落地成为重心;千寻的配置是产业老炮韩峰涛加年轻科学家。他定义的L2是单场景多任务,为此机器人未必人形,但需双臂加轮式底盘,双足并不难;叠衣服是当前“智商测试”,难在理解乱态与泛化,而Figure 02展示了快慢系统的工程优势。数据方面,他提出具身Scaling Law,称做到GPT-3.5级需约100亿条有效互联网视频、1亿条遥操数据和数千万强化学习数据,而仿真数据因多样性有限不适用。他还解释为何要同时做大模型和本体——只做大脑缺乏跨具身肌肉记忆,只做本体则价值集中在大脑端;中国优势在于“修机器人快”,行业将在跑出L2/L3后收敛,当前瓶颈在AI而非硬件;商业化上现在应把技术做到GPT-4程度,L1场景已有人愿付十几万,L2会带来几何级数增长。个人层面,他回顾2016年与许华哲做端到端自动驾驶、伯克利归国经历,称自己从不熬夜、每天骑车31-33分钟,以COT式链条思考应对科研与创业。
由 PodHood 提供支持