149: 具身模型哪家强?|与范浩强、高阳聊具身模型的测评、RoboChallenge,26 年具身展望
2026年1月25日 · 1:21:52
本期节目邀请原力灵机联创范浩强与千寻智能联创高阳,核心是讨论具身模型“哪家强”,并介绍由原力灵机与 Hugging Face 联合发起的 RoboChallenge 真机测评平台——用 Table 30 的 30 个桌面任务和每任务约 1000 条示例数据,让团队微调后远程提交,以平均成功率排名。最新结果显示,π0 在 Table 30 上平均成功率仅 20% 多,π0.5 翻倍至约 42%,千寻的 Spirit v1.5 更以超过 π0.5 的成绩登顶;平台上线两个多月已收到超 1 万次测试提交,覆盖国内外多家机构。两人对比了 Physical Intelligence 发起的 RoboArena(分布式 zero-shot 测评)与 RoboChallenge 的集中式 few-shot 思路,指出具身模型难以像 CV 一样统一测试,因为物理环境、物体、光照都有差异;而 Table 30 中的碎纸、插花、扫二维码等任务各考察不同能力,比如扫码任务暴露了单帧 VLA 模型没有记忆、分不清是否已扫码的局限。展望 2026 年,他们认为学习原理已收敛,Scaling Data 是行业主题;高阳团队 bet 仿真之外的人类视频、可穿戴、遥操作三类数据,认为仿真多样性难提升,原力灵机则以真机采集为主。关于落地,他们反问“机器人时代的 Coding 是什么”,并预计破圈时刻可能在三四年后出现。范浩强期待中国出现具身的 DeepSeek 时刻,高阳希望基础模型能达到 GPT-3 水平;节目还揭示了行业心照不宣的 demo 工程(cherry pick、遥操作、AIGC 等)以及测评可能被 hack 的方式与反制手段。