在 晚点聊 LateTalk 中提及的公司。

149: 具身模型哪家强?|与范浩强、高阳聊具身模型的测评、RoboChallenge,26 年具身展望
2026年1月25日 · 1:21:52
本期节目邀请原力灵机联创范浩强与千寻智能联创高阳,核心是讨论具身模型“哪家强”,并介绍由原力灵机与 Hugging Face 联合发起的 RoboChallenge 真机测评平台——用 Table 30 的 30 个桌面任务和每任务约 1000 条示例数据,让团队微调后远程提交,以平均成功率排名。最新结果显示,π0 在 Table 30 上平均成功率仅 20% 多,π0.5 翻倍至约 42%,千寻的 Spirit v1.5 更以超过 π0.5 的成绩登顶;平台上线两个多月已收到超 1 万次测试提交,覆盖国内外多家机构。两人对比了 Physical Intelligence 发起的 RoboArena(分布式 zero-shot 测评)与 RoboChallenge 的集中式 few-shot 思路,指出具身模型难以像 CV 一样统一测试,因为物理环境、物体、光照都有差异;而 Table 30 中的碎纸、插花、扫二维码等任务各考察不同能力,比如扫码任务暴露了单帧 VLA 模型没有记忆、分不清是否已扫码的局限。展望 2026 年,他们认为学习原理已收敛,Scaling Data 是行业主题;高阳团队 bet 仿真之外的人类视频、可穿戴、遥操作三类数据,认为仿真多样性难提升,原力灵机则以真机采集为主。关于落地,他们反问“机器人时代的 Coding 是什么”,并预计破圈时刻可能在三四年后出现。范浩强期待中国出现具身的 DeepSeek 时刻,高阳希望基础模型能达到 GPT-3 水平;节目还揭示了行业心照不宣的 demo 工程(cherry pick、遥操作、AIGC 等)以及测评可能被 hack 的方式与反制手段。

112: 与千寻高阳聊具身:一个像机器人的人,怎么做像人的机器人
2025年4月29日 · 1:22:09
高阳(千寻智能联合创始人、清华叉院助理教授)直言具身智能必走端到端 VLA,并给出时间表:明年6月达L2,再一年半到两年达L3。他认为行业已从500个研究话题收敛到100个,这正是他选择创业的时刻——科学家能做的探索变少,工程化落地成为重心;千寻的配置是产业老炮韩峰涛加年轻科学家。他定义的L2是单场景多任务,为此机器人未必人形,但需双臂加轮式底盘,双足并不难;叠衣服是当前“智商测试”,难在理解乱态与泛化,而Figure 02展示了快慢系统的工程优势。数据方面,他提出具身Scaling Law,称做到GPT-3.5级需约100亿条有效互联网视频、1亿条遥操数据和数千万强化学习数据,而仿真数据因多样性有限不适用。他还解释为何要同时做大模型和本体——只做大脑缺乏跨具身肌肉记忆,只做本体则价值集中在大脑端;中国优势在于“修机器人快”,行业将在跑出L2/L3后收敛,当前瓶颈在AI而非硬件;商业化上现在应把技术做到GPT-4程度,L1场景已有人愿付十几万,L2会带来几何级数增长。个人层面,他回顾2016年与许华哲做端到端自动驾驶、伯克利归国经历,称自己从不熬夜、每天骑车31-33分钟,以COT式链条思考应对科研与创业。

108: 与马毅聊智能史:“DNA是最早的大模型”,智能的本质是减熵
2025年3月17日 · 2:18:18
香港大学计算与数据科学学院院长马毅在《晚点聊》中提出,智能是生命对抗熵增的机制,DNA是最早的大模型,35亿年历史中它从DNA进化、神经系统个体记忆、语言文化演进到数学科学,因此机器智能的起点应回溯至1940年代维纳的控制论和香农的信息论,而非1956年达特茅斯会议。他认为知识本身不是智能,智能是获取和更新知识的能力,当前大模型仍停留在类似DNA的强化学习阶段,缺乏闭环反馈和自主纠错,OpenAI o1和DeepSeek-R1的推理更像刷题式的记忆模仿,而非真正的逻辑推理,甚至不如猫狗的适应能力。他预言开源模型终将超越闭源,DeepSeek式突破只是where and when的问题,不是if or not的问题。谈到技术品味,马毅强调它来自探索未知的价值观和严谨科学训练,并透露自己引用最多的成果一度没有任何会议接收,博士毕业时也找不到对口教职。他正在推动港大面向所有本科生的AI通识教育(以一门英语课为代价),并通过忆生科技研发白盒大模型和闭环纠错机制,认为人脑是并行结构,闭环系统才能应对开放世界,而端到端VLA未必是具身智能的正确解法。智能在熵增宇宙中只是短暂过程,但对抗熵增本身就构成生命的意义。

102: DeepSeek 启动开源周,大模型开源到底在开什么?
2025年2月25日 · 56:40
本期《晚点聊》由程曼祺主持,邀请西北大学MLL Lab博士生王子涵,围绕DeepSeek开源周及大模型开源的具体层次展开。节目指出,开源不只是开放权重,还包括技术报告、推理框架、训练框架和数据集等层级,而绝大多数公司只开放前两者。王子涵以FlashMLA为例,解释了算子级优化如何提升推理效率,并对比了vLLM、SGLang、字节VERL等社区框架的生态差异。节目还剖析了DeepSeek选择MIT协议、开源最强模型背后的优先级与盈利模式,并谈到开源训练框架需额外投入代码规范化工作。王子涵分享了自己因开源模型被滥用导致推特账号被盗的经历,提出最强模型是否应开源的社会风险问题。节目最后讨论了OpenAI可能的开源选择,以及人类在AGI时代的位置。
由 PodHood 提供支持