在 晚点聊 LateTalk 中提及的产品。

179: 蒸馏风暴:一场无人公开谈论的技术竞赛
2026年8月16日 · 49:33
《晚点聊》主播高洪浩与《晚点 LatePost》科技报道负责人程曼祺在本期中拆解AI模型蒸馏:它并非简单抄答案,而是有门槛的复杂系统工程。围绕字节跳动,节目披露张一鸣在内部会上反对蒸馏,理由是只能逼近难超越,且会让组织依赖捷径、丧失长期探索动力;程曼祺也分析Seed 2.1可能曾用蒸馏,字节在讨论后仍决定不走这条路。节目梳理了蒸馏出圈的关键节点——OpenAI o1开启推理模型与DeepSeek-R1发布推动规模扩大,并详解大规模蒸馏的账号与数据管线know-how、隐藏行为的难度,以及学生模型理论上可超越教师但代价是组织激励偏向确定性路径。此外,节目提及Anthropic曾点名DeepSeek、Kimi、MiniMax和阿里千问疑似蒸馏,并讨论蒸馏对商业模式的冲击:更便宜的智能让许多任务‘够用’,V4和Grok这类高性价比模型正在‘斩杀’高价低能的模型。

178: 与田渊栋聊 RSI:模型自进化如何到来?
2026年8月7日 · 1:29:02
田渊栋做客《晚点聊》谈他联合创立的 Recursive SuperIntelligence(缩写同为 RSI)如何让 AI 自我进化:这家公司刚完成6.5亿美元融资、估值超46亿美元,他认为 RSI 比 coding agent 大得多,完全自动化短期不会到来。他讲述从去年用 GPT-5 合写论文到决定创业的过程,称模型已强到「不用再招实习生」,并对比十年前 AutoML:现在大模型能理解 AI 本身,搜索空间不再由人定义。关于公司6月初的 First Steps,他说系统在 NanoChat 的 BPB 与 Speedrun、英伟达 SOL-ExecBench 算子优化上取得 SOTA:Speedrun 比社区两年成绩再快约两秒,算子优化比专注 GPU 的以色列团队 Double AI 高10%;他也评价 Anthropic《When AI builds itself》更多是提效而非递归自进化。对「领先者会越甩越远」的假设,他提出变量:智能提升可能是阶梯式跳跃而非平滑曲线,若 scaling law 不是全部,初创公司仍有空间;他还谈到大公司超过150人后变慢,RSI 目前缺数据、算力与可解释性。他坚持可解释性是关键,相信 AI 研究终将变成科学,但承认这是少数派观点。

163: 详解DeepSeekV4:Infra巨鲸、百万上下文走进现实、极致效率优化
2026年4月30日 · 1:33:52
本集晚点聊详解DeepSeek V4,SGLang核心开发者赵晨阳(RadixArk工程师)和UCLA博士生刘益枫判定:它并非范式创新,而是沿R1的“测试时扩展”范式,用混合稀疏注意力、Muon优化器、mHC、FP4等互相耦合的工程优化,让百万上下文从理论进入实用。V4放弃了V3的MLA架构,改用滑动窗口+CSA稀疏压缩+HCA稠密压缩的层间分工,换来激活参数占比仅3%、单token推理FLOPs仅V3.2的27%、KV cache占用仅10%的极致效率;但两人也指出,解决同一问题的token消耗反而增加,有“高压水枪浇花”式的浪费。他们具体拆解了四个新特性:Muon优化器已成为检验工程能力的试金石,V4将Kimi Muon Lite的0.2系数改为0.18;mHC是DeepSeek对Hyper-Connection的稳定化改造;Infra侧TileLang降低新kernel开发成本,FP4训练让采样和部署一致,实现真正的物理提速。此外,DeepSeek这次不再披露训练成本,两人认为最终训练成本只是冰山一角;发布延期源于四个新feature耦合导致组合爆炸,但团队流动率极低。节目还讨论了DeepSeek内部评测中9%工程师不会将V4 Pro作为编程首选,以及中美模型路线分化:美国公司追新能力、高定价,中国公司追性价比和工程极限。关于评测,他们认为benchmark会过时饱和,evaluation才是永恒追求;V4也未提出新的能力域,但它的极致压缩和低单token成本,可能成为后续开源模型的起点。

144: “大而强”到“小而强”|与刘知远、肖朝军聊密度法则、RL 的 Scaling Law 和智能的分布式未来
2025年12月11日 · 1:41:54
本期嘉宾是清华大学副教授、面壁智能首席科学家刘知远和清华大学博士后、面壁 MiniCPM 文本模型负责人肖朝军,他们在《自然·机器学习》子刊发表封面文章提出大模型“密度法则”:能力密度每 3.5 个月翻一番,用更少算力和数据获得同等甚至更多智能。节目先谈 Gemini 3、Nano Banana 等行业动向,区分“能力更强”和“能效更高”两条主线,并复盘面壁 2023 年下半年放弃花几千万训 140B 模型追 GPT-4、转向端侧智能的商业判断。提升密度被拆为架构(MoE 与稀疏注意力)、数据治理(Ultra-FinWeb 用不到十分之一数据达到更好效果)、算法(强化学习还没有自己的 Scaling Law,有继续扩大规模或寻找新学习方式两条路)和软硬协同四层。他们还预测 2027 年端侧模型能支持大规模强化学习,2030 年手机可跑 60B 参数、8B 激活的模型,能力相当于 GPT-4 到 GPT-5;未来智能是分布式的,每个人可拥有随身“NAS”终端。肖朝军介绍了面壁开源的 InfLLM-V2,将稀疏注意力做到预训练阶段,128K 上下文只需关注 4-6K token,并认为长文本应更多关注长输出而非长输入。最后讨论 AGI 下一步:从自主学到 AI 协作网络再到真正创新,刘知远认为“用 AI 制造 AI”是智能时代本质,他不担心生产力过剩,而担心人类自我束缚。

108: 与马毅聊智能史:“DNA是最早的大模型”,智能的本质是减熵
2025年3月17日 · 2:18:18
香港大学计算与数据科学学院院长马毅在《晚点聊》中提出,智能是生命对抗熵增的机制,DNA是最早的大模型,35亿年历史中它从DNA进化、神经系统个体记忆、语言文化演进到数学科学,因此机器智能的起点应回溯至1940年代维纳的控制论和香农的信息论,而非1956年达特茅斯会议。他认为知识本身不是智能,智能是获取和更新知识的能力,当前大模型仍停留在类似DNA的强化学习阶段,缺乏闭环反馈和自主纠错,OpenAI o1和DeepSeek-R1的推理更像刷题式的记忆模仿,而非真正的逻辑推理,甚至不如猫狗的适应能力。他预言开源模型终将超越闭源,DeepSeek式突破只是where and when的问题,不是if or not的问题。谈到技术品味,马毅强调它来自探索未知的价值观和严谨科学训练,并透露自己引用最多的成果一度没有任何会议接收,博士毕业时也找不到对口教职。他正在推动港大面向所有本科生的AI通识教育(以一门英语课为代价),并通过忆生科技研发白盒大模型和闭环纠错机制,认为人脑是并行结构,闭环系统才能应对开放世界,而端到端VLA未必是具身智能的正确解法。智能在熵增宇宙中只是短暂过程,但对抗熵增本身就构成生命的意义。

86: We, Robot-2,清华叉院/星海图许华哲看“Optimus”的门道
2024年10月27日 · 1:05:06
许华哲(清华大学交叉信息研究院助理教授、具身智能公司星海图联合创始人)在《晚点聊》中从特斯拉We, Robot发布会的人形机器人Optimus谈起,阐释遥操作为何重要,并拆解通用具身智能当前的算法进展与创业选择。他认为这次丝滑的遥操作既是远程运力转移的实用价值,也为机器人提供高质量训练数据;从遥操到自主仍需海量数据和模型迭代。节目中他梳理了伯克利AI Research的强化学习传统、2019年ETH让机器狗爬山的标志性工作,以及自己用改进的PPO算法(BPPO)让机器狗在软垫上真实环境学习;他还区分了强化学习、模仿学习与多模态大模型的不同作用。关于形态,星海图选择轮式人形而非双足,是为了聚焦操作能力,因为操作才能改变物理世界、产生经济价值;灵巧手难度不亚于做好整个人形机器人,所以公司现阶段“力出一孔”做移动操作的本体、遥操作和智能。他也讨论了世界模型的定义争议(Sora为何不是、具备动作输入的视频预测才是)、触觉这一被忽视的模态,以及通用机器人面对的数据、模型两大瓶颈;他给出5年工厂大量部署、10年进入家庭的预期,并提醒机器人普及可能让人丧失部分决策权利。

71: “如果相信只靠 Scaling Laws 就能实现 AGI,你该改行了”,与香港大学马毅聊智能
2024年6月11日 · 1:53:00
本期《晚点聊 LateTalk》的嘉宾是香港大学计算机系主任、数据科学研究院院长马毅,他与主持人程曼祺的对话围绕“智能”展开,尖锐质疑当下主流的大模型路线。马毅的核心观点是:只靠 Scaling Laws(更多数据、更大算力、更大参数)无法实现 AGI,因为深度学习网络本质上都在做“压缩”——从图像、声音、语言等高维信号中寻找低维结构和规律;GPT 表现出的数学推理仍是记忆和统计,如同“高分低能”的填鸭式学生,学不到因果与逻辑。他区分了知识与智能:知识是存量,智能是增量,智能的本质是能纠正已有知识的不足并增加新知识。为此他提出“简约与自洽”原则,并用白盒模型(ReduNet、CRATE)从数学上解释神经网络每一层在做什么,称其已接近甚至超越经验设计的网络,能显著降低算力与试错成本。他还批评 AI 威胁论“要么无知要么别有目的”,主张政府应监管技术应用而非技术本身,并透露已创立公司“益生”推动白盒技术产业化;同时梳理了从控制论到深度学习的历史,强调闭环、自主学习和 AI 通识教育的重要性。

64: 让奶牛猫跳洗澡舞,与阿里通义薄列峰聊多模态共识中的变量是什么?| AI 大爆炸
2024年3月27日 · 51:20
本期《晚点聊》邀请阿里通义实验室XR实验室负责人薄列峰,聊其以“数字人”为主线的多模态研究——包括让奶牛猫跳洗澡舞的Animate Anyone、一键换装的Outfit Anyone,以及用一段语音驱动蒙娜丽莎开口说话/唱歌的EMO;他的核心判断是多模态是大模型发展的必然方向,但“世界模型”如何实现仍是最大变量。面对Sora,薄列峰认为其60秒高质视频确实震撼,但视频生成和世界模型远未解决,业界对世界模型的定义也无共识;相比谷歌、字节的视频平台积累,他提示OpenAI可能还用仿真数据,数据问题仍有挖掘空间。他解释EMO与旧Talking head方法的区别:它不只对口型,语音会同时控制表情、眼睛、头颈和上半身,且是zero shot,任意照片加音频即可生成,这得益于大模型的容量。节目还复盘了他的跨领域经历:07年博士毕业时深度学习尚非主流,在Amazon Go用深度学习解决实际视觉问题后确认其效果最好,并由此理解AI与硬件结合;他认为机器人等物理世界AI进化慢,硬件自由度与能耗是长期瓶颈。他也讲了Animate Anyone接入通义千问后的用户启发:宠物跳舞比真人跳舞更受欢迎,上传狗的人比猫更多,团队为此优化了骨骼检测;现阶段免费开放更重视用户反馈与模型能力迭代,而非成本。最后他提出世界模型的未来变量:应能模拟因果而非统计关系,是否必须3D化、是否需要能主动与物理世界交互的实体智能体,都还是开放问题。
由 PodHood 提供支持