在 晚点聊 LateTalk 中提及的产品。

144: “大而强”到“小而强”|与刘知远、肖朝军聊密度法则、RL 的 Scaling Law 和智能的分布式未来
2025年12月11日 · 1:41:54
本期嘉宾是清华大学副教授、面壁智能首席科学家刘知远和清华大学博士后、面壁 MiniCPM 文本模型负责人肖朝军,他们在《自然·机器学习》子刊发表封面文章提出大模型“密度法则”:能力密度每 3.5 个月翻一番,用更少算力和数据获得同等甚至更多智能。节目先谈 Gemini 3、Nano Banana 等行业动向,区分“能力更强”和“能效更高”两条主线,并复盘面壁 2023 年下半年放弃花几千万训 140B 模型追 GPT-4、转向端侧智能的商业判断。提升密度被拆为架构(MoE 与稀疏注意力)、数据治理(Ultra-FinWeb 用不到十分之一数据达到更好效果)、算法(强化学习还没有自己的 Scaling Law,有继续扩大规模或寻找新学习方式两条路)和软硬协同四层。他们还预测 2027 年端侧模型能支持大规模强化学习,2030 年手机可跑 60B 参数、8B 激活的模型,能力相当于 GPT-4 到 GPT-5;未来智能是分布式的,每个人可拥有随身“NAS”终端。肖朝军介绍了面壁开源的 InfLLM-V2,将稀疏注意力做到预训练阶段,128K 上下文只需关注 4-6K token,并认为长文本应更多关注长输出而非长输入。最后讨论 AGI 下一步:从自主学到 AI 协作网络再到真正创新,刘知远认为“用 AI 制造 AI”是智能时代本质,他不担心生产力过剩,而担心人类自我束缚。

143: 阿里、Kimi都在用的DeltaNet是什么?|与杨松琳聊线性注意力新改进
2025年11月30日 · 1:27:20
本期《晚点聊》邀请DeltaNet核心贡献者、MIT在读博士及开源小组FLA发起者杨松琳,解释线性注意力机制和DeltaNet从提出到被业界采用的演进脉络。她指出,DeltaNet源自2021年的论文《Linear Transformers Are Secretly Fast Weight Programmers》,它用Delta Rule强化模型的上下文检索能力,但当时缺少short convolution、输出门控等现代架构元素,也没有高效的并行实现,因此长期不受关注;直到她2024年提出《Parallelizing Linear Transformers with the Delta Rule》等算法,才让DeltaNet可以高效训练和扩展。节目中她也回应了最新行业动向:阿里Qwen 3.0 Next在注意力层混合了Gated DeltaNet与Gated Attention,Kimi Linear的KDA则是对Gated DeltaNet的改进,将粗粒度衰减细化为每个维度独立;而MiniMax M2从M1使用的线性注意力退回Full Attention,原因是线性注意力在多跳推理、状态追踪等Agentic能力上表现欠佳。杨松琳认为,线性注意力在推理效率和状态追踪上有独特价值,即便算力无限,它在高质量数据有限时也能凭借归纳偏更高效地学习;而稀疏注意力虽然单层表达更接近Full Attention,但KV cache不减少,长文本下仍是瓶颈。她还分享了自己从算法出身自学CUDA、受FlashAttention启发发起FLA开源社区的经历,以及未来可能将稀疏注意力和线性注意力混合(如DSA+KDA)的构想。

104: 我给线性注意力找“金主”,字节 say No,MiniMax say Yes
2025年3月3日 · 1:26:50
主播曼祺与MiniMax高级研究总监钟怡然聊全球首个把线性注意力做到4560亿参数级的大模型MiniMax-01;钟怡然称这证明线性注意力可以scale up,但业界仍非共识。这也是MiniMax首次开源,目的是展示架构创新并吸引人才。她解释线性注意力通过调整QKV矩阵计算顺序将复杂度从二次降到线性;MiniMax-01每7层线性注意力混1层Softmax注意力,弥补纯线性注意力召回缺陷,100万Token序列下比全Softmax注意力快2700倍,且混合架构效果优于纯Transformer。她还回顾了自己从2021年押注这个“看起来很美好的泡泡”的经历:自称是全球最懂线性注意力的一批人,找“金主”时字节say no,MiniMax say yes;创始人闫俊杰以约50%把握拍板投入公司超80%研发资源,团队此前做了3700次预训练测试验证可扩展性。她认为稀疏注意力如NSA、Mobile有损且上限低,DeepSeek的NSA只是把稀疏注意力工程化提速;而线性注意力是无损优化,序列越长优势越大。MiniMax计划4月发布整合线性架构、原生多模态和强化学习的深度推理模型。节目最后聊到她的AGI愿景——能持续自我学习的模型,以及DeepSeek爆火后研发加班追赶推理模型的节奏。

103: 用Attention串起大模型优化史,详解DeepSeek、Kimi最新注意力机制改进
2025年2月26日 · 1:28:15
清华计算机系刘知远团队的肖朝军与清华电子系汪玉团队的傅天予在本期解读DeepSeek和Kimi最新发布的注意力机制NSA与MoBA:两者都在预训练阶段引入动态与静态混合的块状稀疏注意力,以应对长文本和长思维链带来的计算瓶颈。节目先讲清原理:注意力机制让每个词与上下文动态关联,但标准Full Attention需存储所有词向量并与每个词逐一匹配,因此序列变长时存储和计算按N方爆炸,这也催生了稀疏注意力和线性注意力(RNN回归)两大改进方向。两位嘉宾指出,NSA与MoBA的突破在于用块状稀疏设计(整块保留或丢弃)适配GPU并行与内存访问,并通过Triton算子优化让训练和推理都获得实际加速;静态稀疏(如滑动窗口)虽快但可能错过远距关键信息,所以动态与静态混合成为共同选择,而稀疏训练的性能也被证明可追平甚至超过稠密注意力。他们还对照自己此前的InfLLM与MoA:前者强调稀疏需在块级别做并做到训练无关的推理加速,后者通过识别关键注意力头来保留长程关联;两人在实验中最看重训练曲线(如NSA的Figure4和MoBA的Figure3)和长CoT生成速度,而非传统Benchmark。展望未来,多模态会让序列急剧变长(如一小时视频约百万token),存储/记忆将成下一瓶颈,线性注意力或RNN路线仍是重要理论选项。下期节目将与MiniMax研究员聊其01模型采用的线性注意力架构。
由 PodHood 提供支持