在 晚点聊 LateTalk 中提及的产品。

143: 阿里、Kimi都在用的DeltaNet是什么?|与杨松琳聊线性注意力新改进
2025年11月30日 · 1:27:20
本期《晚点聊》邀请DeltaNet核心贡献者、MIT在读博士及开源小组FLA发起者杨松琳,解释线性注意力机制和DeltaNet从提出到被业界采用的演进脉络。她指出,DeltaNet源自2021年的论文《Linear Transformers Are Secretly Fast Weight Programmers》,它用Delta Rule强化模型的上下文检索能力,但当时缺少short convolution、输出门控等现代架构元素,也没有高效的并行实现,因此长期不受关注;直到她2024年提出《Parallelizing Linear Transformers with the Delta Rule》等算法,才让DeltaNet可以高效训练和扩展。节目中她也回应了最新行业动向:阿里Qwen 3.0 Next在注意力层混合了Gated DeltaNet与Gated Attention,Kimi Linear的KDA则是对Gated DeltaNet的改进,将粗粒度衰减细化为每个维度独立;而MiniMax M2从M1使用的线性注意力退回Full Attention,原因是线性注意力在多跳推理、状态追踪等Agentic能力上表现欠佳。杨松琳认为,线性注意力在推理效率和状态追踪上有独特价值,即便算力无限,它在高质量数据有限时也能凭借归纳偏更高效地学习;而稀疏注意力虽然单层表达更接近Full Attention,但KV cache不减少,长文本下仍是瓶颈。她还分享了自己从算法出身自学CUDA、受FlashAttention启发发起FLA开源社区的经历,以及未来可能将稀疏注意力和线性注意力混合(如DSA+KDA)的构想。

103: 用Attention串起大模型优化史,详解DeepSeek、Kimi最新注意力机制改进
2025年2月26日 · 1:28:15
清华计算机系刘知远团队的肖朝军与清华电子系汪玉团队的傅天予在本期解读DeepSeek和Kimi最新发布的注意力机制NSA与MoBA:两者都在预训练阶段引入动态与静态混合的块状稀疏注意力,以应对长文本和长思维链带来的计算瓶颈。节目先讲清原理:注意力机制让每个词与上下文动态关联,但标准Full Attention需存储所有词向量并与每个词逐一匹配,因此序列变长时存储和计算按N方爆炸,这也催生了稀疏注意力和线性注意力(RNN回归)两大改进方向。两位嘉宾指出,NSA与MoBA的突破在于用块状稀疏设计(整块保留或丢弃)适配GPU并行与内存访问,并通过Triton算子优化让训练和推理都获得实际加速;静态稀疏(如滑动窗口)虽快但可能错过远距关键信息,所以动态与静态混合成为共同选择,而稀疏训练的性能也被证明可追平甚至超过稠密注意力。他们还对照自己此前的InfLLM与MoA:前者强调稀疏需在块级别做并做到训练无关的推理加速,后者通过识别关键注意力头来保留长程关联;两人在实验中最看重训练曲线(如NSA的Figure4和MoBA的Figure3)和长CoT生成速度,而非传统Benchmark。展望未来,多模态会让序列急剧变长(如一小时视频约百万token),存储/记忆将成下一瓶颈,线性注意力或RNN路线仍是重要理论选项。下期节目将与MiniMax研究员聊其01模型采用的线性注意力架构。
由 PodHood 提供支持