在 晚点聊 LateTalk 中提及的产品。

177: 详解Kimi K3:强到冲击Anthropic估值的模型什么样?
2026年8月3日 · 1:55:18
《晚点聊》由曼祺主持,邀请RadixArk与SGLang创始成员赵晨阳、华盛顿大学博士生曾致远,从Infra与算法两条线拆解Kimi K3:这款近3T参数的开放权重模型以混合注意力架构逼近并部分超越Claude Opus 4.8等闭源前沿,同时引发对Anthropic估值的冲击与开源安全辩论。节目指出,K3用KDA线性注意力与MLA全局注意力按3:1混合,靠循环状态压缩历史,在百万上下文下获得6.3倍解码加速;其Quantile Balancing以分位数估计替代固定步长调整,支撑896个路由专家中选16个的极端稀疏负载均衡,Per-head Muon则通过逐注意力头正交化提升大规模训练稳定性。后训练部分,K3先用MOPD多教师在线蒸馏合并9个领域专家模型,既降低合版压力又提升迭代速度;在Kimi CodeBench 2.0上,K3得分仅低最强模型4分,成本却只有对方的38%。嘉宾还拆解了Attention Residuals如何让深层模型选择性读取浅层信息,以及Kernel Development Agent如何让早期checkpoint自主优化内核,甚至为国产GPGPU写Kernel。讨论也点明,K3开放了权重、MuonEP、Flash KDA和agent-inv,但未开源RL环境、知识图谱任务系统与原始专家checkpoint——权重是一次训练的产物,环境才是能反复产生下一代权重的'流水线',构成开源模型真正的护城河。最后,嘉宾判断开源模型短期内仍难超越闭源,因为OpenAI与Anthropic内部最强模型通常比已发布版本领先半代到一代,但KDA这类线性注意力混合架构已证明'条条大路通罗马'。

143: 阿里、Kimi都在用的DeltaNet是什么?|与杨松琳聊线性注意力新改进
2025年11月30日 · 1:27:20
本期《晚点聊》邀请DeltaNet核心贡献者、MIT在读博士及开源小组FLA发起者杨松琳,解释线性注意力机制和DeltaNet从提出到被业界采用的演进脉络。她指出,DeltaNet源自2021年的论文《Linear Transformers Are Secretly Fast Weight Programmers》,它用Delta Rule强化模型的上下文检索能力,但当时缺少short convolution、输出门控等现代架构元素,也没有高效的并行实现,因此长期不受关注;直到她2024年提出《Parallelizing Linear Transformers with the Delta Rule》等算法,才让DeltaNet可以高效训练和扩展。节目中她也回应了最新行业动向:阿里Qwen 3.0 Next在注意力层混合了Gated DeltaNet与Gated Attention,Kimi Linear的KDA则是对Gated DeltaNet的改进,将粗粒度衰减细化为每个维度独立;而MiniMax M2从M1使用的线性注意力退回Full Attention,原因是线性注意力在多跳推理、状态追踪等Agentic能力上表现欠佳。杨松琳认为,线性注意力在推理效率和状态追踪上有独特价值,即便算力无限,它在高质量数据有限时也能凭借归纳偏更高效地学习;而稀疏注意力虽然单层表达更接近Full Attention,但KV cache不减少,长文本下仍是瓶颈。她还分享了自己从算法出身自学CUDA、受FlashAttention启发发起FLA开源社区的经历,以及未来可能将稀疏注意力和线性注意力混合(如DSA+KDA)的构想。
由 PodHood 提供支持