在 晚点聊 LateTalk 中提及的产品。

163: 详解DeepSeekV4:Infra巨鲸、百万上下文走进现实、极致效率优化
2026年4月30日 · 1:33:52
本集晚点聊详解DeepSeek V4,SGLang核心开发者赵晨阳(RadixArk工程师)和UCLA博士生刘益枫判定:它并非范式创新,而是沿R1的“测试时扩展”范式,用混合稀疏注意力、Muon优化器、mHC、FP4等互相耦合的工程优化,让百万上下文从理论进入实用。V4放弃了V3的MLA架构,改用滑动窗口+CSA稀疏压缩+HCA稠密压缩的层间分工,换来激活参数占比仅3%、单token推理FLOPs仅V3.2的27%、KV cache占用仅10%的极致效率;但两人也指出,解决同一问题的token消耗反而增加,有“高压水枪浇花”式的浪费。他们具体拆解了四个新特性:Muon优化器已成为检验工程能力的试金石,V4将Kimi Muon Lite的0.2系数改为0.18;mHC是DeepSeek对Hyper-Connection的稳定化改造;Infra侧TileLang降低新kernel开发成本,FP4训练让采样和部署一致,实现真正的物理提速。此外,DeepSeek这次不再披露训练成本,两人认为最终训练成本只是冰山一角;发布延期源于四个新feature耦合导致组合爆炸,但团队流动率极低。节目还讨论了DeepSeek内部评测中9%工程师不会将V4 Pro作为编程首选,以及中美模型路线分化:美国公司追新能力、高定价,中国公司追性价比和工程极限。关于评测,他们认为benchmark会过时饱和,evaluation才是永恒追求;V4也未提出新的能力域,但它的极致压缩和低单token成本,可能成为后续开源模型的起点。

158: V4发布前的DeepSeek:人才竞争、组织特点和独特的AGI目标|Solo
2026年4月6日 · 30:44
梁文锋领导的DeepSeek正因人才竞争、期权定价模糊和AGI目标分歧而经历人员变动,但这家不到200人的实验室仍保持不加班、重原创的独特氛围。主播程曼祺在节目中梳理了近期核心研究员离职:王炳轩被腾讯姚顺雨挖走,魏昊然、郭达雅可能加入大厂,阮冲去了自动驾驶公司元荣启行;直接诱因包括腾讯实习日薪被曝达5500元、字节Seed曾开出4000元,而DeepSeek无明确估值使期权价值难预期,MiniMax和智谱上市后股价翻五六倍也形成财富效应对比。更底层的张力是目标分歧:梁文锋重视国产生态(如换用Tailon算子库)和原创探索(GENIUS、Prover、OCR等),不单纯卷性能,这与他“每天高质量输出难超6~8小时、反对加班”的理念一致,却与外界期待其每次出手都像R1一样惊艳并不匹配。组织上,DeepSeek保持扁平,梁文锋直接带基模架构团队,周会向其他组开放,小团队可自发立项;产品端仅小几十人,至今未涉及AI编程、OpenClaw等热门方向,但梁文锋从2025年秋起强调产品化和商业化,3月招聘已首次提到要招agent产品经理。关于V4,节目称其或于4月开源,至少包括接近300B和500~600B的版本;但同时DeepSeek在OpenClaw模型消耗量中整体排第12(剔除免费模型后进前十),迭代频率低于智谱、MiniMax和Kimi。梁文锋本人几乎不融资、不见投资人,曾长期住酒店、现在租房,也不参与团建,被熟悉的人评价为“特别能抵抗噪音”;节目最后呼吁以平常心看待这家公司。

103: 用Attention串起大模型优化史,详解DeepSeek、Kimi最新注意力机制改进
2025年2月26日 · 1:28:15
清华计算机系刘知远团队的肖朝军与清华电子系汪玉团队的傅天予在本期解读DeepSeek和Kimi最新发布的注意力机制NSA与MoBA:两者都在预训练阶段引入动态与静态混合的块状稀疏注意力,以应对长文本和长思维链带来的计算瓶颈。节目先讲清原理:注意力机制让每个词与上下文动态关联,但标准Full Attention需存储所有词向量并与每个词逐一匹配,因此序列变长时存储和计算按N方爆炸,这也催生了稀疏注意力和线性注意力(RNN回归)两大改进方向。两位嘉宾指出,NSA与MoBA的突破在于用块状稀疏设计(整块保留或丢弃)适配GPU并行与内存访问,并通过Triton算子优化让训练和推理都获得实际加速;静态稀疏(如滑动窗口)虽快但可能错过远距关键信息,所以动态与静态混合成为共同选择,而稀疏训练的性能也被证明可追平甚至超过稠密注意力。他们还对照自己此前的InfLLM与MoA:前者强调稀疏需在块级别做并做到训练无关的推理加速,后者通过识别关键注意力头来保留长程关联;两人在实验中最看重训练曲线(如NSA的Figure4和MoBA的Figure3)和长CoT生成速度,而非传统Benchmark。展望未来,多模态会让序列急剧变长(如一小时视频约百万token),存储/记忆将成下一瓶颈,线性注意力或RNN路线仍是重要理论选项。下期节目将与MiniMax研究员聊其01模型采用的线性注意力架构。
由 PodHood 提供支持