晚点晚点聊 LateTalk2026年4月30日· 1:33:52

163: 详解DeepSeekV4:Infra巨鲸、百万上下文走进现实、极致效率优化

本集晚点聊详解DeepSeek V4,SGLang核心开发者赵晨阳(RadixArk工程师)和UCLA博士生刘益枫判定:它并非范式创新,而是沿R1的“测试时扩展”范式,用混合稀疏注意力、Muon优化器、mHC、FP4等互相耦合的工程优化,让百万上下文从理论进入实用。V4放弃了V3的MLA架构,改用滑动窗口+CSA稀疏压缩+HCA稠密压缩的层间分工,换来激活参数占比仅3%、单token推理FLOPs仅V3.2的27%、KV cache占用仅10%的极致效率;但两人也指出,解决同一问题的token消耗反而增加,有“高压水枪浇花”式的浪费。他们具体拆解了四个新特性:Muon优化器已成为检验工程能力的试金石,V4将Kimi Muon Lite的0.2系数改为0.18;mHC是DeepSeek对Hyper-Connection的稳定化改造;Infra侧TileLang降低新kernel开发成本,FP4训练让采样和部署一致,实现真正的物理提速。此外,DeepSeek这次不再披露训练成本,两人认为最终训练成本只是冰山一角;发布延期源于四个新feature耦合导致组合爆炸,但团队流动率极低。节目还讨论了DeepSeek内部评测中9%工程师不会将V4 Pro作为编程首选,以及中美模型路线分化:美国公司追新能力、高定价,中国公司追性价比和工程极限。关于评测,他们认为benchmark会过时饱和,evaluation才是永恒追求;V4也未提出新的能力域,但它的极致压缩和低单token成本,可能成为后续开源模型的起点。

  1. 0:00开场
  2. 2:50使用体感
  3. 7:44成本与延期
  4. 12:37范式讨论
  5. 16:42性能与效率
  6. 27:55架构总览
  7. 33:45注意力机制
  8. 39:47Muon优化器
  9. 48:52mHC
  10. 54:24Infra
  11. 1:09:58训练与测评
  12. 1:19:25行业趋势

PodHood 提供支持

文字稿

开场0:00

赵晨阳0:06

范式变化这个词在 AI 圈子被用得有点蓄势过载了 。

刘益枫0:12

DeepSeek 它放弃了 V3 的 MLA 架构 ,Kimi 的 K2 系列 、 然后 GLM5 系列依然是采用的 MLA 架构 。

赵晨阳0:20

现在的这个 Token 浪费 ,有种拿着高压水枪浇花的美感 。

刘益枫0:27

我们现在不是说 " 我们能不能做到 ",而是说 " 我们不知道我们还有哪些需要做的 "。

曼祺0:34

欢迎收听 《 晚点聊 》, 我是曼祺 。 这是一期非常硬核的节目 , 我邀请了两位一线 AI 从业者和我一起详解 DeepSeek V4 的技术报告 。

一位是模型架构背景的刘益枫 ,UCLA 在读博士 ; 一位是 Infra 背景的赵晨阳 ,他已加入开源推理框架 SGLang 核心团队 , 成立的商用公司 RadixArk。

如果一句话概括 :DeepSeek V4 是继续在 R1 的 " 测试时扩展 " 范式下, 用一系列组合创新和工程优化 , 让百万上下文从理论进入了实用新阶段 。

下面我们正式进入节目吧 。

刘益枫1:11

哈喽哈喽 , 我是刘益枫 , 目前是 UCLA 的机专级博士生 , 之前在越战面和字节 Seed 参与过基础模型研发 。

我主要研究方向是大语言模型的预训练 , 包括优化器和模型架构 ,也有后训练的研究经历 。 目前我一方面在开发新的大语言模型训练算法 , 另一方面也在尝试利用目前工业级别的模型的力量 , 参与主理面 Agent 相关的项目开发 。

赵晨阳1:39

哈喽大家好 , 我和益枫是本科加博士同学 。 我姓赵 , 叫赵晨阳 , 我在美国硅谷这边一家叫 RadixArk 的公司担任工程师 , 然后在 SGLang 这个开源推理架构和生态项目里面做开发 。

我们这个项目大概部署在全球可能有超过 40 万张 GPU 上做一个生产级别的推理 , 这算是这一代开源引擎当中规模很大的一个 。

我自己先前做强化学习系统很多 , 我也亲眼见证了 DeepSeek R1 在 LML 领域带来的巨大影响力 , 可以说某种意义上让这个领域得到了前所未有的重视 。

上一周 DeepSeek 新一代的模型 V4 发版 , 这个也是我们今天要讨论的重点内容 , 我们团队做了相当多的工程优化 , 成功在 DeepSeek V4 发布的当天 , 就把推理和强化学习两条链路都跑通了 。

这个待会儿聊到 Infra 的部分我会展开讲一讲 , 然后今天的播客会由我和益枫同学一块儿来分享 。

曼祺2:36

因为正好益枫的背景和之前的经验是比较偏算法和架构这块的 , 然后晨阳是比较偏 Infra 这块的 , 这两方面 V4 都会有一些改进和新的东西 , 两位的视角非常互补 。

就是正式来聊这个 V4 的进展之前 ,有几个我比较关心的问题 。 一个是 V4 发布之后, 你们作为一线的 AI 从业者 , 你们自己上手使用的体验是怎样的 ?

使用体感2:50

刘益枫3:01

作为用户使用端的角度 , 我也在 Arena AI 上面 , 就相当于是把 DeepSeek V4 和其他模型进行对比 。 我感觉的话 , 无论是像数学推理 、 像代码编写 , 还是说它让我 follow 一个 Agent 的指令执行 , 都要比 V3 要好得多 , 尤其是它幻觉比 V3 要少得多 。

能力上我觉得跟御三家还是比较接近的 ,但是在代码层面 ,Claude 还是比其他模型要好得多 。 体感上我觉得跟像 Kimi K2.6 这些开源模型还是比较接近的 。

曼祺3:40

你说和 Kimi 最近发的模型的感觉是接近的 , 那就可以说中国这些第一梯队的开源模型其实用起来体感都差不了太多 。

刘益枫3:48

对 ,但是代码方面就是说还是跟国外的御三家来说 , 它会有一定的差距 。

曼祺3:56

晨阳你可以说说你用 V4 的感受 。 因为这次就是你带的这个 SGLang 的创业团队 RadixArk, 你们也是做了 Day0 的 Infra 的适配 。

做这个适配的过程中间 , 你有什么比较有意思的发现吗 ?

赵晨阳4:10

这个很好玩 , 就是从工程角度 , 大概从 DeepSeek V3 开始 , 我们有一个细程 , 说 DeepSeek 每年的发布都会为开源社区的研究和 Infra 基本上是续命一年, 会注入一个非常非常强大的活力 。

比如去年 DeepSeek 提出这些 LargeGPT 等等这些架构 , 我们可能前前后后扎扎实实地做了有一年的时间 , 才能把这些细节都在开源领域实现一通 。

然后今年我预感也不会例外 ,因为今年他们这个报告上的 Infra 细节非常的扎实 。DeepSeek V4 依旧是 Infra 巨鲸 , 这次的变化架构也是非常大 。

就是从 DeepSeek V2 到 DeepSeek V3, 我们觉得这个 Infra 的变化比较渐进 , 它整体上是把 MLA 和 DeepSeek 的 MoE 这两套架构给 scale up 了 。

然后到了这个 DeepSeek V4, 注意力本身又有了新的巨大改变 , 这个 SWA 搭配着双压缩策略 ,其实也难度非常之大 。

我们在适配这个过程当中, 也得为我们先前有的前缀缓存 , 还有头级采样的这些方法 , 做一些非常多的优化 。

这个最终我们拿到的效果也是很不错 ,在各家评测上属于领先地位 。

曼祺5:22

因为正好益枫你这几天也去参加这个 ICLR 嘛 , 然后就很多研究员也聚在一起 , 又赶上 V4 发布 。 就是在这个会场大家有一些什么讨论吗 ?

刘益枫5:32

刚好就是说 DeepSeek 在那个会议期间发布了 , 然后大家讨论比较感兴趣的一个点是 DeepSeek 它放弃了 V3 的 MLA 架构 。

之前的话 ,DeepSeek 提出的 MLA 架构 , 然后 Kimi 的 K2 系列 、 然后 GLM5 系列之类的前源开源模型依然是采用的 MLA 架构 。

今年的 ICLR 会场上有一些就是基于 MLA 架构的改进或者说雕花啥的 , 比如像并行的 MLA 之类的这些改进 , 然后大家就会讨论这些继续在 MLA 的范式上进行深挖或者说雕花的研究到底还有没有意义 。

另一方面也在思考未来模型架构还有什么值得改进的方向 。 因为就是相当于是像几个月之前大家都认为就是说现在比较先进的开源模型都会就相当于是它的模型架构都逐渐收敛了 , 比如说都收敛到 MLA, 然后在 MLA 基础之上再进行一些小的改进 。

但 DeepSeek 它就相当于是它又放弃了 MLA 架构 , 回到了传统的 MQA, 那个就相当于 MQA 架构就相当于是说明那个模型架构本身它其实还是有非常大的改进空间的 。

曼祺6:43

MLA 就是 V2 的时候他们提的 。 如果这个要解释一下的话 , 就是 MLA 和 MQA 的这个简单的区别是什么 ?

刘益枫6:50

MQA 就相当于是跟其实跟最原始的那个 Multi-head Attention 其实差不多的 。 然后 MLA 就是跟之前的架构完全不一样 , 它是将那个 KV 进行低值压缩 , 这样的话就是我只需要存储就是比较就是压缩过后的那个 KV, 然后在那个在 Infra 的时候再把它 scale 上去 , 这样的话就相当于是能够节省 KV cache。

曼祺7:15

所以就是在比较核心的注意力机制这块 ,V4 相比于 V3 它又有一个比较大的改进 。

刘益枫7:22

对 ,V4 相比 V3 的话就相当于是它引进了就是 Token-wise 的这样一些改进 , 这样一个非常大尺度的压缩 。 我猜测的话可能是由于那个就是底层实现的原因 , 就说是那个如果把这些压缩合并到 MLA 上, 那可能实现起来就相当复杂了 , 可能就是因为这一点舍弃了 MLA 这种比较复杂的结构 。

成本与延期7:44

曼祺7:45

这次其实这个技术报告里有一个消失的东西 , 就是训练成本 。 我是指相比于 V3,因为 V3 的时候是直接提了说最后一次的训练成本是 557 万美元 。

这次其实报告里面 , 包括他们自己的官方的博客里 , 都没有特别明确地去讲这个数字 。 两位怎么看这个变化呀 ?

赵晨阳8:03

我觉得首先这个作为一个严谨的成熟公司 , 这个 DeepSeek 内部对成本的核算一定是算得非常清楚 。 我觉得他们不选择主动公开本身是一个信号 , 就是他们不再是一个需要靠成本叙事来定义自己的团队 , 转而希望用模型本身的能力来代表他们发声吧 。

刘益枫8:23

最终模型的最后那一次训练成本只是所有成本的冰山一角 。 就当时候的训练成本写的 557 万美元 , 它应该是最后一次成本 ,但是它有大量的前沿技术探索 , 然后包括像对比验证的实验成本 , 然后包括人力和数据成本 , 这些才是最终成本的主要部分 。

因此我觉得就是说那个再公布成本这个意义其实不算特别大 。 研发成本肯定是最后一次训练成本的几十倍吧 。

曼祺8:56

就是你们怎么看这个 V4, 它是没有上多模态的能力的 ?

刘益枫8:59

我认为 DeepSeek 可能一方面它更专注于文本处理能力 , 毕竟如果一个模型它想要处理多种能力的话 , 还是难度比较大的 。

另一方面对于像国产模型适配 、 国产显卡适配 , 包括本身它的结构已经很复杂了 , 如果说再融入多模态的这样一个结构来说 , 就是写 Infra 其实很难写 。

曼祺9:23

为什么 V4 训练了这么长时间 ,而且它确实也是 delay 了自己的预期的 。 因为大概在春节的时候 ,他们本来有计划想争取在春节的时候发 , 后来差不多应该算是晚了两个多月吧 。

赵晨阳9:37

所以这个具体的发布计划我们外界是很难知晓的 。 然后我可以从 Infra 角度去做一些推测 , 这个 DeepSeek 一次性引入了四个互相耦合的新 feature, 混合注意力 , 然后 MHC、Muon 作为一个新的优化器 , 还有 FP4 训练 。

这个像我之前提到过任何一个功能的单独上线 , 都是需要一个极大规模的 debug 的 。 四个起上, 这就是一个组合爆炸问题 。

然后特别是 Muon 在如此大规模 MoE 上的稳定性 , 然后把 FP4 做这个 forward-backward 的生产级别 , 生产级别的这个稳定 ,其实在公开层面都是极为前沿的尝试 。

我还是一直非常喜欢 DeepSeek, 然后他们在发的时候引用了一句话 , 叫这个 " 率道而行 , 端然正己 ", 这个非常有意思 。

我前面就读 《 道德经 》 嘛 , 这个 《 道德经 》 里面有一句话 , 我觉得可以用来讲讲他们这个状态 , 我觉得叫做 " 为而不是 , 功成弗居 , 创造万物却不占为己有 , 然后这个工业有成却不会自我夸耀 "。

我觉得他们一直都是一个非常值得学习的团队 。

刘益枫10:40

我补充一点 , 这次 DeepSeek 一个亮点是它原生支持国产芯片 , 这在 DeepSeek 之前的研究就是其实很少提到的 ,也有可能是因为那个国产芯片底层算子或者接口量比较大 , 很多时候就需要从零开始编写 。

如果他们之前尝试过这样一个编写的话 , 可能也会就是进一步增加研发时间 。

曼祺11:04

其实我看这个报告原文 , 它只有一个地方提到了国产的芯片 , 就是在 Infra 讲并行 EP 方案的时候 , 它提到了说我们在华为升腾上做了技术验证 , 这个就是你说的原生支持国产芯片 , 这个是做推理对吧 ?

刘益枫11:18

是的 。

曼祺11:19

训练是否用了其实不知道 , 就是外界有很多推测而已 。

刘益枫11:23

对 , 就是它并没有写 。 外界的推测大部分人还是推测它还是用的英伟达的芯片 。

曼祺11:29

我可以补充说一下, 就是刚才晨阳提到 " 率道而行 , 端然正己 " 这句话嘛 , 然后他们引用的是荀子非十二子 。在博客里面还写了前面两句话 ,是说 " 不宥于欲 ,不恐于傍 ",不要去就听那个追捧 , 你也不要去恐惧大家对你的质疑 。

这可能确实是我觉得从去年下半年大家一直期待它发 , 然后到现在真的发中间一段时间 , 这个团队会面临的一些内外压力 。

刘益枫11:57

对 。

赵晨阳11:57

这个高中的时候是 《 逍遥游 》 嘛 , 就讲这个 " 举世于之而不加劝 , 举世非之而不加举 "。 这是非常极高的境界 。

刘益枫12:06

我可能补充一点 , 就是在那个 DeepSeek 的作者致谢名单里面 , 我们可以看到就是说它的离职人员其实不是特别多 , 可能就是 5% 这样一个比例 。

就相比于就是其他公司的这样一个流动率来说 , 就是 DeepSeek 它的流动率是相当低的 。 我认为 " 不宥于欲 " 不仅仅是整个公司它的一个那个相当于是一个信仰之一 ,而且是那个公司研发人员他们自己就是也是不宥于欲 , 就是专心做好自己的事情 。

曼祺12:37

我觉得 R1 的时候它有一个非常大的舆论反响 ,是因为可能它有一个很好表达的一个变化 , 就是它用开源的方式验证了当时的一种新的范式 , 就是测试时的扩展 。

范式讨论12:37

曼祺12:47

也就是 24 年 9 月的时候 , 就 OpenAI 发 O1 的时候 , 大家看到的这样一种新的范式 。 是不是可以说其实 V4 从训练的整个这种大的思路上, 它不是一个范式的变化 , 它更多是你刚才说的 , 就我很多这种工程的创新 , 然后组合在一起 , 又能给它完成得很好的这样的一个进展 。

赵晨阳13:09

我觉得范式变化这个词在 AI 圈子被用得有点叙事过载了 。 就是范式这个东西 , 你也定成一种十年一遇 , 甚至更加稀疏 , 比如说这是什么牛顿 、 爱因斯坦这种人可以称得上一种科学范式对吧 ?

然后回到 AI 上, 我们觉得可能是 Transformers、Scaling Law, 然后 RLHF 或者 Constitutional AI, 然后 Test Time Scaling, 这些算是范式 。 可以想见这个 R1 在当年一年前 ,R1 的范式意义就是这个它在开源世界走通了 Long-Scale 的这个 Reasoning 吧 。

然后 V4 自己也非常坦诚地承认说其实也是 follow 了 R1 开创的范式 , 然后并且 V4 的这个定位也算是在范式下面解决了一些更艰难的问题吧 。

所以回过头来 , 我觉得每隔半年要是我们就要为这个 AI 找个新的范式 , 那只能说是 AI 的发展远远不成熟 。

我更想要讨论一个问题就是说 , 我们沿着现在这个 L1 的范式继续优化吧 , 我们还有多少的空间可以做 , 我们还有什么新的应用可能会诞生 , 然后我们做这一切事情它的上限在哪 。

我的判断就是说这个有非常非常大的空间可以做 ,而且每一步都会很艰难 。 像是 V4 这种系统级别耦合的工程 , 我还是觉得会是接下来一两年的处悬地 。

我们会想尽很多办法把这些所谓的 one million token 拆分成非常多的细散优化 , 然后结合起来做个整体能跑 。

这件事情它很工程 ,而且商业价值也非常巨大 。

刘益枫14:33

我再补充一点 , 与其就是从那个就是说方法论的角度去解释这个范式变化 ,不如说是范式变化可以解释成就是说提出一个新的模型能力的领域 , 比如说在像之前的常温能力 , 像 Kimi 就是相当于是用常温能力 , 包括现在 Agent 能力 、 幻觉能力这些 。

我觉得就是提出这些新的能力这样一个领域 , 才是目前大语言模型需要不断去做的这些东西 。 就我们现在不是说是我们能不能做到 ,而是说我们不知道我们还有哪些需要做的 。

从这一点上来说 , 我觉得就是 V4 带给我的远远没有像 R1, 甚至像 Kimi 最开始那个模型 , 那个提出的常温这种范式来说 , 就是非常大的震撼 。

曼祺15:19

就是说关键的是要去找要解决哪些问题 , 要做什么 。

刘益枫15:24

对 ,是的 。

曼祺15:24

不光是能不能做到 。

刘益枫15:25

是的 , 只要提出了一个能力的领域 , 我觉得就是说也就半年到一年的时间 , 基本上这个能力就会被现在的那个模型给刷爆 。

曼祺15:36

那你现在有看到什么能力 , 它现在可能还没有那么被关注 ,但之后可能会很有潜力吗 ?

刘益枫15:41

比如说 AI 自己的意识 , 目前 AI 还是人类的一个工具 ,但是 AI 是不是能够有自己的意识 , 自主行为能力是怎么样的 ?

赵晨阳15:51

其实我觉得有个重要的能力是减少推理的量 。 我的观点就是说很多东西是不需要 over-reasoning 的 , 然后这也是我对于现在这些模型 , 尽管大家对于解决 one million token 都非常在乎 , 然后我是觉得 one million token 应该拿去做更重要的事情 。

曼祺16:08

所以你关心的是其实它现在已经在做的一些事 , 它其实可以用更高的效率做到 。

赵晨阳16:13

对 , 就是我认为 somehow 这个 Agent community 需要想一个过程 , 就是我们怎么更高效地去利用上下文 。 我觉得现在大家对于上下文的铺张浪费已经被 Infra 给惯坏了 。

就现在大家可能觉得 one million token 是一个非常自然的事情 ,但是我始终认为 Infra 固然可以支持让 one million token 吐得更快 ,但是我们可能能在 one million token 里面做更多的事情 。

对 , 比如说现在可能我们去用 Claude Code, 去用 OpenClaude, 可以看看那个它吞吐的 token 量是一个非常恐怖的数量级 。

曼祺16:42

那回到 V4, 我们下面可以展开来详细地讨论一下就 V4 的效果 , 然后它里面的你们刚才提到的很多这种新的东西 , 它是具体怎么来起作用的 。

性能与效率16:42

曼祺16:52

我们可以先来看一下这个性能 , 就是因为按照惯例 , 每次发新的模型 , 大家也都会去更新一些 benchmark 嘛 。

这一次 V4 的 benchmark 有什么表现你们觉得是比较值得关注的吗 ?

赵晨阳17:02

V4 的 benchmark 里面有一段是我很喜欢的 , 就是他们只做了一段像 Arena 一样的这个双盲测试 。 然后我可以简单体现一下, 就是说这些 benchmark 大概是有这么几种逻辑吧 。

第一种就是比如说我要测你一个问题的正确性 , 我肯定就是一个 question, 然后你给我一个 answer, 然后我可以拿这个 answer somehow 去和正确答案做比较 , 然后按照某些规则给它一个分数 。

这种我们叫做 offline 的这个 benchmark 嘛 。 然后还有一种 benchmark 我们是做 online 的 , 就是说因为语言模型的评估非常主观 , 然后刚好我们可以利用这种主观性来做评估 。

那时候我们同样发一个问题 , 给两个你不知道的具名模型 , 然后 A 模型给一个答案 ,B 模型给一个答案 , 你自己 pick 是 A 模型好还是 B 模型好 。

而且就是有的时候可能大家用 GPT, 会发现 GPT 居然真的会干这个事情 , 就是它给你同一个问题下生成了两个 Claude, 然后让你自己 pick A 好还是 B 好 。

然后这也是一个很常见的分数嘛 。 我们管这个东西叫做这个 Tribalt 的这个对拼机制 , 叫做 Arena 或者叫竞技场 。

我们看到 DeepSeek V4 的 Tech Report 里面也讲了一下 ,他们自己有做一个内部的 online 实验 , 就是在公司里面有不同的工程师面临不同的任务 ,他们可以自行去选择用什么样的模型来完成他们的任务 ,并且给这些模型反馈 。

所以最后 overall 他们 complete 了很多模型 , 类似于 Claude 4.5、4.6、OpenAI 的 GPT 5.5 等等 , 然后坦诚地发布了说 V4 的分数大概是在 Opus 4.5 左右 , 然后和 Opus 4.6 还有和 5.5 还是有区别 。

然后他们有 9% 的工程师说不会将 V4 Pro 作为首选模型 。 我觉得这是一个非常坦诚的方法吧 。 然后这种内部采用的意愿 , 我个人认为非常的重要 。

这是先前这个晚点 , 可能是两天前的报道也说过 , 就是硅谷顶尖的模型公司 , 甚至可能也会用其他公司的模型来辅助编程 。

这是一个非常有趣的角度 。 我觉得这个还有一个非常有意思的问题 , 就是说这个世界上只有极少数的公司在编程上面是有数据飞轮的 。

就是任何一家公司如果想要在 coding 上面做出领先模型 , 都需要建立自己的这个编程数据飞轮嘛 。 然后被使用是有这种数据的最佳方式 。

这个事情是全球的同行都需要仔细思考的问题 。 这是我从报道当中解读出来一些角度 。

刘益枫19:24

我好奇问一下晨阳一个问题 。 首先一个解释数据飞轮 , 中国主要是以开源模型为主 , 然后美国是以闭源模型为主 。

开源模型就意味着就是说很多时候用户使用会自己部署在自己的机器上, 于是模型研发厂商它是拿不到这些数据的 。

这会不会导致了就是中国这种开源模型拿不到很多实际使用的数据 ?

赵晨阳19:48

我觉得不是的 。 因为首先这些开源模型 , 当它上了一个 trillion 之后的部署成本 , 根本不是个人能负担的 。

这个就是个人是不可能有一台去 200 或者像 B200, 或者说像国内的 910B 这样规模的显卡 , 对吧 ? 成本实在非常的高 。

然后退回来就是大多数的 , 哪怕这些模型开源 ,其实也是 host 在这个第三方的这些云上, 然后通过 API 的方式大家来调用 。

所以事实上无论如何都是走 API,在第三方有这个 trace。 所以事实上这些 trace 如果大家愿意用开源模型 , 肯定会拿到的 。

不过很遗憾的是 , 我据我所知 , 国内也是大量的在用美国的这些闭源模型 。

刘益枫20:26

OK, 然后第二个问题就是刚刚也提到了这 Arena。 目前来说 Arena DeepSeek V4 Pro 它排名大概是在 23 左右 , 然后比 Qwen 3.5 Max 和 Mimo V2.5, 然后包括像 GMM 5.1 都要略逊不少 。

然后包括另一个第三方的机构就是 Artificial Analysis, 它的 Intelligence Index DeepSeek V4 大概在 52 左右 , 然后同样也是比 Mimo V2.5、Kimi K2.6。

赵晨阳20:55

我个人感觉选择某款模型是需要有一定的 AI 信仰的 , 然后我愿意为了我的信仰选择这个 。

刘益枫21:02

确实 , 我觉得很多时候刷搒不是目的 。

赵晨阳21:04

这个也是我有一个很有趣的分享 , 就是我一直用 Claude Code, 然后有一天我们公司这个 Claude 因为账单的原因它被下线了 , 然后那天我去用了 Codex, 然后我的结论是离开了 Claude, 这个世界完全没有下雨 。OK, 所以我其实也很强的相信就是这些模型已经在 somehow 我的 use case 很难 differentiate 它们出来 。

然后所以我觉得这些在一个极其微小的空间里面去排一个先后其实很难 。 但是我觉得非常可以预见的是 , 现在我们国内也有非常非常多优秀的顶尖模型 , 跻身于智能的最前线 。

曼祺21:41

所以你刚刚意思就是说 ,其实你那天从 Claude 换成 Codex, 你也并没有觉得差多少 。

赵晨阳21:47

是的 ,是的 。 就是说这个一方面我觉得这个技术上, 这个技术流动非常快 , 然后另一方面这个也是从商业上来说 , 这个竞争也是激烈得不可思议 。

曼祺21:57

我今天也在跟人讨论这个问题 ,因为现在在硅谷的话 ,Anthropic 看起来它的势头非常的盛 , 对吧 ? 它是有盖过 OpenAI 的这个趋势的 , 包括估值上, 包括大家对这个产品的讨论上 。

就是有一个点在于说 Claude Code 你要一直保持现在这种领先的话 ,因为它还是一个相对封闭的体系嘛 , 它官方还是和自己的模型绑定在一起的 , 就是你背后要接的是 Claude 的模型 。

那如果说你要一直长期保持这个优势的话 , 那你就需要你自己的这个模型一直在这个产品它需要的能力 , 比如说 coding,也包括这种交互或者 agent 的框架上, 你一直要是最 sought 的 , 你要一直在第一梯队 。

但这个事能不能一直这样持续 ? 其实 GPT 5.5 发了之后, 我也是看了一些讨论 , 就有的人会认为 5.5 的编程能力又上了一个台阶 。

赵晨阳22:47

我周围有很多朋友这么反馈 。

曼祺22:48

包括我认识的有一些公司的 C-level 这种高管 ,他们也在考虑说要把下面接的模型从 Claude 有些也要换成 GPT。 就 to be 的 , 就是从公司的角度 , 它可能也会比较快有变化 。

我觉得这个我们可以都可以之后再观察 。 那回到 V4 的话 , 就刚才提到一些现象 , 一方面就是说他们可能在一些 Arena 上仅看排名是落后于同期发的一些中国其他的模型的 。

同时从使用上其实大家也不是很能明显地感受到它这个区别 。 这是性能 。 然后我觉得另一个大家比较关心的就是效率 。

然后效率上也是这次大家讨论比较多 , 觉得他们效果做得比较好的 , 就是相比于 V3,他们的单 token 的推理的 flops 是只有 V3.2 的 27%, 然后那个 KV cache 缓存占用是只有 V3.2 的 10%。

这个效率提升的程度是一个什么水平 ? 晨阳你可以讲讲 , 这个可能和 Infra 关系比较大 。

赵晨阳23:46

首先 DeepSeek V3 的时候 , 当时 DeepSeek 团队有说过一件事情 , 即便 V3 把价格杀得就是给市场来了重重的一刀 , 即便到了这种程度上 ,他们都仍旧有利可图 。

包括最近 DeepSeek 又发了一次大的降价 , 我不确定他们现在能不能还是取一个有 marginal gain 的一个状态 ,但是我还是觉得这是一件非常不可思议的工程壮举 。

曼祺24:10

就你说那篇文章是他们在 25 年 2 月搞了一个开源周 , 前面五天连发了五个 Infra 的开源成果 , 然后周六的时候发了一篇文章讲了自己的这个推理的成本 。

赵晨阳24:24

这个我印象不深了 ,但是我相信每股的股民印象也不深 。OK, 回到这个问题上来说 , 就是他们提到了这么几个数字嘛 , 这个类似于 flops 仅占 3.2 的 27%,KV cache 仅占 10%。

然后这个其实有一个比较重要的问题 , 就是说我们这次讨论的是压缩和稀疏带来的注意力改进 。

它得有一个前提 , 就是说上下文越长 , 这个效率优势才会越显著 。 如果你的实际测试场景只有几千 token, 那么 V4 相对 V3.2 的 flops 节省根本不会这么极致 。

然后包括很早的时候就是有一些第三方机构去评测这个 DeepSeek V4 的推理速度 , 可能拿着一个 8K token 输入 、4K token 输出的这个状态 , 这个其实不太能反映出来 V4 的一个架构优势的 。

所以 quick takeaway 就是说你的上下文越长 , 这个效率带来的优势会越发显著 。 然后如果你就是几 K token, 这个其实没有什么很明显的提升 。

不过换句话来说 , 几 K token 到现在是一个连 system prompt 都打不住的一个状态 。 所以基本上我能感受到就大家日常用的这些编程 , 或者说处理文字工作用到的这些 token lens 都会有比较好的提升 。

曼祺25:40

那是不是在 agent 上它的体感也会很明显 ? 因为其实 agent 要处理的上下文应该是挺长的 , 如果是个多步骤的复杂任务的话 。

赵晨阳25:48

是的 ,是的 。 这个就是说现在这些动辄接近 million token 的这些 agent 会很有收益 。

刘益枫25:54

但是有一个问题是什么 ? 它是在相同 token 数量的情况下, 它的 flops 和 KV cache 降低了 。 但是其实就是有很多用户反映 , 就是它的 token 消耗量 , 就解决一个问题的 token 消耗量比之前要大不少 。

如果说考虑这一点的话 ,其实它的整体的那个效率提升并不是特别明显 。 当然还是比之前来说总和加起来还是会有一定的效率提升 。

曼祺26:19

你说的这个点其实 cue 到了刚之前晨阳说的那个点 , 就是你觉得接下来一个要解决的问题就是我同样的 token 数量 , 我应该解决更多的问题 ,而不是说把推理一直搞得很长 。

那我也想问一下, 就是为什么它解决同样的问题 , 它的 token 消耗还变多了呀 ?

刘益枫26:36

首先它可能在训练时候目标还是倾向于就是说我只要完成这个任务 , 我得到的奖励越大 ,而不是说我完成这个任务需要多少 token。

然后还有的话就是说是它的一些结构 , 比如像 token-wise 的注意力压缩 , 把它的信息压缩得就是比较狠 ,也有导致了需要更多 token 去补足这些缺失的信息或者一些推理的过程 。

赵晨阳26:59

我之前在小红书发过一篇文章 , 我说现在的这个 token 浪费 ,有种拿着高压水枪浇花的美感 。 这本身是一件非常奇怪的事情 。

而且模型忠实地反映它受到了训练是什么样子的 , 可以想见就是在它的训练当中有部分的数据肯定是解决同一个问题比之前长了 , 所以导致这些在进入到了一个非常 , 我其实觉得这是一个不太好的 loop 里面 , 让解决一个问题所需要的 token 越来越长 。

这个问题一直存在嘛 , 类似于 K1.5 的报告里面有讲过 ,他们有一个这个叫做长度惩罚 , 就是会对这个解决同一个问题用了更长回复的回答做一个惩罚 。

我想这种技术肯定一直都是在用的 ,但是哪怕有了这种技术 , 我们也看到这个东西在不可逆的增长 。

那这可能背后体现出来我们一些训练上面还是有很多值得思考的地方 。

曼祺27:55

接下来就可以聊聊你们刚才提到的很多 , 就这种具体的进展的一些更细节的东西 , 就它是怎么在一起运转的 ,以及给整个业界带来哪些启发 。

架构总览27:55

曼祺28:06

这个其实我们可以根据它的这个技术报告来看 , 这个报告的脉络也非常清楚 。 就前面的引言 , 它自己也是解释了它认为这是一个什么样的进展 ,是在测试时间这个范式里面继续去优化它的效率 。

后面它就是在讲模型架构的设计 , 这是第二部分 。 然后第三部分是 Infra, 然后第四部分是预训练的过程 , 第五部分是后训练和评测 。

我们可以先说一下就是 V4 架构上的一些整体的思路是什么 。

赵晨阳28:33

V4 整体上保留了 DeepSeek、MoE 和 MTP 的这个两个主线策略嘛 , 然后在四个层面上做的改进是比较值得关注的 。

注意力上混合 , 还是说更加的混合稀疏 , 然后用了 mHC 的残差 , 然后在优化器上面选择 shift 到了 Muon 上面 。

然后 Infra 上面有两个关键词 , 一个是用了 TileLang, 然后另一个是做了 FP4。 然后这四个事情共同来说 , 它们让先前的一个 medium 上下文从一个理论可行变成一个成本可接受 。

我觉得这四个激活比例就是这一波模型里面很能说明问题的 。V4 Pro 的这个总参数是 1.6T 吧 , 然后它的激活参数反正就 50 左右 。OK,49, 对 。

所以这个比例大概是 3%, 对吧 ? 就是之前这个 Kimi K2.6 应该是比这个比例要稍微高一点的 , 然后他们应该再次往下探了这个极限 。

这个比例的下降其实反映出来大家一个很明确的工程信念 , 这个总参数越大 , 模型的知识容量会越高 , 然后激活参数越小 , 我们的推理成本会下降 。MoE 的核心价值就是把这两个量结偶嘛 , 然后 V4 又把这种结偶推到了一个更加极端的一个位置 。

当然激活比例并不是越低就越好 , 这个比例太低可能会带来负载不均 、 训练不充分 , 然后路由抖动这些问题吧 。DeepSeek V3 自己的这个 blog 也讨论过了 , 它说这个就是 routing 负载均衡是不是应该被纳入到这个训练损失里面 。

我个人觉得他们把 3% 的激活比例能够稳定训练到这种程度 , 再次印证了这个工程的极致能力 。

曼祺30:16

对 , 我补充说一下, 就你刚说那个激活比例比总参数的这个比例 ,在 V3 的时候是 5.5 左右 , 然后现在同期的这些模型里面 ,MiniMax、Model 7 是 4.3%,GLM 5.1 是 5.3%,Kimi K2.6 也比较低 ,是 3.2%。DeepSeek V4 Pro 是最低的 , 它就刚刚 3%,3% 多一点 。

赵晨阳30:37

OK, 我觉得可能听众朋友来听这个感觉像是在雕花一样 ,但是我可以说这个东西它的这个难度是随着这个数量在指数上升的 。

可能比如说从 5% 到 4% 的难度是一个样子 , 然后从 4% 到 3% 是另一个 ,是远远的强 。 我并不是说其他团队可能做不到这个样子 ,但是他们的技术选型可能想要走得更极致 , 然后很多团队可能会选择一些比较稳扎稳打的方案 , 这些并没有对错 , 只是我惊叹于这个事情还是能够继续往极限走 。

刘益枫31:08

我的话就是我倒是想用它的倒数来进行比较 , 比如说之前的话大概是一个 5:1 或者说 10:1、20:1, 然后现在 V4 已经提高了三十几 , 将近 40:1 这样一个系数比 。

就是这对于算法和底层算子开发 , 然后提出了相当高的要求 , 就相当于是它 40:1 的话 , 就是它有大量种余的这个 expert, 就需要保证各 expert 之间它训练程度的平衡 ,以及 token 路由的平衡 。

这一方面就是说它需要各个专家都能够几乎差不多的训练 , 另一方面来说 Infra 也要保证就是说这些路由能够非常顺畅地抵达各个专家 , 然后再合并起来 。

除此之外, 另外一个创新就是说它在前几层的 MoE, 它是用了哈希路由的形式 ,而不是说用一个给那个相当于是一般的 MoE 的路由的方式来进行 token 在各个专家之间分配 。

从算法程度上, 它是避免了前几层专家路由就高度集中在少数几个专家这样一个问题 。 不仅如此 , 就是说像 Muon 啊 , 然后包括像混合稀疏这些 , 它其实是以之前就已经有大量实践的这样一些那个 feature, 然后像 mHC 啊 , 然后包括一些特定的 Infra, 它是这次最新纳入实践的那些东西 。

但是呢 , 就是 V4 之前提出了很多技术 ,Engram 是其中少数没有被应用到 V4 模型上的技术之一 。 一方面呢 , 就是我们自己在实验中发现 Engram 本身对能力的提高非常有限 , 就相当于是它要增加非常大的参数 ,但其实它能力提升非常有限 ,而且 Engram 对于 Infra 来说 , 它其实也是比较大的挑战 。

曼祺32:52

你可以稍微解释一下那个 Engram, 就是这个是 25 年下半年的时候 ,DeepSeek 就单独发了一个论文去讲这个事儿 , 然后包括 mHC 也是那个时候单独发了一个论文 , 然后 mHC 是用到了这个 V4 里的 ,但是 Engram 没有用到 V4 里面 。

刘益枫33:06

对 ,Engram 是比一般的 Transformer, 它相当于是把就是两个 token 或者多个 token 就是合起来作为一个新的 token, 就是进行编码 , 然后再输入到对应的层数里面 。

就一般的输入 input embedding, 它只是针对单 token 进行编码 ,但是呢 ,Engram 是对于连续的几个 token, 它会有一个全新的编码 。

理论上可以提高像大海捞针这种能力 ,但是呢 , 就是说实际上来说 , 就是 Engram 它的提升效果非常有限 。Engram 只是强调了这个信号加强的这样一个作用 , 至少在短期之内 , 一般的 Frontier Lab 的模型应该不会采用这个方案 。

注意力机制33:45

曼祺33:45

那我们可以按照就晨阳你说的耦合起来工程爆炸的这四个点 , 我们可以展开说一说 。 一个是这个注意力的变化 , 它现在是用了一个混合了 CSA 和 HCA 的这样一个新的注意力的机制 。其实我们之前 2025 年到现在的好几期节目里都专门讨论了这个注意力机制的变化 , 然后 DeepSeek 一直走的都是这个稀疏注意力的改进 。

你们可以简单地分享一下, 就这次的改进具体是有哪些提升 , 包括你们看到的就是它背后可能是一个什么样的思路 , 可能给大家的启发是什么 。

赵晨阳34:17

一个首先他们的注意力是怎么用的 ,以及这个稀疏注意力嘛 。 然后有肯定有个对等的名词叫做这个线性注意力 , 这个就是一个非常容易掐架的话题了 。

这个简单来说 ,V4 的注意力是每一层都在跑一个滑动窗口注意力嘛 , 我们叫做这个 sliding window attention, 然后还有一个长距注意力 , 可能是 CSA 或者 HCA。

这个 CSA 是一个稀疏路线 , 然后在序列维度会做一个 4:1 的压缩 , 然后再做一个 top k 的选取 。HCA 可能是一个更激进的方法 , 做这个 128 分之 1 的压缩 , 然后保持一个稠密注意力 。

然后他们这个任何一层选择 CSA 还是 HCA 是一个预定义的 ,因此这个同一个上下文从不同的层来看 , 这个有的是稀疏层 ,有的是稠密层 , 然后稀疏层会来锁定这些关键的 token, 然后稠密层我个人认为它会提供一种语义上的概览 。

对于工程团队来说 , 我们 SGLang 在实现这个混合方案上面会有很多的挑战 。 我们最后把这个复杂问题集中, 需要处理的是这个前缀缓存的一致性 。

我们开发了一套缓存架构 , 称之为 Shadow Redis, 然后这套设计就是为了应对这个问题 , 然后我们做了三个异构的 KV cache 池 , 给这个 SWA 和 C4、C128 都加了压缩状态 , 然后同时我们还有这个注意在 prefill、decode、speculative decoding 这三个阶段都保持同步 。

可以听上去这些问题的复杂性相比 V3 阶段又上了一个台阶 ,而且这也不是 MoA 时代需要解决的问题 。 之前我可能听到过 , 应该也是晚点的播客吧 , 当时采访了松林 , 然后他讲 DeepSeek 内部是比较看好稀疏 ,而不是线性的 。

我是比较认为稀疏在工程上面是一个更容易控制的方案 , 然后和现在这些 KV cache、prefix cache 的基础设施都有比较好的亲和性 。

然后线性注意力的话 , 我目前没有听到有非常强大的模型 , 就是现在这个规模的 Frontier 模型能够验证的这套工具 。

刘益枫36:22

对 , 我补充一点 , 就是我看来的话 , 线性注意力它是能够很好地提高模型推理速度的 ,因此它其实被广泛应用在千问 3.5 的这种中效型的模型当中 。

但是呢 , 像松林提出的 gated DeltaNet 之类的结构 , 它在隐藏状态更新的过程中, 它每一步 token 的信息它都会不断压缩 ,因此在需要长程注意力的任务 , 比如像推理啊 , 比如像数学推导这些任务上, 它较于那个非线性注意力 , 它的上限可能就比较低 。

因此在更大的模型 , 像 DeepSeek V4 啊 、German 5.1 这些模型当中, 目前来说还是采用的稀疏注意力 , 或者说 sliding window attention 这样一个结构 。

就是一个非常直观的例子 , 就是说比如说第一个 token 到第 1024 个 token, 如果是线性注意力 , 它需要压缩 1023 次 。

对 ,但如果是 128 窗口的 sliding window attention, 它只需要跳 8 次 , 这两个 token 就能够几乎无损地进行那个信息交流 。 对 , 所以说要冲上限的模型 , 它肯定是比较倾向于稀疏和滑动注意力的 。

然而稀疏注意力对于训练 Infra 的性能要求较高 , 然后滑动注意力实验相对简单 , 然后短程注意力能力比较强 。

因此我觉得在未来一段时间的话 , 那个 sliding window attention 这种注意力的模型可能会越来越多 。

曼祺37:49

之前其实 Kimi 有可能有考虑过 , 就是在接下来的比较大的模型上用线性注意力的结构 , 就是混合了线性注意力的结构 。

刘益枫37:58

对 ,但是为什么要用混合而不单纯用那个就是全线性呢 ? 就是因为这线性还是有一个线性压缩的问题 , 就必须得用全注意力来进行兜底 。其实上次就是和杨松林聊那一期播客的时候 , 刚好是赶上 MiniMax 它又换成全注意力了 。

它之前有一个版本 , 就是 MiniMax 2.0, 它用的是一个他们叫 Lightning Attention, 就是一种混合了线性注意力的注意力 ,但在 2.1 它又改回全注意力了 。

赵晨阳38:28

我还有点印象哈 ,因为 MiniMax 2.0 的知识是我做的 ,MiniMax M1 应该是一个线性注意力的模型 ,但是 M2,2 开头的模型都是这个全注意力的 。

当时我还和他们这个做算法的同事有过交流 , 就是为什么会 take it back, 我们在我们 LMC SOG 的这个 blog 上面也讲过 , 我们称之叫做 no free launch 啊 , 这个欢迎大家可以去读一读当时的这个 blog。

然后退回来就是说 , 我们最近有一个新的工作叫做 High Sparse,是在 SGLang 上面支持的一个 KV cache offload 的一个工作 。 简单来说 , 我们针对稀疏注意力设计了一套特定的 KV cache 卸载策略 , 我们能够把稀疏注意力的 KV cache 预卸到这个 host memory 上面 , 然后在长上下文场景上面能够把吞吐量做到 5 倍以上 , 然后类似于 V4 这种把成本压缩到这个 27% 啊 、10% 的这种模型 , 要在生产环境

上跑出商业价值 。 我个人认为我们这个 Shadow Redis 还有 High Sparse 这一套底层可以同时推进 , 非常非常的有前景 , 然后这也是我们团队一直在做的事情 。

曼祺39:37

嗯 , 那接下来可以聊一下就是它架构里的另外就是你说的那四个变化里 , 另外两个一个是 mHC, 还有一个是在这么大的规模上用了 Muon 的优化器 。

Muon优化器39:47

曼祺39:47

我们可以先从 Muon 开始聊吧 ,因为这个可能业界的实践会比较多 , 包括刚才也提到说 Kimi 其实也用了这个优化器的开发者 , 就是那个 Keller Jordan,他也是因为这个成果 ,他是在 24 年 12 月就被招入了 OpenAI,他本来是一个个人开发者 。

今年在好几个场合上, 包括在 GDC 上, 杨志林也是一直在讲 Kimi 他们对 Muon 的一个优化 , 那个版本是叫 Muon Lite。 这个义风你可以先讲讲优化器 , 它在模型训练里本来是起一个什么作用的 , 为什么现在一个趋势就是好像大家都用 Muon 比较多了 。

刘益枫40:23

就是优化器的话 , 就相当于是就是模型训练原理 , 就是用梯度下降或者类似的方式 , 然后让那个就是模型逐步趋向于它定义 loss 最小的那些地方嘛 。

最开始是大家都在用 AdamW 进行训练 , 它这个本质上就是说融合了动量以及它的更新量的归一化的这两个技术 。

动量能够让那个就是它的更新更加 smooth, 归一化的是让它每一步 scale 是比较统一的 , 它就能够进一步的稳定训练 。

但是呢 ,AdamW 它是对于每一个元素进行的更新 , 它不涉及到整个矩阵的更新 。Muon 的提出就是为了解决 AdamW 只针对单个参数进行的更新 , 相当于是它对于二维的参数 , 比如像线性层 , 就是本质上是矩阵乘法 , 提出了效率更加高的一个优化 , 能够捕捉就是二维参数各个元素之间的信息 。

曼祺41:23

以前的那个工具的问题是 。

刘益枫41:26

它忽略了元素之间的联系 , 就会导致有些元素就是已经训好了 , 那就是比如说同样一个矩阵里面 ,有些元素可能已经训到收敛了 ,但有些元素还没训到收敛 。

曼祺41:38

训练时间更长 。

刘益枫41:39

Muon 把整个矩阵看作一个整体去进行更优化 , 使得整个矩阵各个元素之间它步调一致 , 它就优化更快 。

但是呢 ,在 24 年底的时候 ,Keller Jordan 刚开始提出的时候 ,他是对于每一个不同的模组 , 比如像线性层啊 、input embedding 啊 , 去特意的去调它的 learning rate, 对于使用者来说就是不是特别友好 。

但是到那个 25 年初的时候 ,Kimi 提的 Muon Lite 这样一个优化器 , 就是改进了 Muon, 使得 Muon 它能够和 AdamW 进行结合 , 就是因为在一维的参数上, 它并不是矩阵 , 就是 Muon 它必须要基于矩阵进行更新 ,而一维参数上它没有矩阵这一个概念 , 于是呢 , 就还是用 AdamW, 包括现在也是一样的 。

但是呢 ,Muon 和 AdamW 的 learning rate 在 Keller Jordan 提出来的时候 ,是并不知道它们两个比例的 ,而那个 Muon Lite 的一个重要的那个贡献 , 就是说把这个比例的系数基本给它确定了 , 就是 0.2, 然后在 V4 就进一步提个改进了 , 就是 0.18, 然后使得就是说我只需要调一个 learning rate 就可以适用整个模型 。

对 , 这样的话 ,Muon 才从一个理论上的创新转向实际上的大规模应用 。

曼祺42:57

嗯 , 所以 Kimi 做了 Muon Lite 这个改进之后, 可以说业界也是广泛地使用了是吗 ?

刘益枫43:02

对 , 就相当于我全局只需要调一个参数就够了 。 但是呢 , 就是比较特别的是 V4 它不没有使用 Muon Lite 提出 0.2, 它用了更精确的 0.18。

曼祺43:13

哎 , 晨阳有什么补充吗 ? 优化器需要你们 Infra 配合做什么吗 ? 就大家从 AdamW 变成 Muon 啊 。

赵晨阳43:19

其实这是一个相当大的问题 , 就是说在推理侧 , 这是一个不小关系的问题 , 推理本来就不涉及到这个参数更新嘛 , 然后在训练侧这个是一定需要做到的 , 然后整个链条动起来会是一个非常庞大的工程 , 要从 NVIDIA 的 Megatron 或者是 Megatron Bridge 这一层开始改 , 然后一层层往下传 。

当然我说的是针对开源而言 , 就是对于闭源的这些训练引擎 ,他们的 Muon 怎么实现 , 这个我也 。

刘益枫43:46

啊 , 关于这个我倒是了解一点点 。 对 , 就是相当于是 Muon 的话 ,因为它是相当于是矩阵层面的这样一个优化 , 它涉及到大量的矩阵乘法 。

如果说模型的某个矩阵比较大 , 那它会需要涉及到大量的就是拆分 , 它可能会需要分布式的训练 , 这个是 AdamW 是没有的 。

对 ,因为 AdamW 就是每个元素单独更新 , 就是元素可以无限拆分 , 这个是 Muon 特有的这样一个 Infra 的问题 。

所以在训练的过程中, 它会涉及到大量的这个拆分啊 、 合并啊这些操作 。 然后还有一个就是说是 , 嗯 , 预训练和后训练的那个优化器基本上得保持一致 。

对 , 就是说就是预训练用 AdamW, 后训练也得用 AdamW, 预训练用 Muon, 后训练也得用 Muon。Post training 的它比预训练的结构上更加复杂 , 又导致了如果说后训练它要用 Muon 的话 , 它可能会涉及到更多的结构上的修改 ,因为它可能在一个机器上装不下 。

曼祺44:47

现在开源的模型就近期更新的 ,是不是都用上 Muon 了 ?

刘益枫44:52

大部分模型应该都改到 Muon 了 ,但是应该还是有一部分用的 AdamW。 千问好像没有特别提及它的模型的优化器是什么 。

曼祺45:02

现在还没有改的是因为觉得 AdamW 有它的好处 , 还是说还没来得及改 ?

刘益枫45:08

就我认为可能大部分还是没来得及改吧 , 尤其是像后训练 , 它的 Infra 其实是很难改的 。 如果说后训练就是它没改成功的话 , 就导致了预训练也就只能用 AdamW 先将就训训 。

曼祺45:21

那我可以把这个东西作为一个判断模型团队自己的 Infra 能力强弱的标志之一吗 ?

刘益枫45:29

也可以这么说 。

曼祺45:30

嗯 , 这个挺有意思的啊 。 所以你觉得这基本上就是一个确定的趋势了 , 可能之后就变成行业的主流了 , 只不过在一个过渡阶段 ,有的人用了 ,有的人还没用 。

刘益枫45:40

啊 ,是的 。 但是呢 , 就是需要注意点是 , 即便是用了 Muon 的模型 , 它在像输入的 embedding 和输出 embedding 这种模块来说 , 它还是得用 AdamW。

赵晨阳45:53

其实这个可以简单纠正一下, 就刚才义风提到这个 AdamW 可能不太适合做 , 且说这个东西不一定 ,因为它跟你的模型体量相关 。

就是说你的模型都上 training 了 ,不可能在任何一个 node 上面 host 下来的 。 所以 , 呃 ,Muon 和 AdamW 肯定是要做非常复杂的并行策略的 ,而且 Muon 只会比 AdamW 还复杂 。

呃 , 这个简单可以简单想想看 Muon 和 AdamW 的区别 , 就是说 AdamW 是同时会维护这个 , 呃 ,momentum 和这个 maculum, 啊 , 这个什么 , 应该就是动量和速度两个 state 嘛 , 然后这些都是我们先前用的给 AdamW 都是 element-wise 的算子 , 然后所以它用来做切分会相对简单一点 。

就是你的 zero stage 怎么切 , 你的 FSDP 这些东西怎么做 , 怎么做 partial, 然后你的 TP 怎么对齐 , 相对而言会简单一些 。

然后 Muon 的话 , 它把这个二层的 momentum 砍掉了 , 所以 optimizer stage 就是从两倍掉到了一倍 , 这个肯定能够节省相当大量的显存 。

不过代价就是说它在 momentum 上面跑完一轮这个牛顿 - 舒尔曼迭代之后, 还要做增加化 , 然后这就不是一个除元素的过程了 。

呃 , 相当于以前是可能一个一个元素去做 pick, 现在已经变成一个更为复杂的矩阵计算 , 我们叫做一个 gym。 所以为了做这个 gym, 它是得拿到一个完整的二维权重的 。

所以说如果你之前你的这些参数它被切得很碎 , 比如说被 TP 或者被 FSDP 给切碎了 , 那么你还得把它聚合回来再来计算 。

所以这里涉及到很多分布式的原理 。 然后这一系列讨论最终得出的效果就是说 , 我们可以看 Kimi 在 K2 里面 ,Kimi 我印象中他们老老实实就只在这个就是 data parallelism 这个层面去做 Muon 的切分 ,他们不会去在这个张量变异上面去做切分 。

然后以及刚才义风系也提到嘛 , 这个 embedding、layer lorm, 还有 bias 这些层其实还是走的 AdamW。 所以 optimizer 层现在到了一个非常混杂的一个状态 , 然后它的调度逻辑啊 , 它的这些 , 呃 , 给 states 做的 checkpoint 啊 , 还有做的这些 , 就是就是我们叫做 checkpoint resume 啊 , 都有远超以前的这个复杂度 。

然后 Muon 可能它不是那么一个简单的换掉 AdamW, 就是你可以想象是我们用了大量的人力 、 大量的 Infra 复杂度去置换出来了一个当量的显存和收敛效率 。

然后这笔账值不值得 , 取决于每一个团队的工程水平 , 然后也取决于你有多少的显卡 , 你训练的模型规模有多大 。

但是义风提到有个观点比较对 , 就是 Muon 优化其实是检验一个团队工程优化上限的很好试金石 , 这个我非常的认可 。

这个专业名词听着非常的头疼 ,但事实上你可以想见 , 当我要报菜名的时候 , 说这么多名词的时候 , 每这里提到的每一个名词都是可能是一个 engineering day 的复杂度 。

啊 , 就是 。

刘益枫48:48

不而言之外一点 , 就是每一个名词都对应着一篇文章 。

mHC48:52

曼祺48:52

那这是优化器的这部分 。 然后关于 mHC 的话 , 就简单来说 , 这是一个什么改进了 ? 它为什么要引入这个东西 , 解决什么问题的 ?

刘益枫49:00

对 , 就是 mHC 是之前是基于自己的 Hyper-Connection 这样一个工作 , 它是扩散了层与层之间的信息流的宽度 。 以前的 transformer, 它相当于是层与层之间 , 假设就是每一层之间它只有低维的信息的宽度 ,而 Hyper-Connection 的话 , 就是我在低维之上再加了一个 channel 位 , 就是现在有 channel 乘以 d 这么大一个信息的宽度 , 现在就是 d 乘 c, 就相当于比以前的信息的宽度大了 c 倍 。

这样的话就能够更好让模型能力能进一步提升嘛 。 对 , 它的信息流更大了 , 它的模型的就是推理啊什么的能力就会有显著的提升 。

但是呢 , 就是朴素的 Hyper-Connection, 它的数学原理就导致了它的梯度回传不太稳定 , 训练不太稳定 。 所以说就是之前就是直接提出来过后 ,其实社区的反响不是特别大 , 对 ,因为训不好 。

然后 mHC 的话 , 它加入了这个 synchron crop 的算法 , 就是相当于是它限制了整个信息流的 scale 是 1, 横竖都是 1, 就相当于控制了就是正向和反向传播 , 它不至于爆炸和消失 。

这个改进呢 , 我认为一方面就是需要对于这个前人 Hyper-Connection 这样的那个细致分析 , 然后另一方面呢 , 就是说它可能是基于一些内科指标 , 比如像它梯度的那个 scale, 或者说它的激活值的这个大小 , 来发现一些现象 , 然后从现象去倒推我怎么样去解决这样一个问题 。

曼祺50:33

所以这算 DeepSeek 一个比较独特的判断也好 , 或者说它的什么选择也好 , 就是他们选择去改进这个事 , 本身在当时可能也不是很多人在做 。

刘益枫50:43

对 。

曼祺50:43

在现在所有的这种就是到这个规模 , 一 T 大左右的这种模型里面 ,是不是也只有 V4 用了这个东西啊 ?

就这并不算一个特别主流的做法 , 对吧 ? 相比于 Muon 优化器 。

刘益枫50:53

是的 。

曼祺50:53

那你怎么看 , 就它用了这个 mHC 带来的这个模型 , 比如说哪些方面的提升 ?

刘益枫50:58

直观的看法就是推理能力 , 就相当于是有了大幅度的增长 , 就是说我不必等着那个信息从第一层慢慢慢慢的传到最后一层 ,而是说就是我的就是车道变宽了 。

曼祺51:11

推理能力有大幅的提升 , 这个是当时 DeepSeek 在 mHC 这个单独的论文里面 ,他们专门是做了就是比如说控制变量的这种非常精确的比较吗 ?

刘益枫51:21

他们应该也没有精确的去比较 , 就是说这个它的具体是不是能力提升 , 它只去比较它一些 benchmark。 另外一个我想补充一点就是说 mHC 它是从增加信息流宽度去进行增加层与层之间信息的互动 , 然后最近我也注意到 Kimi 提出 Attention Residual, 它是像 DenseNet 一样 , 它层与层之间直接就是说就是跨层进行互相连接 , 它不需要就是每一层每一层挨着这样连接 ,而是说第一层

也可以直接去影响最后一层的信息 。 我认为这两个虽然说那个方法完全不一样 ,但是呢 , 都是异曲同工的想到了我需要去在 layer-wise 去进行那个信息流的这样一个改进 。

曼祺52:09

嗯 , 那这两种方法的区别和它未来的上限你怎么看 ? 一个是 DeepSeek 现在在用的 mHC, 这是它比较独特的一个做法 , 然后另一方面是你说的 Kimi 也是最近 Kimi 提的 Attention Residuals 这个 。

刘益枫52:25

我认为对于我们资源比较有限来说 ,mHC 它的实现起来 ,Infra 相较于 Attention Residual 还是相对比较简单的 。 对于我我来说的话 , 可能就是更加倾向于那个去搞 mHC 相关的 , 就包括我们 1 月份提出的 Deep Delta Learning, 就是类似的 Hyper-Connection 技术去进行另一方面的那个规划的处理 ,在只增加极少的计算量的效果之上, 就是说达到了非常好的那个 performance。Attention Residuals 的话 , 它就是它对 Infra 的要求更高 ,

对 ,但是呢 ,因为它对于层与层之间关系一个更加精确的这样一个描述 , 所以说我认为它的上限会比 Hyper-Connection 这一系列研究它的上限会更高 。

曼祺53:12

mHC 这个事啊 ,因为它可能也是在训练这个过程的 , 它对你们比如说推理框架去做适配 , 或者说去做一些变化会有影响吗 ?

赵晨阳53:22

其实是很多的呀 。 就是从推理的角度来说 ,mHC 把残差的简单 add 变成一个需要这个 synchron 归一化的 , 然后还要给 gym 加个 mixing, 这个操作会复杂许多 。

呃 , 然后呢 , 这个我们带来的直接挑战就是先前的算子对于这个 mHC 而言是不够高效的 , 所以我们需要为这个 mHC 给单独写一些新的 kernel, 包括呃 , 我们最近也 release 了用 TileLang 去给 mHC 写的 split kernel。OK, 这个东西在少 batch 解码情况下能够显著提高 GPU 的利用率 。

呃 , 我们不太需要在乎这个具体的 kernel 是什么东西 ,但是呃 , 为了新的算法定制新的 kernel 的事情 ,在 V3 以前其实做的没有那么的频繁 , 然后这个时代我们也做的越来越多 。

不过可以不过比较欣喜的是 , 现在我们也有了更多更好的工具 , 类似于 TileLang 能够更高效的去支持这个为新算法写新 kernel 吧 。

Infra54:24

曼祺54:24

OK, 那到现在其实我们是盘点了 , 就是你说的那四个一起来的新东西里面的前三个 ,有新的注意力机制 ,有那个优化器 Muon 他们有一些改进 , 然后还有 mHC 就是 DeepSeek 比较独特的做法 。

然后第四个就是它在 Infra 上的两个关键词 ,TileLang 和 FP4 啊 , 这个可以陈阳你主要展开说一说吧 , 这个你应该比较了解啊 。

赵晨阳54:50

嗯 , 这两个词 , 哎 ,again, 这个都是付出了无数 Infra 工程师的辛勤劳动 。 我可以简单先介绍一下这个 TileLang 啊 , 我喜欢叫做这个东西叫 TileLang,因为 TileLang 听着像是那种拳击大师的名字 。

我可以这么理解 , 就是说 , 呃 , 大家可以想就是 , 呃 ,Infra 解决的问题应该叫做给定同样的计算路径的情况下怎么样一个计算更快 。

然后写 kernel 大概就是说 , 呃 , 我们底层有非常多的这种核 , 就是这些核会结合一些硬件特性 , 然后呃 , 嗯 , 然后虽然可能我们做的矩阵计算都是同一块 ,但是经过不同的核 , 它拿到的效率是不一样的 。

举个简单例子 , 比如说我给一个这个 4096 乘以 4096 的矩阵做一些计算 , 你可以把它按照 128、128 的拆 , 那你可以把它按照 250、256 的拆 。

然后不同的硬件由于它的这个显存带宽之类不一样 , 所以有的硬件可能喜欢 128,有的硬件可能喜欢 256。 总之就是 , 呃 ,kernel 大概就是干的这么一个事 , 就是让这些底层的矩阵计算变得越来越快 , 当然还有很多很多不同种的 kernel。

然后写 kernel 是依赖于很多语言的 , 然后这种语言我们称之为 DSL, 就是呃 ,Domain Specific Language。 这里面我们一般拿这三者做个对比嘛 , 就是 CUDA、Triton, 还有 TileLang。

然后 CUDA 是最有名的 , 我们一般称之为英伟达的护城河 , 英伟达是一家伟大的硬件公司 , 然后在硬件上的一层的软件 , 就是在 CUDA 这一层也是做得非常非常的优秀 。CUDA 呢 , 毫无疑问是性能最高 ,但是开发维护成本也最高的一套语言 。

然后 Triton 极大的降低了写 kernel 的门槛 , 虽然还是很高 , 它比 CUDA 的门槛低了很多 。 然后坏处就是它确定了很多表达能力以及它的极端性能 。

然后, 呃 , 可能同一个 kernel 你用 Triton 写出来 , 可能比起用 CUDA 写出来 ,CUDA 就会效率高不少 。 呃 ,yeah, 然后 TileLang 的话走的算是一条中间路线 , 就是它比 Triton 更底层一些 , 然后表达能力也更强 , 然后又比手写 CUDA 的开发效率更高 。

然后 TileLang 也是这个这个国内发展起来一个优秀的开源项目嘛 。 嗯 , 然后在这个 V4 的报告里面提到了 TileLang 的几个优势 , 我可以简单解读一下, 就是把一些 kernel 的启动开销压缩到了微秒级别 , 然后以及它为这个未即可重现给了很多的提升 。

这个未即可重现类似于我同样一个 prompt 输入给 , 呃 ,DeepSeek V4, 如果我用 TileLang 的话 , 它的它两侧 forward 的推理出来的结果可能是更好重现的 , 这对于推理工程师去 debug 是很有帮助的 。

这些可能科普一下, 就是这些什么 TileLang、Triton 和 , 呃 ,CUDA 的区别吧 。 然后我个人来看的话 ,TileLang 的长期价值是为了这个是在这个新算法快速开发高性高性能 kernel 这件事情的编辑成本大大降低了 。

这个在 DeepSeek 提这个 mHC 的时候 ,他们就写了嘛 , 这个他们已经为 mHC 写了一版 TileLang 的这个混合精度的 kernel。

然后 TileLang 现在非常流行 , 我们团队 SGLang 这边的话 ,也是针对推理场景的 small batch side decoding 做了一个 split k 的 TileLang 版本 。TileLang 现在已经被前沿的 lab 当做算法的默认选择之一了 , 这也是可能最近一年半发生的一件事 。

曼祺58:15

你说的这个前沿 AI lab 是就所有的美国的也都算上全球的前沿 AI lab。

赵晨阳58:21

嗯 , 对 , 大家对于这块的投入其实是很大的 ,因为很早以前这个大家戏称这个做做编译器这一层是非常非常苦的 ,但是现在大家也看到了这一层的优势 , 就这一层的重要性 。

曼祺58:34

嗯 , 我觉得这个还挺感慨的 ,因为这是北大就杨志老师那边他们发起的一个开源项目 , 当然后面肯定也有很多社区的人一起来贡献和维护啊 。

然后它又是就你刚说 DSL 这个比较底层的语言 ,其实在五年前的时候 , 那会儿我刚来晚点啊 ,有一个采访 , 就是去采访鸿蒙的负责人, 然后他就提到说他们以前在华为就做鸿蒙的时候 ,他们想去招那种就是会会编语言的人 ,在国内就非常非常难找啊 , 就找不到啊 ,因为他们那个做得很早嘛 , 就差不多可能之前十年前吧 ,他们就有在想做这个

事情啊 。

赵晨阳59:11

对 , 这个我可以说这个做编译器一直是一个非常伟大的事业 , 真的非常的苦 ,而且它并不是一个那么容易出名的事情 ,因为这事情听上去它 , 呃 , 很扎实 , 然后, 嗯 , 它离商业层面很远 , 所以听所以其实受到关注不多 。

然后这几年我觉得它越来越受到关注 。 然后我前面也提到这个 TileLang 和 CUDA、Triton, 然后可以这么说 , 就是严格来说我看来这个 TileLang 和 Triton 是 DSL,CUDA 不是 ,CUDA 太全面了 , 就以至于它不算很 specific。OK, 然后 TileLang 和 Triton 做出的抽象我个人理解都很不错 。

所以简单来说就是我觉得 TileLang 为了表达力放弃的底层控制算是达到一个很好的 。

曼祺59:52

像这种开源的这种生态越来越多 , 它和 CUDA 之间的关系未来长期会是怎么样了 ? 就它是帮助说比如说 CUDA 这个生态更丰富更完善了 , 还是说它也有可能和其他的国产的芯片啊 , 或者什么其他的芯片结合 ,他们可以一起来和英伟达形成一种竞争 ?

赵晨阳1:00:10

Hard to say, 我觉得这是一个复杂的关系 , 就这个类似于各个模型厂商之间彼此会发这个技术报告 , 然后大家可能会彼此学习 ,但是另一方面就是大家多少也有些竞争 。

刘益枫1:00:22

对 , 我我也补充一下, 就是我感觉就是说像 TileLang 啊 、Triton 啊 , 相比于 CUDA 也就类似于 C++ 相比于会编 , 或者说 Python 相比于 C 一样 , 就是不同的层级而已 。

赵晨阳1:00:34

就 CUDA 还是要更底层一些 , 对吧 ?

刘益枫1:00:36

对 , 就是 CUDA 它直接就是跟那个硬件进行交互嘛 。

曼祺1:00:42

那像 TileLang 的话 , 它可以用在就是别的芯片的厂商做的这一层更底层的软件上吗 ?

赵晨阳1:00:49

啊 , 事实上也是如此 , 很多硬件厂商也会主动去支持这些 DSL, 包括这个就是 Triton 中国这个生态圈也是有非常非常多的硬件厂商一块 host 起来的 。

曼祺1:01:00

你们怎么看 , 就是 DeepSeek 用了非常多的 TileLang, 当然你也说到这个是一个呃 , 全球的 lab 也都在做的事情啊 , 然后可以说他们在这个上面投入的是额外的要多一些吗 ?

因为我看 V3.2 里其实就提到了 。

赵晨阳1:01:15

我觉得这个会比 , 嗯 , 就是我只能说他们投入了很多 ,但是你说他们比其他人更多 , 我不确信 ,因为其他公司的这个披露出来的内部技术实现是相对有限的 。

曼祺1:01:27

嗯 , 这是一个关键词 。 然后 Infra 另一个关键词你前面提到你说是 FP4 啊 。

赵晨阳1:01:33

呃 , 我们其实先前提到过这个 DeepSeek V3 是第一个把 FP8 这个做到一个很大量级的工作 , 到了 V4 就把 FP4 给做出来了 。

我很难想象难道再往下走会进行更更激烈的优化 , 更激烈的压缩吗 ? 呃 , 非常值得期待 。 然后, 呃 , 我们可以对比一下 FP4、FP8, 当然还有 BF16, 这些词 , 呃 , 只看最后一位嘛 ,48:16, 就是它代表的是这个 , 呃 , 浮点数的储存位宽 。

比如说 BF16 就是用 16 位来储存一个浮点数嘛 , 然后 FP4 就是同样的一个数字 , 我只用四位数来表达 。 然后, 呃 , 直观来说这些迭代最大的区别就是数位在不断被减半 , 好处是我们的峰值算力肯定会得到很大的缓解 。

然后除此之外, 给我们的显存容量和数据读取也带来了很大的这个提升 。 呃 , 我可以想见就是 , 呃 , 大家经常提算力算力算力 ,其实还有两个很关键的词 , 显存容量和数据读取太宽也是大模型训练的一个显著瓶颈 。FP8 的精度压缩到 FP4, 这个显然显存和带宽需求近似于是砍半了的 , 这个是可以带来很明显的提速 。

以前业界是很少有人在超大规模训练中直接使用 FP4 的 , 首先这 FP4 的范围实在是非常的狭窄 , 很容易在训练过程当中出现梯度溢出或者归零 。

所以 , 呃 , 这个 DeepSeek 为了解决 FP4 的这个训练 , 无论是 pre-training 还是 post-training 都用了非常多的工程上的巧思 。 然后这个我可以 pick 一个比较我自己最熟络的这个东西叫做 QAT, 就是他们在这个 post-training 的时候做了所谓的量化感知训练 ,Quantization Aware Training, 它是一种叫做训练时模拟量化 、 采样时真实量化的一种方案 。

呃 , 我们可以理解这个强化学习是一个两阶段的循环 , 一个阶段是采样嘛 , 就是模型拿到了这个系统机的这个输入 , 然后开始生成自己的回复 , 然后进行采样 , 然后之后采样得到的东西进行打分 , 然后再把这些打分拿去训练 。

所以它就分为了一个采样阶段和训练阶段 。 采样阶段就是我们称之为 rollout。 然后, 呃 , 我们可以倒着来讲 ,在训练阶段的话 , 我们会做一个叫模拟量化的操作 , 训练时我们在优化器维持 FP32 的主权重 , 然后在计算前先将其压缩到 FP4 的范围 , 然后再无损反量化回到 FP8 进行计算 。

这个就是我们说的伪量化 , 它进行了一步快速的快速的量化再反量化回来 。 这个过程其实中间没有进行任何的前向计算 , 它只是就做做这么一个 flipping 的操作 , 让量化误差在这一步能够得到体现 。

做了这一步这个伪量化之后, 我们再用 blockwise 的 scale 的 scale scale point 去把离群点给兜住 , 这样模型虽然没有在训练阶段这个真正的受到量化影响 ,但是它已经适应了这个低精度的损失 。

然后回到这个采样阶段 , 我们会进行真实的 FP4 量化 。 到了这一步 , 我们会把前前面那个量化得到 FP4 的权重拿去真正的去做采样 , 然后这样到了采样阶段 ,FP4 的权重真正的斩断了仿存瓶颈 , 让这个物理提速得到了真正的实现吧 。

然后更值得欣喜的是 , 推理阶段的 FP4 的这种采样和我们之后的模型部署是一致的 ,因为看现在 DeepSeek 发布的那个 checkpoint, 它也是 FP4 的嘛 。

所以说训练过程中拿去采样的那个权重就是拿来发布的权重 , 它不是说我们拿 FP8 训练好了之后得到一个 FP8 的权重再把它量化成 FP4, 这样其实还是会有精度损失的 。

所以 , 呃 , 通过这种训练端的伪量化 , 然后采样时的真实量化的方案 ,其实这个强化学习的效率得到了很大的提升 。

然后, 呃 , 我们可以举一个更有意思的例子 , 就是强化学习经常我们会认为它在越大的模型和越长的越长的这个 token budget 下面 , 采样是越重的 , 采样可能会占到 70% 以上的时间 。

然后在采样的时候 , 我们把位宽和显存读取压力大大降低 ,其实对采样速度有很好的提升 。 呃 , 这个说得非常的具体啊 , 总之我就可以推荐就是这套这个伪量 , 这套训练时伪量化 , 然后采样时真实量化的方案在 DeepSeek 的论文当中也有很强的体现 。

这个作为 Infra 同行 , 这个可能是我们去年在十月份左右的一个重点 , 然后先前 Kimi 的 K2 其实也有用这套方案 。

我们 SGLang 的 R1 团队去年就啃这块硬骨头 , 我们做了两个工作 , 一个叫做 FP8 的全流程强化学习 , 就是训练的时候用 FP8, 然后推理时候用 FP8, 然后还有一个是 INT4 的 QAT。INT4 和 FP4 其实不太一样 ,但是可以想见其实也是一些比较激进的压缩方案 。

然后, 呃 , 基本上这个行业里面大家还是躺过同一条河的 , 这个背后的艰辛是很是难能可贵的 。OK, 然后实事求是的讲的话 ,在开源领域 , 我们团队的这个 , 呃 , 这个量化 R1 做得还是很领先 ,不过我们其实相比 DeepSeek 还是有一些这个差距 。

我们的这个 INT4 的这个量化感知训练在采样还是做的 W4、A16, 就是说这个 , 呃 , 权重是这个四位 ,但是激活值是十六位 。

然后 DeepSeek 做到了更极限的 W4、A4, 就是所谓的权重是四位宽 ,但是激活值是八位宽 。 然后在极致性能上面 ,他们当然走得更远 , 这也会是我们要继续攻坚克难的方向 。

曼祺1:07:04

我有一个问题是 , 如果 DeepSeek 它自己把推理框架给开源了 , 它和别的就官方的推理框架开源了 , 它和别的开源的这种框架的关系会是什么 ?

赵晨阳1:07:16

OK, 这个其实是一个开源 , 就是其实开源推理框架和闭源推理框架的一些哲学上的区别吧 。 我觉得开源推理框架的一个重点是众口要条 , 比如说我们同样一套框架 , 可能 DeepSeek 的模型领先 , 我们要 serve DeepSeek, 然后可能有小米的模型 、MiniMax 模型 、Kimi 的模型 , 我们要在这么多模型中中间都要支持上, 这种就是整合性是非常非常重要的 。

这可能是我觉得开源的推理引擎和 DeepSeek 内部推理引擎的重大区别 。

曼祺1:07:48

那进一步来说 , 就作为一个这种开源的要支持很多模型的这个框架 , 它最后给开发者或者说给你们的用户的这个价值是什么 ?

赵晨阳1:07:57

嗯 , 我觉得最大价值就是本地部署的推理引擎对于很多这个公司是有直接需求的 , 开源推理引擎的性能提升也会反过来 push 这些闭源的推理引擎 。

呃 , 训练上其实也是一样的 , 就是开源很多时候未必能做得比闭源领先 , 然后我觉得推理上面闭源和开源其实差距并不大 ,但是训练上面其实闭源的训练会比开源还是要领先不少的 。

我觉得开源有个很大的意义 ,也是通过开源的方式让整个领域变得更加透明 。 我可以再分享一下这个 , 很长一段时间闭源的训练引擎是比开源的训练引擎强大很多 , 然后以前 R1 也是一个负担非常非常重的事情 , 比如说一个模型可能二月份上线 , 可能到了五六月份才会有开源的 R1 框架能够把它的 R1 跑起来 。

这点上来说 , 呃 , 我也比较欣喜这个我们团队这次其实也做到了一个在发布当天就支持了这个 R1 的 , 呃 , 全全链路 。

就是 , 呃 , 逻辑上来说这个 R1 和推理是很相关的 , 就是推理是做这个不带参数回传的 forward 的嘛 , 我们做强化学习就 care 采样 , 采样完了再做参数回传 。

我还是觉得非常高兴能够在如此巨大的 MoE 模型上面同时做好推理 , 同时做好 R1, 然后我们在训练侧和推理侧的一致性也做了 ,也做到了极致 。

我也可以预见 FP4 已经算是正式走出了这个硬件厂商的 PPT, 成为了这个开源语言模型世界里面真正跑通超级模型的工业标准 。

曼祺1:09:25

嗯 , 那像 FP4 的目前来说 ,是不是这么大模型上只有 DeepSeek 用了 ? 就开源的可以看到技术细节的模型里面 。

赵晨阳1:09:34

啊 ,其实这个那个 GPT-oss 其实也是的 ,但是大家的这个技术选择不完全一致 。 呃 , 只能说 FP4 是一个全世界一起努力的方向 。

曼祺1:09:45

但至于说闭源模型是怎样的 , 就外界就不太清楚了是吗 ?

刘益枫1:09:48

另外一个用了 FP4 的是英伟达 ,因为它它自己 。

曼祺1:09:52

应该是黄仁勋想推这个吧 , 这是他们推动的方向之一 。

刘益枫1:09:55

然后 Blackwell 也是支持这个 FP4。

训练与测评1:09:58

曼祺1:09:58

对 , 然后前面就是讲了这四个四个这个新的东西嘛 , 然后在这个报告的最后一部分 ,其实他们自己是讲了训练的过程 , 包括预训练的过程 , 包括后训练和测评 。

这个部分你们有看到什么觉得比较有意思的亮点吗 ?

刘益枫1:10:11

一个比较亮点就是那个它的 post-training 的里面 , 就相当于是先分裂专家 , 然后就相当于是再进行那个 on-policy distillation 嘛 。在最近一段时间就是 on-policy distillation 又开始大家都在研究这个东西 ,但是呢 , 具体怎么做其实各家还是有很大区别的 。

蒸馏这个做法在 DeepSeek V3 和 R1 上, 它其实有一定时间 , 只不过它是把强的模型蒸馏到比较小的模型 , 比如像那个 R1 蒸馏出来的千问模型上 。

但是 V4 的蒸馏呢 , 就相当于是它先训练一些小的专家 , 然后把这些小的专家的学习的技能给它蒸馏起来 , 就是节省它的参数量 。

就相当于是就是在训练过程中, 专家越多 , 它容量越大嘛 。 但是呢 , 它那个专家越多 , 它的那个显存啊 , 就是它的参数量 , 它的要求也比较大 。

我们先让这些专家先学好 , 然后再把这些专家的一些精华给它提取出来 , 能够显著地提高最终的模型的能力 。

赵晨阳1:11:11

这个易峰其实讲的这个很有意思 , 就是他们做的这个叫多专家训练 , 这个本质上就是要解决一个所谓的多目标优化问题 。

可以想见这个有句话说 , 这个同时优化的目标的个数 , 同时优化目标个数的多少 ,是智力上限的体现 。

一个人能够同时操控的系统 , 它的参数越大 , 证明它的能力越强 。 呃 , 就像刚才易峰讲这个联合训练 , 就相当于是在一个多目标的这个我们称之为 loose surface 上面找一个帕洛夫最优 ,但是实际的工程里面这个最优点是很难同时去找到的 ,因为这个梯度的走向很复杂 , 这个冲突很严重 。

所以说 , 呃 , 像刚才易峰提到的嘛 , 就是如果你一味地去 push coding 的能力 , 可能你的数学就不好了 , 你把数学修好了 , 你可能这个对指令的遵循又不好了 。

所以现在的做法其实是所谓的先分裂再蒸馏嘛 , 就是在各个目标上都去找找局部的最优值 , 然后我们再让一个统一的学生模型去同时拟合多个这个教室模型的输出分布 。

有点像是我们学高数的时候教数学实验有这么课 , 讲过一个叫差值的东西 , 我们把一个在复杂的这个 loose surface 上面的联合优化问题 , 换成一个在已经收敛的一些离散点之间做差值 。

这个事情在工程上面听上去是一个更稳定可控的事情 。 然后, 呃 , 先前来说这个在业界我们也有过很多类似的尝试嘛 , 就是说这个早年领先的某开源模型也有过这个所谓的专家聚合阶段 , 然后他们的公开细节比较少 。

然后 Qwen 的话 , 你指的都是开源领域的原神啊 , 这个 Qwen 的 post-training 阶段就说过他们有这个 multi-stage 的这个专家聚合阶段 , 然后学术界的话一直都有这个所谓的模型聚合 , 还有模型的这个叫做模型 spawn 这种技术 。

呃 , 我觉得大概是从有 GPT-2 的时候就有人在做这些事情了 。 硅谷这边的话 , 前沿的闭源模型我认为大概率也会有相同的思路 ,但是 , 呃 ,因为商业原因 , 大家的披露很有限 , 然后开源这个生态是这一波中国实验室给整个 AI 领域的实质贡献 。

曼祺1:13:17

嗯 , 测评的部分其实我们前面聊过了 , 你们有什么还要补充的吗 ?

赵晨阳1:13:20

这个我经常会做一些锐利的批评啊 , 这个有有句话是这么讲的 , 这个我本科毕业的时候 ,有一位 NLP 领域非常知名的研究者给我说过一句一件事儿 ,他觉得我们不能去优化我们不能评测的东西 。

如果我们不能给我们想要优化的能力一个分数 , 我们根本就不知道我们的优化对不对 。 We cannot optimize what we cannot evaluate.

所以经常大家会讲一个词叫 benchmark,也会讲一个词叫 evaluation。 我其实觉得我们最好把这东西叫做 evaluation,而不是 benchmark,因为 benchmark 指的是一个个具体的任务 ,但是 benchmark 是经常会过时的 。

可能一个 benchmark 可能发布一年、 两年, 它就 saturated 了 , 所以大家都说它是一个 finished problem。 但是 evaluation 这个事情永远都是存在 ,而且它是一个非常一直都是一个非常重要的事情 。

我最近也有一个很大的感觉 , 就是 evaluation 越来越难做 ,因为我们的场景越来越复杂 。 举个具体的例子 , 经常 Claude code 更新了之后, 就会有人去批评说这个版本怎么更新了之后变某某某方面变差了 。

啊 , 我我是非常的好奇 , 对于 Claude code 这样的工具 , 大家是怎么去评估一个 feature 要不要更新的 。 举个例子就是我们做 agents 这个行业 , 大家就有万千种想法 , 然后每一个想法听着都有那么一些道理 ,但是直观上来讲 , 你是不可能把所有的所有的想法都做了 , 然后你说这个东西一直在变好 。

对 , 你加的东西越多 , 可能这个东西就在变差 。 有个词叫做 less is more 嘛 , 你这个东西加进去真的有没有变好 , 这个东西是需要量化来说明的 。

所以 evaluation 就是做这个量化 , 它尽量的应该凭感觉走 , 否则我们的优化就会出问题 。 所以 take it back, 就是我觉得这一版 DeepSeek 的这个 benchmark 一如既往做得很扎实 ,而且我从来坚定的认为我们要做好 evaluation,而且 evaluation 只能做得越来越好才行 , 否则我们这个行业会变成一种这个早些年这个修炼气功的感觉 。

有我们会觉得这些这个气功大师让人觉得非常的费解 ,因为就从我们的科学教育观来来讲 , 对吧 , 这个东西有没有什么客观的标准说它这些就是什么奇怪的功 , 真的能够给这个社会带来正向的争议 , 还是说它只是挑出几个例子说这个人的病好了 。

对 , 我觉得现在就是 , 呃 ,不做好 evaluation, 我们这个行业就会陷入这种这个自欺欺人的恶性循环 。 呃 , 这点上来看的话 ,DeepSeek 这次的这个 evaluation 嘛 ,他们测了什么呢 ?

多步任务的稳定性 、 长程对话 、 人格一致 , 还有什么工具调用的鲁棒性 , 这些可能在 V4 的报告里面提到了 ,而且我觉得这也是 V4 能不能进入第一梯队的真正问题所在 。OK, 呃 , 所以 quick takeaway 就是 benchmarking 会过时, 然后任何一个 benchmark 都有被刷满的那一天 ,但是 evaluation 一直需要是一个公正的追求 , 否则我们这个行业是没法去 guide 整个领域积极向上发展的 。

曼祺1:16:16

对 , 我觉得这事儿是确实越来越难了 , 包括最近 Opus 4.7 更新之后, 就很多人认为还是要用 4.6 啊 。

赵晨阳1:16:24

确实也是 , 现在有个词叫做 vibe checking 啊 , 或者叫 vibe benchmarking, 就是说我已经感觉不出来模型的好坏了 , 我只能根据它我的有限词对话说 , 哎 ,以前这个任务 4.5 能做 , 为什么你 4.7 就做不好啊 。

我们已经进入了这个 benchmark 的可信危机 , 这些模型乍一看这 benchmark 全都是 90 加 ,但是实际差异大家都说很大 。

所以说我觉得这个 generation 的 agentic evaluation 还没有达成共识 , 我们还需要更好的 evaluation 基建 。

曼祺1:16:50

易峰你有什么要补充的吗 ?

刘益枫1:16:51

我觉得就是 benchmark 就相当于是在某一个具体任务上的这样一个能力 ,但是我认为的话 , 更重要的还是去发现和提出新的 ability domain, 比如说 agentic 的能力 , 比如像那个长程注意力的能力 ,domain 比具体的某个 benchmark 重要程度更更高 。

因为就是你要一旦提出这个 benchmark 的话 , 我觉得就是刷满也就是半年到一年的时间 。

曼祺1:17:17

V4 在这方面应该也没有提什么新的领域的能力 , 对吧 ? 这个是没有提的 。

刘益枫1:17:22

是的 , 所以说就是说就是这个事我觉得就是说还是不是那么特别令人震惊的一点之一吧 。

赵晨阳1:17:30

我觉得一个非常有意思的点是 , 我们发现这几代模型它居然没有做 degradation, 就是就是先前好过的任务它再也没有差下去过 。

这点上其实还是很值得欣喜的 。 当然我觉得可能一方面的另一个代价就是现在模型的 context lens, 呃 , 达到了一种令人发指的地步 。OK, 我想起来这个讲 benchmarking 里面 ,他们提到那个多轮的这个多轮工具调用 , 还有这个这个多轮人格一致性嘛 。

我们去年就是 DeepSeek V3 发的时候 , 当时我自己有一篇 paper, 我们当时也是去年投了 ITDEAR, 前几天应该也在巴西开会 ,但我没有去 。

就是也是讲这个评估一个语言模型在 GitHub 上面去面对刁钻的 reviewer 去交一个 PR, 然后把它 merge 这个能力 。 这个其实它相对于以前就是什么打数学竞赛 , 还有这个解决 , 比如说修一个单测 , 像 Sweb 这种修单测还是区别很大的 。

这个可能跟现在 Claude code 的 idea 很像 , 就 Claude code, 比如说你让它去完成一个工程 , 你要交付了之后, 你得希望把它 merge 进去 , 对吧 ?

然后在 merge 之前 , 你还得和你的 reviewer 做很多轮的 rebattle。 所以我感受中就是 , 就算我自己做过 benchmark 来说 , 我很欣喜我们做的 benchmark 能够得到更多的认证 ,而且即便今年这个 benchmark 它已经被刷满了 , 无所谓 , 至少首先这个 ITDEAR 这个我们拿到很好的分数 , 它这边 all the paper 嘛 。

然后另一个方面 , 我是非常欣喜见到这一年这个能力就能被刷满 , 那我们明年是不是可以期待一些更劲爆的东西 ?OK, 呃 , 最近我自己比较关注的 benchmark 叫做 Claude Bench, 就是就这个名字 , 就是 OpenClaud 的 Claude Bench, 它就是评估在这个 OpenClaud 的这种应用场景下面 , 用户的满意度是什么样子 。

我觉得这我我也比较希望到了明年这种类似的 benchmark, 这种个人非严肃编程助手的 benchmark 也能被刷满 , 那我们肯定会有新的挑战 , 新的全新的应用能到来 。

曼祺1:19:25

对 , 接下来正好我们可以讨论下就行业正在发生的一些更广泛的变化 ,因为最近的模型更新还是非常密集的 。

行业趋势1:19:25

曼祺1:19:32

那从 3 月底到现在 , 呃 , 包括前面提到的小米的 Mi Mo 2.5、GLM 5.1、MiniMax 2.7、K2.6、Opus 4.7、GPT 5.5, 你们觉得这些所有的模型里面可以总结出大家有哪些在努力的共性的方向 ?

刘益枫1:19:48

我觉得的话 , 就是开源模型来说的话 , 它的方法和 architecture 实际上还是在某种程度上趋同的 。 就是它基座也就是 MRA,但是它会堆一些很多其他的 architecture feature,但是基座基本上就相当是基于这个架构去进行拓展 。

对 , 然后包括像优化器 , 大家都都在用 Muon, 然后之前的话可能就是 AdamW 啊 , 甚至还会有一些那个其他的 MScribe 啊这些优化器 ,但现在大家都陆续的转是 Muon 优化器 , 或者说那个就相当于在 Muon 优化器的基础上去进行微调 。

那个 agent 能力我觉得是那个这一波就是所有不管是开源模型还是闭源模型都在注重的趋势 ,因为就是像 OpenClaud 啊 、Claude code 这些 , 就是让大家就发现了模型研究它未来商业化可能的方向 , 给这些那个 agent 去提供那个 token, 从而就相当是真正的能够实现这样一个盈利 ,而不是仅仅靠之前的会员服务盈利 。

赵晨阳1:20:49

呃 , 这个其实是一个很有意思的商业问题 , 就是你是要把它做成一个订阅制 , 还是要做成一个 token by token 的一个计费 。

我觉得现在其实我心里是 vote for 订阅制的 , 我觉得订阅制是一个更好的商业模式 , 然后你完全可以就是先订阅 , 订阅满了之后再让大家交交 token 的钱 ,但是实际上大部分的用户不会用到订订阅的定格 , 所以做订阅制其实反而是一个更赚钱的事情 。

刘益枫1:21:12

对 ,但是现在很多公司它又抛弃了订阅制 , 转而是按 token 计费 , 可能订阅制也扛不住 。 就如果说订阅制它高了 , 没有用户满 , 订阅制低了的话 ,其实公司公司是亏的 。

赵晨阳1:21:24

嗯 , 这这是一个统一的商业问题 , 然后我不觉得现在哪家公司有给出一个很好的结论 , 哪怕这个我们看 , 呃 , 可以吧 , 就是我觉得 Claude code 这么成功的商业产品 , 究竟盈利如何 , 我们且待且且看 。

曼祺1:21:40

嗯 , 如果它今年底要 IPO 的话 , 那应该能看到财务数据啊 。 现在很多那种做视频生成的产品 , 就是偏 AIGC 应用的这些产品 , 比较类似于陈阳说的两种结合 , 然后如果你用完用满这个额度之后, 你就要额外买积分 , 然后影视从业者就因为他们有刚需去用这个东西 ,他们还是比较接受的啊 。

所以所以视频生成类的产品的客单价还真的挺高的 , 就比我想象中高很多啊 。

赵晨阳1:22:06

我其实在商业上面非常的喜欢他们视频这样的一个生态 ,但是坏消息是视频生成模型的开开源的视频生成模型和闭源的差距确实很大 。

曼祺1:22:17

嗯 ,因为我发现好像没有什么人愿意开源视频生成模型 ,有可能这这正正是说明了它还真的挺赚钱吧 。

啊 , 好像就到目前为止 , 呃 , 迄今就就就已经开源的 , 然后大家认为比较先进的一个应该也是千问 , 呃 ,是阿里那边开源的 , 就通一万上 。

赵晨阳1:22:38

嗯 ,是的 , 我最近做这个语音模型也做的比较多 , 就是我们做这个语音生成的模型嘛 , 然后可以想见 , 就比如说现在开源的语音生成模型相比于比如说 Gemini, 相比 OpenAI 的那个 GPT-4 那个时代的模型 , 还是有不少差距的 。

我的一个推论就是这些模型应该很赚钱 , 哈哈 。

刘益枫1:22:59

就是还有一个就是说是视频模型 , 它的用户粘性特别大 , 相比于语言模型来说 , 所以就是说视频模型可能更倾向于那个就是订阅制 。

曼祺1:23:09

我的感觉啊 , 就关注度和舆论是全部被 coding 被通用的这种 agent 吸引走的 ,因为这方面的竞争非常焦灼 ,而且都是最大的公司在竞争 。

但另一方面确实可能视频是一个更创业友好 , 或者说 AIGC 这个方向是个更创业友好的方向啊 , 包括语音啊 , 像 Eleven Labs 这种公司 , 对吧 ,在好像在一个相对自己的空间里在存在着啊 。

这是相同的部分 , 那你们观察到各家的差异是什么了 ? 包括中美之间会有什么这种分化的趋势吗 ?

赵晨阳1:23:38

首先我们可以讨论一下国内的比较有代表性的这几家开源模型 , 然后我觉得开源里面 DeepSeek 和 Kimi 的这个取向比较接近 ,他们做的工程和这个创新性比较极限吧 , 大的 MoE 低的激活 , 长上上下下文 , 还有一些 aggressive 的 cost, 然后千问还有 MiniMax, 我觉得在 R1 训练端 , 然后在长上下文落地方面都有非常扎实的基本 , 大家的发力点不太一样 。Person to person 我觉得这五家

公司仍旧非常的有希望 。 哦哦 ,sorry, 这里可能漏掉了小米 , 然后当然小米可以大家看到昨天这个模型 V V2.5 的 Pro 吧 , 然后在那个 Arena 上面的分数也是比 V4 要高的 。

嗯 , 哎 , 竞争实在非常激烈 , 看到这种百花齐放的局面 , 我至少还是非常开心的 。 当然坏处就是这些开源的模型也给了也给了我们开源这个推理引擎有很多的这个就是我们的工作量也很大 。

曼祺1:24:31

你为什么没有提到阶跃和浑源啊 ?

赵晨阳1:24:34

To myself 就是阶跃的话 ,在这个多模态上面 ,其实他们发力是很早的 , 然后呃 , 我是觉得现在多模态是一个 fashion saturate 的一个状态 , 所以就像当刚才刚才易峰也提到了这个呃 , 多模态要不要做原生多模态 , 这些事情是非常值得研究的 。

然后混源的话 , 这个最近这个姚顺雨 , 这个我和易峰的学长啊 ,他这个回去长上混源 , 看到混源发的可能是 300B 的那个模型吧 , 然后当然肯定现在不是在这个一一个 T 里上这个模型的牌桌上面 ,但是在 300B 这个规模 , 我觉得做的也非常的扎实 。

现在是 3.0 的 preview, 对 , 如果等到 3.0 它可能上了 Pro, 它可能又进了微信端 , 那这个格局会很有意思 , 哈哈 。

曼祺1:25:16

这我觉得也不久之后应该可能就会看到 。

刘益枫1:25:19

美国模型就是总体来说 , 就是它更多追求就是我开辟了一个新的领域 , 比如像我常常想问那个 Gemini, 就是谷歌团队提出的 , 然后多模态融合 , 然后包括像那个 agent 能力 , 它的性能跨时代的提高 , 就像最近很火的那个那个 Image 2, 就相当于它比之前的模型有的就是跨时代的提高 。

还有一点就是中国模型它更加侧重于性价比 , 美国模型就是说大家都知道非常贵 , 那中国模型就是说是在同样的能力下, 哎 , 收费比美国模型小一个数量级 , 我觉得这跟中国充足的技术人员储备是有很大关系 。

曼祺1:25:59

陈阳你有什么要补充的吗 ? 比如你观察到的中美模型进化的这种差别 。

赵晨阳1:26:05

嗯 , 我在美国的话 , 我先前在 Amazon 的这个 AGI self-lab 工作过 , 我也和易峰都在 Seed 有过实习 。 这个 generation long horizon agent 只有一个词 , 惊叹 。

嗯 , 包括 OpenClaud, 包括这个 Claude code 这两个产品吧 , 我觉得心里是很 admire 的 。 嗯 ,Claude 这一代模型就从 4.5 之后在多轮 agentic coding 上面的表现 , 相比于这个先前真的进步了非常非常多 。

可以想见这个 RLHF 或者 RLAIF 这一套 , 我们先前 alignment 的方法论 , 这么几年积累之后, 加上巨量的高质量人类反馈数据 , 已经在美国这边形成了一个非常强大的数据闭环 。

中国团队这边的话 , 我觉得强项是这个架构创新的密度 , 还有令人咋舌的工程完成度 。V4 一个报告里面就是一次性把混合系数注意力 MSC Mio FP4 TileLang 这么多事情全部都换掉并且跑通 , 这种决心和执行力是相当罕见的 。

我觉得这个中美的路径风格上有所不同 ,但整个行业还是在徬徨上升的 。

曼祺1:27:12

美国的模型没有做得那么稀疏 , 就大家没有再追求这个啊 , 你觉得这不是个选择的问题 ,是实现的问题 。

刘益枫1:27:19

对 ,而且就是美国这边算力比较多嘛 , 对 , 它不需要做那么稀疏 ,因为稀疏它会牺牲一定上限 。

曼祺1:27:27

就大家的选择就是我就是去冲性能的 , 反正我这么贵也有人买啊 , 我就先做到那些之前模型可能做不到的事啊 , 然后我再想降成本的问题啊 。

刘益枫1:27:37

是的 。

曼祺1:27:38

因为理论上你性能能冲上去之后, 就降成本这个事 , 我觉得它会相对确定一点啊 。 嗯 , 当然你也需要更多资源和支持啊 。

赵晨阳1:27:47

Partially agree, 哈哈 。 对 , 就是可能很多人批评说这个中美现在是这个大搞太空竞赛 , 我觉得很遗憾 , 只有中美能搞太空竞赛 , 没有任何国家能够玩得起这一波的 AI 比赛 。

曼祺1:28:00

你们觉得就是再过一两年来看的话 ,V4 最可能被记住的是什么成果 , 或者说是它的什么思路和想法呢 ?

刘益枫1:28:10

可能为为数不多能被记住作业 , 就是 tokenwise 的这种极致压缩 , 压缩从算法层面来说 。 对 ,因为之前的话 , 大家就是可能 KV cache 更多的是就是相当是单个 token 里面降维啊之类的 , 比如像 MLA 就是先降维再升维 , 对 , 都是涉及到单个 token 的这种压缩 。

然后 tokenwise 的压缩的话 , 应该是 V4 首先被应用到这种工业级别的模型上 。 对 , 然后其他的话 , 就是算法层面就是没有什么特别 , 就是说是让我非常惊艳的地方 。

赵晨阳1:28:44

哎 , 我和易峰的观点是比较类似的 , 就是长上下文极致低激活比例 , 然后还有一个低单 token 成本 , 这个组合无论是这个 architecturewise 还是在这个 infrawise, 可能都是 V4 留下的持久遗产 。

然后聚点某一个技术 , 比如说 MHC 或者混合注意力 , 会不会按照现在的形式被采用下去 , 可能都像 MLA 一样 , 那是可能是那个阶段的最优解 ,但是可能过了一两个一两个 round, 它可能会被更优雅的方案替代 。

当然硬件可能也会反过来推动往上级替代吧 。 呃 , 我觉得 DeepSeek V4 它率先验证了这种工程配方 , 还是会成为后续许多开源大模型的默认起点 。在这个意义上面 ,DeepSeek 一直是开源模型的参考基准 。

曼祺1:29:30

嗯 , 然后最后一个问题就是想问一下两位 , 呃 , 接下来的一些行动啊 , 就比如说你们选择的一些研究方向 , 然后或者是陈阳这边 ,因为你已经创业了嘛 , 你肯定有很多具体的事得干的啊 ,有哪些可能是因为比如说 V4, 又或者是其他最近发的这些模型啊 , 会有一些影响和改变的 。

刘益枫1:29:51

对我来说的话 , 就是因为我现在也没在公司实习 , 如果说有机会去公司实习 , 我可能会比较想做 CSA、HSA 这种 tokenwise 的压缩这种长文本 ,但在我实验室里面的话 , 长文本是很难实验的 , 所以说对我来说更倾向于就是去进一步去研究那个呃 ,hyperconnection 相关的研研究 , 包括像 Kimi 的 Attention Residuals 这种 , 就相当于是我感觉这又是另一波 , 就是说就是之前是从那个 ResNet 到 DenseNet 这

样一波 , 我觉得的话 , 就是说对于 Transformer 来说 , 它可能也是会有一个相同的这样一个趋势 , 就是提高层与层之间的信息流动 。

对 , 然后的话 , 我自己也在做优化器 , 就是说那个 DeepSeek V4 它采采用的就是不同的超参数 , 那么 Muon 它自己还能不能去进一步的改进 , 或者说是 Muon 它的超参数如何去设定 , 就到底那个就是呃 ,Kerry Jordan 提出的 5 步 Newton 的数字更好 , 还是那个 DeepSeek V4 呃 , 采用的 10 步 Newton 的数字更好 , 这个还是非常值得去进一步的探索的 。

赵晨阳1:31:04

嗯 , 然后我的话 , 这个嗯 , 就像我刚才提到的 , 我们有一个我今年我在我在大概去年这个时候的一个工作 , 讲那个多轮的 agent 去给 GitHub 依据招 PR 这个事情 , 呃 , 这算是我之前的一个 research 方向 , 就是研究这种 coding 下面的这种真实场景下的 coding 表现嘛 。

我可能最近不需要做一个 research,但是我需要真的需要把它用起来 ,因为现在我自己维护开源的工具 , 会有很多人教 AI 生成的这个 PR, 那我有没有什么 golden standard 能够类化到我自己的工作里面来 , 我看到什么 PR 我知道这玩意靠谱 , 我看到什么 PR 适当的就会把它避掉 , 这个是我需要去研究的 , 从研究里面汲取出来到我的工作当中来 。

然后还有一点是我最近做这个语音模型做的比较多 , 我觉得语音模型上面其实它的工程优化相比于语言模型差了非常多 , 然后包括很多事情其实可以在语音模型上面重现一次 , 我觉得都是可行的 。

这个版本的 DeepSeek 的话还是做到了很优秀的这个 PD 分离呀 , 还有这个 MTP 这些工作 , 我会认为 PD 分离可能未必要在语音模型上实现 ,但是 MTP 对语音还是挺关键的 。

就像是现在可能你打开手机跟豆包对话 , 你会觉得豆包吐出第一个语音的速度还是很快的 , 很遗憾在开源上面我们做的没有这么优秀 , 所以我觉得这里还是有一个很大的 gap, 我们可以去努力的 。

曼祺1:32:29

嗯 ,OK, 那今天非常感谢两位做客晚点聊 , 分享了你们在看到 DeepSeek V4 发布之后, 包括最近这么密集的这么多模型更新之后, 观察到的一些变化 , 尤其是我们非常详细的展开聊了 DeepSeek 这一次一下子端出来的四个新东西 , 然后在 1.6T 这么大的模型上都实现了 , 就包括它新的注意力机制 , 这个是改变了 V2 到 V3 的 MLA 主流的做法 ,而现在 Kimi 和 Jeep 的 GLM 还是

用的 MLA 的架构 , 然后第二个就是 Muon 优化器 ,而且 DeepSeek 也在之前的比较主流的版本上做了一些改进 , 然后第三个是 MHC, 这是 DeepSeek 自己提出来的一个让训练更稳定的方法 , 然后最后是在 Infra 层面的 TileLang 还有 FP4 的使用 。

那今天的节目就到这里 , 各位拜拜 。

本期节目就到这里 , 感谢收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。

你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 推荐更多你想听的主题和嘉宾 。 你可以从小宇宙 、 苹果 Podcast 等渠道关注晚点聊 LateTalk,也欢迎关注我们的公众号晚点 LatePost。

下期再见 。