开场0:00
欢迎收听 《 晚点聊 》。 本期的主播是曼祺 , 这期继续来聊注意力 。 上一期我们与清华的两位博士生肖朝军和傅天予聊了稀疏注意力机制的改进 ,也以注意力为线索串起了大模型的优化史 。DeepSeek、Kimi 最近发布的新工作 , 都属于稀疏注意力的大范畴 。
这期我们来聊注意力机制的另一大改进方向 : 线性注意力 。 中国大模型公司 MiniMax 在今年 1 月发布了参数为 4560 亿的开源大模型 MiniMax-01。01 就用到了他们开发的线性注意力机制 lightning attention。
本期节目我邀请了这个项目的负责人,MiniMax 高级研究总监 、 负责 01 模型网络架构的钟怡然 , 来与我们一起聊线性注意力的研发过程 。
钟怡然曾担任上海人工智能实验室青年科学家 ,是新架构探索组的 PI,也就是项目负责人。 她在澳洲国立大学获得了博士学位 ,是从李宏东教授和 Richard Hartley 院士 。
我原本的设想是了解更多技术知识和趋势 ,但其实我得到了一些故事 。 钟怡然自己的故事是 : 在一个方向不被看好时, 愿意押注时间去追求自己相信的技术判断的故事 。
在 2021 年, 线性注意力还是一个 " 看起来很美好的泡泡 "。 怡然和她的团队就开始探索线性架构的实现 。
到 2023 年下半年, 她认为探索已经相对成熟 ,并判断到 2024 年年底一定会出现线性架构的大模型 。
我当时想法很简单 , 就是我觉得我当时是我的判断就是 2024 年底大模型已经出来 , 我们已经做了 3 年了 , 我们为什么不让它诞生在我们自己手上 ,而让它们诞生在别人手上呢 ?
因为当时我们是作为最懂 linear attention 的这批人。
另一个故事是 MiniMax 创始人闫俊杰的故事 。他之前曾说过 :" 我选的技术路线都是上限最高 、 最激进的 。" 这次我得到了一个具体的例子 : 把线性注意力用到几千亿参数这么大的模型上, 之前没有人做过 。
钟怡然说自己在训练之前 ,其实有 90% 以上的把握线性架构可以 scale up,但她觉得当时闫俊杰心里对这件事情可能只有 50% 的把握 ,而她最后拍板投了公司超过 80% 的研发资源 。
当然 , 训练模型不是一个戏剧性的梭哈的过程 。在训练 01 的大参数版本之前 ,MiniMax 团队做了 Scaling Law 的测试 , 就是通过各种实验去预测一种架构在更大参数的模型上是否也有好的表现 。
最后他们训了 3700 个模型 , 做了 3700 次测试 , 当然这其中有很多都是小规模的实验 。 这期节目中我们也完整地聊了这个过程 。
到现在为止 , 线性注意力能否超越原本的 Transformer 架构仍然没有共识 。在上限上, 从计算方法推导 , 当序列非常长 , 线性注意力在计算效率上的优势会越来越大于稀疏注意力 。
但从效果上 ,也就是线性注意力的模型能否和 Transformer 模型一样聪明 , 甚至更聪明 , 现在还没有谁能给出有绝对说服力的答案 。
这也是之后 MiniMax 的技术进展可能会揭晓的悬念 。 最后说一些声音上的注释 : 在本期节目中, 怡然有时会说 "linear attention", 这也是指线性注意力 。在提及 "full attention" 就是标准 Transformer 里的 attention 时, 她有时也会说 "Softmax attention"。
如果听过上期节目 , 听友肯定会知道什么是 Softmax。在我们聊天的语境里 , 可以简单理解为 : 她就是在说 full attention。
以及这期后面聊到研发和训练过程时, 怡然提了几次 IO, 她指的是闫俊杰 。 还是和上期一样 , 我会在 show notes 的末尾贴上一些本期提到的术语的简单解释 。
从本期开始 , 我会在每期节目的末尾不定期地录一个小模块 , 是一些联点呈现的小总结 。 我会讲讲这期节目让我想到了过往的哪些节目 , 它们之间的哪些事实或者观点产生了共鸣和呼应 。
下面我们就正式进入本期吧 。
那这一次我们也是邀请到了在 MiniMax 来做这个项目的研发负责人钟怡然 。 她是 MiniMax 的高级研究总监 , 来和我们聊一聊 MiniMax 在探索注意力机制改进的过程中间的一些过程和思考 。
怡然 , 你可以先和我们的听友打个招呼 , 可以简单自我介绍一下 。
大家好 , 我叫钟怡然 , 目前是 MiniMax 的高级研究总监 , 然后主要是负责这个模型结构设计和多模态理解大模型 , 就比如说那个 MiniMax vL01。
然后我是主导设计了这个 MiniMax-01 的新一代的网络结构 。在之前呢 , 我在上海人工智能实验室做这个青年科学家 、 新架构探索组的 PI, 然后负责这个新一代非 Transformer 架构的研究和一些视听语言多模态的融合 。
然后我们的研究其实从 2021 年就开始了 , 然后在一些 Tipami 这些顶级的会议和期刊上发表了 20 多篇关于新架构探索的相关的论文 。
然后这些论文研究呢 , 全面覆盖了当前的先进的非 Transformer 架构 , 比如这个线性注意力机制 、 长卷积和线性循环网络 , 就是 linear RNN。
我们同时呢 ,也在这个新架构的工程上进行了研究 , 相当于这个新架构的一些并行策略 。 然后我们也推出了这个异步优化器 , 它是针对这种国产的集群通信的效率较低的现状推出了的这个异步的优化器 。
然后我们在计算机视觉和自然语言处理上都验证了它的有效性 。
那这个我们后面也可以展开讲一讲 , 就我们可以从线性注意力机制讲到更多你们在模型架构上的一些探索和创新 。
开源策略5:20
然后那个正式聊这个 MiniMax-01 的线性注意力机制之前 ,其实我也想聊一下开源的变化 ,因为 MiniMax-01 应该也是 MiniMax 第一个开源的模型 。
然后当时也是有去跟闫俊杰就是 IO 去聊 ,他说他也认识到说开源是一个很重要的可以去更极致的加速技术进步 , 然后在这个社区里建立技术影响力的方式 。
可以先聊聊就是为什么你们第一个开源的项目就是选了 MiniMax-01 这个项目吗 ?
我们其实很早就在考虑要不要开源 , 像那个俊杰在去年六七月份的时候也考虑过这个形式 。
然后呢 , 后面我们坚持开源的原因是因为首先 MiniMax-01 它是一个非 Transformer 架构在真正的商业大模型上的一个亮相 。
我们认为呢 , 这个是会影响这个未来大模型结构设计的一个开创性的工作 。 作为第一家这个吃新架构螃蟹的公司 , 我们向公众展示了这新一代架构的效果和潜力 。
然后我们在这些长文上的突破可以让更可以让大家更关注这个长文应用的发展 。 从我们的主营业务上来说的话 ,MiniMax-01 开不开源其实它都不太影响公司的主营业务 。
然后开源的好处是呢 , 我们可以对外展示我们是一家关注技术 、 更愿意尝试新技术的公司 。 这样来说 , 对我们去吸引一些有创造力的人才的话是有益的 。
你刚才说是去年六七月的时候就考虑在开源 ,是从那个时候就开始准备吗 ? 还是说到什么时间才有一个密集准备的过程 ?
当时其实还在犹豫 ,因为如果要开源的话 , 起码你需要有一个能拿得出手的东西 。 然后 MiniMax-01 它的模型训练其实在那个时候还没还在训练过程当中, 还没有还没有还没有真正的训练训练完成 , 所以那个时候只是第一次我们才考虑这样一件事情 。
然后后面等到 MiniMax 其实在十月份的十一月份的时候就已经训练训练完训练完毕了 。 那么我们就写了一篇完整的 report, 然后也补充了一些对应的这些实验 , 可以让它这个结论更加的充分一点 , 论证能够更加充分一点 。
然后第二呢 ,其实开源社区对于新架构的支持是很少的 。 我们为了就是把这个新架构运行起来 , 我们自己改造了很多轮子 。
所以为了让大家也能够自己部署这个模型的话 , 我们也开源了部分的轮子 , 就比如说这个新架构的一些推理优化 。
因为我们得到的反馈是像 GitHub 的 Issue 上他们反馈是说他们用 Hugging Face 的这个 inference 的话 , 它的效率是非常低的 。
那是因为毕竟是新架构 ,他们是没法做一个非常友好的支持 。 所以为了让大家感受到这个新架构的优势 , 我们把把我们的这些推理的优化已经合并到了这个 VLM 上, 这样大家就可以自己部署的时候可以感受我们让 VLM 去支持我们的这个新架构 。
然后开源后的反馈 , 除了你刚才说的就是你们把一些优化的东西开源之外, 还有什么别的反馈吗 ?
比如说有没有人去自己去尝试部署这个东西 , 包括自己去测试它得到什么效果之类的 ?
会有人尝试部署 ,但是他们的部署就会导致他们的没有优化的时候 ,他们速度是很慢的 。 所以我们之前是觉得不一定需要自己来部署 , 你可以在海螺 ,因为它跟海螺用的是同款模型 , 所以你可以直接在海螺上或者是自己的 API 上, 或者是用我们的 API 直接来测试 。
但是我们现在因为把这个推理优化已经合并到了 VLM 上, 所以开发者也是可以来自己来进行部署 。 然后社区内的别的反馈大概就是反馈一些这个模型的一般性的一些问题吧 。
一般性的问题是指什么 ?
就比如说有没有哪些问题总会出一些 , 比如说混合图一些词 , 或者是能不能支持多图 ,他们就会有些这些疑问 , 然后我们会在这个 Issue 里面进行回答 。
你们现在就是 lightning attention, 它是可以处理多模态的 , 对吧 ? 就是我视频 、 图像 、 语言混合输入也是可以的 。
对对对 , 它是可以支持的 。
那我们接下来就可以就是详细讲讲就是你们这个做线性注意力机制的这样一个结果 、 成果和一个思考的过程 。
注意力原理9:18
我觉得你可以先简单的解释一下, 就是为什么就你们要去做这个注意力机制的改进 ,而且这不光是你们的选择 。
因为刚才我也在开头的时候提到像 NSA、 像 Mobile, 就是很多公司都在做这个方向的进展 , 然后学界也有很多这个方向的进展 。
就大家特别想去优化注意力机制 , 主要是为什么 ?
其实因为 Transformer 架构它有一个最大的 bug, 就是它对这个 complexity, 它的这个计算复杂度是对序列长度 , 它是一个二次的计算复杂度 。
然后 FlashAttention 不是得到了很大的关很大的关注吗 ? 但 FlashAttention 它其实解决的是它的一个显存占用的二次复杂度 。
所以 FlashAttention 它对显存占用是是一个线性的 ,但是呢 , 它没法解决它的这个计算复杂度的问题 。 那么我们为了解决它这个计算复杂复杂度的问题呢 , 学术界提出了很多种 。其实最早提出的就是稀疏注意力 。
因为 Transformer 提的很早 , 所以它的二次复杂度是学术界一直在关注的一个问题 。 因为学术界它也会它会想 , 你这二次复杂度那肯定受不了 , 我要处理非常长的这种情这种情况下, 它这二次复杂度 ,并且你考虑在那个时候其实最常见的是 V 是 V100。
但是实际上为什么后面学术界不太在意这个二次复杂度的问题呢 ? 其实是因为从 V100 到 A100 到 H100, 它的算力的提升是非常大的 。其实它进一步的已经遮掩住了这个对于 Transformer 二次计算复杂度的一个紧迫性 , 就是由于它的算力的增长的加速 , 它对这个二次复杂度的解决这个问题的紧迫性其实并不是很高 。
所以可以看到现在其实很多的这些大模型其实采用的仍然是 Transformer 架构 。 然后因为它的这个算力的增加 , 它的这个序列长度其实也可以做到一定的扩增 , 比如说现在的 128K、256K,在这种长度下, 这个 Transformer 的这二次复杂度还是可以接受的 。
也可以跟听友解释一下, 二次复杂度就是平方增长的意思 , 就是随着你的序列的增长 , 它的计算复杂度是平方增长 。
对 , 所以在那个时候我们就一直在想解决这个二次复杂复杂度的问题 。 然后我们当时觉得觉得一个问题是稀疏注意力呢 , 这个因为它是一个有损的一个毕竟 ,也就是说 Attention Matrix 它是一个完整的一个 n 乘 n 的一个矩阵 。
那么稀疏注意力呢 , 意思就是说我在里面只算有限个这个 Attention 的这个 score, 然后因为你算的 Attention score 不是一个 n 乘 n 的这个这个矩阵了 , 那么自然而然它的算力就会需要的算力就会减少 。
这样子的话很明显是我们认为这是一个有损的毕竟 ,因为你本身需要算 n 乘 n 的这个这个 Attention score, 你现在只在里面截取了一部分来算这个 Attention 的 score。
我们认为呢 , 这个算法在未来不算是一个比较优雅的方式 。 所以我们我们那个时候我们就取取向了当时还是研究比较初期的 linear attention, 大概是在 2021 年左右 。
然后关于这个 linear attention, 它其实方法是非常非常简单的 。 标准的这个 Softmax attention 的话 , 它是先 Q 乘以 K 的转置 , 过一遍 Softmax 再乘一个 V。
因为这个本质上其实就是首先我们要算的乘法就是 Q 乘 K 乘 V。 那么如果你直直接左乘 , 左乘的意思就是我先乘 QK 再乘 V 的话 , 它的计算复杂度呢 , 就是二次复杂度 。
如果我先乘 K 跟 V 再乘 Q 的话 , 它的计算复杂度就是一次复杂 , 就是线性线性复杂度了 。 那么整个的这 linear attention 呢 ,其实就是把这个左乘变成右乘的形式 , 就我们先乘 KK 跟 V。
因为不是所有的听友都是这个对这些技术比较熟悉 , 那可能也要解释一下, 就是在注意力机制里面 QKV 它是什么 。
QKV 你把它看成就是三个 metrics 好了 。
三个矩阵 。
对对对 , 然后这三个矩阵相乘呢 , 就会得到这个 Attention score。
注意力的分数 , 然后这个分数其实是个相关性 。
对对对 , 改变这个它们的这个顺序关系 , 我们就可以从二次复杂度变成一次复杂度 , 这是它的最核心的一个思想 。
那我们可以到这里总结一下, 就是到 2021 年你们开始探索线性注意力之前的一个注意力机制改进的大概的过程 。
最开始是在 2017 年有了 Transformer 这个架构 , 最初标准的是 Full Attention, 或者也可以叫 Softmax Attention, 差不多同期有了你提到的 FlashAttention 的这个优化 , 它解决的是 Full Attention 的显存太小的问题 。
然后大家开始去探索稀疏注意力 , 它是想进一步解决最开始的 Full Attention 的计算复杂度的问题 。 然后是你们到 2011 年开始去想做这个线性注意力机制 。
对对对 , 我们其实认为这个 linear attention 技术成熟的时间其实是在 23 年的中期 , 就七八月份的时候 , 我们认为它已经从效率和效果上已经我们在小规模上已经比肩了这个最先进的 Transformer 架构了 。
那你们当时有试过稀疏注意力的方向吗 ?
我们在 21 年的时候其实试过稀疏注意力的方向 , 我们就发现它的效果也也不太行 , 然后运行的效率也不行 。
它其实碰到的问题是跟这个 lightning, 就是我们的这个 linear attention 是同样的问题 , 就是它们那时候的效果比不上 Softmax attention, 然后它的速度呢 , 顶多也就比它快了一丢丢 。
我们认为这个得不偿失 ,因为它的我们当时是认为它的上限是一个比较低的一个方向 , 所以我们就转向了这个 linear attention。
那 NSA 和 Mobile, 包括最近微软量理院 Scaling Laws 这些新的成果 , 我理解它们都是属于这个稀疏注意力的大方向 。
就它们所展现的一些效果和效率上的表现 , 你怎么看 ? 就是它会跟你之前的认知有一些不一样吗 ?
具体我们其实还在做进一步的一些实验 。 因为从我们的现在的实验上来说的话 ,lightning attention 是我们当前测试的方案当中, 随着模型越大 , 它的增益越明显的一个优化的方向 。
模型越大指的是参数的这个越大的意思是吗 ?
对对对 , 一般来说的话 , 像 MLA,因为我们测试过 MLA,也测试过这个 TPA,TPA 也 TPA 是像清华那边提的一个 , 就是 Query-Cache 压缩的一些方法 。
我们发现的是那些方法随着模型的增大 , 它的优势就会变得比较小了 。 也就是说它的这个压缩方式是对于这个模型的大小是有要求的 。
但是 lightning attention 就是 linear attention, 它不太一样的点是在于它的模型越大 , 它展现出来的优势是更加明显的 ,并且包括现在这个它放出来的这个 NSA Mobile Scaling Attention, 它还没有真正的做工业级的这个 Scale up。
不过它 Mobile 不是也放了工程代码吗 ? 都在线上跑了一年了 。
那它得开源让我们真正来看一下它在几百 B 的这种 level 上, 它是否真正的和这个 Transformer 是有一个比较好的一个对比 。
它们的大小其实最多也在只在 7B 规模上面验验证过了 。7B7B 这个规模就相当于我们之前 23 年中期的中期差不多也就验到了 7B lightning attention。
这个就是你刚才说到的这个稀疏注意力和线性注意力 , 它在不同大小的模型上的这个效果的差异是在几 B 之后会比较明显 , 就规模超过几 B 之后它会拉开 。
在在 7B 以上的话 。
7B 以上 。
对 , 基本上你可以看到它们的性能差异的这个趋势 。
最后你们这个 MiniMax 01 的模型的参数做到了多大 ?
4560 亿 。
它是改 Mobile 架构的嘛 , 所以就是它的激活大概是多少 ?
它的激活大概是 45.9B。
就差不多十分之一的样子 。
对 。
总体来说 , 现在在学界或者工业界是稀疏注意力做的人多 , 还是线性注意力做的人多 , 这个有明显的差异吗 ?
还是两个方向其实尝试的人都挺多的 ?
这两个方向其实尝试的人都比较都比较多 。 然后自从 23 年以后 ,其实线性注意力是比较火的 。
因为 Mamba 那时候大火嘛 ,在 23 年的时候 , 它其实带火了这个方这个方向 。
就整体从对本来 Transformer 的这个 Full Attention 的改进程度上来说 ,是不是稀疏的改的要相对少一些 ? 就架构上, 然后线性的可能会改的多一些 。
对对对 , 稀疏它本质上还是一个 Transformer, 它只是对于 Attention score 的计算方式做了一些改进 。
那如果说线性它就本质上就不是 Transformer 了 , 那它是什么了 ?
这个名字有很多 , 你可以把它叫成线性线性注意力 ,也可以把它叫做线性 Transformer。 因为它这里面关系到的是你怎么样去定义这个东西 。
因为对于 Transformer 来说 , 它最关键的一点就是里面的 Softmax attention, 就是它里面的这个这个 KV 我需要相乘 , 然后然后过一遍 Softmax。在线性的线性 attention 里面 , 这一步是没有的 , 就它没它是没有 Softmax attention 的 。
你可以既把它叫做非 Transformer, 你也可以把它叫做 linear transformer。 学学术界对它的叫法是多种多样的 。
对 , 我刚才还有一个比较好奇的问题嘛 , 这个其实我们在开始正式开始前我们有稍微聊了一下线性注意力和循环和 RNN 神经网络的这个关系 。
它本质上是一个是一个东西 , 本质上是一个东西 。
所以可以说就是大家去往线性注意力机制方面去优化 , 它也是把以前的 RNN 这个东西我再用到大语言模型里面的这样一种尝试是吗 ?
以前的 RNN 最大的问题是它没法并行化 , 所以就出现了 linear RNN, 就让它能够做大规模的并行化 。
刚才是聊了你们为什么在注意力机制的改进中是选了对 Transformer 原来的架构改动更大的线性注意力的大的方向 。
线性架构19:30
那接下来我们可以具体来聊一下 MiniMax 01 里最后用的这个 lightning attention 在线性注意力上, 它具体是一个什么样的结构 ,以及为什么它是这样 , 带来了一些什么效果 。
我们其实很早 , 比如说在 23 年底的时候 , 我们就我们就觉得这个东西已经 ready 了 ,并且我们当时其实用有实验室有限的资源 , 我们是训过一版 15B 的模型的 。其实效效果上是跟 Transformer 已经差不多的 , 它是一个纯线性的方案 。
但是后来我们把它 scale up 上去以后, 我们发现这个 lightning attention 包括线性系统线性线性的这个方法有个最大的问题 , 就是它的 retrieval 能力是比较差的 。
这个是我们把这模型训出来了以后, 我们才观测到的一个现象 , 就是我们对它跑大海捞针的时候 , 我们发现它的这个跟我们想象中的结果并并不一样 。
那么为了解决这个问题 , 比如说你要把它真正的 scale up 上 scale up 上去的话 , 我们就选择了一个比较折中的方案 , 就是就是叫做 Hybrid 的这个方案 。
你也你看到的 , 我们会每隔七层往里面再放一层这个 Softmax attention, 把它变成一个混合的架构 。 然后我们做了一个 Scaling Law 的一些实验 , 结果发现这个混合架构 , 它的效果比我们想象中的要更好 , 特别是在这个 retrieval 的这个方向上, 它比全部都是 Softmax attention 的架构会更好 。
我们得到的这个结论是我们也是比较惊讶的 ,也就是相相当于
你用一个在这方面比较有缺的一个方法方法和一个这个这方向上正常的方法 , 你反而得到了一个远超于这个 Softmax attention 的一个方法 。
我们当时是比较惊讶的得到的这个结论 。
可以给我们的听友也解释一下, 就是 retrieval 是一个什么样的能力吗 ? 以及注意力机制改进的论文里面都会去测的大海捞针的任务是个什么样的任务 ?
Retrieval 就是一个召回的能力 , 就是你就比如说大海捞针 , 大海捞针任务就是给你一篇长文 ,但是长文里面呢 , 它里面有一有一段话可能显得跟有一句话可能跟别的话是格格不入的 , 然后我应该怎么把这句话把它给找出来 。
这就会体现这个模型它去定点召回的这个能力 。 然后大海捞针它就会把这个格格不入的这句话放在一篇很长的文章中的各个部分 , 我们来看它能不能把这句话把它检索回来 。
这个其实是一项基础能力 , 基础能力就是大模型的这个 in-context 的基础能力 , 就是它必须能够复述上文的所有的内容 。
然后我们发现线性注意力呢 , 它是做这个能力 , 它有一个先天的弱势 , 这个也很正常 。 很正常的点是在于线性注意力它的这个 Query-Cache 它是一个恒定的值 ,也就是说无论你的输入有多长 , 它都会被压缩到一个恒定大小的 Query-Cache 里面 。
那么很明显这会有个悖论嘛 。 那么你的 Query-Cache 的这个大小是一个固定容量的 ,但是你的 input 可以是任意容量的 , 你的你的 input 可以是任意大小的 , 那很明显它就会有个压缩的过程 , 它就会有个信信息压缩的过程 。
那么那么这个信息压缩的过程就会就会导致它做 retrieval 的能力会比较差 。 这是从原理上的一个解释 ,high level 的解释 。
那也可以再解释一下, 就是 Transformer 里的 Softmax attention 它本来的一个计算流程是怎样的 , 包括它里面的这个 Query-Cache 缓存的部分是一个什么样的机制 ?
我觉得这个就是对比来讲的话 , 可能听友会更容易理解 。
High level 上来讲这个问题就是对于标准的 attention 来说的话 , 就是它每输出一个 Token 的时候 , 它都会去回溯前面的所有的 Token。
我们把这个过程呢 , 把它叫做一个翻书的一个过程 , 就是 attention 你在生成下一个 Token 的时候 , 它会把前面从第一个 Token 到 n-1 的 Token 它全部再看一遍 , 来得到输出的第 n 个 Token。
那么对于 linear attention 来说的话 , 它只看前一个 Token,也就是说它输出第 n 个 Token 的时候 , 它只会看第 n-1 个 Token, 然后再通过它里面有个缓存的机制 , 它从它的缓存和这个 n-1 它就会得到第 n 个 Token。
可以看到从这个上面来说的话 ,Transformer 就是有一个二次计算复杂度的一个关系了 ,因为它每输出一个 Token, 它都会看前面所有的 Token。
用通俗的话怎么理解呢 ? 就是你回答的内容 , 你前面呢是你依靠的是前一个人的回答 。 打一个比方 , 你在做一个游戏 , 什么游戏呢 ?
就是传话的游戏 。 对于 Transformer 来说的话 , 它会去听前面所有人的传传话 , 得到它自己的结果 。 但是对于 linear 来说的话 , 它只会听前一个人的传传话来得到它当前的结果 。
那就那就意味着如果前面出现了任何的问题 , 它会它这个错误会一直累积起来 。 但 Transformer 里面实际上它并它并不会 ,因为它会每次都会重复的去过前面的所有的内容 。
所以你们最后发现的就是去改善纯线性的注意力机制召回能力比较差的这个方式 , 就是你们现在在论文里写的我一层 Full Attention, 后面接七个线性 Attention。
对 ,其实是每七个里面放一个 , 我们第一层还是 linear attention。其实 Hybrid 是一个很折中的方案 , 我们只是为了去解决这个 retrieval 的问题 , 所以我们做了一个这种混合的架构 。
但是我们也尝试过 , 比如说每隔七层混一个模型 , 或者是每隔十四层混一个模型 , 或者每隔十六十六层混混一个这个 Softmax attention。
我们混合过不同的比例 , 然后从我们的结果上来说的话 ,其实影响最大的其实是 retrieval 的能力 。 但是在语言建模上, 它其实能力差别并不是很大 。
这个具体在做的过程中间 , 你怎么去混合 ? 就是你到底选什么比例 ? 它是有什么前面的技术社区里的其他人的研究可以做参考吗 ?
我们是自己试出来的 , 当然我们我们也参考了这个 Jamba 的 Jamba 的它的混合层数 ,其实也是一个 1:8、1:7 的这种模式 。
那这个试的过程它有任何的理论指引或者解释吗 ? 比如说能帮你提前去判断一下这个效果会怎么样吗 ?
这个没有 , 就这个就是试 ,并且我们试过最极端的一层的 ,其实效果也还可以 , 效果也还可以 。 只不过我们选择选择这种方式的原因 ,其实还是我们不太 , 我们已经很激很激进的去换了解换了架构了 ,但是我们担心它会有一定程度上的损失 , 它最它最终的 performance。
所以我们就选了一个较为保守的 1:7 的这个比例 , 这其实是一个很保很保守的比例 。
你刚说最激进的一种是只有只有一层 , 这是指什么结构 ?
就只有一层 Full Attention, 比如说现在 80 层的话 , 你们可能只有十十层的 Full Attention, 那么极端情况下我们就把十层变变成一层 。
我理解了 , 就是说你们整个大模型可能是大几十层 , 然后中间只有一层是 Full Attention, 然后其他全都是线性 Attention。
对对对 。
那你们最开始是怎么想到要去混合的这种方式了 ?
这个其实是非常符合直觉的一种尝试吧 , 然后再加上前面也有 Jamba 的出现 。
你们这个新的混合的线性注意力的结构 , 它最后带来的实际的效率提升是怎样的 ?
就是你的序列长度是 1M 的情况情况下, 它比 Full Attention 要快 2,700 倍 。
你这个 2,700 倍 , 它是在什么环节的 2,700 倍啊 ? 就是它是 decoding, 就是生成的这个环节 , 还是它前面一些环节 ?
就你算 end-to-end 的这个规模会是 2,700 倍的加速 , 或者你就你就算 Attention 这一步吧 ,在 1M 的长度下 。
那 1M 就是 100 万 Token, 确实非常长 ,而且 2,700 倍我觉得听起来也是个比较惊人的数字 。其实按照线性 Attention 的原理 , 它就是序列越长 , 效率优势越明显 , 对吧 ?
就我只相比于稀疏注意力 。
对 , 越长它的倍数越多 。
规模验证28:01
那当你们去找到这个具体结构的过程时, 你们是怎么一步一步去验证你们对注意力机制做的这个改进它是有效的呀 ?
因为模型其实最初我们需要对它进行 Scaling Law 的一些实验 ,Scaling Law 的一些实验基本基本上在 24 年初的时候就开始了 。
所以 Scaling Law 的实验 , 它其实发生在正式训练 MiniMax 01 这个模型之前 。
首先我们要把它 Scaling up 是一个这个决策 , 你需要去说服老板的 。 对 , 然后呢 , 这个东西你不可能去去想我我花了几千万 , 然后去训了一个大模型出来 , 发现它失败了 , 对吧 ?
那么对我们来说的话 , 前期特别是这种吃螃蟹的事情 , 我们需要把前期的工作要做得非常的 solid, 就是我们的参数应该要怎么样选择 , 然后我们应该是用 lightning attention 还是用 HGN 啊 , 还是用 Mamba, 还是用各种各样的这些 linear attention 的算法 , 我们都需要对它进行一定的 benchmark 的 。
就是我们最终选择的就是速度效果上的一个均衡 。 所以我们觉得一个完整的严格的 Scaling Law 的一个对比实验是必须的 。
但是如果只是拍脑袋决拍脑袋决策的话 , 当然可以省下这部分的成本 , 那你会增加之后的失败的概率 。
我们大概训了 3,700 个模型才跑出来的一篇文章 。
3,700 次模型是全部从头训练 ,是 3,700 次预训练的意思吗 ?
全部都是从头训的 , 不同的大小 , 不同的参参数 。 所以跑 Scaling Law 是一个成本很高的一个实验 。
工业界和业界做注意力机制优化的时候 , 跑 Scaling Law 测试这个做法常见吗 ? 就是有多少公司会这么做了 ?
跑 Scaling Law 的公司其实并不多 , 谷歌就是谷歌 , 谷歌是跑过跑过的 , 就他们产出那篇论文的 Scaling Law 那篇论文的时候 ,他们也他们也跑过 OpenAI 也跑过 Scaling Law 的一些一些实验 。
这是因为我们还是希望我们的选择是 solid 的 , 所以我们会选择把这件事做得非常极致的扎实 , 就是我们每一个选择都是有实验来支撑的 。
你们居然试了几千次 ,3,700 次 , 这个还挺有意思的 ,也也让我有点意外 。 我觉得我们可以从更开始来聊一聊 , 就是你们在最开始 21 年开始做这个线性注意力的探索 , 到今天这样一步一步是怎么样的一个过程 ?
研究缘起30:25
从 21 年开始 ,其实我们最早提出的就是 Transformer。Transformer 这个项目其实是从 21 年 7 月份开始的 , 这是我们第一次接触到这个 linear attention, 然后我们就我们就推出了这个 Transformer。Transformer 现在在 linear attention 上的知名度其实还可以 , 然后这篇文章其实是发表在了当年的这个 ICRR 上的 , 然后从此呢 , 我们我们发现这个方向上看起来大有可为 。
当时我们的想法其实很简单 , 第一做 Transformer 已经很多人了 , 然后你继续做 Transformer, 你做到极致也是跟着人家屁股后面来后面来走了 。
但是 lightning 作为这个 linear attention 作为一个新的方向上, 它的人数其实是比较小众的 。 那么与其跟着人家屁股后面走的话 ,不如选取一个我们的新的新的方向上来看一看未来呢 , 我们是不是可以在这上面做出一点东西出来 。
这是我们当时的心理嘛 。 然后我们其实产出最多的就是 21 年到 22 年, 我们我们基本上探索了很多方法 , 包括现在的 linear linear attention,linear RNN, 还有我们把它叫做 long convolution 这个这个方法 。
我们其实探探索了探索了现有的
几乎所有的这个 linear 的这些方案 。 我们最先开始其实是在解决这个 linear attention 效果的问题 , 就是像 linear attention 其实也很也很早 , 它的这个最早论文出来的也很早 ,其实跟 Transformer 差不多同差不多同时 。
但是呢 , 它的效果不好 , 速度又慢 , 所以就导致大家对它的这个大家觉得它是一个美好的泡泡 , 就是看起来很好 ,但是实际用起来不行 。
所以在 21 年到 23 年的时候 , 我们解决的问题就是我们把它的效果真正做到跟 Transformer 差不多 。 我们做到这一步差不多到 22 年底的时候 , 我们已经能我们做出来的这这些方法已经能做到跟这个 Transformer 效果上是差不多的了 , 就语言建模方面 。
当时你们是去测哪些 benchmark? 就是你们怎么去判断说你们当时的线性注意力的架构已经和 Transformer 差不多了 ?
基本上有些学术上的一些数据集 , 当时走的都是学术上的数据集 。 我们比如说我们我们会看它的这个困惑度 PPL, 然后我们也会也会也会去看一下它在一些常见的大模型的这个数据搒单上面 ,在相同的数据下我们我们看一下它的这些结果 。
然后我们还会测一些像 Long-Andretta,Long-Andretta 就是一个属于长文的一个 benchmark, 当时推出的一个长文的一个一个 benchmark。 我们我们我对比过这个 Transformer, 当时我们最主要其实对比的就是它的建模精度 , 就是困惑度 。
然后我们第一次我们第一步先是去解决它的建模建模精度的问题 , 然后第二步才是去解决它的速度的问题 。
就是 linear attention 很 tricky 的一个点就是在于它虽然理论复杂度是线性 ,但它实际上跑起来它是很慢的 。 它是很慢的 , 原因是因为是因为你右程的时候它会牵涉到一系列的循环操作 , 你知道循环操作对 GPU 是相当不友好的 , 所以它里面就会就会导致你的实际的运行效率是远低于它的理论复杂度的 。
为了解决这个问题 , 所以我们我们在 23 年的时候就就推出了 TNL 和 lightning attention, 就是 23 年的时候我们我们推出的这个 lightning attention, 真正把它的效率让它的实际效率符合它的理论的计算复杂复杂度 。
所以当年在上荣智联实验室的时候 ,其实已经我们已经觉得它是一个工程就 scale up ready 的一个状态了 。 我们当时自己认为的是我们解决了它的精度问题 ,也解决了它的推理效率问题 。
所以我们当时觉得它是一个 scale up ready 的一个一个一个状态 。
你们当时做到这个 , 你认为 scale up ready 的这个状态 , 你们是在多大的模型上做了 scale up 的测试 ?
我们最大是训到了 15B 的模型 ,15B 的一个 dense 的模型 。
你们当时没有继续往下做更大规模的 Scaling Law 的测试 ,是是因为在实验室里会有一些资源的限制是吗 ?
没有 , 上仁是没有这么多卡来支持这个工作的 。 所以那当时对我来说的话 , 我们就是一个找找金主的一个过程 ,因为我们需要把它真正要做到 scale up。
因为当时对我来说 , 我的判断是最迟在 24 年底 ,linear attention 的大模型是肯定会出来的 , 就是基于 linear attention 的这种大模型是一定会一定会出来的 。
因为不是我们做出来 , 就是谷歌做出来 , 就是 OpenAI 做做出来 , 它终归会有一家把它给做出来的 。
对当时来说的话 , 我是比较着急的 , 我就是我就相当于这也相当于一个找投资人的一个过程 。 我需要去找一个人 ,他愿意来投资这个方法 ,并且把它 scale up 上去 。
找金主36:14
你说找金主 , 你最后找到的金主就是 MiniMax?
这个其实是双向的 ,其实是当年因为我之前就在俊杰的下面嘛 ,在上汤的时候 , 然后后面我记得是在 23 年底的时候 , 俊杰正好找我找我吃了个饭 , 然后就正好聊到了这个 linear attention 的问题 。
因为在 23 年底的时候 , 我其实最在找投资人找的最多的就是 23 年下半年的时候 。
那你自己也是想过自己创业是吗 ?
一个是自己自己创业 ,但是自己创业其实我后面想了想是很难的 , 原因是你改基础架构 , 你需要的投资金额是非常高的 ,并且我们其实只有算法上的优势 ,在数据上的优势是比是比不上顶尖的这些一流的公司的 。
因为因为在那个时候 , 你必须的积累的这个预训练数据基本上是实体往上走了 。在 23 年底的时候 , 就你需要进第一梯队 , 你就必须要有这么多的数据 ,并且这里面很 tricky 的东西就是在于你要证明这个模型的有效性 , 你就得进第一梯队 。
所以这是一个诞生期鸡生蛋的问题 。
对 , 对这段话来说 ,因为大模型它是它其实很复杂 , 一个是你的架构要好 , 你的训练数据要好 , 你的训练方式也得要对 。
所以这三环是缺一不可的 , 你任何一个地方掉了链子 , 你都会没法证明你想要证明的证明的东西 。
所以对我来说能选这个也很 tricky。 首先我得保证这家公司它是能够做出来一流的预训练模型的 , 包括这一点上其实已经砍掉很多公司了 。
那你当时视野之中, 你看到的能做一流预训练的公司都有谁啊 ?
大小公司能算上的 , 我觉得第一个是字节 , 第二个是 MiniMax, 然后其实已经没了 。
Kimi 不算吗 ?
就 Kimi 关于它的这个我得到的消息是比较少的 , 所以当时其实在我眼里的话 , 我只有两个选择 , 要不然就是寻求海外了 。
那你当时见过的一些投资人和他们的反馈是什么 ?
他们的反馈很简单 , 就是你的应用方向是什么 ,他们会想一大堆你的应用方向你你怎么去变现 。
大公司你也见过吗 ?
腾讯那边见过 , 阿里也见过吧 。
VC 你你见过的反馈是什么 ?
VC 也见过 ,也见过一些一些 VC,但是呢 , 就感觉他们比较喜欢聊的是你的应用方向是什么 , 就是你的变现渠道是什么 , 你怎么你将来怎么样去盈利 。
对 , 就是刚好我今天也是和一位投资人聊 ,他也提到说就是在 2023 年、2024 年的时候 , 大家还是比较看重应用 ,但那个时候你就让一个模型应用要去产生比较大的商业收益 , 这有点像让一个高中生还没有完全训练好的情况下, 它就出去赚钱 。
所以在那个时间点 , 你想去找人 scale up 一个线性 attention 的这种比较新的架构 , 确实可能会有一点难 。
这其实对我们来说的话 , 我当时想法是很简单 , 就是我觉得我当时是我我的判断 , 就是 223 年底大模型已经出来 , 我们已经做了三年了 , 我们为什么不让它诞生在我们自己手上 ,而让它们诞生在别人手上呢 ?
因为当时我们是作为最懂 linear attention 的这批人。
你说最懂 linear attention 的人是全球范围内的意思吗 ?
基本基本上是 ,因为当时包括现在现在比较活跃的松林杨松林 ,他们也他之前也是我们组的组员的 。
我们当时其实就是这个想法 , 所以我们就去比较积极的去找谁能够把它 scale up。
MiniMax 之外你和字节聊的话是什么反馈 ?
我聊到了那个时候有德国的一家 ,他们的实验实验室也也来找过我们 , 就是聊这个事情 ,但是我们当时也跟他们有有一些合作吧 。
然后字节的字节那边是在于我感我感觉他们信支度不是很高 ,并且字节作为一家大公司的话 , 它虽然它有数据也有人 ,但是你要你让他们真正做转型去那么大的这个精力去做一个未知的方向 ,是件比较 tricky 的事情 。
你是 2023 年什么时候和字节聊的 ?
8、9 月份吧 。
那回到 23 年下半年, 就是你和闫俊杰聊的话 ,他的一些具体的反馈是什么 ?
俊杰来找我的话 , 我首先跟俊杰很是很很熟悉的 ,21 年的时候我已经跟他非常熟非常熟悉的一个状态 , 然后我们聊我们聊下来 , 我们对这个东西他是很愿意去尝试的 ,并且他是愿意绝大部分公司的精力来做这样一件事情的 。
就是这个这因为这个这个模型是一个主模主模型 , 就是它需要需要花公司可能百分之八九十的力量来做这样一件事情 , 包括牵涉到数据团队 、 工程团团队 、 算法团队 , 需要很多人去一起来把这个东西做出来的 。
押注决策41:20
闫俊杰他比较认可你 ,是因为他们之前在这个线性助力上有一些探索 , 还是因为一些什么原因啊 ?
之前他们对于 linear attention 其实做的是并不并不多的 ,但是呢 ,他们也当时是处于下一代模型的技术选型的一个阶段 。
俊杰可能认为 , 比如说我做的工作是比较 solid 的 ,他是对这个工作是比较信任的 。 当然对于俊杰来说的话 ,他看这件事情跟我看这件事情不一样 , 我认为这件事情百分之九十九能成功 。
那么那么对对他来说的话 ,他可能有个百分之五十和百和百分之五十的几率 ,因为他对这块领域 ,他并不是从 21 年就一直开始往下做 ,并且做很深入的研究 。
但对我们来说的话 , 我们是对他很多 tricky 的都是比较了解的 , 我们是很相信他能够他能够 scale up 的 。
那他有百分之五十的把握 ,他就敢上百分之八十的资源 ,他这个赌性是不是有点大 ?
这确实是要赌的 ,但是我们的 Scaling Law 的实验其实是给了他 , 就是他花这件事情 ,他不是一 ,他他不是一开始就 all in 把这个全部弄起来 , 肯定是我们需要一步步的去说服他 。
我们包括我们也是先是做了一个小小的模型 ,在一个成本可控的范围内训了一个小的模型 , 然后我们再训一个大的大的模型 。
那在你们去就是一步一步去验证这个想法的过程中间 , 你们后面又看到了一些什么东西 ?
然后在这段时间里面 , 我们跟他说的是我们有一些结论 ,有一些结论基本上都是因为因为所有的东西是公开发表的 ,他们内部可以去做一些做一些复现的 。
然后我们是在 MiniMax 的内部呢 ,是做了一个就我去了 MiniMax 以后才把混合架构往上推的 。 我们是在 24 年初的时候才发现有这个比较 tricky 的 , 我才发现这个 lightning attention 有缺陷的 , 所以导致我们必须采用这个混合的架构 。
采用混合架构和做 Scaling Law 基本上是同是同时的 。 然后当时有个我的前我的前组员去了 MiniMax, 然后他来他来做这样一件事情 , 跑了这个 Scaling Law 的这些这些实验 。
你之前说有百分之九十的把握 , 这是你们在发现就是你刚才说的这个缺陷 , 它在 retrieval 的能力上有些缺陷之前还是之后 ?
它有发现之前 ,但是我们当时认为只要我们只需要混合架构 , 这个问题是可以解决的 。
那你当时的心态可以分享一下吗 ? 就是因为你之前已经做了两三年的这个线性的改进 , 然后你当时也本来有个很大的把握 ,但当你去做到更大规模上的时候 , 你发现它在召回的这样的基础能力上会有一些缺陷 , 这会非常压力山大吗 ?
还是说你大概心里是有底的 ?
我们有个备选方案 , 就是 hybrid, 就是混混 Softmax, 这这是一个保底方案 , 我们是有保底方案的 ,但是我们当时觉得这个方案确实不好看 , 就是不够优雅 , 就是它就不会是一个标标准准的纯线性的一个方一个方案了 。
那可以再往下聊啊 , 就是你们发现了这个缺陷 , 然后解决了这个缺陷 , 然后做这个 scale up 的过程是怎样的 ?
训 Scaling Law 的这个实验其实是首先是去论证这个技术方向到底有没有问题 。Hybrid 的实验也在 Scaling Law 实验里面 , 对 , 我们我们是要同时做这个 Scaling Law 的一个实验的 。
所以你们当时这个 Scaling Law 的测试 , 就是你们测了非常多不同类型的架构是吗 ?
对对对 ,并且我们测试的 linear 的方案也也很多 , 除了 lightning 啊 , 还有 IGNR 啊 , 包括 Mamba 其实我们也测过 。
你们要训练多少次这件事情 , 就是你们最开始的预测是多少 ? 你们怎么去定我最开始要给多少资源啊 ?
这个我们最早就有预估的 , 最早就有预估的 , 就是我们我们把它需要的卡数和它需要的资源数 ,其实其实要训的模型数我们是有一个 Excel 表的 , 然后我们就根据这个根据根据这些表去训出来就行 。
那你最开始设计的就是要训 3,700 次吗 ? 还是说最后它其实超出了你的预期 ?
就一样的 , 就是一样的 。 对对对 。
你怎么跟闫俊杰说要训 3,700 次 ? 他是什么反应 ?
因为我们我们最高其实只 scale up 到了 7B 的这个模型 ,其实很很多一部分是小模型 , 它需要的资源并并不是很多 。
OK, 所以它总的资源是相对可控 。
好走 , 对对对 。
那你们在实验阶段 ,其实你们只 scale up 到了 7B 这样一个规模 , 那你怎么知道它往更大的规模上去做的时候 , 它的效果也是可以保证的 ?
首先我们假设 Scaling Law 是已有的一个可实现的一个 , 就是我们认为 Scaling Law 是存在的 , 那么对我们来说的话 , 我们只需要把这个趋势给画出来就可以了 。7B 以上的话 , 我们是去是走预测就好 。
就是在训 MiniMax 01,因为这是一个很大的模型嘛 , 就正式开始训这个模型的时候 , 它用到你们这个新的架构 , 它是一个怎么样的过程 ?
就是它进一步扩大 , 它会顺利吗 ?
我们先训了一个比较小的比较小的模型 , 可能就只有一个 9B 激活的一个模型 。 你看 9B 跟 7B 其实差异并并差异并不是很大 。
然后这里面其实会牵涉到一个问题 , 就是我们的 Scaling Law 是在 Dense 下做做的 , 就是 Dense 模型下做的 , 我们真正的业务场景的模型都是 MoE 架构 。
OK, 那从 Dense 就是稠密的模型到 MoE 混合专家的这种架构 , 这个里面它有什么难点 ?
然后这时候就有另外一拨人去去接手 , 把它放到 MoE 架构上去做进一步的什么 , 像调参呀 , 训练啊 。
这个什么时间的时候 ?
23 年年中的时候 , 大概六七月份的时候 , 就不需要我了 。 就我们的这个这个方案就是已经 deliver 的一个状态了 , 就我们只是算法部门嘛 , 它直接签上去就可以了 。其实训小模型训的训的训的很快 , 可能一个月就训完了 , 然后接下来就开始用 2,000 卡左右去训一个这个 MiniMax 01 了 。
那在 2,000 卡的这个过程中间去训的时候 , 整个公司你们又做了哪些优化 ,以及它需要多少资源 ?
这是算力的这么多成本过来 ,但是实际上在之前你工程优化需要需要很多的工程能力的 。 就像就像我说的 , 这里面你是有很多轮子要自己去照的去去照的 ,因为我们之前只是一个科研小组 。
科研小组首先我们并不我们虽然很关心它的训练的效率 ,但是我们并不关心它的 inference 的效效率的 ,并且最早我们其实做的规模也是比较比较小的 , 最多到 15,15B。15B 的时候你是不牵涉到什么更高阶的这种序列并行啊 , 这些这些方案的 , 所以他们需要做很多的工程优化 , 才能让它真正的在大规模上训起来 。
所以整个后面去训 01 正式版 , 就是这个大的版本的过程其实比较顺利的是吗 ?
对 , 后面把它 scale scale up 上去都是比较都是比较顺比较顺利的 ,因为我们前期其实因为跑了 Scaling Law 以后, 大家对它都是比较有信心的 , 再加上训了个小小模型出来也没有什么问题 , 那么大模型的话大家都是比较有信心的 。
你们有看到什么其他的类似你们现在做的这种架构的成果吗 ?
现在用它做大规模模型 , 采用线性注意力的应该是全球第一个 ,MiniMax 01 应该是第一个 。
因为其实你们的这个改进 , 你们是从训练阶段就开始做线性注意力的架构 , 就引入了线性注意力 。
那整个业界的话 ,有没有一些就是在在推理阶段去做这件事的一些成果 ?
有 ,他们有有方法 , 就是想就是想把已经训好的模型 , 比如说 Nama, 把它蒸馏到一个线性的模型里面里面去 , 确实有类似的方案 。
就是为什么你们敢做一个就在我看来还是一个比较激进的方案 ,而且还投入这么多资源 , 就为什么要做这个决策 ?
对 , 我们第一是展现技术实力 , 表示我们是一个敢于创新的一家公司 , 就我们敢于押注这个 , 就是敢押敢押注这个新的这个技术 。
然后并且我们我们把序列长度已经提升到了 4M 嘛 ,其实我们愿意的话 , 我们可以提到提到 10M,也是已经也是可以承受得住的一个一个序列长度 ,但只只不过对于我们来说的话 , 我们我们现在是考虑 10M 的数据怎么构造 , 这其实会牵涉到很多的数据方面的问题 ,以及我们把它做了 10M 以后, 这 10M 到底能干什么 。
毕竟我们现在还是先想把在 1M 以内的这这些东西把它做到极致 , 然后再我们再把它往外面推 。
4M 就是 400 万的话 , 这么长的序列它可以干什么了 ?
比如说你想想把四四大明珠直接放到这个里面 , 然后让它去归纳总结一些东西 , 可以把一本 《 红楼梦 》 往里面放 。
OK, 你刚才提到其实你们也可以做 4M, 就是 400 万 Token 的这么长的一个序列 。 那我们更早的时候也讲到说你们这样一个改进之后, 它在整个效率提升上, 你之前说是 2,700 倍 , 对吧 ?
也是个很惊人的数字 。 但另一方面就是大家可能也会在想 , 线性注意力这种架构它怎么去保证效果 , 比如说在 MiniMax 01, 还有 K1.5, 还有 DeepSeek-R1 发了之后, 我也是在朋友的电脑上看过它实际的测试 。
效果与数据50:45
它当时的这个场景是一个大概 2 万字左右的英文文章 , 这个文章是比较详细的去讲述了海外的这些社交媒体大家是怎么去用它的 , 就涉及里面的很多功能 。
然后最后提问的时候就问了一个具体的点 , 就是说大家是怎么去使用这些社交媒体上的短视频的功能的 。
回答的问题就会发现 ,MiniMax 它的回答里其实有一些它没有直接在回答我的这个提问 , 它不是在讲这些人怎么用短视频 ,而是后面讲到比如说年轻人是怎么用一个社交媒体的 , 就它讲了一些跟问题本身不相关的东西 。其实 R1 也有这个问题 , 这要测的那一次是这样 。
然后当时 K1.5 的表现是比较好的 , 这个它是什么导致的 ?
我们有专门的 benchmark, 比如说 《 大海捞针 》 或者是 《Runer》, 这也标准的 benchmark 去来测试它的这个长温度 。 我们我们会会看到它的一些基础能力 ,但是你所提到的这个能力 , 它其实会跟训练数据会严格相关 , 就是我们我们只能保证的是这个模型它有这个模 , 它有这个能力的潜力 ,但是它具体要要具有这个能力的话 , 它其实跟训练数据也是强相强
相关的 。 你所提到的这个这个问题 , 这是我们下一代模型需要去解决的问题 , 就是我们真正把长文做得更好 。
很 tricky, 就是我们现在这个确实很尴尬的一个点 , 就是我们现在这版模型的真正的长温上的应用并没有做得特别的极致 , 就它没有充分来挖掘这个模型的能力 。
但是它并不是这个架构导致的是吗 ? 它可能是一些别的环节加起来导致的 。
这个我们认为是数据导致的 , 训练数据的缺乏导致的 ,因为我们做过非常严格的这个 apple to apple 的一个对比 , 就我们这个架构在相同的数据下是没有劣势 。
就是我们其实也看到现在 MiniMax 01 它不是一个推理模型 。
对对对 。
然后像 R1、O1 还有 1.5 它是推理模型 。 那你们现在这个架构它去做推理 , 就是去结合强化学习 , 它的潜力或者说它的方法是怎样的 ?
这块我就我倒用一下接月那边的结论 ,是其实他们认为 linear 架构在推理上会更强一点 。
为什么呢 ?
他们的 climb 的点是压缩产生智能 , 那么 linear 模型它干的活就是把信息做了一轮的压缩 , 所以他们通过这个理论呢 ,他们就会觉得这个 linear 的效果会在这种深度推理下, 它是比较有优势的 ,并且我从我有跟他们的技术人员也聊过嘛 ,他们的意他们他们的意思是说 ,他们在 linear 模型上面做过这种深度推理的一些实验 , 表表现上是 linear 的是比较有优势
的 。
那你们自己看到的是什么了 ?
这个我们正在做 。
所以现在还不方便透露是吗 ?
就我们因为我们其实最开始并没有选择去做 O1, 就 O1 刚刚出来的时候 ,因为国内有一大批的跟随跟随者嘛 , 我们当时当时的想法其实还是先把基础能力做扎实 。
当然这里面也有个研判是我们觉得这些推理的能力只会让它的某一方面 , 比如说 indomand 这块能力变得更强 。
但是 R1 出来以后, 它改变的事情什么呢 ? 它是发现它的它的这个加了这些推理能力的话 , 它的 generalization 能力会变得更好 , 就它的外推能力 , 它能够把这个能力去延展到它没有见过的类类没有见过的方向的这些内容里去 。
就是它的泛化能力会更好吗 ? 可以这么理解吗 ?
对 , 就是它的泛化能力会更好 , 这就导致为什么我们现在要去做深度推理模型 。
那你刚才说你们当时研判要把技术的基础先做得更扎实 , 这些指的是什么呀 ?
本质上来说就是我们有一批内部的搒单 , 我们希望这个模型能在内部搒单上跟 Seo 差不多 , 或者跟世界顶尖模型差不多 。
为什么要对标 Seo?
因为当时的话 ,Seo 是目前最先进的模型 ,在那个在那个时候 。
就是你们你们会比较去追求这个多模态吗 ? 因为 Seo 其实它是一个混合模态的模型 。
因为我后面就接手了这个多模态理解大模大模型 ,但当时我们其中也是有两也是有两条两条路的 , 第一个是原生多模态 , 还有一个就还有一个就是这种 adapter 这种形式的多模态 。在在这在这一块上, 我当时的判判断是我们还是做 adapter 的形式 。
第一个第一是当时原生多模态是没有走通的 ,因为当时的是像 Gemini 2.0 是没有发还是还没有发布的 , 我们会选择一个较为保守的方案 , 就是 adapter 这个这个这个方案 。
这个方案的好处就是第一 , 我们可以很快的去验我们的数据有没有问题 ; 第二呢 , 它的效果是立竿见影的 , 我们只需要一个较小的成本 , 我们就能得到一个比较好的模型 。
然后从我们从这个我们发布的这个 vL01 来说的话 , 我们的 benchmark 结果其实还是不错的 。 对 , 它不是一个原生多模态模型 ,但我们我们现在正在做的是一个原生多模态的模型 。
所以 vL01 它还不是一个原生的多模态 , 它是一个 adapter 的这种形式 。
对 。
就说我能混合输入多模态 , 混合输出多模态 , 它也有可能内部的结构并不是一个原生多模态 ,而是通过 adapter 给它拼起来的什么 ,也有可能是这样 。
对对对 。
所以可以理解为 MiniMax 01 其实是 MiniMax 主线模型上还挺大的一个转型或者说升级的 , 就是从以前他们 ABAB 的那个系列 , 我理解应该是 Transformer 架构的 , 对吧 ?
然后到现在 01 它是一个线性的架构的 。
对对对 ,其实这一段的模型更迭很快 ,因为 ABAB 上代的模型就是 6.6.5, 放出来这个 6.5, 它其实训我还是 24 年 6 月份 , 对 , 然后马不停蹄的就开始训 MiniMax 01。
所以就是上 2,000 卡去训 01, 就是 24 年 6 月之后的事儿 。
对对对 ,以后的事情 。
那之后就是会沿着这个线性的架构一直去迭代一段时间是吗 ? 包括你们推理 , 你刚才也说也会在这个上面去做 。
我的预测是我们这个模型应该会用到今年 6 月份 , 起码会用到今年 6 月 6 月份 , 然后今年 6 月 6 月份以后的话 , 我们这边还会有新的架构出来 。
推理之后你们想探索什么呀 ?
就更新模型啊 。
那或者说就是大家看到的下一个趋势是什么 ?
就是我们的模型会变得更加的高效 。
更加的高效 ,以及就是推理能力也更强 , 对吧 ? 数学编程这些 。
首先它的数据量会高很多 , 然后模型结构也会有更新的 , 我觉得我们会从头再训一版 。
因为从 O1 之后, 就是把强化学习引入到 Transformer 整个流程啊 ,因为之前也用了强化学习 , 可能主要是在后面这个微调的部分 。
就是这样一个变化之后, 你觉得下一个大的变化可能会是什么 ? 就 AI 界有看到一些苗头吗 ?
现在还没有 , 现在其实还是在做深度推理 , 就是这波其实刚刚起来 , 包括我们现在还处于一个跟随的状态 ,但我们其实认为未来长文还是一个趋势的 。
我们其实比较高兴看到像 MiniMax 啊 、Kimi 啊 ,他们都推出他们各自的长文优化的这个模型架构 , 那就意味着他们跟我们是上了同一个赛道了 , 就是长文的赛道 。在长文赛赛道上,linear attention 是我个人觉得很难碰到对手的 , 当 scale up 到一定程度的时候 。
所以一方面大家都上了长文赛道 , 另一方面你对你们现在选的这个方向 , 线性这个大的方向你是更有信心的 。
对对对 。
那你怎么去看 NSA 啊 ? 就它现在因为 DeepSeek 本身很火 , 所以上 NSA, 包括近期的像 Moba 这种成果 , 可能也跟着大家的关注度比较高 。
那实际上你觉得 DeepSeek 在注意力改进上的进度是怎样的 ?
这块他们主要的创新其实是我们当时就是我们 21 年说的 , 就是这个稀疏注意力速度很慢 ,他们这篇工作其实就是把它的速度真正的提上来了 。
它做了一个工程化的一个极致的一个一个优化 ,但是它的上限是很低的 , 就是我并不认我并不认为 DeepSeek 会走这条道路 。
这个上限主要是反映在当模型的参数变大的时候 , 它的提升效果就会没有这么明显了是吗 ? 就不如线性了 。
因为他们肯定他们想要 scale up,他们一定会做 Scaling Law 的实验 。
除了就是 MiniMax 01 这个主线之外, 现在 MiniMax 它其他的模型或者说算法上的投入有收缩到一些几个比较主要的方向吗 ?
还是说还是像之前一样 ,其实像视频生成这些你们也也会投入比较多在做 。
视频生成现在主要还是在做效果 , 然后视频关于视频生成的 linear 架构其实我们也是有的 , 它只是还没训而已 , 我们都是有新架构的 ,他们只是还没有采用而已 , 就是技术储备已经有了 。
所以线性也可以去做视频生成 。
就是就是我们的这个线性其实
有很强的技术储备 , 只是还没用而已 。
那可以说是你们的各个方向的模型都会转到这个线性的结构上是吗 ?
理论上是可以的 , 理理论上是可以 , 只是他们现在的研判是还不需要 , 就还不需要把它转化成线性 , 就它还没有遇到那个序列长度过长导致它的训练效率低下的问题 。
道心之争1:00:52
线性上限很高 ,而且这件事是可以 work 的 , 就实际上它可以 work。 你觉得它现在在行业里这是一个共识还是属于非共识 ?
这是个非共识 , 包括现在大家其实还对 linear attention 有 concern 的 , 即使 MiniMax 01 都已经发出来 ,他们觉得他们还是觉得 linear attention 可能 scale up 上去不太不太行 。
Concern 的展开说了 ,scale up 上去为什么不行 ? 它是原理上哪有问题吗 ? 让大家会有这样一个疑虑 。
第一可能是 MiniMax 01 的宣传度不够 ,他们还没看到 ,他们现在很很多人的一个共识 ,他们是觉得 linear attention 也是一个有损的优化 , 很多人是有这个共识的 ,他们他们说一个二次的 , 我现在用一个一次去逼近 , 那它当然是一个有损的一个优化了 。
但是事实上是有一有没有一种可能是这个二次计算复杂度本身就是冗余的呢 ?
就是你认为它其实是无损的 , 或者说它有可能是无损的 。
我们就认为它是一个无损架构 , 它是一个无损优化 , 特别是变成混合架构以后, 它就是一个无损优化 , 甚至还有增强 。
还有增强 , 你是指比纯 full attention 还有增强是吗 ?
对对对 , 比纯 full attention 还是有增强的 。
稀疏和有损这件事情是对等的吗 ?
稀疏就是一定是有损的呀 。
稀疏一定有损 ,其实 attention 固然就它固有的特性之一就是它是稀疏的 。
你的你最终 attention 会算出一个 attention mask, 这个 mask 它它本身是一个 dense 的 , 就它每一个元素都是有值的 。 稀疏的话就是我只计算里面部分位置的值 , 那么它是那么它本质上就是个有损的嘛 。
那稀疏的话就是我现在让它变成一个固定的 pattern 而已 , 我不去计算他们他们每个每个值了 。
如果说稀疏的这个 pattern 是可以学到的 , 这也是 NSA、Moba 包括 scale attention 在讲的一个事情啊 , 就是我可能到底在这个全的这个值里我选哪些 , 这件事本身是可以被学习到的话 , 那它能解决这个有损的问题吗 ?
这个方法其实在 20 年已经有了 , 已经已经 20 年的时候已经有方法 , 就是叫做可学的稀疏 attention, 这个也不是一个新的东西 。
但是呢 ,他们做的好处是当时的可学稀疏速度很慢 ,他们现在可以把它速度做得很快 , 采用不同的方方式 ,他们把它做得很快 。
但是我们认为我们认为 , 哎 , 这个就属于叫什么技术方面的 " 道心 " 之争 , 就我们认为它是有它是有损的 。
你刚说叫什么之争 ?
道心之争 。
那这个道心肯定也是来自于以前的一些积累 , 对吧 ? 比如说这是大家的一些数学上的理解不一样 , 还是什么东西不一样 ?
学术理念的不一样 , 就比如说我们从 21 年开始 , 我们我们就一直我们为什么那么长时间一直在做 linear attention 呢 ?
其实当时跟我们一起做 linear attention 的有些人已经已经不不接着往下做了 。
这属于叛道了是吧 ?
信信念感 , 我们觉得它是它一定是能 work 能 work 的 , 那么他们认为稀疏一定是能 work 的 , 这也可以 。
但是但是稀疏跟我们呢是正交的 。
怎么讲 ?
正交的意思就是他们的方法我们也可以用 , 我们可以直接拿过来用 。
你们的方法他们也可以用 ?
我们的方法他们用就比较麻烦了 ,因为他们要改他们的底层架构了 。其实我今天早上聊的时候 ,他们也讲到说可能理论上来说 , 线性注意力的机制的上限是更高的 。
其实我们已经证明了 , 只是他们选择选择他们相不相信而已 。
那说回来就是为什么 MiniMax 01 的技术技术社区的影响力 , 可能它就是没有那么让大家认知到这件事情了 。
对对 , 我们宣传比较少 ,其实还是因为 IO 的风格属于做 5 分 , 做 10 分 , 宣传 5 分 。
这个东西它到底是靠宣传 , 还是靠技术社区的人自己去发现 , 还还是说靠你们 , 比如说开源更好的工具 , 让他们能更好的来自己体验这件事情 ?
他们体验不了呀 , 你现在你个人也部署不了这个 600 多 B 的东这个 400 多 B 的模型啊 , 你们当然可以去检验一些用 API 的测试嘛 。
那有很多人去复现 R1,他们是在怎么做呀 ?R1 当然 R1 也开了一些小的 。
小规模上做 。
对对对 ,R1 是小模型 。 它是开了大的也开了小的 。 你们为什么在开源的时候不去放不同尺寸的出来 ?
因为一些小尺寸确实可能对学界 , 对这种个人开发者 , 对小机构是更友好 ,有更多人能参与这个事情啊 。
这个我们需要去说服 IO 去说服 , 我们是有小尺寸的 , 我们有我们我们有小尺寸 ,但是 IO 觉得觉得我们就是要效果好 , 它希望能把效果的上限先提上去 , 然后再考虑小模型开源的事情 。
因为我觉得如果按他自己说的 , 就是技术影响力是 , 当然可能我想简单了啊 , 就我觉得如果技术影响力是目标的话 ,其实你让更多人参与也是很重要的一个点 , 对吧 ?
你一个特别大模型大家都搞不了的话 , 那那对吧 , 那讨论度不就变低了吗 ?
对 , 我觉得他的点是在于他希望更专注 , 开源的东西会更加专注一点 , 你开源两个模型就说明我要去维护两个模型 。
可是你不同尺寸的 , 它其实还是一个模型吧 ?
训练的东西不一样 , 训练的数据其实是不一样的 。 我们的我们我们我们最近训的那批那个那个小模型的训练数据其实跟大的会不太一样 。
那你们不能像 R1 那样 , 我直接用我自己的大的模型蒸馏出几个小的 。
现在没人干这事 , 这需要人力的 。
对
, 这这个其实也是我最开始的时候我我问你说开源额外需要做什么吗 ? 就是如果你可能想让它在社区有一个非常好的效果 , 可能你就得额外多干点事啊 。
我个人觉得 PR 是要强的 ,因为现在已经不是一个酒香不怕巷子深的一个时一个时代了 ,因为有太多太多的这些宣传出来 , 你真的东西是容易被埋没的 ,是容易被埋没的 。
而且我刚才说的开源更多小的模型 , 它还不是一个直接的宣传 , 就是它并不会让很多人认为这是一种宣传 。其实我觉得那种效果是好的 , 就你去硬说我特别特别好 , 我发一堆稿什么的 , 这种可能也现在效果也已经非常的衰减了 。
其实还有个点 ,因为就我们做这个东西 , 包括 IO 其实也比较清楚 , 就是我们打的是一个长线 , 就是我们在短期内一定是在效果上会落后的 。
我们做了新架构 ,在相同的算力的情算力和人工的情况下, 我们是没有太多的人力去做深度推理的 , 就会就会导致我们跟随深度推理的脚步会慢一点 。
但是好处就是 , 当我们转型去做深度推理的时候 , 开源已经把这一部分已经做得做得差不多了 , 就我们复现起来的难度会降会降得很低 , 就我们赶上去的话会很快 , 赶上的步伐会很快 。
所以我们在这场跑步当中, 我们跑的其实是下半场 , 我们赌的就赌的就是未来长文的需求 。
据你所知的话 , 像 OpenAI 这种国外的一些 AI 公司 ,他们有在去尝试线性架构的优化吗 ?
他们的架构很可能是基于 sliding window attention 的 。
滑动窗口 。
对对对 , 滑动窗口注意力 。
滑动窗口也是一种稀疏注意力是吗 ?
对 , 滑动窗口是一个比较基础的稀疏注意力机制 ,他们也是他们采用的方法 , 大概率啊 , 大概率是滑动窗口加 full attention。
所以其实你们这个方向是很原创的 ,并不是说美国那几个最强的公司 , 比如说 Anthropic 或者 OpenAI、 谷歌 、Meta 这些有很大的迹象说要往这个方向转 ,是你们自己很相信线性这个方向的潜力很大 。
对对对 ,并且我们的我们这个也是真正把论文转化成产品的 , 就说明我们的技术是很是比较先进的 ,因为这篇论文是 24 年初的论文 ,24 年底的产品 。
你刚才也讲到就是说认可线性注意力的上限很大 ,而且这件事能 work 在业界是一个非共识 , 那你们现在介意去讲这个非共识吗 ?
不介意 , 我们希望能宣传宣传这个 , 这样子的话 , 首先他们就得花一部分精力来跑这个 linear attention 的赛道了 , 然后呢 , 同时他们也会开发出更多的长文的应用 。
所以其实你们是希望更多人也来做这个线性的 attention。
对对对 ,是因为开源其实选择的就是知名度嘛 。
总体来说的话 , 你们觉对 MiniMax 01 这次开源的目前的反馈你们满意吗 ? 包括影响力啊 , 综合的反馈啊 。
我听到的是 , 包括群里面的反馈是说这个报告写得很好 , 这个工作比较 solid,但是不知道为什么没有很多人知道 。
这是你们外部的一些反馈 ,MiniMax 之外的人的反馈 。
对对对 。
明白明白 , 就好像比如说我看了一个特别好的电视剧或者一个小说 , 我觉得特别特别好 , 我跟人安利 ,但是没有什么人看 , 就或者说你发现自然在看的人比较少 。
我觉得这个这个这个现这现状其实就是要也要加强宣传 , 然后一方面我们下一版模下一版模型也会做得比较好吧 , 大概再等一个月吧 。
整体上你觉得外界对 MiniMax 的技术实力有什么印象和误解啊 ?
之前他们应该会觉得 MiniMax 是一是一个比较低调的公司吧 , 会是一家 2C2C 的产品化的一家公司 ,因为它的技术是不公布的 , 你也没看过有 MiniMax 有发布相关的论文 。
你觉得在 01 之后这个印象是在变化的是吗 ?
01 之后我觉得外外界他就会突然发现 , 哎 , 这是一家真正做技术的公司 , 或者说它是一家有技术信仰的公司 , 它愿意花钱花真金白银去实现一个新新技术的公司 。
你感受到的内部氛围在 DeepSeek 春节这个大大大出圈之后, 你们的内部氛围有什么变化吗 ? 研发团队 。
研发团队都在加班 。
都在加班 ,但是是因为本来就要加班还是 。
因为 DeepSeek 没让我们过年 。
就是你们相当于你们在加快你们去做这个推理模型的节奏 , 可以这么说吗 ?
对对对 , 所以就有很多的紧迫性 ,因为对我们来说的话 , 比如说我们过一个月再发出一个跟 R1 差不多的 , 这显然不够的 , 我们得做出的东西一定要比 R1 要好 , 甚甚至要跟 O1 差差不多的一个水水平的一个东西 ,O1 或者 O3 差不多的水平的一个东东西出来 。
这个评判标准还是用那些常规的 benchmark 去看是吗 ? 包括数学的 ,outside 的 , 程编程的 ,SWE, 然后 AIME 这些 。
对对对 , 会有一些标准的 benchmark, 然后我们我们自己也有一些内部的搒单 , 我们会做得更加激进一点 , 就是原来 Domotai 的模型就就是你可以看到现在基本上所有的 benchmark, 你就可以看到现在所有的模型都是视觉理解模型和文本模型是分开的 ,但是在这一版上我们已经没有文本模型 , 我们就只有一个模型 , 就是 Domotai 理解大模型 。
这里面最 tricky 的点就是我应该怎么去平衡这个文本能力和视觉理解能力 , 让它两个搒单都不掉 。
你们做的过程中你觉得难吗 ? 发现这个事难在哪 ?
还在尝试 , 还在尝试 ,但是目前的实验实验结论还可以 , 这其实是一个比较激进的方案吧 , 然后会是一个深度推理的多模态模型 。
所以它是一个用了新的线性架构的原生多模态深度推理模型 。
对的 。
哇 , 那你们这确实一下子做了就好好好好几个改进在一起啊 。
新模型1:12:33
对 , 被迫的嘛 。
那你觉得这件事有多少把握了 ? 你刚才说你们最开始做线性的架构 , 你可能觉得你有 90% 多的把握这个是可以 work, 你们现在这个新的东西你有多大把握它是可以 work 的 ?
从现在的进度上来说的话 , 大概七八成吧 。
然后你们这一次又是把可能超过 80% 左右的资源放在这个新的这一个模型上是吗 ?
这个优先级是最高优先级 。
就绝大部分算法 , 包括工程优化的这些研发的人头都是在你们接下来这个大模型上 。
都在大模型上 。
你们今年就会推出来对不对 ?
下个月 。
这么快 ?
大概 4 月 ,4 月份吧 ,不超过 5 月 。
你说的是 4 月份能发出来的意思吗 ?
对 ,4 月份能发出来 。
那这个发出来也是指开源的意思是吗 ?
发出来应该就开源了 。
那这个速度还真的是挺快的 。 你刚才讲的有一些点我还是比较吃惊的 , 比如说你们做这个 Scaling Law 测试 , 然后预训练这么多次 ,以及你们可能在一个比较新的架构上就花了 80% 的精力和资源在做这个事 。
我们现在的主要主要东西还是看怎么样去提高模型的上限 , 我们现在所有的精力都是在提高模型上限上 。
我们现在其实是认为模型上限提高比去维护产品更加重要 。
那你会羡慕就是 DeepSeek 那种完全不做产品吗 ? 当然他们有一个 2C 的产品 ,但他们其实没怎么维护 , 我觉得就你当机就当机了 。
那那其实没有是这样子的 , 我为什么来 MiniMax 也是出于这个考虑 。 第一 , 我们当时想宣传 linear attention, 确实也借助了一些 lab 的资源去做宣传 ,但是呢 , 我发现啊 , 当时我跟所有人聊的时候 , 我都发现很难去说服他们 ,因为他们会有会有一个点说你这个模型只在小规模上验证过 ,在大规模上的效果并不确定 ,他们会用这一点来说不买你的账 。
那我当时我就想 , 那我应该怎么办 ? 那我就只能去找一个愿意来的这个人。 那宣传最好最好宣传新技术的方式是什么呢 ?
把它放到产品里面 , 然后让所有人都用到 , 这就是证明这项技术最好的方式 。
你现在还是这样想的是吗 ?
对啊 , 这就是为什么我来了这个 MiniMax 去把这个模型真正的放到了产品里面去 。
那你怎么看上 DeepSeek? 它其实也没有一个产品 , 或者说它没有一个好用的产品 ,但它的影响力会特别爆炸在一段时间里 。
就这件事它是一个偶然的因素导致的 , 还是说它有可能会持续了 ? 就大家可能最大的焦点都是在于模型能力本身的提升 ,而不见得是这个模型能力提升之后, 本身这个公司自己做了什么产品 , 它可能是生态里其他的人在做 。
我个人觉得其实它那个 R1 的出圈其实是偏偶然的 。 第一个是当然模型效果确实不错 , 这是它偶它它能够出圈的一个 ,但是它也跟很多别的情况也相关 。
对我们来说的话 , 我其实你没法去想这样一个偶发事件 , 对吧 ? 那么我有一个新技术 , 我想让很多人都知道它 , 那能怎么做呢 ?
那就是把它变成一个产品 。
这其实是 ChatGPT 实现的事情 。 就当时 OpenAI ChatGPT 有一些无心插柳的成分 , 它确实是通过一个产品有了这样一个 ChatGPT 时刻 ,而且在那之后 OpenAI 是马上和微软有一个更深的绑定 , 它接了更多的算力资源 , 它相当于把这个关注它转化成自己的用户 , 然后积累到现在 。
然后我觉得 DeepSeek 的前半段的事跟这个是比较类似的 ,但是后面不一样的地方就是在于它其实自己没有怎么去做这个产品 。
现在出现的一个局面就是包括像腾讯的元宝 、 阿里 , 然后百度 , 就还有很多其他什么车企啊 , 各种公司 , 就这些其他的公司在接 DeepSeek, 就它好像这个故事的后面的一部分不太一样 。
这个无所谓 ,因为首先它的这个模型效果确实好 ,但是在大模型其实很少有很大的领先的 , 基本上你的所有的领先都会在三个月以内被抹平的 。
所以你还是觉得那个逻辑是对的 , 就是说实际上你只靠技术本身 , 就如果一个正常的商业公司啊 , 就我们 DeepSeek 可能有些特殊情况 , 一个正常的商业公司只靠技术领先 ,其实你是没有办法长时间有一个正向的反馈和壁垒的 。
对对对 。
我对我我觉得这个分享也挺好的 。 对 ,也许它会是一个更长期的趋势 ,也许 DeepSeek 是一个短期的极值性的事件 , 它可能改变了一些人的想法 。
原因其实是因为 , 虽然大家都说深度推理 ,但是真正让大家第一次能够切身实际的感知到深度推理的每一步的其实就是 R1 嘛 。
对 ,因为之前 O1 它并没有完全开放思维链 ,而 R1 是把思维链透明给用户的 。 还有一个点就是 OpenAI 比较贵 , 然后对中国的 , 或者说对全世界其他很多地方的人来说 , 要用 O1 的成本和门槛是比较高的 。
另外其实还有个点 ,R1 不是个通用模型 , 就是你可以去问它一些通用的东西 , 就比如说谁是谁啊这种通用的事件 , 它的回复往往不会很好 ,但是它解一些难题或者在在专业的任务上, 它其实效果会比较好 。
我的定义是它并不像一个通用通用模型 。
其实你经历过上一代的计算机视觉为主要技术的 AI 公司 , 然后像上海人工智能实验室这样的一个 Lab, 然后还有 MiniMax 这样新的一批大模型的创业公司 , 就你自己感觉在这些不同类型的机构里面来做 AI, 来做 AGI, 它的区别是什么 ?
这里面其实最重要的是决策 ,因为 21 年 21 年 3 月份的时候 , 我在商汤做的就是文本大模型 。在那个时候 , 首先 ChatGPT 是 22 年 11 月份开开始的 ,在那个时候只有 GPT-3 发布了 , 所以在那个时候 ,其实商汤做大模型是非常早的 , 然后后面经历了很多事情嘛 。
你自己在 AI 上的追求是什么 ? 你个人我是指 。
我一直想做的 , 我一直想做的一个模型 ,他们叫 AGI,但是我想做的时候那个时候还不叫 AGI。 我觉得我想看我想做的东西是一个真正能够自我学习 、 自我进步的一个一个模型 , 它能干的活是什么呢 ?
就是你给它的输入是人看到的 、 人人听到的所有东西输入进去 , 然后它能够去自发的去学习不同的模态之间的关系和里面的 , 比如说怎么样去处理文本 , 文本也是通过自监督学出来的嘛 , 然后通过这种方法 , 我们我们就能够得到一个真正的一个初步的一个能够自发学习的一个大模型出来了 。
当时还没有大模型这个概念 ,但是我现在觉得这一步它们这里面其实会牵涉到很多别的模型 , 比如说世界模型 , 它其实也属于这里面的一块吧 。
那么我想做这样这样一件事情的话 , 第一我需要文本模型 , 第二我需要多模多模态模型 , 然后然后慢慢的第三步就是看怎么怎么让它自发的把这不同模态的之间的关系把它学出来 , 就跟人跟人一样 ,因为人也是这么学到 , 人从婴儿开始也是这么学 , 怎么这也是这么学出来的 。
你说的这个它涉及到就是我不需要一版一版的去预训练这件事情吗 ? 要跳过这个步骤吗 ?
你或者把这叫做可叫做持续学持续学习 , 就是它一直在预训练 。
但这个好像在现在目前的学界其实大家并没有 , 就这这是个很模糊的方向 , 对不对 ? 就它并没有收敛到一个具体我怎么能实现到这个目标上 。
它虽然没有具体实现到这个方向 ,但是你可以发现大家都是在往这个方向方向走 。 第一 , 你会你会发现现在有几个方向比较比较比较火的 , 第一个是大模型方向 , 第二是具身智能方向 , 然后第三是空间智能方向 。
你会发现为什么他们会走这三个方向呢 ? 第一 , 大模型现在碰到的一个问题是不是你看大家都说啊 , 训练数据即将耗尽 , 当你的训练数据耗尽的情况下, 你大模型应该怎么办呢 ?
这时候具身智能就出来了 ,因为具身智能的定义是什么 ? 它通过跟环境的交互来获得智能 。 你看机器人跟环境的交互 , 它在所有的这些交互范围内 , 它是不是可以产生无穷无尽的数据 ?
它是不是直接就可以解决大模型的训练数据问题 ? 那么空间智能在这里面有什么用 ? 因为你具身智能你是要跟环境做交互的 , 你跟环境做交互 , 你就自然而然你需要有空间理解能力 。
那么空间智能也会要进来 。 所以你会发现所有的 , 虽然大家对这观念是比较模糊的 ,但是他们每个走的小方向都是一步步往这块走的 。
你觉得强化学习深度推理这个方向能走到自己持续学习的模型吗 ? 还是中间会有一些比较大的 gap?
强化学习它其实是一种学习方式 , 走通了这一这一步以后, 它可能会未来我们真正要走到 AGI, 它可能是可以依靠这种这种方法去进行自发的自发的学习的 。
强化学习它这一块其实非常像具身智能里面的强化学习 。
对 , 具身智能现在也用强化学习去做很多运动控制的 。
它其实很像 , 对我来说的话 , 我觉得像这 R1 更像是一个偶发 , 就是偶然发现那个东东西 ,他们就把在机器人领域比较火的这 RL 我们就直接拉过来 , 我们来训一训 。
你指的是 O1 吧 ?
O1 或者 R1。
但这个方向应该算就最开始是 O1。
对对对 , 我感觉就像他们直接拉过来训 , 结果发现效果居然特别好 , 应该是一个偶然的发现吧 。
而且有可能 OpenAI 也是有做类似的动作 ,但因为 OpenAI 它并没有就对外说很多细节嘛 , 就你也不知道它是怎么做的 。
所以你个人想追求的一个东西就是你想看到某一种你想象中的那个 AI 它会实现 ,以及你你是去推动这个过程 。
对我来说的话 , 现在反正是一步步往上往上走呀 ,但是进入了大模型这个领域 , 你其实发现你的驱动已经是外界来给你驱动了 , 已经很多情况下已经身不由己了 。
就是竞争驱动的 。
对 , 已经是竞争竞争驱动了 。
如果抛开所有的限制 , 你觉得实际上现在应该做什么呀 ?
还是要把这模型能力先能基础能力先往先往先往上提的 。
对我我是指具体了 , 就就如果提基础能力 , 具体它最该做的事是什么 ?
具体在做 , 我其实觉得 RL 是个很好的方向 , 首先是我们解决了基础架构的问题 , 让它的计算复杂度往下降了 。
那么架构问题就意味着我们有一个比较好的一个基础了 , 好的基础了以后, 那么我在上面再尝试不同的算法 。
了解 , 所以至少在目前这个阶段 , 外部竞争驱动你去做的这个方向和你觉得本身应该做的事它也是契合的 。
对我我觉得今天这个交流很好 , 本来我是想跟你聊线性注意力的 ,但我听下来之后其实有一个更广的一个话题 ,而且你比较详细的回述了你们怎么去做线性注意力的这个探索这样一个过程 。
中间我觉得有很多心路历程也是让我觉得很有启发 , 然后也对你们团队 , 包括对 MiniMax 的一些决策 , 我觉得也是有一些新的认识吧 。
那今天非常感谢怡然来做客我们的 《 晚点聊 》, 谢谢 。
好嘞 。
那我们可以最后跟听友打个招呼 。 大家拜拜 。
好 , 拜拜 。
尾声1:23:38
本期的连点呈现我有三个联想 。 第一个是这期和上期有很多联动 ,因为我们都是在聊 Attention。 怡然提了一个问题 , 就是她认为大部分人觉得 Scaling Laws Attention 是有损的 , 这呼应了我们上一期聊到的目前学界的一些探索 , 表明纯线性的注意力它的效果是可能无法比肩 Transformer 的 。
但怡然也说有没有另一种可能 , 就是原初 Attention 中的二次计算复杂度本身是冗余的 。 第二个联想是我们最后讨论到她想做什么样的 AI 时, 她设想了一个可以连续学习的 AI 系统 ,而不需要人类去一代一代的预训练去给它升级 。其实上期朝军也聊到了类似的未来设想 , 还有更早时在 《 晚点聊 》 的第 71 期节目 , 香港大学计算机系主任马毅也谈到了这个话题 。
马老师认为现在的 Transformer 并不是真的高级智能 , 我们混淆了智能和知识 , 大模型和一个婴儿谁更有知识谁更智能 。他认为是婴儿更有智能 , 婴儿有可能成为下一个爱因斯坦 ,因为它可以自主学习 。
那么系统如何自主学习了 ? 马老师认为关键是闭环训练 、 反馈和纠错机制等 ,以及他提出智能的原则是简约和自洽 。
更详细的如果大家感兴趣可以去听 71 期节目 , 那一期我们也聊了很多历史 。 虽然 AI 每天有很多新鲜的事情 ,但是马老师的一个想法是年轻的学生应该更多的去关注 AI 的历史 。
我们当时聊了从上世纪 40 年代的控制论 、 信息论 , 再到 56 年的达特茅斯会议 , 还有明斯基他们最开始去提 Artificial Intelligence 这个词时到底是在指什么 。
最后一个联想是关于语言和多模态对智能的意义 。 钟怡然在描述自己想做什么样的 AI 时, 提到了语言 、 具身智能 、 空间智能和世界模型的相互促进 。
比如说以 RL 强化学习为例 ,在 O1、R1 类模型中很重要的强化学习 ,也是近几年大家在机器人上去做运动控制的时候会用的比较多的一种方法 。
那之前我们在第 101 期节目和王小川聊的那期节目中 ,他非常鲜明的表达了另一个观点 , 就是他认为语言才是智能的主轴 ,而多模态 , 比如说世界模型 ,他认为是跑偏了 ,因为语言才凝结了人对世界的认知 。
而从科学时代到智能时代 , 要从解构物理世界到解构人, 这背后可能是现在不同的人对智能 、 对 AGI 本身有不同的理解 。
现在的大语言模型更像是一个虚拟世界中的缸中之脑 , 再往下能在物理世界活动并改变物理世界 , 这件事本身对智能的产生和发展到底有什么意义 ?
不同人现在有不同的答案 。 你觉得完全虚拟的缸中之脑成立吗 ? 它未来会产生类似好奇心 、 厌恶 、 喜好等机制吗 ?
我想我们之后的节目里可能还会反复回应类似的议题 。
本期节目就到这里 , 欢迎收听 。 如果你对今天聊的话题有观察 、 好奇或疑问 , 欢迎在评论区分享想法 , 这也会成为我们节目的一部分 , 让整个讨论更完整 。
你也可以把我们的节目分享给对这个话题感兴趣的朋友 , 欢迎推荐更多你想听的主题和嘉宾 。
你可以从小宇宙 、 苹果 Podcast 等渠道关注 《 晚点聊 LateTalk》,也欢迎关注我们的公众号 《 晚点 LatePost》。 下期再见
。




